《电子技术应用》
您所在的位置:首页 > 人工智能 > 业界动态 > 国产存储杀入大模型推理核心

国产存储杀入大模型推理核心

曙光ParaStor首家接入Mooncake:吞吐暴增16倍
2026-09-29
来源:快科技

9月29日消息,中科曙光分布式存储ParaStor近日成为业界首家接入Mooncake社区的商用分布式存储,首次完成商用分布式存储后端的生产环境落地,相关技术能力已全部合入Mooncake社区主干。

大模型推理中,Agent、高并发对话、代码生成等场景会产生大量KV Cache中间数据。高效保存并复用这些数据,能大幅减少重复计算,降低算力消耗和AI运行成本。

内存方案成本高,本地SSD方案受单机容量和故障限制,外置分布式存储成为破解痛点的关键路径。但Mooncake原有外置存储接入能力在容量弹性扩展、数据恢复、异常场景稳定性等方面仍存短板。

曙光ParaStor团队对Mooncake DFS存储分配逻辑进行模块化改造,围绕标准化接入、动态扩容和IO链路持续优化。商用分布式存储由此首次进入大模型推理核心业务链路,承接长尾KV Cache卸载工作。

生产环境实测数据极具说服力。曙光联合SGLang,基于国产加速卡与ParaStor F9000搭建端到端测试环境。在64K上下文、单卡7并发下,KV Cache卸载实现16倍吞吐提升,达到DRAM池吞吐值的80%;平均首Token延迟和P90首Token延迟均保持在10秒以内。

接口标准化方面,曙光完成Mooncake接口标准化改造,无需修改上层程序,满足通用文件访问即可快速适配。复杂架构改造变为轻量化开发,为更多商用存储接入大模型缓存场景铺平了道路。

改造后的DFS接口支持缓存空间随业务负载按需扩容,实现以完整存储段为单元完成冷数据回收,系统重启后缓存数据仍可恢复使用。

这套方案可为用户提供更低的AI运行成本、更高的GPU利用率,并以完整可复制的商业化落地方案,为国产全栈AI基础设施补上关键一环。


2.jpg

本站内容除特别声明的原创文章之外,转载内容只为传递更多信息,并不代表本网站赞同其观点。转载的所有的文章、图片、音/视频文件等资料的版权归版权所有权人所有。本站采用的非本站原创文章及图片等内容无法一一联系确认版权者。如涉及作品内容、版权和其它问题,请及时通过电子邮件或电话通知我们,以便迅速采取适当措施,避免给双方造成不必要的经济损失。联系电话:010-82306118;邮箱:aet@chinaaet.com。