![]()
新一代词元加速方案今日迎来首发。
2026 年 8 月 28 日,2026 数博会期间,中科曙光正式推出 ParaCache 高效管理方案,该方案已在十万卡 AI 超集群曙光 8000 上完成验证,是中科曙光 AI 数据工厂理念的又一项重要技术落地。
![]()
业内为什么如此关注这项技术成果?
随着词元经济快速兴起,大模型词元能力已经大规模落地到各类业务场景。企业搭建或选择 AI 基础设施,不再只比拼硬件算力的纸面参数;更要考量同等算力下的有效 Token 产出效率,兼顾业务落地成本,同时保障系统能够稳定承接海量用户的并发请求。
词元经济时代,比拼的是效率
大模型和智能体加快落地,长文本、多轮对话和高并发逐渐成为常态。模型每次回答,都要处理已有对话、知识库和业务规则。同样的内容如果被反复计算,就会拉长等待时间,持续消耗和浪费宝贵的 GPU 算力资源。
当万卡、十万卡 AI 集群陆续建成,减少重复计算、提高算力使用效率,已经成为国产 AI 基础设施的新课题。
ParaCache 怎样减少重复计算?
ParaCache 把模型已经算好的中间结果保存下来,统一管理。后续请求再次遇到相同内容时,可以直接调用已有结果,主要处理新增部分。一份公共知识计算一次,便能在不同请求和计算节点之间继续使用。
这套方案以中科曙光分布式全闪存存储 ParaStor 为基石,把不同层级的存储资源纳入统一调度,可以称之为业界最完善的 KV Cache 管理方案。
ParaCache 采用全国产化技术路线,同时兼容主流推理框架和开源生态,现有业务系统无需大幅改造。
十万卡 AI 超集群,给出验证结果
ParaCache 已经在首个全国产十万卡 AI 超集群曙光 8000 的推理应用场景完成验证。
实测显示,120K 输入长度下,单轮首 Token 时延最高降低 98.5%,高并发 Token 吞吐量最高提升 27 倍,多轮会话的等待时间也明显缩短。
更快响应、更多并发和更好兼容,是 ParaCache 带来的主要变化。分层管理也能适度减轻高配显存和大容量内存的投入压力。
从“提供算力”走向“提高算力使用效率”,国产算力技术正在补上规模建设之后的效率一环。
ParaCache 的发布,就是这一变化的标杆级事件。
云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.