作者:王聪彬
![]()
使用大模型时,往往要先等待片刻,才能看到第一个Token生成。但第一个Token出现,后续内容便会持续、流畅地输出。这还要从背后一项关键的工程机制KV Cache说起。
中科曙光把提升推理效率的突破口放在了KV Cache上。8月28日,在2026中国国际大数据产业博览会期间,中科曙光提出从“存数据”到“存智能”的概念,发布新一代词元加速方案ParaCache。该方案聚焦大模型推理的Token交互场景,为企业带来计算性能提升、计算成本降低、技术生态适配三大收益。
为什么KV Cache值得专门做一套管理方案?因为一次完整的推理过程,通常可以分为Prefill和Decode两个阶段。Prefill阶段负责处理输入内容,并生成相应的KV Cache。进入Decode阶段后,模型会基于这些结果逐个生成Token,形成用户看到的连续输出。
在实际应用中,不同请求之间经常存在重复内容。如果能够保存并复用已经生成的KV Cache,模型便可以减少重复计算,释放更多GPU算力。中科曙光分布式存储产品部总经理石静表示,通过KV Cache“以存换算”,已经成为业界提升推理效率的一条重要路径。
但新的问题随之出现,KV Cache会占用大量显存,尤其是在长上下文和高并发场景下,如果全部存放在HBM中,很快就会触及容量上限。即使GPU仍有计算余力,也可能因为显存不足而无法承接更多请求,这就是大模型推理过程中常说的“显存墙”。
破解“显存墙”主要有两个方式:一是在算法和模型侧压缩KV Cache,减少其占用空间;另一个是将KV Cache从HBM卸载至容量更大的CPU DRAM、SSD或分布式存储。
因此,KV Cache需要在不同存储层级之间进行统一管理和调度,但这一过程中也出现了两个瓶颈。一是缺少全局视角,不同层级的元数据相互割裂,KV Cache难以在多个推理实例之间共享,也无法实现准确调度;二是分布式存储虽然具备共享和池化优势,但受访问延迟等因素影响,目前大多只能作为冷数据仓库使用。
ParaCache的思路,正是让KV Cache在不同存储层级和计算节点之间高效流动。
ParaCache管起整个KV Cache池
KV Cache被视为推理过程中沉淀下来、可以重复利用的“智能化数据”,需要一套贯穿不同存储层级的管理机制。
ParaCache能够统一管理GPU显存、CPU内存、固态硬盘和分布式存储,根据使用频率对计算结果进行分层存放和智能调度,并支持在不同请求、不同计算节点之间共享,实现“一次计算、多次使用”。
从架构上看,ParaCache覆盖四个存储层级:L1对应GPU HBM,L2对应CPU DRAM,L3包括本地SSD和集中式全闪存储FlashNexus,L4是基于POSIX协议的曙光分布式存储ParaStor。“目前ParaCache已经实现L2、L3和L4的池化,并对不同层级中的KV Cache进行全局管理和动态调度,打破各层之间的元数据孤岛。”石静说道。
![]()
ParaCache通过业界主流的vLLM、SGLang等推理框架就可以无缝对接上层应用。无论采用Prefill与Decode一体化部署,还是在GPU侧对KV Cache进行分类管理,ParaCache都能够提供相应支持。
在具体的调度过程中,ParaCache还可以与推理框架的调度层配合,提前预测下一次请求所需的KV Cache。如果相关数据位于L3或L4,系统可以在请求到来前完成调取,减少数据迁移对响应时间的影响。
L3层除了常见的本地SSD,ParaCache还将面向推理场景的FlashNexus Neo集中式存储纳入这一层级,使多个计算节点能够共享同一套存储资源。实际测试显示,在延迟、吞吐量和并发请求处理等指标上,综合表现达到了本地SSD方案的两倍。
L4层是基于曙光ParaStor F9000,并进行了一系列针对KV Cache的优化。例如,首先是将部分Offset覆盖写调整为追加写,减少写入带来的延迟;其次是对分布式锁进行轻量化处理,按目录取消部分锁机制,降低强一致性和排他锁对访问效率的影响;最后在PD分离架构下仅传输增量KV Cache,从而减少集群网络带宽消耗。
ParaCache还通过XDS打通加速卡与分布式存储之间的数据通路。XDS可以同时支持GPU和国产加速卡,使KV Cache可以直接在L1与L4之间卸载和回迁,绕过CPU DRAM和本地SSD。优化使得ParaStor在L4层也能够直接参与KV Cache调度,具备承载生产级推理业务的能力。
首词元时延最高降低98.5%,词元吞吐量提升27倍
ParaCache让KV Cache从“用完即弃”的临时数据,变成可反复调用的数据资产。ParaCache带来的价值,可以概括为“多、快、好、省”。
“多”:高并发场景下,系统每秒处理的词元量最高达到原来的27倍,同样的硬件资源能够承接更多业务请求。
“快”:输入约12万词元时,单轮对话开始回答前的等待时间最多可降低98.5%至0.4秒;连续20轮对话中,这一时间也降低超80%,由43.1秒降至4.9秒。
“好”:兼容主流推理框架和国产AI加速卡,可在现有系统基础上接入,降低部署和迁移成本。
“省”:高频内容保留在显存,其他内容转移至成本更低的存储设备,减少对高成本显存和新增硬件资源的依赖。
KV Cache复用的价值,在多轮对话和Agent应用中更为明显。随着对话不断推进,此前生成的KV Cache可以被后续请求重复调用,从而减少重复计算。
ParaCache也进行了多轮对话场景的测试,初始输入长度分别设置为30K和120K,并在此基础上连续进行20轮对话,每轮增加0.5K输入。测试结果显示,在约12万词元输入下,ParaCache可使模型开始回答前的等待时间最高降低98.5%;
测试还模拟了多轮对话下的高并发请求。与KV Cache全部存放在HBM中的方案相比, ParaCache加速方案,使系统每秒处理的词元量最高达到原来的27倍。
目前,ParaCache已经进入实际业务。ParaCache支撑某头部互联网厂商的在线推理业务,模型开始回答前的平均等待时间降低50%以上;在同等硬件条件下,系统可承载的业务请求也提升数倍。
针对具体的行业案例,在某银行的信用卡及办卡业务中,超节点与ParaCache配合使用,使并发吞吐量提升约3倍;在教育行业的RAG知识库和智能助学场景中,部分测试的并发能力提升了15至20倍。
“从大模型训练、在线推理,到自动驾驶、具身智能和智算中心,ParaStor积累的存储实践成为ParaCache的重要基础。”石静强调。当KV Cache成为可管理、可复用的数据资产,分布式存储也由此进入大模型推理的核心链路。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.