这一两年,大家都被内存、SSD、存储设备的涨价搞破防了吧?
跟AI大模型沾点边的“存储器”,都在猛涨!
![]()
注:根据知名机构TrendForce预计,2026年第三季度,DRAM合约价格将环比上涨13%—18%,NAND Flash合约价格上涨10%—15%。
这种“涨不停”形成了让人无语的尴尬循环↓
大模型把存储需求推高了,存储涨价又反过来抬高了大模型的推理成本。
![]()
而偏偏这时候,推理需求彻底大爆发!
上下文越来越长,对话轮数越来越多,大模型越来越“聊不起”了,又慢又贵。
![]()
为什么大模型这么“吃存储”?
一切的背后,都绕不开大模型推理的一项细节技术:KV Cache。
KV Cache是个大冤种
KV Cache相当于大模型的“工作记忆”。
大模型的脑回路有点特别,在回答问题的时候,每吐一个新字(token),都要把前面上下文重新参考一遍。
![]()
就好比一个傻小子爬楼,每向上爬一层,都要返回一楼重新蓄力,把爬过的楼层重爬一遍…
你说折腾不折腾。
![]()
为了解决大模型这种死脑筋,KV Cache机制就出现了。
它把前面已经计算过的Key和Value保存在缓存中,下次生成新Token时,模型只需要计算新增内容,历史结果直接从KV Cache里拿。
![]()
有了这份记忆,大模型虽然还是那个脑回路,但不需要对前面的内容进行重复计算了。
![]()
然而,这份记忆是有代价的,不仅很占地方,还要优先放在速度快、价格高的GPU HBM显存中。
模型参数越大、上下文越长、对话轮数越多、并发用户越多,KV Cache占用的显存也就越大。
![]()
显存太贵了,也不可能都拿来放KV Cache,还要放模型权重、激活值等等。
![]()
放不下怎么办呢,挪到便宜一点的DRAM内存和本地SSD里。
传统KV Cache扩容思路简单粗暴:GPU显存不够就增加显存,内存不够就增加内存,再用本地SSD承接溢出的缓存。
![]()
这套方法确实可以承载更长的上下文、提升推理效率,但成本会随着业务规模同步增长。
更大的问题在于,传统KV Cache通常被限制在单次对话、单块GPU或单个节点内,难以在整个集群中共享。
![]()
同时,企业部署大模型时,大量请求往往会使用同一套系统提示词、知识库、行业文档和标准模板。
不同用户提出的问题有差异,前面的公共上下文却可能高度相似,而这些公共上下文的KV Cache,却被重复缓存了。
![]()
集群规模越大,这种重复消耗也越容易被放大。
一方面,KV Cache重复消耗存储空间,另一方面存储产品(尤其显存/内存)价格涨了又涨,企业已经扩不起了。
你没想到吧,本来被拿出来提升推理效率的KV Cache,竟然成了拖后腿的大冤种。
![]()
必须要对KV Cache下手了
在这种情况下,为了提升推理效率,同时又不额外增加太多存储成本。
很多企业希望围绕KV Cache下手,进行优化↓
![]()
![]()
![]()
![]()
其实,破局的关键
是重新设计KV Cache的保存位置、复用范围和调度方式。
![]()
理儿都懂,但要商业化落地,却没有那么简单。
此时,国内顶流存储大厂中科曙光给出了解法↓
ParaCache高效管理系统
ParaCache基于存算协同理念,构建起分布式共享缓存体系。
![]()
在硬件层面,它打通显存、内存、本地SSD和集中式存储,以及分布式共享存储。
在运行层面,它让KV Cache脱离本机范畴,实现跨请求、跨GPU、跨节点复用。
![]()
这里面的关键技术有三步↓
第一步,重塑缓存池,打造出堪称业界最完整的KV Cache层级与池化。
ParaCache提供4级缓存层级,不仅有传统KV Cache包含的3级缓存(显存、内存、本地SSD),还把集中式存储FlashNexus纳入进来,替换本地SSD。
![]()
更创新的还有第4层,ParaCashe突破了传统分布式存储只能干备份的局限,让ParaStor分布式存储成为生产级L4 KV Cache共享缓存池。
ParaStor能和其他层级的缓存一样,参与KV Cahe全部跃迁行为,但成本却远远低于其他层级。
![]()
第二步,智能跃迁,给不同“温度”的KV安排最合适的位置。
访问频繁的热KV放在显存中,保证读取速度,访问频率下降的温KV进入内存,然后根据温度逐级下放到本地SSD/集中式存储→分布式存储。
![]()
当然,这种智能分层不是一成不变的。
ParaCache会通过智能稀疏、动态淘汰和层级跃迁机制,根据访问情况自动迁移缓存。
![]()
第三步,全局元数据管理,把分散的KV Cache变成整个集群的共享资源。
通过全局元数据管理,ParaCache建立了一个全局共享的“记忆池”,让计算结果在不同请求、GPU和节点之间流动起来。
并通过全局预取、预热能力,提升推理性能。
![]()
曙光ParaCache带来了什么
ParaCache带来的价值,我们可以概括为“多快好省”。
先看推理用户感受最直观的快↓
首Token时延,也就是TTFT,是推理用户判断模型快不快的直接体验指标。
![]()
在120K输入长度下,ParaCache可使单轮对话TTFT最高降低98.5%,降至400毫秒。
多轮会话TTFT降低超过80%,降至4.9秒。
![]()
再看衡量集群token生产效率的多↓
高并发场景中,大量请求共享相同的知识库、提示词和行业文档。
ParaCache让这部分公共内容只计算一次,然后KV Cache能被整个集群复用。
![]()
这样,GPU算力可以处理更多差异化Token,从而让整个集群的Token吞吐能力大大提升。
![]()
接下来看迁移上手是否好用↓
ParaCache原生兼容LMCache开源生态,企业无需大规模重构现有推理技术栈,可以保留已有技术投入,降低集群改造和系统迁移风险。
![]()
最后,面对内外存涨价压力,如何帮企业省一点↓
通过四级缓存和冷热分层,企业不必把所有KV Cache都留在高成本显存和大容量内存中。
利用集中式和分布式存储,降低推理系统对本地大内存的依赖,比如曙光搭配ParaCache专门推出FlashNexus Neo全闪,构建L3 KV Cache池。
![]()
这意味着企业有机会使用成本更低的硬件承载超长Token任务,降低单次Token生成的硬件成本和集群整体TCO。
这一回,推理成本飞涨的压力,终于能缓解了。
![]()
省硬件、降时延、提吞吐,再兼顾现有生态,这一回,曙光对KV Cache的下手,够狠也够准。
而ParaCache缓存管理系统,也是中科曙光AI数据工厂理念的一项重要技术落地。
只因,在推理时代,AI数据工厂的效率,既取决于有多少算力,也取决于能省多少算力。
Cache虽是小细节,拼的却是真功夫。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.