客服是目前AI应用最广的场景,大量重复或相近的问题给本地推理部署带来了巨大挑战,尤其是缓存系统。按照传统的大模型工作方式,每一个请求GPU都要把系统提示词和历史对话重新计算一遍,宝贵的算力被浪费在“算已经算过的东西”上。随着大模型从实验室走向生产环境,推理已经成为吞噬算力的黑洞。
推理时代的“显存墙”
![]()
大模型推理分两步:第一步是预填充,模型把用户问题“读懂”,生成一堆缓存(KV Cache);第二步是解码,模型一个字一个字往外蹦答案。多轮对话里大量问题重复,每一次重新预填充都在浪费算力。业界早就形成共识:用存储空间换计算时间,把重复生成的KV Cache存下来,下次直接调取。但执行起来遇到一堵实实在在的墙——“显存墙”。
GPU的高带宽内存容量有限且成本很高,KV Cache随着上下文长度和并发请求数线性增长,很快就能把显存撑爆。中科曙光分布式存储产品部总经理石静告诉媒体,KV Cache在推理过程中的内存开销可以达到数十乃至数百GB,远超单张顶级GPU的显存容量。显存一满,GPU算力再强也转不动,新的请求进不来,正在处理的请求开始卡顿。
东方证券在行业深度报告中判断,AI算力中心的核心挑战已从之前算力为主,逐步转向存储与带宽为主。SEMI中国总裁冯莉在今年3月的演讲中披露,2026年全球AI基础设施支出将达到4500亿美元,其中推理算力占比首次超过70%。她同时判断,全球存储产值将在2026年首次超越晶圆代工,成为半导体产业的第一增长极。存储正在从一个“配角”,转变为决定推理性能的关键因素。
石静分享了一个更具体的例子:AI智能体在工作时会频繁调用相同的工具包和数据源,KV Cache的重复利用率极高。但如果没有合理的卸载机制,所有KV Cache都挤在高带宽内存里,显存很快被撑爆。“表现就是吐字延时非常高,响应卡顿,用户体验很差。”石静指出。企业面对这种情况,通常只有两条路:要么买更贵的、显存更大的高端GPU,要么就只能眼睁睁看着业务并发上不去。
存储进化方向
解决显存墙,理论上只有两条技术路线。一条是在算法层面压缩KV Cache的体积,从源头上减少数据量。另一条是把KV Cache从高带宽内存里搬出来,放到容量更大、成本更低的存储介质上,比如CPU的动态随机存取内存或者本地固态硬盘,再或者分布式存储。第二条路径已经成为厂商重点布局的方向。
开源的LMCache可以在GPU、CPU和本地磁盘之间灵活存储KV Cache。实测数据显示,在多轮问答和检索增强生成场景中,LMCache能实现3到10倍的延迟降低。谷歌云也在2025年推出了基于Managed Lustre的外部KV Cache方案,据披露数据显示,该方式可将总拥有成本降低35%,用大约40%甚至更少的GPU支撑同样的工作负载。
这些方案虽然能一时解决显存墙的问题,但都有一个比较明显的瓶颈:大多是“单机版”。石静告诉媒体,LMCache虽然能破除KV Cache的实例级隔离,但在高带宽内存、动态随机存取内存、本地固态硬盘三级仍存在较大程度的节点级资源孤岛。这带来两个问题:
- 资源利用率低。A节点缓存的KV Cache,B节点用不了,只能各自重新计算,集群应用下算力被浪费。
- 元数据管理混乱。模型推理引擎、框架原生组件、第三方KV组件各有各的元数据管理方式,三层嵌套,缺乏全局视角。
石静管这叫“元数据迷雾”,“没有全局视角,就没办法判断什么时候该把KV Cache放到哪一个层级。”石静强调。更“致命”的问题在L4层(分布式存储层)。理论上,分布式存储天然适合做KV Cache的池化共享,因为其容量大、成本低、可跨节点访问。但现实是,分布式存储的强一致性锁机制带来较大的延迟,导致它长期被当作“冷数据仓库”使用。KV Cache的分层管理在L1到L3已经有了不错的实践,但到了真正能实现大规模池化共享的L4层,反而卡住了。
ParaCache的集群化破局
正是看到了这个卡点,中科曙光在2026中国国际大数据产业博览会(数博会)期间发布了ParaCache。据石静介绍,ParaCache的核心思路是将KV Cache的管理从单机扩展到集群,从四个层级(L1高带宽内存、L2 CPU动态随机存取内存、L3固态硬盘、L4分布式存储)实现全局池化和动态调度。这个过程并非“一蹴而就”,实现路径中经历了不少挑战。
在L3层,ParaCache做了一件业界此前没人做过的事——把集中式存储FlashNexus纳入缓存体系。传统的L3层用的是计算节点自带的本地固态硬盘,存算一体,难以跨机共享,而且固态硬盘盘性能受限于CPU和PCIe通道。FlashNexus Neo是专门为AI推理设计的硬件系列,通过存算解耦实现全局共享,单阵列提供160GB/s带宽能力。实测数据显示,在首次令牌时间、每秒查询数、吞吐量等关键指标上,使用FlashNexus Neo构建的L3缓存池比本地NVMe固态硬盘有接近2倍的提升。
在L4层挑战更大。ParaStor F9000本身已经是高性能的分布式全闪存储底座,单框提供220GB/s带宽和1000万IOPS。但光有高性能硬件还不够,ParaCache针对KV Cache的应用方式做了几项定向优化:
- 数据写入方式。传统分布式存储使用offset覆盖写,ParaCache改成追加写,更有利于降低延迟。
- 锁机制。分布式存储被人诟病最多的就是强一致性带来的延迟,ParaCache在KV Cache场景下做了轻量化处理,可以基于目录去掉分布式锁,或者去除重量的排他锁。
- 在PD分离架构下,只让节点间传输增量KV,节省集群网络带宽。
在全局调度层面,ParaCache提出了一个“Best-effort数据预取”的机制。推理框架调用KV时,会先判断KV是否存在,再调用数据获取,判断与获取之间存在一个时间差。对于已经卸载到L3或L4的冷KV,ParaCache利用这个时间差提前预取。“不用等通知了再去调,而是通过算法提前感知到需要的时候,先把KV调到所需要的层级上,把等待时间化为加速。”石静介绍道。
数字背后的共同逻辑
从测试数据来看,效果是明显的。在多轮对话场景下(30k初始输入叠加20轮对话),ParaCache让首次延迟降低了89%。在多并发场景下,相较于仅使用高带宽内存的方案,吞吐量提升了近26倍。在与头部互联网厂商的在线推理业务合作中,首次令牌时间降低了77%,P99首次令牌时间优化了84%,吞吐量提升了3倍,缓存命中率提升了5.7倍。
这些数字背后有一个共同的逻辑:企业不需要通过堆叠更多的高性能GPU,而是通过软件层面的优化,减少GPU花在重复计算和数据搬运上的时间,从而让GPU把更多时间花在真正的计算上。ParaCache的发布,折射出存储行业正在经历变革。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.