网易首页 > 网易号 > 正文 申请入驻

存储成了AI落地最大变量,企业如何打破阻碍?丨ToB产业观察

0
分享至


客服是目前AI应用最广的一个场景。在客服场景中,存在大量重复或相近的问题,这也给本地推理部署带来了巨大挑战,尤其是缓存系统。

按照传统的大模型工作方式,每一个请求GPU都要把系统提示词和历史对话重新计算一遍。这意味着,宝贵的算力被浪费在了“算已经算过的东西”上。

随着大模型从实验室走向生产环境,一个曾经只属于学术讨论的话题被推到了产业前台:推理已经成为吞噬算力的黑洞。

推理时代的“显存墙”

大模型推理的过程,简单来说分两步。第一步是Prefill(预填充),模型把用户的问题“读懂”,生成一堆缓存(也就是KV Cache)。第二步是Decode(解码),模型一个字一个字往外蹦答案。问题在于,多轮对话里大量的问题是重复的,每一次重新Prefill都是在浪费算力。

所以业界早就形成了一个共识:用存储空间换计算时间,把重复生成的KV Cache存下来,下次直接调取。听起来很合理,但执行起来遇到了一堵实实在在的墙,那就是“显存墙”。

GPU的HBM(高带宽内存)容量有限,且成本很高。KV Cache随着上下文长度和并发请求数线性增长,很快就能把显存撑爆,对此,中科曙光分布式存储产品部总经理石静告诉我们,KV Cache在推理过程中的内存开销可以达到数十乃至数百GB,远超单张顶级GPU的显存容量。显存一满,GPU算力再强也转不动,新的请求进不来,正在处理的请求开始卡顿。

东方证券在行业深度报告中判断,AI算力中心的核心挑战已从之前算力为主,逐步转向存储与带宽为主。无独有偶,SEMI中国总裁冯莉在今年3月的演讲中披露,2026年全球AI基础设施支出将达到4500亿美元,其中推理算力占比首次超过70%。她同时判断,全球存储产值将在2026年首次超越晶圆代工,成为半导体产业的第一增长极。

在此背景下,存储正在从一个“配角”,转变为决定推理性能的关键因素。

石静与我们分享了一个更具体的例子:AI智能体在工作时会频繁调用相同的工具包和数据源,KV Cache的重复利用率极高。但如果没有合理的卸载机制,所有KV Cache都挤在HBM里,显存很快被撑爆。“表现就是吐字延时非常高,响应卡顿,用户体验很差。”石静指出。企业面对这种情况,通常只有两条路:要么买更贵的、显存更大的高端GPU,要么就只能眼睁睁看着业务并发上不去。

存储进化方向

解决显存墙,理论上只有两条技术路线。一条是在算法层面压缩KV Cache的体积,从源头上减少数据量。另一条是把KV Cache从HBM里搬出来,放到容量更大、成本更低的存储介质上,比如CPU的DRAM或者本地SSD,再或者分布式存储。

这其中,第二条路径已经成为厂商重点布局的路径。开源的LMCache可以在GPU、CPU和本地磁盘之间灵活存储KV Cache。实测数据显示,在多轮问答和RAG场景中,LMCache能实现3~10倍的延迟降低。谷歌云也在2025年推出了基于Managed Lustre的外部KV Cache方案,据披露数据显示,该方式可将TCO降低35%,用大约40%甚至更少的GPU支撑同样的工作负载。

这些方案虽然能够一时解决显存墙的问题,但他们都有一个比较明显的瓶颈:大多是“单机版”。对此,石静告诉我们,LMCache虽然能破除KV Cache的实例级隔离,但在HBM、DRAM、Local SSD三级仍存在较大程度的节点级资源孤岛。

这就带来了两个问题,一个是资源利用率低。A节点缓存的KV Cache,B节点用不了,只能各自重新计算,这也又导致集群应用下,算力的浪费。另一个是元数据管理混乱。模型推理引擎、框架原生组件、第三方KV组件各有各的元数据管理方式,三层嵌套,缺乏全局视角。石静管这叫“元数据迷雾”,“没有全局视角,就没办法判断什么时候该把KV Cache放到哪一个层级。”石静强调。

此外,更为“致命”的问题在L4层(分布式存储层)。理论上,分布式存储天然适合做KV Cache的池化共享,因为其容量大、成本低、可跨节点访问。但现实是,分布式存储的强一致性锁机制带来较大的延迟,导致它长期被当作“冷数据仓库”使用。

也就是说,KV Cache的分层管理在L1~L3(HBM、DRAM、本地SSD)已经有了不错的实践,但到了真正能实现大规模池化共享的L4层,反而卡住了。分布式存储的性能不够好,延迟太高,无法直接参与推理的实时数据流动。

正是看到了这个卡点,中科曙光在2026中国国际大数据产业博览会(数博会)期间发布了ParaCache。据石静介绍,ParaCache的核心思路是将KV Cache的管理从单机扩展到集群,从四个层级(L1 HBM、L2 CPU DRAM、L3 SSD、L4分布式存储)实现全局池化和动态调度。

当然,这个过程并非“一蹴而就”,实现路径中经历了不少的挑战。首先,在L3层,ParaCache做了一件业界此前没人做过的事——把集中式存储FlashNexus纳入缓存体系。

传统的L3层用的是计算节点自带的本地SSD,存算一体,难以跨机共享,而且SSD盘性能受限于CPU和PCIe通道。FlashNexus Neo是专门为AI推理设计的硬件系列,通过存算解耦实现全局共享,单阵列提供160GB/s带宽能力。实测数据显示,在TTFT、QPS、吞吐量等关键指标上,使用FlashNexus Neo构建的L3缓存池比本地NVMe SSD有接近2倍的提升。

据石静介绍,在L4层挑战更大。ParaStor F9000本身已经是高性能的分布式全闪存储底座(单框提供220GB/s带宽和1000万IOPS)。但光有高性能硬件还不够,ParaCache针对KV Cache的应用方式做了几项定向优化。

第一是数据写入方式。传统分布式存储使用offset覆盖写,ParaCache改成追加写,更有利于降低延迟;第二是锁机制。分布式存储被人诟病最多的就是强一致性带来的延迟,ParaCache在KV Cache场景下做了轻量化处理,可以基于目录去掉分布式锁,或者去除重量的排他锁;第三是在PD分离架构下,只让节点间传输增量KV,节省集群网络带宽。

在全局调度层面,ParaCache提出了一个“Best-effort数据预取”的机制。推理框架调用KV时,会先判断KV是否存在,再调用数据获取,判断与获取之间存在一个时间差。对于已经卸载到L3或L4的冷KV,ParaCache利用这个时间差提前预取。“不用等通知了再去调,而是通过算法提前感知到需要的时候,先把KV调到所需要的层级上,把等待时间化为加速。”石静介绍道。

从测试数据来看,效果是明显的。在多轮对话场景下(30k初始输入叠加20轮对话),ParaCache让首次延迟降低了89%。在多并发场景下,相较于仅使用HBM的方案,吞吐量提升了近26倍。在与头部互联网厂商的在线推理业务合作中,TTFT降低了77%,P99 TTFT优化了84%,吞吐量提升了3倍,缓存命中率提升了5.7倍。

这些数字背后有一个共同的逻辑:企业不需要通过堆叠更多的高性能的GPU,而是通过软件层面的优化,减少GPU花在重复计算和数据搬运上的时间,从而让GPU把更多时间花在真正的计算上。

存储的角色正在被重写

ParaCache的发布,折射出存储行业正在经历变革。赛迪顾问发布的《中国分布式存储市场研究报告(2026)》显示,2025年中国分布式存储市场规模达到289.4亿元,同比增长46%,四年累计增幅177.8%。

但这个市场正在发生结构性的变化。存储不再只是一个存放数据的容器。对此,石静对我们表示,KV Cache正在从“临时状态”变成数据资产。传统的架构里,GPU是中心,KV Cache只是它计算过程中的一个中间产物。但在新的架构下,KV Cache本身是有价值的、可复用的数据,GPU应该围绕这些数据去提供Prefill和Decode的计算能力。

而这个判断将会给存储带来很大的影响。最直接的影响是AI集群的建设思路。以前规划一个智算中心,核心指标是有多少张GPU卡。现在变成了算力、存储、网络乃至缓存的一体化规划。石静表示,现在企业在选择方案时,会更多从TCO成本去考虑,“不再单纯堆砌GPU,而是把SSD和分布式存储都纳入KV Cache管理的考量范围。”石静如是说。

此外,石静也表示这一轮变化也给国产存储的厂商带来了更多的机会。以前存储技术跟随国外,但这两年国内大规模智算中心建设带来了大量实际场景和真实需求。“从计算、存储到网络,国产化的技术和方案层出不穷。”石静说。

当然,ParaCache并非适用所有场景。石静坦言,短请求、问一次就不再问的场景,KV Cache复用率低,收益不明显。此外,实时交易性非常强的场景,对延迟要求极高,L2到L4无论如何优化也追不上L1 HBM的速度。但她也指出,这两个极端场景在当前的推理应用中不是最多的。“真正需求大的是多轮对话、知识库问答、RAG、AI智能体工作流,这些场景里,公共KV Cache的占比越来越高,ParaCache的价值也越来越大。”石静指出。

存储正在从一个“配角”走向前台。它不是要替代GPU,而是要让GPU的算力花在真正该花的地方,而不是等数据、搬数据。如果一套存储方案能让已有的GPU跑出两三倍的吞吐量,让首包延迟降下来,让并发请求扛得住,那它就不只是一个存储产品,而是推理效率的放大器。(本文首发于钛媒体APP,文|Leo张ToB杂谈,作者|张申宇,编辑丨盖虹达)

声明:包含AI生成内容

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“她塌房也太快了吧!”

“她塌房也太快了吧!”

中国新闻周刊
2026-09-01 18:59:20
随着云南玉昆1-0!足协杯4强全部诞生,2支中超二年级球队会师半决赛

随着云南玉昆1-0!足协杯4强全部诞生,2支中超二年级球队会师半决赛

中超伪球迷
2026-09-02 21:58:10
上合峰会落幕!中方当场签约,巴基斯坦有了新身份,莫迪强烈不满

上合峰会落幕!中方当场签约,巴基斯坦有了新身份,莫迪强烈不满

军情观察家
2026-09-02 18:53:47
唐嫣罗晋的新瓜,太炸了!

唐嫣罗晋的新瓜,太炸了!

背包旅行
2026-09-02 15:04:39
31岁女律师李禹墨离世,死因曝光是突发疾病,履历优秀长得像明星

31岁女律师李禹墨离世,死因曝光是突发疾病,履历优秀长得像明星

娱乐圈圈圆
2026-09-02 11:28:25
婚外胚胎案最新:重婚罪未成立,朱女士发视频哭诉认错,满心不甘

婚外胚胎案最新:重婚罪未成立,朱女士发视频哭诉认错,满心不甘

社会日日鲜
2026-09-02 13:16:17
哪个瞬间,你突然就释怀了?网友:有时候老天爷也会给你征兆,再三阻止你走向命运的另一边

哪个瞬间,你突然就释怀了?网友:有时候老天爷也会给你征兆,再三阻止你走向命运的另一边

带你感受人间冷暖
2026-09-02 00:11:31
里奥:从曼联内部获悉,拉什福德回归以来的表现几乎无可挑剔;BBC:目前而言,齐尔克泽很可能留队

里奥:从曼联内部获悉,拉什福德回归以来的表现几乎无可挑剔;BBC:目前而言,齐尔克泽很可能留队

MUREDS
2026-09-02 00:08:42
CCTV5直播,中国男篮VS沙特阿拉伯,赛前3利好1噩耗,能否拿下?

CCTV5直播,中国男篮VS沙特阿拉伯,赛前3利好1噩耗,能否拿下?

体坛小快灵
2026-09-02 09:45:01
“对干得慢、效果差的,该约谈的约谈、该通报的通报,对问题突出、工作严重滞后的,依规依纪追责问责”

“对干得慢、效果差的,该约谈的约谈、该通报的通报,对问题突出、工作严重滞后的,依规依纪追责问责”

政知新媒体
2026-09-02 21:43:56
李想:新一代理想MEGA是全世界最好开最舒适的MPV

李想:新一代理想MEGA是全世界最好开最舒适的MPV

CNMO科技
2026-08-31 10:47:11
重伤老人换四家医院都不敢收?家属控诉:没有医院愿意承担责任!三甲主任:碰到苛刻的病人使人丧失信心,过度维权下,医生不敢轻易冒险

重伤老人换四家医院都不敢收?家属控诉:没有医院愿意承担责任!三甲主任:碰到苛刻的病人使人丧失信心,过度维权下,医生不敢轻易冒险

梅斯医学
2026-09-02 07:56:26
第五代三菱帕杰罗全球首发,经典硬派越野正式回归

第五代三菱帕杰罗全球首发,经典硬派越野正式回归

陋观
2026-09-02 19:25:06
邵氏"五虎将"现状:狄龙功成身退,李修贤当网红,只有他俩已去世

邵氏"五虎将"现状:狄龙功成身退,李修贤当网红,只有他俩已去世

娱圈办事处
2026-09-02 18:58:42
如果当初梁思成的方案被采纳,也许今天的北京是这个样子的

如果当初梁思成的方案被采纳,也许今天的北京是这个样子的

浩渺青史
2026-09-02 02:48:33
突然大反转!美联储主席放鹰砸了金价:黄金一度跌破4300美元!现在能抄底吗?

突然大反转!美联储主席放鹰砸了金价:黄金一度跌破4300美元!现在能抄底吗?

王爷说图表
2026-09-02 16:51:56
“林肯”号航母抵达泰国,又脏又旧连拖船都不想靠近它

“林肯”号航母抵达泰国,又脏又旧连拖船都不想靠近它

三叔的装备空间
2026-09-02 22:47:36
从数据看吉尔吉斯:人口仅720万,却有座蓄水量1.7万亿m³的大湖

从数据看吉尔吉斯:人口仅720万,却有座蓄水量1.7万亿m³的大湖

抽象派大师
2026-09-02 02:23:04
太期待了!罗永浩放狠话,到年底市面上还没开机就能看的电视,他来做,网友:我年龄不算大,现在的电视机我也不会操作

太期待了!罗永浩放狠话,到年底市面上还没开机就能看的电视,他来做,网友:我年龄不算大,现在的电视机我也不会操作

火山詩话
2026-09-02 09:53:09
全网都在画清华丁教授:用你的画风画你,怎么就成了人身攻击?

全网都在画清华丁教授:用你的画风画你,怎么就成了人身攻击?

再战五百回合
2026-09-01 22:32:53
2026-09-02 23:40:49
钛媒体APP incentive-icons
钛媒体APP
独立财经科技媒体
138887文章数 862558关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

乌安全局与乌国防部情报总局在基辅交火 泽连斯基发声

头条要闻

乌安全局与乌国防部情报总局在基辅交火 泽连斯基发声

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

配双腔空悬+机械差速锁 传祺越7预售权益价17.18万起

态度原创

本地
教育
数码
艺术
房产

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

教育要闻

幼稚!高考全省260名瞧不上2600名室友要退学,港中深校长当场说:半年后谁厉害还不一定

数码要闻

华为Watch 6系列手表海外发布

艺术要闻

明代隐藏的“草书奇才”!水平不输张旭、怀素,当今知道他的人不足1%

房产要闻

新四代住宅 新样板间开放丨以艺术之名 赴一场迭代之约

无障碍浏览 进入关怀版