网易首页 > 网易号 > 正文 申请入驻

显存占用直降30倍!大模型稀疏注意力解码KV缓存方案HiSparse夯爆了

0
分享至

智猩猩AI整理

编辑:BugMaker

长上下文大模型推理,正撞上一堵看不见的墙。

不是算力不够,而是显存放不下。

智能助手需要处理超长文档,Coding Agent需要读取完整代码库,而模型上下文窗口正在迈向百万Token。可每个在线解码请求,都拖着一个随上下文长度线性膨胀的KV Cache。

但服务系统为了随时能选到任意位置,仍把整个 KV 压在 GPU 高带宽内存(HBM)里。

128K token 的 GLM-5.1 请求要占13.09 GB BF16 KV,一个1M Token请求仅KV Cache就可能超过单张H200显存容量。

32K 时几十个并发就耗尽 HBM,128K 时只能容下约 15 个请求。

解码在算力耗尽前,早就撞上了"容量墙"(capacity wall)

来自斯坦福、Meta、阿里巴巴、蚂蚁集团、上海交通大学、北京大学以及 NVIDIA Research 的研究团队提出了HiSparse


值得注意的是,论文作者之一马瑞阳(Ruiyang Ma)来自北京大学,主要研究大模型系统优化与 KV Cache 管理,此次 HiSparse 正是围绕长上下文推理中的缓存效率问题展开设计。他也将作为2026全球AI芯片峰会的报告嘉宾,参与智猩猩在同期主办的,进一步交流这一方向的最新探索。

HiSparse不是新的模型,而是一套大模型推理优化技术,它重新设计了KV Cache的存储方式,让长上下文推理不再被GPU显存卡住。

HiSparse 的思路很直接,把每个请求的完整 KV 历史放进主机内存(host memory),GPU 上只留一个小的固定大小缓存。解码时的 HBM 占用随缓存大小走,而不是随上下文长度走。

结果上,它在 H200、B200、GH200 三种硬件上跑 DSA、NSA、Quest 三种稀疏注意力,长上下文负载下峰值生成吞吐最高提升4.7 倍,每Token生成延迟(TPOT)基本持平,高负载下首 token 延迟(TTFT)反而更低。

01

算力还剩,显存先满

稀疏注意力让"读"变便宜,却没让"存"变便宜。

每步选中的集合在不同 token、不同层之间漂移。当前未被访问的位置,下一刻仍可能重新进入选择集合。所以系统干脆把全部 KV 常驻 HBM。

代价就是那堵墙。32K 输入时,一个 GLM-5.1 请求最多占 4 GB KV。全KV基线约在60个并发时达到饱和,此时KV占用约240GB,这是扣掉权重、激活和 CUDA graph 状态后,HBM 剩下的全部。

再往上加并发,调度器放不进新请求,吞吐原地踏步。注意力内核却还有算力余量。

到 128K,同样的算术只能容下约 15 个请求。


更扎心的是,稀疏选择器在每一步都会明确给出“当前需要哪些KV位置”的需求信号。这是一个现成的、逐位置的需求信号,全 KV 服务却白白浪费了。

而且这个需求有结构,相邻解码步大量重选同一批位置,相邻层的选择高度相关

部分新型稀疏注意力机制进一步利用层间相关性,让多层共享索引器输出。

这正好符合计算机系统中经典的“小缓存+大后端”设计思路。

HBM 应该为注意力真正读的东西付费,而不是为"可能被读到"的所有东西付费。

02

把 KV 搬出 HBM,再用

缓存补回来

HiSparse 把 KV 组织成两级。主机内存(pinned DRAM)存每个活跃请求的权威完整 KV 副本。GPU 上只留一个固定大小的热点缓存(hot device buffer),每个请求、每层 B 个槽位,缓存最近被选中的 KV 记录。

一个页表把每个逻辑位置映射到缓存槽或"仅在主机"标记,LRU 元数据驱动替换。

但真正困难的是,如何在降低显存占用的同时,不拖慢解码过程。

第一,驻留什么。只暂存当前 top-k(B=k)会漏掉每步 30% 的选择,因为选中集合会漂移。HiSparse 用 LRU 管理,在 B=2k 时把 87% 的选择变成设备命中。

第二,把剩余的 miss 藏起来。每个 miss 都要让那一层的注意力等一次主机内存取数。


HiSparse 把命中检测、LRU 替换、元数据更新、主机取数全部融合进一个 CUDA 内核 RESOLVE。每个稀疏层启动一次,直接捕获进 SGLang 的解码 CUDA graph 里。

第三,让解析本身几乎不花时间。RESOLVE 只消费发出的逻辑位置和自己的元数据,对 DSA、NSA、Quest 一视同仁——逻辑索引进、物理槽位出,像一个软件管理的 TLB。

因为它只改 KV 放在哪,选中位置、注意力分数、输出都不变,所以是精确的(exact)。


03

吞吐最高 4.7 倍,

延迟基本不涨

差距随上下文长度放大。

4K 时基线还能在 HBM 里塞下有用的 batch,HiSparse 几乎没空间发挥。一旦上下文变长,基线被容量绑死,HiSparse 让解码显存只随配置的缓存大小走。

为验证通用性,团队进一步测试了三类代表性稀疏注意力模型。

Qwen3+Quest 在 GH200 上,32K 提升3.6 倍(511 到 1824 tokens/s),200K 直接4.7 倍(111 到 520)。

GLM-5.1+DSA 在 H200 上,32K 提升3.1 倍(624 到 1919),160K 提升2.9 倍(232 到 680)。

DeepSeek-V4-Flash 在 2×B200 上,并发 64 时从600 涨到 1257 tokens/s(2.1 倍),如果只统计解码阶段吞吐,提升可达到2.9倍


HiSparse的主要收益来自更大的解码Batch规模,HiSparse 没让单个解码步更快,而是让同样 HBM 能塞进更大的解码 batch。128K 时每请求 KV从 13.09 GB 压到约 0.4 GB(B=4096),大约 30 倍缩减

不需要更多吞吐的运营方,可以将省下的容量转化为更少的 GPU 数量,或改用 HBM 更小、成本更低的型号。

延迟这边,重叠区间内每 token 延迟基本持平。以 DeepSeek-V4-Flash 为例,并发16时,基线与HiSparse的 TPOT分别为15.9 ms16.0 ms

而在 GLM‑5.1‑FP8 的高负载测试中,高负载下 TTFT反而更低,并发 64 时从 829s降到 171s

在 GLM-5.2 上开了精确预取后,基线 618 → 无预取 HiSparse 1515 → 开预取后 1727 tokens/s。端到端提升 2.8 倍,其中仅预取一项就把 TPOT 再降 13–15%、吞吐再提 14–17%

在理想的零主机 IO 情况下,HiSparse 已接近理论性能上界的85%。这说明,系统新增开销主要来自GPU与主机之间的数据传输,而不是缓存管理本身。

HiSparse 全部的代价,就是主机 IO


04

容量墙换成可调的

延迟问题

HiSparse 不是免费午餐。它用主机 IO 换 HBM 容量,同步解析时每 token 暴露 7 到 8 ms IO,开了预取压到约 3 ms。

短上下文或低并发场景里,它没收益可抵消这份开销,直接关掉就行。


当然,HiSparse也不是所有场景都适用。它更适合长上下文、高并发推理场景,而短上下文任务中收益有限。

因此,HiSparse并不是简单地消除成本,而是把不可控的显存瓶颈,转化为系统可以优化的IO开销。

实验表明,仅依赖投机预测很难稳定隐藏miss,而模型提供更准确的选择信息,才能进一步提升预取效果。

LRU 的选择本身有数据支撑。在 GLM-5.1 的 LongBenchV2 选择轨迹上,B=4096 时 LRU 平均 13.4% miss,稳稳低于 FIFO(17.2%)和随机(16.1%)。而且贴着离线最优 Bélády(8.2%)的走势,说明"近期是否被选"是未来稀疏选择的一个好的在线近似指标。

把缓存翻倍到8192,miss 再砍半到 6.7%

HiSparse说明,当模型已经知道“需要什么”时,推理系统就不必为“可能需要什么”提前支付全部显存成本。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
日本全面叫停种植牙?种牙潜藏的风险与后遗症,一次为你讲明白

日本全面叫停种植牙?种牙潜藏的风险与后遗症,一次为你讲明白

健康科普365
2026-08-13 14:30:15
日本记者质问李连杰:南京大屠杀真有三十万人,你们一个个数的?

日本记者质问李连杰:南京大屠杀真有三十万人,你们一个个数的?

芳芳历史烩
2026-08-20 09:29:17
听闻儿子被枪毙了,龙云怒闯中南海,毛主席:你自己回去看看吧

听闻儿子被枪毙了,龙云怒闯中南海,毛主席:你自己回去看看吧

掠影后有感
2026-09-14 09:58:38
国内首次!新疆在盐碱地成功产出天然橡胶,我国将变成橡胶大国?

国内首次!新疆在盐碱地成功产出天然橡胶,我国将变成橡胶大国?

铭记历史呀
2026-09-14 13:41:07
「白头发多,更不易患癌」又添新证!最新研究:早生白发,患癌风险更低;压力耗竭色素细胞,催生白发,预防癌症!异常激活或诱发黑色素瘤

「白头发多,更不易患癌」又添新证!最新研究:早生白发,患癌风险更低;压力耗竭色素细胞,催生白发,预防癌症!异常激活或诱发黑色素瘤

梅斯医学
2026-09-14 07:54:36
赖清德承认中国人身份?洪申翰参加APEC会议,赴大陆必须拿台胞证

赖清德承认中国人身份?洪申翰参加APEC会议,赴大陆必须拿台胞证

就像当初啊
2026-09-15 13:27:14
国家一级女演员陈丽云被逮捕!

国家一级女演员陈丽云被逮捕!

许三岁
2026-03-28 09:24:30
灵活就业人口超3亿,有知名律师称:对老板发牢骚,这下好了,必须怀念“996是一种福报”

灵活就业人口超3亿,有知名律师称:对老板发牢骚,这下好了,必须怀念“996是一种福报”

Mr王的饭后茶
2026-09-15 11:10:58
有人坚决不用智能马桶的冲洗功能?看到内部结构:我也不用了!

有人坚决不用智能马桶的冲洗功能?看到内部结构:我也不用了!

装修秀
2026-09-11 11:35:07
小视频:景甜“粉色抹胸”忽隐忽现,不时“喂饭”孙宇晨!

小视频:景甜“粉色抹胸”忽隐忽现,不时“喂饭”孙宇晨!

默默有话说
2026-09-15 13:37:11
哈里梅根孩子上学两天就退学,专家:早干嘛去了

哈里梅根孩子上学两天就退学,专家:早干嘛去了

浅遇时光
2026-09-15 09:26:21
47岁,今年挣钱到底难到什么程度

47岁,今年挣钱到底难到什么程度

经济学教授V
2026-09-14 19:21:06
HYBE女团成员「唱一半突遭袭胸」惊吓错愕全被拍 竟反被酸穿太露

HYBE女团成员「唱一半突遭袭胸」惊吓错愕全被拍 竟反被酸穿太露

ETtoday星光云
2026-09-14 09:35:03
铁道部长丁关根不知王震要来,竟跑步下楼迎接,王震:我来打土豪来了!

铁道部长丁关根不知王震要来,竟跑步下楼迎接,王震:我来打土豪来了!

海佑讲史
2026-09-09 06:45:10
雷宇扬离世才一周,41岁马荔富婆生活被扒底朝天,广州大豪宅太壕

雷宇扬离世才一周,41岁马荔富婆生活被扒底朝天,广州大豪宅太壕

娱说瑜悦
2026-09-14 13:28:15
他被称为军中一霸:担任兰州军区司令员期间,顶住压力拒不批判首长

他被称为军中一霸:担任兰州军区司令员期间,顶住压力拒不批判首长

大运河时空
2026-09-15 08:10:03
40岁陈赫自曝确诊!已暂停工作

40岁陈赫自曝确诊!已暂停工作

黎兜兜
2026-09-15 12:29:40
叙利亚16年来首次小麦自给,朱拉尼20个月做成了巴沙尔父子54年没做成的事

叙利亚16年来首次小麦自给,朱拉尼20个月做成了巴沙尔父子54年没做成的事

莫地方
2026-08-24 19:38:38
家中搜出300根金条,美中情局前官员认罪

家中搜出300根金条,美中情局前官员认罪

澎湃新闻
2026-09-14 13:59:09
北京北海公园宝积楼牌匾被啄木鸟啄出窟窿?工作人员回应:已关注到,因其属文物,具体保护措施正进行报批,不敢轻易擅自进行维修

北京北海公园宝积楼牌匾被啄木鸟啄出窟窿?工作人员回应:已关注到,因其属文物,具体保护措施正进行报批,不敢轻易擅自进行维修

扬子晚报
2026-09-14 07:31:24
2026-09-15 15:11:00
智猩猩
智猩猩
AI 技术内容与服务平台
114文章数 5关注度
往期回顾 全部

科技要闻

芯片产业链蒸发超5000亿美元,特朗普大怒

头条要闻

也门战事升级 胡塞武装距吉布提的美军基地仅32公里

头条要闻

也门战事升级 胡塞武装距吉布提的美军基地仅32公里

体育要闻

英格兰业余门将,拒绝去非洲当国王

娱乐要闻

她是敬一丹女儿,把公益当事业

财经要闻

未来五年,电子信息制造业发展规划出炉

汽车要闻

纯电续航960km/迪迪虾上车 腾势N8L纯电售29.98万元起

态度原创

旅游
本地
手机
公开课
军事航空

旅游要闻

长城览金秋·栗香飘世界|首届国际板栗丰收节即将上线!

本地新闻

不止胖东来!许昌藏着半部三国史

手机要闻

iOS 26.7正式版发布:修复82个安全漏洞,AirPods固件也一并更新

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

穆杰塔巴近况披露 地方官员:他身体非常健康

无障碍浏览 进入关怀版