随着大模型上下文窗口从 4K、32K 快速迈向 128K 乃至百万级 token,长文档、多轮对话、RAG 与 Agent 已成为主流用法。然而上下文越长、并发越高,推理系统在 KV Cache 存储上的压力就越突出,这成为了制约吞吐、延迟与成本的关键瓶颈。
本文由英特尔-道客联合实验室出品,系统阐述长上下文推理中的 KV Cache 存储之困,介绍英特尔 KV Shrink 分层卸载与硬件压缩加速方案,并以核心测试数据验证其在 TTFT(Time to First Token,首 token 时延)、压缩效率与 TCO(Total Cost of Ownership,总体拥有成本) 上的收益;同时呈现英特尔与道客围绕该方案联合推出的软硬协同解决方案,以及面向未来的 KV Cache 优化技术矩阵。
一、背景:长上下文推理的“存储之困”
大模型每生成一个 token,都需要前文所有 token 的 KV Cache 参与计算。上下文越长、并发会话越多,Prefill(预填充)阶段的计算量与数据加载量越大,KV Cache 体量也会随之近似线性膨胀,极易占满昂贵的 GPU HBM 显存(High Bandwidth Memory,高带宽内存)。当 GPU 显存无法容纳所有活跃请求时,系统只能频繁将不活跃的会话逐出显存。
用户或 Agent 继续对话时,不得不从零重新计算全部历史 KV Cache,如此往复的驱逐与重算形成了性能的恶性循环。TTFT随上下文增长而陡峭攀升(如图 1 所示),用户体验受到严重影响,运营运维团队也不得不在延迟、并发与TCO之间艰难平衡。
![]()
图 1 TTFT 增长曲线
以存代算、分层卸载
破解之道是“以存代算、分层卸载”:将巨量 KV Cache 从 GPU 显存卸载到 DDR 内存或其他更经济的存储介质(如图 2,大致划分为 L1 到 L4 四层)。但数据卸载会带来性能损耗,巨量数据的传输与存储也会造成额外开销——因此真正可用的方案必须做到“既能卸载、又不掉性能”。
![]()
图 2 基于不同存储介质的 KV Cache 多层卸载机制(L1–L4)
二、解决方案:英特尔 KV Shrink 分层卸载与硬件压缩加速
英特尔推出 KV Shrink 分层卸载与硬件压缩加速方案,依托多级卸载调度机制与英特尔® QAT(Intel® QuickAssist Technology,英特尔® 数据保护与压缩加速技术)硬件加速引擎,在保障推理性能和精度的同时消解卸载损耗,以高效的“以存代算、分层卸载、硬件压缩”破解长上下文推理的存储与性能困局。在实践中,方案以 20%+ 的平均压缩率[i],使 L2 层以下(包括 DDR 内存、SSD 固态盘和远端分布式存储)TB 级乃至 PB 级的大体量 KV Cache 场景都能从中获得运营运维与成本收益。
一
金字塔式多层卸载与灵活调度
通过金字塔架构的多层卸载与灵活的调度机制,KV Cache 在 L1 至 L4 各层存储间分层流动,并借助 CPU 内置的 QAT 硬件加速引擎(从第四代至强® 可扩展处理器开始集成)高效完成相应的数据压缩/解压缩任务。对于 L2 及以下各层,QAT 硬件压缩不仅能够降低传输与存储开销,更直接缩减了下沉到 DDR 内存、SSD 固态盘与远端存储中的实际数据量,成为撬动大体量 KV Cache 存储成本的关键支点。
实时对话等场景中的极热数据将常驻在成本最为昂贵的 L1 层(GPU HBM 显存)以保障低延迟响应;多轮对话等场景中的热数据则被卸载至 L2 层(DDR 内存),通过构建大容量缓存池来扩容降本;历史对话、RAG、Agent 等场景中的温冷数据会下沉至相对经济的 L3/L4 层(本地 SSD 固态盘或远端分布式存储),实现持久化复用。KV Shrink 为多层卸载方案提供了完备的调度机制,可驱动 KV Cache 数据在不同存储层级间灵活流转,充分复用历史 KV Cache,避免重复计算带来的算力浪费。
![]()
图 3 基于英特尔 KV Shrink 的 KV Cache 卸载
二
冷热调度 API 与实战卸载
实战中,用户可结合自身产品策略,通过英特尔 KV Shrink 提供的冷热调度 API 实现 KV Cache 卸载。如图 3 所示,当 vLLM 空闲时,系统可将 KV Cache 数据卸载到 DDR 内存(通过 QAT 实施压缩/解压缩),当会话重启时,再迅速将数据回载到 vLLM 使用。同时当 DDR 内存容量紧张时,系统也可将最旧的数据驱逐到更下一层的固态盘等存储介质。得益于 QAT 专用硬件,其压缩/解压缩吞吐相较纯 CPU 软件方案高出数十倍[ⅱ],整个过程由专用硬件完成,能有效降低 CPU 核心占用率,系统性能损耗很小。
三
数据格式重排,压缩率翻倍
此外,英特尔重新编排了 KV Cache 的数据存储格式,使其对压缩算法更为友好,可将压缩率从原本的 10%+ 提升至 20%+。在保障数据无损、不影响推理精度的前提下实现 20%~30% 的存储空间压降,从而在大幅缩减 KV Cache 存储容量的同时,也降低了跨介质传输的数据量,进一步放大分层卸载的容量、性能和成本收益[ⅲ]。
四
无侵入式集成与极简部署
在集成与部署上,英特尔 KV Shrink 提供了无侵入式集成与极简部署方案。方案采用动态装饰器方式扩展 vLLM,实现零源码修改即可集成;其不仅提供可开箱即用的 Docker 容器化方案,还提供 Python 安装包,支持一键安装部署,目前已适配几乎所有主流开源模型[ⅳ]。得益于极简的工程化设计,企业用户通常仅需两周左右即可接入英特尔 KV Shrink 方案。
三、核心测试结果与性能验证
英特尔已开展一系列测试验证 KV Shrink 的性能表现[ⅴ]。测试采用 vLLM 自带的 benchmark 工具,在典型业务场景下(缓存命中率 80%),对比了未开启 KV Cache 分层卸载的原生 vLLM 基线组、使用英特尔® QAT 硬件压缩卸载的 KV Shrink 方案组、使用 CPU 软件压缩卸载组,以及未使用压缩卸载组在 TTFT 这一核心指标上的表现。从数据结果可以看出,KV Shrink 在多项关键指标上均交出了亮眼的成绩单。
一
TTFT 性能:最高约 5 倍提升
如图 4 所示,在 80% 缓存命中率的典型业务场景下,英特尔 KV Shrink 方案组相比原生 vLLM 基线组实现了大幅的 TTFT(首 token 时延)性能提升,性能最高提升约 5 倍,用户交互体验提升明显。
![]()
图 4 英特尔 KV Shrink 方案与原生 vLLM 基线组 TTFT 性能对比
二
硬件压缩 vs 软件:整体性能提升达 2 倍
如图 5 所示,得益于英特尔® QAT 强劲的压缩/解压缩吞吐能力,基于 QAT 硬件压缩的 KV Shrink 方案整体性能约为软件方案的 2 倍。由于在高并发、长上下文场景下,CPU 软件压缩会占用大量计算核心,导致推理主链路性能下降,而 KV Shrink 方案的压缩/解压缩任务由专用硬件完成,可有效减少对 CPU 核心的占用,性能稳定性更优。
![]()
图 5 英特尔 KV Shrink 方案与纯 CPU 软件方案压缩/解压缩性能对比
三
QAT 压缩开销可控:额外损耗 < 10%
如图 6 所示,在同样的分层卸载机制下,开启 QAT 压缩对比不开启压缩,KV Shrink 方案的 TTFT 性能几乎没有损失(额外开销控制在 10% 以内)。这说明基于英特尔® QAT 的 KV Shrink 方案可在大幅节省 KV Cache 存储空间的同时,把额外性能损耗控制在可忽略的范围内。
![]()
图 6 英特尔 KV Shrink 方案与不使用压缩/解压缩方案的性能对比
四
价值与 TCO
将 KV Cache 卸载到 DDR 内存或本地固态盘,单节点在长上下文、高并发场景下的会话延迟获得显著改善,企业也能以更低的硬件成本支撑同等规模的业务量。当业务规模持续扩展时,同样的卸载与压缩策略所换来的成本节省将被进一步放大;得益于 QAT 优异的压缩性能,这种收益还会随着 KV Cache 整体规模的放大呈线性提升。
生产环境中实际管理的 KV Cache 容量动辄达到几百 TB 甚至 PB 级,即便只是 20%~30% 的压降,落到绝对值上也是非常可观的数字:以 500 TB KV Cache 体量为例,按 30% 的压缩率可直接省下约 150 TB 的存储空间。在 DDR 内存等存储硬件价格日益高涨的今天,这一数量级的 TCO 优化,对企业级推理集群的整体运营而言意义远大于局部资源池层面的节省。同时,节省出来的容量可被重新用于承载更多活跃会话,并进一步提升缓存命中率、降低 Prefill 阶段 GPU 算力消耗,从而在算力与存储两端同时压降 TCO。
五
核心结果汇总
以下表 1 汇总了上述各项核心测试结果,便于快速对照与引用。
![]()
四、落地实践:英特尔-道客(DaoCloud)联合实验室与道客 d.run 应用
搭载英特尔® 至强®处理器的服务器的核心竞争力,不仅在于Telemetry(带外遥测)与Debug(实时诊断与安全调试)技术各自的优势,更在于两者的深度协同,构建起 “预警-排查-修复” 的全流程运维闭环。上部的带外遥测技术负责实时采集数据、捕捉故障前兆,提前发出预警,为下部的实时诊断与安全调试提供精准的排查方向;Debug技术则针对预警信息,快速定位故障根源、完成修复。
一
联合实验室背景
英特尔-道客联合实验室由双方共同发起,聚焦大模型推理基础设施的软硬协同优化。双方围绕 KV Cache 优化、长上下文推理加速等关键方向展开联合攻关与产品化落地,致力于把领先的推理加速能力转化为企业可即用的产品特性。
二
道客实测:Coding Agent 场景[ⅵ]
在联合实验室的测试验证中,英特尔 KV Shrink 方案在 Agent、多轮对话等场景下展现出良好的加速效果。在 TTFT 性能表现上,Coding Agent 场景(80% 命中率)中的 KV Shrink 方案不仅在单路负载和八路并发下的表现均优于同类型的 LM Cache 方案,TTFT 降幅分别约为 12.1% 和 4.6%,同时其单路负载的 TTFT 仅为 114.13 毫秒,展现出良好的性能表现。
![]()
图 7 道客使用 KV Shrink 方案与 LM Cache 方案的 TTFT 性能表现对比
三
英特尔与道客联合解决方案
围绕长上下文推理降本与智算中心资源提效两大方向,英特尔与道客联合推出以下软硬协同解决方案:
方案一:长上下文推理降本利器 —— 英特尔 × DaoCloud 软硬协同 KV Cache 加速方案
DaoCloud 自研多层 KV Cache 方案,集成英特尔 KV Shrink技术,借助 QAT 加速数据压缩/解压缩,通过显存→内存→存储分层卸载,在长上下文场景下几乎不损失推理性能。借助此方案,KV Cache 存储空间可压缩 20%–30%[ⅶ],推理吞吐领先业界方案。
方案二:智算中心资源提效引擎 —— 英特尔 × DaoCloud软硬协同基础设施优化方案
DaoCloud 智算平台统一编排 AI 推理工作负载,并按需调用处理器内置 QAT 加速引擎,将压缩/解压缩任务从 CPU 核心卸载。通过将 QAT 加速能力嵌入推理资源调度链路,压缩性能提升约 2 倍[Ⅷ],可有效缩短 TTFT,同时释放更多 CPU 资源。释放的 CPU 算力可统一调度和再分配,同时通过压缩降低数据传输与存储开销,提升整体资源利用率并降低 TCO。
关于道客
DaoCloud 是全球领先的云原生 AI 操作系统企业,打造 d.run Token 工厂效能平台与 d.run AI 操作系统,实现算力到 Token 的全链路价值转化。
五、面向未来:KV Cache 优化技术矩阵
KV Shrink 只是英特尔在 KV Cache 优化矩阵上的起点。围绕推理优化的深水区,英特尔正逐步布局完整的技术矩阵,针对不同场景与精度要求提供更为多元化的选择:例如基于有损压缩技术的 KV Shrink,可在保证精度的前提下,通过更激进的算法实现 50% 以上的极限压缩比,进一步释放显存与内存空间;另一项按需加载技术,可有效打破全量回载的限制,无需将 KV Cache 全量搬回显存,而是仅加载当前推理所需的关键部分,进一步降低数据搬运开销与恢复延迟。随着这些技术的逐步落地,并经由联合实验室加速产品化,英特尔 KV Cache 优化体系将在大模型推理中持续释放更大潜能。
结语
英特尔-道客联合实验室将持续以“以存代算”理念推动大模型推理降本增效。英特尔 KV Shrink 已在性能、压缩率与 TCO 上验证价值,并在 Coding Agent 等场景的联合测试中完成验证。随着大模型推理深入千行百业,如何用好存储、用好分层、用好硬件加速,已成为推理优化的另一命题,也将成为算力走向普惠的关键一步。
Intel Connection 2026启幕在即,作为英特尔面向中国市场的年度重磅交流平台,本届大会将聚焦智能体AI带来的算力新需求,覆盖算力中枢、AI 工厂、企业 AI 域、AI基础设施、数据中心核心方向,分享最新技术与生态进展。更多硬核技术尽在 15000㎡超大展区,等你来打卡体验!
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.