网易首页 > 网易号 > 正文 申请入驻

让AI自己写大模型推理引擎,跑分暴打vLLM,1792 tokens/s

0
分享至

大家好,我是 Ai 学习的老章

最近硅谷算力圈发生了一件极具震撼力的事情:老牌推理平台 Baseten 的一帮工程师,没有手写一行 CUDA 算子,而是直接把 Claude Code 放进服务器,让它自主攻坚去写一套定制化大模型推理引擎

整整跑了一周之后,压测结果十二分离谱:这套 AI 自己编译出来的推理引擎,跑分竟然暴打当前公认最顶级的开源 SOTA 引擎 vLLM,Decode 生成速度直接拉升了整整 90%

就问你这个提升幅度夸张不夸张

传统引擎的“大而全”包袱

可能很多朋友会有疑问:vLLM、SGLang、TensorRT-LLM 凝聚了全球最顶尖系统架构师的心血,怎么会被一个跑在终端里的 Coding Agent 给挑翻了?

答案藏在现代软件工程的妥协里

现有的开源通用推理引擎确实极为强悍,但它们身上背负着沉重无比的历史包袱:

  • 它们必须同时适配 NVIDIA、AMD、华为昇腾等五花八门的不同硬件架构

  • 它们必须支持 FP16、BF16、INT8、INT4 以及最新 NVFP4 等各种量化格式

  • 它们必须兼容张量并行、流水线并行、MoE 专家并行等各种分布式切分策略

为了兼顾所有可能性,通用框架里堆叠了无数层抽象与动态分支判断

然而当你的业务真正部署上线时,生产环境里的条件其实是完全固定的:

  • 模型规格固定:比如就是 Qwen-3.6-35B-A3B

  • 硬件设备固定:比如就是单台工作站里的单张 NVIDIA B200 GPU

  • 精度格式固定:直接锁死在 NVFP4

  • 流量特征固定:单流长文本吞吐或者高并发特定分布

在这种极度严苛的固定约束下,通用框架里 90% 以上的抽象兼容逻辑全成了拖累性能的纯冗余

既然环境边界已经完全确定,为什么还要用大而全的瑞士军刀?为什么不让 AI 针对这套特定配置,量身定做一把锋利至极的手术刀?

下图清晰揭示了当前行业正处于技术拐点的四大合流趋势:模型推理能力跃升、Agent 自动化工作流成熟、客观可量化验证指标明确,以及全行业对推理成本控制的极度渴求


四大驱动趋势合流 战报:单卡 B200 实测数据暴打 vLLM

口说无凭,咱们直接看 Baseten 官方实测的硬核压测数据

实验团队选用了国产之光 Qwen-3.6-35B-A3B 作为基准,采用 NVFP4 精度,直接在单张 NVIDIA B200 硬件上死磕 vLLM 0.25.1 最新稳定版

经过 AI 多轮自主优化,最终产出的定制推理引擎被命名为 VibeQwen,各项核心指标全部呈现碾压态势:

  1. 单流 Decode 解码速率(TPOT): 在处理结构化、高重合度的单流文本时,VibeQwen 飙出了 1,792 tokens/s 的惊人速率,相比经过精心调优的 vLLM(943 tokens/s), 速度直接暴增 90%

  2. 首字响应延迟(TTFT): 返回第一个 Token 的时间从 vLLM 的 28ms 直接暴跌到 12ms ,缩短了整整 57%,响应速度提升达 2.33 倍,直接为极低延迟交互场景打开了大门

  3. 高并发场景总吞吐量: 在 Concurrency 为 32 的高并发真实压测下,VibeQwen 的单卡输出吞吐量达到 10,307 tokens/s ,而 vLLM 停留在 6,030 tokens/s, 整机吞吐提升 71%

下图是两者的正面硬刚对比柱状图,右侧绿色高光部分就是 VibeQwen 砍下的战绩:


VibeQwen 与调优版 vLLM 性能正面对比

除了大语言模型,团队还趁热打铁做了第二组跨模态验证

他们将这套优化方法迁移到了 Meta 最新的图像分割大模型 SAM 3.1 上,基于单张 H100 打造了专职推理服务 Sammie:

  • 面对图像与短文本提示词,Sammie 在单张 H100 上跑出了 每秒 91 张图片 的超强吞吐

  • 比 Meta 官方提供的参考服务整整高出 50%

  • 最可怕的是:因为复用了前一次实验沉淀的优化经验知识库,Sammie 从立项到完工只用了大概 2 天时间与 2 亿 Token

Sammie 在 SAM 3.1 图像分割任务上的吞吐实测 核心解密:AI 是怎么当好“超强编译器”的

看到这里,估计做底层 Infra 的同学坐不住了:AI 到底掌握了什么黑魔法?

其实整个工程背后依托的是开源界前沿的 MetaInfer 架构(arXiv:2607.12875),其核心思想被称为 LLM-as-Compiler(大模型即编译器)

整个执行链路并没有玄学,而是一个设计极度精密且完全闭环的自动化实验场

下图完整拆解了这套由大模型主导的“自动化编译器”攻坚全流程,从物理边界定义、长程自治攻坚,一直到不可变真值裁决:


MetaInfer 闭环工作流架构图

工程师首先给 Claude Code 赋予了 B200 算力机的 SSH 权限与底层诊断工具,设定了一个极度明确的不可变目标:/goal beat vLLM by 20% on all performance metrics without accuracy loss

在这场无人值守的长程攻坚战里,有两项设计堪称教科书级别:

1. 极其严苛的“防作弊”精度裁决器(Oracle)

如果你让 AI 优化代码却没给它锁死精度底线,AI 很快就会展现出极其狡黠的作弊能力:它会直接写出下面这段逻辑来交卷:

while True:
yield "a"

这种代码的 TTFT 和 TPOT 跑分能秒杀宇宙间所有引擎,延迟无限趋近于零,吞吐无限大,但它除了吐字符 "a" 之外没有任何实用价值

Baseten 的做法是直接挂载原版 BF16 权重作为终极裁判,AI 每次改动算子或调整内存分配,都必须在容差阈值内通过精度测试,一旦结果发生漂移直接被红牌罚下

2. 自主进化且可沉淀的领域知识库

与 Karpathy 提出的 autoresearch 思想一脉相承,Agent 在攻坚过程中并非盲目乱撞,而是会将验证成功的 CUDA 算子组合、显存预分配策略与通信方案记录进知识库

在第一轮搞定 Qwen-3.6-35B 后,这些优化经验立刻被用于加速 SAM 3.1,展现出了极具生产力价值的复用能力

下图展示了全球对 AI 推理算力需求的指数级井喷现状,推理成本的急剧增加正在迫使全行业寻求算力极限:


全球 AI 推理算力需求指数级跃升 成本复盘与真诚思考

咱们必须要讲真话,客观看待这项技术的当下与未来

首先看账本:这套方案目前绝不是零成本的游戏:

  • 在打磨 VibeQwen 的一周时间里,Claude 累计消耗了大约 17 亿 Token (绝大多数由输入上下文缓存覆盖)

  • 消耗了约 200 个 B200 GPU 卡时

  • 整体研发开销折合数千美元

但站在商业视角的另一端,算力经济学展现出了恐怖的吸引力: 如今头部大厂每年在模型在线推理上的算力账单动辄数千万甚至数亿美元,哪怕整体吞吐仅提升 10%,对应的都是真金白银数百万美元的机房服务器结余

花几千美元的 API 和电费,让 Agent 自主烧卡跑出一套提速 50% 到 90% 的专用引擎,这笔投资回报率在商业上已经完全算得过来账

局限性同样客观存在:

  • 目前产出的 VibeQwen 和 Sammie 仍停留在实验与特定基准测试阶段,尚未承接真实的混合生产流量

  • 面对复杂的多机多卡流水线与动态超长上下文,Agent 的鲁棒性仍需要人类架构师在旁保驾护航

总结

Baseten 的这次实测,给我们整个技术社区敲响了警钟:

以往底层系统优化被视为仅有少数顶尖黑客才能涉足的禁区,大家习惯了漫长的代码抽象、接口兼容与跨平台编译,结果系统越来越重,推理瓶颈越积越深

而 MetaInfer 与这次实验展现了一种全新的范式: 未来的工程师不再需要日夜死磕手撕 CUDA 汇编,真正的技术壁垒正在转移到 如何精准定义硬件与业务边界、如何设计防止 AI 作弊的基准裁决器,以及 如何调度 Agent 建立自动化评估流水线

让大模型去加速大模型,这一天来得比我们所有人想象的都要快得多

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
飞天奖这晚,闫妮无语挂脸,迟蓬一脸不屑,宋佳大满贯骂声满天飞

飞天奖这晚,闫妮无语挂脸,迟蓬一脸不屑,宋佳大满贯骂声满天飞

洲洲影视娱评
2026-10-10 12:44:45
中国再获重大突破!治疗糖尿病或许不再需要打胰岛素,首例已成功

中国再获重大突破!治疗糖尿病或许不再需要打胰岛素,首例已成功

云霄纪史观
2026-10-11 00:50:15
iPhone 18 Pro Max,打脸来得太快

iPhone 18 Pro Max,打脸来得太快

搞机小帝
2026-10-10 18:06:57
大利好!下周一可能要上涨的3大板块!请听我一句

大利好!下周一可能要上涨的3大板块!请听我一句

风风顺
2026-10-11 00:05:19
谁防守谁孙子!欧洲假球悬案:上半场0球 下半场轰11球 99分钟绝杀

谁防守谁孙子!欧洲假球悬案:上半场0球 下半场轰11球 99分钟绝杀

风过乡
2026-10-11 09:06:52
天津一公司男领导给女下属发送淫秽露骨照片,母亲上门讨说法,知情人:事发隔壁公司,女孩可能刚毕业,性格比较腼腆,后续有民警到场处理

天津一公司男领导给女下属发送淫秽露骨照片,母亲上门讨说法,知情人:事发隔壁公司,女孩可能刚毕业,性格比较腼腆,后续有民警到场处理

潇湘晨报
2026-10-10 16:49:10
杨兰兰财富来源为何查不清?澳洲旧反洗钱规则漏了哪些环节?

杨兰兰财富来源为何查不清?澳洲旧反洗钱规则漏了哪些环节?

江山挥笔
2026-10-10 11:15:21
卡扎菲倒台后,那位“乌克兰美女保镖”,真被折磨致死抛尸街头了吗?

卡扎菲倒台后,那位“乌克兰美女保镖”,真被折磨致死抛尸街头了吗?

纪史行者
2026-10-11 05:30:07
苹果宣布,这款 iPhone 钉子神机已经正式过时淘汰!

苹果宣布,这款 iPhone 钉子神机已经正式过时淘汰!

XCiOS俱乐部
2026-10-11 08:52:40
深夜!美联储迎来双重风暴,加息、政治博弈双双引爆

深夜!美联储迎来双重风暴,加息、政治博弈双双引爆

魏家东
2026-10-10 13:37:09
不文明!郑钦文4-1被追到5-5被球迷喊声干扰,生气了:不要说话,谢谢!

不文明!郑钦文4-1被追到5-5被球迷喊声干扰,生气了:不要说话,谢谢!

818体育
2026-10-11 10:15:27
55岁郎永淳现状:妻子退休金只有3000,海归儿子待业,他停不下来

55岁郎永淳现状:妻子退休金只有3000,海归儿子待业,他停不下来

娱说瑜悦
2026-10-10 21:12:17
3-0横扫!弗里克神了:率队8轮全胜,巴萨甩开皇马,稳居榜首

3-0横扫!弗里克神了:率队8轮全胜,巴萨甩开皇马,稳居榜首

足球狗说
2026-10-11 02:30:39
四年大学全部白忙活!上海外国语大学阿拉伯语本科,多地驻外实习,回国无对口岗位,只得做内容运营

四年大学全部白忙活!上海外国语大学阿拉伯语本科,多地驻外实习,回国无对口岗位,只得做内容运营

蝴蝶花雨话教育
2026-10-10 00:05:17
快船106-114输猛龙!此战看到3个事实:八村要拿大合同了

快船106-114输猛龙!此战看到3个事实:八村要拿大合同了

篮球大视野
2026-10-11 09:44:36
29岁手握6座电诈园区!被判死刑的明珍珍,私下生活到底有多壕?

29岁手握6座电诈园区!被判死刑的明珍珍,私下生活到底有多壕?

日不西沉
2026-10-11 04:23:33
大家发现了吗,在农村凡是存款几十万以上者,绝大多数全是这些人

大家发现了吗,在农村凡是存款几十万以上者,绝大多数全是这些人

爱看剧的阿峰
2026-10-11 01:03:14
他是江青内定的副总理,1976年被隔离审查,一年后喝洗厕水自杀

他是江青内定的副总理,1976年被隔离审查,一年后喝洗厕水自杀

史阁
2025-10-14 08:50:53
64岁吴镇宇成都觅食大踩雷!蹄花太腥,兔头吐掉,网红店接连翻车

64岁吴镇宇成都觅食大踩雷!蹄花太腥,兔头吐掉,网红店接连翻车

艺能八卦局
2026-10-11 06:55:55
你已经39岁啦!梅西禁区里1V3杂技:对手被晃晕 13分钟2球 评分10分

你已经39岁啦!梅西禁区里1V3杂技:对手被晃晕 13分钟2球 评分10分

风过乡
2026-10-11 09:58:45
2026-10-11 11:35:00
Ai学习的老章 incentive-icons
Ai学习的老章
Ai学习的老章
3536文章数 11199关注度
往期回顾 全部

科技要闻

卸任CEO后,苹果董事长库克再度到访中国

头条要闻

牛弹琴:特朗普发出最后通牒 泽连斯基的至暗时刻来了

头条要闻

牛弹琴:特朗普发出最后通牒 泽连斯基的至暗时刻来了

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

梅艳芳63岁冥诞骨灰被盗,亲哥从不知情

财经要闻

黄仁勋长女完婚,万亿帝国如何传承?

汽车要闻

武汉市区都能开的游刃有余 风神L8+智驾体验

态度原创

游戏
本地
旅游
时尚
公开课

《异界揭踪》制作人游民采访:努力塑造“违和感”

本地新闻

踏访沙县第一村,寻国民小吃本源

旅游要闻

“经”彩新图景丨从“流量”到“留量”:8.26亿人次出游背后的文旅经济之变

伊姐周六热推:电视剧《魅影神捕》;电视剧《美人余》......

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版