网易首页 > 网易号 > 正文 申请入驻

比英伟达会玩,本地部署 Qwen3.6 ,速度翻了 2.5 倍

0
分享至

大家好,我是 Ai 学习的老章

NVFP4一直是英伟达专属,前几天我也刚介绍:

没想到大模型量化巨星 Unsloth 比英伟达还会玩,他们发布了全新的 Dynamic NVFP4 量化技术,直接让本地跑 Qwen3.6 的速度翻了 2.5 倍,而且精度几乎无损,就问你猛不猛吧


先说结论

如果你手上有一张 RTX 5090 或者 B200 这样的 Blackwell 架构 GPU,那这次的 NVFP4 量化绝对值得关注:

  • Qwen3.6-27B:跑在 24GB VRAM 里,速度比标准 NVFP4 快 2.5 倍

  • Qwen3.6-35B-A3B:高并发下在 B200 上飙到17,561 tokens/s

  • 精度呢?MMLU-Pro、GPQA、AIME 2025 全线对齐 BF16 水平

  • 附赠FP8 KV Cache 校准,上下文长度直接翻倍

一句话总结:又快又准,还省显存


Qwen3.6 NVFP4 吞吐量对比 Qwen3.6 速览

先快速回顾一下 Qwen3.6 本身——这是阿里 4 月份发布的新一代混合思维多模态模型家族,包含两个版本:

模型

参数量

特点

Qwen3.6-27B

270 亿(Dense)

旗舰级编码能力,SWE-bench Verified 77.2

Qwen3.6-35B-A3B

350 亿总参/30 亿激活(MoE)

每 token 只激活 3B 参数,推理效率极高

关键能力:

  • 256K 原生上下文,YaRN 可扩展到 100 万

  • 201 种语言支持

  • Agentic Coding:前端工作流和仓库级推理表现优异

  • Thinking Preservation:保留历史思维链,多轮对话更连贯

  • 多模态:支持图片、视频理解

Qwen3.6-27B 在 SWE-bench Verified 上拿到 77.2 分,Terminal-Bench 2.0 上 59.3 分——这是跟 Claude 4.5 Opus 同档的成绩,就这么说吧,27B 的密集模型做到这个水平,确实离谱


Qwen3.6-27B 官方 Benchmark Dynamic NVFP4 到底做了什么

这是整篇文章的重头戏,先解释一下为什么 Unsloth 的 NVFP4 比 NVIDIA 官方的 NVFP4 快这么多

核心差异:W4A4 vs W4A16

NVIDIA 官方的 NVFP4 量化方案是W4A16——权重是 4-bit,但激活值(Activation)仍然是 16-bit,这意味着矩阵乘法时,GPU 需要把 4-bit 权重先反量化到 16-bit,再做计算

Unsloth 的方案是W4A4——权重和激活值都压到 4-bit,直接利用 Blackwell 架构的FP4 Tensor Core做原生计算,少了反量化这一步,吞吐量直接起飞

下面这张图一目了然地展示了两种方案的核心区别:


W4A4 vs W4A16 对比 动态层量化

"Dynamic" 不是随便起的名字,Unsloth 不是把所有层一刀切量到 4-bit,而是:

  1. 重要层保留更高精度——对模型输出影响大的层会被上采样

  2. 校准数据集精选——混合 Unsloth 自有数据集 + UltraChat,专门针对编程、工具调用、对话三个场景优化

  3. Chat Template 改进——修复了编码和工具调用的一致性问题,减少循环和其他已知问题

这就是为什么精度能保住——不是暴力压缩,而是"该省省、该花花"

内置 MTP 加速

MTP(Multi-Token Prediction)是 Qwen3.6 的独门武器,可以一次预测多个 token,Unsloth 这次把 MTP 张量直接内置到 NVFP4 量化模型里,相当于开箱即用,不需要额外加载 MTP 模块


FP8 KV Cache 校准

另一个实用改进:通过 FP8 KV Cache 校准,上下文长度可以翻倍,对于 Agent 场景来说,更长的上下文意味着可以记住更多的对话历史和工具调用结果

性能跑分:说数据 吞吐量对比(1×B200,128 并发)

Unsloth 官方在 B200 上做了完整测试:

  • Qwen3.6-27B NVFP4:比 NVIDIA 官方 NVFP4 快2.5 倍

  • Qwen3.6-35B-A3B NVFP4:1.56 倍提速(精准版)

  • Qwen3.6-35B-A3B NVFP4-Fast:1.79 倍提速(全 W4A4 版本)

  • 高并发场景下,35B-A3B 可以飙到17,561 tokens/s

解码速度(Decode Speed)方面:27B 提升 1.03 倍,35B-A3B 提升 1.17~1.22 倍

精度对比:几乎无损

这是最让人放心的部分——量化后精度跟 BF16 基本持平:

Qwen3.6-27B NVFP4 精度 Benchmark:

Provider

MMLU-Pro

GPQA

AIME 2025

Unsloth NVFP4

NVIDIA NVFP4

FP8

BF16

Qwen3.6-35B-A3B NVFP4 精度 Benchmark:

Provider

MMLU-Pro

GPQA

AIME 2025

Unsloth NVFP4

Unsloth Fast

NVIDIA NVFP4

FP8

BF16

Unsloth 还特别检查了输出长度——NVFP4 量化后的模型并没有"思考更久"来弥补精度,所以加速是实打实的,不是靠多想来凑的

两个 35B-A3B 版本的选择

Unsloth 给 35B-A3B 出了两个版本:

版本

特点

加速比

NVFP4

部分层保留高精度,更准确

1.56x

NVFP4-Fast

全 W4A4,最大速度

1.79x

如果你跑 Agent 或者工具调用场景,建议用标准版;如果纯聊天或者对速度更敏感,Fast 版本更合适

硬件要求

这是最关键的限制——NVFP4 需要 Blackwell 架构 GPU:

  • ✅ RTX 50 系列(5090、5080 等)

  • ✅ DGX Spark

  • ✅ B200 / B300

  • ❌ RTX 40 系列及更早的卡不支持

如果你的 GPU 不是 Blackwell 架构,别急——Unsloth 的 Dynamic GGUF 量化同样优秀,配合 MTP 在旧卡上也能跑出不错的速度:

Qwen3.6

3-bit

4-bit

6-bit

8-bit

BF16

27B

15 GB

18 GB

24 GB

30 GB

55 GB

35B-A3B

17 GB

23 GB

30 GB

38 GB

70 GB


怎么跑起来 方案一:vLLM(推荐)

# 安装 vLLM
uv venv myenv --python 3.12
uv pip install --python myenv/bin/python \
"vllm==0.24.0" "nvidia-cutlass-dsl==4.5.2" --torch-backend=auto

# 启动 27B NVFP4
vllm serve unsloth/Qwen3.6-27B-NVFP4 \
--speculative-config '{"method": "mtp", "num_speculative_tokens": 2}'

# 或者 35B-A3B Fast 版本
vllm serve unsloth/Qwen3.6-35B-A3B-NVFP4-Fast \
--speculative-config '{"method": "mtp", "num_speculative_tokens": 2}'
方案二:SGLang

python -m sglang.launch_server \
--model-path unsloth/Qwen3.6-27B-NVFP4 \
--speculative-algorithm NEXTN \
--speculative-num-steps 3 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 4
方案三:Unsloth Studio(最简单)

如果你不想折腾命令行,Unsloth Studio 提供了完整的 Web UI:

# 安装
curl -fsSL https://unsloth 。ai/install。sh | sh


# 启动
unsloth studio -p 8888

打开浏览器搜索 Qwen3.6,下载模型就能直接跑,Studio 会自动帮你设置最优的推理参数,包括 MTP 配置

部署为 API 服务

跑起来之后,可以直接用 OpenAI 兼容的 API 调用:

from openai import OpenAI

client = OpenAI(
base_url="http://127.0.0.1:8000/v1",
api_key="sk-no-key-required",
)

completion = client.chat.completions.create(
model="unsloth/Qwen3.6-27B-NVFP4",
messages=[{"role": "user", "content": "帮我写一个 Snake 游戏"}],
temperature=0.6,
top_p=0.95,
extra_body={"top_k": 20},
)
print(completion.choices[0].message.content)

这意味着你可以把它接入 Claude Code、Codex、或者任何支持 OpenAI API 的工具链

和其他方案的对比

Unsloth NVFP4

NVIDIA NVFP4

Unsloth GGUF + MTP

Ollama

速度

⭐⭐⭐⭐⭐

⭐⭐

⭐⭐⭐

⭐⭐

精度

⭐⭐⭐⭐⭐

⭐⭐⭐⭐

⭐⭐⭐⭐

⭐⭐⭐

易用性

⭐⭐⭐⭐

⭐⭐⭐

⭐⭐⭐⭐⭐

⭐⭐⭐⭐⭐

GPU 要求

Blackwell

Blackwell

任意

任意

推荐场景

高吞吐生产部署

生产部署

个人开发/本地

入门体验


总结

Unsloth 这次的 Dynamic NVFP4 量化,核心创新就三个字:W4A4——把权重和激活值都压到 4-bit,直接用 Blackwell 的 FP4 Tensor Core 做原生计算,绕过了传统方案的反量化瓶颈

对于有 Blackwell GPU 的用户来说,这基本是目前跑 Qwen3.6 最快的方案,27B 模型只需要 24GB VRAM,精度还跟 BF16 齐平,对于还在用 40 系卡的同学,Unsloth 的 Dynamic GGUF + MTP 依然是最优选择

最后的最后,提醒一下:不要用 CUDA 13.2(会输出乱码),用 13.2 以下或者 13.3 版本

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中方立场很坚决,若胡塞横扫也门,夺得政权,我们绝不会立马承认

中方立场很坚决,若胡塞横扫也门,夺得政权,我们绝不会立马承认

旧史新谭
2026-10-11 05:34:53
4-0!39岁梅西双响+1V3破门 助迈阿密终结5轮不胜 生涯已进934球

4-0!39岁梅西双响+1V3破门 助迈阿密终结5轮不胜 生涯已进934球

我爱英超
2026-10-11 09:41:37
14亿老百姓的疑问:大数据全覆盖的时代,为什么医院的检查结果,永远不能通用?

14亿老百姓的疑问:大数据全覆盖的时代,为什么医院的检查结果,永远不能通用?

青苹果sht
2026-10-10 06:01:13
国际油价18年间跌了55美元,国内油价却从5.44元涨到8.58元?

国际油价18年间跌了55美元,国内油价却从5.44元涨到8.58元?

爆角追踪
2026-10-10 23:30:31
二十一大马上召开,为什么现在重提70多年前的“两个务必”呢?

二十一大马上召开,为什么现在重提70多年前的“两个务必”呢?

補懂事的孩紙
2026-10-11 08:40:32
男子吃妻子情夫的醋,2010年为让妻子证明更爱他,让妻子将情夫诱来杀死

男子吃妻子情夫的醋,2010年为让妻子证明更爱他,让妻子将情夫诱来杀死

汉史趣闻
2026-10-10 13:59:11
女子找情夫缠绵,被情夫的妻子阻止脱裤子,2015年她砍伤情夫妻子后被杀

女子找情夫缠绵,被情夫的妻子阻止脱裤子,2015年她砍伤情夫妻子后被杀

汉史趣闻
2026-10-11 09:46:16
人社部:要把未参保人员找到动员参保,网友:灵活就业人员是重点

人社部:要把未参保人员找到动员参保,网友:灵活就业人员是重点

东方豪侠
2026-10-11 06:32:43
雅思考试大面积取消,有考生在考场外崩溃大哭:offer待确认,急需语言成绩;多方最新回应

雅思考试大面积取消,有考生在考场外崩溃大哭:offer待确认,急需语言成绩;多方最新回应

91.6陕西交通广播
2026-10-10 21:49:56
由他们去吧!韭菜和镰刀其实也是绝配

由他们去吧!韭菜和镰刀其实也是绝配

细雨中的呼喊
2026-10-10 22:53:11
梅西获评10分+加冕MVP:梅开二度,现场视角还原,太丝滑了

梅西获评10分+加冕MVP:梅开二度,现场视角还原,太丝滑了

侧身凌空斩
2026-10-11 09:39:15
自闭症男童乘电梯遭男子踹倒“被踹后自己躲起来”

自闭症男童乘电梯遭男子踹倒“被踹后自己躲起来”

看看新闻Knews
2026-10-11 00:05:05
永州周女士全网火了!离婚纠纷牵出实名举报,网友:9个男人的原配,才是最揪心的人

永州周女士全网火了!离婚纠纷牵出实名举报,网友:9个男人的原配,才是最揪心的人

火山詩话
2026-10-10 06:55:40
国外发现“饿两天定律”,体重从138斤降到108斤,稳稳瘦下30斤

国外发现“饿两天定律”,体重从138斤降到108斤,稳稳瘦下30斤

健身狂人
2026-10-11 00:58:32
美俄柴油协议,就是今天的慕尼黑协议

美俄柴油协议,就是今天的慕尼黑协议

晓看说
2026-10-11 09:12:58
蓉城冠军要丢!京媒:大连英博有望夺冠,还拥有主动权

蓉城冠军要丢!京媒:大连英博有望夺冠,还拥有主动权

建哥说体育
2026-10-11 08:55:10
男子称三人赴泰旅游,姐夫和弟弟外出后失联 泰国皇家部队‌内部安全行动司令部人士:切勿上他人安排车辆

男子称三人赴泰旅游,姐夫和弟弟外出后失联 泰国皇家部队‌内部安全行动司令部人士:切勿上他人安排车辆

红星新闻
2026-10-10 19:22:04
百万粉丝博主实锤女友出轨多男,“捉奸”细节太劲爆,当场崩溃

百万粉丝博主实锤女友出轨多男,“捉奸”细节太劲爆,当场崩溃

往史过眼云烟
2026-10-10 12:06:25
湖南永州周局长的仕途,为什么能做到极致

湖南永州周局长的仕途,为什么能做到极致

黔有虎
2026-10-10 22:13:23
广西男子河道捞沙时捡到春秋编钟卖了30万元,被判5年并追缴违法所得

广西男子河道捞沙时捡到春秋编钟卖了30万元,被判5年并追缴违法所得

极目新闻
2026-10-10 12:10:07
2026-10-11 12:40:49
Ai学习的老章 incentive-icons
Ai学习的老章
Ai学习的老章
3536文章数 11199关注度
往期回顾 全部

科技要闻

卸任CEO后,苹果董事长库克再度到访中国

头条要闻

牛弹琴:特朗普发出最后通牒 泽连斯基的至暗时刻来了

头条要闻

牛弹琴:特朗普发出最后通牒 泽连斯基的至暗时刻来了

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

梅艳芳63岁冥诞骨灰被盗,亲哥从不知情

财经要闻

黄仁勋长女完婚,万亿帝国如何传承?

汽车要闻

红旗天工07上市 限时16.79万起 硬核通关巴音布鲁克

态度原创

手机
数码
家居
公开课
军事航空

手机要闻

存储芯片疯狂涨价,手机迎来第四轮涨价潮!等等党这次彻底输麻了

数码要闻

行业首款八千元档4K 120Hz投影坚果N5S Turbo高刷版亮相,支持小米米家生态联动

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

沙特利雅得机场遭袭致12死309伤 中国大使馆紧急提醒

无障碍浏览 进入关怀版