网易首页 > 网易号 > 正文 申请入驻

DeepSeek-V4-Flash 正式版开源,极限量化,本地部署成本骤降

0
分享至


DeepSeek-V4-Flash-0731

你梁哥还是你梁哥

DeepSeek-V4-Flash 正式版发布并同步开源了

保留 DeepSeek-V4-Flash-Preview 相同模型结构和参数规模情况下,重新做了后训练(针对具体工作进行专项训练,让模型学会怎样回答问题、怎样调用工具,以及怎样按照要求完成任务),多项基准就超越了三个月前的 V4-Pro 预览版


在大家卷参数量(万亿参数已经常态了)的时候,DeepSeek 又选择了一个巧妙的方向(后训练)并证明了可行

Artificial Analysisi 的大模型智能指数与单任务成本对比图上,横轴是完成一次任务的成本,越往左越便宜;纵轴是模型智能得分,越往上能力越强

所以,一款理想模型应该尽量靠近左上角:既便宜,又聪明;DeepSeek-V4-Flash-0731(Max)所处的位置那两条虚线,被网友称为 DeepSeek 斩杀线


我最关注的自然还是本地部署,企业级应用,本地模型几乎是必选

GLM-5.2、Kimi-K3 都很好,但是它们参数量太大了,部署成本也离谱

DeepSeek-V4-Flash-0731 只有 304B,原生 8-bit 精度,模型文件只有 167GB

诶?我怎么用了只有俩字。。。


vLLM 原版部署

官方版本的本地部署,首推 vLLM,不过要先升级到 v0.25 以上

依然挑卡,英伟达也必须是 Hopper 架构或 Blackwell 架构


vLLM recipe 里还有 H200 单机 PD 分离的方案(4 卡 prefill + 4 卡 decode,Mooncake 或 Nixl 传 KV cache),做推理集群的可以去翻

量化版本地部署

量化之神 Unsloth 量化版本的 GGUF 也来了


DeepSeek-V4-Flash 有点特殊,大家看压缩比例Q4 也没能把权重文件降低多少


官方 checkpoint、UD-Q8_K_XL、UD-Q4_K_XL 和第三方量化的权重构成对比

DeepSeek-V4-Flash 做了量化感知训练(QAT),官方 checkpoint 里那些 routed experts 占了整个模型96%,本来就是用 MXFP4 存的,剩下 4% 是 FP8 或 BF16

GGUF 的 MXFP4 恰好就是同一个格式,所以 Unsloth 做的事情不是「压缩」,而是逐位重打包:专家权重一个 bit 都不动,FP8 反量化到 BF16 也是零舍入

这里有个很反直觉的结论:不是所有人做的 4bit 都一样

同样 4bit 档,Unsloth 的 UD-Q4_K_XL 只把非专家那 4% 压到 Q8_0,专家部分保持逐位精确;而某些第三方转换把专家重新量化到 Q4_K,文件反而更大(164.6GB)、质量还更差(KLD 0.029)


量化质量与体积的关系:UD-Q8_K_XL 是唯一的无损点,UD-Q4_K_XL 在同尺寸档位上质量最优

几个关键数字放一起看:

版本

体积

PPL

KL 散度

top-token 一致率

官方原版(基准)

156.4GB

0

100%

UD-Q8_K_XL

161.9GB

≈0(无损)100%

UD-Q4_K_XL

155.1GB

96.28%

bartowski MXFP4

156.0GB

96.18%

antirez Q4KExperts-F16

164.6GB

93.94%

antirez IQ2XXS

86.7GB

77.92%

UD-Q8_K_XL 的困惑度和官方原版完全相同,小数点后四位一模一样,这在量化里基本见不到

顺手补一句:Unsloth 说他们试过把部分 tensor 用 Q8_0 和 F16 存,结果有损,因为 DeepSeek 做 QAT 就是为了让 MXFP4/FP8 这条路走得通,所以那些 tensor 只能老老实实留 BF16

13 个档位到底怎么选

Unsloth 一共放了 13 个档位,这张曲线图能一眼看出断点在哪:


DeepSeek-V4-Flash 全部量化档位的质量与体积曲线,Q4 到 Q8 之间几乎是垂直下降

我的判断和官方推荐不完全一样

官方推荐 UD-IQ3_XXS,理由是 103GB 能塞进 128GB 内存的机器,这个推荐没错,但看曲线你会发现:从 UD-Q4_K_XL 的 0.0094 掉到 UD-IQ4_XS 的 0.0747,质量差了 8 倍,体积只省了 18GB;再往下到 IQ3_XXS,KL 散度直接是 Q4 的 25 倍

原因就是前面那件事:这个模型的 4bit 是「官方原生的 4bit」,不是「从 16bit 压出来的 4bit」,低于 4bit 才开始真正动专家权重,一动就崩

所以我的选择顺序是:

  • 内存/显存169GB 以上→ 直接 UD-Q8_K_XL,无损

  • 162GB 左右→ UD-Q4_K_XL,只差 0.0102 KLD,实际用起来感知不到

  • 128GB→ UD-IQ3_XXS 是退让方案,能用

  • 128GB 以下→ 我建议别折腾了,去用 API

官方给的内存门槛表(含 KV cache 和上下文分配的余量):

1-bit

2-bit

3-bit

4-bit(接近无损)

Q8_K_XL(无损)

92GB

102GB

110-135GB

162GB

169GB

注意这里的单位是总内存(RAM + VRAM,或者统一内存),Mac 用户可以直接对着自己的统一内存容量看

怎么跑

先编译 llama.cpp,没 GPU 就把-DGGML_CUDA=ON改成OFF,Apple Metal 也是改成OFF(Metal 默认开):

apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
-DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp

最省事的跑法,像ollama run一样直接拉:

export LLAMA_CACHE="unsloth/DeepSeek-V4-Flash-0731-GGUF"
./llama.cpp/llama-cli \
-hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q8_K_XL \
--temp 1.0 \
--top-p 1.0 \
--min-p 0.0

不过这个下载过程很慢,一百多 G 建议手动下,按档位过滤别把整仓库拖下来:

hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \
--local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \
--include "*UD-Q8_K_XL*"

思考档位的开关是这次的重点,三种写法都给你:

--chat-template-kwargs '{"reasoning_effort":"max"}'
--chat-template-kwargs '{"reasoning_effort":"high"}'
--chat-template-kwargs '{"enable_thinking":false}'

llama.cpp 现在也支持--reasoning on/--reasoning off了,Windows PowerShell 用户注意引号得转义成"{\"enable_thinking\":false}"

采样参数照官方来:temperature = 1.0,top_p = 1.0,agentic 场景换成top_p = 0.95;如果开 Think Max,上下文至少给到384K,不然思考没写完就被截断了

嫌命令行麻烦的可以用 Unsloth Studio,Mac / Windows / Linux 都能跑,界面右侧直接切 Non-think / High / Max:


DeepSeek-V4-Flash-0731 在 Unsloth Studio 中运行,右上角可以切换思考档位

curl -fsSL https://unsloth·ai/install·sh | sh
unsloth studio -H 0.0.0.0 -p 8888

有个坑得提醒:DeepSeek 这次官方没给 Jinja 格式的 chat template,只提供了一个encoding文件夹让你自己写编码脚本,Unsloth 补了一版 jinja 模板,拿 4000 多轮对话对齐官方基线,还把工具调用时被丢掉的reasoning_content加回来了

所以下别人的 GGUF 之前,先确认对方有没有处理模板和 MXFP4 重打包这两件事,不然「能跑」和「跑对」是两回事

总结

写到最后,我反而觉得,DeepSeek-V4-Flash 最值得讨论的,并不是又赢了几个榜单,也不是把成本压到了什么位置

DeepSeek 真正厉害的地方,是它一直在探索不同的路

大家都在堆参数,它去做架构创新;大家开始追求万亿参数,它又用后训练告诉我们:模型结构和参数量不变,依然可以把能力提升一大截。更重要的是,每次验证了一条新路线,它没有只把结果留在自己的 API 里,而是选择开源,让所有人都能研究、部署、复现,甚至继续往前走

这对企业尤其重要,说到底还是看成本

企业需要的从来不只是一个榜单第一的模型,而是一个能力足够强、成本可以接受、能够本地部署、技术路线相对透明,并且可以长期掌握在自己手里的模型

GLM、Kimi、Qwen 都在快速进步,但 DeepSeek 依然在不断刷新我们对国产模型能力边界的认知

我最近已经取消了 Codex Pro,越来越多编程、Agent 任务转到国产模型上。说实话,切换之前我也担心会不会明显降级,但实际用下来,并没有想象中的不适,很多任务甚至已经感觉不到差距

DeepSeek 最伟大的贡献,或许并不是给出了某一个标准答案,而是一次次证明:大模型还有很多路可以走,而且这些路,中国团队也能走在前面

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
沙特利雅得机场遭袭,造成12人死亡、309人受伤,中国驻沙特大使馆紧急提醒

沙特利雅得机场遭袭,造成12人死亡、309人受伤,中国驻沙特大使馆紧急提醒

政知新媒体
2026-10-11 07:18:10
大闸蟹全线崩盘,面子经济碎了

大闸蟹全线崩盘,面子经济碎了

城事堂
2026-10-10 09:43:42
懂车帝“前主编“晒猛料,这场“尊界风波”监管可能要进场了

懂车帝“前主编“晒猛料,这场“尊界风波”监管可能要进场了

大厂财经社
2026-10-11 00:10:57
网友吐槽阿迪海报宋雨琦指甲变犄角 门店回应:现已撤下

网友吐槽阿迪海报宋雨琦指甲变犄角 门店回应:现已撤下

快科技
2026-10-10 20:51:10
盒马涉事银鳕鱼已下架 店员苦劝:不要买给孩子吃

盒马涉事银鳕鱼已下架 店员苦劝:不要买给孩子吃

看看新闻Knews
2026-10-10 19:37:05
惨遭一日双杀!张本美和1:4完败王曼昱,赛后采访彻底被打服!

惨遭一日双杀!张本美和1:4完败王曼昱,赛后采访彻底被打服!

田先生篮球
2026-10-10 21:02:36
雅思官方:10月10日中国大陆地区雅思纸笔和机考全部取消,系英国方面雅思考试系统出现技术问题

雅思官方:10月10日中国大陆地区雅思纸笔和机考全部取消,系英国方面雅思考试系统出现技术问题

和讯网
2026-10-10 15:07:43
再次调整!中网官宣:郑钦文冲冠时间有变,获1个利好,CCTV直播

再次调整!中网官宣:郑钦文冲冠时间有变,获1个利好,CCTV直播

大秦壁虎白话体育
2026-10-10 21:55:53
中欧贸易谈判取得重大突破,很多人不理解中国为何主动让步?

中欧贸易谈判取得重大突破,很多人不理解中国为何主动让步?

罗富强说
2026-10-10 21:38:16
中菲发生海上冲突,美方已经介入,中方兵力已翻倍,对菲网开一面

中菲发生海上冲突,美方已经介入,中方兵力已翻倍,对菲网开一面

向日葵向阳西晒
2026-10-11 01:22:17
车企证实收到中汽中心对制动踏板总成材质调研问卷 业内:或推动行业标准修订

车企证实收到中汽中心对制动踏板总成材质调研问卷 业内:或推动行业标准修订

红星资本局
2026-10-10 16:42:09
“天眼深度游”调查:付费可自驾到核心区,有住酒店游客竟带电子设备上“锅圈”拍照

“天眼深度游”调查:付费可自驾到核心区,有住酒店游客竟带电子设备上“锅圈”拍照

红星新闻
2026-10-10 21:38:41
1.25亿先生处子球,维尼修斯进球被吹+染红,十人皇马1-0黄潜

1.25亿先生处子球,维尼修斯进球被吹+染红,十人皇马1-0黄潜

钉钉陌上花开
2026-10-11 04:58:17
秘鲁一位名叫希特勒·墨索里尼的男子当选市长,该国数千人名叫“希特勒”;2018年也曾产生“希特勒”市长,竞选口号是“我是好希特勒”

秘鲁一位名叫希特勒·墨索里尼的男子当选市长,该国数千人名叫“希特勒”;2018年也曾产生“希特勒”市长,竞选口号是“我是好希特勒”

极目新闻
2026-10-10 14:46:03
人民币升值将引爆财富增长:人民币越值钱,你的工资房子越值钱

人民币升值将引爆财富增长:人民币越值钱,你的工资房子越值钱

兴趣知识
2026-10-11 01:12:39
拉拽对手头发!皇马1.3亿巨星染红后怒喷主裁 或禁赛3场+无缘战巴萨

拉拽对手头发!皇马1.3亿巨星染红后怒喷主裁 或禁赛3场+无缘战巴萨

我爱英超
2026-10-11 06:59:03
武网遭批!郑钦文次轮就打萨巴 外卡不给朱琳 网友:生怕她们赢球?

武网遭批!郑钦文次轮就打萨巴 外卡不给朱琳 网友:生怕她们赢球?

念洲
2026-10-11 09:04:06
尊界制动踏板支架断裂后,岚图、本田、仰望等多家车企高管晒自家刹车部件

尊界制动踏板支架断裂后,岚图、本田、仰望等多家车企高管晒自家刹车部件

澎湃新闻
2026-10-10 10:54:30
《伟大的长征》被骂惨!于和伟负主要责任,网友:看1集就换台了

《伟大的长征》被骂惨!于和伟负主要责任,网友:看1集就换台了

锅锅爱历史
2026-10-11 00:52:04
舆论反转!尊界踏板支架断裂事件,余承东淡定反应获网友力挺,直言“余总这波,输没输产品另说,至少没输人”

舆论反转!尊界踏板支架断裂事件,余承东淡定反应获网友力挺,直言“余总这波,输没输产品另说,至少没输人”

火山詩话
2026-10-09 14:57:30
2026-10-11 10:28:49
Ai学习的老章 incentive-icons
Ai学习的老章
Ai学习的老章
3536文章数 11199关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

牛弹琴:特朗普发出最后通牒 泽连斯基的至暗时刻来了

头条要闻

牛弹琴:特朗普发出最后通牒 泽连斯基的至暗时刻来了

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

梅艳芳63岁冥诞骨灰被盗,亲哥从不知情

财经要闻

黄仁勋长女完婚,万亿帝国如何传承?

汽车要闻

千匹马力+三把锁/顶配能浮水 银河战舰700限时焕新价16.98万起

态度原创

旅游
数码
游戏
家居
公开课

旅游要闻

10月10日最佳情报|泉城公园秋英绽放,济阳山楂红满枝头!

数码要闻

苹果新一代Apple TV 4K有望于10月13日正式亮相

《异界揭踪》制作人游民采访:努力塑造“违和感”

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版