网易首页 > 网易号 > 正文 申请入驻

DeepSeek-V4-Flash 正式版开源,极限量化,本地部署成本骤降

0
分享至


DeepSeek-V4-Flash-0731

你梁哥还是你梁哥

DeepSeek-V4-Flash 正式版发布并同步开源了

保留 DeepSeek-V4-Flash-Preview 相同模型结构和参数规模情况下,重新做了后训练(针对具体工作进行专项训练,让模型学会怎样回答问题、怎样调用工具,以及怎样按照要求完成任务),多项基准就超越了三个月前的 V4-Pro 预览版


在大家卷参数量(万亿参数已经常态了)的时候,DeepSeek 又选择了一个巧妙的方向(后训练)并证明了可行

Artificial Analysisi 的大模型智能指数与单任务成本对比图上,横轴是完成一次任务的成本,越往左越便宜;纵轴是模型智能得分,越往上能力越强

所以,一款理想模型应该尽量靠近左上角:既便宜,又聪明;DeepSeek-V4-Flash-0731(Max)所处的位置那两条虚线,被网友称为 DeepSeek 斩杀线


我最关注的自然还是本地部署,企业级应用,本地模型几乎是必选

GLM-5.2、Kimi-K3 都很好,但是它们参数量太大了,部署成本也离谱

DeepSeek-V4-Flash-0731 只有 304B,原生 8-bit 精度,模型文件只有 167GB

诶?我怎么用了只有俩字。。。


vLLM 原版部署

官方版本的本地部署,首推 vLLM,不过要先升级到 v0.25 以上

依然挑卡,英伟达也必须是 Hopper 架构或 Blackwell 架构


vLLM recipe 里还有 H200 单机 PD 分离的方案(4 卡 prefill + 4 卡 decode,Mooncake 或 Nixl 传 KV cache),做推理集群的可以去翻

量化版本地部署

量化之神 Unsloth 量化版本的 GGUF 也来了


DeepSeek-V4-Flash 有点特殊,大家看压缩比例Q4 也没能把权重文件降低多少


官方 checkpoint、UD-Q8_K_XL、UD-Q4_K_XL 和第三方量化的权重构成对比

DeepSeek-V4-Flash 做了量化感知训练(QAT),官方 checkpoint 里那些 routed experts 占了整个模型96%,本来就是用 MXFP4 存的,剩下 4% 是 FP8 或 BF16

GGUF 的 MXFP4 恰好就是同一个格式,所以 Unsloth 做的事情不是「压缩」,而是逐位重打包:专家权重一个 bit 都不动,FP8 反量化到 BF16 也是零舍入

这里有个很反直觉的结论:不是所有人做的 4bit 都一样

同样 4bit 档,Unsloth 的 UD-Q4_K_XL 只把非专家那 4% 压到 Q8_0,专家部分保持逐位精确;而某些第三方转换把专家重新量化到 Q4_K,文件反而更大(164.6GB)、质量还更差(KLD 0.029)


量化质量与体积的关系:UD-Q8_K_XL 是唯一的无损点,UD-Q4_K_XL 在同尺寸档位上质量最优

几个关键数字放一起看:

版本

体积

PPL

KL 散度

top-token 一致率

官方原版(基准)

156.4GB

0

100%

UD-Q8_K_XL

161.9GB

≈0(无损)100%

UD-Q4_K_XL

155.1GB

96.28%

bartowski MXFP4

156.0GB

96.18%

antirez Q4KExperts-F16

164.6GB

93.94%

antirez IQ2XXS

86.7GB

77.92%

UD-Q8_K_XL 的困惑度和官方原版完全相同,小数点后四位一模一样,这在量化里基本见不到

顺手补一句:Unsloth 说他们试过把部分 tensor 用 Q8_0 和 F16 存,结果有损,因为 DeepSeek 做 QAT 就是为了让 MXFP4/FP8 这条路走得通,所以那些 tensor 只能老老实实留 BF16

13 个档位到底怎么选

Unsloth 一共放了 13 个档位,这张曲线图能一眼看出断点在哪:


DeepSeek-V4-Flash 全部量化档位的质量与体积曲线,Q4 到 Q8 之间几乎是垂直下降

我的判断和官方推荐不完全一样

官方推荐 UD-IQ3_XXS,理由是 103GB 能塞进 128GB 内存的机器,这个推荐没错,但看曲线你会发现:从 UD-Q4_K_XL 的 0.0094 掉到 UD-IQ4_XS 的 0.0747,质量差了 8 倍,体积只省了 18GB;再往下到 IQ3_XXS,KL 散度直接是 Q4 的 25 倍

原因就是前面那件事:这个模型的 4bit 是「官方原生的 4bit」,不是「从 16bit 压出来的 4bit」,低于 4bit 才开始真正动专家权重,一动就崩

所以我的选择顺序是:

  • 内存/显存169GB 以上→ 直接 UD-Q8_K_XL,无损

  • 162GB 左右→ UD-Q4_K_XL,只差 0.0102 KLD,实际用起来感知不到

  • 128GB→ UD-IQ3_XXS 是退让方案,能用

  • 128GB 以下→ 我建议别折腾了,去用 API

官方给的内存门槛表(含 KV cache 和上下文分配的余量):

1-bit

2-bit

3-bit

4-bit(接近无损)

Q8_K_XL(无损)

92GB

102GB

110-135GB

162GB

169GB

注意这里的单位是总内存(RAM + VRAM,或者统一内存),Mac 用户可以直接对着自己的统一内存容量看

怎么跑

先编译 llama.cpp,没 GPU 就把-DGGML_CUDA=ON改成OFF,Apple Metal 也是改成OFF(Metal 默认开):

apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
-DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp

最省事的跑法,像ollama run一样直接拉:

export LLAMA_CACHE="unsloth/DeepSeek-V4-Flash-0731-GGUF"
./llama.cpp/llama-cli \
-hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q8_K_XL \
--temp 1.0 \
--top-p 1.0 \
--min-p 0.0

不过这个下载过程很慢,一百多 G 建议手动下,按档位过滤别把整仓库拖下来:

hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \
--local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \
--include "*UD-Q8_K_XL*"

思考档位的开关是这次的重点,三种写法都给你:

--chat-template-kwargs '{"reasoning_effort":"max"}'
--chat-template-kwargs '{"reasoning_effort":"high"}'
--chat-template-kwargs '{"enable_thinking":false}'

llama.cpp 现在也支持--reasoning on/--reasoning off了,Windows PowerShell 用户注意引号得转义成"{\"enable_thinking\":false}"

采样参数照官方来:temperature = 1.0,top_p = 1.0,agentic 场景换成top_p = 0.95;如果开 Think Max,上下文至少给到384K,不然思考没写完就被截断了

嫌命令行麻烦的可以用 Unsloth Studio,Mac / Windows / Linux 都能跑,界面右侧直接切 Non-think / High / Max:


DeepSeek-V4-Flash-0731 在 Unsloth Studio 中运行,右上角可以切换思考档位

curl -fsSL https://unsloth·ai/install·sh | sh
unsloth studio -H 0.0.0.0 -p 8888

有个坑得提醒:DeepSeek 这次官方没给 Jinja 格式的 chat template,只提供了一个encoding文件夹让你自己写编码脚本,Unsloth 补了一版 jinja 模板,拿 4000 多轮对话对齐官方基线,还把工具调用时被丢掉的reasoning_content加回来了

所以下别人的 GGUF 之前,先确认对方有没有处理模板和 MXFP4 重打包这两件事,不然「能跑」和「跑对」是两回事

总结

写到最后,我反而觉得,DeepSeek-V4-Flash 最值得讨论的,并不是又赢了几个榜单,也不是把成本压到了什么位置

DeepSeek 真正厉害的地方,是它一直在探索不同的路

大家都在堆参数,它去做架构创新;大家开始追求万亿参数,它又用后训练告诉我们:模型结构和参数量不变,依然可以把能力提升一大截。更重要的是,每次验证了一条新路线,它没有只把结果留在自己的 API 里,而是选择开源,让所有人都能研究、部署、复现,甚至继续往前走

这对企业尤其重要,说到底还是看成本

企业需要的从来不只是一个榜单第一的模型,而是一个能力足够强、成本可以接受、能够本地部署、技术路线相对透明,并且可以长期掌握在自己手里的模型

GLM、Kimi、Qwen 都在快速进步,但 DeepSeek 依然在不断刷新我们对国产模型能力边界的认知

我最近已经取消了 Codex Pro,越来越多编程、Agent 任务转到国产模型上。说实话,切换之前我也担心会不会明显降级,但实际用下来,并没有想象中的不适,很多任务甚至已经感觉不到差距

DeepSeek 最伟大的贡献,或许并不是给出了某一个标准答案,而是一次次证明:大模型还有很多路可以走,而且这些路,中国团队也能走在前面

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
飞天奖这晚,闫妮无语挂脸,迟蓬一脸不屑,宋佳大满贯骂声满天飞

飞天奖这晚,闫妮无语挂脸,迟蓬一脸不屑,宋佳大满贯骂声满天飞

洲洲影视娱评
2026-10-10 12:44:45
中国再获重大突破!治疗糖尿病或许不再需要打胰岛素,首例已成功

中国再获重大突破!治疗糖尿病或许不再需要打胰岛素,首例已成功

云霄纪史观
2026-10-11 00:50:15
iPhone 18 Pro Max,打脸来得太快

iPhone 18 Pro Max,打脸来得太快

搞机小帝
2026-10-10 18:06:57
大利好!下周一可能要上涨的3大板块!请听我一句

大利好!下周一可能要上涨的3大板块!请听我一句

风风顺
2026-10-11 00:05:19
谁防守谁孙子!欧洲假球悬案:上半场0球 下半场轰11球 99分钟绝杀

谁防守谁孙子!欧洲假球悬案:上半场0球 下半场轰11球 99分钟绝杀

风过乡
2026-10-11 09:06:52
天津一公司男领导给女下属发送淫秽露骨照片,母亲上门讨说法,知情人:事发隔壁公司,女孩可能刚毕业,性格比较腼腆,后续有民警到场处理

天津一公司男领导给女下属发送淫秽露骨照片,母亲上门讨说法,知情人:事发隔壁公司,女孩可能刚毕业,性格比较腼腆,后续有民警到场处理

潇湘晨报
2026-10-10 16:49:10
杨兰兰财富来源为何查不清?澳洲旧反洗钱规则漏了哪些环节?

杨兰兰财富来源为何查不清?澳洲旧反洗钱规则漏了哪些环节?

江山挥笔
2026-10-10 11:15:21
卡扎菲倒台后,那位“乌克兰美女保镖”,真被折磨致死抛尸街头了吗?

卡扎菲倒台后,那位“乌克兰美女保镖”,真被折磨致死抛尸街头了吗?

纪史行者
2026-10-11 05:30:07
苹果宣布,这款 iPhone 钉子神机已经正式过时淘汰!

苹果宣布,这款 iPhone 钉子神机已经正式过时淘汰!

XCiOS俱乐部
2026-10-11 08:52:40
深夜!美联储迎来双重风暴,加息、政治博弈双双引爆

深夜!美联储迎来双重风暴,加息、政治博弈双双引爆

魏家东
2026-10-10 13:37:09
不文明!郑钦文4-1被追到5-5被球迷喊声干扰,生气了:不要说话,谢谢!

不文明!郑钦文4-1被追到5-5被球迷喊声干扰,生气了:不要说话,谢谢!

818体育
2026-10-11 10:15:27
55岁郎永淳现状:妻子退休金只有3000,海归儿子待业,他停不下来

55岁郎永淳现状:妻子退休金只有3000,海归儿子待业,他停不下来

娱说瑜悦
2026-10-10 21:12:17
3-0横扫!弗里克神了:率队8轮全胜,巴萨甩开皇马,稳居榜首

3-0横扫!弗里克神了:率队8轮全胜,巴萨甩开皇马,稳居榜首

足球狗说
2026-10-11 02:30:39
四年大学全部白忙活!上海外国语大学阿拉伯语本科,多地驻外实习,回国无对口岗位,只得做内容运营

四年大学全部白忙活!上海外国语大学阿拉伯语本科,多地驻外实习,回国无对口岗位,只得做内容运营

蝴蝶花雨话教育
2026-10-10 00:05:17
快船106-114输猛龙!此战看到3个事实:八村要拿大合同了

快船106-114输猛龙!此战看到3个事实:八村要拿大合同了

篮球大视野
2026-10-11 09:44:36
29岁手握6座电诈园区!被判死刑的明珍珍,私下生活到底有多壕?

29岁手握6座电诈园区!被判死刑的明珍珍,私下生活到底有多壕?

日不西沉
2026-10-11 04:23:33
大家发现了吗,在农村凡是存款几十万以上者,绝大多数全是这些人

大家发现了吗,在农村凡是存款几十万以上者,绝大多数全是这些人

爱看剧的阿峰
2026-10-11 01:03:14
他是江青内定的副总理,1976年被隔离审查,一年后喝洗厕水自杀

他是江青内定的副总理,1976年被隔离审查,一年后喝洗厕水自杀

史阁
2025-10-14 08:50:53
64岁吴镇宇成都觅食大踩雷!蹄花太腥,兔头吐掉,网红店接连翻车

64岁吴镇宇成都觅食大踩雷!蹄花太腥,兔头吐掉,网红店接连翻车

艺能八卦局
2026-10-11 06:55:55
你已经39岁啦!梅西禁区里1V3杂技:对手被晃晕 13分钟2球 评分10分

你已经39岁啦!梅西禁区里1V3杂技:对手被晃晕 13分钟2球 评分10分

风过乡
2026-10-11 09:58:45
2026-10-11 11:35:00
Ai学习的老章 incentive-icons
Ai学习的老章
Ai学习的老章
3536文章数 11199关注度
往期回顾 全部

科技要闻

卸任CEO后,苹果董事长库克再度到访中国

头条要闻

牛弹琴:特朗普发出最后通牒 泽连斯基的至暗时刻来了

头条要闻

牛弹琴:特朗普发出最后通牒 泽连斯基的至暗时刻来了

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

梅艳芳63岁冥诞骨灰被盗,亲哥从不知情

财经要闻

黄仁勋长女完婚,万亿帝国如何传承?

汽车要闻

武汉市区都能开的游刃有余 风神L8+智驾体验

态度原创

游戏
教育
亲子
房产
公开课

《异界揭踪》制作人游民采访:努力塑造“违和感”

教育要闻

看起来这道题很复杂,实际其中有很多的奥妙

亲子要闻

医院曝光新毒物!多个厂家投毒,坑害婴幼儿,江浙沪已沦为重灾区

房产要闻

海棠湾销冠再出牌:海南顶豪「终局答案」,突然砸出!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版