网易首页 > 网易号 > 正文 申请入驻

DeepSeek V4 Flash刷屏海外, “像魔法一样” 的 AI,只卖几分钱,我终于养得起智能体了

0
分享至


出品 | 网易智能

作者 | 小小

编辑 | 王凤枝

DeepSeek又一次引发海外开发者热议,连马斯克都在X上关注了它。


7月31日,DeepSeek正式开放V4 Flash API公测。官方公布的测试结果显示,新版本在多个智能体基准测试中大幅超过此前的V4-Pro Preview。


真正让开发者兴奋的,并不只是一次科技圈围观,而是DeepSeek V4 Flash走出的路线:

在保持2840亿总参数规模、单Token激活130亿参数和100万Token上下文窗口的基础上,通过后训练优化提升智能体与代码能力。

更关键的是,它把这种能力压到了一个极低的价格区间。

V4 Flash每百万未命中缓存输入Token仅1块钱,输出Token 2块钱;缓存命中输入成本更低至2分钱。 海外开发者实测中,单次任务调用成本甚至低至0.0005美元,与部分竞品拉开了数量级差距。

这也是DeepSeek V4 Flash真正引发关注的原因:

它不只是又一个"便宜能用"的模型,而是在尝试证明,接近前沿水平的智能体能力,也可以用远低于传统旗舰模型的成本运行。

官方同时明确表示,本次更新仅升级DeepSeek-V4-Flash API,V4 Pro API与客户端维持不变,V4 Pro正式版即将发布。


当OpenAI、Anthropic等头部实验室仍在围绕更强模型和更高算力投入竞争时,DeepSeek正在重新提出另一个问题:

前沿智能,究竟应该卖多少钱?


马斯克关注之后,

海外社区为何热议

"马斯克需要亲自试试V4 Flash。它就像魔法一样。"

这句话最初来自X上的开发者讨论。

随着这句话传播,网友发现,埃隆·马斯克真的关注了DeepSeek官方账号。这一细节迅速在海外社区引发讨论。

有网友认为,马斯克与DeepSeek在推动AI技术发展、探索科学突破方面存在一些共同点;也有人开始猜测未来可能出现合作。

当然,更多开发者选择用玩笑回应。有人调侃下一代编程模型Composer 3.5可能会基于DeepSeek构建;还有网友直接调侃Grok:

"我猜他要买下DeepSeek。你说呢Grok,你的爹要给你买个小弟弟吗?"

这些玩笑背后,是海外开发者对V4 Flash的真实兴趣:他们关注的不是一次社交媒体热搜,而是这个模型是否正在改变AI开发的成本结构。


基准压测:

官方数据与第三方验证怎么说

评估一次后训练的成效,最直接的办法就是看标准化测试集上的量化表现。

方公布的基准测试中,V4 Flash在模拟真实命令行环境操作的Terminal Bench 2.1(82.7分)、网络安全攻防Cybergym(76.7分)以及复杂API协同Toolathlon Verified(70.3分)等智能体场景中均表现上佳。

而在代码工程化与复杂软件重构领域(如NL2Repo与DeepSWE),它同样取得了较好成绩,甚至在其内部的全栈难题测试集(DSBench-Hard)中拿下59.6分。


官方解释称,这套代码智能体表现是在最大努力级别与特定采样参数下跑出的。这种"小体积、高智商"的突破,直接打破了传统大模型"参数越庞大、智能体表现才越强"的固有认知。

第三方权威测评机构的交叉验证,进一步补充了该模型的表现细节。

测评机构Artificial Analysis在Intelligence Index智能指数测试中给予V4 Flash 50分的成绩,这一分数比上代模型提升10分,领先V4 Pro预览版6分,甚至追平了Gemini 3.6 Flash,并与GPT-5.6 Luna、GLM-5.2等模型接近。


在运行效率与输出质量方面,Artificial Analysis的测试表明,V4 Flash跑完整个智能指数消耗了2.06亿个输出Token,相比前代的2.34亿个下降12%。

同时,该模型在AA-Omniscience事实准确率与抗幻觉评估中的表现提升了12个百分点,展现出更好的上下文理解能力。


在评估真实世界智能体任务的GDPval-AA v2中,V4 Flash拿下1559的Elo评级,在开源权重模型中仅次于Kimi K3,超越了GLM-5.2。

而在Arena.ai前端代码竞技场中,DeepSeek-V4-Flash-High拿下1586分,位列竞技场第七名、开源模型第三名,较前代提升154分。

结合其首token延迟(TTFT)与吞吐量(TPS)表现,凭借98% 的缓存折扣,V4 Flash单任务执行成本比打折后的GPT-5.6 Luna还低60%。

Arena.ai评价指出,V4 Flash在前端代码与智能体领域重新塑造了"价格—质量"层面的帕累托前沿。



开发者工程实测:

150倍价差下的极致性价比

随着公测展开,开发者社区涌现出大量实操压测,V4 Flash在真实Terminal智能体、Canvas前端渲染以及跨模型工作流中的表现被多角度呈现。

在最直观的极限性价比层面,科技分析师 @RoundtableSpace在对比发布时间仅相隔七天的Opus 5时观察到,尽管Opus 5能一次完成复杂任务,而DeepSeek需要经过三次迭代尝试,但Opus输出了长达3000行代码,DeepSeek用约900行精简代码就达到了目的,且单次尝试成本仅约1美分。


科技博主 @SciTechera也援引数据进一步验证,在Terminal-Bench 2.1上,V4 Flash完成单个基准任务的估计花费仅为0.03美元, 相比高价旗舰模型展现出了极强的成本压制。

而当脱离极端高价模型、转而对比同预算档位的竞品时,V4 Flash依然保持了品质上的小幅领先。

在前瞻性的前端与动态交互测试中,开发者 @stevibe将降价后的OpenAI GPT-5.6 Luna与V4 Flash放在一起对比。

在3D魔方旋转测试中,DeepSeek的贴纸与旋转表现流畅,而Luna出现了贴纸位置错位的问题;在烟花爆破绽放效果中,Luna出现较明显的卡顿;而在笔写"Hello"草书的动态渲染上,Luna直接渲染为静态图像,DeepSeek则完成了动态草书轨迹。

@stevibe认为,在相同的预算档位下,DeepSeek的综合渲染表现略胜一筹。


除了直接对抗,面对V4 Flash暂未原生接入视觉输入的短板,开发者们探索出了具有实操价值的"跨模型组合"工作流。

前端开发者 @hqmank在重建3D地球仪表板测试中,先让Kimi K3读取参考图像并提取布局与颜色规范,再将结构化文本转交给V4 Flash进行代码生成。实测结果显示,布局与间距被较好还原,而整体输出成本远低于完全调用顶级多模态模型。


这种灵活的生态配合,最终落脚于工业级智能体开发的成本账单上。

Bold Metrics CTO摩根·林顿(Morgan Linton)在VulcanBench测试后指出,V4 Flash在中等努力水平(Medium Effort)下的表现极其稳定,成功击败了Grok 4.5、Fable 和ChatGPT。

对于需要成千上万次API 调用的工业级智能体工作流而言,这种极低的价格让大批量自动化试错第一次具备了财务可行性。


大模型测评团队 @CommandCodeAI 在相同的游戏设计提示词测试中发现,Kimi K3与GLM 5.2表现出色,单次调用花费分别为0.0740美元和0.0480美元;而DeepSeek V4 Flash 虽在边缘细节上略显粗糙,但单次调用的实际账单仅为0.0005美元,便宜了整整150倍。


硬件与模型设计师 @bookwormengr 体验后感叹,V4 Flash 在如此小巧的体积和极低成本下展现出的知识密度简直如同"巫术", 虽然UI 和视觉交互体验上仍可向月之暗面借鉴,但其底层智力产出已足够令人震撼。


尽管V4 Flash 在性价比与常态代码补全上表现优异,但客观的工程压测中,它也暴露出了一定的技术边界:

首先,在极高难度的推理与算法突破场景中,Flash 模型的表现依然受限于其激活参数规模。 软件开发者 @OmedVibeCodes 在深度基准压测后指出,面对顶级模型(如GPT-5.6 Sol、Kimi K3等)时,V4 Flash 在处理极其复杂的长逻辑链求解上仍有明显差距。

其次,在特定测试套件的兼容性上,@OmedVibeCodes 观察到Pi 套件在DeepSeek 上的运行表现逊于 OpenCode,显示出不同基准下的适配差异。

此外,当前 V4 Flash 尚不支持原生的多模态视觉输入,处理图文混排任务时仍需借助外部模型进行前置解析。

因此,在真实的生产架构中,V4 Flash 更适合承担80% 高频、常态化任务的基础引擎角色,而极端复杂的难题仍需交由规模更大的旗舰模型处理。


灰度中的 V4 Pro 提前亮相:

"矿泉水掺顶级茅台"

在 Flash 模型凭性价比引发关注的同时,正在小范围灰度测试的旗舰模型 V4 Pro GA 正式版也引发了讨论。

开发者 @BoxMrChen 仅用4行提示词,要求模型融合《我的世界》与《无人深空》的核心机制编写一款 Web 网页游戏。V4 Pro 经过深度推理,以约0.1美元的 Token 成本生成了包含任务树系统、物品合成逻辑与资源采集的可玩游戏。


开发者 @mirochill 在复杂 Bug 修复测试中表示,针对《鱿鱼游戏》机制的代码构建中,V4 Pro 只经历2次自我迭代就修复了深层逻辑缺陷,连续输出3000行代码,总成本仅0.12美元,表现足以正面抗衡 Fable 5和 GPT-5.6 Sol。


开发者 @Waguri_Kaoruko8补充称,新版 V4的推理思维链(CoT)能够自动梳理出"编写主要场景代码……""生成核心逻辑……"等节点,可读性有所提升。


然而,V4 Pro 展现出的生成能力,也在社区内引发了争议。

科技媒体 @TechFlowPost 报道称,有部分开发者称在调用 V4 Pro 生成复杂大厂级别代码时,发现其输出风格与某些高价旗舰模型(例如 Claude Fable 5)存在相似之处,甚至有用户称触发了疑似特定高价模型风格的安全拒绝响应,从而引发了后台是否采用了混合路由机制的猜测。

社区调侃该现象为"矿泉水瓶里掺茅台"。 需要指出的是,上述安全响应细节目前多为社区反馈,尚无官方的进一步复现说明。


面对社区的种种猜想,技术专家 @TeksCreate 从架构层面给出了分析。

V4 Pro 拥有1.6万亿的总参数规模(推理时单 Token 激活490亿),采用 MoE 混合专家架构。 其核心改进在于引入了混合注意力系统,将历史压缩(CSA)、超长文本压缩(HCA)与全保真跟踪(SWA)结合,使处理100万上下文时的计算量降至前代的27%,KV 缓存占用也大幅下降。

在性能上,V4Pro在Codeforces 跑出3206分,SWE-bench Verified 达80.6%,1M 长上下文检索 MRCR 达83.5%。 @TeksCreate 认为,这些架构创新证明 V4 Pro 本身具备独立达到该水平的技术条件。至于模型在实际部署中是否使用了混合路由,在官方明确回应之前尚无定论。



宏观市场重构:

更多人负担得起的前沿 AI 生产力

从 V4 Flash 的正式公测到 V4 Pro 正式版的灰度亮相,DeepSeek 掀起的定价风暴正在全球开发者生态与市场预期中引发连锁反应。

对比当下主流厂商的定价策略,V4 Flash 每百万输入/输出 Token 0.14/0.28美元的价格,不仅让打折后的 GPT-5.6 Luna(输入0.20美元/输出1.20美元)感到巨大压力,更是对 Anthropic Haiku 4.5(输入1美元/输出5美元)形成了输入端便宜7倍、输出端便宜18倍的优势。

预测市场平台 Polymarket 的分析者 @goodworse 认为,V4 Flash 的出现将迫使前沿 AI 服务的综合使用成本进一步降低。


0xSupergemma 创始人宋骏(Jun Song)从全球经济视角分析指出,全球有相当庞大的低收入群体与初创团队无法直接承担高昂的模型订阅费。DeepSeek 极低 API 定价的意义,在于能够通过下游开发者转化为极其便宜的 SaaS 工具、应用与服务,间接让更广泛的终端用户享受技术红利,成为降低 AI 生产力门槛的重要选项之一。


财富》杂志分析指出,DeepSeek V4的研发与发布与华为底层芯片生态进行了紧密适配。 随着华为昇腾系列处理器软硬件协同效率的提升,未来模型推理成本还有进一步下探的空间。DeepSeek 展现出的成本优势,背后是算法架构重构与本土硬件生态适配共同作用的结果。


结语

综合官方测试集数据、权威第三方交叉验证以及一线开发者的真实反馈,DeepSeek V4 Flash 展现出的核心价值,并不在于要在每一个实验室单项榜单上都拿下第一,而在于它以一种务实的方式,重构了智能体与代码开发中的成本账单。

在现代智能体软件工程中,一个看似简单的自然语言指令,往往需要拆解为意图理解、环境感知、文件检索、工具调用以及多次代码生成与自我修正,调用的乘数效应会瞬间放大 Token 消耗。

V4 Flash 在中等努力水平下的稳定性、对 Codex 接口的无缝集成以及高额缓存折扣,为开发者提供了一个能够支撑大规模日常调用的基础选项。

当越来越多的企业财务官与开发者开始精细化计算 API 账单时,答案已经很明确:前沿智能的价格,正在被重新定义。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
省几百万赔13亿,星宇车灯被奔驰判道德死刑港股也凉了

省几百万赔13亿,星宇车灯被奔驰判道德死刑港股也凉了

社会日日鲜
2026-09-11 09:11:11
“9.11”事件25周年 纽约夜空2977架无人机重现世贸双子塔

“9.11”事件25周年 纽约夜空2977架无人机重现世贸双子塔

快科技
2026-09-11 09:01:06
真是没想到!43岁刘翔太难了!买断之后,被曝耐克全球合作运动员名单上,从来就没有他!詹姆斯C罗杜兰特都在

真是没想到!43岁刘翔太难了!买断之后,被曝耐克全球合作运动员名单上,从来就没有他!詹姆斯C罗杜兰特都在

锐评利物浦
2026-09-11 17:14:46
复旦女硕士在意大利旅游被蜱虫叮咬染重症,严重时生活不能自理,家属全网求助:暂无特效药,希望找到擅长蜱传疾病的专家,寻求诊疗方案

复旦女硕士在意大利旅游被蜱虫叮咬染重症,严重时生活不能自理,家属全网求助:暂无特效药,希望找到擅长蜱传疾病的专家,寻求诊疗方案

鲁中晨报
2026-09-11 07:15:05
仅仅一天就扛不住!日本要求中方撤回决定,抱怨中方索要的钱太多

仅仅一天就扛不住!日本要求中方撤回决定,抱怨中方索要的钱太多

阿纂看事
2026-09-11 10:06:10
确认裁员22000人,赔偿N+4

确认裁员22000人,赔偿N+4

新浪财经
2026-09-10 20:23:20
武汉小学订奶的坐着喝,没订的站后排喝水。教育局说“误解”——可画面里是那排站得整整齐齐的孩子

武汉小学订奶的坐着喝,没订的站后排喝水。教育局说“误解”——可画面里是那排站得整整齐齐的孩子

听心堂
2026-09-11 07:48:07
社死名场面啊!一件裙子把女明星的“小肚子”逼上热搜,强光一打,她吓得死死捂着肚子,满脸写着尴尬,真相流出

社死名场面啊!一件裙子把女明星的“小肚子”逼上热搜,强光一打,她吓得死死捂着肚子,满脸写着尴尬,真相流出

火山詩话
2026-09-11 10:01:05
在华首店开业在即,日企却选“918”这天联名辱华IP

在华首店开业在即,日企却选“918”这天联名辱华IP

观察者网
2026-09-11 19:00:15
如果解放军单挑整个北约,胜算有多大?北约32国总兵力超340万

如果解放军单挑整个北约,胜算有多大?北约32国总兵力超340万

果妈聊娱乐
2026-09-11 15:30:20
胡塞武装称9天攻占5400平方公里地区

胡塞武装称9天攻占5400平方公里地区

界面新闻
2026-09-11 21:21:54
及时止损有多难?深圳家庭宁愿多亏200万卖房,也要卸下沉重包袱

及时止损有多难?深圳家庭宁愿多亏200万卖房,也要卸下沉重包袱

捣蛋窝
2026-09-11 15:35:51
后视镜也开始做“双保险”?三场复杂路况挑战,一见智界RX双后视镜实力

后视镜也开始做“双保险”?三场复杂路况挑战,一见智界RX双后视镜实力

极果酷玩
2026-09-11 14:36:44
15.6万!日产新车官宣:9月23日,正式发布

15.6万!日产新车官宣:9月23日,正式发布

科技堡垒
2026-09-11 11:09:59
湖南湘潭雨湖区住建局一副局长,在楼栋长群内辱骂业主;涉事副局长:很后悔,已被停职,区纪委正调查

湖南湘潭雨湖区住建局一副局长,在楼栋长群内辱骂业主;涉事副局长:很后悔,已被停职,区纪委正调查

大风新闻
2026-09-11 19:13:04
赛后挑衅公众!韦世豪被中足联官宣禁赛3场罚款3万 河南赛区遭警告

赛后挑衅公众!韦世豪被中足联官宣禁赛3场罚款3万 河南赛区遭警告

我爱英超
2026-09-11 20:58:27
“4岁男童被指摸臀”,男孩父亲最新发声:将进行反诉;不为索赔,只为给孩子要一个法律上的清白;胜诉赔偿全额捐给青少年公益

“4岁男童被指摸臀”,男孩父亲最新发声:将进行反诉;不为索赔,只为给孩子要一个法律上的清白;胜诉赔偿全额捐给青少年公益

都市快报橙柿互动
2026-09-11 14:03:52
日本的梅毒,到底严重到什么地步

日本的梅毒,到底严重到什么地步

徐静波静说日本
2026-09-11 07:41:53
男子买房后,房价从240万降到了80万。在网上抱怨几句后,李诞说:你应该赶紧去买几瓶茅台...

男子买房后,房价从240万降到了80万。在网上抱怨几句后,李诞说:你应该赶紧去买几瓶茅台...

背包旅行
2026-09-11 18:37:06
这场臭气熏天的裸奔,辟谣后续来了!

这场臭气熏天的裸奔,辟谣后续来了!

胖胖说他不胖
2026-09-11 10:25:19
2026-09-11 21:36:49
星海情报局 incentive-icons
星海情报局
关注“中国制造”的星辰大海
1441文章数 2031关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

打假网红"铁头"获刑8年:以曝黑料威胁向主播索要黄金

头条要闻

打假网红"铁头"获刑8年:以曝黑料威胁向主播索要黄金

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

女装“玖姿”母公司跨境贸易迷局:安正时尚说谎了吗?

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

艺术
房产
本地
时尚
数码

艺术要闻

美国秘藏的一部《金刚经》!这才是楷书“金字塔尖”,欧颜柳赵也比不过

房产要闻

时隔7年,绿地海南再拿地!

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

女人不管三十还是四十,衣服都可以多穿白色,清爽百搭又减龄

数码要闻

上着课突然冒烟!戴尔XPS 16笔记本发生严重烧毁:机身内部已碳化

无障碍浏览 进入关怀版