网易首页 > 网易号 > 正文 申请入驻

刚发布就落伍!DeepSeek V4竟坦承不如GPT-5.4

0
分享至

2026年4月24日,全球AI行业迎来一个足以载入史册的日子。

中国AI公司DeepSeek正式发布全新系列模型DeepSeek-V4预览版并同步开源,总参数高达1.6万亿。而同一天,OpenAI发布的新一代旗舰模型GPT-5.5,API定价飙升至每百万Token输出30美元,是前代的三倍。



一边是“开源普惠、成本重构”,另一边是“性能登顶、价格翻倍”。同一天的隔空对撞,彻底将AI行业撕裂为两条完全不同的道路。

这不是巧合,这是一场蓄谋已久的路线摊牌。

01

参数对决

1.6万亿MoE架构的降维打击

DeepSeek-V4此次推出Pro和Flash两个版本:DeepSeek-V4-Pro总参数1.6万亿、激活参数49B;DeepSeek-V4-Flash总参数284B、激活参数13B,均原生支持100万token上下文。

架构上,V4采用了DSA2注意力机制,融合了DeepSeek V3/R1中已验证的DSA设计与今年初论文中提出的NSA稀疏注意力方案。混合专家系统(MoE)启用Mega内核结构,每层配置384个专家,每次推理激活其中6个。



这套架构的直接效果是惊人的效率突破——在100万上下文设置下,V4-Pro的单token推理FLOPs只有前代V3.2的27%,KV Cache只有10%;V4-Flash更极端,分别压到10%和7%。

这意味着,DeepSeek做了一个大胆的选择:不拼绝对性能的“越级”,而是把超长上下文的计算成本打穿到极致。官方自己承认,V4的能力水平发展轨迹大约滞后前沿闭源模型3至6个月。但这句话背后隐藏的真实意图是——当别人在堆性能时,我在拆成本。

而GPT-5.5则在另一条赛道上狂奔。在Terminal-Bench 2.0这项测试复杂命令行工作流的硬核基准中,GPT-5.5得分82.7%,不仅碾压前代GPT-5.4的75.1%,更将最强竞品Claude Opus 4.7的69.4%拉开了超13个百分点。在评估44种职业知识工作能力的GDPval中,GPT-5.5在84.9%的任务中达到或超过行业专家水平。



但注意,DeepSeek V4技术报告公开的对比对手,是GPT-5.4、Opus 4.6,并不含同一天发布的GPT-5.5。在这场同台竞技中,V4的对手已经不是最新一代,真正的差距还需要第三方评测来验证。

02

30美元 vs 1元钱

AI的阶级分裂

如果说参数是武器,价格就是那道真正的撕裂线。

GPT-5.5的API定价为每百万Token输入5美元、输出30美元,GPT-5.5 Pro更是高达输入30美元、输出180美元,比GPT-5.4翻了三倍。OpenAI总裁Greg Brockman的辩解是:虽然单价涨了,但GPT-5.5完成相同任务所需Token数量大幅减少,完成相同智能水平任务时综合成本反而下降约40%。



再看DeepSeek V4:Flash版本1元/百万Token(缓存未命中),输出仅需2元;Pro版本也不过12元/百万Token输入、24元输出。按当前汇率简单换算,GPT-5.5 Pro的输出价格约是DeepSeek V4-Pro的50倍以上。

这不是价格差异,这是阶层分化。

OpenAI选择了“奢侈品路线”——让最先进的技术先服务于能付得起钱的企业级客户。NVIDIA GB200 NVL72系统上部署GPT-5.5后,百万Token成本确实降到了前代的1/35,但这个降幅的受益方是英伟达内部,不是普通开发者。

DeepSeek则选择了一条完全相反的路线——开源权重、全量模型可下载,1M上下文成为所有官方服务的标配。不需要依赖特定硬件,不需要支付天价Token费。"普惠"这个词,DeepSeek是认真的。

03

谁才是真正的“打工人替代者”

如果说价格是用户的选择题,Agent能力就是技术路线的最终验收场。

GPT-5.5的核心定位是“面向真实工作的新型智能”,最大的突破在于Agent能力——用户无需精细管理每一步,只需下达模糊的多部分任务,模型即可自主规划、调用工具、检查结果并持续推进直至完成。



英伟达一位内测工程师的说法极具冲击力:“失去GPT-5.5的访问权限,就像被截肢。”这不是公关话术,这是一线开发者的真实反馈。Cursor CEO Michael Truell也给出了实测评价:“GPT-5.5比GPT-5.4明显更聪明、更持续,对于复杂、长时间运行的任务,它能坚持到底不中途停下。”

而在Agent这条赛道上,DeepSeek V4同样没有缺席。V4-Pro在Agentic Coding评测中已达到当前开源模型最佳水平,使用体验优于Sonnet 4.5,交付质量接近Opus 4.6非思考模式。V4还针对Claude Code、OpenClaw、OpenCode、CodeBuddy等主流Agent产品进行了专项适配和优化。



但差距也是明摆着的。在Terminal-Bench 2.0 Agent任务中,V4-Pro得分67.9%,低于Gemini 3.1 Pro的68.5%,与GPT-5.5的82.7%差距更是一目了然。

一位行业观察者的判断精准而残酷:“GPT-5.5从模型层面改进了智能体最核心的几个特征——理解目标、拆解步骤、调用工具、修正过程,并最终交付结果。每一项都不是全新能力,但被放到同一个系统里之后,体验开始发生变化。”

这句话翻译过来就是:DeepSeek把Agent的基础设施铺好了,但GPT-5.5已经跑在上面的成品赛道上了。

04

开源 vs 闭源

一场没有回头路的路线分裂

这场同日对撞的本质,不是“谁更好”的比较题,而是“哪条路能走通”的路线之争。

OpenAI的GPT-5.5走的是极致性能闭环。它与英伟达GB200/GB300 NVL72系统联合设计,从训练到部署,模型和硬件之间从诞生开始就“双向奔赴”。NVIDIA内部已有超过10,000名员工率先使用,原本耗时数天的调试周期缩短至数小时,复杂多文件代码库的实验周期从数周压缩至一夜之间。



DeepSeek V4走的是开源生态扩张。模型权重全部公开,API兼容OpenAI ChatCompletions与Anthropic两套标准,1M上下文向下兼容,全部模型可本地部署,对国产AI硬件(华为昇腾等)和NVIDIA Blackwell架构做了双重优化。

这两条路的选择背后,藏着更深的地缘政治逻辑。DeepSeek V4在KnowYourSymbol评测中以96%领先GPT-5.4的95%和Gemini 2.5 Pro的92.8%,在中文语境和东方知识体系中的表现已展现独到优势。而OpenAI则深度绑定英伟达生态,Codex产品被推广至英伟达全公司,奥尔特曼亲自晒出了与黄仁勋的交流邮件。

这不是一场单纯的产品竞争,这是两种AI治理体系和产业生态的全面角力。

05

差距承认了,然后呢?

最有意思的,是DeepSeek这次罕见的“坦诚”。

官方技术报告中明确写道:V4的能力水平仍落后GPT-5.4和Gemini-3.1-Pro。注意,这里说的甚至不是GPT-5.5,而是上一代的GPT-5.4。



这种公开“认输”在AI行业极为罕见。但细看之下,这不是认输,而是一种精妙的重置叙事——我承认我现在追不上你,但我要告诉你,追不上的那段路,我不跟你比了。

V4在长上下文成本上做到了极致,将百万token推理的KV Cache降到了前代的10%,这种工程化突破的价值远不止于“省内存”——它打开了允许模型在一个连续语境中读完100万本书、追踪整个代码仓库历史、处理一个企业全部会议纪要的技术通道。

GPT-5.5在智力上跑得更快,但GPT-5.5的400K上下文窗口背后,是每百万Token 30美元的代价。DeepSeek的1M上下文背后,是1元钱的Flash版入门费。



“更聪明”需要更强算力、更贵硬件、更高单价。而“足够聪明但更便宜”需要更极致的架构创新和工程优化。哪条路能走得更远?行业里没人有标准答案。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
普京搬出600年前圣王公遗骨!乌克兰嘲讽:他自己怎么不上前线

普京搬出600年前圣王公遗骨!乌克兰嘲讽:他自己怎么不上前线

老范谈史
2026-09-14 17:41:16
高市早苗改组内阁,中日关系又要变了?

高市早苗改组内阁,中日关系又要变了?

刘乐观天下
2026-09-15 18:09:06
中国公民尽快撤离!外交部发出重磅提醒:那片山区真的不能再待了

中国公民尽快撤离!外交部发出重磅提醒:那片山区真的不能再待了

闻香阁
2026-09-16 08:02:16
啄木鸟上门维修换1个开关收费2800元

啄木鸟上门维修换1个开关收费2800元

界面新闻
2026-09-16 19:42:38
“大三女生纠结同居开销!”最近一位大三女生的求助,她要承担每月300元水电费,评论炸锅

“大三女生纠结同居开销!”最近一位大三女生的求助,她要承担每月300元水电费,评论炸锅

火山詩话
2026-09-15 10:53:34
美联储加息25个基点,预计年内还将加息一次!美股跳水收跌,黄金白银下挫,特朗普:美国利率应当降至1%或更低

美联储加息25个基点,预计年内还将加息一次!美股跳水收跌,黄金白银下挫,特朗普:美国利率应当降至1%或更低

21世纪经济报道
2026-09-17 06:42:47
汽车圈太卷了!汽车头部供应链放弃5亿大单,直言接下此订单会变成负债,网友:你不干,有的是人干

汽车圈太卷了!汽车头部供应链放弃5亿大单,直言接下此订单会变成负债,网友:你不干,有的是人干

火山詩话
2026-09-16 04:31:57
体制内的饭局基本消失了

体制内的饭局基本消失了

砚田文化
2026-09-16 18:33:32
长鑫科技利润率全球第一!

长鑫科技利润率全球第一!

中国半导体论坛
2026-09-16 12:55:24
北口榛花世界排名升至第二,亚运叫板严子怡:我特别享受和她竞争

北口榛花世界排名升至第二,亚运叫板严子怡:我特别享受和她竞争

杨华评论
2026-09-17 02:47:47
《交锋》5大叛徒5种结局,曹了平枪毙,尹宝山灭口,谢逢时丢官帽

《交锋》5大叛徒5种结局,曹了平枪毙,尹宝山灭口,谢逢时丢官帽

老吴教育课堂
2026-09-16 05:13:30
45岁卡里克不敢相信!10亿欧曼联主场蒙羞:2-0变2-3 联赛杯一轮游

45岁卡里克不敢相信!10亿欧曼联主场蒙羞:2-0变2-3 联赛杯一轮游

风过乡
2026-09-17 06:13:07
拍完奥斯卡神作,他为何转头去拍第9部《生化危机》?

拍完奥斯卡神作,他为何转头去拍第9部《生化危机》?

赴一场山海啊
2026-09-17 00:08:54
法国《世界报》认为中国:这场伊朗战争,证明中国的战略十分正确

法国《世界报》认为中国:这场伊朗战争,证明中国的战略十分正确

麓谷隐士
2026-09-13 00:05:03
为啥说中国军力吓不倒日本?石破茂说得很透彻:日本会重走老路的

为啥说中国军力吓不倒日本?石破茂说得很透彻:日本会重走老路的

咸鱼金脑袋
2026-09-17 02:19:38
重磅!CLTC续航1218公里!比亚迪全固态电池2027年正式上车

重磅!CLTC续航1218公里!比亚迪全固态电池2027年正式上车

沙雕小琳琳
2026-09-16 15:57:30
古天乐1.49亿欠款被曝出!本人发文回应,向华强评价他:都快睡到天桥底下了

古天乐1.49亿欠款被曝出!本人发文回应,向华强评价他:都快睡到天桥底下了

可乐谈情感
2026-09-17 00:19:35
边境吃紧,普京助理回应波兰外长速胜论调:若波兰动手“将在两三天内不复存在”

边境吃紧,普京助理回应波兰外长速胜论调:若波兰动手“将在两三天内不复存在”

红星新闻
2026-09-16 16:50:23
林彪为何多次探望远离政治的贺子珍?孔东梅:恐怕只有一个原因

林彪为何多次探望远离政治的贺子珍?孔东梅:恐怕只有一个原因

小豫讲故事
2026-09-14 00:15:07
乌克兰再重创索契港!俄乌爆发人类首次无人战船交战

乌克兰再重创索契港!俄乌爆发人类首次无人战船交战

项鹏飞
2026-09-14 17:39:49
2026-09-17 07:40:49
电脑报少年派 incentive-icons
电脑报少年派
最新鲜的互联网产业资讯
3975文章数 1609关注度
往期回顾 全部

科技要闻

赛力斯接管问界,撑得住华为给的身价吗?

头条要闻

"恋陪本"现色情服务:行为尺度越来越大 还有了"脏陪"

头条要闻

"恋陪本"现色情服务:行为尺度越来越大 还有了"脏陪"

体育要闻

对话西甲联盟高管:西班牙足球到底强在哪?

娱乐要闻

乔任梁去世十周年,陈乔恩悼念

财经要闻

美联储加息!沃什重磅发声

汽车要闻

激光雷达+EVA机器人+爆胎稳行 星瑞L PLUS预售限时价11.57万起

态度原创

本地
时尚
教育
家居
公开课

本地新闻

不止胖东来!许昌藏着半部三国史

8年没换过|| 每次“垮脸”都靠它救,这笔小投资已值回本

教育要闻

外籍留学生的待遇有多好?

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版