网易首页 > 网易号 > 正文 申请入驻

ZPedia|实测DeepSeek-V4-Pro:强于逻辑闭环,弱于视觉与交互

0
分享至



在大模型的牌桌上,DeepSeek 一直是个挺特别的存在:价格还不到美国闭源旗舰的零头,靠着极致的稀疏架构,把前沿能力的使用成本压到了地板上。

面对规则复杂、验收标准明确的真实工程任务,它能不能直接交出一个能运行、能交互、能播放的成果?这次,我们让 DeepSeek-V4-Pro 和 Kimi K3、Qwen3.8-Max 站在同一个擂台上,跑完全相同的五道硬核场景题。


五个真实工程任务实测

判断一个模型能否胜任复杂工作,至少要考察三个层面:它是否真正理解了规则;它是否建立了正确的数据和状态系统,而非用静态页面或预设动画伪装;它能否把结果落成一个可以打开、运行、交互或播放的实体文件。

题目相同、验收标准相同、硬性指标相同,只接受可执行的真实文件,这也是我们第一次真正把三款模型放在同一张考卷上横向对比:

1. 视觉还原:仅凭一张截图重建 NASA Webb Images 页面;

2. 数据工程:依据真实业务口径,从零搭建动态运营驾驶舱;

3. 系统仿真:实现涵盖烟雾扩散、人群行为、防火门响应与出口容量的物理疏散仿真;

4. 图形交互:从空白代码构建一个完全可交互的 Web 3D 魔方;

5. 多模态渲染:将结构化异常日志直接转化为一段可流畅播放的 MP4 视频。

跑完五个 Case,结论很明确:DeepSeek-V4-Pro 是三个模型中功能闭环做得最彻底的一个。它在 Case 3 交出了三款模型里最完整的仿真系统,在 Case 2 补齐了 Kimi K3 缺失的全局筛选联动,在 Case 5 实现了关键数据终值零失误。省下的算力,显然被投入到了逻辑与规则执行之中。

但它的短板也很集中,丢分集中在视觉精度与交互收尾的最后一公里:全局导航的黑白反转、视频阶段标题的低对比度、形同虚设的播放控制按钮。

Case 1 - 从一张截图,重建NASA Webb Images页面


目标网页

第一项任务只给出一张页面截图和一句话提示词,模型必须自行完成视觉识别、内容提取、页面拆解与前端重建。

DeepSeek-V4-Pro 交付了一份约 230 行的单文件 HTML。就内容与结构而言,它的理解相当到位:双层导航、左侧标题与介绍段落、右侧两列共八个分类入口一应俱全,介绍文字与参考页面几乎逐字吻合,八个分类入口的文案与分组也没有任何错漏,并且完全依靠独立的 DOM 与 CSS 实现,没有把截图伪装成图片。


但在视觉还原上出现了大的纰漏:参考页面的 NASA 全局导航本是黑底白字,它却重建成白底深色字,页面最醒目区域的色彩关系被整个颠倒。NASA 标志被替换为一个简化的蓝色圆形 SVG,底部的深空天文摄影则由纯 CSS 渐变的星空插画代替,星云与星系全是程序化绘制的色块。此外,代码中未针对窄屏进行专门适配,实际缩窄窗口后布局表现也不稳定。

这道题勾勒出的画像颇具代表性:DeepSeek-V4-Pro 对页面上有什么、结构怎么组织的理解能达到及格线,但对页面风格和细节的把控明显粗糙。

Case 2 - 带真实业务口径的运营驾驶舱

第二项任务要求结合 API 运行记录与品牌规范,构建纯离线、具备多维联动与特定计算口径的运营驾驶舱。这类任务最容易陷入静态假效果的套路,也最考验模型对统计口径的理解深度。


DeepSeek-V4-Pro 没有投机取巧,还顺手补齐了 Kimi K3 当时的主要缺口。在它交付的约 44KB 单文件中,日期范围、Provider、Model 三维筛选器全部到位,且 KPI 卡片、四张图表、异常列表、明细表与成本模拟器消费同一个过滤后的数据状态——任何筛选条件变化,全页同步重算。这正是 K3 版本中筛选只作用于图表和明细表所缺失的全局联动。

计算口径同样经得起逐项核对。五项核心 KPI 全部正确:成功率按成功请求量之和除以请求量之和得出,P95 延迟与质量分均以请求量为权重加权,没有对每日百分比做算术平均。末日环比正确区分了相对变化率与百分点,与标准答案完全一致。提示词指定的四类图表,即请求量堆叠面积图、带 97% 警戒线的成功率多折线图、成本—质量气泡散点图、请求量占比环形图,无一缺席,全部由原生 SVG 绘制并绑定真实数据。


异常检测的表现尤其值得记录:三条规则全部落地,默认视图精确命中全部 5 条异常,并且正确处理了 97.00% 这一边界——规则要求低于 97% 才触发,Nova-Pro 恰好 97.00% 的成功率没有被误报。成本模拟器的公式与标准答案严丝合缝,且推演过程没有污染真实指标。

主要的不足落在两处细节上:环形图缺少鼠标悬停提示,而提示词明确要求所有图表都具备悬停能力;成本类异常依赖前一个自然日作为基线,一旦日期筛选把前一日移出范围,异常判定便会失去参照。这些都属于边界收尾问题,无碍它成为三个模型中该题功能覆盖最完整的交付。

Case 3 - 复杂规则驱动的应急疏散仿真

第三项任务是三个模型拉开差距最明显的一题:一个包含建筑网格、差异化人员、烟雾扩散、定时关门及出口限流的离散事件仿真系统。它最容易暴露表演式代码,也最能检验模型对状态链的掌控能力。

DeepSeek-V4-Pro 交出了三款模型中最完整的一份答卷。


在仿真内核层面,它采用固定 0.5 秒逻辑步长,1×/2×/4× 倍速只改变推进频率而不干扰状态转移;A* 四方向寻路将普通格代价设为 1、烟雾格设为 8,门状态变化后全体人员实时重新规划路径。几个关键对标点全部命中:烟雾源在零时刻即已生效——Qwen3.8-Max 当时首帧无烟雾的初始化语义缺口在这里并不存在;12 秒时先执行 D4 自动关闭、再执行该时刻的烟雾扩散,处理顺序与规则文档分毫不差;D4 关闭后 P11 如期进入受困状态,手动打开 D2 的下一个逻辑步即恢复路径并写入恢复路径日志;人员冲突按等待时长与 ID 字典序排定优先级,任一非出口格不会同时出现两人;两个出口独立累计通行额度,容量不足时人员排队等待而非凭空消失。

在交互功能层面,它补齐了 Kimi K3 当时缺失的三项能力:图层开关(网格/全量路径/烟雾热力图)、人员点击选中与路径高亮、自动运行至下一事件,并额外附带了规则说明面板、出口通过统计与仿真结果摘要卡。暂停期间可以开关门改变环境而时间不推进,重置后状态完整归零,无人撤离时平均撤离时间正确显示为—而非 NaN。

若吹毛求疵,撤离判定发生在当步容量累计之前,存在半个逻辑步的顺序偏移;390px 移动端的适配更多依赖整体缩放;代码中还残留了个别无效的事件绑定。但这些都不触及内核正确性。这道题证明的是:在把自然语言规则转译成真正运行的动态系统这件事上,DeepSeek-V4-Pro 做得比两位旗舰对手更加彻底。

Case 4 - 一个真正可玩的三维魔方

第四项任务要求从零实现包含真实块体、六面转动、动作队列、确定性打乱、完成态判断、撤销重做与公开测试接口的 3D 魔方。市面上不少网页魔方只是视觉玩具,连续操作之后,贴纸、历史和完成态会逐渐失去一致性。

DeepSeek-V4-Pro 选择了一条扎实的实现路径:维护 54 个面片的标准状态序列,每次转动通过预定义的置换环更新真实状态,完成态判断来自面片本身而非动作数量;页面上是 26 个 CSS 3D 块体构成的真实三维结构,层旋转动画只让对应层的 9 个块体参与;界面按钮与公开的 cubeTestAPI 共享同一套状态引擎,没有为自动验收单开捷径。


我们将官方契约测试脚本完整跑了一遍,结果为 10 组测试通过 9 组:初始 54 格快照、逆步复原、同面四转、交换子不误判、Sexy Move 六次复原、180 度记号、25 步打乱的 seed 确定性与逆序复原、撤销重做与 HTM 计步悉数通过。

唯一折戟的一组是非法算法保持原子性。值得说明的是失败的方式:它的实现会先整体校验算法串,非法记号不会污染任何一步状态——原子性本身是守住的;但它用显示错误文案并静默返回替代了契约要求的抛出异常,拒绝方式与接口约定不一致。这属于典型的契约理解偏差,而非状态引擎缺陷。

真正的功能短板在别处:算法播放的播放/暂停/单步按钮形同虚设——代码里虽然设置了暂停标志位,动作队列却从未消费它,按下暂停无法让队列停在整步边界。键盘交互也存在一个设计缺陷:先按面字母再按数字 2 触发 180 度转动的二连击设计,会在第一次按键时就已经执行一次转动,导致实际多转一步。状态引擎是对的,围绕引擎的控制台却有两处没接上电的控件——这再度印证了开头的判断:逻辑闭环彻底,交互收尾缺少验收。

Case 5 - 从结构化数据直接生成复盘视频

最后一项任务要求直接交付一支可播放的 MP4:15 秒、1920×1080、30fps、H.264、无音轨,准确呈现两次异常事件与恢复数据。

我们对视频文件做了容器级解析:单一视频流、无音频流、avc1 High 编码、1920×1080、精确 30fps、时长 15.000 秒整、共 450 帧,技术规格全部达标。视频按片头、Kestrel-R1 异常、Nova-Pro 告警、恢复与品牌收束四个阶段展开,全部画面均为程序化绘制,没有生成式视频常见的跳字、融化与 Logo 变形。

更关键的是数据准确性。我们对每个阶段逐一抽帧核对,所有数字的终值全部正确:Kestrel-R1 的 4,200ms、95.50%、成本 +49.35%;Nova-Pro 的 3,350ms、97.00%、+27.66% 与警告分级;恢复阶段的 2,448→2,006ms、-18.05%、98.07%→98.69%、+0.61 个百分点。97.00% 没有被表达成低于 97%,百分点与百分比也没有混淆。在这项最容易翻车的基础功上,它做到了零失误。

但这支视频的问题同样突出,而且全部出在看的层面。

一是数字缓动节奏过慢。在评分标准推荐的抽帧点上,数值往往仍在爬坡:5.0 秒时成本变化显示 48.96%(终值 49.35%),8.5 秒时三项指标还停在 3,136ms/76.05%/13.50% 的半途,11.8 秒时恢复数据甚至刚从 0 起跳。所有数字最终都能爬到位,但每组关键数据稳定可读约 1.8 秒的要求被明显压缩,观众在标准验收时刻看到的其实是错误读数。

二是阶段标题的对比度失控。 Kestrel-R1 阶段的橙红色标题压在粉红色巨圆上几乎无法辨认;恢复阶段的粉色标题压在青色圆上彻底隐形;而 Nova-Pro 阶段在其核心时间窗内,画面上甚至找不到日期与模型名,只剩一枚警告徽章。此外,片头的日期区间标注为 07.10—07.13,与数据周期 07.07—07.13 和事件窗口 07.10、07.12 都对不上号;占据半个画面的巨大纯色圆形背景,也让整体观感更接近粗犷的动效草稿,而非精修的品牌成片。

这道题最典型的意义在于:DeepSeek-V4-Pro 把视频任务的数据层做到了三个模型中最干净的水平,却在表现层摔了最狠的一跤。技术规格满分,数据零失误,视觉不及格。


Kimi、Qwen、DeepSeek,差距究竟出在哪里?

同一套题跑完三个模型,各自的能力画像变得非常清晰。

Kimi K3 属于骨架正确,覆盖不全:视觉还原最稳(Case 1 的 594 行重建最完整),魔方契约测试全过,但 Case 2 缺少日期与 Provider 筛选、没有全局联动,Case 3 缺少图层开关、人员选中等产品功能——它优先保证做对,功能覆盖则留有余地。

Qwen3.8-Max 属于架构严密,尺度欠校:Case 2 的统一数据状态、Case 3 的仿真内核、Case 4 的可逆状态机都展现了最强的系统架构力,但 Case 1 的整体尺度偏小、Case 3 的零时刻烟雾缺失,暴露了起始边界与绝对精度上的疏漏。

DeepSeek-V4-Pro 则是闭环最彻底,收尾最粗糙:Case 2 的联动、Case 3 的功能完整性、Case 5 的数据终值准确性均为三者最佳,可一旦走出逻辑层踏入表现层,涉及导航的颜色、标题的对比度、控件的连通性,它的粗糙便无所遁形。


V4 Pro 的长板和盲区更明显了

为了更系统地衡量模型的能力,我们比较了 DeepSeek-V4-Pro 和 Kimi K3 在 In-house benchmark 上的评测结果。


一句话总结 V4-Pro:能读复杂规则、能修真实代码、能处理多约束任务,也能在部分研究型任务里打出高上限;它的短板集中在并发一致性、严格优先级、长期搜索效率这几类问题上。

  • 编码能力:有具体并发盲区
    V4 Pro 已经具备比较扎实的软件工程能力:给它一个现成代码仓库、一组测试和一个隐藏 Bug,它多数时候能定位问题并把代码修到测试通过。而它的问题集中在一种很容易埋雷的场景:多个请求同时修改同一份数据时,旧请求不能覆盖新结果。V4 Pro 在两个不同任务里连续犯了同一种错误,说明它对“版本号、旧写入失效、迟到结果不能覆盖新状态”这套并发规则掌握得不够。日常代码问题可以放心交给它;如果系统涉及缓存、多人同时修改、分布式状态同步,需额外审查。

  • 规则审计:业务场景规则判断接近熟练业务人员
    这类题可以简单理解为:给模型几十页规则、合同和证据,让它像保险理赔员、审核员一样逐单判断“该不该赔、赔多少、缺什么材料”。
    它不仅能看懂单条规则,还能处理前后关联的信息,例如上一笔业务生成的凭证,在下一笔业务里继续用来判断重复申请。弱点也比较集中:有两次连续漏掉同一类必需材料,还有一次规则已经足够支持拒绝申请,它仍然选择继续向客户补要材料。因此,可以把 V4 Pro 的能力边界解读为:业务规则读得准,但偶尔会在“材料是否齐全”和“什么时候应该果断结束流程”上偏保守。

  • 规划与调度:整体能做复杂约束,分层规则的处理弱于 K3
    这类题考的是:一次安排很多条件,而且所有条件都要同时满足。比如安排维修任务时,要同时考虑员工技能、班次、停机窗口、备件、预约时间和审计记录。V4 Pro 在这种任务上能把很多局部条件一起守住,一道题 12 项检查全部通过。
    它失手的地方出现在规则有明确先后顺序时。另一道任务要求“高优先级对象先拿满,剩下的资源再分给低优先级对象”,V4 Pro 却把剩余资源平均分了,24 项检查过了 21 项。
    K3 在同一道题上 24/24 全过。因此这轮可以说:两者都具备复杂规划能力,K3 对优先级、层级关系和细节约束处理得更严谨。

  • Auto-research:上限高,但持续研究能力不稳定
    这类任务可以理解成:不给模型一个标准答案,而是让它自己不断尝试、修改方案,争取把性能或结果一点点提高。V4 Pro 的表现很分化,有明确突破口时,它可以一下冲得很高:其中一道性能优化题拿到 0.9982,几乎顶格,并把程序速度提高了两个数量级。可当任务需要不断尝试新方案、慢慢寻找更优解时,它的提升能力明显弱一些;另一道近似优化题连续尝试 7 次,最后只有 0.1987。所以 V4 Pro 的研究能力更像:找到关键抓手时爆发力很强;找不到抓手时,继续投入更多轮思考也未必能产生新的突破。

  • “多想”不等于“想得更好”
    这轮有一个很明显的现象:高分任务往往很快就解决,低分任务反而最消耗时间。最成功的那道只用了 13 轮,几道效果一般的题却一路磨到 141、170 轮。这个样本已经能看到一个很明显的规律:V4 Pro 会做的题通常很早就能找到方向;几十轮之后还没有突破,继续增加 Token 的收益会快速下降。

  • 效率与稳定性:V4 Pro 更省钱,K3 更快
    V4 Pro 跑完,中位每题约 20 轮、11.5 分钟,总成本 3.71 美元;K3 中位约 16 轮、6.5 分钟,速度更快,但整包成本达到 18.81 美元。两者计价方式不同,因此不能简单理解成 K3 消耗了五倍算力,不过从实际使用的账单看,成本差距很明显。

如果你也是高频 AI 用户,不愿只看参数和跑分,欢迎加入我们:从真实场景出发,把模型之间的差异还原成普通人每天都会遇到的问题。

感兴趣请点击阅读全文报名。

作者:Wang Shijie, Qiu Yangtian

本轮评测统一通过 Harbor 框架执行,多模态测试集不在本次评测范围内。





特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
没有任何退路可言!中国国防部向世界警告:解放军已做好全部准备

没有任何退路可言!中国国防部向世界警告:解放军已做好全部准备

阿芒娱乐说
2026-09-23 15:11:19
1.5欧元的家乡菜,换来2700欧元天价罚单!法国女生泪洒澳洲机场,竟栽在它身上…

1.5欧元的家乡菜,换来2700欧元天价罚单!法国女生泪洒澳洲机场,竟栽在它身上…

新欧洲
2026-09-22 19:40:20
演员潘粤明画的一幅鬼画,网友:狗链子画的好!

演员潘粤明画的一幅鬼画,网友:狗链子画的好!

乡野小珥
2026-09-21 04:03:10
第一集就要打码!这部史诗级大作,太生猛了

第一集就要打码!这部史诗级大作,太生猛了

来看美剧
2026-09-25 18:11:02
事实证明,现在大部分男性,单靠自己的工资收入,根本养不起家

事实证明,现在大部分男性,单靠自己的工资收入,根本养不起家

舒山有鹿
2026-09-25 14:42:19
规则收紧、乒超除名、留洋只剩一年窗口,樊振东的路越走越窄

规则收紧、乒超除名、留洋只剩一年窗口,樊振东的路越走越窄

许三岁
2026-09-01 16:35:07
美媒:中国6代机歼-36高强度试飞,原型机变化不少,美国难研发同水平6代机

美媒:中国6代机歼-36高强度试飞,原型机变化不少,美国难研发同水平6代机

蓝星杂谈
2026-09-24 17:25:48
这次美国国宴名单和菜单,大有深意

这次美国国宴名单和菜单,大有深意

煮酒杂谈
2026-09-25 13:20:02
周杰伦南京演唱会上调侃刘畊宏:“本来祝福他在节目里长长久久,结果被淘汰了”

周杰伦南京演唱会上调侃刘畊宏:“本来祝福他在节目里长长久久,结果被淘汰了”

韩小娱
2026-09-25 14:00:34
小米澎程N90那个升顶帐篷是疯了吗?

小米澎程N90那个升顶帐篷是疯了吗?

硬核的半佛仙人
2026-09-24 11:45:00
全公司都请假连休13天!!!我被架空了……

全公司都请假连休13天!!!我被架空了……

毕导
2026-09-24 12:52:24
贵州茅台医院一女护士倒在工作岗位,查出脑出血去世留下8岁儿子;人社局:抢救10天不予认定工伤

贵州茅台医院一女护士倒在工作岗位,查出脑出血去世留下8岁儿子;人社局:抢救10天不予认定工伤

大风新闻
2026-09-24 19:00:05
安东尼:曼联不会无缘无故花9500万欧买我,这也确实影响了我

安东尼:曼联不会无缘无故花9500万欧买我,这也确实影响了我

懂球帝
2026-09-25 17:37:40
敬一丹曾爆料:主持揭露东莞特殊服务节目时,她与导演发生争执

敬一丹曾爆料:主持揭露东莞特殊服务节目时,她与导演发生争执

言过于诚
2026-09-21 10:04:14
美日韩外长发表声明,不许改变台海现状,不到24小时,中方罕见表态

美日韩外长发表声明,不许改变台海现状,不到24小时,中方罕见表态

闻识
2026-09-25 06:02:23
贫穷能让一个人有多卑微?网友:给05年小富婆妹当过狗,还给130斤小富婆做了俩月男朋友

贫穷能让一个人有多卑微?网友:给05年小富婆妹当过狗,还给130斤小富婆做了俩月男朋友

带你感受人间冷暖
2026-09-15 00:05:19
俄要乌克兰承认被占5地归俄,泽连斯基:这事已经不用谈了

俄要乌克兰承认被占5地归俄,泽连斯基:这事已经不用谈了

桂系007
2026-09-25 13:27:02
安徽省委常委、副省长蔚盛斌已任省政府党组副书记

安徽省委常委、副省长蔚盛斌已任省政府党组副书记

澎湃新闻
2026-09-25 11:54:31
伊朗称只要美方封锁还在,就不让霍尔木兹海峡有航行自由,外交部回应

伊朗称只要美方封锁还在,就不让霍尔木兹海峡有航行自由,外交部回应

澎湃新闻
2026-09-24 17:18:25
特斯拉10月优惠来了:Model3最高立减2.1万,ModelY反而只少3000元

特斯拉10月优惠来了:Model3最高立减2.1万,ModelY反而只少3000元

小8说科技
2026-09-25 11:57:05
2026-09-25 18:47:00
ZFinance
ZFinance
Z世代的一站式AI、科技和财经资讯
275文章数 22关注度
往期回顾 全部

科技要闻

华为赛力斯,一次声势浩大的权、利再分配

头条要闻

中国博士生枪杀北卡华人导师 因精神失常被判无罪

头条要闻

中国博士生枪杀北卡华人导师 因精神失常被判无罪

体育要闻

这场青春风暴,中国足球等了太久

娱乐要闻

肖战因拍《十日终焉》连续做半个月梦

财经要闻

月饼卖不动了...

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

数码
本地
房产
教育
公开课

数码要闻

三星Galaxy Tab S12系列平板曝光:无标准版,预估10月7日发布

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

房产要闻

全年霸榜TOP1!南海・叁號院周年官宣:新作即将登场

教育要闻

央媒调查:孩子的书包,为啥这么重?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版