网易首页 > 网易号 > 正文 申请入驻

视频生成模型会「推理」吗?303道题全面揭示世界模型的推理短板

0
分享至



视频生成模型(Video Generative Models)是近年最炙手可热的方向。从 Sora、Veo 到 Kling、Seedance,它们能生成以假乱真的画面,对时间动态与物理规律的模拟令人惊叹。越来越多证据表明,它们已在大规模视频数据中隐式学到了某种「世界模型」(World Model)。

但一个关键问题被长期忽视:当模型生成一段看似「合理」的视频时,它真的在一帧帧地连贯推理吗?还是只画出了一个看似正确的结果?

我们把这一维度正式定义为推理一致性(Reasoning Coherence):生成视频中的事件,能否在帧与帧之间保持因果一致、可信的演化。



已有一些工作开始评估视频模型的推理:有的只看「最后一帧」判断结果对错,有的只评单个物理现象是否合理,但都没有刻画「推理一致性」,也就难以回答:到底是推理链上哪一步走错,导致了整个任务失败。

MME-CoF-Pro 基准

该团队此前已提出 MME-CoF(arXiv:2510.26802,已被 CVPR 2026 Findings 接收)——首个系统探究视频模型 Chain-of-Frame(CoF)推理潜力的研究,覆盖 12 个维度。

如今,已被 ECCV 2026 接收的 MME-CoF-Pro 在此基础上全面升级:类别从 12 扩至 16,把粗粒度定性评估升级为人工校验的过程级 Reasoning Score,并首次将「推理引导」(文字/视觉提示)作为可控变量纳入评测。



  • 论文:
  • https://arxiv.org/abs/2603.20194v1
  • 项目主页:
  • https://video-reasoning-coherence.github.io/
  • Huggingface:
  • https://huggingface.co/datasets/yqi19/mme-cof-pro
  • GitHub:
  • https://github.com/yqi19/MME-CoF-Pro

这项工作由美国东北大学(Northeastern University)联合香港中文大学(CUHK)、北京大学(Peking University)与 NVIDIA 共同完成。MME-CoF-Pro 是业界首个显式将「推理引导」作为可控变量、并在过程级别(process-level)评估视频推理一致性的基准,同时提供了细粒度的错因分析与有趣的机理发现。

数据构成



MME-CoF-Pro 共包含303个精心策划的图像 - 文字 - 视频推理样本,370张图像,覆盖16个推理类别,从 27 个现有的真实与合成基准中筛选构建,并经过领域专家三轮人工校验。

这 16 个类别被组织为四大能力组,从底层感知逐级递进到高层任务推理:

  • 感知推理(Perceptual):视觉细节、旋转、物体计数;
  • 空间与结构推理(Spatial & Structural):视觉轨迹、真实世界空间、2D / 3D 几何;
  • 物理与因果推理(Physical & Causal):物理规律、4D 动态、自然科学;
  • 任务导向推理(Task-oriented):具身操作、GUI 交互、医学影像、表格图表、文本 / 代码、视觉逻辑。



与以往工作最大的不同在于:MME-CoF-Pro 把「推理引导」当成一个可显式控制的变量。每个样本都提供 No Hint 与 Text Hint 两种设置;其中 8 个感知要求最高的类别(记为 MME-CoF-Pro-mini)还额外提供 Visual Hint。除提示部分外,其余指令完全一致:

  • No Hint(无提示):标准设置,模型只能凭任务指令独立推理;
  • Text Hint(文字提示):在指令中补充关键推理步骤的文字描述;
  • Visual Hint(视觉提示):在输入图像上画出边界框 / 箭头 / 轨迹来引导。

因为只有提示在变、其余完全相同,任何性能差异都可以因果地归因到推理引导本身。



Reasoning Score:直击推理链路的「手术刀」

传统评测只看生成「质量」,无法回答模型到底懂不懂世界。我们提出过程级指标 Reasoning Score(RS):为每个样本标注一串人工校验的关键推理步骤,每步都是正确生成必须命中的 checkpoint;RS 即被正确完成的步骤比例,由判别模型(Gemini-2.5-Flash)逐步独立判定。

它不再是「答对 / 答错」的非黑即白,而能精准定位模型在推理链的哪一步崩塌,并支持跨模型可靠比较。



测评实验

实验部分,作者全面测评了7个最强的闭源与开源视频生成模型:Veo-3.1、Veo-3.1-fast、Sora-2、Seedance-1.0-pro、Seedance-1.0-fast、Kling-v2.1 与 Cosmos-Predict2-14B,并在三种提示设置下系统对比,得出以下几个有趣的结论。

发现一:视频生成模型普遍不具备强推理能力,且推理能力与生成质量几乎完全解耦。

即便最强的 Veo 也仅 56 分,Sora 50 分,其余明显落后——最强也只勉强过 50 分。更值得警惕的是:高画质 ≠ 会推理。以 Kling 为例,它的综合生成质量(Avg)高达65.1,但 Reasoning Score 却低至13.8。它能把风吹树林的动态渲染得惟妙惟肖,却完全没有遵循「逐渐放大并寻找手提包」的推理指令。推理,是一种与生成质量相互独立的能力。



发现二:文字提示是一把双刃剑——看似提分,实则诱发幻觉、损害一致性。

多数模型加文字提示后 RS 提升(Veo-3.1 +4.5、Sora-2 +7.6、Cosmos +6.7),但代价是 7 个模型的一致性分数(CS)几乎全线下降,尤其 4D Dynamics 上 7 模型 CS 全降(-1.2 至 -15.6)。模型往往只在「照本宣科」执行字面指令——例如为满足运动指令凭空「分裂」出一个多余物体。显式提示更像是转移注意力,而非增强理解。

发现三:视觉提示并非万能,对精细感知任务甚至会帮倒忙。

它在结构化、需空间引导的任务(Embodied、GUI)上有帮助,却在视觉细节、物体计数等精细任务上拉低成绩(Visual Detail:Veo-3.1 RS -13.0、CS -14.4)。更有趣的是,模型常把视觉提示「画进」画面——指示方向的箭头被当成物体、渲染成弯曲轨迹。作者推测这源于训练数据偏差:标注箭头 / 高亮常与合成内容共现,模型把「引导」误当「内容」。

案例研究:提示越多,推理就越好吗?

一个自然的问题是:不断增加提示信息,能单调地提升推理表现吗?作者在 Frozen Lake 任务上用 Sora-2 做了一组渐进式 scaling 实验。



结果表明:虽然文字与视觉提示带来的推理分数普遍高于无提示基线(0.23),但两条曲线都在各阶段剧烈波动,没有清晰的上升趋势。这说明当前模型无法以累积的方式稳定地利用越来越详细的提示信息——简单地堆叠提示,并不能保证推理表现的提升。这也指向了一个开放问题:如何让视频模型把多步提示稳定地落地为连贯的推理轨迹。

人类研究:Reasoning Score 究竟靠不靠谱?

为验证 RS 是否能有效、独立地刻画视频推理能力,作者邀请 10 位标注者对随机抽取的视频按标注步骤打分,并与现有指标对比。



结果显示,Reasoning Score 与人工评分的 Spearman 相关性高达 0.61,大幅超越 Instruction Alignment(0.17),与 Pass@5 last-frame correctness 则呈负相关(-0.41)。这充分说明:RS 比现有指标更能捕捉人类视角下的推理行为,是评估推理一致性的有效指标。

结语

本文系统评测了主流视频生成模型在推理一致性上的真实水平,提出了过程级评测指标 Reasoning Score,并通过文字 / 视觉提示的可控对比,深入分析了模型的失败模式与作用机理。

核心结论令人深思:当前的视频生成模型,更多是在「跟随」提示,而非真正「理解」并落地世界规律。通往真正世界模型推理的道路上,更强的视觉对齐能力、指令理解能力与抗幻觉机制,仍是必须攻克的方向。

作者希望这些分析结果,能为视频生成模型与世界模型的未来迭代提供有价值的参考。非常欢迎感兴趣的老师同学们联系作者团队进一步交流!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
大坂直美美网致敬艾弗森造型引发争议

大坂直美美网致敬艾弗森造型引发争议

甜份超标的我
2026-09-01 20:39:11
66岁刘雪华独居上海别墅,每天清晨六点,都会准时给远在加拿大的姐姐通话报平安

66岁刘雪华独居上海别墅,每天清晨六点,都会准时给远在加拿大的姐姐通话报平安

音乐时光的娱乐
2026-08-26 02:44:53
斯诺克赛程:决出8席16强,赵心童领衔,中国12人上阵,5场冠军大战!

斯诺克赛程:决出8席16强,赵心童领衔,中国12人上阵,5场冠军大战!

刘姚尧的文字城堡
2026-09-02 08:21:55
安东尼:曼联首秀进球是难忘的时刻;拉什福德需要感受到快乐

安东尼:曼联首秀进球是难忘的时刻;拉什福德需要感受到快乐

懂球帝
2026-09-02 19:31:07
追觅CEO俞浩微博禁言三月后疑似解封,其多社交平台账号大面积停更,此前称个人账号已交由公司接管

追觅CEO俞浩微博禁言三月后疑似解封,其多社交平台账号大面积停更,此前称个人账号已交由公司接管

大风新闻
2026-09-02 14:43:09
大陆接到消息,郑丽文行动了,确定断“台独”后路,岛内铺路统一

大陆接到消息,郑丽文行动了,确定断“台独”后路,岛内铺路统一

钩子的爱好
2026-09-02 07:14:07
马卡记者:曼联、多特旧将桑乔将加盟巴甲帕尔梅拉斯

马卡记者:曼联、多特旧将桑乔将加盟巴甲帕尔梅拉斯

懂球帝
2026-09-02 17:14:25
吴石案终极潜伏者隐姓 42 年,晚年返大陆热泪盈眶

吴石案终极潜伏者隐姓 42 年,晚年返大陆热泪盈眶

唠叨说历史
2026-01-07 12:42:21
不焯水等于在"服毒"?以下几类蔬菜再懒也要焯水,你焯水了吗?

不焯水等于在"服毒"?以下几类蔬菜再懒也要焯水,你焯水了吗?

小胡军事爱好
2026-08-20 11:24:37
为什么有钱后一定要低调?网友:我爸8000万身家,几年负债1000万

为什么有钱后一定要低调?网友:我爸8000万身家,几年负债1000万

夜深爱杂谈
2026-08-30 20:56:54
羽坛惊天黑幕曝光!三大高层集体被抓才懂,林丹6年前选择太清醒

羽坛惊天黑幕曝光!三大高层集体被抓才懂,林丹6年前选择太清醒

独步天涯
2026-09-02 10:04:53
宇树科技股价暴跌50%:超过2200亿灰飞烟灭,这到底是谁的过错?

宇树科技股价暴跌50%:超过2200亿灰飞烟灭,这到底是谁的过错?

清流财记
2026-09-02 16:29:52
寿命长不长,看体重就知?过了71岁以后,体重最好保持在这个范围

寿命长不长,看体重就知?过了71岁以后,体重最好保持在这个范围

任医生聊健康
2026-09-02 12:55:14
《醒来》直到金宝牺牲,陈开来才知,原来这才是冯少的真实身份

《醒来》直到金宝牺牲,陈开来才知,原来这才是冯少的真实身份

可乐谈情感
2026-09-02 07:50:33
一架无人机炸出基辅末日景象,泽连斯基怒了,37人谁负责

一架无人机炸出基辅末日景象,泽连斯基怒了,37人谁负责

阿纂看事
2026-08-31 17:43:16
袁立现身苏州大学,剪寸头暴瘦脱相,身边老公一路贴心相伴

袁立现身苏州大学,剪寸头暴瘦脱相,身边老公一路贴心相伴

街上的行人很刺眼
2026-09-02 15:12:16
17.6万元,廉价版特斯拉杀入中国!

17.6万元,廉价版特斯拉杀入中国!

互联网品牌官
2026-09-01 11:09:29
耿直!朱婷被意大利记者问亚锦赛话题:亚锦赛?可以忽略这个问题吗?

耿直!朱婷被意大利记者问亚锦赛话题:亚锦赛?可以忽略这个问题吗?

818体育
2026-09-02 09:51:53
一个很残酷的真相:父弱母强的家庭,养出来的孩子,大多是这两种

一个很残酷的真相:父弱母强的家庭,养出来的孩子,大多是这两种

户外阿毽
2026-08-25 00:18:35
毛主席曾对尼泊尔首相说:你想把珠峰全部划归贵国?还有更好办法

毛主席曾对尼泊尔首相说:你想把珠峰全部划归贵国?还有更好办法

究竟谁主沉浮
2026-08-17 20:19:17
2026-09-02 21:11:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13905文章数 142728关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

旅游
艺术
亲子
家居
公开课

旅游要闻

北京师范大学“九寨青禾”暑期实践队走进九寨沟景区和大录乡开展调研

艺术要闻

明代隐藏的“草书奇才”!水平不输张旭、怀素,当今知道他的人不足1%

亲子要闻

宝蓝和弟弟妹妹手上涂满颜料,用手掌画画,有趣又漂亮~

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版