网易首页 > 网易号 > 正文 申请入驻

arXiv:从人类认知出发重新审视世界模型

0
分享至


导语

从视频生成、具身智能到能够检索文献和调用工具的AI Agent,越来越多系统被冠以“世界模型”之名,但生成连贯画面是否等于理解物理世界,完成复杂任务又是否意味着具备真正的机器认知?2016年4月17日发表于arXiv的一篇综述以认知架构理论为框架,从感知、记忆、语言、推理、想象、动机与元认知七项功能出发,系统比较视频、具身与知识型世界模型。研究指出,当前模型在世界表征和未来预测上进展显著,但内在动机与元认知仍明显不足;世界模型要从“生成得像”走向真正服务于预测、行动与自我修正,仍需回答目标从何而来,以及系统能否识别并纠正自身错误。

关键词:关键词:世界模型、认知架构、机器认知、具身智能、AI Agent、主动推断、元认知

贾梓杏丨作者

赵思怡丨审校


论文题目:Human Cognition in Machines: A Unified Perspective of World Models 论文链接:https://arxiv.org/abs/2604.16592 发表时间:2026年4月17日 论文来源:arXiv

今天,越来越多不同的技术路线被放进“世界模型”(World Model)这个名字之下:从 Dreamer 的潜空间想象、JEPA 的表征预测,到生成未来视频、机器人在行动前预演后果,再到能检索文献、调用工具的 AI Agent。这些系统常被描述为能“理解场景”“想象未来”“推理行动”,甚至表现出“类人行为”。 但一篇新综述提醒我们:这些描述在指向具体计算能力时是有用的,却也可能掩盖模型实际在做什么——生成了连贯的几秒画面,就等于理解了物体、因果和行动吗?能写出研究计划,就等于拥有了某种"科学世界模型"吗? 《Human Cognition in Machines: A Unified Perspective of World Models》没有试图再给世界模型下一个更宽泛的定义,而是换了一把尺子:以认知架构理论为组织框架,把当代世界模型放进感知、记忆、语言、推理、想象、动机和元认知这七项功能中逐一审视——不问系统整体上"像不像人",而问它在功能上实现、近似或遗漏了哪些认知能力。沿着这把尺子,研究者发现了两个被严重忽视的功能:动机与元认知,并以主动推断和全局工作空间理论为参照,给出了改进方向。

1. 当“世界模型”成为集合性术语

1.1 从内部模型到技术热词

“世界模型”并不是凭空出现的新名词。早在 1943 年,心理学家 Kenneth Craik 就在《The Nature of Explanation》中提出,人会在头脑中携带一个外部世界的“小尺度模型”,用它来预演尚未发生的事件——这几乎就是今天世界模型定义的雏形。后来 Grush 进一步论证,Craik 所识别的感知—运动回路(sensorimotor loop)会在大脑中形成建模世界的神经回路:感觉运动交互不断确认或否决模型对感觉反馈的预期。

认知科学家 Allen Newell 则尝试把人类与机器的认知活动拆解为可以统一讨论的功能部件。在强化学习中,这一思想被写成了更可操作的形式:智能体学习环境的状态转移规律,再利用这个内部模型生成模拟经验、规划行动——Sutton 提出的 Dyna 架构即是代表。[4]

2018 年,Ha 与 Schmidhuber 将可学习的视觉压缩、记忆网络和控制器结合,以“World Models”命名这条在内部潜空间中训练控制策略的路线。[2] 此后,随着视频生成、具身控制、视觉—语言—动作模型(VLA)及 Agent 系统的迅速发展,世界模型开始覆盖越来越大的对象范围:它可以是像素或三维几何的预测器,也可以是动作条件下的潜状态动力学,还可以是围绕语言、文献、数据库与工具输出不断更新的知识状态。


图1:世界模型思想谱系:从心智模型、认知架构与 Dyna,到今天的神经世界模型。图源:笔者自行可视化,依据相关文献整理。

1.2 分类角度

这种扩张并不意味着所有系统都在做同一件事。它恰恰说明,“世界”可以指视觉时空、可操作的物理环境,也可以指一组会被交互改变的知识状态;而“模型”可以是显式的转移函数,也可以分散在编码器、策略、检索器、工具调用和多 Agent 协议之中。

这正是《Human Cognition in Machines》一文首先面对的概念问题。作者指出,“世界模型”一词的快速扩张制造了概念上的含混:当一个系统被描述为“理解场景”“想象未来”时,这些说法可以提示模型可能具有的计算能力;但若没有明确的功能标准,它们也会遮蔽系统实际做了什么、没有做什么。用论文的话说,这个领域缺少一种共享的词汇,来区分“哪些认知功能已经存在、哪些缺席、哪些仍只是愿景”。

例如,能生成下一帧不等于能够为行动建立因果预测;能在长上下文中保留 token,不等于具有可检索、可更新并能参与决策的记忆;有一个 reward function,也不等于系统形成了自己的动机。既有综述常把世界模型粗略分为“世界表征”与“世界生成”两类,本文并不否认这个划分,而是追进一步:两类系统的内部究竟依赖哪些认知功能?不同领域在这些功能上又各自推进到了哪里?在论文的综述范围对比表(Table 1)中,既有综述分别按“理解 vs 预测”“仿真器”“物理对齐”等线索组织,而本文是第一个以认知架构理论为组织框架、并同时覆盖视频、具身与知识型三类系统的综述。

2. 从人类认知出发

2.1 Newell、Soar 与 Global Workspace

本文借用的不是“机器大脑”这一比喻,而是认知架构理论中的功能分解:先把一个能够适应环境的智能系统需要完成的工作拆开,再检查不同人工系统在这些工作上分别做到了什么。

Newell 在《Unified Theories of Cognition》中给出了这套分解的关键来源:感知、记忆、语言、推理、想象和动机,都可以被理解为人类与机器认知中需要协调的功能部件。[3] 值得注意的是,Newell 的原始清单只有这六项;本文作者额外加入了第七项——元认知,理由是它在调节其他所有认知功能时具有关键作用。

随后,Laird 与 Newell 将这份清单实现为 Soar 认知架构:一个递归的 State–Operator–Result(S-O-R)循环——系统表征当前状态,选择并应用算子,再得到一个新状态,写作 R=frules(Sₜ, Oₜ),其中 R 就是 Sₜ₊₁。[6] 论文把它和今天世界模型的标准写法并置:zₜ₊₁=Wθ(zₜ, aₜ)。状态对应状态,算子对应动作,规则函数对应学到的转移模型——这个式子不只是一个神经网络公式,也是一个认知循环的现代写法。Soar 的产生式规则作用于一个共享的工作记忆,这又恰与为人类认知提出的全局工作空间理论遥相呼应。


图2:本文分类框架的三项理论来源。Newell 的功能分解提供坐标;Soar 将状态、操作和结果写成循环;GWT 提供全局可访问与元认知的视角。(图源:笔者自行可视化,依据论文及相关文献整理。)

Global Workspace Theory(GWT)补充的是另一层问题:信息能否在不同认知成分之间被共享和访问。Baars 用“剧场”作类比:记忆、语言、感官处理等成分像舞台上的演员与道具,幕后还有一位导演在排练中给出反馈;注意的“聚光灯”在成分之间移动,一次只照亮一处,但即便不在聚光灯下,剧院的所有组件依然在场并相互作用。[5] 论文借此讨论元认知,但并没有把“全局可访问”直接等同于元认知:只有当系统能利用这些共享信息去反思、评价或控制自己的表征、推理和决策时,才算跨过了元认知的门槛。

语言在这一框架中的位置也值得单独一提。论文回顾了从“语言是影响外部世界的工具”到“语言演化自人类共享意图的能力”的谱系,并引用 Deacon 与 Jaynes 的论断——“符号思维并非先天内置,而是通过内化语言背后的符号过程发展起来的”“意识嵌入在语言之中”。作者由此断言语言的作用至关重要(paramount):人类语言始终指向一个由交谈各方共享的世界模型。

2.2 一种描述方式

作者明确承认,认知架构并不只有一种合法的功能划分:ACT-R 使用贝叶斯式的激活机制,ICARUS 强调层级化的技能与概念,EPIC 关注感知—动作的时间约束,Active Inference 则以生成模型和自由能目标组织认知。选择 Newell 的分解,并不表示它是关于认知的最终答案;它的价值在于,Newell 的功能清单同时贯穿早期与当代的机器认知研究,因而能把视频、具身和 Agent 系统放进同一坐标中比较。

同样重要的是“功能类比”与“机制等同”的区分。论文说得很直白:机器认知是在功能上模拟(functionally emulates)人类认知的组件,而不是在机制上复制它们。“当我们说一个世界模型有‘记忆’时,我们的意思是它在时间步之间维持了状态表征,而不是说它拥有任何类似情景回忆或人类记忆生物基础的东西。”一个模型可以被归入“记忆”,因为它维持了跨时间一致的潜状态,这并不意味着它有人的情景记忆;一个 Agent 可以在语言工作空间中反复生成、评审和修改假设,这也不自动证明它拥有意识。本文要比较的是计算贡献,而不是把人工系统的内部机制拟人化。

正是这种克制,让框架的提问方式变得可检验:某个表征是否保留了任务相关变量?某次 rollout 是否真的受行动条件约束?模型能否发现自己的预测不可靠,并据此改变后续的信息获取或行动?

3. 七项认知功能:统一框架与数学骨架

3.1 七项功能及其内部结构

论文从 Newell 的六项功能出发,补充元认知后得到七项,每一项都对应一个明确的“世界模型类比”:感知对应把观测编码为世界状态 zₜ;记忆对应存储过去状态、地图或外部记忆;语言对应对目标、状态与推理的 token 化;推理对应从其他组件推断 zₜ₊₁ 或 aₜ;想象对应 rollout 生成的、模拟的或假想的状态与动作;动机对应选择 zₜ₊₁ 或 aₜ 的准则;元认知则对应对所有其他组件的自我反思、自我评估与自我控制。

这套分类还有一个比“七功能清单”更重要的内部结构:感知与记忆对应传统世界模型中的 world representation;想象与动机对应 world prediction / generation;语言与推理横跨二者;元认知则作用于整套系统。也就是说,论文不是把语言简单放入“输入端”、把推理简单放入“输出端”,而是将二者视为连接世界表征与世界生成的中间能力。而元认知也不是一个额外的内容模块,它是其他功能的递归应用:推理自己的推理、监控自己的感知、评估自己的记忆检索,并据此决定修改表征、补充信息、模拟备选方案,还是暂缓行动。


表 1. 本文采用的七项功能及其世界模型类比。资料来源:论文 Table 2。


图3:论文提出的统一认知框架。图中将感知、记忆、语言组织为世界表征,将推理、想象、动机组织为世界生成,并把元认知置于对其他功能的调节层。(图源:论文 Fig. 3)

用这套框架给具体工作归类时,作者采用了一条刻意克制的编码规则:只有当一项工作自述的贡献明确落在某项功能上时,才为它标记该功能;声称多项贡献的工作会被归入多类。以 I-JEPA 为例:它的第一项贡献——通过预测表征(而非像素)学习强编码——被记为感知与动机上的创新;而“模型更简单、归纳偏置更少”与“可扩展、高效”则被视为非认知层面的工程考量,不计入任何功能。这条规则让分类结果可以被检查,也让持有不同意见的读者能够精确定位分歧所在。

3.2 感知:压缩不是目的,“足够”才是约束

论文为这套功能框架写出了一组统一的数学骨架。感知从多模态观测开始:图像、语言、音频等输入 oₜ 经由编码器 φθ 形成当前的潜在世界状态 zₜ=φθ(oₜ)。这一表示同时受两个约束:它的维度不能超过记忆容量预算 B,即 dim(zₜ)≤B;它与观测之间的互信息也不能无节制地大,即 I(oₜ; zₜ)≤C——这是信息瓶颈的形式。


图4:多模态观测经编码器形成潜在状态,同时受到 memory budget 与 information bottleneck 约束。(图源:笔者自行可视化,依据论文 Eq. (2)–(3) 整理)

但压缩本身不是目的。作者进一步用一个“足够性”(sufficiency)条件来选择编码器:在所有候选编码器组成的集合 F 中,理想的 在尽量少保留冗余信息的同时,必须让下游任务 T 达到不低于 ρ 的预期回报,即 ,。这里的下游算子 T 可以是世界转移模型 Wθ、直接策略网络,也可以是模型预测控制器(MPC)。换言之,世界表征要丢弃多少细节,取决于这些细节会不会影响后续的预测、规划和行动。论文特别指出,ρ 这样的阈值由研究者选择——所谓“足够好的表征”,仍然取决于人在系统之外定义的任务。

3.3 记忆:状态必须携带历史

单时刻的编码有一个明显漏洞:zₜ=φθ(oₜ) 不含任何状态转移动力学,无法表示状态如何随时间演化;而且从单一观测状态出发去最大化一个标量奖励,容易导致 reward collapse,并在长时程、奖励延迟的任务中加剧信用分配问题。论文于是把观测扩展为历史序列 o≤t,让潜状态携带短期记忆:zₜ=φθ(o≤t),信息瓶颈也随之改为针对整段历史 o₁:t。

这一改写的实践含义很直接:当世界以视频帧的形式呈现时,V-JEPA 与 I-JEPA 的差别,正在于是否把滑动窗口式的短期记忆纳入表征。而记忆也不止于上下文长度。论文回顾了从演化中的 LiDAR 地图、光流与 3D 点流,到可查询的长期场景记忆(如 MosaicMem、SparseWorld),再到 KV-cache、自回归 transformer 与状态空间模型等一系列机制,并给出一个强调性的判断:“Adding memory to world models does not just make world models more human-like, it is what makes their practical use possible.”——给世界模型加上记忆,不只是让它们更像人,而是让它们的实际应用成为可能。这也解释了为什么视频世界模型、激光雷达地图和跨模态时序编码会同时触及感知与记忆:它们共同回答的是“什么样的状态足以支持后续的世界演化”。

3.4 语言与推理:连接表征与生成

在论文的框架里,语言占据一个特殊位置。作者指出,LLM 与 VLM“本身就是世界模型”——尽管它们作为世界模型的鲁棒性仍有争议:有证据表明,语言模型学到的潜空间会跨模态收敛到相似的嵌入,其视觉表征甚至与人脑的激活模式对齐;也有证据表明,LLM 对意义并不敏感、尚不能像人一样推理。更重要的是语言与元认知的关系:从统一框架图可以看出,语言可以作用于其他每一个认知组件——论文图注称之为“语言模仿了元认知”(the component of language mimics metacognition)。但作者同时保持谨慎:语言是否是操作机器中其他认知组件的理想算子,“尚待验证”。

推理则被写作一个优化问题。若转移模型 Wθ 支配潜状态演化、奖励函数 R(z) 评估未来状态的可欲性,那么行动选择就是在时间范围 H 内寻找使累计期望回报最大的行动序列:(Eq. 6)。在这个意义上,“行动选择可以被理解为对时空潜轨迹的推断”。论文把当代系统的推理设计排成一个谱系:一端是 VLA 这样的直接策略网络,用 VLM 骨干加 flow-matching 动作头,把观测直接映射为动作,完全绕过显式的未来状态预测;另一端是只表征世界、另配独立价值或策略模型的 World Action Models——表征与行动生成的分离带来了想象上的最大灵活性,但世界预测的误差与行动选择的误差也会各自独立地累积。

想象(imagination)则有两种形态:训练时的“dreaming”——在无监督或模拟环境中学会世界动力学,让策略在潜空间中预演,从而以 sim-to-real 克服真实数据的稀缺;推理时的假设性推理(hypothetical reasoning)——在一组候选行动 rollout 上模拟未来,以选出最优动作。而这一切的前提是 3.2 节的编码足够好:只有可遍历、在长时程上保持一致的世界表征,想象的轨迹才不会迅速失真。

3.5 动机:谁在选择未来?

在论文的统一框架中,想象、动机和推理组成一个连续的行动环:想象从当前状态 rollout 出可能的未来,动机为这些未来提供选择标准,推理据此选取轨迹。传统模型式强化学习把这个过程写成 3.4 节的 Eq. (6):在行动序列中寻找使未来回报期望和最大的那一条——世界模型负责预测,reward function 则告诉系统哪些未来值得追求。问题在于,这个 reward 通常定义在世界模型外部:手工设计的奖励在新环境里可能无法泛化,甚至会与真正的操作目标错位(misaligned);多任务训练和 RLHF 能补充目标与偏好,却并没有回答“目标从哪里来”。论文的盘点印证了这一点:三个领域中动机一栏的创新“几乎总是”实现某种外在动机,而“Using intrinsic motivation for world models is drastically unrealized”——在使用内在动机的强化学习工作中,只有 7 篇是显式的世界模型工作,其中仅 3 篇明确把 Active Inference 用作奖励信号。

作者因此把 Active Inference(主动推断)[7] 作为一个值得认真探索的方向。它把认知理解为不断“最小化惊讶”的过程,并分成两条路径。面对已经发生的观测,系统更新自己关于世界的信念:观测越出乎意料,“惊讶”(surprise)就越大;而直接计算惊讶需要对看不见的潜在状态积分,通常不可行,于是转而最小化它的一个可优化上界——变分自由能。这个量可以拆成 complexity 与 accuracy 两项:前者是为了容纳新证据,当前信念相对先验需要改变多少;后者是这些信念能否把已经看到的数据解释好。最小化自由能,就是在“不要无谓地改变既有信念”与“要把证据解释清楚”之间取得可优化的平衡。面对尚未发生的未来,系统则用期望自由能来比较不同的行动方案,其中同样有两项:information gain——沿这条路径走下去,未来观测能在多大程度上减少模型对世界的不确定性;value——这条路径带来的结果有多接近系统偏好的状态。最小化期望自由能的行动,既“减少不确定”,又“趋向偏好”。

这就是 Active Inference 与动机相连的准确位置:它把“认识世界的需要”(信息增益、减少不确定性)和“趋向某些世界状态的需要”(偏好结果)同时写进行动选择的目标——探索欲与目标追求不再是外挂的静态标量奖励,而是从生成模型内部长出来的信号。这正是“内在动机”的精确含义:它回答的不是“世界将如何演化”,而是“什么样的未来值得被选择”。不过论文也保持清醒:偏好分布本身仍可由设计者给定,目标的来源依然部分是外部的;而且今天替世界模型选择阈值、设计奖励与训练集的,仍是研究者本人——“It is researchers who breathe life into world models.”

3.6 元认知:不是“再想一遍”

论文补充进框架的第七项功能——元认知,同样不能被简化为多一轮生成。按照论文基于认知架构理论与 GWT 给出的操作性定义,它是 self-reflection、self-evaluation 与 self-control 的能力:估计不确定性、发现错误、选择模型、重新规划、寻求额外信息,或者暂缓行动。Soar 把抽象任务递归拆解为子任务、在进展受阻时对记忆与感知等组件进行“调试”并提出替代路线,提供了一种早期类比;但论文的措辞很保守:这仅仅“展示了最低程度的”(a minimal degree of)元认知,让世界模型具备类人元认知“在理论上可能,但在实现上仍是一个基本未解的问题”。核心局限在于:潜空间世界模型学会了 zₜ 和状态转移,却“缺少一种监控、评估或控制内部计算路由的机制”。

作者讨论了几条潜在的工程路径作为近似:用 mixture-of-experts 加 world-aware router,让路由对专家的选择表现出某种自我控制;让 router 决定 looped transformer 的循环次数,即对“推理多少”的控制——某种意义上是“reasoning about reasoning”;或引入第一人称之外的第三人称视角模态,为自我反思提供更多参考。语言 Agent 的 Global Workspace 则提供了一个更直观的起点:共享的语言记录让系统可以比较不同假设、检查工具结果、要求补充证据,生成与判断也可分配给不同角色,通过 critique、ranking、execution trace 等机制形成“提出—评估”循环。但这只是元认知的脚手架,不是已经完成的自主元认知:评审器可能与生成器共享数据、模型和盲点。作者的结论因此并不乐观:关键不只是“多加几个 Agent”,而是发展出可靠的来源追踪(provenance tracking)、不确定性感知的验证,以及可问责的人机治理机制。


图5:综述提出的几条潜在元认知工程路径:按状态选择专家、调节推理深度,以及利用多视角进行交叉检查。(图源:笔者自行可视化,依据论文及相关工作整理)

4. 不同的世界表征

4.1 Video、Embodied 与 Epistemic

作者将当代世界模型研究归入三类。Video World Models 围绕视觉时空状态工作:以观测和动作为条件生成或预测未来视觉状态,核心挑战是空间一致性与长时程的时间连贯。Embodied World Models 把问题推进到可干预的物理环境:接触几何的感知、持久环境的记忆、力传播的推理,都成为状态建模的一部分。前两类被统称为 latent world models——它们在学习得到的潜空间中表示和预测世界,涵盖了此前绝大多数世界模型工作。

第三类是作者新提出的 Epistemic World Models。这里的“世界”不再是场景或机器人周围的物体,而是由文献、数据库、代码、实验结果、工具输出和人类反馈组成的结构化知识空间:领域专业知识诱导出状态空间,科学产物充当观测,智能体通过推理和工具操作不断更新这个认识状态。前一类路线是对外部环境的“潜压缩”,后一类则是对结构化知识的“显式维护与更新”——两种互补的世界建模策略。


图7:本文的三类世界模型。Video 与 Embodied World Models 主要在潜在状态中表示与预测世界;Epistemic World Models 将知识工作空间视为可更新的“世界”。(图源:笔者自行可视化,依据论文整理)

4.2 视频世界模型:超越“视觉上的逼真”

论文用一组方程概括视频世界模型:zₜ₊₁=fθ(zₜ, aₜ),xₜ=gφ(zₜ)——潜状态编码场景几何、物体位形、物理因素与时间上下文,视频经由“状态演化加渲染”产生,而不是逐帧直接合成。作者由此强调:Wan、Sora、Kling 这样的系统“并不只是在合成像素”;一个世界模型必须超越视觉上的逼真(visually plausible synthesis),支持持久的状态表征、因果的转移建模、可控的干预和有物理依据的预测。这一区分标志着“从被动的文生视频,走向可交互、可控制、面向智能体的环境”。

在这一框架下,视频域的推理被整理为几种范式:自回归因果 rollout(zₜ₊₁=Wθ(z≤ₜ)),每一步只看过去,因果清晰但误差逐步累积;可提示/动作条件生成(zₜ₊₁=Wθ(zₜ, aₜ, c)),可以回答“如果这样做会怎样”;双向/掩码生成则对整条轨迹的联合分布建模,全局更优但严格因果性较弱。关于记忆,论文的判断同样适用于此:关键不在于上下文窗口有多长,而在于设计出“在反复 rollout 下仍保持稳定与因果性”的潜状态——Self-Forcing、Causal Forcing、Reward Forcing 等工作,正是在处理训练与生成之间的输入错位(exposure bias)与长程漂移问题。

值得注意的是两个“缺席”。其一,语言在视频世界模型中几乎不作为明确贡献出现——Table 3 的语言列近乎空白,正文甚至没有任何一个语言小节。其二,动机虽有个案——如用可验证的牛顿力学奖励对视频扩散模型做后训练,或 Cambrian-S 以预测误差作为“surprise”来驱动记忆更新与事件分割——但论文对后者有一句关键批评:它“falls short of implementing Active Inference’s full exploratory learning objective”,只用像素级预测误差作 surprise 的代理,缺少驱动探索的信息增益项(见 3.5 节)。

4.3 具身世界模型:从像素到接触几何

论文用一句话点明具身域与视频域的本质区别:视频世界模型的成功,在于生成的帧足够逼真、时间上连贯;而具身世界模型的成功,在于它的预测在物理上准确到足以引导一个有质量、有运动学、有接触表面的身体完成任务。因此,感知必须编码接触几何与六自由度位姿,而不只是视觉外观;记忆必须维持跨交互的、空间落地的持久世界模型;推理必须捕捉物理因果与力的传播;想象必须生成物理上可执行的动作条件未来。

与视频域相比,语言在具身域有了一席之地:LiDARCrafter 把自由文本转成场景图再生成 LiDAR 序列;DrivingGPT 把图像与动作 token 交错成一种“多模态驾驶语言”,将世界建模与轨迹规划统一为同一个 next-token prediction。推理一侧则呈现更丰富的谱系:VLA 模型(如 π0.5、LingBot-VLA)把推理视为语言条件下的长程规划,擅长反应式控制与指令跟随,但在长程物理推理或反事实模拟时需要外部规划器;World Action Models(如 LingBot-VA、DreamZero)联合建模 (zₜ₊₁, aₜ),把想象与控制统一在同一生成过程中;几何世界模型(如 PointWorld)直接在点云上预测 scene flow 并配合 MPC 规划,物理意义明确但依赖强几何监督。

论文对混合路线的评价颇高:兼具直接动作预测与世界建模的 hybrid VLA-WAM,被称作“如图 3 所示的真正统一世界模型——只缺少内在动机与元认知”。但它也记下一个耐人寻味的反例:Fast-WAM 移除了未来状态的想象能力,推理延迟降到 190ms(比 SOTA 快 4 倍以上)而质量损失很小,作者由此发问——在当前具身场景中,“想象”到底有多重要?

4.4 知识型世界模型:语言工作空间作为动态状态

对 Epistemic World Models 而言,语言不是单纯的输入输出格式。论文将这类系统的 Global Workspace 定义为由既往 prompts、responses 与 tool-call outputs 构成的语言集合——就像一份不断增长的聊天记录。初始的“世界”是静态的:用户给出的 context 与研究目标;随后,智能体检索文献、运行分析、写入代码、接收人类反馈,每一次交互都更新这个集合,也改变系统下一步能看见什么、能验证什么、能提出什么假设。这正是作者把它称作世界模型的理由:交互创造了一个不断变化的环境,从而形成动态状态空间——这与 Soar 的 S-O-R 循环完美对齐。

以 AI Co-Scientist 为例:文献综述、分析引擎、假设生成与辩论智能体围绕一个共享工作空间协作,假设之间通过 Elo 式成对比较排名,critique 与 reflection 循环在湿实验验证之前就对假设进行筛选——生成与判断被分配给不同角色。与潜空间模型相比,这样的状态更可读、更容易审计,也为元认知提供了早期实例。但代价同样明显:状态转移常常分散在 prompts、文档、数据库、检索片段、日志和人工修改之中,“很少像潜空间世界模型那样被清晰地形式化”,可复现性与因果归因都更困难。

论文对这类系统的局限同样直言不讳,并归结为三条:状态转移缺乏形式化;动机仍然是外在的——继承自用户指令、benchmark、奖励函数、机构激励或同行评审,而非内在的目标形成;元认知则“仍是脚手架式的,而非自主的”(scaffolded rather than autonomous)——自我评估依赖额外的智能体、外部工具或人类验证者,而它们“可能与生成者共享同样的盲点”。

5. 回到读书会:世界模型究竟要回答什么?

这篇综述的价值,不在于替世界模型宣布一个封闭的最终定义。它做的是更基础的工作:在视频、具身和 Agent 等技术路线不断扩张时,给出一套可以反复使用的比较语言。用作者在结论中的话说:“Our report provides researchers a vocabulary to debate the merits of equating human and machine cognition.”——在断言机器认知与人类认知可以划等号之前,我们至少应该先能说清楚:哪些功能已被实现,哪些只是近似,哪些仍是愿景。

沿着这套语言,论文把“统一世界模型”写成一幅由七条要求组成的路线图:使用多模态输入;编码多尺度的时空表征;让 token 化的语言成为输入、中间推理空间或输出,以支持人类在环协作;数据稀缺时用 sim-to-real 训练、推理时用假设性推理;用与领域匹配的 SOTA 架构进行推理;为世界模型提供内在奖励信号;以及利用全局工作空间实现自我反思、自我评估与自我控制。

借助这把认知功能的尺子,我们也可以不再满足于“模型看起来很像”“生成得很逼真”这样的判断,而是继续追问:它把什么编码为世界状态?它保存了哪些过去?它能推演怎样的未来?谁在决定它追求什么?当预测与现实不符时,它能否知道自己错在何处,并据此改变信息获取、推理或行动?

这也正是集智俱乐部希望持续讨论的问题。读书会自 2026 年 8 月 7 日起每周五晚 19:30–21:30 进行,围绕“世界如何被表征、其动力学如何被建模、内部模型如何服务于智能体”这条主线,从概念溯源与理论框架,到方法范式与共性问题,再到具身智能、AI Agent、复杂系统等应用场景逐层展开。我们关心的并不只是又出现了哪一个热门模型,而是:当人工智能从语言与屏幕进入机器人、工业现场、生命系统与多主体社会,它究竟需要怎样的内部世界,才能真正预测、行动并修正自己?

参考文献

[1] Rupprecht, T., Zhao, P., Taherin, A., et al. Human Cognition in Machines: A Unified Perspective of World Models. arXiv:2604.16592v2, 2026.

[2] Ha, D., & Schmidhuber, J. World Models. arXiv:1803.10122, 2018.

[3] Newell, A. Unified Theories of Cognition. Harvard University Press, 1990.

[4] Sutton, R. S. Dyna, an integrated architecture for learning, planning, and reacting. SIGART Bulletin, 2(4), 160–163, 1991.

[5] Baars, B. J. A Cognitive Theory of Consciousness. Cambridge University Press, 1988.

[6] Laird, J. E. The Soar Cognitive Architecture. MIT Press, 2012.

[7] Friston, K., FitzGerald, T., Rigoli, F., Schwartenbeck, P., & Pezzulo, G. Active Inference and Learning. Neuroscience & Biobehavioral Reviews, 68, 862–879, 2016.

世界模型读书会


目前,世界模型并非边界明确的单一技术范式。强化学习、生成模型、认知科学、具身智能与复杂系统等领域,对“世界”“状态”及其动力学机制有着不同理解。世界模型究竟应预测感知信号、学习隐空间中的状态转移,还是刻画行动、物理约束与因果关系?预测能力又如何转化为有效的规划、决策和行动?这些问题仍有待系统梳理。


为此,集智俱乐部联合认知科学、具身智能、AI Agent、复杂系统与高阶网络等领域的研究者发起,围绕世界模型的思想源流、理论基础、技术路线与应用边界展开专题分享和讨论。读书会自2026年8月7日起,每周五晚19:30-21:30,将以“世界如何被表征、其动力学如何被建模、内部模型如何服务于智能体”为主线,尝试讨论整理世界模型统一框架。



详情请见:

1.

2.

3.

4.

5.

6.

7.

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
保利集团董事长贺平的传奇人生:身为邓小平女婿,曾悄悄斥资3000万买回三件国宝

保利集团董事长贺平的传奇人生:身为邓小平女婿,曾悄悄斥资3000万买回三件国宝

人生录
2026-09-09 00:05:15
拒绝1.7亿,又拒绝1.9亿,你飘了,29队不报价,要做下一个库明加

拒绝1.7亿,又拒绝1.9亿,你飘了,29队不报价,要做下一个库明加

大西体育
2026-09-12 11:55:43
 李大钊的藏身地固若金汤,把他供出来的不是敌人,而是他最信任的人

 李大钊的藏身地固若金汤,把他供出来的不是敌人,而是他最信任的人

磊子讲史
2026-09-10 17:11:14
库克承认:是看到华为才决定做 iPhone Duo

库克承认:是看到华为才决定做 iPhone Duo

简科技
2026-09-11 18:02:46
2026年出生人口预测:老百姓对断绝香火危机的冷漠,官方看到都无奈

2026年出生人口预测:老百姓对断绝香火危机的冷漠,官方看到都无奈

非虚构人间
2026-09-11 01:40:57
四川宜宾一女子称被公职人员推入厕所强奸,县警方不予立案,市公安局复核“有犯罪事实”

四川宜宾一女子称被公职人员推入厕所强奸,县警方不予立案,市公安局复核“有犯罪事实”

第一财经资讯
2026-09-12 21:27:41
“一熟食店肉制品检出剧毒硼砂”引热议!古法食品未必更健康

“一熟食店肉制品检出剧毒硼砂”引热议!古法食品未必更健康

环球网资讯
2026-09-13 13:11:07
澳门冠军赛:延续全胜金身!4-3送早田希娜交手4连败,陈熠晋级决赛

澳门冠军赛:延续全胜金身!4-3送早田希娜交手4连败,陈熠晋级决赛

钉钉陌上花开
2026-09-13 12:16:25
简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

步论天下事
2026-09-07 09:40:52
“苹果18抢不到”,热搜榜第一!iPhone 18 Pro系列闪电售罄,抢购界面崩溃,起售价9999元

“苹果18抢不到”,热搜榜第一!iPhone 18 Pro系列闪电售罄,抢购界面崩溃,起售价9999元

每日经济新闻
2026-09-12 23:04:37
下周,两大重磅事件!A股重回年内低位,机构建议大胆布局

下周,两大重磅事件!A股重回年内低位,机构建议大胆布局

每日经济新闻
2026-09-13 10:05:02
央企行贿7610万美金,总统只分到101.17万……

央企行贿7610万美金,总统只分到101.17万……

家传编辑部
2026-09-06 21:28:20
生活在日本的穆斯林女人哭诉:为什么日本不能像中国那样迁就我们

生活在日本的穆斯林女人哭诉:为什么日本不能像中国那样迁就我们

步论天下事
2026-09-11 14:48:05
“打假变打劫” :网红“铁头”被判有期徒刑八年 曾因曝光三亚“五两秤”走红

“打假变打劫” :网红“铁头”被判有期徒刑八年 曾因曝光三亚“五两秤”走红

封面新闻
2026-09-12 16:45:03
等不到金砖开幕了,印度提前对华摊牌:要求中方让出印度市场

等不到金砖开幕了,印度提前对华摊牌:要求中方让出印度市场

触摸史迹
2026-09-12 13:57:11
黄健翔点评维尔茨:建队核心选错了,比赛踢的如此便秘

黄健翔点评维尔茨:建队核心选错了,比赛踢的如此便秘

懂球帝
2026-09-13 00:12:29
100名僧侣组团参观埃菲尔铁塔,两天后,铁塔员工集体罢工了

100名僧侣组团参观埃菲尔铁塔,两天后,铁塔员工集体罢工了

英国那些事儿
2026-09-12 23:23:22
人活多久,看起夜就知道?寿命短的人,起夜一般有这3个特征

人活多久,看起夜就知道?寿命短的人,起夜一般有这3个特征

芹姐说生活
2026-09-10 23:50:29
敬一丹去世,丈夫是亿万富翁,两人在考场认识,女儿嫁给老外

敬一丹去世,丈夫是亿万富翁,两人在考场认识,女儿嫁给老外

李博世财经
2026-09-13 14:19:42
40岁陈赫公布病情!已暂停工作,"疼痛到无法直起身子",早前妻子张子萱一句话,差点让大家吵翻?

40岁陈赫公布病情!已暂停工作,"疼痛到无法直起身子",早前妻子张子萱一句话,差点让大家吵翻?

美芽
2026-09-10 19:34:30
2026-09-13 15:32:49
集智俱乐部 incentive-icons
集智俱乐部
科普人工智能相关知识技能
6042文章数 4684关注度
往期回顾 全部

科技要闻

三位AI大佬,罕见呼吁AI减速

头条要闻

男子与女同事偷情后发病成植物人被公司解雇 法院判了

头条要闻

男子与女同事偷情后发病成植物人被公司解雇 法院判了

体育要闻

乔丹的得分统治力:如何违背篮球规律?

娱乐要闻

主持人敬一丹去世,女儿悲痛发讣告

财经要闻

“1+N+X”!私募业,监管规则密集落地!

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

旅游
健康
游戏
教育
亲子

旅游要闻

造假景区,“早就没人了”

手脚发麻口齿不清?也可能是中风!

卖爆了!《暗黑破坏神》官宣系列玩家达1.3亿

教育要闻

大学英语,「学分降级」

亲子要闻

“前额叶主理人”杨雨坤:脑科学对育儿的帮助

无障碍浏览 进入关怀版