![]()
责编 | 梦依丹
出品丨AI 科技大本营(ID:rgznai100)
具身智能领域,世界模型正成为继大模型之后的新一轮技术竞争焦点。
近日,大晓机器人宣布,其开悟世界模型 Kairos 在 RoboTwin 2.0、LIBERO-Plus、WorldModelBench Robot、DreamGen Bench 四项国际权威评测中均取得第一名成绩,超过 Cosmos3、Pi、MotuBrain、Being-H0.7、Abot、Fast-WAM、Wan2.2 等当前主流世界模型。
![]()
从双臂操作、场景泛化,到物理建模与视频预测能力,这也是目前少见同时在多个核心维度实现领先的具身世界模型。
![]()
从“视频生成”走向“理解—生成—预测”统一架构
过去一年,世界模型快速发展,但行业主流路线大多仍建立在视频生成模型基础之上。
这种路径虽然能够生成逼真的未来画面,却普遍存在物理规律建模不足、因果关系理解有限以及推理链路较长等问题。
针对这一行业现状,大晓机器人于 2025 年底推出 Kairos 世界模型,并提出原生统一世界模型架构,将多模态理解、视频生成与状态预测整合到同一模型体系中。
据了解,Kairos 并未采用当前较为普遍的后训练改造路线,而是从底层网络架构和预训练范式重新设计世界模型。其核心包括自研混合线性注意力机制以及全局状态共享机制,使理解、生成和预测能力能够在统一框架下协同运行。
这一技术路线与当前国际主流世界模型的发展方向高度一致。英伟达近期发布的 Cosmos 3.0 也采用了类似的统一架构设计,进一步验证了该方向在行业中的重要价值。
![]()
十余万小时真实数据构建世界认知能力
除了模型架构之外,数据规模同样是决定世界模型能力的重要因素。
在训练阶段,Kairos 使用了超过十万小时 human-centric 真实场景数据,以及数百万小时互联网真实世界视频,覆盖数百种职业和生活场景。
在此基础上,团队结合显式模仿学习与隐空间强化学习,使模型能够同时学习环境变化规律、动作演化逻辑以及任务执行过程中的因果关系。
大晓机器人认为,这种训练方式不仅提升了模型的场景理解能力,也增强了其在未知环境中的泛化能力,为具身智能领域关于世界模型 Scaling Law 的探索提供了新的实践样本。
![]()
Kairos-4B:让机器人直接使用世界模型
在世界模型的发展过程中,一个长期存在的问题是模型预测结果与机器人执行系统之间往往存在多层转换环节。
Kairos-4B尝试解决这一问题。
据介绍,这是首个能够在端侧直接驱动机器人本体运行的具身世界模型。模型可以同时完成世界理解和状态预测,并直接输出机器人所需的决策结果,从而减少中间转换带来的延迟。
对于机器人而言,这意味着更快的响应速度和更高的执行精度,也让世界模型真正开始从“认知系统”向“执行系统”延伸。
RoboTwin 2.0 登顶:双臂操作能力获得验证
RoboTwin 2.0 被认为是当前最具挑战性的双臂机器人操作评测之一。
![]()
该基准由上海交通大学、香港大学以及上海人工智能实验室等机构联合推出,共包含 50 项复杂双臂协同任务,重点考察机器人在复杂环境下的操作能力和规划能力。
测试结果显示,Kairos 取得 96.1% 平均成功率,排名所有参评模型第一。
其中:
Clean 场景:96.9%
Randomized 场景:95.2%
这一成绩不仅超过 G0.5(93.2%)、starVLA(88.3%)等 VLA 模型,也超过 AIM(93.1%)、Fast-WAM(91.8%)、MotuBrain(96.0%)等世界模型方案。
评测结果表明,Kairos 在复杂双臂协同操作、精细动作控制以及多任务泛化方面具备较强能力。
![]()
LIBERO-Plus:世界模型首次超越主流 VLA 路线
如果说 RoboTwin 关注操作能力,那么 LIBERO-Plus 更关注机器人能否适应真实世界。
该基准由上海创智学院、复旦大学、同济大学和新加坡国立大学团队联合提出,通过光照、背景、噪声、语言指令、相机视角等七类变量模拟真实环境变化,被视为机器人泛化能力的重要测试平台。
在该评测中,Kairos 以 89.0 分排名第一。
![]()
其成绩超过:
ACoT-VLA(88.0)
Pi 0.5(85.7)
ProGAL-VLA(85.5)
Being-H0.7(84.8)
尤其是在环境鲁棒性方面表现突出:
光照:97.7
背景:95.8
噪声:96.8
相机视角:95.5
这一结果显示,世界模型路线在场景级泛化能力上已经开始展现超越传统 VLA 路线的潜力。
对于产业落地而言,这意味着机器人部署到家庭、工厂、商场等不同环境时,对重新训练和环境适配的依赖进一步降低。
![]()
WorldModelBench Robot:4B 参数挑战更大模型
在由加州大学伯克利分校、加州大学圣迭戈分校、英伟达和麻省理工学院联合推出的 WorldModelBench Robot 中,Kairos-4B 取得 9.30 分总成绩。
![]()
值得关注的是,其参数规模仅为 4B。
相比之下:
Lingbot:28B
Cosmos3:16B
Abot-PhysWorld:14B
Wan2.2:5B
评测结果显示:
指令遵循:2.36(与 Cosmos3 并列第一)
物理遵循:4.96
牛顿力学:1.00
重力规律:1.00
时序质量:1.00
在更小参数规模下达到同等甚至更优表现,也体现出 Kairos 在参数效率方面的优势。
![]()
DreamGen 双项第一:验证世界模型泛化价值
DreamGen Bench 是当前专门面向机器人世界模型泛化能力设计的重要评测。
该基准由英伟达联合华盛顿大学、加州大学伯克利分校、加州大学洛杉矶分校等机构共同提出,其评分结果与机器人策略训练效果具有较高相关性。
![]()
评测数据显示:
AVG_PA(平均物理遵循):0.538,全球第一
AVG_Score(总平均分):0.618,全球第一
在核心泛化场景中:
新行为执行 PA:0.489,第一
新环境适配 PA:0.581,第一
新行为执行 IF:0.745,第一
相比 Cosmos3、Lingbot、Abot-PhysWorld 等模型,Kairos 在多个维度取得领先。
从结果来看,Kairos 不仅能够生成符合物理规律的数据,也具备较强的跨场景迁移能力,为机器人训练数据生成提供了新的技术路径。
从 RoboTwin 的操作能力,到 LIBERO-Plus 的场景泛化,再到 WorldModelBench 的物理建模和 DreamGen 的数据生成能力,Kairos 在四项国际评测中的表现,展示了当前世界模型技术路线的发展趋势。
对于具身智能而言,行业关注点正在从单纯的动作生成,逐渐转向对世界规律的理解、预测与推理。
而世界模型,也正从实验室研究走向机器人实际部署的核心基础设施。
随着 Kairos 等新一代世界模型的出现,具身智能距离大规模商业化落地或许又近了一步。
![]()
CSDN 6 月宠粉福利
200 小时 GP U 算力免费领
瑞幸咖啡/肯德基早餐/下午茶等能量套餐任选其一
入群还可每月定期抽取旗舰显卡、AI PC 等极客神装
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.