机器之心发布
世界模型正迎来关键转向。
从 Genie、Sora 到 WorldLabs,它们已经将视觉世界模型推向了一个高度。但表象之下,它们仍是统计意义上的视觉模拟器 —— 精通像素排列,却不懂物理规律和因果逻辑。
新的跃迁正在发生。近年来,具身世界模型的赛道陡然升温,备受全球 AI 大厂的关注。具身世界模型的本质是直接与物理世界的规则和约束对齐,将视频生成能力转化为动作控制能力。比如说,一个球被抛出去会如何下落,机器人手臂抬起杯子时液体是否会洒出,抓取生鸡蛋时需要施加多大的力。这种 “物理规律的本质抽象” ,正是嫁接数字仿真与物理现实的关键桥梁。
全球 AI 大厂已先行入局。谷歌、英伟达、特斯拉相继加码,或押注仿真训练平台,或自研机器人基座模型,试图率先卡位这一技术高地。而在这场竞速中,中国玩家同样不甘示弱。
今日,智象未来(HiDream.ai)正式发布具身世界模型 HiDream-O1-Embodied。秉承原生全模态的技术理念,模型强化机器人物理感知与动态预判能力,助力具身智能实现更高阶的物理交互。具身模型的发布,标志着智象逐步实现了打通图像、视频、3D、动作等模态,贯通理解 — 推演 — 执行全流程,构建统一世界模型基座的技术闭环。
模型发布同期,HiDream-O1-Embodied 首次参评具身智能模型评测平台 RoboColiseum,即在核心的 Robustness(扰动适应)子榜单中,以平均分 0.692 的成绩登顶榜首。
![]()
智象未来 CTO 姚霆表示:“我们相信,围绕真实世界的表达、理解和生成,构建同时具备全模态表达、因果推演与物理世界构建三大核心能力,才能建立完整的世界模型基座。智象的原生全模态世界模型技术理念,从设计架构之初便计划面向包括动作等全模态在内的统一表征构建。HiDream-O1-Embodied 的发布,是这一技术战略从 “模拟世界” 迈向 “真实世界” 的关键里程碑。”
登顶 RoboColiseum:用 “扰动适应” 子榜第一交出硬核答卷
常态化具身智能仿真评测平台 RoboColiseum 旨在构建多维度的系统评测体系,以与真机表现高度一致的仿真评测,帮助开发者识别模型的能力优势与短板,持续迭代提升。平台面向全球高校、科研机构、模型企业与研究者开放,实时更新评测结果,致力于构建一套结果可信、过程可复现的具身模型评测标尺。
该平台基于高保真仿真环境构建,高度还原真实世界。平台围绕四个维度推出 4 类能力子榜、78 个高保真仿真评测任务 —— 指令跟随、空间理解、扰动适应与通用操作。自内测上线以来,已吸引海内外几十款重量级模型开展评测。在这四个维度中,扰动适应(Robustness)被公认为最具挑战性的一环。它通过改变背景、光照、材质、机器人初始状态、相机位置与图像质量,并对指令进行多样化改写,检验模型在非理想环境中的稳定性与泛化能力。换言之,这不是在实验室的 “温室” 里考试,而是在各种 “意外” 中检验真本事。
HiDream-O1-Embodied 以 0.692 分的成绩登顶该榜单榜首,这得益于其原生全模态底座。原生全模态世界模型天然为跨模态的理解与生成提供了基础。而在执行环节,为了保证在真实世界的各类 “意外” 中保持稳定。HiDream-O1-Embodied 在三项核心能力上进行了突破性创新,让理解更精准、感知更稳健、抗干扰能力更强。
![]()
视频链接:https://mp.weixin.qq.com/s/tbpyMP9u_dprpqmaeC-azQ
视频展示的是“pick block shape”任务的头部视角实录。机器人需要按指令(比如“右臂拿起桌面上的三棱柱”),完成抓取任务。任务对模型提出了三层考验:一是先要从一堆杂物里精准找出三棱柱,然后再实时算出它的三维位姿,最后规划一条稳当的抓取轨迹。测试还故意加了光影晃动、局部遮挡和纹理混淆等干扰。从画面中可以看到,大部分情况下,HiDream-O1-Embodied 都能一气呵成地完成“认出—定位—抓起”,感知精准,操作也足够扎实。
语言理解 —— 突破关键词匹配的局限
传统机器人对语言指令的理解往往停留在关键词匹配层面。说 “把杯子拿过来” 能听懂,换成 “给我拿个杯子” 或 “杯子递我一下” 就可能 “宕机”。HiDream-O1-Embodied 覆盖多元动词、句式与表达方式的等价指令空间,不被句式束缚,只锁定意图本身。无论指令如何变换,它都能穿透字面,直达用户的本意。
视觉感知 —— 多视角协同,避免 “一处失灵、全局失效”
在物理世界中,机器人的视觉通道并非是理想状态。相机位置可能发生偏移,标定精度会随时间变化,单路画面也可能受到遮挡或干扰。HiDream-O1-Embodied 综合多个视角的信息,让不同视觉通道相互补充,而非依赖某一固定视角。当部分视觉信息出现偏差或暂时不可用时,模型仍能借助其他视角理解场景、判断任务并继续执行,让系统从 “一处失灵、全局失效”,转变为 “局部受限、整体仍可运行”。
高容错机制 —— 在 “不完美” 中学会稳定执行
多数模型的训练基于 “完美数据”—— 清晰的图像、完整的画面、标准的视角。但真实世界从来不是这样。光照变化、画面污损、视野遮挡、信号波动,都是机器人实际运行时可能遇到的日常情况。
HiDream-O1-Embodied 在训练阶段便主动引入多种非理想条件,让模型反复面对不完整、不稳定的信息,并学会从有限线索中作出可靠判断。这样的训练使模型不只追求理想条件下的最佳表现,也更加重视复杂环境中的持续稳定。这种容错能力也不局限于某一种视觉异常。面对光照、外观和场景变化,模型能够更灵活地利用已有信息,减少环境变化对任务执行的影响。对 HiDream-O1-Embodied 而言,真正重要的不只是 “看得清时做得好”,更是 “条件不理想时,依然能够稳稳完成任务”。
模型 + 数据:打造 “真实基座 + 生成增强” 数据生产范式
而这种 “在训练中见过足够多不完美” 的能力,并非凭空而来。它触及一个更底层的命题:模型的认知边界,由它所接触的数据所影响。高质量数据,恰恰是具身训练中最稀缺、也最具决定性的变量。智象极力打造的 “模型 + 数据” 双驱动的策略,正是问鼎具身世界模型榜单的真正护城河。
该策略的关键突破口,在于让数据生产本身成为模型迭代的有机一环。为此,智象探索出 “真实基座 + 生成增强” 的数据生产范式。模型不再是被动接收数据,而是主动参与数据的创造。
以与诺亦腾的合作为例:其高精度真人动作捕捉数据作为真实底座,智象借助原生全模态能力完成百倍级的数据精细化扩增。基于单段真实动作样本,模型可以生成变体视频:在严格恪守物理约束不变的前提下,切换背景环境、光照条件、物体形态等变量,产出海量多元训练样本。
这一机制的关键,在于模型既做 “考生”,也做 “出题人”—— 它根据自身所需主动生成针对性训练样本,形成数据与模型互相驱动的增长飞轮。最终让 HiDream-O1-Embodied 在面对现实世界的强扰动时,展现出超乎寻常的鲁棒性。
原生全模态世界模型矩阵日臻完善
就在不到一个月前,智象刚刚发布了交互式世界模型 HiDream-O1-World,并在交互式视频世界模型评测基准 WBench 的 Navi 分榜中以平均分 80.9 登顶榜首。
交互式世界模型解决的是 “理解与推演”,让 AI 在数字世界中具备对空间、时间、运动与物体关系的完整认知。而具身世界模型解决的是 “操作与执行”,让 AI 在物理世界中完成真实任务。两者将形成有力互补,为原生全模态世界模型的发展筑牢根基。
正如智象未来创始人兼 CEO 梅涛博士此前所言,下一代大模型竞争的关键,不在于单一模态能力的增长,而是从单模态走向多模态,并走向原生统一的全模态。从 HiDream-O1-Image 到 HiDream-O1-World,再到 HiDream-O1-Embodied,智象作为创新型大模型企业,正坚定地逐步形成覆盖视觉模型、交互式世界模型及具身世界模型的模型家族矩阵。这既是原生全模态技术在多领域铺展的能力,更体现了其强大的内生进化能力。
具身世界智能的内核,是让 AI 真正踏入现实世界,在充满不确定性的物理环境中获得持续学习与自适应能力。从符号推演,到数据世界的大模型爆发,再到面向实体交互的具身范式,通用人工智能正完成从虚拟走向现实的关键演进。AI 不再仅仅停留在 “看懂世界”,而是走向 “在世界中行动,在交互中成长”。世界模型的下一场竞争,终将发生在真实物理场景之中。这一场竞争,中国企业相信不会缺席。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.