网易首页 > 网易号 > 正文 申请入驻

一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?

0
分享至


语义和几何能力,正在 Model 层形成可以公开验证的技术结果。

编辑丨李希

如果机器人最终要进入家庭,它面对的将是一个和标准实验环境完全不同的世界:

桌上的东西不会永远摆在同一个位置,光线不会始终一致,用户也不会按照模型训练时的固定模板给出指令。

今天,用户说:“帮我拿杯子。”明天就可能变成:“把我刚才喝水那个拿过来。”甚至是:“不要大的,拿旁边那个。”

这些表达对于人类几乎没有理解成本,但对一个真正需要执行动作的机器人来说,背后同时包含了任务意图、目标识别、空间关系和动作选择等等要素。

于是,一个问题开始变得明确:如果机器人最终要进入家庭,“会做动作”并不足够。它既需要理解人,也需要理解物理世界。

欧拉万象最近公开的两个模型【OLA-Sem】和【OLA-Geo】可以被看作对这两个问题的阶段性回答。

01


第一道题:

用户到底想让机器人做什么?

标准机器人任务往往定义得很清楚:“抓取红色杯子”“把物体放进盒子”……只有定义清楚任务,机器人才能知道要去什么地方,面对什么目标,执行什么动作。

但在家庭里,没人会这么说话,用户会使用指代、属性、上下文,也会在任务执行过程中临时改变要求。

这意味着,机器人真正需要解决的问题,并不只是“下一步动作是什么”,还包括“用户说的对象是什么”、“当前环境发生了什么”、“原来的任务是否还成立”、“接下来又应该如何继续”等等问题。

欧拉万象的 OLA-Sem,就是为了让机器人更好地执行家庭任务而诞生的。

它尝试在统一模型中联合动作预测、图像生成和文本推理,让视觉、语言和动作共享统一表征;预训练阶段则联合第一视角视频、视觉问答与机器人操作数据,希望把语义、环境交互与机器人行动能力进一步连接起来。

换句话说,OLA-Sem 想强化的是:用户的任务意图、机器人当前看到的世界,以及最终行动之间的关联。


02


第二道题:理解目标以后,

它真的知道东西在哪吗?

即使机器人已经准确知道,用户要的是桌上某个特定的杯子,但任务还仍然没有完成——机器人还需要知道不少信息:杯子距离自己多远,前面有没有遮挡物;相邻物体是否会影响抓取;从哪个方向接近更合理;动作发生之后,空间关系又会如何改变。

因为“知道这是一个杯子”和“能够把杯子拿起来”,中间隔着一个真实的三维世界。

这就是 OLA-Geo 试图处理的问题。

它没有简单在一个已经训练完成的 VLA 后增加独立的 3D 模块,而是尝试让几何空间信息从预训练阶段开始就参与模型表征的形成。

训练过程中,空间感知基础模型作为“空间教师”,通过多视角 RGB 图像提供几何信息,再通过特征层面对齐,将位置、深度、尺度和遮挡等信息逐渐融入 VLA 自身的视觉表征。而到了真正部署阶段,“空间教师”就无需额外参与推理。


为什么一家做家庭场景的公司,会觉得几何必须更早地进入模型?

OLA-Geo 背后的判断可以概括为:空间不应该只是机器人准备行动时临时调用的一条辅助信息,而应该逐渐成为模型理解物理世界的一部分,也就是空间原生的具身模型。

03


一个目标家庭服务的机器人公司,

为什么同时做这两件事?

要回答这个问题,答案恰恰可能来自家庭本身。

假设用户说:“把沙发旁边那个蓝色的东西拿给我。”机器人首先需要判断语义——“蓝色的东西”是什么;同时还需要理解几何空间——“沙发旁边”意味着怎样的空间关系,目标到底在哪里。

而真正执行时,两种信息必须共同转化为动作,这样机器人才能在家庭里实际地完成任务。

所以,OLA-Sem 和 OLA-Geo 并不是两道彼此独立的题: OLA-Sem更关注任务意图、当前观察与行动之间的关联;OLA-Geo 更关注物理世界当前是什么状态,以及目标处在怎样的空间关系里。

最终,它们都必须回答:机器人怎样真正理解并作用于物理世界?

但对于欧拉万象来 说, OLA- Sem 和OLA-Geo 并不是最终目的。它们只是 OLA 整个 Real-worldRSI(Recursive Self-Improvement)System 中,Model 层目前已经公开的两种探索。

真正的问题是:当这些模型能力进入真实机器人以后,一次执行产生的新数据和反馈,能否重新推动模型、系统与本体继续进化?


欧拉万象基础模型:语义几何并行,迭代自我提升

04


RoboTwin

给出了第一张阶段性成绩单

最近更新的 RoboTwin 2.0 Leaderboard,为欧拉万象的两个探索提供了一次公开评测结果:

OLA-Sem 取得 71.3% 的 Average 综合成绩,排名第一;

OLA-Geo 在 clean2clean设置下取得 83.0%,排名第一;

同时,OLA-Sem 在更强调环境变化与泛化能力的 clean2random设置中取得 67.6%,排名第二。




【成绩汇总图】RoboTwin 2.0 来源

从这个角度看,RoboTwin 给出的更像是一张阶段性成绩单。它验证的是 OLA 在 Model 层的一部分探索,而不是一个完整家庭机器人系统已经成立。

05


欧拉万象真正想 build 的,

不只是一个 Model

如果把 OLA-Sem、OLA-Geo、Agentic OS、Embodiment 和 Data & Model Infra 分开看,它们很容易被理解成几条独立的技术线。

而“分别把四个模块做好”,却无法概括欧拉万象的野心。

如果整个公司只 build 一件事,那就是一套面向具身智能的 Real-world RSI System。

Model、Agentic OS 、 embodiment 与 Data & Model Infra,都是这套系统的组成部分:

Model负责持续增强机器人对语义、空间与行动的理解;

Agentic OS连接用户意图、任务规划、技能调度与执行过程,让机器人从“完成一个动作”,进一步走向“完成一个任务”;

Embodiment则让这些模型和系统能力真正进入物理世界——OLA 围绕 AI-native 的机器人本体与 Mobile Manipulation 持续优化,让机器人既走得到,也拿得到;

Data & Model Infra承担的,是整套系统里“让下一轮变得更好”的闭环角色——机器人进入真实世界以后,每一次成功、失败和异常执行都会产生新的数据,这些数据又会被重新采集、处理、分析,进入训练与评测,再重新部署回机器人——因此,Infra 的价值不只是“把模型训练出来”,而是让真实世界本身持续成为下一轮模型和系统进化的数据来源。

于是,整个系统就形成了一个具身智能持续进化的循环:真实任务 → 执行 → 反馈 → 数据 → Model / System 迭代 → 再部署 → 新的真实任务。

当这个循环不断发生,OLA 希望实现的就不只是某一次 Benchmark 上的性能提升,而是机器人在真实世界中的持续Self-Improvement——这就是 OLA 所定义的 Real-world RSI System。

从这个角度再看 OLA-Sem 和 OLA-Geo,它们的重要性也不只在于分别解决语义与空间问题。它们是这个循环里 Model 层已经露出的两种能力。

而 Agentic OS、本体和 Data & Model Infra,则负责让这些能力真正进入现实世界,并将新的现实世界经验重新送回下一轮迭代。


06


Benchmark 之后,

真正的问题仍然是现实世界

当然,RoboTwin 不等于一个真实家庭:真实家庭中的语言更自由,空间更复杂,人与物会持续变化,任务可能持续更长时间,机器人还会遇到错误恢复、安全、人机协作以及长期学习等一系列问题——这些都无法由一张 Leaderboard 给出最终答案。

所以,对欧拉万象来说,OLA-Sem 和 OLA-Geo 更像两张阶段性答卷,它们至少回答了一个问题:语义和空间这两种能力,正在 Model 层形成可以公开验证的技术结果。

而下一步的问题则是:当这些能力真正离开 Benchmark,来到一个持续变化的现实环境中之后,它们到底还能做到什么?

从这个角度看:第一名不是结论。真正的考试,才刚刚开始。

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
孙宇晨再抛小作文,彻底反转了!

孙宇晨再抛小作文,彻底反转了!

互联网品牌官
2026-09-22 15:49:16
我国首批航天员已全部停航停训,背后释放的信号不简单

我国首批航天员已全部停航停训,背后释放的信号不简单

军武咖
2026-09-23 00:14:57
iPhone Duo难产!代工厂要求苹果二选一:要良率还是要产量

iPhone Duo难产!代工厂要求苹果二选一:要良率还是要产量

快科技
2026-09-23 16:38:17
苹果“最建议买”的3款手机,性能强不卡顿,能用到2032年

苹果“最建议买”的3款手机,性能强不卡顿,能用到2032年

小柱解说游戏
2026-09-23 00:30:51
雷军回应“打新宇树挣了100多亿”

雷军回应“打新宇树挣了100多亿”

澎湃新闻
2026-09-22 19:07:44
安徽黄山一鸡排店店员发文怀念一位老顾客:丈夫瘫痪,她打零工还每周给儿子买鸡排,许久未见她来,发去消息等来的却是她车祸去世的噩耗

安徽黄山一鸡排店店员发文怀念一位老顾客:丈夫瘫痪,她打零工还每周给儿子买鸡排,许久未见她来,发去消息等来的却是她车祸去世的噩耗

潇湘晨报
2026-09-23 12:06:13
张展硕1分43秒49有多强?跻身200自历史前10,仅4人比他更快

张展硕1分43秒49有多强?跻身200自历史前10,仅4人比他更快

全景体育V
2026-09-23 17:02:08
“整完容才到普通人水平!”初中女孩晒整容前后对比照,有点心酸

“整完容才到普通人水平!”初中女孩晒整容前后对比照,有点心酸

世界圈
2026-09-14 15:05:05
3换1交易!老鹰送出希尔德+内姆哈德+现金 从黄蜂换来芬尼史密斯

3换1交易!老鹰送出希尔德+内姆哈德+现金 从黄蜂换来芬尼史密斯

罗说NBA
2026-09-23 06:05:52
仅3场比赛!从国足核心到“边缘人物”,王钰栋恐要被安东尼奥毁掉了

仅3场比赛!从国足核心到“边缘人物”,王钰栋恐要被安东尼奥毁掉了

兵哥篮球故事
2026-09-23 18:40:00
随着中国男足0-0,朝鲜4-1伊朗,最终排名大反转:中国队变大赢家

随着中国男足0-0,朝鲜4-1伊朗,最终排名大反转:中国队变大赢家

大秦壁虎白话体育
2026-09-23 15:25:22
“没显过人家,开始嫉妒了!”宝妈暗中较劲被嘲:品位差距太大!

“没显过人家,开始嫉妒了!”宝妈暗中较劲被嘲:品位差距太大!

林林先生
2026-09-23 11:17:49
拥有核武器50年却不承认,联合国调查遭驱赶,数量可能比我国还多

拥有核武器50年却不承认,联合国调查遭驱赶,数量可能比我国还多

人间无味啊
2026-09-06 16:45:34
不给钱就卖到园区会所?22岁哈尔滨女孩王然,这次怕是凶多吉少了

不给钱就卖到园区会所?22岁哈尔滨女孩王然,这次怕是凶多吉少了

皮蛋儿电影
2026-09-22 11:20:47
中国是否继续允许伊朗航班降落?外交部回应

中国是否继续允许伊朗航班降落?外交部回应

看看新闻Knews
2026-09-23 17:21:18
将日本记者干沉默!日媒失态:用争议图片报道张博恒 韩美女也遭殃

将日本记者干沉默!日媒失态:用争议图片报道张博恒 韩美女也遭殃

风过乡
2026-09-23 07:16:25
四川一高校给学生发中秋国庆大礼包,学生称“零食多到数不过来”,校方:住校学生每人一份,一共发了28350份

四川一高校给学生发中秋国庆大礼包,学生称“零食多到数不过来”,校方:住校学生每人一份,一共发了28350份

极目新闻
2026-09-23 16:07:06
大V:3架枭龙战机被胡塞武装击毁!

大V:3架枭龙战机被胡塞武装击毁!

烽火观天下
2026-09-22 11:39:14
月薪1700元,每月休2天!安徽永辉超市一则保洁招聘启事,引发轩然大波

月薪1700元,每月休2天!安徽永辉超市一则保洁招聘启事,引发轩然大波

火山詩话
2026-09-21 17:52:20
日乒首败混双剩独苗!张本美和松岛辉空赢得磕磕绊绊,金牌恐落空

日乒首败混双剩独苗!张本美和松岛辉空赢得磕磕绊绊,金牌恐落空

排球黄金眼
2026-09-23 15:18:11
2026-09-23 20:36:49
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7668文章数 20785关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

南开教授胡金牛"段子手式"简介更新 曾自称"力压普京"

头条要闻

南开教授胡金牛"段子手式"简介更新 曾自称"力压普京"

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

性能与实用兼得 全新奥迪S5 Avant上市 57.18万元

态度原创

健康
时尚
房产
教育
本地

痘痘没成熟,千万别硬挤!

消失的天后,带病复出,先赚10个亿

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

教育要闻

2026想给孩子报记忆力培训班?隆成义最强大脑特训营口碑推荐

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

无障碍浏览 进入关怀版