网易首页 > 网易号 > 正文 申请入驻

一家瞄准家庭场景的机器人公司,为何同时押注「语义」和「几何」?

0
分享至


语义和几何能力,正在 Model 层形成可以公开验证的技术结果。

编辑丨李希

如果机器人最终要进入家庭,它面对的将是一个和标准实验环境完全不同的世界:

桌上的东西不会永远摆在同一个位置,光线不会始终一致,用户也不会按照模型训练时的固定模板给出指令。

今天,用户说:“帮我拿杯子。”明天就可能变成:“把我刚才喝水那个拿过来。”甚至是:“不要大的,拿旁边那个。”

这些表达对于人类几乎没有理解成本,但对一个真正需要执行动作的机器人来说,背后同时包含了任务意图、目标识别、空间关系和动作选择等等要素。

于是,一个问题开始变得明确:如果机器人最终要进入家庭,“会做动作”并不足够。它既需要理解人,也需要理解物理世界。

欧拉万象最近公开的两个模型【OLA-Sem】和【OLA-Geo】可以被看作对这两个问题的阶段性回答。

01


第一道题:

用户到底想让机器人做什么?

标准机器人任务往往定义得很清楚:“抓取红色杯子”“把物体放进盒子”……只有定义清楚任务,机器人才能知道要去什么地方,面对什么目标,执行什么动作。

但在家庭里,没人会这么说话,用户会使用指代、属性、上下文,也会在任务执行过程中临时改变要求。

这意味着,机器人真正需要解决的问题,并不只是“下一步动作是什么”,还包括“用户说的对象是什么”、“当前环境发生了什么”、“原来的任务是否还成立”、“接下来又应该如何继续”等等问题。

欧拉万象的 OLA-Sem,就是为了让机器人更好地执行家庭任务而诞生的。

它尝试在统一模型中联合动作预测、图像生成和文本推理,让视觉、语言和动作共享统一表征;预训练阶段则联合第一视角视频、视觉问答与机器人操作数据,希望把语义、环境交互与机器人行动能力进一步连接起来。

换句话说,OLA-Sem 想强化的是:用户的任务意图、机器人当前看到的世界,以及最终行动之间的关联。


02


第二道题:理解目标以后,

它真的知道东西在哪吗?

即使机器人已经准确知道,用户要的是桌上某个特定的杯子,但任务还仍然没有完成——机器人还需要知道不少信息:杯子距离自己多远,前面有没有遮挡物;相邻物体是否会影响抓取;从哪个方向接近更合理;动作发生之后,空间关系又会如何改变。

因为“知道这是一个杯子”和“能够把杯子拿起来”,中间隔着一个真实的三维世界。

这就是 OLA-Geo 试图处理的问题。

它没有简单在一个已经训练完成的 VLA 后增加独立的 3D 模块,而是尝试让几何空间信息从预训练阶段开始就参与模型表征的形成。

训练过程中,空间感知基础模型作为“空间教师”,通过多视角 RGB 图像提供几何信息,再通过特征层面对齐,将位置、深度、尺度和遮挡等信息逐渐融入 VLA 自身的视觉表征。而到了真正部署阶段,“空间教师”就无需额外参与推理。


为什么一家做家庭场景的公司,会觉得几何必须更早地进入模型?

OLA-Geo 背后的判断可以概括为:空间不应该只是机器人准备行动时临时调用的一条辅助信息,而应该逐渐成为模型理解物理世界的一部分,也就是空间原生的具身模型。

03


一个目标家庭服务的机器人公司,

为什么同时做这两件事?

要回答这个问题,答案恰恰可能来自家庭本身。

假设用户说:“把沙发旁边那个蓝色的东西拿给我。”机器人首先需要判断语义——“蓝色的东西”是什么;同时还需要理解几何空间——“沙发旁边”意味着怎样的空间关系,目标到底在哪里。

而真正执行时,两种信息必须共同转化为动作,这样机器人才能在家庭里实际地完成任务。

所以,OLA-Sem 和 OLA-Geo 并不是两道彼此独立的题: OLA-Sem更关注任务意图、当前观察与行动之间的关联;OLA-Geo 更关注物理世界当前是什么状态,以及目标处在怎样的空间关系里。

最终,它们都必须回答:机器人怎样真正理解并作用于物理世界?

但对于欧拉万象来 说, OLA- Sem 和OLA-Geo 并不是最终目的。它们只是 OLA 整个 Real-worldRSI(Recursive Self-Improvement)System 中,Model 层目前已经公开的两种探索。

真正的问题是:当这些模型能力进入真实机器人以后,一次执行产生的新数据和反馈,能否重新推动模型、系统与本体继续进化?


欧拉万象基础模型:语义几何并行,迭代自我提升

04


RoboTwin

给出了第一张阶段性成绩单

最近更新的 RoboTwin 2.0 Leaderboard,为欧拉万象的两个探索提供了一次公开评测结果:

OLA-Sem 取得 71.3% 的 Average 综合成绩,排名第一;

OLA-Geo 在 clean2clean设置下取得 83.0%,排名第一;

同时,OLA-Sem 在更强调环境变化与泛化能力的 clean2random设置中取得 67.6%,排名第二。




【成绩汇总图】RoboTwin 2.0 来源

从这个角度看,RoboTwin 给出的更像是一张阶段性成绩单。它验证的是 OLA 在 Model 层的一部分探索,而不是一个完整家庭机器人系统已经成立。

05


欧拉万象真正想 build 的,

不只是一个 Model

如果把 OLA-Sem、OLA-Geo、Agentic OS、Embodiment 和 Data & Model Infra 分开看,它们很容易被理解成几条独立的技术线。

而“分别把四个模块做好”,却无法概括欧拉万象的野心。

如果整个公司只 build 一件事,那就是一套面向具身智能的 Real-world RSI System。

Model、Agentic OS 、 embodiment 与 Data & Model Infra,都是这套系统的组成部分:

Model负责持续增强机器人对语义、空间与行动的理解;

Agentic OS连接用户意图、任务规划、技能调度与执行过程,让机器人从“完成一个动作”,进一步走向“完成一个任务”;

Embodiment则让这些模型和系统能力真正进入物理世界——OLA 围绕 AI-native 的机器人本体与 Mobile Manipulation 持续优化,让机器人既走得到,也拿得到;

Data & Model Infra承担的,是整套系统里“让下一轮变得更好”的闭环角色——机器人进入真实世界以后,每一次成功、失败和异常执行都会产生新的数据,这些数据又会被重新采集、处理、分析,进入训练与评测,再重新部署回机器人——因此,Infra 的价值不只是“把模型训练出来”,而是让真实世界本身持续成为下一轮模型和系统进化的数据来源。

于是,整个系统就形成了一个具身智能持续进化的循环:真实任务 → 执行 → 反馈 → 数据 → Model / System 迭代 → 再部署 → 新的真实任务。

当这个循环不断发生,OLA 希望实现的就不只是某一次 Benchmark 上的性能提升,而是机器人在真实世界中的持续Self-Improvement——这就是 OLA 所定义的 Real-world RSI System。

从这个角度再看 OLA-Sem 和 OLA-Geo,它们的重要性也不只在于分别解决语义与空间问题。它们是这个循环里 Model 层已经露出的两种能力。

而 Agentic OS、本体和 Data & Model Infra,则负责让这些能力真正进入现实世界,并将新的现实世界经验重新送回下一轮迭代。


06


Benchmark 之后,

真正的问题仍然是现实世界

当然,RoboTwin 不等于一个真实家庭:真实家庭中的语言更自由,空间更复杂,人与物会持续变化,任务可能持续更长时间,机器人还会遇到错误恢复、安全、人机协作以及长期学习等一系列问题——这些都无法由一张 Leaderboard 给出最终答案。

所以,对欧拉万象来说,OLA-Sem 和 OLA-Geo 更像两张阶段性答卷,它们至少回答了一个问题:语义和空间这两种能力,正在 Model 层形成可以公开验证的技术结果。

而下一步的问题则是:当这些能力真正离开 Benchmark,来到一个持续变化的现实环境中之后,它们到底还能做到什么?

从这个角度看:第一名不是结论。真正的考试,才刚刚开始。

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

心理观察局
2026-08-01 07:10:30
情况不妙了,另一场大战随时开打,朝俄动作不断,中国避得开?

情况不妙了,另一场大战随时开打,朝俄动作不断,中国避得开?

史潎的生活日记
2026-09-21 18:19:22
湖南二婚女爱上美国大叔,带儿子远嫁美国,现在却要和宠物狗争宠

湖南二婚女爱上美国大叔,带儿子远嫁美国,现在却要和宠物狗争宠

橘仔看世界
2026-09-23 18:35:15
毛伟杰是少数亮点,U23国足后防不稳,胡荷韬传球失误多,依木兰不受重用

毛伟杰是少数亮点,U23国足后防不稳,胡荷韬传球失误多,依木兰不受重用

替补席看球
2026-09-23 15:53:07
张展硕破纪录成绩有多强?过去3届奥运均能夺冠,现役仅1人能超他

张展硕破纪录成绩有多强?过去3届奥运均能夺冠,现役仅1人能超他

全景体育V
2026-09-23 17:17:43
彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

彻底摊牌了?一个欠9亿一个骗13.9亿,董卿被爆猛料,原来她和王丽坤同样困境

她时尚丫
2026-08-07 18:55:34
王东伟任安徽省委副书记,省政府党组书记、代理省长

王东伟任安徽省委副书记,省政府党组书记、代理省长

界面新闻
2026-09-23 18:44:49
被批"太暴露"后,她穿三件内衣登台,网友笑疯

被批"太暴露"后,她穿三件内衣登台,网友笑疯

热搜摘要官
2026-09-21 16:39:09
章子怡湾区晚会状态引热议:不是胖了老了,是活成了另一种境界

章子怡湾区晚会状态引热议:不是胖了老了,是活成了另一种境界

小椰的奶奶
2026-09-22 14:36:12
中央5台直播亚运女篮时间表:9月24日CCTV5直播中国PK蒙古冲击4强

中央5台直播亚运女篮时间表:9月24日CCTV5直播中国PK蒙古冲击4强

薇说体育
2026-09-23 17:24:43
超长长长长长蛋挞,你还敢吃吗?你也被收割了吗?爆出内幕了

超长长长长长蛋挞,你还敢吃吗?你也被收割了吗?爆出内幕了

西楼知趣杂谈
2026-09-22 20:06:45
孙千肚子上的肉也太真实了!我盯了半天,普通女生谁还敢饿自己

孙千肚子上的肉也太真实了!我盯了半天,普通女生谁还敢饿自己

南万说娱26
2026-09-21 08:50:16
一斤等于10斤菠菜!一护肝,二润肠,三排毒,不吃亏大了

一斤等于10斤菠菜!一护肝,二润肠,三排毒,不吃亏大了

美食店主
2026-09-16 02:21:46
深业集团:有错就要认,被打要立正

深业集团:有错就要认,被打要立正

大嘴説
2026-09-23 14:39:38
蔡澜说,刘銮雄追女明星,都是先送3000万,这样90%港姐可以拿下

蔡澜说,刘銮雄追女明星,都是先送3000万,这样90%港姐可以拿下

晓銊就是我
2026-09-07 12:39:23
俄方:泽连斯基的声明自相矛盾

俄方:泽连斯基的声明自相矛盾

参考消息
2026-09-23 13:29:26
没想到人性中的恶如此恐怖!网友隐姓埋名分享真实经历,我大为震撼

没想到人性中的恶如此恐怖!网友隐姓埋名分享真实经历,我大为震撼

夜深爱杂谈
2026-08-25 19:54:03
如今黄金价格变成了一个天大的笑话,买黄金的人可笑到什么程度?

如今黄金价格变成了一个天大的笑话,买黄金的人可笑到什么程度?

史虇的生活科普
2026-09-03 16:32:12
国家一级女演员陈丽云被逮捕!

国家一级女演员陈丽云被逮捕!

许三岁
2026-03-28 09:24:30
24股今日获机构买入评级 6股上涨空间超20%

24股今日获机构买入评级 6股上涨空间超20%

证券时报
2026-09-23 17:58:02
2026-09-23 21:31:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7669文章数 20785关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

性能与实用兼得 全新奥迪S5 Avant上市 57.18万元

态度原创

教育
数码
房产
亲子
公开课

教育要闻

拯救躺平的孩子有个最简单办法:把他当“狗”养!

数码要闻

国补3299元起 Xiaomi Pad 9 Pro发布:12.5英寸高分高刷护眼屏

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

亲子要闻

离职举报“炒菜锅洗拖把”,良心老师不该没有前程 |新京报快评

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版