网易首页 > 网易号 > 正文 申请入驻

OpenAI百亿投入砸向具身,机器人竞争进入数据与算力时代

0
分享至

近日,一份发表在 GitHub 上匿名的仿真测评报告,在具身智能圈投下了一枚深水炸弹:混合 GPT-6 Astra 的架构 62.6 分,第二名仅 38.26 分。

64% 的性能差距,这种差距说明已经不是微调优化了,可以说是架构层面的降维打击。

这项研究没有用 GPT-6 Astra 直接操控机械臂,它做了一件更聪明的事:用 GPT-6 Astra 提供语义层面的判断与修正,与 π₀.₅ 的物理空间交互及动作先验形成互补架构。

银河通用团队对 Astra 模型的深度评测揭示了其在 System 2 通用性上取得重要突破。虽然轨迹质量和实时性不高,但可以零样本在各种形态机器人上高成功率完成各类新任务,并有很强的错误恢复能力。

看起来,具身智能已经离我们不再遥远,在数万亿级的模型参数体量下,机器人的通用性已经取得了类似 ChatGPT 程度的水平飞跃。

这份测评是怎么做的?

该报告的撰写者来自银河通用团队的研究员,第一作者是银河通用创始人兼 CTO 王鹤教授的博士生。整个测评是一套严格对齐的闭环控制对比实验。

研究用两种用于仿真双臂操作的闭环控制架构进行了分析:

Direct 模式:不跑π0.5,GPT-6 Astra 直接看三路相机画面和机器人状态,输出双臂末端位姿和夹爪开合,每次执行 1 到 5 个控制步。

混合模式:每个决策时刻,π0.5先生成 50步候选动作。GPT-6 Astra 看同一份画面、执行历史,还有候选动作对应的双臂轨迹,然后二选一:要么沿用π0.5的前 1 到 15 步,要么自己出 1 到 5 步末端位姿修正。走完这一段,再看新画面,重新决定。

这个架构其实非常简单。一作在报告里也提到,这种“候选动作挑选”的 TopK 思路,在业内交流中已经被多次讨论过。但真正把它跑出量级差异的,这是第一次。

结果显示混合模式拿下 48% 成功率和 62.60 平均分,平均分甚至大幅超出第二名 64%。



01

RoboDojo:混合 GPT-6 Astra 后大幅提升成功率

首先是 RoboDojo 实验。

团队选取了 10 类复杂机器人操作任务,包括整理桌面、根据语言分类物体、排序数字、装箱、搭塔、麻将杠牌、叠衣服和瓶子入桶等,每个任务进行 5 次测试,共 50 次。

实验设置了两种方案。

一种是GPT-6 Astra Direct,由 Astra 直接根据视觉、本体状态和任务目标生成机器人动作;另一种是π0.5+Astra,由机器人 VLA 模型 π0.5 提供动作,Astra 观察环境和候选动作,并在必要时进行修正。

结果差异明显。

Astra Direct 在 50 次任务中成功 13 次,成功率为26%,48 个具有完整原生评分的任务平均得分为

接入 π0.5 后,成功次数提高到 24 次,成功率达到48%,平均得分升至。更值得注意的是,Astra 只修改了全部执行控制步骤中的14.4%

也就是说,大部分动作仍由 π0.5 完成,Astra 主要在关键节点负责理解任务、判断当前状态,以及决定是否需要修正。

这组实验首先说明,两类模型具有明显的互补性。

Astra 最擅长的是语义理解、视觉识别、空间关系判断和任务规划。在“物体分类”等任务中,Astra Direct 甚至取得 100 分;面对抓取失败、物体遗漏或环境发生变化,它还能够重新观察现场,再决定下一步行动。

但到了搭塔、麻将杠牌等需要精细接触、稳定抓取和连续控制的任务,大模型的短板迅速暴露。

Astra Direct 在搭塔任务中平均只有12 分,麻将杠牌为0 分。模型可以知道木块应该放在哪里,却未必能够稳定控制落点、摩擦和碰撞。

加入 π0.5 之后,搭塔从 12 分提高到 64 分,麻将杠牌从 0 提高到 40,叠衣服和瓶子入桶等任务也明显改善。

这是报告最重要的一层信息:大模型已经能够进入机器人策略层,但对物理世界的理解和对物理世界的操作,仍然是两种不同的能力。



02

RoboLab:在带语义理解任务上能力进一步验证

RoboLab 实验进一步展示了 Astra 在另一类任务上的优势,考察通用机器人策略对视觉、物体关系、任务指令和空间结构的理解。团队从中选取 10 类任务,每类进行 5 次评测,共 50 次,包括将方块放入容器、在杂物中寻找并移动南瓜、按照指定顺序堆叠积木、调整杯子朝向,以及把不同物体放入指定位置等。

结果非常突出。

GPT-6 Astra Direct 在 50 次实验中成功 49 次,成功率 98%;Astra+π0.5 完成 46 次,成功率 92%。作为参考,同一组统计中的 π0.5 完成 18 次,Cosmos3-Nano-Policy 完成 18 次,DreamZero 完成 17 次。



尤其值得注意的是,Astra 没有针对这些具体任务额外训练。模型根据当前画面、机器人状态和自然语言任务描述,持续判断下一步应该如何操作。

从逐任务结果看,Astra 在多个任务中实现 5 次全部成功,包括方块入箱、杂物中处理南瓜、按照关系摆放物体、按指定顺序堆叠、重新调整杯子方向等。唯一没有全部成功的是“大号葡萄干盒放入容器”,5 次完成 4 次。

这组实验展示出的核心能力,是零样本泛化。模型能够识别目标、理解空间关系,将语言要求转化为动作,并在环境变化后继续调整策略。

不过,这一数字需要结合实验口径理解。报告明确说明,RoboLab 实验只选取了 10 个任务、每种方法每个任务 5 个最终评测槽位,并非完整 RoboLab 排行榜复现;历史基线与 Astra 也没有严格保证完全相同的初始状态和控制配置,部分 Astra 实验包含授权重试。

因此,98% 更适合用来观察 Astra 在这些任务上的能力上限,不能简单作为严格同条件排行榜成绩。

03

GPT-6 Astra 强在理解任务和发现“哪里不对”

回到 RoboDojo 的逐任务结果,还能进一步看清它究竟强在哪里。

在“物体分类”任务中,Astra Direct 得到 100 分,5 次全部成功;“按语言分类”平均得分达到 60,成功率 40%;“排出最大数字”得分 57。



Score 热力表成功率热力表。

这些任务高度依赖语言理解、视觉识别、关系推理和目标规划,恰好是大模型擅长的能力。

实验中还出现了大量传统机器人策略较少展示的行为。

例如模型发现一次抓取姿态不理想后,会主动改变接近方式;物体大致摆好后,它会重新观察环境,发现任务实际上尚未完成,并继续调整;在装箱过程中,它能够发现箱子后面还有遗漏物体;当原计划执行受阻时,也会根据新的视觉反馈重新规划。



图:实验中,Astra 会根据执行后的新画面继续判断任务状态,并在必要时调整动作。例如在物体分类任务中,模型发现当前抓取需要局部修正;在装箱等长程任务中,模型会持续检查场景中的剩余目标,再决定后续动作。

数字摆放任务中也出现了很精彩的恢复:模型在运动受阻后重新理解机械臂的控制反馈,调整动作并继续执行。它展示了 GPT-6 Astra 对控制约束的局部适应能力,而不只是被动地重复失败命令。



图:数字摆放:理解控制反馈后的精彩恢复

这些现象说明,Astra 并非机械执行一条预先生成的轨迹,而是在形成一个“观察—决策—执行—重新观察”的闭环。

模型甚至会主动选择一些训练数据中未必常见的策略。例如在“瓶子入桶”任务中,Astra Direct 曾尝试不逐个抓取瓶子,而是将瓶子扫向垃圾桶。这个方案最终失败,但展示了模型能够根据目标自行寻找新的解决路径。

04

真正的瓶颈仍然在物理交互

但是,研究报告也揭示了 Astra 的弱点。

在“搭塔”任务中,Astra Direct 平均得分只有 12,成功率为 0;“麻将杠牌”得分为 0;这些任务要求精确接触、稳定抓取、碰撞控制以及对物体受力状态的持续判断。相比语义和视觉任务,大模型在这里明显吃力。

一个典型问题是,理解目标并不等于能够稳定完成动作。

模型可能知道木块应该放在哪里,却无法保证放下时塔不会倒;知道物体应该进入容器,也可能因为夹爪与容器边缘发生碰撞导致失败。当前控制采用分段执行,模型通常需要等一个动作段结束后才能重新观察,因此动作执行过程中发生的滑落、碰撞等问题,有时直到下一轮反馈才被发现。

这也是 π0.5 产生价值的地方。

加入 π0.5 后,“搭塔”得分从 12 提高到 64,成功率达到 60%;“麻将杠牌”从 0 提高到 40;“叠衣服”从 40 提高到 100;“瓶子入桶”也从 36 提高到 100。

π0.5 提供机器人动作数据训练形成的运动先验,Astra 则在更高层负责识别任务、判断进展和修正错误。两者结合后,一些单独依赖 Astra 难以完成的任务明显改善。

研究还分析了一些在 GPT-6 Astra 模式下出现的有趣但不一定鲁棒或物理不可实现的情况。由于缺少具身 Policy 提供的成熟动作与物体交互先验,模型需要自行解决抓取、支撑、接触、释放及双臂协调中的细节,一些看似合理且有趣的方案在实际执行时并不稳定。

Zero-shot 行为:有趣的方案,不一定鲁棒的动作

GPT-6 Astra(direct)会尝试用机械臂把瓶子扫进桶、单手抓取搭塔板,或以单臂完成原本适合双臂协作的操作。这些都是对同一目标的不同实现方式,而非单纯的任务理解错误。

问题在于:提出一种可能有效的操作,与稳定地执行该操作,是两个不同层次的能力。缺少成熟动作先验的支撑时,方案可能忽略可靠的抓取姿态、足够的支撑或适当的释放时机,使局部可行的动作难以转化为稳定的任务完成。具身 Policy 的价值不只在于提供一个动作答案,还在于提供经过交互经验形成的执行模式,让语义层面的方案建立在更可靠的操作基础上。



图:零样本方案:尝试用机械臂把瓶子扫入桶中

05

能力提升的代价仍然很高

报告同时强调,当前方案距离真正部署仍有明显距离。

首先是推理成本。RoboDojo 实验中,π0.5+Astra 累计消耗约6.25 亿 Token,Astra Direct 则超过11.3 亿 Token。Astra 需要反复读取视觉和历史上下文,并进行较长推理,这与机器人需要的低延迟、高频控制存在天然矛盾。

其次,当前实验主要发生在仿真环境中。真实世界还会增加相机噪声、机械误差、延迟、摩擦力变化以及安全约束。

因此,这份报告更接近一次能力边界测试:在暂时不严格限制 Token、时间和推理成本的条件下,大模型究竟能把机器人控制推进到什么程度。

06

大模型正在进入机器人策略层,但机器人模型仍然不可替代

从这份报告最终来看,可以得到两个关键结论。

第一,大规模训练带来的泛化能力,正在具身任务中展现出明显优势。

GPT-6 Astra 在语义理解、视觉感知和任务规划等“认知层”任务上,大幅抬高了端到端具身模型的能力上限。RoboLab 中,Astra 直接控制机器人取得 49/50 的结果,说明通用模型通过大规模预训练获得的能力,已经能够迁移到机器人决策环节。

这也验证了王鹤教授此前的判断:随着数据规模扩大,模型能够获得更强的语义理解和视觉泛化能力。过去在语言和视觉模型中被反复验证的Scaling Law,正在向具身智能延伸。

第二,认知泛化能力再强,也无法自动解决物理世界中的精细操作问题。

在搭塔、麻将杠牌等高度依赖接触稳定性和精细控制的任务中,Astra Direct 的得分只有 12 和 0。模型可以理解目标,却未必能稳定处理摩擦、碰撞、夹爪状态和连续接触。

π0.5 的价值正在这里体现。加入 π0.5 后,搭塔得分从 12 提高到 64,杠牌从 0 提高到 40,叠衣服、瓶子入桶等任务也明显改善。机器人交互数据训练出的动作先验,仍然是大模型无法直接替代的能力。

但 π0.5 自身也受到数据规模和任务覆盖范围的限制。在 RoboLab 中,π0.5 单独 zero-shot 成功率只有 36%;与 Astra 组合后达到 92%,仍低于 Astra Direct 的 98%。这说明,动作模型如果缺乏足够的泛化能力,也可能成为整个系统的约束。

GPT-6 Astra+π0.5 未必是最终形态,但这份报告已经让一条路径变得更清楚:通用模型扩大认知和泛化边界,具身模型补足动作与物理交互能力。

无论是语义泛化还是物理交互,其能力根源都是数据。数据规模越大、质量越高,模型的能力边界就越宽。随着数据与算力的进一步放大,我们或许才能真正期待具身智能价值的释放。

07

中国具身智能,急需继续放大数据和算力

GPT-6 Astra 带来的压力,让国内具身产业面临一个更现实的问题:OpenAI 已购买上千万小时类具身数据,在具身模型上投入超百亿人民币的数据与算力资源,超过中国任何一家具身公司,剑指“具身 ChatGPT”。

压力之下,中国必须扩大数据和算力投入。GPT-6 Astra 成功率虽高,但轨迹质量一般,软硬件不一体,模型太大、部署几乎不可能、成本极高。这说明它的路线也还不完美。但现有的能力已经验证了:大规模数据+大规模算力,正在攻入机器人技术腹地。

中国制造业、物流、零售等领域拥有大量机器人应用环境,也具备完整的硬件供应链。但场景不等于优势。只有把现场问题变成数据,把数据送进训练,再把模型放回真实环境验证,形成闭环,场景才能变成模型能力。这个闭环的燃料,就是数据和算力。

中国很难复制前沿模型公司的每一轮资源投入,但拥有更密集的真实应用场景和完整产业链。接下来真正决定竞争结果的,是能否把这些场景持续转化成高质量数据,再把数据转化成模型能力。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
4999元,小米把咖啡机做成了2200W的智能终端

4999元,小米把咖啡机做成了2200W的智能终端

算力游侠
2026-09-15 11:03:19
大陆还没发话,岛内先开价!热议两岸和平统一,张口甩出六大条件

大陆还没发话,岛内先开价!热议两岸和平统一,张口甩出六大条件

寻墨阁
2026-09-16 13:51:42
Claude独立破译370年前密文!仅44分钟,密码学家破防了

Claude独立破译370年前密文!仅44分钟,密码学家破防了

新智元
2026-09-15 13:11:38
阿根廷之所以大老远把牛肉便宜卖到中国,是因为中国什么部位都要

阿根廷之所以大老远把牛肉便宜卖到中国,是因为中国什么部位都要

流苏晚晴
2026-09-15 12:17:39
“4岁男童被指摸臀”事件背后,一场被放大的公共冲突

“4岁男童被指摸臀”事件背后,一场被放大的公共冲突

新京报
2026-09-16 08:43:23
最后一舞!梅西入选阿根廷国家队大名单,10月6日迎盛大告别赛

最后一舞!梅西入选阿根廷国家队大名单,10月6日迎盛大告别赛

全景体育V
2026-09-16 06:41:19
正面硬刚!野人先生惨遭罗永浩“炮轰”,店员神回复笑翻网友

正面硬刚!野人先生惨遭罗永浩“炮轰”,店员神回复笑翻网友

雷科技
2026-09-16 18:04:53
9月14日,赵本山引发关注!不是因为他本人,而是他的徒弟小沈龙,被曝骗了榜一大姐200万

9月14日,赵本山引发关注!不是因为他本人,而是他的徒弟小沈龙,被曝骗了榜一大姐200万

火山詩话
2026-09-15 05:08:28
亚运男篮四强定3席!中国男篮“死里逃生”,廖三宁30分本场之星

亚运男篮四强定3席!中国男篮“死里逃生”,廖三宁30分本场之星

乒烧泳球
2026-09-16 16:56:19
最扎心的不是失业,是社保年限从15年涨到20年

最扎心的不是失业,是社保年限从15年涨到20年

细说职场
2026-09-16 16:15:54
打脸特朗普!乌克兰摧毁锡兹兰炼油厂,导弹袭击别里耶夫飞机厂

打脸特朗普!乌克兰摧毁锡兹兰炼油厂,导弹袭击别里耶夫飞机厂

项鹏飞
2026-09-15 21:17:26
武大杨景媛被爆在西班牙读研,有网友向学校反映情况,当地学生回应会跟进确认

武大杨景媛被爆在西班牙读研,有网友向学校反映情况,当地学生回应会跟进确认

Mr王的饭后茶
2026-09-15 22:28:40
重磅!拉塞尔,CBA!

重磅!拉塞尔,CBA!

技巧君侃球
2026-09-16 14:18:43
穆帅:2-0换人时已经觉得比赛要失控;最后换人是孤注一掷

穆帅:2-0换人时已经觉得比赛要失控;最后换人是孤注一掷

懂球帝
2026-09-16 07:20:07
东风导弹打响全球首战!沙特突然动用东风-15,证明战机不够用了

东风导弹打响全球首战!沙特突然动用东风-15,证明战机不够用了

爱吃醋的猫咪
2026-09-15 21:48:15
DeepSeek工程师长文爆火出圈,本人回应:并非表达失业焦虑

DeepSeek工程师长文爆火出圈,本人回应:并非表达失业焦虑

界面新闻
2026-09-16 10:32:14
CCTV5直播中朝大战!官方442阵型?纯属烟雾弹!毛伟杰又被安排到中场了

CCTV5直播中朝大战!官方442阵型?纯属烟雾弹!毛伟杰又被安排到中场了

刀锋体育
2026-09-16 17:49:54
有人说,新中国“谋事在毛,成事在周”,从历史事实看果真如此吗?

有人说,新中国“谋事在毛,成事在周”,从历史事实看果真如此吗?

大运河时空
2026-09-15 17:55:03
胡塞武装:击落一架F-15

胡塞武装:击落一架F-15

鲁中晨报
2026-09-16 16:03:03
京沪高速天津段发生车祸,一辆厢式货车与小轿车相撞,货车侧翻后燃起大火,小轿车右侧车门被撞掉,“明火已扑灭,事故具体原因还在调查”

京沪高速天津段发生车祸,一辆厢式货车与小轿车相撞,货车侧翻后燃起大火,小轿车右侧车门被撞掉,“明火已扑灭,事故具体原因还在调查”

台州交通广播
2026-09-16 14:20:47
2026-09-16 18:31:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14007文章数 142733关注度
往期回顾 全部

科技要闻

赛力斯接管问界,撑得住华为给的身价吗?

头条要闻

钱货两清2年后已到账的58万元突然成赌资 被法院划扣

头条要闻

钱货两清2年后已到账的58万元突然成赌资 被法院划扣

体育要闻

对话西甲联盟高管:西班牙足球到底强在哪?

娱乐要闻

乔任梁去世十周年,陈乔恩悼念

财经要闻

中际旭创六家供应商股东疑现关联人

汽车要闻

方向盘踏板全取消 特斯拉Cybercab国内亮相实拍

态度原创

手机
健康
艺术
本地
公开课

手机要闻

小米 18 Pro 真机来了!边框拉满,镜头不再凸起,3.2X长焦大亮眼

亲属查出脑动脉瘤?你也尽快筛查!

艺术要闻

广州最长时间的烂尾楼!160多栋像鬼城,当年抢着买,如今没人管?

本地新闻

不止胖东来!许昌藏着半部三国史

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版