网易首页 > 网易号 > 正文 申请入驻

全球最大,谷歌Figure排队买!这个团队,撑起硅谷最火机器人

0
分享至


新智元报道


藏不住了,这次是彻底藏不住了!

Google DeepMind、Figure、1X、Genesis AI、Dyna Robotics……

硅谷这一轮最火的机器人玩家,背后竟站着同一家数据「供血商」


Dyna-2跑出100万小时的Scaling Law,背后有它。

GENE-26.5一口气完成一顿20步的饭,用到的第一人称数据,也来自这里。

能拿下这些头部客户,光会「数据采集」显然不够。

这家神秘公司手里,还有另一张更硬核的王牌——强大的数据处理与算法能力。

那些行业中最难啃的corner cases,手被挡住、戴着透明手套、动作快到发虚的画面,到了他们的手里,依然能一帧一帧重新提取成模型可学的材料。

也正因为采集、处理、算法、交付整条链路全部打通,它才能沉淀出150万小时高质量数据存量,并在全球累计完成200万小时级别的数据交付


快速移动+多手入镜,依旧可以稳定识别

能做到这个量级,基本上已经算是头部机器人公司背后的数据基础设施了。

如今,这家神秘公司终于揭晓了——它,就是Maxinsights!

一家扎根硅谷的Physical AI团队,头部客户几乎都在美国,今年3月才悄悄回到国内开展业务。

它要做的,是把真实世界的人类经验,规模化变成Physical AI的训练燃料。

人类日常视频

成为Physical AI恶补的大课

那么问题来了,一家做数据的公司,为什么要训自己的模型?又为什么要把模型做到如此高精?

答案,要从Physical AI走进现实世界的那道门槛说起。

让Physical AI解释怎么叠衣服,和让它真的把衣服叠好,中间隔着大量细节。

手应该抓在哪里?衣角被压住了怎么办?布料滑动之后,下一步动作该怎么调整?

这些经验,很少被完整写进文字。人类却每天都在使用它们。

大语言模型能跑通Scaling Law,是因为互联网早就替它攒好了文本;视觉模型也继承了几十亿张现成的图片。

机器人从来没有这样的条件。互联网上有几十亿小时的视频,却几乎没有一段是从「手的视角」记录人怎么干活的。

而第一人称数据,也叫Egocentric Data或Ego数据,提供了一种记录方式——

从操作者的视角,拍下双手如何与物体交互,以及动作发生前后,环境出现了什么变化。

它让学习材料,更贴近任务本身。

过去教机器人干活,主流做法是遥操作。也就是,一个人戴着设备远程控制机器人抓杯子、叠毛巾,机器人把每一次动作记下来。

这种数据质量高,但贵、慢,一台机器人一天也就产出几小时,而且数据和特定的机器人本体绑死,换一台机器就得重采。

第一人称数据的价值,就在这里。

采集设备跟随操作者,记录他看到的场景,以及双手与物体的交互过程。

人在厨房、工作台和生活空间里积累的操作经验,由此有了进入训练系统的机会。

然而,拍下来,只是第一步。

视频不等于训练数据

以人类在厨房拧瓶盖的视频举例,人看一眼,就知道发生了什么。

进入训练流程后,却需要进一步拆解——

哪只手握住瓶身,哪只手开始旋转,动作从哪一帧开始、在哪一帧结束,手腕在空间中如何移动。

如果两只手交叉,手指被瓶身挡住,或者动作太快带来模糊,判断就会变难。

一句「正在拧瓶盖」的标签,解释不了这些细节。

机器人要的是带着结构的数据,而非一段影像。

Maxinsights的算法到底强在哪里?团队介绍的一段演示,把三层能力放到了同一条数据里。

这张王牌算法,解决了什么

先来看人,手被挡住了,动作还能不能追得上?

人在真实环境中干活,上半身一直在动,双手还会交叉、被物体遮挡。追踪系统要从不断变化的画面里,尽可能准确地还原身体与手部姿态。

但视频的演示中,即便在这样的情况下,算法追踪仍能保持较高准确性。

这背后,自研MaxEgo所承担的手部与姿态信息提取,正是这套处理能力的重要组成部分。


遮挡的手部追踪依然稳定

难就难在,真实操作不会为了方便算法,始终把双手摆在镜头前。

抓取时手指被物体挡住,转身时视角发生变化,这些片段都包含有价值的动作信息。追踪越可靠,后续训练就越有机会保留这些细节。

再来看空间,人出门走了一圈,系统还能不能对回原点

这里考验的是SLAM,也就是一边确定自身位置,一边建立周围环境的地图。

拍摄者不断移动时,定位误差可能逐渐累积。人明明回到了出发点,系统记录的轨迹却未必能对得上。


这段演示里,从出门到绕一圈回来,轨迹能够较好地闭合,与起点重新对齐。

由此一来,这让手部动作有了更完整的空间背景——

手怎样运动、人在什么位置,以及周围环境的几何关系,可以被放在一起理解。

这背后全靠团队打底的硬功夫。

Maxinsights的核心工程班底集结了Waymo、谷歌、Meta、QCraft等等顶尖企业,以及斯坦福、伯克利前沿实验室的资深人才,大多深耕自动驾驶多年。

作为一个由海量数据驱动的行业,团队早已具备了管理与迭代百万级车端数据的成熟实战经验。

如今转向机器人,底层的工程方法与数据链路依旧纯熟。

最后再来看动作,轨迹追到了,还要讲清楚人在做什么。

在演示中,语言标注由自研视频理解与标注模型生成,能够较准确地对应实际操作。

在Maxinsights的数据体系里,这些信息会按照环境、任务、子任务、动作指令分层组织。

比如,一段酒店房间里的操作,可以拆成:

酒店房间 → 打扫房间 → 摆放水壶 → 双手把水壶放到桌上。

这就把运动轨迹与任务含义联系起来:模型既能获得身体和双手如何运动的信息,也能知道这些动作是在完成什么目标。

身体怎么动、在空间里怎么走、正在做什么,三层信息合在一起,一段日常视频才有了更完整的学习价值。

数据处理得越深入,原始画面中可供模型学习的信息就越丰富。

根据内部版本的评测,从MaxEgo 0.5到1.0,相关难例上的关键误差指标下降超过一半。

支撑算法迭代的,是20亿余帧人体姿态数据,以及人工校正和高精度参考数据构成的验证体系。

这也解释了,为什么数据积累和算法能力会相互促进。

在姿态追踪、空间定位与动作理解之外,还有更深的物理信息可挖。

按Maxinsights的排序,往上还有身体与环境几何、物体位姿,以及最难测、也最值钱的接触信息。

因此,在Maxinsights的流程里,采集之后还连接着质量检查、格式统一、视频理解、空间处理、姿态追踪和人工校正,交付前再进行检查与格式转换。

两个模型加上四阶段自动化QA,把98%的质检覆盖交给机器完成,人只处理机器拿不准的那部分。

而人纠正过的样本,又回流成下一版模型的训练数据。

这是一个越做越顺的飞轮:交付得越多,模型越准,标注越便宜。

5000个人的手艺,第一次被「电子化」

技术之外,Maxinsights更难复制的是另一件事——

怎么让全球5000+名采集员,持续、不重样地拍出真实生活。

Maxinsights在多个国家铺了直管的现场团队加社区网络,覆盖2000+采集环境、50000+场景,月采集产能45万小时。

运营靠一个Agent平台调度:

  • 它会盯着数据分布,发现「餐厅后厨够多了、修车间不够」,就把设备和人往缺口调;

  • 它会识别无效片段、摆拍片段、佩戴偏移;

  • 它还会让场景每两周轮换一次,避免同一个厨房被拍到模型厌倦。

采集员是谁?

很多是家庭主妇,餐馆厨师,车间工人,农场采摘不同水果的农民,维修各种汽车的工程师,照顾老人的陪护等等......



一位主妇几十年切菜、择菜、拧瓶盖的手感,过去只存在于她自己的肌肉记忆里。

现在,她戴着相机做一顿饭,这些动作被拆成手部轨迹、动作时序和语义标签,成了机器人学做家务的第一课。

这大概是普通人第一次,能把「手艺」直接卖给Physical AI。

对模型公司来说,这也是最不可替代的一部分——

真实生活里的凌乱、失误和临场调整,实验室里怎么演都演不出来。

百万小时,进入模型训练

今年夏天最火的两个机器人,便是由Maxinsights的数据「喂」大的。

8月10日,Dyna Robotics发布Dyna-2,拿100万小时人类第一人称视频做预训练。

这相当于一个人睁着眼睛过了170年。

从1000小时到100万小时,模型性能跨越四个数量级持续单调提升,暂时看不到天花板。而且用更多人类数据预训练的模型,在从未见过的机器人数据上表现同样更好。



这100万小时,最大的供应商就是Maxinsights。

再往前5月,Genesis AI发布GENE-26.5,机器人两只手做完一顿20步的饭:切菜、打蛋、倒果昔,中间不用人接手。

GENE-26.5的第一人称数据合作伙伴,还是Maxinsights。


Genesis把第一人称视频和带传感器的手套数据叠在一起用,结果是许多高难度技能只靠不到一小时的机器人专属数据,就能达到自主执行。

硅谷这一轮出圈的两个具身智能模型,背后都有这家美国公司的数据支持。

对Maxinsights而言,美国头部客户一直是业务重心。从样本评估到大批量交付,它积累的,是与当地前沿团队持续配合、跟着训练需求一起扩量的经验。

Maxinsights的「家底」同样硬核——

2024年起步,从机器人遥操作数据采集切入,跟着湾区头部基础模型和机器人团队一路做到今天。累计交付超200万小时第一人称数据,仓库里压着150万小时以上带手部追踪和语言标注。

每月采集能力45万小时,Dyna-2那100万小时的训练量,两个多月就能采一遍。

好像大家满世界寻找的海量精品 EGO 数据,绕了一圈才发现——原来就在Maxinsights手里。


Scaling Law涌现之后

Dyna-2证明了一件事,机器人领域的Scaling Law存在,而且到100万小时还没看到天花板。

游戏规则从此变了。

具身智能的下半场竞争会变得很朴素:谁能持续、稳定、便宜地把真实世界喂进模型,谁就跑得快。

去年,特斯拉让Optimus团队的采集员戴上头盔、背上背包,五个摄像头对着自己的手,一遍遍叠衬衫。

8月下旬,Figure上线了众包平台Index,普通人打开App自己开抽屉、叠衣服就能拿钱。


之所以连特斯拉和Figure都要自己下场拍,是因为这个世界从来没有为机器人准备过一份「人类动作的互联网」。

Physical AI的互联网,得从零开始制造。

而Maxinsights,是目前少数几家在真正动手建造它的公司之一。

「制造」这个词,并不夸张。人需要真正执行任务,传感器需要持续采集,采完之后数据还要经过同步、验证、标注和质检,最后才变成训练系统能直接消费的形式。

Maxinsights把这件事概括成一句话:Physical AI的Scaling Law,同时也是一条Manufacturing Law。


整条管线是一串关口,良率是乘出来的。四道关口各95%,端到端只剩81%;各提到99%,就是96%。到1000万小时的规模,这15个点决定的是顺利交付还是大规模返工。

这也是Maxinsights把硬件、模型、真值体系、全球运营和交付管线放在一起的原因。它的定位是,成为Physical AI的数据与学习基础设施。

交付之外,Maxinsights还看到了下一道考题。

过了100万小时,规模依然重要,但更重要的是每新增一个小时,有没有为模型带来新的物理经验。

他把这叫Experience Density:同样一小时,固定桌面上反复抓取放置,和双手协同、物体状态不断变化、带工具使用的一小时,学习价值天差地别。在1万小时的规模上这只是噪声,到1000万小时,它就是预算本身。

数据规模上去之后,第1000万个小时和已有数据的相似度,会远高于当年第1万个小时。不主动设计,规模就只是重复。

这也是Maxinsights那个Agent平台盯着数据分布往缺口调人的原因。

所以这套体系最终要回答的问题有两个:客户扩大训练需求时,数据能不能跟上;跟上的每一小时,是不是模型没见过的世界。

150万小时,对Maxinsights来说是一个起点。

第一个100万小时,回答的是Scale是否有效。接下来的1000万小时,要回答的是一个小时究竟值多少。

拍下世界只是起点,把它持续变成模型学得会的材料,才是这场工程赛跑的硬功夫。

编辑:桃子 摩西

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
前线传来重磅消息!俄军击毙日本、美国、德国雇佣军,杀疯了

前线传来重磅消息!俄军击毙日本、美国、德国雇佣军,杀疯了

果妈聊娱乐
2026-09-10 10:18:30
美联储9月加息概率为71.3%

美联储9月加息概率为71.3%

财联社
2026-09-11 06:50:04
德国将150名俄罗斯外交官及其家属驱逐出境,俄罗斯外交官表达强烈愤怒

德国将150名俄罗斯外交官及其家属驱逐出境,俄罗斯外交官表达强烈愤怒

山河路口
2026-09-11 13:35:15
摩托罗拉官宣新折叠屏,直指iPhone Duo

摩托罗拉官宣新折叠屏,直指iPhone Duo

Ping值焦虑
2026-09-10 23:11:18
脸都不要了!湖南洞口孩子买了50元学平险,结果真得癌了,谁料保险公司翻出国际疾病分类,说编码不对,不符合“恶性肿瘤-重度”条款

脸都不要了!湖南洞口孩子买了50元学平险,结果真得癌了,谁料保险公司翻出国际疾病分类,说编码不对,不符合“恶性肿瘤-重度”条款

火山詩话
2026-09-10 10:40:36
魏德尔这番夸奖之后,估计很长一段时间内,德国议会里都没人敢批评中国了

魏德尔这番夸奖之后,估计很长一段时间内,德国议会里都没人敢批评中国了

怪味历史连连看
2026-09-11 10:35:23
杭州地方国企疯狂财务造假,多项业务纯属虚构,时任董事长已被查办

杭州地方国企疯狂财务造假,多项业务纯属虚构,时任董事长已被查办

大风新闻
2026-09-11 09:20:02
刚刚!葫芦娃爷爷又把7个葫芦挂回去了!网友泪奔:葫芦娃打怪回家了!

刚刚!葫芦娃爷爷又把7个葫芦挂回去了!网友泪奔:葫芦娃打怪回家了!

我爱大绍兴
2026-09-11 14:32:27
对不起刘翔,对不起很多人……

对不起刘翔,对不起很多人……

红色少女主播
2026-09-11 00:58:18
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
别用“尽力局”骗自己了,女篮世界杯惨败法国无缘半决赛,撕开的是更难看的东西

别用“尽力局”骗自己了,女篮世界杯惨败法国无缘半决赛,撕开的是更难看的东西

子非鱼人
2026-09-10 23:25:42
离婚4年后,黄晓明首谈失败婚姻,结婚时不成熟做了错误的评估

离婚4年后,黄晓明首谈失败婚姻,结婚时不成熟做了错误的评估

椰黄娱乐
2026-09-11 10:58:22
黄金坑出现 反攻号角吹响

黄金坑出现 反攻号角吹响

趋势巡航
2026-09-11 14:51:25
妻子证实雷宇扬因胃癌去世,终年62岁,晚年低调定居广州

妻子证实雷宇扬因胃癌去世,终年62岁,晚年低调定居广州

扒虾侃娱
2026-09-11 15:52:08
视频丨外国游客说来就来、中国制造越走越远 服务出口成外贸增长新引擎

视频丨外国游客说来就来、中国制造越走越远 服务出口成外贸增长新引擎

国际在线
2026-09-11 01:45:06
1949年李讷在课堂上指出老师错误,老师恼羞成怒:把你爸爸叫来

1949年李讷在课堂上指出老师错误,老师恼羞成怒:把你爸爸叫来

萧竹轻语
2025-08-04 11:45:40
反转来了!助学事件迎来大反转!被资助女生发声称“说曝光资助人是情急失言”,资助人删帖并送去1500元资助费,但帮扶方式已彻底改变

反转来了!助学事件迎来大反转!被资助女生发声称“说曝光资助人是情急失言”,资助人删帖并送去1500元资助费,但帮扶方式已彻底改变

行者聊官
2026-09-10 09:14:31
越南敲定北南高铁项目启动时间

越南敲定北南高铁项目启动时间

财联社
2026-09-11 07:01:03
新版世界地图将争议岛屿标为俄罗斯同色,日本要求修正

新版世界地图将争议岛屿标为俄罗斯同色,日本要求修正

澎湃新闻
2026-09-11 09:30:26
iPhone 18 Pro Max现场真机上手:槽点不吐不快

iPhone 18 Pro Max现场真机上手:槽点不吐不快

搞机小帝
2026-09-11 01:11:03
2026-09-11 17:04:50
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16161文章数 67057关注度
往期回顾 全部

科技要闻

罗永浩连用7个“抄的”吐槽苹果折叠屏

头条要闻

"男子称停资助遭受助学生质问"疑反转 民政局查无此人

头条要闻

"男子称停资助遭受助学生质问"疑反转 民政局查无此人

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

千叶珠宝创始人夫妇失联 股价应声"腰斩"

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

游戏
艺术
数码
教育
公开课

首届日本恐怖游戏大奖揭晓 《寂静岭f》强势登顶

艺术要闻

梅尔尼科夫:全山石、苏高礼、林岗等的老师

数码要闻

友通推工业ITX主板ARH171/ARH173,支持"MTL" "ARL"处理器

教育要闻

为什么越在意孩子感受,孩子越脆弱

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版