网易首页 > 网易号 > 正文 申请入驻

8.86秒!百米跑再破纪录,却端不好一杯水?

0
分享至

近日,在北京举行的第二届世界人形机器人运动会上,机器人400米赛跑成绩已提升至38.15秒,比人类男子400米世界纪录快了近5秒;跳高纪录更是达到2.88米,把人类保持的2.45米世界纪录远远甩在身后。

8月25日,继开幕式上跑出的9.39秒,来自北京人形机器人创新中心的天工机器人,跑出了8.86秒的最好成绩,再次刷新纪录。比“飞人”博尔特保持的人类男子百米世界纪录9.58秒快0.72秒。

场馆里的欢呼声还没落下,隔壁的灵巧手专项赛现场却透着肉眼可见的吃力:参赛机器人要在5分钟限时内完成积木搭建、镊子夹豆、粉末称量等“指尖微操”,可组委会委员巩潇坦言,预赛中不少机器人一旦遇到物体材质、软硬度或摆放角度的细微变化,自主决策仍然可能出现偏差,这种面对真实物理世界的不确定性,恰是目前技术攻关的核心难点。能破人类纪录的“钢铁飞人”,到了指尖却未必稳得过学龄前儿童。这种“体格”与“大脑”的严重错位,正是当下人形机器人行业最尴尬的缩影。

8月20日,宇树科技创始人王兴兴给出了行业公认的临界点:当人形机器人在80%陌生场景中能通过语音指令自主完成80%的日常任务,才算迎来属于这个赛道的“ChatGPT时刻”。话音刚落,宇树科技作为人形机器人第一股上市次日收跌18.70%,单日市值蒸发超600亿元——资本市场用脚投票的冷峻,与产业界对下一个十年的乐观,在同一天形成了微妙对峙。

此刻,卡住所有玩家的,恰恰是最核心的“大脑”之困。



8月23日,第二届世界人形机器人运动会的400米预赛现场。图/IC

Demo背后的困境

今年5月,美国机器人公司Figure曾经连续直播19个小时以上,机器人在流水线上分拣超过23.8万件包裹。不过直播过程也出现不少意外情况,比如机器人不能捡起意外滚落的包裹;再比如机器人突然停止工作,连续十多秒双手抬起做骑车状。有人甚至质疑,机器人仍由人操作,人换班时机器人就会“罢工”。

国内亦有人形机器人做类似的“干活Demo(展示)”。6月底,智元机器人在龙旗科技的平板质检流水线上进行6天直播作业。近期的世界机器人大会(WRC)现场,能看到各类Demo,从分拣到理货,不一而足。

一位负责人形机器人后训练的工程师告诉《中国新闻周刊》,一些人形机器人“干活”的Demo,往往只是在特定场景执行单一任务,一般只需要几百条数据微调。“比如机器人在WRC现场所做的展示,一般需要工作人员提前一两天到场,现场采集几百条真机数据,再微调一下既有模型即可。因为这种展示可能对成功率要求并不严苛,七八成成功率即可,训练模型完成这种展示并不困难。”

但是从Demo到真实场景应用,还存在巨大的鸿沟。鸿沟之所以存在,就是因为具身模型的泛化能力不足。

“泛化能力就是机器人今天只学习抓起苹果,明天就能抓起梨,而不是只有学过才会做。”北京人形机器人创新中心(下称“北京人形”)具身智能部负责人鞠笑竹告诉记者。

昆仑行机器人联合创始人兼CTO郎咸朋喜欢以机器人拿起杯子为例,训练时机器人只见过空杯子,那么它是否能成功拿起装满水的杯子,这就是对泛化能力非常直观的一个检验。

具身模型泛化能力的不足,不仅体现在无法识别出没有见过的对象上,还体现在对于不同环境的适应上。前述工程师表示,展示Demo时能更好控制各种环境变量,但是在现实环境中,同一台机器人不同时段的表现都可能完全不同,比如光照发生变化,机器人表现也会变化,因为它们对于光照变化很敏感,其直接影响视觉信息的像素。“目前的现实情况是,人形机器人在特定场景面对特定任务可能达到很高的成功率,但是一旦面对新场景、新任务时往往表现很差,成功率趋近于零。”

人形机器人每次面对新的任务、场景都需要重新学习,这在很大程度上被认为受困于具身模型当前的技术路线。

在具身智能领域,VLA模型(视觉—语言—动作模型)2023年兴起,此后便有大量基于VLA模型的具身模型推出。2025年,国内的银河通用、智平方、自变量等企业均对外发布VLA模型。人们希望利用VLA模型处理视觉、语言信息的能力,利用机器人传感器获取的数据进行训练,最终实现执行任意任务的能力。

“2025年初,大家发现VLA模型泛化能力并没有那么好。”鞠笑竹认为,限制VLA模型泛化能力的一个关键因素在于数据。“VLA模型无法使用大量视频数据训练,更多依赖真机采集数据,很难上量。”

前述工程师告诉记者,他正在尝试用仿真数据替代真机数据,因为前者可以无限生成,更容易上量,但是数据质量对训练结果的影响很大。对于VLA模型而言,使用真机输出的动作信息进行训练才能保证误差最小,从而达到最好的训练效果。

国内企业对于具身模型的真正投入都比较有限。“多数具身模型其实就是两类来源,要么是很小的数据量套用开源框架简单训练而来,要么就是直接微调开源模型而来。”自变量CEO王潜表示。

“王潜所说的情况并不鲜见,国内真正做具身智能模型预训练的公司比较有限,更多是基于美国公司的开源具身模型,如PI的π0.5、英伟达的GR00T等VLA模型进行后训练,也就是针对具体任务、场景进行后训练。”前述工程师坦言。

根据他的观察,今年情况开始改变,更多公司今年也开始进行一些基础模型预训练。不过各家公司对于基础模型的投入差异比较大。“比如像自变量模型团队的人数就比较多,而且内部部门划分很细致,负责基础模型、数据等环节的部门,之前他们也推出了开源具身模型。”

“即使进行具身模型预训练,多数公司还是会使用一些开源模型的权重。”他认为,中美公司在基础模型上仍有一定差距,比如国内对标比较多的π0.5其实是PI去年开源的一款基础模型,两边应该有数月到一年的差距。



4月7日,在广州海珠区的广东省具身智能训练场,工作人员在模拟环境下训练机器人进行电力设备巡检与维护。图/新华

狂“卷”后训练

当前具身模型在部署到具体场景时都需要后训练,这也是国内人形机器人企业在跳过模型预训练,更多“卷”后训练的原因。既然模型能力有限,不如面对具体场景和任务更多收集数据,提升表现。

鞠笑竹认为,针对具体场景和任务,基于VLA进行后训练,对于基础模型能力的提升意义有限,更多只是在拼落地能力与交付。“一旦某个场景被开发出来,大家就会蜂拥而至。后训练就是用大量真机数据训练VLA模型,就跟训练智驾模型的方式一样,不断发现corner case(边缘场景),从而提升人形机器人表现,这种能力可能难以迁移到新的场景和任务。”

这种后训练的成本并不低。就在8月中旬,自变量也效仿Figure进行人形机器人物流分拣直播,分拣效率达到1816件/小时,超过此前Figure 1248件/小时的纪录,效率提升了45%,而且直播时的成功率达到98%以上。

有接近自变量的人士向记者透露,为准备这场直播,自变量累积了大量数据进行训练,数采员数量超过百人,早晚两班倒,底薪6000元,还有绩效奖励。

一则招聘广告展示了数采员的工作状态,纯夜班岗的工作时间是晚10:00到早7:00,中间休息一个小时,每晚有50元夜班补助。“24小时,早晚两班倒,这种数采方式堪称‘变态’。”上述人士告诉记者,为了完成这次直播,自变量使用了10万小时真机数据进行后训练。





8月17日,在北京市海淀区AI原点社区内的一处真实场景试验室,一款搭载具身大模型的机器人进行播放唱片训练(上图)和整理家务训练(下图)。图/新华

“目前来看,机器人面对具体场景和任务的表现,在数据上的差异相比模型上的差异能产生更大影响,特别是真机数据,使用1万小时的真机数据训练出的模型,可能比用10万小时模拟数据训练出的效果更好。”优必选副总裁、具身智能与人形机器人研究院院长焦继超告诉记者。

但是采集真机数据的成本,目前比较高。优必选目前每天的真机数据采集量约在8000小时,经过清洗等处理后留下的有效数据占比约为25%。

不过焦继超表示,VLA模型的部署成本可能并非大家想象的那么高,同样是物流行业的分包工作,从A公司迁移到B公司的成本相对可控,因为面对的包裹相差不多,环境可能稍有差异,比如工作台不同,迁移时可能只需要再采集几千条数据,用一两个月时间就能完成。

“随着数据积累,一旦突破某个点之后人形机器人能力的提升就会变得非常快。”焦继超坦言,如果人形机器人面对从未见过的快件,可能很难完成分拣,但是如果只是快件尺寸、颜色发生变化,人形机器人能展现出一定的泛化能力,并非一定需要“见过”。

“像搬运这样的场景会在今年或明年实现真正规模化落地,下一步会转向一些轻便灵巧类的任务,比如拧螺丝,以及一些长程任务。其实客户并不关心人形机器人究竟在使用什么基础模型,他们更关注其在工作场景中的表现,对成功率的关注高于效率。”焦继超告诉记者,早期一些客户的容忍度比较高,但是真正在场景规模化落地的成功率至少要达到99%以上。

“基于VLA模型进行后训练,依然可以在一些比较标准的场景中短期落地,但是从未来人形机器人的终极目标来看,无论进厂还是进家可能面对无穷无尽的场景组合,只有人形机器人的泛化能力足够强才能应对。”鞠笑竹说。

在具身模型能力有限的情况下,通过“卷”后训练落地具体场景,更多是商业化的权宜之计。



8月21日,2026世界机器人大会期间,多台工业机械臂与人形机器人模拟汽车车身产线协同作业,展示工业机器人、人形机器人在汽车制造领域的柔性生产应用方案。图/视觉中国

“相当于十年前的智驾”

从去年开始,业界与学界都开始将实现通用人形机器人的希望聚焦到世界模型。力挺世界模型的美国学者杨立昆、李飞飞成立的公司都在短期内获得10亿美元规模的融资。

国内业界亦快速跟进世界模型,今年以来,自变量、智元等公司相继发布世界模型。2025年底,朗咸朋还是理想智驾团队负责人,他是智驾领域VLA路线的拥护者,也了解VLA的上限。他坦言,具身智能需要“新故事”,主题就是世界模型。他今年参与创立的昆仑行机器人,在3个月内就获得了10亿元融资。

世界模型之所以让人兴奋,便在于其展现的泛化能力。英伟达介绍,世界模型更具泛化性,能让机器人完成没有见过的任务。

“当前针对单一场景任务,基于VLA模型再进行后训练,确实能获得更好效果,世界模型生成的动作在精度上还没有达到VLA模型的水平。”郎咸朋做出这样的类比,世界模型与VLA模型的差距有一些像智能驾驶是否依赖高精度地图的区别,如果依赖高精度地图,每到一座新的城市,就需要从采集数据做起。

星源智创始人刘东告诉记者,从星源智推出的世界模型来看,所需的真机数据大概只占全部数据需求的10%。

2025年初“北京人形”内部开始讨论世界模型,4月开始做,11月就推出一版开源模型。今年8月,“北京人形”发布了大一统模型 Pelican Unify。鞠笑竹表示,在这个过程中一直在思考世界模型究竟能给具身智能带来什么。

“其实世界模型也分为不同的路线,比如国内比较火热的路线是基于现有视频生成模型的世界模型。”尽管鞠笑竹认为,它可能并非未来具身模型的终极答案,但是仍对其在泛化性上的表现感到兴奋。

“比如在训练视频生成模型时,不可能有小猫、小狗说话、跳舞的视频,但是我们能生成这样的视频,这说明它能把人类的动作映射到小猫、小狗上,那么小猫、小狗是不是可以变成一台人形机器人?这样就能生成大量人形机器人模仿人类操作的视频,这首先意味着未来可以使用海量人类在不同场景下工作的视频,进行大规模训练,而非像VLA模型那样只能依赖真机数据,难以上量。”



3月11日,江苏无锡市,优必选子公司优启的人形机器人实验室。图/视觉中国

鞠笑竹介绍:“真机数据依然需要,但是相比过去那种重复某一运动轨迹几百上千次的数据,更需要多样的数据,这样才能避免未来训练出的模型陷入局部最优的陷阱。”

“在训练世界模型时,需要在训练数据中加入原始动作数据中蕴含的物理量和物理关系,这样模型才有可能理解物理世界。模型训练中有句话‘garbage in,garbage out’(你喂给它垃圾,也会产出垃圾)。如果训练使用的数据只是一些运动轨迹信息,那模型学习时也只会模仿这些运动轨迹,而非理解其背后的物理因果关系。”郎咸朋说。

不过,一旦涉及基础模型,特别是世界模型预训练,对机器人企业算力、数据、人才和资金等资源方面的压力都比较大。“北京人形”在算力上还算充足,但是对于世界模型预训练而言仍然捉襟见肘。

“像英伟达训练cosmos模型依托于8000块B300的算力资源,未来可能需要国内进一步统筹资源。”鞠笑竹说,“大家也有疑问,大语言模型参数规模已经高达千亿、万亿级别,一个几十亿参数规模的世界模型谈何理解物理规律?”

鞠笑竹认为:“留给具身智能企业的选择已经不多,要不开始做自己的基础模型,要不就不要做了。”

宇树科技上市后,模型研发成为最大的单一募投方向:42.02亿元募集资金中,20.22亿元投向模型研发项目。

不过由于技术尚未收敛,没人敢押注特定模型路线。“从具身模型的发展来看,并非阶梯式上升,而是螺旋式上升。比如很早的时候,有人希望大模型自己编程,编辑一些模块化技能,再交给机器人操作,李飞飞探索过这条技术路线,当时成功率很低,不被认可。但是随着大模型编程能力提升,很多人又开始重新审视这条技术路线。”鞠笑竹认为。

郎咸朋将当前具身智能所处的阶段类比于10年前的智能驾驶,当时智驾领域也是Demo很多,但是技术并未收敛。“未来具身模型的范式可能还会经历迭代,迭代可能导致之前的努力白费,但让机器人理解物理规律一定是方向。”

记者:陈惟杉

(chenweishan@chinanews.com.cn)

编辑:闵杰

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
张嘉倪离婚大翻盘:夺回两子抚养权,分得别墅千万抚养费

张嘉倪离婚大翻盘:夺回两子抚养权,分得别墅千万抚养费

悦君兮君不知
2026-09-12 07:46:42
全世界都被普京骗了?打乌克兰只是幌子,真正目标其实已悄悄布局四年

全世界都被普京骗了?打乌克兰只是幌子,真正目标其实已悄悄布局四年

扶苏聊历史
2026-08-27 16:15:02
前军方领导人吴丹瑞住所安保出大事!4名士兵趁换岗逃跑,军方全力搜捕

前军方领导人吴丹瑞住所安保出大事!4名士兵趁换岗逃跑,军方全力搜捕

缅甸中文网
2026-09-11 20:29:59
福建省委决定,黄水木任南平市委副书记

福建省委决定,黄水木任南平市委副书记

新浪财经
2026-09-12 11:12:41
在俄罗斯8天,回国后才敢讲实话:对方看你是中国人,那态度变了

在俄罗斯8天,回国后才敢讲实话:对方看你是中国人,那态度变了

怪味历史连连看
2026-09-12 09:10:35
网上的真人,越来越少了

网上的真人,越来越少了

人人都是产品经理社区
2026-09-11 07:50:18
为什么和华为合作的车企越卖越亏

为什么和华为合作的车企越卖越亏

多比财经
2026-09-11 14:04:31
全场被压制!周启豪1-4张本智和无缘澳门冠军赛4强,男乒全军覆没

全场被压制!周启豪1-4张本智和无缘澳门冠军赛4强,男乒全军覆没

篮球资讯达人
2026-09-12 12:44:05
唏嘘!昔日欧洲豪门悍将如今无人问津,只能委身巴甲,身价仅250万欧

唏嘘!昔日欧洲豪门悍将如今无人问津,只能委身巴甲,身价仅250万欧

零度眼看球
2026-09-12 13:11:54
流落中国的外国公主,如今拒绝回国:我是中国人,中国就是我的家

流落中国的外国公主,如今拒绝回国:我是中国人,中国就是我的家

奇思妙想生活家
2026-08-30 09:33:02
谢林汉姆:凯恩没有世界杯欧冠,只是金球陪跑者;我投罗德里

谢林汉姆:凯恩没有世界杯欧冠,只是金球陪跑者;我投罗德里

懂球帝
2026-09-12 09:11:09
1958年5月,宋美龄专程去看望被软禁的张学良,共进午餐后张学良趁机提了两个请求,宋美龄答应了

1958年5月,宋美龄专程去看望被软禁的张学良,共进午餐后张学良趁机提了两个请求,宋美龄答应了

磊子讲史
2026-09-10 14:20:10
76岁谭咏麟香港演唱会:刀郎送4个花篮支持,甘比刘銮雄携女现身

76岁谭咏麟香港演唱会:刀郎送4个花篮支持,甘比刘銮雄携女现身

梦回千年aa
2026-09-12 09:33:22
上海一幼儿园要求收集家长工作单位和职务信息?教育局回应:消息系编造,警方已介入

上海一幼儿园要求收集家长工作单位和职务信息?教育局回应:消息系编造,警方已介入

潇湘晨报
2026-09-12 08:24:12
出乎意料,尹锡悦被判无罪,输掉所有的金建希反倒成了最悲催的人

出乎意料,尹锡悦被判无罪,输掉所有的金建希反倒成了最悲催的人

墨羽怪谈
2026-09-12 10:22:03
万亿资产归零,全国第四大保险集团破产,1.5万亿保单怎么样了?

万亿资产归零,全国第四大保险集团破产,1.5万亿保单怎么样了?

米果说识
2026-08-17 19:17:49
国内极端女拳都是惯出来的毛病

国内极端女拳都是惯出来的毛病

浪子说
2026-09-11 07:07:23
澳门冠军赛:国乒独苗饮恨中日大战!周启豪1-4张本智和无缘四强

澳门冠军赛:国乒独苗饮恨中日大战!周启豪1-4张本智和无缘四强

钉钉陌上花开
2026-09-12 12:42:35
张庭一家的正式全家福,一双儿女长相惊艳蜕变

张庭一家的正式全家福,一双儿女长相惊艳蜕变

娱你同欢
2026-09-11 11:33:02
尼泊尔泥石流灾害遇难人数升至1386人 失联5130人

尼泊尔泥石流灾害遇难人数升至1386人 失联5130人

新京报
2026-09-12 09:00:33
2026-09-12 14:04:49
中国新闻周刊 incentive-icons
中国新闻周刊
运营主体:《中国新闻周刊》杂志社有限公司
36266文章数 2076122关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

尼泊尔工人失联10多天后突然回村:只剩汗衫和内裤

头条要闻

尼泊尔工人失联10多天后突然回村:只剩汗衫和内裤

体育要闻

老鹰真正的底气来自于什么?

娱乐要闻

港媒曝钟丽淇疑患渐冻症,本人发文

财经要闻

继房子茅台之后 中产的第"神话"也破灭了

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

艺术
手机
数码
本地
公开课

艺术要闻

211米!义乌第二高楼,封顶了

手机要闻

11999元起!华为Pura X Max阔折叠新版本开售:预装HarmonyOS 7

数码要闻

华为MatePad Air全渠道开售:潮流轻旗舰,屏幕与生产力双升级

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版