![]()
【摘要】2026年,全球人形机器人正迎来跨越工业化鸿沟的关键卡位期。在发布会上,它们洗碗、分拣、倒水,动作行云流水,宛如科幻照进现实;然而一旦脱离受控的实验室“温室”,面对陌生的物体或突如其来的干扰,这群AI新星便集体遭遇了多步骤“长程任务”的翻车魔咒,成功率断崖式下跌。
面对具身智能的“长程难题”,科技巨头们正分裂为两大门派:究竟是以特斯拉、英伟达为代表,笃信海量数据与算力灌注的“数据暴力美学”能大力出奇迹?还是以Figure AI、智元机器人为先锋,精细缝合大脑推理与传统控制的“分级控制哲学”更能筑起可靠性的防线?
在通用智能与绝对稳定性的钢丝绳上,谁又将率先打破技术的紧箍咒,真正推开通用机器人的商业大门?
以下是正文:
01
繁华背后的长程任务魔咒
过去两年里,具身智能(Embodied AI)的技术迭代呈现爆发式增长。以英伟达的GR00T、Physical Intelligence的pi-0.5为代表的VLA模型正逐步让机器人具备理解自然语言并生成连续动作控制序列的能力。
在受控的实验室或特定演示环境下,机器人已经能流畅完成诸如洗碗、倒水、分拣特定物体等单点任务。
2026年5月13日,一场史无前例的“人机耐力赛”在全球数百万人的围观下悄然开幕——美国机器人公司Figure AI将旗下搭载Helix-02神经网络系统的Figure 03人形机器人推上了物流传送带,开启了一场原定8小时的包裹分拣直播。
北京时间5月25日前后,这场超乎预期的200小时连续直播才在Figure AI加州森尼韦尔总部正式落幕。
3台Figure 03机器人累计分拣包裹249,560个,期间出现了约 0.8% 的操作失误(如包裹掉落、方向摆错)。它们搭载了 Helix-02 神经网络系统,将视觉、触觉和全身控制整合为一个模型,能直接通过摄像头画面驱动动作。
这场直播迅速引爆社交媒体,观看人数突破300万,俨然成为具身智能领域的“里程碑事件”。然而,光鲜数字背后,这套经过高度优化的受控场景同样暴露了一个关键问题:当机器人一旦脱离这层“温室”,进入真实开放环境,它们还能延续这份从容吗?
这层繁荣外衣在进入真实开放场景时却被无情戳破。
业内普遍认为,VLA模型在长程、多步骤任务中的稳定性仍是当前具身智能的重要挑战。
长程操作不仅意味着漫长的闭环规划,更包含密集的物理接触与环境变数。
一旦机器人脱离“温室”,面对陌生的物体、多变的光照或者突如其来的外部干扰,多步骤操作中的微小误差就会呈指数级累积。在实验室拿满分的机器人策略,在现实工业或家庭场景中的成功率明显下跌。
为对抗这些痛点,行业分化出两条截然不同的进化路径。
02
英伟达与特斯拉:数据堆砌的“暴力美学”
第一种路径是以特斯拉和英伟达为代表的“数据驱动派”,他们笃信通过海量多模态数据的洗礼和算力灌注,能够让机器人自然“涌现”出解决长程难题的通用智能。
特斯拉Optimus坚守纯粹的端到端神经网络路线,软件栈直接复用并扩展了FSD(全自动驾驶)的AI基础设施。
这一路线选择代表了大量车企向具身赛道快速迁移的底层逻辑。
其一,特斯拉积累了全球规模最大的车载视觉数据集,成熟的神经网络感知栈可直接向机器人平移复用,实现“一套算法,两端场景”的跨域泛化;
其二,纯视觉方案彻底绕开了激光雷达、力矩传感器等高成本硬件,为机器人的批量量产奠定了极低的边际成本基础。
从FSD到Optimus,特斯拉押注的不是单一产品,而是一套能在自动驾驶与具身机器人之间自由流动、持续进化的“通用视觉智能”基础设施。
随着特斯拉加紧将加州弗里蒙特工厂转型为Optimus的大规模量产基地,成千上万台机器人在生产线内进行质量检测与轻量组装,特斯拉也试图借鉴自动驾驶领域的数据闭环思路,将机器人真实操作数据持续回流用于模型迭代。
与此同时,英伟达则凭借Project GR00T大模型和Isaac Lab平台,致力于成为物理AI时代的“安卓”。
英伟达的逻辑是利用Omniverse强大的物理仿真能力,向模型灌注海量的虚拟仿真数据以及人类操作视频,让大模型在数字孪生世界中进行数百万次的低成本试错与强化学习。
该方案的优势是上限极高。纯端到端的系统消除了人为制定的规则局限,模型能融合复杂的感知与动作,表现出从未被显式编程过的柔顺过渡与长程适应力。
其劣势是黑盒不可控。纯端到端架构在复杂长闭环任务中容易出现动作偏移、状态误判等问题,且对分布外数据的容错率极低,一次动作变形就会引发后续所有步骤的系统性崩溃,且工程师极难进行针对性Debug。
03
Figure AI与智元机器人:大模型与控制专家的“二元融合”
与数据暴力美学相对立的,是Figure AI与智元机器人所代表的“大模型+传统控制”的分级控制哲学。这一派别试图在高层通用推理与低层高频确定性控制之间搭建一座高可靠性的桥梁。
Figure AI虽然追求感知、语言和控制的一体化训练,但其在处理超长程工业任务时依然精细地嵌合了任务重规划层。
开篇所描述的那场200小时直播,恰恰是理解Figure AI技术路线的最佳切入口。根据Figure AI官方披露,Helix-02是一套统一的神经网络系统,将头部摄像头、掌心摄像头、指尖触觉传感器、全身本体感知四类输入整合为单一AI模型,直接输出腿部、躯干、手臂、手腕、手指的全身关节运动指令。在这次200小时、249,560个包裹的持续作业中,机器人完成了识别条形码、抓取、翻转、放置的多步骤连续动作,期间通过自主轮班充电实现了不间断运转,全程无重大机械故障。
长时间连续运行测试一定程度上反映出其系统具备极高的物理韧性与长程持续性,但也同样揭示出由于端到端物理交互的复杂性,精准度与异常动作恢复依然是需要动态调整的严苛课题。
值得注意的是,此次直播场景经过了高度优化,流转的包裹以标准纸盒和软包为主,规格较为统一,与真实物流中心中形态各异的异形件、易碎品相去甚远;作业区域在受控环境中运行,有别于夏季高温、空间复杂的真实仓储现场。
此外,有观众注意到机器人偶尔出现“用手摸头”的动作,引发了关于是否存在远程操控介入的争议——尽管Figure AI的CEO Brett Adcock随后公开澄清,称这是机器人为规避旁侧金属滑槽而做出的策略性抬手。但这些细节提醒我们,200小时的稳定运行是在精心设计的环境约束下取得的里程碑,机器人走向真实开放场景仍需跨越一道不小的鸿沟。
国内领军者智元机器人(Agibot)将分级思维发挥到了极致。2025年3月,智元发布的通用具身基座大模型GO-1中创新性地提出了ViLLA(Vision-Language-Latent-Action)架构。系统由多模态大模型(VLM)与混合专家系统(MoE)深度组合。
“大脑层”采用基于InternVL-2B的VLM大模型,通过海量互联网图文和跨本体视频进行预训练,具备常识推理、语义理解与任务全局拆解能力。
“小脑”层MoE结构内包含隐式规划器(Latent Planner)与动作专家(Action Expert),负责承接大模型拆解出的局部子任务,并以高频、精准的传统机器人控制算法生成具体的物理执行序列。
ViLLA架构的本质是让大模型负责高层的“谋定”,而让垂直专家或高频控制方法负责低层的“身体力行”,从而解决大模型高频控制能力弱、实时性差的天然短板。
一方面,这种架构可靠性强。通过将复杂的“长程任务”显式或隐式地拆解为多个确定性的“短程任务”,系统可以设置明确的事件触发 replanning(重规划)和纠错容灾机制,极大提升了机器人进入恶劣、陌生现实场景时的存活率。
另一方面,其认知与动作存在“断层”。高层大模型与低层动作专家之间的频繁切换和翻译会带来不可避免的通讯延迟与信息损耗,使得机器人在进行复杂的全身协同、高速肢体对抗或极度流畅的连续直觉操作时,灵动性逊色于纯端到端模型。
04
量产成本与安全冗余的商业博弈
如果说技术路线之争是学术层面的优雅辩论,那么在商业世界里,它的本质则要直白得多:纯视觉方案与多传感器融合方案之间的拉锯,是“规模化量产成本”与“极端场景安全冗余”之间无法回避的博弈。这两条路线并非你死我活的绝对对立,而是在商业回报率(ROI)的坐标轴上,形成了泾渭分明的场景分层。
纯视觉路线的核心优势,是极致的硬件成本压缩。摄像头可以廉价量产,而激光雷达、六维力矩传感器等精密硬件至今仍是机器人成本的重要构成。自动驾驶行业的经验表明,从多传感器融合转向纯视觉路线的车企,能够在单车硬件成本上实现可观的压缩空间——特斯拉正是凭借这套逻辑,将FSD系统的硬件边际成本压到同类产品中极低的水平。
迁移至具身机器人赛道,这种成本优势将在家庭服务、商业零售、低速物流等对价格高度敏感的消费级场景中被放大。规模出货带来的海量真实操作数据,又能持续回流喂养端到端大模型,形成“越用越便宜、越用越聪明”的商业飞轮。
但在工业制造、高危作业、精密装配等B端核心场景中,“便宜”不是首要考量,“不出错”才是。一台工业机器人在高度串联的汽车产线上发生一次碰撞,可能造成整线停产;一次精密装配的失误,损失的不只是零件本身,更是整个工程交付节点。
多传感器融合方案提供的物理冗余与毫米级精度,是这些高壁垒场景获得B端客户信任、实现商业交付的“准入门票”。对急于替代人力的工业客户而言,融合方案虽然初期采购成本较高,但更稳定的作业成功率意味着更短的“从演示到投产”周期,其实际商业回报反而更为清晰。
由此,一条基于ROI逻辑的场景分层格局正在形成:短期内,工业制造、高危环境将成为多传感器融合的主战场;家庭服务、轻量商业场景则是纯视觉的天然腹地。长期看,两条路线在各自的商业根据地上共同壮大,分别撑起具身智能这片万亿级赛道的不同象限。从这个意义上说,技术路线之争终将以“场景定路线”的市场铁律收场,实则殊途同归。
05
尾声
2026年作为具身智能从原型验证走向规模化商业试产的决胜之年,长程任务的稳定性已成为决定企业前路的试金石。
无论是特斯拉与英伟达坚守的“数据暴力美学”,还是Figure AI与智元机器人推崇的“分级控制哲学”,都在用各自的方式逼近通用智能的现实边界。
纯粹的端到端黑盒容易在复杂多变的真实世界中“因一步错而步步错”,而分级架构则必须在高层推理与低层执行的系统断层间找到更平滑的衔接。
淘汰赛的枪声已经响彻整个行业,留给各方在开放世界中证明自身长期可靠性的时间窗口正不断缩短。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.