![]()
作者|周淼
主编|赵妍
来源|星火Ember
今年世界机器人大会(WRC)上有个微妙的变化:数据采集设备从去年的配角,,一跃成为今年各家展台的重点展示内容。厂商们也不再满足于实验室里的标准动作,而是开始秀“真实场景自采”。
这背后不是展台布置的偶然,而是行业风向的切换。随着机器人从DEMO走向落地,业内逐渐形成一种共识,眼下卡脖子的不再是“身体”或“大脑”,而是数据——海量、高质量、能够从真实环境中采集的数据。
据亿欧智库报告估算,至2026年初,全球高质量具身交互数据仅约50万小时。而训练一个能泛化的通用模型,门槛是千万小时级。正是基于这样的数据缺口,数采中心的建设在过去一年迅速铺开。
数采中心一般由企业自建或与地方政府、科研机构共建。据Interact Analysis的一份报告,过去一年全国至少已有90个数采中心投入运营或在规划建设中,头部人形机器人厂商几乎都在其中。
但与此同时,部分数采中心的实际运行效果也引发关注。近期,北京首个人形机器人数采中心悄然关停,合作机器人厂商睿尔曼智能直言,实验室遥操数据不好用——具身智能要真正“干活”,数据必须来自真实生产生活场景。
产能的算盘
业内通常将训练数据分为互联网、仿真和真实世界三大类。前两类成本低,适合模型预训练阶段“见世面”,但要让模型真正靠谱,终究需要真实世界的数据在后训练阶段来校准和微调——前述高质量具身交互数据,即来自这类真实数据。
而真实世界数据的获取,主要分为两种,一种为无本体采集,人戴着设备在真实场景干活就行,不需要机器人本体;另一种为真机遥操——采集员戴上VR头显,与机器人视野对齐,遥控机器人执行任务。
无本体数据便宜又能堆量,所以预训练阶段大量用,让模型先学会“动作大概长什么样”。但真机遥操的数据才是后训练阶段的刚需——毕竟模型最后要装在机器人身上干活,这一步没法省。这也是数采中心最主流的采集模式。
头部厂商早已跑马圈地。截至目前,智元机器人、优必选、宇树、乐聚均已自建或参与了10座以上数采中心的建设,其中智元参与数量超30个。此外,银河通用、睿尔曼、星海图、傅利叶也在多个中心成为数据采集终端。
比建厂更值得看的,是各家喊出的产能目标——“百万小时”几乎已是门槛:智元2026年规划了千万小时有效数据目标,其中约200万小时为真机数据,800万小时为无本体数据;
优必选提出超100万小时真实数据采集目标,来源包括工厂真实场景、仿真数据、无本体数据;星海图、千寻智能、鹿明机器人、灵初智能等厂商也纷纷喊出100万小时真实数据采集的目标,但数据来源同样指向无本体数据。
![]()
不难看到,同样叫“百万小时”,有的实打实是真机跑出来的,有的则把仿真数据、无本体数据也一并打包。数字对不上口径,“百万小时”到底有多少真机含量,得先打个问号。
喊目标的人口径对不齐,不喊目标的人连数都不给:近期冲刺IPO的乐聚和刚上市的宇树科技,均未在招股书或公告中提及数据采集的产能目标——尽管两家公司均已参与数采中心的建设,且将相关投入列为募投方向之一:
乐聚拟使用6.16亿元募资建设高质量大规模数据集,仅在招股书中提及“技能模型已在纸箱拆垛场景验证,大模型研发仍在起步阶段”;宇树拟使用8.65亿元用于智能机器人算法研发(涉及数采),同样没给出具体产能数字。
一边是“百万小时”的目标,一边是招股书里对产能闭口不谈,理想与现实,可能还有不小的距离。
现实的账本
要知道,想在数采中心采出高质量的真机数据,远非让机器人动起来那么简单。从动作捕捉、多模态同步到人工标注、质检,每一个环节的偏差都可能产出低质数据。有业内人士直言,数据采集后续的数据清洗、标注有时比采集本身还费劲。
效率瓶颈同样触目惊心。在智元机器人合伙人姚卯青口中,一名专业遥操员一天工作8小时,平均只能产出2到3小时有效数据。而从前述头部厂商已披露的数采中心项目来看,单台机器人的数据产能规划大致在4小时/天:
智元无锡工厂部署300台机器人,年有效数据50万小时,就此推算,单台机器人的日产能(按年365天)约4.6小时;乐聚(济南)数采中心规划45台机器人,年有效数据近7万小时,单台日产能约4.26小时。
这意味着,要实现上述规划产能,机器人需一年365天连轴转,遥操员每天至少到岗12小时。这还不算上中间的试错成本——设备故障、维护检修,哪样不需要时间来补缺口?
北京人形机器人创新中心数据训练基地相关负责人曾在3月对媒体透露,该基地数据合格率从50%提升到95%花了三个月,期间历经人员培训、流程建立、问题追溯与质量标准优化的反复试错。
目前,该基地日产能约500小时数据,集中宇树、优必选等品牌的120台主流机器人,推算出其单台机器人日产能在4.17小时左右。也就是说,规划的产能看似触手可及,但落地还需要爬坡期。
再来看成本,数采中心是典型的吞金兽,单台人形机器人造价60万至70万元,加上场景搭建、团队运营、多模态采集系统等,一个百台级中心的前期投入动辄数亿元。据业内估算,单小时真机数据的采集成本已达数百至上千元。
来看一组更直观的数字:乐聚前述搭载了45台机器人的济南人形机器人数采中心,总投资约5亿元。优必选2025年签下了14亿元订单,其中近六成来自数采中心,采购的正是其核心机器人产品。
一个绕不开的疑问是,数采中心花大力气建“片场”,性价比还撑得住吗?
片场数据的“性价比”
先得说清楚:真机数据本身是有价值的,业内公认,模型训练离不开它,尤其是后训练阶段。但当前数采中心采集的大多是“片场数据”——在1:1复刻的家庭、商超场景里跑动作、练模型。
斯坦福《2026 AI Index Report》给了个刺眼的数字:仿真环境任务成功率 89.4%,进真实家庭骤降到 12.4%。而数采中心的片场数据同样面临着这个问题:场景预设、物体固定、没有意外。
再把各家的规划摊开,家庭、餐饮、商超、工业几乎成“标配”,场景趋同、动作雷同、数据形态高度相似——你采我也采,投下去的钱不少,产出的数据却长着同一张脸,差异化从哪来?
行业正在转向:睿尔曼撤出北京首钢园数采中心,转向真实工作场景采集。这并非个例。越来越多手握场景的新老玩家都已经让机器人到餐厅、家庭、工厂中干真活,遇到搞不定的事人工接管,数据自动沉淀。
鹿明机器人创始人喻超直言,“实验室采集的数据、仿真生成的数据、视频数据,有用,但不足以让机器人在工厂里稳定干活。”
更底层的变化是采集方式:过去行业默认,只有机器人本体遥操采的才算高质量真实场景数据。但无本体采集正在打破这一认知:自变量近期的测试显示,在部分任务中,10份无本体数据配1份真机数据,效果等同于同等规模的纯真机数据。
这意味着,真机数据还是要的,但需求量正在缩水。这条路线已经有厂家在跑通商业化。主打仿真合成数据与实景无本体采集业务的光轮智能,今年上半年订单新增数亿,部分优质数据复售率超10倍。
相较之下,机器人厂商自建数采中心目前主要还是服务于自家模型训练——真机数据被视为竞争壁垒,且存在“跨本体”难题,换一台不同构型的机器人,采集的数据就得重来。多名机器人厂商均表示,真机数据只靠自采。
这就好比餐馆里的招牌菜——米面粮油可以到处进货,但独家配方得攥在自己手里。更麻烦的是,灶台换了火候还得重调,哪怕你把方子给别人,别人的灶跟你的不一样,照样做不出同一个味。
另一边,回本的压力已经压到眼前。有报道提到,一座此前采购约8000万元机器人的数采工厂,因为回本时间超过预期,今年初已经把部分机器人转卖给了学校——风口上砸下去的钱,一旦算不过账,连机器人都得另寻出路。
片场还在扩建,但观众已经开始离场了。
