研究员|邱慧
把一双小尺码的鞋子后跟分开,再操控同构臂将其摆正、对齐,以此反复。“00后”的小金在8小时内重复无数次同样的收纳动作后,能向数据质检平台输出1—3小时有效的采集数据。
这是北京人形机器人创新中心(以下简称“北京人形”)具身智能机器人数据与训练基地一期的数采一角。
基地6000平方米的训练场被划分为光学动作捕捉区以及家居、商超、办公、医疗等30余个1:1真实复刻的场景。百余名数采员在这里通过遥控真机、佩戴数采头环等方式,模拟真实任务场景,完成日均600小时的数据采集任务。
基地负责人夏华林告诉第四波等机构,该基地年产量达18万小时的高质量数据中,除了对内用于天工机器人的训练,还有部分高质量数据被销往其他厂商,目前已交付3万小时。
01
各有各的“百万小时”
“机器人走向物理世界,模型能力之外,还缺大量高质量数据”,早已是行业共识。然而,一批又一批数采厂建立后,具身智能厂商对数据的深度渴求仍未得到满足。
对于高质量数据,夏华林认为,并不是所有数据价值均等,“真正高质量的,是能帮机器人在真实场景完成任务的数据。”
不同于大语言模型,具身智能的数据体量缺口、类型以及技术路线,还未收敛。一些头部厂商选择自建数采体系,通过提升数据规模与质量,满足自我训练需要,形成数据飞轮。
与此同时,百万小时也成了具身智能数采的某种新门槛。觅蜂科技于8月31日宣称已累计生产超过100万小时无本体数据。蚂蚁灵波、千寻智能、黎曼动力、大晓机器人等企业都提出了百万小时的数采目标。
![]()
机器人在进行快递分拣数采任务。(图/邱慧)
夏华林也称,目前,该数据基地正向着“100万小时高质量数据”的目标迈进,致力于打造全球首个百万小时高质量具身智能数据平台。
但百万小时里的数据构成,各有说法。在互联网视频数据、仿真数据、真机数据三种常见的数据来源中,真机数据往往因更接近机器人落地物理世界,成了多家厂商更推崇的高质量数据来源。
不同厂商会在产能口号阶段就做出划分。智元规划2026年千万小时数据目标中,包括200万小时真机数据、800万小时无本体数据;京东宣称两年千万小时真实场景无本体视频数据,以及100万小时的机器人本体数据采集。
光象科技创始人张涛此前告诉第四波,对于具身智能而言,数据规模是必要的,“起码在目前,还没有技术路径能做到,在数据量不够的前提下,让模型水平得到提升”。量之外,数据多样性、质量、跨本体可验证等维度都是考量指标。
据Interact Analysis统计,截至今年4月底,全国已经投用的数据采集与训练中心达到64个,其中至少13个中心部署了上百台机器人,用于真机采集。
一些机器人厂商也因此开辟了科研、展示之外的业务新场景。比如乐聚智能在招股说明书(申报稿)中称,2025年以来,多地政府加快建设人形机器人数据采集中心,为行业商业化初期带来了新的规模化采购需求。公司依托Kuavo系列产品及配套的数据采集、项目交付能力,获得多个数据采集中心的集中采购订单。
不过,业内对数采工厂集中式采集的模式也存有疑虑。有具身智能企业创始人就向第四波表达了对该模式下数据场景局限、泛化性难突破的质疑。
此外,不做数据质量评估就堆砌数采时长也造成了资源的浪费。觅蜂科技董事长兼CEO姚卯青提到,“盲目采集百万小时,是很容易做到的事情,重复做工种任务就可以,但几乎没有任何价值”。
夏华林把当下机器人所处的阶段类比为10年前的自动驾驶。“真实场景数据的价值最终一定最高,只是这条路还没有被大规模验证过。”他认为,集中式采集能快速验证数据—算法—本体闭环。
8月下旬,北京首个人形机器人数据训练中心停止运营的消息在业内掀起关注。据该数据训练中心核心设备与技术提供方睿尔曼智能解释,撤出是因数采模式的调整。
睿尔曼智能就此回应《南方都市报》称,实验室采集出的数据只解决了“数据有没有”的问题,但因无法覆盖物理世界光照等因素的变化与干扰,导致机器人环境泛化能力一般。“数据好不好”最终还是要到真实作业环境中远程遥控数采。
夏华林不否认数采工厂会是一个过渡形态,因为“最终还是要到真实场景里采集数据”,最有价值的数据,是让模型在场景里能落地、产生好效果的数据。但这“还有很长的一段路要走”。
02
规模之外,厂商开始算细账
在北京人形的数采基地,第四波了解到,数采员来自金融、电气等专业,背景不一,多数人为00后。“大部分场景的数采工作培训半日就能上岗,半月即能成熟练工。”小金说,数采员日常工作内容单一、难度较小,就是通过不断地放慢动作遥操机械臂,模拟真实抓夹任务,积累真实交互数据。
![]()
小金在上传数采数据。(图/邱慧)
多位数采员提到,每日连续8小时的数采工作仅能提炼出不到一半时长、可供上传至质检平台的有效数据量。
夏华林说,基地设立三道质检,采集后一检、标注后二检、交付算法侧验收三检,以此确保交付客户的数据良率。
姚卯青也认为,衡量数据公司的数据质量,先要看数据资产是否有很好的覆盖,有无场景多样性上的分布,以及各种质量是不是能自己提供详尽的数据质量验证报告。
然而,数据规模不断扩大的背后,高成本、长周期也是当下难以冲破的困局之一。有媒体测算,一条30秒的真机操作数据,采集成本10到15元。按中国信通院等机构对具身智能领域Scaling Law(规模定律)时刻到来所需千万小时级的数据量来看,前期采集投入成本不可估量。
相比投入成本,数据的交易价格却开始下降。夏华林说,目前,1小时真机数据的价格约500至1000元不等,价格已有所回落,无本体数据的价格在几十到一两百元的区间。
另一边,厂商买回来的数据,能不能直接用于本体的训练,或是适配实际场景,又是摆在数据良性流通面前的一道门槛。一旦不匹配,意味着这批数据价值将递减乃至归零。
多重因素考量下,数采规则开始变化。今年开始,一些厂商不约而同地在无本体数据采集业务上加大投入。其核心就是简化数采流程,减少成本,以头环、腕部等可穿戴数采设备,部署更多真实场景。
觅蜂算是已形成规模化的无本体数据采集商之一。它采用的就是众包模式,把设备部署至数采工厂之外。姚卯青说,数采的参与者包括退休人员、宝妈等群体,他们不需要懂AI技术,戴上设备,正常完成工作与家务,动作数据就会被自动采集、回传、处理,场景丰富,任务类型多样。
夏华林说,其所在的基地也引入了百余台无本体数据采集设备,用于第一视角的动作捕捉记录。在他看来,机器人的本体和算法不是壁垒,最后1公里的数据闭环能力才是。
尽管各厂商纷纷开卷百万小时的数据体量,但具身智能到底需要多少数据才能“喂饱”,谁都给不出标准答案。对于数采厂商而言,现阶段,谁能够进入效果验证环节,谁才更有条件解释自己的数据为什么值得付费。
编辑|王晓
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.