![]()
让懂模型的具身公司,做数采设备。
作者丨高景辉
编辑丨董子博
8月的北京,世界机器人大会(WRC)如期而至。AI科技评论也来到了现场,全程参与了这场为期五天的行业盛会。
我们看到,展馆里各家机器人厂商使出了浑身解数:人形机器人在舞台上跳舞、挥拳、写字,机械臂在分拣线上高速作业,家庭服务机器人在模拟客厅里端茶倒水。观众围着展台前拍照、惊叹,讨论着哪款机器人更灵活、哪个场景更落地。
但当我们来到自变量机器人的展区,却发现画风有些不同。除了家庭服务和物流分拣两个真实业务场景的演示,他们还把一套看起来并不起眼的数采设备搬上了核心展台,工作人员戴着头环、手持夹爪,采集着操作者的每一个动作数据。
![]()
这不禁引起了我的思考:当行业热衷于比拼机器人"能做什么"的时候,为什么自变量要重点讲"数据从哪来"?
01
具身智能,逃不掉"数据焦虑"
要理解自变量为什么在WRC上秀数采,得先回到具身智能最根本的困境。
大模型的智能涌现,本质上是数据喂养出来的。语言模型的Scaling Law已经反复证明:数据规模和质量,直接决定模型能力的天花板。GPT系列之所以能从一个对话工具进化为通用AI助手,背后是万亿级Token的文本数据在支撑。
但机器人的数据,和文本、图像数据完全不是一回事。
文本数据可以从互联网上海量爬取,图像数据可以通过众包标注快速积累,而具身智能需要的是物理交互数据,也就是机器人在真实世界中伸手、抓取、移动、操作物体时产生的多模态数据。这种数据无法从互联网上"捡"到,必须在物理世界中一次次真实操作才能产生。
更麻烦的是,物理交互数据的采集成本极高。传统方式依赖真机遥操:一台机器人本体动辄数万甚至数十万元,部署繁琐,需要专业操作员手持遥操器,一个动作一个动作地录制。一台机器人一天能采集的数据量有限,而训练一个通用具身模型需要的数据量,是百万级甚至千万级的操作轨迹。
成本高只是问题的一面,更致命的是效率低和质量差。
具身行业里长期存在一种割裂的现象:数采方不懂模型需求,模型方管不了数采细节。做数采设备的硬件厂商,关心的是传感器精度、穿戴舒适度、设备稳定性,但他们并不清楚模型训练到底需要什么样的数据分布、什么样的动作标注、什么样的时空对齐精度。而做模型的团队,拿到采集来的原始数据后,往往发现大量数据无法直接使用,比如动作轨迹不完整、视角有盲区、时间戳对不齐、标注粒度不够。
用更简单的话说,生产数据的人缺乏对数据的“审美”。就像刘慈欣在小说《诗云》里写的那个外星文明:即使他们拥有神级的计算能力,能够穷举汉字所有可能的排列组合,把世界上所有的诗歌都"写"出来,但他们却无法从这堆浩如烟海的字符中,分辨出哪些是真正优美的诗。
具身数据采集面临同样的困境。很多团队花了大量成本采集的数据,真正能用于模型训练的比例并不高。行业里无本体数据的良率一般在60%左右,意味着每采集100条数据,40条是无效的。这些无效数据不仅浪费了采集成本,还会在训练中引入噪声,拖慢模型迭代速度。
没有高效、低成本、高质量的数据供给,通用具身模型的规模化迭代只能是空中楼阁。这是全行业共同面临的难题,也是2026年被业内视作"数采元年"的原因——当模型架构逐渐趋同,真正拉开差距的,是谁能更快、更便宜地生产出高质量数据。
02
让懂模型的人,来做数采设备
理解了具身智能行业的症结所在,解题方式便呼之欲出:让真正懂模型的人来做数采设备不就行了吗?
没错,自变量就是这么干的。
在WRC展会上,自变量正式展出了QUANXTA Zero系列无本体数采方案,不仅包含硬件产品,本质上这是一个从模型训练需求出发的软硬一体化数据生产平台。
先解释下什么是"无本体数采"。传统数采依赖机器人本体,你得先有一台机器人,让它在操作员的遥控下完成动作,再把动作数据记录下来。无本体数采则完全不同,这种方式不依赖机器人本体,而是让人穿戴一套传感设备,直接在真实环境中完成操作,设备同步记录人的动作轨迹、视觉画面、触觉力反馈等多模态数据。采集到的数据可以通过算法映射到不同构型的机器人本体上,实现"人怎么操作,机器人就怎么学习"。
这套思路的技术源头可以追溯到“UMI”和“EGO”两种范式。UMI通过夹爪模拟人的双手操作,将人的操作直接转化为机器人可学习的轨迹;EGO则以第一视角摄像头为核心,记录操作者眼中的世界和手部动作,数据更贴近机器人执行时的视角。
QUANXTA Zero系列,则是把这两种范式工程化、产品化,做成了可规模化部署的数采工具。具体来说,包含三款产品,覆盖不同采集需求:
G0采用VR头显、双夹爪和背包的组合,支持全身移动采集,定位精准稳定,适合需要完整空间定位和全身动作的复杂场景。
G1是系列的"拳头产品",单头环加双夹爪的形态,取消了背包设计,在数据质量、用户体验和穿戴续航之间取得平衡。它支持一键式全身移动操作采集,覆盖移动、双臂操作、升降等全场景,多视角摄像头实现第一视角与手部近距离视角的互补,有效消除视觉盲区。
E0是轻量化版本,单头环形态配备6路摄像头,专为第一视角场景数据采集打造,适合对便携性要求高、不需要全身动作捕捉的场景。
![]()
不过,真正让这套方案区别于行业其他数采设备的,倒不是硬件形态,而是设计逻辑的根本差异。
市面上大多数数采设备是硬件厂商做的,他们从传感器和工程实现出发,关心"能采到什么数据",而不是"模型需要什么数据"。自变量则反过来:作为一家具身模型公司,它最清楚WALL-B通用具身大模型在训练中需要什么样的数据分布、什么样的标注粒度、什么样的时空对齐精度。它从模型训练的实际需求出发,反向定义数采硬件的传感器配置、采集流程和数据格式,从根源上解决数据与模型割裂的问题。
这种"由需求反向定义"带来的效果是可量化的。AI科技评论了解到,QUANXTA Zero方案的数据入库有效率超过85%,在硬件成本低于行业平均值的前提下,自变量通过研究实验出的“无本体数据:真机数据”混合配方,能够将模型完成简单任务的数据成本,整体降低约60%。
反向定义的好处还有采集效率的提升。一键式全身移动操作采集,让数采员专注于动作本身,算法自动完成后续标注。现场工作人员告诉我们,实测最高采集速度可达每小时近百次,效率提升至传统遥控方式的2倍多;多模态传感器的时间同步精度被严苛控制在1毫秒以内,视频帧率100%对齐,保障了数据的时空一致性。
![]()
之所以说“软硬一体”,就在于除了硬件本身,自变量还提供了一套全链路数据服务。采集来的原始数据通过自建的数据管线,自动完成高保真接入与同步、清洗与智能标注、人机协同质检与安全脱敏,最终直接接入模型训练与评测闭环。这意味着数据采下来不是一堆需要二次加工的"原材料",而是可以直接喂给模型的"成品"。
更让我们感到意外的是,QUANXTA Zero还有一个"移动采集数据本体回放"功能——采集的全身数据可以适配不同构型的机器人本体,在真机上高保真回放。这意味着一套数据不只能训练一种机器人,而是可以迁移到多种本体上,数据的复用价值被大幅放大。
结合以上信息来看,自变量展示出的,是一套包含“数据-处理-训练模型”整个闭环的数采设备,我们在WRC逛了一圈,发现只有自变量跑通了这套模式。但也不奇怪,这确实是只有模型公司才能做到的事。
如此看来,数据采集这行的门道还真不少,把数采设备交给模型公司来做,或许是最正确的选择。
03
一套数采设备背后,
是一整条技术护城河
数采设备只是数据的入口。要真正把数据转化为模型能力,还需要一整套底层技术体系的支撑。
自变量的思路是:从数据采集到模型训练,形成一个完整的技术闭环。数采方案背后,是DMuon优化器、X-Tokenizer等技术的协同。
DMuon优化器解决的是"数据怎么高效变成模型能力"的问题。海量数据采集上来后,如果训练效率跟不上,数据就只是躺在存储里的负担。
DMuon引擎通过优化训练流程和算力调度,大幅提升模型训练效率,降低大规模训练的算力成本,让海量采集数据能快速、低成本地转化为模型能力。
X-Tokenizer解决的是"数据怎么喂得进、吃得好"的问题。具身数据是多模态的——视觉、触觉、听觉、动作轨迹,每种模态的数据格式和编码方式都不同。
X-Tokenizer则实现了多模态具身数据的高效统一编码,把不同来源、不同格式的数据转化为模型可以理解和处理的统一表示,解决了数据"输入适配"的难题。
不仅如此,自变量还搭建了整套数据管线,涵盖数据清洗、自动化标注、质量控制和数据增广等流程,将原始数据持续加工为模型可训、可用的资产。
在模型基础设施层面,自变量自研了面向具身大模型的分布式训练与高性能推理框架,可将数据采集、模型训练到真机部署的全流程工作从6个月缩短到3天。
正是这套底层架构,支撑了自变量的模型能同时跑通家庭和物流两个差异巨大的真实场景。
在WRC展会上我们看到,自变量展示的家庭服务场景中,机器人可以完成整理物品、递送物件等日常操作;物流分拣场景中,同一套模型驱动的机器人可以在分拣线上快速识别、抓取、分类不同包裹。两个场景的操作对象、环境布局、任务逻辑完全不同,但模型能够跨场景复用,背后正是高质量、多样化数据的支撑,以及全链路基建保障的数据到模型能力的高效转化。
![]()
这种能力还在形成正向飞轮。家庭、物流等真实落地场景持续产生真实操作数据,这些数据反哺数采方案的迭代优化。哪些场景的数据质量需要提升、哪些动作的采集效率可以改进、哪些标注粒度需要调整,都在真实业务中得到验证。
高质量的数采方案又加速模型进化,模型能力提升后又能落地更多场景,产生更多数据。"场景产生数据→数据迭代模型→模型落地更多场景",这个飞轮一旦转起来,就会形成越来越强的复利效应。
04
结语:具身智能正在进入"基建时代"
回望WRC 2026的展馆,当大多数观众还在为机器人的灵巧操作惊叹时,自变量把数采设备搬上核心展台的选择,其实传递了一个明确的信号:具身智能的竞争维度正在发生变化。
短期看Demo效果,中期看落地能力,长期看基础设施,这是理解具身智能行业演进的三个时间尺度。当下,行业仍处在Demo比拼的阶段,各家都在展示机器人能做什么、做得多好;但真正决定谁能走到最后的,是中期的规模化落地能力,以及更长期的底层基建。
数据基建就是那道最深的壁垒。当模型架构逐渐趋同、算法创新的边际收益递减,谁能以更低成本、更高效率、更优质量生产数据,谁就能在模型迭代的赛道上跑出加速度。自变量从模型端下场做数据基建,既是自身通用模型路线的必然选择,也在给整个行业搭梯子——通过开源数采研究方案、推出成熟可复用的产品矩阵,降低中小团队和高校的研发门槛,推动具身智能整体生态的成熟。
当数据不再是卡脖子的难题,具身智能才会真正从"演示时代",走进规模化落地的产业时代。而WRC 2026上那台并不起眼的数采设备,或许正是这个时代开启的一个注脚。
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.