![]()
对视触觉的许多质疑,并不中肯。
作者丨向 欣
编辑丨高景辉
在 3C 产线上,让机器人把一根 USB 线插进毫米级的接口,难点藏在视觉看不到的地方。插没插正、有没有卡滞、该加力还是收手,答案都落在指尖与工件接触的瞬间。
精密装配、柔性物体抓取、插拔等任务,是自动化产线上价值最高、也最难被机器人替代的一批工序。这类过去依赖老师傅手感的工序,正把触觉推到具身智能的台前。
![]()
视觉解决「看到了什么」,触觉解决「碰得怎么样」。VLA 模型在真实任务里反复碰壁后,越来越多团队意识到,仅依靠视觉感知推进到一定阶段后,性能天花板就会出现,核心短板正是缺少触觉信息。
有具身厂商创始人打了个比方:如果让一个人度过三天无触觉的生活,他会活得非常痛苦,抓个杯子都不知道该使多大劲。
触觉赛道里,视触觉是热度最高的分支之一,高端灵巧手几乎把它当成标配。
资本也闻风而动,视触觉厂商今年都完成了大额融资:戴盟机器人两个月内完成亿元级 A 轮与蚂蚁集团领投的数亿元战略融资;一目科技7 月完成超 10 亿元 E 轮融资,投后估值超百亿元;千觉、纬钛今年也拿到亿元级融资。
但热度越高,争议也越多。
有人认为,视触觉不过是「摄像头+硅胶」,容易复制;有人认为,光学结构决定了它做不薄,帧率也很难提升;还有观点担心,大量视觉数据会带来算力、存储、线束和功耗压力,柔性表面也很难经受工业场景的长期使用。
不过,不少争议未必是中肯的行业预警,很多已经与实际情况脱节,甚至演化成对整条路线的误解。
成本、厚度、一致性、耐久性,以及触觉数据如何真正进入模型训练体系,确实是这条路线目前还没有完全跨过的坎。
但把视触觉从原理、产品、数据到落地场景完整拆开,会发现,市场上流传的很多判断,已经跟今天的产品进展出现了偏差。
带着 「视触觉究竟走到了哪一步」 的疑问,我们与戴盟、一目、纬钛、千觉、模量等视触觉厂商聊了聊,把市面上的产品参数和各家的技术生态梳理了一遍,试图拆开那些被简化、被误读、被低估的环节。
01
视触觉的底牌:把触觉变成图像
视触觉的工作原理并不复杂:传感器表层是一层透明弹性体,内部装着光源和微型相机。物体压上来,凝胶发生形变,形变在内部变成明暗图案,相机拍下图像,算法再从中重建接触几何、力分布与滑动。
把触觉变成图像,是这条路线的核心换算逻辑。
这条路线真正起源于 MIT。2009 年,MIT CSAIL 的 Edward Adelson 团队在 CVPR 上提出 GelSight,最初只用于观测物体表面的微观形貌,和机器人没有关系;
![]()
Gel Sig h t
2014 年,团队推出全球首款超高分辨率指尖 GelSight 传感器,视触觉第一次装上机器人指尖,那篇论文的第一作者李瑞,后来回国创立了纬钛机器人。
![]()
全球首款超高分辨率指尖GelSight传感器
2020 年,Meta(当时 Facebook)开源 DIGIT 触觉传感器全套硬件设计,大幅降低了视触觉的科研门槛;2021 年 Meta 与 GelSight 达成合作,由后者负责 DIGIT 的量产商业化,视触觉从这个阶段开始进入全球实验室并衍生出 OmniTact 等变体,光学路线逐渐成为触觉研究的主流技术路线之一。
源自视觉算法与图像处理,也让视触觉常被质疑「没有自己的算法」。实际上,虽然光度立体法本身来自计算机视觉,但 GelSight 将其与弹性体反射涂层和多角度可控照明深度结合,形成了视触觉标志性的高分辨率几何重建范式;此后针对凝胶非线性、剪切力解耦、标记点跟踪的定制改进,也都围绕触觉的物理特性展开,并非拿视觉工具、算法简单套用。
视触觉的另一个质疑,是表面沾上油污会不会弄脏图像。其实,传感器的光学腔体封闭,相机向内拍摄,油污进不了内部,也不会像污染摄像头镜头那样糊掉画面。
污染真正影响的是凝胶表面的力学与光学耦合特性,改变局部变形、间接拉低精度与寿命。这个问题与压阻、电容等软体触觉方案面对的污染问题类似,属于表面材料工程,谈不上视触觉独有的原理缺陷。
回到价值本身。传统的触觉传感器,本质上是通过布置一个个离散的感知单元来获取压力或形变。感知点越多,意味着需要塞进更多物理器件,因此在密度上存在天然限制。而视触觉的触觉信息点的密度由相机分辨率决定,这正是视触觉最突出的长处。
纬钛机器人创始人李瑞介绍,640×480 的图像就有 30 万个像素点,每一个对应一个触觉信息点,若传感器面积是3平方厘米,每平方厘米就是上万个点甚至更多。
一目科技创始人李智强用人体做对比:人手指尖约 1.2 万个触觉点,一目可以做到 24 万个,已经超过人手。对比之下,传统压阻式传感器每平方厘米只有几十个点,电容、霍尔方案在百个上下。
感知维度上,视触觉同样能拉开差距,李瑞概括了视触觉传感器的三个优势:能同时测法向力、切向力与滑动,能操作衣服、线缆、食物这类柔性物体,不受温湿度与电磁场干扰。
「最类人」是他们共同给出的理由,视触觉跟人的感知能力最接近。 有厂商认为,这条路径会是触觉传感器的终极方案。
02
走上牌桌的厂商
视触觉热起来之后,玩家也越来越多。
专业视触觉厂商中,国外有GelSight,国内有戴盟机器人、一目科技、纬钛机器人、千觉机器人、模量科技、叠动科技、知行具身;另有一批灵巧手厂商选择自研,如Sharpa、曦诺未来、拾玥科技。
它们的出身也各异:GelSight 与纬钛源自 MIT ,戴盟孵化自香港科技大学机器人研究院,千觉的创始人是上海交大副教授马道林,叠动核心团队也来自港科大,一目从光谱芯片业务转来,模量创始团队来自香港城市大学、厦门大学等高校。
几家公司身上有几个明显的共性。
其一,都朝系统级公司走,产品边界超出传感器本身,纷纷向上游数据采集、底层算法平台以及数据集、末端执行器延伸,试图打造系统级的能力闭环。
戴盟、一目、千觉、纬钛都做了数采设备、数据集与模型,模量发布了数采手套,连成立最晚的叠动也推出了集成算力的夹爪。
都在往全栈做,其实有两方面的原因。
一方面,尚未成熟的地带是厂商的潜在业务增长点。 千觉联合创始人、CTO 赵浩南解释, 传感器、数据、模型几个环节环环相扣,在特别好的硬件或模型出现之前,这些接口地带就是大家的机会。
另一方面也是行业所处的早期阶段使然,一目科技创始人李智强判断这是「先全栈、后往回收」的过渡阶段,最终会走向分工;戴盟相关负责人也认为,全栈不是目的,出发点始终在触觉上,适合合作的部分会找做得好的厂家,不过,触觉数据处理链路与触觉模型能力必须自己做。
其二,产业资本密集入场。
戴盟的股东覆盖汇川技术、中国移动、中国电信、蚂蚁集团、联想、招商局创投;一目背后有小米系顺为资本、TCL 与博世旗下博原资本;纬钛的天使轮由小米战投领投,Pre-A 轮有韦尔股份旗下韦豪创芯;千觉的天使轮由智元机器人领投,理想汽车、吉德电器随后加入。
翻看股东名单,会发现家电与消费电子产业方出镜率最高。 小米系资本、TCL、松霖、吉德都位列其中,家电产品迭代快、型号多,产线需要机器人适应更多变化,而插接、装配、抓取等任务又高度依赖接触反馈;车企、半导体产业方看中产线精密装配,蚂蚁、联想等大厂在押注数据与生态。
落到场景上,各家都在啃高价值工序:戴盟在 3C 产线承担 USB 插拔、标签张贴,纬钛与小米及多家世界 500 强合作,千觉已服务 300 多家头部客户,夹爪类产品去年完成量产,订单量级在千套至万套之间。
其三,不少产品补齐了防水防尘能力,帧率基本都能达到百Hz级别。
戴盟传感器做到 IP67 防护,通过 500 万次按压与 20 万次摩擦测试;纬钛夹爪款视触觉传感器具备 IP54 防护,还可以升级防护等级,工作温度覆盖零下 25 ℃到 80 ℃;一目 Sentra T0 系列达到 IP65 防护,工业寿命超五百万次按压,并宣称无惧温漂;千觉正在研发防水款传感器。
千觉机器人联合创始人、 CTO 赵浩南解释,研发防水款传感器,是为了适应机器人进入家庭后的真实需求,洗碗、洗水果、拿抹布等涉水任务,都要求传感器能够在水环境中正常工作。
而防尘更多是基于工业场景的需求,总体而言,防水防尘,目的是延长凝胶寿命与标定长期有效。
![]()
戴盟视触觉传感器
行业里「视触觉帧率只有 30 到 60 fps」的说法也已过时。戴盟夹爪款 120 Hz、灵巧手款180Hz,千觉的采样帧率最高可到 150 Hz,模量工业夹爪可到120Hz,叠动甚至可以把全系采样频率拉到400Hz以上。
其四,产品形态多样,并且已出现不少曲面产品。做曲面的视触觉传感器一度被认为是难题,其实如今的视触觉传感器可以做到仿生曲面,有的已接近指腹形态。一目有方形、楔形与指尖三类形态,千觉的视触觉传感器精灵为仿生指尖,夸克 N1 与夸克 W1 为仿生曲面,光子为楔形平面。
03
格局未定,各有各的解法
厂商一多,同质化的说法随之而来,甚至有观点认为在电商平台买齐零件就能手搓出产品。
但把各家的产品放在一起看,同质化判断其实站不住脚。开源方案确实降低了入门门槛,但真正商用的产品对凝胶配方、光学校准、批量一致性、可更换设计与软件栈上都有极高要求,这些环节决定产品能否离开实验室、走进产线。取舍不同,厂商产品也不同。
评判一款视触觉传感器,可抓住几个方向:
空间分辨率与深度精度: 决定能「看」到多细的纹理与形变,直接影响对物体表面特征(如芯片引脚、头发丝分叉)的识别能力;
力感知性能: 包括法向力、切向力、力矩的测量范围与精度,决定能否感知滑动、判断抓取稳定性,其中切向力非常关键;
帧率与延迟: 影响动态操作中的响应速度,高频操作(如装配、插拔)需要百Hz级别的实时反馈;
尺寸与集成性: 决定能否嵌入灵巧手指尖、能否适配不同构型的末端执行器;
耐久性与环境适应性: 决定产品在产线上能扛多久,包括防水防尘等级、按压寿命、抗穿刺与抗腐蚀能力。
把市面上各类视触觉传感器的产品参数都盘了一遍后,我们发现行业里参数标注并不统一,横向对比有难度,不过仍然可以根据各家强调的指标,简单看出他们打法差异之处。
戴盟把功夫下在耐用性和一致性上。产品具备 IP67 防护能力,能够防水防溅、抗尘耐污,具备强抗电磁干扰,特别标注了灵敏度、零漂、输出时漂、非线性等指标,传感器表面可以承受划、刺、刮等操作。
![]()
这背后很大程度上是材料工艺的结果。传感器并非单一材料构成,而是由外层保护层、中间透明层以及贴合工艺等多层结构组成,每一层都需要针对实际使用场景进行调整。
一目最突出的标签是薄,靠自研超表面硅光感光芯片压缩光路,把产品压到 10 毫米以内,第二代做到3 毫米。
![]()
一目科技视触觉传感器
一目科技相关负责人介绍,一目团队多名核心成员有华为背景,优势在于具备强大的工程化能力,据公司披露今年已拿下多家行业头部客户订单,应用于灵巧手的仿生指尖款触觉传感器已经开启量产。
千觉在参数上强调一致性和精度表现,全系带自标定算法,自动校准保障片与片之间的稳定,其整手触觉方案中跨传感器一致性超过97 %;对产品的合力精度、变形场精度标注细致。
![]()
纬钛的产品明显能看出有面向场景的取舍,夹爪款采样频率相对低但工作温度范围宽,指尖款频率高、面向 0 到 50 ℃环境;GF225 的法向力与切向力量程都到 30 N,在几家公开标注中最高。
![]()
模量走视触觉与压阻多技术融合路线,以视触觉做指尖高精度,以压阻做手掌大面积覆盖。
知行具身换了感知范式,把相机换成了事件相机:只检测亮度变化的区域,变化即输出,绕开了传统视触觉传感器「逐帧快照」的物理限制,输出方式的改变也减少了大量重复图像数据的输出,带宽小而无需外挂算力设备。
叠动则把 MEMS 工艺引入视触觉,全系采样频率拉到 400 Hz以上,在频率上形成了差异化。
技术生态上,各家虽然都在全栈化,但也有具体差异。
戴盟是目前技术生态布局最完整的厂商,从传感器到数据采集设备、数据集、评测基准到VTLA 模型、世界模型均有布局。
模型方面,戴盟2024年在业内率先提出 VTLA(视觉-触觉-语言-动作)架构,后续不少厂商跟进。戴盟近期又发布了触觉锚定世界模型 Daimon-TWM。
数据方面,公开数据集的有四家,戴盟的 Daimon-Infinity 是全球最大规模含触觉数据集,并开源其中 1 万小时数据;千觉的 TacVerse 1k是首批 1000 小时真实交互数据;纬钛的白虎-VTouch 超6万分钟,强调跨本体;一目在联合斯坦福推进开源项目 TouchNet。
此外,一目还着力于降低模型厂商用触觉数据的门槛: 触觉基座负责采集,Tactile Transformer Encoder 把不同硬件采到的原始信号编码成与视觉、语言对齐的通用表征,做基模的人不再需要理解底层细节。
仿真方面的探索也有不同。戴盟把仿真能力用在评测上,与银河通用联合发布评测基准RobOmni,更希望定义行业标准;一目自研触觉仿真平台,千觉发布全球首个触觉仿真工具Xense_Sim,填补切向力模拟空白;纬钛与光轮智能合作,把传感器数据接入人类示教平台,记录轨迹之外的手感数据。
厂商选择各异,行业对「触觉该长成什么样」还没有标准答案。
04
落地之前,还有几道坎
关于应用节奏,业内比较一致的判断是装上视触觉传感器的夹爪会先行。 夹爪装上机械臂就能用,控制难度比灵巧手低不少,补上触觉就补齐了抓取闭环的关键拼图。
而灵巧手各家构型不同,对传感器的形状与曲率要求各异,这种高度定制化要求,也是部分灵巧手厂商选择自研视触觉传感器的原因,因为内部迭代效率更快。
不过,各厂商口径都称自己的灵巧手款传感器正在进入量产阶段。一只五指灵巧手需要的传感器数量远多于两只夹爪,需求起来后出货量会可观得多,但视触觉要过的关也不少。
第一道坎是成本和厚度。国外代表产品 DIGIT 售价约 355美元;有灵巧手厂商透露,国产夹爪型视触觉传感器单价一千多元,指尖型三四千元,一只整手仅视触觉传感器成本就可能上万。
厂商对此的态度比较一致:先解决性能,再谈成本,产品成熟了,规模化过程中自然会降本。
这个价格区间也正在被拉平。戴盟透露,其视触觉传感器不管夹爪款还是指尖款,单价都在一千多元。
另一方面,视触觉的成本也要换个算法,要拉长到整个生命周期来看。戴盟相关负责人介绍,视触觉是唯一表面材料可替换的技术方案,其他方案花 500 元买传感器,三个月坏了,再花 500 元换新的,视触觉虽然一开始贵,但表面坏了,后续只需要几十元换一片硅胶就能接着用。 这个账,很多人一开始没算过。
一目科技还透露,自家视触觉传感器已进入可规模化量产的成本区间;能降本主要得益于自研解算芯片与供应链能力。
厚度则是视触觉从实验室进入灵巧手时绕不开的问题,但它的进展经常被低估。
最初的 GelSight 接近一个30厘米见方的盒子,2014 年的指尖版仍有 60 毫米厚,DIGIT 做到 18 毫米。
![]()
Digit
今天,戴盟产品已经做到 5 到 8 毫米;叠动产品做到 7 到 9.8 毫米;一目则将产品从第一代的 10 毫米以内迭代到第二代的 3 毫米;知行具身的产品最薄仅 3–4 毫米。
视触觉因为有摄像头,所以永远做不薄的说法并不成立。
厚度问题上,各家解法不同:戴盟可以靠材料与结构优化,一目用自研芯片压缩光路。至于灵巧手指尖究竟需要多薄,行业还没有共识,多数产品仍在迭代阶段。
第二道坎是一致性与耐用性,这其实比成本和厚度更重要。
视触觉数据要进入模型训练,前提是同一批传感器对相同输入给出相近读数;一致性差的传感器,采出的数据进模型反而成为噪音。
戴盟从材料、结构和防护入手提升耐用性,千觉用自标定算法解决一致性。一目科技具身产品 PDT 经理周爱第把这个问题归结为系统工程能力:只做好传感器某一个零件做好还不够,材料、光学、算法、制造和标定全部需要协同。
「网上买零件就能手搓一个视触觉」的说法,只能说明原理验证的门槛并不高,却不能说明产业化门槛低。
第三道坎是算力与功耗。
如果一只灵巧手上部署多个传感器,持续输出高分辨率数据,算力、存储和通信压力确实会增加。
但工程上并不意味着所有原始图像都必须完整保留下来。
一目工程师介绍,面对较大的数据量,实际使用时通常会先进行下采样,或者用轻量级网络(如ResNet)提取特征,再交给下游模型。
另一种方式是在感知端就减少数据量,从源头解决。
李瑞给出的解法是适当降低分辨率,认为 240×240 就够了,甚至 120×120 也行。每个手指 240×240,五个手指加起来比一个 640×480 的摄像头还少。
知行具身则改变了成像架构,通过基于定制的微型事件相机模组由内而外重构了整套传感系统,使传感器在高速感知下仍能保持较低的数据率,无需外挂算力盒。
而且,视触觉把几何与力统一在同一个传感器里,比起「力传感器再加一路视觉」的系统,整体链路反而更省力。
真正需要比较的,是增加的计算成本,能不能换来足够高的任务收益,并不是视触觉的数据量大不大。
第四道坎,是触觉数据如何融入模型。这或许才是行业下一阶段最大的变量。
现在很多 VLA 模型仍然是先把视觉和语言体系做起来,再尝试把触觉补进去。
千觉机器人把这种做法比作补作业,传感器格式不统一,数据融合度不够,多设备延迟不同,延迟越高,长序列任务越容易断裂。
戴盟 2024 年提出 VTLA,把触觉放到与视觉平级的位置,千觉也是类似思路,是让触觉作为原生模态,传感器、数据规则、数采设备与模型训练保持同一套体系。
不过,戴盟相关负责人认为,数采硬件本身难度不大,真正的壁垒在数据链路:时间戳对齐、多模态打通、后处理管线,决定数据能不能用、好不好用。
这也是触觉数据竞争正在发生变化的原因。
上半年各家还在卷数据集时长,下半年开始有人转向卷质量,厂商开始越来越多地讨论数据质量、一致性、同步精度以及数据能否真正训练模型。正如赵浩南所说,时长再长,质量不够,只会越采越污染。模量科技联合创始人周建林也提到,触觉感知行业的竞争,最终是数据的竞争。
而这件事最终会落到一个现在还没有答案的问题:
训练一个真正能完成灵巧操作的模型,到底需要什么规模的触觉数据?需要包含哪些维度的触觉数据?
目前没人能交出一份准确的答卷,视触觉厂商和具身本体、模型公司都在探索,这是一个需要合力才能解决的难题。
对爆发时点,乐观者认为今年下半年就会掀起触觉风潮,保守的预判是灵巧手明年或后年先放量,触觉传感器随后跟上。
共识在于,视触觉的节奏绑在灵巧手的成熟度上。对厂商而言,眼下要做的事排序清晰:把一致性与耐用性做到位,把数据管线打通,再逐步压低厚度与成本。
每一步都不轻松,但和一两年前相比,方向已经清楚许多。视触觉需要的,其实只是时间,以及更多耐心。
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.