![]()
你有没有想过,一个机器人要认路,到底有多难。
不是那种走迷宫的难,是更根本的难。让一个人形机器人在陌生的房子里找到"蓝色的食物菜单牌子",让一个四足机器人跟着一个穿蓝上衣的陌生人走,让一辆轮式小车听懂"出门左转,到楼梯右转再进卧室,在床边停下"这种拐了好几个弯的指令。这三件事看起来都是"导航",但过去做机器人的人会告诉你,这几乎是三个完全不同的工程项目。
问题出在哪里。传统的导航系统喜欢把任务拆成一条流水线:先用摄像头和雷达把周围环境建成一张地图,再用规划算法在地图上找路径,最后用一个专门训练的模块把路径翻译成机器人的具体动作。每一个任务、每一种机器人、每一种传感器组合,都得重新搭一遍这条流水线。换一个任务,摄像头视角变了,机械结构变了,整套系统就得推倒重来。
这就是这篇论文要解决的事情:能不能用同一个模型,换一个说法就能干另一件事,换一个机器人身体就能直接上岗,不用重新训练,也不用给每个任务单独配一个"专用零件"。
答案是可以的,做出来的模型叫LightNav-0。
一件反直觉的事实是,现在的视觉语言模型其实早就"看得懂"空间了。
VLM
视觉语言模型,一种既能看图片又能理解文字的AI模型,比如可以回答"图里的杯子在桌子的左边还是右边"
你可能觉得,让AI理解空间关系是个新鲜的高难度任务,但事实并非如此。现在主流的VLM,比如Qwen3-VL,早就具备开放词汇识别、空间推理、指令理解、视频解读这些能力了。研究者们做过测试,这些模型能准确说出"沙发在壁炉旁边",能判断"左边第二把椅子"是哪一把。
这就带来一个很有意思的悖论:AI已经会"看懂空间"了,但过去几乎没有人直接拿这份能力去指挥机器人走路。大家宁愿另起炉灶造一套专门的导航模块,也没有把VLM的空间理解能力直接接到控制系统上。LightNav-0团队的思路是,与其重新发明轮子,不如干脆问一句:能不能直接把这份能力"借用"过来,让VLM亲自开车?
这个想法听起来简单,但真正做起来,中间横着一道鸿沟。
VLM理解的是图像上的像素和文字,它可以说出"目标在左边靠前的位置",但它没法直接说出"轮子转多少度,走多少米"这种精确的物理指令。一个是模糊的语义判断,一个是精确的几何控制,这两者中间需要一座桥。
LightNav-0的核心创新,就是造了这座桥。
用"指点"当作导航的通用语言
桥的第一段叫双通道指点。
具体做法是,模型在做任何决策之前,先在当前看到的画面上标出两个点:一个是affordance point
可行点,标出画面中一个安全可走、可以落脚的方向或位置,相当于告诉自己"这条路能走"
另一个是object point
目标点,标出画面中的目标物体或目的地所在的位置,比如"沙发在这里"
这两个点都不是用两个数字(横坐标、纵坐标)分别表示的,而是被编码成图像网格上的单一编号。打个比方,把画面切成一张方格纸,每个格子给一个编号,模型直接说"第483号格子",这个格子就代表了那个点的位置。
这个设计有个很实际的好处。VLM本身就是在一张二维的像素网格上"看"世界的,如果你让它去学着输出连续的浮点坐标,其实是在逼它做一件它天生不擅长的事:把视觉证据翻译成一套跟它原本表达方式完全不同的数字系统。而指点这件事,恰恰是VLM训练时天然接触过的任务形式,因为大量的开放世界图片标注数据里,早就有大量"指出图中某处"的样本。让VLM继续用它熟悉的语言说话,而不是强迫它换一套新方言,这就是为什么指点会比直接回归坐标更靠谱。
这里可以做一个类比。想象你请一个外语翻译帮你办事,这个翻译精通中文和英文,但你却非要让他用一套只有你自己看得懂的手语来汇报进度。他明明可以直接用英文告诉你"目标在左前方",你偏要他先把这句话转换成一串你发明的手势编码。结果是,原本流畅的表达变得磕磕绊绊,翻译能力被浪费了一大半。如果不用指点这种和VLM原生能力对齐的表达方式,而是强行引入全新的坐标预测头,那就等于把VLM原本积累的视觉理解能力晾在一边,重新从零训练一套陌生的输出机制,这不仅浪费了预训练的成果,还可能让模型在陌生场景下表现得不稳定。
这个指点前缀,论文里管它叫latent spatial reasoning
隐式空间推理,指模型在真正生成动作之前,先用简短的中间表示(这里就是两个点)做一次空间层面的思考,相当于"想一步再做"
这跟这几年流行的"思维链"是同一个逻辑,但过去大部分方法让AI用大段文字做推理,一步一步写出"我看到了什么,我应该往哪走",这样做的问题是每次决策都要生成一长串文字,耗时又不稳定。LightNav-0把这个思考过程压缩成固定的两个点,代价极小,却依然保留了"先想清楚再行动"这个结构。
从两个点到十步路:动作怎么变成token
光有两个点还不够,机器人真正需要的是一串具体的移动指令。这就轮到桥的第二段:RVQ动作分词器
残差向量量化动作分词器,把一段10步的连续轨迹压缩编码成三个离散符号,模型生成这三个符号就能还原出完整的移动路径
这个设计要解决的问题是,语言模型天生只会吐出离散的符号(也就是token),可机器人走路需要的是连续的坐标变化,这两者之间存在天然的不匹配。
论文的做法是分层量化。第一层用一个包含256种选项的"粗糙动作词典",先框定一个大致的运动方向,误差大概在0.9米左右。第二层再从256个选项里挑一个,用来修正第一层留下的误差,把精度提到7厘米左右。第三层继续修正,精度进一步收窄到4厘米左右。三层叠加起来,256的三次方,也就是超过1600万种组合,全部只用三个token就表达完了。
这个层层修正的逻辑,其实就跟你用尺子量东西差不多。先用米尺量出大概几米几,这是第一层的精度;再拿卷尺细量到厘米级,这是第二层;最后拿游标卡尺量到毫米级,这是第三层。每一层工具的作用都是去修正上一层量出来的误差,而不是重新量一遍。如果没有这种分层设计,直接让模型一次性输出一个高精度的坐标,那就相当于让你蒙着眼睛直接说出"这根木棍长37.482厘米",这几乎是不可能精确完成的任务,而且训练起来也极其困难,因为语言模型的输出空间是离散的,却要硬凑出连续精度,误差会被无限放大。
论文里给出了具体数字:三层全部解码后,平均位移误差是0.72厘米,而如果用一种叫VADv2
一种自动驾驶领域常用的单层向量量化轨迹方案,用单个token表示一整条轨迹,不做残差修正
的单层方案,误差是2.48厘米。差了三倍还多。这说明分层修正不是锦上添花,而是精度的关键来源。
更妙的是,这套设计还留了一个"应急开关"。如果机器人算力吃紧,或者对实时性要求很高,可以只解码第一个token,拿到一条粗糙但可执行的轨迹,牺牲一点精度换取速度。这种"用几层就有几层的可用结果"的弹性,在实际部署时非常实用。
记性也要分远近亲疏:视觉历史怎么压缩
机器人在移动过程中会不断看到新画面,如果把每一帧都原样存起来喂给模型,视觉token的数量会无限膨胀,很快撑爆模型的处理上限。
LightNav-0借鉴了一个心理学概念,叫Ebbinghaus forgetting curve
艾宾浩斯遗忘曲线,一个描述人类记忆随时间推移而逐渐衰退的心理学规律,越久远的记忆细节丢失得越快
做法是,越新的画面,采样频率越高、保留的细节越丰富;越旧的画面,采样越稀疏、压缩得越粗糙。当前这一帧永远保持最高分辨率,而几十秒前的画面可能只剩下寥寥几个模糊的token。
这跟你回忆一场旅行很像。你能清楚记得昨天下午发生的每一个细节,几点出门、吃了什么、遇到谁,但一个月前那次旅行,你可能只记得大致去了哪个城市、印象最深的一两个瞬间,中间琐碎的过程早就模糊成一团。如果非要让大脑对每一分钟都保持同等清晰度的记忆,那大脑的存储和处理负担会成倍增加,最终反而什么都记不住。视觉历史压缩就是把这个"该忘的忘、该记的记"的机制搬到了机器人的感知系统里,在有限的token预算内,同时保留长期的场景脉络和短期的动作细节。
一套语料喂出全能选手:数据从哪来
光有巧妙的架构还不够,模型得吃到足够丰富、足够干净的数据才能真正学会导航。
LightNav-0的训练语料分成两大块。第一块是embodied reasoning
具身推理数据,用来强化模型的空间理解、时间推理和视觉定位能力,不直接涉及导航动作,而是打基础
这部分数据来自36个来源,涵盖单图问答、视频推理、多图对应、指点定位等等,占比最大的是"指点"类数据,接近35%。这一步的作用是先让模型把"看懂空间"这件事练扎实,再谈导航。
第二块才是真正的导航数据,来自16个导航来源加33个辅助来源,总共覆盖2000多个场景、4000多个小时的轨迹,包括指令跟随、物体搜索和视觉跟踪三大类任务。有意思的是,训练时并没有把这三类任务完全分开对待,它们被打散混在同一个训练流里,模型看到的每一条样本,输出格式都是统一的:一个可行点,一个目标点,三个动作token。这种设计让模型不用区分"我现在在做哪个任务",因为任务的语义信息已经隐含在指令文字和监督格式里了。
论文还专门造了一个新的评测集,叫INSIGHT-Bench
一个融合了传统网格地图和三维高斯泼溅重建场景的导航评测基准,包含1683个训练场景和210个独立的评测场景,覆盖公寓、别墅、商业空间、机构建筑和户外五种场景类型
这个基准的特别之处在于,它不只是简单地问"机器人有没有到达目标",而是设计了一套两轴诊断体系。一个轴是场景类型,一个轴是指令类型,指令又细分成基础指令、方向指令、关系指令、极值指令(比如"最左边的桌子")、序数指令(比如"从左数第二把椅子")。这样设计出来的评测结果不再是一个笼统的成功率,而是能清楚看出模型在哪种场景、面对哪种语言表达时更容易翻车。
三步走的训练配方
模型的训练分三个阶段。第一阶段是embodied reasoning中期训练,让Qwen3-VL-4B这个基础模型先专门补一补空间理解的课,这个阶段结束后得到的模型叫LightNav-ER。第二阶段是监督微调,把导航数据和之前学到的推理能力放在一起训练,防止模型学了导航就忘了原本的通用能力,这里还用了一种叫DAgger
一种让模型在自己犯的错误状态下继续学习的技术,而不是只在专家演示的标准状态下学习,能缩小训练和实际部署之间的差距
的技术,让模型接触到自己走偏之后的真实场景,而不只是完美的专家轨迹。第三阶段是在线强化学习,用GRPO
一种去掉了传统强化学习里"价值函数"的策略优化算法,通过同一批次内多次尝试的相对好坏来计算优势,简化了训练流程
针对三类任务设计了三套不同的奖励函数,跟踪任务看重视野保持和距离恰当,指令跟随看重路径和终点的双重吻合,物体导航则更看重路径效率。
这里有个细节值得多说一句。做在线强化学习最大的痛点是仿真环境跑得慢,而且大量样本压根没有训练价值,因为一个模型永远能做对的任务和永远做不对的任务,都不会产生有意义的梯度信号。研究者的做法是先用监督好的模型跑一遍所有候选任务,把它们分成"总是能做对"、"有时对有时错"、"总是做不对"三类,然后重点训练"有时对有时错"这批任务,因为只有这批任务的多次尝试之间存在差异,才能真正驱动模型学习。这跟老师批改作业时的经验很像,一道全班都会做的题和一道全班都不会做的题,拿来讲评的价值都不大,真正值得花时间讲的,是那些"有人做对有人做错"的题,因为这才能暴露出学生之间真正的思维差异。
结果说话:一个模型打赢十个赛道
论文里最硬核的部分,是拿这一个模型去跟十个不同的公开仿真评测硬碰硬,结果全部拿下最强单目(只用一个摄像头,不借助深度信息和里程计)成绩。
方法 | R2R成功率 | RxR成功率 | HM3D v1成功率 | HM3D v2成功率
Qwen-RobotNav-8B | 65.7 | 73.4 | 73.7 | 77.0
DualVLN | 64.3 | 61.4 | -- | --
Uni-NaVid | 47.0 | 48.7 | 73.7 | --
LightNav-0 | 68.5 | 73.6 | 74.5 | 79.5
在开放词汇物体导航HM3D-OVON这个更难的评测上,LightNav-0在未见过的类别设置下,成功率从此前最好的39.5提升到47.0,涨了7.5个百分点,将近两成的相对提升。在具身视觉跟踪任务里,面对干扰目标的场景,成功率从73.3提升到82.6,同时把碰撞率也压低了不少。
INSIGHT-Bench这个自建评测集上,差距更明显。LightNav-0的成功率是43.7,而对比的六个开源模型里最好的JanusVLN只有27.4,差了16.3个百分点,相对提升接近六成。细看指令类型,方向类指令的提升最猛,从29.7涨到57.7,几乎翻倍。这背后的原因也不难理解,方向类指令要求模型准确判断"左边""右边""身后"这些以自身为参照系的空间关系,而这恰好是指点这套机制最擅长的地方,因为标注数据里本来就带着精确的相机朝向和目标像素位置。
不过也不是每个维度都完美。极值类指令(比如"最左边的桌子")依然是最难啃的类型,成功率只有37.2,因为要判断"最左边",模型得先在画面里找到好几个同类候选,再比较它们的相对位置,这对单一前向摄像头来说信息量本身就有限。
从游戏世界到真实街道的零样本迁移
最能说明这套方案泛化能力的,是论文里展示的跨域测试。同一个模型checkpoint,没有做任何针对性微调,就直接扔进反恐精英1.6、我的世界、毁灭战士、拉力赛车这四款画风完全不同的游戏里。它在反恐精英里跟着"绕过箱子沿上层通道走到B点"这种多步指令走,在我的世界里追着一只移动的苦力怕不放,在拉力赛车里对着赛道上的checkpoint环开车过去。
这几款游戏的视觉风格、场景结构、控制方式几乎没有任何共同点,但模型都能拿捏得住,这说明它学到的不是某个游戏的具体套路,而是一种更底层的东西:怎么在画面里找到能走的地方,怎么锁定该去的目标。
真实世界的部署更直接。研究团队把同一个模型分别装到人形机器人、四足机器人、无人机、轮式机器人这四种完全不同的物理平台上。有意思的是,跟踪能力的训练数据里只有人类目标,但实际部署时,模型能顺利跟踪它从没见过的人形机器人、轮式机器人、小推车,这种跨类别的目标识别能力,并不是靠额外训练数据堆出来的,而是模型本身的开放词汇理解能力在起作用。
论文还专门做了一套通用的通信接口,让高层的"看画面出轨迹"这套逻辑保持不变,具体到每个机器人平台,只需要一个轻量的执行层把轨迹翻译成对应的速度指令和里程计反馈。这种做法本质上是把"决策的大脑"和"执行的手脚"彻底解耦,大脑不需要知道自己长在哪种身体里。
规模到底该往哪个方向扩
论文最后做了一组扩展性实验,挺值得琢磨。
把模型从2B参数扩到4B,R2R的成功率从59.9涨到68.5,涨幅明显。但再从4B扩到8B,成功率反而掉了1.6个点。这个结果有点反直觉,一般人的默认预期是参数越多效果越好,但这里给出的答案是,在这个规模区间,参数量继续加码,收益已经不明显,甚至可能因为训练难度增加而适得其反。
数据量的扩展效果是单调递增的,但收益越往后越小。从十六分之一的数据量扩到全量,成功率涨了15个百分点,但从二分之一扩到全量,只多涨了不到1个点。
真正让人意外的是场景数量的扩展。把训练场景从八分之一扩到全量,R2R成功率涨了16.7个百分点,涨幅甚至超过同等比例的数据扩展。这说明比起简单堆叠更多的重复轨迹,让模型见识更多不同的场景,才是性价比最高的投入方向。这个结论对做数据工程的人来说,其实挺有启发:与其在同一批场景里反复采集更多轨迹,不如想办法拓宽场景的种类和数量。
写在后面
读到扩展性实验那部分时,最让我意外的是场景多样性居然比模型参数量更重要。这跟大家过去对"大模型就该无脑堆参数"的直觉不太一样,至少在导航这个具体任务上,数据的广度比模型的深度更划算。这也许暗示了一个更普遍的规律:对于需要泛化到未知环境的任务,见多识广比脑子大更管用。
另一个让我反复琢磨的细节是,论文提到跟踪能力的训练数据只包含人类目标,但模型部署后却能跟踪从没见过的机器人和推车。这说明这套系统学到的不是"人长什么样",而是"怎么持续锁定一个移动物体并保持合适距离"这个更抽象的能力。这种能力的迁移,某种程度上比单纯的准确率数字更让人兴奋,因为它意味着模型抓住的是任务的本质结构,而不是训练数据的表面特征。
论文里也留了一个没解决的问题:目前整个系统只有一条决策通路,快速的避障反应和缓慢的语义规划混在同一个流程里处理。如果机器人在闹市区突然窜出一个行人,模型需要先完成"看画面、想空间、生成轨迹"这一整套流程才能反应,这个链路会不会太长了?未来如果真能拆出一个专门处理紧急情况的快速反射层,配合现在这套偏慢的语义规划大脑,会不会更接近真实世界里人类"先躲后想"的反应模式?这个问题,论文自己也承认还没有答案。
Q&A
Q1:LightNav-0是什么?
A:LightNav-0是一个基于Qwen3-VL-4B改造的通用导航模型,用双通道指点和残差向量量化动作分词器,让单一模型同时支持指令跟随、物体搜索和视觉跟踪三类导航任务,还能零样本迁移到人形、四足、飞行、轮式四种机器人上。
Q2:LightNav-0和传统导航系统的区别是什么?
A:传统系统需要为每个任务、每种机器人单独设计感知、地图和动作模块,而LightNav-0只用一个摄像头画面输入,通过统一的指点加动作token接口处理所有任务,不需要任务专用的预测头或embodiment专用的动作专家。
Q3:INSIGHT-Bench是什么,为什么要新建这个评测集?
A:INSIGHT-Bench是论文自建的导航评测基准,包含1683个训练场景和210个评测场景,按场景类型和指令类型两个维度诊断模型表现,能精确看出模型在哪类场景、哪种指令表达下容易出错,而不只是给一个笼统的成功率。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.