网易首页 > 网易号 > 正文 申请入驻

从认路到「跌倒再战」,机器人也在重走大模型的Scaling之路?

0
分享至

机器之心发布

过去三年,大模型走完了一条已被反复验证的路:先在海量数据上预训练出能力,再用对齐把能力变成可用性,最后靠大规模部署中的真实反馈持续进化。GPT-3、InstructGPT、ChatGPT——三步,一步一个台阶。

于是一个问题开始在具身智能行业里产生:这条路,能不能在物理世界原样再走一遍?

提出这个问题,是因为具身智能正卡在一道与当年大模型相似的“鸿沟”前:模型在仿真榜单上分数越刷越高,演示视频越拍越炫,但真正放到真实环境里,换一个场景、换一台机器,往往就要重新采数据、重新训练。而在物理世界里,差一点就是失败,而失败之后,大多数机器人只能停在原地等人来解决。榜单上的领先,与真实世界的可用之间,始终隔着一段距离。

最近几天,一家名为亮源新创的具身智能公司,用两次技术发布给出了自己的回答:9 月 1 日,开源通用导航模型LightNav-0;9 日又发布了机器人韧性控制技术Light REACT





前者对应“对齐”,后者对应“部署”。两次发布落子的位置,严格对着大模型那三步棋。

这并不奇怪。这家公司的创始人姜旭,此前是 OpenAI 的算法专家,方向是 RLHF,而这正是 ChatGPT 背后的对齐方法。他创业后率先提出“规模化预训练(Scalable Pre-Training)、规模化对齐(Scalable Alignment)、规模化部署(Scalable Deployment)”的三段范式。他的信条是:通用比专用重要;即先实现全场景的泛化,再走向全场景的精确。与“先在单一场景做精、再谈泛化”仍是主流打法相比,这算得上是一条 “反共识”路线。

亲历者

参与过“能力如何变成可用性”的完整答案

要理解这家公司为什么这么下棋,得先回到 RLHF 在大模型历史上的位置。

2020 年的 GPT-3 已经证明了规模化预训练的威力,但它本质上只会“补全下一个词”。看起来能力惊人,却谈不上好用。真正的转折发生在对齐:InstructGPT 用人类反馈的强化学习,把“会补全”驯化成“会干活”,同一个基座模型,交互体验天差地别。再往后,ChatGPT 把对齐后的模型推到亿级用户面前,真实使用中暴露的问题源源不断回流,成为下一代模型的养料。也就是说,能力、可用性、进化速度,分别来自三个不同的环节,这是大模型行业用五年时间换来的认知。

姜旭的履历恰好穿过其中最关键的一环。在 OpenAI 从事 RLHF 研究,意味着他是从一线看到了“对齐”如何把一个只会补全的模型变成改变行业的产品。也就是说,当很多团队还在讨论范式的理论框架时,他已经见过这套范式完整运转一遍的成果。

这段经历,解释了这家公司技术选择里那股罕见的笃定:

  • LightNav-0的后训练严格按“中期训练—SFT—在线 RL”三阶段展开,几乎是大模型后训练流程的具身翻版;
  • Light REACT则干脆把偏好对齐做进了机器人全身控制:先通过监督学习整合起身、行走和爬行技能,再用强化学习对齐“能站着走,就别爬”的人类偏好。

十天内两连发

对齐与部署,各落一子

9 月 1 日开源的LightNav-0,解决的是“认路”。它以开源视觉语言模型为基座,不添加任何导航专用模块,同一套模型权重,可以零样本地部署到人形、四足、轮式乃至飞行机器人上。模型无需采新数据、不做微调,就能听懂自然语言指令,自己找路。

据其技术报告,该模型在 10 项公开仿真评测中取得领先;一个被复现者格外留意的细节是,仅用单目 RGB、不依赖深度与里程计,它在动态跟踪基准上的成绩超过了使用全景与多相机的系统。传感器配置降级、成绩反超,这类反直觉的数字,往往最能说明方法本身的含金量。



LightNav-0 在公开视觉语言导航评测基准上实现全面领先

设计上也有巧思:为了让模型“记住来路”又不被历史观测撑爆,团队按人类记忆的遗忘曲线来分配注意力,即越久远的画面,保留得越粗略,眼前的画面保留最高精度。数据则没有走遥操作采集的路,而是把 2000 余个真实场景转化为仿真资产,在其中合成了 4000 余小时训练数据。也就是说,真实世界负责定义数据分布的边界,仿真负责在这个边界内规模化合成,具身后训练由此跨过了最难的冷启动门槛。



视频链接:https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww

落到工程细节上,基座是Qwen3-VL-4B-Instruct,团队没有为导航添加任何专用头,而是选择了扩展词表。

双通道指点(dual-channel pointing)token在图像坐标系中表达与任务、场景、本体无关的空间意图;残差向量量化(RVQ)动作分词器再把意图落成 10 步 SE(2)轨迹——一个粗码本加两级残差码本,分辨率依次约 0.9 米、7 厘米与 4 厘米,全部经由基座原生的自回归语言头解码。历史观测按遗忘曲线压缩:采样率随帧龄指数衰减、空间池化步长指数增长,支持 256K 至 1M 三档像素预算。后训练沿“ER 中期训练—具身 SFT—在线 RL”三阶段推进;发布时还附带了一套面向部署的评测:210 个真实室内外场景、1097 个 episode。

一周后的Light REACT,解决的是“摔不垮”。发布前几天,一段测试视频先在 X 上传开:一台双腿被捆住的人形机器人,起身失败后转为爬行,脱困、绳索剪断,再自行站起走掉。全程一个策略网络,没有模式切换,没有人工介入。



视频链接:https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww

技术博客把“韧性”拆成了一座四层金字塔:身体完好时按指令行走;被推搡、被撞倒后自己爬起来;部分关节断电或锁死时,换一种步态(比如跛行、单足跳)继续移动;伤到双足行走在物理上已不可行,就转入爬行,保住移动能力本身,而不是保住某一种走法。

真机演示里最耐人寻味的一幕:机器人双膝“过热断电”后跛行,中途电力恢复(没有任何信号告知它),它从自己身体最近的反应里推断出“腿又能用了”,自行站回直立行走。

配方上,Light REACT(REsilient humAnoidConTrol)分三步走:

  1. 先在动力失效、关节锁死、膝折叠约束三类伤损域上,训练 6 个域专用教师(每域一个“恢复—行走”教师、一个“爬行”教师);
  2. 随后以 DAgger 式多教师蒸馏并入单一学生策略,学生只接收速度指令与本体感知,伤损识别被整体推迟为对交互历史的上下文推断;
  3. 最后以偏好强化学习对齐“可直立则直立”。

承载这一切的,是一个支持全身上下文学习(Whole-Body In-Context Learning)的 Transformer 单一模型:不依赖故障标签、不做模型切换、不做部署期权重更新。

团队将韧性称为规模化部署的“最后一公里”:机器人先得摔不垮,部署产生的经验流才不会中断,数据飞轮才转得起来。

LightNav-0 开源不到一周,已有第三方在消费级显卡上完整跑通官方模型并公开实测;海外技术博主对那段绑腿视频的评价是:一套策略搞定行走、爬行与摔倒恢复,“令人印象深刻”。在这个惯于用剪辑视频讲故事的赛道里,“可下载、可复现”正在成为一种更稀缺的说服力。

拼图

算法判断、训练工程与真机落地的互补阵型

把大模型的路线搬进机器人,需要的远不只是一个想法。这条技术链路天然横跨多个领域:既要有对范式与算法的判断,决定资源投向哪里;也要有大规模模型训练的工程能力,把判断变成模型;还要有真实机器人上的控制与落地能力,让模型在物理世界里兑现。三块能力,缺一块,链条就断在那一环。

围绕这条技术链路,亮源新创搭建起一支优势互补的技术团队:CEO 姜旭牵引技术路线,推动技术范式与对齐方法的研发探索;联合创始人兼 CTO 范廷翔负责机器人整体工程与算法落地,推动模型能力在真实机器人上的集成、验证与应用。团队在大脑算法、多模态模型训练与具身 Agent 等方向设有专门负责人,协同推进算法研发、规模化训练与真机落地。据了解,公司成立于 2024 年底,目前在北京、深圳与新加坡三地设有团队。



姜旭,亮源新创创始人兼 CEO

具身智能的“部署时刻”

过去两年,具身智能的竞争主要发生在榜单和演示视频里。但一个判断正在业内形成共识,即下一阶段的胜负手在别处:当机器人真正走出实验室,谁能让它们在真实世界持续运行、持续回传经验,谁才拥有属于自己的数据飞轮。

特斯拉在自动驾驶上验证过这个逻辑,北美的人形机器人公司也在反复讲同一个故事:部署规模决定数据规模,数据规模决定进化速度。这正是大模型故事里“部署”那一步的具身版本,也是所有玩家迟早要过的关。

从这个视角回看,亮源新创十天内的两次落子就有了另一层含义:导航解决“去哪儿”,韧性解决“倒了还能继续”——都是机器人离开实验室之前,必须先回答的问题。而按照“三段范式”的棋谱,预训练、对齐、部署三格,这家公司已经点亮了后两格的第一子。

从 OpenAI 到亮源新创,如果说姜旭此前参与回答的命题是“如何让大模型从能力走向可用”,那么接下来要回答的,是如何让同一套范式在物理世界完整转起来。

据了解,团队围绕该范式的更多技术成果仍在推进中,一款面向消费场景的机器人产品也已在研发日程上,将在适当时机对外披露。

对这家刚刚完成首次连续亮相的公司而言,十天两子只是开局。这盘棋能不能在物理世界里走通,现在下结论还早。但至少,它并不是一张凭空画出的棋谱,毕竟人们已经在数字世界里见过一次相似路径如何改变一个行业。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
心理学上说:你跟伴侣倾诉委屈时,对方的第一反应不是心疼你、理解你,反而不断回避你、指责你、反驳你,你们其实并没有在沟通

心理学上说:你跟伴侣倾诉委屈时,对方的第一反应不是心疼你、理解你,反而不断回避你、指责你、反驳你,你们其实并没有在沟通

心理观察局
2026-09-07 06:23:08
情侣在瑞士雪山顶“撒欢”,就这么被全世界直播了···

情侣在瑞士雪山顶“撒欢”,就这么被全世界直播了···

新欧洲
2026-04-21 19:37:05
董路九年,终于爆发了,吕孟洋之后,又有两个孩子进了西班牙球队

董路九年,终于爆发了,吕孟洋之后,又有两个孩子进了西班牙球队

体育全天候
2026-09-13 19:32:57
起售价15999元,被黄牛炒到9万元,近100万人预约苹果折叠屏,网友:太疯狂

起售价15999元,被黄牛炒到9万元,近100万人预约苹果折叠屏,网友:太疯狂

鲁中晨报
2026-09-12 09:59:11
奥委会这下尴尬了:2036年奥运会,中国上海、成都、广州都没申办

奥委会这下尴尬了:2036年奥运会,中国上海、成都、广州都没申办

轻扬墨雨
2026-08-14 13:21:23
第二架确认:巴斯基坦歼-10刷上击落标志,又来自第15眼镜蛇中队

第二架确认:巴斯基坦歼-10刷上击落标志,又来自第15眼镜蛇中队

混沌录
2026-09-13 23:15:14
心理学:尽量不要跟任何人,包括你的枕边人、熟人、子女,分享这两件事

心理学:尽量不要跟任何人,包括你的枕边人、熟人、子女,分享这两件事

心理观察局
2026-09-13 06:18:05
63岁“琏二爷”近照曝光,为维持形象常年戴假发,和红楼梦化妆师恩爱至今

63岁“琏二爷”近照曝光,为维持形象常年戴假发,和红楼梦化妆师恩爱至今

一盅情怀
2026-09-12 12:42:57
议员团碰壁回国,高市打出底牌,前外相岩屋毅即将来华探底

议员团碰壁回国,高市打出底牌,前外相岩屋毅即将来华探底

耀眼的星火
2026-09-13 22:24:35
章若楠直播回应被夸漂亮:大家卸了妆都长一样,所有人都在去包装一个产品,那能不漂亮吗?

章若楠直播回应被夸漂亮:大家卸了妆都长一样,所有人都在去包装一个产品,那能不漂亮吗?

台州交通广播
2026-09-11 21:52:19
最近宣告取消的10部好莱坞续集电影

最近宣告取消的10部好莱坞续集电影

吃青菜长高
2026-09-13 03:25:26
落后16分一度追平,辽篮2分惜败!双外援首秀合砍23分,凑合用吧

落后16分一度追平,辽篮2分惜败!双外援首秀合砍23分,凑合用吧

萌兰聊个球
2026-09-13 22:01:49
差一点就成英国王后!查尔斯的灵魂伴侣去世:若不是前男友搅局,就没戴妃卡米拉什么事了...

差一点就成英国王后!查尔斯的灵魂伴侣去世:若不是前男友搅局,就没戴妃卡米拉什么事了...

悦居英国
2026-09-13 15:57:29
俄军少将在乌大开杀戒,回到俄罗斯刚出门,就被摩托青年两枪打爆

俄军少将在乌大开杀戒,回到俄罗斯刚出门,就被摩托青年两枪打爆

爱吃醋的猫咪
2026-09-11 20:28:58
别笑!2026年还在买MP3的人,可能是真正清醒

别笑!2026年还在买MP3的人,可能是真正清醒

数码黄药师
2026-09-12 10:49:16
真的惨!8月MPV销量榜:仅2款破5千,智界V9连冠,腾势D9第6!

真的惨!8月MPV销量榜:仅2款破5千,智界V9连冠,腾势D9第6!

梦白评车
2026-09-12 20:10:06
实锤!武汉大学举报事件后续,曾教授学术造假确凿,她还有退路吗

实锤!武汉大学举报事件后续,曾教授学术造假确凿,她还有退路吗

平老师666
2026-09-13 22:24:46
马思纯抑郁期间不愿出门,井柏然坚持拉她外出,马思纯坦言对方是救了自己的人

马思纯抑郁期间不愿出门,井柏然坚持拉她外出,马思纯坦言对方是救了自己的人

阿废冷眼观察所
2026-09-13 14:30:52
吃大补的东西身体会有什么反应?网友:四十岁吃人参,头发掉光!

吃大补的东西身体会有什么反应?网友:四十岁吃人参,头发掉光!

夜深爱杂谈
2026-09-13 16:47:47
16岁的中国“小花”首夺美网冠军!

16岁的中国“小花”首夺美网冠军!

五星体育
2026-09-13 01:04:57
2026-09-14 00:04:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13985文章数 142733关注度
往期回顾 全部

科技要闻

三位AI大佬,罕见呼吁AI减速

头条要闻

烧烤店被检查15次致停业 12345:同一举报人投诉116次

头条要闻

烧烤店被检查15次致停业 12345:同一举报人投诉116次

体育要闻

魔术是今夏市场上最安静的球队

娱乐要闻

敬一丹留给世间最后的温柔

财经要闻

蔡昉:农民工落户可释放万亿消费潜力

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

本地
时尚
手机
艺术
公开课

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

伊姐周六热推:电视剧《生逢其时》;综艺《大哥小助理》......

手机要闻

华为Mate XT2麒麟9050 Pro实测出炉,游戏体验比肩骁龙8至尊

艺术要闻

被称作 "愤怒者" 的画家,把文艺复兴画成了风暴

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版