网易首页 > 网易号 > 正文 申请入驻

前沿分享丨Jim Fan、李飞飞团队新作:机器人也能「上下文scaling」

0
分享至

转自 学术头条

过去,受限于极短的上下文窗口,机器人很快就会遗忘刚刚发生的一切。那么,机器人能不能像当前的大语言模型(LLM)一样,记住并利用更长的上下文?

针对这一问题,英伟达高级研究科学家 Jim Fan 与斯坦福大学教授、“AI教母”李飞飞团队及其合作者,推出了机器人模型与训练方案 RoboTTT(Test-Time-Training Robot Policies),将视觉运动上下文扩展到 8K 时间步,相当于 5 分钟的“肌肉记忆”,比现有 SOTA 策略高出 3 个数量级,且不增加推理延迟。


论文链接:https://arxiv.org/abs/2607.15275

这意味着,RoboTTT 可以将一整段视频作为上下文输入,并根据人类视频进行一次性模仿。它还拥有实时“自我改进”的能力,能将修正信息纳入上下文,并在执行中不断调整动作,从而在多阶段长程任务上取得更好的表现。

研究团队表示,上下文长度将成为机器人基础模型的新 scaling 方向:使用 8K 时间步上下文训练的 RoboTTT,比使用 1K 时间步预训练的同一模型取得了 +62% 的性能提升。Jim Fan 甚至在 X 上发帖称:“很快,即使是 100 万上下文,也不再是幻想。”

面向机器人策略的长上下文建模

RoboTTT 将测试时训练(TTT)嵌入机器人基础模型,用快速权重作为模型的循环状态。每次接收传感器输入,模型都会执行一步梯度更新,把历史信息写入权重。这样做的好处是,由于隐藏状态大小固定,机器人可以在较低开销下保留更长历史信息,并在部署后继续学习。


图|RoboTTT 的模型架构、训练和推理。

RoboTTT 主要包含三项设计,如下:

1.模型架构:RoboTTT 由视觉-语言模型(VLM)骨干和带有 TTT 层的 DiT 动作头组成。注意力层处理单个时间步内的信息,TTT 层加在注意力层之后,负责沿时间维度处理跨时间信息。为提高效率,模型不直接将所有视觉-语言 token 输入 TTT 中,而是使用少量 register token 在时间上传递视觉-语言信息。为保留预训练能力,TTT 输出经 Tanh Gating 后再加入注意力输出。


图|带有 Tanh Gating 的计算流程。

2.序列训练:为扩展训练上下文的长度,RoboTTT 结合了序列动作强制和截断反向传播算法。训练时,序列动作强制为每个动作块独立采样噪声水平,以稳定 flow-matching 训练;TBPTT 将长序列切分为片段,只在片段内反传梯度,但让快速权重继续跨片段传递,这样既能让 TTT 贯穿整条序列,又能把显存开销控制在片段长度范围内。


图|TBPTT。

3.长上下文约束:RoboTTT 会把部分时间步只作为上下文使用,这些时间步会写入快速权重,但不参与动作损失计算。基于这一机制,模型可以从两类上下文中学习:

  • 视频模仿:人类视频作为上下文,只更新快速权重;动作损失在同任务机器人轨迹上计算。测试时,单个人类视频即可作为未见配置的条件。
  • DAgger 蒸馏:完整 DAgger 轨迹都会更新快速权重,其中次优机器人动作提供失败上下文,人类纠正动作提供监督目标;损失只在人类纠正动作上计算,把失败后的纠正方式写入快速权重。


图|DAgger 蒸馏。

上下文越长,性能越强

研究团队在三个长程双臂装配任务上评估了 RoboTTT。整体而言,RRoboTTT 能够利用自身更多的历史信息进行训练,除了上述更强的闭环性能之外,它仅需一段包含上下文信息的人类视频即可进行一次性模仿、实时自我改进以及对物理扰动鲁棒


图|评估任务。

1.在长程任务上持续优于基线

主评估显示,RoboTTT 的平均任务完成分数达到 79%,高于单步上下文基线 GR00T N1.7 和将 TTT 层替换为 Gated DeltaNet 的 GDN。


图|主评估:三个装配任务上的任务完成分数。

此外,RoboTTT 也是完全成功次数最多的方法,尤其是在平均约 5 分钟、包含 10 个阶段的“齿轮机器人”(Gear Bot)任务上,RoboTTT 是唯一完整完成任务的方法。


图|主评估:三个装配任务上的完全成功试验次数。

简单拼接过去观测并不能可靠提升表现。在 Pup Go Car(玩具车装配)任务上,加入一个历史帧的 GR00T N1.7 Hist 得分为 39.5%,低于只看当前观测的 GR00T N1.7(57%)。GDN 将历史压缩为循环状态,但没有在所有任务上带来提升。

RoboTTT 更善于跟踪任务进度、恢复错误和完成细粒度操作。在视觉相似的多阶段装配中,RoboTTT 能更好地区分当前阶段;电钻未对准螺丝时,它也会重新对齐并再次尝试;在插入、扣紧电路组件等细粒度操作中,动作也更精确。

2. 预训练上下文越长,闭环表现就越好

研究团队将预训练上下文从 128 扩展到 8K 时间步后评估发现,RoboTTT-8K 的平均任务完成分数达到 71.5%,比 1K 版本高 63%,比短上下文基线高 57%,且没有出现饱和迹象。相比而言,上下文变长后,GDN 却没有获得同样的性能提升。

研究团队认为,这一差异来自更新机制,RoboTTT 通过梯度下降更新快速权重,并学习快速权重的初始化和更新方式;GDN 则使用线性关联状态,不具备这种元学习机制。


图|闭环性能随预训练上下文长度扩展而提升。

3.one-shot 模仿与扰动鲁棒

RoboTTT 能基于上下文中的人类视频完成 one-shot 模仿。在 Circuit(电路装配任务中),机器人只能通过上下文中的人类视频判断该装配哪种电路配置。结果显示,RoboTTT 在 10 次未见配置试验中成功 6 次,任务完成分数为65%;GDN 没有取得完全成功,任务完成分数为 33%。


图|从上下文内人类视频进行一次性模仿。

长上下文约束也提升了扰动恢复能力。当人类在游戏过程中移除已安装的部件时,RoboTTT 会根据自身的部署情况返回并重新安装该部件。车顶被移除时,RoboTTT 的恢复率为 75%,高于 GDN 的 65% 和短上下文基线的 50%;轮胎被移除时,RoboTTT 与 GDN 的恢复率均达到 90%,也高于短上下文基线。

4.更强的即时恢复能力

RoboTTT 具备更强的即时恢复能力,并优于标准 DAgger。标准 DAgger 只在人类纠正动作上微调,平均提升9%;DAgger 蒸馏把完整轨迹作为上下文,包括次优机器人动作,但只在人类纠正动作上计算损失,平均提升 33%。通过 DAgger 蒸馏,RoboTTT 学习了一种隐式纠错算法,并能在线从自身的错误中恢复,无需人工干预。


图|DAgger 蒸馏在 Pup Go Car 上的结果。

不足与未来方向

研究团队指出,尽管 RoboTTT 展示了上下文长度作为机器人基础模型新 scaling 轴的潜力,但仍存在一些不足。

首先,扩展训练上下文长度会增加训练成本。虽然 RoboTTT 在推理时保持成本恒定,但训练更长上下文仍需要更多开销。未来,研究人员应采用更高效的 TTT 训练技术(如 TNT)来降低这一成本。

其次,TTT 层的目标函数仍有探索空间。当前工作提出了一种将 TTT 整合进机器人基础模型的方法,但面向机器人的 TTT 层目标(类似视觉领域中的相关探索)将是一个有潜力的方向。

此外,RoboTTT 仍未覆盖部署中可能出现的全部失败模式。研究团队表示,RoboTTT 与强化学习结合,直接优化任务成功率,有望进一步提升实际执行表现。

更多技术细节,详见原论文。

作者:夏千斯

【免责声明】转载出于非商业性的教育和科研目的,只为学术新闻信息的传播,版权归原作者所有,如有侵权请立即与我们联系,我们将及时删除。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
网传中国农大一学生因不当言论被开除,网友不服……

网传中国农大一学生因不当言论被开除,网友不服……

慧翔百科
2026-09-10 17:21:21
曝网红“深圳六哥”去世!年仅47岁,欠大几百万,张大炮还有30万

曝网红“深圳六哥”去世!年仅47岁,欠大几百万,张大炮还有30万

裕丰娱间说
2026-09-10 06:27:50
卫健局长开会当场哽咽!医院连工资都快发不出,谁看了不心酸?

卫健局长开会当场哽咽!医院连工资都快发不出,谁看了不心酸?

医脉圈
2026-09-10 12:29:32
网友:谁都不服,就服郭德纲!官方通报都已经出来了,他本人硬是不道歉、不露面、不发声明!

网友:谁都不服,就服郭德纲!官方通报都已经出来了,他本人硬是不道歉、不露面、不发声明!

谭谈社会
2026-09-09 18:13:09
越南女星回应合照被刘亦菲裁掉了:我会更加努力

越南女星回应合照被刘亦菲裁掉了:我会更加努力

韩小娱
2026-09-10 08:32:00
“高考数学132分,入学考试12分”,大学回应

“高考数学132分,入学考试12分”,大学回应

第一财经资讯
2026-09-10 11:04:09
长达3小时10分钟的闭门密谈后,美方方案被披露:克里米亚划归俄罗斯,乌克兰须在宪法中承诺永不加入北约

长达3小时10分钟的闭门密谈后,美方方案被披露:克里米亚划归俄罗斯,乌克兰须在宪法中承诺永不加入北约

人生录
2026-09-10 00:05:15
除了整体实力差距,中国女篮惨败法国29分,还因宫导迷恋使用1人

除了整体实力差距,中国女篮惨败法国29分,还因宫导迷恋使用1人

我就是一个说球的
2026-09-10 22:28:18
湖北小县城的工资已经开始崩塌

湖北小县城的工资已经开始崩塌

火锅局
2026-09-10 13:09:05
官媒发文,高调宣布57岁王菲喜讯,与谢霆锋分手传闻早已真相大白

官媒发文,高调宣布57岁王菲喜讯,与谢霆锋分手传闻早已真相大白

秋姐居
2026-09-10 14:26:08
45年,全国小学从91.7万所降到12.83万所

45年,全国小学从91.7万所降到12.83万所

老郭在学习
2026-09-10 16:32:25
重庆一初二女生在楼道里遭殴打,嫌疑人已被抓获,公安局长通宵审问,刑事拘留2人行政拘留3人

重庆一初二女生在楼道里遭殴打,嫌疑人已被抓获,公安局长通宵审问,刑事拘留2人行政拘留3人

扬子晚报
2026-09-10 15:32:19
快讯!巴基斯坦可能要打大仗了!

快讯!巴基斯坦可能要打大仗了!

故事终将光明磊落
2026-09-10 10:55:49
私吞上亿善款真相终于大白?官方正式宣布,54岁韩红身份迎来转变

私吞上亿善款真相终于大白?官方正式宣布,54岁韩红身份迎来转变

乌克兰小静
2026-09-10 09:09:45
韩旭21+9杨舒予19分,女篮双核苦苦支撑,29分不敌法国止步8强

韩旭21+9杨舒予19分,女篮双核苦苦支撑,29分不敌法国止步8强

钉钉陌上花开
2026-09-10 22:02:58
“忍耐并非没有限度” ,俄方警告:俄罗斯有权使用核武器,支持乌克兰的西方国家正在将世界推向核灾难边缘

“忍耐并非没有限度” ,俄方警告:俄罗斯有权使用核武器,支持乌克兰的西方国家正在将世界推向核灾难边缘

每日经济新闻
2026-09-10 17:09:41
马来亚大学回应“长沙摸臀事件”:已收到对当事女生的举报,将采取必要措施

马来亚大学回应“长沙摸臀事件”:已收到对当事女生的举报,将采取必要措施

可达鸭面面观
2026-09-10 17:23:31
脸都不要了!湖南洞口孩子买了50元学平险,结果真得癌了,谁料保险公司翻出国际疾病分类,说编码不对,不符合“恶性肿瘤-重度”条款

脸都不要了!湖南洞口孩子买了50元学平险,结果真得癌了,谁料保险公司翻出国际疾病分类,说编码不对,不符合“恶性肿瘤-重度”条款

火山詩话
2026-09-10 10:40:36
“打我妈不行”,排队冲突中老人多处骨折,不予刑事立案

“打我妈不行”,排队冲突中老人多处骨折,不予刑事立案

中国新闻周刊
2026-09-10 20:35:09
华人女子希腊失踪案最新进展:一公园内发现其护照被撕成22块碎片,附近有人类骸骨

华人女子希腊失踪案最新进展:一公园内发现其护照被撕成22块碎片,附近有人类骸骨

红星新闻
2026-09-10 13:15:44
2026-09-11 00:47:00
中国人工智能学会
中国人工智能学会
中国人工智能学会网易官方账号
4281文章数 1492关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

外媒:伊朗捕获美国"大鱼"后发了条消息 令五角大楼受挫

头条要闻

外媒:伊朗捕获美国"大鱼"后发了条消息 令五角大楼受挫

体育要闻

16岁的国产小库里,还有多少功课要做

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

标配全线控底盘 全新一代智己LS6预售20.99万起

态度原创

本地
房产
健康
游戏
公开课

本地新闻

拼假 13 天国内长线路线合集

房产要闻

别不服!海南的亿万富豪,只有不到300个!

牙疼,也可能跟心梗有关?!

R星下一作是《荒野大镖客3》?怕不是又要等10年

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版