网易首页 > 网易号 > 正文 申请入驻

面向无梯度推理时学习的双过程架构:ReflexGrad

0
分享至

ReflexGrad:面向无梯度推理时学习的双过程架构

ReflexGrad: A Dual-Process Architecture forGradient-Free Inference-Time Learning

https://arxiv.org/pdf/2511.14584v2



摘要
扩展推理时计算已成为一种强大的范式——但更长时间的思考并不等同于学习。当前针对大语言模型的扩展推理方法会分配更多计算资源用于“思考”,但本质上仍是静态的:它们无法在执行过程中从自身犯下的错误中调整适应。在线强化学习能够实现适应,但需要在运行时进行梯度更新——这成本高昂、容易导致灾难性遗忘,且在部署中不稳定。我们提出 ReflexGrad,一种用于真正推理时学习的无梯度框架:无需重训练、无需权重更新、无需示范即可实现适应。我们的关键洞察是,有效的运行时学习需要两种互补机制——在前进过程中快速修正策略,以及在陷入困境时进行审慎的因果诊断——并在二者之间进行智能路由。ReflexGrad 的实现方式是,在保持模型权重冻结的同时,通过文本反馈优化一条自然语言“策略”。当失败发生时,系统会分析最近的动作-结果序列,以识别根本原因,并在同一执行过程中立即应用修正——从而无需多次试错。在多种交互式任务上进行零样本评估,且无需任务特定工程,ReflexGrad 展现了强大的单次执行性能,表明无梯度的推理时学习不仅在理论上有吸引力,而且在实际中可行。

关键词:推理时学习,双过程架构,文本梯度,自我反思,LLM智能体,零样本泛化


代码:https://github.com/qpiai/reflexgrad

1 引言

人工智能系统能否在执行过程中从错误中学习——无需权重更新、无需示范、也无需多次试错?我们将这种能力称为“推理时学习”,它将使已部署的系统能够实时适应,同时规避在线训练的成本和风险。然而,当前的方法尚不足:传统强化学习需要权重更新,这有导致灾难性遗忘的风险[8];而最近的推理时扩展方法[9, 14, 16–18]则增加了思考的深度,却并未实现真正的学习。

设想一个智能体试图冷却平底锅:它尝试“用冰箱冷却平底锅”,但失败了,因为冰箱门是关着的。即便是前沿模型[2, 11],它们知道“容器必须打开”,却常常无法在执行过程中从这类错误中恢复——它们无法提取教训并在同一回合中应用于后续动作。当前系统要么需要6次以上的试错回合才能学会此类模式[12],要么完全失败。我们的实验证实了这一差距:零样本的GPT-5在ALFWorld任务上尽管拥有强大的通用推理能力,成功率却仅为47.1%。

我们提出 ReflexGrad,一种填补这一空白的无梯度架构。受双过程认知理论[5]启发,我们认为有效的运行时学习需要三种互补机制,并辅以智能路由:

  • 任务分解:在执行前,将高层任务分解为有序的子目标(TODO列表),以提供策略结构并防止动作循环。

  • 快过程(TextGrad):通过基于动作结果计算的文本梯度信号来快速修正策略——在前进过程中提供渐进式改进。

  • 慢过程(Reflexion):在陷入困境时进行审慎的因果诊断——分析近期历史以识别系统性失败模式。

关键创新在于基于进度的路由:大约85%的步骤使用快过程以保证效率,而慢过程诊断仅在连续失败表明真正卡住时才会触发。TODO检查点则确保始终向前推进。

ReflexGrad在单次执行中,于ALFWorld上达到了95.6% ± 1.5%的成功率——比零样本基线提升了48个百分点,且可与需要6次以上回合和示范的多试错方法相媲美。跨领域评估在TextWorld上(89%对56%基线)也验证了其无需领域特定调优的泛化能力。我们的贡献如下:

  1. 统一的推理时学习架构,结合了层次化任务分解、基于文本梯度的快速策略修正,以及审慎的因果诊断——由新颖的基于进度的路由机制驱动。

  2. 基于进度的路由机制,智能地在快过程和慢过程之间分配计算资源,并借助TODO检查点防止动作循环并确保持续向前推进。

  3. 跨领域推理时学习的实证验证:在两种不同环境(共43个任务)中,无需权重更新、示范或领域特定调优,达到94.2%的平均成功率。

2 相关工作

我们将 ReflexGrad 与先前方法在三个关键维度上进行对比:(1)实时策略适应——该方法能否在执行过程中更新自身行为?(2)因果失败诊断——能否识别动作失败的根源?(3)单次试错学习——能否在不依赖多个回合的情况下实现高性能?

无适应的推理。ReAct [19] 将思维链推理与动作交错进行,支持可解释的单次决策。Inner Monologue [4] 在此基础上,将环境反馈纳入具身智能体的规划中。然而,这些方法既缺乏策略适应,也缺乏因果诊断——如果某个动作失败,推理或许会改变,但底层策略保持固定不变。智能体无法从经验中学会“容器必须打开”;它要么已经知晓这一点,要么就会反复失败。

文本梯度优化。TextGrad [20] 首次提出将大语言模型的反馈视为用于提示优化的梯度,从而实现实时策略适应。然而,TextGrad 是为离线多轮迭代优化而设计的,既缺乏因果诊断,也不具备单次试错能力——它只能建议“尝试另一个位置”,却无法识别动作失败的根源(例如,前提条件未满足)。DSPy [6] 与此类似,支持提示编程,但侧重于流水线优化。

面向智能体的自我反思。Reflexion [12] 开创了带有因果诊断的言语强化学习——通过分析失败的回合来识别根本原因。Self-Refine [10] 应用迭代式自我反馈来优化输出,而 LATS [21] 则通过结合树搜索与反思来统一推理和规划。Voyager [15] 通过开放式探索构建技能库,但需要跨回合的持久记忆。然而,这些方法要么缺乏回合内的策略适应,要么不具备单次试错学习能力:Reflexion 在执行过程中使用静态提示,只能跨回合学习,在 ALFWorld 上需要 6 次以上回合才能达到 91% 的成功率。ReflAct [7] 引入了目标状态反思,但仍依赖示范。

ReflexGrad。实现单次推理时学习的关键创新在于基于进度的路由——一种根据执行信号来决定何时使用哪种学习过程的机制。快速的策略修正处理常规调整(占步骤的 85%),而高成本的因果分析仅在连续失败表明真正卡住时才会被触发。这种路由机制带来了:(1)实时策略适应,实现快速的战术修正;(2)因果诊断,在卡顿时识别系统性失败模式;(3)层次化任务分解,配合 TODO 检查点以防止动作循环。该路由机制在单次零样本执行中达到了 95.6%的成功率——表明基于进度的路由能够实现真正的推理时学习。

3 问题表述


4 方法

ReflexGrad 通过三个互补组件结合智能路由来实现推理时学习。完整的执行循环请参见附录中的算法 1。


4.1 架构概览

ReflexGrad 包含三个互补能力:



4.2 层次化任务分解




4.3 快速策略修正(过程 1)

快速过程通过文本梯度计算提供渐进式改进,将 TextGrad 框架 [20] 适配到在线序贯决策场景中。




4.4 慢速因果诊断(过程 2)



4.5 基于进度的路由


4.6 双向耦合

这两个过程是双向耦合的:

反思 → TextGrad:反思产生的洞察会成为 π θ 中的持久约束。当慢速过程识别出“容器必须打开”这一规则后,后续的梯度计算将以该约束为上下文进行,从而确保快速过程遵循已习得的因果规则。

TextGrad → 反思:梯度历史为因果诊断提供证据。当反思分析停滞的进度时,它会接收到那些失败的梯度——从而实现更深入的诊断(例如,如果“尝试不同位置”反复失败,那么问题在于如何交互,而不在于哪里交互)。

为何二者缺一不可:TextGrad 擅长战术优化,但无法诊断结构性失败。Reflexion 擅长因果诊断,但代价高昂。ReflexGrad 将两者结合,实现了二者单独都无法提供的单次试错学习。

5 实验 5.1 实验设置

环境。ALFWorld [13],基于文本的家务任务环境,需要多步推理。

基准。在 零样本、单次执行设定下涵盖 34 个多样化任务——无示范、无先前经验、无多次试错。

模型。使用 GPT-5 进行 TODO 分解、损失计算、梯度合成和反思生成;使用 GPT-4o 进行动作选择。

基线:零样本 LLM、Reflexion [12]、ReflAct [7]。

5.2 主要结果

表 1 和图 2展示了实验结果:



强劲的单次执行性能。ReflexGrad 在无示范的情况下达到了 95.6% ± 1.5%的成功率(3 次运行中 34 个任务成功 32–33 个),比零样本 GPT-5(47.1%)提升了 48 个百分点,且与需要 6 次以上回合的多试错方法相当。

零动作循环。与基线方法每回合出现 3–8 次重复失败不同,ReflexGrad 通过智能路由实现了零循环。

错误分析。各次运行中持续出现的失败发生在“检查”类任务中,即智能体需要找到某个物体并在灯下对其进行检查。这类任务要求协调多个子目标(找到物体、找到灯、导航、使用灯)——这揭示了当因果链特别长时的一个局限性。

统计说明。结果为 3 次独立运行(使用不同随机种子)的均值 ± 标准差。相对于基线 48 个百分点的提升在各次运行中保持一致(方差为 ±1 个任务)。

计算成本。ReflexGrad 每步大约需要 4–6 次 LLM 调用(动作生成、损失计算、梯度计算、周期性策略更新)。对于一个典型的 15 步成功回合,总计约 75 次调用,而零样本基线约为 15 次(5 倍开销)。然而,ReflexGrad 在 1 次试错中即可成功,而 Reflexion 需要 6 次试错,因此在达到相同成功率时,总成本相当。

5.3 消融实验

为了分离各组件的贡献,我们在与完整系统完全相同的设置(相同模型、超参数、任务和随机种子)下,评估了仅含单一组件的变体。

分析。表 2 显示了跨环境的一致模式:(1)仅 Reflexion通过因果诊断带来了适度提升(ALFWorld +5 个百分点,TextWorld +5 个百分点),但缺乏回合内的快速适应;(2)仅 TextGrad实现了更强的战术优化(+23 个百分点,+16 个百分点),但无法诊断结构性失败;(3)ReflexGrad(+49 个百分点,+33 个百分点)将两者结合,产生的协同效应超过了各组件单独贡献之和。


5.4 跨领域泛化

为了评估泛化能力,我们在 TextWorld [3] 上进行了测试——这是一个程序化文本游戏环境,其任务结构与 ALFWorld 不同。我们使用完全相同的超参数(未进行任何调优),在烹饪、寻宝和解谜类别的 9 个任务上进行了测试。

ReflexGrad 在 TextWorld 上达到了 89% 的成功率(9 个任务中成功 8 个),而基线为 56%——提升了 33 个百分点(图 3)。综合两个领域:在 零领域特定工程的情况下,成功率达到 94.2%(43 个任务),表明推理时学习能够在根本不同的环境之间迁移。

5.5 定性分析

我们展示了两个执行轨迹,以说明双过程架构在实践中的运作方式(完整的逐步骤轨迹见附录 D)。

示例 1:双过程均需参与

任务:“冷却一个平底锅并将其放到台面上。”智能体开始搜索橱柜以寻找平底锅。TextGrad 快速学会“在搜索前先打开容器”(3 步内完成战术修正)。然而,在连续 5 步低进展地搜索橱柜后,Reflexion 被触发并诊断出根本原因:“炊具通常位于炉灶附近,而不是橱柜里。”这一策略性洞察将智能体引向炉灶燃烧器,并在那里找到了平底锅。后续步骤——拿起、通过冰箱冷却、放到台面上——在 TextGrad 的指导下顺利进行。关键洞察:TextGrad 处理“如何交互”的问题;Reflexion 决定“去哪里搜索”的问题。任务在 11 步内完成,零循环。

示例 2:仅快速过程即可胜任

任务:“将一个干净的杯子放入橱柜。”整个过程中进度评分始终保持在 4 以上——智能体在台面上找到杯子,在水槽处清洗,然后将其放入橱柜。路由函数 ϕ ϕ从未触发 Reflexion,因为进度从未停滞。仅靠 TextGrad 就通过策略更新学会了“使用水槽完成清洗任务”。关键洞察:基于进度的路由将昂贵的慢速诊断仅保留给真正需要它的任务。任务在 9 步内完成,零循环。

6 讨论

双过程为何有效。该路由实现了高效的计算分配:85% 的步骤使用快速过程处理常规修正,而 15% 的步骤触发慢速诊断以应对系统性失败。两者单独使用都无法成功——快速修正无法诊断结构性问题,而慢速诊断若在每步都使用则成本过高。这与双过程认知理论 [5] 相呼应:系统 1 处理常规决策;当模式匹配失效时,系统 2 介入。

局限性。(1)需要能力较强的大语言模型——未来工作应评估较小规模模型的表现;(2)结果基于文本环境;视觉领域可能需要适配;(3)增加更多基准(如 WebShop、ScienceWorld)将有助于进一步验证泛化性主张。

7 结论

我们提出了 ReflexGrad,一种用于无梯度推理时学习的双过程架构。通过将快速策略修正与审慎的因果诊断相结合——并基于进度信号在两者之间进行智能路由——ReflexGrad 能够在单次执行过程中实现真正的学习,无需权重更新、示范或多轮试错。我们的结果——在两个不同领域的 43 个任务上达到 94.2%的成功率——表明推理时学习在实际中是可行的,且无需领域特定调优即可泛化,为自适应 AI 系统开辟了新的方向。

原文链接:https://arxiv.org/pdf/2511.14584v2

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
零跑汽车紧急声明:已下线与蔡康永相关的全部内容,并保留追究法律责任的权利

零跑汽车紧急声明:已下线与蔡康永相关的全部内容,并保留追究法律责任的权利

都市快报橙柿互动
2026-10-05 00:27:48
事态升级!蔡康永风波扯出5位港台明星,已不是道德问题这么简单

事态升级!蔡康永风波扯出5位港台明星,已不是道德问题这么简单

孤城落日
2026-10-05 16:53:01
特朗普:我和金正恩相处得很好,若有人拥有112枚核武器,应当与他保持良好关系

特朗普:我和金正恩相处得很好,若有人拥有112枚核武器,应当与他保持良好关系

台州交通广播
2026-10-05 08:37:45
深圳APEC开幕在即,高市称谓被撤!中方拒认“首相级”外交名分

深圳APEC开幕在即,高市称谓被撤!中方拒认“首相级”外交名分

无情有思可
2026-10-05 16:13:32
《兰香如故》大结局:吕蕺儿经商20年重回金陵!许兰香独撑林家濒临绝境,蕺儿携十万两白银救急,两姐妹后巷抱头痛哭:我再也不走了

《兰香如故》大结局:吕蕺儿经商20年重回金陵!许兰香独撑林家濒临绝境,蕺儿携十万两白银救急,两姐妹后巷抱头痛哭:我再也不走了

喵喵的追剧笔记
2026-10-05 19:09:22
广西一处新能源充电站内多名小孩用充电枪荡秋千,客服:严禁该行为,将联系巡查;专家:属高压带电设备,未成年人擅自玩耍有极大安全隐患

广西一处新能源充电站内多名小孩用充电枪荡秋千,客服:严禁该行为,将联系巡查;专家:属高压带电设备,未成年人擅自玩耍有极大安全隐患

极目新闻
2026-10-04 22:59:09
国际乒联最新世界排名:王楚钦第四林诗栋第九,国乒男单无缘前三,松岛辉空升至第一;孙颖莎重回女单第一

国际乒联最新世界排名:王楚钦第四林诗栋第九,国乒男单无缘前三,松岛辉空升至第一;孙颖莎重回女单第一

先锋新闻
2026-10-05 15:17:26
中纪委严厉强调!要求各地哪怕脱层皮,也要一抓到底!

中纪委严厉强调!要求各地哪怕脱层皮,也要一抓到底!

职场资深秘书
2026-10-05 14:17:32
新娘婚礼前两天被马蜂蜇伤,嘴唇肿胀自嘲“像蛤蟆精”,当事人:连夜就医,婚礼如期举行

新娘婚礼前两天被马蜂蜇伤,嘴唇肿胀自嘲“像蛤蟆精”,当事人:连夜就医,婚礼如期举行

极目新闻
2026-10-05 14:00:13
真的辣眼睛!苦命的鸳鸯,在田野里的私会,却是最美的风景吗

真的辣眼睛!苦命的鸳鸯,在田野里的私会,却是最美的风景吗

史海流年号
2026-10-03 15:16:56
央视:“佤邦联合军”副总司令鲍军峰落网画面公开,住所查获大量珠宝豪车

央视:“佤邦联合军”副总司令鲍军峰落网画面公开,住所查获大量珠宝豪车

黄河新闻网吕梁
2026-10-05 16:52:56
苹果让友商怎么活!iPhone 18 Pro系列国内开售不到半月最新销量出炉:很快破250万台

苹果让友商怎么活!iPhone 18 Pro系列国内开售不到半月最新销量出炉:很快破250万台

快科技
2026-10-04 17:28:04
快讯!杨兰兰不简单呀!

快讯!杨兰兰不简单呀!

故事终将光明磊落
2026-10-05 12:55:20
耐克水深火热:取消大中华独立大区,市值蒸发近15000亿

耐克水深火热:取消大中华独立大区,市值蒸发近15000亿

南方都市报
2026-10-05 18:58:05
乔布斯去世15周年,苹果新CEO特努斯发文缅怀:他教会了我们用心对待每一个细节、每一份体验和每一个人,这份教益至今依然指引我们的工作

乔布斯去世15周年,苹果新CEO特努斯发文缅怀:他教会了我们用心对待每一个细节、每一份体验和每一个人,这份教益至今依然指引我们的工作

极目新闻
2026-10-05 22:19:09
出生792万,死亡1131万!2027年,中国人口或将迎来三大巨变

出生792万,死亡1131万!2027年,中国人口或将迎来三大巨变

掠影后有感
2026-10-05 09:20:34
空姐被逼下跪后续!欧某某的面相、T恤被网友吐槽:真是求锤得锤自作自受

空姐被逼下跪后续!欧某某的面相、T恤被网友吐槽:真是求锤得锤自作自受

王老师你还好吗
2026-10-05 14:48:03
“家里钱多的鲍岩板,有个大库房专门装钱,警卫员偷他一千多万都没发现!”缅北电诈覆灭纪实第一集《利剑出鞘》,完整视频来了

“家里钱多的鲍岩板,有个大库房专门装钱,警卫员偷他一千多万都没发现!”缅北电诈覆灭纪实第一集《利剑出鞘》,完整视频来了

都市快报橙柿互动
2026-10-05 19:13:23
市长邀请?蔡康永回应漏洞百出,太平轮旧事被扒,罗永浩遭牵连

市长邀请?蔡康永回应漏洞百出,太平轮旧事被扒,罗永浩遭牵连

揭秘世间万象
2026-10-05 19:31:03
大唐不夜城人均消费一块五引质疑

大唐不夜城人均消费一块五引质疑

热点追踪人
2026-10-05 15:04:00
2026-10-05 22:47:00
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1610文章数 21关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

本地
旅游
数码
公开课
军事航空

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

旅游要闻

甜城两日,溯脉千年 国庆长假仅余两日,何不向内江而行?

数码要闻

AMD锐龙AI Max Pro 495亮相 统一内存最高192GB

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

俄军连续4天轰炸基辅大桥

无障碍浏览 进入关怀版