网易首页 > 网易号 > 正文 申请入驻

走出数学与代码,大模型还能自我进化吗?

0
分享至



可验证奖励的强化学习(RLVR)逐渐成为提升大模型推理能力的重要技术路线。在数学和代码任务中,标准答案和编译器能够自动判断输出是否正确,从而为大规模强化学习提供准确、低成本的奖励信号。

然而,创意写作和研究分析等开放式任务通常不存在唯一正确答案。现有方法往往依赖人工偏好、奖励模型或 LLM Judge 评估输出质量,容易受到评估偏差和裁判模型能力的限制,同时还会增加训练阶段的推理成本。如何为开放式任务构造稳定、可扩展且能够自动验证的奖励,成为 RLVR 进一步扩展的关键障碍。

受到自监督学习的启发,作者提出了RLSVR(Reinforcement Learning with Self-Verifiable Rewards)训练框架。自监督学习通过掩码预测、对比学习等代理任务,从数据本身生成训练标签;RLSVR 将类似的任务变换思想引入强化学习,通过构造带有环境隐藏变量和确定性规则的代理任务,让开放式任务也能够产生可验证奖励。



  • 论文标题:From RLVR to RLSVR: Task Transformation Induces SelfVerifiable Rewards for Open-Ended LLM Self-Improvement
  • 代码链接:https://github.com/wangqinsi1/RLSVR/tree/SpyRL
  • 论文链接:https://arxiv.org/abs/2607.23802



基于这一思路,作者进一步提出自博弈训练方法实例SpyRL(Self-PlaY Reinforcement Learning)。其核心是构造一个信息不对称的多智能体博弈环境:不同智能体在掌握信息量存在差异的条件下完成同一目标任务,并通过彼此的输出进行比较、判断和互动。环境预先记录造成信息差异的隐藏状态,因此博弈结果可以被自动、精确地验证;与此同时,智能体能否在竞争中取得优势,又取决于其完成原始任务的质量。由此,开放式任务中难以直接衡量的能力,被映射为可用于强化学习的规则化奖励信号。

从 RLVR 到 RLSVR:

为开放式任务构造可验证奖励

RLVR 能够有效提升数学推理和代码生成能力,关键在于这些任务拥有确定性的验证机制。数学答案可以与标准答案直接比对,代码则可以通过编译器和单元测试判断是否正确,因此模型能够以较低成本持续获得稳定的强化学习信号。

开放式任务的情况更复杂。摘要、写作和研究分析通常不存在唯一答案,任务质量分散在完整性、逻辑性、相关性和创造性等多个维度中,很难通过简单规则直接计算。奖励模型和 LLM Judge 虽然可以提供近似评价,但训练效果会受到评估器能力、偏差和推理成本的影响。

针对这一问题,RLSVR 引入了任务变换(Task Transformation)。其基本思想是将原始开放式任务转化为一个可验证的代理环境,并在环境中主动构造监督信号。环境首先从原始数据中采样任务,再注入并记录一个隐藏变量,例如哪个输入受到扰动、哪部分信息被删除,或某个输出在什么条件下生成。模型仍然需要完成原始目标任务,从而保证训练过程中使用的能力与真实应用场景保持一致;随后,模型通过输出之间的比较和交互,对环境中的隐藏状态作出判断。

由于隐藏变量由环境预先生成并保存,模型的判断结果可以通过确定性规则直接核验。这样一来,原本难以直接衡量的输出质量,就能够通过代理环境中的交互结果转化为强化学习奖励。论文将这种奖励称为自可验证奖励(Self-Verifiable Rewards):它不依赖人工标注或外部裁判,其验证依据来自环境自身的状态和规则,标准答案在任务生成时就已经确定。

从这个角度看,RLSVR 可以视为将自监督学习的思想引入 RLVR。自监督学习通过代理任务从数据中自动生成标签,RLSVR 则通过任务和环境变换自动生成奖励。任务变换对应代理任务,环境隐藏变量对应自动构造的标签,最终得到的规则化奖励可以直接用于 GRPO 等现有强化学习算法。RLSVR 由此提供了一条新的路径:开放式任务的可验证性可以通过环境设计获得,并进一步支持大规模、低成本的模型自我进化。

SpyRL:基于自博弈的 RLSVR 的实例



为了验证 RLSVR 能否真正应用于开放式任务,作者设计了一个基于信息不对称自博弈的具体实例——SpyRL(Self-PlaY Reinforcement Learning)。SpyRL 将摘要、创意写作和数学推理等任务嵌入一个类似「谁是卧底」的多智能体环境中,通过环境预先分配的隐藏身份,为原本缺乏标准答案的任务构造可验证奖励。

如论文图 2 所示,SpyRL 的每轮训练包含Performing和Detection两个阶段。首先,环境从任务数据中采样一个输入,并随机指定一名玩家为 spy。其余 civilian 玩家获得完整输入,spy 则只能看到经过信息降质处理的版本,例如被连续遮盖部分内容的报告、写作提示或数学材料。随后,所有玩家根据各自掌握的信息完成同一个目标任务,生成摘要、故事或数学问题及解答。信息降质只移除影响任务完成的关键内容,同时尽量保持输入的主题、风格和表面形式一致,以避免模型通过长度、格式等简单特征识别身份。

在 Detection 阶段,所有输出会被公开,玩家需要结合这些结果判断谁获得了残缺信息。由于 spy 的身份由环境提前随机指定,投票是否正确能够直接与环境记录进行比较,Detection 阶段也因此获得了确定性的奖励。与此同时,一个玩家生成的内容越不完整、逻辑越薄弱,越容易暴露其信息缺失并收到更多怀疑票。因此,投票结果也可以反向用于评价 Performing 阶段:收到的怀疑票越多,任务执行奖励越低;能够生成更完整、更连贯、更具说服力输出的玩家,则更有可能避免被识别。

这两个阶段共同构成了 SpyRL 的闭环自博弈机制。检测能力提升后,模型能够发现输出中更细微的缺陷,给执行者带来更严格的训练信号;执行能力提升后,不同玩家的输出会变得更难区分,又会推动检测模型继续进化。作者对两个阶段进行交替优化:当检测任务已经较为容易时,训练重点转向执行模型;当执行模型的提升导致身份识别准确率下降时,再增强检测模型。这样的动态过程能够持续围绕模型当前的能力边界产生学习压力,降低固定评估器逐渐失效带来的训练停滞。

在奖励设计上,Detection 阶段根据身份判断是否正确获得可验证奖励,并通过类似 GRPO 的组内相对优势进行优化。Performing 阶段则采用零和奖励,将 spy 与 civilian 之间的竞争以及 civilian 内部的相对表现结合起来。

通过这样的设计,SpyRL 将「输出质量」映射为「输出是否暴露了信息缺失」,再将身份判断结果转化为可由环境直接核验的训练信号。整个训练过程不需要人工标注、奖励模型或外部 LLM Judge,并且执行阶段始终围绕原始目标任务展开,从而保证代理博弈所训练的能力能够迁移回摘要、写作和推理等真实任务。

实验结果

作者在 Qwen3-4B 和 Qwen3-8B 上验证了 SpyRL,实验覆盖文本摘要、创意写作和数学推理三类任务,并与 R-Zero、Absolute Zero 等自进化方法进行比较。评估同时采用任务专用自动指标、GPT-4o 成对 A/B 测试和人工盲测,以考察模型在客观指标和人类偏好下的表现。

在文本摘要任务中,SpyRL 在 GovReport、Multi-News、QMSum、VCSum 和 SAMSum 五个数据集上均取得最高的 ROUGE-L。以 GovReport 为例,Qwen3-4B 的 ROUGE-L 从 30.2 提升至 36.7,Qwen3-8B 则从 29.0 提升至 34.1。在与未经训练的基础模型进行 A/B 测试时,SpyRL 在五个数据集上的平均胜率分别达到 73.9% 和 75.4%,并且在与 R-Zero、Absolute Zero 的对比中赢得了绝大多数测试。这表明,基于身份识别产生的训练信号能够有效改善摘要的完整性、信息覆盖和组织质量。



创意写作上的提升更加明显。作者从新颖性、情感表达、连贯性、一致性和总体质量五个维度进行评估。在 WritingPrompts 和 WritingBench 上,SpyRL 相比基础模型及两种自进化基线,在所有细分维度上的胜率均超过 50%。其中,Qwen3-4B 相比基础模型的总体胜率分别达到 81.3% 和 75.1%,Qwen3-8B 则达到 76.5% 和 78.1%。优势在新颖性和情感表达上尤其突出,说明 SpyRL 带来的改善并不局限于语言流畅度和表面结构,也覆盖了更具主观性的创作能力。



虽然 SpyRL 主要面向缺少确定性奖励的开放式任务,它在数学和通用推理任务上同样取得了稳定增益。在 GSM8K、Math500、AIME 2024、AIME 2025、Minerva、MMLU-Pro 和 GPQA-Diamond 七个基准上,SpyRL 均取得了最佳结果。Qwen3-4B 的七项平均成绩相比基础模型提升 8.97 个百分点,Qwen3-8B 提升 6.16 个百分点。例如,Qwen3-4B 在 AIME 2025 上从 6.7 提升至 20.0,在 GPQA-Diamond 上从 26.3 提升至 41.3;Qwen3-8B 在 Math500 上从 74.2 提升至 81.2。这说明,多玩家竞争和集体判断也能够为已有标准答案的任务提供更细粒度的学习信号。



人工评估也支持这一结论。10 名博士生对 400 个创意写作样本进行了盲测,SpyRL 在 WritingPrompts 上相对基础模型、R-Zero 和 Absolute Zero 的总体胜率分别达到 80.0%、78.5% 和 74.0%,在 WritingBench 上则分别达到 85.0%、80.5% 和 72.0%。



此外,SpyRL 的效果并未局限于主实验所使用的数据分布。将训练语料从政府报告换成 PubMed 科学论文后,模型在 arXiv、PubMed 和 BillSum 三个数据集上的平均 ROUGE-L 从 33.2 提升至 38.1,平均 A/B 胜率达到 70.2%。跨任务实验还显示,摘要和创意写作之间存在双向正迁移,说明 SpyRL 学到的内容组织、完整性和长程一致性等能力能够跨开放式任务复用。



启示

本篇工作为自监督学习与强化学习建立了一条连接。自监督学习的核心经验是:当真实标签难以获得时,可以通过掩码预测、对比学习等代理任务,从数据本身构造监督信号。RLSVR 将同样的思想推进到强化学习阶段:面对缺少确定性奖励的开放式任务,通过任务变换构造代理环境,并由环境预设的隐藏变量和交互规则自动生成奖励。自监督学习通过构造任务获得标签,RLSVR 通过构造环境获得奖励;前者解决「没有标注如何学习」,后者进一步探索「没有验证器如何做强化学习」。

这也意味着,RLVR 的适用范围不必完全受限于任务天然具备的标准答案。过去,数学和代码之所以适合 RLVR,是因为答案检查器和单元测试已经存在;对于写作、摘要和研究分析,RLSVR 将问题转化为如何设计一个与目标能力高度相关、同时具有确定性答案的代理任务。由此,可验证性从任务的一项固定属性,逐渐转变为一种可以通过环境设计获得的训练资源。SpyRL 所采用的信息不对称博弈正是这一思想的实例:环境主动制造一个可记录的隐藏状态,模型对该状态的判断可以被精确核验,而完成判断所依赖的能力又与原始开放式任务紧密相关。

这一视角也为大模型自我进化提供了新的研究方向。现有工作常将重点放在更强的奖励模型、更复杂的评价标准或更大规模的 LLM Judge 上,而 RLSVR 提示我们,还可以系统性地研究代理任务和训练环境本身。未来,不同开放式能力可能对应不同的任务变换方式。随着这些变换逐渐丰富,任务设计本身可能成为继数据、模型和优化算法之后,推动模型自我提升的另一项关键变量。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
苹果官方账号已取关库克,仅关注现任CEO特努斯1人

苹果官方账号已取关库克,仅关注现任CEO特努斯1人

极目新闻
2026-09-02 19:53:46
走进国博的一块瓷砖,藏着中国制造的新答案

走进国博的一块瓷砖,藏着中国制造的新答案

智谷趋势
2026-09-02 10:48:44
河北高阳警方通报“女子被当街殴打撕扯”:2人被刑拘

河北高阳警方通报“女子被当街殴打撕扯”:2人被刑拘

界面新闻
2026-09-02 16:13:22
原切牛肉检出瓜尔胶:大厂为何会踩这条红线

原切牛肉检出瓜尔胶:大厂为何会踩这条红线

思考不息
2026-09-02 14:41:23
金正恩女儿持枪开坦克,韩情报院称已进入接班人内定阶段

金正恩女儿持枪开坦克,韩情报院称已进入接班人内定阶段

桂系007
2026-09-02 10:15:38
6年还76万,本金只还17万!苏州一断供者哭诉:房子没了,首付93万没了,还倒欠银行98万

6年还76万,本金只还17万!苏州一断供者哭诉:房子没了,首付93万没了,还倒欠银行98万

火山詩话
2026-09-01 18:58:37
外交部:G20财长和央行行长会议未能发表公报,中方对此深表遗憾

外交部:G20财长和央行行长会议未能发表公报,中方对此深表遗憾

新京报
2026-09-02 16:32:08
官宣!曼城1.25亿镑签下25岁恩佐:夏窗标王诞生 球员感谢切尔西

官宣!曼城1.25亿镑签下25岁恩佐:夏窗标王诞生 球员感谢切尔西

风过乡
2026-09-02 06:43:53
“5亿吨冰层突然崩塌,很可能是永久冻土发生变化所致”,山体滑坡专家:尼泊尔境内发生冰岩崩之前,没有明显的地表异常信号

“5亿吨冰层突然崩塌,很可能是永久冻土发生变化所致”,山体滑坡专家:尼泊尔境内发生冰岩崩之前,没有明显的地表异常信号

都市快报橙柿互动
2026-09-02 00:34:44
揪心!西藏吉隆口岸被抹平,已发现:失联人员被深埋在巨石淤泥下

揪心!西藏吉隆口岸被抹平,已发现:失联人员被深埋在巨石淤泥下

胡侃社会百态
2026-09-02 12:56:20
“车灯女王”终于低头!星宇股份董事长周晓萍公开致歉

“车灯女王”终于低头!星宇股份董事长周晓萍公开致歉

听心堂
2026-09-02 12:23:22
天妒英才!31岁律师李禹墨离世,律所透露死因是突发疾病,长得很漂亮不输明星,履历又很优秀

天妒英才!31岁律师李禹墨离世,律所透露死因是突发疾病,长得很漂亮不输明星,履历又很优秀

火山詩话
2026-09-02 17:44:47
奔驰新车官宣:10月12日 ,正式首发

奔驰新车官宣:10月12日 ,正式首发

科技堡垒
2026-09-02 11:35:42
G20公报流产怪中国,贝森特数出"19比1",但全世界的眼睛不瞎

G20公报流产怪中国,贝森特数出"19比1",但全世界的眼睛不瞎

闻识
2026-09-02 12:38:12
孙宇晨和景甜的瓜反转了,大量照片和聊天记录流出!

孙宇晨和景甜的瓜反转了,大量照片和聊天记录流出!

七阿姨爱八卦
2026-09-01 10:46:18
武汉街头正大量出现,20岁大学生一个月赚了7000元;有人半天花掉两三百元,“这钱花得值”

武汉街头正大量出现,20岁大学生一个月赚了7000元;有人半天花掉两三百元,“这钱花得值”

极目新闻
2026-09-01 13:04:24
演员王侃在上海瑞金医院去世,享年66岁,他把全部家产全给了妻子

演员王侃在上海瑞金医院去世,享年66岁,他把全部家产全给了妻子

可乐谈情感
2026-09-02 00:03:07
景甜事件炸裂后续!孙宇晨2019年聊天曝光,代孕搞"三权分立"防女方架空,原来是早有预谋?

景甜事件炸裂后续!孙宇晨2019年聊天曝光,代孕搞"三权分立"防女方架空,原来是早有预谋?

可达鸭面面观
2026-09-02 18:32:18
美国地勤不拔油管扯爆国航油箱?国航回应:CA982航班在纽约肯尼迪国际机场地面加油作业时,加油车非正常移动,导致飞机相关部件损伤

美国地勤不拔油管扯爆国航油箱?国航回应:CA982航班在纽约肯尼迪国际机场地面加油作业时,加油车非正常移动,导致飞机相关部件损伤

潇湘晨报
2026-09-02 18:04:59
普京欲发布动员令,俄罗斯11万中产阶级闻风而逃?

普京欲发布动员令,俄罗斯11万中产阶级闻风而逃?

高博新视野
2026-09-01 18:56:12
2026-09-02 21:47:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13905文章数 142728关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

7人豪宅楼盘看房被困电梯呼叫铃还无反应 售楼部回应

头条要闻

7人豪宅楼盘看房被困电梯呼叫铃还无反应 售楼部回应

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

全新理想MEGA售50.98万 这一次“移动的家”更舒适更灵活

态度原创

本地
亲子
游戏
公开课
军事航空

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

亲子要闻

我在韩国差点想打人 怎么回事? 小朋友来韩国能玩什

《GTA6》新截图暗示坏结局?主角穷途末路 绝境相拥

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普威胁伊朗终极打击蓄势待发

无障碍浏览 进入关怀版