![]()
有一种很奇怪的困境,你可能没想到过:一个AI模型要变得更聪明,靠的不是学习新知识,而是自己跟自己下棋。
这话听起来有点玄乎,但确实是这两年AI研究里一条越来越热的路子,叫做自我进化。简单说就是不再靠人类标注数据、不再靠人类出题,模型自己给自己出题,自己学着解题,然后循环往复,越滚越强。这条路子在数学、编程这类有标准答案的领域已经玩得很溜了,一道数学题对不对,代码能不能跑通,机器一眼就能判断,学习信号干净利落。
但问题来了。
如果是写一篇文章、给一条人生建议、编一个故事呢?这些事情没有唯一正确答案,好坏全凭感觉。这时候谁来当裁判?
这就是这篇论文要解决的核心麻烦。
一、当裁判自己也不进步的时候
先说清楚这套自我进化游戏是怎么玩的。
一般的做法里有两个角色:一个叫挑战者,专门负责出题,而且要出得越来越难;一个叫求解者,负责答题,要越答越好。这两者之间是一种对抗关系,挑战者想让求解者答不出来,求解者拼命想证明自己能答出来,一来一回,双方水平都在涨。这种设计思路其实来自更早的强化学习框架GRPO(组相对策略优化),一种通过组内比较来计算优势、更新策略的训练算法。
这套机制在数学题上工作得很好,因为答案对不对,机器自己就能判断,不需要额外找人来裁决。
但在写作文、提建议这种没有标准答案的领域,就必须找一个第三方来打分,这个角色叫裁判。裁判会给求解者的每一份答案打分,分数高的说明答得好,分数低的说明答得差,求解者就是靠这个分数信号来调整自己。
问题就出在这个裁判身上。
如果裁判是一个训练好之后就固定不变的模型,会发生什么?求解者会拼命学习裁判喜欢的风格,直到求解者的答案质量摸到了裁判能分辨的天花板。这之后再怎么训练,裁判也分不出高下了,因为在它眼里两份答案已经一样好。
这时候求解者就卡住了,不是因为它不能再进步,而是因为裁判看不出它到底有没有进步。
这就好比你请了一位钢琴老师来给你打分,这位老师自己只学过车尔尼练习曲的水平。你弹车尔尼弹得越来越好,老师能听出差别,给你打分很准。可你后来开始练肖邦的夜曲,弹得再有感情、再有层次,老师听起来都差不多,因为老师自己压根没到能分辨肖邦弹奏细腻差异的耳朵。你要是继续跟着这位老师学,进步就到此为止了,不是因为你弹得不好,是老师的耳朵跟不上了。如果这时候还硬要靠这位老师打分来判断自己该往哪个方向练,结果只会是原地打转甚至练偏。
这正是论文里反复强调的一句话:自我进化的上限,被裁判自身的评判能力锁死了。
二、思路:让裁判也跟着一起进化
这篇论文提出的框架叫J-ZERO,全称是从零数据出发的裁判协同进化。它的解法听起来简单粗暴:既然裁判会成为瓶颈,那就让裁判也动起来,跟挑战者和求解者一起进化,而不是训练完就锁死不动。
但这里立刻冒出一个逻辑陷阱。
如果挑战者、求解者、裁判三个角色最初都来自同一个模型,那裁判要靠什么信号来提升自己?如果裁判的训练数据也是这个系统自己产生的,那不就是自己骗自己吗?一个人闭着眼睛给自己打分,分数怎么可能变得更准?
论文作者想明白了这件事的关键:不能让裁判的训练信号来自裁判自己的打分,必须找到一种在这个闭环系统里,天然就带着正确答案的比较对。
换句话说,得找到那种不需要裁判介入,靠系统结构本身就能确定谁好谁坏的场景。
论文里设计了两种这样的场景,我一个个说。
三、第一种信号:角色不对等带来的天然优劣
第一种叫角色不对等对,思路是这样的:挑战者的本职工作是出题,让求解者答不上来;求解者的本职工作是答题,尽力答好。
那如果让挑战者去回答自己出的题,会发生什么?
挑战者压根没有被训练成一个答题高手,它所有的训练信号都在教它怎么把题目出得更刁钻,从来没人奖励过它答得好不好。而求解者恰恰相反,它的每一次训练都是在打磨答题能力。
于是这里就出现了一个不需要裁判介入就能确定的优劣关系:同一道题,求解者的答案系统性地会比挑战者的答案好。这个优劣关系不是裁判打出来的分,是由这两个角色各自被训练的目标决定的,天然如此。
这就像一场厨艺比赛,请了一位专门负责设计刁钻食材组合的美食评论家,和一位天天在后厨练刀工火候的主厨。评论家的工作是想出最难搭配的食材清单,让主厨发挥不出来,评论家从来没练过颠勺和调味。你现在让评论家自己下厨做一道菜,和主厨做的同一道菜放在一起比,不用请第三方裁判尝味道,单凭常识就知道主厨做得更好。这个判断不靠裁判的舌头,靠的是两人各自练的是什么功夫。如果没有这层天然优劣关系,系统就只能干等着一个可能已经失灵的裁判来打分,永远没法给裁判本身补课。
论文把这种成对数据叫做角色不对等偏好对,把这些对子收集起来喂给裁判训练,用的是布拉德利-特里模型这种经典的偏好学习损失函数,专门用来从成对比较中学出打分能力。
四、第二种信号:拆开来做比一口气做得好
第一种办法有个缺陷。
如果只靠角色不对等对来训练裁判,裁判学到的上限也就是当下求解者的水平线,它能分辨出求解者比挑战者强,但分辨不出求解者还能强到什么程度。裁判永远只是在追认已经发生的水平,追不上求解者接下来要突破的天花板。
论文这里借用了一个更早的思想,叫迭代放大,核心逻辑是:一个复杂任务,如果拆成几个简单子任务分别解决,再把答案拼起来,往往会比一口气硬解出来的答案更完整更准确。
具体做法是,挑战者把一道难题拆成三到五个子问题,求解者针对每个子问题单独作答,再由挑战者把这些子答案整合成一份完整回答。这份整合出来的答案,和求解者自己一口气直接答出来的答案放在一起比。
论文观察到的规律是,拆解组合出来的答案系统性地优于一口气答出来的答案,因为求解者面对小任务时更可靠,面对大任务时容易漏掉细节或者逻辑跳跃。
这就好比你让一个刚学做饭没多久的人一次性做一桌满汉全席,他大概率手忙脚乱、顾此失彼,某道菜火候不到,某道菜忘了放盐。可如果把这桌菜拆成八道单独的菜,一道一道地做,每道菜他都能专心对付,最后拼出来的满汉全席质量反而比他硬着头皮一次做完要好得多。这里的关键不是他做菜水平提高了,而是任务被拆小之后,他犯错的概率降低了。如果没有这套拆解流程,裁判就只能看到求解者一口气作答时的天花板,永远看不到求解者其实还有更大的潜力没被激发出来,自然也学不会怎么给更高质量的答案打高分。
这一类偏好对叫子任务放大对,同样用来训练裁判。
角色不对等对和子任务放大对合在一起,构成了裁判训练的全部数据来源,论文里用了个很形象的说法:这两种信号在训练的不同阶段各自可靠,合在一起才能让裁判在整个自我进化过程中始终有饭吃。
研究团队专门做了验证,请了一个外部大模型作裁判,去检验这两类偏好对里"谁更好"的标注到底准不准。结果发现角色不对等对从训练一开始就很可靠,求解者的胜率一直在六成以上;而子任务放大对在训练早期反而不太准,前三轮胜率只有两成出头,因为这时候求解者水平还太弱,连子任务都答不好,拆解反而帮了倒忙。但从第四轮开始,子任务放大对的胜率翻过五成,后来稳定在七成到八成,说明求解者成熟之后,拆解组合的优势才真正显现出来。
两条曲线在训练中段交叉,这个细节挺妙的,角色不对等对负责撑住早期,子任务放大对负责接手后期,裁判从头到尾都有靠谱的信号可学。
五、三方博弈:挑战者、求解者到底是怎么打起来的
说完裁判怎么进化,再说回挑战者和求解者这两个老对手是怎么互相较劲的。
每一轮训练分三步走。
第一步,固定住求解者和裁判,单独训练挑战者。挑战者出一批题,求解者去答,裁判打分,挑战者要学会出那种求解者普遍答得差的题,这样它才能拿到高分励,因为它的目标就是让求解者的平均分越低越好。
但光是让题目变难还不够,论文里加了两道保险,一个是重复惩罚:如果挑战者投机取巧,老是出很相似的题目,会被扣分,这个通过计算题目之间的文本相似度,把长得像的题目归为一类,同类题目越多惩罚越重;另一个是格式检查,题目必须按规定格式包裹好,否则直接给最低分。
第二步,固定住挑战者和裁判,单独训练求解者。这一步之前还有个筛选环节,挑战者出了很多候选题目,但不是每道题都拿来练,而是专挑那些求解者多次作答后分数波动最大的题目。
这个筛选逻辑背后有理论支撑:一项研究证明,训练某道题带来的策略提升,下限就取决于这道题奖励分数的方差。方差越大,说明求解者在这道题上表现忽高忽低,说明这道题正好卡在求解者能力的边界线上,这种题目才最有练习价值。
这就像健身房里的私教给你选训练重量。如果重量选得太轻,你每次都能轻松举起来,身体根本不需要适应,练了也白练;如果选得太重,你每次都举不动,也没法形成有效刺激。真正让你进步的,是那个你时而能举起来时而举不起来的临界重量,私教盯着的就是你举起这个重量时动作的稳定性波动,波动越大越说明这是你该练的重量段。如果私教随便选重量,不管你的实际波动表现,你要么原地踏步要么练伤自己。
第三步,才轮到裁判自己更新,用前面说的那两类偏好对,通过布拉德利-特里损失函数来调整参数。
三步走完算一轮,然后从头再来,一轮接一轮地循环。
六、数据说话:效果到底有多大
论文在两种规模的模型上做了实验,一个是40亿参数的Qwen3-4B-Base,一个是80亿参数的Qwen3-8B-Base,裁判用的是一个80亿参数的现成打分模型Skywork-Reward-V2。
对比的对象是两个同类框架,一个叫R-Zero,靠多数投票机制来获得奖励信号,是专门为有标准答案的领域设计的;另一个叫G-Zero,思路是用挑战者生成的提示来构造偏好对,但裁判是固定不变的。
在有标准答案的领域,涵盖数学推理、通用推理、指令遵循一共11个测试集,J-ZERO在40亿参数模型上比基础模型平均提升9.47分,比R-Zero还要高出4.74分,而R-Zero本来就是专门为这类领域设计的,J-ZERO居然还能反超。在80亿参数模型上,提升幅度是7.88分,同样超过R-Zero3.56分。
真正拉开差距的是那些没有标准答案的领域,涵盖开放式指令跟随、高难度问答、创意写作三类测试集。R-Zero在这里几乎失灵,提升只有3.08分和2.31分,差不多是它在有答案领域涨幅的一半,因为它依赖的多数投票机制本来就不适合开放式任务。G-Zero的表现更弱,只提升1.31分和2.08分,几乎跟没训练差不多,因为它压根没有引入裁判机制。
而J-ZERO在这个领域提升了11.23分和10.18分,涨幅最猛的是一个覆盖写作、商务沟通、生活建议、规划推荐等场景的综合测试集,40亿参数模型上从6.22分直接冲到28.56分,80亿参数模型上从12.93分冲到33.53分。
更值得说道的是训练轮次的表现。R-Zero和G-Zero都在训练到第二轮的时候达到顶峰,之后就开始掉头下滑,像是撞到了一堵看不见的墙。J-ZERO却一直在涨,论文里训练了整整十轮,始终没有停止改善的迹象。
论文还专门做了一个对照实验:把裁判固定住,只让挑战者和求解者互相较劲。结果这个固定裁判版本前三轮和完整版本表现差不多,但从第四轮开始就掉队了,最终比完整版本低1.66分到4.44分。这个分叉点正好对应求解者的水平摸到了固定裁判的判断天花板,之后裁判就分不清好坏了,信号变成了噪音。
七、拆开来看:两种偏好信号各自的贡献
论文还专门做了消融实验,把两种偏好数据分别拿掉,看看各自贡献多大。
去掉子任务放大对,总分从37.59掉到35.95,少了1.64分;去掉角色不对等对,总分掉到36.62,少了0.97分。子任务放大对的贡献更大,这和前面说的逻辑对得上,角色不对等对只能教会裁判分辨求解者比挑战者强,但没法让裁判看到超越求解者当下水平的答案是什么样;子任务放大对恰恰能提供这种超前样本,对持续进步更关键。
如果把裁判完全撤掉,回到最初那种固定评判、不做任何协同进化的设定,总分直接跌到34.54,这也印证了前面反复强调的那个核心结论:裁判本身要是不进步,整套系统的天花板就焊死了。
八、一个意外发现:裁判在标准测试上也变强了
论文原本的目的是让裁判跟上求解者的步伐,而不是让裁判本身变成更强的通用打分器。但研究团队还是顺手在一个独立的、跟训练数据完全无关的评测集RM-Bench上测了一下每一轮的裁判。
结果发现,裁判在所有四个测试维度上都在涨,平均准确率从92.61涨到93.95。涨幅最大的是聊天对话类场景,提升了3.70分,这恰好是最接近挑战者出题风格的领域;安全类场景本来就接近满分,几乎没有变化空间。
更有意思的是难度细分。这个测试集把偏好对按难度分成简单、正常、困难三档,困难档指的是那种回答风格和回答质量对不上的情况,比如一份措辞平实但内容扎实的回答,对上一份辞藻华丽但内容空洞的回答,裁判很容易被表面文采骗到。结果显示困难档的准确率从85.08涨到89.85,涨了4.77分;而简单档反而略微下降了0.74分。
这个反差其实合情合理。当求解者已经足够强,它很少再产生那种一眼假的低质量答案了,简单对比对裁判来说信息量本来就在变少;真正卡脖子的是那种文笔好但内容空的回答会不会骗过裁判,这才是决定求解者能不能持续被正确引导的关键点,而这恰恰是裁判进步最多的地方。
九、这套框架目前还做不到什么
论文也坦率承认了限制。
受限于算力,实验只做到了80亿参数规模,挑战者、求解者和裁判都没有超过这个体量,而且都是基础模型,没有测试过经过后训练、擅长写长链条推理过程的模型。更大规模下这套框架是否依然有效,还是未知数。
另外,论文里的裁判用的是一个判别式打分模型,直接输出一个分数,而挑战者和求解者共用同一套生成式初始化。论文提出了一个方向:如果裁判本身也是一个能够生成文字点评的语言模型,让点评本身成为一种更丰富的训练信号,会不会效果更好?这个问题作者留给了未来的工作。
写在后面
读完这篇论文,让我印象最深的其实不是最终的分数提升,而是那个训练中段两条曲线交叉的图。
角色不对等对早期可靠、后期逐渐失效,子任务放大对早期不可靠、后期逐渐接管,这个交叉点几乎是这篇论文里最朴素也最耐琢磨的一处设计。它说明一件事:任何一种单一的评判信号,都有自己的保质期,单靠一种信号硬撑到底,系统迟早会在某个阶段失灵。真正能撑住长期自我进化的,是懂得在信号即将失效之前,提前准备好下一种信号来接棒。
这个思路其实可以脱离AI训练本身来想。任何一个需要长期自我提升的系统,不管是一个人的技能成长,还是一个组织的迭代节奏,大概都逃不开这个规律:早期靠简单粗暴的对照就能判断好坏,越往后,评判标准本身就得跟着水涨船高,不然进步的人早晚会撞上一个跟不上他的裁判。
这篇论文没有回答的问题是,如果裁判本身也开始产生带偏见的判断,谁来纠正裁判的裁判?这个链条能不能一直往上叠,还是说总会在某一层撞上一堵真正的墙?
Q&A
Q1:J-ZERO是什么?
A:J-ZERO是一个让挑战者、求解者、裁判三个角色共同进化的自我训练框架,不需要任何外部人工数据,专门解决固定裁判会限制AI持续进步的问题,在有标准答案和没有标准答案的任务上都能用。
Q2:J-ZERO和R-Zero、G-Zero有什么区别?
A:R-Zero靠多数投票获得奖励,只适合有标准答案的领域;G-Zero用固定裁判构造偏好对训练求解者;J-ZERO让裁判本身也跟着挑战者和求解者一起持续更新,不会被固定裁判的判断天花板卡住。
Q3:J-ZERO的训练效果能持续多久?
A:论文测试了十轮训练,J-ZERO的表现一直在稳步上升,没有出现停滞或下滑;而对比的R-Zero和G-Zero都在训练到第二轮时达到顶峰后开始下降。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.