网易首页 > 网易号 > 正文 申请入驻

当AI的老师自己也不会打分的时候,怎么办

0
分享至


有一种很奇怪的困境,你可能没想到过:一个AI模型要变得更聪明,靠的不是学习新知识,而是自己跟自己下棋。

这话听起来有点玄乎,但确实是这两年AI研究里一条越来越热的路子,叫做自我进化。简单说就是不再靠人类标注数据、不再靠人类出题,模型自己给自己出题,自己学着解题,然后循环往复,越滚越强。这条路子在数学、编程这类有标准答案的领域已经玩得很溜了,一道数学题对不对,代码能不能跑通,机器一眼就能判断,学习信号干净利落。

但问题来了。

如果是写一篇文章、给一条人生建议、编一个故事呢?这些事情没有唯一正确答案,好坏全凭感觉。这时候谁来当裁判?

这就是这篇论文要解决的核心麻烦。

一、当裁判自己也不进步的时候

先说清楚这套自我进化游戏是怎么玩的。

一般的做法里有两个角色:一个叫挑战者,专门负责出题,而且要出得越来越难;一个叫求解者,负责答题,要越答越好。这两者之间是一种对抗关系,挑战者想让求解者答不出来,求解者拼命想证明自己能答出来,一来一回,双方水平都在涨。这种设计思路其实来自更早的强化学习框架GRPO(组相对策略优化),一种通过组内比较来计算优势、更新策略的训练算法。

这套机制在数学题上工作得很好,因为答案对不对,机器自己就能判断,不需要额外找人来裁决。

但在写作文、提建议这种没有标准答案的领域,就必须找一个第三方来打分,这个角色叫裁判。裁判会给求解者的每一份答案打分,分数高的说明答得好,分数低的说明答得差,求解者就是靠这个分数信号来调整自己。

问题就出在这个裁判身上。

如果裁判是一个训练好之后就固定不变的模型,会发生什么?求解者会拼命学习裁判喜欢的风格,直到求解者的答案质量摸到了裁判能分辨的天花板。这之后再怎么训练,裁判也分不出高下了,因为在它眼里两份答案已经一样好。

这时候求解者就卡住了,不是因为它不能再进步,而是因为裁判看不出它到底有没有进步。

这就好比你请了一位钢琴老师来给你打分,这位老师自己只学过车尔尼练习曲的水平。你弹车尔尼弹得越来越好,老师能听出差别,给你打分很准。可你后来开始练肖邦的夜曲,弹得再有感情、再有层次,老师听起来都差不多,因为老师自己压根没到能分辨肖邦弹奏细腻差异的耳朵。你要是继续跟着这位老师学,进步就到此为止了,不是因为你弹得不好,是老师的耳朵跟不上了。如果这时候还硬要靠这位老师打分来判断自己该往哪个方向练,结果只会是原地打转甚至练偏。

这正是论文里反复强调的一句话:自我进化的上限,被裁判自身的评判能力锁死了。

二、思路:让裁判也跟着一起进化

这篇论文提出的框架叫J-ZERO,全称是从零数据出发的裁判协同进化。它的解法听起来简单粗暴:既然裁判会成为瓶颈,那就让裁判也动起来,跟挑战者和求解者一起进化,而不是训练完就锁死不动。

但这里立刻冒出一个逻辑陷阱。

如果挑战者、求解者、裁判三个角色最初都来自同一个模型,那裁判要靠什么信号来提升自己?如果裁判的训练数据也是这个系统自己产生的,那不就是自己骗自己吗?一个人闭着眼睛给自己打分,分数怎么可能变得更准?

论文作者想明白了这件事的关键:不能让裁判的训练信号来自裁判自己的打分,必须找到一种在这个闭环系统里,天然就带着正确答案的比较对。

换句话说,得找到那种不需要裁判介入,靠系统结构本身就能确定谁好谁坏的场景。

论文里设计了两种这样的场景,我一个个说。

三、第一种信号:角色不对等带来的天然优劣

第一种叫角色不对等对,思路是这样的:挑战者的本职工作是出题,让求解者答不上来;求解者的本职工作是答题,尽力答好。

那如果让挑战者去回答自己出的题,会发生什么?

挑战者压根没有被训练成一个答题高手,它所有的训练信号都在教它怎么把题目出得更刁钻,从来没人奖励过它答得好不好。而求解者恰恰相反,它的每一次训练都是在打磨答题能力。

于是这里就出现了一个不需要裁判介入就能确定的优劣关系:同一道题,求解者的答案系统性地会比挑战者的答案好。这个优劣关系不是裁判打出来的分,是由这两个角色各自被训练的目标决定的,天然如此。

这就像一场厨艺比赛,请了一位专门负责设计刁钻食材组合的美食评论家,和一位天天在后厨练刀工火候的主厨。评论家的工作是想出最难搭配的食材清单,让主厨发挥不出来,评论家从来没练过颠勺和调味。你现在让评论家自己下厨做一道菜,和主厨做的同一道菜放在一起比,不用请第三方裁判尝味道,单凭常识就知道主厨做得更好。这个判断不靠裁判的舌头,靠的是两人各自练的是什么功夫。如果没有这层天然优劣关系,系统就只能干等着一个可能已经失灵的裁判来打分,永远没法给裁判本身补课。

论文把这种成对数据叫做角色不对等偏好对,把这些对子收集起来喂给裁判训练,用的是布拉德利-特里模型这种经典的偏好学习损失函数,专门用来从成对比较中学出打分能力。

四、第二种信号:拆开来做比一口气做得好

第一种办法有个缺陷。

如果只靠角色不对等对来训练裁判,裁判学到的上限也就是当下求解者的水平线,它能分辨出求解者比挑战者强,但分辨不出求解者还能强到什么程度。裁判永远只是在追认已经发生的水平,追不上求解者接下来要突破的天花板。

论文这里借用了一个更早的思想,叫迭代放大,核心逻辑是:一个复杂任务,如果拆成几个简单子任务分别解决,再把答案拼起来,往往会比一口气硬解出来的答案更完整更准确。

具体做法是,挑战者把一道难题拆成三到五个子问题,求解者针对每个子问题单独作答,再由挑战者把这些子答案整合成一份完整回答。这份整合出来的答案,和求解者自己一口气直接答出来的答案放在一起比。

论文观察到的规律是,拆解组合出来的答案系统性地优于一口气答出来的答案,因为求解者面对小任务时更可靠,面对大任务时容易漏掉细节或者逻辑跳跃。

这就好比你让一个刚学做饭没多久的人一次性做一桌满汉全席,他大概率手忙脚乱、顾此失彼,某道菜火候不到,某道菜忘了放盐。可如果把这桌菜拆成八道单独的菜,一道一道地做,每道菜他都能专心对付,最后拼出来的满汉全席质量反而比他硬着头皮一次做完要好得多。这里的关键不是他做菜水平提高了,而是任务被拆小之后,他犯错的概率降低了。如果没有这套拆解流程,裁判就只能看到求解者一口气作答时的天花板,永远看不到求解者其实还有更大的潜力没被激发出来,自然也学不会怎么给更高质量的答案打高分。

这一类偏好对叫子任务放大对,同样用来训练裁判。

角色不对等对和子任务放大对合在一起,构成了裁判训练的全部数据来源,论文里用了个很形象的说法:这两种信号在训练的不同阶段各自可靠,合在一起才能让裁判在整个自我进化过程中始终有饭吃。

研究团队专门做了验证,请了一个外部大模型作裁判,去检验这两类偏好对里"谁更好"的标注到底准不准。结果发现角色不对等对从训练一开始就很可靠,求解者的胜率一直在六成以上;而子任务放大对在训练早期反而不太准,前三轮胜率只有两成出头,因为这时候求解者水平还太弱,连子任务都答不好,拆解反而帮了倒忙。但从第四轮开始,子任务放大对的胜率翻过五成,后来稳定在七成到八成,说明求解者成熟之后,拆解组合的优势才真正显现出来。

两条曲线在训练中段交叉,这个细节挺妙的,角色不对等对负责撑住早期,子任务放大对负责接手后期,裁判从头到尾都有靠谱的信号可学。

五、三方博弈:挑战者、求解者到底是怎么打起来的

说完裁判怎么进化,再说回挑战者和求解者这两个老对手是怎么互相较劲的。

每一轮训练分三步走。

第一步,固定住求解者和裁判,单独训练挑战者。挑战者出一批题,求解者去答,裁判打分,挑战者要学会出那种求解者普遍答得差的题,这样它才能拿到高分励,因为它的目标就是让求解者的平均分越低越好。

但光是让题目变难还不够,论文里加了两道保险,一个是重复惩罚:如果挑战者投机取巧,老是出很相似的题目,会被扣分,这个通过计算题目之间的文本相似度,把长得像的题目归为一类,同类题目越多惩罚越重;另一个是格式检查,题目必须按规定格式包裹好,否则直接给最低分。

第二步,固定住挑战者和裁判,单独训练求解者。这一步之前还有个筛选环节,挑战者出了很多候选题目,但不是每道题都拿来练,而是专挑那些求解者多次作答后分数波动最大的题目。

这个筛选逻辑背后有理论支撑:一项研究证明,训练某道题带来的策略提升,下限就取决于这道题奖励分数的方差。方差越大,说明求解者在这道题上表现忽高忽低,说明这道题正好卡在求解者能力的边界线上,这种题目才最有练习价值。

这就像健身房里的私教给你选训练重量。如果重量选得太轻,你每次都能轻松举起来,身体根本不需要适应,练了也白练;如果选得太重,你每次都举不动,也没法形成有效刺激。真正让你进步的,是那个你时而能举起来时而举不起来的临界重量,私教盯着的就是你举起这个重量时动作的稳定性波动,波动越大越说明这是你该练的重量段。如果私教随便选重量,不管你的实际波动表现,你要么原地踏步要么练伤自己。

第三步,才轮到裁判自己更新,用前面说的那两类偏好对,通过布拉德利-特里损失函数来调整参数。

三步走完算一轮,然后从头再来,一轮接一轮地循环。

六、数据说话:效果到底有多大

论文在两种规模的模型上做了实验,一个是40亿参数的Qwen3-4B-Base,一个是80亿参数的Qwen3-8B-Base,裁判用的是一个80亿参数的现成打分模型Skywork-Reward-V2。

对比的对象是两个同类框架,一个叫R-Zero,靠多数投票机制来获得奖励信号,是专门为有标准答案的领域设计的;另一个叫G-Zero,思路是用挑战者生成的提示来构造偏好对,但裁判是固定不变的。

在有标准答案的领域,涵盖数学推理、通用推理、指令遵循一共11个测试集,J-ZERO在40亿参数模型上比基础模型平均提升9.47分,比R-Zero还要高出4.74分,而R-Zero本来就是专门为这类领域设计的,J-ZERO居然还能反超。在80亿参数模型上,提升幅度是7.88分,同样超过R-Zero3.56分。

真正拉开差距的是那些没有标准答案的领域,涵盖开放式指令跟随、高难度问答、创意写作三类测试集。R-Zero在这里几乎失灵,提升只有3.08分和2.31分,差不多是它在有答案领域涨幅的一半,因为它依赖的多数投票机制本来就不适合开放式任务。G-Zero的表现更弱,只提升1.31分和2.08分,几乎跟没训练差不多,因为它压根没有引入裁判机制。

而J-ZERO在这个领域提升了11.23分和10.18分,涨幅最猛的是一个覆盖写作、商务沟通、生活建议、规划推荐等场景的综合测试集,40亿参数模型上从6.22分直接冲到28.56分,80亿参数模型上从12.93分冲到33.53分。

更值得说道的是训练轮次的表现。R-Zero和G-Zero都在训练到第二轮的时候达到顶峰,之后就开始掉头下滑,像是撞到了一堵看不见的墙。J-ZERO却一直在涨,论文里训练了整整十轮,始终没有停止改善的迹象。

论文还专门做了一个对照实验:把裁判固定住,只让挑战者和求解者互相较劲。结果这个固定裁判版本前三轮和完整版本表现差不多,但从第四轮开始就掉队了,最终比完整版本低1.66分到4.44分。这个分叉点正好对应求解者的水平摸到了固定裁判的判断天花板,之后裁判就分不清好坏了,信号变成了噪音。

七、拆开来看:两种偏好信号各自的贡献

论文还专门做了消融实验,把两种偏好数据分别拿掉,看看各自贡献多大。

去掉子任务放大对,总分从37.59掉到35.95,少了1.64分;去掉角色不对等对,总分掉到36.62,少了0.97分。子任务放大对的贡献更大,这和前面说的逻辑对得上,角色不对等对只能教会裁判分辨求解者比挑战者强,但没法让裁判看到超越求解者当下水平的答案是什么样;子任务放大对恰恰能提供这种超前样本,对持续进步更关键。

如果把裁判完全撤掉,回到最初那种固定评判、不做任何协同进化的设定,总分直接跌到34.54,这也印证了前面反复强调的那个核心结论:裁判本身要是不进步,整套系统的天花板就焊死了。

八、一个意外发现:裁判在标准测试上也变强了

论文原本的目的是让裁判跟上求解者的步伐,而不是让裁判本身变成更强的通用打分器。但研究团队还是顺手在一个独立的、跟训练数据完全无关的评测集RM-Bench上测了一下每一轮的裁判。

结果发现,裁判在所有四个测试维度上都在涨,平均准确率从92.61涨到93.95。涨幅最大的是聊天对话类场景,提升了3.70分,这恰好是最接近挑战者出题风格的领域;安全类场景本来就接近满分,几乎没有变化空间。

更有意思的是难度细分。这个测试集把偏好对按难度分成简单、正常、困难三档,困难档指的是那种回答风格和回答质量对不上的情况,比如一份措辞平实但内容扎实的回答,对上一份辞藻华丽但内容空洞的回答,裁判很容易被表面文采骗到。结果显示困难档的准确率从85.08涨到89.85,涨了4.77分;而简单档反而略微下降了0.74分。

这个反差其实合情合理。当求解者已经足够强,它很少再产生那种一眼假的低质量答案了,简单对比对裁判来说信息量本来就在变少;真正卡脖子的是那种文笔好但内容空的回答会不会骗过裁判,这才是决定求解者能不能持续被正确引导的关键点,而这恰恰是裁判进步最多的地方。

九、这套框架目前还做不到什么

论文也坦率承认了限制。

受限于算力,实验只做到了80亿参数规模,挑战者、求解者和裁判都没有超过这个体量,而且都是基础模型,没有测试过经过后训练、擅长写长链条推理过程的模型。更大规模下这套框架是否依然有效,还是未知数。

另外,论文里的裁判用的是一个判别式打分模型,直接输出一个分数,而挑战者和求解者共用同一套生成式初始化。论文提出了一个方向:如果裁判本身也是一个能够生成文字点评的语言模型,让点评本身成为一种更丰富的训练信号,会不会效果更好?这个问题作者留给了未来的工作。

写在后面

读完这篇论文,让我印象最深的其实不是最终的分数提升,而是那个训练中段两条曲线交叉的图。

角色不对等对早期可靠、后期逐渐失效,子任务放大对早期不可靠、后期逐渐接管,这个交叉点几乎是这篇论文里最朴素也最耐琢磨的一处设计。它说明一件事:任何一种单一的评判信号,都有自己的保质期,单靠一种信号硬撑到底,系统迟早会在某个阶段失灵。真正能撑住长期自我进化的,是懂得在信号即将失效之前,提前准备好下一种信号来接棒。

这个思路其实可以脱离AI训练本身来想。任何一个需要长期自我提升的系统,不管是一个人的技能成长,还是一个组织的迭代节奏,大概都逃不开这个规律:早期靠简单粗暴的对照就能判断好坏,越往后,评判标准本身就得跟着水涨船高,不然进步的人早晚会撞上一个跟不上他的裁判。

这篇论文没有回答的问题是,如果裁判本身也开始产生带偏见的判断,谁来纠正裁判的裁判?这个链条能不能一直往上叠,还是说总会在某一层撞上一堵真正的墙?

Q&A

Q1:J-ZERO是什么?

A:J-ZERO是一个让挑战者、求解者、裁判三个角色共同进化的自我训练框架,不需要任何外部人工数据,专门解决固定裁判会限制AI持续进步的问题,在有标准答案和没有标准答案的任务上都能用。

Q2:J-ZERO和R-Zero、G-Zero有什么区别?

A:R-Zero靠多数投票获得奖励,只适合有标准答案的领域;G-Zero用固定裁判构造偏好对训练求解者;J-ZERO让裁判本身也跟着挑战者和求解者一起持续更新,不会被固定裁判的判断天花板卡住。

Q3:J-ZERO的训练效果能持续多久?

A:论文测试了十轮训练,J-ZERO的表现一直在稳步上升,没有出现停滞或下滑;而对比的R-Zero和G-Zero都在训练到第二轮时达到顶峰后开始下降。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
2.2亿抄底不良资产,中国前首富杀回来了

2.2亿抄底不良资产,中国前首富杀回来了

新浪财经
2026-09-13 18:42:30
再这么错下去,中产的崩溃是迟早的事!

再这么错下去,中产的崩溃是迟早的事!

纽约君
2026-09-09 22:01:41
10位被永久封禁的网红:从4400万粉到全网消失,他们踩了哪些红线

10位被永久封禁的网红:从4400万粉到全网消失,他们踩了哪些红线

喜欢历史的阿繁
2026-09-12 09:47:25
托雷斯跨界破纪录!重拳出击惊呆众人,退役后身材更胜球员时期

托雷斯跨界破纪录!重拳出击惊呆众人,退役后身材更胜球员时期

星耀国际足坛
2026-09-13 22:39:21
魏德尔当着全国的面,立下三大执政承诺,德国政坛彻底变天了?

魏德尔当着全国的面,立下三大执政承诺,德国政坛彻底变天了?

生活魔术专家
2026-09-13 19:23:40
2-3!意甲36冠豪门遭赛季首败 半场两度追平后遭20岁弃将读秒绝杀

2-3!意甲36冠豪门遭赛季首败 半场两度追平后遭20岁弃将读秒绝杀

我爱英超
2026-09-14 05:16:53
随着韩国男篮100:83胜日本,中国男篮头号强敌浮现,复仇机会来了

随着韩国男篮100:83胜日本,中国男篮头号强敌浮现,复仇机会来了

小哆说体育
2026-09-13 20:18:43
糯康临死前道出实情:金三角毒枭不怕云南武警的枪口,他们内心真正忌惮的是那道30年没人敢动的密令

糯康临死前道出实情:金三角毒枭不怕云南武警的枪口,他们内心真正忌惮的是那道30年没人敢动的密令

磊子讲史
2026-09-11 16:21:43
上海未来一周难见高温日,秋天要提前来了吗

上海未来一周难见高温日,秋天要提前来了吗

上观新闻
2026-09-13 20:04:41
世界杯-西班牙女篮大胜德国获季军 马丁22+9当选最佳新人

世界杯-西班牙女篮大胜德国获季军 马丁22+9当选最佳新人

醉卧浮生
2026-09-14 06:28:49
人社部释放明确信号,给全国退休人员吃下定心丸,读懂背后含义

人社部释放明确信号,给全国退休人员吃下定心丸,读懂背后含义

小鹿姐姐情感说
2026-09-14 00:02:13
别再无效努力了!这才是高质量性生活该有的时长与满足度

别再无效努力了!这才是高质量性生活该有的时长与满足度

精彩分享快乐
2026-09-08 21:00:05
王健林再谈楼市走向:不出意外,2026年下半年楼市将面临5大变化

王健林再谈楼市走向:不出意外,2026年下半年楼市将面临5大变化

说故事的阿袭
2026-09-13 16:36:37
魔术是今夏市场上最安静的球队

魔术是今夏市场上最安静的球队

静易墨
2026-09-13 21:00:29
男子与女同事发生不正当关系后,突发脑出血成植物人,被解除劳动关系,家属起诉公司索赔38万余元,法院判了

男子与女同事发生不正当关系后,突发脑出血成植物人,被解除劳动关系,家属起诉公司索赔38万余元,法院判了

鲁中晨报
2026-09-13 14:19:14
斯诺克最新战报!3场4-1,中国军团大获全胜,巩晨智临阵退赛!

斯诺克最新战报!3场4-1,中国军团大获全胜,巩晨智临阵退赛!

刘姚尧的文字城堡
2026-09-13 19:47:09
你能认出三个算我输!三十年前的老物件你认识几个?

你能认出三个算我输!三十年前的老物件你认识几个?

时尚的弄潮
2026-09-13 09:34:24
刚上太空就放大招!香港女警拧毛巾,美国2万亿市值瞬间成了陪衬

刚上太空就放大招!香港女警拧毛巾,美国2万亿市值瞬间成了陪衬

咸鱼金脑袋
2026-09-13 19:13:21
A股:全体股民提前准备好,信号很强烈,9.14或再迎来暴风雨?

A股:全体股民提前准备好,信号很强烈,9.14或再迎来暴风雨?

风风顺
2026-09-14 00:30:06
2026-09-14 06:55:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9843文章数 568关注度
往期回顾 全部

科技要闻

三位AI大佬,罕见呼吁AI减速

头条要闻

烧烤店被检查15次致停业 12345:同一举报人投诉116次

头条要闻

烧烤店被检查15次致停业 12345:同一举报人投诉116次

体育要闻

魔术是今夏市场上最安静的球队

娱乐要闻

敬一丹留给世间最后的温柔

财经要闻

蔡昉:农民工落户可释放万亿消费潜力

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

手机
本地
数码
时尚
公开课

手机要闻

iPhone17三巨头霸榜,2026 W36销量第四名,竟是这台“塑料机”?

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

数码要闻

惠普推出OmniDesk Mini迷你主机:仅0.8升体积 支持最多四台4K显示器

伊姐周六热推:电视剧《生逢其时》;综艺《大哥小助理》......

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版