网易首页 > 网易号 > 正文 申请入驻

00后硕士揭开AI推理“黑科技”:两个Token,基模追平强化学习版本

0
分享至


智东西
作者 杨京丽
编辑 李水青

智东西10月10日报道,一项来自麻省理工学院(MIT)等机构的研究发现,只要固定基础模型回答开头的两个Token,就能让模型的数学推理成绩接近对应的强化学习版本。

以艾伦人工智能研究所(Ai2)的基础模型Olmo-3-7B为例,将回答固定为“.\n\nOkay”开头后,模型在MATH-500上的准确率从42%升至78%,超过其强化学习版本的75%。


这个过程没有修改模型参数,也没有给模型增加新的解题示例。模型只是换了一个回答起点,原本没有稳定表现出来的解题能力,似乎就更容易被调用出来。

换句话说,基础模型答错题,有时不一定是完全不会做,而是没有进入能够解题的状态。强化学习的一部分作用,可能正是让模型更容易选择这种有效的回答开头。

这一发现来自论文《基础模型可以借助训练数据中的线索进行推理(Base Models Can Reason By Taking a Cue From Training Data)》。论文于10月5日提交,由MIT、加州大学伯克利分校、华盛顿大学和艾伦人工智能研究所的研究者共同完成。

论文第一作者是麻省理工学院硕士生索菲·L·王(Sophie L. Wang)和加州大学伯克利分校博士生阿米尔·德拉维德(Amil Dravid)。索菲·L·王目前仍是MIT的硕士生,她从2023年进入MIT本科,2026年进入MIT硕士,目前她已先后在ICML和NeurIPS上发表研究成果。


论文链接:

https://arxiv.org/abs/2610.06851

项目链接:

https://www.sophielwang.com/cues

开源地址:

https://github.com/sophicle/cues

一、回答开头只改两个token,基础模型准确率追平强化学习版本

论文将模型回答拆分为“开头token线索”和后续生成内容两部分。研究者通过预先固定回答开头,观察不同开头如何改变模型接下来的生成结果。

他们首先观察Olmo-3-7B在MATH-500上的回答。正确答案中,约有50%的回答以“.\n\n”(句号加两个换行)开头,错误答案中这一比例只有14%。句号和换行本身没有提供数学知识,却与正确率出现了明显关联。

研究者随后从模型可能生成的回答开头中寻找有效线索。他们先用搜索方法找出基础模型较可能生成的短开头,再让模型从每个开头继续回答,比较多次采样结果的一致性。

对Olmo-3-7B,最终选中的开头是“.\n\nOkay”;对Qwen3-14B,选中的是“ Alright,”。研究者把这些文字预先填入模型回答,再让模型自行生成后续内容。

在MATH-500上,Olmo-3-7B基础模型自行生成回答开头时,其准确率约为42%;将回答开头固定为“.\n\nOkay”后,准确率升至约78%,高于其强化学习版本约75%的成绩。

Qwen3-14B使用“ Alright,”作为回答开头后,准确率则从72%提高到87%,与强化学习版本持平。相同开头还被用于GSM8K、AMC 23、AIME 2024等数学测试,在多数测试中都能带来提升。在代码生成测试HumanEval上,固定开头提高了Olmo-3-7B的成绩;Qwen3-14B的成绩则与不固定开头时相近。


论文中展示了一道具体题目的生成差异。题目较为简单,要求计算834名学生占全校人数三分之二时,全校共有多少名学生。

当模型以“.\nAnswer”开头时,它直接给出“1002”,答案错误;当模型以“.\n\nOkay”开头时,它先列出“(2/3)×T=834”,计算出1251,随后又主动检查结果,确认计算没有问题。设置新开头后,模型给出了正确的答案,生成过程中,模型没有获得额外提示,也没有更换参数,仅修改了回答开头。

二、从14%升至65%,强化学习先改变模型的回答开头

如果基础模型在固定开头后已经能达到接近强化学习模型的成绩,强化学习究竟改变了什么?

研究者采用RL-Zero设置,让模型直接根据自己生成答案的对错获得奖励。比较强化学习前后的模型后,他们发现,两者预测分布的最大差异集中在回答最开始的两个token。

对Olmo-3-7B,强化学习将“.\n\nOkay”的生成概率从0.14提高到0.65;对Qwen3-14B,“ Alright,”的生成概率从0.04提高到0.58。强化学习前后,模型的预测差异主要集中在回答最开始的两个token,之后差异明显减小。


研究者还把强化学习模型已经生成的回答开头交给基础模型,让基础模型从相同位置继续回答。Olmo-3-7B在这种条件下可以达到强化学习模型的准确率。

训练曲线显示,预先固定有效开头后,Olmo模型的成绩大约相当于标准强化学习训练100步后的水平,Qwen模型则相当于约50步后的水平。

这说明,在这组实验中,强化学习的一部分作用可能是提高模型选择有效推理开头的概率,让它更容易进入原本已经存在的推理路径。

研究者还控制了回答长度。部分开头会让模型写出更长的回答,但准确率仍低于不固定开头的结果;在相同token预算下,“.\n\nOkay”仍保持优势。因此,成绩提升不能只用回答变长来解释。


三、训练数据改写词语关联,“Chicken”也能诱导推理

“Okay”为什么有效?它可能符合人类开始思考时的表达习惯,但研究者希望进一步确认,效果是否来自训练数据中反复出现的词语关联。

他们将Olmo模型中期训练数据里与推理轨迹共同出现的“Okay”替换为“Chicken”,再从相同检查点继续训练。测试时,模型都被固定为以“.\n\nChicken”开头。

在原始基础模型中,固定“.\n\nChicken”后的MATH-500准确率约为18%,低于不固定开头时的42%。重新训练后,模型则会沿着推理文本的模式继续生成,准确率升至77%,接近“.\n\nOkay”开头的78%。

在使用10B-token中期训练数据的重训实验中,固定“.\n\nChicken”后,MATH-500准确率从2.4%升至37.2%;在使用100B-token数据的另一组实验中,准确率则从18.2%升至76.9%。两组实验的数据规模不同,但都说明,重新建立“Chicken”与推理文本之间的训练关联后,这个词才具备了推理线索的作用。


修改后的模型也没有忘记Chicken的日常含义。面对“A chicken is a”或“She roasted the chicken”这样的句子,它仍然可以生成与鸟类或食物有关的内容。

研究者还将训练数据中的“step by step”替换成“duck duck goose”。重新训练后,“Think duck duck goose”也能像“Think step by step”一样诱导模型推理。

隐藏状态分析显示,不同开头会把模型带向不同类型的训练文本。“.\n\nOkay”更接近合成推理轨迹,“To”更接近解释型数学文本,“Answer”则更接近简短问答文档。研究者还发现,线索越早出现在回答中,产生的影响越持久;等到第三至第六段才插入“Okay”,效果会明显下降。


四、修改回答开头,模型可能拒绝请求

此外,研究者还把同样的方法用于安全测试中,观察不同回答开头会如何影响模型拒绝或遵从请求。

在Olmo-3-7B中,以“I’m sorry”开头的回答更容易拒绝请求,但也会增加对无害请求的误拒绝;“Okay,”会减少拒绝,并增加模型对危险请求给出有害内容的概率。

数学实验中有效的“.\n\nOkay”则呈现出另一种效果:模型会更多拒绝危险请求,同时减少对正常请求的误拒绝,表现出更有选择性的拒绝行为。

论文还发现,仅仅改变空格、标点和换行方式,就可能带来不同结果。“Okay,”和“.\n\nOkay”看起来很接近,但前者可能成为更容易遵从危险请求的开头,后者则更接近先分析、再决定是否拒绝的回答模式。


这说明,回答开头对模型行为的影响并不局限于数学推理,也涉及拒答、安全等问题。

结语:模型能力和稳定发挥之间,还隔着一个“开头”

通过这篇论文可以发现:模型答错题,有时不代表它完全不会做,也可能是没有进入正确的思路。对Olmo-3-7B来说,只是在回答开头加上“.\n\nOkay”,准确率就从约42%提高到了78%。

“Chicken”的实验则说明,词语能起什么作用,和它在训练数据中经常跟什么内容一起出现有关。经过重新训练后,“Chicken”也能引导模型一步步解题。模型记住的可能不只是词语本身,还包括这个词通常会带来什么样的回答。因此,在实验条件下,预先固定有效的回答开头,都可能帮助模型进入更适合解题的状态。

不过,需要注意的是,实验测试的模型主要为Olmo-3-7B和Qwen3-14B,无法确定在其他模型上是否能产生类似的效果。这种方法是否有效,还要看具体模型和任务。这一方法虽然在一定程度上能够提高准确率,但想让模型面对不同问题和不同表达时都能稳定回答,仍然需要高质量的训练数据和充分的模型训练。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
高市早苗公开反对特朗普,称不会将AI改名为SI,此前特朗普称任何继续使用“AI”一词而非“SI”的都是敌人

高市早苗公开反对特朗普,称不会将AI改名为SI,此前特朗普称任何继续使用“AI”一词而非“SI”的都是敌人

极目新闻
2026-10-09 13:50:37
没有任何退路可言!中国国防部向世界警告:解放军已做好全部准备

没有任何退路可言!中国国防部向世界警告:解放军已做好全部准备

阿芒娱乐说
2026-09-23 15:11:19
港媒:大陆高铁已被“粪便淹没”!再不解决后果严重,真的假的?

港媒:大陆高铁已被“粪便淹没”!再不解决后果严重,真的假的?

铭记历史呀
2026-09-02 02:21:33
四五十元一个的面包没人买了,开面包店的年轻人集体闭店

四五十元一个的面包没人买了,开面包店的年轻人集体闭店

每日人物
2026-10-10 10:18:40
“我儿子周岁13,虚岁40”,家长无奈晒照片:跟中年男人没啥区别

“我儿子周岁13,虚岁40”,家长无奈晒照片:跟中年男人没啥区别

番外行
2026-10-09 09:39:16
伊能静儿子恩利现身上海逛街,五官酷似庾澄庆,一身富家公子打扮

伊能静儿子恩利现身上海逛街,五官酷似庾澄庆,一身富家公子打扮

大眼妹妹
2026-10-10 12:18:50
龙凤胎高考出分哥哥690妹妹350,次日妹妹在家中失踪警方查后傻眼

龙凤胎高考出分哥哥690妹妹350,次日妹妹在家中失踪警方查后傻眼

罪案洞察者
2025-10-18 10:08:44
家长晒“10岁女儿的脚”,才知道啥叫家教差距,很多人被养得太差

家长晒“10岁女儿的脚”,才知道啥叫家教差距,很多人被养得太差

番外行
2026-10-10 10:07:57
WTT中国大满贯:男单4强诞生!奥运亚军惨败,林昀儒强势晋级

WTT中国大满贯:男单4强诞生!奥运亚军惨败,林昀儒强势晋级

全言作品
2026-10-10 14:50:54
两起投毒案:北京男子给狗投毒判4年,云南女子给人投毒判3年半

两起投毒案:北京男子给狗投毒判4年,云南女子给人投毒判3年半

不掉线电波
2026-10-09 21:27:40
海灯法师:79年摆拍著名“二指禅”照片,宣传放癌功,最后死于癌症

海灯法师:79年摆拍著名“二指禅”照片,宣传放癌功,最后死于癌症

黑句本
2026-10-08 22:13:16
乌军再次攻入俄本土 泽连斯基怒怼卢比奥

乌军再次攻入俄本土 泽连斯基怒怼卢比奥

西楼饮月
2026-10-09 21:47:49
报告称疑似位于广东的人员使用中国开发的AI工具,对韩国金融机构实行了网络攻击,中方:反对出于政治目的散布虚假信息

报告称疑似位于广东的人员使用中国开发的AI工具,对韩国金融机构实行了网络攻击,中方:反对出于政治目的散布虚假信息

政知新媒体
2026-10-08 16:02:51
34:0!日本投出罕见全票,高市失声沉默,遭全民炮轰!

34:0!日本投出罕见全票,高市失声沉默,遭全民炮轰!

让心灵得以栖息
2026-10-09 19:46:27
“权贵们的新套路!”北理工裴轶的来时路被扒:和协和4+4竟是一个套路

“权贵们的新套路!”北理工裴轶的来时路被扒:和协和4+4竟是一个套路

妍妍教育日记
2026-10-05 10:10:15
NBA的嫪毐?替补轮换泡到老板女儿!祸乱朝纲,冠军教头因他被裁

NBA的嫪毐?替补轮换泡到老板女儿!祸乱朝纲,冠军教头因他被裁

你的篮球频道
2026-10-10 08:56:13
随着F勒布伦1-4,WTT中国大满贯男单4强已诞生3席:中巴日各一人

随着F勒布伦1-4,WTT中国大满贯男单4强已诞生3席:中巴日各一人

侧身凌空斩
2026-10-10 14:02:05
证监会放大招 晚间利好堆积

证监会放大招 晚间利好堆积

趋势巡航
2026-10-10 07:10:24
全球禁赛:姆巴佩离开皇家马德里面临的严重后果

全球禁赛:姆巴佩离开皇家马德里面临的严重后果

本泽体育
2026-10-10 05:01:49
新华社删文、热搜消失,尊界风波越来越不简单了!

新华社删文、热搜消失,尊界风波越来越不简单了!

新动察
2026-10-09 11:43:41
2026-10-10 16:12:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12708文章数 117184关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

陪读爸爸自筹200多万把孩子的心事拍成电影 本人发声

头条要闻

陪读爸爸自筹200多万把孩子的心事拍成电影 本人发声

体育要闻

与C罗硬碰硬,一个72岁老人的倔强

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

蹭尊界流量?岚图汽车在“玩火”

汽车要闻

老车主请回避 2026款理想i6升级都是你想要的

态度原创

数码
手机
游戏
艺术
家居

数码要闻

狼蛛昆仑L5电竞鼠标10月12日开启预约:PAW3955 EVO传感器、59g重量、SSHS 2.0电磁微动技术

手机要闻

iQOO Neo12首发搭载pTSF技术的2K 185Hz超冠屏,本月见

《异锁》更新陆续加入六名英雄 在线人数创新高

艺术要闻

21幅 野兽派创始人‌ 马蒂斯作品集二

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版