网易首页 > 网易号 > 正文 申请入驻

AI做数学题时,脑子里到底在想什么

成年人的选择题突然变成了数学题

0
分享至


你有没有想过这样一个问题:当一个大语言模型解出一道数学题的时候,它到底经历了什么?

不是问它算对了没有,而是问它内心的解题过程长什么样。是像一个训练有素的数学家一样,先想清楚用什么方法,再一步步推导?还是像一个学生瞎蒙,写了一堆公式,凑巧撞上了正确答案?

这个问题过去很难回答,因为我们评价AI数学能力的方式太粗糙了。基本上就是看它最后写的答案对不对,顶多再看看它的思维链条有多长、有没有说"等等""啊哈"这种自我修正的口头禅。这就好比你想了解一个学生的解题思路,却只盯着他草稿纸的字数和涂改次数,从来不看他写了什么内容。

这篇来自首尔大学的论文,提出了一个叫SHAPE的框架,试图真正走进AI解题的思维内部,搞清楚它用了什么样的数学策略、在不同的问题理解方式之间怎么切换。这个研究不但揭示了AI推理的内在结构,还发现了一个让人有点意外的现象:强化学习训练出来的模型,反而在解题策略上变得更"专一"、更保守了。

问题出在哪里

先说清楚现有方法的局限在哪。

CoT(Chain-of-Thought,思维链):大语言模型在回答复杂问题前,先生成一步步的中间推理过程,而不是直接给出答案。

过去研究CoT的人,主要盯着几个表面特征看:推理链条有多长,有没有"wait""aha"这类自我修正的词,或者把推理过程粗略分成"计划""验证"这样几个大阶段。还有人研究推理的图结构、树结构。

这些方法都有一个共同的盲点:它们不追踪模型在解题时到底站在哪个"数学立场"上。

打个比方,同一道题,你可以把它当成一个代数问题来解(设未知数、列方程),也可以把它当成一个几何问题来解(画图、找相似三角形),还可以直接暴力枚举试答案。这三种"立场"背后是完全不同的思维路径。一个模型可能一开始用代数方法列了方程,卡住了,转头去试了几个具体数字,然后又杀回代数方法把方程解出来。这整个过程,如果你只数它说了几次"wait",或者只看它推理链条多长,你根本看不出来它经历了这场"立场切换"的戏码。

这就好比你想评价一个人炒股的策略,却只记录他每天交易了多少次、犹豫了几回。至于他到底是在做价值投资还是短线投机,这些交易记录完全反映不出来。如果不追踪策略本身,你永远只能看到动作,看不到动机。

数学教育学界其实早就在琢磨这个问题了。波利亚(Pólya)在1945年那本经典的《怎样解题》里,还有后来舍恩菲尔德(Schoenfeld)的研究,都在讨论解题者是怎么组织自己的思维的。这些研究沉淀出了两个核心概念。

语义空间*:解题者当下对问题的数学理解方式,比如是用代数眼光看,还是用几何眼光看,还是把它当成一个计数问题。

启发式*:在某个语义空间里,解题者采取的具体行动,比如引入新的符号、简化问题、试几个特殊值、反证法等等。

SHAPE框架把这两个概念直接搬到了AI推理分析上,用来拆解CoT轨迹。

SHAPE到底怎么工作

先看一个具体例子。题目是"120只动物一共328条腿,是鸡和兔子,求各多少只"。

模型一开始设未知数c(鸡)和r(兔子),列出方程组,这时候它处在"代数约束"这个语义空间里。接着它卡住了,说"要不我试几个具体数字吧",开始枚举兔子数量0、1、2……这时候它已经切换到了"试算计数"这个全新的语义空间。试了几步发现太慢了,又杀回代数方法,用消元法解出了方程,答案是76只鸡、44只兔子。这时候它又"返回"了最初的语义空间。

整个过程里,每一步具体动作都被打上了启发式标签,比如"引入符号表示"、"探索特殊情形"、"呈现相关工具",而这些动作串起来,形成了空间1→空间2→空间1这样一条切换路径。

这套标注怎么做到自动化、大规模跑起来的?研究团队搭了一条三阶段流水线。

内容单元切分*:先把一整段CoT文本切成一个个"内容单元",每个单元对应一个连贯的解题动作,不是按句子机械切分,而是按策略是否发生变化来切分。

第一阶段做内容单元切分,第二阶段给每个单元打启发式标签(一个单元可能同时打多个标签),第三阶段判断语义空间的状态变化,是维持当前空间(MAINTAIN)、开辟新空间(NEW),还是返回之前用过的某个空间(RETURN)。

为了保证这套自动化流程靠谱,研究者们先手工标注了一个"黄金标准"数据集。四位作者(其中一位是数学教育方向的研究生)对48条CoT轨迹逐条讨论,直到达成共识,一共标了1598个内容单元。然后拿这个黄金集去测试各种候选的标注模型,最终选定Grok-4.1-Fast和开源的Qwen3.5-27B作为主力标注工具。

这里有个细节挺有意思的:标注启发式这件事本身就是个主观判断很强的活。比如论文里举了个例子,模型在验证一个计数方法时,用小范围数字做了测试。这个动作到底该标成"探索特殊情形",还是"用不同方法推导验证",还是"简化问题"?三位标注者一开始意见不一致,最后讨论下来发现,这个动作其实同时承担了三个角色,干脆三个标签都保留。这种处理方式其实挺诚实的,承认了数学思维本身就是多层次交织的,不是非黑即白的分类题。

有了标注结果,研究者定义了两个关键指标来刻画模型的解题模式。

有效空间数*:衡量模型的推理精力分散在多少个语义空间里,数值越高说明探索的角度越多越杂。

有效转移数*:衡量模型在不同语义空间之间来回切换的频繁程度。

这两个指标搭配起来,能揭示很多东西。比如一个模型如果有效空间数很低但有效转移数很高,说明它在一个很窄的几个立场之间反复横跳,却始终没有拓宽思路,这其实是一种"原地打转"的低效状态。

策略比长度更能预测对错

第一个重要发现是:追踪启发式比看CoT的表面特征,更能预测答案对不对。

研究者用了100道Omni-MATH数据集里的题目,收集了15个不同模型生成的CoT轨迹,然后训练逻辑回归分类器,看哪种特征集合最能预测最终答案是否正确。

结果相当清楚。只看CoT长度,预测准确率几乎是瞎猜的水平(AUROC只有0.504)。加上推理token数量和占比,还是没什么提升(0.503)。看自我修正词汇(wait、aha之类),能到0.618。对比一个叫ThinkARM的方法(把推理过程分成读题、分析、计划等8个阶段来统计),也是0.618,但它用了8个特征,而"wait"类词汇只用了3个特征就打平了。

而SHAPE的启发式特征,用了11到12个特征,AUROC冲到了0.664,是所有方法里最高的。

这说明什么?说明真正决定一道题能不能做对的,不是模型话说得多不多、有没有反复嘀咕,而是它具体采取了什么样的数学动作。这就好比判断一个人做菜好不好吃,你去数他颠了几次勺、说了几句"这个不对我重来",都不如直接看他到底放没放盐、火候对不对来得准。表面动作和最终结果之间隔着一层,只有看到具体的"策略选择",才能真正摸到那层决定成败的关键。

聚焦,而不是发散

第二个发现更有意思:正确的推理轨迹倾向于把精力集中在少数几个语义空间里,而错误的轨迹往往在很多不同空间之间来回摇摆。

论文对比了15个模型在正确和错误轨迹上的语义空间指标。几乎所有模型都表现出同一个规律:错误轨迹的有效空间数、有效转移数、转移比率都比正确轨迹更高。

尤其是转移比率这个指标(衡量平均每个语义空间被重复访问多少次),错误轨迹普遍更高,这意味着模型在错误路径上不是在往前推进,而是在反复折返同样的几个立场,却始终解不出来,这跟大家常说的"过度思考"现象是吻合的。

再看开源推理模型和普通指令微调模型的对比也很说明问题。像Qwen3-32B、DeepSeek-R1、QwQ-32B这些开了"深度思考"模式的模型,有效空间数普遍在1.7到2.5之间,转移比率在0.3到0.5左右;而没开思考模式的普通模型(Qwen3-32B-NR、GPT-4o这些),有效空间数只有1.1到1.7,转移比率也就0.07到0.3。

这说明"想得久"不只是把文字堆得更长,而是真正在做更复杂的立场切换和探索。但探索本身是一把双刃剑:探索得多,如果最后能收敛回一个正确的方向,是好事;如果探索完还是散着,收不回来,那就成了浪费。

这里可以打一个比方:一个人写论文,如果他脑子里始终有一条明确的主线,即使中途去查阅了几个不同的资料、验证了几个不同的说法,最后还是能收回到那条主线上,这篇论文大概率是扎实的。但如果他东翻一个理论、西试一个框架,翻来覆去却始终没有一个稳定的立场支撑全文,那这篇论文大概率是一团糟。如果没有一个"收敛"的动作,单纯的探索广度并不会带来质量,它只会带来混乱。这正是论文里说的"人类行为一致性",人类专家解题时也是这样,广泛探索之后一定要收敛,而不是一直发散下去。

换了题型,AI能不能真正换个活法

接下来论文做了一个很巧妙的实验设计,专门探测模型是不是真的能"随机应变"。

研究者用了一个叫MATH-Perturb的数据集,里面每道原始题目都配了两个"变种":一个叫"简单扰动",只是改改数字或者措辞,解题方法完全不变;另一个叫"困难扰动",表面上看起来长得差不多,但背后要求的解题思路完全不一样。

这个设计其实很像给学生出的"陷阱题":题目长得跟他刚做过的那道很像,但套路已经变了,如果学生只会死记硬背套路,就会栽跟头。

研究者在四个后训练模型(Qwen3-8B、Qwen3-32B、Nemotron-Cascade-8B、Olmo-3-7B-Think-RLVR)上做了测试,结果显示,困难扰动下所有模型的准确率都大幅下降。比如Qwen3-32B从原题的92%掉到困难扰动的76%,掉了16个百分点;Nemotron-Cascade-8B更惨,从92%掉到71%,掉了21个百分点。

但更有意思的问题是:这个准确率下降,是因为模型完全没意识到题目变了,还是它意识到了,只是没找到正确的应对策略?

研究者用D_JS(衡量启发式使用频率分布的差异程度)、有效空间数变化、转移比率变化这三个指标做了对比。结果很明确:困难扰动带来的这三个指标变化,都显著大于简单扰动带来的变化,而且这个差异在推理刚开始的前5个、前10个内容单元里就已经出现了,不是推理到后期才慢慢跑偏的。

这说明什么?模型确实感知到了题目的变化,它并不是死板地套用记忆里的固定套路,一开始就调整了具体的解题动作。但问题是,即使它开了更多的语义空间、换了更多的启发式,它同时也更频繁地在这些空间之间反复折返,结果还是没能收敛到正确答案。

这就像一个人明明发现自己走错路了,也开始四处张望找新路,但他张望的方式是在原地转圈,而不是真正走向一条新的路径。感知到变化和真正解决变化,中间还隔着一道坎。

强化学习让AI变得更"专一",但代价是什么

这篇论文最让人意外的发现,可能是关于强化学习(RL)后训练的效果分析。

过去大家普遍认为,RLVR(带可验证奖励的强化学习,Reinforcement Learning with Verifiable Rewards,一种通过检验答案对错来给模型打分、进而优化模型的训练方式)能提升模型的推理能力,但也有一些研究开始质疑,RL可能只是在给模型已有的推理轨迹重新分配概率权重,而不是真正教会模型新的推理方式。这些质疑大多基于表面文本相似度或者最终准确率来判断,缺乏更细粒度的证据。

这篇论文用Density和Coverage这两个指标(原本是生成模型领域用来衡量生成样本和真实样本分布重合度的工具),去衡量后训练模型和它的基座模型在启发式使用模式上的关系。

Density(密度)*:衡量后训练模型的推理轨迹是不是扎堆聚集在基座模型分布的密集核心区域,数值超过1说明确实在扎堆。

Coverage(覆盖度)*:衡量后训练模型覆盖了基座模型多少种不同的推理模式,数值越低说明基座模型里有越多的策略模式被后训练"丢弃"了。

结果非常一致:三组基座-后训练模型配对(Olmo-3-7B配它的两个RL版本、Qwen3-1.7B-Base配自己训练的GRPO版本),Density全部超过1.0(1.03到1.25之间),Coverage全部低于1.0(0.53到0.87之间)。而作为对照的两个毫无关系的模型(Olmo-3-7B和Qwen3-1.7B-Base)之间,Density只有0.52,Coverage也只有0.437,明显不是同一种模式。

这说明后训练确实让模型的推理策略变得更集中了,它把精力压缩到了基座模型里那些"最靠谱"的策略模式上,但代价是,基座模型原本掌握的一部分策略多样性被舍弃了。

这就好比一个新手厨师原本会做十道菜,水平参差不齐,经过大厨严格调教之后,他只专精三道拿手菜,做得又快又好,但另外七道菜他基本不做了,甚至可能不太会做了。如果不追问这背后的取舍,你只看最终考核分数,会觉得这个厨师进步了,但如果你关心的是"这个厨师能不能应对各种突发情况",那么他技能范围收窄这件事,恰恰是需要警惕的信号。

论文里配了一张图,展示Olmo-3-7B基座模型和它的RLVR版本在启发式频率空间的主成分投影分布。RLVR版本的曲线明显向基座分布的峰值聚拢,而基座分布左边的一段"长尾"完全被荒废了。这张图直观地说明了后训练不是在拓宽策略版图,而是在收窄它。

给AI喂"启发式清单",效果立竿见影

前面说的都是诊断,发现问题。那能不能反过来,用SHAPE的洞察去改进训练呢?

研究者做了一个初步实验,在GRPO(Group Relative Policy Optimization,一种强化学习训练算法)训练过程中,直接把数学启发式的清单塞进提示词里。

具体做法是这样的:训练了两个版本。一个叫Plan-GRPO,只是让模型在解题前先写一段"计划",但不给它任何具体的启发式提示。另一个叫HA-Plan-GRPO(Heuristic-Augmented,启发式增强版),在提示词里列出了11种数学启发式(改变表征方式、重新解读对象、引入新符号、简化问题、分情况讨论、反证法等等),让模型在每一步推理时先选一个合适的启发式,再执行对应的动作。

两个版本用同样的奖励函数、同样的验证器、同样的优化器训练,唯一的区别就是训练时给模型看的提示词不一样。

结果显示,在MATH-Perturb的原题、简单扰动题、困难扰动题三种测试集上,两个版本都比裸的基座模型有提升,说明"先计划再执行"这个结构本身是有用的。但HA-Plan-GRPO的提升幅度明显更大:原题上的平均得分从基座模型的23.54分,Plan-GRPO提升到30.00分,HA-Plan-GRPO直接冲到36.80分;困难扰动题上,基座是11.84分,Plan-GRPO是14.52分,HA-Plan-GRPO是17.72分。

这个结果挺震撼的,因为两个模型的训练配方几乎一模一样,差别就在于提示词里有没有列出那份启发式清单。这说明仅仅是让模型"知道有这些策略可选",就能实实在在地提升它解题的效果,哪怕这些策略的具体使用方式还需要模型自己去摸索。

这有点像给一个刚学做菜的人一份调料清单,即使不手把手教他每道菜怎么搭配调料,光是让他知道"原来还有八角、桂皮、香叶这些东西可以用",他做出来的菜可能就已经比完全靠自己瞎试的强不少了。如果不给这份清单,他可能永远也想不到试试反证法,这不是能力问题,是压根没往那个方向想过。

写在后面

读完这篇论文,我印象最深的其实不是那些指标和数字,而是那个"困难扰动"实验里的一个细节:模型明明感知到了题目变了,前5个推理单元里就已经调整了策略,但这种感知没能转化成正确的答案。这让我想起考试时的一种真实体验,你隐约觉得这道题不对劲,跟平时练的不太一样,于是开始换角度想,但脑子越转越乱,最后还是没做对。感知到问题和解决问题之间,真的隔着一道不小的坎,这道坎AI也没能跨过去。

另一个让我意外的地方是Density和Coverage那组实验。之前听到"RL让推理多样性下降"这种说法,总觉得是个比较空泛的结论,现在看到具体数字(Density从0.52到1.25,Coverage从0.437掉到0.531),才第一次对这个"收窄"有了具体的手感。它不是一个模糊的印象,而是一条可以量化、可以复现的曲线。

还有一点值得单独说一说:论文里那个手工标注时的争议案例(一个动作到底该算探索、验证还是简化),研究者最后选择三个标签都保留,而不是强行分出唯一答案。这个处理方式本身其实在提醒我们,"数学思维"这个东西压根不是干净利落的分类问题,它是层层叠叠、彼此交织的。我们总想用一个清晰的标签体系去框住一个模糊的认知过程,但也许认知过程本身就该是模糊的,逼着它变清晰反而是在丢失信息。

这篇论文没有回答的问题是:为什么给模型看一份启发式清单就能提升效果?模型是真的理解了"反证法"这个概念的数学含义,还是仅仅学会了在提示词里出现类似关键词时调用某种固定套路?这两者对应的能力天差地别,一个是真正的数学素养,一个可能只是又一层更精致的模式匹配。SHAPE框架把这层区分变得可以观察了,但观察到不等于回答了。这个坑,可能得留给下一篇论文去填。

Q&A

Q1:SHAPE框架是什么?

A:SHAPE是首尔大学团队提出的一个分析框架,用数学教育学里的"语义空间"和"启发式"两个概念,拆解AI模型解数学题时的思维过程,而不只是看最终答案对不对。

Q2:为什么强化学习后训练会让AI的解题策略变窄?

A:论文发现RLVR训练会让模型的推理轨迹更集中在基座模型已有策略的密集区域,用Density和Coverage指标衡量,后训练模型的Density普遍超过1,Coverage普遍低于1,说明部分原有策略被舍弃了。

Q3:给AI训练时加入启发式提示,效果真的更好吗?

A:是的。论文实验显示,在GRPO训练中加入11种数学启发式提示词后,模型在MATH-Perturb困难扰动题上的得分从14.52分提升到17.72分,效果比单纯加计划步骤更明显。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“李梅烧烤”:烧死近50万人,800万人流离失所,比原子弹还可怕

“李梅烧烤”:烧死近50万人,800万人流离失所,比原子弹还可怕

史之铭
2026-06-12 09:55:26
66岁刘雪华独居上海别墅,每天清晨六点,都会准时给远在加拿大的姐姐通话报平安

66岁刘雪华独居上海别墅,每天清晨六点,都会准时给远在加拿大的姐姐通话报平安

音乐时光的娱乐
2026-08-26 02:44:53
《爸爸去哪儿》11个孩子变化大,石头高考落榜,黄多多最让人意外

《爸爸去哪儿》11个孩子变化大,石头高考落榜,黄多多最让人意外

娱说瑜悦
2026-09-10 18:22:08
千问、智谱开始做地推抢用户了!

千问、智谱开始做地推抢用户了!

人人都是产品经理社区
2026-09-10 21:45:41
三星向Tim Cook赠送Galaxy Z Fold 8 并幽默喊话“欢迎入场”

三星向Tim Cook赠送Galaxy Z Fold 8 并幽默喊话“欢迎入场”

cnBeta.COM
2026-09-12 00:27:08
导演喊“再亲一下”,井柏然孙千就真亲了:今年最敢放花絮的剧组

导演喊“再亲一下”,井柏然孙千就真亲了:今年最敢放花絮的剧组

小椰的奶奶
2026-09-11 07:42:18
甘肃省委:坚决拥护党中央决定

甘肃省委:坚决拥护党中央决定

新京报政事儿
2026-09-11 21:18:02
乌克兰最要命的问题来了:如果仗打完了,留下几百万女人怎么办?

乌克兰最要命的问题来了:如果仗打完了,留下几百万女人怎么办?

麓谷隐士
2026-08-23 00:10:04
陈幸同决胜局逆转险胜!国乒1男2女进八强,周启豪将战张本智和

陈幸同决胜局逆转险胜!国乒1男2女进八强,周启豪将战张本智和

叮咚体坛
2026-09-11 22:46:09
美国女间谍辛西娅有多牛?偷海军密码时即将被发现!脱光衣服自救

美国女间谍辛西娅有多牛?偷海军密码时即将被发现!脱光衣服自救

春秋砚
2026-07-27 13:45:08
1956年众人高呼万岁,陈云当众直言:天天喊万岁,一出错就是大错

1956年众人高呼万岁,陈云当众直言:天天喊万岁,一出错就是大错

流云青史
2026-09-10 16:24:24
王实味:一个需要向记者证明自己还活着的人

王实味:一个需要向记者证明自己还活着的人

熊倌儿
2026-08-28 21:51:10
李小璐和贾乃亮离婚后罕见同框,两人带甜馨一起做公益,画面暖心

李小璐和贾乃亮离婚后罕见同框,两人带甜馨一起做公益,画面暖心

娱乐团长
2026-09-10 09:49:06
能揍越南,不能打菲?为何菲律宾上蹿下跳,中国却始终隐忍不发?

能揍越南,不能打菲?为何菲律宾上蹿下跳,中国却始终隐忍不发?

静夜史君
2026-09-12 00:52:07
为艺术献身的澳大利亚女星—罗丝·伯恩,代表作《特洛伊》

为艺术献身的澳大利亚女星—罗丝·伯恩,代表作《特洛伊》

原梦叁生
2026-09-11 11:53:51
千叶珠宝疑似爆雷:实控人夫妇双双失联,账上仅余93万现金

千叶珠宝疑似爆雷:实控人夫妇双双失联,账上仅余93万现金

凤凰网财经
2026-09-12 00:25:31
25人遇难,中国船舶发布公告

25人遇难,中国船舶发布公告

龙de船人
2026-09-11 09:22:51
王楚钦和师母合影曝光,师母颜值气质双在线,难怪大头见了会害羞

王楚钦和师母合影曝光,师母颜值气质双在线,难怪大头见了会害羞

做一个合格的吃瓜群众
2026-09-11 10:12:23
郭德纲处罚结果仅一天!央媒点名,离谱一幕发生,与杨议旧怨被扒

郭德纲处罚结果仅一天!央媒点名,离谱一幕发生,与杨议旧怨被扒

荣亭小吏
2026-09-12 02:23:21
丢人丢到国外!中国奥运冠军落马被查,官方实锤辞职国羽颜面尽失

丢人丢到国外!中国奥运冠军落马被查,官方实锤辞职国羽颜面尽失

论事的老枢
2026-07-31 12:09:46
2026-09-12 04:31:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9842文章数 568关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

18岁女子加前男友微信被现男友发现 争吵后跳楼身亡

头条要闻

18岁女子加前男友微信被现男友发现 争吵后跳楼身亡

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

女装“玖姿”母公司跨境贸易迷局:安正时尚说谎了吗?

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

教育
房产
数码
健康
军事航空

教育要闻

现场直击!武汉科技大学2026年研究生新生开学典礼!

房产要闻

别再等了!广州改善好房,正在进入“卖一套少一套”时代

数码要闻

无开机广告!哈趣 K3 Ultra Max,高亮哈曼音响畅享大屏观影

手脚发麻口齿不清?也可能是中风!

军事要闻

涉伊朗核问题 中国和俄罗斯投下反对票

无障碍浏览 进入关怀版