网易首页 > 网易号 > 正文 申请入驻

EMNLP 2026高分论文MathDebugger:当合成数据涌入训练集,如何为数学题做体检?

0
分享至


作者 | 北大 OpenDCAI 团队

过去谈模型数学能力时,评测标准往往是解题的准确率。但随着越来越多的合成数据出现,错误有时会出现在题目上,模型必须要能判断一条数学数据题目本身能否被信任,是否存在条件冲突等,再验证答案。

比如把下面这道题目输入模型问答:一个圆的半径是 3 英寸,已知这个半径和圆周长的乘积等于圆面积,问圆的周长是多少?模型给出 3π 的答案。实际上题目中的额外条件和圆的基本几何关系冲突,所以题目无解。


这便是合成数学数据里非常棘手的问题。一条样本数据可以有完整题干、公式和参考答案,内部却已经混入条件缺失、表达歧义、逻辑矛盾、推理错误或计算错误。它进入训练集以后,模型学到的可能包括正确知识,也可能包括错误的题目结构和推理习惯。

为了提高数学领域合成数据的质量,北京大学 DCAI 团队提出数学数据质检 BenchMark——MathDebugger,它同时覆盖 Question 和 Answer 两端,包含 4,000 道题目、2,000 条带标注答案、7 类细粒度错误类型,并评测了 14 个主流 LLM 和 3 个 Process Reward Model。论文《MathDebugger: Detecting and Diagnosing Errors in Synthetic Mathematical Data》也已被接收为 EMNLP 2026 高分论文。( OA 3.83|Meta 4|Top 0.45%)

MathDebugger 主要解答三个问题:

• 一条 Question 或 Answer 是否正确?

• 如果它是错的,错误到底属于哪一类?

• 给出明确错误类型以后,模型能不能把它修得更准?

论文中也出了一个重要实验结果:强推理模型在细粒度验证上仍远未达到饱和,而错误类型监督能稳定提升纠错准确率。MathDebugger 的价值既在评测,也在于同时对问题和答案进行测试与错误分类,并把错误变成后续修复可以使用的信号。


论文地址 https://arxiv.org/abs/2502.19058

开源仓库 https://github.com/haolpku/MathDebugger

1 Dataset:同时评测问题与答案

在评测数据集的设计上,MathDebugger 基于 GSM8K 和 MATH 种子,合成并整理了一批带质量标签的数学样本。

这批数据同时覆盖题目和答案。题目侧先检查一道数学题本身能不能成立,答案侧再检查给定解答是否可靠。按照真实的数据清洗流程,题目如果已经无解或条件冲突,后面的答案评测就没有意义。只有题目先通过检查,才适合继续看答案写得对不对。

对应到 benchmark 里,MathDebugger 把评测拆成四个任务。

评测任务

输入内容

模型需要输出

题目正确性检测

数学题目

题目正确或题目错误

题目错误类型分类

有错误的数学题目

表达错误、条件缺失、条件矛盾或不现实设定

答案正确性检测

数学题目和对应答案

答案正确或答案错误

答案错误类型分类

数学题目和有错误的答案

逻辑错误、计算错误或表达错误

前两个任务检查问题。它们判断题目本身是否成立,再进一步分类题目错误。后两个任务检查回答。它们判断给定答案是否可靠,再进一步分类答案错误。这样一来,MathDebugger 测的是模型能不能完成过滤、定位和修复前的诊断,单次解题分数退到了背景里。

MathDebugger 采用两个难度层级。SIMPLE 来自 GSM8K seed,CHALLENGING 来自 MATH seed。这样做的好处是,数据集既保留小学和初中风格的文字应用题,也覆盖更具挑战性的竞赛数学题。


数据分布设计方面。题目数据在正确与错误之间保持平衡,四类题目错误也保持平衡。答案数据则更接近自然分布,错误类型并不均匀。比如在 610 条错误答案中,logic error 有 314 条,computing error 有 232 条,expression error 有 64 条。

标签质量方面做了专门控制。实验使用 STEM 背景标注者和复核者进行多轮检查,并采用独立标注与专家复核。错误类型层面的 Fleiss’ κ 达到 0.69 到 0.91。这个数字说明,细粒度错误类型经过了一致性检验。

评测协议方面。官方 evaluator 尽量减少比较时的歧义。Binary 任务使用 Accuracy 和 F1,Type 任务使用 Macro F1,无法解析的输出会进入 Other 类别。这样一来,模型答错和模型无法按要求回答,会被清楚地区分。

2 七类错误:题目侧和答案侧分别怎么标

MathDebugger 针对题目和答案定义了不同的错误标签,题目侧的错误来自合成数据中常见的题干缺陷。

错误类型

含义

典型问题

Expression error

表达、术语或符号让题目难以理解

把数量、单位或对象写混

Lack of conditions

缺少求解所需信息

问剩余数量,却没有给出转移数量

Contradictions

条件互相冲突

总数、个体数量和约束不能同时成立

Unrealistic

设定违反现实约束

半个人、负边长、非整数学生数

这四类错误的共同点是,题目看起来都有数学外壳。它们通常已经是有完整外观的数学文本。很多情况下,模型必须先理解题目要表达什么,再判断它有没有足够条件,条件之间能不能同时成立,设定是否符合现实。

答案侧的问题更接近模型生成结果的质量检查。

错误类型

含义

典型问题

Logic error

方法或推理路径错误

公式选错、条件使用错误、步骤不可行

Computing error

计算过程出错

算术、代数变形或近似错误

Expression error

表述不完整或无法形成有效答案

只说会帮忙,没有真正作答

在真实训练数据里,一个答案的最终数值可能碰巧正确,中间推理却是错的。也可能推理方向正确,但某一步计算出了问题。只看最后结果,会漏掉这些训练风险。MathDebugger 把答案当作一条推理轨迹来验,这让它更适合评估 reward model、LLM judge 和数据清洗系统。

3 实验结果:会做题和会验题是两种能力

MathDebugger 的实验结果有一个直接结论:模型的解题能力很强,但它对数学数据质量的验证能力没有同步变强,会做题和会验题对模型来说是两种能力,这个差距可以称为 solving versus verifying gap。

SIMPLE split 结果显示,Question detection 的高分模型可以达到 70 多分,Answer detection 也能达到 80 左右。但到了 Answer type,最好的 Macro F1 仍然在 55 左右。也就是说,判断答案有没有错已经不容易,进一步判断错在哪里更难。

任务

观察

Question detection

Claude 3.5、GPT-o4-mini、GPT-o1、Qwen2.5-72B、DeepSeek-R1 位于前列

Question type

GPT-4o、Qwen2.5-72B、GPT-o1、LLaMA-3.3-70B 等表现较好

Answer detection

Qwen2.5-72B、Qwen2.5-7B、GPT-4o 等位于前列

Answer type

最好结果仍接近 55 Macro F1

因此,数学验证能力并没有随着解题能力自动饱和。此外实验还观察到,经过数学微调的模型、擅长长链推理的模型在验证任务上并不稳定优于通用模型。能把题做出来,不代表能判断题目和答案是否可靠。

4 从诊断到矫正:错误标签是有效监督信号

精细化检测的意义在于,精准定位错误,然后定向解决它。

实验发现,当把真实错误类型提供给模型时,GPT-4o 和 DeepSeek-R1 的纠错准确率都会稳定提升。提升最明显的是条件缺失和条件矛盾这类结构性错误。比如 Lack of Conditions 上,GPT-4o 从 49.2% 提升到 53.9%,DeepSeek-R1 从 52.1% 提升到 55.6%。Contradictions 上,两类模型也都有 2.1 个百分点左右的提升。

场景

最大增益

Missing conditions · GPT-4o

+4.7 percentage points

Missing conditions · DeepSeek-R1

+3.5 percentage points

Contradictions · GPT-4o

+2.1 percentage points

Computing errors · both

+1.8 percentage points

这也有效证明了错误标签是一种可以直接参与修复的监督信号。对于合成数学数据来说,发现错误只是第一步。更重要的是把错误描述到足够具体,让后续模型知道该修改哪个环节。


随着合成数据规模越来越大,对数据质量的把控更加不能只依赖抽样检查和事后修补。数学数据一旦进入训练流程,错误就不再只是单条样本的问题,它可能变成模型反复学习的推理习惯。MathDebugger 的价值也在于此——把题目是否成立、答案是否可靠、错误能否定位、修复是否有效,变成一组可以持续评测、可量化的任务。

只有当模型能够识别条件冲突、定位推理偏差等错误,并借助错误标签修正答案,数学领域的合成数据才真正从“数量堆砌”走向“质量可控”。

关于作者

梁昊

北京大学大数据科学研究中心博士,曾连续两年获北京大学校长奖学金,第一作者发表 10+篇 CCF-A 论文/期刊。主导 Data-Centric AI 系列开源项目设计开发,项目累计获得上万 GitHub Star,其中 DataFlow 项目荣获 ICML SeePhy 比赛冠军,智源 LIC 挑战赛冠军。同时带领团队负责 Camel,LLaMAFactory 项目的数据模块设计开发,分别获得 17k+和 74k+ stars。

北京大学 DCAI 团队

专注于大模型数据系统研究与 Data-Centric AI 基础设施建设,开源 DataFlow、DataFlex、One-Eval、3AGameFactory、OpenWorldLib 等多个项目。

开源项目:

  • DataFlow (7.9k+ Stars) :一站式 LLM 训练数据准备系统 https://github.com/OpenDCAI/DataFlow

  • DataFlex:LLM 动态数据训练框架 https://github.com/OpenDCAI/DataFlex

  • DataMind:Agentic 范式的推理时数据检索框架 https://github.com/OpenDCAI/DataMind

  • One-Eval:基于 Agent 的自动化大型语言模型评估框架 https://github.com/OpenDCAI/One-Eval

  • OpenWorldLib:统一世界模型的通用推理与交互框架 https://github.com/OpenDCAI/OpenWorldLib

  • 3AGameFactory:3A 游戏生成 skill 与资产框架 https://github.com/OpenDCAI/GameFactory-3A

  • 更多开源项目可查看 https://github.com/OpenDCAI


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
可悲,已经独立百年的外蒙古,或许正在把中国人40年的努力毁掉

可悲,已经独立百年的外蒙古,或许正在把中国人40年的努力毁掉

耀眼的星火
2026-09-03 10:29:06
毛主席建国后有“三不踏”的说法:不回延安、不进故宫、不登泰山

毛主席建国后有“三不踏”的说法:不回延安、不进故宫、不登泰山

纪史行者
2026-09-03 01:20:03
俄提议在俄建金砖统一黄金库,中国:黄金不搬家,账上互认更稳妥

俄提议在俄建金砖统一黄金库,中国:黄金不搬家,账上互认更稳妥

有牙的兔纸
2026-09-03 07:11:29
我和前妻刚离婚,她就把私生子接回了家,她妈打电话来哭诉:你停了我们每月6万的生活费,这是要我们的命啊,我直接挂了电话

我和前妻刚离婚,她就把私生子接回了家,她妈打电话来哭诉:你停了我们每月6万的生活费,这是要我们的命啊,我直接挂了电话

晓艾故事汇
2026-09-01 15:19:22
印度小伙来中国,与中国姑娘交往2个月被踹,姑娘:我现在全身病

印度小伙来中国,与中国姑娘交往2个月被踹,姑娘:我现在全身病

悬案解密档案
2025-05-21 10:46:02
致敬梅西!阿根廷所有足球比赛暂停1分钟全体鼓掌

致敬梅西!阿根廷所有足球比赛暂停1分钟全体鼓掌

体坛周报
2026-09-03 09:38:11
320位院长落马、顶级院士被抓!而这位老人为救人放弃了天价财富

320位院长落马、顶级院士被抓!而这位老人为救人放弃了天价财富

江启
2026-09-03 11:51:47
百万"数字人"成了赛博僵尸,直播间流量崩塌,每天收益还不足5块

百万"数字人"成了赛博僵尸,直播间流量崩塌,每天收益还不足5块

米果说识
2026-09-03 22:06:00
5亿吨冰层崩塌,6分钟狂奔22公里,为何科学家仍在争论?

5亿吨冰层崩塌,6分钟狂奔22公里,为何科学家仍在争论?

三农老历
2026-09-03 00:42:57
美股科技七巨头深夜爆发,特斯拉大涨超6%,中概股普跌,博通大跌超5%,金银拉涨

美股科技七巨头深夜爆发,特斯拉大涨超6%,中概股普跌,博通大跌超5%,金银拉涨

第一财经资讯
2026-09-04 00:52:40
黄瓜再次成为关注对象!多名院士发现:常吃黄瓜的人,有7个变化

黄瓜再次成为关注对象!多名院士发现:常吃黄瓜的人,有7个变化

任医生聊健康
2026-08-03 08:40:30
高希希新《新三国》要来了!对标《权游》,AI打辅助,预计2年内拍完9季!

高希希新《新三国》要来了!对标《权游》,AI打辅助,预计2年内拍完9季!

设计最前沿
2026-09-01 21:50:02
碰见中国人就打?这个国家有多讨厌中国人,为何我们还要去旅游?

碰见中国人就打?这个国家有多讨厌中国人,为何我们还要去旅游?

怪味历史连连看
2026-07-18 20:48:32
麻烦大了!仅24小时,郭德纲再迎3大噩耗,被立案调查仅"开胃菜"

麻烦大了!仅24小时,郭德纲再迎3大噩耗,被立案调查仅"开胃菜"

社会日日鲜
2026-08-14 07:00:02
长期吃隔夜剩菜,顺德3岁男童全身发紫住进ICU;家长还以为是“气色差”,幸好老师发现不妥!医生紧急提醒

长期吃隔夜剩菜,顺德3岁男童全身发紫住进ICU;家长还以为是“气色差”,幸好老师发现不妥!医生紧急提醒

小强热线
2026-09-03 21:14:15
女子拉萨旅游花8万买藏刀,4年后重游店主见刀傻眼:这次竟要30万回收?

女子拉萨旅游花8万买藏刀,4年后重游店主见刀傻眼:这次竟要30万回收?

坠入二次元的海洋
2026-09-01 11:52:06
拒绝谈论亚锦赛,朱婷官宣新决定,首次发声,赖亚文该调整

拒绝谈论亚锦赛,朱婷官宣新决定,首次发声,赖亚文该调整

不问归期d
2026-09-02 18:55:37
暗黑界10大G系女神天花板,凪光只能排在第二

暗黑界10大G系女神天花板,凪光只能排在第二

吃瓜党二号头目
2026-07-20 08:46:45
人伦大乱正在毁掉无数家庭,很多家庭一地鸡毛,根本不是缺钱

人伦大乱正在毁掉无数家庭,很多家庭一地鸡毛,根本不是缺钱

周哥一影视
2026-08-04 00:38:27
公安系统的朋友坦言:微信如同没穿衣服,很多普通人却浑然不知

公安系统的朋友坦言:微信如同没穿衣服,很多普通人却浑然不知

花小猫的美食日常
2026-08-19 07:08:36
2026-09-04 03:43:00
InfoQ incentive-icons
InfoQ
有内容的技术社区媒体
12892文章数 52051关注度
往期回顾 全部

教育要闻

全国小学初中已全部替换新教材,告别死刷题主打学以致用

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

体育要闻

梅西:巴萨10号与阿根廷10号

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

章子怡套现3亿 上美拿什么补韩束的缺?

科技要闻

英伟达129亿美元拿下Hugging Face

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

教育
时尚
亲子
旅游
房产

教育要闻

同样考80分,北京和天津的孩子为什么不能用同一套学习计划?

女人到了60岁衣服少穿大红大绿,试试这些纯色单品,高级又耐看

亲子要闻

儿科医生建议,这些零食可以给孩子吃的

旅游要闻

公告!忻州云中河温泉旅游度假区足球场9月6日、13日、27日暂时关闭

房产要闻

投资50亿!三亚又一重大配套,方案曝光!

无障碍浏览 进入关怀版