网易首页 > 网易号 > 正文 申请入驻

AI拿下IMO满分金牌!小红书dots模型42/42分,比肩全球7位人类天才

0
分享至


IMO满分金牌——这是AI数学推理能力的"图灵测试"级别里程碑

2026年7月21日,一个注定被写进AI史的日子:小红书dots团队带着dots-note 3.0模型参加第67届国际数学奥林匹克(IMO 2026),六道题全部满分,42/42分,全球仅7位人类选手获此成绩

这不是一个"AI又考了个高分"的新闻。IMO是地球上最难的数学竞赛,没有之一。每年全球最顶尖的高中生在IMO上鏖战,能拿满分的寥寥无几。2026年,全球只有7个人类选手拿到了满分金牌。现在,AI也做到了。

更令人震惊的是:dots-note 3.0不依赖形式化语言,直接读取原始LaTeX题目,通过递归自我批判能力端到端完成解题。而且,它还是dots3系列中最轻量级的模型。

"IMO满分金牌这个里程碑,背后是模型递归自我批判能力的突破。不依赖形式化验证就能给出优雅证明,这对数学推理研究是个真信号,做推理方向的值得细读。"——AIHOT编辑推荐语

1 IMO满分意味着什么?不只是"AI会做题"

很多人会问:AI能考IMO满分,跟我们有什么关系?

答案是:IMO满分验证的不是"AI会做题",而是"AI能推理"

IMO的题目不是"1+1=2"的计算题。每道IMO题目都需要创造性的数学思维——你需要从零开始构建证明思路,尝试不同的路径,在遇到死胡同时回溯,最终找到一条优雅的证明路径。这不是"模式匹配"能解决的问题,这是真正的"推理"。

过去,AI在数学推理上的表现一直差强人意。大语言模型可以"背诵"已知的数学定理,但遇到需要原创性思维的新问题时,往往会"胡编乱造"。这就是为什么IMO一直是AI的"终极考场"——它考的不是知识,而是创造力

dots-note 3.0的满分,意味着AI第一次在"需要创造性推理"的顶级智力竞赛中,达到了人类顶尖水平。这不是"AI的记忆力比人好",而是"AI的推理能力开始逼近人类"。


递归自我批判——让AI在解题过程中不断"反思"自己的推理,是这次突破的核心


2 递归自我批判:dots-note 3.0的核心秘诀

dots-note 3.0最引人注目的技术特点是递归自我批判

什么是递归自我批判?简单说,就是让模型在解题过程中不断"反思"自己的推理是否正确。传统的大模型在推理时是"一条路走到黑"——给出一个答案,然后坚持这个答案。但dots-note 3.0不同:它在生成每一步推理后,会主动检查这一步是否正确、是否有漏洞、是否有更优雅的解法。

这就像人类数学家的工作方式:不是"写下一个答案就完事",而是"反复推敲、反复修改、反复验证"。高斯不会因为第一次尝试就得到正确答案而停止——他会寻找更优美的证明。dots-note 3.0的递归自我批判,本质上是在模拟这种"数学家式的思维"。

而且,dots-note 3.0不依赖形式化验证工具(如Lean、Coq等)。这意味着它不需要把数学问题翻译成形式化语言,而是直接读取人类写的LaTeX题目,用人类的数学语言进行推理。这个能力,比依赖形式化工具的方案更接近"人类式的数学思维"。


dots-note 3.0 IMO 2026 核心数据

  • IMO成绩:42/42分,满分金牌

  • 人类对比:全球仅7位人类选手获满分金牌

  • 解题方式:不依赖形式化语言,直接读取原始LaTeX题目

  • 核心技术:递归自我批判

  • 模型规模:dots3系列最轻量级模型

  • 开源状态:预期将开源

  • 团队:小红书 dots 团队

3 小红书做AI?从"种草"到"IMO金牌"

很多人对小红书的印象还停留在"种草平台"。但dots团队在AI数学推理上的突破,让人不得不重新审视这家公司的技术实力。

小红书dots团队并非突然冒出来的。dots系列模型一直在数学推理、代码生成等方向深耕。dots3系列在多个基准测试中都有出色表现。但IMO满分金牌,无疑是最具冲击力的"成绩单"。

这背后是中国AI行业一个值得关注的趋势:非传统AI公司正在AI核心技术上取得突破。不只是BAT和字节,小红书、快手、美团等公司也在AI研发上投入巨资。这些公司有独特的业务场景和海量数据,当它们把AI能力与自身业务深度结合时,往往能产生意想不到的化学反应。

dots-note 3.0预期将开源,这意味着全世界的数学家和AI研究者都可以基于这个模型进行进一步的研究。这不仅是小红书的胜利,也是开源AI社区的胜利。


从"会做题"到"能发现新的数学定理"——AI数学推理的下一站


4 从IMO满分到"AI数学家":还有多远?

IMO满分是一个里程碑,但它不是终点。从"能解IMO题"到"能发现新的数学定理",中间还有巨大的鸿沟。

IMO的题目,再难也是"已知有解"的。每道题都有标准答案,评委会提前验证过。AI做的是"找到已知的答案"。但真正的数学研究,面对的是"不知道有没有解"的问题——你甚至不知道答案是否存在,不知道这条路是否走得通。

这种"在不确定性中探索"的能力,是当前AI不具备的。人类数学家可以花几年甚至几十年研究一个猜想(比如费马大定理,花了358年才被证明),但AI目前还不能做这种"长期、开放式的探索"。

不过,腾讯混元同日发布的Hyra-1.0给出了一个方向:递归自我改进的研究智能体。Hyra在55个数学开放问题中刷新了29个历史最好结果。如果dots的"递归自我批判"和Hyra的"递归自我改进"结合起来,AI自主进行数学研究的那一天,可能比我们想象的更近。


AI数学推理的三条技术路线

形式化验证路线(Lean/Coq):将数学问题翻译成形式化语言,用定理证明器验证。优点是100%可靠,缺点是翻译成本高、不灵活。

端到端推理路线(dots-note 3.0):直接读取人类数学语言,自主推理。优点是灵活、接近人类思维,缺点是可靠性不如形式化验证。

递归自我改进路线(Hyra-1.0):让AI在推理过程中不断改进自己的策略。优点是可能发现人类未发现的解法,缺点是稳定性不足。


5 冷静看待:IMO满分背后的"冰山"

尽管dots-note 3.0的IMO满分令人振奋,但几个现实问题值得冷静思考:

42分≠42分。AI的42分和人类的42分,意义不完全相同。人类选手在考场上只有几个小时,不能查阅资料,不能重试。AI的"考试环境"是否与人类完全一致?如果AI可以多次尝试、可以选择最优答案,那这个"满分"的含金量需要更透明的评估标准。

最轻量级模型拿满分,说明什么?dots-note 3.0是dots3系列最轻量级模型。这当然说明了"小模型也能有大能力",但反过来也说明:IMO题目可能被"过拟合"了。如果模型在训练数据中见过类似题目,满分就不完全代表"推理能力"。

从"解题"到"发现"的鸿沟。如前所述,IMO题目是"已知有解"的。真正的数学研究是"探索未知"。AI能否从"解题工具"进化为"发现工具",是下一个需要回答的问题。

IMO满分金牌是一个里程碑,但它的真正意义不在于"AI比人类聪明",而在于"AI终于开始理解'推理'这件事了"。当AI不仅能"算"出答案,还能"想"出答案、"批判"自己的答案时,我们离通用人工智能就近了一步。这条路,刚刚开始。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
国内挣钱,海外花!61岁演员晒美国奢华生活,一番言论惹网友争论

国内挣钱,海外花!61岁演员晒美国奢华生活,一番言论惹网友争论

高洁之冬
2026-09-07 10:07:23
留学花光家里60多万,面试字节、阿里、鹅厂等被拒,不敢告诉爸妈找不到工作

留学花光家里60多万,面试字节、阿里、鹅厂等被拒,不敢告诉爸妈找不到工作

蚂蚁大喇叭
2026-09-05 17:11:29
中方是否愿意加强与德国选择党的交流?外交部回应

中方是否愿意加强与德国选择党的交流?外交部回应

澎湃新闻
2026-09-07 16:31:24
武大付磊被亲生女儿举报后,课题组学生为何沉默、出路几何?

武大付磊被亲生女儿举报后,课题组学生为何沉默、出路几何?

朗威谈星座
2026-09-06 11:21:26
“张雪机车”两获季军 赛事组织方:中国品牌正在改变整个行业

“张雪机车”两获季军 赛事组织方:中国品牌正在改变整个行业

大风新闻
2026-09-07 11:06:03
“她是桃花眼,前途不敢估量”,女孩考上中山大学,面相火了

“她是桃花眼,前途不敢估量”,女孩考上中山大学,面相火了

世界圈
2026-08-21 09:05:40
CHINA GT发生重大撞车起火事故,“救援人员因害怕,放下灭火器后逃离”,对手弃赛冲入火海救人

CHINA GT发生重大撞车起火事故,“救援人员因害怕,放下灭火器后逃离”,对手弃赛冲入火海救人

澎湃新闻
2026-09-06 16:54:03
上海交大研究:肺结节防止变肺癌,教你6招,赶紧记住了!

上海交大研究:肺结节防止变肺癌,教你6招,赶紧记住了!

叙说医疗健康
2026-09-08 06:00:12
《兰香如故》央八播出:但凡36岁谭松韵演技拉垮一点,都压不住这两位美貌兼实力派女配角

《兰香如故》央八播出:但凡36岁谭松韵演技拉垮一点,都压不住这两位美貌兼实力派女配角

奴染
2026-09-07 00:15:18
世界杯-日本女篮狂输20分难阻西班牙直通八强 田中心15+4+3

世界杯-日本女篮狂输20分难阻西班牙直通八强 田中心15+4+3

醉卧浮生
2026-09-08 02:31:31
森林北商业代言,穿着旗袍,脚上踩着恨天高,坐姿被嘲坐没坐相

森林北商业代言,穿着旗袍,脚上踩着恨天高,坐姿被嘲坐没坐相

猪小艳吖
2026-09-06 16:50:59
社保交15、20、25年差距真大!别等退休吃亏才后悔

社保交15、20、25年差距真大!别等退休吃亏才后悔

小虎新车推荐员
2026-09-07 15:11:09
中国驻法兰克福总领馆再次提醒领区中国公民防范不法分子冒充驻外使领馆进行电信诈骗

中国驻法兰克福总领馆再次提醒领区中国公民防范不法分子冒充驻外使领馆进行电信诈骗

环球网资讯
2026-09-07 17:29:05
脑梗离世的人越来越多!记住:3不喝、2不吃、1坚持,别马虎

脑梗离世的人越来越多!记住:3不喝、2不吃、1坚持,别马虎

健康之光
2026-09-07 18:55:06
最高优惠1万元!特斯拉中国宣布本月Model 3和Y全系“降价”

最高优惠1万元!特斯拉中国宣布本月Model 3和Y全系“降价”

澎湃新闻
2026-09-07 11:00:27
忍了8年,中国终于对欧美航空霸权掀桌子!C919用硬实力杀出

忍了8年,中国终于对欧美航空霸权掀桌子!C919用硬实力杀出

快乐彼岸
2026-09-08 01:38:41
唏嘘!景甜卖房了

唏嘘!景甜卖房了

互联网品牌官
2026-09-07 12:31:30
李斌炮轰宁德时代,车企“去宁王化”到底能不能成功?

李斌炮轰宁德时代,车企“去宁王化”到底能不能成功?

阿芒娱乐说
2026-09-07 09:51:20
世界上断送国家命运的六大决策:1、俄罗斯卖掉阿拉斯加,2、乌克兰主动放弃核武器,3、伊朗霍梅尼回国,推翻巴列维政权

世界上断送国家命运的六大决策:1、俄罗斯卖掉阿拉斯加,2、乌克兰主动放弃核武器,3、伊朗霍梅尼回国,推翻巴列维政权

扶苏聊历史
2026-09-02 18:25:39
阿里P8:人一旦失业,就会“扣扣搜搜”。家庭收入从去年140万降到今年50多万

阿里P8:人一旦失业,就会“扣扣搜搜”。家庭收入从去年140万降到今年50多万

蚂蚁大喇叭
2026-09-06 17:09:52
2026-09-08 08:15:00
星海情报局 incentive-icons
星海情报局
关注“中国制造”的星辰大海
1431文章数 2031关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

大桥被指施工太过潦草 开通不到一周盲道已经多处开胶

头条要闻

大桥被指施工太过潦草 开通不到一周盲道已经多处开胶

体育要闻

世界杯-中国女篮20分大胜意大利锁D组第二 韩旭19+10杨舒予15分

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

艺术
旅游
本地
数码
公开课

艺术要闻

一幅分裂的古画:一边祝你升官,一边劝你放下欲望

旅游要闻

缙云丨龚炜:山城远近,盛夏的传奇(组诗)

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

数码要闻

949元!小米推出米家智能浴霸2:自带毫米波雷达 人感照明/换气

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版