网易首页 > 网易号 > 正文 申请入驻

全球首个IMO满分AI,正在研究怎么帮你搞装修、办婚礼

0
分享至



今天凌晨,小红书终于是把IMO满分夺金模型的同系列版本开源了,这个模型就是dots3-note preview。

和GPT-5.6、Claude Fable 5这样的大参数模型不同,dots3-note preview是一个非常小非常轻量的模型。

2026年7月的时候,它的同系列模型,曾以42/42拿下IMO国际数学奥林匹克竞赛官方认证的满分金牌。是IMO官方评阅史上第一个满分 AI,同年金牌线是29分,全球所有人类选手中,仅有7人获得满分。

和常规的benchmark不一样,IMO的赛题都是保密的,无法提前针对性训练,能拿满分就是真有实力。

有意思的地方是,它没有把IMO当卖点,反而把重点放在了“生活里没有标准答案,但有真实任务”上。

01

小模型办大事,靠谱吗?

dots3-note preview是dots3系列里最轻的一个,总参280B,激活只有16B,512K上下文。

在dots3-note preview之前,轻量模型跟Agent之间有一道鸿沟。无论是技术社区,还是大众媒体,都普遍认为Agent只属于万亿参数的巨无霸模型。

因为参数量本身就代表了模型的知识储备,这是无可厚非的。不过参数量多少,并不等于完成任务的效果。

结果就是dots3-note preview甚至只用了那些超大模型成本的零头,就完成了相同的任务。

能做到这些,主要在于dots3-note preview“解题”的思路很有意思。它是轻量模型,所以不可能和别的模型比肌肉、硬碰硬。于是dots3-note preview走了一个很“不AI的方法”,整体的运行逻辑更像是我们小时候刷考试题。

把试卷的每道题都单独拎出来,一道题一道题地看,遇到不会的题就翻开书看一眼,看明白了再做下一道题。这样下来,一个完整、复杂的任务,就被分解成了一道又一道熟悉的题,整个任务便迎刃而解。

从多项主流benchmark数据来看,在多项推理及智能体任务上,dots3-note preview的得分甚至超过了参数规模数倍于自身的大尺寸模型,视觉能力在同尺寸区间表现突出。





dots3-note preview最大的优势体现在“个人智能体、复杂推理与从环境中学习解决长程问题”上,相关训练方法创新已在技术博客中对应展开。

还有一点,在解决“日常生活”中的难题时,往往追求的并不是谁性能上限更高,而是谁用起来更方便。就像雨伞一样,大模型就像是超大的庭院伞,覆盖面积又大,防晒防雨效果又好,可是相较于日常出行,随手能揣在包里的折叠伞才更实用。

这一年有一个很明显的变化,大模型能力的叙事主线不再是“答对一道题”了,反而是比谁更便宜地“完成一件事”。

数学、代码、科学和工程之所以是现阶段最热门的话题,主要是因为它们评分标准比较清晰,模型效果如何,可以被verifier判断,训练系统也因此拿到清晰的奖励信号(reward signal)。

靠着强化学习、test-time scaling和更长的rollout,模型逐渐学会规划、执行、检查、修正。

但问题在于,生活并没有那么理性,假如AI想要走进人们的现实生活,它需要一套完全不同的评判标准。

现实生活里碰到的问题,很难像数学题那样明确地区分出对与错。比如结婚、旅行这样的经历,就没办法给出直接明了的判断。

所以诸如此类的long-horizon RL任务,它的核心瓶颈,从来不是把rollout过程拉长,而是在奖励模糊、评价主观。需要一套标准,在外部状态持续变化的任务里,建立可扩展的自我评价和学习信号。

小红书dots实验室这次开源的dots3-note preview,本质上就是在做这件事。

这版模型的训练非常强调self-critiquing(自我评价),并提出了TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization)。

自我评价解决的,是“信号来得太晚”的问题。

在训练阶段,自我批评能为长时间rollout的中间状态,提供更可扩展的value和奖励信号,让模型不再完全依赖可能几十小时后才到来的终局反馈。

到了推理和执行阶段,这套能力又变成一个类似于Harness的持续循环。它会先让模型观察环境,然后评价当前的进展。根据评价结果重新规划,最后采取行动,完成整个循环后“自我评价”将再次启动评估。

模型会主动获取信息、理解环境变化、评估任务进度、调整计划,再用工具或代码跟环境交互。



就像考试一样,以前是你做完所有的题目,把试卷交上去,老师判完卷子给你发下来,你才知道你哪里做错了。但是有了“自我评价”之后,你每做一道题,都能立刻知道是错了还是对了。

但是光有“自我评价”不够,就像我们拍蚊子,明明眼睛能看到蚊子的飞行轨迹,可是到手拍的时候,却发现自己很难精准拍上。

于是小红书dots实验室又提出了TEMPO,它想解决的,正是“评价跟不上行动”这个问题。

TEMPO的全称是Test-time-scaled Value Estimation with Macro-step Policy Optimization(测试时扩展的价值估计 + 宏步策略优化)。

它的核心逻辑是通过刚才提到的“自我评价”来进行超长程任务的强化学习。

具体来讲,TEMPO把一条可能持续几十小时的轨迹,切成若干个macro-step,每个macro-step里模型和环境进行多轮交互。

阶段结束时,同一个模型从actor切换成critic,通过推理、工具调用和test-time scaling,估算当前状态的预期剩余回报,为还没走完的轨迹构造训练信号。

actor和critic共享完全相同的参数,所以无论是上场做事,还是停下来评价对错,都是同一个模型自己完成的,就像运动员跑步的时候自己给自己掐秒表一样。

所以训练不只是教它怎么行动,也在教它怎么把自己评准:评得越准,训练信号越可靠,那就会让学习的过程越来越稳。

相比之下,依赖终局奖励的传统范式,一条rollout几十小时,信号来得晚,还很难做信用分配。

TEMPO训练的模型,不仅在测试时评估指标上更好,而且因为它能优化到很靠后的探索步骤,agent不会像基线方法那样,在高轮数状态下分数不再提升。

目前,这套机制已经初见成效。7月的IMO 2026上,基于dots3-note preview分支版本的模型,在推理阶段同时负责生成proof,并通过工具调用对自己生成的proof做迭代式自我评估,最终拿下IMO 2026官方认证的满分金牌。

当然,如果你感兴趣,还可以自己去体验一把。

官方技术博客:
https://studio.dots.ai/dots/dots3-zh.html

Huggingface:https://huggingface.co/dots-studio/dots3-note-prev

Github:https://github.com/studio-dots-ai/dots3-note-prev

02

从《杀戮尖塔2》再到“斩杀线”

现实生活中常见的问题,往往都是持续变化的,尤其像是天气、堵车这些临时变更,不可能会有人提前打跟模型好招呼,这就使得,AI的随机应变、临场发挥能力,要远比背了多少本书更重要。

dots3-note preview在这类能力上最直观的展示,是《杀戮尖塔2》。此前,模型从未训练过该游戏,连类似环境都没见过。



但视频里能看到,它靠持续探索从环境里学习,比如游戏的这张卡有什么作用,那张卡又能打多少伤害。

一开始没有规则,也不会告诉模型如何才能通关,dots3-note preview只能一点一点摸索,先假设、再尝试、再验证,把假设写进自己的memory,等到下次做决策的时候再拿出来用。

视频中显示,通过自己的摸索,模型也是一口气玩到了33关。在一个完全陌生的环境里,它证明了“自主学习”这件事本身能成立,而不是只会背题。

完全通过上下文去学习,也是ARC-AGI 3这个benchmark想测的东西。

ARC-AGI 3是ARC Prize在2026年推出的测试,重点从以前benchmark常见的静态推理,变成了看AI能不能像人一样在陌生环境里自学,先假设通关条件,尝试通关,验证假设,假设不准就自我批评、修正。

举个简单例子,我们在浏览网页的时候,偶尔会有小弹窗遮挡视线。我们通常的做法是第一时间找到这个弹窗上的X按钮,来关掉弹窗。

ARC-AGI 3里面也有类似的试题,关卡会出现网格内的遮挡色块(类似弹窗挡住可交互区域),必须先点击对应位置消除这块遮挡,才能继续完成关卡。

简单来说,ARC-AGI 3就是一个专门为“折腾”模型而生的榜单,上面每一道题,全都是现实生活中真实经历过的。

dots3-note preview在公开评测上已经和opus4.8、gpt-5.5等闭源接近。



然而正如前文所提到的,现在已经不流行比上限了,现在比的是在完成任务的前提下,单位智能的成本。

最近有个词很火,叫做“DeepSeek斩杀线”。指的正是此事。

dots3-note preview在ARC-AGI 3上也有,那就是在500美元的成本预算内,dots3-note preview是表现最好的那一个。



图源:dots实验室官方技术博客

而且这次开源的,不只是模型本身。为了让社区能复现、能衡量这类能力,dots团队还同步开源了两个面向真实生活的benchmark,分别为VibeSearchBench和VibeLifeBench。

为什么要把这两个 benchmark 单独拿出来说?因为在“真实生活的长程任务”这件事上,过去没有人给过一把统一的尺子。dots 团队只能先自己搭一套复杂场景模拟:覆盖出行、就医、采购、履约、社交这些真实服务,每个场景都带后端状态机、模拟时间线和一堆可调用工具。为了让社区也能复现、也能衡量,他们干脆把这套评测标准本身开源了出来。

VibeSearchBench考的是“意图逐步披露条件下的多轮搜索”,共20个领域、200项任务。每项任务由一个模糊的初始请求和一个persona驱动的用户模拟器构成。

用户一开始根本不说清楚自己要什么,在多轮对话里会把约束、条件、需求一点点放出来。Agent可以用search、visit、code 三种动作,去搜索、访问页面、写代码。最后把模型预测出的知识图谱和标准答案做节点与三联体匹配,就是本次搜索的最终得分,核心指标是Triplet F1。

VibeLifeBench考的是“非静态环境下的跨阶段任务执行”,10个领域、20项任务,每项横跨20到30个阶段,带模拟时间线,覆盖大量真实服务环境。但是这个benchmark不是静态的,用户消息、业务通知、后端状态的变化,都是按阶段发生的,并且不一定会全同时发生。

03

小红书dots实验室的愿景

聊到最后,其实dots实验室想讲的,是下一代的Agent,要走进现实生活的。

比起更会答题,dots实验室希望下一代的Agent,应该是一个真正长期服务每个人的AI。

它能靠多模态能力感知真实世界,又能通过模型能力和Agent能力做复杂推理,最后调用工具解决问题。更重要的是,它需要具备主动性和持续学习能力,会随着世界的变化、对用户理解的加深,不断进化。

dots实验室在官网(studio.dots.ai)这样写道,创前沿智能,解生活之问。让前沿智能服务于日常生活。从预训练、多模态到后训练、AI Infra,落脚点始终是“生活”本身。

那为什么偏偏从“真实生活长程任务”切入呢?

因为小红书本身就是围绕真实的生活内容分享建立的。这里面也有参数,比如审美、预算、忌口、甚至还有带不带娃等等。

这些事说不清对错,又多模态、动态、主观。

而dots实验室想解决的,恰恰正是这些生活任务。

小红书自己就长在这些场景里,旅行、婚礼、开店、选房、养娃……每天有无数用户在这里分享真实偏好和真实经历。所以这不是绕开谁的主战场,而是从自己最熟悉、也最复杂的地方出发,做一件别人还没做明白的事。

dots3-note preview是坚实的一步,方向立住了,剩下的是耐心。

它把方法、评测和思考,一起摊开在技术社区面前。至于最后AI能不能走进现实生活,接下来,不只小红书一家的事。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
49次失误+0胜2负!郑钦文今晚迎战“克星”,刚把奥运冠军磨出局的31岁老将到底有多难缠?

49次失误+0胜2负!郑钦文今晚迎战“克星”,刚把奥运冠军磨出局的31岁老将到底有多难缠?

宠物管理师雯雯
2026-09-02 09:12:34
家长试卷“签字”走红,连老师都赞叹不绝:有这样的家长未来可期

家长试卷“签字”走红,连老师都赞叹不绝:有这样的家长未来可期

犀利辣椒
2026-08-14 06:22:46
1995年,他花1万买下苏州河废弃驳船,28年后嘲笑过他的人都傻眼

1995年,他花1万买下苏州河废弃驳船,28年后嘲笑过他的人都傻眼

灿烂夏天
2025-06-10 12:42:15
中一签,预计浮盈超28万元

中一签,预计浮盈超28万元

极目新闻
2026-09-02 12:32:29
张继科:我教乒乓球一个半小时25元,让孩子进步是教球初心

张继科:我教乒乓球一个半小时25元,让孩子进步是教球初心

懂球帝
2026-09-02 16:42:20
定档9月3号!爱奇艺全网独播,这部剧的阵容堪称非常强大

定档9月3号!爱奇艺全网独播,这部剧的阵容堪称非常强大

小邵说剧
2026-09-02 07:50:46
上合峰会开完,普京允许扩员,中俄均有各自人选,形势对美国不利

上合峰会开完,普京允许扩员,中俄均有各自人选,形势对美国不利

阿天爱旅行
2026-09-02 14:53:23
这舞蹈女孩太强了,力量与柔美兼具,尽显超强身体柔韧度

这舞蹈女孩太强了,力量与柔美兼具,尽显超强身体柔韧度

娱你同欢
2026-08-28 12:50:46
80岁罗家英现身广州,称“想在番禺买房住”

80岁罗家英现身广州,称“想在番禺买房住”

南方都市报
2026-09-02 08:31:33
向余望替补上场后又被换下,刘建业:这完全是出于战术的考虑

向余望替补上场后又被换下,刘建业:这完全是出于战术的考虑

懂球帝
2026-09-02 23:14:05
草台班子,苹果新品又出现严重宣传错误!

草台班子,苹果新品又出现严重宣传错误!

XCiOS俱乐部
2026-09-01 19:47:33
少儿不宜!Netflix再推限制级神作,口碑炸裂了

少儿不宜!Netflix再推限制级神作,口碑炸裂了

乡野小珥
2026-09-02 08:34:08
50岁男演员无戏可拍景区当NPC:“日收入1000,还给交社保,很满足”

50岁男演员无戏可拍景区当NPC:“日收入1000,还给交社保,很满足”

娱乐嗑学家.
2026-09-02 15:26:27
劝退应届生事件后,星宇股份外包工涨薪1元/小时,中介:有争议舆论不好招人,所以涨薪

劝退应届生事件后,星宇股份外包工涨薪1元/小时,中介:有争议舆论不好招人,所以涨薪

北青网-北京青年报
2026-09-02 11:46:07
几千块真的可以难倒英雄汉!东莞父亲掏不出女儿高中9300元学费急哭,兜里仅剩3000元

几千块真的可以难倒英雄汉!东莞父亲掏不出女儿高中9300元学费急哭,兜里仅剩3000元

捣蛋窝
2026-09-01 17:05:01
明码标价!冠军沦为阶下囚,国羽腐败远超男足?20万青训黑幕曝光

明码标价!冠军沦为阶下囚,国羽腐败远超男足?20万青训黑幕曝光

丁丁鲤史纪
2026-09-02 01:26:02
莱万:皇马有新援和穆帅加入后感觉更强了,但我始终支持巴萨

莱万:皇马有新援和穆帅加入后感觉更强了,但我始终支持巴萨

懂球帝
2026-09-02 18:28:09
河南一小学新生名单惊艳老师:“子涵”时代已经过去,取自国风典籍的名字格外亮眼,重名率也降低不少

河南一小学新生名单惊艳老师:“子涵”时代已经过去,取自国风典籍的名字格外亮眼,重名率也降低不少

河南交通广播1041
2026-09-01 23:18:51
37岁女子被当街殴打扒裤,官方回应来了:打人的两个女子50多岁

37岁女子被当街殴打扒裤,官方回应来了:打人的两个女子50多岁

汉史趣闻
2026-09-02 18:14:53
六台记者:切尔西接近免签威纳尔杜姆,合同1+1

六台记者:切尔西接近免签威纳尔杜姆,合同1+1

懂球帝
2026-09-02 23:42:08
2026-09-03 00:16:49
字母榜 incentive-icons
字母榜
让未来不止于大。
2743文章数 8091关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

乌安全局与乌国防部情报总局在基辅交火 泽连斯基发声

头条要闻

乌安全局与乌国防部情报总局在基辅交火 泽连斯基发声

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

配双腔空悬+机械差速锁 传祺越7预售权益价17.18万起

态度原创

数码
旅游
本地
家居
公开课

数码要闻

华为Watch 6系列手表海外发布

旅游要闻

忻州荷花开 遍地是吾乡

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版