网易首页 > 网易号 > 正文 申请入驻

IMO 42分满分刷屏后,小红书开源同系列模型!

0
分享至

智猩猩AI整理

编辑:金水

如果上个月你被"AI 首次在 IMO 国际数学奥林匹克拿下官方认证 42/42 满分"刷过屏,那背后那个模型到底怎么做到的,可能直到最近才有人讲清楚。

8 月 17 日,研究者 @GenAI_is_real(Chayenne Zhao)在 X 上发了一篇长文《dots3-note Preview: What Does an LLM Contestant Do to Take On the IMO?》。


从 Proof-Verify-Refine 循环、TEMPO 训练方法、自我评价机制一路拆到超长程 Agent 的推理挑战,把模型设计、强化学习和系统工程串成了一条完整线索。

紧接着,小红书 dots studio 官方账号转发了这篇文章。

并回应:"长期推理不仅是一个模型问题,也是一个强化学习和系统问题。这正是我们希望在 dots3-note 预览版正式发布时能够引发的那种技术讨论。感谢您细致的解析!"

而这份讨论的主角,就是小红书旗下的 AI 实验室 dots.studio 在 Apache 2.0 许可下开源的dots3-note preview。

dots3 系列中第一个开放权重的版本,也是该系列目前最轻量的一员。

权重已同步上线 Hugging Face 与 ModelScope,社区追问了一个月,终于等来了它。

小红书做基础模型并不算新事。

此前 dots.llm1、dots.tts、FireRed 等一批项目都曾开源。

但这一次,公开资料指向的方向与过去不太一致,官方给出的定位,是「迈向真实世界长时程智能体的一个步骤」。


01

这次开源是

一个什么样的模型

dots3-note preview 是一个混合专家(MoE)模型,总参数 280B,每次推理只激活 16B。

原生上下文512K token、同时理解文本·视觉·语音三种模态,并且专门针对复杂推理和长程 Agent 任务做了优化。

视觉用 MoE ViT(7B/1.2B),音频用 800M 稠密编码器,多模态独立建模后由语言主干统一输出。

它是 dots3 系列的成员,而完整系列将由 note / jazz / aria三档组成,分别覆盖不同的任务复杂度、响应速度和计算成本。

note 是其中最轻量的一档。

换句话说,它走的是"把模型做精,而不是做大"的路线。

光看参数你可能没感觉,但官方给了一组横向对比:

在多项任务上,dots3-note 可以比肩甚至超过参数规模数倍于自身的大尺寸模型。

比如它面对的是 GLM 5.2(743B/39B)、Kimi K3(2.8T/104B)这一量级对手,激活参数却只有它们的零头。

评测覆盖的维度包括个人助理 Agent、编程与计算机使用、信息获取、复杂推理,以及多模态感知。

所以更准确的说法是,它不是一个又一个"答题机器",而是一个面向"长程 Agent + 真实生活"的模型。

它的野心,是从封闭、可验证的单道题,走向开放、模糊、可能拖上几天几周的真实生活任务。

02

从「答题」,转向「长时程干活」

为什么这件事难?

因为过去的范式是"答题":一道题、一个答案、对错分明。

可真实世界里的任务更像"干活"。

跨好几天、需求会变、环境在动,而且常常没有标准答案。

把模型从答题者训练成能长时程干活的 Agent,正是 dots3-note 想要解决的核心命题。

难点卡在训练上,长程任务一次探索要十几小时,传统 RL 等整条轨迹结束才给奖励,慢且难归因;

PPO 的 critic 用固定算力估计价值,不如 actor 会推理反思,复杂任务上估计不准。

dots studio 给出的解法是TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization)。

思路很巧妙,把一条很长的轨迹切成多个 macro-step,每个阶段包含多轮模型与环境的互动;

当一个阶段结束,让同一个 Agent 从"执行者"切换成"评价者",通过推理和工具调用来估算"当前这个状态,未来还能拿多少回报",并在轨迹结束之前就把这个评价变成训练信号。

训练过程中,模型既学"怎么行动",也学"怎么评价自己"。

效果很直接,在 ARC-AGI-3 上,TEMPO 的平均得分比基础版本高 31.5%,比 GRPO 高20.6%,而且越到任务深水区,领先越明显。


在这个基础上,团队还强调递归自我评价(recursive self-critiquing)。

让模型在缺少外部奖励信号时,也能自己判断进展到了哪一步。

这被认为是从"可验证的长程任务"走向"模糊的真实生活任务"的关键,也是他们下一步的重点方向。

另一块是陌生环境在线学习,用数千个不依赖先验知识的新颖超长程环境,训练模型在测试时从探索中学习、更新记忆。

当任务长度明显超过上下文窗口,模型会逐渐学会主动生成对后续决策有用的记忆。

一句话总结这套方法论,评价比生成更简单,让模型学会给自己打分,长程强化学习才真正跑得动。

下文那个"放置骑士"的实测,会让你直观看到 critic 是怎么工作的。

03

实测表现如何

官方公布了一份自测成绩表,对比对象包括 Claude Opus 4.8、GPT-5.5、Kimi K3、GLM 5.2 与 DeepSeek V4 等模型。

结果呈现明显的分化。

在抽象推理与逻辑类任务上,dots3-note 表现突出。



上图是官方自测成绩,来源 dots.studio 官方 Hugging Face 模型页公开配图 。

ARC-AGI-2 得分为 81.39,高于 Claude Opus 4.8 的 72.1;在难度更高的 ARC-AGI-3 上得 6.9,Claude 为 1.5,GPT-5.5 为 0.4。IFBench 上得 80.4,高于 Claude 的 62.2。

然而在更接近真实工程的智能体编码任务上,它明显落后于第一梯队。

Terminal-Bench 2.1 上得 75.1,低于 Kimi K3 的 88.3 与 GLM 5.2 的 81;SWE-bench Pro 上 61,低于 Claude 的 69.2;Toolathlon 上 55.6,而 Kimi 为 76.5。

这一短板并未被否认。



上图是另一组官方自测成绩(多模态维度),来源 dots.studio 官方模型页公开配图 。

SemiAnalysis 的图表中,其 Terminal-Bench 得分仍高出图表中最优的美国开源模型 4.9 分,但与头部闭源模型的差距依然存在。

04

实测案例大赏

数学、代码这些目标清晰、结果可验证的场景,Agent 已经跑得很顺。

但 dots3-note 挑了一块难啃的骨头,真实生活里那些没有标准答案、需求还会变、能拖几小时甚至几天的任务。

它接过户型图和两款冰箱参数,算出墙面剩余空间后还主动提醒"到现场复尺确认";

它参考 9 张界面图,自主选定 SwiftUI + RealityKit 方案,端到端写出 12 个 Swift 文件、1876 行代码,自建 Xcode 工程编译出 BUILD SUCCEEDED;

它没专门练过《杀戮尖塔 2》,却从战斗反馈里学机制、一路权衡玩到 33 层;

在 ARC-AGI-3 里它用 Self-Critiquing 把修正后的规则写进"记事本",320 步解完全部 6 关。

在婚礼筹备、咖啡电商、全周期旅游这类模拟生活任务里,它跨阶段维护状态,并在机型、天气、航班变化后持续更新行程。


而在"放置骑士"这样的隐藏约束游戏里,critic 对两条轨迹给出明显不同的价值估计,正好呼应上节说的"评价比生成更简单"。

这些任务的共同点是:信息散在图里文里,用户自己都未必一次想清楚要什么,模型得边探索、边记新信息、边自我纠错,才能交付结果。

同一套能力,最终在 IMO 2026 上拿下官方认证 42/42 满分,分支版本递归生成证明,并用工具调用反复自我评估增强。

05

使用教程

模型已按 Apache 2.0协议开源,同时放出 BF16 与 FP8 两个权重版本,发布在 Hugging Face 与 ModelScope,模型结构也已提交至 Transformers,可直接加载。

pip install accelerate pillow torchcodec kernels==0.16.0 "transformers @ git+https://github.com/huggingface/transformers.git@refs/pull/47844/head"

想快速上手,最省事的是申请官方 API,入口在 dots studio 技术博客里,填表即可排队。

运行最小化本地推理示例:

print(processor.decode(outputs[0, inputs.input_ids.shape[1] :], skip_special_tokens=True))

如果打算自己部署,官方建议用 SGLang 或 vLLM,在单个 8 卡节点上跑 FP8 权重即可;

BF16 更吃显存,需按可用显存、并发和输入模态调整上下文长度。

更完整的部署参数(Transformers / SGLang / vLLM 三套方案)可参考官方 README。

06

总结

综合来看,本次开源的真正价值,不在于单项跑分的高低,也不在于参数规模的大小,而在于它首次将长时程智能体、多模态与完全开源三者结合在同一次发布中。

一家以内容社区为主业的公司,愿意将仍处探索阶段的成果以 Apache 2.0 许可整体公开,这一姿态本身构成了一个有讨论价值的信号。

长时程智能体能否最终跑通,目前尚无定论。

但方向的选择与开源的意愿,二者是相互独立的议题。

回看过往 dot 系列的开源记录,这一次发布延续了其一贯的开放策略。

至于这一步由谁先走、又如何走完,需要交由后续的独立复现与持续评测来回答。

关注+星标,获取AI前沿进展与优质开源项目

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

江山挥笔
2026-08-25 16:40:36
当“混子”成为一门玄学:论中国女足的“洋相自由”

当“混子”成为一门玄学:论中国女足的“洋相自由”

姜大叔侃球
2026-09-17 19:14:08
曼联伤情更新:卡里克等来关键回归,一人已缺阵近一年

曼联伤情更新:卡里克等来关键回归,一人已缺阵近一年

元气满分吖
2026-09-18 00:55:36
他是NBA现役“水货榜眼”,生涯狂赚1.8亿美元,下一站或是CBA

他是NBA现役“水货榜眼”,生涯狂赚1.8亿美元,下一站或是CBA

大卫的篮球故事
2026-09-17 13:51:41
成都一剧院被指地面倒影过于清晰容易走光,剧院回应:我们是女性友好剧院,会做好接下来的关注

成都一剧院被指地面倒影过于清晰容易走光,剧院回应:我们是女性友好剧院,会做好接下来的关注

台州交通广播
2026-09-16 00:29:50
50岁的阿姨这样打扮,确实显得年轻了不少

50岁的阿姨这样打扮,确实显得年轻了不少

美女穿搭分享
2026-08-15 20:48:56
6000块的“豆包手机”,把苹果隔空打破防了

6000块的“豆包手机”,把苹果隔空打破防了

金错刀
2026-09-17 15:14:58
一起倒霉!沙特使出杀手锏,英国和欧盟一片哀嚎!

一起倒霉!沙特使出杀手锏,英国和欧盟一片哀嚎!

扶苏聊历史
2026-09-16 17:42:35
美国媒体确认了:俄罗斯的一颗尖端间谍卫星向伊朗提供了情报,至少协助了伊朗部分对美军基地的精确打击行动

美国媒体确认了:俄罗斯的一颗尖端间谍卫星向伊朗提供了情报,至少协助了伊朗部分对美军基地的精确打击行动

吉刻新闻
2026-09-17 16:22:03
大连市委书记熊茂平被免职,去向未定

大连市委书记熊茂平被免职,去向未定

张嘴说财经
2026-09-17 16:43:09
昂首告别世界杯!中国U20女足已创20年最佳战绩 2大新星可进国家队

昂首告别世界杯!中国U20女足已创20年最佳战绩 2大新星可进国家队

我爱英超
2026-09-17 03:44:12
懂行人买手机,为何很少选OPPO、vivo?4个现实原因看完恍然大悟

懂行人买手机,为何很少选OPPO、vivo?4个现实原因看完恍然大悟

辉哥说动漫
2026-09-17 07:06:03
亚预赛+亚运会打完!男篮这4人,该离开国家队了!

亚预赛+亚运会打完!男篮这4人,该离开国家队了!

烟浔渺渺
2026-09-17 13:48:33
博士孟小蓓嫁李健喝茶浇花20年不上班,26年一张合影撕开真实一面

博士孟小蓓嫁李健喝茶浇花20年不上班,26年一张合影撕开真实一面

扒星人
2026-07-11 14:38:18
大明星赵薇的前夫,判了!

大明星赵薇的前夫,判了!

微微热评
2026-07-29 12:12:29
膝盖虚惊一场:巴萨门神为何只休一场就够

膝盖虚惊一场:巴萨门神为何只休一场就够

绿茵狂热者
2026-09-18 00:07:42
解放台湾,难上加难?中国解放台湾,到底存在哪些困难和阻碍?

解放台湾,难上加难?中国解放台湾,到底存在哪些困难和阻碍?

補懂事的孩紙
2026-07-30 17:25:34
离婚的妇人都是咋和前夫相处的?网友:我就好奇,有没有睡在一起

离婚的妇人都是咋和前夫相处的?网友:我就好奇,有没有睡在一起

带你感受人间冷暖
2026-08-31 00:05:16
早春晴朗之后,井柏然又一部好剧来袭!这题材演员真牛了!

早春晴朗之后,井柏然又一部好剧来袭!这题材演员真牛了!

小邵说剧
2026-09-18 00:30:04
哪些东西你认为已经贵到不值了?网友:看了物价,我认为减肥辟谷是普通人攒钱的最佳方法

哪些东西你认为已经贵到不值了?网友:看了物价,我认为减肥辟谷是普通人攒钱的最佳方法

带你感受人间冷暖
2026-09-14 10:27:48
2026-09-18 01:20:49
智猩猩
智猩猩
AI 技术内容与服务平台
131文章数 6关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

猛士X700内饰公布 打造家庭泛越野智能座舱

态度原创

亲子
家居
教育
房产
旅游

亲子要闻

性生活不爽?可能是这些细节没做好

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

都叫七中不是一所学校成都家长最容易认错的集团校一篇分清

房产要闻

突发!三亚安居房出台新政!

旅游要闻

忻州这2个地方,专门用来“虚度秋天”

无障碍浏览 进入关怀版