网易首页 > 网易号 > 正文 申请入驻

小红书开源IMO 满分同系模型,主攻生活 Agent!

0
分享至

编辑|杜伟、杨文

终于,小红书 IMO 满分夺金模型的同系列版本开源了!

上个月,小红书自研大模型「dots-note-3.0」创下了一个历史记录:AI 首次在国际奥数竞赛中斩获官方认证的满分42 分。此后,社区最关心的问题,就是模型什么时候开源。


HuggingFace AI 研究及社区生态相关负责人 Adina Yakup。图源 X Post

就在今天,小红书 dots 模型实验室(以下简称 dots 实验室)宣布开源 dots3-note preview!它也是 dots3 系列模型首个开源版本,瞄准了更贴近现实、更难评测的长程任务。

从参数来看,dots3-note preview 的总参数为 280B,其中激活参数为 16B,支持 512K 超长上下文窗口,具备了文本、视觉与语音多模态理解能力,并针对复杂推理、Agent 和多模态感知进行了优化

  • API 入口: https://dots.ai/platform/

  • Huggingface: https://huggingface.co/dots-studio/dots3-note-prev

  • GitHub: https://github.com/studio-dots-ai/dots3-note-prev

IMO 满分验证了该系列模型在数学推理与证明上的能力,此次开源把挑战带到了另一类更难标准化的场景:旅行规划、婚礼筹备、开店经营。这类任务没有唯一答案,时间还可能拉长到数小时、数天甚至更久。

dots3-note preview 将重心放在长程任务上,也踩中了当前 Agent 发展的一条主线:它们开始被要求独立承担越来越长、越来越完整的工作。OpenAI 曾披露,今年 5 月,超过 70% 的用户让 Codex 处理需要人类一小时以上才能完成的工作;到 6 月,OpenAI 内部使用量最高的 1% 活跃用户每天产生超过 60 小时的 agent turns。

不过当任务落到不同场景里,难度很快就会拉开。与数学、代码和工程等 Agent 表现比较成熟的场景不同,真实生活环境更开放、需求更模糊。dots3-note preview 选择把「考场」放在这里,对自身的长程规划、判断与纠错能力提出了更高要求。

从多项主流 benchmark 数据来看,在多项推理及智能体任务上,模型可比肩甚至超过参数规模数倍于自身的大尺寸模型视觉能力在同尺寸区间表现突出


图源:官方技术博客


图源:官方技术博客

此前,小红书已经陆续开源了文本大模型 dots.llm1、多语言文档布局解析模型 dots.ocr 和多模态视觉理解大模型 dots.vlm1。最新的开源,补上了 Agent 这一块拼图

一手实测:

它能真正完成复杂任务吗?

模型的真实能力,光看榜单远远不够。接下来,我们通过几个 case,来看看这款模型在面对信息零散、步骤繁多、环境持续变化的任务时,如何独立推进并交付结果的。

接管《杀戮尖塔 II》

先让 dots3-note preview 接管一局《杀戮尖塔 II》。

该游戏的难点在于,选什么路线、拿哪张牌、是否挑战精英、金币怎么花、营地选择休息还是升级,都会影响几十个回合后的生存概率。局部最优的选择,很可能给后面的 Boss 战埋下隐患。

模型事先并未针对这款游戏进行专门训练,却能根据战斗反馈学习卡牌和敌人机制,同时管理生命、牌组、金币与药水,在商店、营地和精英战之间不断权衡,一路玩到了 33 层。

从零破解 ARC-AGI 3

在长程推理任务 ARC-AGI 3 中,规则完全未知,模型需要观察画面,提出假设,再通过操作加以验证。

dots3-note preview 逐步发现两个方块上下同步、左右镜像规律,并摸索出危险格、可移动标记、压力开关和闸门等机制。


每当假设出错后,它会启动 Self-Critiquing 机制重新评估,将修正后的规则写入 memory.md,这个文件类似模型的记事本,持续保存对环境的动态理解。



最终,模型通过 320 步操作解开全部 6 关。


读图解决装修难题

持续学习与推理能力,最终还是要回到真实生活。

比如下面这个典型的装修难题:同时上传户型图和两款冰箱的参数截图,并补充信息:厨房靠近书房一侧的墙面,已经做了 1.5 米长的台面,现在想把冰箱放在这面墙上,究竟还能不能放下?

关键信息分散在不同图片和文字表述中,模型需要结合户型图、已有台面尺寸和两款冰箱规格,计算出墙面剩余空间,给出适配结论。它还主动提醒用户到现场复尺确认。

整个过程涉及视觉空间理解、复杂推理和工具调用,也体现出模型基于个人实际环境生成定制化答案的能力。


沿用刚才的户型图,继续让模型为书房设计几套实木风装修方案。

模型保留此前识别的尺寸与采光信息,搜索小红书相关笔记,整理四套实木风方案并生成网页,连续完成读图、计算、检索和内容生成。


端到端跑通 visionOS 应用开发

最后,来看 dots3-note preview 能否独立完成一个完整的端到端软件工程任务,让它「参考小红书的设计,开发一款 Apple Vision Pro 原生应用」。

接到任务后,模型没有急于写代码,它先理解产品需求并参考 9 张界面图,自主确定开发方案,包括采用 SwiftUI+RealityKit 技术路线,规划组织窗口、沉浸式空间和 3D 商品展示等不同模块。方案敲定后,它继续准备本地图片和 3D 模型等素材,再逐步完成代码实现。

整个项目生成 12 个 Swift 文件、1876 行代码,实现信息流、个人主页、私信、商品等界面,并接入 USDZ 3D 模型。随后,模型又自行生成 Xcode 工程、调用 xcodebuild 编译,并在 visionOS Simulator 中完成检查,最终显示「BUILD SUCCEEDED」。

从需求理解、技术选型到代码实现、编译和验证,这套开发流程最终被完整跑通


从最后的成品来看,已经具备了一套比较完整的空间交互。信息流可以滚动、笔记能够进入详情页,个人主页、私信可以作为独立窗口展开。


用户还可以在购物界面中直接查看并切换不同的 3D 商品。


没有标准答案,

模型得持续学习,并给自己纠错

从几组实测来看,dots3-note preview 最突出的能力是边探索、边记住新信息,遇到变化或判断失误后再调整,直到把结果交付出来。它是怎么做到呢?关键在于两件事:学习并记住真正有用的信息,以及及时发现自身判断出现偏差并修正

dots 实验室首先要解决的一个问题是:模型结束训练之后,能不能持续从环境和用户身上学习。

为了训练这种能力,dots 实验室构建了数千个不依赖先验知识的超长程新颖环境,让 Agent 在此前没有接触过的场景中持续探索,通过与环境交互学习新的规则和知识,用于后续决策。并且,当任务长度显著超过模型的上下文窗口后,模型不能始终依赖上下文中已有的信息。经过强化学习训练,它会逐渐学会如何保留对后续解决问题有用的信息。这项能力已经在 ARC-AGI 3 上得到了验证。

从下图可以看到,dots3-note preview 在 ARC-AGI-3 上以不到 500 美元的成本取得约 0.35 分,绝对分数虽低于 Claude Opus 4.8 (high),但成本效率明显更高。


但要把这样的过程训练出来,又会遇到另一大麻烦:长程任务的探索成本太高,Agent 完成一次探索可能得跑上十几个小时。如果继续沿用依赖终局奖励的 value-free 强化学习方法,往往要等整条轨迹结束才能拿到训练信号,不仅效率低,也很难判断最后的成果或失败归因于前面的具体哪一步。

PPO 等 actor-critic 方法可以缓解这个问题,但传统 critic 通常通过一次固定算力的前向计算来估计当前状态的价值。面对复杂 Agent 任务,actor 可以反复推理、调用工具再决定下一步,critic 无法做到这样,很容易导致对当前进展的判断不准。

dots 实验室提出了 TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization),它把一条很长的轨迹切分成多个 macro-step,每一个包含多轮模型与环境的交互。一个阶段结束之后,模型会暂时从 actor 切换到 critic,并通过推理、工具调用和 test-time scaling 估计当前状态未来能获得多少回报,接着把这个评价变成尚未结束轨迹的训练信号。

值得注意的是,在 TEMPO 的训练过程中,模型既要学习如何行动,也要学习如何评价自己当前做得怎么样。借助这种自我评价,强化学习训练可以放到更长的任务中,并持续优化长轨迹中的行为。

结果显示,TEMPO 的优势主要出现在任务进入深水区之后。随着交互轮次增加,GRPO 和 Base checkpoint 的得分趋于停滞,TEMPO 仍能继续提升。从通关进度来看,三者也在任务后半程明显拉开差距。


而在引入 Self-Critiquing 机制之后,dots3-note preview 的自我评价能力比最初预想的更强。即使某个问题 Agent 还没有解出来,它也能从两个表面相似的中间状态中判断出哪个更有希望取得突破。

这样的自我评价能力除了用于强化学习训练,也体现在了推理阶段。在此前的 IMO 2026 参赛中,dots3-note preview 的同系列分支版本一边生成证明,一边通过工具调用反复对这些证明进行检查,并根据评价结果修改优化,最终拿下满分。

未来 dots 实验室将在「开放任务」中探索递归自我评价(recursive self-critiquing),让模型在缺少清晰外部奖励的情况下,能够自己判断任务进展,并据此调整记忆和规划后续行动。

小红书这套「主动记忆 + 超长轨迹强化学习 + 中途自评」的组合,给出了长程 Agent 进入现实世界的一种具体解法。

小红书为什么选择「真实生活长程 Agent」?

对于小红书这个生活兴趣社区来说,它天然接近这类真实生活任务。用户每天讨论的很多问题不仅没有唯一答案,很多时候连用户自己也未必想清楚了最终想要什么。

旅行、婚礼、家装、穿搭等本身就带有偏好不一、条件不断补充、多模态信息密集等特征。小红书长期面对的就是这类复杂长程需求,因此很自然地把它们作为 Agent 的重点研究和应用场景。

数学、代码等其他领域的 Agent 已经让行业看到,在目标相对清晰、结果能够验证的环境里,AI 可以把复杂任务拆成大量步骤,并持续执行很长时间。真实生活中的条件麻烦得多,没有随处可用的测试用例,目标和约束还会随着任务一起变化。这种模糊性让长程 Agent 的短板暴露得更加明显。

dots 实验室开源的两套评测基准,把差距与不足直观地摆了出来。

一套是 VibeSearchBench,它考察「当用户没有一次说清需求,Agent 能不能弄明白他到底想要什么」,覆盖 20 个领域、200 项任务。评测模拟真实用户,在多轮对话中逐步补充需求和限制条件,再看模型能否准确理解用户想要什么。

另一套是 VibeLifeBench,强调时间和环境变化,考察「外部条件变化之后,Agent 还能不能跟得住」,覆盖 10 个领域、20 项任务,每项任务包含 20 到 30 个阶段,并设置 1247 项 atomic checks,用于检查状态能否保持一致、工具有没有正确执行,以及最后交付了什么。

结果显示,即便是 Claude Opus 5、GPT-5.5 这样的全球头部模型,在这两套评测基准中也没有达到设定的及格水平


图左为 VibeSearchBench 完整榜单,图右为 VibeLifeBench 完整榜单。

  • VibeSearchBench 主页:https://vibebench.github.io/VibeSearchBench.github.io/

  • VibeLifeBench 主页:https://vibebench.github.io/VibeLifeBench_homepage/

这些结果说明了一件事:模型在高难度单点任务上已足够强,但把这种能力稳定维持数小时甚至更久,仍是 Agent 力所不及的地方。小红书对此的探索与布局才刚刚开始。

dots3-note 是 dots3 系列中最轻量级的版本,目前开源的 preview 版本在体验和细节上仍有继续优化的空间。据 dots 实验室透露,dots3-note 正式版也将于近期开源。未来 dots3 系列还将推出 jazz 和 aria,与 note 组成三个层级,覆盖不同任务复杂度、响应速度和计算成本的应用需求。

更多训练方法细节请查看官方技术博客(中文):https://studio.dots.ai/dots/dots3-zh.html

© THE END

本文为机器之心授权转载文章

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
日本网友:亚运会餐食让日料名声扫地!难怪日本人身高40年停滞不前

日本网友:亚运会餐食让日料名声扫地!难怪日本人身高40年停滞不前

念洲
2026-09-21 10:59:04
没想到,大湾区晚会请来一屋子专业歌手,竟让3个跨界的演员抢镜

没想到,大湾区晚会请来一屋子专业歌手,竟让3个跨界的演员抢镜

白面书誏
2026-09-21 12:31:16
还在发力,马竞官方晒齿轮警示标识:这赛季他们开始得非常早

还在发力,马竞官方晒齿轮警示标识:这赛季他们开始得非常早

懂球帝
2026-09-22 01:37:06
德天空:和执教利物浦时类似,克洛普将更多地安排在下午训练

德天空:和执教利物浦时类似,克洛普将更多地安排在下午训练

懂球帝
2026-09-22 01:37:06
8年敛财14亿吃顿饭花百万,奢靡堪比e租宝“大佬”,最终下场咋样

8年敛财14亿吃顿饭花百万,奢靡堪比e租宝“大佬”,最终下场咋样

启迪你的思维
2026-09-21 16:47:06
一加新机正式亮相:9月22日即将上市,9000mAh+第六代骁龙8超级至尊版

一加新机正式亮相:9月22日即将上市,9000mAh+第六代骁龙8超级至尊版

手机讲坛
2026-09-22 01:11:48
体育局不再隐瞒!公布中国男篮集训备战经费,难怪要求全员写总结

体育局不再隐瞒!公布中国男篮集训备战经费,难怪要求全员写总结

十点街球体育
2026-09-21 21:24:09
中国社保为什么会走到今天这个地步?它到底经历了什么?

中国社保为什么会走到今天这个地步?它到底经历了什么?

非虚构人间
2026-09-10 21:40:03
保时捷卡宴狂降30万清库存!博主:这价格比德国本土的还香

保时捷卡宴狂降30万清库存!博主:这价格比德国本土的还香

快科技
2026-09-21 10:10:13
西贝要是倒闭,就轮到罗永浩害怕了

西贝要是倒闭,就轮到罗永浩害怕了

大嘴説
2026-09-21 10:18:29
陈建州突发心梗手术后已出院,本人发文道歉:因疏忽违反医院规定在社交平台晒照,为占用医疗资源与社会关注深感自责

陈建州突发心梗手术后已出院,本人发文道歉:因疏忽违反医院规定在社交平台晒照,为占用医疗资源与社会关注深感自责

极目新闻
2026-09-21 17:48:58
贾玲彻底陷入死局:新片不敢上,综艺路也走不通,两头全堵死

贾玲彻底陷入死局:新片不敢上,综艺路也走不通,两头全堵死

乐悠悠娱乐
2026-09-07 10:10:12
“这颜值,放艺术生里也是顶级!”家长晒素颜大一女儿哭鼻子火了

“这颜值,放艺术生里也是顶级!”家长晒素颜大一女儿哭鼻子火了

世界圈
2026-09-15 15:50:08
刚刚,GPT-6 Astra取得哥德巴赫猜想重大突破!

刚刚,GPT-6 Astra取得哥德巴赫猜想重大突破!

新智元
2026-09-21 10:13:35
记住,钱存到“这个数”,抓紧去享受生活,人生3万天,你还在等什么?

记住,钱存到“这个数”,抓紧去享受生活,人生3万天,你还在等什么?

CG说科技
2026-09-21 10:57:21
“贾国龙要求罗永浩下跪才愿意和解”冲上热搜,罗永浩发文回应:不要信谣传,已经取证,接下来会该投诉的投诉,该起诉的起诉

“贾国龙要求罗永浩下跪才愿意和解”冲上热搜,罗永浩发文回应:不要信谣传,已经取证,接下来会该投诉的投诉,该起诉的起诉

极目新闻
2026-09-22 00:12:08
炸了!17岁中国小将西班牙人首秀就破门,登场30分钟赢得全队信任

炸了!17岁中国小将西班牙人首秀就破门,登场30分钟赢得全队信任

绿茵舞着
2026-09-21 22:15:59
30队实力榜出炉:詹皇去费城,字母哥赴热火,尼克斯仍是头号目标

30队实力榜出炉:詹皇去费城,字母哥赴热火,尼克斯仍是头号目标

林间小温柔
2026-09-22 00:43:59
李宗仁晚年点破惊人内情:红军二万五千里长征能够顺利突围转移,蒋介石有一半功劳,调动数十万大军层层围堵最后为何全盘失利?

李宗仁晚年点破惊人内情:红军二万五千里长征能够顺利突围转移,蒋介石有一半功劳,调动数十万大军层层围堵最后为何全盘失利?

磊子讲史
2026-07-18 15:07:08
陪玩陪睡仅皮毛!又一女星深夜爆猛料,4女共侍1夫,61岁也不放过

陪玩陪睡仅皮毛!又一女星深夜爆猛料,4女共侍1夫,61岁也不放过

往史过眼云烟
2026-07-29 14:27:07
2026-09-22 02:00:49
天天开柒 incentive-icons
天天开柒
天天开柒是有前瞻、有判断的科技行业观察者。这里有关于行业深度分析和热辣小道。
149文章数 80关注度
往期回顾 全部

科技要闻

吃AI红利的凡人,年薪10万美元,每天3万步

头条要闻

iPhone18第一批受害者来了 网友:24小时死机5次

头条要闻

iPhone18第一批受害者来了 网友:24小时死机5次

体育要闻

跟着华裔天才重仓AI,勇士旧将成资本大佬

娱乐要闻

张佳宁穿搭宽松小腹微凸 引发怀孕猜测

财经要闻

酒鬼酒经销商半年跑了40%

汽车要闻

全系800V/红旗司南智驾 红旗天工07预售权益价16.99万起

态度原创

游戏
教育
时尚
数码
军事航空

《辐射》新作或许比想象中快得多!官方藏惊喜?

教育要闻

老师罚站被投诉,被逼写三天说明,讲话的孩子站后面,全班替他的家长买单

夏秋换季,学宋慧乔“挂件衣服”出门

数码要闻

华硕商用破晓系列亮相,用Agent PC为办公降本增效

军事要闻

莫斯科称遭"有史以来最大规模袭击"

无障碍浏览 进入关怀版