网易首页 > 网易号 > 正文 申请入驻

何恺明团队新作:给大模型加上“视觉记忆”,AGI基准测试从40分升到100分

0
分享至



同一个大模型,仅仅换了一套“看世界”和“记东西”的方式,成绩就能相差 60 分。

近日,MIT 电气工程与计算机科学系副教授、Google DeepMind 杰出科学家何恺明团队发表论文《VISTA:面向交互世界推理的视觉框架》。研究团队没有训练新的基础模型,而是在现有多模态模型外增加了一套视觉交互与记忆框架。

结果显示,接入 VISTA 后,模型在 ARC-AGI-3 的 25 个公开游戏中分数显著提升。Claude Opus 5 的得分从 40.68 分直接提升至 100 分,GPT-5.6 Sol 则从 13.33 分提升至 99 分,两个模型最终都顺利完成了全部公开关卡。


(来源:Arxiv)

作为一套面向多模态 Agent 的视觉交互框架,VISTA 主要解决两个看似基础、却长期影响 Agent 表现的问题:模型如何直接观察视觉环境,以及在长周期的连续交互中,如何保存并重新调用过去的信息。

ARC-AGI-3 是今年 3 月推出的一套 AGI 基准测试,由 ARC Prize 基金会主导,延续了 Keras 创始人 François Chollet 提出的 ARC 系列思路,主要考察模型面对陌生任务时的适应和推理能力。

与此前以静态图形题为主的 ARC 不同,ARC-AGI-3 把测试放进了动态交互环境。参与者进入一个从未见过的像素小游戏后,没有操作说明,也不会被直接告知目标,只能通过不断尝试,观察环境变化,逐步摸清规则并完成任务。


图|ARC-AGI-3 中的部分交互式游戏环境。(来源:ARC Prize)

这套测试不仅看是否通关,也会参考人类首次试玩时的表现,衡量智能体完成任务所需的环境操作次数。它希望测试的是一种更接近“流体智能”的能力:当现成知识无法直接给出答案时,系统能否通过有限的观察和试错快速理解陌生环境。今年 3 月测试发布时,前沿 AI 系统整体表现仍然很低;半年后,公开测试集已被多种 Agent 系统推进到接近满分甚至满分。

给模型一双“眼睛”和一本相册

VISTA 做的第一件事很简单,就是让模型直接“看“”画面。

ARC-AGI-3 的游戏本质上是一个 64×64 的彩色网格。此前提供给语言模型的最小接口,会把这些颜色逐格转换成数字,最终变成一长串文本。虽然信息本身没有丢失,但一个原本一眼就能看出位置、边界和形状的二维画面,就这样被拆成了 4096 个数字。

VISTA 把这一过程倒了回来。它直接将游戏画面以 PNG 图像交给多模态模型,让模型在视觉空间中判断物体在哪里、彼此是什么关系,再决定下一步操作。研究团队还专门比较了不同的信息呈现方式:同一个游戏既可以变成数字文本,也可以保持原本的二维画面,甚至还能重新渲染成三维场景。底层规则没有改变,改变的只是模型“看见”这个世界的方式。


(来源:VISTA 项目主页)

这种改动看起来并不复杂,但效果很明显。在论文的消融实验中,仅仅从数字文本改成直接看图,GPT-5.6 Sol 的得分就从 13.33 分提高到 47.32 分。

直接看图还有一个额外好处,更省上下文。论文估算,一个 64×64 的数字网格如果完整转成文本,大约需要 4000 个 Token;而同一画面以图像形式输入时,只需要约 300 个图像 Token。换句话说,把二维画面强行翻译成几千个数字,不仅让空间关系更难理解,也会挤占模型原本可以用于推理的上下文预算。

研究团队还发现,单纯把上下文窗口做得更大,并不会继续提高成绩。VISTA 默认使用约 20 万 Token 的上下文;当窗口扩大到约 78 万 Token 后,模型消耗的 Token 大幅增加,但成绩没有随之提升。相比把所有历史信息一直堆在上下文里,更有效的方式,是把原始信息保存下来,需要时再主动调取。

而这正是 VISTA 的第二个核心设计:无损视觉记忆(Lossless visual memory)。

一场 ARC-AGI-3 游戏可能持续数百次操作。模型第一次碰到某个机关时,往往并不知道这个变化意味着什么;直到几十步之后出现新的线索,才可能意识到自己需要重新检查当时的画面。如果早期画面已经被截断,或者只留下几句文字摘要,其中很多细节就再也找不回来了。

因此,VISTA 会把环境返回的每一帧画面按照时间顺序完整保存下来,包括一次动作触发的中间动画帧。模型不需要始终把这些图片塞在当前上下文里,而是在需要时主动调用 “inspect”,重新翻出几十步甚至上百步以前的画面;它也可以同时调出多张历史图片进行比较,或者放大其中某个区域。如果需要确认非常细微的差别,还可以通过 “read_pixels” 直接读取具体位置的像素信息。

研究团队把这种机制称为一种“显式注意力”。普通上下文里的记忆更接近于“希望模型还记得”,VISTA 则给了模型一套主动查档案的工具。它可以明确决定什么时候回看、回看哪一帧,以及具体查看画面的哪个位置。

这种机制放到游戏里就很好理解。比如模型点击一个橙色方块后,发现画面发生了变化,但一时无法判断其中的规律。它可以重新调出操作前后的几帧图像并排比较,观察哪些元素消失、哪些位置发生改变,再根据这些视觉证据修正自己的判断。

除此之外,VISTA 还给模型准备了两份很简单的文字笔记。`GUIDE.md` 用来记录已经比较确定的游戏规则,`WORKING.md` 则更像一张草稿纸,保存当前关卡的状态、正在验证的假设以及下一步计划。当一轮上下文快要用完时,模型可以先把关键进展写进笔记,再开启新的上下文继续游戏,而此前保存的历史画面和笔记仍然可以继续调用。

于是,VISTA 最终形成了一套相对完整的循环。模型先观察当前画面,根据已有信息形成判断,执行一次操作,再根据环境反馈修正对游戏规则的理解。如果发现线索不足,它还可以随时回看过去,而不是只能依赖当前上下文里的残余信息。


图|VISTA 的 Agent 工作循环。(来源:VISTA 项目主页)

消融实验也显示,真正拉开差距的正是这种“可以回头看”的能力。加入直接视觉输入和笔记后,GPT-5.6 Sol 的成绩已经提高到 70 分左右;当无损视觉记忆和主动回看能力加入之后,得分进一步跃升到 94 分以上,最终在加入精确像素读取后达到 99 分。

这组结果指向的其实是一种不同的 Agent 设计思路——与其不断扩大上下文窗口,让模型把所有经历始终“记在脑子里”,不如把原始经历完整地保存在外部,在真正需要的时候再把对应的信息找回来。VISTA 本身没有训练新的基础模型,也没有针对每一个游戏预先编写规则,它改变的只是模型观察、保存和重新调用信息的方式。

连续三次把 ARC 拉回视觉问题

其实,VISTA 并不是何恺明团队第一次尝试从视觉角度重新审视 ARC。

去年11月,团队发表了题为《ARC Is a Vision Problem!》的论文,首次提出 VARC。彼时 ARC 的主流解法高度依赖纯大语言模型,将二维网格矩阵翻译成数字、纯文本或代码脚本,再交由 LLM 去归纳其中的转换规律。何恺明团队采取了另一条路线,把 ARC 直接视为一个纯粹的“图像到图像”的视觉转换问题,仅使用一个约 1900万 参数的小型 Vision Transformer 从零训练。最终,VARC 在 ARC-1 基准上拿到了 60.4% 的准确率,追平了许多规模远大于它的大模型方案。


(来源:VARC 论文)

今年团队推出的第二项工作《Natural Image Pretraining Improves Abstract Reasoning》,则将这一思路向前推进了一步。团队发现,视觉模型此前在 ImageNet 这类自然图像数据集上学到的能力,即便表面上只是“认猫看狗”,与 ARC 抽象的彩色方格相距甚远,却能切实提升后续的抽象推理能力。

其深层原因在于,自然图像的预训练让模型形成了关于物体、边缘、前景与背景以及空间结构等视觉先验。引入这一先验后,Nat-ARC 的单模型在 ARC-1 上的得分提高到了 63.4%,组合多个模型后进一步达到 70.2%。

而到了 VISTA,研究的问题再次发生了延伸。前两项工作主要讨论“模型该如何从静态视觉中学习抽象规则”,VISTA 则开始直面动态的交互世界:画面在实时变化,过去的信息会转瞬即逝,Agent 必须通过不断试错、记忆、回看,再决定下一步行动。在这一过程中,视觉不再仅仅是一种输入格式,而是真正变成了整个闭环推理循环的一部分。

论文还将同一套框架迁移到了更多复杂环境中。将 ARC 游戏重新渲染为具有三维透视关系的场景后,VISTA 依然取得了 84.12分;在包含34款浏览器游戏的 GameWorld、AI GameStore,以及静态视觉推理基准 BabyVision 上,它的表现也普遍超越了使用同款基座模型但采用默认接口的版本。在 BabyVision 的测试中,仅仅是赋予模型主动放大局部细节的能力,其准确率就从 41.0% 直接提升到了 63.2%。

满分之后,Agent 到底该怎么测?

不过,这块“100 分”的成绩牌仍有一个重要前提,VISTA 刷满的是 ARC-AGI-3 的 25 个公开游戏。它还不能完全证明面对真正陌生任务时,模型也具备同样的泛化能力。

另一方面,在 VISTA 之前,ARC-AGI-3 公开集上已经出现过满分或接近满分的方案。不同的是,此前不少系统依赖程序合成,让大模型为具体游戏构建可运行的“世界模型”,再在模拟环境中验证规则和规划动作;VISTA 没有为每个游戏单独编写模拟器,而是直接让通用多模态模型观察、回看和理解视觉环境。

研究团队也指出,由于这些公开游戏早于 Claude Opus 5 和 GPT-5.6 Sol 发布,无法完全排除相关题目进入训练数据的可能。真正更严格的泛化能力,还需要尚未公开的私有测试集进一步检验。

但 VISTA 更值得关注的地方,也许并不只在于这张满分成绩单。它进一步暴露出 Agent 时代一个越来越重要的问题:我们测到的,究竟是模型本身的能力,还是整套系统的能力?

进入 Agent 阶段后,模型之外的感知接口、记忆机制、工具调用和上下文管理都会直接影响最终表现。VISTA 没有改变模型参数,却大幅提升了成绩,说明排行榜上的“模型能力”正在越来越多地由模型与外部系统共同决定。

这个变化在真实世界里会更加明显。无论是浏览器、电脑,还是未来的机器人,环境都不会主动把信息整理成适合模型理解的形式。智能体必须持续观察、记住关键状态,并在需要时重新调取过去的信息。

因此,VISTA 提出的其实是一条不同于继续扩大模型规模的路径。当基础模型能力逐渐增强后,如何让模型更好地看见、记住并理解外部世界,也可能成为下一阶段 Agent 能力提升的重要来源。

1. https://arxiv.org/abs/2610.02200

2. https://vista-research.github.io/

3. https://arcprize.org/blog/arc-agi-3-launch

4. https://arcprize.org/arc-agi/3

5. https://arcprize.org/competitions/2026/arc-agi-3

6. https://arcprize.org/leaderboard/community

7. https://arcprize.org/leaderboard

8. https://arxiv.org/abs/2511.14761

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
事业没了、婚也离了,被封5年后赵薇再曝近况,瘦到脱相不敢认

事业没了、婚也离了,被封5年后赵薇再曝近况,瘦到脱相不敢认

阿讯说天下
2026-08-30 06:10:34
《兰香如故》若非林锦岐摊牌,许兰香始终不知,养父的隐瞒有多深

《兰香如故》若非林锦岐摊牌,许兰香始终不知,养父的隐瞒有多深

天玑影视说
2026-10-05 19:56:33
首胜!詹姆斯发挥神勇!5点启示,让球迷振奋…

首胜!詹姆斯发挥神勇!5点启示,让球迷振奋…

詹姆斯吧
2026-10-05 14:07:05
直降100美元,iPad Mini回到涨价前

直降100美元,iPad Mini回到涨价前

硅屿手记
2026-10-04 20:57:58
孙颖莎重返女单第一后获首胜,赛后回应闪光灯与呐喊声干扰:观众非常热情,希望接下来的比赛大家能进一步遵守观赛规则

孙颖莎重返女单第一后获首胜,赛后回应闪光灯与呐喊声干扰:观众非常热情,希望接下来的比赛大家能进一步遵守观赛规则

大风新闻
2026-10-05 21:48:03
CCTV16直播中网第3轮:孙心然vs高芙,美网青少年冠军挑战世界第4

CCTV16直播中网第3轮:孙心然vs高芙,美网青少年冠军挑战世界第4

小犙拍客在北漂
2026-10-05 16:35:52
30天30队·热:扬尼斯、阿德巴约与克雷

30天30队·热:扬尼斯、阿德巴约与克雷

张佳玮写字的地方
2026-10-05 12:07:49
中山5只濑尿虾702元!食客称点菜未告知价格,结账才发现,天价海鲜争议再起

中山5只濑尿虾702元!食客称点菜未告知价格,结账才发现,天价海鲜争议再起

火山詩话
2026-10-05 08:17:39
当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

鹤羽说个事
2026-09-02 16:51:59
坏消息,勒布朗·詹姆斯生涯第24赛季仍受慢性关节炎和背伤困扰

坏消息,勒布朗·詹姆斯生涯第24赛季仍受慢性关节炎和背伤困扰

好火子
2026-10-05 22:04:37
首进中网决赛!德米纳尔领先收胡尔卡奇伤退大礼 静候德约科维奇

首进中网决赛!德米纳尔领先收胡尔卡奇伤退大礼 静候德约科维奇

醉卧浮生
2026-10-05 18:48:18
徐巧芯为蔡康永解释,蒋万安发出邀请,郑丽文回应来了。

徐巧芯为蔡康永解释,蒋万安发出邀请,郑丽文回应来了。

经点星娱
2026-10-05 18:06:53
郑钦文2-1啃下种子名将,大坂退赛让她白捡个武网名额

郑钦文2-1啃下种子名将,大坂退赛让她白捡个武网名额

罗纳尔说个球
2026-10-05 18:17:35
中方决定撤离援助后,对中国的态度立马变了

中方决定撤离援助后,对中国的态度立马变了

麓谷隐士
2026-10-04 00:15:04
《牛来》后遗症还在,连续四部电影票房为零,国庆档总票房惨败

《牛来》后遗症还在,连续四部电影票房为零,国庆档总票房惨败

影视高原说
2026-10-05 15:10:51
百年前胃癌是美国头号癌,几十年发病率暴跌,经验值得中国人借鉴

百年前胃癌是美国头号癌,几十年发病率暴跌,经验值得中国人借鉴

今日养生之道
2026-10-05 01:50:49
大批中国精英移民美国后,集体消失!朋友圈彻底停更,太真实了

大批中国精英移民美国后,集体消失!朋友圈彻底停更,太真实了

史之铭
2026-10-03 02:22:30
医生:胃病不怕辣、不怕饿,更不怕喝冰水,真正怕的是饭后做6事

医生:胃病不怕辣、不怕饿,更不怕喝冰水,真正怕的是饭后做6事

健康科普365
2026-10-05 11:55:14
2026诺贝尔生理医学奖颁给光遗传学,华人学者遗憾错过

2026诺贝尔生理医学奖颁给光遗传学,华人学者遗憾错过

知识分子
2026-10-05 17:52:59
入秋后,“打死”都不能买的6种食物,别贪便宜给家人吃,别大意

入秋后,“打死”都不能买的6种食物,别贪便宜给家人吃,别大意

思思夜话
2026-10-05 13:10:35
2026-10-05 22:23:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17341文章数 515227关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

缅北电诈头目在中国临刑前对着镜头叫嚣:狼生来要吃肉

头条要闻

缅北电诈头目在中国临刑前对着镜头叫嚣:狼生来要吃肉

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

旅游
健康
教育
房产
手机

旅游要闻

永定河集盲盒双路线实测!闺蜜漫游线vs情侣约会线

刷酸祛痘,为什么有人翻车?

教育要闻

聪明的父母,大多是“农民思维”

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

手机要闻

三星Galaxy S27 Ultra基础颜色选项曝光:黑色、蓝色、浅粉色、白色

无障碍浏览 进入关怀版