网易首页 > 网易号 > 正文 申请入驻

何恺明团队新作:给大模型加上“视觉记忆”,AGI基准测试从40分升到100分

0
分享至



同一个大模型,仅仅换了一套“看世界”和“记东西”的方式,成绩就能相差 60 分。

近日,MIT 电气工程与计算机科学系副教授、Google DeepMind 杰出科学家何恺明团队发表论文《VISTA:面向交互世界推理的视觉框架》。研究团队没有训练新的基础模型,而是在现有多模态模型外增加了一套视觉交互与记忆框架。

结果显示,接入 VISTA 后,模型在 ARC-AGI-3 的 25 个公开游戏中分数显著提升。Claude Opus 5 的得分从 40.68 分直接提升至 100 分,GPT-5.6 Sol 则从 13.33 分提升至 99 分,两个模型最终都顺利完成了全部公开关卡。


(来源:Arxiv)

作为一套面向多模态 Agent 的视觉交互框架,VISTA 主要解决两个看似基础、却长期影响 Agent 表现的问题:模型如何直接观察视觉环境,以及在长周期的连续交互中,如何保存并重新调用过去的信息。

ARC-AGI-3 是今年 3 月推出的一套 AGI 基准测试,由 ARC Prize 基金会主导,延续了 Keras 创始人 François Chollet 提出的 ARC 系列思路,主要考察模型面对陌生任务时的适应和推理能力。

与此前以静态图形题为主的 ARC 不同,ARC-AGI-3 把测试放进了动态交互环境。参与者进入一个从未见过的像素小游戏后,没有操作说明,也不会被直接告知目标,只能通过不断尝试,观察环境变化,逐步摸清规则并完成任务。


图|ARC-AGI-3 中的部分交互式游戏环境。(来源:ARC Prize)

这套测试不仅看是否通关,也会参考人类首次试玩时的表现,衡量智能体完成任务所需的环境操作次数。它希望测试的是一种更接近“流体智能”的能力:当现成知识无法直接给出答案时,系统能否通过有限的观察和试错快速理解陌生环境。今年 3 月测试发布时,前沿 AI 系统整体表现仍然很低;半年后,公开测试集已被多种 Agent 系统推进到接近满分甚至满分。

给模型一双“眼睛”和一本相册

VISTA 做的第一件事很简单,就是让模型直接“看“”画面。

ARC-AGI-3 的游戏本质上是一个 64×64 的彩色网格。此前提供给语言模型的最小接口,会把这些颜色逐格转换成数字,最终变成一长串文本。虽然信息本身没有丢失,但一个原本一眼就能看出位置、边界和形状的二维画面,就这样被拆成了 4096 个数字。

VISTA 把这一过程倒了回来。它直接将游戏画面以 PNG 图像交给多模态模型,让模型在视觉空间中判断物体在哪里、彼此是什么关系,再决定下一步操作。研究团队还专门比较了不同的信息呈现方式:同一个游戏既可以变成数字文本,也可以保持原本的二维画面,甚至还能重新渲染成三维场景。底层规则没有改变,改变的只是模型“看见”这个世界的方式。


(来源:VISTA 项目主页)

这种改动看起来并不复杂,但效果很明显。在论文的消融实验中,仅仅从数字文本改成直接看图,GPT-5.6 Sol 的得分就从 13.33 分提高到 47.32 分。

直接看图还有一个额外好处,更省上下文。论文估算,一个 64×64 的数字网格如果完整转成文本,大约需要 4000 个 Token;而同一画面以图像形式输入时,只需要约 300 个图像 Token。换句话说,把二维画面强行翻译成几千个数字,不仅让空间关系更难理解,也会挤占模型原本可以用于推理的上下文预算。

研究团队还发现,单纯把上下文窗口做得更大,并不会继续提高成绩。VISTA 默认使用约 20 万 Token 的上下文;当窗口扩大到约 78 万 Token 后,模型消耗的 Token 大幅增加,但成绩没有随之提升。相比把所有历史信息一直堆在上下文里,更有效的方式,是把原始信息保存下来,需要时再主动调取。

而这正是 VISTA 的第二个核心设计:无损视觉记忆(Lossless visual memory)。

一场 ARC-AGI-3 游戏可能持续数百次操作。模型第一次碰到某个机关时,往往并不知道这个变化意味着什么;直到几十步之后出现新的线索,才可能意识到自己需要重新检查当时的画面。如果早期画面已经被截断,或者只留下几句文字摘要,其中很多细节就再也找不回来了。

因此,VISTA 会把环境返回的每一帧画面按照时间顺序完整保存下来,包括一次动作触发的中间动画帧。模型不需要始终把这些图片塞在当前上下文里,而是在需要时主动调用 “inspect”,重新翻出几十步甚至上百步以前的画面;它也可以同时调出多张历史图片进行比较,或者放大其中某个区域。如果需要确认非常细微的差别,还可以通过 “read_pixels” 直接读取具体位置的像素信息。

研究团队把这种机制称为一种“显式注意力”。普通上下文里的记忆更接近于“希望模型还记得”,VISTA 则给了模型一套主动查档案的工具。它可以明确决定什么时候回看、回看哪一帧,以及具体查看画面的哪个位置。

这种机制放到游戏里就很好理解。比如模型点击一个橙色方块后,发现画面发生了变化,但一时无法判断其中的规律。它可以重新调出操作前后的几帧图像并排比较,观察哪些元素消失、哪些位置发生改变,再根据这些视觉证据修正自己的判断。

除此之外,VISTA 还给模型准备了两份很简单的文字笔记。`GUIDE.md` 用来记录已经比较确定的游戏规则,`WORKING.md` 则更像一张草稿纸,保存当前关卡的状态、正在验证的假设以及下一步计划。当一轮上下文快要用完时,模型可以先把关键进展写进笔记,再开启新的上下文继续游戏,而此前保存的历史画面和笔记仍然可以继续调用。

于是,VISTA 最终形成了一套相对完整的循环。模型先观察当前画面,根据已有信息形成判断,执行一次操作,再根据环境反馈修正对游戏规则的理解。如果发现线索不足,它还可以随时回看过去,而不是只能依赖当前上下文里的残余信息。


图|VISTA 的 Agent 工作循环。(来源:VISTA 项目主页)

消融实验也显示,真正拉开差距的正是这种“可以回头看”的能力。加入直接视觉输入和笔记后,GPT-5.6 Sol 的成绩已经提高到 70 分左右;当无损视觉记忆和主动回看能力加入之后,得分进一步跃升到 94 分以上,最终在加入精确像素读取后达到 99 分。

这组结果指向的其实是一种不同的 Agent 设计思路——与其不断扩大上下文窗口,让模型把所有经历始终“记在脑子里”,不如把原始经历完整地保存在外部,在真正需要的时候再把对应的信息找回来。VISTA 本身没有训练新的基础模型,也没有针对每一个游戏预先编写规则,它改变的只是模型观察、保存和重新调用信息的方式。

连续三次把 ARC 拉回视觉问题

其实,VISTA 并不是何恺明团队第一次尝试从视觉角度重新审视 ARC。

去年11月,团队发表了题为《ARC Is a Vision Problem!》的论文,首次提出 VARC。彼时 ARC 的主流解法高度依赖纯大语言模型,将二维网格矩阵翻译成数字、纯文本或代码脚本,再交由 LLM 去归纳其中的转换规律。何恺明团队采取了另一条路线,把 ARC 直接视为一个纯粹的“图像到图像”的视觉转换问题,仅使用一个约 1900万 参数的小型 Vision Transformer 从零训练。最终,VARC 在 ARC-1 基准上拿到了 60.4% 的准确率,追平了许多规模远大于它的大模型方案。


(来源:VARC 论文)

今年团队推出的第二项工作《Natural Image Pretraining Improves Abstract Reasoning》,则将这一思路向前推进了一步。团队发现,视觉模型此前在 ImageNet 这类自然图像数据集上学到的能力,即便表面上只是“认猫看狗”,与 ARC 抽象的彩色方格相距甚远,却能切实提升后续的抽象推理能力。

其深层原因在于,自然图像的预训练让模型形成了关于物体、边缘、前景与背景以及空间结构等视觉先验。引入这一先验后,Nat-ARC 的单模型在 ARC-1 上的得分提高到了 63.4%,组合多个模型后进一步达到 70.2%。

而到了 VISTA,研究的问题再次发生了延伸。前两项工作主要讨论“模型该如何从静态视觉中学习抽象规则”,VISTA 则开始直面动态的交互世界:画面在实时变化,过去的信息会转瞬即逝,Agent 必须通过不断试错、记忆、回看,再决定下一步行动。在这一过程中,视觉不再仅仅是一种输入格式,而是真正变成了整个闭环推理循环的一部分。

论文还将同一套框架迁移到了更多复杂环境中。将 ARC 游戏重新渲染为具有三维透视关系的场景后,VISTA 依然取得了 84.12分;在包含34款浏览器游戏的 GameWorld、AI GameStore,以及静态视觉推理基准 BabyVision 上,它的表现也普遍超越了使用同款基座模型但采用默认接口的版本。在 BabyVision 的测试中,仅仅是赋予模型主动放大局部细节的能力,其准确率就从 41.0% 直接提升到了 63.2%。

满分之后,Agent 到底该怎么测?

不过,这块“100 分”的成绩牌仍有一个重要前提,VISTA 刷满的是 ARC-AGI-3 的 25 个公开游戏。它还不能完全证明面对真正陌生任务时,模型也具备同样的泛化能力。

另一方面,在 VISTA 之前,ARC-AGI-3 公开集上已经出现过满分或接近满分的方案。不同的是,此前不少系统依赖程序合成,让大模型为具体游戏构建可运行的“世界模型”,再在模拟环境中验证规则和规划动作;VISTA 没有为每个游戏单独编写模拟器,而是直接让通用多模态模型观察、回看和理解视觉环境。

研究团队也指出,由于这些公开游戏早于 Claude Opus 5 和 GPT-5.6 Sol 发布,无法完全排除相关题目进入训练数据的可能。真正更严格的泛化能力,还需要尚未公开的私有测试集进一步检验。

但 VISTA 更值得关注的地方,也许并不只在于这张满分成绩单。它进一步暴露出 Agent 时代一个越来越重要的问题:我们测到的,究竟是模型本身的能力,还是整套系统的能力?

进入 Agent 阶段后,模型之外的感知接口、记忆机制、工具调用和上下文管理都会直接影响最终表现。VISTA 没有改变模型参数,却大幅提升了成绩,说明排行榜上的“模型能力”正在越来越多地由模型与外部系统共同决定。

这个变化在真实世界里会更加明显。无论是浏览器、电脑,还是未来的机器人,环境都不会主动把信息整理成适合模型理解的形式。智能体必须持续观察、记住关键状态,并在需要时重新调取过去的信息。

因此,VISTA 提出的其实是一条不同于继续扩大模型规模的路径。当基础模型能力逐渐增强后,如何让模型更好地看见、记住并理解外部世界,也可能成为下一阶段 Agent 能力提升的重要来源。

1. https://arxiv.org/abs/2610.02200

2. https://vista-research.github.io/

3. https://arcprize.org/blog/arc-agi-3-launch

4. https://arcprize.org/arc-agi/3

5. https://arcprize.org/competitions/2026/arc-agi-3

6. https://arcprize.org/leaderboard/community

7. https://arcprize.org/leaderboard

8. https://arxiv.org/abs/2511.14761

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
成都3片回锅肉卖105元:老板说“就赚20块”,网友算完账沉默了!

成都3片回锅肉卖105元:老板说“就赚20块”,网友算完账沉默了!

大稻网络科技
2026-10-04 15:59:45
网传孙宇晨在迪拜遭遇枪击!网友的回复绝了……

网传孙宇晨在迪拜遭遇枪击!网友的回复绝了……

麦杰逊
2026-10-05 11:36:41
新娘婚礼前两天被马蜂蜇伤,嘴唇肿胀自嘲“像蛤蟆精”,当事人:连夜就医,婚礼如期举行

新娘婚礼前两天被马蜂蜇伤,嘴唇肿胀自嘲“像蛤蟆精”,当事人:连夜就医,婚礼如期举行

极目新闻
2026-10-05 14:00:13
被开除后、实名举报中国电信 4 名高管:串标、虚假合同、套取财政资金等

被开除后、实名举报中国电信 4 名高管:串标、虚假合同、套取财政资金等

云头条
2026-10-05 15:38:10
国庆77周年招待会,这13位上将亮相!

国庆77周年招待会,这13位上将亮相!

华山穹剑
2026-10-04 20:30:26
啪啪打脸!上海同学聚会一顿吃掉46888元,众人认定组局人必须请客,结果18人起诉被驳回

啪啪打脸!上海同学聚会一顿吃掉46888元,众人认定组局人必须请客,结果18人起诉被驳回

火山詩话
2026-10-04 11:18:18
零跑汽车紧急声明:已下线与蔡康永相关的全部内容,并保留追究法律责任的权利

零跑汽车紧急声明:已下线与蔡康永相关的全部内容,并保留追究法律责任的权利

都市快报橙柿互动
2026-10-05 00:27:48
蔡康永怂了!最新回应还想当双面人网友不买账,更多品牌出面切割

蔡康永怂了!最新回应还想当双面人网友不买账,更多品牌出面切割

萌神木木
2026-10-05 16:31:00
耐克水深火热:取消大中华独立大区,市值蒸发近15000亿

耐克水深火热:取消大中华独立大区,市值蒸发近15000亿

南方都市报
2026-10-05 18:58:05
视频疯传!华人女子深夜赶飞机,却在洛杉矶国际机场被ICE逮捕

视频疯传!华人女子深夜赶飞机,却在洛杉矶国际机场被ICE逮捕

大洛杉矶LA
2026-10-05 02:04:58
郑钦文晋级中网八强,喜讯之后还有4大利好,有希望夺冠

郑钦文晋级中网八强,喜讯之后还有4大利好,有希望夺冠

南海浪花
2026-10-05 18:22:23
瞒妻子投资亏超1亿美元,美国CEO崩溃枪杀妻子后自杀!小舅子:他蜷缩成一团哭了几周

瞒妻子投资亏超1亿美元,美国CEO崩溃枪杀妻子后自杀!小舅子:他蜷缩成一团哭了几周

红星新闻
2026-10-05 16:25:09
中国大满贯!爆大冷,国乒劲敌0-3出局,雨果剃光头,勒布伦逆转

中国大满贯!爆大冷,国乒劲敌0-3出局,雨果剃光头,勒布伦逆转

南海浪花
2026-10-05 06:20:07
快讯!杨兰兰不简单呀!

快讯!杨兰兰不简单呀!

故事终将光明磊落
2026-10-05 12:55:20
以色列:严禁拥有伊朗、伊拉克、黎巴嫩、阿曼、巴基斯坦、卡塔尔和沙特等27国单一或双重国籍的机组人员执飞或搭乘赴以航班

以色列:严禁拥有伊朗、伊拉克、黎巴嫩、阿曼、巴基斯坦、卡塔尔和沙特等27国单一或双重国籍的机组人员执飞或搭乘赴以航班

第一财经资讯
2026-10-05 09:08:21
德拉帕蒂:这次反击要打到俄罗斯军事、政治当局崩溃

德拉帕蒂:这次反击要打到俄罗斯军事、政治当局崩溃

西楼饮月
2026-10-04 23:53:22
大结局!惩罚东航空姐下跪事件,欧某某终于被扒出来了,果然看起来财大气粗

大结局!惩罚东航空姐下跪事件,欧某某终于被扒出来了,果然看起来财大气粗

静若梨花
2026-10-05 16:48:43
油价大降!一夜崩落,10月5日全国92,95汽油“预跌近1.9毛/升”后,今天预跌或“升至2.3毛/升”,油价变“大降”中,下次10月15日调价

油价大降!一夜崩落,10月5日全国92,95汽油“预跌近1.9毛/升”后,今天预跌或“升至2.3毛/升”,油价变“大降”中,下次10月15日调价

猪友巴巴
2026-10-05 14:16:59
贵阳花果园:共 240 栋 45 层以上住宅,房价从 3 千涨到 1.4 万,如今严重分化

贵阳花果园:共 240 栋 45 层以上住宅,房价从 3 千涨到 1.4 万,如今严重分化

专业聊房君
2026-10-05 13:18:45
蔡康永露出真面目,他将面临3重惩罚,但他为什么一点都不怕

蔡康永露出真面目,他将面临3重惩罚,但他为什么一点都不怕

李昕言温度空间
2026-10-05 08:16:22
2026-10-05 21:32:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17341文章数 515226关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

松岛辉空登顶男单世界第一 终结国乒8年7个月榜首垄断

头条要闻

松岛辉空登顶男单世界第一 终结国乒8年7个月榜首垄断

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

数码
艺术
房产
手机
健康

数码要闻

重视中国玩家!AMD 26.9.2 WHQL驱动发布:虚幻5后台预编译

艺术要闻

吴冠中 大英博物馆展过的香港夜,1024万!

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

手机要闻

荣耀MagicOS 11新增自定义充电上限功能,充多少自己决定

刷酸祛痘,为什么有人翻车?

无障碍浏览 进入关怀版