网易首页 > 网易号 > 正文 申请入驻

何恺明团队新作:给大模型加上“视觉记忆”,AGI基准测试从40分升到100分

0
分享至



同一个大模型,仅仅换了一套“看世界”和“记东西”的方式,成绩就能相差 60 分。

近日,MIT 电气工程与计算机科学系副教授、Google DeepMind 杰出科学家何恺明团队发表论文《VISTA:面向交互世界推理的视觉框架》。研究团队没有训练新的基础模型,而是在现有多模态模型外增加了一套视觉交互与记忆框架。

结果显示,接入 VISTA 后,模型在 ARC-AGI-3 的 25 个公开游戏中分数显著提升。Claude Opus 5 的得分从 40.68 分直接提升至 100 分,GPT-5.6 Sol 则从 13.33 分提升至 99 分,两个模型最终都顺利完成了全部公开关卡。


(来源:Arxiv)

作为一套面向多模态 Agent 的视觉交互框架,VISTA 主要解决两个看似基础、却长期影响 Agent 表现的问题:模型如何直接观察视觉环境,以及在长周期的连续交互中,如何保存并重新调用过去的信息。

ARC-AGI-3 是今年 3 月推出的一套 AGI 基准测试,由 ARC Prize 基金会主导,延续了 Keras 创始人 François Chollet 提出的 ARC 系列思路,主要考察模型面对陌生任务时的适应和推理能力。

与此前以静态图形题为主的 ARC 不同,ARC-AGI-3 把测试放进了动态交互环境。参与者进入一个从未见过的像素小游戏后,没有操作说明,也不会被直接告知目标,只能通过不断尝试,观察环境变化,逐步摸清规则并完成任务。


图|ARC-AGI-3 中的部分交互式游戏环境。(来源:ARC Prize)

这套测试不仅看是否通关,也会参考人类首次试玩时的表现,衡量智能体完成任务所需的环境操作次数。它希望测试的是一种更接近“流体智能”的能力:当现成知识无法直接给出答案时,系统能否通过有限的观察和试错快速理解陌生环境。今年 3 月测试发布时,前沿 AI 系统整体表现仍然很低;半年后,公开测试集已被多种 Agent 系统推进到接近满分甚至满分。

给模型一双“眼睛”和一本相册

VISTA 做的第一件事很简单,就是让模型直接“看“”画面。

ARC-AGI-3 的游戏本质上是一个 64×64 的彩色网格。此前提供给语言模型的最小接口,会把这些颜色逐格转换成数字,最终变成一长串文本。虽然信息本身没有丢失,但一个原本一眼就能看出位置、边界和形状的二维画面,就这样被拆成了 4096 个数字。

VISTA 把这一过程倒了回来。它直接将游戏画面以 PNG 图像交给多模态模型,让模型在视觉空间中判断物体在哪里、彼此是什么关系,再决定下一步操作。研究团队还专门比较了不同的信息呈现方式:同一个游戏既可以变成数字文本,也可以保持原本的二维画面,甚至还能重新渲染成三维场景。底层规则没有改变,改变的只是模型“看见”这个世界的方式。


(来源:VISTA 项目主页)

这种改动看起来并不复杂,但效果很明显。在论文的消融实验中,仅仅从数字文本改成直接看图,GPT-5.6 Sol 的得分就从 13.33 分提高到 47.32 分。

直接看图还有一个额外好处,更省上下文。论文估算,一个 64×64 的数字网格如果完整转成文本,大约需要 4000 个 Token;而同一画面以图像形式输入时,只需要约 300 个图像 Token。换句话说,把二维画面强行翻译成几千个数字,不仅让空间关系更难理解,也会挤占模型原本可以用于推理的上下文预算。

研究团队还发现,单纯把上下文窗口做得更大,并不会继续提高成绩。VISTA 默认使用约 20 万 Token 的上下文;当窗口扩大到约 78 万 Token 后,模型消耗的 Token 大幅增加,但成绩没有随之提升。相比把所有历史信息一直堆在上下文里,更有效的方式,是把原始信息保存下来,需要时再主动调取。

而这正是 VISTA 的第二个核心设计:无损视觉记忆(Lossless visual memory)。

一场 ARC-AGI-3 游戏可能持续数百次操作。模型第一次碰到某个机关时,往往并不知道这个变化意味着什么;直到几十步之后出现新的线索,才可能意识到自己需要重新检查当时的画面。如果早期画面已经被截断,或者只留下几句文字摘要,其中很多细节就再也找不回来了。

因此,VISTA 会把环境返回的每一帧画面按照时间顺序完整保存下来,包括一次动作触发的中间动画帧。模型不需要始终把这些图片塞在当前上下文里,而是在需要时主动调用 “inspect”,重新翻出几十步甚至上百步以前的画面;它也可以同时调出多张历史图片进行比较,或者放大其中某个区域。如果需要确认非常细微的差别,还可以通过 “read_pixels” 直接读取具体位置的像素信息。

研究团队把这种机制称为一种“显式注意力”。普通上下文里的记忆更接近于“希望模型还记得”,VISTA 则给了模型一套主动查档案的工具。它可以明确决定什么时候回看、回看哪一帧,以及具体查看画面的哪个位置。

这种机制放到游戏里就很好理解。比如模型点击一个橙色方块后,发现画面发生了变化,但一时无法判断其中的规律。它可以重新调出操作前后的几帧图像并排比较,观察哪些元素消失、哪些位置发生改变,再根据这些视觉证据修正自己的判断。

除此之外,VISTA 还给模型准备了两份很简单的文字笔记。`GUIDE.md` 用来记录已经比较确定的游戏规则,`WORKING.md` 则更像一张草稿纸,保存当前关卡的状态、正在验证的假设以及下一步计划。当一轮上下文快要用完时,模型可以先把关键进展写进笔记,再开启新的上下文继续游戏,而此前保存的历史画面和笔记仍然可以继续调用。

于是,VISTA 最终形成了一套相对完整的循环。模型先观察当前画面,根据已有信息形成判断,执行一次操作,再根据环境反馈修正对游戏规则的理解。如果发现线索不足,它还可以随时回看过去,而不是只能依赖当前上下文里的残余信息。


图|VISTA 的 Agent 工作循环。(来源:VISTA 项目主页)

消融实验也显示,真正拉开差距的正是这种“可以回头看”的能力。加入直接视觉输入和笔记后,GPT-5.6 Sol 的成绩已经提高到 70 分左右;当无损视觉记忆和主动回看能力加入之后,得分进一步跃升到 94 分以上,最终在加入精确像素读取后达到 99 分。

这组结果指向的其实是一种不同的 Agent 设计思路——与其不断扩大上下文窗口,让模型把所有经历始终“记在脑子里”,不如把原始经历完整地保存在外部,在真正需要的时候再把对应的信息找回来。VISTA 本身没有训练新的基础模型,也没有针对每一个游戏预先编写规则,它改变的只是模型观察、保存和重新调用信息的方式。

连续三次把 ARC 拉回视觉问题

其实,VISTA 并不是何恺明团队第一次尝试从视觉角度重新审视 ARC。

去年11月,团队发表了题为《ARC Is a Vision Problem!》的论文,首次提出 VARC。彼时 ARC 的主流解法高度依赖纯大语言模型,将二维网格矩阵翻译成数字、纯文本或代码脚本,再交由 LLM 去归纳其中的转换规律。何恺明团队采取了另一条路线,把 ARC 直接视为一个纯粹的“图像到图像”的视觉转换问题,仅使用一个约 1900万 参数的小型 Vision Transformer 从零训练。最终,VARC 在 ARC-1 基准上拿到了 60.4% 的准确率,追平了许多规模远大于它的大模型方案。


(来源:VARC 论文)

今年团队推出的第二项工作《Natural Image Pretraining Improves Abstract Reasoning》,则将这一思路向前推进了一步。团队发现,视觉模型此前在 ImageNet 这类自然图像数据集上学到的能力,即便表面上只是“认猫看狗”,与 ARC 抽象的彩色方格相距甚远,却能切实提升后续的抽象推理能力。

其深层原因在于,自然图像的预训练让模型形成了关于物体、边缘、前景与背景以及空间结构等视觉先验。引入这一先验后,Nat-ARC 的单模型在 ARC-1 上的得分提高到了 63.4%,组合多个模型后进一步达到 70.2%。

而到了 VISTA,研究的问题再次发生了延伸。前两项工作主要讨论“模型该如何从静态视觉中学习抽象规则”,VISTA 则开始直面动态的交互世界:画面在实时变化,过去的信息会转瞬即逝,Agent 必须通过不断试错、记忆、回看,再决定下一步行动。在这一过程中,视觉不再仅仅是一种输入格式,而是真正变成了整个闭环推理循环的一部分。

论文还将同一套框架迁移到了更多复杂环境中。将 ARC 游戏重新渲染为具有三维透视关系的场景后,VISTA 依然取得了 84.12分;在包含34款浏览器游戏的 GameWorld、AI GameStore,以及静态视觉推理基准 BabyVision 上,它的表现也普遍超越了使用同款基座模型但采用默认接口的版本。在 BabyVision 的测试中,仅仅是赋予模型主动放大局部细节的能力,其准确率就从 41.0% 直接提升到了 63.2%。

满分之后,Agent 到底该怎么测?

不过,这块“100 分”的成绩牌仍有一个重要前提,VISTA 刷满的是 ARC-AGI-3 的 25 个公开游戏。它还不能完全证明面对真正陌生任务时,模型也具备同样的泛化能力。

另一方面,在 VISTA 之前,ARC-AGI-3 公开集上已经出现过满分或接近满分的方案。不同的是,此前不少系统依赖程序合成,让大模型为具体游戏构建可运行的“世界模型”,再在模拟环境中验证规则和规划动作;VISTA 没有为每个游戏单独编写模拟器,而是直接让通用多模态模型观察、回看和理解视觉环境。

研究团队也指出,由于这些公开游戏早于 Claude Opus 5 和 GPT-5.6 Sol 发布,无法完全排除相关题目进入训练数据的可能。真正更严格的泛化能力,还需要尚未公开的私有测试集进一步检验。

但 VISTA 更值得关注的地方,也许并不只在于这张满分成绩单。它进一步暴露出 Agent 时代一个越来越重要的问题:我们测到的,究竟是模型本身的能力,还是整套系统的能力?

进入 Agent 阶段后,模型之外的感知接口、记忆机制、工具调用和上下文管理都会直接影响最终表现。VISTA 没有改变模型参数,却大幅提升了成绩,说明排行榜上的“模型能力”正在越来越多地由模型与外部系统共同决定。

这个变化在真实世界里会更加明显。无论是浏览器、电脑,还是未来的机器人,环境都不会主动把信息整理成适合模型理解的形式。智能体必须持续观察、记住关键状态,并在需要时重新调取过去的信息。

因此,VISTA 提出的其实是一条不同于继续扩大模型规模的路径。当基础模型能力逐渐增强后,如何让模型更好地看见、记住并理解外部世界,也可能成为下一阶段 Agent 能力提升的重要来源。

1. https://arxiv.org/abs/2610.02200

2. https://vista-research.github.io/

3. https://arcprize.org/blog/arc-agi-3-launch

4. https://arcprize.org/arc-agi/3

5. https://arcprize.org/competitions/2026/arc-agi-3

6. https://arcprize.org/leaderboard/community

7. https://arcprize.org/leaderboard

8. https://arxiv.org/abs/2511.14761

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
他是国务院原副总理兼秘书长,唯一儿子娶了元帅千金!

他是国务院原副总理兼秘书长,唯一儿子娶了元帅千金!

历史甄有趣
2026-10-05 07:25:26
高市早苗又出神图了!日网民又羞耻了

高市早苗又出神图了!日网民又羞耻了

这里是东京
2026-10-05 18:00:45
穿上裤子不认人 《巫师3》新手又给凯拉整死了

穿上裤子不认人 《巫师3》新手又给凯拉整死了

游民星空
2026-10-05 19:03:22
哈马斯高官:哈马斯加沙地带领导人阿穆迪在以色列暗杀行动中幸存

哈马斯高官:哈马斯加沙地带领导人阿穆迪在以色列暗杀行动中幸存

观察者网
2026-10-05 18:11:25
大家提前做好准备,不出意外的话,10月开始中国或将出现4大转变

大家提前做好准备,不出意外的话,10月开始中国或将出现4大转变

梦回千年aa
2026-10-04 09:38:11
中俄再突发重大事情,普京还没踏上访华飞机,俄远东港口全线大堵

中俄再突发重大事情,普京还没踏上访华飞机,俄远东港口全线大堵

花颜蕴韵
2026-10-05 18:37:13
郑钦文晋级中网八强,喜讯之后还有4大利好,有希望夺冠

郑钦文晋级中网八强,喜讯之后还有4大利好,有希望夺冠

南海浪花
2026-10-05 18:22:23
“给你钱,让我搞一下”:29岁女子独自骑马到新疆,被一个70岁大爷性骚扰,摸了她两次大腿

“给你钱,让我搞一下”:29岁女子独自骑马到新疆,被一个70岁大爷性骚扰,摸了她两次大腿

江山挥笔
2026-09-13 11:03:46
人大获捐5.03亿,全网猜刘强东,官方为何沉默?

人大获捐5.03亿,全网猜刘强东,官方为何沉默?

解说阿洎
2026-10-05 13:32:57
日本35岁男假装“爸爸活”面试,把17岁女高中生诱骗回家:“我教你怎么做”

日本35岁男假装“爸爸活”面试,把17岁女高中生诱骗回家:“我教你怎么做”

日本物语
2026-10-04 20:34:54
情侣在瑞士雪山顶“撒欢”,就这么被全世界直播了···

情侣在瑞士雪山顶“撒欢”,就这么被全世界直播了···

新欧洲
2026-04-21 19:37:05
砍机长的副驾驶身份终于被扒出!3000多条“仇女”言论被翻出来

砍机长的副驾驶身份终于被扒出!3000多条“仇女”言论被翻出来

哎呀哎呀看电影
2026-10-04 20:39:20
2-1!郑钦文爆冷晋级,狂轰11记ACE球,下轮对手曝光,或直通8强

2-1!郑钦文爆冷晋级,狂轰11记ACE球,下轮对手曝光,或直通8强

体育就你秀
2026-10-05 17:26:23
随着亚运会结束后,6名U23球员可直接进国家队踢首发,37岁吴曦恐悬了

随着亚运会结束后,6名U23球员可直接进国家队踢首发,37岁吴曦恐悬了

大卫的篮球故事
2026-10-04 17:28:30
高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

明话直说
2026-08-25 18:07:55
三家新能源车企纷纷倒下,这不是价格战,是蓄谋已久的资本大逃杀

三家新能源车企纷纷倒下,这不是价格战,是蓄谋已久的资本大逃杀

流苏晚晴
2026-09-01 18:39:03
这很科学:89%的人幻想过同时和多人发生性行为,算精神出轨吗?

这很科学:89%的人幻想过同时和多人发生性行为,算精神出轨吗?

宇宙时空
2026-05-26 18:20:10
房价很大可能重走1998年老路!所有人一定要提前做好心理准备

房价很大可能重走1998年老路!所有人一定要提前做好心理准备

偷喝一口奶
2026-09-11 08:36:30
英国绿党通过“犹太复国主义即种族主义”决议,成为欧洲首个主流反犹太复国主义政党

英国绿党通过“犹太复国主义即种族主义”决议,成为欧洲首个主流反犹太复国主义政党

老王说正义
2026-10-05 14:55:23
台湾和上海都是 2000 多万人口,上半年台湾 GDP3.48 万亿,上海多少

台湾和上海都是 2000 多万人口,上半年台湾 GDP3.48 万亿,上海多少

抽象派大师
2026-09-20 16:57:21
2026-10-05 19:44:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17341文章数 515225关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

明珍珍被执行死刑前画面披露 接受采访神情淡定露微笑

头条要闻

明珍珍被执行死刑前画面披露 接受采访神情淡定露微笑

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

健康
手机
游戏
房产
亲子

刷酸祛痘,为什么有人翻车?

手机要闻

消息某厂商2亿像素三摄旗舰机被砍,预计为小米18 Ultra

《巫师3RE》猎奇Bug太诡异 谁把我性感特莉丝皮剥了

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

亲子要闻

公立医院“下场”带娃,并非跨界“抢生意” | 新京报快评

无障碍浏览 进入关怀版