何恺明团队提出 VISTA,让多模态模型按需回看视觉历史

何恺明团队提出 VISTA,让多模态模型按需回看视觉历史

N
News Editor
2026-10-09 07:58:55
何恺明团队在论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中提出视觉原生 Harness 框架 VISTA,核心是保存交互过程中的原始画面,并让模型在推理时按需回看、放大和比对细节。论文称,在 ARC-AGI-3 上,搭配 VISTA 的 Claude Opus 5.0 完成全部 25 个公开游戏并取得 100 分,GPT-5.6 Sol 也全部通关并取得 99 分。团队还在浏览器游戏、迷宫和连线题上做了测试,并将更接近物理世界的具身任务列为后续方向。

何恺明团队发布了一套面向多模态模型的视觉原生 Harness 框架 VISTA,论文题为《VISTA: A Visual Harness for Reasoning in an Interactive World》。这套方法的重点,不是重新训练一个新模型,而是让现有多模态模型能够直接观察环境、保存原始画面,并在推理过程中随时回看、放大和检查细节。

何恺明团队提出 VISTA,让多模态模型按需回看视觉历史 2

论文给出的核心思路是,尽量不把环境先压缩成文字或代码,而是保留原始视觉信息。模型在面对当前问题时,可以把过去看过的画面重新调入上下文,参与当下的判断与推理。这样一来,视觉经验不再只是一次性的输入,而成为可以反复调用、持续检查的上下文。

评测结果显示,搭配 VISTA 后,Claude Opus 5.0 完成了 ARC-AGI-3 全部 25 个公开游戏,相对人类动作效率得分达到 100,所用游戏动作数比首次游玩的人类基线少 57.4%。换成 GPT-5.6 Sol,同样完成全部 25 个公开游戏,得分达到 99。

团队还把这套方法扩展到浏览器游戏、迷宫和连线题等任务,并把更接近物理世界的具身任务列为后续研究方向。

VISTA 试图解决什么问题

从 ResNet、Mask R-CNN 到 MAE,视觉感知与表征学习一直是何恺明研究中的主线。这次,VISTA关注的是另一个问题:模型如何在持续交互中积累、保存并利用视觉经验。

论文把答案概括为 Harness。去年 11 月,Anthropic 曾以长时间编程任务为例,介绍 Harness 如何帮助模型跨越多个上下文窗口持续推进任务。它通常通过任务清单记录未完成事项,通过进度文件和代码记录已完成工作。即使模型进入新的上下文窗口,也能通过读取这些信息,知道此前做了什么、接下来该做什么。

何恺明团队提出 VISTA,让多模态模型按需回看视觉历史 3

这种主要依靠文字和代码保存任务状态的 Harness,在复杂任务分步执行、结果检查和跨上下文接续工作上已经显示出作用,也在一定程度上推动了这一波 Agent 能力的发展。

但论文指出,进入真实视觉环境后,仅靠文字记忆并不够。模型不仅要记住物体的位置和朝向,还要理解每次动作前后环境发生了什么变化。更麻烦的是,模型第一次看到一张图时,未必知道哪个细节会在后面变得重要,而这些视觉信息也很难提前用一份文字笔记完整记录下来。

在 ARC-AGI-3 这类基准中,已有一种思路是先把画面转换成由数字组成的文本网格,再让模型编写程序,模拟环境规则并验证行动方案。论文注释称,ARC-AGI-3 是一套交互式视觉推理基准,不预先提供游戏规则和目标,智能体需要通过观察和行动,自行摸索如何通关。

问题在于,环境越复杂,物体外观、空间关系和动态变化就越难被完整转成文字和代码。随着交互历史变长,早期画面也会逐渐移出上下文,或者被文字摘要替代。

因此,VISTA提出的研究问题是:在不额外训练基础模型的情况下,如何让智能体在推理需要时,重新检查过去看到的视觉信息。

何恺明团队提出 VISTA,让多模态模型按需回看视觉历史 4

视觉原生 Harness 的三项核心组件

围绕这个问题,VISTA把环境返回的每一帧原样保存在上下文之外,包括动作过程中的动画中间帧,模型需要时再取回。在 ARC-AGI-3 评测中,模型既可以比较不同时刻的画面,也可以放大局部,检查小方块上的朝向标记。

论文把这种机制称为对交互历史的显式注意力。文字笔记记录模型当前的理解,原始画面则保留供模型重新判断的证据。为了实现这一点,系统需要保存原始画面,并提供随时调取和检查的工具。

VISTA由三个核心组件组成:视觉观测、无损视觉记忆和主动视觉检查,分别负责让模型看清画面、保存历史,以及按需回看。

视觉观测

视觉观测负责把环境画面提供给模型。在 ARC-AGI-3 实验中,VISTA会把官方提供的 64×64 画面放大为 512×512 的 PNG 图像,同时保留物体颜色、外观和空间关系,让模型直接观察环境。

无损视觉记忆

无损视觉记忆负责保存模型看到的画面。每次执行动作后,VISTA都会完整保存环境返回的所有画面,包括动作过程中的动画中间帧,并按照回合号和帧号建立索引。这样,模型不必提前判断哪些信息值得记住,而是先把视觉经验完整保留下来,留待后续使用。

何恺明团队提出 VISTA,让多模态模型按需回看视觉历史 5

主动视觉检查

主动视觉检查负责让模型按需回看历史画面。通过 inspect 工具,模型可以指定某个历史回合,调出对应画面,也可以裁剪、放大局部区域,检查其中的细节。如果需要知道某次操作究竟改变了什么,模型还可以一次调出多帧画面,对比动作前后的变化。

论文把这一过程比作给模型配了一套可以随时翻阅的视觉档案。模型不仅能看到眼前环境,也能主动回看过去的观察结果,为接下来的行动提供依据。

VISTA 如何在任务中运行

按照论文描述的执行流程,每个回合开始时,模型会先观察当前画面和可用动作,再结合此前积累的经验,判断当前环境状态,并提出下一步行动的假设。

如果现有信息不足,模型可以调用工具回看历史画面、放大局部区域,甚至读取具体像素信息,继续寻找证据。找到证据后,模型不会立刻行动,而是先预测这次操作可能带来的变化。等动作执行完毕,再把实际结果与预测进行对比,检查自己的判断是否正确,并据此修正对游戏规则的理解。

论文认为,这样的循环让模型能够在持续交互中一边探索环境,一边积累经验。

为了让长时间任务保持连贯,VISTA还引入了两份文字笔记:

何恺明团队提出 VISTA,让多模态模型按需回看视觉历史 6

  • GUIDE.md:记录不同关卡之间可以复用的规则和经验。
  • WORKING.md:记录当前关卡的状态、进度和后续计划。

当上下文接近上限时,模型会先整理交接摘要,再进入新的上下文窗口继续执行任务。此前的文字笔记、动作历史和视觉档案都会保留下来。

论文还提到一个设计细节:虽然 VISTA完整保存了历史画面,但不会把所有图片一次性塞进模型上下文。在完整方案中,每次执行动作后,框架默认只向模型展示最后一帧,动作过程中的中间画面统一保存在视觉档案里,等模型需要时再主动调取。这样既保留了完整视觉信息,也避免大量历史图片持续占用上下文空间。

更关键的是,VISTA没有为此额外训练一个新模型。环境理解、行动规划和推理仍由现成多模态模型完成,Harness负责执行工具调用、保存视觉历史,并在模型需要时提供相应证据。也就是说,VISTA改变的不是模型本身,而是模型获取、保存和使用视觉信息的方式。

在 ARC-AGI-3 之外的测试结果

除开头提到的 ARC-AGI-3 实验外,团队还在 GameWorld、AI GameStore 和 BabyVision 三个基准上测试了 VISTA,覆盖浏览器游戏、迷宫和连线等任务。

在使用相同 GPT-5.6 Sol 模型的情况下,相比官方基础框架,VISTA在 GameWorld 的 170 项任务中,将成功率从 40.0% 提高到 63.3%;

何恺明团队提出 VISTA,让多模态模型按需回看视觉历史 7

在 AI GameStore 的 10 个游戏中,综合得分从 47.3 升至 140.3,其中人类中位数被归一化为 100;

在 BabyVision 选取的 39 道迷宫与连线题上,准确率从 41.0% 提高到 63.2%。论文提到,这组任务只有静态图片,模型也能通过放大局部、检查像素来改善判断。

这些结果显示,保存原始画面并让模型按需回看,能够继续挖掘现有多模态模型的能力。同一套 VISTA 框架只需少量适配,就可以用于不同游戏与谜题。论文在结论部分把未来验证方向指向更接近物理世界的具身任务,即让模型在持续变化的环境中保存、复查并利用自己的视觉经验,再决定下一步行动。

论文作者与背景

论文的三位共同第一作者为 Qiushi Han、胡珂雅和 Linlu Qiu,另外两位作者为 Cathy Wu 和何恺明。

Qiushi Han(Josh Han)目前是 MIT 运筹研究中心博士生,导师为 Cathy Wu。

何恺明团队提出 VISTA,让多模态模型按需回看视觉历史 8

胡珂雅(Keya Hu)目前是 MIT 电气工程与计算机科学系博士生,由何恺明和 Jacob Andreas 联合指导。文中介绍,她本科毕业于上海交通大学 ACM 班,研究兴趣集中在语言与视觉的交叉领域,希望构建数据效率更高、泛化能力更强的智能体。

Linlu Qiu 目前是 MIT 电气工程与计算机科学系及计算机科学与人工智能实验室的博士生,导师为 Yoon Kim 和 Jacob Andreas。其研究方向包括自然语言处理和机器学习,曾在 Google Research 及 Meta FAIR 开展研究。

Cathy Wu 目前是 MIT 土木与环境工程系、数据系统与社会研究所副教授,研究如何用机器学习和强化学习改进交通等复杂系统。她在 MIT 获得学士和工程硕士学位,随后在加州大学伯克利分校获得博士学位。

何恺明目前是 MIT 电气工程与计算机科学系终身副教授,也是 ResNet、Mask R-CNN 和 MAE 等工作的主要作者。他本科毕业于清华大学、博士毕业于香港中文大学,曾任职微软亚洲研究院和 FAIR,于 2024 年加入 MIT。

参考链接为:https://arxiv.org/pdf/2610.02200。本文来自微信公众号「量子位」,作者为 henry。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。