何恺明团队发布了一套面向多模态模型的视觉原生 Harness 框架 VISTA,论文题为《VISTA: A Visual Harness for Reasoning in an Interactive World》。这套方法的重点,不是重新训练一个新模型,而是让现有多模态模型能够直接观察环境、保存原始画面,并在推理过程中随时回看、放大和检查细节。
论文给出的核心思路是,尽量不把环境先压缩成文字或代码,而是保留原始视觉信息。模型在面对当前问题时,可以把过去看过的画面重新调入上下文,参与当下的判断与推理。这样一来,视觉经验不再只是一次性的输入,而成为可以反复调用、持续检查的上下文。
评测结果显示,搭配 VISTA 后,Claude Opus 5.0 完成了 ARC-AGI-3 全部 25 个公开游戏,相对人类动作效率得分达到 100,所用游戏动作数比首次游玩的人类基线少 57.4%。换成 GPT-5.6 Sol,同样完成全部 25 个公开游戏,得分达到 99。
团队还把这套方法扩展到浏览器游戏、迷宫和连线题等任务,并把更接近物理世界的具身任务列为后续研究方向。
VISTA 试图解决什么问题
从 ResNet、Mask R-CNN 到 MAE,视觉感知与表征学习一直是何恺明研究中的主线。这次,VISTA关注的是另一个问题:模型如何在持续交互中积累、保存并利用视觉经验。
论文把答案概括为 Harness。去年 11 月,Anthropic 曾以长时间编程任务为例,介绍 Harness 如何帮助模型跨越多个上下文窗口持续推进任务。它通常通过任务清单记录未完成事项,通过进度文件和代码记录已完成工作。即使模型进入新的上下文窗口,也能通过读取这些信息,知道此前做了什么、接下来该做什么。
这种主要依靠文字和代码保存任务状态的 Harness,在复杂任务分步执行、结果检查和跨上下文接续工作上已经显示出作用,也在一定程度上推动了这一波 Agent 能力的发展。
但论文指出,进入真实视觉环境后,仅靠文字记忆并不够。模型不仅要记住物体的位置和朝向,还要理解每次动作前后环境发生了什么变化。更麻烦的是,模型第一次看到一张图时,未必知道哪个细节会在后面变得重要,而这些视觉信息也很难提前用一份文字笔记完整记录下来。
在 ARC-AGI-3 这类基准中,已有一种思路是先把画面转换成由数字组成的文本网格,再让模型编写程序,模拟环境规则并验证行动方案。论文注释称,ARC-AGI-3 是一套交互式视觉推理基准,不预先提供游戏规则和目标,智能体需要通过观察和行动,自行摸索如何通关。
问题在于,环境越复杂,物体外观、空间关系和动态变化就越难被完整转成文字和代码。随着交互历史变长,早期画面也会逐渐移出上下文,或者被文字摘要替代。
因此,VISTA提出的研究问题是:在不额外训练基础模型的情况下,如何让智能体在推理需要时,重新检查过去看到的视觉信息。

视觉原生 Harness 的三项核心组件
围绕这个问题,VISTA把环境返回的每一帧原样保存在上下文之外,包括动作过程中的动画中间帧,模型需要时再取回。在 ARC-AGI-3 评测中,模型既可以比较不同时刻的画面,也可以放大局部,检查小方块上的朝向标记。
论文把这种机制称为对交互历史的显式注意力。文字笔记记录模型当前的理解,原始画面则保留供模型重新判断的证据。为了实现这一点,系统需要保存原始画面,并提供随时调取和检查的工具。
VISTA由三个核心组件组成:视觉观测、无损视觉记忆和主动视觉检查,分别负责让模型看清画面、保存历史,以及按需回看。
视觉观测
视觉观测负责把环境画面提供给模型。在 ARC-AGI-3 实验中,VISTA会把官方提供的 64×64 画面放大为 512×512 的 PNG 图像,同时保留物体颜色、外观和空间关系,让模型直接观察环境。
无损视觉记忆
无损视觉记忆负责保存模型看到的画面。每次执行动作后,VISTA都会完整保存环境返回的所有画面,包括动作过程中的动画中间帧,并按照回合号和帧号建立索引。这样,模型不必提前判断哪些信息值得记住,而是先把视觉经验完整保留下来,留待后续使用。

主动视觉检查
主动视觉检查负责让模型按需回看历史画面。通过 inspect 工具,模型可以指定某个历史回合,调出对应画面,也可以裁剪、放大局部区域,检查其中的细节。如果需要知道某次操作究竟改变了什么,模型还可以一次调出多帧画面,对比动作前后的变化。
论文把这一过程比作给模型配了一套可以随时翻阅的视觉档案。模型不仅能看到眼前环境,也能主动回看过去的观察结果,为接下来的行动提供依据。
VISTA 如何在任务中运行
按照论文描述的执行流程,每个回合开始时,模型会先观察当前画面和可用动作,再结合此前积累的经验,判断当前环境状态,并提出下一步行动的假设。
如果现有信息不足,模型可以调用工具回看历史画面、放大局部区域,甚至读取具体像素信息,继续寻找证据。找到证据后,模型不会立刻行动,而是先预测这次操作可能带来的变化。等动作执行完毕,再把实际结果与预测进行对比,检查自己的判断是否正确,并据此修正对游戏规则的理解。
论文认为,这样的循环让模型能够在持续交互中一边探索环境,一边积累经验。
为了让长时间任务保持连贯,VISTA还引入了两份文字笔记:

- GUIDE.md:记录不同关卡之间可以复用的规则和经验。
- WORKING.md:记录当前关卡的状态、进度和后续计划。
当上下文接近上限时,模型会先整理交接摘要,再进入新的上下文窗口继续执行任务。此前的文字笔记、动作历史和视觉档案都会保留下来。
论文还提到一个设计细节:虽然 VISTA完整保存了历史画面,但不会把所有图片一次性塞进模型上下文。在完整方案中,每次执行动作后,框架默认只向模型展示最后一帧,动作过程中的中间画面统一保存在视觉档案里,等模型需要时再主动调取。这样既保留了完整视觉信息,也避免大量历史图片持续占用上下文空间。
更关键的是,VISTA没有为此额外训练一个新模型。环境理解、行动规划和推理仍由现成多模态模型完成,Harness负责执行工具调用、保存视觉历史,并在模型需要时提供相应证据。也就是说,VISTA改变的不是模型本身,而是模型获取、保存和使用视觉信息的方式。
在 ARC-AGI-3 之外的测试结果
除开头提到的 ARC-AGI-3 实验外,团队还在 GameWorld、AI GameStore 和 BabyVision 三个基准上测试了 VISTA,覆盖浏览器游戏、迷宫和连线等任务。
在使用相同 GPT-5.6 Sol 模型的情况下,相比官方基础框架,VISTA在 GameWorld 的 170 项任务中,将成功率从 40.0% 提高到 63.3%;

在 AI GameStore 的 10 个游戏中,综合得分从 47.3 升至 140.3,其中人类中位数被归一化为 100;
在 BabyVision 选取的 39 道迷宫与连线题上,准确率从 41.0% 提高到 63.2%。论文提到,这组任务只有静态图片,模型也能通过放大局部、检查像素来改善判断。
这些结果显示,保存原始画面并让模型按需回看,能够继续挖掘现有多模态模型的能力。同一套 VISTA 框架只需少量适配,就可以用于不同游戏与谜题。论文在结论部分把未来验证方向指向更接近物理世界的具身任务,即让模型在持续变化的环境中保存、复查并利用自己的视觉经验,再决定下一步行动。
论文作者与背景
论文的三位共同第一作者为 Qiushi Han、胡珂雅和 Linlu Qiu,另外两位作者为 Cathy Wu 和何恺明。
Qiushi Han(Josh Han)目前是 MIT 运筹研究中心博士生,导师为 Cathy Wu。

胡珂雅(Keya Hu)目前是 MIT 电气工程与计算机科学系博士生,由何恺明和 Jacob Andreas 联合指导。文中介绍,她本科毕业于上海交通大学 ACM 班,研究兴趣集中在语言与视觉的交叉领域,希望构建数据效率更高、泛化能力更强的智能体。
Linlu Qiu 目前是 MIT 电气工程与计算机科学系及计算机科学与人工智能实验室的博士生,导师为 Yoon Kim 和 Jacob Andreas。其研究方向包括自然语言处理和机器学习,曾在 Google Research 及 Meta FAIR 开展研究。
Cathy Wu 目前是 MIT 土木与环境工程系、数据系统与社会研究所副教授,研究如何用机器学习和强化学习改进交通等复杂系统。她在 MIT 获得学士和工程硕士学位,随后在加州大学伯克利分校获得博士学位。
何恺明目前是 MIT 电气工程与计算机科学系终身副教授,也是 ResNet、Mask R-CNN 和 MAE 等工作的主要作者。他本科毕业于清华大学、博士毕业于香港中文大学,曾任职微软亚洲研究院和 FAIR,于 2024 年加入 MIT。
参考链接为:https://arxiv.org/pdf/2610.02200。本文来自微信公众号「量子位」,作者为 henry。

