VISTA发布:给多模态模型装上"长时程视觉",ARC-AGI-3满分通关
一、当”看”成为智能体的短板:ARC-AGI-3的残酷现实
过去两年,多模态大模型的感知能力突飞猛进——它们能读懂图片、转写音频、甚至实时视频对话。但一旦进入交互式视觉环境(需要边看边决策、边行动边推理的场景),前沿模型的表现却屡屡令人失望。
MIT 在 ARC-AGI-3 基准上揭示了这一痛点。ARC-AGI-3 是一套交互视觉游戏集合:智能体必须在完全陌生的规则下,通过不断观察屏幕反馈来发现规律并达成目标。传统做法把这个问题当成”语言问题”处理——给 LLM 一份环境文本化、结构化的描述(比如网格坐标矩阵),让它用世界模型在脑内推理。结果呢?官方基线下,GPT-5.6 Sol 仅拿到 13.33 的 Relative Human Action Efficiency (RHAE) 分,Claude Opus 5.0 高努力模式也只有 40.68。
这个数字意味着:即便用最前沿的模型,让它在陌生视觉世界里”靠推理找规则”,表现还不如一个第一次上手的人类玩家。问题不在模型不够聪明,而在于它失去了对原始视觉证据的直接访问权——文本化过程把宝贵的空间线索、颜色、相对位置全部压扁成了符号。
二、VISTA 的核心思想:把”看”还给模型
针对这一症结,MIT 团队(含 Kaiming He 组)提出了 VISTA——一个面向交互世界的视觉智能体框架(Visual Harness for Reasoning in an Interactive World)。它的理念朴素却深刻:不要让模型靠脑补推理,而是让它始终看着真实画面行动。
VISTA 的关键设计有三点:
- 无损视觉记忆(Lossless Visual Memory):环境帧被原样保存为视觉记忆,而非转写为文本摘要。模型在推理时可以随时回看最初的证据,保留每一个细节级别的信息。
- 主动检索与重组:模型能够主动从记忆中调取历史观测,并根据当前任务重新组织视觉输入——不是被动接收,而是主动”翻旧账”。
- 极简工具集:VISTA 只给模型两个核心能力——
inspect(检查环境)和read_pixels(读取像素)。它刻意不做文本化的世界模型,把理解环境的责任交还给多模态模型本身。
这种”少即是多”的设计正是 VISTA 的聪明之处:它没有堆砌复杂的符号系统,而是用最小的干预解锁了现有模型的潜力。
三、技术剖析:为什么极简框架能创造奇迹
VISTA 在 ARC-AGI-3 上的成绩堪称震撼——无需任何程序合成(program synthesis),仅靠视觉 harness 就让模型达到满分:
| 系统 | 是否编程 | 模型 | 努力程度 | RHAE |
|---|---|---|---|---|
| 官方实现(最小 harness) | 否 | GPT-5.6 Sol | max | 13.33 |
| 官方实现(最小 harness) | 否 | Opus 5.0 | high | 40.68 |
| Schema(含编程) | 是 | Opus 4.8 → Fable 5 | max | 98.98 |
| VISTA | 否 | GPT-5.6 Sol | max | 99.00 |
| VISTA | 否 | Opus 5.0 | xhigh | 100.00 |
最引人注目的是:VISTA 让 Claude Opus 5.0 从 40.68 直接跃升到满分 100.00,完成全部 25 个公开关卡,且动作数量比首次上手的人类玩家少 **57.4%**(人类需 17,135 次动作,VISTA 仅用 7,302 次)。这是迄今首个无需程序合成即在 ARC-AGI-3 达到满分或接近满分的视觉系统。
更值得玩味的是效率维度。RHAE 衡量的不是”能不能通关”,而是”是否比人类更高效”。VISTA 用 57.4% 更少的动作完成同样的任务,说明它真正理解了环境规则,而非靠暴力试错。
开源复现:GLM-5.3 Flash 也能打
VISTA 的另一个亮点是模型无关性。团队用它接入了开源权重模型 GLM-5.3 Flash 320B,构建出完全可复现的开源系统。在 GLM-5.3 Flash 下,VISTA 仍能达到 66.93 的 RHAE,大幅超越其最小 harness 基线。这意味着视觉框架的价值不绑定任何闭源模型——开源社区同样能从中受益。
代码视角:harness 如何运作
虽然 VISTA 是研究框架而非开箱即用的库,但其核心逻辑可抽象为以下流程:
1 | # VISTA 交互循环的伪代码示意 |
与 Schema、Retrodict 等需要程序合成的系统不同,VISTA 的简洁性使其能快速迁移到游戏世界之外的场景——团队已在 GameWorld(34 个浏览器游戏)、AI GameStore(10 个游戏)和 BabyVision(39 个视觉追踪问题)上验证了其泛化能力。
四、影响与未来展望:智能体的竞争重心正在转移
VISTA 的意义远超一个基准成绩,它指向三个深层趋势:
第一,”harness 即产品”成为新赛道。 当模型能力趋于同质化,真正拉开差距的不再是模型本身,而是如何调度、记忆和检索信息的环境框架。VISTA 与 Sakana 的 Fugu(把多智能体封装成一个模型)、Meta 的 Muse(运行时即产品)一脉相承——编排与上下文管理正在成为比算力更稀缺的资源。
第二,视觉而非文本才是交互世界的原生语言。 当 ARC-AGI-3 这类任务本质是空间推理时,把环境压扁成文本矩阵是一种信息损失。VISTA 证明:让模型直接”看”原始像素,配合无损记忆,反而比精巧的符号世界模型更强大。这对具身智能(embodied AI)、机器人操作、自动驾驶等需要实时视觉反馈的领域具有启发意义。
第三,开源生态获得可复现的前沿基线。 GLM-5.3 Flash 的成功接入表明,视觉 harness 技术不依赖闭源黑箱。随着 Qwen3.8-Omni、Gemini 4 Argon 等原生多模态模型的涌现,VISTA 这类框架将成为连接”聪明模型”与”真实交互任务”的关键桥梁。
当然,VISTA 目前仍聚焦于游戏和谜题这类相对结构化的环境。如何将其扩展到更接近物理世界的具身任务(如机器人操作、家庭服务),仍是未解之谜。但它的核心洞察已经清晰:在智能体时代,让模型”看得见、记得住、翻得出”,或许比让它”想得更深”更为根本。
当 GPT-5.6 和 Opus 5 还在单点冲刺峰值能力时,VISTA 告诉我们:真正的智能,可能藏在如何管理信息与记忆的架构设计里。这不仅是 MIT 的一份研究成果,更是多模态智能体从”能看”走向”会思考”的一块关键拼图。
