← 返回 2026-07-23

面向主动观察能力的多模态大模型评测基准 ActiveVision An Exam for Active Observers

Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger 📅 2026-07-17 👍 25 2026-07-28 18:30
主动视觉 多模态大模型 智能体工具调用 视觉感知 视觉评测基准

ActiveVision:测试 MLLM 能否反复回到图像中验证假设的视觉推理基准

前置知识

主动观察 / Active Observation

人类视觉是一个闭环系统:注视点不断被中间假设重新引导,而非一次性快照。例如要数清一张图里的全部目标,我们需要“注视—预测—返回”的迭代循环。几十年心理物理学和认知科学(如 Yarbus 的眼动研究、Ballard 的 animate vision、O'Regan 的 sensorimotor 观点)都表明这种主动观察对很多任务是必不可少的。在计算层面,它意味着推理过程中要不断回到原始像素去形成、检验并修正假设。

这是本文要测量并“变成一个数字”的核心能力,理解它才能明白为什么现有的一次性视觉 token 编码范式不够。

多模态大语言模型(MLLM)

指能同时处理图像和文本的大语言模型,如 GPT-5.5、Claude Fable 5、Claude Opus 4.8、Gemini 3.1 Pro、Gemini 3.5 Flash 等。当前主流架构把图像编码成一串固定的视觉 token,再送入 LLM 做自回归推理。这种“图像编码一次、后续纯推理”的方式让模型在结构上像被动感知者,没有显式的感知—行动闭环,尽管自回归推理中模型可能靠注意力在 token 间漂移来近似这种闭环。

本文诊断的就是这些前沿 MLLM 在主动视觉任务上的表现,需要先了解它们的工作方式才能读懂评测结论。

感知—推理闭环(Perception–Reasoning Loop)

完整的视觉推理应包含感知与推理交替进行:早期的视觉发现指导后续步骤,后续假设又反过来要求重新审视图像。当前 MLLM 把图像压成静态 token 序列后,依赖注意力在 token 间漂移近似闭环,但论文强调这是“行为问题而非架构问题”——关键不在有没有闭环架构,而在模型是否真的会回到像素去检验假设。

论文的核心论点正是“问题在行为而非架构”,理解闭环概念才能抓住基准设计的意图和评测解释。

推理强度档位(Reasoning Effort)

GPT-5.5、Claude 等模型在 API 中暴露了不同推理强度档位(none/min/low/med/high/xhigh/max),档位越高模型可以“思考”越久,消耗更多输出 token 与费用。论文把每个模型放在全部档位下评测,单题费用从约 $0.01 到 $1 不等,目的是排除“推理不够”这一解释。

论文关键消融之一是“加大推理强度几乎不缩小人机差距”,需要先理解 reasoning effort 才能看懂这个结论。

智能体工具调用(Agentic Tool Use)

指模型不仅推理,还能编写并运行代码来解决问题,如调用 OpenCV 的 findContours、Canny 边缘检测、模板匹配、连通域分析、flood-fill 等经典计算机视觉原语。论文测试了 Codex(GPT-5.5)和两个 Claude Code agent(分别基于 Opus 4.8 与 Fable 5),它们在只含图像和问题的沙箱里写并执行自己的视觉处理代码,把感知负担部分转嫁给经典 CV 算法。

论文最重要的消融是检验“工具调用能否替代主动观察”,结论是只能部分替代且把瓶颈转移到验证环节。

研究动机

当前主流多模态大语言模型(GPT-4 家族以来的 GPT-5.5、Claude Fable 5、Gemini 3.1 Pro 等)在 MMMU-Pro、CharXiv 等多模态基准上的表现已逼近饱和,前沿模型之间几乎拉不开差距,给人“视觉语言理解已被解决”的错觉。然而机器人操作、CAD 设计、制造业质检、计算机操作、空间理解、科学发现等真实应用,都要求模型在推理过程中反复回到视觉证据上去形成、检验、修正假设,而现有评测几乎不测量这种能力。公共排行榜仍被图像描述、单图 VQA、多选题主导,这些任务往往从对图像的一次性静态描述就能答出。问题本质在于:现有 MLLM 是被动感知者,把图像一次性编码成固定 token 序列、没有显式感知—行动闭环;而现有视觉中心基准要么已饱和,要么只刻画人机差距却不隔离缺失的具体能力,应用型基准又把编码、推理、视觉感知混在一起、失败无法归因到感知。

本文的目标是论文要把“主动观察”这一抽象认知主张变成一个可量化、可被未来架构和训练目标问责的数字。具体目标包括:第一,构建一个受控基准,包含 17 个任务、覆盖主动视觉的三个认知维度,迫使模型反复进行视觉感知而非一次性静态描述;第二,在每个模型全部推理强度档位下系统评测前沿 MLLM;第三,作为工具使用测试,评测基于这些模型的自主编码 agent;第四,把残余失败追溯到独立于推理和工具的感知瓶颈,从而把主动视觉定位为当前模型缺失但真实应用必需的独立能力。基准规模为 17 个生成器各采样 $N=5$ 实例共 85 题,并附三人人类基线作为参照。

与已有工作不同的是,已有三类视觉基准都有盲区。第一类(MMVP、MMStar、CV-Bench)致力于把视觉感知从语言先验中隔离,但如今已饱和,仍未测量“迭代观察循环”这一剩余短板;第二类(BLINK、BlindTest、ArtQA、BabyVision、ChildBench、KidGym)以人机差距为框架,证明模型不如人却不隔离缺失的具体能力;第三类(OSWorld、BenchCAD)是应用驱动,但每个任务把编码、推理、视觉感知打包在一起,失败无法归因。本文的独特切入是:明确把“主动视觉”识别为缺失能力的主体并为其单独设计可测量的任务;同时让所有任务实例都携带“超过任何单一语言描述所能无损承载”的判别性视觉状态,使迭代感知成为唯一自然解法;并用照片级真实渲染贴近真实部署场景,而非玩具化卡通图。

核心方法

直觉上,作者把“主动观察”具象化为人类视觉的三个基本操作:超出瞬间计数(subitizing)范围的穷举枚举、沿轮廓的曲线追踪、视觉工作记忆限制下的精细比较——心理物理学和神经生理学都把这些操作刻画为串行、需注意、靠反复眼动完成的例程。技术路线上,ActiveVision 把这三个操作实例化为三个任务族共 17 个生成器:Distributed Scanning(分布式扫描)、Sequential Traversal(序列遍历)、Visual Attribute Transfer(视觉属性迁移)。每个生成器从一个确定性种子产出合成脚手架、问题和真值答案;再用 GPT-image-2 把抽象脚手架重渲染为照片级真实图像,只把渲染后的真实图喂给模型评测。整个设计围绕一条原则:每道题携带的判别性视觉状态的信息量超过任何一句语言描述所能无损承载。

核心创新点是这条“强制迭代感知”的设计原则及其三种实现属性。它与已有方法的本质区别在于:以往视觉基准靠“排除可从文本答出的题目”来奖励读图,而本文进一步要求“读图后还必须反复回到像素”。三种属性是:其一,任意位置(arbitrary positions)——元素放在连续采样坐标而非网格或命名锚点上,20 个点的散布携带 $\binom{20}{2}=190$ 对空间关系和 20 对实值坐标,远超一句语言摘要;其二,任意形状(arbitrary shapes)——区域边界、轮廓、剪影、纹样都为每个实例重新合成,半径由随机数量的傅里叶谐波(采样振幅与相位)调制的闭合等值线,或穿过抖动环形路径点的周期样条,轮廓空间连续且高方差,没有两个实例重复同一形状;其三,任意轨迹(arbitrary traces)——路径、箭头链、缠结环、穿色区的连接曲线都是过采样控制点的平滑随机样条,有数十个有意义拐点。这三条共同让“一次性压缩图像再在摘要上推理”的捷径失效。

方法步骤详情

评测流程分四步。第一步,每个任务生成器用确定性 Python 函数(creation.py)从一个随机种子产出几何脚手架:例如缠环节点数 $n \sim \mathrm{Uniform}(10, 16)$ 条随机平滑闭合曲线,并附完整真值。第二步,针对该任务的 GPT-image-2 提示把过程性原语映射到真实场景:Voronoi 区域变成航拍田野和河流,箭头链变成脚印串连的石头,缠结环变成浮木上的绳子,提示明确要求“保留每个环、遵循精确路径、正确处理上下交叉、不增不减”。第三步,只把照片级真实图连同逐字问题作为单条用户消息发给模型,无系统提示,要求把最终答案包在 标签里;评分取最后一个此类块做精确匹配(归一化大小写、空白、分隔符后)。每个生成器采样 $N=5$ 实例共 85 题,主评测用纯思维链、无外部工具。第四步,人类基线由 3 名参与者通过自定节奏网页界面独立完成全部 85 题,用同一标准评分,每人耗时约 31–69 分钟。消融阶段另跑推理强度全档位与三个自主编码 agent。

技术新颖性

新颖性有三层。其一,理论锚定:不像以往凭直觉出题,本文从心理物理学的“穷举枚举、曲线追踪、工作记忆下精细比较”三个有据操作出发设计任务族,使每个任务对应一个被神经生理学刻画为串行注意例程的认知能力,并据此定义典型的失败模式(部分覆盖、格式塔插值、先验替代)。其二,生成管线的两阶段设计:确定性脚手架保证精确真值与可控结构,照片级重渲染消除“卡通输入”混淆并贴近真实图像噪声——这正是经典视觉算法(findContours、Canny、模板匹配)急剧退化的场景,所以同一组图既测 MLLM 也约束了工具脚本的上限。其三,抗捷径的构造性保证:通过任意位置/形状/轨迹三属性从数学上排除“先压成一句语言描述再作答”的可能;同时答案在宽范围内扁平分布,防止“众数答案”或“任务身份”成为可靠捷径。

Overview of all 17 tasks in ActiveVision.
Figure 2: Overview of all 17 tasks in ActiveVision.
The four-stage generation pipeline, illustrated on Tangled Loop Counting.
Figure 3: The four-stage generation pipeline, illustrated on Tangled Loop Counting.

实验结果

论文的核心发现可分四点,每个都有具体数字支撑。第一,主结果:六个前沿模型在最高推理强度下几乎全失败。最强模型 GPT-5.5 xhigh 仅解 9/85 = 10.6%,且在 17 个任务中 11 个得 0 分;Claude Fable 5(推理和编码榜单第一)仅 3/85 = 3.5%;Claude Opus 4.7 max 4/85 = 4.7%、Opus 4.8 max 2/85 = 2.4%、Gemini 3.1 Pro high 5/85 = 5.9%、Gemini 3.5 Flash high 7/85 = 8.2%。三人人类基线均分 96.1%(个体 94.1%/96.5%/97.6%),约为最强模型的九倍;六个模型的成功集合几乎不重叠,没有任何一题被六个模型同时解出。第二,捷径检验:GPT-5.5 仅给问题不给图的对照只解 2/85 = 2.4%,与同 none 档带图运行一致,说明提示先验解释不了这点成绩。第三,加大推理几乎无用:把 GPT-5.5 从 none 推到 xhigh,单题费用涨近百倍但准确率只从 2.4% 升到 10.6%;Fable 5 单题多花 31 倍费用,差距仍在 85 题采样噪声内。第四,失败行为有规律:计数任务中模型是保守计数器,预测值对真值的最小二乘斜率仅 0.44–0.69,真值越大漏计越多(Figure 5);三个有序走步任务中前一两步存活率就崩塌,18 次运行池里没有一条走步被完整无误完成(Figure 6);差异比对任务中漏报率高达 73%–100%、误报率却接近 0%,模型把“相同”当安全默认(Table 3)。工具调用方面,最强 agent Claude Code (Fable 5) 解 43/85 = 50.6%、Codex 32/85 = 37.6%、Opus 4.8 agent 21/85 = 24.7%,但每题耗时 12–15 分钟、花费 $2.74–$7.63,约为人类的 25 倍,且三个 agent 在 Tangled Loop Counting 上全部 0/5。

The 17 task generators in ActiveVision, grouped by cognitive axis.
Table 1: The 17 task generators in ActiveVision, grouped by cognitive axis.
Per-task exact-match accuracy on ActiveVision.
Table 2: Per-task exact-match accuracy on ActiveVision.
Per-run miss and false-alarm rates on the difference tasks.
Table 3: Per-run miss and false-alarm rates on the difference tasks.
Accuracy and mean per-item resource use on the 85-item split.
Table 4: Accuracy and mean per-item resource use on the 85-item split.
Accuracy versus API cost per item (log scale) on the 85-item ActiveVision split.
Figure 4: Accuracy versus API cost per item (log scale) on the 85-item ActiveVision split.
Predicted versus ground-truth counts across eight counting tasks.
Figure 5: Predicted versus ground-truth counts across eight counting tasks.
Agentic tool use on the 85-item ActiveVision split.
Figure 7: Agentic tool use on the 85-item ActiveVision split.
查看结构化数据
任务指标本文基线提升
ActiveVision 85 题(纯思维链) exact-match 准确率 最强模型 GPT-5.5 xhigh 10.6%(9/85);其余前沿模型 2.4%–8.2% 人类三人均分 96.1%(81.7/85) 最强模型仍落后人类约 85.5 个百分点(约 9 倍)
ActiveVision 85 题(智能体工具调用) exact-match 准确率 最强 agent Claude Code (Fable 5) 50.6%(43/85) 人类 96.1% 工具把最强结果从 10.6% 抬到 50.6%,但耗时约 25 倍、仍远低于人
Tangled Loop Counting(缠环节计数) 5 题正确数 所有三个 agent 均 0/5,所有纯 CoT 模型 0/5 人类 5/5 该任务对所有系统零分,凸显不可归约的感知瓶颈
推理强度消融(GPT-5.5 none→xhigh) exact-match 准确率 从 2.4% 升到 10.6%(单题费用增约 100 倍) 费用近百倍换 8.2 个百分点,边际收益极低

局限与改进

作者承认的局限主要有两点。其一,图像仍是合成的:GPT-image-2 是按受控提示生成“看起来真实”的输出,并非自然图像分布的真实样本,作者用这一点换取了精确真值与可控结构,因此外部效度落在任务测量的基本视觉操作(扫描、追踪、比较)而非渲染本身。其二,任务被设计成“无短语言描述能承载答案”,但随着模型描述图像的能力增强,这一抗捷径性质可能被侵蚀,未来版基准需要不断收紧。我自己的观察:85 题规模偏小,每个任务仅 5 例,准确率以 20% 为粒度,不同推理档位间的差异常落入采样噪声;人类基线只有 3 人,难以刻画人类方差;任务虽贴近真实但场景类型仍由渲染提示限定,与医疗、卫星、显微等真实多源噪声分布可能存在系统差异;评测接口封闭(只给整图、禁止裁剪放大),可能把“没有闭环架构”与“接口不允许闭环”混淆。

独立分析的弱点

第一,样本规模与粒度:85 题、每任务仅 5 例意味着准确率粒度 20%,许多前沿模型在同一任务的 0/5 与 1/5 之间无法可靠排序,推理强度消融的结论部分被噪声掩盖。改进方向:扩到每任务 50–100 例并用 bootstrap 报告置信区间,同时做显著性检验。第二,人类基线单薄:仅 3 人难以代表人类方差,也没报告参与者的视觉任务专业度。改进方向:招募更多被试并区分普通成人、放射科医生、校对员等专家群体,刻画“主动观察”随专长变化的曲线(论文本身引用眼动研究称“专长就是知道看哪里”)。第三,真实噪声差距:渲染虽照片级但仍由单一提示模板驱动,与真实低分辨率手机快照、扫描文档、超声散斑的多源噪声有系统差。改进方向:在真实图像子集上对部分任务做小规模复测,验证合成结论的可迁移性。第四,评测接口过于封闭:只给图加问题、禁止局部裁剪/放大,对人类专家也不利。改进方向:增加允许模型主动请求局部高分辨率裁剪或“注视点”的接口,直接测量“眼动式”机制,从而区分“模型不会闭环”与“接口不许闭环”。

未来方向

作者明确提出的方向有二:把 agent 视觉问题求解作为独立赛道留给未来专项基准;并随模型描述能力增强不断收紧任务以维持抗捷径性质。基于成果可延伸的方向包括:其一,构建带显式注视/裁剪动作空间的“主动 MLLM”架构并在 ActiveVision 上验证,这正是论文结论呼吁的“闭合感知—推理闭环”的直接落地;其二,把心理物理学的扫视、追踪、比较操作纳入预训练或后训练的视觉目标,构造对应的合成数据课程;其三,向真实高 stakes 场景延伸,如胸片结节检出(作者引用约 30% 漏诊结节从未被注视)、连接组学中沿电子显微镜体追踪神经突、潜指纹比对与病理比对,建立带专业标注的迁移评测;其四,针对 agent 失败模式,研究“视觉自验证”机制,让模型学会把刚生成的掩膜叠加回原图做合理性检查。

复现评估

复现门槛中等偏高、计算成本低。论文首页给出 Website、GitHub、Dataset 三个链接,85 题官方 split 已发布,manifest 含逐字问题与真值,评分规则(取最后一个 块、归一化大小写/空白/分隔符后做精确匹配)描述清晰。复现主结果只需调用各模型 API、无须训练、无需 GPU;每个生成器由确定性种子产出,理论上可无限扩展实例,复现者可自验生成管线。主要成本在 API 费用与时间:推理强度消融每个模型跑全档位,单题费用从约 $0.01 到 $1;agent 测评更贵也更慢——三个 agent 总计花费 Codex $232.63、Claude Code (Opus 4.8) $359.90、Claude Code (Fable 5) $648.63,每题耗时 12–15 分钟、34–53 次工具调用、上万输出 token;相比之下人类基线每题仅 0.56 分钟、零工具零代码。主要风险点是 GPT-image-2 的渲染结果可能随版本变化,复现照片级图像需固定模型版本与提示。