MNIST-PRO:作为 AI 智能体部分可观测世界的 MNIST 基准 MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents
将 MNIST 改造为部分可观测探索任务,暴露多模态智能体感知状态构建的三大瓶颈
前置知识
POMDP(部分可观测马尔可夫决策过程)
一种序贯决策框架,智能体无法直接观测环境的真实状态 $s_t$,每步只收到由观测函数 $\Omega$ 给出的局部观测 $o_t$,需要基于历史 $(o_0, a_0, \ldots, o_t)$ 维护信念状态来做决策。完整定义为 $\langle S, A, T, \Omega, R \rangle$:状态空间、动作空间、转移函数、观测函数与奖励。本文将 MNIST-PRO 形式化为 POMDP,状态是 $s_t = (I, p_t)$(隐藏画布 + 窗口坐标),观测是屏蔽掉窗口外像素的图像。
第 2.1 节是全文的形式化基础,动作空间、步数预算 $T_{max}$ 的推导都建立在 POMDP 记号上,不懂它就无法理解任务的严格定义。
感知状态(Perceptual State)
智能体在部分可观测环境中维护的、对世界真实状态的运行估计,记为 $z_t = F_\theta(z_{t-1}, o_t, p_t)$,即每步把新瞥视与旧状态融合。它可以是原始视觉历史、文字笔记、坐标地图或拼合画布等不同表示。本文进一步把预测分解为 $H_\theta = D_\theta \circ R_\theta$:$R_\theta$ 负责从状态中读出信息(解读),$D_\theta$ 负责产出最终决策。
感知状态的构建与解读正是本文要隔离测量的对象,全文的所有实验设计(记忆消融、画布重放、预测器交换)都服务于把 $F_\theta$ 和 $R_\theta$ 的失败区分开。
主动感知(Active Perception)
与被动识别相对:智能体主动控制传感器(视线、摄像头、窗口)的位置来获取有信息量的观测,经典源头是 Bajcsy 等人的主动视觉。主动视觉强调"控制感知以获得信息",可视为本文所说 agentic perception 的一个子组件;后者还要求把获取的证据整合进持久状态并据此决策。
MNIST-PRO 的本质就是把被动识别改造成主动感知任务,理解这一范式才能明白为什么全观测下近满分的模型在窗口探索中会崩溃。
视觉回望(Visual Lookback, H)
指多轮对话上下文中允许保留的历史瞥视帧数量:$\mathcal{H} = \infty$ 表示所有历史帧都可见,$\mathcal{H} = 1$ 表示零回望——模型只看到当前帧,必须完全依靠自己写下的文字/结构化记忆来延续探索。这是本文的关键控制变量,可取 $1, 2, 4, \infty$。
零回望约束强制暴露"记忆写入通路",是区分四种记忆表示(原始历史、文本状态、网格地图、画布)的核心机制,表 7 的消融也围绕它展开。
路径积分(Path Integration)
源自机器人与神经科学的术语:不依赖外部参照,仅通过累积自身的位移增量来估计当前位置。本文的 Metric Grid Map 配置要求模型做在上下文中的路径积分:$\mathbf{x}_t = \mathbf{x}_{t-1} + \Delta(a_{t-1})$,其中 $\Delta$ 是四向移动的单位位移向量,并把每个坐标处看到的特征写成结构化 JSON。
这是最复杂的一种内部状态表示,论文用它检验模型能否维护几何一致的空间记忆,表 5 显示它能大幅降低重访率(45.1% → 13.6%)。
研究动机
现有基准都无法隔离"感知状态构建"这一能力。被动多模态基准(MMBench、MMMU、SEED-Bench 等)在提问时就把完整视觉输入一次性交给模型,完全不要求模型在推理过程中主动收集或筛选视觉证据。主动控制基准(ActiView、ActiveVision)虽然要求模型迭代获取多帧观测,但默认模型可以把所有历史瞥视无限制地留在上下文里,因此无法区分"真正维护了连贯的任务相关状态"与"只是反复回看低层视觉历史"这两种截然不同的行为。具身 3D 基准(如 ALFRED)虽然需要序贯决策,但模拟导航和物体交互会引入碰撞、抓取失败等低层执行噪声,把感知、记忆、规划、控制的失败混在一起无法归因。与此同时,SOTA 视觉语言模型在全观测 MNIST 上已接近满分(本文控制组 83%-99%),给人"视觉感知已解决"的错觉。
本文的目标是构建一个最小、可控的基准 MNIST-PRO,把经典 MNIST 数字识别改造成顺序的、基于瞥视窗口的搜索任务:模型只能通过 64×64 像素的窗口观察 224×224 的图像,必须决定窗口往哪移动、在有限的视觉回望约束下记住看过什么、并判断何时证据充分可以作答。由于底层识别能力被控制到接近满分,任何性能损失都可以干净地归因于部分可观测性本身。论文围绕四个研究问题展开(RQ1-RQ4):多模态智能体能否从顺序局部观测构建有效感知状态?状态表示如何影响表现?能力如何随空间/时间需求扩展?智能体能否合理分配感知预算并判断何时该停止探索?
与已有工作不同的是,本文的独特切入是三重控制。其一,刻意选用模型极熟悉的 MNIST 域:动作语义已知、规则明确,与 ARC-AGI-3 那种规则未知、需靠探索推断动态的环境相反,从而保证失败反映的是感知能力而非任务理解。其二,首次系统化消融感知状态的表示形式——原始视觉历史($\mathcal{H}=\infty$)、自由文本状态($\mathcal{H}=1$)、结构化度量网格地图($\mathcal{H}=1$)、程序化拼合的视觉画布(在线/离线两种模式)——并用"离线画布重放"和"预测器交换"这类反事实实验,把证据采集、状态构建、状态解读三个环节解耦,这超越了以往基准只报告任务成功率的做法。其三,提供重访率、笔画覆盖率、探索步数等过程级诊断指标,而不只看最终对错。
核心方法
直觉上,这相当于把模型的"眼睛"蒙住,只留一个 64×64 像素的小窗去看一幅 224×224 的二值数字图:模型必须自己决定窗口往上下左右哪边移(步长 $\delta = 32$ 像素)、把看到的内容存进记忆、并在耗尽步数预算前给出答案。形式化为 POMDP:状态 $s_t = (I, p_t)$ 由静态画布和窗口坐标组成;观测函数 $\Omega$ 只显示窗口 $[x_t, x_t+w) \times [y_t, y_t+h)$ 内的像素,其余一律屏蔽为灰色;动作空间 $\mathcal{A} = \mathcal{A}_{move} \cup \mathcal{A}_{predict}$,移动按 $p_{t+1} = \mathrm{clip}(p_t + \delta \cdot u(a_t))$ 更新,预测动作终止回合。任务分两级:Level 1 是单数字(步数预算 $T_{max} = 36$),Level 2 把两个数字水平拼接成 224×448 的画布(预算 78 步),要求按顺序输出如 "58"。数据预处理:灰度反转使笔画为黑、背景为白,双线性上采样到 224×224,再以阈值 200 二值化。每级 100 个测试回合,共评测 10 个模型。
核心创新是把"识别难度"与"感知难度"解耦:全观测控制组下模型识别准确率高达 83%-99%,因此部分可观测设置中的任何失败都只能来自主动感知本身——证据采集、状态构建或状态解读。围绕这一点,论文设计了记忆表示的系统消融:(1) Image Only 基线($\mathcal{H}=\infty$),提供全部历史瞥视加文字动作日志,不要求写状态;(2) Textual State($\mathcal{H}=1$),零视觉回望,模型每步必须输出自由文本"想法"作为唯一持久记忆;(3) Metric Grid Map($\mathcal{H}=1$),在文本之上强制输出坐标锚定的结构化空间地图,通过路径积分 $\mathbf{x}_t = \mathbf{x}_{t-1} + \Delta(a_{t-1})$ 维护几何一致的状态;(4) 视觉记忆画布,由环境程序化地把历史瞥视按坐标拼成一张图 $C_t$,分在线(每步更新并展示)与离线(探索结束后重放构建)两种。配合预测分解 $H_\theta = D_\theta \circ R_\theta$,就能定位失败究竟发生在采集、构建还是解读环节。
方法步骤详情
完整流程:回合开始时环境随机暴露一个 64×64 窗口作为 $o_0$;每步模型根据当前观测与所配置的记忆形式输出 JSON(thought、action,Grid Map 下还有 spatial_map);移动动作按 $p_{t+1} = \mathrm{clip}(p_t + \delta \cdot u(a_t))$ 更新窗口坐标,预测动作终止回合,步数超出 $T_{max}$(L1 为 36 步、L2 为 78 步)也强制终止。Grid Map 额外要求坐标锚定($\mathbf{x}_0 = [0,0]$)与逐步路径积分,历史的"坐标-特征"对隐式累积在上下文中。在线画布条件下,环境每步后按 $C_t(u,v)$ 公式把新瞥视叠加到坐标对齐的画布上,模型同时收到画布与最新瞥视两张图;离线画布则先让模型在 Image Only 或 Textual State 下自由探索,再重放轨迹、程序化拼图,仅用于最终预测——轨迹固定,只改变表示。评测指标包括控制准确率(全观测上限)、部分可观测分类准确率与平均步数,诊断指标有重访率 $RR_T = R_T/M_T$ 与笔画覆盖率 $C_T = |S \cap V_T|/|S|$。另设 harness 实验:给 GPT-5.6-Terra 与 Gemini-3.7-Flash 文件读写、代码执行等工具及跨回合持久记忆,考察其能否自主发现"拼画布"类策略。
技术新颖性
与最相关工作的本质区别有三点。第一,以往主动感知基准(ActiView、ActiveVision、V*)隐式假设模型可无限制回看所有历史帧,本文首次引入可控视觉回望 $\mathcal{H} \in \{1, 2, 4, \infty\}$,把"如何写记忆"变成硬约束而非可选项,从而能测出纯状态构建能力。第二,2D 二值画布剔除了 3D 具身环境的物理噪声与渲染复杂度,使探索覆盖可以被精确度量,失败可以被精确归因——这是 ALFRED 类环境做不到的。第三,方法学上的反事实设计很干净:离线画布重放固定轨迹只换表示,预测器交换(用 Gemini-3.7-Flash 替换 GPT-5.6-Sol(xhigh) 去解读同一张画布)固定证据只换解释器,把"同一份证据在不同模型手里的解读差异"量化出来(Level 1 上 66.5% → 84.3%)。此外,把"何时构建状态"(在线 vs 离线)本身作为变量,发现持续暴露不完整状态反而有害,这一发现是全新的。
实验结果
核心发现有四。(1) 识别不等于感知:全观测下 83%-99% 的模型在部分可观测下大幅崩溃——Gemini-3.1-Pro 从 99% 跌至 38%(Image Only, $\mathcal{H}=\infty$),Claude-5-Sonnet 从 94% 跌至 24%;原生多轮设置中 Gemini-3.7-Flash 最佳(L1 75.0%、L2 47.0%,平均 61.0%),而 Claude-5-Sonnet 平均走 29.6 步却只有 11.5%(L2 为 0%),GPT-5.6-Sol、Qwen-3.8-27B、GLM-4.6V 平均仅走 5.7/4.6/2.8 步就抢答,L2 全部 0%。(2) 表示决定成败且无一致赢家:L2 上文本状态把 Gemini-3.1-Pro 从 5.0% 提到 20.0%;Textual State + 离线画布把 Claude-5-Fable 从平均 28.0% 拉到 75.0%(L1 81.0%、L2 69.0%)。(3) 三大瓶颈被精确定位:L2 精确序列准确率仅 9.5%-11.5%;失败审计显示 323 个 L2 预测只报一个数字,其中 238 个从未看过第二个数字的任何像素,平均只用 15/78 的预算;覆盖率 ≤25% 时精确率仅 1.0%,>75% 也只有 26.0%,说明瓶颈在工作记忆而非采集。(4) harness 下 Gemini-3.7-Flash 达 88.0%/63.0%(比在线画布高 20/25 pp),但持久记忆无增益(73.5% vs 75.5%);消融显示回望越长步数越省(Gemini-3.6-Flash L2 从 39.29 降到 15.89 步),窗口从 32×32 扩到 128×128 使其 L2 准确率从 3% 飙到 74%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Level 1+2 部分可观测识别(原生多轮设置) | 平均准确率 | Gemini-3.7-Flash 61.0%(L1 75.0% / L2 47.0%) | 次优 Gemini-3.6-Flash 46.0%;开源最佳 Qwen-3.8-27B 14.5% | +15.0 pp(对次优专有模型) |
| Level 1 单数字(Image Only, H=∞) | 准确率 | Gemini-3.1-Pro 38.0% | 全观测控制组 99.0% | -61.0 pp(识别-感知鸿沟) |
| Level 2 多数字序列(Textual State, H=1) | 准确率 | Gemini-3.1-Pro 20.0% | Image Only 基线 5.0% | +15.0 pp(文本记忆的价值) |
| Level 1+2(Textual State + 离线画布) | 平均准确率 | Claude-5-Fable 75.0%(L1 81.0% / L2 69.0%) | 纯 Textual State 28.0% | +47.0 pp |
| Agentic harness(MCP 工具,自主探索) | 平均准确率 | Gemini-3.7-Flash 75.5%(L1 88.0% / L2 63.0%) | 在线 Memory Canvas 53.0% | +22.5 pp(代价是 2.0-2.8 倍步数) |
| 预测器交换(固定 GPT-5.6-Sol(xhigh) 画布) | Level 1 准确率 | Gemini-3.7-Flash 解读同一画布 84.3% | GPT-5.6-Sol(xhigh) 自行解读 66.5% | +17.8 pp(纯解读能力差异) |
局限与改进
作者承认的局限包括:每级只有 100 个测试回合(1 个回合即 1 个百分点),小样本使模型间差异的统计显著性存疑;harness 实验的系统提示本身为可验证性做了优化、可能鼓励更长探索,因此工具增益部分来自提示引导而非纯能力(作者在 Memory Canvas 实验中观察到模型仍过早决策,部分支持工具增益真实,但无法完全排除);过自信停止被认为可能与 RLHF 引入的校准偏差有关,但本文未做隔离实验。我的补充观察:其一,MNIST 是所有 VLM 训练语料中的"母语级"数据,强先验使任务退化为"先验确认"而非开放感知,这正是作者自己提出的过乐观停止假说,也限制了结论向陌生视觉域的外推;其二,2D 静态画布没有动态性与物理反馈,结论向 GUI 操作、机器人等真实部分可观测场景迁移时需谨慎;其三,在线/离线画布都由环境程序硬编码拼合,"模型能否学会自己构建状态"只有 harness 实验的小样本回答(Gemini-3.7-Flash 自发写 stitch.py 拼图);其四,拓扑分析按 1/4/7、2/3/5、0/6/8/9 粗粒度分组,未报告置信区间或多随机种子方差。
独立分析的弱点
弱点一:先验泄漏。模型对 MNIST 字形烂熟于心,一瞥局部笔画即可确认猜想,导致过乐观停止(GLM-4.6V 平均仅 2.76 步即预测、L1 准确率 13%);改进方向是用伪造字形、反转对比度、随机笔划符号集或 CAPTCHA 式变体重做同构任务,剥离字形先验后再测纯感知。弱点二:评测规模过小且无方差报告,Claude-5-Sonnet 的 L2 0% 这类极端结论需要至少数百回合与多种子支持;改进方向是扩样并报告 bootstrap 置信区间。弱点三:在线画布的失败(如 GPT-5.6-Terra 16.0% vs 离线 30.0%)可能只是"每步都被不完整状态干扰"的工程问题,可测试每 N 步合并一次或仅在覆盖率阈值后展示画布的调度策略。弱点四:记忆表示全部由提示模板强制指定,模型无法学习适合自己的状态写入策略;改进方向是把 Grid Map 质量纳入奖励做可训练的记忆策略。弱点五:停止决策缺乏校准信号,模型无法表达"我还没看够";可引入显式不确定性估计或训练证据充分性价值头。
未来方向
作者提出的方向包括:让智能体学会何时以及如何构建整合表示(时机感知的状态构建——本文发现持续暴露不完整画布有害、探索后再合并更好);把受控回望约束迁移到 GUI 操作、机器人等真实部分可观测任务;研究停止策略与证据充分性的校准。基于其成果可延伸的方向:(1) 把覆盖率与成功率组合成奖励,用 RL 训练主动感知策略,直接优化"看哪里、何时停";(2) 把离线画布思想转化为可微分的记忆模块或学习式的状态压缩器,而非硬编码拼接;(3) 在先验未知的符号域重复实验,与作者引用的 ScrambleToolBench(陌生环境中智能体反而退化为穷举搜索)对照,刻画"任务先验强度-探索策略"的关系曲线;(4) 将 Level 2 扩展到 N>2 个数字、乱序重建、甚至动态变化画布,进一步拉伸时空记忆负载;(5) 用预测器交换范式系统评测更多模型,建立"解读能力排行榜"。
复现评估
复现难度低、可行性高。代码已开源(github.com/declare-lab/MNIST-PRO),数据来自公开 MNIST,预处理(反转、上采样到 224×224、阈值 200 二值化)完全确定;每级仅 100 回合,虽然多轮图像对话的 API 调用次数不少,但图像小、总成本很低;两个开源模型(Qwen-3.8-27B、GLM-4.6V)可本地部署,无需顶级算力。需要注意的坑:专有模型通过默认 API 配置调用,厂商更新后数字会漂移,精确复现表 1/表 2 较难;harness 实验(MCP 工具、shell、持久记忆)依赖具体脚手架实现,版本差异会改变行为(如 Claude Code harness 在 26 个 L1 回合上得 80.8%);初始瞥视随机但论文未提供多种子方差。总体而言,这是智能体感知研究理想的开箱即用测试床,主要复现风险在于商业 API 的非确定性而非算力或数据。
论文图表