画出你所见:面向多模态智能体灵巧视觉工具使用的基准测试 Paint What You See: Benchmarking Dexterous Visual Tool Use in Multimodal Agents
提出EASEL基准,以参考引导绘画评测多模态智能体的闭环参数化视觉动作能力
前置知识
闭环参数化视觉动作
指智能体在多步交互中,每一步读取像素级视觉状态,输出显式的连续动作参数(坐标、颜色、粗细等),且这些参数直接决定视觉输出结果;更新后的画面又作为下一步的反馈输入。与一次性预测不同,它强调动作-观察-修正的循环过程。
本文将'灵巧视觉工具使用'操作化为这一能力,EASEL 的任务设计、指标体系与失败模式分析全部围绕闭环展开,不理解它就无法理解论文动机。
二次贝塞尔曲线笔触参数化
EASEL 的 brush_stroke 动作用 13 个归一化连续参数描述一笔:路径由起点 $(x_s,y_s)$、控制点 $(x_c,y_c)$、终点 $(x_e,y_e)$ 定义的二次贝塞尔曲线构成,外观包含两端半径与不透明度 $(r_s,\alpha_s,r_e,\alpha_e)$ 及共享 RGB 颜色 $(c_r,c_g,c_b)$,渲染时沿曲线线性插值并经 alpha 混合叠加到画布上。
这是评测与训练数据共用的统一动作接口,理解参数空间才能理解评分设计、坐标量化与轨迹监督的构造方式。
SSIM 与 Edge IoU
SSIM(结构相似性)从亮度、对比度、结构三方面衡量两幅图像的感知相似度,取值 0 到 1;Edge IoU 先对参考图与生成画布提取边缘二值图,再计算边缘像素集合的交并比,衡量轮廓结构是否对齐。前者对外观纹理敏感,后者对几何边界敏感,二者互补。
EASEL 的核心指标 $S_t$ 由这两者与 RGB L1 距离加权组成,是解读全部实验数字(如 0.535、0.665 锚点)的基础。
轨迹诊断指标(@50%、AUC、F-B Gap)
除最终相似度外,EASEL 记录整条动作轨迹:Similarity@50% 是半程时刻的相似度,AUC 是相似度对步数的平均值 $\frac{1}{T}\sum_t S_t$,Best 是全程最大值 $\max_t S_t$,F-B Gap 为 $\max_t S_t - S_T$,衡量模型能否保住已达到的最佳状态。
论文用这组指标区分'早期饱和'与'峰值后退化'两类失败模式,并揭穿开源模型'近乎不动'的行为,是实验分析的主线。
笔触渲染(Stroke-based Rendering)
将目标图像分解为一系列离散笔触矢量并逐笔渲染逼近的技术,代表工作 Learning to Paint 用强化学习、Paint Transformer 用前馈网络预测笔触序列。它为任意图像提供了自动生成绘图轨迹的途径,无需人工标注。
EASEL-Data 的 25 万步级矢量轨迹正是用这类绘画策略自动生成,再转化为 44 万下一动作监督样本。
LoRA 微调
LoRA 冻结预训练权重,在每层旁路注入低秩增量矩阵并只训练这部分参数,大幅降低显存与算力需求。本文用 rank 64、alpha 128、以全部线性层为目标,另通过 modules_to_save 全量更新 ViT 最后四个块与 merger 层。
EASEL-9B 的训练方案与复现评估都建立在 LoRA 之上,理解它才能判断 8 卡微调 9B 模型的可行性与成本。
研究动机
多模态模型越来越多地借助外部工具在复杂数字环境中完成任务,但现有评测几乎都回避了'精确执行'。Web/GUI 导航类基准(WebArena、OSWorld、ScreenSpot-Pro、SeeClick)中的点击坐标只要落在宽松的容差区域内即算成功,坐标精度并不直接决定任务结果;V*、SoM、DeepEyes 等视觉搜索与区域标注工作只服务于理解、不产生持久的视觉输出;VisProg、LISA、PSALM、ImgEdit 等则把像素级执行委托给外部分割解码器或生成模型这个'黑盒'。结果是,在所有这些设定中,模型从不需要把细粒度视觉证据翻译成直接决定成败的动作参数——'理解'与'精确执行'之间的耦合能力在现有评测中处于空白,GUI grounding 的坐标即便预测不准也会被高容忍度的交互元素吸收。
本文的目标是论文的目标是构建一个可控评测'灵巧视觉工具使用'的基准 EASEL:以参考引导的视觉重建作为主代理任务,智能体观察参考图与当前画布,逐步输出参数化画笔动作使画布逼近参考图,共 110 个重建样本(分四个难度梯度类别)加 5 个语义任务(圆形轮廓、苹果轮廓、手写 hello、简单迷宫、复杂迷宫),单次完整评测最多涉及 11,392 次交互;同时沿结果质量与轨迹质量两条轴系统诊断 25 个多模态智能体。作者进一步构建 44 万样本的两阶段课程数据集 EASEL-Data 并训练 EASEL-9B,检验轨迹级监督能否提升这一能力,以及训练是否会损害通用感知。
与已有工作不同的是,论文的独特切入是借鉴机器人学中的灵巧操作:机械臂自身的运动动作通过连续反馈直接塑造物理结果,而不是向外部执行器下达命令。作者据此把该能力定义为'细粒度、闭环、参数化的视觉动作',并选择绘画作为自然代理任务——每一笔都可见地改变画布并塑造下一步决策,参数误差不会被容忍接口或外部生成器吸收。与最接近的已有范式 SimpleSeg(直接预测多边形坐标但一次性、无闭环修正)不同,EASEL 要求多步闭环执行;同时评测实例无需人工标注:参考图可自由获取,笔触轨迹可自动派生,使该设定易于规模化扩展。
核心方法
EASEL 的主任务是参考引导重建:给定参考图 $R$ 和空白画布 $C_0$,每一步智能体观察 $(R, C_t)$ 并输出 JSON 格式的 brush_stroke 动作 $a_t$,渲染器执行 $C_{t+1}=\text{Render}(C_t, a_t)$,整集跑 $T$ 步,目标是让 $C_T$ 尽量接近 $R$。动作由 13 个归一化连续参数组成:二次贝塞尔曲线的起点、控制点、终点坐标 $(x_s,y_s),(x_c,y_c),(x_e,y_e)$、两端半径与不透明度 $(r_s,\alpha_s,r_e,\alpha_e)$、共享 RGB 颜色 $(c_r,c_g,c_b)$。语义任务把动作空间扩展为 {brush_stroke, undo, submit},固定外观(全不透明深蓝、中等笔宽)只预测路径参数,迷宫中撞墙动作被拒绝为无效但仍消耗步数并反馈给后续上下文。重建相似度定义为 $S_t = 0.5\cdot\text{SSIM} + 0.3\cdot(1-\text{RGB}_{L1}) + 0.2\cdot\text{Edge IoU}$,最终相似度 $S_T$ 是排名主指标。
核心创新有二。其一,把'参数精度直接决定结果质量'变成硬约束:不存在容忍边距、语义抽象层或外部黑盒执行器,任何坐标误差都直接体现在画布上,从而首次在通用多模态智能体上实现分割式动作的闭环评测,弥合了'理解型操作'与'委托式执行'之间的空白。其二,引入轨迹质量诊断维度:Similarity@50%、AUC($\frac{1}{T}\sum_t S_t$)、Best($\max_t S_t$)与 F-B Gap($\max_t S_t - S_T$)共同刻画模型如何在动作序列中使用中间反馈,把'早期饱和'与'峰值后退化'两类定性不同的失败模式区分开来——这是只看最终答案的 QA 式评测完全无法暴露的。F-B Gap 还需与精确重复率联读,避免把'不作为'误读为'稳定性'。
方法步骤详情
基准构建分四类重建任务形成难度梯度:Programmatic(15 个样本,64×64,32 步预算)提供最干净的工具格式基线;Spatial Geometry(40 个,128×128,96 步)测多物体布局;Abstract/Cartoon(15 个,128×128,96 步)削弱语义先验;Natural Images(40 个,128×128,128 步)是主要难度来源;另含 5 个语义任务,迷宫中撞墙动作被拒绝为无效但仍消耗步数并反馈。EASEL-Data 构建分三步:先汇集 11k 参考图(程序几何 2k、文字 1k、COCO 裁剪 6k、Tiny ImageNet 2k);再用 stroke-based 绘画策略为每张参考图生成 250 步矢量轨迹;最后转为下一动作预测样本——C1(308k)保留第 0–49 笔(前 16 笔全保留),C2(132k)以递减密度覆盖全程 0–249 笔,坐标量化为 [0,1000] 整数以对齐 MLLM 分词器,10% 参考由推理模型标注 CoT(44k)。EASEL-9B 基于 Qwen3.5-9B 两阶段 LoRA(rank 64、alpha 128、全线性层):阶段一在 C1 上以学习率 $1\times10^{-4}$ 训练;阶段二在 C2 上混 15% C1 回放、学习率降至 $5\times10^{-5}$;bf16、DeepSpeed ZeRO-2、8 卡有效批 64、序列长 8192,ViT 末四块与 merger 全量更新。
技术新颖性
技术新颖性体现在三个层面。评测范式上,首次让通用多模态智能体在不借助分割解码器或外部生成模型的情况下完成分割式动作的闭环评测,SimpleSeg 虽可直接预测多边形但停留在一枪式静态设定,EASEL 补上了'多步闭环修正'这块缺失的拼图。数据上,把 stroke-based rendering 的专家轨迹低成本转化为 44 万个下一动作监督样本,并设计'先早期后全程'的两阶段课程——实验证明早期笔触监督(C1)贡献了主要增益(+0.024 中的绝大部分),中后段补全(C2)仅再 +0.003,这一消融本身就是对长程反馈学习难度的量化证据。诊断方法上,F-B Gap 与精确重复率(82.3%–92.4%)联用,揭穿了多个开源模型'低 F-B Gap'实为近乎不动而非主动保持质量,避免了轨迹指标的误读。
实验结果
25 个模型(6 个闭源 API + 19 个开源 4B–90B)的评测揭示系统性短板。重建任务上最终相似度整体压在 0.40–0.54:Gemini 3.1 Pro 以 0.535 居首,Claude Opus 4.7 次之(0.472),开源模型聚在 0.40–0.45 且与参数量无明显相关。锚点实验(Table 2)极具解释力:Gemini 的 0.535 仅与'参考图均值色填充'(0.534)相当,但其 Edge IoU 0.053 显著高于所有填充的 0;数据策略在同等预算下达 0.665(Edge IoU 0.281)、原生 250 步达 0.715(Edge IoU 0.563),证明任务可解、指标未饱和。轨迹诊断暴露两种失败模式:Gemini 3.1 Pro、Claude Opus/Sonnet 4.6/4.7 在前 5% 步内急升后平台化(@50%、AUC、Final 几乎相同),GPT-5.5、GLM-5V-Turbo、qwen3.5-plus 持续行动但退化(GPT-5.5 F-B Gap 0.073,AUC 0.440 > Final 0.426);所有闭源模型的有效峰值都在前 10% 步预算内。EASEL-9B 达 0.459,总排名第三、非专有模型最高,比基座 Qwen3.5-9B 的 0.432 高 0.027(相对 6.3%),C1 贡献 +0.024、C2 再 +0.003,但 F-B Gap 从 0.015 微升至 0.019–0.020,长程纠错仍受限。语义任务边界更锐利:Gemini 3.1 Pro 圆轮廓 Dice 0.919、hello 满分但 Simple Maze 仅 0.183;GPT-5.5 Simple Maze 满分(25 次 undo 迭代修正后提交,是评测中最清晰的闭环自纠错案例);Claude Opus 4.7 因画-撤死循环圆轮廓得 0.000(124 次非迷宫 undo);Hard Maze 全体未解(最佳仅 Sonnet 4.6 的 0.047)。EASEL-9B 在标准感知基准上不降反升:MMVP +0.7%、POPE +2.0%、HallusionBench +0.6%、BLINK 计数 +1.7%,说明闭环动作训练保留并小幅拓展了细粒度感知。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 标准重建(EASEL-9B 课程消融) | Final Similarity | EASEL-9B 0.459(C1-only 0.456) | 基座 Qwen3.5-9B 0.432 | +0.027(相对提升 6.3%),开源模型中最高、总排名第三 |
| 标准重建(最佳智能体 vs 锚点) | Final Similarity / Edge IoU | Gemini 3.1 Pro 0.535 / Edge IoU 0.053 | 均值色填充 0.534 / 0;数据策略同预算 0.665 / 0.281 | 仅与平凡填充持平,距可达分数上限仍差 0.130–0.180 |
| Circle Outline(圆形轮廓标注) | Dice 系数 | Gemini 3.1 Pro 0.919 | Claude Opus 4.7 0.000(画-撤死循环) | 头部模型已具备分割式直接描边能力,但稳定性差异巨大 |
| Simple Maze(简单迷宫路径) | 归一化路径进度 | GPT-5.5 1.000(满分,25 次 undo 后提交) | Gemini 3.1 Pro 0.183 | 证明重建精度与指令跟随是部分正交的维度 |
| Hard Maze(复杂迷宫路径) | 归一化路径进度 | Claude Sonnet 4.6 0.047(全体最佳) | 多数模型 0.000 | 无——该任务在所有 25 个模型上仍未解决 |
局限与改进
作者承认 EASEL 用广度换控制:2D 画布隔离了视觉目标、参数化动作与闭环反馈中的混杂变量,便于聚焦诊断,但也意味着结论向医疗标注、CAD 草图、图表绘制、具身操作等真实场景外推时需要谨慎;EASEL-9B 只是课程效应的诊断探针,并非绘画质量的上界。我的补充观察:其一,所有模型的最终分数离数据策略锚点(0.665–0.715)差距巨大,说明 32–128 步预算内的长程闭环纠错远未解决,但论文未系统分析步预算长度对结论的影响;其二,F-B Gap 的语义依赖底层行为(保住好结果 vs 几乎没动),单看该指标会误导,必须配合重复率解读;其三,语义任务每类仅 1 个实例共 5 个,样本量过小,Dice、路径进度等指标对笔宽设定与边缘二值化阈值的敏感性未报告置信区间;其四,混合指标权重(0.5/0.3/0.2)虽在附录做了排序敏感性分析,但论文正文大量引用单指标对比,存在被择优解读的空间。
独立分析的弱点
独立分析以下几点不足。1)动作空间固定为单一笔刷且外观统一,只能测路径精度,无法覆盖颜色控制、多工具切换等更自然的工具使用形态,可扩展为可变笔刷与工具库的动作空间。2)开源模型普遍'近乎不动'(精确重复率 82.3%–92.4%),这种保守策略同时压低 AUC 与 Final,但也意味着当前排名可能在奖励不作为,建议引入最小改进约束或对无变化步施加惩罚。3)渲染器是理想化的确定性函数,真实工具(如 GUI 绘图软件)存在延迟、遮挡与不确定性,可在渲染噪声下复测以检验结论鲁棒性。4)C2 阶段增益仅 +0.003,说明中后段的下一动作监督信号质量不足——专家轨迹的中后段本身接近饱和,模仿学习收益递减,应引入基于结果奖励的强化学习或过程奖励模型。5)语义任务统计功效有限:手写、迷宫各一个实例,单模型分数波动可能很大,应扩充实例数并报告方差。
未来方向
作者提出的方向:显式的动作轨迹与环境反馈使 EASEL 天然兼容结果导向的优化、强化学习与规划方法;EASEL 式任务若结合更有针对性的监督设计,有望成为细粒度视觉感知的训练信号(EASEL-9B 在 MMVP/POPE 上的小幅提升已是初步证据)。我的延伸:1)把 Hard Maze 这类未解任务发展为长 horizon 规划的挑战集,配合树搜索或学习型世界模型;2)将两阶段课程范式迁移到机器人操作、CAD 草图、医学影像标注等参数化动作域,检验跨域泛化;3)在 44 万轨迹数据上训练过程奖励模型(PRM),替代稀疏的模仿监督以解决 C2 增益微弱的问题;4)利用参考图可自由派生的特点,把 EASEL 扩展为持续增长的无标注评测流,监测前沿模型在精确执行上的代际进展,避免基准饱和。
复现评估
复现条件较好。代码开源于 github.com/OOOHS/EASEL,基准与 EASEL-Data 发布在 HuggingFace(EASEL-Bench);评测无需任何人工标注,参考图来自 COCO、Tiny ImageNet 等公开数据集,程序几何与迷宫任务可程序化合成,渲染器为确定性实现。训练侧门槛不高:EASEL-9B 仅需 LoRA(rank 64、alpha 128)+ 8 卡 GPU、bf16、DeepSpeed ZeRO-2、8192 序列长度,9B 模型在中型集群即可复现。评测侧需要调用 6 个闭源 API(Gemini、Claude、GPT、GLM、Qwen)并本地推理 19 个开源模型;重建任务每样本最多 128 步、全量约 11,392 次交互,多轮图像输入的 token 开销需要预算,但总体成本可控。风险点在于:若渲染器实现细节或 CoT 标注所用推理模型未完全公开,复现分数可能有细微漂移;闭源 API 版本迭代也会影响横向可比性。
论文图表
对比四类视觉任务执行范式:①容差区域交互(如 OSWorld),动作落在宽松边界内即成功;②纯理解型操作(如 V*、SoM、DeepEyes),只做指认不产生持久视觉输出;③委托外部模型执行(如 VisProg、ImgEdit、LISA),把像素级工作交给黑盒分割/生成模型;④EASEL 要求智能体自己通过闭环细化直接产生参数化动作。
一图说清论文的动机与定位:现有三类范式都以不同方式回避了精确执行,这正是 EASEL 要填补的能力空白,是理解整篇论文叙事的起点。