PaperBanana-Interact:基于多轮人类反馈的科学图表精修系统 PaperBanana-Interact: Scientific Diagram Refinement with Multi-Turn Human Feedback
提出多轮图表精修基准与多智能体系统,破解质量漂移与遗忘两大失败模式
前置知识
多轮交互式生成
指系统不是一次性产出最终结果,而是与用户来回多轮:每轮用户给出自然语言反馈 $x_t$,系统在上一版输出 $I_{t-1}$ 基础上生成新版本 $I_t$。难点在于系统必须同时理解新请求、保留先前已实现的修改、并且不让整体质量随轮次退化。
本文的整个任务设定、基准构造和两大失败模式(质量漂移、遗忘)都建立在多轮交互范式之上,不理解这一范式就无法理解论文要解决什么问题。
用户模拟器
用 LLM 扮演用户进行自动评测:给定一份对被测系统隐藏的需求清单 $R=[r_1,\dots,r_N]$,模拟器每轮用裁判模型检查当前图表未满足哪些需求,按预定义顺序挑出前 $k$ 条并转写成自然语言反馈发给被测系统,直到需求全部满足或达到轮数上限 $T_{\max}$。
MTPaperBananaBench 的多轮交互完全由它驱动,理解它才能看懂实验设置中 $k{=}1$ 与 $k{=}3$ 两种模拟条件的含义。
LLM-as-a-Judge(模型裁判)
用大模型(通常是视觉语言模型 VLM)代替人类为输出打分。本文中裁判查看生成的图表和每条需求,输出 0/1 二元满足分及理由;图表质量则与人类专家参考图对比,在忠实性、简洁性、可读性、美观性四个维度上计算胜率。其可靠性需要用人工标注的一致性系数来校验。
论文的需求满足率和质量分全部由 VLM 裁判产出,且裁判、用户模拟器与被评系统均基于同一模型(Gemini-3.1-Pro),读实验数字时必须意识到这一点。
Cohen's κ 一致性系数
衡量两个标注者在分类任务上一致程度的统计量,修正了随机一致带来的虚高:$\kappa = \frac{p_o - p_e}{1 - p_e}$,其中 $p_o$ 是观测一致率,$p_e$ 是期望随机一致率。经验上 0.6–0.8 为较大一致,0.8 以上接近完全一致。
论文用它验证需求标注质量(标注者间 $\kappa=0.767$)和 VLM 裁判可靠性(与人类评估者 $\kappa=0.812$),这是判断整个评测体系是否可信的依据。
多智能体流水线
把复杂任务拆分给多个分工明确的 LLM 角色,各 agent 通过结构化中间产物衔接。本文有四个角色:总结器(压缩交互历史为文本记忆)、批评家(审查图表找缺陷)、精修器(更新图像生成 prompt)、可视化器(图像模型渲染最终图),外加协调它们的外层循环。
PaperBanana-Interact 本身就是一个四角色多智能体系统,理解每个角色的输入输出和数据流是读懂方法部分的关键。
指令引导的图像编辑模型
以图像加文字指令为输入、输出修改后图像的生成模型(如 NanoBananaPro、GPT-Image-2)。它们天然支持按指令修改图像内容,因此可以被直接当作多轮精修器使用,但逐轮迭代时容易引入视觉伪影、风格漂移和逻辑错误。
它们既是论文中的基线精修器(表现最差的那个),也是 PaperBanana-Interact 中可视化器 $V$ 的底层图像生成引擎。
研究动机
现有科学图表生成系统(如 PaperBanana、AutoFigure、Crafter 等)都遵循一次生成范式:从论文内容与交流意图 $x_0$ 直接产出图表 $I_0$,之后不再迭代。然而图表设计天然是迭代过程,作者往往看到初稿后才意识到哪里需要改。论文的形成性用户研究($N=14$ 名有学术写作与科研绘图经验的参与者)显示:所有参与者在看完初稿后都要求进一步修改;86%(12/14 人)对多轮精修后的图评价更高,平均满意度从 3.2 分升到 4.2 分(1–5 分制),提升幅度 0.5–2 分;64% 的会话中细化需求是在看到初稿或中间版本后才浮现的,其中 9 人直言初稿改变了自己对图表应有的设想。后续访谈还暴露了现有迭代基线 PaperBanana-DirectRefine 的具体缺陷:事实忠实度下降(29% 会话)、审美质量退化(43%)、无法保留已满足的修改(29%)。尽管需求明确,多轮图表生成此前几乎无人系统研究。
本文的目标是本文的目标是把多轮人类反馈下的科学图表精修变成可系统评测、可针对改进的研究任务,具体分三步走。其一,构建首个多轮图表生成基准 MTPaperBananaBench:包含 292 张人类专家绘制的图表和 3,518 条标注需求(平均每图 12 条,覆盖内容、组织布局、视觉呈现三大类及不同严重程度),为多轮评测提供受控环境。其二,设计可扩展的用户模拟器,每轮从隐藏需求池中挑出 $k$ 条未满足项并转写成自然语言反馈,替代昂贵且难以跨评测运行标准化的大规模人工研究。其三,建立需求满足率与图表整体质量双维度评测协议,外加单轮满足率和遗忘率两个诊断指标,系统评测生成式模型与智能体基线,定量定位失败模式,并提出能在多轮迭代中持续提升而非退化图表质量的新系统。
与已有工作不同的是,本文的独特切入角度有二。评测方法论上:以往图表生成评测几乎都是单轮的,而收集大规模真实多轮交互既昂贵又难以标准化,本文改用隐藏需求加用户模拟器的思路——需求池来自对专家手绘参考图 $I_H$ 的两阶段标注(先由 Gemini-3.1-Pro 生成候选需求并按分类体系打标签,再由三位人工标注者独立复核,最终删除 0.5%、修订 24.7% 的候选,标注者间 Cohen's $\kappa=0.767$ 属较大一致),模拟器按预定义随机顺序逐步揭示未满足需求,使多轮评测可规模化、可复现。系统设计上:与 DirectRefine 式一次性改写 prompt 的做法不同,本文先定量识别出质量漂移与遗忘两大失败模式,再针对性地提出内部 critique-and-refine 循环加多目标批评家的架构,让系统设计直接对准实测失败模式而非凭直觉堆模块。
核心方法
论文的出发点是一个直觉判断:多轮精修失败是因为系统要么把多张历史图像全部塞给模型(长上下文互相干扰且昂贵),要么只看最近一版(忘记早先对用户的承诺)。PaperBanana-Interact 的整体思路是压缩记忆加内部自我批评循环。它沿用智能体流水线范式:语言模型(Gemini-3.1-Pro)负责生成与精修图像 prompt,图像模型(NanoBananaPro)负责渲染最终图像。每轮 $t$ 先由总结器 $S$ 把交互历史 $(I_{<t}, x_{\le t})$ 压缩成紧凑的文本记忆 $M_t$,记录图上画了什么、相对上一版改了什么、这些修改是否符合当轮请求;随后进入内部精修循环:批评家 $C$ 审查当前图并输出结构化批评 $c_t^{(\tau)}$,精修器 $R$ 据此更新 prompt $P_t^{(\tau)}$,可视化器 $V$ 渲染出新图 $I_t^{(\tau)}$ 再送回批评家复查,直到批评家判断无需继续修改或达到迭代预算 $\tau_{\max}=10$。实验表明该系统在 5 轮反馈下质量不降反升。
核心创新是多目标批评家驱动的内部精修循环。与 PaperBanana-DirectRefine 只用一个 VLM 把 $(I_{t-1}, P_{t-1}, x_{\le t})$ 一次性改写成新 prompt 不同,本文让系统在每轮内部反复自我审查、自我修正:批评家被要求输出结构化 JSON,对四类约束分别给出明确的批评条目——当前用户请求 $x_t$ 是否满足、全部历史请求 $x_1,\dots,x_t$ 是否仍然保留(防遗忘)、对源上下文 $x_0$ 是否忠实(防漂移)、整体呈现质量是否达标。这把用户本轮说了什么从唯一目标升级为多目标约束检查,从机制上对准了定量分析发现的两大失败模式。另一关键设计是共享文本记忆 $M_t$:连续多版图像之间存在大量视觉冗余,压缩成文字后所有 agent 共享,相比直接喂全历史图像节省 37.1% 输入 token,同时避免了长多图上下文导致的注意力退化。
方法步骤详情
第一步,总结器:计算 $M_t = S(I_{<t}, x_{\le t})$,把逐轮图像与用户话语压缩为文本记忆,涵盖每版图描绘什么、相对上一版的变化、以及变化是否符合当轮请求。第二步,初始化内部循环:令 $I_t^{(0)} = I_{t-1}$,$P_t^{(0)} = P_{t-1}$。第三步,批评家审查:$c_t^{(\tau)} = C(I_t^{(\tau-1)}, x_{\le t}, M_t)$,针对当前请求、历史请求、源上下文忠实性、呈现质量四项输出结构化 JSON 批评。第四步,若仍需修改,精修器更新 prompt:$P_t^{(\tau)} = R(I_t^{(\tau-1)}, P_t^{(\tau-1)}, c_t^{(\tau)}, x_{\le t}, M_t)$。第五步,可视化器渲染 $I_t^{(\tau)} = V(P_t^{(\tau)})$ 并反馈给批评家进入下一迭代。循环在批评家认为无需修改或达到 $\tau_{\max}=10$ 时终止,输出最终 $I_t$;外层用户反馈最多 $T_{\max}=5$ 轮,需求全部满足时提前停止。
技术新颖性
技术新颖性体现在三处,且都有消融数据支撑。第一,多目标结构化批评:把朴素批评家换成多目标版后单轮满足率 Reqpt 从 72.3 升到 77.2(+4.9)、质量从 58.9 升到 61.2(+2.3)、遗忘率从 13.1% 降到 12.6%,证明分项检查历史请求与源上下文不是工程装饰而是性能来源。第二,紧凑文本记忆替代多图历史:完全去掉历史使遗忘率从 12.6% 恶化到 14.7%;而喂全历史虽把遗忘率降到 11.6%,却使 Reqpt 从 77.2 掉到 73.5、质量下降,并多耗 37.1% 输入 token,说明该压缩方案是效果与成本的最优权衡点。第三,首次量化了内部迭代预算的价值:$\tau_{\max}$ 从 10 降到 5、3、1 时质量单调下滑(61.2→60.6→53.3→43.5),而 $\tau_{\max}=1$ 恰好等价于基线的单遍直接改写,从消融角度解释了为什么所有直接改写型基线都会质量漂移。
实验结果
评测给出四个结论。一是生成式模型当精修器会严重退化:以 NanoBananaPro 精修 PaperBanana 输出,$k{=}1$ 时质量从单轮的 50.3 跌到 19.0,遗忘率高达 19.0–22.9%。二是智能体基线略好但仍漂移:PaperBanana-DirectRefine 质量维持 47.1(低于单轮),Reqpt 68.6、遗忘率 18.8。三是 PaperBanana-Interact 全面领先:$k{=}1$ 下取得质量 61.2、需求满足率 58.0、Reqpt 77.2、遗忘率 12.6,较 DirectRefine 质量提升 14.1 点、整体领先 11.9–18.6 点、遗忘率降低 3.7–6.2 点;$k{=}3$ 下 Req 达 94.2(vs 87.6),质量 54.5 仍最优;150 样本人类偏好测试中 81.3% 优于 NanoBananaPro、76.7% 优于 DirectRefine。四是消融确认三大组件均有效,迭代预算影响最大($\tau_{\max}$ 10→1 时质量 61.2→43.5);裁判一致性 $\kappa=0.812$。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 多轮图表精修(PaperBanana 初始图,$k{=}1$ 用户模拟器) | 质量得分 Qual↑(与专家参考图的胜率) | 61.2 | PaperBanana-DirectRefine 47.1;NanoBananaPro 19.0 | +14.1(vs DirectRefine),+42.2(vs NanoBananaPro) |
| 多轮图表精修(PaperBanana 初始图,$k{=}1$ 用户模拟器) | 需求满足率 Req↑ / 遗忘率 Forget↓ | Req 58.0,Forget 12.6% | DirectRefine Req 52.6,Forget 18.8% | Req +5.4,Forget -6.2 |
| 多轮图表精修(PaperBanana 初始图,$k{=}3$ 用户模拟器) | 质量 Qual↑ / 需求满足率 Req↑ | Qual 54.5,Req 94.2 | DirectRefine Qual 42.6,Req 87.6 | Qual +11.9,Req +6.6 |
| 人类两两偏好评测(150 个样本) | 偏好率 ↑ | 81.3%(vs NanoBananaPro),76.7%(vs DirectRefine) | NanoBananaPro / PaperBanana-DirectRefine | 约四分之三以上场景被人类评估者偏好 |
局限与改进
作者承认并可从数据推出的局限包括:其一,遗忘未被根除,最优配置下仍有 10.3–13% 的需求在后续轮次丢失,说明多目标批评家只是缓解而非解决;其二,$k{=}3$(每轮 3 条反馈)时优势明显收窄,质量 54.5 相比单轮 50.3 仅 +4.2,远小于 $k{=}1$ 时的 +10.9,说明反馈更长更复杂时系统更吃力;其三,整个评测栈——用户模拟器、评估裁判、各智能体——都构建在 Gemini-3.1-Pro 上,裁判与被评系统同源可能带来偏好偏差,且用户模拟器的需求本质是对专家参考图设计选择的逆向标注,未必等于真实作者的反馈分布;其四,外层交互固定为最多 $T_{\max}=5$ 轮,更长会话下的行为未知;其五,内部循环 $\tau_{\max}=10$ 加上每轮多 agent 串行调用,推理成本显著高于单次生成,论文只在消融中提到全历史方案多耗 37.1% token,未系统报告自身方案的时延与费用。另外基准图表均来自论文场景,向幻灯片图、教学插图等载体迁移的效果尚不清楚。
独立分析的弱点
独立分析有三个弱点。其一,遗忘问题的解法是靠检查而非靠机制:多目标批评家本质上只是提示模型在每轮回头核对历史请求,没有任何硬性记忆或约束保持机制,所以在复杂多请求场景($k{=}3$)下遗忘率仍达 13.0%。改进方向是把已满足需求编译成可程序化校验的显式约束清单或结构化场景描述,在渲染前后做自动比对,违例即回滚或重试。其二,评估闭环存在循环性风险:需求满足与质量都由 VLM 裁判打分,而用户模拟器、被评系统和裁判同为 Gemini-3.1-Pro,容易系统性偏向同族模型的输出风格;虽然人工评估($\kappa=0.812$、150 样本偏好测试)部分缓解了这一担忧,但人工评估规模较小且只有单一评估者。改进方向是引入异构裁判(如 GPT 系模型)交叉验证,并扩大真实用户研究规模。其三,成本问题:$\tau_{\max}=10$ 的内部循环意味着单轮最多十几次图像生成调用,而消融显示 $\tau_{\max}=5$ 时质量仅从 61.2 降到 60.6,说明大量迭代是浪费的。改进方向是设计置信度触发的自适应迭代预算,让批评家的评分决定何时早停。
未来方向
作者在结论中把这项工作定位为交互感知图表生成的基础,自然延伸方向包括:用真实作者开展长程用户研究,检验模拟评测结果与真实用户偏好的相关性;把多轮反馈机制推广到幻灯片、海报、教学示意图等更广的视觉传达载体;研究更强的记忆机制,例如把已确认需求维护成结构化状态、或用检索代替全文记忆以进一步压缩上下文。基于本文成果还可延伸:一是把批评家的结构化 JSON 批评升级为可执行的自动检查器,文本溢出、对比度、布局平衡等指标本可程序化度量,从而减少对 VLM 主观打分的依赖并降低成本;二是做跨轮次的因果归因分析,定位哪一轮的哪次编辑导致质量下滑,实现针对性回滚而非全图重画;三是把被动接受反馈升级为主动澄清,让系统在歧义请求时主动提问,进一步贴近真实设计协作;四是探索多用户协作场景下冲突需求的调和机制。
复现评估
复现难度中等偏上。数据方面:基准建立在公开的 PaperBananaBench 之上,但 3,518 条需求标注依赖 Gemini-3.1-Pro 生成候选加三位人工标注者复核(删除 0.5%、修订 24.7%),标注协议见附录 B,论文未明确承诺数据全面开源;项目页面 https://shirley-wu.github.io/PaperBanana-Interact/ 提供补充信息,附录 F/G/H 公开了评估、模拟器和系统全部 prompt,这对复现至关重要。算力与依赖方面:所有系统绑定 Gemini-3.1-Pro 与 NanoBananaPro 两个商用 API,无本地开源替代路径,无法访问同款模型时结果可能有出入;API 费用不可忽视——$\tau_{\max}=10$ 的内部循环使每轮最多触发十次图像生成,可参考全历史方案多耗 37.1% token 估算量级;评测侧还需 VLM 裁判对 3,518 条需求逐条打分。若只复现主结论趋势而非精确数字,用同类前沿模型替代应可行。
论文图表
概念总览图:上半部分说明单轮生成难以满足作者的全部视觉与表达偏好、需要多轮反馈迭代的事实,下半部分以三个要点概括论文的三项贡献——MTPaperBananaBench 基准、对质量漂移与遗忘的系统性发现、PaperBanana-Interact 多智能体精修系统。
这是论文的入口图,一图概括动机与三大贡献,读者可据此快速建立论文的整体框架,再深入各章节细节。
展示 14 名形成性研究参与者的逐人满意度评分:精修前平均 3.2 分,精修后平均 4.2 分,12/14 人(86%)给精修后图表更高评分,个体提升幅度 0.5–2 分。
它是论文动机的实证支柱:证明多轮反馈不是作者设想出来的需求,而是真实用户研究中全员提出的诉求,为整个任务定义提供了合法性。
展示一个完整的遗忘过程:用户请求的某项修改在早期轮次被正确实现,但几轮后系统在处理新的样式调整请求时覆盖了该修改,导致先前已满足的需求重新变为未满足。
遗忘是本文定义的第二个关键失败模式,该示例说明了其典型触发条件(新请求恰好触及已修改区域),是理解遗忘率指标和批评家设计动机的直观材料。