下一步编辑什么:对话系统中视觉对齐的图像编辑后续建议推荐 What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems
三阶段框架让图像编辑对话中的后续建议既契合用户偏好又与当前画面视觉一致
前置知识
SFT(监督微调)
用人工构造或蒸馏得到的输入-目标对直接微调预训练模型,让模型学会任务的输入输出格式与行为模式。本文中 SFT 目标不是人工撰写的,而是由教师模型(Gemini 3 Flash)根据真实在线上下文和人工审核的意图表生成候选,再经过多层校验组装成每条 6 个建议的 slate。
Stage 1 是整个框架的起点,后续 RL 都以 SFT 策略为初始化和参考策略(KL 正则、PPL 奖励都依赖它),理解 SFT 数据从哪来才能看懂整个流水线。
Bradley–Terry 奖励模型与 RLHF
偏好对齐的标准流程:先从人类(或行为)偏好对 $(x, y^+, y^-)$ 训练一个打分模型,损失为 $\mathcal{L}_{RM} = -\mathbb{E}\log\sigma(r_\phi(x,y^+) - r_\phi(x,y^-))$,再用这个奖励去优化生成策略。本文用用户真实点击代替人工标注来提供 $y^+$/$y^-$。
Stage 2 的核心就是从 173,071 个位置感知点击对训练 8B 视觉语言奖励模型,不理解 Bradley–Terry 目标就无法理解点击信号如何变成可优化的标量奖励。
GRPO(组相对策略优化)
DeepSeek 提出的 RL 算法:对每个上下文采样一组(本文 $G=8$ 个)rollout,对每个奖励维度在组内做标准化 $\hat{A}_k^i = (r_k^i - \mu_{k,x})/(\sigma_{k,x} + \epsilon)$ 得到相对优势,加权求和后再做 masked batch standardization,配合裁剪目标和 KL 正则更新策略,无需额外的价值网络。
本文 Stage 2 和 Stage 3 都用 GRPO 优化,且创新点之一就是逐维归一化加动态权重来平衡五个(后来六个)尺度不同的奖励维度。
展示位置偏差
用户只倾向于点击自己看到过的候选,而列表下方位置的候选被看到的概率更低,因此直接用点击/未点击构造偏好对会把位置效应误当作偏好信号。常见修正方法是倾向性加权估计观看概率。
本文的位置感知配对规则(点击建议只与展示在它上方的未点击建议配对)是理解 Stage 2 数据构造的关键,也是 Table 3 消融的实验对象。
视觉幻觉与视觉接地
视觉语言模型常依赖语言先验而非图像像素做判断:例如提问中出现“帽子”,模型就假设图里有帽子。接地(grounding)指判断陈述是否真的被图像内容支持。已有的解码时对比方法和幻觉感知偏好学习主要检验“关于图像的陈述是否为真”。
本文的源-目标验证器正是针对“候选建议本身的措辞会引入错误假设”这一幻觉变体设计的,且把接地从“陈述是否为真”扩展到“编辑在图上是否可执行”。
研究动机
对话助手越来越习惯于主动推荐后续编辑来帮助用户延续任务,但现有的后续建议系统几乎都针对纯文本对话设计,图像创作对话(用户反复生成、编辑、检查、精修图像的场景)长期被忽视。在图像创作场景里,一条有用的后续编辑建议必须反映用户偏好、提供多样化的创作方向、并且在当前图像上真正可执行。为了量化视觉上下文的重要性,作者从 Qwen App 抽取了 100,000 个真实的相邻用户轮次对做审计,结果发现 80.1% 的后续编辑查询是图像依赖的——它们的编辑意图无法仅从前一轮查询推断,必须在最新图像上接地;只有 19.9% 是文本依赖的。而现有相关工作各管一段:query 建议系统从行为反馈学习用户偏好但只处理文本;指令引导图像编辑只执行用户指定的编辑;图像编辑推荐从图像和欠规范提示生成候选指令;agentic editing 只负责把给定的编辑目标分解成迭代动作。没有任何系统同时学习行为对齐的后续建议列表,并验证它们在最新图像上的有效性。
本文的目标是本文要形式化并解决“多模态后续编辑推荐”任务:每个编辑轮次的输入是 $x=(I,q,e)$,即最新图像 $I$、由多轮对话改写而来的当前查询 $q$、以及解析出的编辑意图 $e$;策略 $\pi_\theta$ 生成有序候选列表 $Y=(y_1,\ldots,y_N)$,目标 6 条、产品有效范围 5 到 7 条,服务层再随机选 3 条展示。优化目标形式化为最大化展示列表的期望效用 $\max_\theta \mathbb{E}_{x\sim\mathcal{X}, Y\sim\pi_\theta, D\sim U_3(Y)}[U(Y_D|x)]$。一个有用的展示列表要同时满足三个条件:用户想点(行为偏好)、格式合法且彼此不重复(列表质量)、在当前图像上可执行(视觉一致性)。最终目标是在 Qwen App 真实部署中同时提升 CTR、图片留存率和人均对话轮次,并把视觉不一致率压到接近于零。
与已有工作不同的是,本文最独特的切入是把“用户觉得吸引人”和“编辑在图上可执行”拆成两种互补的监督信号,并实证指出二者会冲突:只优化点击偏好后,专家评分从 SFT 的 +332 升到 +405,但视觉不一致率反而从 3.0% 恶化到 3.7%——因为点击反映的是建议的吸引力而非可执行性,即使奖励模型能看图,它的标签也来自用户选择。针对这个缺口,作者提出图像优先的源-目标结构化验证器:验证器在读取任何候选文本之前先记录图像场景,再把每条建议拆成必需源和目标状态分别检查。更巧妙的是验证器只在训练期提供第六个奖励维度,线上部署的仍是单个 8B 策略,不增加任何服务延迟。
核心方法
整个方法的直觉是:好的后续编辑建议必须同时“有人想点”和“图上做得到”,而这两个性质需要不同的监督来源,因此设计成三阶段递进框架。Stage 1 解决任务监督缺失:真实在线请求只有输入 $(I,q,e)$ 而没有推荐目标,于是作者定义 61 种编辑意图并人工构建“当前意图→合适的后续意图”映射表,让教师模型 Gemini 3 Flash 只看输入和允许的后续意图来写候选,再经意图标签检查、结构/措辞/重复/粗粒度图像相关性验证和产品规则层过滤,组装成每条 6 个建议的 SFT 目标,用 rank-4 LoRA 微调 Qwen3-VL-8B(冻结视觉编码器)。Stage 2 解决偏好监督缺失:从真实点击日志构造位置感知偏好对,训练 8B 视觉语言奖励模型,再用 GRPO 联合优化五个奖励维度——点击偏好、输出门控(合法 JSON、5-7 条、意图标签合法)、SFT 下的对数似然(即负对数困惑度 $r_{ppl}$,约束不偏离 SFT 分布)、内容感知长度(按内容密度类别分配字符预算)、以及用 Qwen3-Embedding 最大相似对衡量的列表内多样性 $r_{div}=1-\max_{j<j'} e_{s_{jj'}}$。Stage 3 解决视觉一致性监督缺失:引入冻结的 Qwen3-VL-30B-A3B 验证器做源-目标检查,接地分数 $\hat{g}(Y,I)$ 作为第六个奖励(权重固定 $\lambda_{grd}=0.5$)加入新一轮从 SFT 初始化的 GRPO 训练。
核心创新是图像优先的源-目标验证。一条编辑指令描述从当前图像到新状态的改变,可拆分为必需源 $S(y)$(编辑前必须已存在于图像中的对象或状态)和目标状态 $T(y)$(编辑后的期望状态),二者遵循相反规则:每个源必须已经可见,而视觉可查的目标不应已被满足。由此定义两种失败模式:缺失源 $v_{ms}(y,I)=1$ 表示某个 $s\in S(y)$ 在 $I$ 中不存在(如“移除帽子”但图中没有帽子);目标已满足 $v_{as}(y,I)=1$ 表示请求的编辑后状态已经成立(如“把帽子变红”但帽子已经是红的)。关键设计有四点:第一,验证器先做图像观察再读候选,防止“移除帽子”这类措辞诱导模型幻觉出帽子;第二,源必须从候选原文引用,且颜色/姿态/风格等属性不能单独充当源;第三,主观或无法从图像判断的目标检查 fail-open,不确定时不计为错误;第四,不一致标志从结构化 JSON 字段推导而非自由文本解释。这与既有幻觉对齐工作的本质区别在于:caption 级事实性只检验“关于图像的陈述是否为真”,而编辑有效性存在源-目标不对称性——编辑可以引入全新的目标(“加一顶帽子”不需要图里先有帽子),但它消耗的源必须可见,这种不对称性是 caption 级度量无法捕获的。
方法步骤详情
Stage 1 数据构造:从 120.0K 条在线请求出发,剔除无可用图像的请求、合并重试导致的重复查询并把原图复制到稳定存储,得到 44.3K 个可用上下文。61 种编辑意图的人工审核表经复核后,通过通用、优先、续填三条轨道生成候选:Gemini 3 Flash 只接收 $(I,q,e)$ 和允许的后续意图,按意图分组写出候选。校验管线(意图标签检查→结构/措辞/重复/粗粒度图像相关性验证→产品规则层)把通用轨道从 359K 条候选缩到 243K;每个上下文按预定义意图顺序恰好保留 6 条,最终产出 41.6K 个完整列表、39.5K 个训练列表,用 rank-4 LoRA 微调 Qwen3-VL-8B(冻结视觉编码器),该 SFT 模型同时是 RL 的初始化和参考策略。Stage 2:每个非空会话最多取一条含有效点击的印象,位置感知规则把被点击建议记为 $y^+$,只与展示在它上方的未点击建议组成 $y^-$,共 173,071 对(164,401 训练/8,670 验证,按请求 ID 切分)。奖励模型用 Bradley–Terry 目标训练,slate 级分数取建议分数平均 $\bar{r}_\phi(Y)=\frac{1}{N}\sum_{j=1}^N r_\phi(x,y_j)$,与随机展示 3 条的期望一致。GRPO 在 98K 上下文上进行,每上下文采样 $G=8$ 个列表,五个奖励各自组内归一化 $\hat{A}_k^i=(r_k^i-\mu_{k,x})/(\sigma_{k,x}+\epsilon)$ 后按权重求和再做 masked batch standardization,长度与多样性权重经 EMA 缺口 $\delta_k$ 动态调整并设上限。Stage 3:冻结的 Qwen3-VL-30B-A3B 验证器按四步执行——图像观察(读候选前记录可见对象、人物、文字、区域)、源-目标拆分、分开的存在性与已满足性检查(源需给出位置和外观描述,目标检查并排对比期望与当前状态)、结构化不一致检测(JSON 字段为权威输出,解析失败 fail-open)。接地奖励 $\hat{g}(Y,I)=1-\frac{1}{N}\sum_{j=1}^N \hat{v}(y_j,I)$ 作为第六维($\lambda_{grd}=0.5$)加入从 SFT 重新初始化的 GRPO。
技术新颖性
技术新颖性体现在五个层面。其一,任务形式化本身是新的:多模态后续编辑推荐要求建议同时满足行为偏好和视觉有效性,作者用 80.1% 图像依赖的审计数据论证了该设定与纯文本 query 建议的本质差异。其二,位置感知点击对构造简单而有效:在匹配 51.9K 数据预算和共享 2B 骨干下把保留点击准确率从 0.619 提到 0.690,且不需要完整的倾向性修正。其三,源-目标结构化验证以极低的误拒率(0.6% 对单遍基线的 22.2%)换来高召回(78.7% 对 47.5%),证明“先看图再读候选”加“源与目标分开检查”的结构对 RL 至关重要——高误拒会惩罚合理的创意编辑、诱导模型产出安全但平庸的建议。其四,训练时验证器、服务时单策略的解耦设计,让 8B 部署模型免费获得 30B 验证器的监督,推理成本零增加。其五,多目标 GRPO 的逐维归一化加动态文本侧权重:归一化防止某个奖励的数值尺度淹没其他维度,动态权重在多样性约束未达标时加压、达标时放松,并设置上限防止模型为了显得多样而编造无关对象。以 14 天、每臂 5% 流量、数百万用户规模的线上 A/B 测试验证,在学术论文中相当罕见。
实验结果
端到端结果(Table 1,500 个真实会话离线评测):相对提示工程基线 PE 的专家评分 GSB 逐级上升——SFT +332、Stage 2 +405、完整框架 +446;视觉不一致率走向不同:PE 8.6%、SFT 3.0%、Stage 2 反弹到 3.7%、完整框架压到 0.9%;冗余率从 23.3% 一路降到 8.8%。线上 14 天用户级随机 A/B(每臂 5% 流量、数百万用户):完整框架相对 PE 实现 CTR +32.70%、图片留存率 +16.32%、人均对话轮次 +39.90%(均 $p<0.05$)。注意 Stage 2 的 CTR 提升最高(+33.48%)但留存率(+7.50%)和轮次(+32.56%)反而低于 SFT,说明纯点击优化损害了后续编辑路径。RL 组件累积消融(Table 2,从 SFT 出发):+核心 RL 后 GSB +374 但不一致率涨到 4.4%、冗余涨到 28.1%;+最大对多样性 +383/4.0/19.1;+逐维归一化与动态权重 +405/3.7/11.9;+接地奖励 +446/0.9/8.8。点击对与 RM 规模消融(Table 3,2,199 个请求内专家对):位置感知构造把 2B 模型保留点击准确率从 0.619 提到 0.690;专家一致性从 raw-pair 2B 的 0.490 升到位置感知 8B 的 0.569;但 Tier0–Tier1 反转率在 0.040–0.041 处停滞,证明更大的点击 RM 仍学不会视觉可执行性。验证器消融(Table 4,488 个不一致 + 491 个优秀建议):源-目标验证召回 78.7%、误拒仅 0.6%;单遍基线召回 47.5%、误拒 22.2%;缺失源召回 92.9% 对 61.6%,已满足目标 74.5% 对 43.4%。阶段分解(Table 5):Stage 3 相对 Stage 2 缺失源错误降 40.0%(0.70%→0.42%),已满足目标错误降 84.0%(3.00%→0.48%),联合不一致率降 75.7%(3.7%→0.9%)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 视觉一致性(离线审计,500 真实会话,外部 Gemini 3.1 Pro 评估) | 视觉不一致率(越低越好) | 0.9%(完整三阶段框架) | PE 提示工程基线 8.6%;Stage 2 点击 RL 3.7% | 相对 PE 降低约 89.5%,相对 Stage 2 降低 75.7% |
| 线上推荐效果(14 天用户级随机 A/B,每臂 5% 流量,数百万用户) | 推荐 CTR / 图片留存率 / 人均对话轮次的 PE 相对提升 | CTR +32.70%、留存率 +16.32%、轮次 +39.90% | PE 提示工程策略(对照组,提升为 0) | 三项均统计显著(p<0.05),且留存与轮次超过 SFT 和 Stage 2 |
| 专家评分质量(8 位专家、每臂 800 条建议、0-3 分盲评) | GSB(相对 PE 的聚合分差) | +446(完整框架) | PE 为 0(报告基准);SFT +332、Stage 2 +405 | 相对 SFT 提升 +114,且在不一致率大降的同时仍为最高 |
| 验证器质量(校准集:488 个视觉不一致 + 491 个优秀建议) | 不一致召回率 / 误拒率 | 78.7% 召回 / 0.6% 误拒(源-目标验证器) | 单遍 VLM 验证器:47.5% 召回 / 22.2% 误拒 | 召回 +31.2 个百分点,误拒下降 21.6 个百分点 |
| 奖励模型偏好学习(2,199 个请求内专家对) | 专家一致性 / 最低两档反转率 | 0.569(位置感知 8B)/ 0.041 | raw-pair 2B:0.490 / 0.090 | 一致性 +0.079、反转率减半,但反转率在 8B 停滞揭示点击监督的上限 |
局限与改进
作者层面承认的局限包括:位置感知配对只能减少而不能消除展示位置偏差,完整的倾向性修正(显式估计观看概率)并未实现;验证器对不确定、无法解析或调用失败的情况一律 fail-open 记为无错误,这虽然避免噪声惩罚但会漏掉真实错误;已满足目标的召回率(74.5%)明显低于缺失源(92.9%),状态比较仍是较弱的一环。我自己观察到的问题:视觉不一致率 0.9% 并非零,在数百万用户的规模下仍意味着每天大量失败编辑;整套系统深度绑定 Qwen App 的数据分布和 61 种人工审核意图表,跨产品、跨语言、跨文化场景的泛化完全未验证;离线评测只有 500 个会话、GSB 依赖 8 位专家的主观盲评,外部审计虽然经 1,276 条分层盲校(90.7% 召回、89.0% 精度)但校准本身由竞品模型 Gemini 3.1 Pro 完成,存在供应商依赖;点击监督天然存在选择偏差——只有被点击的建议才有正标签,冷门但优质的建议方向可能被系统性低估;论文没有报告推理延迟、失败率和负面反馈的绝对数值,只说作为上线约束被监控;代码、数据和模型均未开源。
独立分析的弱点
第一,fail-open 的奖励漏洞:不确定或解析失败时 $\hat{v}=0$ 意味着策略理论上可以通过生成验证器看不懂的建议来逃避接地惩罚,训练中虽有日志监控但没有机制阻止这种规避。改进方向是引入不确定度感知加权(对不确定样本降低而非清零奖励)或对高不确定样本做主动学习人工标注。第二,目标状态比较是短板:74.5% 的召回意味着每四条冗余编辑仍有一条漏网,“期望状态与当前状态并排对比”这种文本化比较对颜色、光照等细粒度属性可能不够,可引入区域级视觉差异特征或专门的状态变化检测器。第三,展示层随机选 3 条完全浪费了策略对 6 条候选的排序信息, Slate 级奖励也只是建议分数的简单平均 $\bar{r}_\phi(Y)$,忽略了列表内的组合效应;可以学习展示策略或用 listwise 奖励建模。第四,长度与多样性权重动态调整依赖人工设定的目标和上限,超参敏感且缺乏理论支撑,换成约束优化或自动搜索更稳健。第五,评估闭环依赖竞品模型(训练验证器用 Qwen,审计用 Gemini),两家模型的系统性偏差可能让审计低估与自家验证器同源的错误。
未来方向
作者明确留下的方向包括:实现完整的倾向性修正以进一步消除位置偏差、扩展验证器覆盖更多失败模式。从成果可自然延伸的研究有:第一,把验证器的能力蒸馏进策略本身,让 8B 模型在生成时就内化源-目标检查,甚至生成前先做一步显式的图像观察推理;第二,验证器与策略的联合训练或迭代式 DPO——用验证器离线构造偏好对替代在线 RL,可以大幅降低训练成本;第三,把源-目标接地范式推广到视频编辑(时间维度的源存在性)、3D 场景编辑和多图编辑等更复杂的视觉状态管理任务;第四,打破人工意图表的瓶颈,用无监督方法从用户日志中自动发现和演化意图空间,让动作空间随产品生态自增长;第五,跨轮意图记忆与长会话建模——本文只用改写后的当前查询,未利用更早轮次的编辑历史;第六,从“建议可执行”进一步走向“建议价值预测”,把编辑成功率、用户编辑后满意度纳入奖励,形成编辑建议-执行-反馈的完整闭环学习。
复现评估
复现难度为高。论文未开源代码、数据和模型权重。有利条件是骨干模型均可获取:Qwen3-VL-8B(策略、SFT 参考、奖励模型)、Qwen3-VL-30B-A3B(验证器)、Qwen3-Embedding(多样性)都是开源模型,Gemini 3 Flash/3.1 Pro 是商业 API;训练方法全部基于公开技术(LoRA、Bradley–Terry、GRPO、KL 正则)。不利条件有三:其一,核心数据完全不可得——44.3K 个真实图像编辑上下文、173,071 个点击偏好对、98K 个 RL 上下文都来自 Qwen App 生产日志,涉及图像的稳定存储和用户行为数据,学术界无法重建;其二,61 种意图的人工审核表和三条生成轨道的细节只在附录中给出部分,人工校验环节(8 位专家盲评、1,276 条分层校准)成本高昂;其三,RL 基础设施要求不低——GRPO 每上下文 8 个 rollout、每个 rollout 需一次奖励模型前向和一次 30B 验证器调用,加上 PPL 计算,训练算力估计需要多卡 A100 级别运行数天。学术研究者可以在开源多模态对话数据上搭建小规模复刻验证源-目标验证器的核心主张(这部分最可复现),但 80.1% 图像依赖审计、A/B 测试结论等核心证据本质上无法独立验证。
论文图表
对比两类策略在同一多轮编辑会话中的表现:左边只有点击监督、没有视觉一致性监督的策略,提出了依赖图中不存在的源的编辑(missing-source)和对已满足目标的冗余编辑(already-satisfied),用户最终只能选择其中可执行的调整光照编辑;右边是完整框架,在更新的图像上提出了可执行、图像一致且不重复的后续编辑。
这是论文问题意识的可视化浓缩:一眼看懂“只有点击信号不够”这一核心论点,展示了缺失源和已满足目标两类视觉不一致错误的具体样例,是理解 Stage 3 动机的最快入口。