搜索超越可教范围:智能体视觉生成中的知识边界演进 Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
提出可演进知识边界概念,用搜索智能体协同训练突破图像生成的世界知识瓶颈
前置知识
检索增强生成(RAG)
在模型推理时从外部知识库检索相关文档注入上下文,以弥补模型参数化知识的不足。文本领域已有 REALM、Atlas、REPLUG 等将检索器与语言模型联合训练的范式。本文把它推广到视觉生成:当图像生成器不具备某个视觉概念(如某游戏角色的固定造型)时,通过搜索引擎检索图像或文本参考来补充。
理解 RAG 的核心思想(参数知识 vs 外部知识)才能理解本文为什么提出「该不该检索」是一个需要专门学习的决策。
扩散模型与流匹配(Diffusion / Flow Matching)
本文实验用的两类生成器:Flux.2-Klein-4B 是流匹配模型(用速度场 $v_\theta(x_t,t)$ 拟合从噪声到数据的常微分方程),Bagel-7B 是统一视觉-语言模型。两者都支持文本到图像和参考图到图像两种条件生成,因此被选来验证方法的架构无关性。
方法的核心训练阶段(Phase 1 DPO)是针对流匹配速度场设计的,需要理解 $v_\theta$ 才能看懂偏好优化损失。
直接偏好优化(DPO)
DPO 不显式训练奖励模型,而是直接用偏好对 $(x^w, x^l)$ 优化策略,使模型对优选样本的概率相对参考模型上升。本文把它改造为扩散/流匹配版(Diffusion-DPO):在搜索增强提示 $\tilde{p}$ 下,对同 prompt 采样 $M$ 张图按评测打分,取最高最低构成偏好对,用 $\mathcal{L}_{DPO}= -\mathbb{E}[\log\sigma(\beta\log\frac{v_\theta(x^w_t|\tilde{p})}{v_{\theta_{ref}}(x^w_t|\tilde{p})}-\log\frac{v_\theta(x^l_t|\tilde{p})}{v_{\theta_{ref}}(x^l_t|\tilde{p})})]$ 更新生成器。
Phase 1 通过 DPO 把生成器的知识边界向外推,是整个协同训练框架能「教会生成器它原本不知道的东西」的关键机制。
拒绝采样微调(Rejection Sampling Finetuning, RFT)
从策略中 rollout $N$ 条轨迹、按奖励打分、计算组相对优势 $A_n=\frac{s_n-\bar{s}}{\sigma_s+\delta}$,只保留 $A_n>0$ 的正优势轨迹做监督微调。本文用它在 Phase 2 重新校准推理器:让推理器学会「何时该搜索、何时不该搜索」。
Phase 2 让搜索策略向内收缩以匹配被 DPO 强化后的生成器边界,是实现「搜索器-生成器协调」的核心。
知识边界(Knowledge Boundary)
本文提出的形式化概念:把世界知识单元集合 $K$ 按生成器参数 $\theta$ 划分为可内化的 $K_{int}(\theta)$ 和必须留在上下文的 $K_{ctx}(\theta)$。判定标准是对容忍度 $\epsilon$,若搜索带来的质量增益期望低于 $\epsilon$ 则属于可内化集:$K_{int}(\theta)=\{k\in K:\mathbb{E}_{p|k}[Q(G_\theta,p,\text{SEARCH}(k))-Q(G_\theta,p,\emptyset)]<\epsilon\}$。该边界与生成器相关、随训练漂移。
这是全文的理论基石——整个方法的动机、训练阶段的设计、实验的三个可证伪预测都围绕「边界是可被协同训练发现的」这一论点展开。
研究动机
现代图像生成器在标准基准上已近乎饱和(Flux.2-Klein-9B 在 GenAI-Bench 上 >4.0/5.0),但在真实生产场景中却会「自信地编造」它根本不知道的内容:让它画 2025 年大阪世博会吉祥物会得到一个精致但完全错误的形象,画斯巴达方阵会渲染出时代错乱的铠甲。作者从生产级 AIGC 平台分析了 20,840 条用户 prompt,提炼出 12 类失败模式,覆盖时效类(近期/当下事件)、实体与 IP、概念与符号、历史事实、文化特异性、UI/UX、数据可视化、字体排印、复合任务等 22 个领域。核心问题是世界知识瓶颈:生成器在固定语料上训练、有不可避免的截止日期,而用户请求是无界、演化、长尾的——他们分析了 31,537 个实体,其中 93.1% 只出现在单条 prompt 中,参数化学习在结构上无法覆盖这个长尾。更严重的是,现有基准完全看不见这个失败:前沿开源生成器在 NoSearch 子集(仅需参数知识)上能拿到 63–75 分,但在需要外部知识的 Search-Intensive 子集上直接坍塌到 21–28 分,差距高达近 40 分,而 GPT-Image-2 因为内置了实时搜索只掉 0.1 分。
本文的目标是作者要构建一个能像插画师那样「画不熟悉的东西前先查资料」的智能体视觉生成系统,并系统性地解决三个层层递进的目标:第一,量化并暴露这个被现有基准掩盖的世界知识瓶颈,为此构建一个覆盖 22 个领域、12 类失败模式、中英双语(英文 58% 均长 266 字符、中文 42% 均长 89 字符)、平均每条 prompt 带 5.2 个知识缺口(90.5% 带 3 个以上)的大规模基准 SEARCHGEN-BENCH,并配上可离线复现的 100 万级搜索语料 SEARCHGEN-CORPUS-1M;第二,搞清楚为什么朴素的「每次都搜索」会失败,并把它形式化为「搜索器-生成器协调问题」;第三,提出一个最小但可证的协同训练配方,让搜索策略和生成器能力互相校准,使得「协同训练后的 8B 推理器 + 4B 生成器」能在同一生成器上追平甚至超过万亿参数的前沿 VLM(Gemini-3)作为推理器时的表现。
与已有工作不同的是,已有工作的盲点在于把搜索当成「永远开启」的开关:Re-Imagen、RDM、KNN-Diffusion、IP-Adapter、DreamBooth 等视觉检索增强方法都对每条 prompt 触发检索,从不考虑「生成器其实已经知道这个概念」。文本领域的 Self-RAG、FLARE、Toolformer 虽然研究了何时检索,但它们针对固定生成模型学习检索策略,且视觉搜索的失败模式(空间扭曲、身份混合、风格污染)没有文本对应物。本文的独特切入角度是抓住了一个被所有人忽视的结构事实:知识该不该搜索,取决于「这个生成器」现在的能力——一个对弱生成器有益的搜索策略,换个强生成器可能就有害。因此边界是生成器特异的、随训练演化的,必须靠协同训练去发现,而不是靠先验规则去规定。这个「teach-then-search」的互补顺序(先教生成器能内化的,再校准推理器去搜剩下的)是和所有已有工作的本质区别。
核心方法
直觉上,作者把图像生成器比作插画师:插画师接到不熟悉的委托会先翻参考资料再下笔,但绝不会把参考图原样临摹下来——他会提取需要的知识(角色的服装剪裁、旗帜的色块结构)而丢弃无关信息(参考图的背景、构图、风格)。技术路线就是模拟这个过程:用一个 VLM 推理器作为「插画师的大脑」,配两个搜索工具(Google 图像搜索 + Web 文本搜索),执行三阶段 gate-filter-integrate 协议——先决定何时搜、搜哪种模态(gate),再从返回结果里挑出真正填上缺口的参考(filter),最后把原始参考图改写成自然语言指令喂给生成器,避免像素级噪声泄漏(integrate)。但单有这个协议还不够,因为「该不该搜」本身依赖生成器的能力。于是作者叠加了协同训练框架:Phase 0 监督热启动让推理器学会三阶段协议;Phase 1 用在线迭代 DPO 把生成器喂满它原本缺的知识、同时锻炼它抵抗噪声参考的能力,把知识边界向外推;Phase 2 用 RFT 重新校准推理器,让它只在边界外才触发搜索,把搜索范围向内收。两阶段在边界上做方向相反、相互匹配的运动。
全文最核心的创新是「知识边界是生成器特异的、可演化的,且可通过协同训练发现」这一论点,并用形式化定义和实验共同支撑它。形式化上,把世界知识 $K$ 划分为可内化集 $K_{int}(\theta)=\{k: \mathbb{E}_{p|k}[Q(G_\theta,p,\text{SEARCH}(k))-Q(G_\theta,p,\emptyset)]<\epsilon\}$ 和上下文集 $K_{ctx}(\theta)=K\setminus K_{int}(\theta)$,边界随 DPO 满足 $K_{int}(\theta)\subseteq K_{int}(\theta')$ 单调外扩。和已有方法最本质的区别在于:以前所有「何时检索」的学习都是对固定生成器学的,搜索策略被视为提示分布的属性;本文则证明搜索策略是「生成器-推理器」二元组的联合属性——为生成器 A 校准的策略换到生成器 B 上就次优,这点被 Table 6 的 cross-check 直接验证(校准到 Klein-4B-DPO 的推理器放回 base Klein-4B 上整体分从 31.8 掉到 26.8)。第二个本质区别是先 teach 再 search 的非对称顺序,区别于对称的自博弈。
方法步骤详情
完整流程分四个阶段。Phase 0 监督热启动:收集约 10,000 条专家标注的 Task A/B/C 轨迹(一一对应 gate/filter/integrate 三阶段),对 Qwen3-VL-8B 做交叉熵 SFT,得到能产出结构化分析但仍「生成器无关」的推理器。Phase 1 在线迭代 DPO(针对生成器):每个 episode 采样一批 prompt,对每条 prompt 先用热启动推理器跑 gate-filter-integrate 得到搜索增强规范 $\tilde{p}$(含过滤后的参考图与整合后的文本指令),生成器据此采样 $M$ 张图,用 SEARCHGEN-BENCH 的 9 维评测协议打分,取最高分 $x^w$ 和最低分 $x^l$ 构成偏好对,按流匹配 DPO 损失更新(温度 $\beta=100$、参考模型用 EMA 衰减 0.99 更新),多轮迭代后得到边界外扩的 $G^{(1)}_\theta$,同时因训练时见到带噪参考而习得抗噪能力。Phase 2 RFT(针对推理器):把 Phase 0 推理器与 $G^{(1)}_\theta$ 配对,对每条 prompt rollout $N$ 条搜索轨迹、生成对应图像并打分 $s_n$,计算组相对优势 $A_n=(s_n-\bar{s})/(\sigma_s+\delta)$,只保留 $A_n>0$ 的轨迹做 SFT——正确「放弃搜索」的轨迹得高分被强化,错误搜索搞坏输出的轨迹被丢弃,整个 RFT 在 $4\times8$ GPU 小时内跑完。推理时,最终 $(G^{(1)}_\theta, R^{(1)}_\phi)$ 联合部署,推理器只在 $K_{ctx}$ 上触发搜索。
技术新颖性
技术新颖性体现在三处。其一,gate-filter-integrate 是首个针对视觉搜索噪声三段式结构化设计的协议:gate 解决「概念腐蚀」(搜索覆盖了生成器本就掌握的准确知识)、filter 解决「拷贝效应」(参考图信息过载变成临摹模板)、integrate 通过把视觉参考改写为自然语言「借这个、不借那个」的指令来阻断像素级风格/背景泄漏,这种 modality-aware(区分 image/web 两类工具)+ 逐缺口决策的设计在视觉领域没有先例。其二,形式化的知识边界定义 $K_{int}(\theta)/K_{ctx}(\theta)$ 把 Mallen 等人在文本域关于「流行实体靠参数、稀有实体靠检索」的经验观察,升级为可操作、可被协同训练发现的设计变量,并明确指出它依赖 $\theta$ 且单调外扩。其三,teach-then-search 的非对称协同训练——Phase 1 DPO 外推边界并练抗噪、Phase 2 RFT 内收搜索范围——区别于对称自博弈(如 SPIN),因为生成器和推理器占据结构上不同的角色、朝相反方向改进。这三点叠加,把「是否搜索」从一个工程调参问题提升为一阶设计变量。
实验结果
实验围绕三个可证伪预测逐一验证。Finding 1(瓶颈的真实性与现有基准的盲区):在 NoSearch 子集上开源与商用生成器都聚在 63–75 分,但切到 Search-Intensive 子集立刻断裂——开源生成器坍塌到 21–28 分(Flux.2-Klein-9B 的 Checklist 仅 24.2、Visual Reference 仅 16.9),而内置搜索的商用系统几乎不掉(GPT-Image-2 仅 −0.1、Nano Banana Pro 仅 −9.7)。Table 4 进一步证明坍塌发生在知识敏感维度(Checklist/Rubric/Visual Reference)而非渲染维度(Image Quality/Physical Plausibility 保持 36–48),即失败是知识缺失而非能力不足。Finding 2(朴素搜索是第二个问题):BlindSearch 在 NoSearch 子集上严格劣化每个生成器,Qwen-Image-2 从 70.7 掉到 60.4(相对 −14.6%);ReasonedSearch(Gemini-3-Flash 选择性搜索)则能把 TextualSearch 从 22.9 拉到 34.1 同时保住 NoSearch(70.7→76.5)。Finding 3(协同训练发现知识边界):Table 6 显示三阶段单调递增,Klein-4B 从 26.4→29.2→31.8、Bagel 从 23.4→24.7→26.8;其中 Phase 1 DPO 贡献 +2.8、Phase 2 RFT 再加 +2.6。最锋利的证据是「协同训练的 8B 推理器 + 4B 生成器」在 Klein-4B-DPO 上拿到 31.8,略超同生成器配万亿参数 Gemini-3 oracle 的 31.2——说明生成器特异性校准能在极小算力下逼近前沿推理。选择性方面,Phase 2 在 NoSearch 上拿到 56.9,比无搜索 DPO 基线 49.9 高 +7.0,证明推理器学会了「何时不搜」。生成器特异性方面,把校准到 Klein-4B-DPO 的推理器放回 base Klein-4B 整体掉到 26.8、Set III(最难)增益大幅缩水,证明策略是生成器-推理器二元组的联合属性。Figure 9b 用无搜索质量分数的 CDF 直观展示 DPO 后曲线右移、低分 prompt 变少、高分变多,可量化「新内化知识」(平均 +3.0 / +2.5 分)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| SEARCHGEN-BENCH Search-Intensive(651 prompt,综合分) | 9维评测综合分(0-100) | 协同训练 RFT-8B + Klein-4B-DPO = 31.8;+ Bagel-DPO = 26.8 | NoSearch + Klein-4B-DPO = 25.0;前沿 Gemini-3 oracle + Klein-4B-DPO = 31.2 | Klein-4B 从 NO SEARCH 到 GENERATOR-ADAPTIVE 共 +6.8;8B 协同训练比万亿 oracle 还高 +0.6 |
| NoSearch 子集(100 prompt,本不该搜索) | 9维评测综合分 | Phase 2 RFT-8B + Klein-4B-DPO = 56.9 | NoSearch + Klein-4B-DPO = 49.9;BlindSearch = 54.6 | 比无搜索 DPO +7.0,证明推理器学会放弃多余搜索 |
| Search-Intensive Set III(最难三分位) | 综合分 | Phase 2 RFT-8B + Klein-4B-DPO = 27.4 | BlindSearch Phase 0 = 21.2;NoSearch DPO = 20.6 | 最难子集增益最大 +6.2,与边界外扩后空间最大一致 |
| 朴素搜索危害(NoSearch 上 BlindSearch) | 综合分 | —(指出现象) | Qwen-Image-2 无搜索 70.7 | BlindSearch 降至 60.4(相对 −14.6%),证实盲目搜索是第二问题 |
| 前沿系统对比(世界知识瓶颈规模) | SEARCHGEN-BENCH 综合分 | 开源协同训练 31.8(4B 生成器) | GPT-Image-2 = 71.0(仅 −0.1);Nano Banana Pro = 65.3(−9.7) | 揭示 39 分绝对差距来自 4B 生成器容量上限,非框架局限 |
局限与改进
作者明确承认的局限有三点:一是采用的「最小配方」(单次 DPO + 单次 RFT、4B 生成器、8B 推理器)与 GPT-Image-2 的 71.0 仍有约 39 分的绝对差距,作者把这归因于 4B 生成器容量而非框架,但并未给出沿生成器规模轴的扫描证据;二是知识边界目前只能通过完整的协同训练动态「事后发现」,尚未实现从模型内部(探测分类器或不确定性估计)直接预测;三是评测依赖单一裁判 Gemini-3-Flash,虽然设计了 9 维细粒度协议并做了知识敏感/渲染不变的解耦,但未报告裁判一致性的稳健性分析(如换裁判后排名是否稳定)。我自己的观察补充几点:第一,gate 阶段只保留 critical/important 缺口、最多 3 条查询,这种启发式阈值是否对所有 12 类失败模式最优未作消融;第二,filter/integrate 的「把参考图改写为自然语言」虽然能降噪,但必然丢失精细的视觉纹理信息(如字体字形、刺绣纹样),对 Text/Typography、Visual/UI 这类高度依赖像素级保真度的失败类可能不利;第三,整个 SEARCHGEN-CORPUS-1M 的搜索结果是冻结快照,真实线上搜索结果会漂移,离线复现的分与线上分可能存在系统偏差;第四,数据集虽双语但中文仅 42%,对中文长尾文化实体(地域性强、互联网曝光少的符号)覆盖深度有限。
独立分析的弱点
第一,知识边界定义中的容忍度 $\epsilon$ 与质量函数 $Q$ 在论文里只是概念性占位,并未给出工程上如何选定的细节,$\epsilon$ 取值不同会显著改变 $K_{int}/K_{ctx}$ 的划分,建议未来工作给出 $\epsilon$ 的敏感性曲线或自适应选择方法。第二,integrate 阶段将视觉参考改写为自然语言是抗噪的关键,但对「像素级身份必须 1:1 复现」的任务(如某明星的脸、某品牌 logo 的精确字形)是劣化——VLM 描述「蓝金长袍」远不如直接把像素喂进 cross-attention,改进方向是设计一个「该用语言描述还是该用像素条件」的模态路由器,让 integrate 自适应。第三,filter 与 gate 都依赖 Qwen3-VL-8B 的判断质量,在文化特异性极强的长尾(如墨西哥 alebrije 龙的色块约定、不丹国旗的 Druk 龙纹)上,8B 推理器自身可能就判不准「什么是有用的参考」,建议引入检索后的人类/强模型校验做蒸馏。第四,只做了单轮 DPO+单轮 RFT,未验证作者反复强调的「递归自改进飞轮」是否真能持续单调收敛而不饱和或震荡——这是全文最大的愿景却未给出多轮证据,改进方向是跑 3–5 轮并报告每轮边界位移曲线与是否出现收益递减。第五,评测只有单一裁判,建议加入多裁判集成或小规模人工校准以排除裁判偏差。
未来方向
作者在结论里明确提出若干方向:知识边界的缩放律(internalizable 集是否随生成器规模均匀扩张,还是某些类如文化特异性天然抗内化);能否用探测分类器或不确定性估计从模型内部直接预测边界,免去完整协同训练;internalizable/contextual 的二分能否推广到视频、3D、音乐等其他受限于「有限训练数据 vs 无界请求」的模态。基于本成果可延伸的方向我补充三点:一是把 gate-filter-integrate 协议和 teach-then-search 协同训练推广到「工具箱」——图像编辑、渲染即代码(SVG/matplotlib/CAD)、3D 资产检索等,研究单一 agent 能否学到跨工具的统一边界;二是把知识边界与不确定性校准、主动学习结合,让推理器在边界模糊区域主动请求人类反馈,构建人在回路的视觉生成;三是 SEARCHGEN-CORPUS-1M 的冻结特性正好可作为「可重放的 Web」做检索增强偏好学习与奖励建模的标准沙盒,可催生一批可复现的检索策略研究。
复现评估
复现友好度是本文的显著亮点。作者不仅放出了代码和模型,还围绕「可重放」做了大量工程投入:开源 SEARCHGEN-20K(20,839 prompt)、SEARCHGEN-BENCH(751 测试 prompt 带 9 维细粒度评测协议)、以及最重要的 SEARCHGEN-CORPUS-1M——145,642 条归档图像/Web 搜索会话、559,973 个唯一 URL、370,733 个缓存下载,使整套流水线可在无任何实时搜索 API 密钥、无搜索结果漂移的情况下离线重放,把昂贵的在线搜索工作流降级为离线 substrate。还放出 90,452 条推理轨迹(多个前沿推理器)和 281,925 张生成图(多推理器×多生成器组合),可直接用于偏好学习与蒸馏。算力需求方面,Phase 1 在线迭代 DPO 需要批量采样 $M$ 张图并打分(论文未给绝对 GPU 数,但 DPO 是扩散模型训练里相对重的环节),Phase 2 RFT 明确标注仅需 $4\times8$ GPU 小时即可完成,对学术实验室友好。主要复现门槛在于:评测依赖 Gemini-3-Flash 商用 API(裁判打分有成本且未来会漂移),以及 DPO 阶段的算力;但有了冻结语料,去掉实时搜索这层后整体复现难度大幅降低,是近期视觉生成 RAG 工作里复现性最好的一档。
论文图表
这张拼图展示了 12 类真实失败模式的生成样例,从时效类(2025 大阪世博会吉祥物、当前世界杯积分榜)、实体 IP(崩坏星穹铁道 Jingliu)、概念符号(不丹国旗)、历史事实(温泉关斯巴达方阵)、文化特异性(瓦哈卡 alebrije 龙)、数据可视化(中国朝代时间线)到复合任务(阿兹特克风 DNA 复制信息图)等,每张都标注了生成器为什么会出错。
它是理解论文动机的最直观入口——读者一眼就能看到生成器不是「画得不好」而是「不知道画什么」,把抽象的世界知识瓶颈具象化。
(a) 实体频率分布显示 31,537 个唯一视觉实体中 93.1% 只出现在单条 prompt,证实真实请求的极端长尾;(b) 多模态知识缺口分布显示平均每条 prompt 带 5.2 个知识缺口、90.5% 带 3 个以上,且 6.7% 带超过 13 个。
它用数据直接论证了「参数化训练无法覆盖长尾、搜索在结构上不可避免」这一核心论点,是动机部分最有力的量化证据。