← 返回 2026-09-10

AgenticGen:面向广告投放的奖励引导智能体视频生成框架 AgenticGen: Reward-Guided Agentic Video Generation for Advertising

Xingyuan Bu, Chengru Song, Hao Zhou, Tao Zhou, Dong Li, Wei Li, Shilong Li, Hao Shi, Yongxin Guo, Donghao Zhou, Qiangpeng Yang, Shilei Wen 📅 2026-08-31 👍 8 2026-09-12 18:30
DPO GRPO 在线A/B实验 奖励模型 强化学习 智能体视频生成 计算广告

把广告视频生成分解为策略选择与草稿生成两阶段,用线上业务反馈训练奖励模型驱动DPO+GRPO优化。

前置知识

DPO(直接偏好优化)

DPO 是一种离线偏好优化方法,跳过训练独立奖励模型的步骤,直接从成对偏好数据 $(X, Y^+, Y^-)$ 优化策略。其核心是构造策略与参考策略的对数概率比作为隐式奖励 $r_\psi(X,Y)=\beta\log\frac{\pi_\psi(Y|X)}{\pi_{ref}(Y|X)}$,然后最大化类似 Bradley-Terry 的损失,让偏好回答的概率上升、非偏好回答下降。相比 PPO 等 RL 方法实现简单、训练稳定。

本文用 DPO 作为 GRPO 之前的离线热身阶段,利用印象均衡投放数据把 SFT 策略先拉向业务偏好,减轻后续在线 RL 的负担。理解 DPO 才能看懂为什么两阶段训练依次进行以及附录 C 的偏好准确率如何定义。

GRPO(组相对策略优化)

GRPO 是一种在线强化学习算法:对同一输入从当前策略采样一组 $G$ 个输出(本文 $G=8$),用组内奖励归一化计算优势 $A_i=\frac{R_i-\mathrm{mean}(\{R_1,\dots,R_G\})}{\mathrm{std}(\{R_1,\dots,R_G\})}$,再用带裁剪的 PPO 式目标更新策略。它省去了价值网络,适合奖励来自多个模型打分的场景。

本文的 GRPO 是第二阶段的核心训练算法,策略选择用过程奖励、草稿生成用结果奖励,都是通过组相对优势来优化。不看懂 GRPO 就无法理解奖励融合公式(式 7、8)和策略更新(式 10)的设计逻辑。

Bradley-Terry 成对偏好模型

Bradley-Terry 模型假设两份候选被选为优的概率取决于它们分数的差:$P(Y^+ \succ Y^-)=\sigma(r(Y^+)-r(Y^-))$,训练时最小化 $\mathcal{L}_R=-\mathbb{E}_{\mathcal{D}_R}\left[\log\sigma(r_\theta(P,V^+)-r_\theta(P,V^-))\right]$。成对比较只需学习相对偏好,比逐点回归绝对指标更抗噪声。

本文的表现奖励模型正是用 BT 成对损失训练的:同一产品组内线上 CTR 最高与最低的视频构成正负样本对,成对形式比逐点预测在 IB 验证集上高 7.93 个百分点(60.85% 对 52.92%),这是论文的关键消融结论之一。

印象均衡投放管道

广告系统里线上指标天然混杂冷启动效应、召回排序偏差和流量组成差异。印象均衡管道为每个产品预留专属流量池,把 $N=12$ 条生成的视频挂在原产品下直接进入曝光服务,在相同上下文内随机分发,绕过上游竞价排序,使各视频获得近似均等的曝光机会。视频累计至少 1000 次曝光后其指标才被视为有效训练信号。

这是全文数据的基石:表现奖励模型(100 万对样本)、DPO 偏好对(每阶段 5 万对)、GRPO 的组内公平比较全部依赖这一协议。没有它,CTR 差异无法归因于视频质量本身,奖励标签会被系统性偏差污染。

过程奖励与结果奖励

长链条智能体任务中,只给最终产物的结果奖励对中间推理步骤的监督过于稀疏。过程奖励对中间决策(如选了哪组策略)直接打分,结果奖励对最终产物(渲染完成的视频)打分。本文中策略选择阶段用全局策略先验 $R_{glob}$、局部赢家重叠 $R_{loc}$ 和格式指标 $I_{sel}$ 构成过程奖励,草稿生成阶段用两个奖励模型分数 $R_{perf}$、$R_{rub}$ 构成结果奖励。

这是本文区别于普通 RLHF 微调的核心设计:两阶段各配一套奖励并交替优化,解决了单一稀疏奖励难以监督长智能体链条的问题,也是理解公式 (7)(8) 中 $\lambda_{sel}=0.5$、$\lambda_{draft}=0.6$ 融合权重的前提。

研究动机

短视频广告投放是典型的高价值创意任务,其成败最终由点击、转化等线上业务指标衡量,而非视觉质量本身。Seedance 2.0、Sora 等视频基础模型已能从文本、图像、音频、视频多模态条件生成逼真片段,但它们本质上是被动生成器:不会自主拆解创意目标、选择参考素材与工具,也无法在长生成链路中迭代修正。更关键的是,这些模型完全没有优化『产品素材应如何被转化为有效广告』这一决策问题,也无法利用投放后的线上反馈改进未来生成。现有工业系统要么对配置人工设定、各组件分散编排(论文中的 Pre-Agent 管道),要么仅对文本、图像类创意使用 CTR 反馈(如 Meta 的 AdLlama、GenCO),缺乏把线上业务反馈系统性回灌到视频生成决策的学习框架。

本文的目标是本文要把广告视频生成重新表述为一个『产品条件化的推理问题』,并建立一个能从线上业务反馈中持续学习的奖励引导智能体框架 AgenticGen。具体目标有三:其一,把生成过程分解为策略选择与草稿生成两个可训练的推理阶段,让业务反馈有明确的优化对象;其二,在广告系统偏差和用户行为噪声下构造可靠奖励——一个从印象均衡投放数据学到的表现奖励模型,加上一个对齐人类质量标准的规则式(rubric)奖励模型;其三,设计高效的优化机制(DPO 热身 + GRPO 在线强化学习),把累积反馈转化为更好的生成决策,并在 TikTok 广告系统上用 A/B 实验验证 CTR、CVR、Advv 的真实提升。

与已有工作不同的是,本文的独特切入角度是把『奖励引导的智能体决策』引入工业级视频广告生成,与已有工作形成三重差异。第一,与 LLM 规划 + 专用智能体的多场景视频创作系统不同,AgenticGen 的优化目标不是离线感知质量,而是在线商业回报,奖励直接来自真实投放的 CTR。第二,与 AdLlama(历史 CTR 反馈)、GenCO(点击派生奖励)等只覆盖文本或图像生成的系统不同,本文首次把业务反馈用于优化多阶段视频生成智能体。第三,方法层面,作者意识到直接在线 RL 不可行——反馈慢(需要足够长的观察窗口)且噪声大(受广告系统偏差影响),因此设计了印象均衡投放协议作为数据底座,再用 BT 成对建模消除混杂因素,用 DPO→GRPO 的两阶段课程把噪声反馈逐步蒸馏成策略改进,这套组合拳是此前文献中没有的。

核心方法

AgenticGen 的整体思路是:与其让视频模型一步生成成品,不如把广告视频生成拆成两次可被业务反馈监督的推理决策。直觉上,广告人有两种关键判断——『对这个产品该用什么创意打法』和『具体怎么执行』——框架对应地设置了策略选择 $S=\mathcal{F}_{sel}(P,M;\mathcal{G},C)$ 和草稿生成 $D=\mathcal{F}_{draft}(P,M,S)$ 两个阶段,其中 $P$ 是产品上下文(名称、描述、卖点),$M$ 是素材包(源视频/图片及其历史表现和多模态解析特征),$\mathcal{G}$ 是十余个内部策略组成的选择目录(资产剪辑、参考引导生成、跨素材混剪三大家族),$C$ 是有效性约束(如素材不足时混剪无效、原素材含演唱时不能换背景音乐)。两阶段均由推理型 VLM(Qwen3-VL-8B-Thinking,SFT 自 235B 教师蒸馏数据)执行;草稿 $D$ 经执行层 $V=\mathcal{F}_{gen}(D)$ 调用 Seedance 2.0 和 CapCut 等工具渲染成片。生成的视频通过印象均衡管道投放(每产品 12 条、随机分发、至少 1000 次曝光才有效),由此累积的轨迹数据用于训练两个奖励模型,再依次执行 DPO($\beta=0.1$、学习率 $5\times10^{-6}$、NLL 权重 $\lambda_{nll}=0.2$)与 GRPO(学习率 $1\times10^{-6}$、组大小 $G=8$、$\epsilon=0.2$、$\beta=0.001$)完成策略优化。

核心创新点在于把『线上业务反馈 → 生成决策改进』这个闭环工程化为可训练的两阶段推理 + 双奖励 + 两阶段优化的完整系统,与已有方法的本质区别有三。其一,奖励信号直接来自投放后的商业指标而非人工标注或离线评估器,并用印象均衡协议 + 组内最高/最低样本配对(式 4 的 BT 损失)剥离流量偏差,把噪声 CTR 变成干净的相对偏好。其二,观察到单一信号会失配——只优化商业表现会容忍画质缺陷和标题党,只优化人类标准又追不上业务偏好(Table 5 显示单独使用两者分别只能到 56.39% 或 55.51% 平均胜率)——因此设计了表现奖励与规则式奖励的互补融合,规则式模型以 TikTok 专家标准(4 内容维度 × 5 质量方面)训练,只保留三名标注者完全一致的样本对。其三,针对长智能体链条奖励稀疏的问题,用过程奖励(全局策略先验 + 局部赢家 Jaccard 重叠)监督策略选择、用结果奖励监督草稿生成,DPO 离线热身后 GRPO 在线精修,交替优化两个策略。

方法步骤详情

完整流程分五步。第一步 SFT 初始化:对 5 万个在线产品请求构造策略选择 prompt,用 Qwen3-VL-235B-A22B-Thinking 教师生成轨迹(保留通过格式与约束校验的),再对 10 万条策略输出生成草稿轨迹,SFT 训练 Qwen3-VL-8B-Thinking 并部署为线上采数策略。第二步反馈收集:每产品采样 12 条候选视频挂到原产品下,经印象均衡管道随机分发,日志完整记录 $(P,M,S,D,V)$ 轨迹与业务反馈,累计一个月得到 100 万视频对。第三步奖励建模:取组内 CTR 最高/最低的视频为正/负样本,用四组特征(视频帧、音频与 ASR、密集字幕与结构化故事线、广告专属特征如 hook/卖点/CTA)训练 Qwen2.5-Omni-7B 表现奖励模型(学习率 $5\times10^{-6}$);并行用 1 万条三标注者一致的人工偏好对 + Qwen3-Omni-30B-A3B-Thinking 拒绝采样数据训练规则式奖励模型(学习率 $1\times10^{-5}$,成对输入判断候选是否优于参考)。第四步 DPO 热身:分别固定另一阶段,采样同一输入下 $N$ 条候选投放,最高/最低反馈构成偏好对(每阶段 5 万对),交替优化两阶段的 $\mathcal{L}^{reg}_{DPO}=\mathcal{L}_{DPO}+\lambda_{nll}\mathbb{E}[-\log\pi_\psi(Y^+|X)]$。第五步 GRPO 精修:策略选择的奖励 $R_{sel}=\lambda_{sel}\tilde{R}_{glob}+(1-\lambda_{sel})\tilde{R}_{loc}$($\lambda_{sel}=0.5$,格式校验失败归零);草稿生成的奖励 $R_{draft}=\lambda_{draft}\tilde{R}_{perf}+(1-\lambda_{draft})\tilde{R}_{rub}$($\lambda_{draft}=0.6$,其中 $R_{rub}$ 按 Pref-GRPO 计算组内平均胜率),计算组相对优势后按 PPO 裁剪目标(式 10)更新。

技术新颖性

技术新颖性体现在四个层面。第一,问题表述层面:首次把广告视频生成显式定义为带业务指标约束的产品条件化推理问题,并证明其两个推理阶段都可以被线上反馈显式优化,这是对『视频生成 = 合成任务』范式的突破。第二,数据工程层面:印象均衡投放管道(专属流量池、组内随机分发、1000 次曝光门槛)是一套针对广告系统偏差的因果控制设计,使 A/B 结论和奖励标签都具有可比性;实验证实成对 BT 目标比逐点回归高 7.93 个百分点。第三,奖励设计层面:表现奖励与规则式奖励的加权融合有明确的消融支撑(Table 5),融合方案保留商业收益(60.52% 性能胜率)的同时把规则胜率从 51.74% 提到 55.86%,缓解单奖励的偏好漂移。第四,优化算法层面:过程/结果奖励分别作用于策略选择/草稿生成,并交替优化两个策略,把 GRPO 从单步 RLHF 扩展到长链条智能体场景;全局奖励按策略跨产品聚合先验、局部奖励用同产品赢家组的 Jaccard 重叠(算法 1、2),也是针对广告多产品场景的新构造。

Overview of the AgenticGen framework and its online optimization loop.
Figure 1: Overview of the AgenticGen framework and its online optimization loop.

实验结果

论文的离线与在线实验形成完整证据链。奖励模型方面:Table 1 显示成对 BT 训练在印象均衡验证集上达 60.85% 准确率,比逐点预测的 52.92% 高 7.93 个百分点,验证了相对偏好建模的必要性;作者也坦承绝对准确率中等,因为奖励模型看不到生产 CTR 模型使用的用户行为序列等交叉特征。Table 2 的特征消融显示准确率从仅视频特征的 56.55% 逐步升到 60.85%:音频贡献最大(+1.88%,音乐节拍与剪辑卡点的同步与线上表现强相关),故事线特征 +0.93%,广告专属特征 +1.49%。Table 3 显示规则式奖励模型 SFT 后在人工标注集上从 55.40% 升到 69.50%,但在印象均衡集上仅从 49.20% 升到 53.30%,说明人类质量标准与业务偏好相关但不等价,佐证了双奖励互补的必要性。策略优化方面:Table 4 显示 DPO 把策略选择偏好准确率从 49.72% 提到 56.48%、草稿生成从 50.64% 提到 58.34%,平均从 50.18% 到 57.41%。Table 5 的 GRPO 消融用奖励模型胜率评估:仅性能奖励达 61.04%/51.74%,仅规则奖励达 50.78%/60.24%,呈明显权衡;加权融合取得 60.52%/55.86%/平均 58.19%,全面优于 DPO 的 51.83%。最终在线 A/B(Table 6):AgenticGen SFT 相对人工配置的 Pre-Agent 提升 CTR +3.48%、CVR +2.30%、Advv +9.83%;DPO+GRPO 后相对 SFT 再提升 CTR +2.72%、CVR +2.63%、Advv +9.61%,且 Advv 增幅超过 CTR×CVR 的乘积效应,作者归因于高出价流量素材更优,智能体有更多可靠参考。

Comparison of pointwise and pairwise reward modeling on the impression-balanced (IB) validation set.
Table 1: Comparison of pointwise and pairwise reward modeling on the impression-balanced (IB) validation set.
Feature scaling for the performance-based reward model on the impression-balanced (IB) validation set.
Table 2: Feature scaling for the performance-based reward model on the impression-balanced (IB) validation set.
Performance of the rubric-based reward model on the human labeled (HL) and impression-balanced (IB) validation sets.
Table 3: Performance of the rubric-based reward model on the human labeled (HL) and impression-balanced (IB) validation sets.
Performance of DPO for strategy selection and draft generation on the impression-balanced (IB) validation sets.
Table 4: Performance of DPO for strategy selection and draft generation on the impression-balanced (IB) validation sets.
Reward model win rates of the DPO and GRPO reward variants.
Table 5: Reward model win rates of the DPO and GRPO reward variants.
Online A/B evaluation in the TikTok advertising system.
Table 6: Online A/B evaluation in the TikTok advertising system.
查看结构化数据
任务指标本文基线提升
表现奖励模型验证(印象均衡集) 成对准确率 IB Acc. 成对 BT 训练 60.85% 逐点预测 52.92% +7.93 个百分点
表现奖励模型多模态特征消融 IB Acc. 全特征 60.85%(音频 +1.88、故事线 +0.93、广告特征 +1.49) 仅视频特征 56.55% +4.30 个百分点
规则式奖励模型 人工标注集 HL Acc. / 印象均衡集 IB Acc. SFT 后 69.50% / 53.30% 未微调 Qwen2.5-Omni-7B 55.40% / 49.20% +14.10 / +4.10 个百分点
DPO 两阶段偏好准确率 策略选择 / 草稿生成 / 平均 Acc. 56.48% / 58.34% / 57.41% SFT 49.72% / 50.64% / 50.18% 平均 +7.23 个百分点
GRPO 奖励变体消融(对 SFT 策略的成片胜率) 性能 WR / 规则 WR / 平均 WR 加权融合 60.52% / 55.86% / 58.19%(单性能 61.04%/51.74%/56.39%,单规则 50.78%/60.24%/55.51%) DPO 54.18% / 49.48% / 51.83% 平均 WR +6.36 个百分点
TikTok 在线 A/B:SFT 对比 Pre-Agent CTR / CVR / Advv 相对提升 +3.48% / +2.30% / +9.83% 人工配置的非智能体管道 Pre-Agent 智能体化带来的系统级收益
TikTok 在线 A/B:RL(DPO+GRPO)对比 SFT CTR / CVR / Advv 相对提升 +2.72% / +2.63% / +9.61% AgenticGen SFT 策略 奖励引导 RL 的算法级净收益

局限与改进

作者明确承认的局限有三点。第一,表现奖励模型绝对准确率只有 60.85%,因为它无法观测生产级 CTR 模型使用的用户行为序列、用户-广告交互等交叉特征,只能基于视频内容本身判断。第二,规则式奖励与线上偏好存在系统性错位:人类标准在人工集上提升 14.10 个百分点、在业务集上仅提升 4.10 个百分点,作者假设很多视频已过质量门槛后,线上表现更多由广告系统内部因素和异质受众偏好决定。第三,全局/局部策略奖励本质上是统计先验和事后赢家近似($S^+$ 只是从 $N$ 个候选中挑出的最优),并非真实的最佳策略上界。我自己的观察还包括:印象均衡管道绕过了召回排序,其结论未必能外推到真实竞价环境;所有实验都在 TikTok 单一平台、单一广告生态内进行,策略目录 $\mathcal{G}$ 因商业机密无法公开,方法对其他平台的可迁移性未经验证;每条视频需要至少 1000 次曝光、每产品 12 条候选的成本意味着数据收集极其昂贵,1 个月 100 万对数据的采集门槛中小团队难以复制。

独立分析的弱点

独立分析可见四个弱点。其一,奖励模型的信息瓶颈:60.85% 的准确率上限源于只看视频内容,改进方向是把上下文特征(用户画像分桶、时段、竞价环境)作为条件输入奖励模型,或采用层次化建模先预测流量分层的组内偏好再聚合,这能部分恢复交叉特征信息而不违反印象均衡的公平性。其二,局部奖励 $R_{loc}$ 用 Jaccard 重叠衡量与赢家组的相似度,会把『与赢家不同但可能更优』的探索性策略组合系统性压低,长期可能导致策略多样性坍缩,改进方向是引入基于不确定性或机会成本的探索 bonus(如对低频策略组给先验加成)。其三,规则式奖励保留三标注者全一致的样本虽稳定,却丢掉分歧样本中的有效信息且引入选择偏差——分歧往往恰恰发生在边界创意上,改进方向是用软标签或标注者加权的 BT 目标建模分歧程度。其四,两阶段交替优化(固定一个训练另一个)在阶段间存在非平稳性:策略选择分布变了,草稿阶段的训练数据分布也随之漂移,可能出现循环追逐;改进方向是引入类似博弈训练的收敛判据或联合采样两组分的轨迹做信用分配。

未来方向

作者方向上,论文未明确列出未来工作,但从结论和框架可自然延伸:把优化目标从 CTR 主导扩展到多目标(转化深度、品牌安全、用户长期留存),需要新的奖励建模与约束;把印象均衡协议推广为可微的流量偏差校正层,摆脱对专属流量池的依赖;将框架迁移到直播带货、商品详情页等其他创意形态。基于成果可延伸的研究方向:第一,用离线策略评估(OPE)或仿真环境替代部分真实投放,把昂贵的在线采数成本降一个量级;第二,研究策略目录 $\mathcal{G}$ 本身的可扩展性——让智能体提出目录外的新策略并通过小流量试探自动扩容,形成开放式的创意空间搜索;第三,过程奖励目前依赖统计先验,可以探索用世界模型预测候选策略的预期表现作为更稠密的过程信号;第四,跨平台/跨市场迁移,验证策略先验的普适性,并与联邦学习结合在保护广告主数据的前提下共享策略奖励统计。

复现评估

复现难度总体很高,属于资源密集型工作。开源情况:论文未提供代码、模型权重或策略目录,$\mathcal{G}$ 的完整定义因『内部商业敏感规则』不可公开(附录 A 只给了三大家族的抽象描述),这直接阻碍了核心组件的复现。数据:100 万表现奖励对、5 万 DPO 偏好对 × 2 阶段全部来自 TikTok 真实印象均衡投放,需要 reserved 线上流量池和至少 1000 次曝光/条的投放协议,外部研究者完全无法获得同质数据。算力与模型:基座是 Qwen3-VL-8B-Thinking(教师为 235B),奖励模型为两个 Qwen2.5-Omni-7B,超参数(DPO $\beta=0.1$、lr $5\times10^{-6}$、$\lambda_{nll}=0.2$;GRPO lr $1\times10^{-6}$、$G=8$、$\epsilon=0.2$、$\beta=0.001$、$\lambda_{sel}=0.5$、$\lambda_{draft}=0.6$)均已在论文中披露,算法层面的学术复现(用公开数据集替代线上反馈)是可行的,但需要多卡训练 8B 级 VLM 并跑通 Seedance 2.0/CapCut 等工具链。结论的可信度建立在 TikTok 规模的在线 A/B 上,独立验证只能依赖其离线消融数字。