AVA-Encoder:迈向智能体原生视频表示学习 AVA-Encoder: Towards Agent-Native Video Representation Learning
把电影编码为可编辑的电影知识图谱,用重构残差驱动双环文本梯度自进化
前置知识
知识图谱(Knowledge Graph, KG)
用节点表示实体或概念、用带类型的边表示实体间关系的图结构数据形式。本文的 Film KG 用 Story/Event/Shot 等文本节点和 Contains、Transition 等类型化边把一部电影组织成结构化文本网络,生成的图像、音频、视频资产只通过引用链接挂在资产层,不做独立节点。
Film KG 是全文的核心表示对象,编码、重构、测试时精炼和图编辑全部作用在这张图上,不理解 KG 的节点/边/资产三层组织就读不懂方法。
自编码器(Auto-Encoder)范式
先由编码器把输入压缩成中间表示、再由解码器从表示重建原始输入的框架,重建误差直接衡量表示保留了多少信息。经典自编码器训练神经网络参数,本文的解码器完全固定,进化的是文本化的策略提示词和图表示。
论文把视频表示学习形式化为“智能体自编码”问题:重构残差 $R(V,\hat{V})$ 是唯一的优化信号与质量度量来源,这是全文的逻辑起点。
文本梯度(Textual Gradient / TextGrad)
源自 TextGrad 的思想:用自然语言书写的反馈替代数值梯度,描述“哪里错了、应如何修改”,作为对文本变量(提示词、图节点描述)的优化方向,再由 LLM 据此提出修订版本。本文把失败事实写成修正记录 $a_i=\mathrm{Corr}(\xi_i)$ 再转成梯度。
AVA-Encoder 的双环自进化完全建立在文本梯度之上:所有基础模型权重冻结,没有任何数值反向传播,这是理解优化机制的前提。
视觉语言模型(VLM)
同时接收图像/视频与文本输入的多模态大模型,能执行视频问答、描述、真值与重构结果比对等任务。本文用 Gemini-3.1-Pro-Preview 承担影片/镜头/关键帧三级理解以及全部奖励与评测判断,用 Qwen-3.7-Plus 做修改。
编码器的三级理解和奖励/评测的 QA 判断全部由 VLM 完成,其能力上限直接决定整个框架的重构保真度上限。
测试时优化(Test-Time Optimization)
在推理阶段针对当前输入继续优化的技术,而非部署后参数固定不变。典型做法是对单个输入的中间表示做迭代修正,用验证信号决定接受或拒绝每次修改。
内环 Data-Dependent KG Representation Refinement 就是测试时优化:固定策略 $P^*$,只精炼当前视频的图表示 $G$,理解它才能分清内外两环的分工。
自动提示优化(Automatic Prompt Optimization)
系统性地用算法代替人工反复调试系统提示词:诊断失败案例、生成候选新提示、在验证集上评估、按门槛决定是否接受。本文外环伪训练的对象正是镜头级与关键帧级两段系统提示词。
外环 Data-Agnostic Encoding Policy Pseudo-Training 本质上就是带防遗忘门控的自动提示优化,伪训练后提示词 token 反而减少 70% 以上。
研究动机
视频创作智能体虽然已能撰写故事、设计关键帧并生成视频,但始终难以稳定产出电影级内容,其根本瓶颈在于电影级视频空间与智能体空间之间存在根本性失配:电影是故事、角色互动、视觉构图、镜头语言、时间节奏与声音设计在时空上高度耦合的多模态内容,成品背后的创作决策链条并未直接呈现;而智能体只能通过文本、代码、计划、图等结构化表示进行检索、推理、规划与编辑。现有表示各有缺陷:像素、latent、视频嵌入等低层表示视觉信息丰富,但智能体难以直接解读、查询与修改;字幕、剧本等文本描述易于操作,却把复杂视频压缩成线性叙述,丢失实体关系、事件组织与跨模态依赖;现有场景图/视频知识图谱多为检索、问答等理解任务设计,只保留稀疏语义事实——可能识别出“两个角色在第八个镜头首次相遇”,却不足以忠实重建该镜头。此外,现有表示均在下游理解任务上评测,无法判断其是否为后续视频创作保留了足够信息。
本文的目标是本文的目标是构建一种同时满足三个要求的“智能体原生”视频表示:对智能体可读、可推理可编辑、且足够忠实以保留后续生成所需的电影信息。具体而言,论文提出 Agentic Video Auto-Encoder(AVA-Encoder)框架:把任意输入电影编码为结构化的电影知识图谱表示,再通过固定的视频解码器将其重构回视频;由于解码器完全固定,重构保真度可直接度量表示的信息保留程度。框架进一步把重构残差转化为优化信号,通过双环文本梯度自进化机制,在部署前跨视频优化共享编码策略(外环伪训练),在测试时精炼当前输入专属的 KG 表示(内环),最终让表示的总体重构保真度达到 49.0%,比最强外部基线 28.3% 绝对提升 20.7 个百分点;同时发布完整框架、首个智能体视频重构基准与首个高质量电影 KG 数据集。
与已有工作不同的是,本文的独特切入角度是把“智能体原生视频表示学习”形式化为智能体自编码问题,并以重构保真度作为表示质量的直接度量和优化信号。与以往为理解任务设计、用检索或问答评测的图表示不同,本文强制要求表示必须能“重构回原片”,从而迫使表示保留生成所需的密集多模态细节。作者还观察到一组结构性矛盾:高质量人类电影蕴含大量编剧、角色设计、运镜、节奏与视听协调知识,但智能体无法直接从中学习;而智能体自身完整的创作过程记录又极其稀缺,形成“创作能力弱→训练轨迹少→更难变强”的死循环。本文用 Film KG 打破该循环:把人类电影转换成智能体可操作的分步创作记录,解码时自然产出对齐的中间记录与渲染输出。此外优化上采用纯文本梯度而非数值梯度,全部基础模型权重冻结,仅进化提示词与图表示,这也是与参数化微调路线的本质差异。
核心方法
整体思路的直觉是“用重构暴露信息损失,用残差驱动自改进”。技术路线分三步:首先,Agentic Video Encoder 按“影片→镜头→关键帧”三级粒度理解输入视频 $V$,逐级注入上级上下文与共享实体注册表 $\mathcal{B}_{reg}$,输出结构化文本记录;随后 BuildGraph 组装成 Film KG $G=(N_G, E_G, A_G)$,含九类文本节点(Story/Event/Shot 叙事层级加 Character/Scene/Object/Style/Camera/Audio 六类镜头状态)与关键帧节点,十一条类型化边分生产、时序、语义三组,图像、音频、视频资产挂在资产层 $A_G$;最后固定解码器从 $G$ 读出每镜头参考关键帧与提示词,渲染重构视频 $\hat{V}=\mathrm{Dec}(G)$。重构残差被转成基于原子事实问答的文本梯度,在部署前(外环伪训练共享策略 $P$)与测试时(内环精炼当前 $G$)两个独立阶段应用,各配防遗忘门控 $\Gamma_{\text{outer}}$ 与防退化门控 $\Gamma_{\text{inner}}$。
核心创新是把视频表示学习变成“智能体自编码 + 文本梯度自进化”,与已有方法的本质区别有三。其一,表示中心从“理解”转向“重建”:Film KG 以结构化文本为中心、生成资产仅作链接,且不把任何源视频帧、裁剪或截图作为资产或提供给重构生成器,忠实度由重构残差直接量化。其二,优化信号从端到端数值反馈变为原子事实问答:对每个选中镜头/关键帧构建约 30 个冻结的二元事实问答库 $Q_{n,s}$,答错一题即定位一次重构失败,标量奖励 $R_{\text{reward}}=\frac{1}{K}\sum_k \chi_{n,s,k}$ 既能定位错误又能验证候选。其三,双环分离:外环 Data-Agnostic Policy 伪训练跨视频进化可迁移的 $P_{\text{shot}}$、$P_{\text{kf}}$($P_{\text{film}}$ 固定),内环 Data-Dependent KG 精炼只改当前输入的图表示,两者不嵌套、可独立启用;并用与 $R_{\text{reward}}$ 完全解耦的独立协议 $R_{\text{eval}}$ 报告最终结果,防止对优化指标过拟合。
方法步骤详情
第一步预处理:把视频切分为时序镜头序列,每镜头提取关键帧 $K_i=\mathrm{Key}(s_i)$。第二步分层理解:影片级 $E_{\text{film}}$ 捕捉全局叙事并初始化实体注册表 $\mathcal{B}_{reg}$;镜头级 $E_{\text{shot}}$ 以其输出为上下文提取时序、视听与运镜动态;关键帧级 $E_{\text{kf}}$ 再抽取细粒度构图,上级上下文逐级注入防止局部误判。第三步组装:BuildGraph 把三级记录映射到固定图模式。第四步重构:固定解码器按每镜头至多 $N_{ref}=5$ 张参考关键帧、$M=1200$ token 预算渲染 $\hat{V}$,评估模块返回失败事实与 $R_{\text{reward}}$。第五步双环:外环每视频最多 3 轮执行“重构→诊断→修正记录 $a_i$→改写提示 $P‘$→当前与回放验证→门控接受”;内环循环“诊断→资产级梯度→提出 $G’$→重解码→防退化门控”,关键帧分支用 $\mathrm{Diff}_{KF}$ 对比给方向、QA 奖励验证,镜头分支用检查单给证据与分数。
技术新颖性
技术新颖性体现在四点。其一,Film KG 的“文本中心 + 链接资产”设计:十类节点、三组共十一条类型化边显式保存层级(Contains)、绑定(Binds)、引用(References)、时序(Transition/Sequence/Jump)与语义(SpokenBy/Rel 等)依赖,使局部编辑可沿受影响子图传播到关联镜头,实现拓扑感知的协同剪辑。其二,TextGrad 式文本梯度被具体化为“源锚定的原子修正记录”$a_i=\mathrm{Corr}(\xi_i)$,把密集视觉残差翻译成智能体可执行的修改指令,。其三,双环各配门控:外环防遗忘门要求当前视频增益 $\Delta R_{\text{reward},n}>\delta$ 且视觉与历史回放退化不超过阈值,内环防退化门保护已正确内容;消融显示去掉门控 Overall 从 49.0 跌至 43.5。其四,评测协议创新:$R_{\text{eval}}$ 让 VLM 只产出原子判断,由确定性规则从事实到维度、镜头、视频、方向逐级聚合,与人工盲评一致率 97.3%(710/730),为“以重构评表示”确立可复现基准。
实验结果
RQ1(Table 1):AVA-Encoder 总分 49.0%,领先最强基线 soap2soap(28.3%)20.7 个百分点(相对 73.1%);分方向 Video 57.8/36.7、KF 73.7/39.5、V-BC 29.7/15.8、KF-BC 34.6/21.3。RQ2(Table 2):层级理解比单层 Naive 编码器高 18.3 分(45.8 对 27.5);双环合计贡献 6.6 分(42.4→49.0),且可分离(仅外环 45.8、仅内环 45.4);伪训练 45.8 超过人工精调 44.4(+1.4 分),提示 token 减少 74.3%/70.1%(31336→8052、13574→4062);去门控则 49.0→43.5。评测与人工盲评一致率达 97.3%。RQ3:角色与风格替换能在六镜头序列中一致传播且不伤无关内容。RQ4(Table 3):仅注入一次 Film KG 文本,MovieAgent 2.47→3.30、FilmAgent 1.85→2.83、Anim-Director 1.85→2.50、VideoStudio 1.90→1.95。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 视频重构保真度(18 个非重叠片段,四方向总评) | Overall (%),即 Video/KF/V-BC/KF-BC 四方向无权平均 | 49.0 | soap2soap 28.3(VideoAnalyzer 21.5、Storyboard Studio 19.4) | +20.7 个百分点,相对提升 73.1% |
| 直接视频对比方向(V) | V (%) | 57.8 | 36.7(soap2soap) | +21.1 分 |
| 关键帧对比方向(KF) | KF (%) | 73.7 | 39.5(soap2soap) | +34.2 分 |
| 策略受控对比:伪训练 vs 人工精调(关闭 KG 精炼) | Overall (%) 与系统提示 token 数 | 45.8;镜头级 8052 token、关键帧级 4062 token | 44.4(人工精调);31336 / 13574 token | +1.4 分(+3.2%),提示 token 减少 74.3% / 70.1% |
| 双环消融(去掉全部优化 vs 完整框架) | Overall (%) | 49.0(双环 + 双门控) | 42.4(两个优化环都移除) | +6.6 分,相对 15.6%;去掉门控则降至 43.5 |
| 评测协议与人工判断一致性 | 盲评三元组一致率 | 97.3%(710/730,覆盖 18 个片段、129 个镜头、246 个关键帧) | 无外部基线(人类标注为参照) | — |
| 下游故事视频生成增强(MovieAgent,注入 Film KG 文本) | Overall(1–4 分,含 Character/Plot/Camera/Style/Audiovisual) | 3.30 | 2.47(无参考条件) | +0.83;四个框架全部提升(FilmAgent +0.98、Anim-Director +0.65、VideoStudio +0.05) |
局限与改进
作者未设独立局限章节,从文中可归纳如下:(1) 强依赖特定闭源商用模型栈——视频理解与评测用 Gemini-3.1-Pro-Preview、修改用 Qwen-3.7-Plus、图像生成用 Nano Banana Pro、图生视频用 HappyHorse 1.0,框架效果与这些模型的能力和版本强耦合,重构上限还受固定解码器约束(每镜头至多 5 张参考关键帧、1200 token 提示预算);(2) QA 式奖励虽细粒度,但题库构造本身依赖 VLM,事实覆盖面与答案可靠性会引入偏差,作者必须专门设置独立 $R_{\text{eval}}$ 防止对奖励指标过拟合,这本身就承认了奖励信号可被钻空子;(3) 伪训练只用 6 个片段,虽有 18 个非重叠片段验证跨域迁移,但训练与评测规模都偏小;(4) 内环测试时精炼会显著增加推理期的重解码与评估调用次数,成本未量化报告;(5) Overall 是四方向无权平均,语义层的 V-BC/KF-BC 绝对分数仅 29.7/34.6,说明叙事与语义保真远未解决;我自己还观察到:整条流水线调用链长、随片长扩展性未验证,长片的注册表消歧与图规模控制也没有讨论。
独立分析的弱点
独立分析几点弱点。第一,端到端延迟与成本:每个候选更新(无论改策略还是改图)都要重新解码并重跑 QA 评估,外环每视频最多 3 轮、内环循环到预算耗尽,处理长片时 API 调用量随镜头数线性放大,改进方向是训练一个小型残差预测器做初筛,只对高残差片段触发完整循环。第二,重构上限受制于生成模型:若 Nano Banana Pro / HappyHorse 本身画不出某个细节(如罕见服饰、特定运镜),残差会被错误归因于表示缺陷,导致对 Film KG 的无效迭代,可引入“生成器能力感知”的残差归因模块,区分表示损失与生成损失。第三,二值 QA 信号粗糙:答案只有对/错,无法表达“部分正确”,且冻结题库可能过时,可用软评分或多裁判集成。第四,Film KG 文本体量与图规模随片长增长,超过一小时的长片中注册表消歧、边的稀疏化与检索策略均未讨论。第五,RQ3 的图编辑只用三个定性案例展示,缺乏定量的编辑一致性指标与失败案例分析,建议构建带人工标注的编辑基准来量化“改 A 不伤 B”的能力。
未来方向
作者明确提出的方向:发布首个高质量 Film KG 数据集(含获奖作品)以填补“过程级”创作轨迹数据空白,让视频生成智能体直接从人类电影学习分步创作记录;解码 Film KG 自然产出对齐的中间记录与渲染输出,可用于未来智能体视频生成模型的训练。基于成果可延伸的方向:(1) 把 Film KG 当作世界模型或规划器的中间状态,用强化学习或图 Transformer 训练策略直接在图空间做规划与编辑,而不只是提示词层面进化;(2) 将“重构残差驱动的双环文本梯度自进化”推广到其他模态的智能体自编码,如 3D 场景、网页、软件仓库,形成通用范式;(3) 用本地开源 VLM 与小型生成器替代商用 API,系统研究表示质量对解码器能力的鲁棒性并降低成本;(4) 在图编辑传播中引入约束求解器,保证传播后的叙事一致性(时间线、因果链不矛盾);(5) 结合长视频流式编码,增量维护 Film KG 支持实时创作辅助与交互式重拍;(6) 扩建 Film KG 与视频配对的大规模语料,作为智能体视频创作的预训练数据来源。
复现评估
复现评估:作者承诺开源完整 AVA-Encoder 框架、重构基准(四方向八维度的评分规则、聚合过程与系统提示在附录 B/N 完整给出)以及首个 Film KG 数据集,附录还提供编码器系统提示(附录 F)、基线适配与公平性协议(共享每镜头至多 5 张参考关键帧、1200 token 预算,附录 G)、数据集清单(附录 H)与门控阈值(附录 D),信息透明度较高。但实际复现门槛不低:流水线依赖四个闭源商用模型(Gemini-3.1-Pro-Preview、Qwen-3.7-Plus、Nano Banana Pro、HappyHorse 1.0),需要持续的多模态 API 预算;重构、QA 评估与双环迭代带来的调用次数多,单片段成本可观。算力方面伪训练仅 6 个片段、评测 18 个片段,绝对计算量不大,难点在工程复杂度(镜头分割、关键帧提取、图组装、回放记忆管理、两套评估协议)。若闭源模型不可得,需替换开源模型并重新校准全部阈值,预期分数会明显波动。总体判断:协议可复现、分数复现难,建议先在小片段上跑通单闭环再扩展。
论文图表