← 返回 2026-08-14

AVA-Encoder:迈向智能体原生视频表示学习 AVA-Encoder: Towards Agent-Native Video Representation Learning

Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun, Zhijing Zhang, Bingnan Li, Shuqi Gu, Kan Ren, Jiaming Liu, Ruihua Hua 📅 2026-08-12 👍 41 2026-08-24 18:30
文本梯度优化 智能体 知识图谱 视频生成 视频表示学习

把电影编码为可编辑的电影知识图谱,用重构残差驱动双环文本梯度自进化

前置知识

知识图谱(Knowledge Graph, KG)

用节点表示实体或概念、用带类型的边表示实体间关系的图结构数据形式。本文的 Film KG 用 Story/Event/Shot 等文本节点和 Contains、Transition 等类型化边把一部电影组织成结构化文本网络,生成的图像、音频、视频资产只通过引用链接挂在资产层,不做独立节点。

Film KG 是全文的核心表示对象,编码、重构、测试时精炼和图编辑全部作用在这张图上,不理解 KG 的节点/边/资产三层组织就读不懂方法。

自编码器(Auto-Encoder)范式

先由编码器把输入压缩成中间表示、再由解码器从表示重建原始输入的框架,重建误差直接衡量表示保留了多少信息。经典自编码器训练神经网络参数,本文的解码器完全固定,进化的是文本化的策略提示词和图表示。

论文把视频表示学习形式化为“智能体自编码”问题:重构残差 $R(V,\hat{V})$ 是唯一的优化信号与质量度量来源,这是全文的逻辑起点。

文本梯度(Textual Gradient / TextGrad)

源自 TextGrad 的思想:用自然语言书写的反馈替代数值梯度,描述“哪里错了、应如何修改”,作为对文本变量(提示词、图节点描述)的优化方向,再由 LLM 据此提出修订版本。本文把失败事实写成修正记录 $a_i=\mathrm{Corr}(\xi_i)$ 再转成梯度。

AVA-Encoder 的双环自进化完全建立在文本梯度之上:所有基础模型权重冻结,没有任何数值反向传播,这是理解优化机制的前提。

视觉语言模型(VLM)

同时接收图像/视频与文本输入的多模态大模型,能执行视频问答、描述、真值与重构结果比对等任务。本文用 Gemini-3.1-Pro-Preview 承担影片/镜头/关键帧三级理解以及全部奖励与评测判断,用 Qwen-3.7-Plus 做修改。

编码器的三级理解和奖励/评测的 QA 判断全部由 VLM 完成,其能力上限直接决定整个框架的重构保真度上限。

测试时优化(Test-Time Optimization)

在推理阶段针对当前输入继续优化的技术,而非部署后参数固定不变。典型做法是对单个输入的中间表示做迭代修正,用验证信号决定接受或拒绝每次修改。

内环 Data-Dependent KG Representation Refinement 就是测试时优化:固定策略 $P^*$,只精炼当前视频的图表示 $G$,理解它才能分清内外两环的分工。

自动提示优化(Automatic Prompt Optimization)

系统性地用算法代替人工反复调试系统提示词:诊断失败案例、生成候选新提示、在验证集上评估、按门槛决定是否接受。本文外环伪训练的对象正是镜头级与关键帧级两段系统提示词。

外环 Data-Agnostic Encoding Policy Pseudo-Training 本质上就是带防遗忘门控的自动提示优化,伪训练后提示词 token 反而减少 70% 以上。

研究动机

视频创作智能体虽然已能撰写故事、设计关键帧并生成视频,但始终难以稳定产出电影级内容,其根本瓶颈在于电影级视频空间与智能体空间之间存在根本性失配:电影是故事、角色互动、视觉构图、镜头语言、时间节奏与声音设计在时空上高度耦合的多模态内容,成品背后的创作决策链条并未直接呈现;而智能体只能通过文本、代码、计划、图等结构化表示进行检索、推理、规划与编辑。现有表示各有缺陷:像素、latent、视频嵌入等低层表示视觉信息丰富,但智能体难以直接解读、查询与修改;字幕、剧本等文本描述易于操作,却把复杂视频压缩成线性叙述,丢失实体关系、事件组织与跨模态依赖;现有场景图/视频知识图谱多为检索、问答等理解任务设计,只保留稀疏语义事实——可能识别出“两个角色在第八个镜头首次相遇”,却不足以忠实重建该镜头。此外,现有表示均在下游理解任务上评测,无法判断其是否为后续视频创作保留了足够信息。

本文的目标是本文的目标是构建一种同时满足三个要求的“智能体原生”视频表示:对智能体可读、可推理可编辑、且足够忠实以保留后续生成所需的电影信息。具体而言,论文提出 Agentic Video Auto-Encoder(AVA-Encoder)框架:把任意输入电影编码为结构化的电影知识图谱表示,再通过固定的视频解码器将其重构回视频;由于解码器完全固定,重构保真度可直接度量表示的信息保留程度。框架进一步把重构残差转化为优化信号,通过双环文本梯度自进化机制,在部署前跨视频优化共享编码策略(外环伪训练),在测试时精炼当前输入专属的 KG 表示(内环),最终让表示的总体重构保真度达到 49.0%,比最强外部基线 28.3% 绝对提升 20.7 个百分点;同时发布完整框架、首个智能体视频重构基准与首个高质量电影 KG 数据集。

与已有工作不同的是,本文的独特切入角度是把“智能体原生视频表示学习”形式化为智能体自编码问题,并以重构保真度作为表示质量的直接度量和优化信号。与以往为理解任务设计、用检索或问答评测的图表示不同,本文强制要求表示必须能“重构回原片”,从而迫使表示保留生成所需的密集多模态细节。作者还观察到一组结构性矛盾:高质量人类电影蕴含大量编剧、角色设计、运镜、节奏与视听协调知识,但智能体无法直接从中学习;而智能体自身完整的创作过程记录又极其稀缺,形成“创作能力弱→训练轨迹少→更难变强”的死循环。本文用 Film KG 打破该循环:把人类电影转换成智能体可操作的分步创作记录,解码时自然产出对齐的中间记录与渲染输出。此外优化上采用纯文本梯度而非数值梯度,全部基础模型权重冻结,仅进化提示词与图表示,这也是与参数化微调路线的本质差异。

核心方法

整体思路的直觉是“用重构暴露信息损失,用残差驱动自改进”。技术路线分三步:首先,Agentic Video Encoder 按“影片→镜头→关键帧”三级粒度理解输入视频 $V$,逐级注入上级上下文与共享实体注册表 $\mathcal{B}_{reg}$,输出结构化文本记录;随后 BuildGraph 组装成 Film KG $G=(N_G, E_G, A_G)$,含九类文本节点(Story/Event/Shot 叙事层级加 Character/Scene/Object/Style/Camera/Audio 六类镜头状态)与关键帧节点,十一条类型化边分生产、时序、语义三组,图像、音频、视频资产挂在资产层 $A_G$;最后固定解码器从 $G$ 读出每镜头参考关键帧与提示词,渲染重构视频 $\hat{V}=\mathrm{Dec}(G)$。重构残差被转成基于原子事实问答的文本梯度,在部署前(外环伪训练共享策略 $P$)与测试时(内环精炼当前 $G$)两个独立阶段应用,各配防遗忘门控 $\Gamma_{\text{outer}}$ 与防退化门控 $\Gamma_{\text{inner}}$。

核心创新是把视频表示学习变成“智能体自编码 + 文本梯度自进化”,与已有方法的本质区别有三。其一,表示中心从“理解”转向“重建”:Film KG 以结构化文本为中心、生成资产仅作链接,且不把任何源视频帧、裁剪或截图作为资产或提供给重构生成器,忠实度由重构残差直接量化。其二,优化信号从端到端数值反馈变为原子事实问答:对每个选中镜头/关键帧构建约 30 个冻结的二元事实问答库 $Q_{n,s}$,答错一题即定位一次重构失败,标量奖励 $R_{\text{reward}}=\frac{1}{K}\sum_k \chi_{n,s,k}$ 既能定位错误又能验证候选。其三,双环分离:外环 Data-Agnostic Policy 伪训练跨视频进化可迁移的 $P_{\text{shot}}$、$P_{\text{kf}}$($P_{\text{film}}$ 固定),内环 Data-Dependent KG 精炼只改当前输入的图表示,两者不嵌套、可独立启用;并用与 $R_{\text{reward}}$ 完全解耦的独立协议 $R_{\text{eval}}$ 报告最终结果,防止对优化指标过拟合。

方法步骤详情

第一步预处理:把视频切分为时序镜头序列,每镜头提取关键帧 $K_i=\mathrm{Key}(s_i)$。第二步分层理解:影片级 $E_{\text{film}}$ 捕捉全局叙事并初始化实体注册表 $\mathcal{B}_{reg}$;镜头级 $E_{\text{shot}}$ 以其输出为上下文提取时序、视听与运镜动态;关键帧级 $E_{\text{kf}}$ 再抽取细粒度构图,上级上下文逐级注入防止局部误判。第三步组装:BuildGraph 把三级记录映射到固定图模式。第四步重构:固定解码器按每镜头至多 $N_{ref}=5$ 张参考关键帧、$M=1200$ token 预算渲染 $\hat{V}$,评估模块返回失败事实与 $R_{\text{reward}}$。第五步双环:外环每视频最多 3 轮执行“重构→诊断→修正记录 $a_i$→改写提示 $P‘$→当前与回放验证→门控接受”;内环循环“诊断→资产级梯度→提出 $G’$→重解码→防退化门控”,关键帧分支用 $\mathrm{Diff}_{KF}$ 对比给方向、QA 奖励验证,镜头分支用检查单给证据与分数。

技术新颖性

技术新颖性体现在四点。其一,Film KG 的“文本中心 + 链接资产”设计:十类节点、三组共十一条类型化边显式保存层级(Contains)、绑定(Binds)、引用(References)、时序(Transition/Sequence/Jump)与语义(SpokenBy/Rel 等)依赖,使局部编辑可沿受影响子图传播到关联镜头,实现拓扑感知的协同剪辑。其二,TextGrad 式文本梯度被具体化为“源锚定的原子修正记录”$a_i=\mathrm{Corr}(\xi_i)$,把密集视觉残差翻译成智能体可执行的修改指令,。其三,双环各配门控:外环防遗忘门要求当前视频增益 $\Delta R_{\text{reward},n}>\delta$ 且视觉与历史回放退化不超过阈值,内环防退化门保护已正确内容;消融显示去掉门控 Overall 从 49.0 跌至 43.5。其四,评测协议创新:$R_{\text{eval}}$ 让 VLM 只产出原子判断,由确定性规则从事实到维度、镜头、视频、方向逐级聚合,与人工盲评一致率 97.3%(710/730),为“以重构评表示”确立可复现基准。

Overview of AVA-Encoder.
Figure 1: Overview of AVA-Encoder.
Dual-loop textual-gradient evolution. (a) Inner loop: Data-Dependent KG Representation Refinement with the Anti-Degradation Gate. (b) Outer loop: Data-Agnostic Encoding Policy Pseudo-Training with the Anti-Forgetting Gate.
Figure 2: Dual-loop textual-gradient evolution. (a) Inner loop: Data-Dependent KG Representation Refinement with the Anti-Degradation Gate. (b) Outer loop: Data-Agnostic Encoding Policy Pseudo-Training with the Anti-Forgetting Gate.
Outer Loop: Data-Agnostic Encoding Policy Pseudo-Training
Algorithm 1: Outer Loop: Data-Agnostic Encoding Policy Pseudo-Training
Inner Loop: Data-Dependent KG Representation Refinement
Algorithm 2: Inner Loop: Data-Dependent KG Representation Refinement

实验结果

RQ1(Table 1):AVA-Encoder 总分 49.0%,领先最强基线 soap2soap(28.3%)20.7 个百分点(相对 73.1%);分方向 Video 57.8/36.7、KF 73.7/39.5、V-BC 29.7/15.8、KF-BC 34.6/21.3。RQ2(Table 2):层级理解比单层 Naive 编码器高 18.3 分(45.8 对 27.5);双环合计贡献 6.6 分(42.4→49.0),且可分离(仅外环 45.8、仅内环 45.4);伪训练 45.8 超过人工精调 44.4(+1.4 分),提示 token 减少 74.3%/70.1%(31336→8052、13574→4062);去门控则 49.0→43.5。评测与人工盲评一致率达 97.3%。RQ3:角色与风格替换能在六镜头序列中一致传播且不伤无关内容。RQ4(Table 3):仅注入一次 Film KG 文本,MovieAgent 2.47→3.30、FilmAgent 1.85→2.83、Anim-Director 1.85→2.50、VideoStudio 1.90→1.95。

Reconstruction fidelity scores on the ground-truth-anchored benchmark.
Table 1: Reconstruction fidelity scores on the ground-truth-anchored benchmark.
Ablation study on the reconstruction benchmark.
Table 2: Ablation study on the reconstruction benchmark.
Downstream story-video quality (1–4) without and with a single textual injection of the complete AVA-Encoder representation.
Table 3: Downstream story-video quality (1–4) without and with a single textual injection of the complete AVA-Encoder representation.
Visual comparison of reconstruction results between AVA-Encoder and baseline methods, illustrating superior fidelity in preserving fine-grained cinematic details, character identities, and visual consistency.
Figure 3: Visual comparison of reconstruction results between AVA-Encoder and baseline methods, illustrating superior fidelity in preserving fine-grained cinematic details, character identities, and visual consistency.
Graph-topology identity editing. Changing a registered character jointly selects and updates the dependent keyframes and shots. The replacement character's registry description can be completed either manually or automatically by an LLM; given this description, an LLM follows the graph dependencies to modify the character's appearance, actions, dialogue, and other affected attributes across the relevant shots. Panels (a) and (b) preserve unrelated characters, scenes, compositions, and event structure while consistently propagating the requested identity.
Figure 4: Graph-topology identity editing. Changing a registered character jointly selects and updates the dependent keyframes and shots. The replacement character's registry description can be completed either manually or automatically by an LLM; given this description, an LLM follows the graph dependencies to modify the character's appearance, actions, dialogue, and other affected attributes across the relevant shots. Panels (a) and (b) preserve unrelated characters, scenes, compositions, and event structure while consistently propagating the requested identity.
Graph-topology visual-treatment editing. A visual-treatment edit follows the corresponding style-state transitions and asset references, applying a consistent treatment to the linked sequence without rewriting each shot independently.
Figure 5: Graph-topology visual-treatment editing. A visual-treatment edit follows the corresponding style-state transitions and asset references, applying a consistent treatment to the linked sequence without rewriting each shot independently.
查看结构化数据
任务指标本文基线提升
视频重构保真度(18 个非重叠片段,四方向总评) Overall (%),即 Video/KF/V-BC/KF-BC 四方向无权平均 49.0 soap2soap 28.3(VideoAnalyzer 21.5、Storyboard Studio 19.4) +20.7 个百分点,相对提升 73.1%
直接视频对比方向(V) V (%) 57.8 36.7(soap2soap) +21.1 分
关键帧对比方向(KF) KF (%) 73.7 39.5(soap2soap) +34.2 分
策略受控对比:伪训练 vs 人工精调(关闭 KG 精炼) Overall (%) 与系统提示 token 数 45.8;镜头级 8052 token、关键帧级 4062 token 44.4(人工精调);31336 / 13574 token +1.4 分(+3.2%),提示 token 减少 74.3% / 70.1%
双环消融(去掉全部优化 vs 完整框架) Overall (%) 49.0(双环 + 双门控) 42.4(两个优化环都移除) +6.6 分,相对 15.6%;去掉门控则降至 43.5
评测协议与人工判断一致性 盲评三元组一致率 97.3%(710/730,覆盖 18 个片段、129 个镜头、246 个关键帧) 无外部基线(人类标注为参照)
下游故事视频生成增强(MovieAgent,注入 Film KG 文本) Overall(1–4 分,含 Character/Plot/Camera/Style/Audiovisual) 3.30 2.47(无参考条件) +0.83;四个框架全部提升(FilmAgent +0.98、Anim-Director +0.65、VideoStudio +0.05)

局限与改进

作者未设独立局限章节,从文中可归纳如下:(1) 强依赖特定闭源商用模型栈——视频理解与评测用 Gemini-3.1-Pro-Preview、修改用 Qwen-3.7-Plus、图像生成用 Nano Banana Pro、图生视频用 HappyHorse 1.0,框架效果与这些模型的能力和版本强耦合,重构上限还受固定解码器约束(每镜头至多 5 张参考关键帧、1200 token 提示预算);(2) QA 式奖励虽细粒度,但题库构造本身依赖 VLM,事实覆盖面与答案可靠性会引入偏差,作者必须专门设置独立 $R_{\text{eval}}$ 防止对奖励指标过拟合,这本身就承认了奖励信号可被钻空子;(3) 伪训练只用 6 个片段,虽有 18 个非重叠片段验证跨域迁移,但训练与评测规模都偏小;(4) 内环测试时精炼会显著增加推理期的重解码与评估调用次数,成本未量化报告;(5) Overall 是四方向无权平均,语义层的 V-BC/KF-BC 绝对分数仅 29.7/34.6,说明叙事与语义保真远未解决;我自己还观察到:整条流水线调用链长、随片长扩展性未验证,长片的注册表消歧与图规模控制也没有讨论。

独立分析的弱点

独立分析几点弱点。第一,端到端延迟与成本:每个候选更新(无论改策略还是改图)都要重新解码并重跑 QA 评估,外环每视频最多 3 轮、内环循环到预算耗尽,处理长片时 API 调用量随镜头数线性放大,改进方向是训练一个小型残差预测器做初筛,只对高残差片段触发完整循环。第二,重构上限受制于生成模型:若 Nano Banana Pro / HappyHorse 本身画不出某个细节(如罕见服饰、特定运镜),残差会被错误归因于表示缺陷,导致对 Film KG 的无效迭代,可引入“生成器能力感知”的残差归因模块,区分表示损失与生成损失。第三,二值 QA 信号粗糙:答案只有对/错,无法表达“部分正确”,且冻结题库可能过时,可用软评分或多裁判集成。第四,Film KG 文本体量与图规模随片长增长,超过一小时的长片中注册表消歧、边的稀疏化与检索策略均未讨论。第五,RQ3 的图编辑只用三个定性案例展示,缺乏定量的编辑一致性指标与失败案例分析,建议构建带人工标注的编辑基准来量化“改 A 不伤 B”的能力。

未来方向

作者明确提出的方向:发布首个高质量 Film KG 数据集(含获奖作品)以填补“过程级”创作轨迹数据空白,让视频生成智能体直接从人类电影学习分步创作记录;解码 Film KG 自然产出对齐的中间记录与渲染输出,可用于未来智能体视频生成模型的训练。基于成果可延伸的方向:(1) 把 Film KG 当作世界模型或规划器的中间状态,用强化学习或图 Transformer 训练策略直接在图空间做规划与编辑,而不只是提示词层面进化;(2) 将“重构残差驱动的双环文本梯度自进化”推广到其他模态的智能体自编码,如 3D 场景、网页、软件仓库,形成通用范式;(3) 用本地开源 VLM 与小型生成器替代商用 API,系统研究表示质量对解码器能力的鲁棒性并降低成本;(4) 在图编辑传播中引入约束求解器,保证传播后的叙事一致性(时间线、因果链不矛盾);(5) 结合长视频流式编码,增量维护 Film KG 支持实时创作辅助与交互式重拍;(6) 扩建 Film KG 与视频配对的大规模语料,作为智能体视频创作的预训练数据来源。

复现评估

复现评估:作者承诺开源完整 AVA-Encoder 框架、重构基准(四方向八维度的评分规则、聚合过程与系统提示在附录 B/N 完整给出)以及首个 Film KG 数据集,附录还提供编码器系统提示(附录 F)、基线适配与公平性协议(共享每镜头至多 5 张参考关键帧、1200 token 预算,附录 G)、数据集清单(附录 H)与门控阈值(附录 D),信息透明度较高。但实际复现门槛不低:流水线依赖四个闭源商用模型(Gemini-3.1-Pro-Preview、Qwen-3.7-Plus、Nano Banana Pro、HappyHorse 1.0),需要持续的多模态 API 预算;重构、QA 评估与双环迭代带来的调用次数多,单片段成本可观。算力方面伪训练仅 6 个片段、评测 18 个片段,绝对计算量不大,难点在工程复杂度(镜头分割、关键帧提取、图组装、回放记忆管理、两套评估协议)。若闭源模型不可得,需替换开源模型并重新校准全部阈值,预期分数会明显波动。总体判断:协议可复现、分数复现难,建议先在小片段上跑通单闭环再扩展。