← 返回 2026-09-09

ReactVAU:面向流式视频异常理解的快慢解耦框架 ReactVAU: A Slow-Fast Decoupled Framework for Streaming Video Anomaly Understanding

Chia-Hui Chen, Shih-Ying Yeh, Fu-En Yang, Min-Hung Chen, Shang-Hong Lai 📅 2026-09-07 👍 19 2026-09-12 18:30
Slow-Fast架构 多模态大语言模型 智能监控 流式视频 视频异常理解

快慢解耦架构只在异常时唤醒重型模型,实现因果流式视频异常理解。

前置知识

VAD 与 VAU

视频异常检测(VAD)只输出每帧的异常概率标量,用于定位异常片段;视频异常理解(VAU)进一步用多模态大语言模型(MLLM)生成对异常的语义描述和因果解释,回答“发生了什么、为什么异常”。VAU 通常在 UCF-Crime、XD-Violence 上评 AUC/AP,在 HIVAU-70K 上评 BLEU、CIDEr 等文本生成指标。

本文的核心命题是把 VAU 从离线推理迁移到严格因果的流式设定下,理解两种任务的评价方式才能读懂它的实验设计。

流式视频理解与持久记忆

流式视频模型只能按时间顺序访问当前帧和历史帧,因此需要把无限长的视觉历史压缩进有界记忆。典型做法包括 KV-cache 压缩、token 合并和持久记忆树。本文用的 StreamForest-7B 把长期历史组织成分层记忆:实时感知层(RTP,当前帧 729 token)、细粒度短窗(FSTW,12 帧每帧 128 token)和持久事件记忆森林(PEMF,每节点 64 token、总配额 2048),超配额时按相似度、时间距离、合并频率组成的惩罚分数迭代合并最相似的相邻节点。

ReactVAU 的 AAPM 模块就是在 StreamForest 这套记忆机制上改造的,不懂记忆分层和合并惩罚就无法理解它的创新点。

Slow-Fast 解耦与事件门控

把系统拆成常开的轻量“快”通道和按需唤醒的重型“慢”通道:快通道用小模型持续做廉价筛查,只有当其输出越过触发阈值($S_{det} > \tau_{trigger}$)时才唤醒慢通道的大模型做精细分析。Dispider、StreamMind 等工作已把这种事件门控用于流式视频问答,本文首次将其系统性地用于异常理解。

这是 ReactVAU 效率收益(重型 7B 模型查询减少 54%–95%)的来源,也是理解其架构图的骨架。

LoRA 与参数高效微调

LoRA 在冻结的预训练权重旁挂低秩矩阵,只训练少量新增参数即可适配下游任务。本文 Fast 模块基于 PaliGemma2-3B,只更新投影层和 LLM 上的 LoRA 权重,在自建的网格图像数据集(来自 UCF-Crime 和 XD-Violence)上微调 1 个 epoch;Slow 模块同样在 StreamForest-7B 上用 LoRA 做指令微调。

论文的训练成本和消融实验都建立在这套微调策略上,解释了为什么 3B 小模型能被改造成可用的异常探测器。

研究动机

现有的顶级 VAU 模型(Holmes-VAU、VADER、VERA、PANDA 等)全部依赖离线推理:它们必须先看到整段视频,再做全局时间采样(如 Holmes-VAU 的异常导向时间采样器、VADER 的上下文感知采样)或计算整段视频的异常密度分布,然后才生成语言解释。这种对未来帧的绝对依赖破坏了因果性,使它们在真实监控流中根本无法部署——监控场景要求系统对当前时刻做出反应,而不是等事件结束后复盘。另一方面,通用流式视频理解框架(StreamForest、Dispider、StreamMind)虽然满足因果访问约束,但直接搬到异常领域有两个致命缺陷:其一,真实世界的异常是瞬态且稀少的,其稀疏视觉特征会在持续的记忆压缩中被大量正常背景稀释掉,等推理时再去检索早已丢失;其二,这些框架对每个流帧都均匀调用重型 MLLM,计算开销巨大。证据很直接:把离线的 LAVAD 强行改成在线版(Online-LAVAD),UCF-Crime 上 AUC 骤降到 76.06%,XD-Violence 上 AP 只有 52.63%,几乎不可用。

本文的目标是本文要构建一个同时满足三个约束的流式视频异常理解系统:严格因果(任何时刻只访问当前帧和历史帧,绝不偷看未来)、低延迟可实时(能在单卡 GPU 上以秒级预算处理无限长的监控流)、并保留深度语义解释能力(不仅检出异常,还能生成对事件的因果描述)。量化目标是:在 UCF-Crime、XD-Violence 两个 VAD 基准上逼近甚至超过可偷看未来帧的离线微调方法,在 HIVAU-70K 上的长程文本指标(Event/Video 级 CIDEr 等)领先所有流式对手,同时把重型 7B MLLM 的调用次数和加权平均延迟大幅压下来,使真实部署(异常率仅 5%–10%)成为可能。

与已有工作不同的是,作者的独特切入是一个朴素但被忽视的事实:真实监控流中正常内容占绝对多数,异常区间又短又少,因此单个高容量 MLLM 没有必要均匀处理每一帧。由此推出快慢解耦的反应式设计——轻量 Fast 模块持续做高频异常过滤,重型 Slow 模块平时休眠、只在检测到可疑事件时被唤醒做语义验证和因果描述。与 Dispider/StreamMind 已有的感知-反应解耦相比,ReactVAU 多走了关键一步:它让检测分数反过来主动改写记忆管理规则(Anomaly-Aware Persistent Memory),在推理模型休眠期间就把瞬态异常证据保护起来,防止其在通用记忆压缩算法下被合并稀释。检测与记忆形成闭环,这是已有事件门控工作没有做到的。

核心方法

直觉上像保安值班:人流正常的时段只需扫一眼,出现可疑动静才凑近细看并写报告。技术上 ReactVAU 由三个组件构成。(1) Fast 检测模块:以 PaliGemma2-3B 为骨干,以 4 FPS 处理视频流,用空间网格折叠(SGF)把 1 秒的 4 帧拼成一张 2×2 网格图,经共享视觉编码器 SigLIP-So400m 和投影层送入轻量 LLM,对 "Yes"/"No" 两个目标 token 做局部 softmax 得到连续异常分数 $S_{det}$,训练用二元交叉熵损失 $\mathcal{L}_{det} = -b\log S_{det} - (1-b)\log(1-S_{det})$。(2) 异常感知持久记忆(AAPM):在 StreamForest 的 RTP/FSTW/PEMF 三层记忆上,用 $S_{det}$ 做三件事——给异常节点加指数保护权重、维护独立异常池、动态切换稀疏/密集采样。(3) Slow 推理模块:StreamForest-7B 平时休眠,当 $S_{det} > \tau_{trigger}$ 时唤醒,在受保护的完整记忆序列上做二次验证得 $S_{reason}$,最终分数 $S_{fused} = 0.4 S_{det} + 0.6 S_{reason}$ 超过确认阈值 $\tau_{confirm}$ 才确认异常并自回归生成描述。

核心创新是检测信号与记忆管理的闭环耦合。已有流式记忆(包括 StreamForest 的 PEMF)对所有内容一视同仁地按相似度、时间距离、合并频率压缩,稀少但关键的异常事件会被反复合并进背景。AAPM 引入异常优先分数 $P_a(i,j) = \exp(-\kappa S_{det}^{(i)})$,直接加进 PEMF 的总惩罚 $\mathcal{P}'_{total} = w_s P_s + w_t P_t + w_m P_m + w_a P_a$,由于 PEMF 总是合并惩罚最低的节点对,异常富集的对就不再容易被吞并。在此基础上再加一层保险:独立的异常池 $\mathcal{M}_{pool}$ 以更高密度(8 帧 × 128 token)保存通过 $S_{det} > \tau_{pool}$ 筛选的可疑帧,且不占用 PEMF 的 2048 token 配额,满了就驱逐分数最低的帧。SGF 则是效率侧的关键:借鉴“VLM 可在拼接帧上做空间化时序推理”的发现,把 1 秒 4 帧折成 2×2 网格,让 3B 小模型利用预训练空间注意力先验做异常判断,彻底绕开 3D CNN 或长序列时序建模。

方法步骤详情

完整流程分四步。第一步,持续检测:视频流以 4 FPS 进入,滑动窗口取 1 秒的 4 帧折叠成 2×2 网格图 $I_{grid}$,经共享视觉编码器 $E_{vis}$ 和投影 $\Psi_{det}$ 后,轻量 LLM 结合检测提示词预测 "Yes"/"No" 的 logits,$S_{det} = \exp(z_{Yes})/(\exp(z_{Yes})+\exp(z_{No}))$。第二步,记忆更新:RTP 层保留当前帧全部 729 个 token;FSTW 层保存最近 12 帧、每帧压缩到 128 token,溢出帧归并为元事件节点进入 PEMF;PEMF 层每节点 64 token、总配额 2048,超配额时合并总惩罚最低的相邻节点对,而异常优先分数使高异常节点免于被合并;同时 $S_{det} > \tau_{pool}$ 的帧进入异常池,池满 8 帧后驱逐 $\arg\min_k S_{det}^{(k)}$ 的帧。第三步,动态采样:正常时段($S_{det} \le \tau_{trigger}$)记忆以 1 FPS 稀疏更新,只编码每秒网格的最后一帧;一旦触发就切换为密集感知,把 4 帧全部编码为 $\mathcal{M}_{RTP}$ 提供局部微动态。第四步,休眠-唤醒推理:$S_{det} > \tau_{trigger}$ 时唤醒 7B 模块,按 $\mathcal{M}_{seq} = \mathcal{M}_{PEMF} \oplus \mathcal{M}_{ST} \oplus \mathcal{M}_{pool} \oplus \mathcal{M}_{RTP}$ 组装记忆序列,经投影 $\Psi_{reason}$ 得到二次分数 $S_{reason}$,与 $S_{det}$ 按 $S_{fused} = 0.4 S_{det} + 0.6 S_{reason}$ 融合,超过 $\tau_{confirm}$ 才确认异常,并以教师强制的交叉熵 $\mathcal{L}_{reason}$ 训练的自回归头生成异常描述。

技术新颖性

技术新颖性体现在三处。第一,SGF 的迁移方式新:让 VLM 用空间注意力处理折叠的时序内容本身有文献依据(帧拼接可激发空间化时序推理),但把它做成 4 FPS 连续流式异常过滤器并配以专门的网格数据集微调是首次,消融显示微调后 XD-Violence AP 从零样本的 43.42% 跃升到 79.55%,证明适配是可行的。第二,AAPM 的“检测引导记忆”是全新机制:以前记忆压缩策略与任务语义无关,本文首次用轻量检测分数作为先验去改写记忆合并的惩罚项,并辅以配额外的异常池和动态密集采样,三个尺度(长期事件保护、高密度证据保留、细粒度当前感知)协同工作。第三,二次验证与分数融合:Slow 模块不是简单复述 Fast 的判断,而是在受保护记忆上独立给出 $S_{reason}$,消融证明直接用 Slow 分数替换(Replace,87.28% AUC)反而不如 $0.4 S_{det} + 0.6 S_{reason}$ 的加权融合(88.44%),因为快慢两路对突变敏感性和语义深度是互补的——这种互补性分析在事件门控文献里少见。

Architecture of ReactVAU.
Fig. 2: Architecture of ReactVAU.

实验结果

VAD 性能:严格流式约束下 ReactVAU 在 UCF-Crime 达 88.44% AUC,XD-Violence 达 88.50% AP / 95.25% AUC,全面超过在线方法——MoniTor(82.57% AUC UCF)、微调 StreamForest†(85.26% AUC UCF / 75.92% AP XD),逼近可偷看未来帧的最佳离线方法 Holmes-VAD(89.51% AUC / 90.67% AP);对照的 Online-LAVAD 只有 76.06% AUC / 52.63% AP。VAU 性能:HIVAU-70K 上 Event/Video 级 CIDEr 达 2.032/2.016,超过 StreamForest†(1.999/1.931)和离线 VADER†(1.763/1.812),BLEU-E 1.366、ROUGE-E 0.488 均为最高;Clip 级 CIDEr-C 0.920 落后于 VADER† 的 1.040,原因是短片段内 AAPM 证据尚未积累。效率:H100 上 UCF-Crime 测试集(约 43% 异常段),7B LLM 查询从 34,670 降到 15,955(-54.0%),加权延迟 98.3 对 StreamForest 的 216.1 ms/query,正常态仅 22.1 ms;投影到真实 5% 异常率时查询减 95.0%、延迟 31.0 ms。消融逐级验证:SGF 微调 85.37% AUC,加 Slow-Fast 双模块微调 87.17% AUC / 86.90% AP,再加 AAPM 达 88.44% / 88.50%,每个组件均有独立贡献。

Video Anomaly Detection Performance.
Table 1: Video Anomaly Detection Performance.
Video Anomaly Understanding Performance on HIVAU-70K.
Table 2: Video Anomaly Understanding Performance on HIVAU-70K.
Efficiency and Scalability Analysis.
Table 3: Efficiency and Scalability Analysis.
Ablation Study.
Table 4: Ablation Study.
Score Fusion Strategies.
Table 5: Score Fusion Strategies.
Qualitative streaming VAU result.
Fig. 3: Qualitative streaming VAU result.
Efficiency vs. Accuracy trade-off analysis on UCF-Crime.
Fig. 4: Efficiency vs. Accuracy trade-off analysis on UCF-Crime.
查看结构化数据
任务指标本文基线提升
视频异常检测(UCF-Crime,在线微调组) 帧级 AUC 88.44% StreamForest† 85.26%(最强在线基线) +3.18 个百分点,且逼近离线 SOTA Holmes-VAD 的 89.51%
视频异常检测(XD-Violence) AP / AUC 88.50% AP / 95.25% AUC StreamForest† 75.92% AP / 92.82% AUC AP 提升 12.58 个百分点,AUC 提升 2.43 个百分点
视频异常理解(HIVAU-70K,Event/Video 级) CIDEr-E / CIDEr-V 2.032 / 2.016 StreamForest† 1.999 / 1.931;离线 VADER† 1.763 / 1.812 全面领先所有流式与离线方法,验证 AAPM 对长程异常证据的保留作用
推理效率(UCF-Crime 测试集,H100-80GB) 7B LLM 查询数 / 加权平均延迟 15,955 次 / 98.3 ms/query StreamForest(纯 Slow)34,670 次 / 216.1 ms/query 查询减少 54.0%,延迟减少 54.5%;真实 5% 异常率下理论延迟仅 31.0 ms/query

局限与改进

作者承认的局限:触发阈值 $\tau_{trigger}$ 需要在训练集上校准,其高低构成敏感性与开销的 Pareto 权衡(Fig. 4),跨数据集迁移只能放到补充材料讨论;µ = 0.4 的融合权重完全来自经验验证而非理论推导;Clip 级短片段指标不敌离线 VADER†(CIDEr-C 0.920 对 1.040),说明因果流式设定在证据积累上有先天代价。我自己观察到的局限:其一,SGF 零样本时性能反而崩塌(UCF-Crime AUC 从单帧的 74.42% 掉到 69.45%),说明网格折叠强依赖领域微调,对训练集未覆盖的异常类型泛化能力存疑;其二,效率收益的华丽数字建立在 UCF-Crime 测试集 43% 异常密度上,真实场景的低异常率收益只是理论投影,且论文没有报告误报率或误报的语义代价——误触发 Slow 模块每次要 269.5 ms;其三,异常池固定 8 帧 × 128 token,对持续数分钟的长事件,早期关键证据会被后来的高分帧驱逐;其四,整套系统绑定 StreamForest-7B 骨干,12 帧短窗、2048 配额、µ、κ、$w_a$ 等超参均为手工设定,跨骨干迁移性未知。

独立分析的弱点

独立分析几处弱点并给出改进方向。(1) SGF 对微调的强依赖:零样本网格输入破坏了 PaliGemma2 的预训练空间先验(AP 反而从 53.71% 掉到 43.42%),意味着部署到全新监控域(如工厂车间、夜间红外)时需要重新收集异常样本微调——可引入网格化的自监督预训练或课程学习,让模型先把“折叠时序”本身学成通用能力。(2) 静态全局阈值:$\tau_{trigger}$、$\tau_{pool}$、$\tau_{confirm}$ 都是单一标量,但商场、地铁、停车场等场景的异常先验和帧间噪声差异巨大——可按场景在线校准阈值,或用 con formal prediction 控制误报率上界。(3) 异常池的固定容量:8 帧配额对长时事件不足,可改为事件分段管理(检测到事件结束才清空)或按异常分数加权保留。(4) 融合权重固定 0.4/0.6:不同异常类型(突发暴力 vs 缓慢徘徊)中快慢两路可靠性不同,可让融合权重随 $S_{det}$ 的置信度动态调整。(5) 缺少误报成本评估:真实监控里每次误触发消耗 269.5 ms 且打断休眠,论文只报延迟均值,应补充误报率-检出率的运营指标和长时间真实流(而非基准测试集)上的稳定性验证。

未来方向

作者方向:补充材料已涉及跨数据集阈值迁移和 RTX 4090-24GB 消费级显卡上的实时可行性分析,说明落地部署是明确的下一步。基于本文成果可延伸的研究:(1) 多摄像头协同——多个流共享同一个 Slow 模块的唤醒预算,做全局资源调度;(2) 引入音频等多模态信号到 Fast 模块,提高对爆炸、尖叫等视觉不明显异常的敏感性;(3) 在线持续学习——让 Slow 模块的验证结果反馈微调 Fast 模块,适应新出现的异常类型,缓解 SGF 泛化短板;(4) 把“检测引导记忆”的 AAPM 思想推广到其他流式理解任务,如直播内容审核、工业缺陷流水线检测,凡是“稀有事件易被记忆压缩稀释”的场景都适用;(5) 知识蒸馏——把 Slow 模块的因果推理能力蒸馏进 Fast 模块,缩小两模块的语义差距,进一步降低误触发率;(6) 与隐私保护结合,探索在边缘设备上只跑 Fast 模块、按需上传片段到云端 Slow 模块的分级架构。

复现评估

复现评估:论文提供了项目页(https://huiyuiui.github.io/ReactVAU/),但正文中没有明确承诺开源代码和权重,只能观望。三个基准数据集全部公开可得(UCF-Crime 1,900 段、XD-Violence 4,754 段、HIVAU-70K 超 70,000 条标注),数据侧无障碍。算力方面门槛不低:需要 LoRA 微调 PaliGemma2-3B(网格数据集构建和平衡策略只在补充材料描述,需自行复刻)和 StreamForest-7B 两个模型,官方效率数据出自 H100-80GB,消费级复现可参考补充材料的 RTX 4090-24GB 路径。复现难点集中在三处:网格图像数据集的具体构建与类别平衡策略、阈值 $\tau_{trigger}$/$\tau_{pool}$/$\tau_{confirm}$ 的校准流程、以及因果在线平滑和帧级分数广播这两个评测协议细节——这些都被推到补充材料,正文信息不足以完整复现。综合判断复现难度为中高,若代码不开源则接近高。