GROVE:在流式视频经验上生长与推理的时序分层记忆 GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience
让连续视频长成时序分层记忆,同一份记忆既能答问也能主动服务。
前置知识
多模态大语言模型 (MLLM)
能同时处理文本、图像、视频等多模态输入的大语言模型,如 GPT-5、Qwen3-VL。GROVE 不训练模型,而是给冻结 MLLM (Qwen3.5-35B-A3B 感知、GPT-5.2/GPT-5-mini 推理) 外挂结构化记忆与检索接口。
GROVE 的所有感知和推理能力都依赖底层 MLLM,理解它如何被冻结复用、如何通过 prompt 和工具调用驱动,是读懂本文方法的前提。
检索增强生成 (RAG) 与 Agent 工具调用
RAG 把外部知识库检索结果拼进 LLM 上下文作答;Agent 让 LLM 在多轮里自主选择调用哪个工具。GROVE 把两者结合:把视频转成文字记忆并建索引,再用 Agent 在最多 $T_{max}$ 轮里反复调用四个检索技能,去重累积证据再作答。
GROVE 的核心检索接口就是这套技能库,理解 RAG 与多轮 Agent 循环才能看懂它的 decide-retrieve-answer 机制,也才能理解为什么它能 training-free。
自我中心视频 (Egocentric Video) 与主动式助手
由穿戴相机拍摄的第一人称长视频,记录佩戴者数小时到数周的生活。主动式助手的难点不是被动答问,而是在无提问时自己判断『现在该不该提醒/干预』,如切菜时手离刀太近要提醒安全。
GROVE 的核心贡献就是用同一份记忆同时支撑这两种发起方式 (query-initiated 与 situation-initiated)。不懂这个区分,就看不出本文和普通视频 QA 工作的本质差异。
情节记忆与语义记忆 (Episodic vs. Semantic Memory)
源自认知科学 (Tulving 1972):情节记忆保存带时间地点的具体事件,语义记忆保存抽象化的规律知识。GROVE 借鉴此思想但做三点改造:在线因果生长、按时间尺度分层、并服务于主动助手而不仅是回忆。
GROVE 的 PATTERN 层就是『语义记忆』的对应物 (跨天的重复活动),MOMENT/EPISODE 对应情节记忆。理解这个类比能快速抓住分层设计的直觉。
流式视频理解 (Streaming Video Understanding)
视频一边到达一边要响应,系统只能访问已观测前缀且须实时决策。代表基准有 OVO-Bench、StreamingBench、ESTP-Bench。GROVE 的『因果生长』约束 (记忆仅由当前时间 t 之前的信息更新) 正是为此而设。
GROVE 的『因果生长』约束 (memory 仅由当前时间 t 之前的信息更新,不回看未来) 正是为流式而设;不理解流式约束就无法理解为什么所有记忆更新必须因果。
研究动机
一个可穿戴助手需要观察世界数小时、数天甚至数周,并提供两种互补的服务:一是被动问答 (用户问『我昨天把钥匙放哪了?』需从过去拉证据),二是主动干预 (用户快要重复犯错时,无需被问就推送及时提醒)。然而现有视频记忆系统存在两个结构性缺陷。首先,绝大多数 (VAM、M3-Agent、StreamRAG、MemDreamer、ReMA 等) 都是『问题优先』契约——必须有一个显式请求才能决定检索什么,无法支撑没有问题的主动服务。其次,主动式助手 (ProAssist、Eyes Wide Open、Vinci2) 虽然用当前情境决定是否干预,但其记忆与控制机制是为『触发服务』设计的,并不构成开放式回忆的通用接口。结果是同一份视频历史被两套割裂的系统管理,长期跨日的规律 (routines) 在任何单帧或单事件里都不存在,只能从多天重复活动中涌现,却没有任何系统能表达它。在 EgoServe 等基准上,最强基线 EgoMemo 总体 Macro-F1 仅 8.0,工具使用仅 7.5、错误恢复仅 1.7,说明既不能答细粒度问题也抓不住跨天的服务时机。
本文的目标是构建一个能在连续视频流上因果地在线生长的『单一记忆』,并同时满足:(1) 当用户提问时,能从任意时间尺度 (秒级状态/分钟级活动/天级规律) 精准定位证据来回答;(2) 当没有提问时,能根据当前情境主动检索相关记忆,判断是否需要推送服务并精确到秒级时机。这个记忆必须保持忠实 (faithful,保留细粒度感知证据)、可搜索 (searchable,跨尺度都能查到)、可操作 (actionable,能驱动真实响应),且在视频仍在到达时就可查询。作者希望证明:把『时间尺度』作为存储与读取之间的接口,是统一两类助手行为的关键。
与已有工作不同的是,本文的独特切入角度是『以时间尺度作为记忆与读取之间的接口 (make temporal scale the interface)』。证据的需求随尺度质变:物体计数/状态变化持续几秒,活动展开持续几分钟,规律只在跨天重复后才显现。把所有观测当成同质记录、用一个通用搜索操作去恢复本质不同的证据,必然力不从心。GROVE 让每个尺度都存储不同种类的信息,并暴露一个与之匹配的检索技能:感知痕迹 R 存秒级细粒度、MOMENT F 存带时间戳的事实、EPISODE E 存连贯活动、PATTERN P 显式构造跨天规律。这一分层不只用于压缩视频,更决定了存储的经验如何被推理。与已有层次化记忆的本质区别在于:(a) 完全在线因果生长,无回顾性 pass;(b) 每层配一个原生检索技能 (而不是一层平面索引);(c) 同一记忆与技能库既服务反应式 QA 又服务主动助手。
核心方法
直觉上,GROVE 把一段连续视频像『写日记』一样层层归纳:先用 VLM 把每个窗口写成两份 (叙述性字幕 + 结构化感知痕迹),再用一个轻量分段器把字幕流聚合成『一段活动』(EPISODE),活动关闭时切成带时间戳的『瞬间』(MOMENT) 并与历史上非连续的相似活动合并成『规律』(PATTERN)。于是记忆 $M_{\le t}=\{R,F,E,P\}$ 自然按时间尺度分层。技术路线上,整个系统被解耦为『流式记忆构造』与『Agent 式记忆访问』两条线:构造端是 captioning→segmentation→consolidation 三个可重叠的异步阶段;访问端是一个有界的多轮 Agent,在两种控制策略下复用同一套技能库。所有更新只用时间 t 之前的观测,无需回看未来,因此记忆在流仍在到达时就可查询。当前窗口通过 R 立即可用,F/E/P 只在开放的 EPISODE 关闭后才更新。
核心创新是『以时间尺度分层,并为每一层配一个原生检索技能』。传统做法把所有 caption 倒进平面索引让 Agent 慢慢搜;GROVE 让每一层只暴露与该尺度匹配的入口:Perception Lookup 读 R 找精确计数/属性/屏上文字;Moment Recall 按关键词与时间窗搜 F 找『何时何事』;Episode Replay 搜 E 摘要或读近期活动单元,返回活动段 $[t_0,t_1]$;Pattern Traversal 沿 P→E→F 群组边遍历,专处理宽泛、跨时段、因果查询。每技能内部用倒数排名融合 ($k=60$) 把 BM25 ($k_1=1.5,b=0.75$) 词面匹配与稠密语义排名结合,既命中具名实体也命中同义表述。本质区别在于:分层不是为了压缩,而是让 Agent 直接落到正确尺度的证据上,而非在平面索引里艰难搜过去。这与 ReMA 的年龄分层、M3-Agent 的实体中心记忆不同——GROVE 按时间尺度而非存储老化分层,且每层有专属技能。
方法步骤详情
记忆构造分四步。(1) 双重感知:窗口 $w_t$ 由 VLM $\Phi$ 输出 $(c_t,r_t)$,$c_t$ 为逐帧叙事字幕加窗口摘要,$r_t$ 为感知痕迹 (物体计数/属性、主-谓-宾事件、屏上文字,均带时间戳),$R_t=R_{t-}\cup\{(c_t,r_t)\}$。(2) 自适应分段:分段器判 extend/cut,录制间隔 >60s、跨天、达 EPISODE 上限则强制 cut,关闭单元存 $E$ 并写摘要。(3) MOMENT 提取:闭 EPISODE 由 $\Psi$ 原子化为 $\{f_i\}$,各配时间戳/关键词与角色权重,上限 200。(4) PATTERN 合并:$\text{Match}(e_t,P_{t-})$ 找到则重合成、否则新开。访问端:反应式 QA 走 Agent 在 $\le T_{max}$ 轮内去重累积证据;主动服务把当前感知痕迹转查询,固定 schema 填三槽 (前置 MOMENT/所在 EPISODE/关联 PATTERN),由尺度匹配专家并行评估,命中则对齐感知网格取秒级时机。
技术新颖性
技术新颖性体现在四个方面。第一,把时间尺度提升为存储-读取之间的接口,是本文独有的设计哲学;其他层次化记忆 (VAM/M3-Agent/OASIS) 用层级来压缩或去重,而 GROVE 用层级决定『如何被推理』。第二,PATTERN 层显式构造跨天规律——这是任何单帧或单事件都不存在、只能在重复中涌现的信息,作者证明了它在周/月尺度上不可替代 (去掉 PATTERN 后周准确率从 19.75 跌到 13.00,但去掉它反而让日准确率略升 18.75→19.90,体现『尺度依赖』)。第三,四技能库是『尺度原生』的:每技能只读一个源层、返回该层粒度,可粗到细跨轮配合;消融显示去掉入口点比去掉内容更伤 (Moment Recall 删除后 EgoServe 12.62→11.05)。第四,完全 training-free 且因果在线:所有更新只用 $t$ 之前观测,构造三阶段异步重叠后达到 3.08× 实时 (19.5 s/min 视频)。此外同一记忆+技能库同时驱动反应式与主动式两种策略,仅由『检索由谁发起』区分,这是与 Vinci2/ProAssist 等纯触发式系统最本质的差异。
实验结果
五基准全面领先。EgoServe 总体 Macro-F1 12.6,比 EgoMemo 高 4.6,10 子类 7 个第一;安全 19.7 vs 12.5、工具使用 20.2 vs 7.5、错误恢复 23.8 vs 1.7。MM-Lifelong (181.1 h) 日/周/月 23.50/22.75/19.98,比 ReMA 高 6.75/3.93/1.36。OVO-Bench 总体 67.5 第一 (实时 76.2/回溯 69.9/前向 56.5)。StreamingBench 均值 65.1 第一,上下文 53.1 比最强基线高 9.2,实时 77.0 持平 77.3。ESTP-Bench 上下文 41.0 vs 26.6、总体 28.6 vs 22.9,隐式主动 34.4 落后 Qwen2-VL 39.3。消融:去 EPISODE 致日最大跌 (18.75→14.57)、压平层级降到 14.75/15.50;去 PATTERN 日反升 (18.75→19.90) 但周暴跌 (19.75→13.00);删检索致日崩 (18.75→7.25);准确率 8 轮见顶、10 轮反降。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| EgoServe 主动服务 | 总体 Macro-F1 | 12.6 | EgoMemo 8.0 | +4.6 (10 子类中 7 个第一;安全/工具使用/错误恢复分别 +7.2/+12.7/+22.1) |
| MM-Lifelong 终身问答 (日) | GPT-5 判官准确率 | 23.50 | ReMA 16.75 | +6.75 (周 +3.93、月 +1.36) |
| OVO-Bench 在线视频理解 | Overall Score | 67.5 | StreamBridge 62.6 | +4.9 (实时感知 76.2、回溯 69.9、前向主动 56.5) |
| StreamingBench 流式理解 | Real-Time + Contextual 平均 | 65.1 | ViSpeak 57.2 | +7.9 (上下文理解 53.1,比最强基线高 9.2) |
| ESTP-Bench 主动式视频理解 | Overall Score (ScoreF1) | 28.6 | MiniCPM-V 22.9 | +5.7 (上下文问答 41.0 vs 26.6) |
| 记忆构造吞吐 | 每分钟视频构造秒数 | 19.5 s/min (3.08× 实时) | 78.2 s/min (密采样起点) | 从 78.2 降到 19.5,1 frame/5s 起超越实时 |
局限与改进
作者承认四点:(1) 继承冻结感知模型的误差,感知阶段漏掉的证据无法通过后续合并恢复;(2) 高层记忆只在 EPISODE 关闭时更新,当前窗口查询只能依赖感知痕迹 R,对尚未闭合活动缺乏结构化视图;(3) 记忆构造与多轮检索成本随观测历史增长;(4) 各主基准用不同推理骨干 (MM-Lifelong 用 GPT-5.2、其余 GPT-5-mini),组件级结论依赖固定骨干消融而非绝对跨基准结果。我额外观察到:绝对值仍偏低 (EgoServe 12.6、MM-Lifelong 月 19.98,人类 80.4-99.2),离实用级主动助手差距大;ESTP-Bench 隐式主动落后 Qwen2-VL,说明对纯情境触发无优势;方法重度依赖 prompt 工程与多次 LLM 调用 (日尺度平均 9.16 次/问、月尺度 15.07 次),鲁棒性与延迟在真实部署是隐患;部分基准 (EgoServe 的 HoloAssist/CaptainCook4D) 注入了任务先验 (标准步骤、已知错误模式),与完全开放生活场景不可同日而语。
独立分析的弱点
第一,强依赖 MLLM 感知质量:VLM 把计数或屏上文字识别错,错误会随 MOMENT/EPISODE 上浮到 PATTERN 且不可恢复;改进方向是引入感知置信度与多模型交叉验证,或对低置信感知痕迹做按需回看原始帧的二次确认。第二,高层更新滞后:EPISODE 不闭合时 F/E/P 不变,长活动 (10 min 上限) 内实时细粒度问答只能靠 R;改进方向是对开放 EPISODE 做软提交增量 MOMENT。第三,延迟与成本随历史线性增长 (日尺度 4.95 轮/47.6 s/26.5K token,月尺度 15.07 轮);改进方向是对 PATTERN 老化合并、对 E 层时间衰减剪枝。第四,对纯情境触发的隐式主动不占优 (ESTP-Bench 34.4 vs 39.3),schema 固定填三槽不够灵活;改进方向是主动侧也用 Agent 式多轮检索或学习轻量触发路由器。第五,绝对分数偏低 (人类 80.4-99.2),可端到端微调轻量 adapter 替代纯 training-free。第六,跨基准骨干不一致削弱可比性,建议统一骨干重测。
未来方向
作者层面未单列未来工作章节,但从结论与局限可归纳:(1) 把记忆做成『可穿戴助手必须持续观察-记忆-行动的实用基底』,向真实部署推进;(2) 降低构造与检索随历史增长的成本;(3) 统一推理骨干以加强组件级可比性。基于成果可延伸的方向:把时序分层思想迁移到机器人长程操作记忆 (具身 Agent 的终身学习),用 PATTERN 层建模『用户的日常 routine 与偏好』做个性化预测;引入主动学习机制让系统在高不确定性时主动回看原始帧或询问用户;与音频流 (语音对话) 联合建模,扩展 M3-Agent 式的多模态记忆;把 schema 主动服务升级为开放域 Agent,让助手自行决定服务类型与措辞而非从闭集中选;探索记忆遗忘与隐私控制 (GDPR 合规的可删除记忆),这对真实可穿戴产品是硬需求;最后用强化学习从用户反馈优化四技能的调度策略,替代当前固定 router。
复现评估
复现友好度中等偏上。代码承诺开源 (github.com/SitongGong/GROVE)。附录 A 给出较完整实现:Table 10 列出全部超参 (窗口 30s/10s、帧间隔 5s/2s、EPISODE 上限 10min/2min、$\Delta=5/10/20s$、BM25 $k_1=1.5,b=0.75$、融合 $k=60$、$T_{max}=8/6/12$),Algorithm 1 给在线构造伪代码,A.2 详述每基准差异化实例化与技能调用统计。算力需 NVIDIA H200 跑本地视频处理,推理端依赖商用 API (GPT-5.2/GPT-5-mini/Qwen3.5-35B-A3B),完整复现主表成本不低 (日尺度单问 26.5K token),五基准均公开。难点:数据体量大 (MM-Lifelong 181.1 h) 构造耗时;多 LLM 调用链路长,工程细节多;部分基准注入任务先验需严格按协议复现。整体按附录可复现主要结论,完整主表需可观预算与工程投入。
论文图表
概览图把 GROVE 与 Gemini、GPT、Qwen、ReMA、EgoMemo、MiniCPM-V 等基线放在五个雷达轴上 (MM-Lifelong/OVO-Bench/StreamingBench/ESTP-Bench/EgoServe),并配三个真实场景示例:识别吃火锅时喝的是豆浆、切蛋糕手离刀近时主动提醒、搅茶时回答杯子颜色与相对车辆位置。视觉上 GROVE 的多边形几乎全面包住基线。
这是全文的卖点图,一图说清 GROVE 同时覆盖『超长记忆问答 + 实时感知 + 主动服务/前向提醒』三类能力,且在每个轴上都领先,是理解论文动机与贡献的最快入口。
一个时序排序问题 (进入黑风山后四个 boss 的击败顺序),GROVE 在 8 轮内先 search_episodes 定位区域,再用 search_moments + hierarchical_search 拉取每个 boss 的击败时间戳,最后把时间范围收窄 (如第 6 轮搜 [01:20:00, 01:25:00]) 重建时间线,得到正确答案 1,4,2,3。
这张图完整展示了 Agent 多轮、粗到细、跨技能协作的推理轨迹,是理解『同一技能库如何被组合』与『答案从重建时间线而非直接回忆得出』的最佳案例,对复现与教学都极具价值。