← 返回 2026-07-21

面向开放视频流的实体导向多模态记忆系统 ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams

Xiaokang Ma, Yifan Sun, Zhihong Jin, Jie Gu, Yudong Luo, Shenyi Shao, Chu Tang, Jingmin Chen, Li Pu 📅 2026-07-14 👍 28 2026-07-25 18:30
多模态记忆 实体识别 流式感知 视频理解 长期记忆

实体导向的多模态长期记忆系统,感知流并围绕实体组织记忆,六项基准全部最优

前置知识

情景记忆/语义记忆/过程记忆

这是认知心理学对人类长期记忆的经典三分法(Tulving 1985)。情景记忆(episodic)记录具体发生过的事件及其时间地点,是最具体的一层;语义记忆(semantic)是从反复经验中蒸馏出的持久知识(属性、习惯、关系),可被强化、修正或删除;过程记忆(procedural)存储规则、技能和偏好,决定系统如何主动行动。本文正是以此三分法组织机器记忆:情景记忆按实体/痕迹/模式三级抽象分层,语义记忆围绕实体不断演化,过程记忆存放用户提醒规则。

本文整个记忆架构的命名、分层和设计哲学都直接源自这套认知理论。不理解情景与语义的区别,就无法理解三级情景记忆层级和可编辑的实体语义记忆这两个核心创新。

实体再识别(Entity Re-Identification)

ReID 是指在跨时间、跨镜头的视频流中,判定某个被检测到的人或物是否对应之前见过的同一个实体,从而为它分配一个持久身份标识。本文对人物同时使用人脸特征(ArcFace)和人体外观特征(CLIP-ReID)进行匹配,针对每个实体维护多槽画廊,让同一个人在不同会话中重出现时仍保持稳定标识。关键设计是:ReID 只产出带相似度分数的候选证据,由一个专门的 resolver 组件独占身份写入决策。

实体身份是本文记忆的组织主键,再识别的准确性直接决定了跨时间证据能否正确累积到同一实体上。而'证据与决策分离'原则是论文三大设计原则之一,是理解其鲁棒性的关键。

流式长视频记忆与上下文缓存

这类方法(MovieChat、MA-LMM、Flash-VStream、ReKV 等)通过把视频帧压缩成记忆库、稀疏 token 缓存或键值缓存,在解码时回读,从而突破模型的上下文长度限制。它们的记忆是单尺度、内容无关(content-agnostic)的,按帧或 token 组织,存放在模型上下文或主内存中。一旦视频流长度远超训练时所见的范围,性能就会退化,且无法以实体为单位追踪反复出现的人或物。

这正是本文要批判和超越的对照系。理解这类方法的'按帧/按 token、内存内、单尺度'局限,才能理解为何要转向'按实体、外部化、多尺度'的设计。

视觉语言模型(VLM)作为感知器

现代视觉语言模型(如 GPT-5、GPT-5-mini)能够同时理解图像/视频帧和自然语言指令,输出结构化描述。本文把 VLM 当作可被引导的感知器:在每个视频片段上,把工作记忆、场景上下文、实体历史和高层 agent 的场景理解注入提示词,再让 VLM 产出锚定到检测结果上的实体级观察。VLM 还被用于语义记忆的合并巩固。

感知前端的核心就是被增强提示词引导的 VLM。理解'过去参与看见现在'这一感知期上下文增强机制,必须先理解 VLM 提示词是如何被组装的。

检索增强与向量数据库

本文把记忆外部化到一个带向量索引的数据库,分别建立情景三级、实体语义、过程规则以及人脸/人体再识别画廊等独立集合,每个记忆项用 OpenAI text-embedding-3-small(1536 维)嵌入。回答问题时,agent 通过工具调用按记忆层级做相似度检索,再用重要性分数排序。这种方式让单片段成本有界、可无限运行,区别于把记忆塞进模型上下文的做法。

外部化索引存储是实现'开放流、无界运行、即插即用'部署的关键,也是本文与传统上下文缓存方法在工程实现上的根本分野。

研究动机

现有视频记忆方法存在结构性缺陷。第一类是流式与长视频模型(MovieChat、MA-LMM、Flash-VStream、ReKV 等),它们把帧压缩成记忆库、稀疏 token 缓存或键值缓存在解码时回读,但记忆是单尺度、内容无关的,按帧或 token 组织,存放在模型上下文或主内存中,一旦流长度远超训练所见范围性能就退化,且无法以实体为单位追踪谁在反复出现。第二类是面向语言 agent 的显式记忆(MemGPT、Mem0、A-MEM、MemoryBank),它们把记忆分解为情景、语义、过程三件套,但只处理文本、是对话驱动的,既不感知视频流,也不解决跨时间的持久视觉实体身份。最接近本文的 M3-Agent 以频率权重投票更新实体图谱,其语义知识几乎是只增不删(append-only),写进去就无法修订或删除;WorldMM 则是手工为每个数据集设定时间尺度且不维护实体身份,无法回答'某人是谁'这类问题。更根本的是,没有哪个系统把多尺度情景记忆、不断演化的实体中心语义记忆和过程记忆统一在一个架构里,也没有哪个系统被实现成能在任意实时流上运行的完整服务。

本文的目标是本文的目标是构建一个完整、分层、实体导向的多模态记忆系统 ReflectWorld-MM,专门面向开放式(无预定终点)的视频流。具体目标包括:第一,把原始音视频流转换成实体已解析的观察,使跨时间反复出现的人和物在同一持久标识下累积证据;第二,把记忆组织成基于人类记忆理论(Tulving 1985)的三级层次结构——多尺度情景记忆、不断演化且可编辑的实体中心语义记忆、以及存放用户规则的过程记忆;第三,让'过去参与看见现在',在模型解读每个片段前就注入已积累的上下文;第四,把记忆外部化为持久、带索引的服务,保持单片段成本有界,可被任意视频源和现成助手接入,在六个长视频与终身记忆基准上取得最优准确率。

与已有工作不同的是,本文的独特切入角度有三处。其一,以实体为组织主键:记忆不是按帧或 token 的平坦日志,而是围绕持久实体来写情景与语义,让纵向证据在实体单位上累积,这正是流式缓存方法所缺失的。其二,记忆可演化而非只增不删:语义记忆每 $N=5$ 次新观察就做一次合并,输出 Add/Update/Delete/无变化四种编辑决策,并用重要性分数 $w \leftarrow w + (1-w)\gamma$($\gamma=0.2$)做强化,使新事实易修订、反复确认的事实更稳定,这从根本上区别于 M3-Agent 的 append-only 设计。其三,把多尺度情景、演化语义、过程三类记忆统一在一个架构中,并实现成可在任意实时流上运行的完整服务,而 M3-Agent 和 WorldMM 都没有同时做到这两点。

核心方法

ReflectWorld-MM 的整体思路是:先有一套感知前端把开放音视频流切成活动连贯的片段,把每个片段里的人/物检测出来并做再识别,再用一个被上下文增强的 VLM 把片段解读成锚定到检测框的实体级观察;这些观察随后被写进一个仿照人类记忆三分法的分层长期记忆——多尺度情景记忆、演化实体语义记忆、过程记忆;整套记忆外部化到一个带向量索引的数据库,使总存储随经验增长而单片段成本始终有界,任意 agent 都可在任意时刻查询。技术路线上有三大原则贯穿始终:分离证据与决策(检测和再识别只产出带分数的证据,一个 resolver 独占身份写入),按时间尺度与抽象层级组织记忆(而非平坦日志),以及让过去参与看见现在(片段解读前先注入工作记忆、场景上下文和实体历史)。系统还提供捕获、感知、记忆查询、通知策略和上下文管理等工具接口,使基准 agent 与真实部署的 OpenClaw 助手共享同一套接口。

核心创新点有两处本质区别。第一是'过去参与看见现在':与以往多模态 agent 先存记忆、只在事后查询时才用过去不同,ReflectWorld-MM 在模型解读每个片段之前就把三层上下文注入提示词——一层是维持当前事件状态的有界工作记忆(约一百字的滚动事件摘要、最近三段片段摘要、活动实体、最多 8 个跟踪目标),第二层是逐相机的场景语义上下文(场景类型、典型活动与例行公事、异常基线),第三层是实体历史(再识别命中后取回该实体的情景与语义记录)。此外一个高层 agent 会注入场景理解来引导模型注意什么,使感知在开放流上保持叙事连续性,而非孤立描述每个片段。第二是实体导向的可演化记忆:情景记忆分实体级(每段每实体一条观察,带持久标识)、痕迹级(每段一条事件摘要并回链参与实体)、模式级(积累事件达到预算或时间间隔后巩固成章节级叙事索引)三级抽象;语义记忆按实体合并、可增改删,重要性分数反复确认时渐近趋于 1。这与只增不删的 M3-Agent 和不维护身份的 WorldMM 形成根本区别。

方法步骤详情

系统按 Algorithm 1 在线逐片段构建记忆,输入为流 $S$、巩固间隔 $N$、模式预算 $B$。对每片 $s$:(1) 网关把任意来源(RTSP/文件/USB/HTTP/手机经 WebRTC)归一化并按运动与语音切成带转写片段;(2) 检测 $D$ 与再识别 $E_v$ 产出局部证据;(3) 组装上下文 $c$(工作记忆 $W$+场景+实体历史);(4) 控制器用帧级与语义片段级策略定分析层级,每检测给局部锚点、身份只能附到已有锚点;(5) VLM 锚定 $D,E_v$ 产出观察 $O$;(6) resolver 把证据落实为身份 $E$;(7) 更新短期记忆;(8) 写实体级与痕迹级观察;(9) 当实体观察数满足 $\bmod N=0$ 时做四态巩固并按 $w\leftarrow w+(1-w)\gamma$($\gamma=0.2$)强化重要性,Update/Delete 须指向已有事实 ID、身份事实以最大重要性写并受保护;(10) 事件关闭且达预算或时间间隔时写模式级章节。查询靠共享实体标识跨层级检索,把事件与参与者、实体与其历史连起来。

技术新颖性

技术新颖性体现在五点。其一,首个把实体导向多模态记忆与开放流式感知、认知式分层组织、真实部署四者合一的系统。其二,可演化语义记忆:区别于 M3-Agent 的频率投票只增不删,本文用四态编辑决策加重要性强化公式 $w \leftarrow w + (1-w)\gamma$,新事实易改、确认过的事实更稳,并有安全编辑目标和身份事实保护(写最大重要性、禁自动改删)。其三,感知期上下文增强:三层上下文(工作记忆、场景、实体历史)加 agent 引导,使'过去参与看见现在',而不仅是事后检索。其四,证据与决策彻底分离:检测/再识别只出证据,resolver 独占身份写入,身份事实永不被不安全证据写入画廊或名称,错误可审计、局部化。其五,完整工程实现:记忆持久化于向量数据库(情景三级、实体语义、过程规则、人脸/人体再识别画廊等独立集合,用 text-embedding-3-small 1536 维嵌入),提供 offline_quality 与 live_latency 两种执行模式——后者在每用户锁下尽快提交身份等关键字段再异步对账富字段,并支持任意源网关、仪表盘和 agent 工具接口。

System architecture of ReflectWorld-MM
Figure 2: System architecture of ReflectWorld-MM
Entity-centric semantic memory over a one-week vlog
Figure 4: Entity-centric semantic memory over a one-week vlog
Task-adaptive extraction in a coffee-making scene
Figure 5: Task-adaptive extraction in a coffee-making scene
Procedural memory for proactive notification
Figure 6: Procedural memory for proactive notification
The ReflectWorld-MM dashboard on a live interview
Figure 7: The ReflectWorld-MM dashboard on a live interview

实验结果

在六个长视频与终身记忆基准上 ReflectWorld-MM 全部取得最优(详见表1、表2与 benchmarks)。实体/身份敏感基准提升最大:M3-bench-web 与 robot 相对最强记忆对手 M3-Agent 分别提升 10.4 与 9.1 个点;EgoLife-QA 46.8 不仅强于 GPT-5 的 42.6,还超过原文手动标注才达的 45.5%。通用长视频也领先:VideoMME-Long、LVBench、HippoVlog 均超 WorldMM 与 GPT-5;因用 GPT-5 作答题 agent,与 GPT-5 参考行对比正好隔离记忆贡献,且提升随视频长度增长(2.6 点→9.0 点)。记忆质量(表3)是关键:高准确率下回退源视频比例仅 4.6%(EgoLife-QA)与 6.8%(VideoMME-L),而 WorldMM 在 VideoMME-L 需 34.0%,说明记忆存的是可答证据而非源流索引。答案期消融(图3)显示移除模式级记忆在 M3-bench-robot 降幅最大(37.4→33.6),证明增益来自实体关联、模式级情景组织与语义巩固。

Results on the entity-sensitive benchmarks
Table 1: Results on the entity-sensitive benchmarks
Results on the general long-video benchmarks
Table 2: Results on the general long-video benchmarks
Memory quality measured by answer efficiency
Table 3: Memory quality measured by answer efficiency
M3-bench per-category breakdown
Table 5: M3-bench per-category breakdown
EgoLife-QA per-sub-task breakdown
Table 6: EgoLife-QA per-sub-task breakdown
Local perception utilities used by the deployment stack
Table 7: Local perception utilities used by the deployment stack
Answer-time ablation on entity-sensitive benchmarks
Figure 3: Answer-time ablation on entity-sensitive benchmarks
Qualitative trace on VideoMME (long)
Figure 8: Qualitative trace on VideoMME (long)
Qualitative trace on HippoVlog
Figure 9: Qualitative trace on HippoVlog
Qualitative trace on M3-bench-robot
Figure 10: Qualitative trace on M3-bench-robot
Qualitative trace on EgoLife-QA
Figure 11: Qualitative trace on EgoLife-QA
查看结构化数据
任务指标本文基线提升
VideoMME-Long(通用长视频多选) 准确率(%) 76.9 WorldMM: 73.8 / GPT-5: 74.3 较 WorldMM +3.1 点,较 GPT-5 +2.6 点
LVBench(通用长视频多选) 准确率(%) 69.4 WorldMM: 61.9 / GPT-5: 60.4 较 WorldMM +7.5 点,较 GPT-5 +9.0 点
HippoVlog(视听长事件多选) 准确率(%) 80.9 WorldMM: 78.3 / GPT-5: 75.7 较 WorldMM +2.6 点,较 GPT-5 +5.2 点
EgoLife-QA(身份敏感多选) 准确率(%) 46.8 GPT-5: 42.6 / EgoLife原文手动标注: 45.5 较 GPT-5 +4.2 点,且自动记忆超过手动标注
M3-bench-robot(实体中心开放问答) GPT-5-mini 判定正确率(%) 37.4 M3-Agent: 28.3 +9.1 点
M3-bench-web(实体中心开放问答) GPT-5-mini 判定正确率(%) 56.0 M3-Agent: 45.6 +10.4 点(六基准最大提升)
记忆质量-视频回退率 需回退源视频的比例(%) EgoLife-QA 4.6% / VideoMME-L 6.8% WorldMM VideoMME-L 34.0% VideoMME-L 回退率从 34.0% 降至 6.8%

局限与改进

作者坦承的局限包括:所有系统在 M3-bench 绝对准确率仍偏低,说明该基准远未解决;消融为答案期消融(固定记忆、只屏蔽答题 agent 的某个组件),各降幅应理解为该组件价值的下界,因为重叠证据仍可经其他路径检索到;记忆写入侧的效果主要靠定性案例(语义记忆演化、任务自适应抽取、过程记忆主动通知)而非定量评估。我自己的观察还有:系统高度依赖闭源前沿模型(GPT-5 做 agent、GPT-5-mini 做感知与巩固、text-embedding-3-small 做嵌入),成本、API 稳定性和可复现性都受制约;再识别一旦出错会把证据累积到错误实体上,虽然有 resolver 兜底但身份串扰仍是长程风险;巩固间隔 $N=5$ 等超参是固定的,缺少自适应;最后,对开放式连续录像存在明显的隐私与伦理隐患,论文未深入讨论。

独立分析的弱点

独立分析有若干弱点。第一,强依赖闭源前沿模型:感知、巩固、答题、嵌入都来自 OpenAI 的 GPT-5/GPT-5-mini/text-embedding-3-small,这带来成本、速率、可用性和可复现性风险,也使结果难以脱离 GPT-5 单独评估记忆本身的贡献;改进方向是用开源 VLM 与嵌入做对照实验并报告成本/延迟。第二,身份串扰的级联风险:尽管有'证据-决策分离'和 resolver,再识别的系统性偏差(遮挡、换装、双胞胎)会让纵向证据错配,错误一旦写入语义记忆会被重要性强化固化;可改进为引入身份不确定度门限、冲突检测与可撤销合并。第三,巩固与调度超参固定:$N=5$、$\gamma=0.2$、事件预算 $B$、工作记忆约百字等均为静态,无法随实体活跃度或场景复杂度自适应;可改为基于证据置信度和事实冲突率的自适应调度。第四,写入侧缺定量评估:论文只用定性案例展示可演化语义记忆,缺少对 Add/Update/Delete 正确率的系统评测;应构建写入侧评测集。第五,隐私与部署伦理未充分讨论:持续录像、人脸/人体画廊存储天然敏感,应有更明确的隐私边界与本地化策略。

未来方向

作者提及的可延伸方向包括:把记忆写入侧的效果从定性升级为定量评估;优化 live_latency 模式的低延迟提交路径以支持更密集的实时流;扩展支持的源类型与本地感知模型替换。基于成果可延伸的方向有:第一,引入身份不确定度与可撤销合并来抑制再识别错误的级联固化;第二,让巩固调度与重要性更新自适应于实体活跃度与证据冲突;第三,研究跨相机的实体追踪与多用户共享记忆,把单相机场景语义扩展为多相机协同的世界模型;第四,把过程记忆从简单规则扩展为可学习的主动行为策略,让通知/提醒更智能;第五,结合开源 VLM 与嵌入做成本/隐私友好的本地化部署,并系统评测隐私边界;第六,探索多 agent 共享同一记忆后端的协作与冲突仲裁机制。

复现评估

复现性总体偏好但有门槛。有利面:代码已开源;用六个公开基准评测;作者用 M3-Agent、WorldMM 官方代码在 EgoLife-QA、M3-bench、VideoMME-L 公平重跑,并以 Table 4 详记每数字来源,说明把不可得的 GPT-4o 评判换成 GPT-5-mini 的口径差异;本地感知 ONNX 模型在 Table 7 列出(YOLO26m、RetinaFace-ResNet50、ArcFace-MobileFaceNet 必需,CLIP-ReID ViT-B、RTMPose-S、Moonshine Tiny 可选/可换)。不利面:抽取与巩固用 GPT-5-mini、答题用 GPT-5、嵌入用 text-embedding-3-small,均为闭源 API,单次重建记忆(含消融)成本可观,难完整复现六基准;未给完整提示词、精确阈值与向量库细节(承诺随代码发布)。整体端到端复现难度较高,但核心算法(三级情景、四态语义巩固、感知期上下文增强、证据-决策分离)思路清晰,可在小规模做概念验证。