NARU:面向日语超长视频叙事演化与文化细微理解能力的基准 NARU: A Benchmark for NARrative Evolution and Cultural Nuance Understanding in Japanese Extreme Long Video
155个日本长视频、1481道选择题,联合评测长视频叙事追踪与文化隐含义推理
前置知识
多模态大语言模型(MLLM)
能同时处理文本、图像和视频输入的大语言模型,如 Gemini 系列、Qwen-VL 系列。处理视频时通常将视频按固定帧率或固定帧数均匀采样为若干关键帧,编码为视觉 token 后与文本一起送入语言模型。模型可处理的帧数(帧预算)直接决定其能看到多少时间分布上的证据。
本文的核心评测对象就是 MLLM,所有结论都建立在「模型只能通过稀疏采样帧理解数小时视频」这一前提之上,帧预算实验($f \in \{8,16,32,64,128\}$)是全文关键分析。
事件分割理论(EST)
认知心理学的经典理论,认为人类会把连续经验感知为由离散事件组成的序列,并在事件边界处更新内部事件模型。它区分了「局部连贯」(相邻事件之间的一致性)与「全局连贯」(把分散在长时段的证据整合为统一解释)两个层次。
NARU 的四个叙事维度(N.1–N.4)正是按局部/全局连贯两档组织的,理解这一理论才能明白题目分类背后的设计逻辑,而非随意切分。
高语境文化与「读空气」
Hall 提出的高语境传播理论指意义主要依赖共享情境而非字面语言的交流方式。日语交流的典型表现包括 kuuki wo yomu(空気を読む,读空气:从氛围推断不成文的社交规范)和 aizuchi(相槌:听者的短促附和,可表注意、惊讶或话轮管理,并不必然表示同意)。
论文五个文化维度(C.1–C.5)全部建立在这些日语特有的隐含交际信号上,是理解「文化理解」这一评测轴到底在测什么的基础。
FActScore 式原子事实召回
一种开放文本评价方法:把参考答案分解为若干自包含的原子事实,再逐一判断生成答案是否覆盖每个事实,召回率即覆盖比例 $\text{recall} = \frac{\text{覆盖的事实数}}{\text{参考事实总数}} \in [0,1]$。相比精确匹配,它允许部分正确,适合开放式生成评分。
论文的开放生成评测用 GPT-5.5 作裁判按此协议打分,MCQ 与开放式的难度反转结论正是靠这种给部分分的指标才显现出来。
文本捷径与视频盲解
指模型不看视频、仅凭问题文本和选项的语言统计线索(如正确答案语气更礼貌、其他选项自相矛盾)就能答对的现象。检验方法是「视频盲解」:让一个代理在 $V = \varnothing$(无视频输入)条件下作答,若成功率显著高于随机水平 $0.25$,说明题目存在泄漏。
NARU 用盲解代理构成 Solver-Critic 迭代去偏循环来清洗题目,这是其数据质量的核心保障机制,也是评价同类基准可信度的重要视角。
研究动机
现有长视频评测能力是割裂的:LongVideoBench 与 LVBench 侧重长程检索、时间定位和通用推理,VRBench 与 StoryVideoQA 专注多步叙事推理,ViMUL-Bench 等多语言基准则拓宽语言与文化覆盖面,但没有一个基准同时考察「持续的叙事理解」与「文化情境下的隐含推理」。与此同时,真正需要这两种能力的场景被系统性忽略:完整电影、电视剧集、直播回档和纪录片要求模型跨越数十分钟到数小时整合信息。日语媒体是典型测试床——日本视频内容市场规模在 2025 财年预计约 6300 亿日元,且日语交流高度依赖读空气、相槌等高语境信号,其意义散布在长时间跨度上。然而构建此类基准面临双重困境:纯人工标注需要母语专家观看数小时视频并捕捉细微文化线索,认知负荷和成本不可扩展;而端到端用 MLLM 自动标注则受上下文窗口瓶颈限制,SOTA 模型处理数小时连续视频时会丢失细节、产生幻觉、无法维持叙事一致性。
本文的目标是本文的目标是构建 NARU——一个系统性评测「叙事智能」与「本土文化理解」联合能力的大规模日语长视频基准。具体包括:从超过 10 万候选视频中筛选 155 个总时长 146.8 小时、30 到 240 分钟的「情境丰富型」长视频;设计 4 个叙事维度(N.1–N.4)与 5 个文化维度(C.1–C.5)共 9 类能力分类体系,产出 1481 道经校验的四选一选择题;提出一套能在数小时尺度上可行运行的分层记忆式标注到出题流水线;并通过 68 名日语母语标注者的两阶段人工校验保证数据质量;最后用 8 个模型配置(3 个闭源 Gemini、5 个开源模型)建立系统基线,刻画叙事与文化推理各自的失效模式。
与已有工作不同的是,本文的独特切入有三点。第一,问题形式化上的区分:作者提出「情境丰富型长视频」概念——监控录像虽长却可用局部检索解决,而影视剧集中事件的意义只有在与早前事件、演化中的人物和累积社会语境的关系中才浮现——把这类内容的理解定义为「维持叙事状态」与「解读文化情境隐含义」的联合问题,而非把时长、叙事、文化当作独立能力。第二,理论驱动的能力分类:不像多数基准照搬已有框架,作者桥接事件分割理论(EST)与高语境传播理论构造出推理目标互不重叠的子类别,文化维度还按「证据到解释」的过程分层(可观察信号 C.1 → 共享情境 C.2 → 说话人意图 C.3 → 背景知识 C.4 → 情感动态 C.5)。第三,以日语高语境媒体为聚焦场景,使文化隐含义推理成为可操作的评测对象,而不只是多语言覆盖的附属品。
核心方法
整个构建流程直觉上就是「先把视频变成结构化记忆,再从记忆里出题,最后用盲测和人工双重把关」。技术上分三大阶段。阶段一是视频收集与筛选:跨 16 个 YouTube 上传类别检索并去重得到超过 10 万视频,ASR 口语语言识别过滤出 51643 个日语视频,按 LVBench 的 ≥30 分钟标准保留 8018 个候选;再由两名日语熟练作者按视觉完整性、时间语义演进性等四项标准人工筛除循环内容与无关片段合集;最后从 30 个种子视频出发做基于嵌入的贪心增量多样性采样(新视频与已选样本的标题和描述余弦相似度低于阈值 $\tau$ 才入选),得到 155 个视频、约 146.8 小时。阶段二是 MLLM 中心的分层标注(Step 1-1 至 1-3),把每个视频转成块级和段级两层相连的时间结构化证据,并叠加分类体系对齐的叙事与文化标注。阶段三是 MCQ 生成(Step 2-1 能力条件化表述、Step 2-2 盲解去偏迭代精炼),随后由 40 名加 28 名共 68 名母语专家做两阶段校验。所有 MLLM 组件统一使用 Gemini 2.5 Pro。
核心创新是分层记忆式标注流水线,它与已有方法的本质区别在于把「发生了什么」与「意味着什么」解耦成两层结构。短块处理加长期叙事历史的机制是关键:5 分钟一块的视频块由 MLLM 顺序处理,每次生成新记录时都会拿到前序块的文本摘要作为长期记忆,从而在局部处理窗口内维持跨边界的实体一致性和事件追踪——这绕开了单次上下文窗口装不下数小时视频的硬约束,而纯人工标注在这个尺度上又因认知负荷不可行,所以这是唯一能兼顾规模与质量的路线。第二个关键设计是 Solver-Critic 去偏循环:先让盲解代理在无视频条件下作答,答对即视为潜在泄漏,再由诊断代理定位漏洞类型(如语气偏差——正确答案唯一礼貌、排除法漏洞——多个干扰项自相矛盾),修订代理据此改写题干、正确答案或干扰项,循环迭代直至盲解成功率接近 25% 随机水平。这从机制上保证了「答对主要靠多模态理解」。
方法步骤详情
Step 1-1 分块:每个视频切成约 5 分钟的块(有转写时边界对齐到 5 分钟后最近的转写端点以免切断对话),MLLM 顺序处理每块,输出模式约束的 JSON 记录(块摘要、实体列表、带时间戳事件、闭式字幕含对话/屏幕文字/非语音音频/语调),并附带前序块的相对时间戳回顾;最后把所有块记录统一到视频相对坐标系的全局时间线,按标识符去重实体并按时序排序事件。Step 1-2 语义分段:以低帧率视觉采样加 Step 1-1 标注为参考做第二次全视频扫描,受分段话语表示理论启发,识别出具有连贯主题或叙事功能的章节级片段(记录时间跨度、摘要、详细描述、内容类型),边界设在实质性主题转换或内容功能变化处。Step 1-3 任务导向标注:叙事模块在视频级表示上推理,为角色分配功能角色并组织成叙事线(中心实体、关键事件、因果推进)支撑 N.1–N.4;文化模块分析每个语义段,抽取五个文化维度(C.1–C.5)的带时间戳证据,再沿时间线整合。Step 2-1 出题:MLLM 接收原视频、段级表示、相关标注和任务指令,生成题干、正确答案及依据记录和三个干扰项,要求所有选项粒度、极性、长度、句法复杂度相当。Step 2-2 去偏:盲解代理无视频作答→诊断代理输出修订计划→修订代理改写,迭代至盲解成功率接近随机或达预算。最后两阶段人工校验:40 人初审(1500 题中 178 题标记无效、161 题修复、17 题删除;标注者另为 107 题亲撰正确答案、纠正 177 题标签)得 1483 候选;28 人复审去偏修订后的题目(949 题原样通过、532 题修订——含 436 处答案纠正、108 处干扰项编辑、35 处题干重写——2 题删除),最终定稿 1481 题。
技术新颖性
技术新颖性体现在四点。其一,这是首个把持续叙事理解与文化情境隐含推理放在同一超长视频基准里联合考察的工作,此前的叙事基准(DramaQA、SCVBench、VRBench)止步于结构化情节元素与显式因果,文化/社会基准(Social-IQ、DESIQ)又缺乏长时叙事弧。其二,分层记忆式标注在工程上首次让 146.8 小时规模的高质量标注变得可行:块级 JSON 记录+章节级语义段+任务导向标注的三层表示,既是可扩展的中间产物,也为出题提供了证据定位能力(每题必须附带依据记录)。其三,视频盲解驱动的迭代去偏循环把「防语言捷径」从事后抽查变成生成过程内建的闭环控制,并用 532/1483 的题目修订率实证了其必要性——超过三分之一题目确有捷径漏洞需人工或自动修复。其四,出题时强制选项在粒度、极性、长度、句法复杂度上对齐,从源头压制选项级捷径,这是多数自动出题基准未做的细节。
实验结果
MCQ 全量评测呈明显分层:闭源模型显著领先,Gemini-3-Flash 以 76.2% 居首,Gemini-3-Pro 70.0%,Gemini-2.5-Flash 51.4%;开源模型处于 29.6%–39.8% 的低位区间,最高的 Qwen3.5-9B 也仅 39.8%(Qwen3VL-8B 37.4%、InternVL3.5 31.5%、Qwen2.5VL-7B 29.7%、MiniCPM-o-2.6 29.6%)。能力维度上出现关键分化:Gemini 系叙事平均分比文化平均高约 11 个百分点,开源模型两个维度几乎无差。叙事类中 N.2(时序/话题流)对所有模型都最容易,但瓶颈随能力水平移动——弱模型卡在低层实体追踪(N.1:InternVL3.5 仅 20.0%、MiniCPM-o-2.6 23.2%,低于 25% 随机线),强模型卡在高层抽象(N.4 主题发展,Gemini-3-Flash 也只有 78.1%)。文化类中 C.3(潜台词解读)即使对前沿模型也极难:Gemini-3-Flash 跌至 57.4%(其文化平均 68.2%),这也是唯一 Gemini-3-Pro(64.2%)反超 Flash 的类别;多个开源模型在 N.1、C.1、C.4 上低于 25% 随机水平。帧预算实验(500 题子集,$f$ 从 8 到 128):Gemini-3-Pro 从约 64% 升至 71%,Flash 从 53% 到 64%,2.5-Flash 从 39% 到 51%,Qwen3VL-8B 从约 31% 到 38%,其余开源模型停留在 30% 附近;叙事增益 1.4–20.5 个百分点远超文化的 -3.9–+10.0,说明叙事错误主因是分散事件缺失(加帧可解),文化瓶颈则在语用推理与预训练知识覆盖。有趣的是 Gemini-3-Pro 在 8 帧时领先 Flash 11 个百分点,而全量 0.25 FPS 下 Flash 反超(76.2% 对 70.0%),揭示低信息推理与高频输入扩展两种不同优势机制。开放式评测(GPT-5.5 裁判、原子事实召回,人工一致性 90.0%、多数投票 96.0%):Gemini 系保持 0.66–0.78(Flash 0.78、Pro 0.75、2.5-Flash 0.66)对开源的 0.21–0.56(Qwen3.5-9B 0.56、Qwen3-VL-8B 0.44、InternVL3.5 0.38、Qwen2.5-VL-7B 0.35、MiniCPM-o-2.6 0.21)。跨格式出现两个反转:MCQ 下最强的 N.2 在开放式下变成 8 个模型中 7 个的最弱叙事类(失去选项脚手架后须自主重建时序);MCQ 下 6/8 模型叙事强于文化,开放式下所有模型文化都高于叙事(78.9% 的文化回答至少覆盖一条参考事实,叙事仅 66.3%)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 日语长视频 MCQ 问答(1481 题,9 个能力维度) | 四选一选择题准确率(%) | NARU 上最佳为 Gemini-3-Flash 76.2%;最佳开源模型 Qwen3.5-9B 39.8%;最弱 MiniCPM-o-2.6 29.6% | 无先前工作直接可比;参照系为 25% 随机猜测线及各模型在既有长视频基准的相对排名 | 闭源最佳领先最佳开源模型 36.4 个百分点,暴露开源模型在高语境长视频上的巨大差距 |
| 开放式长视频问答(500 题诊断子集) | 原子事实召回率(FActScore recall,0–1,GPT-5.5 裁判) | Gemini-3-Flash 0.78、Gemini-3-Pro 0.75、Gemini-2.5-Flash 0.66 | 最佳开源 Qwen3.5-9B 0.56,最弱 MiniCPM-o-2.6 0.21 | 闭源最佳领先最佳开源 0.22,与 MCQ 排位一致但数值整体下移,说明去掉选项后绝对能力更低 |
| 帧预算扩展下的叙事 vs 文化理解(500 题子集) | 准确率变化(百分点,8 帧 → 128 帧) | 叙事最高提升 +20.5 pp,各模型叙事增益 1.4–20.5 pp | 文化维度增益仅 -3.9 至 +10.0 pp,部分模型反而下降 | 叙事错误主要源于分散证据缺失、加帧即可缓解;文化理解受限于语用知识与推理,对采样密度不敏感 |
局限与改进
作者承认的局限相对含蓄,但可从文中推出几点:开放式评测只在 500 题诊断子集上进行,未覆盖全部 1481 题;自动裁判(GPT-5.5)虽经 50 题 150 次判定的人工校验(接受率 90.0%),但仍有约 10% 分歧;文化标注的真值本质上是主观判断,尽管有母语专家校验,论文未报告标注者间一致性系数。我自己的观察:其一,整条构建流水线(标注、出题、盲解、修订)都基于 Gemini 2.5 Pro,题目风格可能系统性偏向 Gemini 家族的输出分布,造成对 Gemini 的隐性利好——虽然Gemini 内部也有分化(Pro 与 Flash 互有胜负)部分缓解了这一担忧,但与开源模型的差距中可能混入「出题者偏爱」成分;其二,每类题目约 143–187 道,细分到具体失效模式时统计功效有限;其三,C.1 相槌理解高度依赖韵律和话轮时机,而帧采样模型主要靠字幕文本,评测测到的可能只是语义侧影;其四,视频来自 YouTube,版权约束下数据开放的完整性存疑,且 2026 年 8 月的模型快照很快会过时。
独立分析的弱点
第一,流水线对单一闭源模型(Gemini 2.5 Pro)的依赖构成系统性偏差风险:标注视角、出题措辞、干扰项风格都继承同一模型的先验,评测时可能形成「同源偏好」。改进方向是用两个以上异构模型交叉标注与出题,报告跨模型标注一致率。第二,文化真值的主观性未量化:读空气、潜台词这类判断即使母语者之间也有分歧,论文未报告 inter-annotator agreement(如 Krippendorff's $\alpha$)。改进方向是让每题由多名标注者独立判定并只保留高一致题目,或引入分歧度作为难度标签。第三,C.1(相槌)的评测设计与输入模态错配:相槌的功能(同意/惊讶/话轮管理)大量编码在韵律、语调和时机中,而均匀帧采样+字幕的输入方式使多数模型根本拿不到这些信号,测得的低分可能是「输入缺失」而非「能力缺失」。改进方向是为此类题目提供音频流输入并分离模态消融。第四,25% 随机线之下还有多个模型-类别组合(N.1、C.1、C.4),暗示选项位置偏差或答案分布不均未被审计。改进方向是发布答案位置打乱的对照版本并检验排序鲁棒性。第五,均匀帧采样对任何模型都不是最优的时间证据选择策略,帧预算实验的结论(叙事可靠加帧解决)可能低估了具备时序定位能力的模型。改进方向是加入检索式/代理式关键帧选择基线。每个弱点都指向同一层结论:NARU 测出的差距是真实信号,但其幅度和归因需要更细的消融来确认。
未来方向
作者方向上希望 NARU 成为开发「能可靠解读长时高语境视频的下一代 MLLM」的催化剂。可延伸的具体方向包括:把基准扩展到其他高语境语言与文化(汉语、韩语的敬语与面子系统),检验「叙事靠上下文长度、文化靠知识覆盖」这一双机制结论的普适性;基于分层记忆标注流水线的副产品——块级/段级结构化标注本身就是稀缺训练数据——构建长视频叙事理解微调集;针对 C.3 潜台词(连 Gemini-3-Flash 也只有 57.4%)开发显式的语用推理模块或理论驱动(tatemae/honne 建模范式);将帧预算扫描延伸到 128 帧以上并测试自适应关键帧检索、记忆代理架构,验证 Gemini 的端到端视频预训练优势能否被开源社区以架构手段弥合;把开放式评测扩展到全量题目并引入时序定位类任务(证据时间戳预测),利用标注中现成的时间戳证据;以及考察测试时计算(更长思考、多轮工具调用)对文化推理的增益是否大于对叙事追踪的增益——帧实验的叙事/文化不对称预示这一分化可能在推理时扩展上重演。
复现评估
复现难度中等偏高,且不同环节差异很大。评测侧较容易:基准数据与评测资源发布在项目网站(ma-labo.github.io/naru/),MCQ 评测只需推理算力——闭源走 Gemini 原生 API(fps=0.25 采样),开源模型最多 128 帧均匀采样,单张高端 GPU 即可跑 7B–9B 模型,1481 题的规模可控。流水线复现则成本高昂:标注、出题、盲解循环全部调用 Gemini 2.5 Pro,对 146.8 小时视频做分块标注加语义分段加两轮出题迭代,API 费用预计数千美元量级,且阈值 $\tau$、迭代预算等超参数仅部分公开在网站;最不可复制的是人工环节——68 名日语母语专家、两轮各约两周的校验(1483 题中人工修订 532 题),任何团队重建同等质量门槛都需要类似的人力组织。此外,复现结论时需注意模型快照时效:表 II 的具体数字绑定 2026 年的模型版本,但「闭源-开源 36 个百分点的结构性差距」和「叙事/文化对帧预算的不对称响应」这两个核心发现有较大概率稳健。总体而言,把 NARU 当评测集用门槛低,复现其构建方法论门槛高。
论文图表
两组对照示例。(a) 叙事智能:模型被要求总结角色在长视频中的完整故事线,图中展示同一次叙事在 0:12:46「新的梦想」、1:04:32「挑战与成长」、1:56:07「成功与新的开始」三个时间点的演化。(b) 文化理解:客人在 1:10:34 表示想多待一会儿,主人在 1:43:26 提出「再喝一杯咖啡吗」,模型需推断其在 1:45:16 场景下(京都语境)这句话实际含义是「你该走了」。
一张图把论文的两条评测轴变成可感知的具体任务:叙事轴测跨数小时的状态演化追踪,文化轴测字面语义与真实意图的反差。理解这两例就理解了 NARU 与普通视频问答基准的本质差异,适合作为读者建立直觉的入口。
基准的类别统计:叙事类共 745 题——N.1 角色/实体演化 185、N.2 时序/话题流 187、N.3 情节/冲突推进 186、N.4 主题/思想发展 187;文化类共 736 题——C.1 相槌 143、C.2 读空气 147、C.3 潜台词解读 148、C.4 文化语境识别 149、C.5 情感分析 149。每类标注了证据类型(如跨段角色状态、事件序列、因果线、社交氛围、文化专名等)。
给出 9 个能力维度的准确定义、证据类型与题目分布,是解读所有实验数字的字典——后续表格中 N.x/C.x 的每一列都对应此表的行,且各类约 150 题的均衡设计保证了类别级结论的统计效力。
8 个模型在全部 1481 题上的分维度准确率。采样设置:Gemini 三型号 0.25 FPS,开源模型 64–128 帧。总体:Gemini-3-Flash 76.2% > Gemini-3-Pro 70.0% > Gemini-2.5-Flash 51.4% >> Qwen3.5-9B 39.8% > Qwen3VL-8B 37.4% > InternVL3.5 31.5% > Qwen2.5VL-7B 29.7% > MiniCPM-o-2.6 29.6%。关键细节:Gemini-3-Flash 叙事平均 84.2% 对文化 68.2%;C.3 是唯一 Gemini-3-Pro(64.2%)超过 Flash(57.4%)的类别;多个开源模型 N.1/C.1/C.4 低于 25% 随机线。
论文的主结果表,所有「闭源-开源差距」「叙事-文化不对称」「瓶颈随能力水平移动」「潜台词最难」等结论的数字出处,逐列阅读可以直接定位每个能力维度上的最强与最弱模型。
同一批模型在 500 题开放式子集上的原子事实召回率:Gemini-3-Flash 0.78、Gemini-3-Pro 0.75、Gemini-2.5-Flash 0.66、Qwen3.5-9B 0.56、Qwen3-VL-8B 0.44、InternVL3.5 0.38、Qwen2.5-VL-7B 0.35、MiniCPM-o-2.6 0.21。分维度看,所有模型文化类召回都高于叙事类;N.2 在 MCQ 下的优势消失,成为 7/8 模型最弱的叙事类。
与 Table II 对照才能看到跨格式反转:去掉选项脚手架后叙事难度反超文化、时序流从最容易变成最难。这张表证明 MCQ 的高分会系统性高估模型自主重建时序证据的能力,是论文方法论上最有说服力的补充实验。