VIABench:由盲人采集的视障辅助综合视频基准 VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance
首个由盲人实拍、覆盖主动提醒/问答/交互三大任务的在线视频评测基准
前置知识
多模态大语言模型 (MLLM)
能够同时处理视觉(图像/视频)和语言(文本)输入的大模型,如 GPT-5、Gemini-2.5 Pro、InternVL3.5、Qwen2.5-VL 等。它们通常由视觉编码器、投影层和语言解码器组成,可执行视频问答、字幕生成、时序推理等任务。
本文要评测的全部对象就是 MLLM,理解其离线/在线两种工作模式以及它们在实时性上的差异,是读懂评测设计的核心前提。
自我中心视频 (Egocentric Video)
由佩戴在用户身上(眼镜、胸挂、手持)的相机以第一人称视角拍摄的视频。视障用户的这类视频常伴随遮挡、过曝、画面倒置、剧烈晃动等低质量伪影,因为用户无法靠视觉调整取景。
VIABench 94% 数据来自视障用户实拍,低画质与非常规视角是评测模型鲁棒性的关键变量,也是普通视频基准不具备的核心挑战。
Proactive Reminder(主动提醒)
一种在线视频任务:模型需要持续监听视频流,在没有用户提问的情况下,自行判断何时该主动发出预警或导航提示(如前方台阶、偏离斑马线、相机被遮挡),并在无需提示时保持沉默。
这是 VIABench 的核心任务,区别于以往被动的视频问答,对模型的时序感知、触发时机把握提出了全新要求。
Token-Level Prompt Activation Decoding (TPAD)
本文提出的方法:把一段固定的二选一提示词(如「应否提醒?(A) 是 (B) 否」)与整段视频的所有帧 token 拼成一个序列,做一次前向传播;再对每一帧的最后一个 token 取隐藏状态,过 LM head 投影到词表空间,对 A/B 两个 token 做 softmax 得到该帧的「提醒概率」。
TPAD 让不能流式输出的离线 MLLM 也能参与主动提醒评测,且一次前向即可得到逐帧评分,是本文最重要的方法贡献。
LLM-as-a-Judge(大模型充当裁判)
用一个强模型(本文为 GPT-5)作为评分器,对被测模型的回答与人工标注做语义相似度打分,分数 $S_i \in [0, 1]$。本文针对安全攸关场景设计了任务特异化的判分准则,惩罚事实性错误(如扶梯运行状态说反)。
VQA 和 VGI 任务的主指标 VAS 以及 PR 的描述准确率 MPS 都依赖 GPT-5 评分,理解这一点才能正确解读实验结果。
研究动机
视障个体(VII)在过马路、找店门、读菜单这类看似简单的日常任务上面临巨大障碍,传统白杖和导盲犬只能提供局部支持,无法传达高层语义或上下文信息。尽管 MLLM 在通用视频理解基准(MVBench、Video-MME、CG-Bench 等)上屡创佳绩,但它们在真实盲人辅助场景的可用性几乎未被系统评测。已有视障辅助数据集存在明显短板:VizWiz 仅 31K 张静态图像无时序;EgoBlind 含 1,392 段视频共 15.5 小时但只支持被动 VQA,平均时长仅 40s;WalkVLM 用 12K 段每段约 3s 的 YouTube 旅游 vlog 训练,与真实盲人第一视角存在显著领域差异,且过短时长不足以支撑长时段推理。这些数据集都无法覆盖「主动预警 + 被动问答 + 交互式引导」这一完整辅助链路。
本文的目标是构建一个真正从盲人用户视角采集、覆盖完整辅助需求的大规模长视频基准。具体目标包括:(1) 收集足够长且真实的视障第一视角视频,提供充足时序上下文;(2) 同时定义三种互补任务——主动提醒、视觉问答、视觉引导交互——分别对应「什么也不做」「提问」「接受迭代引导」三类用户行为;(3) 提供一套严谨且公平的评测流水线,使离线与在线 MLLM 都能在统一协议下被评测;(4) 通过实验揭示当前最强 MLLM 在真实辅助场景下的能力上限与瓶颈,为后续研究指明方向。
与已有工作不同的是,本文的独特切入在于三点。其一,VIABench 是首个同时覆盖主动、被动、交互三类行为、且数据完全由视障用户实拍的统一基准——94% 的数据(约 44 小时)来自真实盲人创作者,平均时长 222s、最长 1959s,远超 EgoBlind 的 40s 和 WalkVLM 的 3s。其二,提出主动提醒任务并配套 TPAD 评测框架,把「何时该说话」这一在线视频独有的难题首次纳入标准化评测,而以往在线基准(如 StreamingBench)依赖稀疏标注、对 ground truth 区间附近反复查询,既昂贵又忽视时序动态。其三,明确把「鲁棒性」作为评测维度,要求模型能识别相机被遮挡、过曝、倒置等异常并主动提示用户调整。
核心方法
整体思路是「任务驱动 + 真实数据 + 公平协议」。作者先从视障用户视频与评论区反馈中归纳出三类典型辅助需求,分别映射到 Proactive Reminder、VQA、Vision-Guided Interaction 三个任务,难度递增、覆盖主动/被动/交互三种用户行为。数据上采用五阶段流水线:从 YouTube/Bilibili/DouYin 检索真实盲人视频,加上由标注员角色扮演补足交互场景的 231 段模拟视频;经 14 名学生标注员在 150 段视频上做 3.5K 条试点标注后,再由专业标注团队规模化,最终用 GPT-4o 翻译为英文。技术路线的关键创新是 TPAD——它把任意 Transformer-based 离线 MLLM 转成逐帧的「主动检测器」,无需微调即可评测主动提醒能力。评测端则统一用 GPT-5 作为评分器,针对安全攸关场景设计任务特异的判分准则。
核心创新是 TPAD,与传统在线评测方法本质不同。StreamingBench 等方法在 ground truth 事件区间附近逐帧反复调用模型,复杂度随序列长度线性增长,且每次查询只能看当前帧、丧失时序上下文。TPAD 的本质洞察是:Transformer 的因果注意力使每一帧的隐藏状态天然编码了「截至该帧的全部上下文」。因此只需把固定二选一提示词与整段视频所有帧 token 拼成一个序列做一次前向,再取出每一帧最后 token 的隐藏状态 $h_{idx^*_k} \in \mathbb{R}^d$,经 LM head 投影 $z^{(k)} = W_{LM} h_{idx^*_k} + b_{LM}$,对 (A)/(B) 两个 token 做 softmax 即得该帧提醒概率 $P(\text{alert}|F_k, S_{prompt}) = \text{softmax}(z^{(k)}_A, z^{(k)}_B)[0]$。一次前向既得到逐帧评分,又隐式建模了全序列上下文,这是离线评测主动任务的根本性突破。
方法步骤详情
(1) 任务定义:从视障第一视角视频与评论区归纳出三个核心任务,并为 Proactive Reminder 设计 21 个细分子任务(OA 障碍、CW 斑马线、DD 方向偏离、PTL 行人信号灯、E 扶梯等)。(2) 数据采集:从公开平台筛选真实盲人视频 530 段约 44 小时,并由受训标注员补录 231 段「知情模拟」视频以覆盖交互稀缺场景。(3) 标注:14 名学生先在 150 段视频上做 3.5K 条试点标注明确边界,再交专业团队规模化,每条含起止时间戳、任务类型与自然语言提醒,全程强调「仅基于视觉、禁偷看后续帧」;最后用 GPT-4o 翻译为英文。(4) TPAD 评测:固定提示词 + 所有视频帧 token 拼接 → 单次前向 → 取每帧末位 token 隐藏状态 $h_{idx^*_k}$ → 过 LM head 得 $z^{(k)}$ → 对 (A)/(B) softmax 得逐帧提醒概率 → 在区间 $[t_s, t_e]$ 内匹配并算 PDR、VAS。(5) VQA 仅取问题时间戳之前的视频段输入;(6) VGI 多轮对话式,每轮把历史回复与当前视觉上下文一并喂入。
技术新颖性
技术新颖性体现在三方面。第一,TPAD 是首个把离线 MLLM 改造成逐帧主动检测器的免微调方法,其利用 Transformer 因果注意力把「上下文建模」与「逐帧评分」统一在一次前向中完成,理论上优雅、工程上高效。第二,评测指标设计安全意识强:主指标 PDR = $|D_{model}|/|A|$ 衡量在有效时间窗 $t_s \le t_m \le t_e$ 内成功触发任务的比例;辅以 GPT-5 评分的描述相似度 MPS = $\frac{1}{|A|}\sum s(y_{pred}, y_{gt})$ 评估语义质量;针对扶梯状态等安全攸关事实设计任务特异判分,避免普通文本相似度过分乐观。第三,数据构造把「主动/被动/交互」三种用户行为整合进单一基准,并以 46.9 小时长视频(最长 1959s)填补了长时序上下文评测的空白。
实验结果
Table 2 显示当前 MLLM 在真实视障辅助上仍处早期:最强 GPT-5 综合仅 28.8,Gemini-2.5 Pro 27.1,GPT-4o 25.2;开源最强 InternVL3.5-8B 仅 20.1。PR 与 VGI 显著弱于 VQA:GPT-5 在 VQA 上 62.9,但 PR 综合约 28、VGI 仅 51.7;在线流式 VideoLLM-Online 1.8、LiveCC 6.7。Stage-1 召回(Table 3)LiveCC 高达 75.8%,但这是高频输出字幕的副作用,回答很少对齐任务(Figure 9 佐证);离线模型召回均 <45%,是端到端硬瓶颈。Stage-2 生成(Table 4)统一 32 帧滑窗下 InternVL3.5-8B 以 43.9 居首,DD 最弱、EER 相对最好。Table 5 显示增加帧数(8→128)几乎无收益;Figure 5 揭示 32 帧时 Qwen2.5-VL-7B 约 4.6s、InternVL3.5 约 15.5s,远不满足实时性。图 6、图 7 进一步揭示开源模型存在严重幻觉与「把盲人当健全人」两类缺陷。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| VIABench 综合得分(PR+VQA+VGI) | Overall Score(GPT-5 评分 0-100) | GPT-5 28.8 / Gemini-2.5 Pro 27.1 / InternVL3.5-8B 20.1 | VideoLLM-Online-8B 1.8 / LiveCC 6.7 | 闭源整体显著优于开源,但即便最强 GPT-5 也仅 28.8,距可用差距巨大 |
| Proactive Reminder Stage-1 召回 | Recall (%) | LiveCC 75.8 / StreamingVLM 69.2 / InternVL3.5-8B 43.0 / LLaVA-OV-1.5 44.9 | VideoLLM-Online-8B 4.6 | 在线模型召回虚高源于高频字幕输出,非真实任务理解;离线模型普遍 <45% 是端到端瓶颈 |
| Proactive Reminder Stage-2 生成(统一 32 帧滑窗) | Generation Avg. | InternVL3.5-8B 43.9 / InternVL3.5-4B 41.4 / Kimi-VL-A3B 41.3 | LLaVA-OV-1.5-8B 27.5 / InternVL3.5-1B 30.4 | 语言建模能力是 Stage-2 的决定因素;即便统一上下文,开源模型仍难产出高质量提醒 |
| VQA / Vision-Guided Interaction | VAS(GPT-5 相似度 0-100) | GPT-5 VQA 62.9 / VGI 51.7;InternVL3.5-8B VQA 39.5 / VGI 22.6 | MiniCPM-o 2.6 VQA 28.4 / VGI 23.2 | VQA 普遍强于 PR/VGI,闭源在多轮交互上优势明显 |
| TPAD 推理效率(53s 视频、6 个事件) | Runtime (s) | TPAD 76.85s | 传统逐帧 Prompting 344.64s | 约 4.5× 加速,且检测精度相同;视频越长、事件越密收益越大 |
局限与改进
作者在第 11 节承认三类局限:第一,真实视障辅助场景本质上是无界开放世界(类比自动驾驶),罕见事件、长尾边缘情况和高情境化挑战无法穷尽,VIABench 上的高分并不能保证现实部署安全,一次轻微幻觉即可能造成严重后果;第二,Vision-Guided Interaction 数据由健全人角色扮演模拟采集,尽管努力还原盲人行为与相机运动,仍存在领域差异,限制了对真实交互泛化能力的评估;第三,评测协议依赖 GPT-5 作为评分器,存在评测成本高、潜在评分偏差与不可复现的隐忧。笔者补充观察到:Proactive Reminder Stage-1 召回与 Stage-2 生成被人为解耦评测,端到端真实效果难以直接量化;TPAD 仅适用于可取出隐藏状态的开源模型,对 GPT-5/Gemini 等闭源 API 仍只能退回逐帧 prompt,导致表 2 中闭源与开源的对比并不完全公平;此外 1 FPS 采样可能漏掉亚秒级关键事件。
独立分析的弱点
第一,方向偏离(DD)任务全程最弱:离线 Stage-2 多在 5 分上下,反映模型对短时轨迹与运动方向的细粒度推理能力不足,改进方向是引入显式的运动/光流特征或 ego-motion 监督。第二,用户身份未被内化:图 7 显示开源模型把盲人当健全人,回答「屏幕可见」而无可用指令,改进方向是在指令微调阶段注入「用户无视觉」的角色设定与对应应答模板。第三,幻觉频发:图 6 中开源模型编造扶梯故障,在安全攸关场景后果严重,改进方向是引入视觉 grounding 约束、可信度自评与「拒答」机制。第四,在线流式模型把「频繁输出」误当「主动能力」:LiveCC 召回 75.8% 但内容多与任务无关,改进方向是设计任务对齐的触发奖励而非字幕连贯性奖励。第五,推理延迟过高:32 帧 InternVL3.5 需 15.5s,远超实时辅助需求,改进方向是 KV-cache 复用、稀疏注意力与端侧小模型蒸馏。
未来方向
作者明确给出三个方向:(1) 探索更有效的主动响应机制,当前模型在 anticipation 与 timing 上仍弱,需要新架构保证上下文感知的实时回答;(2) 扩充训练数据,现有流式模型多用 Ego4D-Narration、SoccerNet-Caption 等密集字幕,缺乏盲辅助所需的多样指令与复杂交互,未来应引入多指令类型、多交互模式的真实数据;(3) 专门为视障用户优化模型,使其真正内化盲人视角与意图。基于本成果还可延伸:把 TPAD 思路推广到其他需要「逐 token 决策」的在线任务(如自动驾驶预警、安防监控);与盲人社区合作收集真实交互视频以补齐 VGI 的领域差异;探索端侧可部署的轻量模型与硬件协同设计(智能眼镜 + 手机),并对安全攸关场景设计形式化的失败检测与回退机制。
复现评估
复现门槛中等偏高。有利因素:作者承诺开源代码与数据(https://github.com/MCG-NJU/VIABench),附录详尽提供了所有 21 个子任务的定义(Table 6)、可视化示例(Figure 15)、推理与评分 prompt 模板(Figure 11-14)、安全提醒距离定义(图 10,前方 1.5-2m、侧向约 50cm);TPAD 评测采用标准 1 FPS 采样、单卡 NVIDIA L20 即可跑延迟实验。不利因素:VQA/VGI 与 PR 的描述质量评分全部依赖 GPT-5 作为裁判,复现者需承担较高的 API 成本且存在评分漂移;数据虽开源但其中 231 段模拟视频与真实盲人视频混合,复用者需自行甄别;标注质量依赖专业团队与多轮 QA,独立复现同等质量的新增任务难度大;闭源模型(GPT-5、Gemini-2.5 Pro)的逐帧 prompt 评测与开源 TPAD 评测协议不同,跨模型比较不完全公平,复现者需谨慎解读排名。
论文图表
展示三个核心任务的定义图:Proactive Reminder(用户什么都不做,模型主动预警)、VQA(用户提问,模型基于当前及过往画面回答)、Vision-Guided Interaction(模型给出迭代引导直到目标完成)。红色框高亮标注中涉及的目标物体。
这是理解全文的地图——三个任务对应三种用户行为,决定了后续数据采集、TPAD 设计与评测指标的全部逻辑。
在单卡 NVIDIA L20 上测量:随输入帧数增加,延迟指数级上升。32 帧时 Qwen2.5-VL-7B 约 4.6s、InternVL3.5 约 15.5s,远超实时辅助所需。
把「实时性」量化为具体数字,是论证当前 MLLM 尚未可用的关键证据。
用户实际站在固定楼梯上,开源模型却幻觉出扶梯故障;闭源模型能正确识别场景。定性展示开源模型在用户查询与视觉冲突时的幻觉风险。
用具体案例说明安全攸关场景下幻觉的危险性,是 limitations 与改进方向的关键论据。
盲人请求「帮我看看洗衣机剩余时间」,GPT-5 与 Gemini-2.5 Pro 正确识别用户身份(读数或指导调相机),而 InternVL3.5-8B、Qwen2.5VL-7B 把用户当健全人回答「屏幕可见」。
揭示开源模型未内化「用户无视觉」身份的根本缺陷,是改进方向的核心依据。