← 返回 2026-07-31

行人原型扩展:面向自动驾驶安全测试的更多行人模型 Pedestrian Archetypes Extension -- More Pedestrian Models for Autonomous Vehicle Safety Testing

Taorui Huang, Namita Gaidhani, Ritvik Bansal, S M Jubaer, Regina Lim, Rhett Zhao, Gavin Rafael Selin, Sunnie Deng Gao, Hasnain N Syed 📅 2026-07-18 👍 1 2026-08-05 19:06
仿真测试 安全测试 自动驾驶 行为本体 行人原型分类 行人行为建模

在原12种原型基础上新增7种危险行人原型,扩大AV安全测试覆盖范围。

前置知识

行人原型(Pedestrian Archetype)

行人原型是一组在现实中频繁共现、能唯一刻画某类行人'接下来很可能做什么'的行为集合,是比单条行为标签更高一层的抽象。例如'犹豫者'不是某一次后退动作,而是反复改变横穿意图的行为模式。每个原型由若干核心行为(essential)与可选行为(optional)共同定义,核心行为出现频率 $\geq 40\%$。

整篇论文的核心概念就是'原型',理解原型与低层行为标签的区别,才能理解为什么要从 12 种扩展到 19 种,以及新增 7 种原型解决了哪些旧分类无法覆盖的盲区。

PedAnalyze 行为本体(Behavior Ontology)

PedAnalyze 是作者团队此前提出的行人行为标注工具与本体,定义了一套标准化的行为标签词汇(如横穿、后退、奔跑、停顿、忽视交通、变向、犹豫等),并为每个标签给出统一定义,公开于 readthedocs。它使不同标注者能用一致口径描述行人动作。

本文所有 7 个新原型的'核心/可选行为'都是从 PedAnalyze 本体的标签词汇中导出的,本体既是标注工具也是原型坐标空间。不熟悉本体会无法理解 Table I–VII 中那些行为标签的含义。

行为标签(Behavior Tag)与原型的层次差异

行为标签描述'行人正在做什么'这类低层、可观察、孤立的动作(如'后退');而原型描述'为什么、接下来会怎样'这类高层、连贯的行为模式。同一次后退可能源于犹豫、分心,也可能是对突发事件的应激反应——标签相同但原型不同。

论文的立论基础正是'标签不足以刻画危险行人',因此必须引入原型层。把握这一层次差异是理解全文 motivation 与 method 的前提。

研究动机

自动驾驶车辆(AV)的行人安全研究长期聚焦于'行人是否过街、在哪里过街、轨迹是什么'这三个可被运动学模型外推的预测子问题,把行人当作一个点。但在真实道路中,真正危险的行人行为往往不是单次动作,而是一连串相互关联、让意图难以预测的行为组合——例如同一次'后退'可能源于犹豫、分心,也可能是对突发事件的应激反应;'不走斑马线横穿'也可能伴随多种截然不同的行人类型。作者团队此前构建的 PedAnalyze 行为本体只能给出'后退、横穿、忽视交通'这类低层、互不关联的行为标签,它回答'行人在做什么',却无法刻画'为什么、接下来会怎样'这种更高层的行为模式。团队此前提出的 12 种行人原型(Wanderer、Drunk、Distracted、Flash、Indecisive、Blind、Flock、Jaywalker、Elderly、Kid、Eventful、Parked Pedestrian)部分缓解了该问题,但对 YouTube 行车记录仪视频的持续标注表明,仍有大量可观察、且与原有原型显著不同的危险行为模式被遗漏。

本文的目标是本文的目标是把行人原型分类体系(taxonomy)从原先的 12 种扩展到 19 种,新增 7 种此前未被建模的危险行人原型:Con Artist(碰瓷者)、Foreigner(异乡者)、Influencer(网红)、Protester(抗议者)、Confronted(挑衅对峙者)、Pseudo Pedestrian(轮式伪行人)和 Street Vendor(街头商贩)。对每一种新原型,作者都给出形式化定义、与相关原型的对比说明、来自真实行车记录仪的视频帧证据,以及从当前标注数据集中导出的'核心行为(essential)'与'可选行为(optional)'标签集。最终目的是让 AV 安全测试不再只针对守法行人,而是覆盖那些'罕见、危险且最需要被预判'的行人模型,为仿真、标注与评估提供一套可沟通、可复用的行为测试空间。

与已有工作不同的是,本文的独特切入角度有两点。其一,它不是凭直觉拍脑袋定义原型,而是采用数据驱动的标注—归纳流程:基于公开的 PedAnalyze 行为本体持续标注 YouTube 行车记录仪中的险情、近碰撞与碰撞片段,通过逐一对比已有 12 种原型来筛出'此前未被建模'的新模式。其二,它给每个原型引入了量化的行为标签判定规则:若某行为在该原型样本中出现频率 $\geq 40\%$ 则判为核心(essential),落在 $[10\%, 39\%]$ 区间则判为可选(optional),出现频率 $< 10\%$ 除非有质性意义否则剔除。这套阈值化方法把'核心行为'与'常伴随但非必需的行为'区分开,使每种原型都附带一张可追溯、可复现的行为画像,填补了'低层行为标签'与'高层行人模型'之间的语义鸿沟。

核心方法

整体思路是'人工标注—归纳模式—量化刻画'三段式,直觉上接近人类专家反复观看事故视频后总结出典型角色。技术路线分四步:首先用 PedAnalyze 行为本体对行车记录仪视频中的行人行为做细粒度标注,本体涵盖横穿、后退、奔跑、停顿、忽视交通、变向、犹豫等可观察动作;其次人工审阅所有标注场景,找出反复出现的行为组合,并与已有 12 种原型逐一比对,判断它们是否代表新模式;接着为每个新模式挑选代表性视频证据并抽取关键帧,用以图解行为序列、支撑原型定义;最后从标注数据集中统计每个原型的行为出现频率,按 $\geq 40\%$(核心)、$10\text{–}39\%$(可选)、$< 10\%$(一般剔除)三档阈值导出每个原型的行为画像。整套方法不依赖任何机器学习模型,全部基于人工标注与统计阈值,因此可解释性强,但规模受限于标注人力。

核心创新在于把'原型(archetype)'明确提升为比'行为标签(tag)'更高一层的抽象:行为标签只描述孤立的可观察动作,而原型是一组在现实中频繁共现、构成连贯行为模型的动作集合,每个原型由若干'核心行为'和'可选行为'定义。这与此前的 AV 行人研究有本质区别——后者要么预测轨迹、要么给单帧贴单一标签,无法表达'这个行人接下来很可能继续做什么'的连续行为模式。第二个关键点是引入 $\geq 40\%$ 与 $10\text{–}39\%$ 两道频率阈值,把'哪些动作是定义该原型所必需的'这一原本主观的问题转化为数据驱动的判定,使每种原型都附带一张可量化、可复现的行为标签表(如论文 Table I–VII)。第三个关键点是用同一套 PedAnalyze 本体贯穿标注与刻画全过程,保证 7 种新原型与原 12 种原型之间的行为标签是可对齐、可比较的。

方法步骤详情

方法分四步,每步输入输出明确。第 1 步(标注):输入是 YouTube 上的险情/近碰撞/碰撞行车记录仪视频,标注员用 PedAnalyze 本体给行人打上横穿、后退、奔跑、停顿、忽视交通、变向、犹豫等行为标签,输出是带时间戳的结构化行为序列。第 2 步(模式归纳):输入是第 1 步的全部标注场景,审阅后找出反复出现的行为组合,并与原 12 种原型逐一比对,输出是'疑似新原型'的候选集合。第 3 步(证据选取):输入是候选新原型,为其挑选代表性视频并抽取关键帧(如 Con Artist 的'站车道—跳向车—倒地—同伙搀扶'四帧序列,见 Fig. 1),输出是图解化的行为证据。第 4 步(标签导出):输入是该原型全部样本的行为标签统计,按核心 $\geq 40\%$、可选 $10\text{–}39\%$、$< 10\%$ 剔除(除非质性显著)三档归类,输出是每原型的 essential/optional 行为表(Table I–VII)。最终得到 7 个新原型及其行为画像。

技术新颖性

技术新颖性体现在三个层面。第一,新原型本身:7 种新原型中多种是文献中几乎未被形式化的——例如 Con Artist(蓄意制造碰撞骗保/讹钱)、Influencer(为拍视频占用机动车道,摄影师躺在路上)、Protester(阻塞道路甚至被车撞仍留在车道内导致二次碰撞,见 Fig. 4)、Street Vendor(在缓行/停车车流中贴近车窗推销)。这些行为在传统 AV 研究里通常被当作'噪声'或'越界',本文首次把它们升格为一等公民的研究对象。第二,量化刻画:用 $\geq 40\%$/$10\text{–}39\%$/$< 10\%$ 三档阈值把行为划分为 essential/optional,使原型从'定性描述'变为'带频率统计的行为表',提升可复现性。第三,本体对齐:所有 7 种新原型复用 PedAnalyze 本体的标签词汇,从而与原 12 种原型处于同一坐标空间,便于后续在仿真、评估中横向比较。相对而言,局限是未给出任何自动识别算法或仿真集成结果。

Pedestrian from [3] stages an accident with friend.
Fig. 1: Pedestrian from [3] stages an accident with friend.
Confused Venice tourist unsure what to do. [4]
Fig. 2: Confused Venice tourist unsure what to do. [4]
Influencer with dog as photographer lies down [5].
Fig. 3: Influencer with dog as photographer lies down [5].
Skateboarder from [8] loses control and falls off, pushing skateboard into traffic and running after it.
Fig. 6: Skateboarder from [8] loses control and falls off, pushing skateboard into traffic and running after it.
Street vendors [9] walk along slow-moving traffic.
Fig. 7: Street vendors [9] walk along slow-moving traffic.

实验结果

本文结果为 7 个新原型及其行为画像,而非数值指标。每个原型带 essential(频率 $\geq 40\%$)/optional 行为表:Con Artist(Table I)含 Collision/Fall/Not-Cross;Foreigner(Table II)含 Ignore traffic/Near-miss;Influencer(Table III)仅 3 项核心、无可选、样本疑偏少;Protester(Table IV)含 Frozen/Not-cross/Agitated;Confronted(Table V)含 Agitated/Aggression;Pseudo Pedestrian(Table VI)含 Run into traffic/Collision;Street Vendor(Table VII)含 Pause-start/Cross-on-red。Fig. 1–7 为各原型提供关键帧证据(如碰瓷四帧、抗议者二次碰撞、滑板者追板)。原型总数由 12 扩展到 19。需强调:论文未报告任何定量基准、模型准确率或统计显著性,结论均基于人工标注与定性证据。

任务指标本文基线提升
危险行人原型分类体系覆盖范围(taxonomic coverage) 原型种类数 19 种原型(原 12 + 新增 7:Con Artist/Foreigner/Influencer/Protester/Confronted/Pseudo Pedestrian/Street Vendor) 原论文 Pedestrian Archetypes [1]:12 种原型 新增 7 种,覆盖数 +58.3%(12→19)
原型行为标签的量化刻画规则(定性描述的工程化) essential/optional 判定阈值 essential 频率 $\geq 40\%$,optional $\in[10\%,39\%]$,$< 10\%$ 一般剔除(除非质性显著) 原论文:仅定性文字描述,无频率阈值与 essential/optional 划分 首次给出数据驱动的核心/可选行为划分,可复现性显著提升

局限与改进

作者将本文定位为 pre-print,承认这是'继续标注'的阶段性发现,但未讨论几个关键局限。其一,样本规模不透明:论文未报告每个原型基于多少段视频与标注样本,而 essential $\geq 40\%$ 阈值在小样本上方差极大——Influencer 在 Table III 仅 3 项核心行为、无可选行为,暗示其样本可能很少。其二,证据单薄:多数原型只给 1 段代表性视频(如 Con Artist 仅引 [3]、Foreigner 仅引 [4]、Influencer 仅引 [5]),难稳健支撑'频率 $\geq 40\%$'这类统计结论。其三,阈值 40%/10% 选取缺乏依据与敏感性分析。其四,无量化验证:缺标注者间一致性(如 Cohen's $\kappa$)、无自动分类器、无仿真碰撞率对比。其五,地域/文化偏差:素材几乎全来自美国/墨西哥 YouTube(Venice CA、New York、Tijuana 边境),Street Vendor、Protester 等原型可能高度依赖特定社会文化语境。

独立分析的弱点

弱点 1:缺少标注者间一致性验证。原型识别完全靠人工,没有报告多人独立标注的一致性指标 $\kappa$,新原型的边界(如 Confronted 与 Protester 都含 Agitated/Ignore traffic)可能因人而异。改进:招募多名标注者独立标注并计算 $\kappa$,对边界模糊的原型合并或细化。弱点 2:样本量过小且统计不透明。essential 判定依赖 $\geq 40\%$ 频率,但每个原型的样本数 $N$ 未披露,$N$ 很小时 40% 的置信区间极宽。改进:公布每个原型的 $N$ 与行为频率原始计数,必要时用 bootstrap 给出区间。弱点 3:阈值 40%/10% 未经敏感性分析。改进:扫描阈值网格观察原型定义稳定性,或改用层次聚类自动确定'核心/伴随'分界。弱点 4:无下游落地。原型停留在分类学,未接入 CARLA/SUMO 等仿真器生成对抗场景,也未训练检测模型。改进:把每个原型参数化为仿真 agent 的行为脚本,测量 AV 规划器碰撞率下降。弱点 5:素材地域偏差大。改进:补充亚洲、欧洲等多地行车记录仪,验证原型跨文化可迁移性。

未来方向

作者提出的方向:把扩展后的 19 种原型用于 AV 仿真、标注与评估,让系统既准备守法行人,也准备'罕见、危险、不可预测'的行人,并以 PedAnalyze 本体(公开于 readthedocs)作为持续扩展的基础。基于成果可延伸的方向:(1) 自动原型识别——用 Fig. 1–7 的关键帧训练视频行为识别模型,在线把行人归类到 19 种原型之一并输出意图概率;(2) 仿真器对抗测试——将每种原型编码为 CARLA/SMARTS 的 agent 行为脚本,对 AV 规划器做压力测试,统计每种原型下的碰撞率与近碰撞率;(3) 原型共现与转移建模——用序列模型刻画行人在原型间的转移(如 Jaywalker→Confronted),预测下一步危险模式;(4) 跨文化/跨地域扩展——在不同国家数据上验证并补充原型;(5) 与轨迹预测融合——把原型标签作为条件输入轨迹预测网络,验证能否降低对危险行人的预测误差;(6) 标注规模与一致性——扩大标注队伍并报告 $\kappa$,使原型从定性资产走向可复现的工程资产。

复现评估

开源与数据:PedAnalyze 行为本体与行为标签定义已公开(Appendix 链接 pedanalyze.readthedocs.io),论文引用的 9 段视频证据 [3]–[9] 均为 YouTube/Newsflare 公开链接并附访问日期(2024-07),原则上可重新获取。算力:本文不涉及任何模型训练或大规模计算,纯人工标注加文字/图表撰写,零算力门槛。复现难度:偏低到中等。主要障碍:(1) 原始标注数据未公开——每个新原型的样本数 $N$、行为频率原始计数、完整标注时间线都没有提供,因此 essential $\geq 40\%$ 这类结论无法独立核验,是最大短板;(2) 视频可能下架——YouTube 视频链接会随时间失效,长期复现性脆弱;(3) 标注主观性——方法依赖人工判断'是否为新原型'与行为标签归属,不同团队可能得到不同结论,缺一致性度量;(4) 阈值复现——40%/10% 阈值可照搬,但若无原始计数,无法验证每张表中的 essential/optional 划分。综合看,方法学可复现,但具体统计结论难以严格核验。