行人原型扩展:面向自动驾驶安全测试的更多行人模型 Pedestrian Archetypes Extension -- More Pedestrian Models for Autonomous Vehicle Safety Testing
在原12种原型基础上新增7种危险行人原型,扩大AV安全测试覆盖范围。
前置知识
行人原型(Pedestrian Archetype)
行人原型是一组在现实中频繁共现、能唯一刻画某类行人'接下来很可能做什么'的行为集合,是比单条行为标签更高一层的抽象。例如'犹豫者'不是某一次后退动作,而是反复改变横穿意图的行为模式。每个原型由若干核心行为(essential)与可选行为(optional)共同定义,核心行为出现频率 $\geq 40\%$。
整篇论文的核心概念就是'原型',理解原型与低层行为标签的区别,才能理解为什么要从 12 种扩展到 19 种,以及新增 7 种原型解决了哪些旧分类无法覆盖的盲区。
PedAnalyze 行为本体(Behavior Ontology)
PedAnalyze 是作者团队此前提出的行人行为标注工具与本体,定义了一套标准化的行为标签词汇(如横穿、后退、奔跑、停顿、忽视交通、变向、犹豫等),并为每个标签给出统一定义,公开于 readthedocs。它使不同标注者能用一致口径描述行人动作。
本文所有 7 个新原型的'核心/可选行为'都是从 PedAnalyze 本体的标签词汇中导出的,本体既是标注工具也是原型坐标空间。不熟悉本体会无法理解 Table I–VII 中那些行为标签的含义。
行为标签(Behavior Tag)与原型的层次差异
行为标签描述'行人正在做什么'这类低层、可观察、孤立的动作(如'后退');而原型描述'为什么、接下来会怎样'这类高层、连贯的行为模式。同一次后退可能源于犹豫、分心,也可能是对突发事件的应激反应——标签相同但原型不同。
论文的立论基础正是'标签不足以刻画危险行人',因此必须引入原型层。把握这一层次差异是理解全文 motivation 与 method 的前提。
研究动机
自动驾驶车辆(AV)的行人安全研究长期聚焦于'行人是否过街、在哪里过街、轨迹是什么'这三个可被运动学模型外推的预测子问题,把行人当作一个点。但在真实道路中,真正危险的行人行为往往不是单次动作,而是一连串相互关联、让意图难以预测的行为组合——例如同一次'后退'可能源于犹豫、分心,也可能是对突发事件的应激反应;'不走斑马线横穿'也可能伴随多种截然不同的行人类型。作者团队此前构建的 PedAnalyze 行为本体只能给出'后退、横穿、忽视交通'这类低层、互不关联的行为标签,它回答'行人在做什么',却无法刻画'为什么、接下来会怎样'这种更高层的行为模式。团队此前提出的 12 种行人原型(Wanderer、Drunk、Distracted、Flash、Indecisive、Blind、Flock、Jaywalker、Elderly、Kid、Eventful、Parked Pedestrian)部分缓解了该问题,但对 YouTube 行车记录仪视频的持续标注表明,仍有大量可观察、且与原有原型显著不同的危险行为模式被遗漏。
本文的目标是本文的目标是把行人原型分类体系(taxonomy)从原先的 12 种扩展到 19 种,新增 7 种此前未被建模的危险行人原型:Con Artist(碰瓷者)、Foreigner(异乡者)、Influencer(网红)、Protester(抗议者)、Confronted(挑衅对峙者)、Pseudo Pedestrian(轮式伪行人)和 Street Vendor(街头商贩)。对每一种新原型,作者都给出形式化定义、与相关原型的对比说明、来自真实行车记录仪的视频帧证据,以及从当前标注数据集中导出的'核心行为(essential)'与'可选行为(optional)'标签集。最终目的是让 AV 安全测试不再只针对守法行人,而是覆盖那些'罕见、危险且最需要被预判'的行人模型,为仿真、标注与评估提供一套可沟通、可复用的行为测试空间。
与已有工作不同的是,本文的独特切入角度有两点。其一,它不是凭直觉拍脑袋定义原型,而是采用数据驱动的标注—归纳流程:基于公开的 PedAnalyze 行为本体持续标注 YouTube 行车记录仪中的险情、近碰撞与碰撞片段,通过逐一对比已有 12 种原型来筛出'此前未被建模'的新模式。其二,它给每个原型引入了量化的行为标签判定规则:若某行为在该原型样本中出现频率 $\geq 40\%$ 则判为核心(essential),落在 $[10\%, 39\%]$ 区间则判为可选(optional),出现频率 $< 10\%$ 除非有质性意义否则剔除。这套阈值化方法把'核心行为'与'常伴随但非必需的行为'区分开,使每种原型都附带一张可追溯、可复现的行为画像,填补了'低层行为标签'与'高层行人模型'之间的语义鸿沟。
核心方法
整体思路是'人工标注—归纳模式—量化刻画'三段式,直觉上接近人类专家反复观看事故视频后总结出典型角色。技术路线分四步:首先用 PedAnalyze 行为本体对行车记录仪视频中的行人行为做细粒度标注,本体涵盖横穿、后退、奔跑、停顿、忽视交通、变向、犹豫等可观察动作;其次人工审阅所有标注场景,找出反复出现的行为组合,并与已有 12 种原型逐一比对,判断它们是否代表新模式;接着为每个新模式挑选代表性视频证据并抽取关键帧,用以图解行为序列、支撑原型定义;最后从标注数据集中统计每个原型的行为出现频率,按 $\geq 40\%$(核心)、$10\text{–}39\%$(可选)、$< 10\%$(一般剔除)三档阈值导出每个原型的行为画像。整套方法不依赖任何机器学习模型,全部基于人工标注与统计阈值,因此可解释性强,但规模受限于标注人力。
核心创新在于把'原型(archetype)'明确提升为比'行为标签(tag)'更高一层的抽象:行为标签只描述孤立的可观察动作,而原型是一组在现实中频繁共现、构成连贯行为模型的动作集合,每个原型由若干'核心行为'和'可选行为'定义。这与此前的 AV 行人研究有本质区别——后者要么预测轨迹、要么给单帧贴单一标签,无法表达'这个行人接下来很可能继续做什么'的连续行为模式。第二个关键点是引入 $\geq 40\%$ 与 $10\text{–}39\%$ 两道频率阈值,把'哪些动作是定义该原型所必需的'这一原本主观的问题转化为数据驱动的判定,使每种原型都附带一张可量化、可复现的行为标签表(如论文 Table I–VII)。第三个关键点是用同一套 PedAnalyze 本体贯穿标注与刻画全过程,保证 7 种新原型与原 12 种原型之间的行为标签是可对齐、可比较的。
方法步骤详情
方法分四步,每步输入输出明确。第 1 步(标注):输入是 YouTube 上的险情/近碰撞/碰撞行车记录仪视频,标注员用 PedAnalyze 本体给行人打上横穿、后退、奔跑、停顿、忽视交通、变向、犹豫等行为标签,输出是带时间戳的结构化行为序列。第 2 步(模式归纳):输入是第 1 步的全部标注场景,审阅后找出反复出现的行为组合,并与原 12 种原型逐一比对,输出是'疑似新原型'的候选集合。第 3 步(证据选取):输入是候选新原型,为其挑选代表性视频并抽取关键帧(如 Con Artist 的'站车道—跳向车—倒地—同伙搀扶'四帧序列,见 Fig. 1),输出是图解化的行为证据。第 4 步(标签导出):输入是该原型全部样本的行为标签统计,按核心 $\geq 40\%$、可选 $10\text{–}39\%$、$< 10\%$ 剔除(除非质性显著)三档归类,输出是每原型的 essential/optional 行为表(Table I–VII)。最终得到 7 个新原型及其行为画像。
技术新颖性
技术新颖性体现在三个层面。第一,新原型本身:7 种新原型中多种是文献中几乎未被形式化的——例如 Con Artist(蓄意制造碰撞骗保/讹钱)、Influencer(为拍视频占用机动车道,摄影师躺在路上)、Protester(阻塞道路甚至被车撞仍留在车道内导致二次碰撞,见 Fig. 4)、Street Vendor(在缓行/停车车流中贴近车窗推销)。这些行为在传统 AV 研究里通常被当作'噪声'或'越界',本文首次把它们升格为一等公民的研究对象。第二,量化刻画:用 $\geq 40\%$/$10\text{–}39\%$/$< 10\%$ 三档阈值把行为划分为 essential/optional,使原型从'定性描述'变为'带频率统计的行为表',提升可复现性。第三,本体对齐:所有 7 种新原型复用 PedAnalyze 本体的标签词汇,从而与原 12 种原型处于同一坐标空间,便于后续在仿真、评估中横向比较。相对而言,局限是未给出任何自动识别算法或仿真集成结果。
实验结果
本文结果为 7 个新原型及其行为画像,而非数值指标。每个原型带 essential(频率 $\geq 40\%$)/optional 行为表:Con Artist(Table I)含 Collision/Fall/Not-Cross;Foreigner(Table II)含 Ignore traffic/Near-miss;Influencer(Table III)仅 3 项核心、无可选、样本疑偏少;Protester(Table IV)含 Frozen/Not-cross/Agitated;Confronted(Table V)含 Agitated/Aggression;Pseudo Pedestrian(Table VI)含 Run into traffic/Collision;Street Vendor(Table VII)含 Pause-start/Cross-on-red。Fig. 1–7 为各原型提供关键帧证据(如碰瓷四帧、抗议者二次碰撞、滑板者追板)。原型总数由 12 扩展到 19。需强调:论文未报告任何定量基准、模型准确率或统计显著性,结论均基于人工标注与定性证据。
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 危险行人原型分类体系覆盖范围(taxonomic coverage) | 原型种类数 | 19 种原型(原 12 + 新增 7:Con Artist/Foreigner/Influencer/Protester/Confronted/Pseudo Pedestrian/Street Vendor) | 原论文 Pedestrian Archetypes [1]:12 种原型 | 新增 7 种,覆盖数 +58.3%(12→19) |
| 原型行为标签的量化刻画规则(定性描述的工程化) | essential/optional 判定阈值 | essential 频率 $\geq 40\%$,optional $\in[10\%,39\%]$,$< 10\%$ 一般剔除(除非质性显著) | 原论文:仅定性文字描述,无频率阈值与 essential/optional 划分 | 首次给出数据驱动的核心/可选行为划分,可复现性显著提升 |
局限与改进
作者将本文定位为 pre-print,承认这是'继续标注'的阶段性发现,但未讨论几个关键局限。其一,样本规模不透明:论文未报告每个原型基于多少段视频与标注样本,而 essential $\geq 40\%$ 阈值在小样本上方差极大——Influencer 在 Table III 仅 3 项核心行为、无可选行为,暗示其样本可能很少。其二,证据单薄:多数原型只给 1 段代表性视频(如 Con Artist 仅引 [3]、Foreigner 仅引 [4]、Influencer 仅引 [5]),难稳健支撑'频率 $\geq 40\%$'这类统计结论。其三,阈值 40%/10% 选取缺乏依据与敏感性分析。其四,无量化验证:缺标注者间一致性(如 Cohen's $\kappa$)、无自动分类器、无仿真碰撞率对比。其五,地域/文化偏差:素材几乎全来自美国/墨西哥 YouTube(Venice CA、New York、Tijuana 边境),Street Vendor、Protester 等原型可能高度依赖特定社会文化语境。
独立分析的弱点
弱点 1:缺少标注者间一致性验证。原型识别完全靠人工,没有报告多人独立标注的一致性指标 $\kappa$,新原型的边界(如 Confronted 与 Protester 都含 Agitated/Ignore traffic)可能因人而异。改进:招募多名标注者独立标注并计算 $\kappa$,对边界模糊的原型合并或细化。弱点 2:样本量过小且统计不透明。essential 判定依赖 $\geq 40\%$ 频率,但每个原型的样本数 $N$ 未披露,$N$ 很小时 40% 的置信区间极宽。改进:公布每个原型的 $N$ 与行为频率原始计数,必要时用 bootstrap 给出区间。弱点 3:阈值 40%/10% 未经敏感性分析。改进:扫描阈值网格观察原型定义稳定性,或改用层次聚类自动确定'核心/伴随'分界。弱点 4:无下游落地。原型停留在分类学,未接入 CARLA/SUMO 等仿真器生成对抗场景,也未训练检测模型。改进:把每个原型参数化为仿真 agent 的行为脚本,测量 AV 规划器碰撞率下降。弱点 5:素材地域偏差大。改进:补充亚洲、欧洲等多地行车记录仪,验证原型跨文化可迁移性。
未来方向
作者提出的方向:把扩展后的 19 种原型用于 AV 仿真、标注与评估,让系统既准备守法行人,也准备'罕见、危险、不可预测'的行人,并以 PedAnalyze 本体(公开于 readthedocs)作为持续扩展的基础。基于成果可延伸的方向:(1) 自动原型识别——用 Fig. 1–7 的关键帧训练视频行为识别模型,在线把行人归类到 19 种原型之一并输出意图概率;(2) 仿真器对抗测试——将每种原型编码为 CARLA/SMARTS 的 agent 行为脚本,对 AV 规划器做压力测试,统计每种原型下的碰撞率与近碰撞率;(3) 原型共现与转移建模——用序列模型刻画行人在原型间的转移(如 Jaywalker→Confronted),预测下一步危险模式;(4) 跨文化/跨地域扩展——在不同国家数据上验证并补充原型;(5) 与轨迹预测融合——把原型标签作为条件输入轨迹预测网络,验证能否降低对危险行人的预测误差;(6) 标注规模与一致性——扩大标注队伍并报告 $\kappa$,使原型从定性资产走向可复现的工程资产。
复现评估
开源与数据:PedAnalyze 行为本体与行为标签定义已公开(Appendix 链接 pedanalyze.readthedocs.io),论文引用的 9 段视频证据 [3]–[9] 均为 YouTube/Newsflare 公开链接并附访问日期(2024-07),原则上可重新获取。算力:本文不涉及任何模型训练或大规模计算,纯人工标注加文字/图表撰写,零算力门槛。复现难度:偏低到中等。主要障碍:(1) 原始标注数据未公开——每个新原型的样本数 $N$、行为频率原始计数、完整标注时间线都没有提供,因此 essential $\geq 40\%$ 这类结论无法独立核验,是最大短板;(2) 视频可能下架——YouTube 视频链接会随时间失效,长期复现性脆弱;(3) 标注主观性——方法依赖人工判断'是否为新原型'与行为标签归属,不同团队可能得到不同结论,缺一致性度量;(4) 阈值复现——40%/10% 阈值可照搬,但若无原始计数,无法验证每张表中的 essential/optional 划分。综合看,方法学可复现,但具体统计结论难以严格核验。
论文图表
四帧:(a) 抗议人群阻塞道路;(b) 一人原地不动被车撞;(c) 被撞后仍留在车道内;(d) 车辆继续行驶造成二次碰撞。展示 Protester(抗议者)的群体性以及'被撞后仍不撤离导致二次碰撞'的高危特征。
强调 Protester 区别于普通 Jaywalker/Flock 的关键——主动占据车道且被撞后不撤离,引发连续碰撞,对 AV 规划器的'停止—绕行'策略构成极端测试。
两帧:(a) 一位母亲带两个孩子过马路时开始做出攻击性手势;(b) 对车辆竖中指。展示 Confronted(挑衅对峙者)由敌意情绪驱动、即便带娃同行仍持续对抗的行为模式。
说明 Confronted 的危险源于情绪化对抗而非理性判断,且即便有儿童同行仍会升级冲突,是 AV 难以用常规意图模型预测的行人类型。
列出 Con Artist 的核心行为(Collision、Looking、Fall、Not-Cross、Run into traffic、Cross without crosswalk)与可选行为(Climbing onto carhood、Thrown-back、Ignore traffic)。核心行为出现频率 $\geq 40\%$,可选行为 $\in[10\%,39\%]$。
是数据驱动原型定义的模板,展示 essential/optional 划分如何把模糊的'碰瓷者'具象为一组可量化的行为标签,是理解其余 6 张同类表格的范本。
Foreigner 核心行为含 Ignore traffic、Near-miss、Cross without crosswalk、Run into traffic、Not looking/glancing;可选行为含 Retreat、Back-turned、Collision。显示异乡者既会忽视交通、又会因后退而避免碰撞。
用具体标签证明 Foreigner 与 Jaywalker、Blind 的区别:它带有 Retreat/Back-turned 这类'不确定'信号,是 AV 可以利用的预判线索。
Influencer 仅列出 3 项核心行为 Ignore traffic、Gesturing、Glancing,未给出可选行为。这暗示其标注样本可能较少,行为画像相对单薄。
这张表暴露了论文的一个潜在弱点——部分新原型(如 Influencer)样本量偏小,essential 行为数量少且无 optional,提示读者对其统计稳健性保持谨慎。
Protester 核心行为含 Frozen、Not-cross、Looking、Ignore-traffic、Agitated;可选行为含 Group-walk、Along-lane、Back-turned。Frozen 与 Not-cross 共同体现'原地固守'的对抗性。
Frozen/Not-cross 这两项核心行为是 Protester 区别于普通 Jaywalker 的关键,直接对应 Fig. 4 中被撞后仍留在车道的二次碰撞风险。
Confronted 核心行为含 Agitated、Aggression、Cross、Ignore traffic;可选行为含 Assault、Gesturing、Near-miss。Agitated/Aggression 同时出现在核心中,凸显其情绪驱动本质。
Agitated 与 Aggression 同时被列为核心,定量地区分了 Confronted(敌意对抗)与 Protester(政治/群体性占道),帮助厘清两者在行为标签上的重叠与差异。
Pseudo Pedestrian 核心行为含 Ignore traffic、Run into traffic、Cross、Collision、Not looking/glancing;可选行为含 Along-lane、Swerve、Pop-out-occlusion。Swerve/Pop-out-occlusion 体现轮式运动的突发性。
Swerve 与 Pop-out-occlusion 这两项可选行为刻画了轮式行人'突然窜出'的几何特征,是 AV 感知—规划系统需要专门处理的遮挡场景信号。
Street Vendor 核心行为含 Pause-start、Pickup-object、Cross-on-red,未列出可选行为。Pause-start 刻画其'随车流走走停停'的接近方式,Cross-on-red 显示其在红灯时仍横穿靠近车窗。
这张表把街头商贩的'经济动机靠近'转化为 Pause-start/Pickup-object 这类可标注动作,说明即便动机非交通性的行人也能被纳入统一的行为标签坐标空间。