← 返回 2026-08-03

坐进驾驶位:自动驾驶系统测试现状的多公司实证研究 In the Driver's Seat: A Multi-Company Study on the Reality of Autonomous Driving System Testing

Qunying Song, Yuan Gao, Johannes Betz, Dietmar Pfahl, Mohammad Reza Mousavi, Federica Sarro 📅 2026-07-17 👍 7 2026-08-08 18:30
场景化测试 工业实证研究 测试框架 自动驾驶测试 访谈研究 软件工程

9家公司访谈揭示自动驾驶测试现状并提出证据闭环测试框架

前置知识

X-in-the-loop 测试(MiL/SiL/HiL/ViL)

这是自动驾驶系统(ADS)分阶段验证的渐进式测试体系。Model-in-the-Loop(MiL)在算法建模阶段验证高层模型,可大规模并行评估场景变体;Software-in-the-Loop(SiL)在功能模块实现后于仿真环境中调试代码与模块集成,重点关注系统稳定性;Hardware-in-the-Loop(HiL)把传感器、转向、制动、底盘等真实硬件通过 CAN 总线接到测试台架上,软件加载到目标平台,验证硬件集成、控制信号响应、通信延迟与组件交互;Vehicle-in-the-Loop(ViL)则将完整整车投入测试场或公共道路,评估真实运行条件下的集成系统表现。

本文的访谈结论几乎全部围绕这条 MiL→SiL→HiL→ViL 流水线展开,不理解这套 in-the-loop 抽象,就无法理解作者归纳的「测试活动」「活动间过渡」「满意准则」等核心主题。

场景化测试与场景覆盖(Scenario-based Testing & Coverage)

场景化测试不按功能点逐项验证,而是把「环境条件 + 道路 + 交通参与者 + 驾驶事件」组合成具体驾驶场景作为测试单元(例如不同泊车位的泊车、夜间施工路段的限速辅助)。场景覆盖度衡量系统在多少类驾驶情境下被充分检验,参与者普遍认为它比「累计行驶里程」更能反映真实测试充分性——P8 直接指出 Waymo 报告的几十亿英里意义有限,因为反复跑同一闭环路线与遭遇多样化真实情况完全不同。

场景覆盖被几乎所有参与者列为最重要指标,也是「不完整场景覆盖」这一头号挑战的根源。读通本文必须理解场景既是测试输入(要够真实够全),也是衡量测试充分性的核心度量。

SAE 自动驾驶等级与 ODD(运行设计域)

SAE J3016 把自动化程度从 L2(辅助驾驶,人类负法律责任)到 L5(全场景完全自动驾驶)分级。ODD(Operational Design Domain)刻画系统被设计运行的环境范围,例如「仅高速公路」「仅城市泊车」。论文披露一个有趣的灰色地带:供应商明明提供接近 L3/L4 的能力,却出于责任与监管压力对外宣称 L2/L2+/L2++,导致「官方等级」与「实际能力」不一致。

测试目标、责任划分、监管要求都随等级与 ODD 而变;论文的「证据闭环框架」第一阶段就要求先确定功能、ODD、自动化等级与架构,因此这是理解所有实践与挑战分类的基础坐标。

模块化架构 vs 端到端架构 vs 世界模型

模块化架构把系统拆成感知、规划、控制等明确接口的模块,确定性强、易开发、易测试,但接口处易丢失信息(如交通锥这类罕见小目标若感知没识别,规划层就完全「看不到」)。端到端架构用神经网络直接从传感输入映射到驾驶轨迹,去掉显式接口,对 L5 那种场景爆炸的情形更有潜力,但可解释性差、错误传播难以隔离。世界模型(如 Waymo、Wayve、Nvidia 投资方向)则直接从数据学习并生成逼真的传感器级环境,可同时支撑测试与感知训练。

架构选择直接决定测试复杂度与 sim-to-real gap 的形态,也决定哪些挑战与解决方案(3D Gaussian Splatting、世界模型)适用。本文对架构演进方向的判断全部建立在这一对比之上。

Sim-to-real gap(仿真到现实的鸿沟)

指仿真环境在保真度、表征能力、质量评估三方面与现实世界的差距。道路、建筑、玻璃、树木会产生不同物理属性与反射,影响点云与相机数据;雷达、激光雷达尤其是相机仿真仍极具挑战。论文提到神经模型在仿真中表现常与真实世界不同,传统汽车仿真擅长轮胎力、车辆动力学等物理量,却无法为 ADS/ADAS 有效扩展,逼得业界转向照片级仿真、神经仿真与生成式世界模型。

这是被 P2/P4/P7/P9 多人点名的头号挑战之一,也是「shift-left / 仿真优先」策略能否成立的根本前提。理解它才能读懂为什么参与者把 3D Gaussian Splatting、端到端、世界模型当作关键解法。

主题分析(Thematic Analysis)与证据闭环测试框架、GSN/SOTIF

主题分析是定性研究的编码方法(论文采用 Cruzes 等的指南):先把访谈转录稿逐段编码成短码,再合并相似代码、归纳主题、最后抽象成高层主题模型。GSN(Goal Structuring Notation,目标结构化符号)是一种把安全论证组织成「目标—子目标—证据」树形结构的可视化方法;SOTIF(ISO 21448 预期功能安全)关注非故障原因导致的危险。论文据此提出「证据闭环框架」:测试应从安全声明与所需证据出发,而非从随手收集的场景出发。

本文的方法学是定性访谈 + 主题分析,最终产出是可操作的「证据中心」框架。若不掌握 GSN/SOTIF 与主题分析的基本概念,就难以理解作者为何把「安全论证」与「证据门(evidence gates)」作为框架中枢。

研究动机

自动驾驶系统(ADS)正被快速商业化部署到不同地理区域,但配套测试实践却没有同步成熟。Beringhoff 等人通过访谈就识别出 31 项测试挑战,Tang、Riedmaier、Zhang、Ding 等综述则分别聚焦关键场景识别、场景化安全评估、测试技术等单一侧面。现实里仍没有一个被广泛接受的流程能具体界定「该测哪些场景、用哪些性能指标、套用什么验收准则」这类根本问题。更关键的是,已有研究多停留在「识别挑战」,却很少从真实工业约束出发提出落地的解决方案,许多挑战对业界仍是开放难题。具体场景上,参与者反映开放道路测试动辄要求 300 公里里程且准确率需 >90%,泊车成功率需从早期约 70% 提升到发布前约 95%,但各家用什么测、怎么判「够」并不一致,亟需一份来自一线工程师的全景式工业地图。

本文的目标是本文要做一次及时的实证调查,系统回答三个研究问题:RQ1 工业界当前用什么实践来测试 ADS;RQ2 工业 ADS 测试存在哪些挑战,以及可能解决它们的方案;RQ3 哪些展望与未来趋势会塑造 ADS 测试的演进。目标不是再写一篇文献综述,而是直接与一线从事 ADS 测试的产业专家对话,捕捉他们亲历的测试策略、流水线、活动、过渡准则、指标、基准与工具,并在此基础上综合出一个能将「工业洞察」翻译成「可操作指引」的测试框架,既为学术界也为产业界提供一份参照,用来理解、设计、评估和改进 ADS 测试流程。

与已有工作不同的是,以往工作大多依赖学术文献或公开资料(如综述、聚合工具/数据集的文章),即使做访谈也只覆盖单一视角——Beringhoff 只列挑战、Song 只看场景化测试、Lou/Liao 把访谈与问卷/综述混合。本文的独特切入点在于:(1)以更宽的实践导向视角直接访谈来自 6 国 9 家公司的产业专家,覆盖实践+挑战+潜在解决方案+未来展望四维一体;(2)刻意用开放式问题让专家按自身经验展开,并允许其审阅修改转录稿,提升内部效度;(3)挖掘以往研究较少触及的盲点,例如测试计划与策略、活动间过渡准则、满意准则与基准;(4)在归纳之外进一步把发现综合成一个「证据中心的闭环测试框架」,把挑战与未来趋势转化为可落地的工作流,而不只是又一份主题清单。

核心方法

整体思路是「用一线专家的声音拼出 ADS 测试的真实全景,再据此提炼可操作框架」。直觉上:既然标准缺失、各家公司做法各异,与其再做文献综述,不如直接去问每天在测的人。技术路线因此是定性实证研究:先通过便利抽样、目的性抽样、滚雪球抽样和社交平台公开招募组合采样,跨 9 国联系了 21 家公司;再对 9 位来自 9 家公司、6 国的专家做半结构化访谈(平均约 60 分钟,区间 45–75 分钟,经 Microsoft Teams 进行,9 个核心问题分背景/实践/挑战/展望四部分);之后按 Cruzes 等的主题分析指南逐份转录、编码、合并代码、归纳主题直至形成统一主题模型;最后把跨公司的实践、挑战、未来展望综合成一张「证据中心的闭环测试框架」。整条链路保证了从原始工业证据到框架的可追溯性。

本文最核心的创新不在访谈本身,而在两点:第一,把以往被忽视的「测试计划/策略」「活动间过渡」「满意准则」显式纳入工业全景,揭示这些决策其实是多因素(功能、需求、开发状态、运营数据、工具、目标)同时作用而非孤立选择;第二,提出「证据中心(evidence-centered)」的根本性重构——测试不应从「随手选一堆场景」出发,而应先声明要支撑的安全/质量主张、分解为可测目标、明确所需证据,再据此构建场景组合、按证据类型把场景路由到合适的测试环境(MiL/SiL/HiL/ViL、仿真/测试场/道路),用一组「证据门」而非仅靠工程师经验来判定是否进入下一阶段,最后把运营反馈(接管、不可复现故障、部署差异、ODD 变化)闭环回灌到场景库。这与「靠累计里程或 proven-in-use 慢慢积累」的传统思路形成本质区别。

方法步骤详情

分研究与综合两线。研究线:(1)多策略采样(便利/目的性/滚雪球/社交平台),跨 9 国联系 21 家公司,纳入 9 位专家,工龄 2–14 年、自动驾驶经验≥2 年,角色覆盖系统分析师、首席工程师、研究员、产品工程师、工程经理;(2)半结构化访谈,9 题大纲(Zenodo 公开)分背景/实践/挑战/展望,经 Teams 录音,区间 45–75 分钟、平均约 60 分钟;(3)转录稿回发参与者增删并对照录像核实;(4)按 Cruzes 主题分析指南逐稿编码、跨稿合并、归纳子主题再抽象为高层主题,迭代至形成 Figure 1–5,以「后期新主题递减」判定数据饱和;(5)以选直接经验者+预发说明+转录复核保构念效度,多国多规模公司抽样保外部效度。综合线:把发现凝练为 6 阶段证据中心框架——①定义安全主张与测试意图;②构建并维护带元数据的场景组合;③按证据类型把场景路由到合适测试环境并做就绪度检查;④套用 8 类证据门;⑤构建安全论证并决定推进/发布/限缩 ODD/返工;⑥运营闭环学习,把接管、不可复现故障、部署差异与新场景回灌组合。

技术新颖性

新颖性体现在三个层面。方法学上,这是首个以「实践+挑战+解决方案+展望」四维一体的多公司访谈研究,并明确把研究焦点从「列挑战」推进到「在真实工业约束下提解法」。内容上,本文贡献了既有综述少见的细节:六大测试策略(功能驱动/需求驱动/仿真驱动 shift-left/开发驱动/数据驱动/目标驱动 GSN)、四种活动间过渡策略(需求基/指标基/经验基/分析基)、以及具体的满意准则与基准(如人类驾驶事故率、认证场景、300 km/90% 的形式化门槛、泊车 70%→80%→95% 的阶段目标)。产出上,作者没有止步于主题模型,而是把发现综合成「证据中心的闭环测试框架」,把安全主张、场景、环境、证据门、安全论证与运营反馈串成一个统一、可迭代、能与 AI/世界模型等未来趋势兼容的工作流,使其既是工业现状的快照,也是可演进的参照模型。

A thematic model of testing processes, including overall strategies, pipelines, activities, and the flows and transitions between them.
Figure 2: A thematic model of testing processes, including overall strategies, pipelines, activities, and the flows and transitions between them.
A thematic model of testing approaches, metrics, benchmarks, and tools.
Figure 3: A thematic model of testing approaches, metrics, benchmarks, and tools.
An evidence-centered closed-loop testing framework for ADS synthesized from the interview findings, consisting of six stages and their key activities.
Figure 6: An evidence-centered closed-loop testing framework for ADS synthesized from the interview findings, consisting of six stages and their key activities.

实验结果

三问皆有据。RQ1(实践):几乎所有参与者围绕场景化测试展开,走 MiL→SiL→HiL→ViL 的 X-in-the-loop 流水线,从仿真推进到测试场再到带安全员的公共道路;核心指标是场景覆盖(多人列最重要),辅以碰撞率、舒适度、成功率、准确率、故障率,P8 指「累计里程」具误导性;可量化门槛含开放道路 300 km 需 >90% 准确率(日夜分项、任一失败即整体失败)、泊车成功率从早期约 70% 经 80% 提升至发布前约 95%。RQ2(挑战):归纳 13 类,集中在「输入真实」与「输出验收」两端——sim-to-real gap、缺公开基准(P8 最关键)、不完整覆盖(P5 最关键)、资源约束(P3 最关键)、客户系统不稳、安全论证缺口、不可复现故障、感知测试复杂性、验收准则不清(P1 最紧迫);解法含 3D Gaussian Splatting、端到端、世界模型、AI 造场景、云端闭环与 OTA。RQ3(展望):期待测试更高效自动化透明,如 SDV 缩流程、生成式模型造场景、开源共享、端到端与世界模型成主流、车辆演化为自主测试代理、减少 proven-in-use 依赖。

Overview of interview participants (P1-P9). Experience includes total industry experience of the participants, with experience in autonomous driving shown in parentheses.
Table 1: Overview of interview participants (P1-P9). Experience includes total industry experience of the participants, with experience in autonomous driving shown in parentheses.
Overview of the interviewed companies (C1-C9) based on their LinkedIn profiles.
Table 2: Overview of the interviewed companies (C1-C9) based on their LinkedIn profiles.
A brief version of the interview questions. A more comprehensive version, including detailed explanations and examples, is available on Zenodo.
Table 3: A brief version of the interview questions. A more comprehensive version, including detailed explanations and examples, is available on Zenodo.
A thematic model of challenges for testing ADS.
Figure 4: A thematic model of challenges for testing ADS.
A thematic model of outlook and future trends for testing ADS.
Figure 5: A thematic model of outlook and future trends for testing ADS.
查看结构化数据
任务指标本文基线提升
智能限速辅助(ISA)认证测试 准确率与里程(TÜV/欧洲法规) 开放道路随机选路 300 km 需 >90% 准确率,日夜分别设阈值,任一类别不达标即整体失败;另有固定测试场测响应时间 TÜV 标准与欧洲法规定义的形式化门槛 给出工业界正在使用的可量化验收门槛,把「准不准」从模糊经验转为分项硬指标
泊车系统全流程成熟度 各阶段成功率(车位搜索/识别/执行) 车位识别早期约 70% → 迭代后约 80% → 发布前需约 95%;并以车道偏离/居中/弯道/减速/急刹等评估车道保持 公司内部各子系统的经验性目标 把整体「能否泊车」拆成阶段化质量门,揭示成熟的渐进曲线
ADS 整体安全基准 事故率对比(相对人类驾驶员) 以人类驾驶员终身事故频率、累计里程、地域多样性为基准,并先通过认证/区域特有场景(如中国高速的黑猪模型横穿)作为最低门槛 人类驾驶事故统计 + 认证场景 提出比「几十亿英里」更具操作性的双层基准(合规底线 + 相对人类)
工业实证覆盖广度 受访专家/公司/国家数 与 主题维度 9 位专家 / 9 家公司 / 6 国,覆盖实践+挑战+方案+展望四维,并达到数据饱和 Beringhoff 等仅列 31 项挑战、Song 仅看场景化、Lou/Liao 问卷+综述混合 首个四维一体的工业全景,并把发现综合为可操作框架而非挑战清单

局限与改进

作者与读者都能识别若干局限。首先是样本规模与代表性:9 位专家、9 家公司虽覆盖 6 国与多种规模,但定性研究本就不强求统计可推广性,且 LinkedIn 来源公司多为大型整车厂(C1–C4、C6、C9 均为万人以上机动车制造商),地理上偏重欧洲与中国,对北美一线视角相对不足。其次是自我报告偏差与记忆偏差:访谈数据依赖参与者主观描述,且部分实践「被多次提及才算报告」,可能遗漏被低估的内容。第三,未来展望带有较强愿景色彩(如「车辆即自主测试代理」),是否兑现尚无证据。第四,也是最关键的——作者坦承提出的「证据中心闭环框架」是对工业实践的综合与提炼,是规范性命题,并未在真实项目中做对照评估或量化验证其能降低多少事故或缩短多少周期。从读者角度还可补充:论文几乎没有对具体工具/仿真平台做性能对比,3D Gaussian Splatting、世界模型等「解法」仅作为方向被点名,缺乏可比的指标支撑。

独立分析的弱点

独立来看,本文有几处可改进的弱点。其一,框架的可证伪性偏弱:6 阶段与 8 类证据门是经验综合而非实证产物,缺乏判据说明「证据门各自阈值如何标定」「不满足时该路由到哪个环境」。改进方向是设计可测的对照实验或纵向案例,度量采用框架前后的事故率、回归轮次、发布周期。其二,工具与平台层面停留在枚举(CARLA、Alpamayo、Sora、3DGS),没有给出保真度/成本/适配场景的量化比较;可补充一张「仿真平台 × 证据类型 × 成本/保真」的决策矩阵。其三,对生成式 AI 造场景的「真实度评估」只点到难点,未给出像素/点云级置信度的可操作定义;可借鉴不确定性量化与 OOD 检测给出度量。其四,定性数据受保密限制难以公开,复现性受限;可考虑脱敏发布结构化代码本与场景元数据 schema。其五,「等级灰色地带」(L2 实为 L3/L4)这一有趣观察被作者自己标记为「值得未来深究」,却未纳入框架,是值得单独立题的方向。其六,对监管与伦理(多少失败可容忍)只在 P1 处一句带过,框架未显式建模责任与合规约束。

未来方向

作者明确点名的方向:在真实项目中评估与迭代证据中心框架、扩大样本与地理覆盖、深入研究「官方等级 vs 实际能力」的灰色地带。基于成果还可延伸若干方向:(1)把 8 类证据门形式化为可量化阈值,如组合覆盖度 $C = \sum \mathrm{covered} / \sum \mathrm{required}$、故障率单调递减曲线、仿真—现实行为距离,并研究门间依赖与冲突仲裁;(2)构建跨公司场景库元数据标准与去敏共享协议,呼应 P8 公开基准诉求;(3)系统评估 3D Gaussian Splatting、神经仿真、世界模型在缩小 sim-to-real gap 上的实际收益,给出可信的「真实度置信」度量;(4)研究生成式 AI(Sora、VLM)与 Agentic AI 在场景生成中的可控性与 OOD 覆盖,解决物理保真瓶颈;(5)把 SOTIF 与 GSN 扩展到端到端与黑箱大模型的安全论证;(6)整合云端闭环(类 Tesla)、OTA、SDV 为「运营即测试」范式,并厘清数据合规与隐私边界。这些方向既呼应参与者展望,又能把框架从参照模型推进为可演进的工程基础设施。

复现评估

复现性中等偏上。访谈材料(邀请信、知情同意书、含示例的完整访谈问题)与最终主题模型均公开于 Zenodo(论文引用 [40]),方法学(半结构化访谈、Cruzes 主题分析、效度威胁控制)描述清晰、可照搬。采样策略与纳入标准(21 家公司→9 位专家、6 国、工龄 2–14 年、自动驾驶经验≥2 年)也写得足够透明。但核心的访谈转录稿因匿名与保密几乎不可能公开,导致编码过程难以被外部逐条复核——这是定性研究的通病而非本文独有。算力方面几乎无门槛(不涉及训练),主要成本是招募与访谈的人力时间。难度集中在「能否找到等量级的工业专家愿意接受访谈」,对学术界复现是真实门槛。所提框架本身可概念性复现,但要验证其有效性必须嵌入真实开发流程做纵向案例研究,这一点目前尚未由作者完成。