← 自动驾驶主线

评测、量产与数据闭环

证明系统真的会开,并让失败变成下一轮能力

约 9 分钟阅读

一个不看路的模型拿了高分——那不是模型的胜利,是考卷的失败。


开场先打一个脸:AD-MLP

2023 年有一篇论文做了个故意气人的实验。搭一个两层 MLP,输入只有:

  • 自车的速度、加速度和历史轨迹;
  • 一个转向指令(左转、直行、右转)。

不接任何感知信息,模型全程“闭着眼”。拿它在 nuScenes 的开环评测上跑规划,结果:L2 平均误差 0.29 米,比当时最先进的端到端模型 VAD-Base 的 0.37 米还要好。这里的 L2 是规划轨迹和人类轨迹之间的欧氏距离,和第 2 章的 L2 级辅助驾驶不是一回事。

结论当然不是“MLP 很强”,而是这张考卷测不出真本事。开环评测是拿模型输出和数据集里人类司机的轨迹比距离,而车辆的历史状态本身就在很大程度上决定了短期的未来:匀速直行的车,大概率继续匀速直行。只做自车外推就能刷出好成绩,根本不用看路。这不是孤例:CVPR 2024 的一篇论文(Is Ego Status All You Need)发现,在某些情况下,把现有端到端框架的视觉输入整个拿掉,规划质量也没有明显下降。

前七章造出来的系统,最终要靠这一章回答“到底会不会开”。而这一章的第一课是:先审考卷,再看成绩。


评测分层:从考卷到考场

开环的问题在于,车辆的输出不改变下一帧:数据是录好的,不管模型说什么,世界照原样放映。它适合快速迭代,便宜、可复现,但开环指标只能作参考:算法相对稳定之后,指标的波动较大。

闭环让车辆的动作真正影响后续的场景。但“闭环”两个字底下也分层。nuPlan 的评测矩阵把它拆成两个维度:自车是否闭环(输出是否推进仿真),他车是否反应。于是有三级:

  1. 第一级日志回放全开环,世界照录像放
  2. 第二级非反应式自车闭环,他车照录像走
  3. 第三级反应式他车会响应你的动作
第二级里,你变道,他车也不会让;第三级才开始检验交互,而交互正是第 4、5 章反复强调的驾驶核心难度。

三个主流基准各占一个生态位,取舍在真实性和交互性之间:

nuPlan

  • 真实采集的数据,加上仿真工具链
  • 对比 7 个常见的预测与规划数据集,只有它支持闭环仿真

NAVSIM

  • 第一版:规划器只在场景起点出一条轨迹,照着执行几秒、不重新规划;背景车按日志回放
  • 第二版:再在几个用 3D 高斯泼溅预渲染的偏离起点上各出一条轨迹补测;背景车改由规则模型响应自车
  • 卡在自车这一维:两版都是整段执行、中途不重新规划,按自车算介于第一级和第二级之间;第二版的背景车虽会响应自车,自车却不回应它们,也算不上第三级

Bench2Drive

  • 基于 CARLA 仿真,环境真响应、场景可编排
  • 220 条路线、44 类场景、5 项技能:汇入、超车、让行、交通标志、急刹
  • 代价是世界是合成的

让自车真的动起来,分数怎么算?NAVSIM 的 PDMS 是个好样本:

  • 不发生有责碰撞、不越出可行驶区域:两项相乘,作惩罚项,犯了就大幅扣分甚至清零;
  • 行驶进度、碰撞时间(TTC)、舒适性:三项加权平均。

这张榜单上有四组数字值得放在一起看:

模型PDMS
人类司机94.8
主流端到端模型(TransFuser、UniAD、LAW)约 84
只看自车状态的 MLP65.6
只做匀速外推(Constant Velocity)21.6

同一类“闭眼模型”,开环能追平最先进的方法;一到 NAVSIM 这种让自车真的动起来的打分,就比主流端到端模型低了将近 20 分。这就是考卷换对了的样子。


一个总分不够:场景化评测

总分及格,不等于每门课都及格。Bench2Drive 把 44 类场景归到 5 项技能下,可以按技能看成绩;针对特定弱点,还有专门的考场。比如 DOS 遮挡基准,专测四类遮挡场景,每类 25 个案例:

  • 路边停车后面突然有人冲出;
  • 前车突然急刹;
  • 视线被挡住的左转;
  • 有人闯红灯。

放到我们的贯穿案例:“路口汇入”这个能力项,应该用“晚切入”“后车不让行”“湿滑路面”这样的场景标签切开看,而不是淹没在全量数据的平均分里。

顺带一个接管类指标的细节:早在 NVIDIA 的端到端方案里,路测前的仿真测试就用 autonomy(自动驾驶时长占比)打分,约定每次人工接管折算 6 秒。看任何接管率数字之前,先问清楚接管是怎么折算的:口径不同,数字就没有可比性。


上车:延迟、退化和降级

评测通过,只说明算法能开;量产还要求它在车载算力和固定的控制周期里稳定运行。第 7 章的数字可以拿来做个量级练习。如果规划按 10 Hz 运行,一个周期只有 100 毫秒:每一帧的感知和规划要在周期里算完,还要留余量;从传感器到控制的整链路时延,是另一笔预算。论文报告的 UniAD 约 555 毫秒(A100)、VAD-Tiny 约 60 毫秒(RTX 3090),是在单张数据中心卡或桌面卡上测的模型推理延迟,论文没写测量范围,卡和模型规模也不同。它们能说明量级差得很远,说明不了谁能上车。能不能上车,要在目标芯片上按整条链路、看最坏情况来测,见量产专题。

另一半是退化处理:传感器时序错位、导航跳变、地图过期、极端天气。量产的做法不是祈祷输入干净,而是在训练时主动制造脏输入。第 2 章讲过的 SD 导航行点,训练时会被故意加噪:横向偏移、前后错位、随机丢点、配上一帧的旧行点。这类增强让模型学会“导航突然不准或没了,也不能画龙”。这和第 7 章 NVIDIA 的纠错数据是同一种思路:把失效模式变成训练样本。


数据闭环:长尾差着三个数量级

模型能力的上限由数据决定,而驾驶数据的形状极不均匀。把各类场景的数量画在对数坐标上:普通行驶、稳定跟车这些常见场景有几十万到上百万条,而“高速上绕开弱势交通参与者”只有几百条,差了大约三个数量级。所以数据配比是量产的核心问题:不做配比,模型就是一个只会直行的优等生。

清洗同样关键,一般分三层:

  1. 基础信息完整:信息都正常存储、不丢帧、定位正常;
  2. 驾驶行为合理:跟随导航、符合交规、舒适;
  3. 在辅助驾驶的能力范围内:不超高速、没有急转弯、满足动力学约束。

第二层说到底,就是筛选出老司机的行为。模仿学习的上限,就是被模仿者的水平。数据里混进新手司机的犹豫和急刹,模型就学会犹豫和急刹。数据清洗不只是技术活,更是选老师。

采不到的长尾,还可以造:用脚本生成对抗场景,比如 if is_close(ego): do cut_in(speed)(这是 RTR 这项研究里真实的伪代码:靠近自车时,就以某个速度切入),再配合闭环仿真训练。长尾不够,脚本来凑,这是很实用的工程手法。


贯穿案例的最后一幕

把整条链闭合。一次实车测试中,还是那个路口:深色轿车比训练数据里见过的切得更晚、更快,主路后车也没有让行。车辆重新刹停,没有碰撞,但制动峰值过高,安全员记下了一次不舒适事件。

接下来发生的事,就是“数据闭环”四个字的展开:

  1. 回传片段连同前后时序、地图、导航、预测和规划
  2. 检索按场景标签找相似片段
  3. 清洗标注去重、选老师、补切入意图
  4. 配比造数提高配比,必要时脚本造变体
  5. 三级回归回放、仿真、受控实车
  • 检索用的标签是“城市路口汇入 + 晚切入 + 后车不让行 + 湿滑路面”;
  • 三级回归:新版本先过历史片段回放,再过他车会反应的仿真,最后在受控条件下实车回归。要确认修好了晚切入,同时没有把普通跟车和舒适性改坏。

像素进来,轨迹出去,失败回流成下一轮的数据。八章在这里闭合成一个环。


收官:四个还没有答案的问题

这条主线的出口,是四个今天仍然开放的问题:

  1. 怎么做有效的闭环评测;
  2. 怎么构建长尾场景的基准,用来验证泛化能力;
  3. 怎么让模型真正实时地部署上车;
  4. 怎么把多模态大模型的常识推理能力挖出来,并和驾驶任务对齐。

这四个问题都还没有公认的答案。你以后读到的每一篇新论文、每一场发布会,多半都在回应其中某一条。

之后再读任何专题或新方案,建议带着三个问题去:它改动了这条链路的哪一环?依赖哪些上游信息?由什么级别的闭环证据证明?答案越含糊,越要小心。


本章速查

概念一句话
AD-MLP不看感知的两层 MLP,开环 L2 0.29 反超 VAD-Base 的 0.37:开环考卷测不出真本事
评测三级日志回放 → 闭环但他车不反应 → 闭环且他车反应;第三级才检验交互
三大基准nuPlan(真实数据 + 闭环工具链)/ NAVSIM(自车每次出一整段轨迹、中途不重新规划,按自车算介于第一、二级之间;第二版背景车会按规则响应)/ Bench2Drive(CARLA 真闭环,但世界是合成的)
PDMS有责碰撞与越界相乘作惩罚,进度、TTC、舒适加权;人类 94.8、主流模型约 84、只看自车状态 65.6:让自车动起来,“闭眼模型”就现形
场景化评测总分拆到技能和场景标签(汇入、急刹、遮挡),DOS 专测遮挡
接管折算autonomy 每次接管算 6 秒;看接管率先问折算口径
实时性10 Hz 下一个周期 100 ms,每帧要在周期内算完并留余量,整链路时延另算;论文里的模型推理延迟(不同卡、不同配置)只能看量级,上车要在目标芯片上按最坏情况实测
长尾常见场景几十万到上百万条,高速绕开弱势交通参与者只有几百条,差约三个数量级;配比是量产的核心问题
清洗 = 选老师模仿学习的上限就是被模仿者的水平;清洗的本质是筛出老司机的行为
数据闭环失败片段 → 检索相似 → 清洗标注 → 调配比、造变体 → 回放 / 仿真 / 实车三级回归
04

评测不只是一个分数

开环、闭环和道路验收各自能证明什么,怎样避免被漂亮指标误导?

05

从论文方法到车上功能

一篇方法论文要跨过哪些系统门槛,才有资格变成持续可交付的量产能力?

06

量产里常见的坑

端到端从论文走到车上,最常在哪些地方翻车?每个坑该去哪里细读?