术语图鉴

当你只能复述会上听到的一句话、却说不出术语名时,从这里反查。每个词条先给白话判断,再讲机制、易混点和可以追问的问题。

45 个术语

共 45 个

端到端

End-to-End· 架构

让模型更直接地从传感器输入学到驾驶输出,减少中间环节的信息损失,但不等于取消工程约束。

会上可能听到:“我们这套是端到端的。——那到底哪一段到哪一段?跟以前的方案差在哪?”

两段式

Two-stage End-to-End· 架构

第一段输出结构化世界(目标、车道线、交通灯),第二段基于它生成轨迹——用信息压缩换可解释和可控。

会上可能听到:“第一段出感知结果,第二段做规划。——这算端到端吗?为什么很多团队转端到端时先做这个?”

一段式

One-stage End-to-End· 架构

规划器除了结构化结果,还能直读上游的共享特征,规划损失能回传更新表征——上限更高,但难归因、难闭环验证。

会上可能听到:“一段式上限更高。——上限高在哪?我们为什么还不敢上?”

潜空间

Latent Space· 架构

模型内部的压缩工作台:信息比结构化标签丰富,但人读不懂,所以出错难归因。

会上可能听到:“这些信息都在 latent 里。——那我怎么知道它到底学到了什么?”

Query 与候选轨迹

Query / Proposal· 架构

query 是模型内部「带槽位的探针」,proposal 才是解码后拿出来比较的候选结果。

会上可能听到:“我们用 N 个 query 出候选。——query 就是候选轨迹吗?”

视觉-语言-动作模型

VLA (Vision-Language-Action)· 架构

把视觉输入、语言/语义桥接和动作输出统一到一个多模态框架,适合更高层的意图和语义条件化。

会上可能听到:“下一代要上 VLA。——它比现在的端到端多了什么?”

导航路径

Navigation Path· 导航

两段式方案里由模型预测的一条宏观参考线:只表达该往哪走,不是可执行轨迹,不能直接控车。

会上可能听到:“第一段已经出了导航路径。——规划器是不是照着这条线开就行?”

导航增强

Navigation Augmentation· 导航

主动注入定位漂移、行点缺失、更新延迟这些真实退化,防止模型过度依赖某一种完美导航输入。

会上可能听到:“导航输入我们做了增强。——增强什么?把导航搞乱了不是更差吗?”

导航先验编码

SD / SDPro Prior· 导航

把 SD 行点、导航动作、限速、候选与推荐车道编码成条件 token,经 cross-attention 注入规划 query。

会上可能听到:“导航信息在一段式里怎么给模型?”

鸟瞰图表征

BEV (Bird's-Eye View)· 感知

把多摄像头视角融合到统一的鸟瞰空间,降低对高精地图的依赖。

会上可能听到:“我们是 BEV 无图方案。——BEV 解决了什么,无图又是什么意思?”

多传感器融合

Multi-Sensor Fusion· 感知

把几路传感器的长处拼进同一份场景表征:相机给语义,激光雷达给几何,毫米波雷达给速度。

会上可能听到:“我们是 BEV 融合方案。——融了哪几路传感器,在哪一层融?”

多目标跟踪

Multi-Object Tracking (MOT)· 感知

把逐帧的检测连成有身份的轨迹:同一辆车跨帧保持同一个 ID,并估出单帧给不了的速度和横摆角速度。

会上可能听到:“检测已经很准了,跟踪就是把框连起来。——那 ID 跳一次,下游会看到什么?”

占据栅格

Occupancy· 感知

用空间中每一块「有没有被占据」来表达障碍,解决检测框只能识别规则形状物体的问题。

会上可能听到:“Occupancy 能识别异形障碍物。——它跟 3D 检测框是什么关系?”

运动学模型

Kinematic Models (CV / CA / CTRV / CTRA)· 预测

假设某个运动量不变,按物理外推:CV 保速度,CA 保加速度,CTRV / CTRA 再保转弯率;短时好用,一长都失准。

会上可能听到:“预测先拿 CTRV 顶着。——顶得住几秒?变道收尾时它会怎么错?”

卡尔曼滤波与 IMM

Kalman Filter / Interacting Multiple Model· 预测

卡尔曼滤波按运动模型「先推一步、再拿观测修正」,连同不确定性一起估;IMM 并行跑几个运动模型、按概率混合,能较快跟上已经开始的机动。

会上可能听到:“前车一变道,跟踪就慢半拍。——滤波器里是不是只有一个匀速模型?”

意图预测

Intention Prediction· 预测

先把「对方想去哪」离散成几个候选:哪条车道、哪个出口,再给每个候选打分;轨迹等意图定了再补。

会上可能听到:“意图模块说它大概率要切进来。——这个概率是在哪几个候选之间分的?”

边际预测与联合预测

Marginal vs Joint Prediction· 预测

边际预测给每辆车各自一组带概率的轨迹;联合预测把概率标在整个场景上,同一场景里各车的轨迹互相配套。

会上可能听到:“每辆车的多模态轨迹都给了,概率也校准过。——能直接乘起来当场景概率用吗?”

MDP 与 POMDP

Markov Decision Process / Partially Observable MDP· 决策规划

MDP 假设状态完全可测;POMDP 承认意图这类状态只能从观测里推,策略变成「置信 → 动作」——更贴近驾驶,但在真实规模上只能近似求解。

会上可能听到:“这块决策我们按 POMDP 建模。——车上跑的是精确解,还是哪种近似?”

MPDM 与 EPSILON

Multipolicy Decision-Making / EPSILON· 决策规划

预定义一小撮语义策略,对每个候选做闭环前向仿真、打分选优——把不可解的 POMDP 砍成「在有限集合里挑一个」。

会上可能听到:“决策层用的是 MPDM 那一套。——候选策略有几种?他车在仿真里怎么动?”

CVaR:尾部风险

Conditional Value at Risk· 决策规划

期望值会拿大概率的顺畅稀释小概率的灾难;CVaR 放大最坏那部分尾巴的安全代价,α 决定尾巴取多宽,是风险容忍度的旋钮。

会上可能听到:“这个策略在仿真里平均分最高。——最坏的那些分支长什么样?”

Hybrid A*

Hybrid A* Search· 决策规划

在栅格上搜路,但节点按车辆运动学扩展,搜出来的每一步车都开得到——擅长停车场、掉头、窄空间这类非结构化场景。

会上可能听到:“泊车和掉头用的是 Hybrid A*。——它和普通 A* 差在哪?”

Frenét 坐标与五次多项式采样

Frenét Frame / Quintic Polynomial Sampling· 决策规划

沿参考线拆成纵向 s 和横向 l,采一批终止状态、每个配一条五次多项式、挑代价最低的——横纵解耦只在高速近似成立。

会上可能听到:“横纵我们是在 Frenét 坐标下分开采样的。——低速的时候也这么拆吗?”

DP + QP:EM Planner

Dynamic Programming + Quadratic Programming· 决策规划

路径和速度分开规划,每边先 DP 后 QP:DP 在非凸空间里做离散决策、圈出凸的可行走廊,QP 在走廊里求平滑解。

会上可能听到:“规划用的是 DP + QP。——DP 那一步输出的只是一条粗路径吗?”

时空语义走廊 SSC

Spatio-temporal Semantic Corridor· 决策规划

沿决策层前向仿真的状态,在 s-l-t 空间里修一串相连的无碰撞立方体,再在这条走廊里铺轨迹——决策和规划在这里合龙。

会上可能听到:“时空联合这块我们用的是走廊法。——走廊里的「语义」指什么?”

多模态轨迹

Multi-modal Trajectory· 轨迹生成

未来不是一个确定的点,而是一个分布:可以跟车、变道、让行、绕行,模型输出多条候选来表达这种不确定性。

会上可能听到:“模型输出了好几条候选轨迹。——为什么不直接给一条?多的那些有什么用?”

扩散模型轨迹生成

Diffusion· 轨迹生成

先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。

会上可能听到:“轨迹生成我们用 diffusion。——它比直接回归好在哪?慢不慢?”

截断扩散与锚点

Truncated Diffusion / Anchor· 轨迹生成

不从纯噪声出发,而是从聚类得到的轨迹锚点加少量噪声开始去噪,用少数几步换取车端实时性。

会上可能听到:“我们用截断扩散做到了实时。——截断掉的是什么?会不会有损失?”

自回归轨迹生成

AR (Autoregressive)· 轨迹生成

把轨迹变成 next-token prediction,一步步生成——训练稳定、天然接 RL,但会误差累积、多模态容易坍缩。

会上可能听到:“AR 方案是一个 token 一个 token 出轨迹。——跟 diffusion 比各有什么取舍?”

动作词元设计

Action Token· 轨迹生成

「下一步」到底表示什么——不同的 token 定义会改变学习难度、噪声传播和极端场景表现。

会上可能听到:“我们的 token 用的是 acc 和 yaw_rate。——为什么不用轨迹点?这个选择影响什么?”

逐步展开与误差累积

Rollout / Exposure Bias· 轨迹生成

策略一步步展开未来时,前一步的输出会变成后一步的输入——错了就会沿着错误状态一路滚下去。

会上可能听到:“闭环里跑着跑着就飘了。——为什么开环测着好好的?”

流匹配

Flow Matching· 轨迹生成

不预测噪声,而是学习从噪声轨迹流向真实轨迹的连续速度场,推理时解 ODE——采样步数更少。

会上可能听到:“Flow matching 比 diffusion 快。——它们本质区别在哪?”

信用分配

Credit Assignment· 轨迹生成

整条轨迹拿到一个 reward,要把功过分配回生成过程中的哪一步——AR 的粒度天然对齐到每个 token,但长期 reward 仍可能错归到早期动作;Diffusion 要摊回多个去噪步。

会上可能听到:“Diffusion 接 RL 比 AR 难。——难在哪?”

奖励钻空子

Reward Hacking· 强化学习

模型会最大化你写下来的数值,而不是你心里真正想要的驾驶行为——这是 RL 的本性,不是偶发 bug。

会上可能听到:“仿真里指标全绿,实车体验却很差。——模型是不是在钻我们 reward 的空子?”

奖励函数

Reward Function· 强化学习

把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。

会上可能听到:“我们在 reward 里加了舒适性权重。——这些权重是怎么定的?加了会不会顾此失彼?”

模仿学习与强化学习的关系

Imitation Learning vs RL· 强化学习

RL 不是从零学开车,而是在模仿学习学出的基础策略上做对齐微调。

会上可能听到:“我们要上强化学习。——是要从头用 RL 学开车吗?”

PPO 与 GRPO

PPO / GRPO· 强化学习

都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。

会上可能听到:“这版我们从 PPO 换成 GRPO 了。——差别在哪,为什么要换?”

参考模型与 KL 约束

Reference Model / KL Penalty· 强化学习

冻结的预训练策略作为锚点,用 KL 惩罚拴住新策略,别为了刷 reward 跑出原本合理的驾驶分布。

会上可能听到:“我们加了 KL 约束。——约束的是什么,加大加小有什么影响?”

RL 能解决的五类问题

What RL Is For· 强化学习

长时序决策、多目标权衡、不确定交互、稀疏延迟反馈、规则写不清的灰色决策区。

会上可能听到:“这个问题上 RL 能解决吗?——什么样的问题才该用 RL?”

运行设计域

ODD (Operational Design Domain)· 量产验收

系统设计时限定的运行条件:哪些路、什么天气和光照、多高车速;快越界时,要么交还给人,要么自己进入最小风险状态。

会上可能听到:“这个功能城区也能开。——它的 ODD 写的是哪些路、什么天气、多高车速?”

开环与闭环

Open-loop vs Closed-loop· 量产验收

开环用数据集里的真实下一状态,闭环用环境动力学产生下一状态——前者看不到误差累积,后者才检验纠错能力。

会上可能听到:“这版指标提升了 15%。——这是开环测出来的还是闭环?”

位移误差指标

ADE / FDE / Miss Rate· 量产验收

ADE 是预测轨迹与真值逐点距离的平均,FDE 只看终点——它们衡量「像不像专家」,不等于安全或舒适。

会上可能听到:“ADE 降了 0.2。——这对用户意味着什么?”

碰撞时间与弱势交通参与者

TTC / VRU· 量产验收

TTC 是碰撞时间;VRU 是行人骑行者。关键不只是轨迹会不会相交,而是会不会在接近同一时刻到达交点。

会上可能听到:“VRU 场景我们加了 TTC 惩罚。——够吗?”

场景隔离

Scenario Isolation· 量产验收

同一个 reward 在不同场景下含义可能相反,所以 reward 不能全局常开,必须按场景生效。

会上可能听到:“加了车道锁定之后,绕行变差了。——这两个是不是打架了?”

数据闭环

Data Flywheel / Hard Case Mining· 量产验收

从线上发现问题到归因、难例挖掘、数据配比、调整、开闭环评测、小流量验证,再回到发现问题的完整循环。

会上可能听到:“我们有数据闭环。——具体是哪几步?多久转一圈?”

RL 数据规模直觉

RL Data Scale· 量产验收

验 reward 方向约 10 条;单任务专项百到千条 clip;全量训练约 10w clip;一段式预训练可能千万级。

会上可能听到:“这个 RL 任务需要多少数据?——有没有大致的量级参考?”