分界线不在模型数量,而在必经接口
两段式的第一段,把环境转换成人读得懂的结果:动态目标的 3D 框、速度、航向角、类别和跟踪 ID,常常还带着他车的预测轨迹;静态道路的车道折线、路沿、属性和置信度。第二段的规划器只消费这些结果。这里的“段”指的是信息契约:规划器看到的是一个被定义过的世界,而不是前端视觉特征的全部。
一段式并不意味着感知头、地图头和 Occupancy 头全都消失。常见的一段式架构仍然保留这些辅助任务,变化在于:从上游特征到规划器多了一条直连通路,结构化结果从“唯一通道”变成了“辅助通道”。所以,一个系统任务头再多,也可以是一段式;一个系统只有两个大模型,也不自动等于两段式。
学术界还有另一套分类:有辅助任务和无辅助任务。它回答的是训练时有没有额外的监督,和产业说的一段式、两段式不是一回事:辅助任务是监督设计,中间接口是运行时和梯度的边界,两者不能一一对应。判断方案时要把两套词拆开,否则容易把“保留了检测 loss”误判成“仍然是两段式”。
行业材料里的叫法也不统一。同一套“规划器只读结构化的动态、静态元素和导航”的架构,有的资料叫一段式,有的资料画成两段式的第二段。两者的框图往往只差两处:后处理结果换成网络直接输出,外加一条从上游特征直达规划器的旁路。碰到叫法打架,别跟着名字走,按上面的判据看:规划器能不能绕过结构化结果读特征,规划损失能不能回传到上游。
- 接口:规划器是否必须消费结构化的感知结果。
- 梯度:规划目标能否穿过中间接口,更新上游的表征。
- 监督:检测、建图、预测这些任务,是必经的输出,还是辅助的训练信号。
- 运行:部署时,是否要靠后处理把第一段的结果重新整理,才能送进规划器。
两种架构共享的部分,比想象中更多
无论一段式还是两段式,系统都要处理多相机输入、时序对齐、动态目标、静态道路、导航和自车状态,最终输出满足安全、合规、舒适与效率要求的轨迹。区别不在于任务是否存在,而在于这些任务以什么粒度交互。
感知内部本身就是一条连续谱:Dense BEV 先构造完整的鸟瞰特征;Sparse 方法用对象或任务 Query 直接从图像里取信息;StreamPETR、Sparse4D 和 DriveTransformer 又都用上了对象级记忆、坐标对齐和运动补偿。所以,“前端怎样组织表征”和“系统是一段还是两段”,是两个相关但不同的设计维度。
导航也不会因为一段式而消失。量产方案里,SD 地图提供推荐车道、行点和剩余距离,编码后和动态、静态信息并列送进规划器;经典的规则栈同样依赖路由、参考线和交通规则。端到端改变的是信息的消费方式,不是把长期目标和交通约束凭空删掉,“只看图像就能开车”是一种错误的想象。
- 传感器与时序多视角图像、车辆状态和历史帧先被对齐、编码。
- 环境表征可以是 Dense BEV、Sparse Query、结构化的目标与地图,也可以是它们的组合。
- 导航与行为先验路由、推荐车道、机动指令和剩余距离,限定长期方向。
- 规划器交互自车 Query 或规划 Token 读取场景和导航信息,生成单模态或多模态轨迹。
- 约束与执行动力学、碰撞、道路边界和交规,要在训练目标、后处理或控制层里生效。
结构化世界与潜空间,各自丢什么
两段式的优势,不是一句笼统的“可解释”,可以拆成三层:能看见中间要素;能理解规划器为什么选某条轨迹;能定位问题出在感知、特征还是规划。结构化接口还能承载规则约束和风险检测,让团队对输入输出建立明确的验收标准。
代价是信息压缩。像素里的遮挡关系、纹理、交警手势,或者标签体系没覆盖的上下文,在变成有限的类别、几何量和置信度时,可能就被丢掉了。规划器拿到的,是一个被工程接口定义过的世界。窄路交互和交警手势这类场景说明,一段式的潜空间旁路,理论上能保留这些很难预先枚举的信号。
但潜空间不自动等于理解力更强。它也带来定位困难:轨迹错了,团队很难确认问题出在检测、交互预测、导航融合还是规划头。Query 规划器的四种范式(见下文“连续谱”一节)也说明,任务关系、训练稳定和效率,没法只凭“用没用 BEV”推断出来,必须落到具体的交互结构上检查。
两段式
把中间表征做成系统契约
- 可读、可测,可以插入规则与安全检查。
- 模块可以独立训练、替换和做回归验证。
- 显式接口会压缩信息,形成性能上限。
- 上游误差可能通过固定接口传给规划器。
一段式
让规划目标塑造共享表征
- 规划器能读到没被标签体系压缩的特征。
- 规划损失能影响上游表征,减少级联误差。
- 任务耦合增加,训练稳定性更难保证。
- 问题定位、闭环仿真和安全解释的成本更高。
证据链:结构被拆掉,又被一件件请回来
先看两笔硬账。训练成本:一段式联训要“千卡 72 小时”,两段式只要“64 卡 24 小时”,差距不是百分比,是量级。运行时:论文报告 UniAD 全任务长链 555.6 毫秒、1.8 FPS,VAD-Tiny 精简任务加矢量化 59.5 毫秒、16.8 FPS;两者不是同一张卡测的(A100 对 RTX 3090),模型规模也不同,只能看量级。架构怎么选从来不只是学术分歧,它直接写进算力预算和迭代周期。
产业站队也没有收敛。一份八家主要厂商的方案对照里,一段式和两段式恰好 4:4:一段式有 Tesla、理想、地平线、文远,两段式有华为、Momenta、小鹏、元戎。输入侧,Momenta 是唯一把导航路径单列为输入的;数据侧,地平线是唯一只用专家数据的;强化学习一栏,没有一家标注“闭环强化学习已落地”,理想把“VLA + 强化学习闭环”写在优化方向里,是目标,不是现状。分界线两边都有量产公司,说明它是取舍,不是代际。
更有意思的证据,在论文的演进方向里。VAD 是一段式,却保留了向量化的场景表示和三类显式约束:自车与他车碰撞、道路边界越界、车道方向一致。到 VADv2,干脆把轨迹回归改成在 4096 条轨迹词表上打概率分,再加一道场景冲突检查。一段式往量产走的每一步,都在把当初拆掉的结构一件件请回来:先请回约束,再请回概率,再请回可评测的中间结果。“结构化是负担”的说法,被一段式自己的演进史否决了。减少表征瓶颈不等于取消约束,真正的问题是约束放在训练、解码、后处理还是控制层。
反方向的回报也真实存在。两段式的接口字段里没有“交警手势”这一栏,标签体系标不出的东西,规划器永远看不见;一段式的潜空间旁路,让复杂标签体系的上限不再限制性能,甚至“即使检测错了,最终轨迹也可能是对的”。DriveTransformer 则展示了放弃 Dense BEV 之后的可扩展红利:decoder 从 L3-D256 扩到 L12-D768,Driving Score 提高 18.22,推理快 34%。不过它那张“四项全优”的评分表出自论文自评,听宣称,看复现。
代价同样具体。一段式在闭环仿真里有五种典型的不稳定:BEV 特征变换失真、轨迹左右抖动、跟车不稳、处理不了切入车辆、连续偏差后直接发散。潜空间的信息完整性在闭环里兑现之前,先兑现的是调试成本:这五条,就是“难调试、难做闭环验证”在工程日志里的样子。
- 成本账:千卡 72 小时 vs 64 卡 24 小时;555.6 ms / 1.8 FPS vs 59.5 ms / 16.8 FPS(论文报告值,不同卡测)。
- 站队账:八家厂商 4:4,没有一家已落地闭环强化学习;分界线是取舍,不是代际。
- 演进账:VAD 保留显式约束,VADv2 补回概率与词表;一段式在把结构请回来。
- 回报账:交警手势这类信号,只有潜空间旁路能保留;检测错了,轨迹也可能对。
- 代价账:闭环仿真里的五种不稳定,从特征变换失真到连续偏差发散。
训练方法才会暴露架构的真实边界
联合训练的困难可以量化:十多个任务、几十种数据、几百个 loss。动态检测与跟踪、静态建图、Occupancy、红绿灯、规划和其他任务同时存在时,问题不只是算力,而是标注缺失、损失尺度和学习率策略互相牵制。所谓“一段式训练不稳定”,对应的就是这个真实的多任务优化问题。
两段式通常先推理或缓存感知结果,也可能直接用感知真值训练规划器,再单独做模仿学习和强化微调。它放弃了感知与规划的联合更新,换来收敛速度、实验可复现和模块回归的确定性。隐藏的风险是:训练时用的真值或高质量缓存,比部署时的实际感知输出更干净,规划器会遇到训练和推理的分布不一致。
一段式也不等于从随机初始化开始全量联训。UniAD 先训感知,再把感知、预测、规划一起训;更大的 VLA 路线还要经过语言、视觉语言、驾驶任务和强化优化几个阶段。多阶段训练是处理复杂度的工程方法,不该被误读成“系统不端到端”。梯度流比模型数量更接近真正的边界,但一段式常常分阶段训练,不代表每一步都全量联训。
还有一个常被忽略的重点:分布偏移和因果混淆,往往要先靠数据干预、对比学习和辅助约束来解决,PLUTO 就是这么做的。系统是不是一段式,替代不了对数据分布和因果捷径的治理。
两段式常见训练
先稳定接口,再优化规划器
- 感知模块独立收敛,输出缓存结果。
- 规划器基于感知输出或感知真值做模仿学习。
- 感知与规划联训这一步通常被省略。
- 强化学习集中在规划侧小步微调。
一段式常见训练
分阶段解冻,最终让规划目标回传
- 先完成 2D、3D、单帧和时序的感知预训练。
- 冻结上游,先让规划器学会基础驾驶。
- 调低上游学习率和辅助 loss 权重,再联合优化。
- 基础策略稳定后,再进入偏好或闭环强化阶段。
量产团队为什么不会只按理论上限选架构
两段式还有一个很少写进论文的组织解释:感知模块已经基本收敛,规则规控的数据驱动能力不足,感知和规划团队的协作方式也已经成型。所以更现实的迁移路径,是先把感知整合成一个 OneModel,再由规划团队建设学习式规划器,而不是一次性打散所有边界。
这条路径也有反面。两段式虽然便于分工,却可能出现“规划说感知太差、感知说规划太敏感”的互相推诿。组织边界塑造系统接口,系统接口又反过来强化组织边界,换一个网络名称,这种张力不会自动消失。接口可读有利于定位问题,但不代表责任边界自然合理:可解释性和团队协同,需要分别验收。
一段式追求更高的联合优化上限,但要求团队同时具备多任务训练、端到端数据闭环、闭环仿真、潜空间诊断和系统级安全验证的能力。缺少这些基础设施时,理论上的信息完整性,可能变成更长的定位周期和更难控制的回归风险。
所以量产路线常常不是永久的二选一,而是能力迁移的顺序:先让规划数据驱动化,再逐步缩短中间接口、增加特征旁路、保留可验证的辅助任务。“上限更高”和“先迁移哪一步”,是两个不同的问题。
- 存量资产:感知模型、标注体系、规则约束和回归工具是否已经成熟。
- 团队结构:感知、预测、规划和数据团队,能否共同承担跨模块的指标。
- 验证能力:是否具备反应式闭环、失效回放和潜空间诊断的手段。
- 算力预算:Dense BEV、时序缓存和多任务头,能否满足车端时延。
- 场景目标:当前瓶颈是感知接口、交互规划、舒适性,还是长尾恢复。
别停在二分法,系统其实是一条连续谱
Query 规划器还能细分成四种范式:直接规划、BEV 串行、BEV 并行和纯 Transformer。UniAD 用 Query 串起感知、预测和规划,任务关系清楚,但训练和效率承压;VAD 同样是顺序结构,只是任务更少、场景用矢量表示,并保留矢量化约束;BEV 并行的代表是 ParaDrive,干脆去掉了任务之间的连接;DriveTransformer 取消 Dense BEV,用稀疏的任务 Token 和时序记忆组织多任务。它们很难用一个“一段式”标签解释完。Query 本身只是信息槽位和交互机制,两段式的 PLUTO 和一段式的 VAD 都在用,它不能单独决定系统边界,还要看它读什么、输出什么、损失回到哪里。
经典规控提供了一条基线,用来判断这些方案是否真的覆盖了规划问题:它明确区分预测、行为决策、路径规划和轨迹优化,也暴露了横纵解耦在窄道会车这类场景里的失效边界。学习式系统即使合并了模块,也仍要证明自己处理了多模态预测、交互、动力学和时空联合约束。
更成熟的评审方式,是给方案画两张图:信息图和梯度图。每种输入经过哪些表示,哪些结果必须显式输出,哪些 Query 能彼此交互,哪些损失能更新哪些模块,部署时哪些规则仍在后处理里生效。画完这两张图,一段式还是两段式,通常就不再含糊。
- 画信息流标出图像、BEV 或图像特征、对象与地图 Query、导航、自车状态到轨迹的所有通路。
- 画梯度流标出规划 loss、感知 loss、约束 loss 和强化信号,分别能更新哪些模块。
- 列运行时接口确认哪些结构化结果是规划器必须等待的,哪些只是可视化或辅助监督。
- 列失效归因对感知错、导航跳变、交互误判、轨迹不可执行,分别定义定位手段。
- 在闭环中比较用相同的数据、算力、场景和安全边界比较,而不是只比单个开环 L2 指标。
把架构争论改写成可回答的问题
“我们要不要上一段式”这个问题太宽,通常只会得到立场。更好的问法是:当前最严重的信息瓶颈在哪里;它是否真的来自结构化接口;绕过接口之后,新增的能力能否在闭环里被测出来;出现回归时,团队有没有足够快的归因和回退路径。
如果目标是先把成熟的感知能力接进数据驱动的规划器,两段式可能是更可控的迁移方案。如果核心长尾来自标签体系表达不了的上下文,而且已经有稳定的多任务训练和闭环验证基础,一段式的特征旁路更值得投入。如果主要问题在交互轨迹生成或奖励偏好,先换规划器或训练目标,可能比重做整条感知链更直接。
最终的评审不该问哪一派更先进,而该记录:这次选择保留了什么、放弃了什么、用什么指标验证,以及在什么条件成熟后重新评估。架构是阶段性的判断,不是身份标签。
- 我们要绕过的具体信息瓶颈是什么,有没有失败样本支持?
- 中间的结构化输出,还继续承担哪些安全、可视化和回归职责?
- 规划损失回传上游之后,怎么防止感知任务掉点或训练振荡?
- 训练用的是感知真值、缓存输出,还是真实的在线输出,分布差异怎么覆盖?
- 车端时延、闭环仿真和问题定位工具,是否随架构一起升级?
- 如果新方案不达预期,能回退到哪一个稳定接口?
沿着主线继续
相关术语
- 端到端——让模型更直接地从传感器输入学到驾驶输出,减少中间环节的信息损失,但不等于取消工程约束。
- 两段式——第一段输出结构化世界(目标、车道线、交通灯),第二段基于它生成轨迹——用信息压缩换可解释和可控。
- 一段式——规划器除了结构化结果,还能直读上游的共享特征,规划损失能回传更新表征——上限更高,但难归因、难闭环验证。
- 潜空间——模型内部的压缩工作台:信息比结构化标签丰富,但人读不懂,所以出错难归因。
- 鸟瞰图表征——把多摄像头视角融合到统一的鸟瞰空间,降低对高精地图的依赖。
- 占据栅格——用空间中每一块「有没有被占据」来表达障碍,解决检测框只能识别规则形状物体的问题。
- Query 与候选轨迹——query 是模型内部「带槽位的探针」,proposal 才是解码后拿出来比较的候选结果。
- 导航路径——两段式方案里由模型预测的一条宏观参考线:只表达该往哪走,不是可执行轨迹,不能直接控车。
- 开环与闭环——开环用数据集里的真实下一状态,闭环用环境动力学产生下一状态——前者看不到误差累积,后者才检验纠错能力。
相关论文
- BEVFormer:用时空 Transformer 从多摄像头学 BEV 表征——BEV query 是空间探针
- Sparse4D:稀疏时空融合的多视角 3D 检测——稀疏 query 换效率
- PLUTO:把模仿学习规划推到极限——把 IL 做到极致,再谈 RL
- VAD:面向高效自动驾驶的向量化场景表示——黑盒与结构化之间的折中
- VADv2:通过概率规划实现端到端向量化自动驾驶——概率规划
- MOTR:基于 Transformer 的端到端多目标跟踪——track query 维持身份