会上可能听到:“一段式上限更高。——上限高在哪?我们为什么还不敢上?”
它到底是什么意思
它不一定取消感知头、地图头这些辅助任务。关键在规划器多了一条直读上游特征的通路:结构化结果从“唯一通道”变成“辅助通道”,规划损失也能穿过去更新共享表征,让网络自己决定哪些信息对规划最重要。
优点是信息不过早离散化、能避免 perception-induced planning failure(中间检测不完美但最终轨迹仍可能对)、也更自然地接世界模型、VLA 和大规模数据。
代价是:输出错了很难判断错在检测、地图、交互预测还是规划策略;多任务联训相互干扰;闭环仿真容易出现轨迹抖动、连续偏差发散;量产验证链路更长。
重要的是:一段式和两段式不是二选一,而是一条连续谱。VAD 这类一段式工作,用向量化的 agent/map token 保留了部分显式结构,在谱上离两段式更近。
机制图解
同样的传感器输入,两种走法
两段式规划器只读结构化结果(框/线/灯,人能看懂),梯度到这一层为止
一段式规划器还能直读上游特征,结构化结果只当辅助,梯度能回传到表征
容易搞混的地方
常见误解
一段式是完全黑盒
正确理解
VAD/VADv2 这类工作证明可以保留向量化结构和概率规划约束
常见误解
一段式和两段式二选一
正确理解
是连续谱。读方案时要问:规划器必须经过哪些结构化接口,规划损失能回传到哪里
看懂之后可以追问
- 我们保留了哪些显式的中间输出?哪些约束还是硬编码的?纯黑盒的一段式在量产上验证链路极长。能说出保留了哪些可评测中间结构,说明团队想清楚了验收路径。
- 闭环仿真里出现轨迹抖动或者发散时,我们怎么定位?这是一段式最典型的失败模式。没有答案意味着上线后会用真车去试错。
- 多任务联训现在有相互干扰吗?哪个任务在被牺牲?联训不稳定是一段式的固有成本,通常某个子任务的指标在悄悄退化。
沿着主线继续
先知道
对比着看
- 两段式——第一段输出结构化世界(目标、车道线、交通灯),第二段基于它生成轨迹——用信息压缩换可解释和可控。
接着看
- 视觉-语言-动作模型——把视觉输入、语言/语义桥接和动作输出统一到一个多模态框架,适合更高层的意图和语义条件化。
相关论文
- VAD:面向高效自动驾驶的向量化场景表示——黑盒与结构化之间的折中
- VADv2:通过概率规划实现端到端向量化自动驾驶——概率规划