会上可能听到:“我们是 BEV 无图方案。——BEV 解决了什么,无图又是什么意思?”
它到底是什么意思
技术路线上,2021 以前靠高精地图提供强先验;2022 年 BEV 解决多视角融合,让系统不必依赖预先采集的地图;2023 年 Occupancy 补上「不规则形状障碍物」;2024 年走向端到端;2025 年是 VLA。
把图像变成鸟瞰图有两条主流做法:一条先估每个像素的深度分布,把特征“抬”到三维再拍平到鸟瞰网格(LSS);另一条用一组 BEV query 表示鸟瞰空间,通过 spatial cross-attention 去各摄像头图像上采样,再用 temporal self-attention 融合历史帧,提升速度估计和动态感知(BEVFormer)。
机制图解
- 01多路摄像头各看一个方向
- 02视角转换按深度把特征抬到鸟瞰(LSS),或让鸟瞰 query 去图像上取信息(BEVFormer)
- 03时序融合叠加历史帧,估速度
- 04统一鸟瞰图供检测 / 地图 / 规划共用
容易搞混的地方
常见误解
无图方案完全不用地图
正确理解
通常是弱依赖:复杂路口、主辅路往往还留着 SD 级导航先验
常见误解
BEV 是一种传感器
正确理解
它是一种表征方式——把多个摄像头的画面融合到统一的鸟瞰坐标系里
看懂之后可以追问
- 无图方案在哪些场景下仍然需要地图先验兜底?「无图」通常是「弱依赖地图」。路口拓扑复杂、主辅路这类场景往往还留着 SD 级先验,问清楚才能排布测试范围。
- 时序融合用了几帧历史?摄像头被遮挡或者脏了的时候表现怎么退化?BEV 的动态感知能力很依赖时序融合。传感器退化下的表现决定了雨雪天和脏污场景的可用性。
沿着主线继续
接着看
相关论文
- BEVFormer:用时空 Transformer 从多摄像头学 BEV 表征——BEV query 是空间探针
- Sparse4D:稀疏时空融合的多视角 3D 检测——稀疏 query 换效率