← 术语图鉴

MPDM 与 EPSILON

Multipolicy Decision-Making / EPSILON · 也叫 多策略决策

预定义一小撮语义策略,对每个候选做闭环前向仿真、打分选优——把不可解的 POMDP 砍成「在有限集合里挑一个」。

会上可能听到:“决策层用的是 MPDM 那一套。——候选策略有几种?他车在仿真里怎么动?”

它到底是什么意思

MPDM 预定义车道保持、左右变道、停车等语义策略,假设自己和周围每辆车都在执行其中一种。对自车每个候选策略做闭环前向仿真,再按到终点的距离、车道偏好、最大角速度等加权打分。

EPSILON 先用 POMDP 把问题形式化,再从两侧砍。动作侧用 DCP-Tree:一个决策周期里最多换一次动作,反复的行为交给下一个重规划周期。观测侧只给有风险的车展开意图,并用前向仿真代替完整的置信更新。

推到头有三条天花板:意图组合会爆炸;他车模型终究是手写假设;没见过的场景组合给不出新答案。这三条就是端到端的动机。

机制图解

  1. 2015MPDM:有限策略 + 前向仿真语义策略逐个仿真,加权打分选优
  2. 2021EPSILON:先形式化,再两侧砍动作树一个周期最多换一次动作;只给有风险的车展开意图;仿真里嵌 RSS 兜底
  3. 后继MARC:场景树 + CVaR共享段对所有分支留余地,再放大最坏尾部的安全代价
每一代都在回答同一个问题:怎样把不可解的 POMDP 砍成可解。

容易搞混的地方

常见误解

一个周期最多换一次动作,车会反应迟钝

正确理解

砍掉的是同一周期里「变道、取消、再变道」的组合;需要反复的行为,交给下一个重规划周期

常见误解

前向仿真能还原他车对我的真实反应

正确理解

他车用基于模型的简单控制器,终究是手写的假设;复杂交互正是这条路线的天花板

看懂之后可以追问

  1. 候选策略集里有哪些策略?有没有场景是集合里根本没有对应策略的?有限集合是可解的前提,也是边界:集合外的行为,打分再准也选不出来。
  2. 车多、交互密的时候,意图组合怎么截断?组合爆炸是第一条天花板。「只给有风险的车展开意图」就是一种截断,「有风险」怎么判定值得评审。

先知道

  • MDP 与 POMDP——MDP 假设状态完全可测;POMDP 承认意图这类状态只能从观测里推,策略变成「置信 → 动作」——更贴近驾驶,但在真实规模上只能近似求解。
  • 意图预测——先把「对方想去哪」离散成几个候选:哪条车道、哪个出口,再给每个候选打分;轨迹等意图定了再补。

对比着看

  • 端到端——让模型更直接地从传感器输入学到驾驶输出,减少中间环节的信息损失,但不等于取消工程约束。

接着看

  • CVaR:尾部风险——期望值会拿大概率的顺畅稀释小概率的灾难;CVaR 放大最坏那部分尾巴的安全代价,α 决定尾巴取多宽,是风险容忍度的旋钮。
  • 时空语义走廊 SSC——沿决策层前向仿真的状态,在 s-l-t 空间里修一串相连的无碰撞立方体,再在这条走廊里铺轨迹——决策和规划在这里合龙。