会上可能听到:“这块决策我们按 POMDP 建模。——车上跑的是精确解,还是哪种近似?”
它到底是什么意思
MDP 求折扣累积奖励的期望最大:γ 管看多远,noise 管动作有多靠不住。它假设状态完全可测,驾驶里这条不成立:切入车的位置和速度测得到,它「打算」切入还是缩回去,测不到。
放松这一条就是 POMDP:手里只有置信,也就是对真实状态的概率分布。老虎问题每听一次花 1 分,说的是获取信息有代价;「低速探出」就像驾驶版的听一次。
难在求解:哪怕只有两个状态,置信也可以是 0 到 1 之间的任意值,没法逐个置信去算价值;到真实驾驶的规模,只能近似。有一种近似是把最可能的状态当真、按 MDP 规划:计算高效,但不会主动收集信息,不确定性高时容易失败。
机制图解
切入车会不会真的切进来
MDP当作测得到 · 策略:状态 → 动作
POMDP意图测不到,只有置信 · 策略:置信 → 动作 · 多看一帧,要付时间和路权
容易搞混的地方
常见误解
把预测给出的最可能意图当真,就算处理了不确定性
正确理解
那是按最可能的状态规划:不会主动收集信息,不确定性高时容易失败
常见误解
看得越清楚越好,没看清就不动
正确理解
获取信息有代价:驾驶里多等一帧,付的是时间和路权
看懂之后可以追问
- 我们是把预测给的最可能意图直接当真,还是保留了意图的概率分布?前者不会主动试探。切入车意图不明的时候,正是这类做法容易失败的时候。
- 「再等一帧看清楚」的代价,在我们的决策里是怎么算的?决策要在「多看」和「动手」之间权衡。这一项算轻了,车倾向多观望;算重了,车会在没看清时就动手。
沿着主线继续
先知道
- 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。
- 意图预测——先把「对方想去哪」离散成几个候选:哪条车道、哪个出口,再给每个候选打分;轨迹等意图定了再补。
接着看
- MPDM 与 EPSILON——预定义一小撮语义策略,对每个候选做闭环前向仿真、打分选优——把不可解的 POMDP 砍成「在有限集合里挑一个」。
- CVaR:尾部风险——期望值会拿大概率的顺畅稀释小概率的灾难;CVaR 放大最坏那部分尾巴的安全代价,α 决定尾巴取多宽,是风险容忍度的旋钮。