跳转至

贝尔曼期望方程

贝尔曼期望方程描述了在固定策略 \(\pi\) 下,MDP 的状态价值函数与动作价值函数所满足的递推关系。

状态价值函数的贝尔曼期望方程

\[ v_\pi(s) = \sum_{a \in A} \pi(a \mid s) \left( R_s^a + \gamma \sum_{s' \in S} P_{ss'}^a\, v_\pi(s') \right) \]

直觉:当前状态的价值 = 对所有可能动作取期望(按策略 \(\pi\) 加权),每个动作带来即时奖励加上后继状态的折扣价值。

动作价值函数的贝尔曼期望方程

\[ q_\pi(s, a) = R_s^a + \gamma \sum_{s' \in S} P_{ss'}^a \sum_{a' \in A} \pi(a' \mid s')\, q_\pi(s', a') \]

直觉:在状态 \(s\) 执行动作 \(a\) 的价值 = 即时奖励 + 转移到后继状态 \(s'\) 后,按策略 \(\pi\) 继续行动的期望价值。

两者的关系

\[ v_\pi(s) = \sum_{a \in A} \pi(a \mid s)\, q_\pi(s, a) \]
\[ q_\pi(s, a) = R_s^a + \gamma \sum_{s' \in S} P_{ss'}^a\, v_\pi(s') \]

将两式相互代入,即可分别得到只含 \(v_\pi\) 或只含 \(q_\pi\) 的递推形式。