贝尔曼期望方程¶
贝尔曼期望方程描述了在固定策略 \(\pi\) 下,MDP 的状态价值函数与动作价值函数所满足的递推关系。
状态价值函数的贝尔曼期望方程¶
\[
v_\pi(s) = \sum_{a \in A} \pi(a \mid s) \left( R_s^a + \gamma \sum_{s' \in S} P_{ss'}^a\, v_\pi(s') \right)
\]
直觉:当前状态的价值 = 对所有可能动作取期望(按策略 \(\pi\) 加权),每个动作带来即时奖励加上后继状态的折扣价值。
动作价值函数的贝尔曼期望方程¶
\[
q_\pi(s, a) = R_s^a + \gamma \sum_{s' \in S} P_{ss'}^a \sum_{a' \in A} \pi(a' \mid s')\, q_\pi(s', a')
\]
直觉:在状态 \(s\) 执行动作 \(a\) 的价值 = 即时奖励 + 转移到后继状态 \(s'\) 后,按策略 \(\pi\) 继续行动的期望价值。
两者的关系¶
\[
v_\pi(s) = \sum_{a \in A} \pi(a \mid s)\, q_\pi(s, a)
\]
\[
q_\pi(s, a) = R_s^a + \gamma \sum_{s' \in S} P_{ss'}^a\, v_\pi(s')
\]
将两式相互代入,即可分别得到只含 \(v_\pi\) 或只含 \(q_\pi\) 的递推形式。