跳转至

价值迭代

价值迭代反复应用贝尔曼最优算子:

\[ V_{k+1}(s)=\max_a\sum_{s'}P(s'\mid s,a)\left[R(s,a,s')+\gamma V_k(s')\right]. \]

收敛后,从 \(V^*\) 对每个状态执行一步贪心选择即可得到最优策略。它要求已知环境的状态转移概率和奖励模型。