跳转至

策略迭代

策略迭代交替执行两个步骤:

  1. 策略评估:计算当前策略 \(\pi\) 对应的价值函数 \(V^\pi\);
  2. 策略改进:对 \(V^\pi\) 做一步贪心选择,得到不差于原策略的新策略。

在有限 MDP 中反复迭代,最终会得到最优策略。