策略迭代¶ 策略迭代交替执行两个步骤: 策略评估:计算当前策略 \(\pi\) 对应的价值函数 \(V^\pi\); 策略改进:对 \(V^\pi\) 做一步贪心选择,得到不差于原策略的新策略。 在有限 MDP 中反复迭代,最终会得到最优策略。