跳转至

目标网络

DQN 使用参数固定一段时间的目标网络计算时序差分目标:

\[ y=r+\gamma\max_{a'}Q_{\theta^-}(s',a'). \]

在线网络 \(Q_\theta\) 持续训练,目标网络参数 \(\theta^-\) 周期性复制或缓慢跟随在线网络,从而减少“预测目标随每次更新同时移动”造成的不稳定。