跳转至

深度 Q 学习简介

Q 学习的局限性

传统的 Q 学习在面对庞大的连续状态空间时,表格存储方式不再适用,且直接使用神经网络估计 Q 函数会导致学习过程不稳定。

什么是深度 Q 学习

DQN 可以看作Q 学习与深度神经网络的结合,用神经网络近似 Q 函数,从而处理高维状态。图像输入常使用卷积神经网络。直接训练时,连续样本之间的相关性以及自举目标不断变化会导致学习不稳定;DQN 使用经验回放和目标网络分别缓解这两个问题。

深度 Q 学习的应用

深度 Q 学习的创新

经验回放

只能在与环境交互过程中产生的经验,包括状态、动作、奖励和下一状态四元组 \((s, a, r, s')\),被存储在一个称为经验池的数据结构中。每次更新策略时,从经验池中随机采样一小批经验,用于更新价值函数或策略。经验回放的优势包括数据复用、去相关性和平滑学习过程。

目标网络

DQN 采用双网络架构,包括主网络和目标网络。主网络负责实时更新参数并选择动作,而目标网络用语计算 Q 学习的目标值。目标网络的参数定期从主网络复制而来,而不是在每次迭代中更新。

深度 Q 学习的特点和扩展

DQN 的优缺点

  • 优点
    • 处理高维状态空间
    • 训练稳定性提升
  • 缺点
    • 仅支持离散动作空间
    • 样本效率低

DQN 的扩展