跳转至

07-强化学习

对应课程讲义第七章;公开仓库不包含原讲义。

前置知识:条件概率与期望、梯度优化,以及第二章的机器学习基本框架。

主线

本章研究智能体如何在与环境的持续交互中学习最优决策策略,核心路径分四步:

  1. 框架建立 — 强化学习的基本要素:智能体、环境、状态 \(S\)、动作 \(A\)、奖励 \(R\)、策略 \(\pi\),以及试错学习与延迟奖励的核心特性。
  2. 数学形式化 — MDP \((S, A, P, R, \gamma)\) 是强化学习的数学基础;状态价值函数 \(v_\pi(s)\) 和动作价值函数 \(q_\pi(s,a)\) 通过贝尔曼方程递归分解。
  3. 规划算法 — 动态规划在环境模型已知时求最优策略:策略迭代(评估 + 改进交替)和价值迭代(直接更新最优值函数)。
  4. 无模型方法 — Q-学习无需环境模型,通过时序差分直接学习动作价值函数;DQN 结合神经网络处理高维状态空间;多智能体强化学习扩展至多个智能体协同决策。

核心方程:贝尔曼最优方程 \(Q^*(s,a) = R(s,a) + \gamma\sum_{s'}P(s'\mid s,a)\max_{a'}Q^*(s',a')\),是 Q-学习迭代更新的理论依据。


关键概念

概念 一句话
强化学习 智能体通过试错从奖励信号中学习最优策略
MDP 强化学习的数学框架,\((S, A, P, R, \gamma)\) 五元组
贝尔曼方程 将值函数递归分解为即时奖励 + 折扣后继价值
策略迭代 策略评估与贪心策略改进交替进行,收敛到最优策略
价值迭代 直接更新最优值函数,每步合并评估与改进
Q-学习 无模型、异策略,通过时序差分学习 \(Q(s,a)\)
DQN 经验回放 + 目标网络,用神经网络逼近 \(Q\) 函数

关键方法

方法 意义
时序差分 (TD) 用当前估计引导更新,无需等到回合结束;Q-学习的基础
经验回放 打破样本时序相关性,提升 DQN 训练稳定性
探索与利用 (\(\epsilon\)-greedy) 以 \(\epsilon\) 概率随机探索,\((1-\epsilon)\) 概率利用当前最优