07-强化学习¶
对应课程讲义第七章;公开仓库不包含原讲义。
主线¶
本章研究智能体如何在与环境的持续交互中学习最优决策策略,核心路径分四步:
- 框架建立 — 强化学习的基本要素:智能体、环境、状态 \(S\)、动作 \(A\)、奖励 \(R\)、策略 \(\pi\),以及试错学习与延迟奖励的核心特性。
- 数学形式化 — MDP \((S, A, P, R, \gamma)\) 是强化学习的数学基础;状态价值函数 \(v_\pi(s)\) 和动作价值函数 \(q_\pi(s,a)\) 通过贝尔曼方程递归分解。
- 规划算法 — 动态规划在环境模型已知时求最优策略:策略迭代(评估 + 改进交替)和价值迭代(直接更新最优值函数)。
- 无模型方法 — Q-学习无需环境模型,通过时序差分直接学习动作价值函数;DQN 结合神经网络处理高维状态空间;多智能体强化学习扩展至多个智能体协同决策。
核心方程:贝尔曼最优方程 \(Q^*(s,a) = R(s,a) + \gamma\sum_{s'}P(s'\mid s,a)\max_{a'}Q^*(s',a')\),是 Q-学习迭代更新的理论依据。
关键概念¶
| 概念 | 一句话 |
|---|---|
| 强化学习 | 智能体通过试错从奖励信号中学习最优策略 |
| MDP | 强化学习的数学框架,\((S, A, P, R, \gamma)\) 五元组 |
| 贝尔曼方程 | 将值函数递归分解为即时奖励 + 折扣后继价值 |
| 策略迭代 | 策略评估与贪心策略改进交替进行,收敛到最优策略 |
| 价值迭代 | 直接更新最优值函数,每步合并评估与改进 |
| Q-学习 | 无模型、异策略,通过时序差分学习 \(Q(s,a)\) |
| DQN | 经验回放 + 目标网络,用神经网络逼近 \(Q\) 函数 |
关键方法¶
| 方法 | 意义 |
|---|---|
| 时序差分 (TD) | 用当前估计引导更新,无需等到回合结束;Q-学习的基础 |
| 经验回放 | 打破样本时序相关性,提升 DQN 训练稳定性 |
| 探索与利用 (\(\epsilon\)-greedy) | 以 \(\epsilon\) 概率随机探索,\((1-\epsilon)\) 概率利用当前最优 |