跳转至

==多智能体强化学习研究多个智能体在同一环境中同时交互、学习行为策略的过程。==在多智能体场景下,每个智能体的行为会影响环境和其他智能体的决策,使得单个智能体观察到的环境呈现非平稳性。

常见形式是多智能体马尔可夫博弈:状态为 \(s\),联合动作为 \(\mathbf a=(a_1,\ldots,a_n)\),环境根据 \(P(s'\mid s,\mathbf a)\) 转移,并为每个智能体给出奖励 \(r_i\)。根据奖励关系,可以分为完全合作、完全竞争和混合场景。

多智能体学习的主要挑战

  • 非平稳性:对智能体 \(i\) 而言,其他智能体的策略也在更新,因此环境转移规律看起来不断变化。
  • 信用分配:团队只得到一个总奖励时,需要判断每个智能体的动作分别贡献了多少。
  • 联合动作爆炸:若每个智能体有 \(m\) 个动作,\(n\) 个智能体的联合动作空间大小为 \(m^n\)。
  • 部分可观察与通信:单个智能体通常只能看到局部信息,需要记忆、推断或显式通信。
  • 均衡选择:竞争或混合场景可能存在多个纳什均衡,学习过程不一定收敛到期望的均衡。

代表性算法与技术

  • 独立学习:每个智能体把其他智能体视为环境的一部分,独立运行 Q-learning 或策略梯度。实现简单,但非平稳性明显。
  • 值函数分解:在合作任务中,把团队价值 \(Q_{tot}\) 分解为各智能体局部价值。VDN 使用求和,QMIX 使用满足单调约束的混合网络。
  • 集中训练、分散执行(CTDE):训练时评论家可以访问全局状态和联合动作,执行时每个智能体只根据自己的局部观测行动。
  • 多智能体 Actor-Critic:每个智能体维护独立 Actor,同时借助集中式 Critic 估计价值,例如 MADDPG 一类方法。
方法 训练时信息 执行时信息 适用场景
独立 Q-learning 局部 局部 简单合作或弱交互
VDN / QMIX 全局团队信号 局部 离散动作、合作任务
集中式 Critic 全局状态与联合动作 局部 Actor 合作或混合任务

策略梯度的多智能体推导

在共享团队回报的合作场景中,联合策略可分解为:

\[ \pi_{\boldsymbol\theta}(\mathbf a\mid s) =\prod_{i=1}^n\pi_{\theta_i}(a_i\mid o_i). \]

对智能体 \(i\),策略梯度可以写为:

\[ \nabla_{\theta_i}J =\mathbb E\left[ \nabla_{\theta_i}\log\pi_{\theta_i}(a_i\mid o_i) A_i(s,\mathbf a) \right]. \]

\(A_i\) 是优势函数。若所有智能体直接共享同一个团队回报,梯度方差可能很大;集中式 Critic、反事实基线或值函数分解都可以提供更有针对性的信用信号。

生活化示例

考虑两个机器人合作搬运长桌:只有两者同时向同一方向移动,桌子才会前进并获得团队奖励。

  • 若各自独立学习,机器人 A 观察不到 B 的策略变化,会觉得同一动作的结果忽好忽坏;
  • 使用 CTDE 时,训练阶段的 Critic 同时观察两台机器人的动作,能判断失败来自方向不一致;
  • 部署时,两台机器人仍只依据各自传感器行动,满足分散执行要求。

这个例子同时体现了非平稳性、信用分配和协调问题。

小结

多智能体强化学习的核心并不是简单地“同时训练多个单智能体”,而是处理其他学习者带来的非平稳性,以及联合奖励下的协调与信用分配。合作任务中,CTDE 是连接全局训练信息与局部执行约束的常用框架。

自测

  1. 为什么其他智能体更新策略会破坏单智能体算法所假设的环境平稳性?
  2. CTDE 中哪些信息只能在训练阶段使用?
  3. 团队获得高回报时,为什么仍然需要解决信用分配问题?