强化学习入门:从 MDP 到 Actor-Critic

REINFORCEMENT LEARNING / INTRODUCTION

强化学习研究的是一个序列决策问题:智能体不断观察环境、选择动作、获得反馈,并据此改进策略。与有标准答案的监督学习不同,强化学习通常只知道一次行为带来了多少奖励。

智能体—环境循环

Agent根据状态选择动作 aₜ
action →
← state, reward
Environment转移到新状态 sₜ₊₁,并返回奖励 rₜ

监督学习关心“这个样本的正确标签是什么”;强化学习关心“现在采取什么动作,才能让未来的累计回报更高”。一个动作的价值可能要经过很多步才显现,这就是信用分配问题。

用 MDP 描述任务

马尔可夫决策过程(Markov Decision Process,MDP)通常写成五元组:

M = (S, A, P, R, γ)
  • S:状态空间,描述智能体当前掌握的环境信息。
  • A:动作空间,智能体可以执行的选择。
  • P:状态转移概率 P(s'|s,a)
  • R:奖励函数,定义局部反馈。
  • γ:折扣因子,控制当前奖励与长期奖励的权衡。

马尔可夫性意味着:在状态定义充分的前提下,下一时刻只依赖当前状态和动作,而不需要完整历史。实际任务往往只能得到部分观测,此时问题会扩展为 POMDP。

回报、策略与优化目标

从时刻 t 开始的折扣回报定义为:

Gₜ = rₜ + γrₜ₊₁ + γ²rₜ₊₂ + …

策略 π(a|s) 给出在状态 s 下选择动作 a 的概率。强化学习的目标,是找到能够最大化期望累计回报的策略。

奖励不是目标本身。

奖励只是我们写给智能体的目标代理。如果奖励设计遗漏了约束,智能体可能找到高奖励但不符合真实意图的行为,即常说的 reward hacking。

价值函数与 Bellman 递推

状态价值 Vπ(s) 表示从状态 s 出发、之后遵循策略 π 时的期望回报;动作价值 Qπ(s,a) 还额外指定了第一步动作。

Qπ(s,a) = E[rₜ + γ Vπ(sₜ₊₁) | sₜ=s, aₜ=a]

Bellman 方程把一个长期问题拆成“当前奖励 + 下一状态的价值”。动态规划、时序差分学习和许多深度强化学习算法,都建立在这种递推关系上。

三条主要算法路线

01

Value-based

学习状态或动作价值,再选择价值最大的动作。代表方法:Q-learning、DQN。

02

Policy-based

直接参数化策略并对期望回报求梯度。代表方法:REINFORCE、PPO。

03

Actor-Critic

Actor 更新策略,Critic 评估动作,把前两条路线结合起来。代表方法:A2C、SAC、DDPG。

路线优势典型限制
Value-based样本利用率较高,离散动作直观难以直接处理连续动作
Policy-based适合随机策略与连续动作梯度方差较大,训练可能不稳定
Actor-Critic兼顾策略表达和价值估计组件更多,偏差与稳定性需要权衡

一个具体例子:Q-learning

Q-learning 使用交互数据迭代更新动作价值:

Q(s,a) ← Q(s,a) + α[r + γ maxₐ'Q(s',a') − Q(s,a)]

方括号中的部分叫 TD Error:当前估计与一步之后目标之间的差。表格型 Q-learning 直接维护每个状态—动作对的数值;DQN 则用神经网络近似 Q 函数,并引入经验回放与目标网络缓解训练不稳定。

Q-learning 是 off-policy 方法,因为更新目标使用“下一步最大价值动作”,不要求它就是采样数据时真正执行的动作;Sarsa 则使用实际执行的下一动作进行更新,是典型 on-policy 方法。

直接优化策略

策略梯度不先求出最优动作价值表,而是调整策略参数 θ,提高高回报动作出现的概率:

∇θ J(θ) = E[∇θ log πθ(a|s) · A(s,a)]

A(s,a) 是优势函数,表示某个动作相比当前状态的平均水平好多少。Critic 负责估计价值或优势,Actor 根据这个信号更新策略。PPO 进一步限制单次策略更新幅度,是目前较常用且相对稳定的策略优化算法。

探索与利用

如果只选择当前认为最好的动作,智能体可能永远发现不了更优路线;如果一直随机探索,又无法稳定获得收益。常见方法包括 ε-greedy、熵正则化、参数噪声与基于不确定性的探索。

稀疏奖励环境尤其困难:智能体可能在很长时间内得不到任何有效反馈。奖励塑形、模仿学习、课程学习和世界模型都可以改善这个问题,但也会引入新的偏差。

强化学习与大语言模型

在 LLM 中,模型生成的 Token 序列可以看作动作,已有文本是状态,偏好模型或可验证结果提供奖励。RLHF、PPO、GRPO 等方法用强化学习信号调整生成策略。

但语言模型的动作空间巨大、序列很长,奖励也常常不完整。如何可靠评估中间步骤、减少奖励投机,并让模型在真实工具环境中学习,是 Agentic RL 的核心难点。

建议的学习顺序

  1. 先理解 MDP、回报、策略、状态价值与动作价值。
  2. 在 GridWorld 中手写动态规划、蒙特卡洛、Sarsa 和 Q-learning。
  3. 理解函数近似后实现 DQN,观察经验回放和目标网络的作用。
  4. 学习策略梯度与 Actor-Critic,再进入 PPO、SAC 等算法。
  5. 最后研究离线强化学习、模仿学习、世界模型或 Agentic RL。

参考资料

本文主要参考 Datawhale 的 Easy-RL(蘑菇书) 与其 GitHub 仓库,按概念地图重新组织。Easy-RL 还包含 DQN、PPO、DDPG、模仿学习等章节与配套代码,适合继续系统学习。