REINFORCEMENT LEARNING / INTRODUCTION
强化学习研究的是一个序列决策问题:智能体不断观察环境、选择动作、获得反馈,并据此改进策略。与有标准答案的监督学习不同,强化学习通常只知道一次行为带来了多少奖励。
智能体—环境循环
← state, reward
监督学习关心“这个样本的正确标签是什么”;强化学习关心“现在采取什么动作,才能让未来的累计回报更高”。一个动作的价值可能要经过很多步才显现,这就是信用分配问题。
用 MDP 描述任务
马尔可夫决策过程(Markov Decision Process,MDP)通常写成五元组:
- S:状态空间,描述智能体当前掌握的环境信息。
- A:动作空间,智能体可以执行的选择。
- P:状态转移概率
P(s'|s,a)。 - R:奖励函数,定义局部反馈。
- γ:折扣因子,控制当前奖励与长期奖励的权衡。
马尔可夫性意味着:在状态定义充分的前提下,下一时刻只依赖当前状态和动作,而不需要完整历史。实际任务往往只能得到部分观测,此时问题会扩展为 POMDP。
回报、策略与优化目标
从时刻 t 开始的折扣回报定义为:
策略 π(a|s) 给出在状态 s 下选择动作 a 的概率。强化学习的目标,是找到能够最大化期望累计回报的策略。
奖励只是我们写给智能体的目标代理。如果奖励设计遗漏了约束,智能体可能找到高奖励但不符合真实意图的行为,即常说的 reward hacking。
价值函数与 Bellman 递推
状态价值 Vπ(s) 表示从状态 s 出发、之后遵循策略 π 时的期望回报;动作价值 Qπ(s,a) 还额外指定了第一步动作。
Bellman 方程把一个长期问题拆成“当前奖励 + 下一状态的价值”。动态规划、时序差分学习和许多深度强化学习算法,都建立在这种递推关系上。
三条主要算法路线
Value-based
学习状态或动作价值,再选择价值最大的动作。代表方法:Q-learning、DQN。
Policy-based
直接参数化策略并对期望回报求梯度。代表方法:REINFORCE、PPO。
Actor-Critic
Actor 更新策略,Critic 评估动作,把前两条路线结合起来。代表方法:A2C、SAC、DDPG。
| 路线 | 优势 | 典型限制 |
|---|---|---|
| Value-based | 样本利用率较高,离散动作直观 | 难以直接处理连续动作 |
| Policy-based | 适合随机策略与连续动作 | 梯度方差较大,训练可能不稳定 |
| Actor-Critic | 兼顾策略表达和价值估计 | 组件更多,偏差与稳定性需要权衡 |
一个具体例子:Q-learning
Q-learning 使用交互数据迭代更新动作价值:
方括号中的部分叫 TD Error:当前估计与一步之后目标之间的差。表格型 Q-learning 直接维护每个状态—动作对的数值;DQN 则用神经网络近似 Q 函数,并引入经验回放与目标网络缓解训练不稳定。
Q-learning 是 off-policy 方法,因为更新目标使用“下一步最大价值动作”,不要求它就是采样数据时真正执行的动作;Sarsa 则使用实际执行的下一动作进行更新,是典型 on-policy 方法。
直接优化策略
策略梯度不先求出最优动作价值表,而是调整策略参数 θ,提高高回报动作出现的概率:
A(s,a) 是优势函数,表示某个动作相比当前状态的平均水平好多少。Critic 负责估计价值或优势,Actor 根据这个信号更新策略。PPO 进一步限制单次策略更新幅度,是目前较常用且相对稳定的策略优化算法。
探索与利用
如果只选择当前认为最好的动作,智能体可能永远发现不了更优路线;如果一直随机探索,又无法稳定获得收益。常见方法包括 ε-greedy、熵正则化、参数噪声与基于不确定性的探索。
稀疏奖励环境尤其困难:智能体可能在很长时间内得不到任何有效反馈。奖励塑形、模仿学习、课程学习和世界模型都可以改善这个问题,但也会引入新的偏差。
强化学习与大语言模型
在 LLM 中,模型生成的 Token 序列可以看作动作,已有文本是状态,偏好模型或可验证结果提供奖励。RLHF、PPO、GRPO 等方法用强化学习信号调整生成策略。
但语言模型的动作空间巨大、序列很长,奖励也常常不完整。如何可靠评估中间步骤、减少奖励投机,并让模型在真实工具环境中学习,是 Agentic RL 的核心难点。
建议的学习顺序
- 先理解 MDP、回报、策略、状态价值与动作价值。
- 在 GridWorld 中手写动态规划、蒙特卡洛、Sarsa 和 Q-learning。
- 理解函数近似后实现 DQN,观察经验回放和目标网络的作用。
- 学习策略梯度与 Actor-Critic,再进入 PPO、SAC 等算法。
- 最后研究离线强化学习、模仿学习、世界模型或 Agentic RL。
参考资料
本文主要参考 Datawhale 的 Easy-RL(蘑菇书) 与其 GitHub 仓库,按概念地图重新组织。Easy-RL 还包含 DQN、PPO、DDPG、模仿学习等章节与配套代码,适合继续系统学习。