11. 强化学习方法分类总览
本页汇总本课程出现的方法。分类维度彼此独立:一个方法既可以是 model-free,也可以是 on-policy 或 off-policy。
1. 分类标准
- Model-based:已知或显式学习环境模型 ,并据此计算期望、规划或搜索。
- Model-free:不显式学习或调用该环境模型;直接从交互样本 学习价值函数或策略。
- On-policy:用于学习/改进的目标策略与产生数据的行为策略相同。
- Off-policy:数据可以由行为策略 产生,但学习的目标是另一策略 (通常为贪心策略)。
“模型”在此专指环境模型,不是价值函数近似器或神经网络。因此 DQN 等使用神经网络的方法仍然是 model-free。
2. 按课程章节归类
| 章节与内容 | 环境模型 | 策略关系 | 备注 |
|---|---|---|---|
| 1. Basic Concept | 不适用 | 不适用 | MDP 与价值函数的概念基础;并非具体学习算法。 |
| 2. Bellman Equation 的 Bellman 迭代求解 | Model-based | 不适用 | 直接对转移概率和奖励取期望,默认已知 MDP。 |
| 3. Bellman Optimality Equation 的 Value Iteration | Model-based | 不适用 | 动态规划(DP)规划方法。 |
| 4. Iteration Method:Value / Policy / Truncated Policy Iteration | Model-based | 不适用 | 都属于 DP,需要模型完成策略评估或 Bellman 更新。 |
| 5. Monte Carlo 的固定策略评估 | Model-free | On-policy | 用当前策略生成的完整 episode 回报评估该策略。 |
| MC Exploring Starts 控制 | Model-free | On-policy | 在当前策略数据上评估并贪心改进;Exploring Starts 是探索假设。 |
| MC -soft 控制 | Model-free | On-policy | 行为和被评估/改进的都是同一个 -soft 策略。 |
| 7. TD Learning 的 TD(0) 策略评估 | Model-free | On-policy | 从当前策略的单步样本自举评估该策略。 |
| Sarsa / Expected Sarsa / n-step Sarsa | Model-free | On-policy | target 使用当前策略实际采样的动作,或对该策略的动作取期望。 |
| Q-learning | Model-free | Off-policy | 行为策略可探索,target 始终采用下一状态的贪心动作。 |
| 8. Function Approximation 的 Gradient MC | Model-free | On-policy | 近似固定策略的价值函数。 |
| Semi-gradient TD(0) | Model-free | On-policy | 默认是对采样策略进行预测;是否 on/off-policy 取决于具体控制扩展。 |
| 带函数近似的 Sarsa | Model-free | On-policy | Sarsa 的策略关系不因使用函数近似而改变。 |
| 带函数近似的 Q-learning / DQN | Model-free | Off-policy | DQN 继承 Q-learning 的离策略目标;经验回放也适合该设定。 |
| 9. Policy Gradient 的 REINFORCE | Model-free | On-policy | 轨迹由正在优化的随机策略采样。 |
| 10. Actor-Critic 的 TD Actor-Critic | Model-free | On-policy | actor 按当前策略采样,critic 用 Sarsa 型 TD error 估计。 |
| Off-policy Actor-Critic(重要性采样校正) | Model-free | Off-policy | 用重要性采样将行为策略 的数据校正为目标策略 。 |
| Deterministic Policy Gradient | Model-free | 通常 Off-policy | 实践中通常用带探索噪声的行为策略收集数据、学习确定性目标策略。 |
| DreamerV3 | Model-based | 通常 Off-policy | 显式学习 latent dynamics、奖励与终止模型;从 replay state 出发,在模型中生成 imagined trajectories 来训练 actor 与 critic。 |
| 6. Stochastic Gradient Descent | 不适用 | 不适用 | 通用优化工具,不是 RL 算法。 |
3. 交叉速查
| On-policy | Off-policy | |
|---|---|---|
| Model-free | MC、TD(0)、Sarsa、Expected Sarsa、n-step Sarsa、Gradient MC、REINFORCE、标准 TD Actor-Critic | Q-learning、函数近似 Q-learning、DQN、带重要性采样的 Actor-Critic、通常的 DPG |
| Model-based | 本课程的 DP 方法不以此维度描述 | DreamerV3(通常如此使用) |
动态规划方法通常不通过“由哪一个行为策略采样数据”来更新:它们直接使用环境模型做全状态的期望备份。因此,对本课程中的 Value Iteration 和 Policy Iteration 标记为 on-policy/off-policy 并不合适。
4. 容易混淆的关系
- 自举不等于 model-based:TD、Sarsa、Q-learning 都会用下一状态的价值估计自举,但并没有预测环境会转移到哪里,因此依然是 model-free。
- 函数近似不决定 on/off-policy:线性函数或神经网络只改变价值/策略的表示方式;Sarsa 仍是 on-policy,DQN 仍是 off-policy。
- MC 与 TD 的主要区别不是 on/off-policy:二者都可构造 on-policy 或 off-policy 版本;本课程讲授的标准 MC 和 TD(0) 评估是 on-policy。它们的核心差异是 MC 使用完整回报,而 TD 使用自举 target。
5. 补充:为什么 DreamerV3 是 model-based
DreamerV3 不是在真实环境中逐步采样后直接更新策略;它先学习一个 latent world model。对 latent model state 与动作 ,该模型预测下一 latent state、奖励和是否继续:
训练 actor 和 critic 时,算法从 replay buffer 的真实状态出发,用当前 actor 选择动作,然后连续调用该模型滚动生成 imagined trajectory:
因此它能在不访问真实环境后续观测的情况下预测多步结果,并用 imagined rewards 构造 return、改进策略。这正是 model-based 的判据;模型处于 latent space 而非像素空间,并不改变这一点。
DreamerV3 也通常是 off-policy:world model 从 replay buffer 的数据学习,buffer 中的轨迹可由旧版本或带探索噪声的行为策略采集;当前 actor 则在这些状态上进行 imagined rollouts。详见 DreamerV3 笔记。