Skip to main content

11. 强化学习方法分类总览

本页汇总本课程出现的方法。分类维度彼此独立:一个方法既可以是 model-free,也可以是 on-policy 或 off-policy。

1. 分类标准​

  • Model-based:已知或显式学习环境模型 p(s′,r∣s,a)p(s',r\mid s,a),并据此计算期望、规划或搜索。
  • Model-free:不显式学习或调用该环境模型;直接从交互样本 (s,a,r,s′)(s,a,r,s') 学习价值函数或策略。
  • On-policy:用于学习/改进的目标策略与产生数据的行为策略相同。
  • Off-policy:数据可以由行为策略 μ\mu 产生,但学习的目标是另一策略 π\pi(通常为贪心策略)。

“模型”在此专指环境模型,不是价值函数近似器或神经网络。因此 DQN 等使用神经网络的方法仍然是 model-free。

2. 按课程章节归类​

章节与内容环境模型策略关系备注
1. Basic Concept不适用不适用MDP 与价值函数的概念基础;并非具体学习算法。
2. Bellman Equation 的 Bellman 迭代求解Model-based不适用直接对转移概率和奖励取期望,默认已知 MDP。
3. Bellman Optimality Equation 的 Value IterationModel-based不适用动态规划(DP)规划方法。
4. Iteration Method:Value / Policy / Truncated Policy IterationModel-based不适用都属于 DP,需要模型完成策略评估或 Bellman 更新。
5. Monte Carlo 的固定策略评估Model-freeOn-policy用当前策略生成的完整 episode 回报评估该策略。
MC Exploring Starts 控制Model-freeOn-policy在当前策略数据上评估并贪心改进;Exploring Starts 是探索假设。
MC ε\varepsilon-soft 控制Model-freeOn-policy行为和被评估/改进的都是同一个 ε\varepsilon-soft 策略。
7. TD Learning 的 TD(0) 策略评估Model-freeOn-policy从当前策略的单步样本自举评估该策略。
Sarsa / Expected Sarsa / n-step SarsaModel-freeOn-policytarget 使用当前策略实际采样的动作,或对该策略的动作取期望。
Q-learningModel-freeOff-policy行为策略可探索,target 始终采用下一状态的贪心动作。
8. Function Approximation 的 Gradient MCModel-freeOn-policy近似固定策略的价值函数。
Semi-gradient TD(0)Model-freeOn-policy默认是对采样策略进行预测;是否 on/off-policy 取决于具体控制扩展。
带函数近似的 SarsaModel-freeOn-policySarsa 的策略关系不因使用函数近似而改变。
带函数近似的 Q-learning / DQNModel-freeOff-policyDQN 继承 Q-learning 的离策略目标;经验回放也适合该设定。
9. Policy Gradient 的 REINFORCEModel-freeOn-policy轨迹由正在优化的随机策略采样。
10. Actor-Critic 的 TD Actor-CriticModel-freeOn-policyactor 按当前策略采样,critic 用 Sarsa 型 TD error 估计。
Off-policy Actor-Critic(重要性采样校正)Model-freeOff-policy用重要性采样将行为策略 μ\mu 的数据校正为目标策略 π\pi。
Deterministic Policy GradientModel-free通常 Off-policy实践中通常用带探索噪声的行为策略收集数据、学习确定性目标策略。
DreamerV3Model-based通常 Off-policy显式学习 latent dynamics、奖励与终止模型;从 replay state 出发,在模型中生成 imagined trajectories 来训练 actor 与 critic。
6. Stochastic Gradient Descent不适用不适用通用优化工具,不是 RL 算法。

3. 交叉速查​

On-policyOff-policy
Model-freeMC、TD(0)、Sarsa、Expected Sarsa、n-step Sarsa、Gradient MC、REINFORCE、标准 TD Actor-CriticQ-learning、函数近似 Q-learning、DQN、带重要性采样的 Actor-Critic、通常的 DPG
Model-based本课程的 DP 方法不以此维度描述DreamerV3(通常如此使用)

动态规划方法通常不通过“由哪一个行为策略采样数据”来更新:它们直接使用环境模型做全状态的期望备份。因此,对本课程中的 Value Iteration 和 Policy Iteration 标记为 on-policy/off-policy 并不合适。

4. 容易混淆的关系​

  • 自举不等于 model-based:TD、Sarsa、Q-learning 都会用下一状态的价值估计自举,但并没有预测环境会转移到哪里,因此依然是 model-free。
  • 函数近似不决定 on/off-policy:线性函数或神经网络只改变价值/策略的表示方式;Sarsa 仍是 on-policy,DQN 仍是 off-policy。
  • MC 与 TD 的主要区别不是 on/off-policy:二者都可构造 on-policy 或 off-policy 版本;本课程讲授的标准 MC 和 TD(0) 评估是 on-policy。它们的核心差异是 MC 使用完整回报,而 TD 使用自举 target。

5. 补充:为什么 DreamerV3 是 model-based​

DreamerV3 不是在真实环境中逐步采样后直接更新策略;它先学习一个 latent world model。对 latent model state st=(ht,zt)s_t=(h_t,z_t) 与动作 ata_t,该模型预测下一 latent state、奖励和是否继续:

(st,at)⟶(s^t+1,r^t,c^t)(s_t,a_t) \longrightarrow (\hat{s}_{t+1},\hat r_t,\hat c_t)

训练 actor 和 critic 时,算法从 replay buffer 的真实状态出发,用当前 actor 选择动作,然后连续调用该模型滚动生成 imagined trajectory:

s0→πθa0⟶s^1,r^0,c^0→πθa1⟶s^2,r^1,c^1⟶⋯s_0 \xrightarrow{\pi_\theta} a_0 \longrightarrow \hat{s}_1,\hat r_0,\hat c_0 \xrightarrow{\pi_\theta} a_1 \longrightarrow \hat{s}_2,\hat r_1,\hat c_1 \longrightarrow \cdots

因此它能在不访问真实环境后续观测的情况下预测多步结果,并用 imagined rewards 构造 return、改进策略。这正是 model-based 的判据;模型处于 latent space 而非像素空间,并不改变这一点。

DreamerV3 也通常是 off-policy:world model 从 replay buffer 的数据学习,buffer 中的轨迹可由旧版本或带探索噪声的行为策略采集;当前 actor 则在这些状态上进行 imagined rollouts。详见 DreamerV3 笔记。