Skip to main content

13 docs tagged with "RL"

View all tags

0. Intro

该分类创建于第一轮强化学习完结后

11. 强化学习方法分类总览

本页汇总本课程出现的方法。分类维度彼此独立:一个方法既可以是 model-free,也可以是 on-policy 或 off-policy。

3. Bellman Optimality Equation

上一篇讨论了固定策略 $\pi$ 的 Bellman 期望方程:给定策略后,可以计算它的状态价值 $v_\pi$。这一篇要解决更进一步的问题:在所有策略中,哪个策略最好,以及怎样计算它?

4. Iteration Methods

上一篇已经得到 Bellman 最优方程,并证明 Bellman 最优算子是压缩映射。这一篇讨论三种由此产生的动态规划算法:

5. Monte Carlo Estimation

动态规划假设环境模型 $p(s',r\mid s,a)$ 已知,因此可以直接计算期望。Monte Carlo(MC)方法走另一条路:不显式建立环境模型,而是通过真实采样得到的回报来估计期望。

6. Stochastic Gradient Descent

当期望或完整梯度难以直接计算时,可以用随机样本构造一个带噪声的估计,再通过小步迭代逐渐接近目标。Robbins–Monro 随机逼近描述了这种方法能够收敛所需的基本条件,SGD 则是它在优化中的典型应用。

7. Temporal-Difference Learning

Temporal-Difference(TD)学习同时吸收了动态规划和 Monte Carlo 的特点:它像 MC 一样不需要环境模型(Model-Free),又像动态规划一样使用已有价值估计进行自举(bootstrapping)。

8. Function Approximation

表格型方法为每个状态或状态—动作对单独保存一个数。当状态空间巨大、连续,或者观测本身是图像时,这种方法无法扩展。函数近似用参数向量 $\mathbf w$ 表示价值: