1. Basic Concept
State
Action
Policy
Policy 本质上是一个条件概率分布 通常写作
表示按照策略 行事时 在状态 下执行动作 的概率
Reward
Reward 是执行动作后获得的奖励。
Trajectory and Return
Trajectory 即轨迹
例如
Return 是沿一条轨迹收集到的所有奖励之和
Discounted Return and Rate
Discounted Rate
Discounted Return
Episode
定义解析
回合
当代理根据策略与环境交互时 可能会停留在某些终态上 由此产生的轨迹称为 episode
一个 episode 通常被认为是有限的 trajectory
Tasks with episodes are called episodic tasks.
然而 有些任务是没有 terminal states 的 意味着与环境的交互永远不会结束 这些任务叫做 continuing tasks
实际工程处理
现实中其实不存在这样一个 continuing task 我们通常在有限步骤后结束任务
Option A:
让目标状态奖励
数学上仍在继续任务 实际上已经结束
Option B:
目标点不代表结束 智能体达到后可以离开 再次进入仍可以得到
这门课采用第二种 不单独处理终止状态
马尔可夫决策过程(MDP)
MDP 的关键要素:
-
集合
- 状态: 状态集合记为
- 动作: 对于状态 ,与之关联的动作集合记为
- 奖励: 在状态 下执行动作 时,奖励集合记为
-
概率分布
- 状态转移概率: 在状态 下执行动作 后,转移到状态 的概率为 。
- 奖励概率: 在状态 下执行动作 后,获得奖励 的概率为
-
策略: 在状态 下选择动作 的概率为
状态转移
策略决定选择哪些动作,动作再通过环境模型决定状态转移和奖励
-
马尔可夫性质: 即无记忆性,下一时刻的状态和奖励只与当前状态及动作有关,而与更早的历史无关。
以上介绍的所有概念都可以统一到 MDP 的框架中。