Skip to main content

1. Basic Concept

State​

S={si}i=1nS = \{s_i\}_{i=1}^{n}

Action​

A={ai}i=1mA = \{a_i\}_{i=1}^{m}

Policy​

π\pi

Policy 本质上是一个条件概率分布 通常写作 π(ai∣sj)\pi(a_i \mid s_j)

表示按照策略 π\pi 行事时 在状态 sjs_j 下执行动作 aia_i 的概率

Reward​

R(s,a)R(s, a)

Reward 是执行动作后获得的奖励。

Trajectory and Return​

Trajectory 即轨迹

例如

s5→r=0a3s8→r=−1a1s8→r=5a0s3s_5 \xrightarrow[r=0]{a_3} s_8 \xrightarrow[r=-1]{a_1} s_8 \xrightarrow[r=5]{a_0} s_3

Return 是沿一条轨迹收集到的所有奖励之和

Discounted Return and Rate​

Discounted Rate​

γ∈[0,1)\gamma \in [0,1)

Discounted Return​

r0+γr1+γ2r2+γ3r4…r_0 + \gamma r_1 + \gamma ^2 r_2 + \gamma ^3 r_4\dots

Episode​

定义解析​

回合

当代理根据策略与环境交互时 可能会停留在某些终态上 由此产生的轨迹称为 episode

一个 episode 通常被认为是有限的 trajectory

Tasks with episodes are called episodic tasks.

然而 有些任务是没有 terminal states 的 意味着与环境的交互永远不会结束 这些任务叫做 continuing tasks

实际工程处理​

现实中其实不存在这样一个 continuing task 我们通常在有限步骤后结束任务

Option A:​

让目标状态奖励 r=0r=0

数学上仍在继续任务 实际上已经结束

Option B:​

目标点不代表结束 智能体达到后可以离开 再次进入仍可以得到 r=+1r = +1

这门课采用第二种 不单独处理终止状态

马尔可夫决策过程(MDP)​

MDP 的关键要素:

  • 集合

    • 状态: 状态集合记为 SS
    • 动作: 对于状态 s∈Ss \in S,与之关联的动作集合记为 A(s)A(s)
    • 奖励: 在状态 ss 下执行动作 aa 时,奖励集合记为 R(s,a)R(s,a)
  • 概率分布

    • 状态转移概率: 在状态 ss 下执行动作 aa 后,转移到状态 s′s' 的概率为 p(s′∣s,a)p(s' \mid s,a)。
    • 奖励概率: 在状态 ss 下执行动作 aa 后,获得奖励 rr 的概率为 p(r∣s,a)p(r \mid s,a)
  • 策略: 在状态 ss 下选择动作 aa 的概率为 π(a∣s)\pi(a \mid s)

    状态转移

    pπ(s′,r∣s)=∑aπ(a∣s)p(s′,r∣s,a)p_\pi(s',r \mid s) = \sum_a \pi(a \mid s) p(s',r \mid s, a)

    策略决定选择哪些动作,动作再通过环境模型决定状态转移和奖励

  • 马尔可夫性质: 即无记忆性,下一时刻的状态和奖励只与当前状态及动作有关,而与更早的历史无关。

p(st+1∣at+1,st,…,a1,s0)=p(st+1∣at+1,st),p(rt+1∣at+1,st,…,a1,s0)=p(rt+1∣at+1,st).\begin{aligned} p(s_{t+1} \mid a_{t+1}, s_t, \ldots, a_1, s_0) &= p(s_{t+1} \mid a_{t+1}, s_t), \\ p(r_{t+1} \mid a_{t+1}, s_t, \ldots, a_1, s_0) &= p(r_{t+1} \mid a_{t+1}, s_t). \end{aligned}

以上介绍的所有概念都可以统一到 MDP 的框架中。