强化学习笔记1--基础概念

强化学习笔记1--基础概念

1、智能体与环境交互的基本要素

状态(state, s∈S)
智能体在环境中所处的情形,是对当前环境的描述。

状态空间(state space, S)
所有可能状态的集合。

动作(action, a)
在某状态下智能体可以执行的操作。

动作空间(action space, A(s))
状态ss 下可采取的动作集合。注意:不同状态对应的动作空间可以不同

状态转移(state transition)
在当前状态 s 执行动作 a 后,环境转移到下一状态 s′ 的过程。
常用转移概率描述:

禁止区域(forbidden area)
环境中某些特殊状态,表现为:

无法进入(转移概率恒为 0);或

进入即受严惩(极大的负奖励),用来表示危险或约束。

奖励(reward, r)
智能体执行一个动作后,环境反馈的标量评价信号。一般正值表示鼓励,负值表示惩罚
奖励也是随机的,其概率为:

示例:p(r=1∣s1,a1)=1 表示在状态 s1 采取动作 a1​ 后,得到奖励 1 概率为100%。


2. 策略

策略(policy, π)
决定了智能体在每个状态下如何选择动作。是状态到动作概率分布的映射。

随机策略:π(a∣s) 表示在状态 s 下选择动作 a 的概率,满足

确定性策略可视为特殊情形,某个动作为 1,其余为 0。


3. 轨迹、回报与折扣回报

轨迹(trajectory)
智能体与环境交互产生的状态、动作、奖励序列,例如:

回报(return, Gt​)
从时刻 t 开始,之后获得的所有奖励的总和。
对于有限步任务,简单求和即可:

折扣回报(discounted return)
为平衡近期与远期奖励,引入折扣因子 γ∈[0,1):

γ 越接近 1,越重视长期奖励;γ 越小,越看重眼前。

注意:即时奖励 Rt+1不被折扣(即系数为 1),后续奖励才依次乘以 γ,γ²,…。

回合与持续性任务

回合(episode):交互序列自然终止的轨迹(如游戏结束)。这类问题称为回合式任务(episodic tasks)。

持续性任务(continuing tasks):没有终止时刻,交互无限进行(如机器人持续运行)。此时折扣回报必不可少,否则回报可能发散。


4. 马尔可夫决策过程(MDP)

马尔可夫决策过程是强化学习问题的数学框架,核心元素包括:

状态集合 S

动作集合(可依赖状态)A(s)

奖励分布 p(r∣s,a) 或奖励函数 R(s,a)

状态转移概率 p(s′∣s,a)

折扣因子 γ

策略 π(a∣s)

马尔可夫性质(Markov property):
下一状态与奖励的概率分布只依赖于当前状态和当前动作,与更早的历史无关: