Reinforcement Learning 强化学习 / RL

“Reinforcement learning is learning what to do—how to map situations to actions—so as to maximize a numerical reward signal.”

强化学习是机器学习中研究”行动如何通过反馈变好”的分支。智能体在环境中按当前策略选择动作,环境返回新状态和数值奖励信号,学习目标是在长期交互中最大化期望回报。与监督学习不同,智能体不会被告知应该采取哪个动作,而必须通过亲身尝试来发现哪些动作能产生最多的奖励。

“These two characteristics—trial-and-error search and delayed reward—are the two most important distinguishing features of reinforcement learning.”

强化学习有两个最核心的特征。第一,试错搜索(trial-and-error search):环境不会直接告诉正确答案,智能体必须主动试探各种动作并从后果中学习。第二,延迟奖励(delayed reward):当前动作不仅影响即时奖励,还会影响后续的状态和奖励序列,因此不能只优化单步反馈,而必须考虑长期后果。

“Reinforcement learning … is simultaneously a problem, a class of solution methods that work well on the problem, and the field that studies this problem and its solution methods.”

强化学习同时指三个层面:问题、方法与研究领域。

  • 作为问题,它描述一个带目标的交互闭环——智能体-环境接口;
  • 作为方法,它包括价值估计、策略搜索、试错控制、基于模型的规划及这些机制的组合;
  • 作为领域,它研究这类问题及其解法的统计、优化、控制和认知基础。

数学形式化

“We formalize the problem of reinforcement learning using ideas from dynamical systems theory, specifically, as the optimal control of incompletely-known Markov decision processes.”

智能体与环境之间的交互按时间步展开:

强化学习的优化目标是最大化折扣回报:

其中 为折扣因子。在有限情形中,马尔可夫决策过程由以下要素刻画:

符号名称作用
状态空间描述智能体决策所依赖的环境状态或观测
合法动作集合描述状态 下可采取的行为
奖励集合描述一步反馈可能取到的数值奖励
一步动态核同时描述动作如何随机地产生下一状态和奖励
折扣因子控制未来奖励相对当前奖励的权重

章节索引

笔记按 Sutton & Barto《Reinforcement Learning: An Introduction》第二版的小节组织,位于 RL-Chapters/ 目录下。

Part I: 表格型方法

第 1 章 导论 → RL-Chapters/Ch01 导论/

第 2 章 多臂老虎机 → RL-Chapters/Ch02 多臂老虎机/

第 3 章 有限马尔可夫决策过程 → RL-Chapters/Ch03 有限马尔可夫决策过程/

第 4 章 动态规划 → RL-Chapters/Ch04 动态规划/

第 5 章 蒙特卡洛方法 → RL-Chapters/Ch05 蒙特卡洛方法/

第 6 章 时序差分学习 → RL-Chapters/Ch06 时序差分学习/

第 7 章 n步自举 → RL-Chapters/Ch07 n步自举/

第 8 章 规划与学习(表格型) → RL-Chapters/Ch08 规划与学习/

Part II: 近似方法

第 9 章 同策略预测与近似 → RL-Chapters/Ch09 同策略预测与近似/

第 10 章 同策略控制与近似 → RL-Chapters/Ch10 同策略控制与近似/

第 11 章 离策略方法与近似 → RL-Chapters/Ch11 离策略方法与近似/

第 12 章 资格迹 → RL-Chapters/Ch12 资格迹/

第 13 章 策略梯度方法 → RL-Chapters/Ch13 策略梯度方法/

Part III: 深入视角

第 14 章 心理学 → RL-Chapters/Ch14 心理学/

第 15 章 神经科学 → RL-Chapters/Ch15 神经科学/

第 16 章 应用与案例 → RL-Chapters/Ch16 应用与案例/

第 17 章 前沿 → RL-Chapters/Ch17 前沿/

主干依赖

强化学习的核心链条可以压缩为:

最基本的算法分野是:

维度典型问题代表方法
是否有模型动态核 是否已知动态规划、Dyna、模型学习
是否逐步更新回报是否必须等到 episode 结束蒙特卡洛方法、时序差分学习、n步自举
学习对象学价值函数、策略,还是二者结合Q-learning、Sarsa、策略梯度、Actor-Critic
表示能力表格、线性函数还是非线性网络表格型RL、线性函数近似、DQN
数据分布行为策略和目标策略是否相同on-policy、off-policy、重要性采样

参考资料