Reinforcement Learning 强化学习 / RL
“Reinforcement learning is learning what to do—how to map situations to actions—so as to maximize a numerical reward signal.”
强化学习是机器学习中研究”行动如何通过反馈变好”的分支。智能体在环境中按当前策略选择动作,环境返回新状态和数值奖励信号,学习目标是在长期交互中最大化期望回报。与监督学习不同,智能体不会被告知应该采取哪个动作,而必须通过亲身尝试来发现哪些动作能产生最多的奖励。
“These two characteristics—trial-and-error search and delayed reward—are the two most important distinguishing features of reinforcement learning.”
强化学习有两个最核心的特征。第一,试错搜索(trial-and-error search):环境不会直接告诉正确答案,智能体必须主动试探各种动作并从后果中学习。第二,延迟奖励(delayed reward):当前动作不仅影响即时奖励,还会影响后续的状态和奖励序列,因此不能只优化单步反馈,而必须考虑长期后果。
“Reinforcement learning … is simultaneously a problem, a class of solution methods that work well on the problem, and the field that studies this problem and its solution methods.”
强化学习同时指三个层面:问题、方法与研究领域。
- 作为问题,它描述一个带目标的交互闭环——智能体-环境接口;
- 作为方法,它包括价值估计、策略搜索、试错控制、基于模型的规划及这些机制的组合;
- 作为领域,它研究这类问题及其解法的统计、优化、控制和认知基础。
数学形式化
“We formalize the problem of reinforcement learning using ideas from dynamical systems theory, specifically, as the optimal control of incompletely-known Markov decision processes.”
智能体与环境之间的交互按时间步展开:
强化学习的优化目标是最大化折扣回报:
其中 为折扣因子。在有限情形中,马尔可夫决策过程由以下要素刻画:
| 符号 | 名称 | 作用 |
|---|---|---|
| 状态空间 | 描述智能体决策所依赖的环境状态或观测 | |
| 合法动作集合 | 描述状态 下可采取的行为 | |
| 奖励集合 | 描述一步反馈可能取到的数值奖励 | |
| 一步动态核 | 同时描述动作如何随机地产生下一状态和奖励 | |
| 折扣因子 | 控制未来奖励相对当前奖励的权重 |
章节索引
笔记按 Sutton & Barto《Reinforcement Learning: An Introduction》第二版的小节组织,位于 RL-Chapters/ 目录下。
Part I: 表格型方法
第 1 章 导论 → RL-Chapters/Ch01 导论/
第 2 章 多臂老虎机 → RL-Chapters/Ch02 多臂老虎机/
- 2.1 k 臂老虎机问题
- 2.2 动作价值方法
- 2.3 10臂测试床
- 2.4 增量实现
- 2.5 非平稳问题
- 2.6 乐观初始值
- 2.7 置信上界动作选择
- 2.8 梯度老虎机算法
- 2.9 关联搜索(上下文老虎机)
- 2.10 小结
第 3 章 有限马尔可夫决策过程 → RL-Chapters/Ch03 有限马尔可夫决策过程/
第 4 章 动态规划 → RL-Chapters/Ch04 动态规划/
第 5 章 蒙特卡洛方法 → RL-Chapters/Ch05 蒙特卡洛方法/
- 5.1 蒙特卡洛预测
- 5.2 蒙特卡洛动作价值估计
- 5.3 蒙特卡洛控制
- 5.4 同策略蒙特卡洛控制
- 5.5 离策略预测与重要性采样
- 5.6 增量实现
- 5.7 离策略蒙特卡洛控制
- 5.8 折扣感知重要性采样
- 5.9 逐决策重要性采样
- 5.10 小结
第 6 章 时序差分学习 → RL-Chapters/Ch06 时序差分学习/
- 6.1 TD预测
- 6.2 TD预测方法的优势
- 6.3 TD(0)的最优性
- 6.4 Sarsa 同策略TD控制
- 6.5 Q-learning 异策略TD控制
- 6.6 Expected Sarsa
- 6.7 最大化偏差与Double学习
- 6.8 博弈、后状态与其他特例
- 6.9 总结
第 7 章 n步自举 → RL-Chapters/Ch07 n步自举/
第 8 章 规划与学习(表格型) → RL-Chapters/Ch08 规划与学习/
- 8.1 模型与规划
- 8.2 Dyna:整合规划、行动与学习
- 8.3 当模型错误时
- 8.4 优先级扫描
- 8.5 期望更新与采样更新
- 8.6 轨迹采样
- 8.7 实时动态规划
- 8.8 决策时规划
- 8.9 启发式搜索
- 8.10 Rollout算法
- 8.11 蒙特卡洛树搜索
- 8.12 本章小结
- 8.13 Part I 总结:方法维度
Part II: 近似方法
第 9 章 同策略预测与近似 → RL-Chapters/Ch09 同策略预测与近似/
- 9.1 价值函数近似
- 9.2 预测目标VE
- 9.3 随机梯度与半梯度方法
- 9.4 线性方法
- 9.5 特征构造
- 9.6 步长参数的手动选择
- 9.7 非线性函数近似:人工神经网络
- 9.8 最小二乘TD
- 9.9 基于记忆的函数近似
- 9.10 基于核的函数近似
- 9.11 兴趣与强调
- 9.12 总结
第 10 章 同策略控制与近似 → RL-Chapters/Ch10 同策略控制与近似/
第 11 章 离策略方法与近似 → RL-Chapters/Ch11 离策略方法与近似/
- 11.1 离策略半梯度方法
- 11.2 离策略发散与Baird反例
- 11.3 致命三角
- 11.4 线性价值函数几何与投影Bellman方程
- 11.5 Bellman误差中的梯度下降
- 11.6 Bellman误差的不可学习性
- 11.7 梯度TD方法
- 11.8 Emphatic TD方法
- 11.9 方差缩减与资格迹扩展
- 11.10 总结
第 12 章 资格迹 → RL-Chapters/Ch12 资格迹/
- 12.1 lambda回报
- 12.2 TD(λ)
- 12.3 截断TD(λ)
- 12.4 在线lambda-return算法
- 12.5 True Online TD(λ)
- 12.6 Dutch迹
- 12.7 Sarsa(λ)
- 12.8 可变λ和γ
- 12.9 离策略资格迹
- 12.10 Watkins’s Q(λ)
- 12.11 稳定离策略资格迹
- 12.12 资格迹实现
- 12.13 资格迹方法总结
第 13 章 策略梯度方法 → RL-Chapters/Ch13 策略梯度方法/
- 13.1 策略近似及其优势
- 13.2 策略梯度定理
- 13.3 REINFORCE
- 13.4 REINFORCE with Baseline
- 13.5 Actor-Critic方法
- 13.6 持续任务的策略梯度
- 13.7 连续动作的策略参数化
- 13.8 总结
Part III: 深入视角
第 14 章 心理学 → RL-Chapters/Ch14 心理学/
第 15 章 神经科学 → RL-Chapters/Ch15 神经科学/
- 15.1 神经科学基础
- 15.2 奖励信号与预测误差
- 15.3 奖励预测误差假说
- 15.4 多巴胺
- 15.5 奖励预测误差假说的实验支持
- 15.6 TD误差与多巴胺的对应关系
- 15.7 神经Actor-Critic
- 15.8 Actor与Critic学习规则
- 15.9 享乐神经元
- 15.10 集体强化学习
- 15.11 大脑中的模型学习方法
- 15.12 成瘾
- 15.13 总结
第 16 章 应用与案例 → RL-Chapters/Ch16 应用与案例/
- 16.1 TD-Gammon
- 16.2 Samuel跳棋程序
- 16.3 Watson下注策略
- 16.4 内存控制优化
- 16.5 Atari强化学习
- 16.6 AlphaGo
- 16.7 Web服务强化学习
- 16.8 热气流滑翔
第 17 章 前沿 → RL-Chapters/Ch17 前沿/
主干依赖
强化学习的核心链条可以压缩为:
最基本的算法分野是:
| 维度 | 典型问题 | 代表方法 |
|---|---|---|
| 是否有模型 | 动态核 是否已知 | 动态规划、Dyna、模型学习 |
| 是否逐步更新 | 回报是否必须等到 episode 结束 | 蒙特卡洛方法、时序差分学习、n步自举 |
| 学习对象 | 学价值函数、策略,还是二者结合 | Q-learning、Sarsa、策略梯度、Actor-Critic |
| 表示能力 | 表格、线性函数还是非线性网络 | 表格型RL、线性函数近似、DQN |
| 数据分布 | 行为策略和目标策略是否相同 | on-policy、off-policy、重要性采样 |
参考资料
- Richard S. Sutton and Andrew G. Barto. Reinforcement Learning: An Introduction. Second Edition.
- http://incompleteideas.net/book/the-book-2nd.html
- https://github.com/MathFoundationRL/Book-Mathematical-Foundation-of-Reinforcement-Learning