作品简介
该书共14章,大致分为4个部分:第1部分介绍强化学习的基础知识,包括强化学习的定义,发展历程,以及要解决的问题。第2部分包括动态规划方法,蒙特卡罗方法,时间差分方法。第3部分通过集成多个基本算法,或者将值函数、策略做函数近似,第4部分使用强化学习解决两类博弈问题:完美信息博弈和不完美信息博弈。
出版时间2020-06-01
共 19 章
内容简介试读
彩插试读
序言试读
自序试读
前言试读
第1章 强化学习概述试读
第2章 马尔可夫决策过程
第3章 动态规划
第4章 蒙特卡罗
第5章 时序差分
第6章 资格迹
第7章 值函数逼近
第8章 随机策略梯度
第9章 Actor-Critic及变种
第10章 确定性策略梯度
第11章 学习与规划
第12章 探索与利用
第13章 博弈强化学习
参考文献

