原文地址:

https://www.cnblogs.com/pinard/p/9669263.html

SRE实战 互联网时代守护先锋,助力企业售后服务体系运筹帷幄!一键直达领取阿里云限量特价优惠。

 

 

 

-----------------------------------------------------------------------------------------------------

 

 

        在强化学习(六)时序差分在线控制算法SARSA中我们讨论了时序差分的在线控制算法SARSA,而另一类时序差分的离线控制算法还没有讨论,因此本文我们关注于时序差分离线控制算法,主要是经典的Q-Learning算法。

 

    Q-Learning这一篇对应Sutton书的第六章部分和UCL强化学习课程的第五讲部分。

 

 

 

1. Q-Learning算法的引入    

 

扫码关注我们
微信号:SRE实战
拒绝背锅 运筹帷幄