TD Temporal-Difference Learning 时序差分法(差分学习)

temporary
英 ['temp(ə)rərɪ]美 [ˈtempəreri]
adj. 临时的,暂时的;短暂的

n. 临时工,临时雇
TD算法是RL的核心算法。TD是DP和MC算法的结合。Like DP, TD methods without waiting for a final outcome (they bootstrap)。

TD(0), or one-step TD

在这里插入图片描述
MC和TD算法的比较

Advantages of TD Prediction Methods

TD methods update their estimates based in part on other estimates. They learn a guess from a guess,they bootstrap.
在这里插入图片描述

Q-learning: Off-policy TD Control

在这里插入图片描述
在这里插入图片描述

猜你喜欢

转载自blog.csdn.net/weixin_41913844/article/details/83817480