【王树森】深度强化学习(DRL)课程笔记:P2 价值学习

Value-Based RL

在这里插入图片描述

试图找出能预测最优action的Q*函数

Deep Q Network(DQN)

在这里插入图片描述

Temporal Difference(TD) Learning

Example

在这里插入图片描述
如果在只到半路DC能不能更新模型?
在这里插入图片描述
TD在这种情况下也可以学习的原因
在这里插入图片描述

TD learning for DQN

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
使用TD Learning 训练 DQN
在这里插入图片描述

Summary

在这里插入图片描述
在这里插入图片描述

猜你喜欢

转载自blog.csdn.net/qin_liang/article/details/132187378