深入理解强化学习——马尔可夫决策过程：状态价值函数 - 代码天地

深入理解强化学习——马尔可夫决策过程：状态价值函数

企业开发 2023-12-16 19:18:34 阅读次数: 0

分类目录：《深入理解强化学习》总目录

我们用 $V^*(s)$ 表示在马尔可夫决策过程中基于策略 $\pi$ 的状态价值函数（State-value Function），定义为从状态 $s$ 出发遵循策略 $\pi$ 能获得的期望回报，数学表达为：
$V_\pi(s)=E_{\pi}[G_t|s_t=s]$

其中，期望基于我们采取的策略。当策略决定后，我们通过对策略进行采样来得到一个期望，计算出它的价值函数。

参考文献：
[1] 张伟楠, 沈键, 俞勇. 动手学强化学习[M]. 人民邮电出版社, 2022.
[2] Richard S. Sutton, Andrew G. Barto. 强化学习（第2版）[M]. 电子工业出版社, 2019
[3] Maxim Lapan. 深度强化学习实践（原书第2版）[M]. 北京华章图文信息有限公司, 2021
[4] 王琦, 杨毅远, 江季. Easy RL：强化学习教程 [M]. 人民邮电出版社, 2022

猜你喜欢

转载自blog.csdn.net/hy592070616/article/details/134538691

深入理解强化学习——马尔可夫决策过程：状态价值函数

深入理解强化学习——马尔可夫决策过程：动作价值函数

深入理解强化学习——马尔可夫决策过程：马尔可夫奖励过程-[计算马尔可夫奖励过程价值的动态规划方法]

深入理解强化学习——马尔可夫决策过程：价值迭代-[确认性价值迭代]

深入理解强化学习——马尔可夫决策过程：马尔可夫决策过程和马尔可夫过程/马尔可夫奖励过程的区别

深入理解强化学习——马尔可夫决策过程：价值迭代-[最优性原理]

深入理解强化学习——马尔可夫决策过程：过程控制

深入理解强化学习——马尔可夫决策过程：预测与控制

深入理解强化学习——马尔可夫决策过程：策略评估

深入理解强化学习——马尔可夫决策过程：占用度量-[代码实现]

深入理解强化学习——马尔可夫决策过程：策略

深入理解强化学习——马尔可夫决策过程：策略迭代-[基础知识]

深入理解强化学习——马尔可夫决策过程：动态规划方法

深入理解强化学习——马尔可夫决策过程：备份图（Backup Diagram）

深入理解强化学习——马尔可夫决策过程：策略迭代-[贝尔曼最优方程]

深入理解强化学习——马尔可夫决策过程：贝尔曼期望方程-[举例与代码实现]

深入理解强化学习——马尔可夫决策过程：贝尔曼期望方程-[基础知识]

深入理解强化学习——马尔可夫决策过程：占用度量-[基础知识]

深入理解强化学习——马尔可夫决策过程：蒙特卡洛方法-[代码实现]

深入理解强化学习——马尔可夫决策过程：蒙特卡洛方法-[基础知识]

【强化学习笔记】2 马尔可夫决策过程

强化学习（二）：马尔可夫决策过程

【强化学习】03 ——马尔可夫决策过程

1、强化学习---马尔可夫决策过程

从马尔可夫奖励过程到马尔可夫决策到强化学习【02/2】

RL - 强化学习马尔可夫决策过程 (MDP) 转换马尔可夫奖励过程 (MRP)

David Silver《强化学习RL》第二讲马尔可夫决策过程

重温强化学习之马尔可夫决策过程(MDPs)

David Silver强化学习Lecture2：马尔可夫决策过程

强化学习-MDP(马尔可夫决策过程)算法原理

今日推荐

美国拟限制 AI 大模型出口中国和俄罗斯

苹果将与 OpenAI 达成协议，将 ChatGPT 应用于 iPhone

openKylin 社区生态委员会第六次会议圆满召开

阿里云正式发布通义千问 2.5

Python 3.13 发布首个 Beta：实验性自由线程模式和 JIT、改进交互式解释器

Stack Overflow 拿我的代码去训练 AI 大模型，还封了我的账号

Pop!_OS 的 COSMIC 桌面完成 App Store 上架工作

报告：Django 仍然是 74% 开发者的首选

《2024 年一季度互联网投融资运行情况》研究报告

15 年前上了“FFmpeg 耻辱柱”，今天他还得谢谢咱——腾讯QQPlayer一雪前耻？

TIOBE 5 月榜单：Fortran “复活”进入 Top 10

GCC 14.1 发布

周排行

curl的POST请求，封装方法

8.1.1. Integer Types

Java基础 Day05(个人复习整理)

Python - Django - 中间件 process_exception

小L的试卷

【Shell编程】（函数）判断用户是否存在

python(css样式)

spring ant path 匹配原则 - 【笔记】

《JavaScript与JScript从入门到精通》(美)James.Jaworski.中译本.扫描版.pdf

Eclipse运行带参数的java程序

每日归档

更多

2024-05-12(0)

2024-05-11(38)

2024-05-10(38)

2024-05-09(35)

2024-05-08(42)

2024-05-07(14)

2024-05-06(40)

2024-05-05(0)

2024-05-04(7)

2024-05-03(19)