强化学习莫凡python——一些补充 - 代码天地

强化学习莫凡python——一些补充

其他 2021-03-24 10:51:44 阅读次数: 0

1. RL分类

在这里插入图片描述

model-free方法：对环境不了解，每次行动只能等环境的反馈才可以进行下一步
model-based方法：由于已经对环境有一定的了解，所以每次在执行行动的时候可以预先想象到之后环境的反馈，来更好指导自己的决策。
对环境的了解主要体现在：环境的奖励、环境的一些状态转移概率，这些内容是否已知

在这里插入图片描述

基于概率的方法输出的是每个动作的概率，这时每个动作都有可能被选到
基于价值的方法输出的每个动作的价值，这时只会选到价值最大的动作

在这里插入图片描述

对于动作空间是连续值的场景来说，基于价值的方法是无能为力的，但是基于概率的方式却可以使用一个概率分布区进行描述，来选择一个动作

在这里插入图片描述

结合基于概率的方法和基于值的方法，可以得到一种更强大的方法：Actor-Critic
Actor使用概率来选择动作
Critic对actor做出的动作给出价值
这样就在原有的Policy Gradients基础上加入了学习过程

在这里插入图片描述

因为单步更新效率高，所以现在大多数方式都采用单步更新

在这里插入图片描述

在线学习就是要自己一边学习一边和环境交互
离线学习就是可以让别人学，然后自己可以找别的时间看着它学，不用一直自己边学边和环境交互。 决策过程和 学习优化决策的过程 是分开的

在这里插入图片描述

假设Q-learning的机器人天生是机器人，
$\gamma=1$ 的时候，就是给了它一副贼好的眼睛，所以它可以非常清晰看到所有未来步骤的奖赏
$\gamma=0$ 的时候，就是眼睛度数不合适，所以看不见未来，只能看到刚刚走的那步的奖励
$\gamma=[0\sim1]$ 时，就是上面的公式，越远的未来看的越不清楚，也就是未来的奖励衰减越来越大。

2. Q-learning

在这里插入图片描述
有一个实际值，有一个估计值（这点有点像监督学习），然后让估计/预测值不断靠近实际值，就可以得到一个很好的Q表。
然后再结合 $\epsilon$ greed策略去选择动作（策略是指导选取动作的）

3. Sarsa

在这里插入图片描述
Q_learning和Sarsa都是model_free的方法

4. Sara-lambda

在这里插入图片描述

Sarsa就是Sarsa(0)，是一种单步更新的方式，
Sarsa(1)属于回合更新，一次episode结束后，所有步都同等程度更新
Sarsa( $\lambda$ )中的这个 $\lambda$ 参数和之前的 $\gamma$ 有点像
- $\lambda$ 参数是更新程度的描述，越靠近终点（或者说要靠近奖励越大的地方），更新的幅度越大
- $\gamma$ 则是当前动作的价值的衰减因子，越远则价值越小。

5. DQN

在这里插入图片描述

6.Actor-Critic

在这里插入图片描述

在这里插入图片描述

猜你喜欢

转载自blog.csdn.net/Castlehe/article/details/112977724

强化学习莫凡python——一些补充

【强化学习】强化学习的一些基础理念【一】

强化学习入门推荐的一些文献

【RL】使用强化学习的一些建议

强化学习-Q_learnning 算法遇到得一些python函数问题

莫凡Python学习笔记一

《强化学习与最优控制》学习笔记（二）：强化学习与最优控制的一些术语对比

介绍强化学习(reinforcement learning)----一些基本概念

强化学习中的应该理解的一些关键概念（笔记）

莫烦Tensorflow——强化学习

强化学习一

莫凡python Tkinter 学习笔记

Python的一些进阶补充

关于Java学习的一些补充

莫凡Python 3

python进阶强化学习

python学强化学习

AI与Python - 强化学习

强化学习(一) 引入

强化学习入门（一）

强化学习(一)：简介

强化学习（一）——简介

强化学习（一）：概述

强化学习笔记（一）

强化学习通俗导论（一）：什么是强化学习

【强化学习篇】--强化学习案例详解一

强化学习系列（一）：强化学习简介

深度强化学习系列（一）：强化学习概述

强化学习系列课程（一）强化学习概论

强化学习(一)：简介——什么是强化学习？

今日推荐

火速冲上 GitHub 热榜 —— 开源编程语言、框架哪有这么可爱？

北京人形机器人创新中心发布全球首个纯电驱拟人奔跑的全尺寸人形机器人“天工”

LFOSSA 源来如此公开课 | 掌握云原生未来：CNCF 认证全面攻略与备考秘籍

国产云输入法——仅华为无云端数据上传安全问题

开源日报 | 工业开源项目OGG 1.0；姐姐，你要和我一起配置火狐吗；苹果AI遥遥落后？Fedora 40

开放签电子签章：停止新增，优化体验，前进更进（五一假期前工作）

周排行

Metasploit文件目录与入侵基本概念

跨域(CORS)请求问题[No 'Access-Control-Allow-Origin' header is present on the requested resource]常见解决方案

CodeIgniter 源码解读之 CodeIgniter.php（二）

SAS入门之（四）改变数据类型

初识元组

[数学建模]数学建模算法和模型（B站视频）（二）

Nginx 服务器源码安装配置流程

C#实现语音视频录制【基于MCapture + MFile】

开发进度4

下载安装vue的方法网址

每日归档

更多

2024-04-28(0)

2024-04-27(56)

2024-04-26(39)

2024-04-25(22)

2024-04-24(36)

2024-04-23(26)

2024-04-22(39)

2024-04-21(0)

2024-04-20(6)

2024-04-19(5)