Deep Learning 最优化方法之Momentum（动量） - 代码天地

Deep Learning 最优化方法之Momentum（动量）

企业开发 2018-10-31 23:21:09 阅读次数: 0

版权声明：本文为博主原创文章，未经博主允许不得转载。 https://blog.csdn.net/BVL10101111/article/details/72615621

本文是Deep Learning 之最优化方法系列文章的Momentum（动量）方法。主要参考Deep Learning 一书。

整个优化系列文章列表：

Deep Learning 之最优化方法

Deep Learning 最优化方法之SGD

Deep Learning 最优化方法之Momentum（动量）

Deep Learning 最优化方法之Nesterov(牛顿动量)

Deep Learning 最优化方法之AdaGrad

Deep Learning 最优化方法之RMSProp

Deep Learning 最优化方法之Adam

先上结论：

1.动量方法主要是为了解决Hessian矩阵病态条件问题（直观上讲就是梯度高度敏感于参数空间的某些方向）的。

2.加速学习

3.一般将参数设为0.5,0.9，或者0.99，分别表示最大速度2倍，10倍，100倍于SGD的算法。

4.通过速度v，来积累了之间梯度指数级衰减的平均，并且继续延该方向移动：

再看看算法：
这里写图片描述

动量算法直观效果解释：

如图所示，红色为SGD+Momentum。黑色为SGD。可以看到黑色为典型Hessian矩阵病态的情况，相当于大幅度的徘徊着向最低点前进。
而由于动量积攒了历史的梯度，如点P前一刻的梯度与当前的梯度方向几乎相反。因此原本在P点原本要大幅徘徊的梯度，主要受到前一时刻的影响，而导致在当前时刻的梯度幅度减小。
直观上讲就是，要是当前时刻的梯度与历史时刻梯度方向相似，这种趋势在当前时刻则会加强；要是不同，则当前时刻的梯度方向减弱。

从另一个角度讲：

要是当前时刻的梯度与历史时刻梯度方向相似，这种趋势在当前时刻则会加强；要是不同，则当前时刻的梯度方向减弱。
假设每个时刻的梯度g总是类似，那么由我们可以直观的看到每次的步长为：

即当设为0.5,0.9，或者0.99，分别表示最大速度2倍，10倍，100倍于SGD的算法。

猜你喜欢

转载自blog.csdn.net/BVL10101111/article/details/72615621

Deep Learning 最优化方法之Momentum（动量）

Deep Learning 之最优化方法

Deep Learning 最优化方法之RMSProp

Deep Learning 最优化方法之AdaGrad

Deep Learning 最优化方法之Adam

Deep Learning 最优化方法

Deep learning：三十七(Deep learning中的优化方法)

干货|通俗易懂讲解Deep Learning 最优化方法之AdaGrad

Deep learning II - II Optimization algorithms - Gradient descent with momentum 动量梯度下降算法

Deep Learning

Deep Learning Specialization课程笔记——最优化算法

Deep Learning Specialization课程笔记——正则化和最优化

Deep Learning - Machine Learning

9、Tips for Deep Learning（深度学习优化）

Deep Learning快速学习方法

Deep Learning学习之CNN代码fenxi

论文学习之综述：《Deep learning》

Deep learning II - I Practical aspects of deep learning - other regularization methods 其他正则化方法

Machine learning/Deep Learning Resources

What is Machine Learning, Deep Learning and Structured Learning?

Important persons in deep learning

Deep Learning 1.1

Deep learning 1.3 作业

(花书) Deep Learning

Deep Learning综述[下]

Deep Learning 简介

deep Learning 合集

「Deep Learning」Note on ADADELTA

「Deep Learning」Note on Swish

「Deep Learning」Note on NADM

今日推荐

开源日报 | Chrome内置Gemini的意义不在于Gemini；中国AI追随之路的五大误区；ECharts创始人“下海”养鱼；谷歌I/O开发者大会什么都有，只是没有惊喜

微软回应中国区AI团队“打包赴美”传闻

基于大语言模型的开源知识库问答系统 MaxKB GitHub Star 数量突破 5,000 个！

美国拟限制 AI 大模型出口中国和俄罗斯

苹果将与 OpenAI 达成协议，将 ChatGPT 应用于 iPhone

openKylin 社区生态委员会第六次会议圆满召开

阿里云正式发布通义千问 2.5

Python 3.13 发布首个 Beta：实验性自由线程模式和 JIT、改进交互式解释器

Stack Overflow 拿我的代码去训练 AI 大模型，还封了我的账号

Pop!_OS 的 COSMIC 桌面完成 App Store 上架工作

《2024 年一季度互联网投融资运行情况》研究报告

报告：Django 仍然是 74% 开发者的首选

周排行

返回指定时间格式

fopen函数中的mode参数

Java 单例模式探讨

Flex remoteobject工作原理探讨

寻找mplayer的便捷安装方法

30天了解30种技术系列---(26)MySQL自动化运维工具Inception

关于Jboss/Tomcat/Jetty的JNDI定义123

程序减肥，strip，eu-strip 及其符号表

AsyncTask、View.post(Runnable)、ViewTreeObserver三种方式总结frame animation自动启动

Json和Bean的互相转换

每日归档

更多

2024-05-15(24)

2024-05-14(0)

2024-05-13(18)

2024-05-12(0)

2024-05-11(38)

2024-05-10(38)

2024-05-09(35)

2024-05-08(42)

2024-05-07(14)

2024-05-06(40)