正则化参数等价于对参数引入
先验分布,使得
模型复杂度 变小(缩小解空间),对于噪声以及 outliers 的鲁棒性增强(泛化能力)。整个最优化问题从贝叶斯观点来看是一种贝叶斯最大后验估计,其中 正则化项 对应后验估计中的
先验信息,损失函数对应后验估计中的似然函数,两者的乘积即对应贝叶斯最大后验估计的形式。
lr太大有时候就是这样的。可以想象一下你在下坡,接近坡底部的时候步子迈太大迈到另外一头了
作者:Charles Xiao
链接:https://www.zhihu.com/question/23536142/answer/90135994
来源:知乎
著作权归作者所有。商业转载请联系作者获得授权,非商业转载请注明出处。