学习地址：https://www.kesci.com/org/boyuai/project/5e4117b1b8c462002d687509

线性回归的基本要素

模型

为了简单起见，假设价格只取决于房屋状况的两个因素，即面积（平方米）和房龄（年）。接下来我们希望探索价格与这两个因素的具体关系。线性回归假设输出与各个输入之间是线性关系:

数据集

我们通常收集一系列的真实数据，例如多栋房屋的真实售出价格和它们对应的面积和房龄。我们希望在这个数据上面寻找模型参数来使模型的预测价格与真实价格的误差最小。在机器学习术语里，该数据集被称为训练数据集（training data set）或训练集training set），一栋房屋被称为一个样本（sample），其真实售出价格叫作标签（label），用来预测标签的两个因素叫作特征（feature）。特征用来表征样本的特点。

损失函数

在模型训练中，我们需要衡量价格预测值与真实值之间的误差。通常我们会选取一个非负数作为误差，且数值越小表示误差越小。一个常用的选择是平方函数。它在评估索引为 i 的样本误差的表达式为

优化函数 - 随机梯度下降

当模型和损失函数形式较为简单时，上面的误差最小化问题的解可以直接用公式表达出来。这类解叫作解析解（analytical solution）。本节使用的线性回归和平方误差刚好属于这个范畴。然而，大多数深度学习模型并没有解析解，只能通过优化算法有限次迭代模型参数来尽可能降低损失函数的值。这类解叫作数值解（numerical solution）。

在求数值解的优化算法中，小批量随机梯度下降（mini-batch stochastic gradient descent）在深度学习中被广泛使用。它的算法很简单：先选取一组模型参数的初始值，如随机选取；接下来对参数进行多次迭代，使每次迭代都可能降低损失函数的值。在每次迭代中，先随机均匀采样一个由固定数目训练数据样本所组成的小批量（mini-batch）B，然后求小批量中数据样本的平均损失有关模型参数的导数（梯度），最后用此结果与预先设定的一个正数的乘积作为模型参数在本次迭代的减小量。

学习率: η代表在每次优化中，能够学习的步长的大小
批量大小: B是小批量计算中的批量大小batch size

总结一下，优化函数的有以下两个步骤：

(i)初始化模型参数，一般来说使用随机初始化；
(ii)我们在数据上迭代多次，通过在负梯度方向移动参数来更新每个参数。

矢量计算

在模型训练或预测时，我们常常会同时处理多个数据样本并用到矢量计算。在介绍线性回归的矢量计算表达式之前，让我们先考虑对两个向量相加的两种方法。

向量相加的一种方法是，将这两个向量按元素逐一做标量加法。
向量相加的另一种方法是，将这两个向量直接做矢量加法。

Softmax与分类模型

softmax回归的基本概念

分类问题

一个简单的图像分类问题，输入图像的高和宽均为2像素，色彩为灰度。
图像中的4像素分别记为x1,x2,x3,x4。
假设真实标签为狗、猫或者鸡，这些标签对应的离散值为y1,y2,y3。
我们通常使用离散的数值来表示类别，例如y1=1,y2=2,y3=3。

交叉熵损失函数

对于样本i ，我们构造向量y(i)∈Rq ，使其第y(i) （样本i 类别的离散数值）个元素为1，其余为0。这样我们的训练目标可以设为使预测概率分布y^(i) 尽可能接近真实的标签概率分布y(i) 。

平方损失估计

然而，想要预测分类结果正确，我们其实并不需要预测概率完全等于标签概率。例如，在图像分类的例子里，如果y(i)=3 ，那么我们只需要y^3(i) 比其他两个预测值y^1(i) 和y^2(i) 大就行了。即使y^3(i) 值为0.6，不管其他两个预测值为多少，类别预测均正确。而平方损失则过于严格，例如y^1(i)=y^2(i)=0.2 比y^1(i)=0,y^2(i)=0.4 的损失要小很多，虽然两者都有同样正确的分类预测结果。

改善上述问题的一个方法是使用更适合衡量两个概率分布差异的测量函数。其中，交叉熵（cross entropy）是一个常用的衡量方法：

其中带下标的yj(i) 是向量y(i) 中非0即1的元素，需要注意将它与样本i 类别的离散数值，即不带下标的y(i) 区分。在上式中，我们知道向量y(i) 中只有第y(i) 个元素y(i)y(i) 为1，其余全为0，于是H(y(i),y^(i))=−log⁡y^y(i)(i) 。也就是说，交叉熵只关心对正确类别的预测概率，因为只要其值足够大，就可以确保分类结果正确。当然，遇到一个样本有多个标签时，例如图像里含有不止一个物体时，我们并不能做这一步简化。但即便对于这种情况，交叉熵同样只关心对图像中出现的物体类别的预测概率。

假设训练数据集的样本数为n ，交叉熵损失函数定义为

其中Θ 代表模型参数。同样地，如果每个样本只有一个标签，那么交叉熵损失可以简写成ℓ(Θ)=−(1/n)∑i=1nlog⁡y^y(i)(i) 。从另一个角度来看，我们知道最小化ℓ(Θ) 等价于最大化exp⁡(−nℓ(Θ))=∏i=1ny^y(i)(i) ，即最小化交叉熵损失函数等价于最大化训练数据集所有标签类别的联合预测概率。

模型训练和预测

在训练好softmax回归模型后，给定任一样本特征，就可以预测每个输出类别的概率。通常，我们把预测概率最大的类别作为输出类别。如果它与真实类别（标签）一致，说明这次预测是正确的。在3.6节的实验中，我们将使用准确率（accuracy）来评价模型的表现。它等于正确预测数量与总预测数量之比。

多层感知机

多层感知机的基本知识

隐藏层

下图展示了一个多层感知机的神经网络图，它含有一个隐藏层，该层中有5个隐藏单元。

表达公式

具体来说，给定一个小批量样本X∈Rn×d，其批量大小为n，输入个数为d。假设多层感知机只有一个隐藏层，其中隐藏单元个数为h。记隐藏层的输出（也称为隐藏层变量或隐藏变量）为H，有H∈Rn×h。因为隐藏层和输出层均是全连接层，可以设隐藏层的权重参数和偏差参数分别为Wh∈Rd×h和 bh∈R1×h，输出层的权重和偏差参数分别为Wo∈Rh×q和bo∈R1×q。

先来看一种含单隐藏层的多层感知机的设计。其输出O∈Rn×q的计算为

也就是将隐藏层的输出直接作为输出层的输入。如果将以上两个式子联立起来，可以得到

从联立后的式子可以看出，虽然神经网络引入了隐藏层，却依然等价于一个单层神经网络：其中输出层权重参数为WhWo，偏差参数为bhWo+bo。不难发现，即便再添加更多的隐藏层，以上设计依然只能与仅含输出层的单层神经网络等价。

激活函数

上述问题的根源在于全连接层只是对数据做仿射变换（affine transformation），而多个仿射变换的叠加仍然是一个仿射变换。解决问题的一个方法是引入非线性变换，例如对隐藏变量使用按元素运算的非线性函数进行变换，然后再作为下一个全连接层的输入。这个非线性函数被称为激活函数（activation function）。

常用的激活函数有 ReLu函数、Sigmoid函数、tanh函数。