机器学习面试题之——LR问题集合

一、LR为什么是线性模型

Logistic Regression从几率的概念构建线性回归模型。一个事件发生的几率（odds）为该事件发生的概率与不发生概率的比值，几率的取值范围为[0,+∞)，其对数的取值范围为实数域，所以，可以将对数几率作为因变量构建线性回归模型：
$log\frac{p}{1-p}=W^{T}X$
由此可得 $p=\frac{1}{1+exp(-W^{T}X)}$ ，即P(y=1|x,w)=p，这便是Logistic Regression采用sigmoid函数的原因，sigmoid函数将自变量的线性组合映射到（0,1），用以表述分类的概率特性。从sigmoid函数看出，当 $\theta ^{T}X>0$ 时，y=1，否则 y=0。 $\theta ^{T}X=0$ 是模型隐含的分类平面（在高维空间中，我们说是超平面）。所以说逻辑回归本质上是一个线性模型.

二、LR如何解决低维不可分

特征映射：通过特征变换的方式把低维空间转换到高维空间，而在低维空间不可分的数据，到高维空间中线性可分的几率会高一些。具体方法：核函数，如：高斯核，多项式核等等。

三、从图模型角度看LR

LR模型可以看作是CRF模型的低配版，在完全不定义随机变量交互，只考虑P(Y|X)的情况下，得到的就是LR模型。

最大熵相比LR，可以提取多组特征（最大熵定义了多个特征函数），本质上等价的。CRF又是最大熵模型序列化的推广。

本质上，LR和softmax是等价的，而且也可证最大熵和softmax也等价，即可证LR和最大熵的等价性

LR(最大熵模型)统计的是训练集中的各种数据满足特征函数的频数(conditional)；贝叶斯模型统计的是训练集中的各种数据的频数；CRF统计的是训练集中相关数据 (比如说相邻的词，不相邻的词不统计) 满足特征函数的频数。

PS，最大熵模型和CRF的区别：最大熵模型在每个状态都有一个概率模型，在每个状态转移时都要进行归一化。如果某个状态只有一个后续状态，那么该状态到后续状态的跳转概率即为1。这样，不管输入为任何内容，它都向该后续状态跳转。而CRFs是在所有的状态上建立一个统一的概率模型，这样在进行归一化时，即使某个状态只有一个后续状态，它到该后续状态的跳转概率也不会为1，从而解决了“labelbias”问题。因此，从理论上讲，CRFs非常适用于中文的词性标注。

四、LR的损失函数