机器学习模型介绍
1. Logistic Regression 模型介绍 逻辑回归 (Logistic regression) 是分类模型, 常用于二分类. 逻辑回归的本质是: 假设数据服从分布, 然后使用极大似然估计做参数的估计 Logistic 分布是一种连续概率分布 分布函数: $$ F(x)=P(X \leq x)=\frac{1}{1+e^{-(x-\mu) / \gamma}} $$ 密度函数: $$ f(x)=F^{\prime}(X \leq x)=\frac{e^{-(x-\mu) / \gamma}}{\gamma\left(1+e^{-(x-\mu) / \gamma}\right)^{2}} $$ $\mu$: 未知参数; $\gamma$: 形状参数. logistic 分布的形状与正态分布的形状相似, 但是Logistic 分布的尾部更长, 所以我们可以使用Logistic 分布来建模比正态分布具有更长尾部和更高波峰的数据分布. Sigmoid 函数就是Logistic 的分布函数在$\mu=0, \gamma=1$的特殊形式. Logistic 回归 Logistic 回归主要用于分类问题, 如二分类, 对于所给的数据假设存在一条直线可以将数据完成线性可分. 先看决策边界 (decision boundary) 问题 有线性决策边界(linear decision boundaries) 可以表示为 $w_1x_1+w_2x_2+b=0$, 假设某个样本点 $h_w(x)=w_1x_1+w_2x_2+b>0$ 那么可以判断其类别为1, 这个过程就是感知机. 非线性决策边界(non-linear decision boundaries) Logistic 回归还需要找到分类概率$P(Y=1)$与输入向量$x$ 的直接关系, 然后通过比较概率值来判断类别. 考虑二分类问题, 给定数据集: $D=\left(x_{1}, y_{1}\right),\left(x_{2}, y_{2}\right), \cdots,\left(x_{N}, y_{N}\right), x_{i} \subseteq R^{n}, y_{i} \in 0,1, i=1,2, \cdots, N$ 由于多元线性回归模型(单调可导函数) $w^Tx+b$ 的取值是连续的, 所以不能拟合离散变量, 但可以用它来拟合条件概率$P(Y=1|x)$, 因为概率的取值也是连续的. 而概率的取值范围是[0, 1], 所以使用广义线性模型. 最理想的模型是单位阶跃函数: $p(y_i=1 \mid x_i)=\left\{\begin{array}{ll}0, & z<0 \\0.5, & z=0 \\1, & z>0\end{array}, \quad z=w^{T} x_i+b\right.$ 但是这个模型不单调, 所以不可导(不连续不平滑), 所以不是广义线性模型 常用的函数是sigmoid函数, 将 $f(x) = \frac{1}{1+e^{-x}}\in(0,1)$, $h(y_i) = w^Tx_i+b\in(-\infty, \infty)$ $y_i = f(x_i) = \frac{1}{1+e^{-(w^Tx_i+b)}}$ 此时$y$是一个概率(0到1之间), 设y为x的正例概率, 1-y为x的反例概率, 两者的比值为几率 (odds). $ln(odds)=ln(\frac{y}{1-y})=w^Tx+b$ $w^Tx+b=ln\frac{P(Y=1|x)}{1-P(Y=1|x)}$ $P(y=1|x)=\pi_w(x)=\frac{1}{1-e^{-(w^Tx+b)}}$ $P(y=-1|x)=1-\pi_w(x)$ 这里$y\in(-1,1)$ 所以输出$y=1$的对数几率是由输入$x$的线性函数表示的模型, 这就是逻辑回归模型. ...