, x; u! X* p. N- K3、逻辑回归算法 3 C" B0 C, N$ b. A; U逻辑回归是一种统计方法,用于根据一个或多个自变量预测二元结果,例如成功或失败。它是机器学习中的一种流行技术,通常用于分类任务,例如确定电子邮件是否是垃圾邮件,或预测客户是否会流失。9 F8 J/ z+ g- a- x v4 B" I
% T7 ^* U( l) M& A# b" l
1 P; v# A0 g6 j/ F' U3 }4 x( P, d$ i" q' e
逻辑回归模型基于逻辑函数,逻辑函数是一个sigmoid函数,它将输入变量映射到 0 到 1 之间的概率。然后使用该概率对结果进行预测。3 x$ ~& @% `! _2 U
{8 i' _ [# l5 Y! M2 F逻辑回归模型由以下方程表示: ! K$ B$ v! ~& c/ N6 x 3 I0 k# q1 T4 @* n+ ^- KP ( y = 1 ∣ x ) = 1 / ( 1 + e − ( b 0 + b 1 x 1 + b 2 x 2 + … + b n ∗ x n ) ) P(y=1|x) = 1/(1+e^-(b0 + b1x1 + b2x2 + … + bn*xn))( k$ m, x7 ^1 Q
P(y=1∣x)=1/(1+e , F1 W) U3 N: r. ]" C: l
−3 j) _0 f/ b8 T* b$ {
(b0+b1x1+b2x2+…+bn∗xn)) 1 ^8 }4 a, I7 e4 _6 A6 `2 N " X) |/ N, \" H3 m" U其中 P(y=1|x) 是给定输入变量 x 时结果 y 为 1 的概率,b0 是截距,b1, b2, …, bn 是输入变量 x1, x2, … 的系数, xn。通过在数据集上训练模型并使用优化算法(例如梯度下降)来最小化成本函数(通常是对数损失)来确定系数。模型训练完成后,就可以通过输入新数据并计算结果为 1 的概率来进行预测。将结果分类为 1 或 0 的阈值通常设置为 0.5,但这可以根据情况进行调整具体任务以及误报和漏报之间所需的权衡。 3 f* U' l" Z$ Q) e1 {4 A3 I' D0 A' {! h* ^5 O w' j% A
3.1 什么是逻辑函数?/ E# y- H& }& t% z: Y" M! \
逻辑函数,也称为s i g m o i d sigmoidsigmoid函数,是一条 S 形曲线,将任何实数值映射到 0 到 1 之间的值。它的定义为f ( x ) = 1 / ( 1 + e − x ) f(x) = 1 / (1 + e^-x )f(x)=1/(1+e 8 a* B8 Z4 d& {3 {7 y" |9 U3 z! q− " e# r; `# S; C' [6 R x)其中 e 是自然对数的底。逻辑函数在逻辑回归中用于对二元结果的概率进行建模。 . B* t' x" U8 N# f- o E6 P8 M, r5 b" I' s5 c/ m: U
& _! \* z4 _3 X- E6 N# Z4 y/ q) a) j! f
3.2 逻辑回归可以用于多类分类吗? ' _: o# h9 k" o3 Z) L8 S5 {, [. G逻辑回归可用于多类分类,方法是为每个类创建单独的二元逻辑回归模型并选择预测概率最高的类。这被称为一对一或一对一的方法。或者,我们可以使用s o f t m a x softmaxsoftmax回归,它是逻辑回归的推广,可以直接处理多个类。9 m& N6 N% u! X+ V& w3 G
+ f% w- t/ z0 p( l4 ?* |- s4 w3.3 如何解释逻辑回归中的系数?) Z, ?# y- Q0 X) ^
逻辑回归中的系数表示在保持所有其他预测变量不变的情况下,预测变量发生一个单位变化时结果的对数几率的变化。优势比可用于解释系数的大小。优势比大于 1 表示预测变量增加一个单位会增加结果的可能性,而优势比小于 1 表示预测变量增加一个单位会降低结果的可能性。 4 Y0 B& n2 v+ c. G9 v6 t/ ?' m8 @$ i8 r1 K/ O, ? k
4、支持向量机(SVM)算法; R2 }* c& M6 G" f( q- z5 Z
支持向量机 (SVM) 是一种监督学习算法,可用于分类或回归问题。SVM 背后的主要思想是通过最大化间隔(边界与每个类最近的数据点之间的距离)来找到分隔数据中不同类的边界。这些最接近的数据点称为支持向量。 5 |% ^ O" Z9 Z( J 0 \ p g" z/ a2 P$ ?# @2 \& b* |" r& C T
当数据不可线性分离(这意味着数据不能用直线分离)时,SVM 特别有用。在这些情况下,SVM 可以使用称为核技巧的技术将数据转换为更高维的空间,其中可以找到非线性边界。SVM 中使用的一些常见核函数包括多项式、径向基函数 (RBF) 和s i g m o i d sigmoidsigmoid。1 Y. D0 @8 s D* B2 C
8 J- L' _& L( s/ zSVM 的主要优点之一是它们在高维空间中非常有效,并且即使在特征数量大于样本数量时也具有良好的性能。此外,SVM 内存效率高,因为它们只需要存储支持向量,而不是整个数据集。另一方面,SVM 对核函数和算法参数的选择很敏感。还需要注意的是,SVM 不适合大型数据集,因为训练时间可能相当长。总之,支持向量机(SVM)是一种强大的监督学习算法,可用于分类和回归问题,特别是当数据不可线性分离时。该算法以其在高维空间中的良好性能以及发现非线性边界的能力而闻名。然而,它对核函数和参数的选择很敏感,也不适合大型数据集。 0 S- g M2 L# F# | m # H, x$ H/ ]( b' b* M* {4.1 优点! ]% ~! q' h5 a! J) F! ]( ]6 f
在高维空间中有效:即使当特征数量大于样本数量时,SVM 也具有良好的性能。, `- R- l6 w& }( d' B. L. K