$ k$ x, G: ~6 F& V; Z. P1.1 机器学习算法包含的两个步骤 " c* o( [- s" R3 S4 O: J机器学习算法通常包括两个主要步骤:训练和预测。在训练阶段,算法使用一部分已知数据(训练数据集)来学习模型或函数的参数,以使其能够对未知数据做出准确的预测或分类。在预测阶段,算法将学习到的模型应用于新的数据,通过模型对数据进行预测、分类或其他任务。 6 a. t$ y1 }) p% Q% I/ l6 T& G+ t9 i R: Y
1.2 机器学习算法的分类 ' B* C, U- r5 t1 E3 u" s k机器学习算法可以是基于统计学原理、优化方法、神经网络等等。根据学习的方式不同,机器学习算法可以分为监督学习、无监督学习和强化学习等几种类型。不同的机器学习算法适用于不同的问题和数据类型,选择合适的算法可以提高机器学习的任务效果。; f$ C b: h/ H* O' F
9 Z0 u/ l3 |4 ^+ p5 @
监督学习算法:监督学习算法需要训练数据集中包含输入和对应的输出(或标签)信息。常用的监督学习算法包括:线性回归、逻辑回归、决策树、支持向量机、朴素贝叶斯、人工神经网络等。9 M- G* b3 } R1 T# G& D6 \
, _- I$ t# K" E* \5 y; q7 S2 I$ {无监督学习算法:无监督学习算法不需要训练数据集中的输出信息,主要用于数据的聚类和降维等问题。常用的无监督学习算法包括:K均值聚类、层次聚类、主成分分析、关联规则挖掘等。' Q% Y6 |4 C. r$ _8 z3 b
3 j! a/ L" c7 i! s强化学习算法:强化学习算法通过与环境进行交互,试图找到最优策略来最大化奖励。常用的强化学习算法包括:Q学习、深度强化学习算法等。, Y6 m' R+ f. w2 p
/ K) l# H j( r* z$ K' M, l此外,还有一些常用的机器学习算法和技术,如集成学习、降维方法、深度学习、迁移学习、半监督学习等,它们通过不同的方式和建模方法来解决不同的问题。选择合适的机器学习算法需要考虑问题的性质、数据的特点、算法的可解释性和计算效率等因素。 - z$ `& s+ b; z* r: X7 C9 S! u7 @/ Y7 `9 s
2、线性回归算法 / }+ X. m0 E) f7 k+ n线性回归是一种统计方法,用于检查两个连续变量之间的关系:一个自变量和一个因变量。线性回归的目标是通过一组数据点找到最佳拟合线,然后可用于对未来的观察进行预测。 & P( d5 I1 u% {% `, L8 j1 x/ _8 |7 L R- V, `1 w- p/ O% C* `4 q) R$ H9 `- @3 F T/ E; Y9 a' h
简单线性回归模型的方程为:/ @$ T8 x4 q m+ f+ l
) q% n# T/ @7 H3 Vy = b 0 + b 1 ∗ x y = b0 + b1*x4 _- E% s5 F: P" W* O' F+ I9 Z
y=b0+b1∗x) c ~- [$ H' z; y. P
, a" [+ A- x. G1 R. E1 b# @
其中 y 是因变量,x 是自变量,b0 是 y 截距(直线与 y 轴的交点),b1 是直线的斜率。斜率表示给定 x 变化时 y 的变化。. @9 J) D2 c8 H1 c8 d3 D' W
; t# ~. w! f. J
为了确定最佳拟合线,我们使用最小二乘法,该方法找到使预测 y 值与实际 y 值之间的平方差之和最小化的线。线性回归也可以扩展到多个自变量,称为多元线性回归。多元线性回归模型的方程为:y = b 0 + b 1 x 1 + b 2 x 2 + … + b n ∗ x n y = b0 + b1x1 + b2x2 + … + bn*xny=b0+b1x1+b2x2+…+bn∗xn。其中 x1, x2, …, xn 是自变量,b1, b2, …, bn 是相应的系数。 4 P, k# S$ ^( h) `7 n3 I, d" |; K1 x! z
线性回归可用于简单线性回归和多元线性回归问题。系数 b0 和 b1, …, bn 使用最小二乘法估计。一旦估计了系数,它们就可以用于对因变量进行预测。线性回归可用于对未来进行预测,例如预测股票的价格或将出售的产品的单位数量。然而,线性回归是一种相对简单的方法,可能并不适合所有问题。它假设自变量和因变量之间的关系是线性的,但情况可能并非总是如此。此外,线性回归对异常值高度敏感,这意味着如果存在任何不遵循数据总体趋势的极值,将会显着影响模型的准确性。 5 t1 S/ f2 {0 u0 A- h* c- ]! B' x, u4 Y7 v, q8 B0 X7 ^
总之,线性回归是一种强大且广泛使用的统计方法,可用于检查两个连续变量之间的关系。它是一个简单但功能强大的工具,可用于预测未来。但是,请务必记住,线性回归假设变量之间存在线性关系,并且对异常值敏感,这可能会影响模型的准确性。" m2 h# D( a. C, x* W4 `0 y
8 r; g' |. f. n2 O2.1 线性回归的假设是什么?3 d- E9 N! D5 Z/ x" K* t" I) `
线性:自变量和因变量之间的关系是线性的。 7 e1 ]( S- Z) e- @ 7 v/ b1 a, R8 u) H `6 B; B& x3 m独立性:观察结果彼此独立。2 \' e2 s9 W1 F1 C1 Q
& P5 A* e. I* l* j6 A
同方差性:误差项的方差在自变量的所有水平上都是恒定的。 3 ^$ u) j- q6 F9 K" E t, l1 [$ f0 A2 i9 g8 I5 ?" V/ N* q
正态性:误差项呈正态分布。; u; s- j# `4 b* H
0 |* D5 ^+ p$ c! w# H+ o% r& ?
无多重共线性:自变量彼此不高度相关。 7 }, p% l! Y3 t / u# C' [; ?$ ~: X/ x. p无自相关:误差项与其自身不自相关。/ ]& E7 ?" \8 O, {; l% n/ p
$ h1 S3 r ^. e1 P E7 Z7 {" g2.2 如何确定线性回归模型的拟合优度?% b* O0 @! z$ x" m5 g8 Q! o% E
有多种方法可以确定线性回归模型的拟合优度: 9 S Y8 y f' a' O3 _% b0 S 0 Z R2 J! x7 E4 c+ K. G; yR 平方:R 平方是一种统计度量,表示因变量中的方差由模型中的自变量解释的比例。R 平方值为 1 表示模型解释了因变量中的所有方差,值为 0 表示模型没有解释任何方差。9 B6 `& k j+ ~0 W
6 h9 `' ]1 V; ?( P {) y7 Z
调整 R 平方:调整 R 平方是 R 平方的修改版本,它考虑了模型中自变量的数量。在比较具有不同数量自变量的模型时,它可以更好地指示模型的拟合优度。 1 |4 F9 K- V4 X2 I9 E+ E( x ) R1 Y% A, a0 k. V5 C均方根误差 (RMSE):RMSE 衡量预测值与实际值之间的差异。RMSE 较低表明模型与数据的拟合效果更好。2 s4 F: K# k u8 d' K( Y4 a
8 C5 r2 ?4 k, O* B
平均绝对误差 (MAE):MAE 测量预测值与实际值之间的平均差异。MAE 越低表明模型与数据的拟合效果越好。# _4 G; r' m* ?( V
- t; @$ }4 N& Q8 f; A3 _0 s& P