2336426014 发表于 2018-7-18 18:01

新手进阶建模(8)数据的预处理 第一部分

       数据预处理有四个任务,数据清洗、数据集成、数据 变换和数据规约。
       本节先讲数据第一个:数据清洗
数据清洗包括1.缺失值处理    2.异常值处理
       其中缺失值的处理有3种:不处理(做建模铁定不选),删除(可以考虑),数据补差(99%的同僚选择)
而补差的方式主要用下面的5类,重点是第五个,插值法
    1. 补插均值/中位数/众数
    2. 使用固定值
    3. 最近邻补插
    4. 回归方法
    5. 插值法
插值法又包含好多种:(1)拉格朗日插值法(最容易看的懂的,用的人较多,用错的也多)(2)牛顿插值法(3)Hermite插值 (4)分段插值 (5)样条插值                        (后三种相对用的较少)


(1)拉格朗日插值法(划重点)
        其原理百度就是构建一个多项式,这个多项式很厉害,假如说我们的数据是城市里的银行位置坐标,那这个多项式就是一条过所有银行的公路,所以,当我们要问50km外的银行在哪儿时,我们顺着这条路算就可以算出来。当然,算出来的坐标只是一个近似值。(当给出的已知银行坐标点越多,近似误差越小)。
       关于拉格朗日多项式的构建原理,这里不说了,百度各种解释,这里只说一下它的优缺点:优点就是过程简单,很容易找到插值,而且还是唯一的。缺点也明显,就是当已知的点很多时候,阶数也会很高,所以不适合插那些百十来个数据点的题。处理十来个的还是很好的。(我个人建议还是用牛顿)
      
(2)牛顿插值法
        相比较与拉格朗日,其优点是当新增加插值点时,得到的拟合函数变化不大。其原理解释还是看百度或者找老师问吧,我的理解就是从第一个插值点开始修路,每修到一个银行就进行一次校正(高阶差商我的理解),然后这样的话插未知点就准一点。所以用的比较多吧也。
       关于其应运代码见附件


2336426014 发表于 2018-7-18 18:08

走过路过给个回复,私信我给你免费资源,只求回复,帮我完成工作{:3_60:}

杜比尔 发表于 2018-7-18 20:01

谢谢分享

杜比尔 发表于 2018-7-18 20:05

谢谢分享

@小孩子 发表于 2018-7-18 22:19

发表回复谢谢分享

fjdieb 发表于 2018-7-19 10:23

发表回复

fjdieb 发表于 2018-7-19 10:24

谢谢分享

一个我 发表于 2018-7-19 14:20

谢谢分享

111111258 发表于 2018-7-19 17:39

发表回复谢谢分享

一个我 发表于 2018-7-19 18:22




分享的很棒,谢谢
页: [1] 2 3 4
查看完整版本: 新手进阶建模(8)数据的预处理 第一部分