美文网首页玩转大数据
特征工程之缺失值与离群值处理

特征工程之缺失值与离群值处理

作者: wujustin | 来源:发表于2016-12-30 19:55 被阅读1464次

缺失值处理方式

  1. 删除

  2. 均值
    缺点:当缺失数据不是随机数据时会产生偏差.对于正常分布的数据可以使用均值代替,

  3. 中位值
    数据是倾斜的,使用中位数比均值可能更好。

  4. 插值法
    随机插值--随机选取一个样本的值
    拉格朗日插值和牛顿插值
    相关变量预测插值--通过与缺失变量关系相关性大的变量, 来预测相关值。

  5. 相似样本值
    找到和缺失样本类似的样本, 缺失样本所丢失的属性用相似样本的值替代。

  6. 用回归或者决策树等,小范围属性列表构建模型判断缺失值, 个人感觉只适合较为重要的列属性缺失值预估。

离群值

离群值简单理解就是和大多数数据相差比较多的点。下面从两个方面

离群值的识别

1.画图, 非常直观

2.正态分布的3a原则
如果数据服从正态分布(如何看数据是否正态分布), 如果值超过平均值的3倍标准差的值被认为离群值。如果不服从正态分布, 则用偏离平均值多少倍来衡量。

3.箱型图识别异常值。利用数据中的五个统计量:最小值、第一四分位数、中位数、第三四分位数与最大值来描述数据的一种方法,它也可以粗略地看出数据是否具有有对称性,分布的分散程度等信息。
第一四分位数(Q1):表示全部观察值中有四分之一的数据取值比它小.
第三四分位数(Q3),表示全部观察值中有四分之一的数据取值比它大;
IQR为四分位数间距,是上四分位数QU与下四分位数QL的差值,包含了全部观察值的一半。
如下图(来自百度经验)所示,如果值小于Q1-1.5IQR, 或者大于Q3 + 1.5IQR,认为数据为异常值。

箱型图

4.Z-score
Z-score又称为标准分数(Standard Score), 可用来帮助识别异常值。Z-score的值求取如下:

Paste_Image.png

建议将Z分数低于-3或高于3的数据看成是异常值。这些数据的准确性要复查,以决定它是否属于该数据集。计算Z值时需要“母体”的平均值和标准差,而不是“样本”的平均值和标准差。因此需要了解母体的统计数据资料。但是要确实了解母体真正的标准差往往是不切实际的。

离群值的处理

离群值的处理和缺失值方式类似,可以把离群值当成缺失值处理。
1.删除
2.中位值或者均值
3.差值法
4.相似样本

参考文档
http://www.cnblogs.com/charlotte77/p/5606926.html

相关文章

  • 特征工程之缺失值与离群值处理

    缺失值处理方式 删除 均值缺点:当缺失数据不是随机数据时会产生偏差.对于正常分布的数据可以使用均值代替, 中位值数...

  • 5.data_preprocessing_and_feature

    1.数据预处理与特征工程 1.1处理缺失值 1.1.1 直接删除缺失值多的样本和特征 1.1.2 计算缺失值与填充...

  • Kaggle_House题目整理

    特征处理 缺失比例: 属性值含义(不是全部) 缺失值处理 缺失量比较多的PoolQC、MiscFeature、Al...

  • 数据预处理

    一.缺失值处理 1.直接使用带有缺失值的数据 2.舍弃该特征 3.缺失值填充 均值插补离散值连续值 同类均值插补 ...

  • Spark建模前的数据准备

    1.检查重复数据 未观测数据和异常数据(离群值) 2. 缺失数据处理 查看什么特征存在大量缺失 根据实际意义决...

  • 2020-03-28

    缺失值处理 像IRIS数据集没有缺失值,故对数据集新增一个特征,4个特征均赋值为NaN,表示数据缺失;用均值、众数...

  • 数据预处理:标称型特征的编码和缺失值处理

    数据预处理:标称型特征的编码和缺失值处理 标称型特征编码(Encoding categorical feature...

  • 预处理

    数据预处理的常用流程 去除唯一属性 处理缺失值 属性编码 数据标准化 特征选择 主成分分析 缺失值处理的三种方法 ...

  • Pandas4——Pandas高级处理

    目录: 缺失值处理/替换 数据离散化 合并 交叉表与透视表 分组与聚合 1. 缺失值处理 data.dropna(...

  • Series第五讲 缺失值处理

    Series第五讲 缺失值处理 本节课将讲解如何处理pandas里的缺失值 缺失值处理 Series.fillna...

网友评论

    本文标题:特征工程之缺失值与离群值处理

    本文链接:https://www.haomeiwen.com/subject/dnlsvttx.html