数据处理-利用 python进行异常值分析

作者: afansdie | 来源:发表于2019-07-06 13:59 被阅读0次

数据处理-利用 python进行异常值分析
2019-10-12
深入浅出Pandas学习与实践
《利用Python进行数据分析》PDF高清完整版-免费下载
《基于Python的大数据分析基础及实战》（余本国）PDF电子书
6.more_about_feature_engineering
利用Python进行数据分析 - 准备工作
你为什么要学习Python，有哪些优缺点，如何一个星期学会？
利用Python进行分析-Chapter 3
数据分析学习计划

异常值分析是检验数据是否有录入错误数据和不合常理的数据。不加剔除的把异常值代入数据分析过程中，会对结果产生不良影响，而对异常值的分析其原因，常常成为为发现问题的而改进决策的契机。

异常值是指样本中的个别值，其数值明显偏离其余的数据。异常值通常也称为离群点，所以异常值分析也叫做离群点分析。

异常值分析通常有以下几种：

（1）简单统计量分析

最常用的统计量是最大值和最小值，用来判断这个变量的取值是否超出了合理的范围。

（2）3 $\sigma$ 原则

如果数据服从正态分布，在3 $\sigma$ 原则下，异常值被定义为一组测定值中与平均值的偏差超过3倍标准差的值。在正态分布的假设下，距离平均值3 $\sigma$ 之外的值出现的概率为，属于极个别的小概率事件

（3）箱型图分析

箱型图提供了识别异常值的一个标准：异常值通常被定义为小于 $Q_{l} -1.5IQR$ 或大于 $Q_{u} +1.5IQR$ 的值。 $Q_{l}$ 称为下四分位数，表示全部观察值中有四分之一的数据取值比它下； $Q_{u}$ 称为上四分位数，表示全部观察值中有四分之一的数据取值比它大； $IQR$ 称为四分位数间距，是上四分位数和下四分位数之差，期间包含了全部观察值的一般。