美文网首页
数据缺失如何补?

数据缺失如何补?

作者: 19e1a2398326 | 来源:发表于2020-11-24 16:28 被阅读0次

企业在做主数据或者依据数据创新前,都要先对数据质量进行诊断与治理,其中数据不完整性就是常见的一个问题。在做数据剖析诊断后,缺失的数据如何补呢?

通常数据缺失值处理主要分成三个大类1.删除;2.补齐;3.忽略。

1.删除含有缺失值的记录

理论上讲,主要有简单删除法和权重法。简单删除法是对缺失值进行处理的最原始方法。它将存在缺失值的记录删除,比如dataframe可以使用dropna方法来实现删除缺失值。

2.插补缺失值 

它的思想来源是以最可能的值来插补缺失值比全部删除不完全样本所产生的信息丢失要少。在数据挖掘中,面对的通常是大型的数据库,它的属性有几十个甚至几百个,因为一个属性值的缺失而放弃大量的其他属性值,这种删除是对信息的极大浪费,所以产生了以可能值对缺失值进行插补的思想与方法。常用的有如下几种方法。

(1)均值插补。数据的属性定性数据和定量数据。如果缺失值是定量的,就以该字段存在值的平均值来插补缺失的值;如果缺失值是定性的,就根据统计学中的众数原理,用该属性的众数(即出现频率最高的值)来补齐缺失的值。

(2)利用同类均值插补。它用层次聚类模型预测缺失变量的类型,再以该类型的均值插补。假设X=(X1,X2…Xp)为信息完全的变量,Y为存在缺失值的变量,那么首先对X或其子集行聚类,然后按缺失个案所属类来插补不同类的均值。如果在以后统计分析中还需以引入的解释变量和Y做分析,那么这种插补方法将在模型中引入自相关,给分析造成障碍。

(3)极大似然估计(Max Likelihood ,ML)。在缺失类型为随机缺失的条件下,假设模型对于完整的样本是正确的,那么通过观测数据的边际分布可以对未知参数进行极大似然估计(Little and Rubin)。这种方法也被称为忽略缺失值的极大似然估计,对于极大似然的参数估计实际中常采用的计算方法是期望值最大化(Expectation Maximization,EM)。使用前提:大样本,并且有效样本的数量足够以保证ML估计值是渐近无偏的并服从正态分布。但是这种方法可能会陷入局部极值,收敛速度也不是很快,并且计算很复杂。

3.不做处理

补齐处理只是将未知值补以我们的主观估计值,不一定完全符合客观事实,在对不完备信息进行补齐处理的同时,我们或多或少地改变了原始的信息系统。而且,对空值不正确的填充往往将新的噪声引入数据中,使挖掘任务产生错误的结果。因此,在许多情况下,我们还是希望在保持原始信息不发生变化的前提下对信息系统进行处理。

华矩数据诊所,可帮助客户对数据进行自动化的诊断、剖析、修正。

相关文章

  • 数据缺失如何补?

    企业在做主数据或者依据数据创新前,都要先对数据质量进行诊断与治理,其中数据不完整性就是常见的一个问题。在做数据剖析...

  • pandas学习笔记之缺失值处理

    对于数据中的缺失值,有两种处理思路: 删除 插补 如何判断数据中是否存在缺失值? pd.isnull(df) ->...

  • 缺失数据常见的插补方法

    缺失数据常见的插补方法 标签(空格分隔): 缺失数据 插补 一、个案剔除法(Listwise Deletion) ...

  • 数据清洗

    数据清洗:删除原始数据集中的无关数据,重复数据,平滑噪声数据,处理缺失值和异常值 缺失值的处理:删除记录 数据插补...

  • 数据预处理

    一.缺失值处理 1.直接使用带有缺失值的数据 2.舍弃该特征 3.缺失值填充 均值插补离散值连续值 同类均值插补 ...

  • 缺失值处理

    对于缺失值的处理,从总体上来说分为删除存在缺失值的个案和缺失值插补。对于主观数据,人将影响数据的真实性,存在缺失值...

  • 笔记|数据分析之pandas基础----Series与DataF

    如何处理缺失数据 在练习中经常遇到pandas使用浮点值NaN来表示数组中的缺失数据。那我们该如何处理这些缺失数据...

  • 2019-04-03

    一、数据清洗 1.1对缺失值的处理 定范围 定量:了解数据库中哪些字段有缺失,缺失比例如何。 定性:明确有缺失数据...

  • 数据清洗-利用python进行缺失值处理

    处理缺失值的方法有3种:删除、不处理、数据插补。 而数据插补主要有5种: 1)利用均值、中位数、众数插补 2)使用...

  • kaggle学习 - 缺失值处理

    如何检测补缺失值的效果?补完以后看“补的数据”和“原生数据”的分布是否有差异。这里有两种合适的可视化方法,散点图、...

网友评论

      本文标题:数据缺失如何补?

      本文链接:https://www.haomeiwen.com/subject/gmaiiktx.html