数据预处理-缺失值处理

📅 2026/7/28 14:03:57
数据预处理-缺失值处理
数据预处理-缺失值处理缺失值类型不完全变量完全随机缺失随机缺失完全非随机缺失缺失值补全1-均值查补2-同类均值插补3-建模预测4-高维映射5-多重插补6-手动插补数据预处理完整目录缺失值类型在对缺失数据进行预处理前了解数据缺失的机制和形式是十分必要的。将数据集中不含缺失值的变量称为完全变量数据集中含有缺失值的变量称为不完全变量。不完全变量完全随机缺失missing completely at random, MCAR指的是数据的缺失是完全随机的不依赖于任何不完全变量或完全变量不影响样本的无偏性。如家庭地址缺失。随机缺失mission at random,MAR指的是数据的缺失不是完全随机的即该类数据的缺失依赖于其他完全变量。如财务数据缺失情况与企业的大小有关。完全非随机缺失mission not at random,MNAR指的是数据的缺失与不完全变量自身的取值有关。如高收入人群不愿意提供家庭收入缺失值补全1-均值查补将初始数据集中的属性分为数值属性和非数值属性来分别进行处理。非数值型缺失值根据统计学中的众数原理用该属性在其他所有对象的取值次数最多的值补齐该缺失的属性值。比如一个学校的男生和女生的数量男生500女生50那么对于其余的缺失值我们会用人数较多的男生来填补。数值型缺失值使用平均值或者中位数填补比如一个班级学生的身高特征对于一些同学缺失的身高值就可以使用全班同学的平均值或中位数来填补。优点简单缺点可能会引入噪音。或者会改变特征原有的分布数据倾斜、数据分布畸变一般如果特征分布为正态分布时使用平均值效果比较好。否则使用中位数比较好。如果缺失值是随机缺失使用平均值会比较好因为可以使数据分布不发生畸变。2-同类均值插补原理用无监督机器学习聚类的方法预测缺失变量的类型再以该类型的均值插补。所有样本进行聚类划分然后通过划分的种类的均值对各自类中的缺失值进行填补。假设X ( X 1 , X 2 . . . X p ) X(X_1,X_2...X_p)X(X1​,X2​...Xp​)为信息完全的变量Y YY为存在缺失值的变量那么首先对X XX或其子集行聚类然后按缺失个案所属类来插补不同类的均值。如果在以后统计分析中还需以引入的解释变量和Y YY做分析那么这种插补方法将在模型中引入自相关给分析造成障碍。3-建模预测将缺失的属性作为预测目标来预测将数据集按照是否含有特定属性的缺失分为两类利用现有的机器学习算法对待预测数据集的缺失值进行预测。例如回归预测即基于完整的数据集建立回归方程。对于有缺失值的特征值将已知特征代入模型来评估未知特征以此估值来填充。个人感觉以假设来假设…4-高维映射原理将属性映射到高维空间对于分类型变量男、女或缺失的情况采用One-hot编码映射成三个变量是否男、受否女、是否缺失对于连续型变量首先对连续变量进行变量分箱采用一定的数据平滑方式平均值/中值/箱边界进行离散化然后增加是否缺失这种维度优点精准保留了原始数据大部分信息也未添加任何额外信息缺点计算量提升只有在样本量非常大的时候效果还好否则会因为数据过于稀疏效果很差。5-多重插补原理多重插补认为待插补的值是随机的它的值来自已观测到的值。实践上通常是估计出待插补的值再加上不同的噪音形成多组可选插补值根据某种选择依据选择最合适的插补值1.为每个缺失值产生一套可能的插补值这些值反映了无响应模型的不确定性2.根据数据缺失机制、模式以及变量类型可分别采用回归、预测均值匹配predictive mean matchingPMM、趋势得分propensity scorePS、Logistic回归、判别分析以及马尔科夫链蒙特卡洛Markov Chain Monte Cario,MCMC等不同的方法进行填补3.评估填补值是否可信。插补值应该接近数据。显示不能的数据值例如负数、怀孕的父亲不应该出现在插补值的数据中。插补值应尊重变量之间的关系并反应其“真实”值的适当不确定性。根据评分函数进行选择产生最终的插补值。6-手动插补原理根据业务知识具体问题具体分析手动对缺失值进行插补。