清理一遍就达到要求的很少?Y程序
复杂Y清理过程变化时工作量大而且Y这种方法也没有充分利用目前
数据库提供的强大的数据处理能力。
数据清洗主要是对缺失值重复值异常值和数据类型有误的数据
进行处理Y数据清洗的内容主要包括四点
?
1?缺失值处理由于调查编码和录入误差Y数据中可能存在
一些缺失值Y需要给予适当的处理常用的处理方法有X估算
整例删除变量删除和成对删除
?
2?异常值处理根据每个变量的合理取值范围和相互关系Y检
查数据是否合乎要求Y发现超出正常范围逻辑上不合理或者相
互矛盾的数据。
数据清洗主要是对缺失值重复值异常值和数据类型有误的数据
进行处理Y数据清洗的内容主要包括四点
?
3?数据类型转换数据类型往往会影响到后续的数据处理分析
环节Y因此Y需要明确每个字段的数据类型Y比如Y来自A表的
学号是字符型Y而来自B表的字段是日期型Y在数据清洗的时候
就需要对二者的数据类型进行统一处理
这章没有结束,请点击下一页继续阅读!
