缺失表示未知、未记录或不适用;零是一个真实观测。两者混淆会直接改变统计与模型。
处理前先分析缺失比例、分布和机制:随机缺失、与其他变量有关的缺失、或系统性缺失。
常见处理:少量且随机可删除;数值可用中位数/分组中位数;时间序列可插值;重要变量可增加“是否缺失”标记。任何填补都要只用训练信息。
先输出每列缺失数与比例,再用业务理由写处理规则。比较处理前后分布,防止填补把波动抹平。
先问为什么缺,再决定怎么补
体检表中“吸烟支数”空白,是 0 支,还是没有填写?
缺失表示未知、未记录或不适用;零是一个真实观测。两者混淆会直接改变统计与模型。
处理前先分析缺失比例、分布和机制:随机缺失、与其他变量有关的缺失、或系统性缺失。
常见处理:少量且随机可删除;数值可用中位数/分组中位数;时间序列可插值;重要变量可增加“是否缺失”标记。任何填补都要只用训练信息。
先输出每列缺失数与比例,再用业务理由写处理规则。比较处理前后分布,防止填补把波动抹平。
比较三种处理方式。
把未知误写成真实零值,均值被拉低。
20% 收入为空,且主要集中在自由职业者。
缺失与职业类型相关,不宜简单随机删除。
可按职业组中位数填补,并增加 income_missing 标记。
在训练集计算各组中位数,再应用到验证/测试。
保留了缺失本身可能携带的信息,同时避免用未来数据污染训练。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
一个是信息缺口,一个是观测结果。
错误。缺失代表未知或未记录,0 代表真实零值,必须区分。
右偏分布的均值容易被高值拉动。
中位数。它对极端值更稳健。
评估数据必须保持未知。
若使用验证/测试集信息,会把未来或未见数据泄漏进训练过程,使评估过于乐观。
分布不均就是线索。
缺失可能与职业变量有关,处理时应考虑分组或缺失机制。
同一个对象只能被正确计数
两行姓名相同就是重复记录吗?两行姓名不同就一定不是吗?
重复需要依据业务主键判断,例如订单号、设备号+时间,而不是只看姓名。
一致性包括类型、编码、单位、大小写、空格和日期格式。同一类别“北京”“北京市”“ 北京 ”应统一。
先定义唯一键,再检查完全重复和键重复;对键重复记录按时间、状态或可信来源决定合并、保留或删除。
建立数据字典:字段、类型、单位、允许范围、编码规则、缺失含义。清洗脚本中输出每条规则影响了多少行。
看看“删重复”从按钮动作变成规则的过程。
只能删除完全相同记录。
同一 device_id 在同一分钟出现两条温度,状态分别为“预览”和“确认”。
唯一键暂定 device_id+minute。
发现键重复后查看状态与时间戳。
保留确认记录,预览记录进入异常日志。
不是随机删一条,而是用业务优先级解决重复。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
业务主键应唯一标识事件。
订单唯一编号。姓名和金额都可能合法重复。
计算机按字符精确比较。
错误。前后空格可能使其成为两个不同字符串,需要清洗统一。
量纲一致是计算前提。
数值无法直接比较或建模,统计量和距离会被严重扭曲;应统一单位并记录转换。
重复处理要有可解释规则。
根据业务状态和时间规则选择,并把冲突数量记录在质量报告中。
错误、极端与重要事件不是一回事
日销量突然是平时 8 倍,应删除,还是可能恰好遇到促销?
异常值可能是录入错误、测量故障、真实极端事件,或新群体。检测只是发出警报,不能自动决定删除。
先回看原始记录与业务事件,再比较保留、截尾、变换或稳健模型对结论的影响。
常用检测:范围规则;箱线图 IQR;Z 分数;时间序列突变;模型残差。IQR 界限为 Q1−1.5IQR 与 Q3+1.5IQR,但不是删除令。
论文写“检测—核查—处理—影响”四步。至少报告处理了多少点,以及保留/删除时核心结果是否改变。
比较自动删除与业务核查。
统计更平滑,但可能删掉真实事件。
某日销量 800,平时约 100。
检查原始单据和日期,确认没有多输一个 0。
发现当天确有大型促销,因此是有效极端事件。
增加促销标记,预测时将其作为解释变量或单独建模。
保留 800,并说明它不是常态;直接删除会丢失重要机制。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
检测不等于处理决定。
错误。该界限用于标记潜在异常,还需业务核查和影响分析。
先算四分位距。
IQR=18−10=8,上界=18+1.5×8=30。
技术检查和业务检查都需要。
检查原始来源/录入与单位;查看对应时间事件或业务背景;比较保留和处理后的结果。
真实极端需要解释。
保留并增加促销标记或分场景建模。它是重要机制,不是脏数据。
拖动保留阈值,观察一个极端值如何改变清洗后的样本量与均值。
调整左侧参数,观察模型输出怎样变化。
阈值越严格,均值可能越稳定,但哪些真实信息也可能被误删?阈值应由什么证据决定?
让不同单位可比较
一个指标范围 0–10000,另一个 0–5,直接算距离时谁会主导?
许多距离和综合评价方法会受尺度影响。标准化把不同单位变成可比较的无量纲数。
Min–Max 映射到固定区间,直观但受极端值影响;Z-score 以均值和标准差为基准,适合关注相对偏离。
Min–Max:z=(x−min)/(max−min)。Z-score:z=(x−μ)/σ。若 max=min,该列没有区分度,应单独处理。
训练/验证场景中,min、max、μ、σ 只在训练集计算。论文要说明方法和参数来源。
观察距离计算前后可比性。
大数值单位可能独占距离。
价格 [20,30,50] 做 Min–Max。
min=20,max=50,范围=30。
依次计算 (x−20)/30。
得到 [0, 1/3, 1]。
数值变成 0–1,但价格仍是负向指标;还需根据评价方向做正向化。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
代入公式即可。
(30−20)/(50−20)=10/30≈0.333。
常数列范围为零。
分母 max−min 为 0。该列没有区分度,应剔除或赋统一值并说明。
尺度与方向是两件事。
错误。标准化只处理尺度,指标方向仍需单独正向化。
预处理也属于模型训练。
测试集信息会进入预处理参数,造成数据泄漏,使评估偏乐观。
正向、负向、适中与区间型
价格越低越好、满意度越高越好,怎样才能放进同一个综合得分?
正向指标越大越好;负向越小越好;适中型接近目标最好;区间型落在合理范围最好。
正向化把它们统一为“数值越大越优”,再进入赋权和评价。
负向常用 max−x 或 (max−x)/(max−min);适中型可用 1−|x−target|/M;区间型区间内为 1,区间外按距离递减。
先建立指标属性表,逐项写方向、单位、转换公式和理由。转换后用极端样本检查:最优对象是否得到更大值。
比较遗漏方向与正确转换。
高价格可能被误当作更优。
交货期 [2,5,8] 天,越短越好,使用 max−x。
最大值 max=8。
转换为 [8−2, 8−5, 8−8]。
得到 [6,3,0],越短得分越高。
方向已统一,但若要跨指标比较,通常还需进一步标准化。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
从业务偏好判断。
通常是负向指标,等待越短越好。
最大值是 8。
[6,3,0]。
很多指标不是单调偏好。
错误。体温通常是适中型,接近正常目标范围更好。
用极端样本做单元测试。
选择原始意义上最优和最差的样本,确认转换后最优值更大、最差值更小。
每次修改都要能追溯
清洗后少了 237 行,如果没人知道为什么,模型还能被信任吗?
质量报告记录原始规模、问题数量、处理规则、影响行数和处理后规模。它把“我清洗过了”变成可核查证据。
还应比较处理前后关键统计和目标变量分布,防止清洗改变研究对象。
最小字段:规则编号、问题类型、检测条件、处理动作、受影响行数、参数来源、备注。保留处理日志与清洗代码。
论文正文放简表,附录放完整规则。清洗结果文件用脚本生成,禁止手工删行后无法复现。
比较不可追溯与审计式清洗。
结果可能干净,但无法重做。
原始 10000 行,删除重复 120 行,修正单位 35 行,异常暂不删除。
分别记录规则与影响数量。
处理后应有 9880 行,单位修正不改变行数。
报告异常标记数量,并在模型中做稳健性比较。
总行数变化可以被重算解释,任何样本去留都有依据。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
报告要能核查修改。
每条规则影响的行数。它解释数据规模和内容如何变化。
不删行也可能改变数据。
错误。它会改变数值尺度,直接影响模型,必须记录转换规则和影响字段。
单位修正等不改变行数的操作另记。
10000−120−30=9850 行。
干净不等于代表性仍相同。
防止清洗选择性删除某类样本,造成样本偏差或改变研究对象。
选择一个含缺失、重复和异常的小数据集,从 Raw 到 Clean 全程用规则和日志完成。
讲义、练习、实验与挑战清单均在本地页面内。