MODEL LAB数学建模交互课
课程进度04/ 16 讲
第 4 讲 · 垃圾进,垃圾出

第 4 讲 · 数据预处理与质量控制

把缺失、重复、异常、量纲和指标方向问题处理清楚,并用质量报告让每一步都有依据、能追溯。

6 个微知识点24 道即时练习答案逐题隐藏无需联网运行
学完能做什么

可检查的学习目标

01
能区分缺失、真实零值、重复与异常
02
能按模型需求选择标准化和指标正向化方法
03
能生成包含规则、数量与影响的数据质量报告
知识点01

先问为什么缺,再决定怎么补

缺失不等于零

约 7 min
先猜一猜

体检表中“吸烟支数”空白,是 0 支,还是没有填写?

缺失表示未知、未记录或不适用;零是一个真实观测。两者混淆会直接改变统计与模型。

处理前先分析缺失比例、分布和机制:随机缺失、与其他变量有关的缺失、或系统性缺失。

别踩坑空值一律填 0用全体数据均值填测试集
动手试一试

缺失处理质量

LIVE

比较三种处理方式。

清晰度
50
可信度
28
可用度
35

把未知误写成真实零值,均值被拉低。

跟我算一遍收入缺失

20% 收入为空,且主要集中在自由职业者。

STEP 01

缺失与职业类型相关,不宜简单随机删除。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01判断未作答

缺失值和数值 0 在模型中含义相同。

02选择未作答

收入分布明显右偏且有极端高值,简单填补更适合用?

03简答未作答

为什么填补参数只能在训练集计算?

04选择未作答

缺失主要集中在某一职业群体,说明什么?

知识点02

同一个对象只能被正确计数

重复、类型与一致性

约 9 min
先猜一猜

两行姓名相同就是重复记录吗?两行姓名不同就一定不是吗?

重复需要依据业务主键判断,例如订单号、设备号+时间,而不是只看姓名。

一致性包括类型、编码、单位、大小写、空格和日期格式。同一类别“北京”“北京市”“ 北京 ”应统一。

别踩坑按整行相同才去重同列混用 kg 与 g
动手试一试

一致性处理

LIVE

看看“删重复”从按钮动作变成规则的过程。

清晰度
62
可信度
50
可用度
48

只能删除完全相同记录。

跟我算一遍设备测量

同一 device_id 在同一分钟出现两条温度,状态分别为“预览”和“确认”。

STEP 01

唯一键暂定 device_id+minute。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01选择未作答

订单数据中最合适的重复判断依据通常是?

02判断未作答

“北京”和“ 北京 ”在分类统计中一定会自动视为同一类。

03简答未作答

同一列混用米和厘米会造成什么问题?

04选择未作答

键重复但记录状态不同,最佳做法是?

知识点03

错误、极端与重要事件不是一回事

异常值先核查,再处理

约 11 min
先猜一猜

日销量突然是平时 8 倍,应删除,还是可能恰好遇到促销?

异常值可能是录入错误、测量故障、真实极端事件,或新群体。检测只是发出警报,不能自动决定删除。

先回看原始记录与业务事件,再比较保留、截尾、变换或稳健模型对结论的影响。

别踩坑超界就一律删除先看最终结论再挑数据
动手试一试

异常处理证据

LIVE

比较自动删除与业务核查。

清晰度
65
可信度
35
可用度
48

统计更平滑,但可能删掉真实事件。

跟我算一遍促销日销量

某日销量 800,平时约 100。

STEP 01

检查原始单据和日期,确认没有多输一个 0。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01判断未作答

超过 1.5IQR 界限的点必须删除。

02计算未作答

Q1=10,Q3=18,按 1.5IQR 规则,上界是多少?

03简答未作答

发现极端值后至少做哪两项核查?

04选择未作答

确认高销量来自真实促销后,最合理的做法是?

本讲主实验 · 拖一拖再下结论

异常阈值与统计结果

拖动保留阈值,观察一个极端值如何改变清洗后的样本量与均值。

实时更新
观察结果等待计算

调整左侧参数,观察模型输出怎样变化。

实验后想一想

阈值越严格,均值可能越稳定,但哪些真实信息也可能被误删?阈值应由什么证据决定?

知识点04

让不同单位可比较

标准化解决量纲与尺度

约 7 min
先猜一猜

一个指标范围 0–10000,另一个 0–5,直接算距离时谁会主导?

许多距离和综合评价方法会受尺度影响。标准化把不同单位变成可比较的无量纲数。

Min–Max 映射到固定区间,直观但受极端值影响;Z-score 以均值和标准差为基准,适合关注相对偏离。

别踩坑先标准化再划分数据常数列除以零
动手试一试

尺度处理

LIVE

观察距离计算前后可比性。

清晰度
60
可信度
40
可用度
45

大数值单位可能独占距离。

跟我算一遍价格标准化

价格 [20,30,50] 做 Min–Max。

STEP 01

min=20,max=50,范围=30。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01计算未作答

x=30,min=20,max=50,Min–Max 结果是多少?

02选择未作答

某列所有值都为 7,Min–Max 时会遇到什么?

03判断未作答

标准化后所有指标自动变成“越大越好”。

04简答未作答

为什么不能先用全数据算均值方差再划分测试集?

知识点05

正向、负向、适中与区间型

统一指标方向

约 9 min
先猜一猜

价格越低越好、满意度越高越好,怎样才能放进同一个综合得分?

正向指标越大越好;负向越小越好;适中型接近目标最好;区间型落在合理范围最好。

正向化把它们统一为“数值越大越优”,再进入赋权和评价。

别踩坑负向标准化方向写反适中型当正向指标
动手试一试

方向检查

LIVE

比较遗漏方向与正确转换。

清晰度
58
可信度
36
可用度
40

高价格可能被误当作更优。

跟我算一遍交货期负向化

交货期 [2,5,8] 天,越短越好,使用 max−x。

STEP 01

最大值 max=8。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01选择未作答

客户等待时间属于哪类指标?

02计算未作答

负向转换 y=max−x,原值 [2,5,8],结果?

03判断未作答

体温越高越好,因此体温是正向指标。

04简答未作答

转换后怎样做一个快速方向检查?

知识点06

每次修改都要能追溯

用质量报告留下证据

约 11 min
先猜一猜

清洗后少了 237 行,如果没人知道为什么,模型还能被信任吗?

质量报告记录原始规模、问题数量、处理规则、影响行数和处理后规模。它把“我清洗过了”变成可核查证据。

还应比较处理前后关键统计和目标变量分布,防止清洗改变研究对象。

别踩坑只展示处理后数据删除样本不记录原因
动手试一试

清洗透明度

LIVE

比较不可追溯与审计式清洗。

清晰度
55
可信度
25
可用度
30

结果可能干净,但无法重做。

跟我算一遍清洗审计

原始 10000 行,删除重复 120 行,修正单位 35 行,异常暂不删除。

STEP 01

分别记录规则与影响数量。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01选择未作答

质量报告中最不能缺少哪项?

02判断未作答

单位从克统一换成千克不会删行,因此无需记录。

03计算未作答

原始 10000 行,删除完全重复 120 行,再删除无法修复的 30 行,剩多少?

04简答未作答

为什么要比较清洗前后目标变量分布?

离开前完成

给一份脏数据建立可审计清洗链

选择一个含缺失、重复和异常的小数据集,从 Raw 到 Clean 全程用规则和日志完成。

LOCAL PACK

本地学习资源

讲义、练习、实验与挑战清单均在本地页面内。