MODEL LAB数学建模交互课
课程进度11/ 16 讲
第 11 讲 · 让数据自己分组,也让模型学会识别

第 11 讲 · 统计分类、聚类与判别

区分有标签分类与无标签聚类,处理尺度与距离,读懂 K-means、层次聚类、判别模型和混淆矩阵。

6 个微知识点24 道即时练习答案逐题隐藏无需联网运行
学完能做什么

可检查的学习目标

01
能区分监督分类与无监督聚类
02
能解释尺度、距离、K 值和聚类稳定性
03
能用混淆矩阵、交叉验证和类不平衡评价分类器
知识点01

分类与聚类的分界线

先问有没有已知标签

约 7 min
先猜一猜

把客户分为高、中、低价值,如果历史上已有标签和没有标签,方法一样吗?

分类是监督学习:历史样本有已知类别,模型学习特征到标签的映射。聚类是无监督学习:没有标准标签,寻找内部相似群组。

聚类结果是探索结构,不天然等于真实类别;需要业务命名与外部验证。

别踩坑把聚类编号当真相用结果变量构造特征
动手试一试

任务识别

LIVE

切换是否有标签。

清晰度
86
可信度
78
可用度
82

聚类发现结构,但类别含义需解释。

跟我算一遍设备故障

历史设备标注正常/故障,预测新设备状态。

STEP 01

有已知标签,属于监督分类。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01选择未作答

历史邮件已标注垃圾/正常,预测新邮件,属于?

02判断未作答

聚类得到的第 1 类就是现实中的“优质客户”。

03简答未作答

分类任务的标签应满足哪两点?

04选择未作答

预测连续销售额更接近?

知识点02

特征、编码与相似性

距离之前必须处理尺度

约 9 min
先猜一猜

年龄范围 18–60、收入范围 2000–50000,欧氏距离主要听谁的?

K-means、KNN 和层次聚类常依赖距离。量纲大、范围大的特征会主导距离,因此通常要标准化。

类别特征不能随意编码成 1、2、3 后当连续距离;应使用独热编码或适合混合数据的距离。

别踩坑类别编码当大小关系重复特征重复计权
动手试一试

距离可信度

LIVE

比较原单位与尺度处理。

清晰度
70
可信度
48
可用度
52

高量纲收入吞掉年龄差异。

跟我算一遍客户距离

客户 A/B 年龄差 5 岁,收入差 5000 元。

STEP 01

原始欧氏距离几乎完全由 5000 决定。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01计算未作答

两点 (0,0) 与 (3,4) 的欧氏距离是多少?

02判断未作答

把职业编码为 1=教师、2=护士、3=司机后,可直接认为司机离护士比离教师近。

03选择未作答

距离算法前标准化的主要目的?

04简答未作答

两个高度相似特征都保留会怎样?

知识点03

让类内平方距离尽量小

K-means:分配与更新

约 11 min
先猜一猜

同一数据运行两次 K-means,为什么可能得到不同结果?

K-means 交替进行:把样本分给最近中心;用每类均值更新中心,直到稳定。

它需要预先给 K,对初始中心敏感,偏好近似球状、尺度相近的簇,容易受异常点影响。

别踩坑只运行一次异常点不处理
动手试一试

K-means 稳定性

LIVE

比较单次与多次初始化。

清晰度
82
可信度
55
可用度
62

可能落入较差局部结果。

跟我算一遍一次迭代

一维点 1,2,8,9,初始中心 1 和 8。

STEP 01

1,2 分到中心 1;8,9 分到中心 8。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01计算未作答

一类样本为 2、4、9,新聚类中心是多少?

02判断未作答

K-means 每次随机初始化都保证同一个全局最优结果。

03选择未作答

K-means 的主要目标是最小化?

04简答未作答

异常点为什么会强烈影响 K-means?

本讲主实验 · 拖一拖再下结论

K 值如何改变分组

改变聚类数 K,观察同一批二维样本如何被划分。

实时更新
观察结果等待计算

调整左侧参数,观察模型输出怎样变化。

实验后想一想

K 增大时类内误差通常下降,为什么不能因此一直增大 K?从解释成本和业务用途回答。

知识点04

拐点、轮廓与树状图共同判断

选 K 与层次聚类

约 7 min
先猜一猜

SSE 随 K 增加一定下降,为什么不能选 K=样本数?

肘部法观察 SSE 下降从快转慢的位置;轮廓系数同时看类内紧密和类间分离。

层次聚类逐步合并/拆分形成树状图,不必一开始固定 K,但链接方式会改变结果。

别踩坑K 越大越好树状图切割高度随意
动手试一试

K 选择证据

LIVE

比较单指标与多证据。

清晰度
82
可信度
60
可用度
62

K 增大总会下降。

跟我算一遍K 的权衡

K=2/3/4 的轮廓为 0.51/0.62/0.60。

STEP 01

K=3 轮廓最高。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01判断未作答

K 增大时 K-means 的 SSE 一定上升。

02选择未作答

轮廓系数接近 1 通常表示?

03简答未作答

选 K 时为什么还要看每类样本量?

04选择未作答

层次聚类结果常用什么图展示?

知识点05

从边界到概率

分类与判别模型

约 9 min
先猜一猜

分类器输出“高风险”,为什么还应该给概率或得分?

逻辑回归输出属于某类的概率,线性判别分析寻找能分开类别的线性组合,决策树用规则切分。

类别阈值决定灵敏度与特异度的取舍;0.5 不是永远正确。

别踩坑把概率当确定事实用测试集调阈值
动手试一试

分类输出层次

LIVE

比较标签、概率与阈值情景。

清晰度
80
可信度
65
可用度
68

无法区分边界样本与高置信样本。

跟我算一遍风险阈值

漏掉高风险代价很大。

STEP 01

模型先输出高风险概率。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01选择未作答

逻辑回归的典型输出是?

02判断未作答

二分类阈值必须固定为 0.5。

03简答未作答

漏报代价很高时,阈值通常怎样调整?

04选择未作答

哪种模型通常最容易转成“如果…那么…”规则?

知识点06

准确率可能掩盖少数类失败

混淆矩阵与交叉验证

约 11 min
先猜一猜

1000 人只有 10 人患病,全部预测健康也有 99% 准确率,这模型有用吗?

混淆矩阵包含 TP、FP、TN、FN。准确率适合类别较平衡且错判代价相近;少数类问题更关注精确率、召回率、F1、PR-AUC。

交叉验证只在训练数据中选模型与参数,最终测试集留到最后一次评价。

别踩坑只报准确率测试集参与模型选择
动手试一试

评价完整度

LIVE

比较准确率与代价导向指标。

清晰度
82
可信度
48
可用度
55

类别不平衡时可能极度误导。

跟我算一遍疾病识别

TP=8、FN=2、FP=12、TN=978。

STEP 01

召回=8/(8+2)=0.8。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01计算未作答

TP=40、FN=10,召回率是多少?

02计算未作答

TP=30、FP=20,精确率是多少?

03判断未作答

99% 准确率一定说明分类器优秀。

04简答未作答

为什么最终测试集只能在最后使用一次?

离开前完成

同一数据做一次“聚类探索 + 分类验证”

先在无标签特征上聚类画像,再选择一个真实标签训练简单分类器,比较两种任务。

LOCAL PACK

本地学习资源

讲义、练习、实验与挑战清单均在本地页面内。