分类是监督学习:历史样本有已知类别,模型学习特征到标签的映射。聚类是无监督学习:没有标准标签,寻找内部相似群组。
聚类结果是探索结构,不天然等于真实类别;需要业务命名与外部验证。
有标签且预测标签→分类;无标签发现分组→聚类;连续数值输出→回归。先定义输出,避免方法混用。
标签必须来自预测时之前且可信。用预测之后才知道的信息构造标签或特征,会造成泄漏。
区分有标签分类与无标签聚类,处理尺度与距离,读懂 K-means、层次聚类、判别模型和混淆矩阵。
分类与聚类的分界线
把客户分为高、中、低价值,如果历史上已有标签和没有标签,方法一样吗?
分类是监督学习:历史样本有已知类别,模型学习特征到标签的映射。聚类是无监督学习:没有标准标签,寻找内部相似群组。
聚类结果是探索结构,不天然等于真实类别;需要业务命名与外部验证。
有标签且预测标签→分类;无标签发现分组→聚类;连续数值输出→回归。先定义输出,避免方法混用。
标签必须来自预测时之前且可信。用预测之后才知道的信息构造标签或特征,会造成泄漏。
切换是否有标签。
聚类发现结构,但类别含义需解释。
历史设备标注正常/故障,预测新设备状态。
有已知标签,属于监督分类。
特征可用预测时已经获取的温度、振动等。
用训练/验证评估新设备识别。
若没有故障标签,只想发现运行模式,则改为聚类探索。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
有标签监督学习。
分类。已有类别标签,目标是预测新样本标签。
算法只给分组。
错误。类别编号任意,含义要根据特征、业务和外部证据解释。
标签质量决定上限。
含义明确且可靠;预测时不会把未来信息泄漏到特征或标签构造中。
看输出类型。
回归,因为输出是连续数值。
特征、编码与相似性
年龄范围 18–60、收入范围 2000–50000,欧氏距离主要听谁的?
K-means、KNN 和层次聚类常依赖距离。量纲大、范围大的特征会主导距离,因此通常要标准化。
类别特征不能随意编码成 1、2、3 后当连续距离;应使用独热编码或适合混合数据的距离。
欧氏距离 d=√Σj(xj−yj)²;标准化后各特征贡献更可比。特征选择应基于问题机制,重复特征会重复放大某方面。
分别用原始、标准化和不同特征子集聚类,比较结果稳定性;记录编码与距离选择。
比较原单位与尺度处理。
高量纲收入吞掉年龄差异。
客户 A/B 年龄差 5 岁,收入差 5000 元。
原始欧氏距离几乎完全由 5000 决定。
对年龄、收入分别标准化。
再计算距离,两个维度才可按相对偏离贡献。
标准化改变的是尺度,不会自动判断哪个特征更重要;业务权重仍需另行设置。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
勾股关系。
√(3²+4²)=5。
编号只是标签。
错误。编号没有自然数值距离,应使用独热编码或适当类别距离。
尺度可比。
避免单位和范围大的特征不成比例地主导距离。
重复维度会双重计票。
相同信息可能被重复计入距离,相当于给该方面更高隐性权重。
让类内平方距离尽量小
同一数据运行两次 K-means,为什么可能得到不同结果?
K-means 交替进行:把样本分给最近中心;用每类均值更新中心,直到稳定。
它需要预先给 K,对初始中心敏感,偏好近似球状、尺度相近的簇,容易受异常点影响。
目标最小化 SSE=ΣkΣxi∈Ck||xi−μk||²。使用 k-means++ 与多次随机初始化,选择较好且稳定结果。
报告标准化、K、随机种子、初始化次数、SSE 和每类中心/样本量。空类或极小类要检查。
比较单次与多次初始化。
可能落入较差局部结果。
一维点 1,2,8,9,初始中心 1 和 8。
1,2 分到中心 1;8,9 分到中心 8。
更新中心为 (1+2)/2=1.5 和 (8+9)/2=8.5。
再次分配不变,算法收敛。
两类为 {1,2} 与 {8,9}。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
K-means 中心是类内均值。
均值 (2+4+9)/3=5。
初始中心会影响路径。
错误。它可能收敛到不同局部结果,应多次初始化并检查稳定性。
紧凑的类。
类内样本到各自中心的平方距离和 SSE。
均值与平方惩罚。
均值中心和平方距离都对极端值敏感,异常点会拉动中心并可能单独形成小类。
改变聚类数 K,观察同一批二维样本如何被划分。
调整左侧参数,观察模型输出怎样变化。
K 增大时类内误差通常下降,为什么不能因此一直增大 K?从解释成本和业务用途回答。
拐点、轮廓与树状图共同判断
SSE 随 K 增加一定下降,为什么不能选 K=样本数?
肘部法观察 SSE 下降从快转慢的位置;轮廓系数同时看类内紧密和类间分离。
层次聚类逐步合并/拆分形成树状图,不必一开始固定 K,但链接方式会改变结果。
轮廓 s=(b−a)/max(a,b),接近 1 较好,接近 0 在边界,负值可能分错。K 还要满足业务可解释与每类样本量。
用 2–8 个 K 比较 SSE、轮廓、稳定性与业务画像,不能只凭一张肘部图。
比较单指标与多证据。
K 增大总会下降。
K=2/3/4 的轮廓为 0.51/0.62/0.60。
K=3 轮廓最高。
检查 K=3 各类样本量与特征中心。
若 K=3 业务也清楚,可优先选 3。
不是只看 0.02 差异,还要检查多次抽样稳定性。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
更多中心更容易靠近样本。
错误。K 增大通常使 SSE 不增、往往下降,因为可用更多中心拟合数据。
a 小、b 大。
类内紧密且与其他类分离较好。
统计结构要能业务使用。
避免产生只有极少样本、无法稳定解释或采取行动的碎片类别。
dendrogram。
树状图,展示样本或簇逐步合并的层级关系。
从边界到概率
分类器输出“高风险”,为什么还应该给概率或得分?
逻辑回归输出属于某类的概率,线性判别分析寻找能分开类别的线性组合,决策树用规则切分。
类别阈值决定灵敏度与特异度的取舍;0.5 不是永远正确。
二分类逻辑回归 p=1/(1+e^(−η)),η=β0+βᵀx。阈值 τ:p≥τ 判为正类。
先用简单可解释模型做基准。报告特征、预处理、概率校准和阈值选择依据。
比较标签、概率与阈值情景。
无法区分边界样本与高置信样本。
漏掉高风险代价很大。
模型先输出高风险概率。
降低阈值可识别更多高风险。
代价是误报增加,应结合业务成本选择。
阈值是决策参数,不是模型天生固定的 0.5。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
logistic 映射到 0–1。
类别概率,再通过阈值转成标签。
0.5 只是默认。
错误。阈值应根据漏报/误报代价、目标指标和验证集选择。
更容易判为正类。
可适当降低正类阈值,提高召回率,但会增加误报,需用验证数据量化取舍。
树的分支就是条件。
决策树。每条根到叶路径可解释为条件规则。
准确率可能掩盖少数类失败
1000 人只有 10 人患病,全部预测健康也有 99% 准确率,这模型有用吗?
混淆矩阵包含 TP、FP、TN、FN。准确率适合类别较平衡且错判代价相近;少数类问题更关注精确率、召回率、F1、PR-AUC。
交叉验证只在训练数据中选模型与参数,最终测试集留到最后一次评价。
Precision=TP/(TP+FP);Recall=TP/(TP+FN);F1=2PR/(P+R)。分层交叉验证保持各折类别比例。
报告类别分布、基准、混淆矩阵和至少两项关键指标;避免在测试集上反复调参。
比较准确率与代价导向指标。
类别不平衡时可能极度误导。
TP=8、FN=2、FP=12、TN=978。
召回=8/(8+2)=0.8。
精确率=8/(8+12)=0.4。
模型找出 80% 病例,但报警中只有 40% 真阳性。
是否可用取决于漏诊与复查成本,不能只看 98.6% 准确率。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
召回分母是真正正类。
40/(40+10)=0.8,即 80%。
精确率分母是预测正类。
30/(30+20)=0.6,即 60%。
先看类别比例。
错误。若正类仅 1%,全预测负类也有 99% 准确率,却一个正类都找不到。
测试集模拟真正未知。
反复用测试结果调参会把测试信息泄漏进模型选择,使最终评价偏乐观。
先在无标签特征上聚类画像,再选择一个真实标签训练简单分类器,比较两种任务。
讲义、练习、实验与挑战清单均在本地页面内。