因变量 y 是要解释或预测的结果,自变量 x 是候选解释信息。散点图能先发现方向、曲线、分组、异常点和方差变化。
相关系数主要衡量线性关系;U 形关系可能相关接近 0,却有明显非线性结构。
画散点时每个点是一条观测。检查:方向、形状、强度、异常、分组、随 x 变化的离散程度。
先做单变量散点与分组着色,再决定线性、变换、分段或加入分类变量。不要直接把全部列塞进回归。
变量角色与关系形状
相关系数接近 0,两个变量就一定没有关系吗?
因变量 y 是要解释或预测的结果,自变量 x 是候选解释信息。散点图能先发现方向、曲线、分组、异常点和方差变化。
相关系数主要衡量线性关系;U 形关系可能相关接近 0,却有明显非线性结构。
画散点时每个点是一条观测。检查:方向、形状、强度、异常、分组、随 x 变化的离散程度。
先做单变量散点与分组着色,再决定线性、变换、分段或加入分类变量。不要直接把全部列塞进回归。
比较先算系数与先看形状。
可能错过曲线和分组结构。
散点呈 U 形:低温和高温用电都高。
简单直线可能斜率接近 0。
加入温度平方项或分段变量。
检查残差是否仍呈曲线。
“线性相关低”不等于“没有关系”,而是直线不足以描述。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
谁是结果 y?
销量。它是希望解释或预测的结果。
U 形是典型反例。
错误。它只说明线性相关弱;仍可能存在非线性关系或分组关系。
先描述点云。
方向、形状、强度、异常点;还应看分组和方差是否随 x 改变。
数字外观不等于数值意义。
连续数值解释变量。编号大小通常没有数量含义。
让残差平方和最小
为什么回归线不要求穿过每一个数据点?
简单线性回归写成 y=β0+β1x+ε。每个观测的残差 e=y−ŷ,最小二乘选择系数使残差平方和最小。
平方会让正负残差不互相抵消,并对大偏差给予更高代价。
β1=Σ(x−x̄)(y−ȳ)/Σ(x−x̄)²,β0=ȳ−β1x̄。拟合线经过样本均值点 (x̄,ȳ)。
用软件拟合,也要用 3–4 个点手算斜率或检查均值点,验证列顺序和单位没有错。
比较三种“最好”的定义。
正负会抵消,坏模型也可能和为 0。
点 (1,2)、(2,4)、(3,6)。
x̄=2,ȳ=4。
协方差型分子=4,x 离均差平方和=2。
β1=2,β0=0。
拟合为 ŷ=2x,三个点残差均为 0。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
代入回归方程。
ŷ=3+2×4=11。
它表示模型没解释掉的纵向偏差。
观测值−预测值,即 e=y−ŷ。
注意“平方”。
错误。含截距时残差和常为 0;目标是残差平方和最小。
直接与 y=β0+β1x 对照。
斜率 5,截距 −1,且理想情况下残差为 0。
单位、控制条件与适用范围
斜率为 2.5,能不能只写“x 对 y 有正影响”?
简单回归中,x 每增加 1 个单位,y 的条件均值平均改变 β1 个单位。多元回归中要加“其他变量保持不变”。
截距是 x=0 时的预测均值;若 x=0 不在数据范围内,它可能只用于定位直线,不必强行解释。
解释模板:在样本与模型适用范围内,其他变量保持不变时,x 每增加 1[单位],y 平均增加/减少 β[单位]。
系数表给估计值、标准误、置信区间、p 值与单位解释。标准化系数与原单位系数不要混说。
比较含糊、完整与因果克制。
缺幅度、单位和条件。
销量=20+3.2×温度,温度单位 ℃、销量单位杯/日。
斜率 3.2 的单位是杯/日/℃。
温度每高 1℃,日销量平均高 3.2 杯。
这是观测关联,若无实验或因果设计,不写“导致”。
范围外外推(如 60℃)没有依据,即使公式能计算。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
方向、幅度、单位、范围。
在样本价格范围内,价格每增加 1 元,销量平均减少约 1.8 件;若为多元模型,应加其他变量不变。
数学角色和业务含义可不同。
错误。x=0 可能不在观测范围,截距仍用于拟合定位;应谨慎解释而非否定整个模型。
控制其他列。
其他变量保持不变。该系数是条件关联。
相关不等于因果。
观测关联可能来自混杂、反向因果或选择偏差;因果结论需要实验或更强识别设计。
调整真实斜率、截距和噪声,观察散点、拟合线与 R² 的变化。
调整左侧参数,观察模型输出怎样变化。
保持斜率不变,只增大噪声。系数含义是否改变?R² 和预测可靠性怎样变化?
一个总分不够判断模型
R²=0.95 的模型,为什么预测仍可能很差?
R² 表示样本中 y 变异被模型解释的比例,但高 R² 不保证关系正确、残差良好或未来预测准确。
残差图应像无结构的随机带;曲线提示非线性,漏斗提示异方差,孤立点提示异常或高影响观测。
R²=1−SSE/SST。检查残差—拟合值图、正态性(用于推断)、独立性、异方差、高杠杆与影响点。
同时报告 R²、调整 R²、RMSE/MAE 和残差图。变量增加后 R² 不降,但调整 R² 可能下降。
比较只报 R² 与多指标诊断。
可能隐藏非线性和外推风险。
拟合直线后残差呈明显 U 形。
U 形说明中间被高估、两端被低估或相反。
考虑平方项、变换或分段。
重新拟合后再次检查残差。
即使原 R² 不低,系统残差说明直线形式仍不充分。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
漏斗描述散布宽度变化。
异方差:误差波动随拟合值增大或减小。
区分普通和调整 R²。
错误。普通 R² 通常不下降;调整 R² 会对无用变量进行惩罚,可能下降。
代入定义。
R²=1−20/100=0.8。
高总分不能替代诊断。
残差结构、留出预测误差、异常/影响点;还要看外推范围、变量合理性与数据泄漏。
统计证据不等于实际重要
p<0.001 的系数一定有很大实际作用吗?
p 值衡量在特定零假设和模型条件下,当前或更极端统计量的相容程度,不代表效应大小。
混杂变量同时关联 x 与 y,会让系数误导;高度相关的自变量会造成多重共线,使系数不稳定、标准误变大。
同时看估计值、置信区间、p 值和实际单位。共线可用相关矩阵、VIF 检查;混杂需靠问题机制和设计识别。
先画因果/机制草图再选控制变量。不要为了 p<0.05 反复筛变量而不说明过程。
比较只看 p 值与机制分析。
忽略效应大小与模型选择过程。
两者夏季同时增加。
直接回归可能得到显著正关系。
气温同时影响冰淇淋销量与游泳活动,是混杂变量。
控制季节/气温后,原关系可能减弱。
显著关联不等于冰淇淋导致溺水。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
显著性与实际意义不同。
错误。大样本下很小效应也可能显著,应结合系数大小、单位和置信区间。
VIF 衡量系数方差膨胀。
多重共线性,即自变量之间高度线性相关。
气温是经典例子。
同时与解释变量和结果变量相关,并可能造成二者表面关联偏差的第三变量。
统计与实际意义都要呈现。
报告系数、置信区间并解释实际单位。
插值谨慎,外推更谨慎
在 10–30℃ 数据上拟合的直线,能放心预测 60℃ 吗?
训练误差衡量拟合,测试误差衡量未见数据表现。时间数据要按时间先后划分,不能随机打乱未来。
点预测只是中心估计;预测区间表达单个未来观测的不确定性,通常比均值置信区间更宽。
常用误差 MAE、RMSE、MAPE。外推超出自变量观测范围,依赖更强假设。比较模型时使用同一测试集与同一指标。
保留简单基准,例如均值、上期值。复杂模型若不能稳定超过基准,就不要只因“高级”而使用。
比较训练拟合、测试评估与区间。
可能严重乐观。
24 个月数据预测第 25–27 月。
用前 18 个月训练,19–24 月验证。
与“用上月值预测本月”基准比较。
选定后用截至 24 月数据重训,给点预测和区间。
模型选择依据来自模拟未来的验证,而不是训练拟合。
答案默认隐藏。聚焦题卡后按 ↓ 或 Space,一次只揭晓一道。
未来不能泄漏给过去。
前段训练、后段验证,保持时间顺序模拟真实未来。
预测一个人比估计平均更不确定。
错误。单个未来观测还包含随机误差,预测区间通常更宽。
取绝对值后平均。
绝对误差为 2 和 3,MAE=(2+3)/2=2.5。
没有基准就不知道好多少。
判断复杂模型是否真正带来增益;若连上期值或均值都不如,复杂度没有实际价值。
选择一个结果变量和 2–4 个解释变量,完成探索、拟合、诊断与留出验证。
讲义、练习、实验与挑战清单均在本地页面内。