MODEL LAB数学建模交互课
课程进度07/ 16 讲
第 7 讲 · 用关系回答影响与预测

第 7 讲 · 回归分析与预测解释

从散点图、最小二乘和系数解释,到残差、显著性、混杂、验证与预测区间,避免把一条拟合线写成因果定律。

6 个微知识点24 道即时练习答案逐题隐藏无需联网运行
学完能做什么

可检查的学习目标

01
能根据散点图判断线性关系是否合理
02
能解释回归系数、R²、残差与显著性
03
能用留出数据评价预测并避免因果过度解读
知识点01

变量角色与关系形状

先画散点,再谈回归

约 7 min
先猜一猜

相关系数接近 0,两个变量就一定没有关系吗?

因变量 y 是要解释或预测的结果,自变量 x 是候选解释信息。散点图能先发现方向、曲线、分组、异常点和方差变化。

相关系数主要衡量线性关系;U 形关系可能相关接近 0,却有明显非线性结构。

别踩坑不看图直接拟合把编号列当连续自变量
动手试一试

建模起点

LIVE

比较先算系数与先看形状。

清晰度
68
可信度
52
可用度
58

可能错过曲线和分组结构。

跟我算一遍气温与用电

散点呈 U 形:低温和高温用电都高。

STEP 01

简单直线可能斜率接近 0。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01选择未作答

要研究广告费对销量的关系,通常哪个是因变量?

02判断未作答

皮尔逊相关系数为 0,说明两个变量完全独立。

03简答未作答

散点图至少应检查哪四项?

04选择未作答

学生编号最不适合直接作为哪种变量?

知识点02

让残差平方和最小

最小二乘拟合一条线

约 9 min
先猜一猜

为什么回归线不要求穿过每一个数据点?

简单线性回归写成 y=β0+β1x+ε。每个观测的残差 e=y−ŷ,最小二乘选择系数使残差平方和最小。

平方会让正负残差不互相抵消,并对大偏差给予更高代价。

别踩坑把残差写成 ŷ−y 后混用误以为误差和必须最小
动手试一试

拟合目标

LIVE

比较三种“最好”的定义。

清晰度
70
可信度
38
可用度
50

正负会抵消,坏模型也可能和为 0。

跟我算一遍三点直线

点 (1,2)、(2,4)、(3,6)。

STEP 01

x̄=2,ȳ=4。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01计算未作答

模型 ŷ=3+2x,x=4 时预测值是多少?

02选择未作答

残差的定义通常是?

03判断未作答

最小二乘让所有残差之和达到最小。

04计算未作答

点恰好满足 y=5x−1,回归斜率和截距应是多少?

知识点03

单位、控制条件与适用范围

正确解释系数

约 11 min
先猜一猜

斜率为 2.5,能不能只写“x 对 y 有正影响”?

简单回归中,x 每增加 1 个单位,y 的条件均值平均改变 β1 个单位。多元回归中要加“其他变量保持不变”。

截距是 x=0 时的预测均值;若 x=0 不在数据范围内,它可能只用于定位直线,不必强行解释。

别踩坑忽略单位把关联写成因果
动手试一试

系数表述质量

LIVE

比较含糊、完整与因果克制。

清晰度
62
可信度
55
可用度
50

缺幅度、单位和条件。

跟我算一遍温度系数

销量=20+3.2×温度,温度单位 ℃、销量单位杯/日。

STEP 01

斜率 3.2 的单位是杯/日/℃。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01简答未作答

模型 销量=50−1.8×价格,如何解释斜率?

02判断未作答

截距没有现实含义时,回归模型一定无效。

03选择未作答

多元回归解释某个系数时最关键的限定是?

04简答未作答

为什么不能直接把正系数写成“x 导致 y 增加”?

本讲主实验 · 拖一拖再下结论

斜率、噪声与拟合强度

调整真实斜率、截距和噪声,观察散点、拟合线与 R² 的变化。

实时更新
观察结果等待计算

调整左侧参数,观察模型输出怎样变化。

实验后想一想

保持斜率不变,只增大噪声。系数含义是否改变?R² 和预测可靠性怎样变化?

知识点04

一个总分不够判断模型

R² 与残差诊断

约 7 min
先猜一猜

R²=0.95 的模型,为什么预测仍可能很差?

R² 表示样本中 y 变异被模型解释的比例,但高 R² 不保证关系正确、残差良好或未来预测准确。

残差图应像无结构的随机带;曲线提示非线性,漏斗提示异方差,孤立点提示异常或高影响观测。

别踩坑只追求最高 R²删除影响点不说明
动手试一试

诊断证据

LIVE

比较只报 R² 与多指标诊断。

清晰度
78
可信度
55
可用度
58

可能隐藏非线性和外推风险。

跟我算一遍残差弯曲

拟合直线后残差呈明显 U 形。

STEP 01

U 形说明中间被高估、两端被低估或相反。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01选择未作答

残差图呈漏斗形最常提示?

02判断未作答

增加任何自变量都会使普通 R² 下降。

03计算未作答

SSE=20,SST=100,R² 是多少?

04简答未作答

R² 很高仍需检查哪三项?

知识点05

统计证据不等于实际重要

显著性、混杂与多重共线

约 9 min
先猜一猜

p<0.001 的系数一定有很大实际作用吗?

p 值衡量在特定零假设和模型条件下,当前或更极端统计量的相容程度,不代表效应大小。

混杂变量同时关联 x 与 y,会让系数误导;高度相关的自变量会造成多重共线,使系数不稳定、标准误变大。

别踩坑p 值当效应大小把所有相关变量都控制
动手试一试

证据解释

LIVE

比较只看 p 值与机制分析。

清晰度
72
可信度
52
可用度
58

忽略效应大小与模型选择过程。

跟我算一遍冰淇淋与溺水

两者夏季同时增加。

STEP 01

直接回归可能得到显著正关系。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01判断未作答

p=0.001 表示效应一定很大。

02选择未作答

VIF 很高通常提示?

03简答未作答

什么是混杂变量?

04选择未作答

以下哪种报告最完整?

知识点06

插值谨慎,外推更谨慎

预测要留出数据与区间

约 11 min
先猜一猜

在 10–30℃ 数据上拟合的直线,能放心预测 60℃ 吗?

训练误差衡量拟合,测试误差衡量未见数据表现。时间数据要按时间先后划分,不能随机打乱未来。

点预测只是中心估计;预测区间表达单个未来观测的不确定性,通常比均值置信区间更宽。

别踩坑随机切分时间序列只给点预测
动手试一试

预测可信度

LIVE

比较训练拟合、测试评估与区间。

清晰度
80
可信度
48
可用度
52

可能严重乐观。

跟我算一遍月销量预测

24 个月数据预测第 25–27 月。

STEP 01

用前 18 个月训练,19–24 月验证。

立即练习

学一点,马上做 4 题

答案默认隐藏。聚焦题卡后按 Space,一次只揭晓一道。

01选择未作答

时间序列预测最合理的划分是?

02判断未作答

预测区间和回归均值的置信区间一样宽。

03计算未作答

测试真实值 [10,20],预测 [12,17],MAE 是多少?

04简答未作答

为什么一定要和简单基准比较?

离开前完成

完成一份不过度解释的回归小报告

选择一个结果变量和 2–4 个解释变量,完成探索、拟合、诊断与留出验证。

LOCAL PACK

本地学习资源

讲义、练习、实验与挑战清单均在本地页面内。