第四节

数理统计基础

总体与样本 · 样本均值 · 样本方差

总体 抽样 样本
1
从概率到统计 —— 为什么需要数理统计?
在前面的学习中,我们学习了概率论:已知分布 → 推算结果的可能性。例如已知一枚硬币正面概率为 $\frac{1}{2}$ ,可以算出抛10次恰好5次正面的概率。
但实际中,我们往往不知道分布!比如:一批灯泡的平均寿命是多少?某药物的治愈率是多少?这时候就需要数理统计从数据出发,反推总体的特征
概率论(正问题)
已知分布 $\longrightarrow$ 推算概率
数理统计(逆问题)
观测数据 $\longrightarrow$ 推断分布
已知分布 X ~ N(100, 25) 计算 概率结果 P(X > 110) = ? 观测数据 98, 102, 97, ... 推断 总体特征 μ ≈ ?, σ² ≈ ? 💡 生活中的例子 抽查100个灯泡测寿命 → 估计这批灯泡的平均寿命 → 估计寿命的波动程度
2
总体与个体
总体:研究对象的某项数量指标的全体,记为 $X$。
个体:总体中的每一个研究对象。
总体容量:总体中包含的个体总数,记为 $N$ 。
关键理解:总体可以看成一个随机变量 $X$ ,它有自己的分布。我们的目标是通过抽样来了解这个分布的特征(如均值 $\mu$ 、方差 $\sigma^2$)。
🔍 具体例子
场景总体个体
检查灯泡寿命全部灯泡的寿命每个灯泡的寿命
了解学生身高全部学生的身高每个学生的身高
零件直径检测全部零件的直径每个零件的直径
总体 X(如:全部灯泡寿命) 每个蓝点 = 一个个体
⚠️ 注意:总体关注的是数量指标(如寿命、身高、直径),而不是对象本身。所以总体 $X$ 就是一个随机变量。
3
样本与抽样
样本:从总体中抽取的 $n$ 个个体 $X_1, X_2, \cdots, X_n$ 称为样本,$n$ 称为样本容量
实际观测后得到的具体数值 $x_1, x_2, \cdots, x_n$ 称为样本观测值
简单随机样本需要满足两个条件:
代表性:每个 $X_i$ 与总体 $X$ 同分布(抽到的能代表整体);
独立性:$X_1, X_2, \cdots, X_n$ 相互独立(每次抽取互不影响)。
总体 X (容量 N,很大) 随机抽取 n 个 样本 (容量 n) X₁ X₂ X₃ Xₙ 每个 Xᵢ 与总体 X 同分布,且相互独立 ✓ 代表性 + 独立性 = 简单随机样本
通俗理解:想知道一锅汤咸不咸,不需要把整锅喝完——搅匀后尝一勺就够了。这一勺就是"样本",整锅汤就是"总体"。
4
统计量 —— 从样本提取信息
统计量:样本 $X_1, X_2, \cdots, X_n$ 的函数(不含任何未知参数),称为统计量
有了样本数据之后,我们需要对数据进行"加工"来提取有用的信息。最常用的两个统计量是:
📊 样本均值
$\bar{X} = \dfrac{1}{n}\displaystyle\sum_{i=1}^{n}X_i$
反映数据的"中心位置"
📐 样本方差
$S^2 = \dfrac{1}{n-1}\displaystyle\sum_{i=1}^{n}(X_i - \bar{X})^2$
反映数据的"波动程度"
🎯 统计量的作用:搭建"样本 → 总体"的桥梁 样本数据 x₁, x₂, ..., xₙ 计算统计量 x̄ = ?, S² = ? (对数据加工提炼) 推断总体参数 μ ≈ x̄, σ² ≈ S²
5
样本均值 —— 数据的"重心"
$\bar{X} = \dfrac{1}{n}\displaystyle\sum_{i=1}^{n}X_i = \dfrac{X_1 + X_2 + \cdots + X_n}{n}$
样本均值就是把所有数据加起来再除以个数——和我们熟悉的"平均数"完全一样。它用来估计总体的均值 $\mu = E(X)$ 。
重要性质
无偏性:$E(\bar{X}) = \mu$
样本均值的期望恰好等于总体均值,没有系统偏差。
方差递减:$D(\bar{X}) = \dfrac{\sigma^2}{n}$
样本量 $n$ 越大,$\bar{X}$ 的波动越小,估计越精确。
96 98 100 102 104 97 99 101 103 x̄ = 100 样本均值 = 数据的"平衡点"
6
例题 —— 计算样本均值
 随机抽取10只灯泡,测得寿命(单位:小时)如下:
1050, 980, 1100, 1020, 1080, 950, 1060, 1000, 1030, 1070
求这组数据的样本均值 $\bar{x}$ 。
第一步:确认样本容量
共有 $n = 10$ 个数据。
第二步:求和
$\displaystyle\sum_{i=1}^{10}x_i = 1050 + 980 + 1100 + 1020 + 1080 + 950 + 1060 + 1000 + 1030 + 1070 = 10340$
第三步:代入公式
$\bar{x} = \dfrac{1}{n}\displaystyle\sum_{i=1}^{n}x_i = \dfrac{10340}{10} = 1034$
结论:这10只灯泡的样本均值为 $\bar{x} = 1034$ 小时。这意味着我们估计这批灯泡的平均寿命大约为 1034 小时
7
样本方差 —— 数据的"离散程度"
$S^2 = \dfrac{1}{n-1}\displaystyle\sum_{i=1}^{n}(X_i - \bar{X})^2$
样本方差衡量数据围绕均值的波动大小。方差越大,数据越分散;方差越小,数据越集中。
样本标准差为 $S = \sqrt{S^2}$,与原始数据量纲相同,更便于直观理解。
方差小 → 数据集中 S² 小
方差大 → 数据分散 S² 大
⚠️ 公式中除以的是 $n-1$ 而不是 $n$!这是本节的重点,下一页将详细解释原因。
8
为什么除以 n−1 ?—— 无偏性
这是同学们最常问的问题!我们来仔细看看。
❌ 如果除以 n
$\tilde{S}^2 = \dfrac{1}{n}\displaystyle\sum_{i=1}^{n}(X_i - \bar{X})^2$
$E(\tilde{S}^2) = \dfrac{n-1}{n}\sigma^2 < \sigma^2$ 偏小!
✅ 除以 n−1
$S^2 = \dfrac{1}{n-1}\displaystyle\sum_{i=1}^{n}(X_i - \bar{X})^2$
$E(S^2) = \sigma^2$ 刚好!无偏!
无偏性是指:如果我们反复抽样、反复计算 $S^2$,那么 $S^2$ 的平均值恰好等于总体方差 $\sigma^2$,没有系统性偏差
💡 直观理解 "自由度" 有 n 个数据 x₁, x₂, ..., xₙ,已知它们的均值 x̄ 后: 前 n−1 个数据可以自由变化,但第 n 个就被 x̄ "锁定" 了。 例如:x₁ = 3, x₂ = 5, x̄ = 4 → 只有 2 个数据,却只有 1 个能自由取值。 所以 "自由度" = n − 1,除以 n−1 才能得到无偏估计。 自由 自由 自由 锁定 n−1 个自由 + 1 个被锁定
9
交互实验 —— 亲眼看到无偏性
从总体 $N(100, 25)$(均值 $\mu=100$,方差 $\sigma^2=25$)中反复抽样,比较除以 $n$ 和除以 $n-1$ 的结果。
样本量 $n$: 5
已抽样:0 次
📈 累计统计
除以 $n$ 的均值:
除以 $n-1$ 的均值:
总体真实方差 $\sigma^2$:25
💡 多次抽样后观察:红线(除以 $n$)总是低于蓝虚线(真值),而绿线(除以 $n-1$)会趋向蓝虚线。
10
样本方差的简化计算公式
在实际计算中,逐个算 $(x_i - \bar{x})^2$ 再求和比较麻烦,我们常用下面的简化公式
$S^2 = \dfrac{1}{n-1}\left(\displaystyle\sum_{i=1}^{n}x_i^2 - n\bar{x}^2\right)$
推导过程(了解即可):
$\displaystyle\sum_{i=1}^{n}(x_i - \bar{x})^2 = \sum_{i=1}^{n}(x_i^2 - 2x_i\bar{x} + \bar{x}^2) = \sum_{i=1}^{n}x_i^2 - 2\bar{x}\sum_{i=1}^{n}x_i + n\bar{x}^2 = \sum_{i=1}^{n}x_i^2 - n\bar{x}^2$
其中用到了 $\displaystyle\sum_{i=1}^{n}x_i = n\bar{x}$
计算步骤:① 算出 $\bar{x}$ → ② 算出 $\displaystyle\sum x_i^2$(每个数据平方再求和) → ③ 代入简化公式
⚠️ 牢记:样本方差 $S^2$ 除以的是 $n-1$;样本均值 $\bar{x}$ 除以的是 $n$。不要混淆!
11
例题 —— 计算样本均值与样本方差
 10只灯泡寿命(小时):1050, 980, 1100, 1020, 1080, 950, 1060, 1000, 1030, 1070 。
求样本均值 $\bar{x}$ 和样本方差 $S^2$ 。
Step 1 $n = 10$,先求均值:$\bar{x} = \dfrac{1050 + 980 + \cdots + 1070}{10} = \dfrac{10340}{10} = 1034$
Step 2 计算每个 $x_i^2$ 并求和:
$\displaystyle\sum_{i=1}^{10}x_i^2 = 1050^2 + 980^2 + 1100^2 + \cdots + 1070^2 = 10\,693\,800$
Step 3 代入简化公式:
$S^2 = \dfrac{1}{n-1}\!\left(\displaystyle\sum x_i^2 - n\bar{x}^2\right) = \dfrac{1}{9}(10\,693\,800 - 10 \times 1034^2)$
Step 4 计算 $n\bar{x}^2 = 10 \times 1034^2 = 10 \times 1\,069\,156 = 10\,691\,560$
Step 5 $S^2 = \dfrac{10\,693\,800 - 10\,691\,560}{9} = \dfrac{2240}{9} \approx 248.9$
结论:$\bar{x} = 1034$ 小时,$S^2 \approx 248.9$(小时²),$S \approx 15.8$ 小时。
说明这批灯泡平均寿命约1034小时,各灯泡寿命与均值的偏差大约在15.8小时左右。
12
交互可视化 —— 样本直方图与统计量
拖动滑块改变参数,观察从正态总体 $N(\mu, \sigma^2)$ 抽样后的直方图及统计量变化。
$\mu$:100
$\sigma$:5
$n$:30
当前样本统计量
样本均值 $\bar{x}$ =
样本方差 $S^2$ =
样本标准差 $S$ =
总体均值 $\mu$ = 100
总体方差 $\sigma^2$ = 25
13
题型一 —— 根据数据求样本均值和样本方差
🎯 方法总结:给一组具体数据 $x_1, x_2, \cdots, x_n$,先求 $\bar{x} = \dfrac{\sum x_i}{n}$,再求 $S^2 = \dfrac{1}{n-1}\!\left(\sum x_i^2 - n\bar{x}^2\right)$ 。
练习1 某食品包装标准重量500g。抽取5袋,测得重量为:$498, 502, 500, 504, 496$(单位:g)。求样本均值和样本方差。
Step 1 $n = 5$
Step 2 $\bar{x} = \dfrac{498 + 502 + 500 + 504 + 496}{5} = \dfrac{2500}{5} = 500$ (g)
Step 3 $\displaystyle\sum x_i^2 = 498^2 + 502^2 + 500^2 + 504^2 + 496^2 = 248\,004 + 252\,004 + 250\,000 + 254\,016 + 246\,016 = 1\,250\,040$
Step 4 $S^2 = \dfrac{1}{4}(1\,250\,040 - 5 \times 500^2) = \dfrac{1\,250\,040 - 1\,250\,000}{4} = \dfrac{40}{4} = 10$ (g²)
结论:$\bar{x} = 500$ g,$S^2 = 10$ g²,$S \approx 3.16$ g 。
样本均值正好等于标准重量,但存在波动,标准差约3.16g。
14
题型二 —— 已知统计量反求参数
🎯 方法总结:利用关系式 $\bar{x} = \dfrac{\sum x_i}{n}$ 和 $S^2 = \dfrac{1}{n-1}(\sum x_i^2 - n\bar{x}^2)$,已知其中部分量反推其余。
练习2 已知一组样本数据 $n = 36$,$\bar{x} = 168$ cm,$S = 6$ cm。求 $\displaystyle\sum_{i=1}^{36}x_i$ 和 $\displaystyle\sum_{i=1}^{36}x_i^2$ 。
Step 1 由 $\bar{x} = \dfrac{\sum x_i}{n}$,得 $\displaystyle\sum_{i=1}^{36}x_i = n\bar{x} = 36 \times 168 = 6048$
Step 2 $S^2 = S^2 = 6^2 = 36$
Step 3 由 $S^2 = \dfrac{1}{n-1}(\sum x_i^2 - n\bar{x}^2)$ 得:
$\displaystyle\sum x_i^2 = (n-1)S^2 + n\bar{x}^2 = 35 \times 36 + 36 \times 168^2 = 1260 + 1\,016\,064 = 1\,017\,324$
结论:$\displaystyle\sum_{i=1}^{36}x_i = 6048$,$\displaystyle\sum_{i=1}^{36}x_i^2 = 1\,017\,324$
15
题型三 —— 矩估计的基本思想
矩估计法(点估计):用样本的统计量来估计总体的未知参数。
核心思想非常直观:用 $\bar{x}$ 估计 $\mu$,用 $S^2$ 估计 $\sigma^2$ 。
$\hat{\mu} = \bar{x}$, $\hat{\sigma}^2 = S^2$
为什么能这样估计?因为它们具有无偏性:$E(\bar{X}) = \mu$,$E(S^2) = \sigma^2$。
练习3 某种零件长度(mm)的10个测量值为:15.1, 14.9, 15.2, 15.0, 14.8, 15.3, 15.0, 14.7, 15.1, 14.9 。试估计该种零件长度的均值 $\mu$ 和方差 $\sigma^2$ 。
Step 1 $\bar{x} = \dfrac{15.1 + 14.9 + 15.2 + 15.0 + 14.8 + 15.3 + 15.0 + 14.7 + 15.1 + 14.9}{10} = \dfrac{150.0}{10} = 15.00$
Step 2 $\displaystyle\sum x_i^2 = 15.1^2 + 14.9^2 + \cdots + 14.9^2 = 2250.10$
Step 3 $S^2 = \dfrac{1}{9}(2250.10 - 10 \times 15.00^2) = \dfrac{2250.10 - 2250.00}{9} = \dfrac{0.10}{9} \approx 0.0111$
结论:$\hat{\mu} = \bar{x} = 15.00$ mm,$\hat{\sigma}^2 = S^2 \approx 0.011$ mm² 。
说明该零件长度均值约15mm,波动很小(标准差仅约0.1mm),加工精度较高。
16
练习 —— 100个零件重量的统计推断
练习4 抽取100个零件,测得重量的样本均值 $\bar{x} = 50.2$ g,样本标准差 $S = 3$ g。
(1)估计总体均值 $\mu$ 和总体方差 $\sigma^2$;
(2)求 $\displaystyle\sum_{i=1}^{100}x_i$ 和 $\displaystyle\sum_{i=1}^{100}x_i^2$ 。
(1)矩估计:$\hat{\mu} = \bar{x} = 50.2$ g,$\hat{\sigma}^2 = S^2 = 3^2 = 9$ g²
(2)求 $\sum x_i$:$\displaystyle\sum_{i=1}^{100}x_i = n\bar{x} = 100 \times 50.2 = 5020$
求 $\sum x_i^2$:由公式 $S^2 = \dfrac{1}{n-1}(\sum x_i^2 - n\bar{x}^2)$ 得:
$\displaystyle\sum x_i^2 = (n-1)S^2 + n\bar{x}^2 = 99 \times 9 + 100 \times 50.2^2 = 891 + 252\,004 = 252\,895$
结论:$\hat{\mu} = 50.2$ g,$\hat{\sigma}^2 = 9$ g²,$\sum x_i = 5020$,$\sum x_i^2 = 252\,895$
17
练习 —— 捉放法估计鱼数(矩估计应用)
练习5 为估计湖中鱼的总数 $N$,先捕100条鱼做标记后放回。过一段时间再捕80条,其中有2条带标记。试估计湖中鱼的总数。
思路:标记鱼在总体中的比例应该和在样本中的比例近似相等——这就是矩估计的思想!
建立等式:总体中标记鱼的比例 $= \dfrac{100}{N}$,样本中标记鱼的比例 $= \dfrac{2}{80}$
令两个比例相等:$\dfrac{100}{N} = \dfrac{2}{80}$,解得 $N = \dfrac{100 \times 80}{2} = 4000$
结论:估计湖中约有 4000 条鱼
这就是著名的"捉放法",本质上是用样本比例来估计总体比例,是矩估计思想的自然应用。
湖中 N 条鱼 🔴 = 标记鱼(100条) 再捕80条 样本:80条 其中 🔴 2条有标记 2/80 ≈ 100/N
Ex
补充例题 1:样本均值的分布
题目:从总体 \(N(\mu, \sigma^2)\) 中抽取容量为 \(n\) 的简单随机样本,问样本均值 \(\bar{X}\) 服从什么分布?
解:由正态分布的可加性和样本均值的定义:
\(\bar{X} = \dfrac{1}{n}\sum_{i=1}^{n} X_i\),其中 \(X_i \sim N(\mu, \sigma^2)\) 独立同分布。
\(E(\bar{X}) = \mu\),\(D(\bar{X}) = \dfrac{\sigma^2}{n}\)
结论:\(\bar{X} \sim N\!\left(\mu,\, \dfrac{\sigma^2}{n}\right)\)
Ex
补充例题 2:计算样本均值与样本方差
题目:有一组样本观测值 \(1, 3, 5, 7, 9\),求样本均值 \(\bar{x}\) 和样本方差 \(S^2\)。
解:\(n = 5\)
\(\bar{x} = \dfrac{1+3+5+7+9}{5} = \dfrac{25}{5} = 5\)
\(S^2 = \dfrac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar{x})^2 = \dfrac{(1-5)^2+(3-5)^2+(5-5)^2+(7-5)^2+(9-5)^2}{4}\)
\(= \dfrac{16+4+0+4+16}{4} = \dfrac{40}{4} = 10\)
结果:\(\bar{x} = 5\),\(S^2 = 10\)
18
本节小结
📌 核心概念
概念含义
总体 $X$研究对象全体的数量指标
样本从总体中抽取的 $n$ 个独立同分布个体
统计量样本的函数(不含未知参数)
样本均值 $\bar{X}$$\dfrac{1}{n}\sum X_i$,估计 $\mu$
样本方差 $S^2$$\dfrac{1}{n-1}\sum(X_i-\bar{X})^2$,估计 $\sigma^2$
🔑 关键公式
$\bar{x} = \dfrac{1}{n}\displaystyle\sum_{i=1}^{n}x_i$
$S^2 = \dfrac{1}{n-1}\displaystyle\sum_{i=1}^{n}(x_i - \bar{x})^2$
$S^2 = \dfrac{1}{n-1}\!\left(\displaystyle\sum x_i^2 - n\bar{x}^2\right)$
⭐ 无偏性
$E(\bar{X}) = \mu$,$E(S^2) = \sigma^2$
除以 $n-1$(而非 $n$)保证方差估计无偏!
⚠️ 易错点:① 样本方差分母是 $n-1$ 不是 $n$;② 简化公式中 $n\bar{x}^2$ 要先平方再乘 $n$;③ 矩估计就是"用样本统计量替代总体参数"。
1 / 19
1 / 1