医疗检测的假阳性悖论 全概率与逆概率
问题: 如果一个人去体检,结果呈现阳性,他真正患病的概率 $P(D|+)$ 是多少?
$$ P(D|+) = \frac{P(D)P(+|D)}{P(+)} $$
阳性预测值 (PPV)
--
大多数人会误以为:既然检测准确率高达 95% 以上,那么检测出阳性,得病的概率也应该是 95% 以上。但实际上,当基础患病率极低时,庞大健康人群产生的假阳性数量,会远远淹没真正的患者。
全概率树状图 人群的分流路径
总阳性率 $P(+)$ 等于“真患者测出阳性”与“健康人误测出阳性”的路径概率之和。
1000 人微观模拟沙盘 上帝视角
图例说明:
真阳性 (有病, 测出有病)
假阳性 (没病, 误报有病)
真阴性 (没病, 测出没病)
假阴性 (有病, 漏报没病)
测出阳性的总人数
0
测出阴性的总人数
0
参数会自动同步左侧面板。请注意观察沙盘中代表“假阳性”的斑点。当患病率很低时,你能在茫茫绿海中找到零星的几个真患者,但同时也会涌现出大批因为仪器误差产生的假阳性。
贝叶斯核心法则
从原因推导结果,到由结果反推原因的逆向思维
先验概率 (Prior)
初始认知$$ P(A) $$
在没有任何新信息或检测结果介入前,基于历史经验或大盘统计数据对事件发生的预估(如总人口患病率)。
样本空间的划分
完备事件组$$ \sum P(A_i) = 1, \quad A_i \cap A_j = \emptyset $$
像切蛋糕一样把所有可能的情况完全切开且不重叠。最简单的划分就是:发生(有病)和不发生(没病)。
全概率公式
合并分支$$ P(B) = \sum P(A_i)P(B|A_i) $$
如果想要到达结果 B 有很多条不同的路径,那么 B 发生的总概率就是把所有能到达 B 的树枝路径的概率全部加起来。
贝叶斯公式的核心
逆向推断$$ P(A|B) = \frac{P(A)P(B|A)}{P(B)} $$
我们通常知道“如果下雨了(A),地上会湿(B)”的概率 P(B|A)。贝叶斯教我们如何反过来算:“如果看到地上湿了(B),到底是因为下雨(A)导致的概率是多少”。
后验概率 (Posterior)
认知更新$$ P(A|B) $$
在获得了最新的证据或测试结果(B发生了)之后,我们立刻修正原来对 A 发生概率的估计。
假阳性陷阱
基础率谬误$$ P(+|\bar{D}) $$
人们在面对惊悚的检测结果时,往往会忽视“先验概率极低”这一事实。机器哪怕只有 1% 的误报率,乘在庞大的健康人群基数上,也会制造出远超真患者数量的假阳性。
算法中的贝叶斯
朴素贝叶斯$$ P(\text{垃圾邮件}|\text{包含关键词}) $$
在机器学习中,垃圾邮件过滤、新闻分类等应用最底层的逻辑也是它。通过计算包含特定词汇的邮件是垃圾邮件的后验概率来进行自动拦截。