P值
计算统计假设测试的P值
如何使用P值
- 1输入检验统计量与自由度(或效应量与样本量)。
- 2选择尾型:单尾或双尾。
- 3查看 p 值,以及在你选定的 alpha 下是否显著。
理解 p 值
p = P(检验统计量 ≥ 观测值 | H0 成立)p 值是在原假设成立时,观察到至少与样本一样极端结果的概率。
较小的 p 值(低于你设定的 alpha,通常 0.05)说明观测效应在原假设下不太可能出现,因此拒绝 H0。
P 值的准确定义是:**如果原假设为真,观察到当前结果(或更极端结果)的概率**。注意它**不是**「原假设为真的概率」,也不是「结论错误的概率」——这是统计学中被误读最多的一句话。P = 0.03 的意思是「若两组真的没差异,只有 3% 的概率看到这么大的差异」,而不是「有 97% 的把握认为有差异」。
另一个常见误区是把 P < 0.05 当成「效应很大」。P 值同时受**效应量**和**样本量**影响:样本量足够大时,一个微不足道的差异也能得到极小的 P 值。比如两组身高差 0.1 厘米,样本 10 万人时 P 可能远小于 0.05,但这个差异毫无实际意义。**所以报告结果时必须同时给出效应量(如 Cohen's d、相对风险)和置信区间**,只看 P 值容易得出误导性结论。
| P 值范围 | 证据强度 | 常用表述 | 典型决策 |
|---|---|---|---|
| > 0.10 | 无证据反对原假设 | 不显著 | 不拒绝 H₀ |
| 0.05 – 0.10 | 弱证据 | 边缘显著 | 需更多数据 |
| 0.01 – 0.05 | 中等证据 | 显著 | 拒绝 H₀ |
| 0.001 – 0.01 | 强证据 | 高度显著 | 拒绝 H₀ |
| < 0.001 | 极强证据 | 极其显著 | 拒绝 H₀ |
P 值与常用显著性水平的判读
常见问题
p < 0.05 能证明我的理论吗?
不能,它只是反对原假设的证据,并非你的理论为真的概率。
单尾与双尾?
双尾把 alpha 分到两端;仅当有预先设定的方向时才用单尾。
什么是 alpha?
你事先设定的显著性阈值,常用 0.05,用于控制假阳性率。
P 值不显著就说明没有差异吗?
不能这么说。「不显著」只表示当前数据不足以拒绝原假设,可能是真的没差异,也可能是样本量不够(统计功效不足)。正确表述是「未检测到显著差异」,而非「证明无差异」。要做「等效性」结论需要专门的等效性检验(TOST),并预先设定可接受的等效边界。
多次检验会有什么问题?
会大幅增加假阳性。单次检验阈值 0.05 时,做 20 次独立检验,即使全无真实效应,也期望有 1 次 P < 0.05。这叫多重比较问题。常用校正方法是 Bonferroni(把阈值除以检验次数,如 20 次就用 0.0025)或控制 FDR(错误发现率,Benjamini-Hochberg 方法,更宽松也更常用)。
