P值

计算统计假设测试的P值

如何使用P值

  1. 1输入检验统计量与自由度(或效应量与样本量)。
  2. 2选择尾型:单尾或双尾。
  3. 3查看 p 值,以及在你选定的 alpha 下是否显著。

理解 p 值

p = P(检验统计量 ≥ 观测值 | H0 成立)

p 值是在原假设成立时,观察到至少与样本一样极端结果的概率。

较小的 p 值(低于你设定的 alpha,通常 0.05)说明观测效应在原假设下不太可能出现,因此拒绝 H0。

P 值的准确定义是:**如果原假设为真,观察到当前结果(或更极端结果)的概率**。注意它**不是**「原假设为真的概率」,也不是「结论错误的概率」——这是统计学中被误读最多的一句话。P = 0.03 的意思是「若两组真的没差异,只有 3% 的概率看到这么大的差异」,而不是「有 97% 的把握认为有差异」。

另一个常见误区是把 P < 0.05 当成「效应很大」。P 值同时受**效应量**和**样本量**影响:样本量足够大时,一个微不足道的差异也能得到极小的 P 值。比如两组身高差 0.1 厘米,样本 10 万人时 P 可能远小于 0.05,但这个差异毫无实际意义。**所以报告结果时必须同时给出效应量(如 Cohen's d、相对风险)和置信区间**,只看 P 值容易得出误导性结论。

P 值范围证据强度常用表述典型决策
> 0.10无证据反对原假设不显著不拒绝 H₀
0.05 – 0.10弱证据边缘显著需更多数据
0.01 – 0.05中等证据显著拒绝 H₀
0.001 – 0.01强证据高度显著拒绝 H₀
< 0.001极强证据极其显著拒绝 H₀

P 值与常用显著性水平的判读

常见问题

p < 0.05 能证明我的理论吗?

不能,它只是反对原假设的证据,并非你的理论为真的概率。

单尾与双尾?

双尾把 alpha 分到两端;仅当有预先设定的方向时才用单尾。

什么是 alpha?

你事先设定的显著性阈值,常用 0.05,用于控制假阳性率。

P 值不显著就说明没有差异吗?

不能这么说。「不显著」只表示当前数据不足以拒绝原假设,可能是真的没差异,也可能是样本量不够(统计功效不足)。正确表述是「未检测到显著差异」,而非「证明无差异」。要做「等效性」结论需要专门的等效性检验(TOST),并预先设定可接受的等效边界。

多次检验会有什么问题?

会大幅增加假阳性。单次检验阈值 0.05 时,做 20 次独立检验,即使全无真实效应,也期望有 1 次 P < 0.05。这叫多重比较问题。常用校正方法是 Bonferroni(把阈值除以检验次数,如 20 次就用 0.0025)或控制 FDR(错误发现率,Benjamini-Hochberg 方法,更宽松也更常用)。

更多工具