P值

計算統計假設檢定的 p 值

如何使用P值

  1. 1輸入檢驗統計量與自由度(或效應量與樣本量)。
  2. 2選擇尾型:單尾或雙尾。
  3. 3檢視 p 值,以及在你選定的 alpha 下是否顯著。

理解 p 值

p = P(檢驗統計量 ≥ 觀測值 | H0 成立)

p 值是在原假設成立時,觀察到至少與樣本一樣極端結果的機率。

較小的 p 值(低於你設定的 alpha,通常 0.05)說明觀測效應在原假設下不太可能出現,因此拒絕 H0。

P 值的準確定義是:**如果原假設為真,觀察到當前結果(或更極端結果)的機率**。注意它**不是**「原假設為真的機率」,也不是「結論錯誤的機率」——這是統計學中被誤讀最多的一句話。P = 0.03 的意思是「若兩組真的沒差異,只有 3% 的機率看到這麼大的差異」,而不是「有 97% 的把握認為有差異」。

另一個常見誤區是把 P < 0.05 當成「效應很大」。P 值同時受**效應量**和**樣本量**影響:樣本量足夠大時,一個微不足道的差異也能得到極小的 P 值。比如兩組身高差 0.1 釐米,樣本 10 萬人時 P 可能遠小於 0.05,但這個差異毫無實際意義。**所以報告結果時必須同時給出效應量(如 Cohen's d、相對風險)和置信區間**,只看 P 值容易得出誤導性結論。

P 值範圍證據強度常用表述典型決策
> 0.10無證據反對原假設不顯著不拒絕 H₀
0.05 – 0.10弱證據邊緣顯著需更多資料
0.01 – 0.05中等證據顯著拒絕 H₀
0.001 – 0.01強證據高度顯著拒絕 H₀
< 0.001極強證據極其顯著拒絕 H₀

P 值與常用顯著性水平的判讀

常見問題

p < 0.05 能證明我的理論嗎?

不能,它只是反對原假設的證據,並非你的理論為真的機率。

單尾與雙尾?

雙尾把 alpha 分到兩端;僅當有預先設定的方向時才用單尾。

什麼是 alpha?

你事先設定的顯著性閾值,常用 0.05,用於控制假陽性率。

P 值不顯著就說明沒有差異嗎?

不能這麼說。「不顯著」只表示當前資料不足以拒絕原假設,可能是真的沒差異,也可能是樣本量不夠(統計功效不足)。正確表述是「未檢測到顯著差異」,而非「證明無差異」。要做「等效性」結論需要專門的等效性檢驗(TOST),並預先設定可接受的等效邊界。

多次檢驗會有什麼問題?

會大幅增加假陽性。單次檢驗閾值 0.05 時,做 20 次獨立檢驗,即使全無真實效應,也期望有 1 次 P < 0.05。這叫多重比較問題。常用校正方法是 Bonferroni(把閾值除以檢驗次數,如 20 次就用 0.0025)或控制 FDR(錯誤發現率,Benjamini-Hochberg 方法,更寬鬆也更常用)。

更多工具