P 值與描述統計

P 值計算與描述統計

把檢定統計量轉成 p 值,或貼上一欄原始數字取得完整的描述統計 —— 包括大部分計算機略去的四分位數與四分位距。

⚠️ 呢個係通用統計工具,唔涉及任何特定考試嘅收生數據。適合用嚟做功課、專題研究或者了解統計檢定嘅基本概念,正式學術研究請以你嘅統計課程/導師指定嘅方法為準。

顯著水平對照

顯著水平 α結果

描述統計結果

統計量數值
常見應用
  • 做功課/專題研究時快速攞p值
  • 檢查數據嘅集中趨勢同離散程度
  • 複核其他統計軟件嘅計算結果

p 值的精確定義

p 值是在虛無假設為真的前提下,取得至少與你觀察到的結果同樣極端的結果的機率。那句條件子句就是全部關鍵,而幾乎所有常見的誤讀都源於把它丟掉。

特別要指出:p 值不是虛無假設為真的機率,1 − p 也不是你的假設正確的機率。它描述的是在「什麼都沒發生」的世界裡,你的數據有多不尋常 —— 而不是那個世界有多大機會成立。美國統計學會在 2016 年正式就此發表聲明,正因為這種誤讀在已發表文獻中實在太過普遍。

選擇正確的分佈

統計量使用時機需要自由度?
Z母體標準差已知,或樣本夠大
t母體標準差由樣本估計而來
χ²類別次數資料 —— 適合度或獨立性
r檢定相關係數是否異於零是(n − 2)

t 分佈與 Z 分佈會隨自由度增加而趨於一致。自由度到 30 時,雙尾 5% 臨界值的差距約為 0.04;到 100 時約為 0.01。自由度低於 30 而誤用 Z 代替 t,會低估 p 值並高估你的信心。

計算實例

一項 24 名受試者的雙樣本 t 檢定(自由度 22)得出 t = 2.31。

雙尾之下,p = 0.031 —— 達到慣用的 0.05 顯著水準。自由度 22 的雙尾臨界值為 2.074,而 2.31 超過了它。

假如同一個統計量來自自由度 5,臨界值會是 2.571,結果就不會達到顯著,p = 0.069。同樣的 t 值,結論相反,純粹因為樣本大小不同。

單尾還是雙尾

除非你事先已經確定只有單一方向的效應才有意義,否則一律用雙尾。誘惑顯而易見:單尾檢定會把 p 值減半,於是 p = 0.08 的結果變成 p = 0.04。但在看到數據往哪邊倒之後才作這個切換,是教科書級別的 p-hacking,而且它抬高偽陽性率的幅度,正好等於它看起來帶來的「好處」。

真正適用單尾的情況相當罕見。它要求相反方向的效應與完全沒有效應被同等看待 —— 也就是說,無論哪一種情況你都會採取同樣的行動。如果反方向的一個大效應會引起你的興趣,那麼這個檢定就是雙尾的。

描述統計:應該報告哪些數字

本工具的描述統計模式會給出樣本數、平均數、中位數、眾數、標準差、變異數、四分位數、四分位距與標準誤。實際應該報告哪些,取決於你的數據形狀:

  • 大致對稱 —— 平均數配標準差。
  • 偏斜或含有極端值 —— 中位數配四分位距。兩者都不受極端值影響,而單一個離群值就可以明顯拉動平均數並膨脹標準差。
  • 描述你的估計有多精確 —— 標準誤,即標準差 ÷ √n。它與標準差不能互換:標準差描述數據的離散程度,標準誤描述平均數的不確定性。在讀者預期看到標準差的位置報告標準誤,會令變異程度看起來約小了 √n 倍。

本站的四分位數採用線性內插法(等同 R 的 type 7 與 Excel 的 QUARTILE.INC)。其他慣例亦存在 —— Minitab 與部分教科書採用不同規則 —— 所以在小樣本上,不同軟體算出的四分位數可能略有差異。這在 n 低於約 20 時特別明顯。

常見錯誤

  • 把 p = 0.049 與 p = 0.051 當成本質不同。兩者是幾乎相同的證據。0.05 這條線是慣例,不是發現與否的門檻。
  • 報告「p = 0.000」。p 值永遠不會恰好等於零。應報告 p < .001,也就是本工具的顯示方式。
  • 做了很多個檢定,只報告顯著的那些。在 α = 0.05 之下,對純雜訊做二十個獨立檢定,平均會產生一個「顯著」結果。若你在檢定多個假設,必須作出校正。
  • 由不顯著的結果推論「沒有效應」。沒有證據不等於證明沒有,在小型研究中尤其如此。請用檢定力分析工具檢查你的設計實際上能偵測到多大的效應。

本站採用的方法

常態 CDF 採用 Abramowitz–Stegun 近似式。t 與 F 分佈經正則化不完全 beta 函數計算,χ² 則經正則化下不完全 gamma 函數計算,兩者均按引數大小選用標準的連分數或級數展開(Numerical Recipes)以維持數值穩定。收斂上限為 500 次迭代,相對容差 10⁻¹⁴。

參考資料

  • Wasserstein, R. L. & Lazar, N. A. (2016). The ASA statement on p-values. The American Statistician, 70(2), 129–133.
  • Press, W. H. et al. (2007). Numerical Recipes (3rd ed.), §6.2 與 §6.4。
  • Hyndman, R. J. & Fan, Y. (1996). Sample quantiles in statistical packages. The American Statistician, 50(4), 361–365.