⚠️ 呢個係通用統計工具,唔涉及任何特定考試嘅收生數據。適合用嚟做功課、專題研究或者了解統計檢定嘅基本概念,正式學術研究請以你嘅統計課程/導師指定嘅方法為準。
顯著水平對照
| 顯著水平 α | 結果 |
|---|
描述統計結果
| 統計量 | 數值 |
|---|
- 做功課/專題研究時快速攞p值
- 檢查數據嘅集中趨勢同離散程度
- 複核其他統計軟件嘅計算結果
p 值的精確定義
p 值是在虛無假設為真的前提下,取得至少與你觀察到的結果同樣極端的結果的機率。那句條件子句就是全部關鍵,而幾乎所有常見的誤讀都源於把它丟掉。
特別要指出:p 值不是虛無假設為真的機率,1 − p 也不是你的假設正確的機率。它描述的是在「什麼都沒發生」的世界裡,你的數據有多不尋常 —— 而不是那個世界有多大機會成立。美國統計學會在 2016 年正式就此發表聲明,正因為這種誤讀在已發表文獻中實在太過普遍。
選擇正確的分佈
| 統計量 | 使用時機 | 需要自由度? |
|---|---|---|
| Z | 母體標準差已知,或樣本夠大 | 否 |
| t | 母體標準差由樣本估計而來 | 是 |
| χ² | 類別次數資料 —— 適合度或獨立性 | 是 |
| r | 檢定相關係數是否異於零 | 是(n − 2) |
t 分佈與 Z 分佈會隨自由度增加而趨於一致。自由度到 30 時,雙尾 5% 臨界值的差距約為 0.04;到 100 時約為 0.01。自由度低於 30 而誤用 Z 代替 t,會低估 p 值並高估你的信心。
計算實例
一項 24 名受試者的雙樣本 t 檢定(自由度 22)得出 t = 2.31。
雙尾之下,p = 0.031 —— 達到慣用的 0.05 顯著水準。自由度 22 的雙尾臨界值為 2.074,而 2.31 超過了它。
假如同一個統計量來自自由度 5,臨界值會是 2.571,結果就不會達到顯著,p = 0.069。同樣的 t 值,結論相反,純粹因為樣本大小不同。
單尾還是雙尾
除非你事先已經確定只有單一方向的效應才有意義,否則一律用雙尾。誘惑顯而易見:單尾檢定會把 p 值減半,於是 p = 0.08 的結果變成 p = 0.04。但在看到數據往哪邊倒之後才作這個切換,是教科書級別的 p-hacking,而且它抬高偽陽性率的幅度,正好等於它看起來帶來的「好處」。
真正適用單尾的情況相當罕見。它要求相反方向的效應與完全沒有效應被同等看待 —— 也就是說,無論哪一種情況你都會採取同樣的行動。如果反方向的一個大效應會引起你的興趣,那麼這個檢定就是雙尾的。
描述統計:應該報告哪些數字
本工具的描述統計模式會給出樣本數、平均數、中位數、眾數、標準差、變異數、四分位數、四分位距與標準誤。實際應該報告哪些,取決於你的數據形狀:
- 大致對稱 —— 平均數配標準差。
- 偏斜或含有極端值 —— 中位數配四分位距。兩者都不受極端值影響,而單一個離群值就可以明顯拉動平均數並膨脹標準差。
- 描述你的估計有多精確 —— 標準誤,即標準差 ÷ √n。它與標準差不能互換:標準差描述數據的離散程度,標準誤描述平均數的不確定性。在讀者預期看到標準差的位置報告標準誤,會令變異程度看起來約小了 √n 倍。
本站的四分位數採用線性內插法(等同 R 的 type 7 與 Excel 的 QUARTILE.INC)。其他慣例亦存在 —— Minitab 與部分教科書採用不同規則 —— 所以在小樣本上,不同軟體算出的四分位數可能略有差異。這在 n 低於約 20 時特別明顯。
常見錯誤
- 把 p = 0.049 與 p = 0.051 當成本質不同。兩者是幾乎相同的證據。0.05 這條線是慣例,不是發現與否的門檻。
- 報告「p = 0.000」。p 值永遠不會恰好等於零。應報告
p < .001,也就是本工具的顯示方式。 - 做了很多個檢定,只報告顯著的那些。在 α = 0.05 之下,對純雜訊做二十個獨立檢定,平均會產生一個「顯著」結果。若你在檢定多個假設,必須作出校正。
- 由不顯著的結果推論「沒有效應」。沒有證據不等於證明沒有,在小型研究中尤其如此。請用檢定力分析工具檢查你的設計實際上能偵測到多大的效應。
本站採用的方法
常態 CDF 採用 Abramowitz–Stegun 近似式。t 與 F 分佈經正則化不完全 beta 函數計算,χ² 則經正則化下不完全 gamma 函數計算,兩者均按引數大小選用標準的連分數或級數展開(Numerical Recipes)以維持數值穩定。收斂上限為 500 次迭代,相對容差 10⁻¹⁴。
參考資料
- Wasserstein, R. L. & Lazar, N. A. (2016). The ASA statement on p-values. The American Statistician, 70(2), 129–133.
- Press, W. H. et al. (2007). Numerical Recipes (3rd ed.), §6.2 與 §6.4。
- Hyndman, R. J. & Fan, Y. (1996). Sample quantiles in statistical packages. The American Statistician, 50(4), 361–365.