檢定選擇

我應該用哪一種統計檢定?

選出你想找出什麼,這裡就會指出適合的檢定、說明為何適合,並直接帶你到該計算工具。

⚠️ 呢個係簡化嘅指引,幫你快速揀返合適嘅工具,唔係完整嘅統計方法教學。如果你嘅情況複雜(例如多因子設計、非參數檢定),請諮詢統計課程/導師。

常見應用
  • 唔識揀邊個統計檢定嗰陣快速搵方向
  • 複習唔同統計方法嘅使用場景
  • 教學/自學統計入門

決定檢定方法的三條問題

選擇統計檢定看似需要背一張很大的對照表,其實大部分時候可以化約成三條依序提出的問題:

  1. 我問的是哪一類問題?組別之間有沒有差異?變數之間有沒有關係?觀察到的次數是否符合預期?
  2. 我的結果變數是什麼類型?連續(身高、分數、時間)還是類別(合格/不合格、投給哪個政黨)?
  3. 有多少組,而它們是否獨立?一組對比某個已知值、兩組,還是三組以上?是同一批對象量度兩次,還是不同的人?

這三個答案幾乎總是只會剩下一種標準檢定。

決策對照表

你的問題結果變數設計檢定
是否異於某個已知值?連續一組單樣本 t 檢定
兩組是否有差異?連續獨立雙樣本 t 檢定
有沒有改變?連續同一批對象量兩次成對 t 檢定
三組以上是否有差異?連續獨立單因子變異數分析
兩個變數是否相關?兩者皆連續配對觀察皮爾森相關
兩個變數是否相關?兩者皆類別交叉表χ² 獨立性檢定
次數是否符合預期?類別單一變數χ² 適合度檢定

右欄的所有檢定都在假設檢定頁上,而上方的精靈會直接連過去並預先選好你的檢定。

成對還是獨立 —— 最多人搞錯的分別

這是表中後果最嚴重、也最容易誤判的一個分岔。問題不在於兩組數字在某種籠統意義上是否相關,而在於其中一組的每一個觀察值,在另一組是否有一個特定而有意義的對應對象。

  • 成對:同一批學生在課程前後。同一批病人服用兩種藥物。雙生子各分配到一個條件。每一列都是同一個個體被量度兩次。
  • 獨立:A 班對 B 班。實驗組對對照組。兩邊是不同的人,列與列之間沒有對應關係。

如果你的兩欄數據必須列數相同才說得通,那這個設計就是成對。這一點搞錯在兩個方向都代價高昂:把成對數據當成獨立分析,會白白丟掉配對換來的精確度,通常也就漏掉了真實效應;而把獨立數據當成成對分析,則根本無效。

當標準檢定不適用時

表中的檢定都是母數檢定 —— 它們假設分佈大致常態,而組別比較還假設變異數相近。當這些假設明顯不成立時,慣常的替代是:

母數檢定無母數替代
雙樣本 t 檢定曼-惠特尼 U 檢定
成對 t 檢定威爾科克森符號等級檢定
單因子變異數分析克拉斯卡-瓦立斯檢定
皮爾森相關斯皮爾曼等級相關

本站目前沒有實作這些無母數檢定。如果你的數據高度偏斜、屬於次序尺度,或樣本極小,請改用 R、jamovi 或 SPSS,不要在這裡硬套母數檢定。老實說出來,比提供一個會靜靜誤導你的檢定有用得多。

看數據之前就決定

應該由研究設計決定檢定方法,而不是由結果決定。做幾個檢定再報告那個跨過 p < 0.05 的,會令 p 值失效 —— 這條門檻的整套邏輯,建立在檢定方法事先已經固定的前提上。

同樣的原則適用於單尾/雙尾的選擇、是否剔除離群值,以及模型放入哪些共變數。每一項都是研究者的自由度,而在看到數據之後才決定它們,正是那麼多已發表發現無法被重複驗證的原因。

檢定之後

p 值只是答案的一半。跑完檢定之後,請把結果換算成效應量,這樣你才能說出差異有多大,而不只是說它跨過了某條門檻。如果結果不顯著,在下結論說「什麼都沒有」之前,先用檢定力分析工具看看你的樣本本來就能偵測到多大的效應。

參考資料

  • Field, A. (2017). Discovering Statistics Using IBM SPSS Statistics (5th ed.). Sage.
  • Simmons, J. P., Nelson, L. D. & Simonsohn, U. (2011). False-positive psychology. Psychological Science, 22(11), 1359–1366.(關於研究者自由度。)
  • Wasserstein, R. L. & Lazar, N. A. (2016). The ASA statement on p-values. The American Statistician, 70(2), 129–133.