⚠️ 呢個係簡化嘅指引,幫你快速揀返合適嘅工具,唔係完整嘅統計方法教學。如果你嘅情況複雜(例如多因子設計、非參數檢定),請諮詢統計課程/導師。
- 唔識揀邊個統計檢定嗰陣快速搵方向
- 複習唔同統計方法嘅使用場景
- 教學/自學統計入門
決定檢定方法的三條問題
選擇統計檢定看似需要背一張很大的對照表,其實大部分時候可以化約成三條依序提出的問題:
- 我問的是哪一類問題?組別之間有沒有差異?變數之間有沒有關係?觀察到的次數是否符合預期?
- 我的結果變數是什麼類型?連續(身高、分數、時間)還是類別(合格/不合格、投給哪個政黨)?
- 有多少組,而它們是否獨立?一組對比某個已知值、兩組,還是三組以上?是同一批對象量度兩次,還是不同的人?
這三個答案幾乎總是只會剩下一種標準檢定。
決策對照表
| 你的問題 | 結果變數 | 設計 | 檢定 |
|---|---|---|---|
| 是否異於某個已知值? | 連續 | 一組 | 單樣本 t 檢定 |
| 兩組是否有差異? | 連續 | 獨立 | 雙樣本 t 檢定 |
| 有沒有改變? | 連續 | 同一批對象量兩次 | 成對 t 檢定 |
| 三組以上是否有差異? | 連續 | 獨立 | 單因子變異數分析 |
| 兩個變數是否相關? | 兩者皆連續 | 配對觀察 | 皮爾森相關 |
| 兩個變數是否相關? | 兩者皆類別 | 交叉表 | χ² 獨立性檢定 |
| 次數是否符合預期? | 類別 | 單一變數 | χ² 適合度檢定 |
右欄的所有檢定都在假設檢定頁上,而上方的精靈會直接連過去並預先選好你的檢定。
成對還是獨立 —— 最多人搞錯的分別
這是表中後果最嚴重、也最容易誤判的一個分岔。問題不在於兩組數字在某種籠統意義上是否相關,而在於其中一組的每一個觀察值,在另一組是否有一個特定而有意義的對應對象。
- 成對:同一批學生在課程前後。同一批病人服用兩種藥物。雙生子各分配到一個條件。每一列都是同一個個體被量度兩次。
- 獨立:A 班對 B 班。實驗組對對照組。兩邊是不同的人,列與列之間沒有對應關係。
如果你的兩欄數據必須列數相同才說得通,那這個設計就是成對。這一點搞錯在兩個方向都代價高昂:把成對數據當成獨立分析,會白白丟掉配對換來的精確度,通常也就漏掉了真實效應;而把獨立數據當成成對分析,則根本無效。
當標準檢定不適用時
表中的檢定都是母數檢定 —— 它們假設分佈大致常態,而組別比較還假設變異數相近。當這些假設明顯不成立時,慣常的替代是:
| 母數檢定 | 無母數替代 |
|---|---|
| 雙樣本 t 檢定 | 曼-惠特尼 U 檢定 |
| 成對 t 檢定 | 威爾科克森符號等級檢定 |
| 單因子變異數分析 | 克拉斯卡-瓦立斯檢定 |
| 皮爾森相關 | 斯皮爾曼等級相關 |
本站目前沒有實作這些無母數檢定。如果你的數據高度偏斜、屬於次序尺度,或樣本極小,請改用 R、jamovi 或 SPSS,不要在這裡硬套母數檢定。老實說出來,比提供一個會靜靜誤導你的檢定有用得多。
看數據之前就決定
應該由研究設計決定檢定方法,而不是由結果決定。做幾個檢定再報告那個跨過 p < 0.05 的,會令 p 值失效 —— 這條門檻的整套邏輯,建立在檢定方法事先已經固定的前提上。
同樣的原則適用於單尾/雙尾的選擇、是否剔除離群值,以及模型放入哪些共變數。每一項都是研究者的自由度,而在看到數據之後才決定它們,正是那麼多已發表發現無法被重複驗證的原因。
檢定之後
p 值只是答案的一半。跑完檢定之後,請把結果換算成效應量,這樣你才能說出差異有多大,而不只是說它跨過了某條門檻。如果結果不顯著,在下結論說「什麼都沒有」之前,先用檢定力分析工具看看你的樣本本來就能偵測到多大的效應。
參考資料
- Field, A. (2017). Discovering Statistics Using IBM SPSS Statistics (5th ed.). Sage.
- Simmons, J. P., Nelson, L. D. & Simonsohn, U. (2011). False-positive psychology. Psychological Science, 22(11), 1359–1366.(關於研究者自由度。)
- Wasserstein, R. L. & Lazar, N. A. (2016). The ASA statement on p-values. The American Statistician, 70(2), 129–133.