檢定力分析

統計檢定力與樣本數計算

在收集數據之前算出需要多少受試者,或者算出一個已完成的研究實際上有多少檢定力。

⚠️ 呢個計算機用常態分佈近似法(Cohen 1988嘅標準做法),重用Z分數嘅數學,唔係用完整嘅非中心t/F分佈。對大部分情況已經夠準,但同專業軟件(例如G*Power,用緊完整嘅非中心分佈)相比,樣本數結果可能相差1至2個。

常見應用
  • 做研究計劃前預估需要幾多樣本
  • 評估現有樣本數係咪足夠偵測到預期效應
  • 功課/論文嘅方法學部分寫檢定力分析

檢定力分析回答什麼

統計檢定力是:假設效應真實存在且達到某個大小,你的研究能夠偵測到它的機率。它把四個量綁在一起,固定其中三個就決定了第四個:

  • 效應量 —— 你想偵測的差異有多大。
  • 顯著水準 α —— 你能容忍的偽陽性率,慣例為 0.05。
  • 樣本數 n —— 你收集多少觀察值。
  • 檢定力(1 − β) —— 效應存在時你找得到它的機會,慣例目標為 0.80。

兩個有用的方向是:研究開始之前,固定效應量、α 與檢定力,求出所需樣本數;以及在資源受限下規劃時,固定你負擔得起的樣本數,看看實際上能偵測到多大的效應。本工具兩者都做。

n ≈ 2(z1−α/2 + z1−β)² ÷ d²   (雙樣本檢定,每組)

計算實例

你想在雙組比較中偵測一個中等效應(d = 0.5),α = 0.05 雙尾,檢定力 80%。

z0.975 = 1.96,z0.80 = 0.84,所以 n ≈ 2 × (1.96 + 0.84)² ÷ 0.25 = 2 × 7.84 ÷ 0.25 = 每組 63 人,合共 126 人。

現在把效應量減半至 d = 0.25:n ≈ 2 × 7.84 ÷ 0.0625 = 每組 251 人。效應減半,所需樣本變成四倍 —— 樣本數與 1/d² 成正比。這個平方反比關係,是研究設計中最值得內化的一件事。

檢定力不足的研究,比表面上更糟

低檢定力最明顯的代價是漏掉真實效應。但另一個較不明顯的代價更具破壞性:在一個檢定力不足的研究確實找到的顯著結果之中,有很大比例會是偽陽性,而真陽性的效應量則會被高估。

機制很直接。如果你的研究只有在觀察到的效應很大時才能達到顯著,那麼你得到的每一個顯著結果,按其構造必然都是一個很大的觀察效應 —— 無論底層效應是否真的很大。這就是重複驗證文獻中所講的「贏家詛咒」,它也相當程度上解釋了為什麼來自小型研究的頭條發現,在重複驗證時往往縮水甚至消失。

實務上的結論是:小型前導研究用來確認流程行得通完全沒問題,但用它得出的效應量去規劃正式研究則幾乎毫無用處。規劃用的效應量,應取自整合分析、過往已發表的研究,或你認為值得採取行動的最小效應。

常見錯誤

  • 用自己觀察到的效應計算事後檢定力。「觀察檢定力」是 p 值的一個確定性函數 —— 它不提供任何新資訊,在方法學文獻中備受批評。如果結果不顯著,有用的問題是你的設計本來能夠偵測到多大的效應,而不是你對碰巧看到的那個效應有多少檢定力。
  • 用你希望看到的效應來規劃。因為 d = 0.8 算出來的 n 比較好看就採用它,等於保證了這個研究對任何現實的效應都檢定力不足。
  • 忘記流失率。這裡的 n 是可供分析的觀察值。如果預期有 15% 流失,招募時就要相應增加。
  • 忽略多重比較。檢定多個結果變數意味著要校正 α,而這會提高每一項所需的樣本數。
  • 把 n 當成總數。雙樣本檢定的數字是每組人數,研究總人數要乘二。

本站採用的方法及其限制

本工具採用常態近似法 —— 即 Cohen(1988)所述的標準教科書做法。它以常態分佈代替了描述對立假設下抽樣行為的非中心 t 與 F 分佈。

這個近似良好但並不精確。與 G*Power 等使用精確非中心分佈的軟體相比,這裡的結果通常每組相差一至兩名受試者。差距在樣本數小、檢定力低時最大,也正是常態近似最不適用的區域。兩個實務含意:

  • 永遠向上取整,不要向下。
  • 如果這個數字要用於研究撥款申請、倫理審查或預先註冊,亦即會被仔細審視,請先在 G*Power 或同類工具中覆核。本工具是為快速規劃估算而設。

相關檢定的檢定力採用 Fisher z 轉換,除了 n 極小或 r 極接近 ±1 的情況外表現良好。

參考資料

  • Cohen, J. (1988). Statistical Power Analysis for the Behavioral Sciences (2nd ed.). Lawrence Erlbaum.
  • Hoenig, J. M. & Heisey, D. M. (2001). The abuse of power: the pervasive fallacy of power calculations for data analysis. The American Statistician, 55(1), 19–24.
  • Button, K. S. et al. (2013). Power failure: why small sample size undermines the reliability of neuroscience. Nature Reviews Neuroscience, 14, 365–376.
  • Faul, F., Erdfelder, E., Lang, A.-G. & Buchner, A. (2007). G*Power 3. Behavior Research Methods, 39, 175–191.