顏色越深代表效應量越大,金色標記顯示你目前 |d| 所在位置。
Cohen's d 對照表
點擊任何一行,自動帶入上方計算機。
| Cohen's d | r | R² | 效應量級別 |
|---|
- 心理學/社會科學研究論文效應量報告
- 統合分析(meta-analysis)前置換算
- 審稿時檢查效應量是否合理
為什麼效應量比顯著性更重要
p 值回答的是一條很窄的問題:如果根本沒有效應,觀察到這批數據有多令人意外?它並沒有告訴你效應有多大。由於 p 值會隨樣本增大而縮小,只要研究規模夠大,一個沒有人會在意的差異一樣可以得出 p < 0.001。效應量正是繞過這個問題的部分 —— 它描述差異的量級,與你量度了多少人無關。
這就是為什麼心理學、醫學與教育學的期刊如今普遍要求 p 值旁邊必須附上效應量,也是美國心理學會的格式指引自第五版起就把它列為必要項目的原因。
本頁的三種量數
- Cohen's d —— 兩組平均數之差,以標準差為單位表示。d = 0.5 代表兩組相差半個標準差。它沒有上限。
- 相關係數 r —— 兩個連續變數之間線性關係的強度與方向,由 −1 經 0 至 +1。
- R² —— 一個變數的變異中可由另一個變數預測的比例。它就是 r 的平方,因此恆為正數,並且失去了關係的方向。
第一條公式中的常數 4 其實是 a = (n₁ + n₂)² ÷ (n₁ × n₂),只有在兩組人數相同時才恰好等於 4。本工具假設兩組人數大致相等。如果你的兩組嚴重失衡 —— 例如 20 對 200 —— 這裡的 d 轉 r 換算就會有偏差,應改用實際組別人數計算 a。
Cohen 的門檻,以及它們比表面上更薄弱
| Cohen's d | r | R² | 慣用等級 |
|---|---|---|---|
| < 0.2 | < 0.10 | < 1% | 可忽略 |
| 0.2 – 0.5 | 0.10 – 0.24 | 1% – 6% | 小 |
| 0.5 – 0.8 | 0.24 – 0.37 | 6% – 14% | 中 |
| > 0.8 | > 0.37 | > 14% | 大 |
Cohen 明確表示這些分界只是「因為找不到更好的依據」而提出的任意慣例,僅應在該領域尚無自身基準時使用。把它們當成客觀門檻,是對他著作最常見的誤用。在介入成本低廉又能大規模推行的領域,d = 0.1 也可能極具價值;而在一種昂貴且有副作用的藥物試驗中,d = 0.4 可能仍不足以支持用藥。
計算實例
某研究報告指一項補習計劃提升了測驗成績,Cohen's d = 0.5 —— 按慣例屬於「中等」效應。
換算得:r = 0.5 ÷ √(0.25 + 4) = 0.5 ÷ 2.06 = 0.243,而 R² = 0.243² = 0.059。換言之,該計劃解釋了成績變異的約 5.9%。
兩種說法都準確,但讀者的觀感截然不同。「中等效應」聽起來相當可觀;「解釋了 6% 的變異」聽起來就平平無奇。這正是為什麼以多於一種形式報告效應量是良好做法。
常見錯誤
- 把 R² 讀成「解釋了多少個案」。它是變異的百分比,是關於離差平方的陳述,不是關於個別對象的陳述。
- 跨研究比較採用不同標準差的 d。Cohen's d 以合併標準差為刻度,因此在同質樣本上進行的研究,同樣的原始差異會得出較大的 d。這在整合分析中是有充分文獻記載的問題。
- 對成對數據直接套用 Cohen's d。成對樣本需要使用差值的標準差,或針對兩次測量之間的相關作出校正;直接使用合併標準差會高估效應。
- 忽略信賴區間。由十二名受試者得出的 d = 0.8,其區間寬得幾乎與任何結論相容。來自小樣本的效應量,與小樣本的其他一切同樣不確定。
如果你手上是原始數據
本頁處理的是你已經有的效應量之間的換算。如果你是從原始數字出發,請先到假設檢定頁執行比較 —— 那裡的雙樣本 t 檢定會直接報告 Cohen's d。若想知道某個效應需要多大的樣本,請使用檢定力分析工具。
參考資料
- Cohen, J. (1988). Statistical Power Analysis for the Behavioral Sciences (2nd ed.). Lawrence Erlbaum.(d 門檻與 d↔r 換算的出處。)
- Borenstein, M., Hedges, L. V., Higgins, J. P. T. & Rothstein, H. R. (2009). Introduction to Meta-Analysis. Wiley.(關於效應量指標之間的換算。)
- Lakens, D. (2013). Calculating and reporting effect sizes. Frontiers in Psychology, 4, 863.