假設檢定

假設檢定計算工具

七種標準檢定,直接由貼上的原始數據計算。每一種都會報告檢定統計量、自由度與 p 值,並說明它對你的數據作了什麼假設。

⚠️ 以下計算機用最常見嘅公式(t檢定用等變異數Student's t-test,卡方2×2獨立性檢定唔用Yates連續性校正)。適合初步了解同做功課用,正式研究請諮詢統計課程/導師,並留意樣本分佈假設(常態性、方差齊性等)。

輸入2×2列聯表嘅四個格仔(a/b為第一行,c/d為第二行)。

各組摘要

組別樣本數平均數
常見應用
  • 比較兩組成績有冇顯著分別
  • 檢查問卷分類數據係咪符合預期比例
  • 功課/專題研究嘅假設檢定計算

本頁的七種檢定

檢定回答什麼需要的數據
單樣本 t 檢定這組的平均數是否異於某個已知值?一欄數據 + 參考平均數
雙樣本 t 檢定兩個獨立組別是否有差異?兩欄數據
成對 t 檢定同一批對象是否有改變?兩欄配對數據
χ² 適合度檢定觀察次數是否符合期望比例?觀察次數 + 期望次數
χ² 2×2 獨立性檢定兩個類別變數是否相關?四格次數
皮爾森相關檢定線性關係是否異於零?兩欄配對數據
單因子變異數分析三組或以上是否有差異?每組一欄數據

如果你不確定哪一種適合你的問題,檢定選擇精靈會先問你想找出什麼,再把你帶到這裡並預先選好對應的檢定。

計算實例:成對與獨立的分別

十二名學生在一個溫習課程前後各考一次,平均進步 4 分,差值的標準差為 5。

成對 t 檢定得 t = 4 ÷ (5 ÷ √12) = 2.77,自由度 11,p = 0.018 —— 達到顯著。

若把同一批數字當成兩組獨立樣本分析,標準誤通常會大得多,因為學生之間的個體差異(有些學生本來就較強)會淹沒個人的進步幅度。配對正是用來移除這種雜訊的。在這一頁上,選錯這兩種檢定是後果最嚴重的一個錯誤。

各項假設,以及本工具對它們的處理

這裡每一種檢定都有前提假設,而本工具不會替你檢查。重要的幾項:

  • 本頁的雙樣本 t 檢定是 Student 而非 Welch。它假設兩組的母體變異數相等。當變異數不等而組別人數又不同時,Student 檢定可能在任一方向上嚴重出錯。目前主流指引普遍建議以 Welch t 檢定為預設,所以如果你兩組的標準差相差超過大約兩倍,就不應依賴這裡的數字。
  • 2×2 卡方未經校正。本工具報告的是未套用 Yates 連續性校正的皮爾森統計量。只要有任何一格的期望次數低於約 5,未校正的統計量就會偏向寬鬆 —— 太容易達到顯著 —— 這時費雪精確檢定才是恰當的替代。
  • 變異數分析假設各組變異數同質,而且它只告訴你存在某一對組別有差異,不會告訴你是哪一對。要知道是哪一對需要 Tukey HSD 之類的事後檢定,本工具並未提供。
  • t 檢定假設抽樣分佈近似常態。中央極限定理在中等樣本數下已相當寬容,但若 n 低於約 15 而數據明顯偏斜,改用無母數方法較為穩妥。
  • 皮爾森 r 假設關係是線性的。一個強烈的曲線關係可以得出接近零的 r。在下結論說「沒有關聯」之前,永遠先看散佈圖。

這些假設被明確寫出來而不是藏在附註裡,是因為它們會改變結論。如果你的情況觸及其中任何一項,本頁給出的數字在算術上依然正確,但在實質上具有誤導性。

解讀輸出

每種檢定都會報告檢定統計量、自由度與 p 值。統計量與自由度共同決定 p 值,而三者一併報告是慣例 —— 例如 t(22) = 2.31, p = .031 —— 因為這樣讀者才能重建並核對你的結果。

這些檢定都沒有報告的,是差異究竟有多大。在 5,000 名受試者身上得出的顯著 t 檢定,可能反映的是一個毫無實務意義的差異。在判斷一個結果是否重要之前,請把各組的平均數與標準差換算成 Cohen's d

常見錯誤

  • 對三個組別逐對做 t 檢定。在 α = 0.05 之下,三個逐對檢定出現至少一個偽陽性的機率約為 14%。應先用變異數分析,再做經過校正的事後檢定。
  • 把百分比餵給卡方檢定。卡方需要原始次數。百分比抹去了檢定所依賴的樣本數資訊,只會產生一個沒有意義的統計量。
  • 未經思考就把李克特量表題當成連續變數。對加總後的多題量表有時說得通,對單一的 1–5 題則很少站得住腳。
  • 看到結果之後才決定用哪個檢定。試了幾種檢定再報告達到顯著的那一個,會令 p 值完全失效。

本站採用的方法

t 檢定與變異數分析的 p 值來自正則化不完全 beta 函數;χ² 的 p 值來自正則化下不完全 gamma 函數。兩者均按引數大小選用級數展開或連分數形式,依循 Numerical Recipes 的標準處理,上限 500 次迭代,相對容差 10⁻¹⁴。相關檢定則透過 t = r√(n−2) ÷ √(1−r²) 把 r 轉成自由度 n − 2 的 t 值。

貼上的數據量過大時會被截斷,而發生截斷時結果面板會明確說明,不會靜靜地只分析其中一部分。

參考資料

  • Delacre, M., Lakens, D. & Leys, C. (2017). Why psychologists should by default use Welch's t-test. International Review of Social Psychology, 30(1), 92–101.
  • Press, W. H. et al. (2007). Numerical Recipes (3rd ed.), §6.2 與 §6.4。
  • Campbell, I. (2007). Chi-squared and Fisher–Irwin tests of two-by-two tables. Statistics in Medicine, 26(19), 3661–3675.