圖表

直方圖與盒鬚圖產生器

貼上一欄數字,看清楚你的分佈形狀。在選擇檢定方法之前,用來檢查常態性假設特別有用。

⚠️ 直方圖用Sturges公式自動決定分組數;箱形圖用標準嘅1.5倍IQR規則判斷離群值(outlier)。呢啲係描述性視覺化工具,唔涉及假設檢定。

直方圖 (Histogram)

箱形圖 (Box Plot)

常見應用
  • 快速睇數據嘅分佈形狀(偏態、集中趨勢)
  • 搵出異常值/離群值
  • 功課/報告入面嘅描述性統計圖表

為什麼要先畫圖

摘要統計量會掩蓋形狀。Anscombe 四重奏是經典示範:四組數據的平均數、變異數、相關係數與迴歸線完全相同,畫出來卻毫不相似 —— 一組是線性,一組是曲線,一組有單一極端離群值,一組是一團垂直點加上一個遠處的點。Datasaurus Dozen 用一隻恐龍更生動地講了同一件事。

這件事直接關係到檢定方法的選擇。t 檢定、變異數分析與皮爾森相關,全都對分佈形狀有前提假設,而一張直方圖幾秒內就能確認或推翻它們。先畫圖再檢定不是為了美觀,它本身就是選對分析方法的一部分。

解讀直方圖

直方圖顯示各個區間內數值出現的頻率。要留意的是:

  • 對稱性 —— 大致對稱的單峰形狀,支持母數檢定背後的常態性假設。
  • 偏斜 —— 某一側拖著長尾。右偏數據(收入、反應時間、計數)的平均數會明顯高於中位數,而基於常態分佈的百分位換算會出錯。
  • 多個峰 —— 通常代表兩個不同的母體混在一起。把它們當成單一組別分析,很少是正確的做法。
  • 缺口與邊界 —— 在零的位置出現硬牆,或在最大值處出現尖峰,往往代表量度工具存在地板效應或天花板效應。

本站的分組採用 Sturges 法則:組數為 ⌈log₂(n) + 1⌉。它是最普遍見於教科書的規則,用於中等規模、大致常態的樣本並無問題。但它對大型數據(大約 n 超過 200)與偏斜數據會分組過少,把你本應看到的結構抹平。如果你的直方圖在大型數據上看起來平淡得可疑,那是這條規則的限制,未必是你數據的問題。

解讀盒鬚圖

盒鬚圖把分佈壓縮成五個數字加上離群值:

  • 由第一四分位數延伸至第三四分位數 —— 也就是中間 50% 的數據。它的寬度就是四分位距。
  • 盒內的線是中位數,不是平均數。它在盒中的位置反映偏斜程度。
  • 延伸到仍在盒外 1.5 × IQR 範圍以內的最遠一點。
  • 鬚以外的點按 Tukey 的 1.5 × IQR 慣例被標記為離群值。

計算實例

數據 2, 4, 4, 5, 6, 7, 8, 9, 22:Q1 = 4,中位數 = 6,Q3 = 8.5,因此 IQR = 4.5。

上界為 8.5 + 1.5 × 4.5 = 15.25。數值 22 超出上界,會被畫成離群值;上鬚停在 9,即界內的最大值。

留意這對摘要統計量的影響:平均數是 7.4,中位數卻是 6。這 1.4 的落差全部來自那一個離群點,而這正是為什麼對這種形狀的數據,中位數是更誠實的中心量數。

離群值是提示,不是判決

超出 1.5 × IQR 純粹是一個機械式的準則。在一個完美的常態分佈中,約有 0.7% 的點會單純因為隨機而被標記為離群值 —— 所以一個大型而乾淨的數據集本來就應該出現一些。

被標記的點值得調查,而不是刪除。要問的是:它是資料輸入錯誤(小數點打錯位置)、量度失誤、真實存在的異常個案,還是只不過是厚尾分佈的尾巴?只有前兩者才構成刪除的理由,而且刪除任何一筆數據都應該在報告中說明。因為某條規則標記了它就把礙眼的觀察值刪走,是較常見的一種隱性資料操縱。

常見錯誤

  • 把盒鬚圖中間那條線讀成平均數。它是中位數。在偏斜數據上兩者可以相差很多。
  • 比較盒鬚圖時不看樣本數。由 8 個點畫出來的盒鬚圖與由 800 個點畫出來的一樣有說服力的外觀,但可靠程度完全不同。
  • 單憑直方圖判定常態性。樣本小的時候,常態數據畫出來的直方圖經常凹凸不平。它適合用來發現嚴重偏離,而不是用來認證常態。
  • 比較組距不同的直方圖。分組方式會改變外觀形狀,兩張直方圖只有在同一分組下才可比較。

你的數據不會離開瀏覽器

兩種圖都在用戶端計算與繪製。你貼進這一頁的內容不會傳送到任何地方 —— 沒有上傳步驟,產生圖表的過程完全不涉及伺服器。本站每一個計算工具都是如此,唯一例外是升學頁上標示清楚的可選 AI 分析功能,詳情見私隱政策

參考資料

  • Anscombe, F. J. (1973). Graphs in statistical analysis. The American Statistician, 27(1), 17–21.
  • Tukey, J. W. (1977). Exploratory Data Analysis. Addison-Wesley.(盒鬚圖與 1.5 × IQR 規則的出處。)
  • Sturges, H. A. (1926). The choice of a class interval. Journal of the American Statistical Association, 21(153), 65–66.
  • Matejka, J. & Fitzmaurice, G. (2017). Same stats, different graphs. CHI '17 Proceedings.(Datasaurus Dozen。)