⚠️ 直方圖用Sturges公式自動決定分組數;箱形圖用標準嘅1.5倍IQR規則判斷離群值(outlier)。呢啲係描述性視覺化工具,唔涉及假設檢定。
直方圖 (Histogram)
箱形圖 (Box Plot)
- 快速睇數據嘅分佈形狀(偏態、集中趨勢)
- 搵出異常值/離群值
- 功課/報告入面嘅描述性統計圖表
為什麼要先畫圖
摘要統計量會掩蓋形狀。Anscombe 四重奏是經典示範:四組數據的平均數、變異數、相關係數與迴歸線完全相同,畫出來卻毫不相似 —— 一組是線性,一組是曲線,一組有單一極端離群值,一組是一團垂直點加上一個遠處的點。Datasaurus Dozen 用一隻恐龍更生動地講了同一件事。
這件事直接關係到檢定方法的選擇。t 檢定、變異數分析與皮爾森相關,全都對分佈形狀有前提假設,而一張直方圖幾秒內就能確認或推翻它們。先畫圖再檢定不是為了美觀,它本身就是選對分析方法的一部分。
解讀直方圖
直方圖顯示各個區間內數值出現的頻率。要留意的是:
- 對稱性 —— 大致對稱的單峰形狀,支持母數檢定背後的常態性假設。
- 偏斜 —— 某一側拖著長尾。右偏數據(收入、反應時間、計數)的平均數會明顯高於中位數,而基於常態分佈的百分位換算會出錯。
- 多個峰 —— 通常代表兩個不同的母體混在一起。把它們當成單一組別分析,很少是正確的做法。
- 缺口與邊界 —— 在零的位置出現硬牆,或在最大值處出現尖峰,往往代表量度工具存在地板效應或天花板效應。
本站的分組採用 Sturges 法則:組數為 ⌈log₂(n) + 1⌉。它是最普遍見於教科書的規則,用於中等規模、大致常態的樣本並無問題。但它對大型數據(大約 n 超過 200)與偏斜數據會分組過少,把你本應看到的結構抹平。如果你的直方圖在大型數據上看起來平淡得可疑,那是這條規則的限制,未必是你數據的問題。
解讀盒鬚圖
盒鬚圖把分佈壓縮成五個數字加上離群值:
- 盒由第一四分位數延伸至第三四分位數 —— 也就是中間 50% 的數據。它的寬度就是四分位距。
- 盒內的線是中位數,不是平均數。它在盒中的位置反映偏斜程度。
- 鬚延伸到仍在盒外 1.5 × IQR 範圍以內的最遠一點。
- 鬚以外的點按 Tukey 的 1.5 × IQR 慣例被標記為離群值。
計算實例
數據 2, 4, 4, 5, 6, 7, 8, 9, 22:Q1 = 4,中位數 = 6,Q3 = 8.5,因此 IQR = 4.5。
上界為 8.5 + 1.5 × 4.5 = 15.25。數值 22 超出上界,會被畫成離群值;上鬚停在 9,即界內的最大值。
留意這對摘要統計量的影響:平均數是 7.4,中位數卻是 6。這 1.4 的落差全部來自那一個離群點,而這正是為什麼對這種形狀的數據,中位數是更誠實的中心量數。
離群值是提示,不是判決
超出 1.5 × IQR 純粹是一個機械式的準則。在一個完美的常態分佈中,約有 0.7% 的點會單純因為隨機而被標記為離群值 —— 所以一個大型而乾淨的數據集本來就應該出現一些。
被標記的點值得調查,而不是刪除。要問的是:它是資料輸入錯誤(小數點打錯位置)、量度失誤、真實存在的異常個案,還是只不過是厚尾分佈的尾巴?只有前兩者才構成刪除的理由,而且刪除任何一筆數據都應該在報告中說明。因為某條規則標記了它就把礙眼的觀察值刪走,是較常見的一種隱性資料操縱。
常見錯誤
- 把盒鬚圖中間那條線讀成平均數。它是中位數。在偏斜數據上兩者可以相差很多。
- 比較盒鬚圖時不看樣本數。由 8 個點畫出來的盒鬚圖與由 800 個點畫出來的一樣有說服力的外觀,但可靠程度完全不同。
- 單憑直方圖判定常態性。樣本小的時候,常態數據畫出來的直方圖經常凹凸不平。它適合用來發現嚴重偏離,而不是用來認證常態。
- 比較組距不同的直方圖。分組方式會改變外觀形狀,兩張直方圖只有在同一分組下才可比較。
你的數據不會離開瀏覽器
兩種圖都在用戶端計算與繪製。你貼進這一頁的內容不會傳送到任何地方 —— 沒有上傳步驟,產生圖表的過程完全不涉及伺服器。本站每一個計算工具都是如此,唯一例外是升學頁上標示清楚的可選 AI 分析功能,詳情見私隱政策。
參考資料
- Anscombe, F. J. (1973). Graphs in statistical analysis. The American Statistician, 27(1), 17–21.
- Tukey, J. W. (1977). Exploratory Data Analysis. Addison-Wesley.(盒鬚圖與 1.5 × IQR 規則的出處。)
- Sturges, H. A. (1926). The choice of a class interval. Journal of the American Statistical Association, 21(153), 65–66.
- Matejka, J. & Fitzmaurice, G. (2017). Same stats, different graphs. CHI '17 Proceedings.(Datasaurus Dozen。)