平均數與離散程度

☰ Contents

平均數是用一個數字代表一大堆數字,而這整個主題講的就是這種替代要付出什麼代價。兩組資料可以有相同的平均數,卻在其他方面毫無共同之處——這正是為什麼任何一句關於資料的正經陳述,都要同時給出集中趨勢和離散程度,也是為什麼單獨一個「平均數」,是統計學裡最悄無聲息、也最容易誤導人的說法。

該用哪種平均數?

數值分布比較均勻時用平均數,資料裡有離群值或者偏斜時用中位數,資料是分類別、沒有運算可做時用眾數。集中趨勢的度量把這個選擇變成一件要認真考慮的事。平均數是把各個值加起來,再除以個數。對於 4、5、5、6 和 30,平均數是 (4 + 5 + 5 + 6 + 30) ÷ 5 = 10,但中位數——排在中間的那個值——是 5,眾數——出現次數最多的值——也是 5。平均數之所以偏了,是因為那個較大的值 30 把總和拉高了,而中位數只取決於排列順序。數值個數是偶數時,中位數是中間兩個數的平均:對於 3、5、7 和 9,中位數是 (5 + 7) ÷ 2 = 6。平均數必定落在最小值和最大值之間。

05101520中位數 4平均數 3.8

把數據從小到大排好後,中位數就是中間的那個值,所以它只取決於排名,不取決於大小——把x₅移到其他值之外也不會改變中位數

把最後一個值拖到最右邊

平均數把總數平均分給每一份,中位數和眾數講另外兩種平均數。

264
先加再平分:2 + 6 + 4 = 12,而 12 ÷ 3 = 4 — 平均,也叫平均數。 完整課程: 平均數

薪水分別是 22、24、25、26 和 180(千元):平均數是 55.4,中位數是 25。 這間辦公室裡沒有一個人賺的錢接近 55.4,中位數才是老實的概括。

平均數是一個平衡點,中位數是一個計數點,這正是它們對離群值反應如此不同的原因。把最大值從 180 改成 1,800,平均數會猛地跳到將近 380;中位數卻紋絲不動,因為它只關心哪個值排在中間,不關心極端值離得有多遠。兩者沒有哪個總是「對」的——平均數可以還原成總數,所以發薪資總額要用平均數,而典型員工的水準不需要。
2424mean 10
把 6 換成 24,平衡點滑到 10——但中間的值仍然是 4。 完整課程: 集中趨勢量數

從表格裡求平均數

同一個值反覆出現時,把它們全部列出來就太浪費了。次數表裡的平均數展示了這條捷徑:把每個值乘以它的次數,把這些乘積加起來,再除以總次數。中位數則來自次數的累計總數,看中間那一項落在哪裡。

1×3 + 2×5 + 3×2 = 19divide by the total frequency19 ÷ 10 = 1.9
平均數用次數為每個值加權:19 球除以 10 場是 1.9。 完整課程: 由次數表求平均

分組資料更難處理,因為單個數值都不見了。分組資料的平均數假設每個值都落在它所在組的中點,這就讓答案成了一個估計值——一個誠實的估計值,也應該這樣標註出來。眾數組從另一邊講了同樣的道理:對分組資料,你能說出人數最多的那一組,卻說不出單獨一個眾數。

515mean 11
這裡是 5 × 4 加 15 × 6,等於 110。共 10 個值,估計平均是 11。 完整課程: 分組資料的平均數

換你試試

0404856

一個非常小的極端值,幾乎不會移動哪一種集中趨勢量數?

4122060

一個非常大的極端值,幾乎不會移動哪一種集中趨勢量數?

為什麼只有平均數還不夠?

平均數給出資料的中心,卻完全沒說數值散布得有多開,而散布程度往往才是關鍵。離散程度的度量用兩組資料說明了這一點。看兩名球員三場比賽的得分:一人得了 9、10、11 分,另一人得了 1、10、19 分。兩人的平均數都是 10,因為 9 + 10 + 11 = 30,1 + 10 + 19 = 30。最簡單的離散程度指標是全距,也就是最大值減最小值。第一名球員的全距是 11 − 9 = 2,第二名是 19 − 1 = 18,所以第一名穩定得多。教練要挑一個靠得住的球員,看的正是離散程度。全距有個弱點:一個不尋常的值就能把它撐得很大,這正是為什麼常常改用四分位距。求全距之前先把資料排序,因為沒排序的清單會把最大值和最小值藏起來。

01020304001020304020高度 20/40 處讀出 20 分鐘這裡有 10/40 的人跨越 6.7 分鐘

20/40 在這以下,所以這是中位數

在總數四分之一的高度橫著讀,再往下找到數值。

abc4.0
這些的平均數也是 4,但分布得更廣。 完整課程: 離散程度量數

全距和四分位距介紹了全距的修正方案。四分位距是上四分位數減去下四分位數,描述的是資料中間一半的散布,一個極端值碰不到它。

061218243036middle half2142230
全距是 30 − 2 = 28。中間一半,22 − 14 = 8,就是四分位距。 完整課程: 全距和四分位距

百分位數把這個想法推廣開來:90% 的資料落在第 90 百分位數以下。四分位數其實就是第 25、第 50 和第 75 百分位數的舊稱,生長曲線圖、考試成績和回應時間指標,實際上都是用百分位數來報告的。

累積次數和四分位數

累積次數是計數的累計總和,把它對著每一組的上邊界畫出來,就得到一條 S 形曲線,能回答任何一個值「有多少筆資料低於它」。

0491317102030
逐步累加,曲線永不下降:3、再 11、再 17。 完整課程: 累積次數

從曲線上讀四分位數直接從曲線上讀出四分位數:沿縱軸走到總數的四分之一,橫著走到曲線上,再往下讀出數值。同樣的操作在二分之一和四分之三處,分別給出中位數和上四分位數。

0203040102030401013minutes taken
40 的四分之一是 10。在 10 處橫向讀,碰到曲線再往下讀出對應值。 完整課程: 由曲線求四分位數
把累積總數對著組的上邊界畫,絕不要對著中點畫。這條曲線畫的是「所有小於等於這個值的資料」,而這句話只有在組的上邊界才成立。對著中點畫,會讓整條曲線往左偏移,從它讀出的每一個四分位數都會偏差半個組距——而且這個錯誤從來不像個錯誤,因為曲線畫出來的形狀照樣看著合理。

換你試試

0510152025304131729

最小值 4,最大值 29。全距是多少?

05014182348

讀數 14、18、23,還有一個離群值 48。全距是多少?

盒鬚圖看的是什麼?

盒鬚圖展示五個數:最小值、下四分位數、中位數、上四分位數和最大值。盒鬚圖把箱子從下四分位數畫到上四分位數,在箱子裡標出中位數,再從箱子兩端拉出鬚線,一直到最小值和最大值。對於資料 3、5、6、8、10、11 和 14,中位數是 8。下四分位數是下半部分 3、5、6 的中間值,也就是 5;上四分位數是 10、11、14 的中間值,也就是 11。箱子從 5 到 11,它的長度 11 − 5 = 6,就是四分位距。箱子裝著資料中間的一半。離群值——超出箱子一個半箱長以外的值——會單獨畫成一個叉。從左到右讀這五個數:它們必須是按順序排的。

1020304050中位數 − q1 = 5,q3 − 中位數 = 5

在任何跨度下 中位數 − q1 = q3 − 中位數,所以對稱只是線索,從來不是證明

保持箱子兩半相等,並讓四個區間等寬。

01020304050Q₃ + 1.5 IQR = 53.5Q₁ = 14.8Q₃ = 30.3IQR = 15.5 · 中位數 22.5

盒子從 Q₁ 延伸到 Q₃,四分位距 IQR = 15.5,無論盒子變得多窄,它始終包含二十個值中的十個:盒子變窄是密度較高,而不是資料點變少

把中間十個值擠在一起,再把最大值推過柵欄

五個數決定它:最小值、下四分位數、中位數、上四分位數、最大值。 完整課程: 箱形圖

它的價值在於比較。同一根軸上的兩個盒鬚圖,一眼就能看出哪組更高、哪組更穩定、哪組是不是偏斜——這三個問題用文字講要寫一整段。

從盒鬚圖判斷是否常態把這種讀法變成一個檢驗:對稱分布裡,中位數在箱子正中間,兩條鬚線長度相近,所以中位數偏向一端,或者一條鬚線特別長,都是偏態的證據。這一點以後很重要,因為好幾種統計方法要先假設對稱,才允許拿來用。

skewed102030405060
這裡箱子右半是左半的三倍,右邊的鬚也更長。 完整課程: 從箱形圖判斷常態性

換你試試

下四分位數 12,上四分位數 24。箱子有多寬?

100 個數值畫成箱形圖。有多少個落在箱子裡面?

標準差怎麼算,為什麼要這樣算?

求標準差,先求出每個值離平均數有多遠,把這些距離平方,求平方的平均數,再開平方根。標準差一步步把它搭出來。對於 2、4、4、4、5、5、7 和 9,平均數是 40 ÷ 8 = 5。離 5 的距離分別是 −3、−1、−1、−1、0、0、2 和 4,它們的平方加起來是 9 + 1 + 1 + 1 + 0 + 0 + 4 + 16 = 32。平方的平均數是 32 ÷ 8 = 4,標準差就是它的平方根,2。之所以要平方,是因為平均數上下兩邊的距離總會抵消成 0,而平方永遠不會是負數。開平方根是為了把答案換回資料本身的單位。如果所有值都一樣,標準差就是 0。答案永遠不會比全距還大。

03691215185Σ(x − x̄) = 0平均絕對偏差 = 3

對任何一組資料都有 Σ(x − x̄) = 0,所以在平均能量出什麼之前,符號就被去掉了

試著讓天平兩側的長度不同。

05101520μ = 7.4|x − μ| = 5.6(x − μ)² = 31.4其餘四個: 27.8σ² = 59.2 / 5 = 11.84

(x − μ)² = 31.4:距離變為2倍時,長條變為2倍,而平方變為4倍,所以一個遠的值會壓過好幾個近的值

拖動最後一個值,直到它的平方達到100

159
平均數相同,但分布更廣,所以標準差更大。 完整課程: 標準差

先說一個更溫和的近親。平均絕對差不平方,直接把距離取平均,用絕對值來阻止正負號互相抵消。它更好講,也確實有用——這就把一個自然的問題問得更尖銳了:既然這樣也行,為什麼還要平方?

4215
它們到 5 的距離是 4、2、1、5。距離沒有正負號。 完整課程: 平均絕對離差
選擇平方,看重的是它在後續步驟裡能帶來什麼,而不是它對這批資料本身做了什麼。絕對值在代數運算裡很彆扭,它們在零點沒有導數,用它們搭出來的變異數也不能相加。平方偏差卻可以相加:幾個獨立量之和的變異數,等於它們各自變異數之和。正是這一條性質,撐起了常態分布、標準誤和假設檢定的整套體系,為此損失一點直觀上的可解釋性是值得的。
d²d²d²
直接相加會抵消成零。先平方,它們就不能抵消。 完整課程: 標準差:未分組數據

標準差:未分組資料用的是更實用的公式——平方的平均數減去平均數的平方——只用掃一遍資料就能得到同樣的答案,不用掃兩遍。標準差:分組資料把它推廣到次數表,用次數給每個平方值加權,對分組資料則用組中點,帶著和分組平均數一樣的估計值提醒。

換你試試

1234567891011

2、2、10、10 的標準差是多少?

4mean5.0

平均數是 6,其中一個值是 4。它的平方距離是多少?

怎麼老老實實地比較兩組資料?

要公平地比較兩組資料,每組都要給出一個集中趨勢指標和一個離散程度指標,兩組用同一對指標,再說清楚這些數字在資料背景下代表什麼。比較資料集練的正是這套結構。中位數要配四分位距,平均數要配標準差。假設兩個班考了同一場測驗。A 班的中位數是 62,四分位距是 10;B 班的中位數是 55,四分位距是 25。一個好的比較會說:A 班平均考得更高,高出 62 − 55 = 7 分,而且成績更穩定,因為它中間一半的分數只跨了 10 分,而不是 25 分。資料裡有離群值時,用中位數這一對,因為離群值幾乎撼動不了它們。一個比較列出四個數卻不下任何結論,等於什麼都沒回答,所以重讀一遍你寫的內容,確保每個數字都在講這兩個班的事。

AB67.3%52.7%90% > 80%,40% > 30%,所以 A 兩行都贏輕症重症

A 兩行都贏,總體也 A% > B%,因為兩種組成相近

讓 A 在兩行都更好,而總體更差。

team Ateam B102030
用同樣的刻度,B 隊平均也是 20 分——但箱子寬得多。 完整課程: 比較數據集

把兩對指標混著用——中位數配標準差——就是拿一個穩健的中心去配一個不穩健的離散度,離群值就會影響這段描述的一半。

還有一個陷阱,就算每一步算術都對,也照樣能落進去。辛普森悖論展示了這樣兩組資料:療法 A 在輕症和重症裡都勝過療法 B,合起來算整體卻輸了——因為兩組人數不一樣多,重症病例又不成比例地集中在某一種療法裡。算術本身沒有一處出錯。這一課講的是:混合族群算出來的平均數,不是其中任何一個人的性質。

AB
把每列加總:A 治好 110 人中的 49,B 治好 110 人中的 83——45% 對 75%。 完整課程: 辛普森悖論

換你試試

oneother10203040

兩組數據的平均數都是 25。其中一組的離散程度小很多。哪一組比較穩定?

oneother203040

兩組數據的平均數都是 30。其中一組的離散程度小很多。哪一組比較穩定?

值得點名的錯誤

接下來學什麼

這些概括是統計學其餘內容所用的詞彙表。統計圖表指南(英文)講的是它們所配的圖,包括累積次數曲線和直方圖。一旦每個研究對象帶著兩個測量值而不是一個,問題就變成它們是不是一起變動——見散布圖、相關與迴歸指南(英文)。而用樣本的平均數和標準差,去說一說你沒有測量過的母體,整個這件事就是抽樣與推論指南(英文)的主題。

在應用程式裡系統學一遍

Math Challenge 把這些內容都教成配圖的課程——一份畫出來的資料集,一道做出來的計算,還有針對你答錯的那道題、而不是隨便一道相近題目重新講一遍的試一試。它們收在一套從最初的數數一直到大學入學統計學的 800 多課課程目錄裡。

輪到你了

三題試一試,點選作答。

4、7 和 10 的平均數

3、9 和 5 的中位數

12、4 和 9 的全距

常見問題

什麼時候該用中位數而不是平均數?
只要資料裡有極端值或者拖著長尾,就該用中位數,因為平均數會被離群值拉著走,中位數不會。房價和收入是最典型的例子:少數幾個特別大的數值,把平均數拉到大多數人的實際水準之上,而中位數說的是排在中間的那戶人家。分布大致對稱、或者你需要求總數的時候,才用平均數,因為平均數乘以個數能還原出總和。
標準差到底量的是什麼?
它量的是一個值到平均數的典型距離。先求出每個值到平均數的偏差,把它們平方,讓正負號不能互相抵消,再求平方的平均數,最後開平方根,回到原來的單位。標準差是 4 公分,意思是各個值平均離平均數大約 4 公分。它和資料的單位相同,這正是它被引用而不是變異數被引用的原因。
四分位距要怎麼求?
把資料排序,求出中位數,再求下半部分的中位數和上半部分的中位數。這兩個就是下四分位數和上四分位數,四分位距等於上四分位數減去下四分位數。它描述的是資料中間一半的散布程度,完全不管兩端的極端值,這正是它總是和中位數搭配、而不是和平均數搭配的原因。
為什麼從分組次數表裡求不出精確的平均數?
因為分組這個動作本身就丟掉了原始數值。一組記作 20 到 30,裡面的數值可能聚在 21 附近,也可能聚在 29 附近,表格已經不知道是哪種情況。標準做法是假設每個值都落在它所在組的中點,這在平均意義上說得過去,但並不精確,所以分組平均數總是作為估計值來報告。同樣的局限,也讓眾數在分組資料裡只能是一組,而不是單一一個眾數。
辛普森悖論是什麼?
指的是每個子組裡都成立的趨勢,一旦把子組合併起來,結論卻反過來了。一種療法可能在輕症和重症裡的成功率都更高,合起來算整體成功率卻更低,因為各組的人數和病情比例相差很大。這個悖論提醒我們:混合族群算出來的平均數,不是其中任何一個個體的性質,而且把資料合併起來,還可能憑空造出一個哪部分資料都不支持的結論。
怎麼才算正確地比較兩組資料?
比較一個集中趨勢指標和一個離散程度指標,再說清楚每個數字在具體情境裡代表什麼。兩個班級測驗的平均數相同,但如果一個標準差是 3、另一個是 15,情況可能完全不同,因為標準差大的那個班裡,既有最好的學生也有最差的學生。只報平均數的比較,只回答了一半的問題,而且藏起來的正是那有意思的另一半。