平均数与离散程度

☰ Contents

平均数是用一个数字代表一大堆数字,而这整个话题讲的就是这种替代要付出什么代价。两组数据可以有相同的均值,却在其他方面毫无共同之处——这正是为什么任何一句关于数据的严肃陈述,都要同时给出集中趋势和离散程度,也是为什么单独一个"平均数",是统计学里最悄无声息、也最容易误导人的说法。

该用哪种平均数?

数值分布比较均匀时用均值,数据里有离群值或者偏斜时用中位数,数据是分类别、没有运算可做时用众数。集中趋势的度量把这个选择变成一件要认真考虑的事。均值是把各个值加起来,再除以个数。对于 4、5、5、6 和 30,均值是 (4 + 5 + 5 + 6 + 30) ÷ 5 = 10,但中位数——排在中间的那个值——是 5,众数——出现次数最多的值——也是 5。均值之所以偏了,是因为那个较大的值 30 把总和拉高了,而中位数只取决于排列顺序。数值个数是偶数时,中位数是中间两个数的平均:对于 3、5、7 和 9,中位数是 (5 + 7) ÷ 2 = 6。均值必定落在最小值和最大值之间。

05101520中位数 4平均数 3.8

把数据从小到大排好后,中位数就是中间的那个值,所以它只取决于排名,不取决于大小——把x₅移到其他值之外也不会改变中位数

把最后一个值拖到最右边

均值把总数平均分给每一份,中位数和众数讲另外两种平均数。

264
先加再分:2 + 6 + 4 = 12,而 12 ÷ 3 = 4 — 平均值,也叫平均数。 完整课程: 平均数

薪水分别是 22、24、25、26 和 180(千元):均值是 55.4,中位数是 25。 这间办公室里没有一个人挣的钱接近 55.4,中位数才是老实的概括。

均值是一个平衡点,中位数是一个计数点,这正是它们对离群值反应如此不同的原因。把最大值从 180 改成 1,800,均值会猛地跳到将近 380;中位数却纹丝不动,因为它只关心哪个值排在中间,不关心极端值离得有多远。两者没有哪个总是"对"的——均值可以还原成总数,所以发工资总额要用均值,而典型员工的水平不需要。
2424mean 10
把 6 换成 24,平衡点就滑到 10——但中间那个值还是 4。 完整课程: 集中趋势的度量

从表格里求平均数

同一个值反复出现时,把它们全部列出来就太浪费了。频数表里的平均数展示了这条捷径:把每个值乘以它的频数,把这些乘积加起来,再除以总频数。中位数则来自频数的累计总数,看中间那一项落在哪里。

1×3 + 2×5 + 3×2 = 19divide by the total frequency19 ÷ 10 = 1.9
平均数按频数给每个值加权:19 个球分给 10 场,是 1.9。 完整课程: 由频数表求平均数

分组数据更难处理,因为单个数值都不见了。分组数据的均值假设每个值都落在它所在组的中点,这就让答案成了一个估计值——一个诚实的估计值,也应该这样标注出来。众数组从另一边讲了同样的道理:对分组数据,你能说出人数最多的那一组,却说不出单独一个众数。

515mean 11
这里是 5 × 4 加 15 × 6,得 110。共 10 个值,估计值是 11。 完整课程: 分组数据的平均数

你来试试

0404856

哪种平均数几乎不受一个特别小的数影响?

4122060

哪种平均数几乎不受一个特别大的数影响?

为什么只有平均数还不够?

平均数给出数据的中心,却完全没说数值散布得有多开,而散布程度往往才是关键。离散程度的度量用两组数据说明了这一点。看两名球员三场比赛的得分:一人得了 9、10、11 分,另一人得了 1、10、19 分。两人的均值都是 10,因为 9 + 10 + 11 = 30,1 + 10 + 19 = 30。最简单的离散程度指标是极差,也就是最大值减最小值。第一名球员的极差是 11 − 9 = 2,第二名是 19 − 1 = 18,所以第一名稳定得多。教练要挑一个靠得住的球员,看的正是离散程度。极差有个弱点:一个不寻常的值就能把它撑得很大,这正是为什么常常改用四分位距。求极差之前先把数据排序,因为没排序的列表会把最大值和最小值藏起来。

01020304001020304020高度 20/40 处读出 20 分钟这里有 10/40 的人跨越 6.7 分钟

20/40 在这以下,所以这是中位数

在总数四分之一的高度横着读,再往下找到数值。

abc4.0
这些数据平均也是 4,但分散得多。 完整课程: 离散程度的度量

极差和四分位距介绍了极差的修正方案。四分位距是上四分位数减去下四分位数,描述的是数据中间一半的散布,一个极端值碰不到它。

061218243036middle half2142230
极差是 30 − 2 = 28。中间一半,22 − 14 = 8,是四分位距。 完整课程: 极差与四分位距

百分位数把这个想法推广开来:90% 的数据落在第 90 百分位数以下。四分位数其实就是第 25、第 50 和第 75 百分位数的旧称,生长曲线图、考试成绩和响应时间指标,实际上都是用百分位数来报告的。

累积频数和四分位数

累积频数是计数的累计总和,把它对着每一组的上边界画出来,就得到一条 S 形曲线,能回答任何一个值"有多少个数据低于它"。

0491317102030
边走边加,曲线永远不会下降:3,然后 11,然后 17。 完整课程: 累积频数

从曲线上读四分位数直接从曲线上读出四分位数:沿纵轴走到总数的四分之一,横着走到曲线上,再往下读出数值。同样的操作在二分之一和四分之三处,分别给出中位数和上四分位数。

0203040102030401013minutes taken
40 的四分之一是 10。在 10 处横着读到曲线,再往下落到对应的值。 完整课程: 由曲线求四分位数
把累计总数对着组的上边界画,绝不要对着中点画。这条曲线画的是"所有小于等于这个值的数据",而这句话只有在组的上边界才成立。对着中点画,会让整条曲线往左偏移,从它读出的每一个四分位数都会偏差半个组距——而且这个错误从来不像个错误,因为曲线画出来的形状照样看着合理。

你来试试

0510152025304131729

最小值4,最大值29。极差是多少?

05014182348

读数是14, 18、23,还有一个离群值48。极差是多少?

箱线图看的是什么?

箱线图展示五个数:最小值、下四分位数、中位数、上四分位数和最大值。箱线图把箱子从下四分位数画到上四分位数,在箱子里标出中位数,再从箱子两端拉出须线,一直到最小值和最大值。对于数据 3、5、6、8、10、11 和 14,中位数是 8。下四分位数是下半部分 3、5、6 的中间值,也就是 5;上四分位数是 10、11、14 的中间值,也就是 11。箱子从 5 到 11,它的长度 11 − 5 = 6,就是四分位距。箱子装着数据中间的一半。离群值——超出箱子一个半箱长以外的值——会单独画成一个叉。从左到右读这五个数:它们必须是按顺序排的。

1020304050中位数 − q1 = 5,q3 − 中位数 = 5

在任何跨度下 中位数 − q1 = q3 − 中位数,所以对称只是线索,从来不是证明

保持箱子两半相等,并让四个区间等宽。

01020304050Q₃ + 1.5 IQR = 53.5Q₁ = 14.8Q₃ = 30.3IQR = 15.5 · 中位数 22.5

箱体从 Q₁ 延伸到 Q₃,四分位距 IQR = 15.5,无论箱体变得多窄,它始终包含二十个值中的十个:箱体变窄是密度更高,而不是数据点变少

把中间十个值挤在一起,再把最大值推过栅栏

五个数画出它:最小值、下四分位数、中位数、上四分位数、最大值。 完整课程: 箱线图

它的价值在于比较。同一根轴上的两个箱线图,一眼就能看出哪组更高、哪组更稳定、哪组是不是偏斜——这三个问题用文字讲要写一整段。

从箱线图判断是否正态把这种读法变成一个检验:对称分布里,中位数在箱子正中间,两条须线长度相近,所以中位数偏向一端,或者一条须线特别长,都是偏态的证据。这一点以后很重要,因为好几种统计方法要先假设对称,才允许拿来用。

skewed102030405060
这里箱子右半是左半的三倍,右边的须也更长。 完整课程: 由箱线图判断正态性

你来试试

下四分位数是 12,上四分位数是 24。箱子有多宽?

用箱线图画出了 100 个数。其中有多少个落在箱子里面?

标准差怎么算,为什么要这样算?

求标准差,先求出每个值离均值有多远,把这些距离平方,求平方的均值,再开平方根。标准差一步步把它搭出来。对于 2、4、4、4、5、5、7 和 9,均值是 40 ÷ 8 = 5。离 5 的距离分别是 −3、−1、−1、−1、0、0、2 和 4,它们的平方加起来是 9 + 1 + 1 + 1 + 0 + 0 + 4 + 16 = 32。平方的均值是 32 ÷ 8 = 4,标准差就是它的平方根,2。之所以要平方,是因为均值上下两边的距离总会抵消成 0,而平方永远不会是负数。开平方根是为了把答案换回数据本身的单位。如果所有值都一样,标准差就是 0。答案永远不会比极差还大。

03691215185Σ(x − x̄) = 0平均绝对偏差 = 3

对任何一组数据都有 Σ(x − x̄) = 0,所以在平均能量出什么之前,符号就被去掉了

试着让天平两侧的长度不同。

05101520μ = 7.4|x − μ| = 5.6(x − μ)² = 31.4其余四个: 27.8σ² = 59.2 / 5 = 11.84

(x − μ)² = 31.4:距离变为2倍时,条形变为2倍,而平方变为4倍,所以一个远的值会压过好几个近的值

拖动最后一个值,直到它的平方达到100

159
平均数相同,但分散得多,所以标准差更大。 完整课程: 标准差

先说一个更温和的近亲。平均绝对偏差不平方,直接把距离取平均,用绝对值来阻止正负号相互抵消。它更好讲,也确实有用——这就把一个自然的问题问得更尖锐了:既然这样也行,为什么还要平方?

4215
它们到 5 的距离分别是 4、2、1、5。距离不带正负号。 完整课程: 平均绝对偏差
选择平方,看重的是它在后续步骤里能带来什么,而不是它对这批数据本身做了什么。绝对值在代数运算里很别扭,它们在零点没有导数,用它们搭出来的方差也不能相加。平方偏差却可以相加:几个独立量之和的方差,等于它们各自方差之和。正是这一条性质,撑起了正态分布、标准误和假设检验的整套体系,为此损失一点直观上的可解释性是值得的。
d²d²d²
直接相加会抵消成零。先平方,就不会再抵消。 完整课程: 标准差:未分组数据

标准差:未分组数据用的是更实用的公式——平方的均值减去均值的平方——只用扫一遍数据就能得到同样的答案,不用扫两遍。标准差:分组数据把它推广到频数表,用频数给每个平方值加权,对分组数据则用组中点,带着和分组均值一样的估计值提醒。

你来试试

1234567891011

2, 2、10, 10 的标准差是多少?

4mean5.0

平均数是 6,一个数值是 4。它们的平方距离是多少?

怎么老老实实地比较两组数据?

要公平地比较两组数据,每组都要给出一个集中趋势指标和一个离散程度指标,两组用同一对指标,再说清楚这些数字在数据背景下意味着什么。比较数据集练的正是这套结构。中位数要配四分位距,均值要配标准差。假设两个班考了同一场测验。A 班的中位数是 62,四分位距是 10;B 班的中位数是 55,四分位距是 25。一个好的比较会说:A 班平均考得更高,高出 62 − 55 = 7 分,而且成绩更稳定,因为它中间一半的分数只跨了 10 分,而不是 25 分。数据里有离群值时,用中位数这一对,因为离群值几乎撼动不了它们。一个比较列出四个数却不下任何结论,等于什么都没回答,所以重读一遍你写的内容,确保每个数字都在讲这两个班的事。

AB67.3%52.7%90% > 80%,40% > 30%,所以 A 两行都赢轻症重症

A 两行都赢,总体也 A% > B%,因为两种构成相近

让 A 在两行都更好,而总体更差。

team Ateam B102030
同样的刻度,B 队平均分也是 20——但箱子宽得多。 完整课程: 比较数据集

把两对指标混着用——中位数配标准差——就是拿一个稳健的中心去配一个不稳健的离散度,离群值就会影响这段描述的一半。

还有一个陷阱,就算每一步算术都对,也照样能落进去。辛普森悖论展示了这样两组数据:疗法 A 在轻症和重症里都胜过疗法 B,合起来算总体却输了——因为两组人数不一样多,重症病例又不成比例地集中在某一种疗法里。算术本身没有一处出错。这一课讲的是:混合人群算出来的平均数,不是其中任何一个人的性质。

AB
把每行加总:A 组 110 人治好 49 人,B 组 110 人治好 83 人——45% 对 75%。 完整课程: 辛普森悖论

你来试试

oneother10203040

两组数据的平均数都是 25。其中一组的离散程度小得多。哪一组更稳定?

oneother203040

两组数据的平均数都是 30。其中一组的离散程度小得多。哪一组更稳定?

值得点名的错误

接下来学什么

这些概括是统计学其余内容所用的词汇表。统计图表指南(英文)讲的是它们所配的图,包括累积频数曲线和直方图。一旦每个研究对象带着两个测量值而不是一个,问题就变成它们是不是一起变动——见散点图、相关与回归指南(英文)。而用样本的均值和标准差,去说一说你没有测量过的总体,整个这件事就是抽样与推断指南(英文)的主题。

在应用里系统学一遍

Math Challenge 把这些内容都教成配图的课程——一份画出来的数据集,一道做出来的计算,还有针对你答错的那道题、而不是随便一道相近题目重新讲一遍的试一试。它们收在一套从最初的数数一直到大学入学统计学的 800 多节课程目录里。

轮到你了

三题试一试,点选作答。

4、7 和 10 的均值

3、9 和 5 的中位数

12、4 和 9 的极差

常见问题

什么时候该用中位数而不是均值?
只要数据里有极端值或者拖着长尾,就该用中位数,因为均值会被离群值拉着走,中位数不会。房价和收入是最典型的例子:少数几个特别大的数值,把均值拉到大多数人的实际水平之上,而中位数说的是排在中间的那户人家。分布大致对称、或者你需要求总数的时候,才用均值,因为均值乘以个数能还原出总和。
标准差到底量的是什么?
它量的是一个值到均值的典型距离。先求出每个值到均值的偏差,把它们平方,让正负号不能相互抵消,再求平方的平均数,最后开平方根,回到原来的单位。标准差是 4 厘米,意思是各个值平均离均值大约 4 厘米。它和数据的单位相同,这正是它被引用而不是方差被引用的原因。
四分位距要怎么求?
把数据排序,求出中位数,再求下半部分的中位数和上半部分的中位数。这两个就是下四分位数和上四分位数,四分位距等于上四分位数减去下四分位数。它描述的是数据中间一半的散布程度,完全不管两头的极端值,这正是它总是和中位数搭配、而不是和均值搭配的原因。
为什么从分组频数表里求不出精确的均值?
因为分组这个动作本身就丢掉了原始数值。一组记作 20 到 30,里面的数值可能扎堆在 21 附近,也可能扎堆在 29 附近,表格已经不知道是哪种情况。标准做法是假设每个值都落在它所在组的中点,这在平均意义上说得过去,但并不精确,所以分组均值总是作为估计值来报告。同样的局限,也让众数在分组数据里只能是一个组,而不是单独一个众数。
辛普森悖论是什么?
指的是每个子组里都成立的趋势,一旦把子组合并起来,结论却反过来了。一种疗法可能在轻症和重症里的成功率都更高,合起来算总体成功率却更低,因为各组的人数和病情比例相差很大。这个悖论提醒我们:混合人群算出来的平均数,不是其中任何一个个体的性质,而且把数据合并起来,还可能凭空造出一个哪部分数据都不支持的结论。
怎么才算正确地比较两组数据?
比较一个集中趋势指标和一个离散程度指标,再说清楚每个数字在具体情境里意味着什么。两个班级测验的均值相同,但如果一个标准差是 3、另一个是 15,情况可能完全不同,因为标准差大的那个班里,既有最好的学生也有最差的学生。只报均值的比较,只回答了一半的问题,而且藏起来的正是那有意思的另一半。