药品销量分析
假设你要分析某种药品的销量。数据是 1000 份、2000 份、3000 份。平均值挺好办,就是 2000 份。这时候平均值定理成立条件挺稳,能告诉你平均销量是 2000。但这不代表药品卖的是 2000 份,也不代表销量曲线是完美的正态分布。
要是实际数据是 1000, 1200, 1800, 2500, 3000,平均值还是 1800,这时候平均值定理适用条件还能用,毕竟大局部数据还在中间那个区域。但要是数据是 1000, 1000, 1000, 1000, 1000,平均值是 1000,这时候平均值定理就失效了,出于所有数据都一样,平均数毫无意义,抽样波动根本不存有。
正态分布与概率论基石
还有人说,平均值定理成立条件是概率论的基石,概率论里没它行不通。这话有道理,但在应用层面得看情况。比如在画正态分布曲线的时候,平均值定理告诉你那个高瘦的那个柱子(均值)在哪儿。但要是你想知道这柱子里有多少概率,那得看那个“方差”(标准差)。
方差大了,柱子就矮胖,平均值定理适用条件只管位置,不管高度。故此,你不能拿着平均值定理去估算置信区间,那是画大饼。你必须结合方差和标准差,才能完整描述数据的分布特征。
异常值与离群点
另外,平均值定理成立条件对“独立性”和“正态性”要求不高,就连有时候它被用来简化那些复杂的模型。比如大数定律,它说样本量大了,平均值就逼近总体平均值。这时候平均值定理是成立的。但要是样本量小,要么数据里有异常值(离群点),那平均值定理就是个“伪命题”。
这时候你得看中位数,看有没有众数,要么干脆用中位数 smoothed(平滑)一下数据。这时候平均值定理适用条件就站不住脚了,出于它受不了干扰。例如,一个亿万富翁走进一个酒吧,酒吧里所有人的平均财富瞬间飙升到数亿,但这并不能代表酒吧里普通人的真实财富水平。