什么是中心极限定理?
中心极限定理的要义是一个大型样本的正确抽样与其所代表的群体存在相似关系。
根据中心极限定理,任何一个群体的样本的平均值都会围绕在该群体的整体平均值周围,并且呈正态分布。
样本的数量越大,取样次数越多,样本平均值的分布也就越接近于一条正态分布曲线。普遍的经验是,样本的数量必须超过30,中心极限定理才能成立。
而正态分布是一个很强大的武器,通过正态分布,我们可以就知道有68%的数值会落在整体平均值的1个标准差范围之内,有95%的数值会落在整体平均值的2个标准差范围之内,有99%的数值会落在整体平均值的3个标准差范围之内。
所以,中心极限定理有两个要点:样本的平均值与总体的平均值类似;样本的平均值呈现正态分布。
标准差和标准误差
要深入了解中心极限定理,还需要知道标准差和标准误差的区别。
标准差是用来衡量群体中所有个体的离散性。它是方差的平方根,而方差是一组数据与该组数据平均值之差的平方数的平均值。其计算公式如下:
2. 标准误差衡量的是样本平均值的离散性,是所有样本平均值的标准差,等于标准差除以样本量的平方根,其计算公式如下:其中SE代表标准误差,SD代表标准差,N代表样本量。
如果标准误差很大,就意味着样本平均值在群体平均值周围分布得极为分散;如果标准误差差很小,就意味着样本平均值之间的聚集程度很高。
中心极限定理能做什么
由于样本平均值是呈正态分布的(这一点要归功于中心极限定理),我们便可以通过这条神奇的曲线推出以下结论(如下图所示):
(1)约有68%的样本平均值会在群体平均值一个标准误差的范围之内;
(2)约有95%的样本平均值会在群体平均值的两个标准误差的范围之内;
(3)约有99.7%的样本平均值会在群体平均值3个标准误差的范围之内。
根据中心极限定理,我们能得出以下推断:
1. 如果从某个群体中多次随机抽取数量足够多的样本,那么这些样本的平均值会以整体平均值为中心呈现正态分布。
2. 绝大多数的样本平均值都会紧紧围绕在整体平均值的周围,通过计算标准误差就可以知道这些样本平均值到底是离得“近”还是“远”。
3. 通过中心极限定理,我们便可知道样本平均值与整体平均值之间的距离及其概率。样本平均值离整体平均值两个标准误差的概率相对较低,3个或以上标准误差的概率基本上为零。
4. 如果出现了某个概率较低的结果,我们便可以推测是不是有一些其他因素介入,而且概率越低,其他因素介入的可能性就越大。
中心极限定理的应用场景和案例
|应用场景:
如果我们知道了某个群体的信息,就能够推测出从这个群体中抽取的随机样本的情况。
比如我们知道一个学校所有学生(1000名)的平均成绩和标准差,那么从中抽取100名学生的平均成绩与所有学生的平均成绩相差不会很大。
2. 如果我们知道了抽取的样本的信息,就可以对群体信息作出精确的推理。
比如我可以根据抽取的100名学生的平均成绩和标准差,去推测全校学生的平均成绩。
3. 如果我们知道了样本的信息,以及群体的信息,我们就能推断出样本是否从该群体中抽取的样本。
比如我们知道100个学生的平均成绩,和某所学校全体学生的平均成绩,那么根据中心极限定理,我们就可以推测中这100个学生属于这个学校的概率有多大,就可以判断这100个样本学生是否该学校的学生。
4. 如果我们知道两个样本的信息,就能推断出这两个样本是否来自同一个群体。
比如我们抽取了一组100名学生,知道了他们的平均成绩和标准差;然后又抽取了另一组100名学生,也知道了他们的平均成绩和标准差,我们就可以推测出这200个学生是否来自同一所学校。
|举个例子:
已知某所学校全部学生(1000名)的平均成绩是90分,标准差是4;假设有100名学生的平均成绩是95分,需要你判断是不是该学校的学生,那么应该如何判断呢?
先计算样本的标准误差SE=4/10=0.4,则根据中心极限定理样本的平均值有68%的可能性在89.6-90.4分之间,有95%的可能性在89.2-90.8分之间,有99.7%的可能性在88.8-91.2分之间。
而现在100个样本的平均值为95分与总体平均值90分的差距,是标准误差的3倍多,也就是说这100个样本只有0.3%的可能性属于整体(即这100个学生不太可能属于这个学校的学生)。

