如何计算置信区间

一、置信区间与置信水平

在做实验时,即使实验条件再准确,也无法避免随机干扰的影响,所以误差永远存在,无可避免。做科学实验时要测量多次,采取取平均值的方法。在科学实验的测量结果上,总是会加上一个测量范围。

统计学核心思想:用样本信息来估计总体信息

之前我们用样本给出一个精确值来估计总体,这个点估计值是有价值的,但可能存在误差,因为有估计就会有误差,误差不可避免但是可以减少。

点(精确值)误差 > 区间(范围)误差

点估计

[图片上传失败...(image-491647-1618377925287)]

图中横轴是不同样本的平均值从小到大,红色虚线表示要求的总体平均值,假设将抽样的过程重复5次,那么就有了5个样本,可以算出5个样本平均值的点估计,也就是蓝色的点代表总体样本。

[图片上传失败...(image-2e6bd9-1618377925287)]

如果图中有许多蓝色的点,每一个蓝色的点都是对总体平均值的一次点估计,这么多点估计,我们是分辨不出那个点估计更好的,也就是说,我们无法知道估计的准确程度是多少,反过来说,我们是不知道误差范围的,为了解决点估计存在的问题,需要运用区间估计。

假如想要知道全国男性的平均身高,这只能通过抽样的方法,用样本信息估计出总体信息,从全国成年男性中随机抽取一个样本,这个样本的平均值就是对总体平均值的一次点估计,当有多个样本时具有多个点估计,由于无法判别那个点估计对总体估计的误差范围更小,所以要用区间估计来解决这个问题。

比如说,全国成年男性的平均身高在165cm~175cm这个区间[165, 175],那么这个区间就叫做置信区间。

置信区间是统计中一种区间估计的方法。用[a , b]表示样本估计总体平均值误差范围的区间,由于a和b的确切数值取决于我们希望自己对于这个区间包含总体平均值这一结果具有的可信程度,因此这个区间叫做置信区间。

[图片上传失败...(image-d127cf-1618377925287)]

有五个样本,样本的总体平均值是上图中的蓝色点,对样本的总体平均值使用某种方法,构造一个置信区间,则5个样本的平均值就有五个置信区间,也就是图中黄色和红色的横线,哪一根横线更好呢,我们任然不知道,但是和点估计相比,因为这次是按照95%的置信水平构造出的区间估计,那么我们可以相信,图中除了红色那根线,没有包含总体平均值之外,其他线都包含了总体平均值。这个结论的相信程度有多大呢?也就是说,如果有100个样本,可以构造出100个这样的区间,其中大约有95个区间会包含总体平均值。这也解释了什么是置信水平。

image

置信水平是指包含总体平均值的概率是多大,例如:95%的置信水平表示,如果有100个样本,可以构造出100个这样的区间,有95%的可能性包含总体平均值。所以说,如果只做一次抽样,那么这个样本包含总体平均值的概率也是95%。

image

二、大样本计算置信区间的四个步骤

1. 确定要求解的问题

用样本信息估计总体信息

2. 求样本的平均值和标准误差

当样本大小大于30时抽样分布符合中心极限定理,也就是抽样分布是正态分布的

image

总体标准差不知道,但可以用样本标准差来估计总体标准差,标准误差其实也是标准差,只不过标准误差的计算对象是所有的“样本平均值”,标准误差是用来衡量所有的“样本平均值”的波动大小

image

3. 确定置信水平

置信水平取多大,完全取决于具体情况,以及对区间中包含总体平均值这一说法有多大信心。

置信水平越高,区间越宽,置信区间包含总体平均值的概率也就越大。常用的置信水平为95%。

[图片上传失败...(image-55c4ad-1618377925287)]

根据中心极限定理,不管总体服从什么分布,任意一个样本的平均值都会围绕在总体平均值周围呈现正态分布,所以图中中间位置的红色竖线就是总体平均值,根据正态分布的经验法则,有95%的样本平均值会落在两个标准误差之内。

4. 求置信区间上下限的值

image

上图中上下限ba是根据总体平均值对称分布的,可以根据求a从而来求b,上图的距离平均值的几个标准误差就是几个标准分,只要求出a对应的标准分是多少就可以了,用z来表示标准分,那么如何求z的值呢?

下图是求z的值的方法

image
image
image

根据中心极限定理,样本平均值约等于总体平均值。根据上图就可以求出ab了

置信区间公式中的z是指其绝对值|z| ,公式修正如下:

a=总体平均值- |z|* 标准误差

b=总体平均值+ |z|* 标准误差

大样本计算置信区间的总结

image
image
image

置信区间公式中的z是指其绝对值|z| ,公式修正如下:

a=总体平均值- |z|* 标准误差

b=总体平均值+ |z|* 标准误差

三、小样本计算置信区间的四个步骤

当样本大小小于30时,抽样分布符合t分布,t分布很像正态分布,曲线较为扁平,有两条突出的尾巴

[图片上传失败...(image-89cbb1-1618377925287)]

上图中的n指的是样本大小,df指的是自由度

小样本的置信区间与大样本的置信区间只有一点不同,也就是第三步所查询的表格不同

image

置信区间公式中的t是指其绝对值|t| ,公式修正如下:

a=总体平均值- |t|* 标准误差

b=总体平均值+ |t|* 标准误差

image
image
image

自由度是指,可选的样本大小中,减去最后一次没有选择可选的只剩下1个样本的数量多少。

如:有四种水果,每天选择吃完一种,到第四天时,只有唯一的一种水果可吃了,此时没有其他选择了,这时自由度为3。

image
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 199,711评论 5 468
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 83,932评论 2 376
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 146,770评论 0 330
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 53,799评论 1 271
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 62,697评论 5 359
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 48,069评论 1 276
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 37,535评论 3 390
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 36,200评论 0 254
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 40,353评论 1 294
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 35,290评论 2 317
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 37,331评论 1 329
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 33,020评论 3 315
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 38,610评论 3 303
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 29,694评论 0 19
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 30,927评论 1 255
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 42,330评论 2 346
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 41,904评论 2 341

推荐阅读更多精彩内容