课程作业-商业数据分析技术篇05-中心极限定理和区间估计-DrFish-20170808

谢谢余博的指导,Daisy同学的作业也有所启发。

第5课 中心极限定理 & 区间估计

本课基本作业

用t分布求房屋平均面积在95%的置信区间,数据为house_size.csv

t分布求置信区间公式

本课进阶作业

output_9_0.png

分布用t分布和bootstrap方法求年均降雨量在95%的置信区间,数据为rainfall.csv,该数据是英国谢菲尔德气象台记录的从1983年到2015年间的降雨量。


课堂回顾

导入模块和配置图像属性

import scipy.stats
import numpy as np
import pandas as pd
import matplotlib.pyplot as plt

%config InlineBackend.figure_format = 'retina'

标准正态分布

standard_norm = scipy.stats.norm

x = np.arange(-4, 4, 0.01)
plt.plot(x, standard_norm.pdf(x))
plt.show()
标准正态分布示例图

t分布

t_dist = scipy.stats.t

plt.plot(x, standard_norm.pdf(x), label='standard normal')

x = np.arange(-4, 4, 0.01)
plt.plot(x, t_dist.pdf(x, df=1), label='t distribution')

plt.legend()
plt.show()
自由度为1的t分布和标准正态分布对比
t_dist = scipy.stats.t

plt.plot(x, standard_norm.pdf(x), label='standard normal')

x = np.arange(-4, 4, 0.01)
plt.plot(x, t_dist.pdf(x, df=99), label='t distribution')

plt.legend()
plt.show()
自由度为99的t分布和标准正态分布对比

当自由度df大于等于30时,t分布和标准整体分布可看作是一样的。上图是自由度为99时的t分布和标准正态分布的对比

置信区间

导入住房面积数据

house = pd.read_csv('G:\Dropbox\data-analysis\lesson5\house_size.csv', header=None)
house_size = house.iloc[:,0]
print(list(house_size))
[314, 119, 217, 326, 342, 318, 130, 465, 383, 396, 507, 283, 250, 326, 279, 363, 229, 303, 367, 246, 247, 262, 209, 294, 112, 249, 354, 355, 272, 277, 377, 411, 223, 232, 445, 333, 336, 349, 611, 516, 233, 275, 395, 241, 127, 228, 305, 321, 235, 226, 288, 503, 305, 280, 318, 281, 227, 279, 171, 290, 336, 284, 380, 314, 316, 476, 309, 293, 160, 300, 319, 396, 275, 212, 344, 305, 280, 331, 359, 283, 136, 322, 359, 202, 188, 187, 457, 340, 262, 288, 318, 381, 289, 205, 373, 200, 320, 213, 261, 357]

基本作业代码及结果

定义计算t分布置信区间的函数

def ci_t(data, confidence):
    sample_mean = np.mean(data)
    sample_std = np.std(data)
    sample_size = len(data)
    df = len(data) - 1
    
    alpha = (1 - confidence) / 2
    t_score = scipy.stats.t.isf(alpha, df)
    
    ME = t_score * sample_std / np.sqrt(sample_size)

    lower_limit = sample_mean - ME
    upper_limit = sample_mean + ME
    
    return (lower_limit, upper_limit)

t分布函数房屋平均面积数据在95%的置信区间返回结果

ci_t(house_size, 0.95)
(283.28723911352608, 318.41276088647396)

进阶作业代码及结果

导入年平均降雨量数据

house = pd.read_csv('G:\Dropbox\data-analysis\lesson5\house_size.csv', header=None)
rainfall = pd.read_csv('G:\Dropbox\data-analysis\lesson5\\rainfall.csv', header=None)
rainfall.describe()
rainfall describe()返回结果
rainfall_volume = rainfall.iloc[:,0]

用之前定义的t分布函数年平均降雨量数据在95%的置信区间

返回结果如下

ci_t(rainfall_volume, 0.95)
(779.30082422089879, 820.88263442571781)

用bootstrap方法求年平均降雨量数据在95%的置信区间

sample_size = len(rainfall_volume)
sample_size
133
def bootstrap_mean(data):
    # 从数据data中重复抽样,样本大小与data相同,并返回样本均值
    return np.mean(np.random.choice(data, size=len(data)))
def draw_bootstrap(data, times=1):
    
    #初始化长度为times的空数组
    bs_mean = np.empty(times)
    
    #进行多次(times次)抽样,将每次得到的样本均值存储在bs_mean中
    for i in range(times):
        bs_mean[i] = bootstrap_mean(data)
        
    return bs_mean

调用bootstrap函数生成10000个样本均值并显示图形。bins取27根据Freedman–Diaconis rule推导而的。

General equation for Freedman–Diaconis rule
bs_mean = draw_bootstrap(rainfall_volume, 10000)
plt.hist(bs_mean, bins=27, normed=True, rwidth=0.9)
plt.show()
10000个年平均降雨量数据的直方图

找出2.5%和97.5%百分位对应的样本均值,即为年平均降雨量数据在95%的置信区间。

np.percentile(bs_mean, [2.5, 97.5])
array([ 779.5668609 ,  820.81815789])
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 215,133评论 6 497
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 91,682评论 3 390
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 160,784评论 0 350
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 57,508评论 1 288
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 66,603评论 6 386
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 50,607评论 1 293
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 39,604评论 3 415
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 38,359评论 0 270
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 44,805评论 1 307
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 37,121评论 2 330
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 39,280评论 1 344
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 34,959评论 5 339
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 40,588评论 3 322
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,206评论 0 21
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,442评论 1 268
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 47,193评论 2 367
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 44,144评论 2 352

推荐阅读更多精彩内容