2021【暑假作业】新高三数学 考点18 统计与统计案例(教师版)
- 格式:docx
- 大小:521.96 KB
- 文档页数:13
2021版高中数学第三章统计案例课时训练18回归分析新人教B 版选修23(限时:10分钟)1.下列是x 和Y 之间的一组数据,x 0 1 2 3 Y 1 3 5 7则Y 关于x 的回来直线方程必过点( ) A .(2,2) B .(1.5,0) C .(1,2) D .(1.5,4)解析:由题意可知,x =0+1+2+34=1.5,y =1+3+5+74=4.又因为回来直线方程必过样本点的中心(x ,y ),故Y 关于x 的回来直线方程必过点(1.5,4).答案:D2.从某高中随机选取5名高三男生,其身高和体重的数据如下表所示:身高x (cm) 160 165 170 175 180 体重Y (kg) 63 66 70 72 74依照上表可得回来直线方程y ^=0.56x +a ^,据此模型推测身高为172 cm 的高三男生的体重为( )A .70.09 kgB .70.12 kgC .70.55 kgD .71.05 kg解析:x =160+165+170+175+1805=170,y =63+66+70+72+745=69.因为回来直线过点(x ,y ),因此将点(170,69)代入y ^=0.56x +a ^中得a ^=-26.2,因此回来直线方程为y ^=0.56x -26.2, 代入x =172 cm ,则其体重约为70.12 kg. 答案:B3.在研究两个变量的相关关系时,观看散点图发觉样本点集中于某一条指数曲线y =e bx +a的周围,令z ^=ln y ,求得回来直线方程为z ^=0.25x -2.58,则该模型的回来方程为________.解析:因为z ^=0.25x -2.58,z ^=ln y .因此y =e 0.25x -2.58.答案:y =e 0.25x -2.584.某工厂为了对新研发的一种产品进行合理定价,将该产品按事先拟定的价格进行试销,得到如下数据:单价x (元) 8 8.2 8.4 8.6 8.8 9 销量Y (件) 90 84 83 80 75 68(1)求回来直线方程y ^=b ^x +a ^,其中b ^=-20,a ^=y -b ^x .(2)估量在今后的销售中,销量与单价仍旧服从(1)中的关系,且该产品的成本是4元/件,为使工厂获得最大利润,该产品的单价应定为多少元?(利润=销售收入-成本)解析:(1)x =16×(8+8.2+8.4+8.6+8.8+9)=8.5.y =16×(90+84+83+80+75+68)=80.a ^=y +20x =80+20×8.5=250,y ^=-20x +250.(2)工厂获得利润z =(x -4)y =-20x 2+330x -1 000,由二次函数知识可知当x =334时,z max =361.25(元).故该产品的单价应定为8.25元.(限时:30分钟)1.某医学科研所对人体脂肪含量与年龄这两个变量研究得到一组随机样本数据,运用Excel 软件运算得y ^=0.577x -0.448(x 为人的年龄,y 为人体脂肪含量).对年龄为37岁的人来说,下面说法正确的是( )A .年龄为37岁的人体内脂肪含量都为20.90%B .年龄为37岁的人体内脂肪含量为21.01%C .年龄为37岁的人群中的大部分人的体内脂肪含量为20.90%D .年龄为37岁的大部分的人体内脂肪含量为31.5%解析:x =37时,y =0.577×37-0.448=20.90,因为回来方程得到的y ^值只是近似的,故选C.答案:C2.在两个变量Y 与x 的回来模型中,分析选择了四个不同的模型,它们的相关系数r 如下,其中拟合成效最好的为( )A .模型①的相关系数为0.876 5B .模型②的相关系数为0.735 1C .模型③的相关系数为0.001 2D .模型④的相关系数为0.215 1解析:由于相关系数越接近于1,拟合成效越好,因此选A. 答案:A3.为了解亲小孩身高与其父亲身高的关系,随机抽取5对父子的身高数据如下:父亲身高x (cm) 174 176 176 176 178 亲小孩身高Y (cm) 175 175 176 177 177则Y 对x 的线性回来方程为( ) A.y ^=x -1 B.y ^=x +1C.y ^=88+12x D.y ^=176解析:设Y 对x 的线性回来方程为y ^=b ^x +a ^,因为b ^=-2×-1+0×-1+0×0+0×1+2×1-22+22=12,a ^=y ^-b ^ x =176-12×176=88,因此Y 对x 的回来直线方程为y ^=12x +88.答案:C则从表中数据分析,________回来方程更好(即与实际数据更贴近).解析:能够依照表中数据分析,两个回来方程对数据推测的正确率进行判定,甲回来方程的数据准确率为3240=45,而乙回来方程的数据准确率为4060=23.明显甲的准确率高些,因此甲回来方程好些.答案:甲9.某电脑公司有6名产品推销员,其工作年限与年推销金额数据如下表:推销员编号 1 2 3 4 5 工作年限x /年 3 5 6 7 9 推销金额Y /万元 2 3 3 4 5(1)求年推销金额Y 关于工作年限x 的回来直线方程;(2)若第6名推销员的工作年限为11年,试估量他的年推销金额.参考数据: 1.04=1.02;由检验水平0.01及n -2=3,查表得r 0.01=0.959.参考公式:线性回来方程系数公式:y ^=b ^x +a ^,其中b ^=∑i =1nx i -xy i -y∑i =1nx i -x2,a ^=y -b ^x .解析:(1)设所求的回来直线方程为y ^=b ^x +a ^,则b ^=∑i =1nx i -xy i -y∑i =1nx i -x2=1020=0.5,a ^=y -b ^x =0.4. 因此年推销金额Y 关于工作年限x 的回来直线方程为y ^=0.5x +0.4.(2)当x =11时,y ^=0.5x +0.4=0.5×11+0.4=5.9万元. 因此能够估量第6名推销员的年推销金额为5.9万元. 10.假设关于某种设备的使用年限x (年)与所支出的修理费用y (万元)有如下统计资料:x 2 3 4 5 6 y 2.2 3.8 5.5 6.5 7.0已知∑i =15x 2i =90,∑i =15y 2i ≈140.8,∑i =15x i y i =112.3,79≈8.9,2≈1.4,n -2=3时,r 0.05=0.878.(1)求x ,y ;(2)对x ,y 进行线性相关性检验;(3)假如x 与y 具有线性相关关系,求出回来直线方程; (4)假设使用年限为10年时,修理费用约是多少万元?解析:(1)x =2+3+4+5+65=4,y =2.2+3.8+5.5+6.5+7.05=5.(2)步骤如下:①作统计假设:x 与y 不具有线性相关关系;。
2017年高考数学(深化复习+命题热点提分)专题18 统计与统计案例理编辑整理:尊敬的读者朋友们:这里是精品文档编辑中心,本文档内容是由我和我的同事精心编辑整理后发布的,发布之前我们对文中内容进行仔细校对,但是难免会有疏漏的地方,但是任然希望(2017年高考数学(深化复习+命题热点提分)专题18 统计与统计案例理)的内容能够给您的工作和学习带来便利。
同时也真诚的希望收到您的建议和反馈,这将是我们进步的源泉,前进的动力。
本文可编辑可修改,如果觉得对您有帮助请收藏以便随时查阅,最后祝您生活愉快业绩进步,以下为2017年高考数学(深化复习+命题热点提分)专题18 统计与统计案例理的全部内容。
专题18 统计与统计案例1.某校高中生共有900人,其中高一年级300人,高二年级200人,高三年级400人.现采取分层抽样抽取容量为45的样本,那么高一、高二、高三各年级抽取的人数分别为()A.15,5,25 B.15,15,15C.10,5,30 D.15,10,20解析:先确定抽样比为错误!=错误!,则依次抽取的人数分别为错误!×300=15,错误!×200=10和错误!×400=20。
故选D。
答案:D2.某同学进入高三后,4次月考的数学成绩的茎叶图如图.则该同学数学成绩的方差是()A.125 B.55C.45 D.3错误!解析:由茎叶图知平均值为114+126+128+1324=125,∴s2=错误![(125-114)2+(125-126)2+(125-128)2+(125-132)2]=45.答案:C3.为了判定两个分类变量X和Y是否有关系,应用K2独立性检验法算得K2的观测值为5,又已知P(K2≥3。
841)=0.05,P(K2≥6。
635)=0.01,则下列说法正确的是()A.有95%的把握认为“X和Y有关系”B.有95%的把握认为“X和Y没有关系”C.有99%的把握认为“X和Y有关系”D.有99%的把握认为“X和Y没有关系”解析:依题意,K2=5,且P(K2≥3。
9.3 统计分析案例(精讲)考法一数据分析【例1】(多选)(2021·福建泉州市·高三其他模拟)某旅游城市为向游客介绍本地的气温情况,绘制了一年中各月平均最高气温和平均最低气温的雷达图.图中A点表示十月的平均最高气温约为15℃,B点表示四月的平均最低气温约为5℃.下面叙述正确的有( )A.各月的平均最低气温都在0℃以上B.七月的平均温差比一月的平均温差大C.三月和十一月的平均最高气温基本相同D.平均最高气温高于20℃的月份有5个【答案】ABC【解析】对于选项A,由图易知各月的平均最低气温都在0℃以上,A正确;对于选项B,七月的平均最高气温点与平均最低气温点间的距离大于一月的平均最高气温点与平均最低气温点间的距离,所以七月的平均温差比一月的平均温差大,B正确;对于选项C,三月和十一月的平均最高气温均为10℃,所以C正确;对于选项D,平均最高气温高于20℃的月份有七月、八月,共2个月份,故D错误.故选:ABC.【举一反三】1.(多选)(2020·全国专题练习)某装修公司为了解客户对照明系统的需求,对照明系统的两种设计方明系统评分面达图案在稳固性、创新性、外观造型、做工用料以及成本五个方面的满意度评分进行统计,根据常见考法统计结果绘制出如图所示的雷达图,则下列说法错误的是( )A.客户对两种设计方案在外观造型上没有分歧B.客户对设计一的满意度的总得分高于设计二的满意度的总得分C.客户对设计二在创新性方面的满意度高于设计一在创新性方面的满意度D.客户对两种设计方案在稳固性和做工用料方面的满意度相同【答案】ACD【解析】根据雷达图可列表如下:评分类别稳固性创新性外观造型做工用料成本设计一得分8分8分8分10分10分设计二得分8分8分10分8分9分根据表格分析可得A、C、D错误,选项B正确.故选:ACD.2.(多选)(2020·全国专题练习)如图是某公司2018年1月至12月空调销售任务及完成情况的统计图,如10月份销售任务是400台,完成率为90%,下列叙述正确的是( )A .2018年3月的销售任务是400台 B .2018年月销售任务的平均值不超过600台 C .2018年总销售量为4870台 D .2018年月销售量最大的是6月份 【答案】ABC【解析】由题图可知选项A 正确; 2018年月销售任务的平均值为10020033003400500700800100045060012++⨯+⨯++++=<,故选项B 正确;2018年总销售量为1000.82001300(0.5 1.50.6)400(1.20.90.9)500 1.17000.8⨯+⨯+⨯+++⨯+++⨯+⨯800110000.74870+⨯+⨯=,故选项C 正确;2018年月销售量最大的是5月份,为800台,故选项D 不正确. 故选:ABC3.(多选)(2020·湖南永州市)某地区城乡居民储蓄存款年底余额(单位:亿元)变化情况如图所示,下列判断一定正确的是()A .该地区城乡居民储蓄存款年底余额总数逐年上升B.到2019年农村居民存款年底总余额已超过了城镇居民存款年底总余额C.城镇居民存款年底余额逐年下降D.2017年城乡居民存款年底余额增长率大约为225%【答案】AD【解析】由条形图可知,余额总数逐年上升,故A项正确;由城乡储蓄构成百分比可知,2019年农村居民存款年底总余额占36.1%,城镇居民存款年底总余额占63.9%,没有超过,故B项错误;城镇居民存款年底余额所占的比重逐年下降,但城镇居民存款年底余额2014年,2017年,2019年分别为6.8198(亿元),155.085(亿元),973.197(亿元),总体不是逐年下降的,故C项错误,2017年城乡居民存款年底余额增长率大约为21165225%65-≈,故D项正确.故选:AD.考法二统计案例运用【例2】(2020·全国高一专题练习)某制造商3月生产了一批乒乓球,随机抽样100个进行检查,测得每个球的直径(单位:mm),将数据分组如下表分组频数频率)39953997,,,⎡⎣10)39973999⎡⎣,,,20)39994001⎡⎣,,,50[]40014003,,,20合计100(1)请在上表中补充完成频率分布表(结果保留两位小数),并在上图中画出频率分布直方图;(2)统计方法中,同一组数据常用该组区间的中点值(例如区间[)39.9940.01,的中点值是40.00作为代表.据此估计这批乒乓球直径的平均值(结果保留两位小数). 【答案】(1)见解析;(2) 40.00(mm) 【解析】(1)频率分布表如下:分组频数频率频率组距[39.95,39.97)10 0.10 5 [39.97,39.99)20 0.20 10 [39.99,40.01)50 0.50 25 [40.01,40.03] 20 0.20 10 合计 1001注:频率分布表可不要最后一列,这里列出,只是为画频率分布直方图方便. 频率分布直方图如下:(2)整体数据的平均值约为39.96×0.10+39.98×0.20+40.00×0.50+40.02×0.20≈40.00(mm). 【举一反三】1.(2020·全国高一课时练习)深夜,一辆出租车被牵涉进一起交通事故,该市有两家出租车公司——红色出租车公司和蓝色出租车公司,其中蓝色出租车公司和红色出租车公司分别占整个城市出租车的85%和15%.据现场目击证人说,事故现场的出租车是红色的,并对证人的辨别能力进行了测试,测得他辨认的正确率为80%,于是警察就认定红色出租车具有较大的肇事嫌疑.请问警察的认定对红色出租车公平吗?试说明理由.【答案】不公平的.【解析】设城市的出租车有1000辆,那么依题意可得如下信息:从表中可以看出,当证人说出租车是红色的,它确定是红色的概率为1200.41290≈,而它是蓝色的概率为1700.59290≈,在实际数据面前,作为警察以证人的证词作为推断的依据,对红色出租车来说显然是不公平的.2.某地教育部门对某学校学生的阅读素养进行检测,在该校随机抽取了M名学生进行检测,实行百分制,现将所得的成绩按照[40,50),[50,60),[60,70),[70,80),[80,90),[90,100)分成6组,并根据所得数据作出了如下所示的频数与频率的统计表和频率分布直方图.分组 频数 频率 [40,50)[50,60) 25p[60,70)s0.30[70,80) mn[80,90)100.10[90,100]合计M1(1)求出表中,M p 及图中a 的值;(2)估计该校学生阅读素养的成绩中位数以及平均数. 【答案】(1)100,0.25,0.02M p a ===;(2)中位数是2003,平均数是68.5. 【解析】(1)由频率统计表可知:101000.1M ==,250.25100p ∴== 由频率分布直方图可知:(0.0050.0250.030.010.01)101a +++++⨯=,解得0.02a = (2)∵前两组的频率和为0.050.250.30.5+=<,前三组的频率和为0.050.250.30.60.5++=> ∴中位数在[60,70)内,设中位数为x ,则0.050.25(60)0.030.5x ++-⨯=,解得2003x =,即中位数为2003. 平均数为450.05550.25650.3750.2850.1950.168.5⨯+⨯+⨯+⨯+⨯+⨯= ∴估计该校学生阅读素养的成绩中位数是2003,平均数是68.5.。
第17讲统计与统计案例统计与现实生活联系较为紧密,应用性非常强,理论要求低,难度不大,在复习中要深入课本,牢牢把握统计的基本思想和统计方法,掌握随机抽样、用样本估计总体、线性回归分析的方法.对于统计案例,知道回归分析、独立性检验的基本思想、方法及简单应用,会解决简单独立性检验问题.1.把握统计的基本思想.通过复习课本,从中提炼出统计的基本思想,即用样本估计总体,它主要研究两个主要问题,一是如何从总体中抽取样本,二是如何通过对所抽取的样本进行数据处理、分析,对总体的情况作出判断和分析.把握了统计的基本思想,就抓住了统计方法的主线.2.能根据样本的特点正确抽样.明确简单随机抽样、分层抽样与系统抽样的共同点,各自特点,适用范围,清楚它们之间的相互联系,用表格的形式把它们作一对比.3.掌握用样本估计总体的方法.利用图表分析数据是统计的基本要求,频率分布表、频数分布表、2×2列联表是统计数据的数字体现,频率分布直方图、茎叶图、散点图是统计数据的直观体现.会用样本的频率分布直方图、茎叶图估计总体分布,会用样本的数字特征估计总体的数字特征,会根据散点图判断两组变量的相关关系.4.了解回归分析、独立性检验的原理.对于回归分析、独立性检验,了解其基本思想、方法及简单应用即可,知道独立性检验的步骤,会按照公式计算,能和临界值表对照得出正确结论.例1某单位有840名职工,现采用系统抽样方法,抽取42人做问卷调查,将840人按1,2,…,840随机编号,则抽取的42人中,编号落入区间[481,720]的人数为()A.11 B.12 C.13 D.14解后反思利用简单随机抽样抽取出的样本号码没有规律性;分层抽样中,在每一层抽取的号码个数m等于该层所含个体数目与抽样比的积,并且应该恰有m个号码在该层的号码段内;利用系统抽样取出的样本号码有规律性,其号码按从小到大的顺序排列,则所抽取的号码是:l,l+k,l+2k,…,l+(n-1)k.其中,n为样本容量,l是第一组中的号码,k为分段间隔=总体容量/样本容量.例2某市2013年4月1日~4月30日对空气污染指数的监测数据如下(主要污染物为可吸入颗粒物):61,76,70,56,81,91,92,91,75,81,88,67,101,103,95,91,77,86,81,83,82,82,64,79,86,85,75,71,49,45.(1)完成频率分布表.(2)作出频率分布直方图.(3)根据国家标准,污染指数在0~50之间时,空气质量为优;在51~100之间时,为良;在101~150之间时,为轻微污染;在151~200之间时,为轻度污染.请你依据所给数据和上述标准,对该市的空气质量给出一个简短评价.解后反思1.用样本估计总体是统计的基本思想,当样本容量较大时,将样本数据恰当分组,通过频率分布表或频率分布直方图,用各组的频率分布描述总体的分布.2.在频率分布直方图中,各小长方形的面积等于相应各组的频率,小长方形的高与频数成正比,各组频数之和等于样本容量,频率之和等于1.例3从某居民区随机抽取10个家庭,获得第i个家庭的月收入x i(单位:千元)与月储蓄y i(单位:千元)的数据资料,算得(1)求家庭的月储蓄y对月收入x的线性回归方程y=bx+a;(2)判断变量x与y(3)若该居民区某家庭月收入为7千元,预测该家庭的月储蓄.解后反思2.在分析两个变量的相关关系时,可根据样本数据作出散点图来确定两个变量之间是否具有相关关系,若具有线性相关关系,则可通过线性回归方程估计和预测变量的值.例4某高校共有学生15 000人,其中男生10 500人,女生4 500人,为调查该校学生每周平均体育运动时间的情况,采用分层抽样的方法,收集300位学生每周平均体育运动时间的样本数据(单位:小时).(1)应收集多少位女生的样本数据?(2)根据这300个样本数据,得到学生每周平均体育运动时间的频率分布直方图(如图所示),其中样本数据的分组区间为:[0,2],(2,4],(4,6],(6,8],(8,10],(10,12],估计该校学生每周平均体育运动时间超过4小时的概率.(3)在样本数据中,有60位女生的每周平均体育运动时间超过4小时,请完成每周平均体育运动时间与性别列联表,并判断是否有95%的把握认为“该校学生的每周平均体育运动时间与性别有关”..附:K2=(a+b)(c+d)(a+c)(b+d)解后反思独立性检验是一种假设检验(先假设,再推翻假设),其基本思想类似反证法:(1)提出假设:即假设两个分类变量没有关系;(2)在此假设下随机变量K2应该很小,如果由观测数据计算得到K2的观测值k很大,则在一定程度上说明假设不合理.然后根据随机变量K2的含义,评价该假设不合理的程度,继而得出在多大程度上认为两个分类变量有关系.总结感悟1.用样本估计总体是统计的基本思想,科学的统计方法是保证.一要合理抽样,使样本更具有代表性,二要对所抽取的样本进行数据处理、分析,对总体的情况作出判断.2.利用图表分析数据是统计的基本方法,能熟练作频率分布表、频数分布表、2×2列联表,它们是作图、计算的基础,频率分布直方图、茎叶图、散点图,是统计数据的直观体现,是识图和用图的基础.3.独立性检验是一种假设检验(先假设,再推翻假设),其基本思想类似反证法.A级1.为了解某地区的中小学生视力情况,拟从该地区的中小学生中抽取部分学生进行调查,事先已了解到该地区小学、初中、高中三个学段学生的视力情况有较大差异,而男女生视力情况差异不大,在下面的抽样方法中,最合理的抽样方法是()A.简单随机抽样B.按性别分层抽样C.按学段分层抽样D.系统抽样2.某校从高一年级学生中随机抽取部分学生,将他们的模块测试成绩分成6组:[40,50),[50,60),[60,70),[70,80),[80,90),[90,100]加以统计,得到如图所示的频率分布直方图.已知高一年级共有学生600名,据此估计,该模块测试成绩不少于60分的学生人数为()A.588 B.480C.450 D.1203.设某大学的女生体重y(单位:kg)与身高x(单位:cm)具有线性相关关系,根据一组样本数据(x i,y i)(i=1,2,…,n),用最小二乘法建立的回归方程为y^=0.85x-85.71,则下列结论中不正确...的是()A.y与x具有正的线性相关关系B.回归直线过样本点的中心(x,y)C.若该大学某女生身高增加1 cm,则其体重约增加0.85 kgD.若该大学某女生身高为170 cm,则可断定其体重必为58.79 kg4.下图是某公司10个销售店某月销售某产品数量(单位:台)的茎叶图,则数据落在区间[22,30)内的频率为()A.0.2 B.0.4 C.0.5 D.0.65.一个容量为20的样本,数据的分组及各组的频数如下:[10,20),2;[20,30),3;[30,40),x;[40,50),5;[50,60),4;[60,70),2;则x=________;根据样本的频率分布估计,数据落在[10,50)的概率约为________.6.200名职工年龄分布如图所示,从中随机抽取40名职工作样本,采用系统抽样方法,按1~200编号,分为40组,分别为1~5,6~10,…,196~200,第5组抽取号码为22,第8组抽取号码为________.若采用分层抽样,40岁以下年龄段应抽取________人.7.下面茎叶图表示的是甲、乙两人在5次综合测评中的成绩,其中一个数字被污损,若乙的平均分是89,求被污损的数字.B级8.已知变量x与y正相关,且由观测数据算得样本平均数x=3,y=3.5,则由该观测数据算得的线性回归方程可能是()A.y=0.4x+2.3 B.y=2x-2.4C.y=-2x+9.5 D.y=-0.3x+4.49.为了普及环保知识,增强环保意识,某大学随机抽取30名学生参加环保知识测试,得分(十分制)如图所示,假设得分值的中位数为m e,众数为m o,平均值为x,则()A.m e=m o=x B.m e=m o<xC.m e<m o<x D.m o<m e<x10.(2015·全国Ⅱ)根据下面给出的2004年至2013年我国二氧化硫年排放量(单位:万吨)柱形图.以下结论中不正确的是()A.逐年比较,2008年减少二氧化硫排放量的效果最显著B.2007年我国治理二氧化硫排放显现成效C.2006年以来我国二氧化硫年排放量呈减少趋势D.2006年以来我国二氧化硫年排放量与年份正相关11.某中学为了解学生数学课程的学习情况,在 3 000名学生中随机抽取200名,并统计这200名学生的某次数学考试成绩,得到了样本的频率分布直方图(如图).根据频率分布直方图推测这3 000名学生在该次数学考试中成绩小于60分的学生数是________.12.下表是某数学老师及他的爷爷、父亲和儿子的身高数据:身高为________.13.某公路设计院有工程师6人,技术员12人,技工18人,要从这些人中抽取n个人参加市里召开的科学技术大会.如果采用系统抽样和分层抽样的方法抽取,不用剔除个体,如果参会人数增加1个,则在采用系统抽样时,需要在总体中先剔除1个个体,求n.14.为了了解一个小水库中养殖的鱼的有关情况,从这个水库中多个不同位置捕捞出100条鱼,称得每条鱼的质量(单位:kg),并将所得数据分组,画出频率分布直方图(如图所示).(1)在下面表格中填写相应的频率;(2)估计数据落在[1.15,1.30中的概率为多少;(3)将上面捕捞的100条鱼分别作一记号后再放回水库,几天后再从水库的多处不同位置捕捞出120条鱼,其中带有记号的鱼有6条.请根据这一情况来估计该水库中鱼的总条数.第17讲 统计与统计案例题型分析例1 B [由84042=20,即每20人抽取1人,所以抽取编号落入区间[481,720]的人数为720-48020=24020=12(人).] 例2 解 (1)频率分布表:(2)频率分布直方图如图所示.(3)答对下述两条中的一条即可:①该市有一个月中空气污染指数有2天处于优的水平,占当月天数的115;有26天处于良的水平,占当月天数的1315;处于优或良的天数为28,占当月天数的1415.说明该市空气质量基本良好.②轻微污染有2天,占当月天数的115;污染指数在80以上的接近轻微污染的天数15,加上处于轻微污染的天数2,共有17天,占当月天数的1730,超过50%;说明该市空气质量有待进一步改善.例3 解 (1)由题意知n =10,x =1n ∑i =1n x i =8010=8,y =1n ∑i =1n y i =2010=2,又l xx =错误!i y i -n x y =184-10×8×2=24,由此得b=l xyl xx=2480=0.3,a=y-b x=2-0.3×8=-0.4,故所求线性回归方程为y=0.3x-0.4.(2)由于变量y的值随x值的增加而增加(b=0.3>0),故x与y之间是正相关.(3)将x=7代入回归方程可以预测该家庭的月储蓄为y=0.3×7-0.4=1.7(千元).例4解(1)300×4 50015 000=90,所以应收集90位女生的样本数据.(2)由频率分布直方图得1-2×(0.025+0.100)=0.75,所以该校学生每周平均体育运动时间超过4小时的概率的估计值为0.75.(3)由(2)知,300位学生中有300×0.75=225(人)的每周平均体育运动时间超过4小时,75人的每周平均体育运动时间不超过4小时.又因为样本数据中有210份是关于男生的,90份是关于女生,所以每周平均体育运动时间与性别列联表如下:每周平均体育运动时间与性别列联表结合列联可算得K 2=300×(45×60-165×30)275×225×210×90=10021≈4.762>3.841.所以,有95%的把握认为“该校学生的每周平均体育运动时间与性别有关”. 线下作业1.C [不同的学段在视力状况上有所差异,所以应该按照学段分层抽样.] 2.B [少于60分的学生人数600×(0.05+0.15)=120(人), ∴不少于60分的学生人数为480人.]3.D [根据线性回归方程中各系数的意义求解. 由于线性回归方程中x 的系数为0.85,因此y 与x 具有正的线性相关关系,故A 正确. 又线性回归方程必过样本点的中心(x ,y ),因此B 正确.由线性回归方程中系数的意义知,x 每增加1 cm ,其体重约增加0.85 kg ,故C 正确.当某女生的身高为170 cm 时,其体重估计值是58.79 kg ,而不是具体值,因此D 不正确.]4.B [10个数据落在区间[22,30)内的数据有22,22,27,29,共4个,因此,所求的频率为410=0.4.故选B.] 5.4 0.7解析 x =20-(2+3+5+4+2)=4, P =2+3+4+520=0.7或P =1-4+220=0.7.6.37 20解析 将1~200编号分为40组,则每组的间隔为5,其中第5组抽取号码为22,则第8组抽取的号码应为22+3×5=37;由已知条件200名职工中40岁以下的职工人数为200×50%=100,设在40岁以下年龄段中应抽取x 人,则40200=x100,解得x =20.7.解 设污损的数字对应的成绩是x ,由茎叶图可得89×5=83+83+87+x +99,所以x =93,故污损的数字是3.8.A [因为变量x 和y 正相关,则回归直线的斜率为正,故可以排除选项C 和D.因为样本点的中心在回归直线上,把点(3,3.5)分别代入选项A 和B 中的直线方程进行检验,可以排除B ,故选A.]9.D [由题目所给的统计图示可知,30个得分中,按大小顺序排好后,中间的两个得分为5,6,故中位数m e =6+52=5.5, 又众数m o =5,平均值x =3×2+4×3+5×10+6×6+7×3+8×2+9×2+10×230=17930,∴m o <m e <x .]10.D [从2006年起,将每年的二氧化硫排放量与前一年作差比较,得到2008年二氧化硫排放量与2007年排放量的差最大,A 选项正确; 2007年二氧化硫排放量较2006年降低了很多,B 选项正确;虽然2011年二氧化硫排放量较2010年多一些,但自2006年以来,整体呈递减趋势,即C 选项正确;自2006年以来我国二氧化硫年排放量与年份负相关,D 选项错误,故选D.] 11.600解析 由频率分布直方图易得,成绩低于60分的频率为0.002×10+0.006×10+0.012×10=0.2,故3 000名学生中成绩低于60分的学生数为:3 000×0.2=600(人).12.185 cm13.解总体容量为6+12+18=36.当样本容量是n时,由题意知,系统抽样的间隔为36n,分层抽样的比例是n36,抽取的工程师人数为n36×6=n6,技术员人数为n36×12=n3,技工人数为n36×18=n2,所以n应是6的倍数,36的约数,即n=6,12,18.当样本容量为(n+1)时,总体容量是35人,系统抽样的间隔为35n+1,因为35n+1必须是整数,所以n只能取6.即样本容量n=6.14.解(1)根据频率分布直方图可知,频率=组距×(频率/组距),故可得下表:(2)0.30+0.15+0.02=0.47,所以数据落在[1.15,1.30)中的概率约为0.47.(3)120×1006=2 000,所以水库中鱼的总条数约为2 000.。
统计一.简单随机抽样:抽签法和随机数法1.一般地,设一个总体含有N个个体(有限),从中逐个不放回地抽取n个个体作为样本(n≤N),如果每次抽取时总体内的各个个体被抽到的机会都相等(n/N),就把这种抽样方法叫做简单随机抽样。
2.一般地,抽签法就是把总体中的N个个体编号,把号码写在号签上,将号签放在一个容器中,搅拌均匀后,每次从中抽取一个号签,连续抽取n次,就得到一个容量为n的样本,这种抽样方法叫做抽签法。
抽签法的一般步骤:a、将总体的个体编号。
b、连续抽签获取样本号码。
3. 利用随机数表、随机数骰子或计算机产生的随机数进行抽样,叫随机数表法。
随机数表法的步骤:a、将总体的个体编号。
b、在随机数表中选择开始数字。
c、读数获取样本号码。
4. 抽签法的优点是简单易行,缺点是当总体的容量非常大时,费时、费力,又不方便,如果标号的签搅拌得不均匀,会导致抽样不公平,随机数表法的优点与抽签法相同,缺点上当总体容量较大时,仍然不是很方便,但是比抽签法公平,因此这两种方法只适合总体容量较少的抽样类型。
二.系统抽样:1.一般地,要从容量为N的总体中抽取容量为n的样本,可将总体分成均衡的若干部分,然后按照预先制定的规则,从每一部分抽取一个个体,得到所需要的样本,这种抽样的方法叫做系统抽样。
系统抽样的一般步骤:(1)采用随机抽样的方法将总体中的N个个编号。
(2)将整体按编号进行分段,确定分段间隔k=N/n。
(k∈N,L≤k).(3)在第一段用简单随机抽样确定起始个体的编号L(L∈N,L≤k)。
(4)按照一定的规则抽取样本,通常是将起始编号L加上间隔k得到第2个个体编号L+K,再加上K得到第3个个体编号L+2K,这样继续下去,直到获取整个样本。
在确定分段间隔k时应注意:分段间隔k为整数,当N/n不是整数时,应采用等可能剔除的方剔除部分个体,以获得整数间隔k。
三.分层抽样:1.一般地,在抽样时,将总体分成互不交叉的层,然后按照一定的比例,从各层独立地抽取一定数量的个体,将各层取出的个体合在一起作为样本,这种抽样的方法叫分层抽样。
第九章算法初步、统计与统计案例第一节算法与程序框图[考纲传真]1.了解算法的含义,了解算法的思想. 2.理解程序框图的三种基本逻辑结构:顺序、条件、循环. 3.理解几种基本算法语句——输入语句、输出语句、赋值语句、条件语句、循环语句的含义.1.算法(1)算法通常是指按照一定规则解决某一类问题的明确和有限的步骤.(2)应用:算法通常可以编成计算机程序,让计算机执行并解决问题.2.程序框图定义:程序框图又称流程图,是一种用程序框、流程线及文字说明来表示算法的图形.3.三种基本逻辑结构及相应语句1.(夯基释疑)判断下列结论的正误.(正确的打“√”,错误的打“×”) (1)程序框图中的图形符号可以由个人来确定.( )(2)一个程序框图一定包含顺序结构,但不一定包含条件结构和循环结构.( ) (3)5=x 是赋值语句.( )(4)输入语句可以同时给多个变量赋值.( )[解析] 图形符号不能个人确定,(1)不正确;赋值语句只能给变量赋值,(3)不正确. [答案] (1)× (2)√ (3)× (4)√2.(教材改编)根据给出的程序框图,计算f(-1)+f(2)=( )图911A .0B .1C .2D .4[解析] 输入-1,满足x≤0,所以f(-1)=4×(-1)=-4;输入2,不满足x≤0,所以f(2)=22=4,即f(-1)+f(2)=0.[答案]A3.运行如图所示的程序,可得A的输出值为( )A=20A=A*2-30PRINT AENDA.30 B.20 C.10 D.-10[解析]A=20×2-30=10.[答案]C4.(2014·天津高考)阅读下边的框图,运行相应的程序,输出S的值为________.图912[解析]S=0,n=3,S=0+(-2)3=-8,n=3-1=2≤1不成立;故S=-8+(-2)2=-4,n=2-1=1≤1成立.故输出S的值为-4.[答案]-45.(2014·福建高考改编)阅读如图913所示的程序框图,运行相应的程序,输出的n的值为________.图913[解析]当n=1时,21>12;当n=2时,22>22不成立,结束循环.因此输出n=2.[答案] 2考向1程序框图的基本结构与应用【典例1】(1)执行下面的程序框图,如果输入的t∈[-1,3],则输出的s属于( ) A.[-3,4] B.[-5,2]C.[-4,3] D.[-2,5]图914图915(2)(2014·浙江高考)若某程序框图如图915所示,当输入50时,则该程序运行后输出的结果是________.[解析] (1)由程序框图知s =⎩⎪⎨⎪⎧3t ,(t<1),4t -t 2,(t≥1),①当-1≤t<1时,-3≤s<3;②当1≤t≤3时,s =-(t -2)2+4.∴3≤s≤4. 由①②知,s 的取值范围属于[-3,4]. (2)第一次循环,S =1,i =2; 第二次循环,S =4,i =3;第三次循环,S =2×4+3=11,i =4; 第四次循环,S =2×11+4=26,i =5;第五次循环,S =2×26+5=57,i =6,此时S>50,退出循环. 所以输出的结果i =6. [答案] (1)A (2)6 【规律方法】1.对条件结构,无论判断框中的条件是否成立,都只能执行两个分支中的一个,不能同时执行两个分支.2.利用循环结构表示算法,第一要确定是利用当型还是直到型循环结构;第二准确表示累计变量;第三要注意从哪一步开始循环.弄清进入或终止的循环条件、循环次数是做题的关键.【变式训练1】 (1)如图916所示的程序框图,运行相应的程序.若输入x 的值为1,则输出S 的值为________.图916(2)(2014·陕西高考)根据下边框图,对大于2的整数N,输出的数列的通项公式是( )图917A.a n=2n B.a n=2(n-1) C.a n=2n D.a n=2n-1[解析](1)第1次运行:x=1,S=0+13=1<50;第2次运行:x=2,S=1+23=9<50;第3次运行:x=4,S=9+43=73>50,满足S≥50,跳出循环.输出S=73.(2)由程序框图可知第一次运行:i=1,a1=2,S=2;第二次运行:i=2,a2=4,S=4;第三次运行:i=3.a3=8,S=8;第四次运行:i=4,a4=16,S=16.故选C.[答案](1)73 (2)C考向2程序框图的识别与完善(高频考点)命题视角程序框图的识别与完善是高考命题的热点,主要以客观题的形式呈现.主要命题角度:(1)根据程序框图确定输出结果;(2)补充程序框图中判断框或执行框;(3)依据程序框图及运行结果求输入变量的初始值等.【典例2】 (1)如图918所示是计算某年级500名学生期末考试(满分为100分)及格率q 的程序框图,则图中空白框内应填入________.图918 图919(2)(2014·重庆高考)执行如图919所示的程序框图,若输出k 的值为6,则判断框内可填入的条件是( )A .s>12B .s>35C .s>710D .s>45[思路点拨] (1)根据程序框图的功能,应确定及格率q 与及格人数M 之间的关系;(2)依次执行程序框图,根据输出结果确定判断框内的控制条件.[解析] (1)由判断框输出可知,M 表示及格人数,N 表示不及格人数, ∴及格率q =M M +N ,因此执行框为“q=M M +N”.(2)第一次循环:s =1×910=910,k =8,s =910应满足条件;第二次循环:s =910×89=810,k =7,s =810应满足条件,排除选项D ;第三次循环:s =810×78=710,k =6,故这时程序不再满足条件,结束循环,因此判断框中的条件为s>710.[答案] (1)q =MM +N(2)C 【通关锦囊】1.(1)第1题的关键在于理解程序框图的功能;(2)第2题要明确何时进入或退出循环体,以及累乘变量的变化.2.解答此类题目:(1)要明确程序框图的顺序结构,条件结构和循环结构;(2)理解程序框图的功能;(3)要按框图中的条件运行程序,按照题目的要求完成解答.【变式训练2】 (2015·潍坊质检)执行如图9110所示的程序框图,若输出的S 是2 047,则判断框内应填写()图9110A .n ≤9?B .n ≤10?C .n ≥10?D .n ≥11?[解析] 由程序框图的功能知,题目的实质是数列{2n}(n∈N )求和. ∵{2n }的首项为20=1,公比为2.∴当n =9时,S =1+2+22+…+29=1-2101-2=1 023.当n =10时,S =1+2+22+…+210=1-2111-2=2 047.此时输出S =2 047,跳出循环,所以判断框的条件为n ≤9. [答案] A考向3 基本算法语句【典例3】 根据下列算法语句,当输入x 为60时,输出y 的值为( )A .25B .30C .31D .61[解析] 由题意,得y =⎩⎪⎨⎪⎧0.5x ,x ≤50,25+0.6(x -50),x>50.当x =60时,y =25+0.6×(60-50)=31. ∴输出y 的值为31. [答案] C ,【规律方法】1.本题主要考查条件语句,输入与输出语句,要注意赋值语句一般格式中的“=”不同于等式中的“=”,其实质是计算“=”右边表达式的值,并将该值赋给“=”左边的变量.2.解决此类问题关键要理解各语句的含义,以及基本算法语句与算法结构的对应关系. 【变式训练3】 运行下面的程序时,WHILE 循环语句的执行次数是( )A .3B .4C .18D .19[解析] 0<20,1<20,2×2<20,5×5>20,程序结束, 故WHILE 循环语句共执行了3次. [答案] A掌握1条规律 每个算法结构都含有顺序结构,循环结构中必定包含一个条件结构,用于确定何时终止循环体.循环结构和条件结构都含有顺序结构.注意1个区别 当型循环与直到型循环的区别:直到型循环是“先循环,后判断,条件满足时终止循环”;当型循环是“先判断,后循环,条件满足时执行循环”;两者的判断框内的条件表述在解决同一问题时是不同的,它们恰好相反.勿忘2点注意 1.赋值号左边只能是变量(不是表达式),在一个赋值语句中只能给一个变量赋值. 2.利用循环结构表示算法,要明确是利用当型循环结构,还是直到型循环结构.要注意:(1)选择好累计变量;(2)弄清在哪一步开始循环,满足什么条件不再执行循环体.易错辨析之10程序框图中“变量”的含义理解不清致误(2014·课标全国卷Ⅰ)执行下面的程序框图,若输入的a ,b ,k 分别为1,2,3,则输出的M =( )图9111A .203 B .72 C .165 D .158[错解] n =1,M =1+12=32,a =2,b =32;n =2,M =2+23=83,a =32,b =83;n =3,M =32+38=158,a =83,b =158;n =4,M =83+815=4815=165,a =158,b =165,此时不满足条件,跳出循环,输出M =165.[答案] C 【智慧心语】错因分析:(1)循环变量n 与累加变量M 计算不对立,或混淆当型循环,误认为直到型循环结构,导致错解.(2)对循环体中各执行框的含义不清,错误赋值,错选A 或B .防范措施:(1)要分清是当型循环结构还是直到型循环结构;要理解循环结构中各变量的具体含义以及变化规律.具体求解时,把每次循环中各个变量的值对应起来,并要清楚的写下来,再根据条件判断是否结束循环.(2)在处理含有循环结构的算法问题时,关键是确定循环的次数,循环中有哪些变量,且每一次循环之后的变量S 、k 值都要被新的S 、k 值所替换.[正解] 第一次执行循环后:M =1+12=32,a =2,b =32,n =2;第二次执行循环后:M =2+23=83,a =32,b =83,n =3.第三次执行循环后:M =32+38=158,a =83,b =158,n =4.这时n =4,跳出循环.输出M 的值158.[答案] D【类题通关】 (2014·北京高考)当m =7,n =3时,执行如图9112所示的程序框图,输出的S 值为( )图9112A.7 B.42 C.210 D.840[解析]程序框图的执行过程如下:m=7,n=3时,m-n+1=5,k=m=7,S=1,S=1×7=7;k=k-1=6>5,S=6×7=42;k=k-1=5=5,S=5×42=210;k=k-1=4<5,输出S=210.故选C.[答案]C课后限时自测[A级基础达标练]一、选择题1.(2014·课标全国卷Ⅱ)执行如图9113所示的程序框图,如果输入的x,t均为2,则输出的S=( )图9113A .4B .5C .6D .7[解析] x =2,t =2,M =1,S =3,k =1. k ≤t ,M =11×2=2,S =2+3=5,k =2;k ≤t ,M =22×2=2,S =2+5=7,k =3;3>2,不满足条件,输出S =7. [答案] D2.(2014·湖南高考)执行如图9114所示的程序框图,如果输入的t∈[-2,2],则输出的S 属于( )图9114A .[-6,-2]B .[-5,-1]C .[-4,5]D .[-3,6][解析] 由程序框图知,当0≤t≤2时,输出S =t -3,此时S∈[-3,-1];当-2≤t<0时,执行t =2t 2+1后1<t≤9,执行1<t≤9时,输出S =t -3,此时S∈(-2,6].因此输出S 的值属于[-3,6].[答案] D3.某程序框图如图9115所示,若输出的结果S=57,则判断框内应填入的条件是( )图9115A.k>4? B.k>5? C.k>6? D.k>7?[解析]由程序框图可知,k=1时,S=1;k=2时,S=2×1+2=4;k=3时,S=2×4+3=11;k=4时,S=2×11+4=26;k=5时,S=2×26+5=57.[答案]A4.阅读如图9116所示的程序框图,运行相应的程序,则输出S的值为( )图9116A.8 B.18 C.26 D.80[解析]执行一次循环S=2,n=2;执行第二次循环:S=2+32-31=8,n=3;执行第3次循环:S=8+33-32=26,n=4;满足n≥4,故输出S=26.[答案]C5.(2014·安徽高考)如图9117所示,程序框图(算法流程图)的输出结果是( )图9117A.34 B.55 C.78 D.89[解析]当输入x=1,y=1,执行z=x+y及z≤50,x=y,y=z后,x,y,z的值依次对应如下:x=1,y=1,z=2;x=1,y=2,z=3;x=2,y=3,z=5;x=3,y=5,z=8;x=5,y=8,z=13;x=8,y=13,z=21;x=13,y=21,z=34;x=21,y=34,z=55.由于55≤50不成立,故输出55.故选B.[答案]B二、填空题6.运行下列的程序,当输入a,b分别为2,3时,最后输出的m的值为________.[解析]∵a=2,b=3,满足a<b,∴应把b值赋给m,∴m的值为3.[答案] 37.(2014·山东高考)执行如图9118所示的程序框图,若输入的x的值为1,则输出的n的值为________.图9118[解析]按照程序框图逐一执行.由x2-4x+3≤0,解得1≤x≤3.当x=1时,满足1≤x≤3,所以x=1+1=2,n=0+1=1;当x=2时,满足1≤x≤3,所以x=2+1=3,n=1+1=2;当x=3时,满足1≤x≤3, 所以x=3+1=4,n=2+1=3;当x=4时,不满足1≤x≤3,所以输出n=3.[答案] 38.(2015·临沂模拟)图9119(1)是某高三学生进入高中三年来的数学考试成绩茎叶图,第1次到第14次的考试成绩依次记为A1,A2,…,A14.图(2)是统计茎叶图中成绩在一定范围内考试次数的一个算法流程图.那么算法流程图输出的结果是________.(1) (2)图9119[解析]从算法流程图可知,该图表示统计成绩大于或等于90分的考试次数.由茎叶图可知输出的结果为10.[答案]10三、解答题9.某篮球队6名主力队员在最近三场比赛中投进的三分球个数如表格所示:图9120统计该6名队员在最近三场比赛中投进的三分球总数的程序框图如图9120所示.(1)试在判断框内填上条件;(2)求输出的s的值.[解](1)依题意,程序框图是统计6名队员投进的三分球的总数.∴判断框内应填条件“i≤6?”.(2)6名队员投进的三分球数分别为a1,a2,a3,a4,a5,a6.故输出的s=a1+a2+…+a6.10.三月植树节,林业管理部门在植树前,为了保证树苗的质量,都会对树苗进行检测.现从甲,乙两种树苗中各抽测了10株树苗,量出它们的高度如下:(单位:厘米) 甲:37,21,31,20,29,19,32,23,25,33;乙:10,30,47,27,46,14,26,10,44,46.(1)画出两组数据的茎叶图,并根据茎叶图对甲,乙两种树苗的高度作比较,写出两个统计结论.(2)设抽测的10株甲种树苗高度平均值为x -,将这10株树苗的高度依次输入,按程序框图(如图9121)进行运算,问输出的S 大小为多少?并说明S 的统计学意义.图9121[解] (1)茎叶图如下:统计结论:①甲种树苗的平均高度小于乙种树苗的平均高度; ②甲种树苗比乙种树苗长得整齐;③甲种树苗的中位数为27,乙种树苗的中位数为28.5;④甲种树苗的高度基本上是对称的,而且大多数集中在均值附近.(任写两条即可) (2)x -=27,S =35;S 表示10株甲种树苗高度的方差,是描述树苗高度离散程度的量.S 值越小,表示长得越整齐,S 值越大,表示长得越参差不齐.[B 级 能力提升练]1.(2015·济南质检)已知函数f(x)=ax 3+12x 2在x =-1处取得极大值,记g(x)=1f ′(x ).程序框图如图9122所示,若输出的结果S>2 0142 015,则判断框中可以填入的关于n 的判断条件是( )图9122A .n ≤ 2 014?B .n ≤2 015?C .n>2 014?D .n>2 015?[解析] 由题意得f′(x)=3ax 2+x ,由f′(-1)=0得a =13,∴f ′(x)=x 2+x ,即g(x)=1x 2+x =1x (x +1)=1x -1x +1. 由程序框图可知S =0+g(1)+g(2)+…+g(n)=1-1n +1, 由1-1n +1>2 0142 015,得n>2 014. 因此条件应为n≤2 015? [答案] B2.执行如图9123所示的程序框图,若输入n 的值为4,则输出s 的值为________.图9123[解析] 第一步运算结果:s =1,i =2(i≤4成立);第二步运算结果:s =2,i =3(i≤4成立);第三步运算结果:s =4,i =4(i≤4成立);第四步运算结果:s =7,i =5(i≤4不成立),程序结束,故输出s 的值为7.[答案] 73.已知数列{a n }的各项均为正数,观察程序框图如图9124所示,若k =5,k =10时,分别有S =511和S =1021,试求数列{a n }的通项公式.图9124[解] 由程序框图可知,数列{a n }是等差数列,首项为a 1,公差为d. S i =1a 1a 2+1a 2a 3+…+1a i a i +1=1d (1a 1-1a 2+1a 2-1a 3+…+1a i -1a i +1) =1d ⎝ ⎛⎭⎪⎫1a 1-1a i +1. 当k =5时,S =⎝ ⎛⎭⎪⎫1a 1-1a 61d =5a 1a 6=511.∴a 1a 6=11,即a 1(a 1+5d)=11;①当k =10时,S =⎝ ⎛⎭⎪⎫1a 1-1a 111d =10a 1a 11=1021,∴a 1a 11=21,即a 1(a 1+10d)=21,② 由①②联立,得a 1=1,d =2, 因此a n =a 1+(n -1)d =2n -1.第二节 随机抽样[考纲传真]1.理解随机抽样的必要性和重要性. 2.会用简单随机抽样方法从总体中抽取样本. 3.了解分层抽样和系统抽样方法.1.简单随机抽样(1)设一个总体含有N 个个体,从中逐个不放回地抽取n 个个体作为样本(n≤N),如果每次抽取时总体内的各个个体被抽到的机会都相等,就把这种抽样方法叫做简单随机抽样.(2)常用简单随机抽样的方法:抽签法和随机数表法. 2.系统抽样的步骤假设要从容量为N 的总体中抽取容量为n 的样本. (1)先将总体的N 个个体编号.(2)确定分段间隔k ,对编号进行分段,当N n 是整数时,取k =N n ,当Nn 不是整数时,随机从总体中剔除余数.(3)在第1段用简单随机抽样确定第一个个体编号l(l≤k). (4)按照一定的规则抽取样本, 3.分层抽样(1)定义:在抽样时,将总体分成互不交叉的层,然后按照一定的比例,从各层独立地抽取一定数量的个体,将各层取出的个体合在一起作为样本,这种抽样方法是分层抽样.(2)应用范围:总体是由差异明显的几个部分组成时.1.(夯基释疑)判断下列结论的正误.(正确的打“√”,错误的打“×”) (1)简单随机抽样是从总体中逐个不放回的抽取抽样.( ) (2)简单随机抽样每个个体被抽到的机会不一样,与先后有关.( ) (3)系统抽样在起始部分抽样时采用简单随机抽样.( )(4)分层抽样中,每个个体被抽到的可能性与层数及分层有关.( )[解析] 由简单随机抽样,系统抽样,分层抽样的意义,知(1)与(3)正确,(2)与(4)不正确.[答案] (1)√ (2)× (3)√ (4)×2.(2014·广东高考)为了解1 000名学生的学习情况,采用系统抽样的方法,从中抽取容量为40的样本,则分段的间隔为( )A .50B .40C .25D .20[解析] 根据系统抽样的特点可知分段间隔为1 00040=25,故选C .[答案] C3.(2015·青岛调研)为了解某地区的中小学生的视力情况,拟从该地区的中小学生中抽取部分学生进行调查,事先已了解到该地区小学,初中,高中三个学段学生的视力情况有较大差异,而男女视力情况差异不大.在下面的抽样方法中,最合理的抽样方法是( )A .简单随机抽样B .按性别分层抽样C .按学段分层抽样D .系统抽样[解析] 由于三个学段学生的视力情况差别较大,故需按学段分层抽样. [答案] C4.(2014·湖南高考)对一个容量为N 的总体抽取容量为n 的样本,当选取简单随机抽样、系统抽样和分层抽样三种不同方法抽取样本时,总体中每个个体被抽中的概率分别为p 1,p 2,p 3,则( )A .p 1=p 2<p 3B .p 2=p 3<p 1C .p 1=p 3<p 2D .p 1=p 2=p 3[解析] 由于三种抽样过程中,每个个体被抽到的概率都是相等的,因此p 1=p 2=p 3. [答案] D5.某学校高一,高二,高三年级的学生人数之比为3∶3∶4,现用分层抽样的方法从该校高中三个年级的学生中抽取容量为50的样本,则应从高二年级抽取________名学生.[解析] 设应从高二年级抽取x 名学生,则x∶50=3∶10.解得x =15. [答案] 15考向1简单随机抽样【典例1】(1)下列抽取样本的方式属于简单随机抽样的个数为( )①盒子里共有80个零件,从中选出5个零件进行质量检验.在抽样操作时,从中任意拿出一个零件进行质量检验后再把它放回盒子里.②从20件玩具中一次性抽取3件进行质量检验.③某班有56名同学,指定个子最高的5名同学参加学校组织的篮球赛.A.0 B.1 C.2 D.3(2)(2013·江西高考)总体由编号为01,02,…,19,20的20个个体组成,利用下面的随机数表选取5个个体,选取方法是从随机数表第1行的第5列和第6列数字开始由左到右依次选取两个数字,则选出来的第5个个体的编号为( )A.08 B.07 C.02 D.01[解析](1)①②③中都不是简单随机抽样,这是因为:①是放回抽样,②中是“一次性”抽取,而不是“逐个”抽取,③中“指定个子最高的5名同学”,不存在随机性,不是等可能抽样.(2)由随机数表法的随机抽样的过程可知选出的5个个体是08,02,14,07,01,所以第5个个体的编号是01.[答案](1)A(2)D【规律方法】1.简单随机抽样是从含有N(有限)个个体的总体中,逐个不放回地抽取样本,且每次抽取时总体内的各个个体被抽到的机会都相等.2.(1)一个抽样试验能否用抽签法,关键看两点:一是制签是否方便;二是号签是否易搅匀,一般地,当总体容量和样本容量都较小时可用抽签法.(2)随机数表法适用于总体中个体数较多的情形:随机数表法的操作要点:编号,选起始数,读数,获取样本.【变式训练1】下列抽样试验中,适合用抽签法的有________.①从某厂生产的5 000件产品中抽取600件进行质量检测; ②从某厂生产的两箱(每箱18件)产品中抽取6件进行质量检验; ③从甲,乙两厂生产的两箱(每箱18件)产品中抽取6件进行质量检测; ④从某厂生产的5 000件产品中抽取10件进行质量检测. [解析] ①,④中总体的个体数较大,不适用抽签法.对于③中,甲,乙两厂的产品质量可能差别较大,不一定能够达到搅拌均匀的条件,不适宜用抽签法.②中为同厂的产品,且样本容量较小,可用抽签法. [答案] ②考向2 系统抽样及其应用【典例2】 (1)(2015·淄博调研)用系统抽样法要从160名学生中抽取容量为20的样本,将160名学生随机地从1~160编号,按编号顺序平均分成20组(1~8号,9~16号,…,153~160号),若第16组抽出的号码为126,则第1组中用抽签的方法确定的号码是________.(2)(2013·陕西高考)某单位有840名职工,现采用系统抽样方法抽取42人做问卷调查,将840人按1,2,…,840随机编号,则抽取的42人中,编号落入区间[481,720]的人数为( )A .11B .12C .13D .14[解析] (1)设第1组抽取的号码为b ,由系统抽样则第n 组抽取的号码为8(n -1)+b , ∴8×(16-1)+b =126,∴b =6, 故第1组抽取的号码为6.(2)抽样间隔为84042=20.设在1,2,…,20中抽取号码x 0(x 0∈[1,20]),在[481,720]之间抽取的号码记为20k +x 0,则481≤20k+x 0≤720,k ∈N *.∴24120≤k +x 020≤36.∵x 020∈⎣⎢⎡⎦⎥⎤120,1,∴k =24,25,26,…,35, ∴k 值共有35-24+1=12(个),即所求人数为12. [答案] (1)6 (2)B 【规律方法】1.如果总体容量N 能被样本容量n 整除,则抽样间隔为k =Nn,否则,可随机地从总体中剔除余数,然后按系统抽样的方法抽样.特别注意,每个个体被抽到的机会均是n N.2.系统抽样中依次抽取的样本对应的号码就是一个等差数列,首项就是第1组所抽取样本的号码,公差为间隔数,根据等差数列的通项公式就可以确定每一组内所要抽取的样本号码.【变式训练2】 (2015·威海质检)采用系统抽样方法从960人中抽取32人做问卷调查,为此将他们随机编号为1,2,…,960,分组后在第一组采用简单随机抽样的方法抽到的号码为9.抽到的32人中,编号落入区间[1,450]的人做问卷A ,编号落入区间[451,750]的人做问卷B ,其余的人做问卷C .则抽到的人中,做问卷B 的人数为( )A .7B .9C .10D .15[解析] 由系统抽样知:抽取号码的间隔为96032=30,∵第一组抽取的号码为9,∴抽取的第n 个号码为a n ,则a n =9+30(n -1), 由451≤a n ≤750,得151115≤n ≤25710,注意到n ∈N *,∴落入区间[451,750]的号码共10个, 因此做问卷B 的有10人. [答案] C考向3 分层抽样及应用(高频考点)命题视角 分层抽样是抽样方法考查的重点,主要以客观题的形式呈现,命题的主要角度:(1)求各层的个体容量;(2)根据某层的容量求总体容量;(3)分层抽样的简单应用.【典例3】 (1)(2015·日照联考)某工厂甲,乙,丙三个车间生产了同一种产品,数量分别为120件,80件,60件.为了解它们的产品质量是否存在显著差异,用分层抽样方法抽取了一个容量为n 的样本进行调查,其中从丙车间的产品中抽取了3件,则n =( )A .9B .10C .12D .13(2)(2014·湖北高考)甲、乙两套设备生产的同类型产品共4 800件,采用分层抽样的方法从中抽取一个容量为80的样本进行质量检测.若样本中有50件产品由甲设备生产,则乙设备生产的产品总数为________件.[思路点拨] (1)利用抽样比为定值,列方程求解;(2)利用分层抽样,先求出总体中甲设备生产的产品数量,再计算乙设备生产的产品数量.[解析] (1)依题意得360=n120+80+60,故n =13.(2)由题设,抽样比为804 800=160.设甲设备生产的产品为x 件, 则x60=50,∴x =3 000. 故乙设备生产的产品总数为4 800-3 000=1 800. [答案] (1)D (2)1 800 【通关锦囊】1.分层抽样中分多少层,如何分层要视具体情况而定,总的原则是:层内样本的差异要小,两层之间的样本差异要大,且互不重叠.2.为了保证每个个体被抽到的可能性是相同的,这就要求各层所抽取的个体数与该层所包含的个体数之比等于样本容量与总体的个体数之比,即n i ∶N i =n∶N.分层抽样的有关计算,转化为按比例列方程或算式求解.【变式训练3】 (1)某个年级有男生560人,女生420人,用分层抽样的方法从该年级全体学生中抽取一个容量为280的样本,则此样本中男生人数为________.(2)(2014·重庆高考)某中学有高中生3 500人,初中生1 500人,为了解学生的学习情况,用分层抽样的方法从该校学生中抽取一个容量为n 的样本,已知从高中生中抽取70人,则n 为( )A .100B .150C .200D .250[解析] (1)抽样比为280560+420=280980=27,所以样本中男生人数为560×27=160.(2)法一:由题意可得70n -70=3 5001 500,解得n =100.法二:由题意,抽样比为703 500=150,总体容量为3 500+1 500=5 000,故n =5 000×150=100.[答案] (1)160 (2)A掌握2条规律 1.三种抽样方法的共同点都是等概率抽样,即抽样过程中每个个体被抽到的概率相等,体现了这三种抽样方法的客观性和公平性.若样本容量为n ,总体容量为N ,每个个体被抽到的概率是nN. 2.系统抽样抽取的个体编号从小到大成等差数列.熟记3个范围 1.简单随机抽样:总体容量较少,尤其是样本容量较少. 2.系统抽样:适用于元素个数很多且均衡的总体. 3.分层抽样:适用于总体由差异明显的几部分组成的情形.勿忘3点注意 1.简单随机抽样中,易忽视样本是从总体中逐个抽取,是不放回抽样,且每个个体被抽到的概率相等. 2.系统抽样中,易忽视抽取的样本数也就是分段的段数,当Nn 不是整数时,注意剔除,剔除的个体是随机的. 3.分层抽样中,易忽视每层抽取的个体的比例是相同的.易错辨析之11 图表信息求解的误区(2014·广东高考改编)已知某地区中小学生人数和近视情况分别如图921①和图②所示.为了解该地区中小学生的近视形成原因,用分层抽样的方法抽取2%的学生进行调查,则样本容量和抽取的高中生近视人数分别为________.图921[错解] 由图①知,样本容量为(2 000+3 500+4 500)×2%=200, 根据图②知,高中学生的近视人数为200×50%=100. 或根据图②知,高中近视人数为50人. 【智慧心语】错因分析:(1)误把样本容量200认为高中学生的样本数量,或将条形图中近视率误为近视人数.(2)不能从图表中提取有效信息,有的考生无从入手,或者未抓住分层抽样的特点:“各层抽取的个体数依各层个体之比来分配”而无法正确完成高中近视人数的计算求值.防范措施:(1)加强识图能力的培养,如本题中纵轴表示的近视率分别为10%,30%,50%.(2)理解分层抽样的概念,首先分层抽样是等概率抽样,因此,各层的抽样比应相等,可以利用这个等比关系计算求值.[正解] 易知,样本容量为(3 500+4 500+2 000)×2%=200.又样本中高中学生共有2 000×2%=40人.利用图②知,高中学生的近视率为50%.因此所抽样本中高中学生的近视人数为40×50%=20人.[答案]200 20【类题通关】从某小学随机抽样100名学生,将他们的身高(单位:厘米)数据绘制成频率分布直方图(如图922所示),由图中数据可知a=________.若要从身高在[120,130),[130,140),[140,150]三组内的学生中,用分层抽样的方法选取18人参加一项活动,则从身高在[140,150]内的学生中选取的人数应为________.图922[解析]∵0.005×10+0.035×10+a×10+0.020×10+0.010×10=1,∴a=0.030.设身高在[120,130),[130,140),[140,150]内的三组学生各有x,y,z人,则x100=0.030×10,y100=0.020×10,z100=0.01×10.∴x=30,y=20,z=10.由分层抽样的意义,抽样比为1830+20+10=30%.因此从身高在[140,150]内的学生中选取10×30%=3(人).[答案](1)0.030 (2)3课后限时自测[A 级 基础达标练]一、选择题1.(2014·四川高考)在“世界读书日”前夕,为了了解某地5 000名居民某天的阅读时间,从中抽取了200名居民的阅读时间进行统计分析.在这个问题中,5 000名居民的阅读时间的全体是( )A .总体B .个体C .样本的容量D .从总体中抽取的一个样本[解析] 调查的目的是“了解某地5 000名居民某天的阅读时间”,所以“5 000名居民的阅读时间的全体”是调查的总体.[答案] A2.从2 007名学生中选取50名学生参加全国数学联赛,若采用下面的方法选取:先用简单随机抽样从2 007人中剔除7人,剩下的2 000人再按系统抽样的方法抽取,则每人入选的概率( )A .不全相等B .均不相等C .都相等,且为502 007D .都相等,且为140[解析] 从N 个个体中抽取M 个个体,每个个体被抽到的概率均为MN .[答案] C3.某学校有男,女学生各500名,为了解男,女学生在学习兴趣与业余爱好方面是否存在显著差异,拟从全体学生中抽取100名学生进行调查,则宜采用的抽样方法是( )A .抽签法B .随机数法C .系统抽样法D .分层抽样法[解析] 由于是调查男,女学生在学习兴趣与业余爱好方面是否存在差异,因此用分层抽样法.[答案] D4.(2015·潍坊一模)高三某班有学生56人,现将所有同学随机编号,用系统抽样的方。
2019-2020年高考数学一轮复习第十八单元统计与统计案例高考达标检测五十二变量间的相关关系统计案例理一、选择题1.根据如下样本数据得到的回归方程为y ^=b ^x +a ^,若a ^=5.4,则x 每增加1个单位,y 就( )x 3 4567y42.5-0.50.5-2A .增加0.9个单位B .减少0.9个单位C .增加1个单位D .减少1个单位解析:选B 由题意可得x =15(3+4+5+6+7)=5,y =15(4+2.5-0.5+0.5-2)=0.9,∵回归方程为y ^=b ^x +a ^,a ^=5.4,且回归直线过点(5,0.9), ∴0.9=5b ^+5.4,解得b ^=-0.9,∴x 每增加1个单位,y 就减少0.9个单位 . 2.已知x 与y 之间的几组数据如下表:x 1 2 3 4 5 6 y21334假设根据上表数据所得线性回归直线方程为y =b x +a ,若某同学根据上表中的前两组数据(1,0)和(2,2)求得的直线方程为y ′=b ′x +a ′,则以下结论正确的是( )A.b ^>b ′,a ^>a ′B.b ^>b ′,a ^<a ′ C.b ^< b ′,a ^>a ′ D.b ^<b ′,a ^<a ′解析:选C 过(1,0)和(2,2)的直线方程为y =2x -2,画出六点的散点图,回归直线的大概位置如图所示,显然b ^<b ′,a ^>a ′.故选C.3.(xx·山东高考)为了研究某班学生的脚长x (单位:厘米)和身高y (单位:厘米)的关系,从该班随机抽取10名学生,根据测量数据的散点图可以看出y 与x 之间有线性相关关系,设其回归直线方程为y ^=b ^x +a ^,已知∑i =110x i =225,∑i =110y i =1 600,b ^=4.该班某学生的脚长为24,据此估计其身高为( )A .160B .163C .166D .170解析:选C 由题意可知y ^=4x +a ^, 又x =22.5,y =160,因此160=22.5×4+a ^,解得a ^=70, 所以y ^=4x +70.当x =24时,y ^=4×24+70=166.4.为了解高中生对电视台某节目的态度,在某中学随机调查了110名学生,得到如下列联表:男 女 总计 喜欢 40 20 60 不喜欢 20 30 50 总计6050110由K 2=n ad -bc 2a +bc +d a +cb +d,得K 2=110×40×30-20×20260×50×60×50≈7.822.附表:P (K 2≥k 0)0.05 0.01 0.001 k 03.8416.63510.828A .在犯错误的概率不超过0.1%的前提下,认为“喜欢该节目与性别有关”B .在犯错误的概率不超过0.1%的前提下,认为“喜欢该节目与性别无关”C .有99%以上的把握认为“喜欢该节目与性别有关”D .有99%以上的把握认为“喜欢该节目与性别无关”解析:选C 根据K 2的值,对照附表可得P (K 2≥k 0)≈0.01, 所以有99%以上的把握认为“喜欢该节目与性别有关”.5.某考察团对10个城市的职工人均工资x (千元)与居民人均消费y (千元)进行调查统计,得出y 与x 具有线性相关关系,且回归方程为y ^=0.6x +1.2.若某城市职工人均工资为5千元,估计该城市人均消费额占人均工资收入的百分比为( )A .66%B .67%C .79%D .84%解析:选D ∵y 与x 具有线性相关关系,满足回归方程y ^=0.6x +1.2, 该城市居民人均工资为x =5,∴可以估计该城市的职工人均消费水平y =0.6×5+1.2=4.2, ∴可以估计该城市人均消费额占人均工资收入的百分比为4.25=84%.6.某研究机构对儿童记忆能力x 和识图能力y 进行统计分析,得到如下数据:由表中数据,求得线性回归方程为y ^=5x +a ^,若某儿童的记忆能力为12,则他的识图能力为( )A .7B .9.5C .10D .12解析:选B 由表中数据得x =4+6+8+104=7,y =3+5+6+84=112,由(x ,y )在直线y ^=45x +a ^上,得a ^=-110,即线性回归方程为y ^=45x -110.当x =12时,y ^=45×12-110=9.5,即他的识图能力为9.5.二、填空题7.(xx·阜阳质检)某班主任对全班30名男生进行了作业量多少的调查,数据如下表:该班主任据此推断男生认为作业多与喜欢玩电脑游戏有关系,则这种推断犯错误的概率不超过________.解析:计算得K 2的观测值k =30×12×8-2×8214×16×20×10≈4.286>3.841,则推断犯错误的概率不超过0.05. 答案:0.058.某品牌牛奶的广告费用x 与销售额的统计数据如下表:广告费用x (万元) 4 2 3 5 销售额y (万元)49263954根据上表可得回归方程y ^=b ^x +a ^中的b ^为9.4,据此模型预报广告费用为7万元时销售额为________万元.解析:因为x =4+2+3+54=72,y =49+26+39+544=42,由题意可得回归方程为y ^=9.4x +a ^, 因为回归直线一定经过样本点中心(x ,y ) 所以42=9.4×72+a ^,解得a ^=9.1,所以回归方程为y ^=9.4x +9.1,当x =7时,销售额为y =9.4×7+9.1=74.9(万元). 答案:74.99.四名同学根据各自的样本数据研究变量x ,y 之间的相关关系,并求得回归直线方程和相关系数r ,分别得到以下四个结论:①y =2.347x -6.423,且r =-0.928 4; ②y =-3.476x +5.648,且r =-0.953 3; ③y =5.437x +8.493,且r =0.983 0; ④y =-4.326x -4.578,且r =0.899 7. 其中不正确的结论的序号是________.解析:对于①,y =2.347x -6.423,且r =-0.928 4, 线性回归方程符合正相关的特征,r >0,∴①错误; 对于②,y =-3.476x +5.648,且r =-0.953 3,线性回归方程符合负相关的特征,r<0,∴②正确;对于③,y=5.437x+8.493,且r=0.983 0,线性回归方程符合正相关的特征,r>0,∴③正确;对于④,y=-4.326x-4.578,且r=0.899 7,线性回归方程符合负相关的特征,r<0,④错误.综上,①④错误.答案:①④三、解答题10.(xx·惠州调研)在某校举行的航天知识竞赛中,参与竞赛的文科生与理科生人数之比为1∶3,且成绩分布在[40,100],分数在80以上(含80)的同学获奖.按文、理科用分层抽样的方法抽取200人的成绩作为样本,得到成绩的频率分布直方图如图所示.(1)求a的值,并计算所抽取样本的平均值x(同一组中的数据用该组区间的中点值作代表);(2)填写下面的2×2列联表,并判断在犯错误的概率不超过0.05的前提下能否认为“获奖与学生的文、理科有关”.文科生理科生总计获奖 5不获奖总计200附表及公式:P(K2≥k0)0.100.050.0250.0100.0050.001k0 2.706 3.841 5.024 6.6357.87910.828K2=2a+b c+d a+c b+d.解:(1)a=110×[1-(0.01+0.015+0.03+0.015+0.005)×10]=0.025,x=45×0.1+55×0.15+65×0.25+75×0.3+85×0.15+95×0.05=69.(2)由频率分布直方图知样本中获奖的人数为40,不获奖的人数为160,2×2列联表如下:文科生 理科生 总计 获奖 5 35 40 不获奖 45 115 160 总计50150200因为K 2=200×5×115-35×45240×160×50×150≈4.167>3.841,所以在犯错误的概率不超过0.05的前提下能认为“获奖与学生的文、理科有关”. 11.某测试团队为了研究“饮酒”对“驾车安全”的影响,随机选取100名驾驶员先后在无酒状态、酒后状态下进行“停车距离”测试.测试的方案:电脑模拟驾驶,以某速度匀速行驶,记录下驾驶员的“停车距离”(驾驶员从看到意外情况到车子完全停下所需要的距离).无酒状态与酒后状态下的试验数据分别列于表1和表2.表1:无酒状态 停车距离d (米)(10,20] (20,30](30,40](40,50] (50,60] 频数26m n82表2:酒后状态平均每毫升血液酒精含量x (毫克)10 30 50 70 90 平均停车距离y (米)3050607090已知表1数据的中位数估计值为26,回答以下问题.(1)求m ,n 的值,并估计驾驶员无酒状态下停车距离的平均数; (2)根据最小二乘法,由表2的数据计算y 关于x 的回归方程y ^=b ^x +a ^;(3)该测试团队认为:驾驶员酒后驾车的平均“停车距离”y 大于(1)中无酒状态下的停车距离平均数的3倍,则认定驾驶员是“醉驾”.请根据(2)中的回归方程,预测当每毫升血液酒精含量大于多少毫克时为“醉驾”?(附:对于一组数据(x 1,y 1),(x 2,y 2),…,(x n ,y n ), 其回归直线y ^=b ^x +a ^的斜率和截距的最小二乘估计分别为b ^=∑i =1nx i -xy i -y∑i =1nx i -x2=∑i =1nx i y i -n x y∑i =1nx 2i -n x2,a ^=y -b ^x )解:(1)依题意,得610m =50-26,解得m =40,又m+n+36=100,解得n=24. 故停车距离的平均数为15×26100+25×40100+35×24100+45×8100+55×2100=27.(2)依题意,可知x=50,y=60,∑i=15x i y i=10×30+30×50+50×60+70×70+90×90=17 800,∑i=15x2i=102+302+502+702+902=16 500,所以b^=17 800-5×50×6016 500-5×502=0.7,a^=60-0.7×50=25,所以回归直线方程为y^=0.7x+25.(3)由(1)知当y>81时认定驾驶员是“醉驾”.令y^>81,得0.7x+25>81,解得x>80,当每毫升血液酒精含量大于80毫克时认定为“醉驾”.某公司为了准确把握市场,做好产品生产计划,对过去四年的数据进行整理得到了第x年与年销量y(单位:万件)之间的关系如表所示:x 123 4y 12284256(1)在图中画出表中数据的散点图;(2)根据(1)中的散点图拟合y与x的回归模型,并用相关系数加以说明;(3)建立y关于x的回归方程,预测第5年的销售量约为多少?参考数据:∑i=14y i-y2≈32.66,5≈2.24,∑i=14x i y i=418.参考公式:相关系数r=∑i =1nx i -xy i -y∑i =1nx i -x-2∑i =1ny i -y-2,回归方程y ^=a ^+b ^x 中斜率和截距的最小二乘法估计公式分别为b ^=∑i =1nx i -x-y i -y-∑i =1nx i -x-2=∑i =1nx i y i -n x -y-∑i =1nx 2i -n x -2,a ^=y -b ^x -.解:(1)作出散点图如图所示.(2)由(1)的散点图可知,各点大致分布在一条直线附近,由题中所给数据及参考数据得: x =52,y =692,∑i =14x 2i =30,∑i =14y i -y2≈32.66,∑i =14(x i -x )(y i -y )=∑i =14x i y i -x∑i =14y i =418-52×138=73,∑i =14x i -x2=∑i =14x 2i -4x 2= 30-4×⎝ ⎛⎭⎪⎫522=5≈2.24,∴r =∑i =14x i -xy i -y∑i =14x i -x2∑i =14 y i -y2=732.24×32.66≈0.997 8. ∵y 与x 的相关系数近似为0.997 8,说明y 与x 的线性相关程度相当大,∴可以用线性回归模型拟合y 与x 的关系.(3)由(2)知,∑i =14x i y i -4x y =73,∑i =14x 2i -4x 2=5,∴b ^=735,a ^=y -b ^x =692-735×52=-2,故y 关于x 的回归直线方程为y ^=735x -2.当x =5时,y ^=735×5-2=71,∴第5年的销售量约为71万件.。
资料正文内容下拉开始>>第十八单元统计与统计案例教材复习课“统计与统计案例”相关基础知识一课过三种抽样方法三种抽样方法类别共同点各自特点相互联系适用范围简单随机抽样是不放回抽样,抽样过程中,每个个体被抽到的机会(概率)相等从总体中逐个抽取总体中的个数较少系统抽样将总体均分成几部分,按事先确定的规则,在各部分抽取在起始部分抽样时,采用简单随机抽样总体中的个数比较多分层抽样将总体分成几层,分层进行抽取各层抽样时,采用简单随机抽样或系统抽样总体由差异明显的几部分组成1.从一个容量为N的总体中抽取一个容量为n的样本,当选取简单随机抽样、系统抽样和分层抽样三种不同方法抽取样本时,总体中每个个体被抽中的概率分别为p1,p2,p3,则()A.p1=p2<p3B.p2=p3<p1C.p1=p3<p2D.p1=p2=p3解析:选D根据简单随机抽样、系统抽样和分层抽样的定义可知,无论哪种抽样,每个个体被抽中的概率都是相等的,所以p1=p2=p3.2.某班共有52人,现根据学生的学号,用系统抽样的方法,抽取一个容量为4的样本,已知3号、29号、42号学生在样本中,那么样本中还有一个学生的学号是() A.10 B.11C.12 D.16解析:选D从被抽中的3名学生的学号中可以看出学号间距为13,所以样本中还有一个学生的学号是16.3.为了调查老师对微课堂的了解程度,某市拟采用分层抽样的方法从A ,B ,C 三所中学中抽取60名教师进行调查,已知A ,B ,C 三所学校中分别有180,270,90名教师,则从C 学校中应抽取的人数为( )A .10B .12C .18D .24解析:选A 根据分层抽样的特征,从C 学校中应抽取的人数为90180+270+90×60=10.[清易错]1.系统抽样中,易忽视抽取的样本数也就是分段的段数,当Nn 不是整数时,注意剔除,剔除的个体是随机的,各段入样的个体编号成等差数列.2.分层抽样中,易忽视每层抽取的个体的比例是相同的,即样本容量n总体个数N.1.从2 018名学生中选取50名学生参加全国数学联赛,若采用以下方法选取:先用简单随机抽样法从2 018名学生中剔除18名学生,剩下的2 000名学生再按系统抽样的方法抽取,则每名学生入选的概率( )A .不全相等B .均不相等C .都相等,且为502 018D .都相等,且为140解析:选C 从N 个个体中抽取M 个个体,则每个个体被抽到的概率都等于MN . 2.从300名学生(其中男生180人,女生120人)中按性别用分层抽样的方法抽取50人参加比赛,则应该抽取男生人数为( )A .27B .30C .33D .36解析:选B 因为男生与女生的比例为180∶120=3∶2, 所以应该抽取男生人数为50×33+2=30.频率分布直方图和茎叶图 [过双基]1.作频率分布直方图的步骤(1)求极差(即一组数据中最大值与最小值的差); (2)决定组距与组数; (3)将数据分组; (4)列频率分布表; (5)画频率分布直方图.2.频率分布折线图和总体密度曲线(1)频率分布折线图:连接频率分布直方图中各小长方形上端的中点,就得到频率分布折线图.(2)总体密度曲线:随着样本容量的增加,作图时所分的组数增加,组距减小,相应的频率折线图会越来越接近于一条光滑曲线,统计中称这条光滑曲线为总体密度曲线.3.茎叶图的优点茎叶图的优点是可以保留原始数据,而且可以随时记录,这对数据的记录和表示都能带来方便.[小题速通]1.在样本的频率分布直方图中,共有7个小长方形,若中间一个小长方形的面积等于其他6个小长方形的面积的和的14,且样本容量为80,则中间一组的频数为( )A .0.25B .0.5C .20D .16解析:选D 设中间一组的频数为x , 依题意有x 80=14⎝⎛⎭⎫1-x 80,解得x =16.2.某学生在8次测试中,数学成绩的茎叶图如图,则这8次成绩的中位数是( ) A .86 B .87 C .87.5D .88.5解析:选A 由茎叶图得到8个数的大小顺序依次是78,79,83,85,87,88,89,96,中间的两个数为85,87,所以中位数为85+872=86. [清易错]1.易把直方图与条形图混淆两者的区别在于条形图是离散随机变量,纵坐标刻度为频数或频率,直方图是连续随机变量,连续随机变量在某一点上是没有频率的.2.易忽视频率分布直方图中纵轴表示的应为频率组距.3.在绘制茎叶图时,易遗漏重复出现的数据,重复出现的数据要重复记录,同时不要混淆茎叶图中茎与叶的含义.1.某校100名学生期中考试数学成绩的频率分布直方图如图所示,其中成绩分组区间是:[50,60),[60,70),[70,80),[80,90),[90,100],则图中a 的值为 ()A .0.006B .0.005C .0.004 5D .0.002 5解析:选B 由题意知,a =1-(0.02+0.03+0.04)×102×10=0.005,故选B.2.(2018·郑州检测)已知甲、乙两组数据如茎叶图所示,若它们的中位数相同,平均数也相同,则图中的m ,n 的比值mn =________.解析:由茎叶图可知甲的数据为27,30+m,39,乙的数据为20+n,32,34,38.由此可知乙的中位数是33,所以甲的中位数也是33,所以m =3.由此可以得出甲的平均数为33,所以乙的平均数也是33,所以20+n +32+34+384=33,解得n =8,所以m n =38.答案:38样本的数字特征1.众数、中位数、平均数 数字特征定义与求法优点与缺点众数一组数据中重复出现次数最多的数众数通常用于描述变量的值出现次数最多的数.但显然它对其他数据信息的忽视使得无法客观地反映总体特征 中位数把一组数据按从小到大的顺序排列,处在中间位置的一个数据(或两个数据的平均数)中位数等分样本数据所占频率,它不受少数几个极端值的影响,这在某些情况下是优点,但它对极端值的不敏感有时也会成为缺点平均数如果有n 个数据x 1,x 2,…,x n ,那么这n 个数的平均数平均数与每一个样本数据有关,可以反映出更多的关于样本数据全体的信息,但平均数受数据中的极端值的影响较大,使平(1)标准差:样本数据到平均数的一种平均距离,一般用s 表示,s = 1n[(x 1-x )2+(x 2-x )2+…+(x n -x )2]. (2)方差:标准差的平方s 2s 2=1n [(x 1-x )2+(x 2-x )2+…+(x n -x )2],其中x i (i =1,2,3,…,n )是样本数据,n 是样本容量,x 是样本平均数.[小题速通]1.对于一组数据x i (i =1,2,3,…,n ),如果将它们改变为x i +C (i =1,2,3,…,n ),其中C ≠0,则下列结论正确的是( )A .平均数与方差均不变B .平均数变,方差保持不变C .平均数不变,方差变D .平均数与方差均发生变化解析:选B 依题意,记原数据的平均数为x -,方差为s 2,则新数据的平均数为(x 1+C )+(x 2+C )+…+(x n +C )n =x -+C ,即新数据的平均数改变;新数据的方差为1n [(x 1+C )-(x -+C )]2+[(x 2+C )-(x -+C )]2+…+[(x n +C )-(x -+C )]2=s 2,即新数据的方差不变.2.样本中共有五个个体,其值分别为0,1,2,3,m .若该样本的平均值为1,则其方差为( ) A.105B.305C. 2 D .2解析:选D 依题意得m =5×1-(0+1+2+3)=-1,样本方差s 2=15(12+02+12+22+22)=2,即所求的样本方差为2.3.10名工人某天生产同一零件,生产的零件数分别是15,17,14,10,15,17,17,16,14,12,设其平均数为a ,中位数为b ,众数为c ,则a ,b ,c 的大小关系为( )A .a >b >cB .b >c >aC .c >a >bD .c >b >a解析:选D 依题意,这些数据由小到大依次是10,12,14,14,15,15,16,17,17,17,因此a <15,b =15,c =17,c >b >a .4.某校甲、乙两个班级各有5名编号为1,2,3,4,5的学生进行投篮练习,每人投10次,投中的次数如下表:学生 1号 2号 3号 4号 5号 甲班 6 7 7 8 7 乙班67679解析:由数据表可得乙班的数据波动性较大,则其方差较大,甲班的数据波动性较小,其方差较小,其平均值为7,方差s 2=15(1+0+0+1+0)=25.答案:25变量间的相关关系、统计案例 [过双基]1.变量间的相关关系(1)常见的两变量之间的关系有两类:一类是函数关系,另一类是相关关系;与函数关系不同,相关关系是一种非确定性关系.(2)从散点图上看,点散布在从左下角到右上角的区域内,两个变量的这种相关关系称为正相关,点散布在左上角到右下角的区域内,两个变量的相关关系为负相关.2.两个变量的线性相关(1)从散点图上看,如果这些点从整体上看大致分布在通过散点图中心的一条直线附近,称两个变量之间具有线性相关关系,这条直线叫做回归直线.(2)回归方程为y ^=b ^x +a ^,其中b ^=∑i =1nx i y i -n x - y-∑i =1nx 2i -n x -2, a ^=y --b ^x -. (3)通过求Q =∑i =1n(y i -bx i -a )2的最小值而得到回归直线的方法,即使得样本数据的点到回归直线的距离的平方和最小,这一方法叫做最小二乘法.(4)相关系数:当r >0时,表明两个变量正相关; 当r <0时,表明两个变量负相关.r 的绝对值越接近于1,表明两个变量的线性相关性越强.r 的绝对值越接近于0时,表明两个变量之间几乎不存在线性相关关系.通常|r |大于0.75时,认为两个变量有很强的线性相关性.3.独立性检验假设有两个分类变量X 和Y ,它们的取值分别为{x 1,x 2}和{y 1,y 2},其样本频数列联表(称为2×2列联表)为:y 1 y 2 总计 x 1 a b a +b x 2 c d c +d 总计a +cb +da +b +c +dK 2=n (ad -bc )(a +b )(a +c )(b +d )(c +d )(其中n =a +b +c +d 为样本容量).[小题速通]1.如图是根据x ,y 的观测数据(x i ,y i )(i =1,2,…,10)得到的散点图,可以判断变量x ,y 具有线性相关关系的图是( )A .①②B .①④C .②③D .③④解析:选D 若变量x ,y 具有线性相关关系,那么散点就在某条直线附近,从左上到右下,或从左下到右上,故选D.2.已知变量x ,y 取值如表所示:x 0 1 4 5 6 y1.3m3m5.67.4画散点图分析可知:y 与x 线性相关,且求得回归方程为y =x +1,则m 的值(精确到0.1)为( )A .1.5B .1.6C .1.7D .1.8解析:选C 由题意知,x =3.2代入回归方程y ^=x +1可得y =4.2,则4m =4.2×5-(1.3+5.6+7.4)=6.7,解得m =1.675,则精确到0.1后m 的值为1.7.3.为了判断高中三年级学生是否选修文科与性别的关系,现随机抽取50名学生,得到如下2×2列联表:理科文科男 13 10 女720已知P (K 2≥3.841)≈0.05,P 根据表中数据,得到K 2的观测值k =50×(13×20-10×7)223×27×20×30≈4.844.则认为选修文科与性别有关系出错的可能性为________.解析:K 2的观测值k ≈4.844,这表明小概率事件发生.根据假设检验的基本原理,应该断定“是否选修文科与性别之间有关系”成立,并且这种判断出错的可能性约为5%.答案:5%[清易错]1.易混淆相关关系与函数关系,两者的区别是函数关系是一种确定的关系,而相关关系是一种非确定的关系,函数关系是一种因果关系,而相关关系不一定是因果关系,也可能是伴随关系.2.回归分析中易误认为样本数据必在回归直线上,实质上回归直线必过(x ,y )点,可能所有的样本数据点都不在直线上.设某大学的女生体重y (单位:kg)与身高x (单位:cm)具有线性相关关系,根据一组样本数据(x i ,y i )(i =1,2,…,n ),用最小二乘法建立的回归方程为y ^=0.85x -85.71,则下列结论中不正确的是( )A .y 与x 具有正的线性相关关系B .回归直线过样本点的中心(x ,y )C .若该大学某女生身高增加1 cm ,则其体重约增加0.85 kgD .若该大学某女生身高为170 cm ,则可断定其体重必为58.79 kg解析:选D 由于线性回归方程中x 的系数为0.85,因此y 与x 具有正的线性相关关系,故A 正确.又线性回归方程必过样本中心点(x ,y ),因此B 正确.由线性回归方程中系数的意义知,x 每增加1 cm ,其体重约增加0.85 kg ,故C 正确.当某女生的身高为170 cm 时,其体重估计值是58.79kg ,而不是具体值,因此D 不正确.一、选择题1.(2018·邯郸摸底)某校数学教研组为了解学生学习数学的情况,采用分层抽样的方法从高一600人、高二780人、高三n 人中,抽取35人进行问卷调查.已知高二被抽取的人数为13,则n =( )A .660B .720C .780D .800解析:选B 由已知条件,抽样比为13780=160,从而35600+780+n =160,解得n =720.2.已知变量x 与y 正相关,且由观测数据算得样本平均数x =3,y =3.5,则由该观测数据算得的线性回归方程可能为( )A.y ^=0.4x +2.3 B.y ^=2x -2.4 C.y ^=-2x +9.5D.y ^=-0.3x +4.4解析:选A 依题意知,相应的回归直线的斜率应为正,排除C ,D.且直线必过点(3,3.5),代入A 、B ,知A 正确.3.从编号为001,002,…,500的500个产品中用系统抽样的方法抽取一个样本,已知样本中编号最小的两个编号分别为007,032,则样本中最大的编号应该为( )A .480B .481C .482D .483解析:选C 根据系统抽样的定义可知样本的编号成等差数列,令a 1=7,a 2=32,则d =25,所以7+25(n -1)≤500,所以n ≤20,最大编号为7+25×19=482.4.根据如下样本数据:x 2 3 4 5 6 7 y4.12.5-0.50.5-2.0-3.0得到的回归方程为y =b x +a ,则( ) A.a ^>0,b ^>0 B.a ^>0,b ^<0 C.a ^<0,b ^>0D.a ^ <0,b ^<0解析:选B 根据样本数据画出散点图(图略),可知b ^<0,a ^>0.5.如图是某学校举行的运动会上七位评委为某体操项目打出的分数的茎叶统计图,去掉一个最高分和一个最低分后,所剩数据的平均数和方差分别为( )A .84,4.84B .84,1.6C .85,1.6D .85,4解析:选C 依题意,所剩数据的平均数是80+15×(4×3+6+7)=85,所剩数据的方差是15×[3×(84-85)2+(86-85)2+(87-85)2]=1.6.6.某时段内共有100辆汽车经过某一雷达测速区域,将测得的汽车的时速绘制成如图所示的频率分布直方图,根据图形推断,该时段时速超过50 km/h 的汽车的辆数为( )A .56B .61C .70D .77解析:选D 由图知,时速超过50 km/h 的汽车的频率为(0.039+0.028+0.010)×10=0.77,所以时速超过50 km/h 的汽车的辆数为100×0.77=77.7.(2018·江西九校联考)随着国家二孩政策的全面放开,为了调查一线城市和非一线城市的二孩生育意愿,某机构用简单随机抽样方法从不同地区调查了100位育龄妇女,结果如下表.非一线 一线 总计 愿生 45 20 65 不愿生 13 22 35 总计5842100由K 2=n (ad -bc )(a +b )(c +d )(a +c )(b +d ),得K 2=100×(45×22-20×13)265×35×58×42≈9.616.参照下表,P (K 2≥k 0)0.050 0.010 0.001 k 03.8416.63510.828A .在犯错误的概率不超过0.1%的前提下,认为“生育意愿与城市级别有关”B .在犯错误的概率不超过0.1%的前提下,认为“生育意愿与城市级别无关”C .有99%以上的把握认为“生育意愿与城市级别有关”D .有99%以上的把握认为“生育意愿与城市级别无关”解析:选C ∵K 2≈9.616>6.635,∴有99%以上的把握认为“生育意愿与城市级别有关”.8.从甲、乙两个城市分别随机抽取14台自动售货机,对其销售额进行统计,统计数据用茎叶图表示(如图),设甲、乙两组数据的平均数分别为x 甲,x 乙,中位数分别为m 甲,m乙,则( )A.x 甲<x 乙,m 甲>m 乙B.x 甲<x 乙,m 甲<m 乙C.x 甲>x 乙,m 甲>m 乙D. x 甲>x 乙,m 甲<m 乙解析:选A 由题意得x 甲=5+6+10+…+4814≈24.3,x 乙=8+8+10+…+4314≈24.4,即x 甲<x 乙; 又m 甲=22+252=23.5,m 乙=23, 即m 甲>m 乙,故选A. 二、填空题9.某中学采用系统抽样方法,从该校高一年级全体800名学生中抽50名学生做牙齿健康检查.现将800名学生从1到800进行编号.已知从33~48这16个数中取的数是39,则在第1小组1~16中随机抽到的数是________.解析:间隔数k =80050=16,即每16人抽取一个人.由于39=2×16+7,所以第1小组中抽取的数为7.答案:710.某车间需要确定加工零件的加工时间,进行了若干次试验.根据收集到的数据(如表):零件数x /个 10 20 30 40 50 加工时间y /分钟6268758189由最小二乘法求得回归直线方程y =0.67x +a ,则a 的值为________. 解析:∵x =15×(10+20+30+40+50)=30,y =15×(62+68+75+81+89)=75,回归直线方程y ^=0.67x +a ^过样本中心点(x ,y ),∴a ^=75-0.67×30=54.9. 答案:54.911.已知甲、乙、丙三类产品共有1 200件,且甲、乙、丙三类产品的数量之比为3∶4∶5,现采用分层抽样的方法抽取60件进行质量检测,则乙类产品抽取的件数为________.解析:由题意可知,乙类产品抽取的件数为 60×43+4+5=20.答案:2012.某医疗研究所为了检验某种血清预防感冒的作用,把500名使用血清的人与另外500名未使用血清的人一年中的感冒记录作比较,提出假设H 0:“这种血清不能起到预防感冒的作用”,利用2×2列联表计算得K 2≈3.918,经查临界值表知P (K 2≥3.841)≈0.05.则下列结论中,正确结论的序号是________.①有95%的把握认为“这种血清能起到预防感冒的作用”; ②若某人未使用该血清,那么他在一年中有95%的可能性得感冒; ③这种血清预防感冒的有效率为95%; ④这种血清预防感冒的有效率为5%.解析:K 2≈3.918≥3.841,而P (K 2≥3.814)≈0.05,所以有95%的把握认为“这种血清能起到预防感冒的作用”.要注意我们检验的是假设是否成立和该血清预防感冒的有效率是没有关系的,不是同一个问题,不要混淆.答案:① 三、解答题13.某地区2011年至2017年农村居民家庭人均纯收入y (单位:千元)的数据如表:(2)利用(1)中的回归方程,分析2011年至2017年该地区农村居民家庭人均纯收入的变化情况,并预测该地区2019年农村居民家庭人均纯收入.附:回归直线的斜率和截距的最小二乘法估计公式分别为:b ^=∑i =1n(x i -x )(y i -y )∑i =1n(x i -x )2,a ^=y -b ^x (其中x ,y 为样本平均值).解:(1)由题意,得x=17×(1+2+3+4+5+6+7)=4,y=17×(2.9+3.3+3.6+4.4+4.8+5.2+5.9)=4.3,∑i=17(x i-x)(y i-y)=(-3)×(-1.4)+(-2)×(-1)+(-1)×(-0.7)+0+1×0.5+2×0.9+3×1.6=14,∑i=17(x i-x)2=(-3)2+(-2)2+(-1)2+02+12+22+32=28,所以b^=1428=0.5,a^=y-b^x=4.3-0.5×4=2.3,所以y关于x的线性回归方程为y^=0.5x+2.3.(2)因为b^=0.5>0,所以2011年至2017年该地区农村居民家庭人均纯收入逐年增加,平均每年增加0.5千元,因为2019的年份代号是x=9,所以代入(1)中的回归方程,可得y^=0.5×9+2.3=6.8, 所以预测该地区2019年农村居民家庭人均纯收入为6.8千元.14.(2018·唐山统考)为了调查某校学生体质健康达标情况,现采用随机抽样的方法从该校抽取了m名学生进行体育测试.根据体育测试得到了这m名学生的各项平均成绩(满足100分),按照以下区间分为七组:[30,40),[40,50),[50,60),[60,70),[70,80),[80,90),[90,100],并得到频率分布直方图(如图).已知测试平均成绩在区间[30,60)内有20人.(1)求m的值及中位数n;(2)若该校学生测试平均成绩小于n,则学校应适当增加体育活动时间.根据以上抽样调查数据,该校是否需要增加体育活动时间?解:(1)由频率分布直方图知第1组,第2组和第3组的频率分别是0.02,0.02和0.06,则m×(0.02+0.02+0.06)=20,解得m=200.由直方图可知,中位数n位于[70,80)内,则0.02+0.02+0.06+0.22+0.04(n-70)=0.5,解得n=74.5.(2)设第i(i=1,2,3,4,5,6,7)组的频率和频数分别为p i和x i,由图知,p1=0.02,p2=0.02,p3=0.06,p4=0.22,p5=0.40,p6=0.18,p7=0.10,则由x i=200×p i,可得x1=4,x2=4,x3=12,x4=44,x5=80,x6=36,x7=20,故该校学生测试平均成绩是x=1200×(35x1+45x2+55x3+65x4+75x5+85x6+95x7)=74<74.5,所以学校应该适当增加体育活动时间.高考研究课(一)随机抽样[全国卷5年命题分析]考点考查频度考查角度系统抽样未考查分层抽样5年1考抽样方法的选择系统抽样[典例]采用系统抽样的方法抽取一个容量为50的样本,且随机抽得的号码为003.这600名学生分住在三个营区,从001到300在A营区,从301到495在B营区,从496到600在C营区,则三个营区被抽中的人数依次为()A.26,16,8B.25,17,8C.25,16,9 D.24,17,9[解析]依题意及系统抽样的意义可知,将这600名学生按编号依次分成50组,每一组各有12名学生,第k(k∈N*)组抽中的号码是3+12(k-1).令3+12(k-1)≤300,得k≤103 4,因此A营区被抽中的人数是25;令300<3+12(k-1)≤495,得1034<k≤42,因此B营区被抽中的人数是42-25=17,故C营区被抽中的人数为50-25-17=8.[答案] B[方法技巧]解决系统抽样问题的2个关键步骤(1)分组的方法应依据抽取比例而定,即根据定义每组抽取一个样本.(2)起始编号的确定应用简单随机抽样的方法,一旦起始编号确定,其他编号便随之确定了.[即时演练]1.某学校教务处采用系统抽样方法,从学校高三年级全体1 000名学生中抽50名学生做学习状况问卷调查.现将1 000名学生从1到1 000进行编号,求得间隔数k =20,即分50组,每组20人.在第一组中随机抽取一个号,如果抽到的是17号,则第8组中应抽取的号码是( )A .117B .157C .417D .367解析:选B 根据系统抽样法的特点,可知抽取出的号码成首项为17,公差为20的等差数列,所以第8组应抽取的号码是17+(8-1)×20=157.2.已知某单位有40名职工,现要从中抽取5名职工,将全体职工随机按1~40编号,并按编号顺序平均分成5组.按系统抽样方法在各组内抽取一个号码.若第1组抽出的号码为2,则所有被抽出职工的号码为________.解析:由题意,把40名职工分成5组,故组距为405=8,又第一组抽出的号码为2,则抽出的所有号码组成以2为首项,8为公差的等差数列,故抽出的号码为2,10,18,26,34.答案:2,10,18,26,34分层抽样分层抽样是历年高考的重要考点之一,高考中常把分层抽样、频率分布、概率综合起来进行考查,反映了当前高考的命题方向.这类试题难度不大,但考查的知识面较为宽广,在解题中要注意准确使用所学知识,不然在一个点上的错误就会导致整体失误.,常见的命题角度有:(1)与频率分布直方图相结合问题; (2)与概率相结合问题.1.某校从高三年级中随机选取200名学生,将他们的一模数学成绩绘制成频率分布直方图(如图). 由图中数据可知a =________.若要从成绩在[120, 130),[130,140),[140,150]三组内的学生中,用分层抽样的方法选取18人参加一项活动,则从成绩在[130,140) 内的学生中选取的人数应为________.解析:由题意知,(0.020+0.035+a +0.010+0.005)×10=1,解得a =0.030.由分层抽样的原则可知,在[120, 130),[130 ,140),[140 , 150]三组内的学生中,人数比为6∶2∶1.所以从成绩在[130 ,140) 内的学生中选取的人数为18×29=4.答案:0.030 42.从某学校所有高一学生某次计算机笔试成绩中选出40名学生的成绩(单位:分),成绩分组区间为[50,70),[70,90),[90,110),[110,130),[130,150],由此绘制成如图所示的频率分布直方图,规定成绩低于90分为不及格,成绩不低于90分为及格.(1)求频率分布直方图中m 的值; (2)求这40名学生中不及格的学生人数;(3)从不及格的学生中按成绩用分层抽样的方法任选5人,再从这5人中任选2人,求这2人的成绩均在[70,90)内的概率.解:(1)由题中频率分布直方图知,组距为20, 由⎝⎛⎭⎫m +32m +72m +3m +m ×20=1,解得m =0.005. (2)这40名学生中不及格的学生人数为 52×0.005×20×40=10. (3)按成绩分层抽样,则从成绩在[50,70),[70,90)的学生中应选取的人数分别为25×5=2,35×5=3,记成绩在[50,70)内的2人分别为A 1,A 2,成绩在[70,90)内的3人分别为B 1,B 2,B 3,“2人的成绩均在[70,90)内”为事件A ,则从这5人中任选2人的基本事件有(A 1,A 2),(A 1,B 1),(A 1,B 2),(A 1,B 3),(A 2,B 1),(A 2,B 2),(A 2,B 3),(B 1,B 2),(B 1,B 3),(B 2,B 3),共10个.其中这2人的成绩都在[70,90)内的基本事件有(B 1,B 2),(B 1,B 3),(B 2,B 3),共3个. 故所求概率P (A )=310. 角度二 与概率相结合问题3.由世界自然基金会发起的“地球1小时”活动已发展成为最有影响力的环保活动之一,今年的参与人数再创新高,然而也有部分公众对该活动的实际效果与影响提出了疑问.对此,某新闻媒体进行了网上调查,在所有参与调查的人中,持“支持”、“保留”和“不支持”态度的人数如下表所示:态度年龄支持 保留 不支持 20岁以下 800 450 200 20岁以上(含20岁)100150300(1)中抽取了45人,求n 的值;(2)在持“不支持”态度的人中,用分层抽样的方法抽取5人看成一个总体,从这5人中任意选取2人,求至少有1人年龄在20岁以下的概率.解:(1)由题意得45800+100=n 800+450+200+100+150+300,解得n =100.(2)设所抽取的人中,有m 人年龄在20岁以下, 则200200+300=m 5,解得m =2. 即20岁以下抽取了2人,分别记为A 1,A 2;20岁以上(含20岁)抽取了3人,分别记为B 1,B 2,B 3,则从中任取2人的所有基本事件为(A 1,B 1),(A 1,B 2),(A 1,B 3),(A 2,B 1),(A 2,B 2),(A 2,B 3),(A 1,A 2),(B 1,B 2),(B 2,B 3),(B 1,B 3),共10个.其中至少有1人年龄在20岁以下的基本事件为(A 1,B 1),(A 1,B 2),(A 1,B 3),(A 2,B 1),(A 2,B 2),(A 2,B 3),(A 1,A 2),共7个,所以从中任意抽取2人,至少有1人年龄在20岁以下的概率为710.[方法技巧]进行分层抽样的相关计算时,常用到的2个关系(1)样本容量n 总体的个数N =该层抽取的个体数该层的个体数; (2)总体中某两层的个体数之比等于样本中这两层抽取的个体数之比.1.(2013·全国卷Ⅰ)为了解某地区的中小学生的视力情况,拟从该地区的中小学生中抽取部分学生进行调查,事先已了解到该地区小学、初中、高中三个学段学生的视力情况有较大差异,而男女生视力情况差异不大,在下面的抽样方法中,最合理的抽样方法是( )A .简单随机抽样 B.按性别分层抽样 C.按学段分层抽样D.系统抽样解析:选C 由于该地区的中小学生人数比较多,不能采用简单随机抽样,排除选项A ;由于小学、初中、高中三个学段的学生视力差异性比较大,可采取按照学段进行分层抽样,而男女生视力情况差异性不大,不能按照性别进行分层抽样,排除B和D.故选C.2.(2015·北京高考)某校老年、中年和青年教师的人数见下表,采用分层抽样的方法调查教师的身体状况,在抽取的样本中,青年教师有320人,则该样本中的老年教师人数为()类别人数老年教师900中年教师 1 800青年教师 1 600合计 4 300A.90 B.100C.180 D.300解析:选C设该样本中的老年教师人数为x,由题意及分层抽样的特点得x900=3201 600,故x=180.3.(2015·湖南高考)在一次马拉松比赛中,35名运动员的成绩(单位:分钟)的茎叶图如图所示.若将运动员按成绩由好到差编为1~35号,再用系统抽样方法从中抽取7人,则其中成绩在区间[139,151]上的运动员人数是()A.3 B.4C.5 D.6解析:选B35÷7=5,因此可将编号为1~35的35个数据分成7组,每组有5个数据,在区间[139,151]上共有20个数据,分在4个小组中,每组取1人,共取4人.4.(2015·福建高考)某校高一年级有900名学生,其中女生400名,按男女比例用分层抽样的方法,从该年级学生中抽取一个容量为45的样本,则应抽取的男生人数为________.解析:设男生抽取x人,则有45900=x900-400,解得x=25.答案:25一、选择题1.某校为了解1 000名高一新生的身体生长状况,用系统抽样法(按等距的规则)抽取40名同学进行检查,将学生从1~1 000进行编号,现已知第18组抽取的号码为443,则第一组用简单随机抽样抽取的号码为()A.16B.17C.18 D.19解析:选C设第一组抽取的号码为x,根据题意可得抽样间隔为1 00040=25,则x+25×(18-1)=443,解得x=18.2.某公司在甲、乙、丙、丁四个地区分别有150,120,180,150个销售点.公司为了调查产品销售情况,需从这600个销售点中抽取一个容量为100的样本,记这项调查为①;在丙地区有20个大型销售点,要从中抽取7个调查其销售收入和售后服务等情况,记这项调查为②,则完成①②这两项调查宜采用的抽样方法依次是()A.分层抽样法,系统抽样法B.分层抽样法,简单随机抽样法C.系统抽样法,分层抽样法D.简单随机抽样法,分层抽样法解析:选B一般甲、乙、丙、丁四个地区会存在差异,采用分层抽样法较好.在丙地区中抽取的样本个数较少,易采用简单随机抽样法.3.《中国诗词大会》的播出引发了全民的读书热,某小学语文老师在班里开展了一次诗词默写比赛,班里40名学生得分数据的茎叶图如图所示.若规定得分不小于85分的学生得到“诗词达人”的称号,小于85分且不小于70分的学生得到“诗词能手”的称号,其他学生得到“诗词爱好者”的称号,根据该次比赛的成绩按照称号的不同进行分层抽样抽选10名学生,则抽选的学生中获得“诗词能手”称号的人数为()A.2 B.4C.5 D.6解析:选B由茎叶图可知,“诗词达人”有8人,“诗词能手”有16人,“诗词爱好者”有16人,由分层抽样可得,抽选的学生中获得“诗词能手”称号的人数为1040×16=4.4.某校高一、高二、高三的学生人数之比为2∶3∶5,若用分层抽样的方法抽取容量为200的样本,则应从高三学生中抽取的人数为()。
第十一编 统计、统计案例11.1 抽样方法1.为了了解所加工的一批零件的长度,抽取其中200个零件并测量了其长度,在这个问题中,总体的一个样本是 . 答案 200个零件的长度2.某城区有农民、工人、知识分子家庭共计2 004户,其中农民家庭1 600户,工人家庭303户,现要从中抽取容量为40的样本,则在整个抽样过程中,可以用到下列抽样方法:①简单随机抽样,②系统抽样,③分层抽样中的 . 答案 ①②③3.某企业共有职工150人,其中高级职称15人,中级职称45人,初级职称90人.现采用分层抽样抽取容量为30的样本,则抽取的各职称的人数分别为 . 答案 3,9,184.(2008·广东理)某校共有学生 2 000名,各年级男、女生人数如下表.已知在全校学生中随机抽取1名,抽到二年级女生的概率是0.19.现用分层抽样的方法在全校抽取64名学生,则应在三年级抽取的学生人数为 .一年级 二年级 三年级 女生 373 x y 男生377370z答案 165.某工厂生产A 、B 、C 三种不同型号的产品,其相应产品数量之比为2∶3∶5,现用分层抽样方法抽出一个容量为n 的样本,样本中A 型号产品有16件,那么此样本的容量n = . 答案 80例1 某大学为了支援我国西部教育事业,决定从2007应届毕业生报名的18名志愿者中,选取6人组成志愿小组.请用抽签法和随机数表法设计抽样方案. 解 抽签法:第一步:将18名志愿者编号,编号为1,2,3, (18)第二步:将18个号码分别写在18张外形完全相同的纸条上,并揉成团,制成号签; 第三步:将18个号签放入一个不透明的盒子里,充分搅匀; 第四步:从盒子中逐个抽取6个号签,并记录上面的编号; 第五步:所得号码对应的志愿者,就是志愿小组的成员.基础自测随机数表法:第一步:将18名志愿者编号,编号为01,02,03, (18)第二步:在随机数表中任选一数作为开始,按任意方向读数,比如第8行第29列的数7开始,向右读; 第三步:从数7开始,向右读,每次取两位,凡不在01—18中的数,或已读过的数,都跳过去不作记录,依次可得到12,07,15,13,02,09.第四步:找出以上号码对应的志愿者,就是志愿小组的成员.例2 某工厂有1 003名工人,从中抽取10人参加体检,试用系统抽样进行具体实施. 解 (1)将每个人随机编一个号由0001至1003. (2)利用随机数法找到3个号将这3名工人剔除. (3)将剩余的1 000名工人重新随机编号由0001至1000. (4)分段,取间隔k =100001=100将总体均分为10段,每段含100个工人. (5)从第一段即为0001号到0100号中随机抽取一个号l .(6)按编号将l ,100+l ,200+l ,…,900+l 共10个号码选出,这10个号码所对应的工人组成样本. 例3 (14分)某一个地区共有5个乡镇,人口3万人,其中人口比例为3∶2∶5∶2∶3,从3万人中抽取一个300人的样本,分析某种疾病的发病率,已知这种疾病与不同的地理位置及水土有关,问应采取什么样的方法?并写出具体过程.解 应采取分层抽样的方法.3分过程如下:(1)将3万人分为五层,其中一个乡镇为一层.5分(2)按照样本容量的比例随机抽取各乡镇应抽取的样本. 300×153=60(人);300×152=40(人); 300×155=100(人);300×152=40(人); 300×153=60(人),10分 因此各乡镇抽取人数分别为60人,40人,100人,40人,60人. 12分 (3)将300人组到一起即得到一个样本.14分例4 为了考察某校的教学水平,将抽查这个学校高三年级的部分学生本年度的考试成绩.为了全面反映实际情况,采取以下三种方式进行抽查(已知该校高三年级共有20个班,并且每个班内的学生已经按随机方式编好了学号,假定该校每班学生的人数相同):①从高三年级20个班中任意抽取一个班,再从该班中任意抽取20名学生,考察他们的学习成绩;②每个班抽取1人,共计20人,考察这20名学生的成绩;③把学生按成绩分成优秀、良好、普通三个级别,从其中共抽取100名学生进行考察(已知该校高三学生共1 000人,若按成绩分,其中优秀生共150人,良好生共600人,普通生共250人). 根据上面的叙述,试回答下列问题:(1)上面三种抽取方式的总体、个体、样本分别是什么?每一种抽取方式抽取的样本中,样本容量分别是多少?(2)上面三种抽取方式各自采用的是何种抽取样本的方法? (3)试分别写出上面三种抽取方式各自抽取样本的步骤.解 (1)这三种抽取方式的总体都是指该校高三全体学生本年度的考试成绩,个体都是指高三年级每个学生本年度的考试成绩.其中第一种抽取方式的样本为所抽取的20名学生本年度的考试成绩,样本容量为20;第二种抽取方式的样本为所抽取的20名学生本年度的考试成绩,样本容量为20;第三种抽取方式的样本为所抽取的100名学生本年度的考试成绩,样本容量为100. (2)三种抽取方式中,第一种采用的是简单随机抽样法; 第二种采用的是系统抽样法和简单随机抽样法; 第三种采用的是分层抽样法和简单随机抽样法. (3)第一种方式抽样的步骤如下:第一步,首先用抽签法在这20个班中任意抽取一个班.第二步,然后从这个班中按学号用随机数表法或抽签法抽取20名学生,考察其考试成绩. 第二种方式抽样的步骤如下:第一步,首先用简单随机抽样法从第一个班中任意抽取一名学生,记其学号为a .第二步,在其余的19个班中,选取学号为a 的学生,加上第一个班中的一名学生,共计20人. 第三种方式抽样的步骤如下:第一步,分层,因为若按成绩分,其中优秀生共150人,良好生共600人,普通生共250人,所以在抽取样本时,应该把全体学生分成三个层次.第二步,确定各个层次抽取的人数.因为样本容量与总体的个体数之比为:100∶1 000=1∶10,所以在每个层次中抽取的个体数依次为10150,10600,10250,即15,60,25. 第三步,按层次分别抽取.在优秀生中用简单随机抽样法抽取15人;在良好生中用简单随机抽样法抽取60人;在普通生中用简单随机抽样法抽取25人.1.有一批机器,编号为1,2,3,…,112,为调查机器的质量问题,打算抽取10台入样,问此样本若采用简单随机抽样方法将如何获得?解 方法一 首先,把机器都编上号码001,002,003,…,112,如用抽签法,则把112个形状、大小相同的号签放在同一个箱子里,进行均匀搅拌,抽签时,每次从中抽出1个号签,连续抽取10次,就得到一个容量为10的样本.方法二 第一步,将原来的编号调整为001,002,003, (112)第二步,在随机数表中任选一数作为开始,任选一方向作为读数方向.比如:选第9行第7个数“3”,向右读.第三步,从“3”开始,向右读,每次读取三位,凡不在001~112中的数跳过去不读,前面已经读过的也跳过去不读,依次可得到074,100,094,052,080,003,105,107,083,092.第四步,对应原来编号74,100,94,52,80,3,105,107,83,92的机器便是要抽取的对象. 2.某单位在岗职工共624人,为了调查工人用于上班途中的时间,该单位工会决定抽取10%的工人进行调查,请问如何采用系统抽样法完成这一抽样? 解 (1)将624名职工用随机方式编号由000至623. (2)利用随机数表法从总体中剔除4人. (3)将剩下的620名职工重新编号由000至619. (4)分段,取间隔k =62620=10,将总体分成62组,每组含10人. (5)从第一段,即为000到009号随机抽取一个号l .(6)按编号将l ,10+l ,20+l ,…,610+l ,共62个号码选出,这62个号码所对应的职工组成样本.3.某电台在因特网上就观众对某一节目的喜爱程度进行调查,参加调查的总人数为12 000人,其中持各种态度的人数如下表:很喜爱 喜爱 一般 不喜爱 2 4354 5673 9261 072电视台为进一步了解观众的具体想法和意见,打算从中抽取60人进行更为详细的调查,应当怎样进行抽样?解 可用分层抽样方法,其总体容量为12 000.“很喜爱”占000124352,应取60×000124352≈12(人);“喜爱”占000125674,应取60×000125674≈23(人);“一般”占000129263,应取60×000129263≈20(人);“不喜爱”占000120721,应取60×000120721≈5(人).因此采用分层抽样在“很喜爱”、“喜爱”、“一般”和“不喜爱”的2 435人、4 567人、3 926人和1 072人中分别抽取12人、23人、20人和5人.4.某初级中学有学生270人,其中一年级108人,二、三年级各81人,现要利用抽样方法抽取10人参加某项调查,考虑选用简单随机抽样、分层抽样和系统抽样三种方案,使用简单随机抽样和分层抽样时,将学生按一、二、三年级依次统一编号为1,2,…,270,使用系统抽样时,将学生统一随机编号为1,2,…,270,并将整个编号依次分为10段,如果抽得号码有下列四种情况: ①7,34,61,88,115,142,169,196,223,250; ②5,9,100,107,111,121,180,195,200,265; ③11,38,65,92,119,146,173,200,227,254; ④30,57,84,111,138,165,192,219,246,270. 关于上述样本的下列结论中,正确的是 (填序号). (1)②、③都不能为系统抽样 (2)②、④都不能为分层抽样 (3)①、④都可能为系统抽样 (4)①、③都可能为分层抽样 答案 (4)一、填空题1.(2008·安庆模拟)某校高中生共有900人,其中高一年级300人,高二年级200人,高三年级400人,现分层抽取容量为45的样本,那么高一、高二、高三年级抽取的人数分别为 . 答案 15,10,202.某牛奶生产线上每隔30分钟抽取一袋进行检验,则该抽样方法为①;从某中学的30名数学爱好者中抽取3人了解学习负担情况,则该抽样方法为②.那么①,②分别为 . 答案 系统抽样,简单随机抽样3.下列抽样实验中,最适宜用系统抽样的是 (填序号).①某市的4个区共有2 000名学生,且4个区的学生人数之比为3∶2∶8∶2,从中抽取200人入样 ②某厂生产的2 000个电子元件中随机抽取5个入样 ③从某厂生产的2 000个电子元件中随机抽取200个入样 ④从某厂生产的20个电子元件中随机抽取5个入样 答案 ③4.(2008·重庆文)某校高三年级有男生500人,女生400人,为了解该年级学生的健康情况,从男生中任意抽取25人,从女生中任意抽取20人进行调查,这种抽样方法是 . 答案 分层抽样法5.某中学有高一学生400人,高二学生300人,高三学生200人,学校团委欲用分层抽样的方法抽取18名学生进行问卷调查,则下列判断不正确的是 (填序号). ①高一学生被抽到的概率最大 ②高三学生被抽到的概率最大 ③高三学生被抽到的概率最小 ④每名学生被抽到的概率相等 答案 ①②③6.某商场有四类食品,其中粮食类、植物油类、动物性食品类及果蔬类分别有40种、10种、30种、20种,现从中抽取一个容量为20的样本进行食品安全检测,若采用分层抽样的方法抽取样本,则抽取的植物油类与果蔬类食品种数之和是 . 答案 67.(2008·天津文,11)一个单位共有职工200人,其中不超过45岁的有120人,超过45岁的有80人.为了调查职工的健康状况,用分层抽样的方法从全体职工中抽取一个容量为25的样本,应抽取超过45岁的职工 人. 答案 108.将参加数学竞赛的1 000名学生编号如下0001,0002,0003,…,1000,打算从中抽取一个容量为50的样本,按系统抽样的方法分成50个部分,如果第一部分编号为0001,0002,…,0020,从第一部分随机抽取一个号码为0015,则第40个号码为 . 答案 0795 二、解答题9.为了检验某种作业本的印刷质量,决定从一捆(40本)中抽取10本进行检查,利用随机数表抽取这个样本时,应按怎样的步骤进行?分析 可先对这40本作业本进行统一编号,然后在随机数表中任选一数作为起始号码,按任意方向读下去,便会得到10个号码. 解 可按以下步骤进行:第一步,先将40本作业本编号,可编为00,01,02, (39)第二步,在附录1随机数表中任选一个数作为开始.如从第8行第4列的数78开始.第三步,从选定的数78开始向右读下去,得到一个两位数字号码59,由于59>39,将它去掉;继续向右读,得到16,由于16<39,将它取出;继续读下去,可得到19,10,12,07,39,38,33,21,后面一个是12,由于在前面12已经取出,将它去掉;再继续读,得到34.至此,10个样本号码已经取满,于是,所要抽取的样本号码是16,19,10,12,07,39,38,33,21,34.10.某政府机关有在编人员100人,其中副处级以上干部10人,一般干部70人,工人20人,上级机关为了了解政府机构改革意见,要从中抽取一个容量为20的样本,试确定用何种方法抽取,如何抽取? 解 用分层抽样抽取. (1)∵20∶100=1∶5, ∴510=2,570=14,520=4∴从副处级以上干部中抽取2人,一般干部中抽取14人,从工人中抽取4人.(2)因副处级以上干部与工人人数较少,可用抽签法从中分别抽取2人和4人;对一般干部可用随机数表法抽取14人.(3)将2人、4人、14人编号汇合在一起就得到了容量为20的样本.11.从某厂生产的10 002辆电动自行车中随机抽取100辆测试某项性能,请合理选择抽样方法进行抽样,并写出抽样过程.解 因为总体容量和样本容量都较大,可用系统抽样. 抽样步骤如下:第一步,将10 002辆电动自行车用随机方式编号;第二步,从总体中剔除2辆(剔除法可用随机数表法),将剩下的10 000辆电动自行车重新编号(分别为00001,00002,…,10000)并分成100段;第三步,在第一段00001,00002,…,00100这100个编号中用简单随机抽样抽出一个作为起始号码(如00006);第四步,把起始号码依次加间隔100,可获得样本.12.某单位有工程师6人,技术员12人,技工18人,要从这些人中抽取一个容量为n 的样本.如果采用系统抽样法和分层抽样法抽取,不用剔除个体;如果样本容量增加一个,则在采用系统抽样时,需要在总体中先剔除1个个体,求样本容 量n .解 总体容量为6+12+18=36.当样本容量是n 时,由题意知,系统抽样的间隔为n36,分层抽样的比例是36n ,抽取工程师36n ×6=6n (人), 抽取技术人员36n ×12=3n(人), 抽取技工36n ×18=2n(人). 所以n 应是6的倍数,36的约数即n =6,12,18,36.当样本容量为(n +1)时,在总体中剔除1人后还剩35人,系统抽样的间隔为135+n ,因为135+n 必须是整数,所以n 只能取6,即样本容量为6.§11.2 总体分布的估计与总体特征数的估计1.一个容量为20的样本,已知某组的频率为0.25,则该组的频数为 .答案 52.(2008·山东理)右图是根据《山东统计年鉴2007》中的资料作成的1997年至2006年我省城镇居民百户家庭人口数的茎叶图.图中左边的数字从左到右分别表示城镇居民百户家庭人口数的百位数字和十位数字,右边的数字表示城镇居民百户家庭人口数的个位数字.从图中可以得到1997年至2006年我省城镇居民百户家庭人口数的平均数为 . 答案 303.63.在抽查产品的尺寸过程中,将其尺寸分成若干组,[a ,b )是其中的一组,抽查出的个体在该组上的频率为m ,该组在频率分布直方图的高为h ,则|a -b |= . 答案hm4.(2008·山东文,9)从某项综合能力测试中抽取100人的成绩,统计如表,则这100人成绩的标准差为 .分数 5 4 3 2 1 人数2010303010答案5102 5.为了了解某地区高三学生的身体发育情况,抽查了该地区100名年龄为17.5岁~18岁的男生体重(kg ),得到频率分布直方图如下:基础自测根据上图可得这100名学生中体重在[56.5,64.5)的学生人数是 . 答案 40例1 在学校开展的综合实践活动中,某班进行了小制作评比,作品上交时间为5月1日至30日,评委会把同学们上交作品的件数按5天一组分组统计,绘制了频率分布直方图(如图所示),已知从左到右各长方形高的比为2∶3∶4∶6∶4∶1,第三组的频数为12,请解答下列问题:(1)本次活动共有多少件作品参加评比? (2)哪组上交的作品数量最多?有多少件?(3)经过评比,第四组和第六组分别有10件、2件作品获奖,问这两组哪组获奖率高? 解 (1)依题意知第三组的频率为 1464324+++++=51,又因为第三组的频数为12, ∴本次活动的参评作品数为5112=60. (2)根据频率分布直方图,可以看出第四组上交的作品数量最多,共有60×1464326+++++=18(件).(3)第四组的获奖率是1810=95, 第六组上交的作品数量为 60×1464321+++++=3(件),∴第六组的获奖率为32=96,显然第六组的获奖率高. 例2 对某电子元件进行寿命追踪调查,情况如下:寿命(h ) 100~200200~300300~400400~500500~600个数2030804030(1)列出频率分布表; (2)画出频率分布直方图;(3)估计电子元件寿命在100 h ~400 h 以内的概率; (4)估计电子元件寿命在400 h 以上的概率. 解 (1)样本频率分布表如下:寿命(h ) 频数 频率 100~200200.10200~300 30 0.15 300~400 80 0.40 400~500 40 0.20 500~600 30 0.15 合计2001(2)频率分布直方图(3)由频率分布表可以看出,寿命在100 h ~400 h 的电子元件出现的频率为0.65,所以我们估计电子元件寿命在100 h ~400 h 的概率为0.65.(4)由频率分布表可知,寿命在400 h 以上的电子元件出现的频率为0.20+0.15=0.35,故我们估计电子元件寿命在400 h 以上的概率为0.35.例3 为了解A ,B 两种轮胎的性能,某汽车制造厂分别从这两种轮胎中随机抽取了8个进行测试,下面列出了每一个轮胎行驶的最远里程数(单位:1 000 km ) 轮胎A 96, 112, 97, 108, 100, 103, 86, 98 轮胎B 108, 101, 94, 105, 96, 93, 97, 106 (1)分别计算A ,B 两种轮胎行驶的最远里程的平均数,中位数; (2)分别计算A ,B 两种轮胎行驶的最远里程的极差、标准差; (3)根据以上数据你认为哪种型号的轮胎性能更加稳定? 解 (1)A 轮胎行驶的最远里程的平均数为: 898861031001089711296+++++++=100,中位数为:298100+ =99; B 轮胎行驶的最远里程的平均数为:810697939610594101108+++++++=100,中位数为:297101+=99.(2)A 轮胎行驶的最远里程的极差为:112-86=26,标准差为: s =821430831242222222+++++++=2221≈7.43; B 轮胎行驶的最远里程的极差为:108-93=15, 标准差为:s = 86374561822222222+++++++=2118≈5.43.(3)由于A 和B 的最远行驶里程的平均数相同,而B 轮胎行驶的最远里程的极差和标准差较小,所以B 轮胎性能更加稳定.例4(14分)某化肥厂甲、乙两个车间包装肥料,在自动包装传送带上每隔30 min 抽取一包产品,称其重量,分别记录抽查数据如下: 甲:102, 101, 99, 98, 103, 98, 99; 乙:110, 115,90,85,75,115,110.(1)这种抽样方法是哪一种? (2)将这两组数据用茎叶图表示;(3)将两组数据比较,说明哪个车间产品较稳定. 解 (1)因为间隔时间相同,故是系统抽样. 2分(2)茎叶图如下:5分(3)甲车间: 平均值: 1x =71(102+101+99+98+103+98+99)=100, 7分 方差:s 12=71[(102-100)2+(101-100)2+…+(99-100)2]≈3.428 6.9分乙车间:平均值:2x =71(110+115+90+85+75+115+110)=100, 11分 方差:s 22=71[(110-100)2+(115-100)2+…+(110-100)2]≈228.571 4. 13分 ∵1x =2x ,s 12<s 22,∴甲车间产品稳定.14分1.为了了解小学生的体能情况,抽取了某小学同年级部分学生进行跳绳测试,将所得数据整理后,画出频率分布直方图如图所示,已知图中从左到右前三个小组的频率分别是0.1,0.3,0.4,第一小组的频数为5.(1)求第四小组的频率;(2)参加这次测试的学生人数是多少?(3)在这次测试中,学生跳绳次数的中位数落在第几小组内? 解 (1)第四小组的频率=1-(0.1+0.3+0.4)=0.2. (2)设参加这次测试的学生人数是n ,则有n =第一小组频率第一小组频数=5÷0.1=50(人).(3)因为0.1×50=5,0.3×50=15,0.4×50=20,0.2×50=10,即第一、第二、第三、第四小组的频数分别为5、15、20、10,所以学生跳绳次数的中位数落在第三小组内.2.从高三学生中抽取50名同学参加数学竞赛,成绩的分组及各组的频数如下:(单位:分) [40,50),2;[50,60),3;[60,70),10;[70,80),15; [80,90),12;[90,100],8. (1)列出样本的频率分布表; (2)画出频率分布直方图;(3)估计成绩在[60,90)分的学生比例; (4)估计成绩在85分以下的学生比例. 解 (1)频率分布表如下:成绩分组 频数 频率 [40,50) [50,60) [60,70) [70,80) [80,90) [90,100]2 3 10 15 12 8 0.04 0.06 0.20 0.30 0.24 0.16 合计501.00(2)频率分布直方图如图所示.(3)成绩在[60,90)的学生比例即为学生成绩在[60,90)的频率,即为(0.20+0.30+0.24)×100%=74%. (4)成绩在85分以下的学生比例即为学生成绩不足85分的频率. 设相应的频率为b . 由808560.0--b =809060.084.0--,故b =0.72. 估计成绩在85分以下的学生约占72%.3.有甲、乙两位射击运动员在相同条件下各射击10次,记录各次命中环数; 甲:8,8,6,8,6,5,9,10,7,4 乙:9,5,7,8,7,6,8,6, 8,7 (1)分别计算他们环数的标准差; (2)谁的射击情况比较稳定. 解 (1)x 甲=101(8+8+6+8+6+5+9+10+7+4)=7.1,x 乙=101(9+5+7+8+7+6+8+6+8+7)=7.1, 2甲s =101[(8-7.1)2+(8-7.1)2+(6-7.1)2+(8-7.1)2+(6-7.1)2+(5-7.1)2+(9-7.1)2+(10-7.1)2+(7-7.1)2+(4-7.1)2]=3.09, ∴s 甲≈1.76.2乙s =101[(9-7.1)2+(5-7.1)2+(7-7.1)2+(8-7.1)2+(7-7.1)2+(6-7.1)2+(8-7.1)2+(6-7.1)2+(8-7.1)2+(7-7.1)2]=1.29,∴s 乙≈1.14.(2)∵x 甲=x 乙,s 乙<s 甲,∴乙射击情况比较稳定.4.(2008·海南、宁夏理,16)从甲、乙两品种的棉花中各抽测了25根棉花的纤维长度(单位:mm ),结果如下: 甲品种:271273 280 285 285 287 292 294 295 301 303 303 307 308 310 314 319323325325 328 331 334 337 352 乙品种:284292 295 304 306 307 312 313 315 315 316 318 318 320 322 322 324327329331333336337343356由以上数据设计了如下茎叶图:根据以上茎叶图,对甲、乙两品种棉花的纤维长度作比较,写出两个统计结论:① ;② .答案 ①乙品种棉花的纤维平均长度大于甲品种棉花的纤维平均长度(或:乙品种棉花的纤维长度普遍大于甲品种棉花的纤维长度).②甲品种棉花的纤维长度较乙品种棉花的纤维长度更分散.(或:乙品种棉花的纤维长度较甲品种棉花的纤维长度更集中(稳定).甲品种棉花的纤维长度的分散程度比乙品种棉花的纤维长度的分散程度更大). ③甲品种棉花的纤维长度的中位数为307 mm ,乙品种棉花的纤维长度的中位数为318 mm.④乙品种棉花的纤维长度基本上是对称的,而且大多集中在中间(均值附近).甲品种棉花的纤维长度除一个特殊值(352)外,也大致对称,其分布较均匀.一、填空题1.下列关于频率分布直方图的说法中不正确的是 .①直方图的高表示取某数的频率②直方图的高表示该组上的个体在样本中出现的频率③直方图的高表示该组上的个体数与组距的比值④直方图的高表示该组上的个体在样本中出现的频率与组距的比值答案①②③2.甲、乙两名新兵在同样条件下进行射击练习,每人打5发子弹,命中环数如下:甲:6,8,9,9,8;乙:10,7,7,7,9.则这两人的射击成绩比稳定.答案甲乙3.某校为了了解学生的课外阅读情况,随机调查了50名学生,得到他们在某一天各自课外阅读所用时间的数据,结果用条形图表示如下:根据条形图可得这50名学生这一天平均每人的课外阅读时间为 h.答案0.94.某班50名学生在一次百米测试中,成绩全部介于13秒与19秒之间,将测试结果按如下方式分成六组:第一组,成绩大于等于13秒且小于14秒;第二组,成绩大于等于14秒且小于15秒;……第六组,成绩大于等于18秒且小于等于19秒.右图是按上述分组方法得到的频率分布直方图.设成绩小于17秒的学生人数占全班总人数的百分比为x,成绩大于等于15秒且小于17秒的学生人数为y,则从频率分布直方图中可分析出x和y分别为 .答案0.9,355.(2009·启东质检)为了解某校高三学生的视力情况,随机地抽查了该校100名高三学生的视力情况,得到频率分布直方图如图所示,由于不慎,部分数据丢失,但知道前四组的频数成等比数列,后六组的频数成等差数列,设最大频率为a,视力在4.6到5.0之间的学生数为b,则a,b的值分别为 .答案0.27,786.甲、乙两名同学在5次体育测试中的成绩统计的茎叶图如图所示,若甲、乙两人的平均成绩分别是x甲、x乙,则x甲x乙,比稳定.答案<乙甲7.(2008·上海理,9)已知总体的各个体的值由小到大依次为2,3,3,7,a,b,12,13.7,18.3,20,且总体的中位数为10.5.若要使该总体的方差最小,则a 、b 的取值分别是 . 答案 10.5、10.58.某教师出了一份共3道题的测试卷,每道题1分,全班得3分,2分,1分,0分的学生所占比例分别为30%,40%,20%,10%,若全班30人,则全班同学的平均分是 分. 答案 1.9 二、解答题9.在育民中学举行的电脑知识竞赛中,将九年级两个班参赛的学生成绩(得分均为整数)进行整理后分成五组,绘制如图所示的频率分布直方图.已知图中从左到右的第一、第三、第四、第五小组的频率分别是0.30,0.15,0.10,0.05,第二小组的频数是40.(1)求第二小组的频率,并补全这个频率分布直方图; (2)求这两个班参赛的学生人数是多少?(3)这两个班参赛学生的成绩的中位数应落在第几小组内?(不必说明理由)解 (1)各小组的频率之和为1.00,第一、三、四、五小组的频率分别是0.30,0.15,0.10,0.05. ∴第二小组的频率为:1.00-(0.30+0.15+0.10+0.05)=0.40. ∴落在59.5~69.5的第二小组的小长方形的高=组距频率=1040.0=0.04.则补全的直方图如图所示.(2)设九年级两个班参赛的学生人数为x 人. ∵第二小组的频数为40人,频率为0.40, ∴x40=0.40,解得x =100(人). 所以九年级两个班参赛的学生人数为100人.(3)因为0.3×100=30,0.4×100=40,0.15×100=15,0.10×100=10,0.05×100=5,即第一、第二、第三、第四、第五小组的频数分别为30,40,15,10,5,所以九年级两个班参赛学生的成绩的中位数应落在第二小组内.10.为了了解高一学生的体能情况,某校抽取部分学生进行一分钟跳绳次数测试,将所得数据整理后,画出频率分布直方图(如图所示),图中从左到右各小长方形面积之比为2∶4∶17∶15∶9∶3,第二小组频数为12.(1)第二小组的频率是多少?样本容量是多少?(2)若次数在110以上(含110次)为达标,试估计该学校全体高一学生的达标率是多少? (3)在这次测试中,学生跳绳次数的中位数落在哪个小组内?请说明理由. 解 (1)由于频率分布直方图以面积的形式反映了数据落在各小组内的频率大小, 因此第二小组的频率为: 391517424+++++=0.08.又因为频率=样本容量第二小组频数,所以样本容量=第二小组频率第二小组频数=08.012=150.(2)由图可估计该学校高一学生的达标率约为 39151742391517++++++++×100%=88%.(3)由已知可得各小组的频数依次为6,12,51,45,27,9,所以前三组的频数之和为69,前四组的频数之和为114,所以跳绳次数的中位数落在第四小组内. 11.观察下面表格:(1)完成表中的频率分布表;(2)根据表格,画出频率分布直方图;(3)估计数据落在[10.95,11.35)范围内的概率约为多少?解 (1)频率依次为:0.03,0.09,0.13,0.16,0.26,0.20,0.07,0.04,0.02,1.00.(2)频率分布直方图如图所示分组 频数 频率 [10.75,10.85) 3 [10.85,10.95) 9 [10.95,11.05) 13 [11.05,11.15) 16 [11.15,11.25) 26 [11.25,11.35) 20 [11.35,11.45) 7 [11.45,11.55) 4 [11.55,11.65)2 合计100。
专题18 统计与统计案例基础巩固一、选择题1.某学校近几年来通过“书香校园”主题系列活动,倡导学生整本阅读纸质课外书籍.下面的统计图是该校2013年至2018年纸质书人均阅读量的情况,根据统计图提供的信息,下列推断不合理的是( )A .从2013年到2016年,该校纸质书人均阅读量逐年增长B .2013年至2018年,该校纸质书人均阅读量的中位数是46.7本C .2013年至2018年,该校纸质书人均阅读量的极差是45.3本D .2013年至2018年,该校后三年纸质书人均阅读量总和是前三年纸质书人均阅读量总和的2倍 【答案】D【解析】对于A ,根据统计图分析可知,从2013年到2016年,该校纸质书人均阅读量分别是:15.5,38.5,43.3,58.4是逐年增长的,故A 是合理的;对于B ,2013年至2018年,该校纸质书人均阅读量按从小到大的顺序排列为:15.5,38.5,43.3,50.1,58.4,60.8,其中位数为43.350.146.72+=本,故B 是合理的;对于C ,因为最大阅读量为60.8本,最小阅读量为15.5本,所以极差为60.815.545.3-=本,故C 是合理的;对于D ,2013年至2018年,该校后三年纸质书人均阅读量总和为58.450.160.8169.3++=本,前三年纸质书人均阅读量总和为15.538.543.397.3++=本,169.397.32194.6≠⨯=, 故D 是不合理的. 故选D.2.设某大学的女生体重y (单位:kg )与身高x (单位:cm )具有线性相关关系,根据一组样本数据(x i,y i)(i=1,2,…,n),用最小二乘法建立的回归方程为y=0.85x-85.71,则下列结论中不正确的是()A.y与x具有正的线性相关关系B.回归直线过样本点的中心(x,y)C.若该大学某女生身高增加1cm,则其体重约增加0.85kgD.若该大学某女生身高为170cm,则可断定其体重必为58.79kg【答案】D【解析】根据y与x的线性回归方程为y=0.85x﹣85.71,则b=0.85>0,y与x具有正的线性相关关系,A正确;回归直线过样本点的中心(,x y),B正确;该大学某女生身高增加1cm,预测其体重约增加0.85kg,C正确;该大学某女生身高为170cm,预测其体重约为0.85×170﹣85.71=58.79kg,D错误.故选D.3.如图是调查某学校高三年级男女学生是否喜欢数学的等高条形图,阴影部分的高表示喜欢数学的频率.已知该年级男生女生各500名(所有学生都参加了调查),现从所有喜欢数学的同学中按分层抽样的方式抽取32人,则抽取的男生人数为()A.16B.32C.24D.8【答案】C【解析】由等高条形图可知:喜欢数学的女生和男生的比为1:3,所以抽取的男生数为24人.故选C.4.某学校为落实学生掌握社会主义核心价值观的情况,用系统抽样的方法从全校2400名学生中抽取30人进行调查.现将2400名学生随机地从1~2400编号,按编号顺序平均分成30组(1~80号,81~160号,…,2321~2400号),若第3组与第4组抽出的号码之和为432,则第6组抽到的号码是()A.416B.432C.448D.464【答案】A【解析】设第n 组抽到的号码是n a ,则{}n a 构成以80为公差的等差数列, 所以311802160a a a =+⨯=+,411803240a a a =+⨯=+, 所以3412805432a a a +=+⨯=,解得116a =, 所以616805416a =+⨯=. 故选A5.下列有关线性回归分析的四个命题:①线性回归直线必过样本数据的中心点(),x y ;②回归直线就是散点图中经过样本数据点最多的那条直线; ③当相关性系数0r >时,两个变量正相关;④如果两个变量的相关性越强,则相关性系数r 就越接近于1. 其中真命题的个数为( ) A .1个B .2个C .3个D .4个【答案】B【解析】①线性回归直线必过样本数据的中心点(,x y ),故①正确; ②回归直线在散点图中可能不经过任一样本数据点,故②错误; ③当相关性系数0r >时,则两个变量正相关,故③正确;④如果两个变量的相关性越强,则相关性系数r 就越接近于1或-1,故④错误. 故真命题的个数为2个, 故选B二、填空题6.回归方程ˆˆ 2.50.2x y=+在样本(4,1.2)处的残差为________. 【答案】9-【解析】由题当x =4时,4ˆ 2.50.210.2y=+=⨯, 1.2-10.2=-9所以回归方程ˆˆ 2.50.2x y=+在样本(4,1.2)处的残差为-9. 故填-97.为了解某班学生喜爱打篮球是否与性别有关,对该班50名学生进行了问卷调查,得到了如下的22⨯列联表:则在犯错误的概率不超过________的前提下认为喜爱打篮球与性别有关.附:()()()()()22n ad bcKa b c d a c b d-=++++.【答案】0.005【解析】根据所给的列联表,得到()225020151058.3337.87930202525K⨯-⨯==⨯⨯⨯>∴至少有99.5%的把握说明喜爱打篮球与性别有关,即在犯错误的概率不超过0.005的前提下认为喜爱打篮球与性别有关.故填0.0058.某药厂选取若干名志愿者进行临床试验,所有志愿者的舒张压数据(单位:kPa)的分组区间为[12,13),[13,14),[14,15),[15,16),[16,17),将其按从左到右的顺序分别编号为第一组,第二组,……,第五组,如图是根据实验数据制成的频率分布直方图,已知第一组与第二组共有20人,则第三组中的人数为_________.【答案】18【解析】由直方图可得分布在区间第一组与第二组共有20人,分布在区间第一组与第二组的频率分别为0.24,0.16,设总的人数为n,则200.240.160.4,50.nn=+=∴=所以第3小组的人数为500.36=18⨯人.故填18三、解答题9.某校两个班级100名学生在一次考试中的成绩的频率分布直方图如图所示,其中成绩分组区如下表:(1)求频率表分布直方图中a的值;(2)根据频率表分布直方图,估计这100名学生这次考试成绩的平均分;(3)现用分层抽样的方法从第三、四、五组中随机抽取6名学生,将该样本看成一个总体,从中随机抽取2名,求其中恰有1人的分数不低于90分的概率.【解析】(1)由题意得10a+0.01×10+0.02×10+0.03×10+0.035×10=1,所以a=0.005.(2)由直方图分数在[50,60]的频率为0.05,[60,70]的频率为0.35,[70,80]的频率为0.30,[80,90]的频率为0.20,[90,100]的频率为0.10,所以这100名学生期中考试数学成绩的平均分的估计值为:55×0.05+65×0.35+75×0.30+85×0.20+95×0.10=74.5(3)由直方图,得:第3组人数为0.3×100=30,第4组人数为0.2×100=20人,第5组人数为0.1×100=10人.所以利用分层抽样在60名学生中抽取6名学生,每组分别为:第3组:306360⨯=人,第4组:206260⨯=人,第5组:106160⨯==1人.所以第3、4、5组分别抽取3人、2人、1人.设第3组的3位同学为A1,A2,A3,第4组的2位同学为B1,B2,第5组的1位同学为C1,则从六位同学中抽两位同学有15种可能如下:(A1,A2),(A1,A3),(A2,A3),(B1,B2),(A1,B1),(A1,B2),(A2,B1),(A2,B2),(A3,B1),(A3,B2),(A1,C1),(A2,C1),(A3,C1),(B1,C1),(B2,C1),其中恰有1人的分数不低于90(分)的情形有:(A1,C1),(A2,C1),(A3,C1),(B1,C1),(B2,C1),共5种.所以其中第4组的2位同学至少有一位同学入选的概率为51 153=.10.随着资本市场的强势进入,互联网共享单车“忽如一夜春风来”,遍布了各级城市的大街小巷,为了解我市的市民对共享单车的满意度,某调查机构借助网络进行了问卷调查,并从参与调查的网友中随机抽取了50人进行分析.若得分低于60分,说明不满意,若得分不低于60分,说明满意,调查满意度得分情况结果用茎叶图表示如图1.(1)根据茎叶图找出40岁以上网友中满意度得分的众数和中位数;(2)根据茎叶图完成下面列联表,并根据以上数据,判断是否有99%的把握认为满意度与年龄有关;(3)先采用分层抽样的方法从40岁及以下的网友中选取7人,再从这7人中随机选出2人,将频率视为概率,求选出的2人中至少有1人是不满意的概率.参考格式:22()()()()()n ad bcKa b c d a c b d-=++++,其中n a b c d=+++【解析】(1)由题意可得,40岁以上网友中满意度得分的众数为75,中位数为57.52=.(2)由茎叶图可得22⨯列联表如下:可知2250(2012108) 3.463 6.63528223020k ⨯-⨯=≈<⨯⨯⨯所以没有99%的把握认为满意度与年龄有关.(3)从所选取的40岁以下的网友中,采用分层抽样的方法选取7人,其中满意度为满意的有5人,分别为1A ,2A ,3A ,4A ,5A ,不满意的有2人, 分别为1B ,2B , 所有组合的情况为()12,A A ,()13,A A ,()14,A A ,()15,A A ,()11,A B ,()12,A B ,()23,A A , ()24,A A ,()25,A A ,()21,A B ,()22,A B ,()34,A A , ()35,A A ,()31,A B ,()32,A B ,()45,A A ,()41,A B , ()32,A B ,()51,A B ,()52,A B ,()12,B B ,共有21种.其中选出的2人中至少有1人是不满意的有11种, 故所求的概率1121P =.知能提升一、选择题11.已知,x y 的取值如下表:若依据表中数据所画的散点图中,所有样本点()(,)1,2,3,4,5i i x y i =都在曲线212y x a =+附近波动,则a =( )A .1B .12C .13D .12-【答案】A【解析】设2t x =,则11(014916)6,(1 1.3 3.2 5.68.9)455t y =++++==++++=, 所以点(6,4)在直线12y t a =+上,求出1a =,故选A.12.某运动制衣品牌为了成衣尺寸更精准,现选择15名志愿者,对其身高和臂展进行测量(单位:厘米),左图为选取的15名志愿者身高与臂展的折线图,右图为身高与臂展所对应的散点图,并求得其回归方程为 1.160.5ˆ37yx =-,以下结论中不正确的为( )A .15名志愿者身高的极差小于臂展的极差B .15名志愿者身高和臂展成正相关关系,C .可估计身高为190厘米的人臂展大约为189.65厘米D .身高相差10厘米的两人臂展都相差11.6厘米, 【答案】D【解析】A ,身高极差大约为25,臂展极差大于等于30,故正确;B ,很明显根据散点图像以及回归直线得到,身高矮臂展就会短一些,身高高一些,臂展就长一些,故正确;C ,身高为190厘米,代入回归方程可得到臂展估计值等于189.65厘米,但是不是准确值,故正确;D ,身高相差10厘米的两人臂展的估计值相差11.6厘米,但并不是准确值,回归方程上的点并不都是准确的样本点,故说法不正确. 故选D.二、填空题13.已知一组数据1x ,2x ,3x ,4x ,5x 的方差为2,则数据123x +,223x +,323x +,423x +,523x +的方差为______.【答案】8【解析】设x ,2s 为数据1x ,2x ,3x ,4x ,5x 的平均数,方差,X ,2S 为数据123x +,223x +,323x +,423x +,523x +的平均数,由题意可得方差为()()()222125125x x x x x x ⎡⎤-+-++-=⎣⎦,所以()()()22212510x x x x x x ⎡⎤-+-++-=⎣⎦,()125235235x x x X x ++++⨯==+,()()()222125212323232323235x x x x S x x ⎡⎤+--++--++--=+⎣⎦()()()22225151444x x x x x x ⎡⎤=-+-++-⎣⎦41085=⨯=故填814.如图所示是世界20个地区受教育程度的人口百分比与人均收入的散点图,样本点基本集中在一个条型区域,因此两个变量呈线性相关关系.利用散点图中的数据建立的回归方程为ˆ 3.19388.193yx =+,若受教育的人口百分比相差10%,则其人均收入相差_________.【答案】31.93美元【解析】设所受教育百分比分别为%,%a b ,且10a b -= 根据回归方程为 3.19388.193y x ∧=+, 收入相差大约为:()3.19388.193 3.19388.193 3.1931031.93a b ⨯+-⨯+=⨯=,即受教育的人口百分比相差10%,则其人均收入相差约31.93美元. 故填31.93美元.三、解答题15.BIM指数是用体重公斤数除以身高米数的平方得出的数字,是国际上常用的衡量人体胖瘦程度以及是否健康的一个标准.对于高中男体育特长生而言,当BIM数值大于或等于20.5时,我们说体重较重,当BIM数值小于20.5时,我们说体重较轻,身高大于或等于170cm我们说身高较高,身高小于170cm我们说身高较矮.(1)已知某高中共有32名男体育特长生,其身高与BMI指数的数据如散点图,请根据所得信息,完成下述列联表,并判断是否有95%的把握认为男生的身高对BMI指数有影响.(2)①从上述32名男体育特长生中随机选取8名,其身高和体重的数据如表所示:根据最小二乘法的思想与公式求得线性回归方程为0.8 75.9y x.利用已经求得的线性回归方=-程,请完善下列残差表,并求2R(解释变量(身高)对于预报变量(体重)变化的贡献值)(保留两位有效数字);②通过残差分析,对于残差的最大(绝对值)的那组数据,需要确认在样本点的采集中是否有人为的错误,已知通过重新采集发现,该组数据的体重应该为58(kg).小明重新根据最小二乘法的思想与公式,已算出0.675y x a ∧∧=+,请在小明所算的基础上求出男体育特长生的身高与体重的线性回归方程.参考数据:2222222(0.1)(0.3)(0.9)( 1.5)(0.5)( 2.3)(0.5)8.95+++-+-+-+-=,168=x ,()821226i i y y=-=∑,0.675168113.4⨯=,参考公式:()()221211nii i n ii yy R yy==-=--∑∑,()()()1122211n niii ii i nniii i x x y y x y nx yb x x xnx====---⋅==--∑∑∑∑,a y bx =-,i i i e y bx a =--,22(),()()()()()n ad bc K n a b c d a b c d a c b d -==+++++++. 【解析】(1)由于2232(65615)1603 3.8411220211177⨯-⨯==<<⨯⨯⨯K ,因此没有95%的把握认为男生的身高对BMI 指数有影响.(2)①对编号为8的数据8660.817375.9 3.5e =-⨯+=,完成残差表如下所示:()22228222221(0.1)(0.3)(0.9)( 1.5)(0.5)( 2.3)(0.5)(3.5)21.2iii y y =-=+++-+-+-+-+=∑()()221218821.2110.91226iii i i y y R y y==-=-=-≈-∑∑. 所以解释变量(身高)对于预报变量(体重)变化的贡献值2R 约为0.91. ②由①可知,第八组数据的体重应为58.此时,易知,168=x ,57.5=y ,ˆ57.50.67516855.9a=-⨯=-, 所以重新采集数据后,男体育特长生的身高与体重的线性回归方程为ˆ0.67555.9yx =-.。