当前位置:文档之家› R语言与统计分析第六章习题答案

R语言与统计分析第六章习题答案

R语言与统计分析第六章习题答案

#第六章习题

#6.1

speed<-c(914,920,910,934,953,940,912,924,930) # 方差未知,小样本要

t 分布检验t.test(speed,mu=950,conf.level=0.99)

#6.2 chisq.var.test<-

function(x,var,alpha,alternative="two.sided"){ options(digits=4)

result<-list()

n<-length(x)

v<-var(x) result$var<-v chi2<-(n-1)*v/var result$chi2<-chi2 p<-

pchisq(chi2,n-1) result$p.value<-p if(alternative=="less")

result$p.value<-pchaisq(chi2,n-1,lower.tail=F)

else if (alternative=="two.sider") result$p.value<-2*min(pchaisq(chi2,n-

1),pchaisq(chi2,n-1,lower.tail=F)) result$conf.int<-c(

(n-1)*v/qchisq(alpha/2,df=n-1,lower.tail=F), (n-1)*v/qchisq(alpha/2,df=n-

1,lower.tail=T)

)

result

} x<-c(1.32,1.55,1.36,1.40,1.1)

chisq.var.test(x,0.048A2,0.05,alternative="two.side") #0.95 置信区间

#6.3

install.packages('DAAG') library('DAAG')

x1<-c(5.5,5.6,6.3,4.6,5.3,5.0,6.2,5.8,5.1,5.2,5.9) x2<-

c(3.8,4.3,4.2,4.9,4.5,5.2,4.8,4.5,3.9,3.7,3.6,2.9) z<-data.frame(x1,x2)

onesamp(z,x="x1",y="x2")

#方法二方差相等

x1<-c(5.5,5.6,6.3,4.6,5.3,5.0,6.2,5.8,5.1,5.2,5.9) x2<-

c(3.8,4.3,4.2,4.9,4.5,5.2,4.8,4.5,3.9,3.7,3.6,2.9) var.test(x1,x2)

t<-(mean(x1)-mean(x2))/(sqrt((10*var(x1)+11*var(x2))/21)*sqrt(1/11+1/12))

t

p<-pt(t,df=21)

p

#6.4

A<-c(0.14,0.138,0.143,0.142,0.144,0.137)

B<-c(0.135,0.14,0.142,0.136,0.138,0.130) var.test(A,B)

t.test(A,B,paired=TRUE)

#6.5

prop.test(12,15,p=0.3,correct=TRUE)

binom.test(c(12,3),p=0.3)

统计学原理作业(1)答案

《统计学原理》作业一 一、判断题 1.社会经济统计的研究对象是社会经济现象总体的各个方面。(×) 2.统计调查过程中采用的大量观察法,是指必须对研究对象的所有单位进行调查。(×) 3.总体的同质性是指总体中的各个单位在所有标志上都相同。(×)4.个人的工资水平和全部职工的工资水平,都可以称为统计指标。(×)5.对某市工程技术人员进行普查,该市工程技术人员的工资收入水平是数量标志。(√) 6.社会经济统计学的研究对象是社会经济现象的数量方面,但它在具体研究时也离不开对现象质的认识。(√) 7.品质标志表明单位属性方面的特征,其标志表现只能用文字表现,所以品质标志不能直接转化为统计指标。(√) 8.品质标志说明总体单位的属性特征,质量指标反映现象的相对水平或工作质量,二者都不能用数值表示。(×) 9.某一职工的文化程度在标志的分类上属于品质标志,职工的平均工资在指标的分类上属于质量指标。(√) 10.总体单位是标志的承担者,标志是依附于总体单位的。(√) 二、单项选择 1.社会经济统计的研究对象是(C )。 A、抽象的数量特征和数量关系 B、社会经济现象的规律性 C、社会经济现象的数量特征和数量关系 D、社会经济统计认识过程的规律和方法

2.构成统计总体的各个单位称为(A )。 A、调查单位 B、标志值 C、品质标志 D、总体单位 3.对某城市工业企业未安装设备状况进行普查,总体单位是(B )。 A、工业企业全部未安装设备 B、工业企业每一台未安装设备 C、每个工业企业的未安装设备 D、每一个工业企业 4.标志是说明总体单位特征的名称(C)。 A、它有品质标志值和数量标志值两类 B、品质标志具有标志值 C、数量标志具有标志值 D、品质标志和数量标志都具有标志值5.总体的变异性是指( B )。 A.总体之间有差异B、总体单位之间在某一标志表现上有差异 C.总体随时间变化而变化D、总体单位之间有差异 6.工业企业的设备台数、产品产值是(D )。 A、连续变量 B、离散变量 C.前者是连续变量,后者是离散变量 D、前者是离散变量,后者是连续变量 7.几位学生的某门课成绩分别是57分、68分、78分、89分、96分,“学生成绩”是(B )。 A、品质标志 B、数量标志 C、标志值 D、数量指标 8.在全国人口普查中(B )。 A、男性是品质标志 B、人的年龄是变量 C、人口的平均寿命是数量标志 D、全国人口是统计指标 9.下列指标中属于质量指标的是(B )。 A、社会总产值 B、产品合格率 C、产品总成本 D、人口总数

完整版上海交大统计学原理第二次作业及答案

1.同时抛两枚不同的硬币,恰有一枚正面朝上的概率是()(单选) 选择一项: 炒a. 1 炒b. 1/8 O c. 1/4 同d. 1/2 2.对于连续型数据的分组()选择一项: a.水平法 b.累计法 c.推算法 d.直接法 ) 4.各变量值与其算术平均数的离差值和等于(选择一 项: a.最小值 C b.取大值 c.各变量值的算术平均数 d.零 ) 5.下列统计指数,不属于数量指标指数的有(选择一 项: a.零售价格指数

b. 产量指数 诃c?收购量指数 因d.工资总额指数 6. 以下分组标志中属于品质标志的是()(多选) 选择一项或多项: * a.性别 □ b.年龄 "c.职业 d.月收入 门e.职称 7. 我国2003年国内生产总值比上年增长了9.1%,这个指标是() (单选)选择一项: U a.发展速度 拥b.增长速度 目c.发展水平 d.增长量 8. 统计指数区分数量指标指数与质量指标指数,是依据()(单选) 选择一项: 炒a.对比基期的不同 °b.对象范围的大小 ⑥c.统计指标的性质不同 d.同度量因素的固定与否 9. 我国财政收入,2003年比上年增加2787亿元,这是()(单选)选择一项: 炒a.发展水平 b.增长量

炒a.两个数列的平均数代表性相同 °b.平均数的代表性甲数列高于乙数列 同c.平均数的代表性乙数列高于甲数列 口d.平均数的代表性无法判断 11.全年12个月的季节比率之和应是()(单选) 选择一项: 」a.标准差系数 b.平均差系数 ‘ c.全距 * d.平均差

」a.是不同情况下同一指标对比的比率 □ b.反映现象的强度、密度和普遍程度 巫c. 一般有正指标与逆指标之分 門d.是两个性质不同而有密切联系的总量指标对比的结果 "e. 一般是以有名数表示的,但也有采用千分数等形式表示的 15.下列现象的相关密切程度最高的是()(单选)选择一项: a. 某商店的职工人数与商品销售额之间的相关系数0.87 * b.流通费用水平与利润率之间的相关关系为-0.94 口c.商品销售额与利润率之间的相关系数为0.51 口d.商品销售额与流通费用水平的相关系数为-0.81 16在实验中,两个事件有一个发生时,另一个就不发生,称这两个事件()(单选)选择一项: ⑥a.互斥事件 口b.必然事件 c. 独立事件 d. 不可能事件 17. 两组数据的均值不等,但标准差相等,则()(单选) 选择一项:

应用多元统计分析试题及答案

一、填空题: 1、多元统计分析是运用数理统计方法来研究解决多指标问题的理论和方法. 2、回归参数显著性检验是检验解释变量对被解释变量的影响是否著. 3、聚类分析就是分析如何对样品(或变量)进行量化分类的问题。通常聚类分析分为 Q型聚类和 R型聚类。 4、相应分析的主要目的是寻求列联表行因素A 和列因素B 的基本分析特征和它们的最优联立表示。 5、因子分析把每个原始变量分解为两部分因素:一部分为公共因子,另一部分为特殊因子。 6、若 () (,), P x N αμα ∑=1,2,3….n且相互独立,则样本均值向量x服从的分布 为_x~N(μ,Σ/n)_。 二、简答 1、简述典型变量与典型相关系数的概念,并说明典型相关分析的基本思想。 在每组变量中找出变量的线性组合,使得两组的线性组合之间具有最大的相关系数。选取和最初挑选的这对线性组合不相关的线性组合,使其配对,并选取相关系数最大的一对,如此下去直到两组之间的相关性被提取完毕为止。被选出的线性组合配对称为典型变量,它们的相关系数称为典型相关系数。 2、简述相应分析的基本思想。 相应分析,是指对两个定性变量的多种水平进行分析。设有两组因素A和B,其中因素A包含r个水平,因素B包含c个水平。对这两组因素作随机抽样调查,得到一个rc的二维列联表,记为。要寻求列联表列因素A和行因素B的基本分析特征和最优列联表示。相应分析即是通过列联表的转换,使得因素A

和因素B 具有对等性,从而用相同的因子轴同时描述两个因素各个水平的情况。把两个因素的各个水平的状况同时反映到具有相同坐标轴的因子平面上,从而得到因素A 、B 的联系。 3、简述费希尔判别法的基本思想。 从k 个总体中抽取具有p 个指标的样品观测数据,借助方差分析的思想构造一个线性判别函数 系数: 确定的原则是使得总体之间区别最大,而使每个总体内部的离差最小。将新样品的p 个指标值代入线性判别函数式中求出 值,然后根据判别一定的规则,就可以判别新的样品属于哪个总体。 5、简述多元统计分析中协差阵检验的步骤 第一,提出待检验的假设 和H1; 第二,给出检验的统计量及其服从的分布; 第三,给定检验水平,查统计量的分布表,确定相应的临界值,从而得到否定域; 第四,根据样本观测值计算出统计量的值,看是否落入否定域中,以便对待判假设做出决策(拒绝或接受)。 协差阵的检验 检验0=ΣΣ 0p H =ΣI : /2 /21exp 2np n e tr n λ???? =-?? ? ???? S S 00p H =≠ΣΣI : /2 /2**1exp 2np n e tr n λ???? =-?? ? ???? S S

西南财大版统计学原理统计学作业练习题及答案。

第四章抽样估计 1.某工厂有1 500个工人,用简单随机重复抽样的方法抽出50个工人作为样本,调查其工资水平,如下表: 要求:(1)计算样本平均数和抽样平均误差。(2)以95.45%的可靠性估计该厂工人的月平均工资和工资总额的区间。 2.采用简单随机重复抽样方法,在2 000件产品中抽查200件,其中合格品190件。 要求:(1)计算合格品率及其抽样平均误差。(2)以95.45%的概率保证程度对合格品率和合格品数量进行区间估计。(3)如果极限误差为2.31%,则其概率保证程度是多少? 3.某电子产品使用寿命在3 000小时以下为不合格品,现在用简单随机抽样方法,从 5 000个产品中抽取进行调查.其结果如下: 要求:试根据上述资料:(1)按重复抽样和不重复抽样计算该产品平均寿命的抽样平均误差。(2)按重复抽样和不重复抽样计算该产品合格率的抽样平均误差。(3)根据重复抽样计算的抽样平均误差,以68.27%的概率保证程度对该产品的平均使用寿命和合格品率进行区间估计。 4.某外贸公司出口一种茶叶,规定每包规格不低于150克,现在用不重复抽样的方法抽取其中1%进行检验,其结果如下: 抽查结果统计表 要求:(1)以99.73%的概率估计该批茶叶平均每包重量的范围,以及确定平均重量是否达到规格要求。(2)以同样的概率保证估计该批茶叶合格率范围。

5.某工厂生产一种新型灯泡5000只,随后抽取100只作耐用时间测试。结果表明,平均寿命为4500小时,标准差300小时,试在90%的概率保证下,估计该新式灯泡平均寿命时间,假定概率保证程度提高到95%,允许误差缩小一半,试问应抽取多少只灯泡进行测试。 6.调查一批机械零件合格率。根据过去资料,合格品率曾有过99%、97%、95%三种情况,现在要求误差不超过1%,要求估计的把握程度为95%,问需要抽查多少零件?(提示:总体方差取最大值) 7.某部门对职工进行家庭经济情况调查,取得年度项抽样资料如下,试以90%的概率保证程度,估计该部门职工的家庭月收入。 抽查结果统计表 8.某市有职工10万人,其中:职员4万人,工人6万人,现进行职工收入抽样调查,并划分职员与工人两类进行选样,要先按不同类型抽查40名职员与60名工人,结果如下:要求这次调查的极限误差不超过2元,概率保证程度 95.45%,试按类型抽样组织计算必要的抽样数目。 如果按简单随机抽样组织,试问:(1)同样的?和t,需按抽取多少样本单位数。(2)同样的样本单位数和概率保证程度,则会有多大的极限抽样误差。(3)同样的样本单位数和?应有多大的概率保证程度。 9.从某县的100个村中抽出10村进行各村的全户调查设平均每户饲养家禽35头,每村平均数的方差为16。 要求:(1)以90%的概率估计全县平均每户饲养家禽数。(2)如果极限误差 2.412 ?= x 则其概率保证程度如何?

应用多元统计分析课后答案

应用多元统计分析课后答案 第五章 聚类分析 判别分析和聚类分析有何区别 答:即根据一定的判别准则,判定一个样本归属于哪一类。具体而言,设有n 个样本,对每个样本测得p 项指标(变量)的数据,已知每个样本属于k 个类别(或总体)中的某一类,通过找出一个最优的划分,使得不同类别的样本尽可能地区别开,并判别该样本属于哪个总体。聚类分析是分析如何对样品(或变量)进行量化分类的问题。在聚类之前,我们并不知道总体,而是通过一次次的聚类,使相近的样品(或变量)聚合形成总体。通俗来讲,判别分析是在已知有多少类及是什么类的情况下进行分类,而聚类分析是在不知道类的情况下进行分类。 试述系统聚类的基本思想。 答:系统聚类的基本思想是:距离相近的样品(或变量)先聚成类,距离相远的后聚成类,过程一直进行下去,每个样品(或变量)总能聚到合适的类中。 对样品和变量进行聚类分析时, 所构造的统计量分别是什么简要说明为什么这样构造 答:对样品进行聚类分析时,用距离来测定样品之间的相似程度。因为我们把n 个样本看作p 维空间的n 个点。点之间的距离即可代表样品间的相似度。常用的距离为 (一)闵可夫斯基距离:1/1 ()() p q q ij ik jk k d q X X ==-∑ q 取不同值,分为 (1)绝对距离(1q =) 1 (1)p ij ik jk k d X X ==-∑ (2)欧氏距离(2q =) 2 1/21 (2)()p ij ik jk k d X X ==-∑ (3)切比雪夫距离(q =∞) 1()max ij ik jk k p d X X ≤≤∞=- (二)马氏距离 (三)兰氏距离 2 1()()()ij i j i j d M -'=--X X ΣX X 11()p ik jk ij k ik jk X X d L p X X =-=+∑

统计学作业答案归纳

统计学作业答案归纳 1、据一次抽样调查表明居民每日平均读报时间的95%的置信区间为〔2.2,3.4〕小时,问该次抽样样本平均读报时间t 是多少?若样本量为100,则样本标准差 是多少?若我想将允许误差降为0.4小时,那么在相同的置信水平下,样本容量 应该为多少? 解:样本平均读报时间为:t = 24.32.2+=2.8 由()96 .121002.24.322.24.305.0?-=?-==s n s z E =3.06 2254.006.396.12 2 22205.02=?=?=E s z n 一家调查公司进行一项调查,其目的是为了了解某市电信营业厅大客户对该电信 的服务的满意情况。调查人员随机访问了30名去该电信营业厅办理业务的大客 户,发现受访的大客户中有9名认为营业厅现在的服务质量较两年前好。试在 95%的置信水平下对大客户中认为营业厅现在的服务质量较两年前好的比率进 行区间估计。 4.据某市场调查公司对某市80名随机受访的购房者的调查得到了该市购房 者中本地人购房比率p 的区间估计,在置信水平为10%下,其允许误差E = 0.08。则: (1)这80名受访者样本中为本地购房者的比率是多少? (2)若显著性水平为95%,则要保持同样的精度进行区间估计,需要调查 多少名购房者。 解:这是一个求某一属性所占比率的区间估计的问题。根据已知n =30,2 /αz =1.96,根据抽样结果计算出的样本比率为%3030 9?==p 。

总体比率置信区间的计算公式为: ()n p p z p ?1??2/-±α 计算得: ()n p p z p ?1??2/-±α=30%()30 %301%3096.1-??± =(13.60%,46.40%) 5、某大学生记录了他一个月31天所花的伙食费,经计算得出了这个月平均每天 花费10.2元,标准差为2.4元。显著性水平为在5%,试估计该学生每天平 均伙食费的置信区间。 解:由已知:=x 10.2,s =2.4,96.1025.0=z ,则其置信区间为: 314 .296.12.10025.0?±=±n s z x =〔9.36,11.04〕。 该学生每天平均伙食费的95%的置信区间为9.36元到11.04元。 7、某电子邮箱用户一周内共收到邮件56封,其中有若干封是属于广告邮件,并 且根据这一周数据估计广告邮件所占比率的95%的置信区间为〔8.9%, 16.1%〕。问这一周内收到了多少封广告邮件。若计算出了20周平均每周收 到48封邮件,标准差为9封,则其每周平均收到邮件数的95%的置信区间 是多少?(设每周收到的邮件数服从正态分布) 解:本周收到广告邮件比率为:p =2 161.0089.0+=0.125 收到广告邮件数为:n ×p =56×0.125=7封 根据已知:x =48,n =20,s =9,093.2)19(025.0=t

统计学原理作业1答案

统计学原理作业1答案 统计学原理作业1 第一章~第三章 一、判断题 1、社会经济统计工作的研究对象是社会经济现象总体的数量方面。(×) 2、 统计调查过程中采用的大量观察法,是指必须对研究对象的所有单位进行调查。(×) 、全面调查包括普查和统计报表。(?) 3 4、统计分组的关键是确定组限和组距。(×) 5、在全国工业普查中,全国企业数是统计总体,每个工业企业是总体单位。(×) 6、我国的人口普查每十年进行一次,因此这是一种连续性调查方法。(?) 7、对全国各大型钢铁生产基地的生产情况进行调查,以掌握全国钢铁生产的基本 情况。这种调查属于非全面调查。(?) 8、对某市工程技术人员进行普查,该市工程技术人员的工资收水平是数量标志。(?) 9、对我国主要粮食作物产区进行调查,以掌握全国主要粮食作物生产的 基本情况,这种调查是重点调查。(?) 10、我国人口普查的总体单位和调查单位都是第一个人,而填报单位是户。(?) 二、单项选题 1、设某地区有670家工业企业,要研究这些企业的产品生产情况,总体单位 是(C) A、每个工业企业 B、670家工业企业 C、每一件产品 D、全部工业产品 2、某市工业企业2003年生产经营成果年报呈报时间规定在2004年1月31日,则调查时限 ) 为(B A、一日 B、一个月 C、一年 D、一年零一个月

3、在全国人口普查中(B) A、男性是品质标志 B、人的年龄是变量 C、人口的平均寿命是数量标志 D、人国人口是统计指标 4、某机床厂要统计该企业的自动机床的产量和产值,上述两上变量是(D) A、二者均为离散变量 B、二者均为连续变量 C、前者为连续变量,后者为离散变量 D、前者为离散变量,后者为连续变量 5、下列调查中,调查单位与填报单位一致的是(D) A、企业设备调查 B、人口普查 C、农村耕地调查 D、工业企业现状调查 6、抽样调查与重点调查的主要区别是(D) A、作用不同 B、组织方式不同 C、灵活程度不同 D、选取调查单位的方法不同 7、下列调查属于不连续调查的是(A) A、每月统计商品库存额 B、每旬统计产品产量 C、每月统计商品的销售额 D、每季统计进口贸易额 8、全面调查与非全面调查的划分是以(C) A、时间是否连续来划分的 B、最后取得的资料是否全面完全来划分 C、调查对象所包括的单位是否完全来划分的 D、调查组织规模的大小来划分 9、下列分组中哪个是按品质标志分组(B) A、企业按年生产能力分组 B、产品按品种分组 C、家庭按年收入水平分组 D、人口按年龄分组 三、多项选择题 1、总体单位是总体的基本组成单位,是标志的直接承担者,因此(A,D) A、在国有企业这个总体下,每个国有企业就是总体单位 B、在工业总产值这个总体下,单位总产值就是总体单位 C、在全国总人口这个总体下,一个省的总人口就是总体单位

03第三篇 多元统计分析作业题

第三篇 多元统计分析作业题 1 证明题 1)已知ψ==A X E X Z T T T ,这里用到关系1-ψ=E A 。以二变量为例证明: 12*-Λ=ψ=A X A X Z T T T 1)(-=T T A X 。 式中X 为标准化原始变量矩阵,A 为载荷矩阵,Z 为非标准化主成分得分,Z *为标准化的因子得分,E 为单位化特征向量构成的矩阵即正交矩阵,Ψ为特征根的平方根的倒数构成的对角阵,Λ为特征根构成的对角阵,对于二变量有 ?????? ??=ψ21 /10 /1λλ, ?? ? ???=Λ21 00λλ. 2)对于二变量因子模型,我们有 ?? ?++=++=222221122 112211111εεu f a f a x u f a f a x . 试以 x 1为例证明1 2 22==+j x j j u h σ ,这里∑== p k kj j a h 1 2 22 21 211a a +=。 2 计算题 1)现有一组古生物腕足动物贝壳标本的两个变量:长度x 1和宽度x 2。所测数据如下(表2.1)。 要求: ① 利用Excel 对数据进行主成分分析。 ② 借助SPSS 对该数据进行主成分分析,并计算结果与Excel 的计算结果进行对比,理解各个表格所给参数的含义。 ③ 用本例数据验证证明题?的推导结果。 表2.1 古生物腕足动物贝壳标本数据 样品编号 长度x 1 宽度x 2 样品编号 长度x 1 宽度x 2 1 3 2 14 12 10 2 4 10 15 12 11 3 6 5 16 13 6 4 6 8 17 13 14 5 6 10 18 13 15 6 7 2 19 13 17 7 7 13 20 14 7 8 8 9 21 15 13 9 9 5 22 17 13

1统计学原理作业1答案

统计学原理作业1 第一章-第三章 一、判断题 1、社会经济统计工作的研究对象是社会经济现象总体的数量方面。(×) 2、统计调查过程中采用的大量观察法,是指必须对研究对象的所有单位进行调查。( × ) 3、全面调查包括普查和统计报表。( √ ) 4、统计分组的关键是确定组限和组距(×) 5、在全国工业普查中,全国企业数是统计总体,每个工业企业是总体单位。(×) 6、我国的人口普查每十年进行一次,因此它是一种连续性调查方法。(×) 7、对全同各大型钢铁生产基地的生产情况进行调查,以掌握全国钢铁生产的基本情况。这种调查属于非全面调查。(√) 8、对某市工程技术人员进行普查,该市工程技术人员的工资收入水平是数量标志。(√) 9、对我国主要粮食作物产区进行调查,以掌握全国主要粮食作物生长的基本情况,这种调查是重点调查。(√) 10、我国人口普查的总体单位和调查单位都是每一个人,而填报单位是户。(√) 二、单项选择题 1、设某地区有670家工业企业,要研究这些企业的产品生产情况,总体单位是(C ) A、每个工业企业; B、670家工业企业; C、每一件产品; D、全部工业产品 2、某市工业企业2003年生产经营成果年报呈报时间规定在2004年1月31日,则调查期限为(B )。 A、一日 B、一个月 C、一年 D、一年零一个月 3、在全国人口普查中(B )。 A、男性是品质标志 B、人的年龄是变量 C、人口的平均寿命是数量标志 D、全国人口是统计指标 4、某机床厂要统计该企业的自动机床的产量和产值,上述两个变量是( D )。 A、二者均为离散变量 B、二者均为连续变量

C、前者为连续变量,后者为离散变量 D、前者为离散变量,后者为连续变量 5、下列调查中,调查单位与填报单位一致的是( D ) A、企业设备调查 B、人口普查 C、农村耕地调查 D、工业企业现状调查 6、抽样调查与重点调查的主要区别是( D )。 A、作用不同 B、组织方式不同 C、灵活程度不同 D、选取调查单位的方法不同 7、下列调查属于不连续调查的是( A )。 A、每月统计商品库存额 B、每旬统计产品产量 C、每月统计商品销售额 D、每季统计进出口贸易额 8、全面调查与非全面调查的划分是以( C ) A、时间是否连续来划分的; B、最后取得的资料是否全面来划分的; C、调查对象所包括的单位是否完全来划分的; D、调查组织规模的大小来划分的 9、下列分组中哪个是按品质标志分组( B ) A、企业按年生产能力分组 B、产品按品种分组 C、家庭按年收入水平分组 D、人口按年龄分组 三、多项选择题 1、总体单位是总体的基本组成单位,是标志的直接承担者。因此( ABD ) A、在国营企业这个总体下,每个国营企业就是总体单位; B、在工业总产值这个总体下,单位总产值就是总体单位; C、在全国总人口这个总体下,一个省的总人口就是总体单位; D、在全部工业产品这个总体下,每一个工业产品就是总体单位; E、在全部固定资产这一总体下,每个固定资产的价值就是总体单位。 2、在对工业企业生产设备的调查中( BCE ) A、全部工业企业是调查对象; B、工业企业的全部生产设备是调查对象; C、每台生产设备是调查单位; D、每台生产设备是填报单位; E、每个工业企业是填报单位 3、对连续变量与离散变量,组限的划分在技术上有不同要求,如果对企业按工人人数分组,正确的方法应是( ACE ) A、300人以下,300-500人 B、300人以下,300-500人(不含300)

统计学原理第三章习题答案

一. 判断题部分 1 : 对统计资料进行分组的目的就是为了区分各组单位之间质的不同。 (×) 2: 统计分组的关键问题是确定组距和组数。 ( × ) 3: 组中值是根据各组上限和下限计算的平均值,所以它代表了每一组的平 均分配次数。 ( × ) 3 : 分配数列的实质是把总体单位总量按照总体所分的组进行分配。 ( ∨ ) 4: 次数分配数列中的次数,也称为频数。频数的大小反映了它所对应的标 志值在总体中所起的作用程度。 ( ∨ ) 5: 某企业职工按文化程度分组形成的分配数列是一个单项式分配数列。 (×) 6: 连续型变量和离散型变量在进行组距式分组时,均可采用相邻组组距重 叠的方法确定组限。 ( ∨ ) 7: 对资料进行组距式分组,是假定变量值在各组内部的分布是均匀的,所 以这种分组会使资料的真实性受到损害。 ( ∨ ) 8: 任何一个分布都必须满足:各组的频率大于零,各组的频数总和等于 或 100%。( × ) 9: 按数量标志分组形成的分配数列和按品质标志分组形成的分配数列,都 可称为次数分布。 ( ∨ ) 10:按数量标志分组的目的,就是要区分各组在数量上的差异。 ( 11:统计分组以后,掩盖了各组内部各单位的差异,而突出了各组之间单位 的差异。( ∨ ) 12:分组以后,各组的频数越大,则组的标志值对于全体标志水平所起的作第三章 统计资料整理 ×)

用也越大;而各组的频率越大,则组的标志值对全体标志水平所起的作用越 小。( × ) .单项选择题部分 2: 在组距分组时,对于连续型变量,相邻两组的组限( A )。 A 、 必须是重叠的 B 、必须是间断的 C 、可以是重叠的,也可以是间断的 D 、必须取整数 3: 下列分组中属于按 品质标志分组 的是( B )。 A 、学生按考试分数分组 B 、产品按品种分组 C 、企业按计划完成程度分组 D 、家庭按年收入分组 4 : 有一个学生考试成绩为70分,在统计分组中,这个变量值应归入 ( B )。 A 、60---70 分这一组 B 、 70---80 分这一组 C 、60— 70或 70—80两组都可以 D 、作为上限的那一组 5: 某主管局将下属企业先按轻、重工业分类,再按企业规模分组,这样的 分组属于( B )。 A 、简单分组 B 、复合分组 C 、分析分组 D 、结构分组 6: 简单分组和复合分组的区别在于( B )。 A 、选择的分组标志的性质不同 B 、选择的分组标志多少不同 1: 统计整理的关键在( B A 、对调查资料进行审核 C 、对调查资料进行汇总 )。 B 、 对调查资料进行统计分组 D 、编制统计表

matlab与应用多元统计分析

多元统计分析中的应用研究 , 摘要:许多实际问题往往需要对数据进行统计分析,建立合适的统计模型,过去一般采用SAS 、SPSS软件分析,本文给出 Matlab软件在多元统计分析上的应用, 主要介绍Matlab 在聚类分析、判别分析、主成份分析上的应用,文中均给以实例, 结果令人满意。 关键词:Matlab软件;聚类分析;主成份分析 Research for application of Multivariate Statistical Analysis Abstract:Many practice question sometimes need Statistical Analysis to data.,and establish appropriate Statistical model SAS and SPSS software were commonly used in foretime ,this paper give the application of Matlab software in Multivariate Statistical Analysis,mostly introduce the application of Matlab software in priciple component analysis and cluster analysis and differentiate analysis.The example are given in writing and the result are satisfaction. Key words: Matlab software; cluster analysis; priciple component analysis 0 引言 许多实际问题往往需要对数据进行多元统计分析, 建立合适的模型, 在多元统计分析方面, 常用的软件有SAS 、SPSS 、S-PLUS等。我们在这里给出Matlab在多元统计分析上的应用, 在较早的版本中, 统计功能不那么强大, 而在Matlab6.x版本中, 仅在统计工具中的功能函数就达200多个, 功能已足以赶超任何其他专用的统计软件,在应用上Matlab具有其他软件不可比拟的操作简单,接口方便, 扩充能力强等优势, 再加上Matlab的应用范围广泛, 因此可以预见其在统计应用上越来越占有极其重要的地位,下面用实例给出Matlab 在聚类分析、主成份分析上的应用。 1 聚类分析 聚类分析法是一门多元统计分类法,其目的是把分类对象按一定规则分成若干类,所分成的类是根据数据本身的特征确定的。聚类分析法根据变量(或样品或指标)的属性或特征的相似性,用数学方法把他们逐步地划类,最后得到一个能反映样品之间或指标之间亲疏关系的客观分类系统图,称为谱系聚类图。 聚类分析的步骤有:数据变换,计算n个样品的两两间的距离,先分为一类,在剩下的n-1个样品计算距离,按照不同距离最小的原则,增加分类的个数,减少所需要分类的样品的个数,循环进行下去,直到类的总个数为1时止。根

统计学课后作业答案

统计学课后作业答案

4.2 随机抽取25个网络用户,得到他们的年龄数据如下: 19 15 29 25 24 23 21 38 22 18 30 20 19 19 16 23 27 22 34 24 41 20 31 17 23 要求;(1)计算众数、中位数: 1、排序形成单变量分值的频数分布和累计频数分布: 网络用户的年龄 从频数看出,众数Mo有两个:19、23;从累计频数看,中位数Me=23。 (2)根据定义公式计算四分位数。Q1位置=25/4=6.25,因此Q1=19,Q3位置=3×25/4=18.75,因此Q3=27,或者,由于25 和27都只有一个,因此Q3也可等于25+0.75×2=26.5。 (3)计算平均数和标准差;Mean=24.00;Std. Deviation=6.652 (4)计算偏态系数和峰态系数:Skewness=1.080;Kurtosis=0.773 (5)对网民年龄的分布特征进行综合分析:分布,均值=24、标准差=6.652、呈右偏分布。如需看清楚分布形态,需要进行分组。 为分组情况下的直方图:

为分组情况下的概率密度曲线:分组: 1、确定组数: () lg25 lg() 1.398 111 5.64 lg(2)lg20.30103 n K=+=+=+=,取k=6 2、确定组距:组距=( 最大值- 最小值)÷组数=(41-15)÷6=4.3,取5 3、分组频数表 网络用户的年龄(Binned) 分组后的均值与方差:

Kurtosis 1.302 分组后的直方图: 组中值 50.00 45.00 40.00 35.00 30.00 25.00 20.00 15.00 10.00 F r e q u e n c y 10 8 6 4 2 Mean =23.30 Std. Dev. =7.024 N =25 4.11 对10名成年人和10名幼儿的身高进行抽样调查,结果如下: 成年组 166 169 l72 177 180 170 172 174 168 173 幼儿组 68 69 68 70 7l 73 72 73 74 75 要求:(1)如果比较成年组和幼儿组的身高差异,你会采用什么样的统计量?为什么? 均值不相等,用离散系数衡量身高差异。 (2)比较分析哪一组的身高差异大? 成年组 幼儿组 平均 172.1 平均 71.3 标准差 4.201851 标准差 2.496664 离散系数 0.024415 离散系数 0.035016 幼儿组的身高差异大。 7.6利用下面的信息,构建总体均值μ的置信区间: 1) 总体服从正态分布,且已知σ = 500,n = 15, =8900,置信水平为95%。 解: N=15,为小样本正态分布,但σ已知。则1-α=95%, 。其置信区间公式为 ∴置信区间为:8900±1.96×500÷√15=(8646.7 , 9153.2) 2) 总体不服从正态分布,且已知σ = 500,n = 35, =8900,置信水平为95%。 解:为大样本总体非正态分布,但σ已知。则1-α=95%, 。其置信区间公式为 2 α() 28.109,44.10192.336.10525 10 96.136.1052=±=?±=±n z x σ αx x 2 α() 28.109,44.10192.336.10525 1096.136.1052=±=?±=±n z x σ α

《统计学原理》形考作业参考答案

《统计学原理》作业(一) (第一~第三章) 一、判断题 1、社会经济统计工作的研究对象是社会经济现象总体的数量方面。(√) 2、统计调查过程中采用的大量观察法,是指必须对研究对象的所有单位进行调查。( × ) 3、全面调查包括普查和统计报表。(× ) 4、统计分组的关键是确定组限和组距(×) 5、在全国工业普查中,全国企业数是统计总体,每个工业企业是总体单位。(×) 6、我国的人口普查每十年进行一次,因此它是一种连续性调查方法。(×) 7、对全国各大型钢铁生产基地的生产情况进行调查,以掌握全国钢铁生产的基本情况。这种调查属于非全面调查。(√) 8、对某市工程技术人员进行普查,该市工程技术人员的工资收入水平是数量标志。(√) 9、对我国主要粮食作物产区进行调查,以掌握全国主要粮食作物生长的基本情况,这种调查是重点调查。(√) 10、我国人口普查的总体单位和调查单位都是每一个人,而填报单位是户。(√) 二、单项选择题 1、设某地区有670家工业企业,要研究这些企业的产品生产情况,总体单位是(C ) A、每个工业企业;B、670家工业企业;C、每一件产品;D、全部工业产品 2、某市工业企业2003年生产经营成果年报呈报时间规定在2004年1月31日,则调查期限为(B)。 A、一日 B、一个月 C、一年 D、一年零一个月 3、在全国人口普查中(B)。 A、男性是品质标志 B、人的年龄是变量 C、人口的平均寿命是数量标志 D、全国人口是统计指标 4、某机床厂要统计该企业的自动机床的产量和产值,上述两个变量是(D)。 A、二者均为离散变量 B、二者均为连续变量 C、前者为连续变量,后者为离散变量 D、前者为离散变量,后者为连续变量 5、下列调查中,调查单位与填报单位一致的是( D ) A、企业设备调查 B、人口普查 C、农村耕地调查 D、工业企业现状调查 6、抽样调查与重点调查的主要区别是(D)。 A、作用不同 B、组织方式不同 C、灵活程度不同 D、选取调查单位的方法不同 7、下列调查属于不连续调查的是(A)。 A、每月统计商品库存额 B、每旬统计产品产量 C、每月统计商品销售额 D、每季统计进出口贸易额 8、全面调查与非全面调查的划分是以( C ) A、时间是否连续来划分的 B、最后取得的资料是否完全来划分的 C、调查对象所包括的单位是否完全来划分的 D、调查组织规模的大小划分的 9、下列分组中哪个是按品质标志分组(B) A、企业按年生产能力分组B、产品按品种分组C、家庭按年收入水平分组D、人口按年龄分组 三、多项选择题 1、总体单位是总体的基本组成单位,是标志的直接承担者。因此(A、D) A、在国营企业这个总体下,每个国营企业就是总体单位; B、在工业总产值这个总体下,单位总产值就是总体单位; C、在全国总人口这个总体下,一个省的总人口就是总体单位; D、在全部工业产品这个总体下,每一个工业产品就是总体单位; E、在全部固定资产这一总体下,每个固定资产的价值就是总体单位。 2、在对工业企业生产设备的调查中(B、C、E) A、全部工业企业是调查对象;B、工业企业的全部生产设备是调查对象; C、每台生产设备是调查单位;D、每台生产设备是填报单位;E、每个工业企业是填报单位 3、对连续变量与离散变量,组限的划分在技术上有不同要求,如果对企业按工人人数分组,正确的方法应是

统计学作业答案...doc

1. 一家调查公司进行一项调查,其目的是为了了解某市电信营业厅大客户对该 电信的服务的满意情况。调查人员随机访问了30名去该电信营业厅办理业务 的大客户,发现受访的大客户中有9名认为营业厅现在的服务质量较两年前 好。试在95%的置信水平下对大客户中认为营业厅现在的服务质量较两年前 好的比率进行区间估计。 4.据某市场调查公司对某市80名随机受访的购房者的调查得到了该市购房 者中本地人购房比率p 的区间估计,在置信水平为10%下,其允许误差E = 0.08。则: (1)这80名受访者样本中为本地购房者的比率是多少? (2)若显著性水平为95%,则要保持同样的精度进行区间估计,需要调查 多少名购房者。 解:这是一个求某一属性所占比率的区间估计的问题。根据已知n =30,2 /αz =1.96,根据抽样结果计算出的样本比率为%30309?==p 。 总体比率置信区间的计算公式为: ()n p p z p ?1??2/-±α 计算得: ()n p p z p ?1??2/-±α=30%()30 %301%3096.1-??± =(13.60%,46.40%) 5、某大学生记录了他一个月31天所花的伙食费,经计算得出了这个月平均每天 花费10.2元,标准差为2.4元。显著性水平为在5%,试估计该学生每天平 均伙食费的置信区间。 解:由已知:=x 10.2,s =2.4,96.1025.0=z ,则其置信区间为: 314 .296.12.10025.0?±=±n s z x =〔9.36,11.04〕。 该学生每天平均伙食费的95%的置信区间为9.36元到11.04元。

6、据一次抽样调查表明居民每日平均读报时间的95%的置信区间为〔2.2,3.4〕 小时,问该次抽样样本平均读报时间t 是多少?若样本量为100,则样本标准 差是多少?若我想将允许误差降为0.4小时,那么在相同的置信水平下,样 本容量应该为多少? 解:样本平均读报时间为:t = 24.32.2+=2.8 由()96 .121002.24.322.24.305.0?-=?-==s n s z E =3.06 2254 .006.396.122 22205.02=?=?=E s z n 7、某电子邮箱用户一周内共收到邮件56封,其中有若干封是属于广告邮件,并 且根据这一周数据估计广告邮件所占比率的95%的置信区间为〔8.9%, 16.1%〕。问这一周内收到了多少封广告邮件。若计算出了20周平均每周收 到48封邮件,标准差为9封,则其每周平均收到邮件数的95%的置信区间 是多少?(设每周收到的邮件数服从正态分布) 解:本周收到广告邮件比率为:p =2 161.0089.0+=0.125 收到广告邮件数为:n ×p =56×0.125=7封 根据已知:x =48,n =20,s =9,093.2)19(025.0=t ()199 093.24819025.0?±=±n s t x =[43.68,52.32] 8、为了解某银行营业厅办理某业务的办事效率,调查人员观察了该银行营业厅 办理该业务的柜台办理每笔业务的时间,随机记录了15名客户办理业务的时间,测得平均办理时间为t =12分钟,样本标准差为s =4.1分钟,则: (1)其95%的置信区间是多少? (2)若样本容量为40,而观测的数据不变,则95%的置信区间又是多少? 解:(1)根据已知有()145.214025.0=t ,n =15,t =12,s =4.1。 置信区间为:()151 .4145.21214025.0?±=±n s t t =〔9.73,14.27〕

《统计学原理》作业四答案

《统计学原理》作业(四) (第八~第九章) 一、判断题 1、数量指标指数反映总体的总规模水平,质量指标指数反映总体的相对水平或平均水平( × )。 2、平均指数也是编制总指数的一种重要形式,有它的独立应用意义。(√ ) 3、因素分析内容包括相对数和平均数分析。( × ) 4、发展水平就是动态数列中的每一项具体指标数值,它只能表现为绝对数。(× ) 5、若将2000-2005年末国有企业固定资产净值按时间先后顺序排列,此种动态数列称为时点数列。 (√ ) 6、定基发展速度等于相应各个环比发展速度的连乘积.所以定基增长速度也等于相应各个环比增长速度积。( × ) 7、发展速度是以相对数形式表示的速度分析指标,增长量是以绝对数形式表示的速度分析指标。(√ ) 8、数量指标作为同度量因素,时期一般固定在基期(×) 二、单项选择题 1、统计指数划分为个体指数和总指数的依据是 ( A ) 。 A 、反映的对象范围不同 B 、指标性质不同 C 、采用的基期不同 D 、编制指数的方法不同 2、数量指标指数和质量指标指数的划分依据是 ( A )。 A 、指数化指标的性质不同 B 、所反映的对象范围不同 C 、所比较的现象特征不同 D 、编制指数的方法不同 3、编制总指数的两种形式是( B )。 A 、数量指标指数和质量指标指数 B 、综合指数和平均数指数 C 、算术平均数指数和调和平均数指数 D 、定基指数和环比指数 4、销售价格综合指数 ∑∑0 1 11p q p q 表示( C )。 A 、综合反映多种商品销售量变动程度 B 、综合反映多种商品销售额变动程度 C 、报告期销售的商品,其价格综合变动的程度 D 、基期销售的商品,其价格综合变动程度 5、在销售量综合指数 ∑∑0 01p q p q 中, 00 1 p q p q ∑∑-表示 ( B )。 A 、商品价格变动引起销售额变动的绝对额

川农《统计学(本科)》17年3月在线作业100分答案

《统计学(本科)》17年3月在线作业 一、单选题: 1.序时平均数与一般(静态)平均数相比较,它的特点在于( ) (满分:5) A. 均抽象了各单位的差异 B. 二者可根据同一数列资料计算 C. 序时平均数表明现象在某—段时间内的平均发展水平,一般平均数表明现象在某一具体历史条件下的平均水平 D. 严格说来,序时平均数不能算为平均指标 正确答案:C 2.调查某市职工家庭的生活状况,调查对象是( ) (满分:5) A. 所有职工 B. 职工家庭 C. 职工 D. 该市所有的职工家庭户 正确答案:D 3.权数本身对加权算术平均数的影响,决定于( ) (满分:5) A. 权数所在组标志值的数值大小 B. 权数的绝对数大小 C. 各组单位数占总体单位数的比重大小 D. 总体单位数的多少 正确答案:C 4.经常性调查与—次性调查是按( )划分的 (满分:5) A. 调查组织形式 B. 调查时间长短 C. 调查时间是否连续 D. 资料收集方式 正确答案:C 5.鉴别计算算术平均数的方法是否正确的标准,是其公式应符合( ) (满分:5) A. 标志总量除以总体总量 B. 总体总量除以标志总量 C. 标志总量乘以总体总量 D. 标志总量开项数方根 正确答案:A 6.、统计中广泛应用大量观察法,是因为( ) (满分:5) A. 只有进行大量观察,才能排除偶然因素的影响而把握现象的本质和规律 B. 大量观察法是一种有效的综合分析法 C. 大量观察法可以研究总体的内部结构 D. 大量观察法可以分析现象间的联系 正确答案:A 7.某连续变量数列,其末组为开口组,下限为500。又知其邻组的组中值为480,则末组组中值为( ) (满分:5) A. 520 B. 510

相关主题
文本预览
相关文档 最新文档