统计学课后题
- 格式:doc
- 大小:60.00 KB
- 文档页数:7
《统计学》课后题答案第一章导论一、选择题1.C2.A3.C4.C5.C6.B7.A8.D9.C 10.D 11.A 12.C 13.C 14.A 15.B 16.A 17.C 18.B 19.D 20.A 21.D 22. D23.B 24.C 25.A 26.A 27.A 28.B 29.A 30.D 31.C 32.A 33.B第二章数据的收集一、选择题1.A2.B3.A4.D5.B6.C7.D8.D9.D 10.C 11.C 12.A 13.D 14.D 15.C 16.A 17.D 18.C 19.B 20.B 21.A 22.B 23.C 24.A 25.B 26.B 27.A 28.B 29.C 30.C (A)二、判断题1.∨2.∨3.×4. ∨5. ×6. ×7. ∨8. ×9. ×10. ×第三章数据整理与显示一、选择题CABCD CBBAB BACBD DDBC第四章数据分布特征的测度一、选择题1.A2.C3.B4.C5.D6.D7.A8.B9.A 10.B 11.A 12.D 13.C 14.C 15.D 16.A 17.A 18.B 19.A 20.B 21.A 22.A 23.B 24.C 25.C 26.D 27.D 28.A 29.D 30.C 31.C 32.D二、判断题1. ×2. ∨3. ×4. ×5. ×6. ×7. ∨8. ×9. × 10. ∨ 11. ∨ 12. ×四、计算题1. 11399073.8954ki ii kii x fx f=====∑∑甲11.96σ===甲73.89100%100% 6.18%11.96x σν=⨯=⨯=甲73.8100%100%7.43%9.93x σν=⨯=⨯=乙甲的代表性强2. 10.2510.966ki ii kii x fx f====∑∑0.250.056σ==0.250.056100%100% 5.834%0.966xσν=⨯=⨯= 1114.534ki ii kii x fx f====∑∑10.1295σ==10.1295100%100% 2.857%4.534xσν=⨯=⨯=该教练的说法不成立。
版权归wagxjysys所有违者必究第1章绪论1.什么是统计学?怎样理解统计学与统计数据的关系?2.试举出日常生活或工作中统计数据及其规律性的例子。
3..一家大型油漆零售商收到了客户关于油漆罐分量不足的许多抱怨。
因此,他们开始检查供货商的集装箱,有问题的将其退回。
最近的一个集装箱装的是2 440加仑的油漆罐。
这家零售商抽查了50罐油漆,每一罐的质量精确到4位小数。
装满的油漆罐应为4.536 kg。
要求:(1)描述总体;(2)描述研究变量;(3)描述样本;(4)描述推断。
答:(1)总体:最近的一个集装箱内的全部油漆;(2)研究变量:装满的油漆罐的质量;(3)样本:最近的一个集装箱内的50罐油漆;(4)推断:50罐油漆的质量应为4.536×50=226.8 kg。
4.“可乐战”是描述市场上“可口可乐”与“百事可乐”激烈竞争的一个流行术语。
这场战役因影视明星、运动员的参与以及消费者对品尝试验优先权的抱怨而颇具特色。
假定作为百事可乐营销战役的一部分,选择了1000名消费者进行匿名性质的品尝试验(即在品尝试验中,两个品牌不做外观标记),请每一名被测试者说出A品牌或B品牌中哪个口味更好。
要求:(1)描述总体;(2)描述研究变量;(3)描述样本;(4)一描述推断。
答:(1)总体:市场上的“可口可乐”与“百事可乐”(2)研究变量:更好口味的品牌名称;(3)样本:1000名消费者品尝的两个品牌(4)推断:两个品牌中哪个口味更好。
第2章统计数据的描述——练习题●1.为评价家电行业售后服务的质量,随机抽取了由100家庭构成的一个样本。
服务质量的等级分别表示为:A.好;B.较好;C.一般;D.差;E.较差。
调查结果如下:B EC C AD C B A ED A C B C DE C E EA DBC C A ED C BB ACDE A B D D CC B C ED B C C B CD A C B C DE C E BB EC C AD C B A EB ACDE A B D D CA DBC C A ED C BC B C ED B C C B C(1) 指出上面的数据属于什么类型;(2)用Excel制作一张频数分布表;(3) 绘制一张条形图,反映评价等级的分布。
1.判断题(把" √"或" Ⅹ"填在题后的括号里)(1)重复抽样的抽样误差一定大于不重复抽样的抽样误差。
(Ⅹ)(2)在抽样推断中,全及总体指标值是确定的、唯一的,而样本指标是一个随机变量。
(√)(3)在缺少总体方差的资料时,也可以用样本方差资料来代替,以计算抽样误差。
(√)(4)在其他条件不变的情况下,提高抽样估计的可靠程度,则降低了抽样估计的精确程度。
(√)(5)抽样估计的优良标准有三个:无偏性、可靠性和一致性。
(Ⅹ)(6)总体参数区间估计必须具备三个要素,即估计值、抽样误差范围和抽样误差的概率度。
(√)2.单选题(1)在抽样调查中,无法避免的误差是(D)A.登记性误差B.系统性误差C.极限误差D.随机误差(2)抽样调查所必须遵循的基本原则是(B)A.准确性原则B.随即原则C.可靠性原则D.灵活性原则。
(3)某工厂连续生产,在一天中每隔1h抽出10min的产品进行检验,这种抽查方式是(B)A.简单随机抽样B.等距抽样C.分层抽样D.整群抽样(4)在简单随机抽样条件下,当抽样平均误差缩小一半时,样本单位数应为原来的。
CA.2倍B.3倍C.4倍D.1/4倍(5)反映抽样指标与全及总体指标之间抽样误差的可能范围的指标是(C)A.概率度 B.抽样误差系数 C.抽样平均误差 D.抽样极限误差。
(6)在抽样推断中,样本容量(D)A.越少越好B.越多越好C.取决于统一的抽样比例D.取决于对抽样推断可靠性的要求3多选题(1)抽样法的基本特点有(ACDE)A.根据部分实际资料对全部总体的数量特征作出估计B.深入研究某些复杂的专门问题 C.按随机原则从全部总体中抽选样本单位 D.调查单位少,调查范围小,了解总体基本情况 E.抽样推断的抽样误差可以事先计算并加以控制(2)抽样估计中的抽样误差(ACE)A.是不可避免要产生的B.是可以通过改进调查方式来消除的C.是可以事先计算出来的D.是只能在调查结束后才能计算的E.其大小是可以控制的(3)在抽样推断中ABD)A.全及总体是唯一确定的B.总体参数只能有一个C.统计量是唯一确定的D.统计量是随机的E.总体参数是随机的(4)要增大抽样估计的置信程度,可采用的方法有(CE)A.增加样本容量B.缩小抽样误差范围C.扩大抽样误差范围D.提高估计精确度E.降低估计精确度(5)从总体中抽取样本单位的具体方法有(ABCD)A.简单随机抽样B.重复抽样C.不重复抽样D.等距抽样E.非概率抽样(6)抽样推断的组织形式有(CDEF)A.重复抽样B.不重复抽样C.随机抽样D.分层抽样E.等距抽样F.整群抽样4计算题(1)某灯泡厂1月份生产灯泡10万只,抽取1%。
第三章统计数据的整理和显示习题二、单项选择题1.统计分组的关键问题是( A >A确定分组标志和划分各组界限 B确定组距和组数C确定组距和组中值 D确定全距和组距4.某连续变量数列,其末组为开口组,下限为200,又知其邻组的组中值为170,则末组组中值为(C >b5E2RGbCAP每个组上限与下限的中点值称为组中值,对于开口组的组限是按相邻组的组距来计算的,所以末组开口组的组中值=末组下限+邻组组限/2=200+<200-170)=230p1EanqFDPwA260 B 215 C 230 D 1855.下列分组中按品质标志分组的是( B >品质标志是说明事物的性质或属性特征的,它反映的是总体单位在性质上的差异,它不能用数值来表现。
A人口按年龄分组 B产品按质量优劣分组C企业按固定资产原值分组 D乡镇按工业产值分组6.对企业先按经济类型分组,再按企业规模分组,这样的分组,属于( C >A简单分组 B平行分组 C复合分组 D再分组7.用组中值代表各组内的一般水平的假定条件是( D > A各组的次数均相等 B各组的组距均相等C各组的变量值均相等 D各组次数在本组内呈均匀分布9.对某地区的全部商业企业按实现的销售额多少进行分组,这种分组属于( A >A变量分组 B属性分组 C分组体系 D复合分组10.在频数分布中,频率是指( C >A各组频数之比 B各组频率之比 C各组频数与总频数之比 D 各组频数与各组次数之比11.频数分布用来表明( A >A总体单位在各组的分布状况 B各组变量值构成情况C各组标志值分布情况 D各组变量值的变动程度12.在分组时,若有某单位的变量值正好等于相邻组的下限时,一般应将其归在( B >A上限所在组 B下限所在组C任意一组均可 D另设新组13.在编制组距数列时,当全距不变的情况下,组距与组数的关系是( B >A正例关系 B反比例关系 C乘积关系 D毫无关系14.统计表的宾词是用来说明总体特征的( C >A标志 B总体单位 C统计指标 D统计对象15.统计表的主词是统计表所要说明的对象,一般排在统计表的( A >A左方 B上端中部 C右方 D下方三、多项选择题1.统计分组的作用在于( BCD >A区分现象的类型 B反映现象总体的内部结构变化C比较现象间的一般水平 D分析现象的变化关系 E研究现象之间数量的依存关系2.指出下表表示的分布数列所属的类型(ABC >A品质数列 B变量数列 C分组数列 D异距数列 E等距数列3.指出下列分组哪些是品质分组( ABCD >A人口按性别分组 B企业按产值多少分组C家庭按收入水平分组 D在业人口按文化程度分组E宾馆按星级分组6.从形式上看,统计表由哪些部分构成(CDE>A总标题 B主词 C纵栏标题 D横行标题 E宾词7.按主词是否分组,统计表可分为( AC >A单一表 B简单表 C分组表 D复合表 E综合表9.统计数据整理的内容一般有( BCE >A对原始数据进行预处理 B对统计数据进行分组C 对统计数据进行汇总 D对统计数据进行分析E编制统计表、绘制统计图11.某单位100名职工按工资额分为300以下、300-400、400-600、600-800、800以上等五个组。
第一章复习思考题与练习题:一、思考题1.统计的基本任务是什么?2.统计研究的基本方法有哪些?3.如何理解统计总体的基本特征。
4.试述统计总体和总体单位的关系。
5.标志与指标有何区别何联系。
二、判断题1、社会经济统计的研究对象是社会经济现象总体的各个方面。
()2、在全国工业普查中,全国企业数是统计总体,每个工业企业是总体单位。
()3、总体单位是标志的承担者,标志是依附于单位的。
()4、数量指标是由数量标志汇总来的,质量指标是由品质标志汇总来的。
()5、全面调查和非全面调查是根据调查结果所得的资料是否全面来划分的()。
三、单项选择题1、社会经济统计的研究对象是()。
A、抽象的数量关系B、社会经济现象的规律性C、社会经济现象的数量特征和数量关系D、社会经济统计认识过程的规律和方法2、某城市工业企业未安装设备普查,总体单位是()。
A、工业企业全部未安装设备B、工业企业每一台未安装设备C、每个工业企业的未安装设备D、每一个工业3、标志是说明总体单位特征的名称,标志有数量标志和品质标志,因此()。
A、标志值有两大类:品质标志值和数量标志值B、品质标志才有标志值C、数量标志才有标志值D、品质标志和数量标志都具有标志值4、统计规律性主要是通过运用下述方法经整理、分析后得出的结论()。
A、统计分组法B、大量观察法C、综合指标法D、统计推断法5、指标是说明总体特征的,标志是说明总体单位特征的,所以()。
A、标志和指标之间的关系是固定不变的B、标志和指标之间的关系是可以变化的C、标志和指标都是可以用数值表示的D、只有指标才可以用数值表示答案:二、 1.× 2.× 3.√ 4.× 5.×三、 1.C 2.B 3.C 4.B 5.B第三章一、复习思考题1.什么是平均指标?平均指标可以分为哪些种类?2.为什么说平均数反映了总体分布的集中趋势?3.为什么说简单算术平均数是加权算术平均数的特例?4.算术平均数的数学性质有哪些?5.众数和中位数分别有哪些特点?6.什么是标志变动度?标志变动度的作用是什么?7.标志变动度可分为哪些指标?它们分别是如何运用的?8.平均数与标志变动度为什么要结合运用?二、练习题(教材第四章P108课后习题答案)1.某村对该村居民月家庭收入进行调查,获取的资料如下:按月收入分组(元)村民户数(户)500~600 600~700 700~800 800~900 900以上20 30 35 25 10合计120 要求:试用次数权数计算该村居民平均月收入水平。
1.指出下面的变量哪一个属于分类变量()。
A.年龄B.工资C.汽车产量D.购买商品时的支付方式(现金、信用卡、支票)2.指出下面的变量哪一个属于顺序变量()。
A.年龄B.工资C.汽车产量D.员工对企业某项改革措施的态度(赞成、中立、反对)3.指出下面的变量哪一个属于数值型变量()。
A.年龄B.性别C.企业类型D.员工对企业某项改革措施的态度(赞成、中立、反对)4.某研究部门准备在全市200万个家庭中抽取2000个家庭,推断该城市所有职工家庭的年人均收入。
这项研究的总体是()。
A.2000个家庭B.200万个家庭C.2000个家庭的人均收入D.200万个家庭的总收入5.某研究部门准备在全市200万个家庭中抽取2000个家庭,推断该城市所有职工家庭的年人均收入。
这项研究的样本是()。
A.2000个家庭B.200万个家庭C.2000个家庭的人均收入D.200万个家庭的总收入6.某研究部门准备在全市200万个家庭中抽取2000个家庭,推断该城市所有职工家庭的年人均收入。
这项研究的参数是()。
A.2000个家庭B.200万个家庭C.2000个家庭的人均收入D.200万个家庭的总收入7.某研究部门准备在全市200万个家庭中抽取2000个家庭,推断该城市所有职工家庭的年人均收入。
这项研究的统计量是()。
A.2000个家庭B.200万个家庭C.2000个家庭的人均收入D.200万个家庭的总收入8.一家研究机构从IT从业者中随机抽取500人作为样本进行调查,其中60%回答他们的月收入在5000元以上,50%回答他们的消费支付方式是用信用卡。
这里的总体是()。
A.IT业的全部从业者B.500个IT从业者C.IT从业者的总收入D.IT从业者的消费支付方式9.一家研究机构从IT从业者中随机抽取500人作为样本进行调查,其中60%回答他们的月收入在5000元以上,50%回答他们的消费支付方式是用信用卡。
这里的“月收入”是()。
第一章一、填空题1.统计这个概念包括三种不同而又密切相关的含义:__________、__________和__________。
2.统计学由于研究对象的不同,可分为__________和__________两大类。
3.标志反映__________的属性和特征,而指标则反映__________的数量特征。
4.统计指标按其所反映的数量特点不同,可分为__________和__________。
5.变量根据变量值连续出现与否,可分为__________和__________。
6.统计数据按其表现形式的不同,可分为绝对数、__________和__________。
二、判断题1.统计总体和总体单位随着统计研究的目的不同是可以相互转化的。
()2.人的年龄是数量指标。
()3.女性是品质标志值。
()4.数量标志值是由许多统计指标的数值汇总而来的。
()5.标志不能用数值表示,而指标都是用数值表示的。
()6.指标是说明总体单位数量特征的名称。
()7.“籍贯”是品质标志的标志值。
()8.标志是说明总体单位数量特征的名称和具体数值。
()三、单项选择题1.一个总体()A.只能有一个标志 C.只能有一个指标C.可以有多个标志D.可以有多个指标2.以产品等级来衡量某种产品质量优劣,则产品等级是()A.数量标志B.品质标志C.数量指标D.质量指标3.某市全部工业企业作为总体。
每个工业企业为总体单位,则每个工业企业全年销售额为()A.数量标志B.品质标志C.数量指标D.质量指标4.下列各项指标中,数量指标为()A.全国人口数B.人口的性别构成C.人口密度D.平均亩产量5.某车间5名工人的日产量分别为20件、21件、18件、24件、19件,这5个数值是()A.指标B.标志C.变量D.标志值E.指标数值6.社会经济统计的研究对象是()A.抽象的数量关系B.社会经济现象的规律性C.社会经济现象的数量特征和数量关系D.社会经济统计认识过程的规律和方法7.社会经济统计是()的有力工具A.解决问题B.克服困难C.进行交流D.认识社会四、简答题1.简述社会经济统计的研究对象及其特点。
1.略2 .某技术小组有12人,他们的性别和职称如下,现要产生一名幸运者。
试求这位幸运者分别是以下几种可能的概率:(1)女性;(2)工程师;(3)女工程师,(4)女性或工程师。
并说明几个计算结果之间有何关系?序号123456789101112性别男男男女男男女男女女男男职称工程师技术员技术员技术员技术员工程师工程师技术员技术员工程师技术员技术员(1)P(A) = 4/12 = 1/3(2)P(B) = 4/12 = 1/3(3)P(AB) = 2/12 = 1/6(4)P(A+B) = P(A) + P(B) - P(AB) = 1/3 + 1/3 - 1/6 = 1/23.向两个相邻的军火库发射一枚导弹,如果命中第一个和第二个军火库的概率分别是0.06、0.09 ,而且只要命中其中任何一个军火库都会引起另一个军火库的爆炸。
试求炸毁这两个军火库的概率有多大。
解:此题考查互斥事件的概率,是一个根底题,解题的关键是看清楚军火库只要一个爆炸就可以,所以知军火库爆炸是几个事件的和事件.P(A)=0.06+0.09=0.154.某项飞碟射击比赛规定一个碟靶有两次命中时机(即允许在第一次脱靶后进行第二次射击)。
某射击选手第一发命中的可能性是80%,第二发命中的可能性为50%。
求该选手两发都脱靶的概率。
解:设入=第1发命中。
B =命中碟靶。
求命中概率是一个全概率的计算问题。
再利用对立事件的概率即可求得脱靶的概率。
P(B)= P(A)P(B | A) P(A)P(B | A) =0.8 案+ 0.2 0.5 = 0.9 脱靶的概率=1-0.9 = 0.1 或(解法二):P(脱靶)=P(第1次脱靶)>P(第2次脱靶)=0.2 >0.5 = 0.15.某产品的合格率是98%,现有一检查系统,它能以0.98的概率准确的判断出合格品,而对不合格品进行检查时,有0.05的可能性判断错误,该检查系统产生错判的概率是多少?解:考虑两种情况,一种就是将合格品判断错误,概率为98%* (1-0.98) =0.0196另一种情况就是将不合格品判断错误,概率为( 1-98%) *0.05=0.001所以该检查系统产生错判的概率是0.0196+0.001=0.02066.有一男女比例为51:49的人群,一直男人中5%是色盲,女人中0.25%是色盲,现随机抽中了一个色盲者,求这个人恰好是男性的概率?解:A =抽到男性,入2=抽到女性。
第二章均值向量和协方差阵的检验1、试谈willks统计量在多元方差分析中的重要意义。
2、形象分析的基本思路是什么?形象又称轮廓图,是将总体样本的均值绘制到同一坐标轴里所得的折线图,每一个指标都表示为折线图上的一点。
形象分析是将两(多)总体的形象绘制到同一个坐标下,根据形象(轮廓图)的形状对总体的均值进行比较分析。
第三章聚类分析1、聚类分析的基本思想和功能是什么?聚类分析的核心思想是根据具体的指标(变量)对所研究的个体或者对象进行分类,使得同一类中的对象之间的相似性比其他类的对象的相似性更强。
聚类分析不仅可以用来对样品进行分类,也可以用来对变量进行分类。
对样品的分类常称为Q型聚类分析,对变量的分类常称为R型的聚类分析。
聚类分析的目的或功能就是把相似的研究对象归成类,即使类间对象的同质性最大化和类与类间对象的异质性最大化。
2、试述系统聚类法的原理和具体步骤(1)系统聚类的基本思想是:距离相近的样品(或变量)先聚成类,距离相远的后聚成类,过程一直进行下去,每个样品(或变量)总能聚到合适的类中。
(2)系统聚类的具体步骤:假设总共有N个样品(或变量)第一步:将每个样品(或变量)独自聚成一类,共有N类;第二步:根据所确定的样品(或变量)“距离”公式,把距离较近的两个样品(或变量)聚合为一类,其他的样品(或变量)仍各自聚为一类,共聚成N-1类;第三步:将“距离”最近的两个类进一步聚成一类,共聚成N-2类;。
,以上步骤一直进行下去,最后将所有的样品(或变量)全聚成一类。
3、试述K-均值聚类的方法原理这种聚类方法的思想是把每个样品聚集到其最近形心(均值)类中。
首先随机从数据集中选取K个点作为初始聚类中心,然后计算各个样本到聚类中的距离,把样本归到离它最近的那个聚类中心所在的类。
计算新形成的每一个聚类的数据对象的平均值来得到新的聚类中心,如果相邻两次的聚类中心没有任何变化,说明样本调整结束,聚类准则函数已经收敛。
4、试述模糊聚类的思想方法模糊聚类分析是根据客观事物间的特征、亲疏程度、相似性,通过建立模糊相似关系对客观事物进行聚类的分析方法。
在模糊聚类中,每个样本不再仅属于某一类,而是以一定的隶属度属于每一类。
换句话说,通过模糊聚类分析,可得到样本属于各个类别的不确定性程度,即建立起了样本对于类别的不确定性的描述,这样就更能准确地反映现实世界。
第四章判别分析1、应用判别分析应该具备什么样的条件?判别分析最基本的要求是:分组类型在两组以上;每组案例的规模必须至少在一个以上;解释变量必须是可测量的,才能够计算其平均值和方差,使其能合理地应用于统计函数。
2、试述贝叶斯判别法的思路思想是:假定对研究的对象已有一定的认识,常用先验概率分布来描述这种认识,然后我们取得一个样本,用样本来修正已有的认识(先验概率分布),得到后验概率分布,各种统计推断都通过后验概率分布来进行。
将贝叶斯思想用于判别分析,就得到贝叶斯判别。
3、试述费歇判别方法的思想。
费歇判别的思想是投影,将K组P维数据投影到某一个方向,使得它们的投影组和组之间尽可能地分开。
4、什么是逐步判别分析凡具有筛选变量能力的判别方法统称为逐步判别法。
逐步判别法的基本思想是:逐步引入变量,每次引入一个"最重要"的变量,同时也检验先前引入的变量,如果先前引入的变量其判别能力随新引入变量而变不显著,则及时将其从判别式中剔除,直到判别式中的变量都很显著,且剩下来的变量也没有重要的变量可引入判别式时,逐步筛选结束。
5、简要叙述判别分析的步骤及流程。
判别分析的6个步骤过程:(1)判别分析的对象:这一步骤主要根据判别分析的研究目的定义观测变量。
(2)判别分析的研究设计:主要包括解释变量和被解释变量的选择、估计判别函数所需的样本量和为了验证目的对样本的分割。
(3)假定:推导判别函数的关键假定是解释变量的多元正态性和被解释变量定义的各组的未知但相等的协方差结构。
(4)估计判别模型和评估整体拟合:研究者必须确定估计的方法,然后确定保留的函数个数;根据估计的函数可用多种方法来评估模型拟合。
(5)结果的解释:这个过程主要介绍在判别分析中每个解释变量的相对重要性,主要有标准化判别权重、判别载荷(结构相关系数)、偏F值三种方法确定重要性。
(6)结果的验证:通常采用分割样本或者交叉验证法。
判别分析的流程:研究问题>设计要点>假定>估计判别函数>使用分类矩阵估计预测的精度>判别函数的解释>判别结果的验证第五章主成分分析1、主成分的基本思想是什么在对某一事物进行实证研究中,为了更全面、准确地反映出事物的特征及其发展规律,人们往往要考虑与其有关系的多个指标,这些指标在多元统计中也称为变量。
这样就产生了如下问题:一方面人们为了避免遗漏重要的信息而考虑尽可能多的指标,而另一方面随着考虑指标的增多增加了问题的复杂性,同时由于各指标均是对同一事物的反映,不可避免地造成信息的大量重叠,这种信息的重叠有时甚至会抹杀事物的真正特征与内在规律。
基于上述问题,人们就希望在定量研究中涉及的变量较少,而得到的信息量又较多。
主成分分析正是研究如何通过原来变量的少数几个线性组合来解释原来变量绝大多数信息的一种多元统计方法。
既然研究某一问题涉及的众多变量之间有一定的相关性,就必然存在着起支配作用的共同因素,根据这一点,通过对原始变量相关矩阵或协方差矩阵内部结构关系的研究,利用原始变量的线性组合形成几个综合指标(主成分),在保留原始变量主要信息的前提下起到降维与简化问题的作用,使得在研究复杂问题时更容易抓住主要矛盾。
一般地说,利用主成分分析得到的主成分与原始变量之间有如下基本关系:1.每一个主成分都是各原始变量的线性组合;2.主成分的数目大大少于原始变量的数目3.主成分保留了原始变量绝大多数信息4.各主成分之间互不相关通过主成分分析,可以从事物之间错综复杂的关系中找出一些主要成分,从而能有效利用大量统计数据进行定量分析,揭示变量之间的内在关系,得到对事物特征及其发展规律的一些深层次的启发,把研究工作引向深入。
2、主成分在应用中的主要作用是什么?设法将原来变量重新组合成一组新的互相无关的几个综合变量,同时根据实际需要从中可以取出几个较少的综合变量尽可能多地反映原来变量的信息的统计方法叫做主成分分析或称主分量分析,也是数学上用来降维的一种方法。
3、由协方差阵出发和由相关阵出发求主成分有什么不同?一般而言,对于度量单位不同的指标或是取值范围彼此差异非常大的指标,我们不直接由其协方差矩阵出发进行主成分分析,而应该考虑将数据标准化。
但是,对原始数据进行标准化处理后倾向于各个指标的作用在主成分的构成中相等。
对于取值范围相差不大或是度量相同的指标进行标准化处理后,其主成分分析的结果仍与由协方差阵出发求得的结果有较大区别。
其原因是由于对数据进行标准化的过程实际上也就是抹杀原始变量离散程度差异的过程,标准化后的各变量方差相等均为1,而实际上方差也是对数据信息的重要概括形式,也就是说,对原始数据进行标准化后抹杀了一部分重要信息,因此才使得标准化后各变量在对主成分构成中的作用趋于相等。
由此看来,对同度量或是取值范围在同量级的数据,还是直接从协方差矩阵求解主成分为宜。
第六章因子分析1、因子分析与主成分分析有什么本质不同?主成分分析和因子分析是两种把变量维数降低以便于描述、理解和分析的方法:实际上主成分分析可以说是因子分析的一个特例。
(1)因子分析中是把变量表示成各因子的线性组合,而主成分分析中则是把主成分表示成各个变量的线性组合。
(2)主成分分析的重点在于解释个变量的总方差,而因子分析则把重点放在解释各变量之间的协方差。
(3)主成分分析中不需要有假设(assumptions),因子分析则需要一些假设。
因子分析的假设包括:各个共同因子之间不相关,特殊因子(specific factor)之间也不相关,共同因子和特殊因子之间也不相关。
(4)主成分分析中,当给定的协方差矩阵或者相关矩阵的特征值是唯一的时候,的主成分一般是独特的;而因子分析中因子不是独特的,可以旋转得到不到的因子。
(5)在因子分析中,因子个数需要分析者指定(spss根据一定的条件自动设定,只要是特征值大于1的因子进入分析),而指定的因子数量不同而结果不同。
在主成分分析中,成分的数量是一定的,一般有几个变量就有几个主成分。
(6)和主成分分析相比,由于因子分析可以使用旋转技术帮助解释因子,在解释方面更加有优势。
大致说来,当需要寻找潜在的因子,并对这些因子进行解释的时候,更加倾于使用因子分析,并且借助旋转技术帮助更好解释。
而如果想把现有的变量变成少数几个新的变量(新的变量几乎带有原来所有变量的信息)来进入后续的分析,则可以使用主成分分析。
当然,这中情况也可以使用因子得分做到。
所以这种区分不是绝对的。
2、因子载荷a ij的统计定义是什么?它在实际问题分析中的作用是什么?因子载荷a(ij)的统计意义就是第i个变量与第j个公共因子的相关系数即表示X(i)依赖F(j)的份量(比重)。
统计学术语称作权,心理学家将它叫做载荷,即表示第i个变量在第j个公共因子上的负荷,它反映了第i个变量在第j个公共因子上的相对重要性。
在因子分析中,通常只选其中m个(m<p主因子),即根据变量的相关选出第一主因子ƒ1,使其在各变量的公共因子方差中所占的方差贡献为最大,然后消去这个因子的影响,而从剩余的相关中,选出与之不相关的因子,使其在各个变量的剩余因子方差贡献中为最大,如此往复,直到各个变量公共因子方差被分解完毕为止。
第七章对应分析1、试述对应分析的思想方法及特点。
思想:对应分析又称为相应分析,也称R—Q分析。
是因子分子基础发展起来的一种多元统计分析方法。
它主要通过分析定性变量构成的列联表来揭示变量之间的关系。
当我们对同一观测数据施加R和Q型因子分析,并分别保留两个公共因子,则是对应分析的初步。
对应分析的基本思想是将一个联列表的行和列中各元素的比例结构以点的形式在较低维的空间中表示出来。
它最大特点是能把众多的样品和众多的变量同时作到同一张图解上,将样品的大类及其属性在图上直观而又明了地表示出来,具有直观性。
另外,它还省去了因子选择和因子轴旋转等复杂的数学运算及中间过程,可以从因子载荷图上对样品进行直观的分类,而且能够指示分类的主要参数(主因子)以及分类的依据,是一种直观、简单、方便的多元统计方法。
特点:对应分析的基本思想是将一个联列表的行和列中各元素的比例结构以点的形式在较低维的空间中表示出来。
它最大特点是能把众多的样品和众多的变量同时作到同一张图解上,将样品的大类及其属性在图上直观而又明了地表示出来,具有直观性。
另外,它还省去了因子选择和因子轴旋转等复杂的数学运算及中间过程,可以从因子载荷图上对样品进行直观的分类,而且能够指示分类的主要参数(主因子)以及分类的依据,是一种直观、简单、方便的多元统计方法。