第六章 拟合优度检验
- 格式:ppt
- 大小:812.50 KB
- 文档页数:54
第六章课后题解答1.与参数检验相比,非参数检验有哪些优缺点?主要适用于那些场合?答:(1)非参数检验不需要严格假设条件,因而比参数检验有更广泛的适用面;非参数检验几乎可以处理包括定类数据和定序数据在内的所有类型的数据,而参数检验通常只能用于定量数据的分析;在参数检验和非参数检验都可以使用的情况下,非参数检验的功效(power)要低于参数检验方法。
(2)参数检验中的假设条件不满足;检验中涉及的数据为定类或定序数据;所涉及的问题中并不包含参数;对各种资料的初步分析。
2.使用“学生调查.sav”文件中的数据检验:(1)能否认为总体中学生的学习兴趣呈均匀分布?(2)能否认为总体中学生的身高服从正态分布?答:(1)利用2拟合优度检验,计算出的2统计量的值为2.000,自由度为4,相应的p值(渐近显著性)为0.736。
由于0.736大于0.05,所以在5% 的显著性水平下不能拒绝原假设,也就是说根据样本数据不能认为总体数据是非均匀的。
乱0伞单疋(0.0%)貝有型于5的期峑a单」T:晨小7.0(2)利用单样本K-S检验法,计算出的D max统计量的值为0.899,相应的p值(渐近显著性)为0.394。
由于0.394大于0.05,所以在5%的显著性水平下不能拒绝原假设,也就是说根据样本数据不能认为总体数据是非正态的。
单样進Kolmogor ov-Smirnov 攪腌亂检验分芜为正悲分布乱根据救摇计算得到*表2.23.某企业生产一种钢管,规定长度的中位数是10米。
现随机地从正在生产的生产线上选取10根进行测量,结果为:9.8,10.1,9.7,9.9, 9.8,10.0, 9.7, 10.0,9.9, 9.8。
问该企业的生产过程是否需要调整。
答:单样本中位数的符号检验法检验钢管长度的中位数是否为50,各个数值与中位数比较的结果,有7个值小于10, 1个值大于10, 2个等于10。
样本量较少,输出双侧检验的p值(精确显著性)为0.070。
拟合优度检验及其应用许某某,数学与计算机科学学院摘要:数理统计的两个主要形式就是参数估计和假设检验,在这里,我们只介绍后者——假设检验,其中又只对假设检验中的拟合优度检验假设作介绍。
假设检验根据样本分布族的数学形式已知与否,可分为参数假设检验和非参数假设检验,作为非参数假设检验之一的拟合优度检验,又是检验理论分布假设的重要方法。
为了帮助我们更好了解拟合优度检验,本文将首先给我们介绍拟合优度检验的数学定义。
其次,重点介绍时下讨论最多的两种拟合优度方法——2Pearsonχ检验和Kolmogorov Smirnov-检验,并穿插具体实例解答来给我们直观的印象,帮助理解。
最后,考虑到检验过程会很复杂,本文在最后一节讲述了这两种检验的软件实现,结合实例,编写运行程序。
关键词:假设检验;非参数假设检验;拟合优度;2Pearsonχ检验;-检验K o l m o g o r o v S m i r n oGoodness-of-fit testing and its applicationMoumou_Xu, Mathematics and computer science institute Abstract:parameter estimation and hypothesis testing are the main contents ofmathematical statistics, here, we only study the latter——hypothesis testing, our key point is goodness-of fit testing. As is known to us, according to whether the mathematical form of sample non-normal distribution is known or not, hypothesis testing contains parameters fake check and nonparameters fake check. Goodness-of fit testing, one of nonparameters fake check, is the important way to test theoretical distribution’hypothesis. To help us understand The goodness of fit better, first of all, this article will tell us the mathematical definition of The goodness of fit. Secondly, two methods, which are talked widely, would be introduced. They are 2Pearsonχtesting and Kolmogorov Smirnov-testing. A special example will leave us direct impression and help us to manage the way. At last,because of the complex testing process,it is necessary to tell how to use the statistical software to solve the bining with specific example,we get the program.Key words: hypothesis testing; nonparameters fake check ; goodness of fit;2Pearsonχtesting;Kolmogorov Smirnov-testing内容安排1.拟合优度检验的提出2.几种常用拟合优度检验介绍2.1.2Pearsonχ检验2.1.1.理论分布完全已知情况1.随机变量X是离散型2.理论分布为确定分布2.1.2.理论分布带有未知参数2.2.Kolmogorov Smirnov-检验2.3.2Pearsonχ检验与Kolmogorov Smirnov-检验的比较3.拟合优度检验实例分析4.拟合优度检验的软件实现4.1.2Pearsonχ检验的软件实现4.2.Kolmogorov Smirnov-检验的软件实现5.参考文献1.拟合优度检验的提出[1]假设检验问题就是通过从有关总体中抽取一定容量的样本,利用样本去检验总体分布是否具有某种特性。
如何理解拟合优度检验?在数据分析中,对于定类变量和低测度的定序变量,通常不能使用均值、T检验和方差分析等方法来处理。
对于不符合正态分布的定类数据或低测度定序数据,其检验方法是利用交叉表技术分行分列计算交叉点的频数,利用卡方距离实施卡方检验,基于频数和数据分布形态分析不同类别的数据是否存在显著性差异,对于定类数据的对比检验,也叫独立性检验。
低测度数据对于定类变量,其数值大小和顺序并不代表什么意义,对于定类变量和低测度的定序变量,均值和方差都不能描述变量特征,故不能通过分析其平均值、方差等参数开展数据分析。
在做统计分析时,对于这类变量通常需要借助中位数、频数、百分比以及不同分布情况,实现数据描述。
对于低测度数据,比较典型的研究是关于结构成分的研究,实际上是一种借助频数来分析数据分布形态,并进而发现数据分布差异性的检验。
拟合及拟合优度由于低测度数据的特点,直接进行基于均值的检验显然是不行的,于是人们借助数学模型,提出了拟合的概念。
所谓拟合,就是分析现有观测变量的分布形态,检查其分布能够与某一期望分布(或标准分布)很好地吻合起来。
在数学上,拟合的过程就是寻找能很好地温和当前数据序列的数学模型的过程。
为了评价拟合的程度,人们提出了判定拟合有效性的机制,这就是拟合优度。
拟合优度也借助检验概率的概念来评价数据拟合的质量。
目前,对于低测度数据序列的处理最常见的分析方法是卡方检验。
特别是基于交叉表的卡方检验在数据分析中具有重要的地位,它们都建立在拟合概念的基础上。
另外,二项分布、游程检验等单样本检验也可以看做是数据拟合的重要应用。
与此同时,对定距或定序变量的分布形态判定,也是数据拟合的应用之一,在分布形态判定过程中所获得的检验概率就是该序列与标准分布形态的拟合优度。
卡方检验卡方检验的目标就是检查观测值的频数与期望频数之间的差异显著性。
由于卡方检验要求便于对个案进行分类并计算频数,因此卡方检验通常基于定类数据或低测度定序数据,并基于它们分类计算个案的实际频数,然后通过实际频数与期望频数的距离,来判定实际频数是否与预期目标存在差异。
第六章课后题解答1. 与参数检验相比,非参数检验有哪些优缺点?主要适用于那些场合?答:(1)非参数检验不需要严格假设条件,因而比参数检验有更广泛的适用面;非参数检验几乎可以处理包括定类数据和定序数据在内的所有类型的数据,而参数检验通常只能用于定量数据的分析;在参数检验和非参数检验都可以使用的情况下,非参数检验的功效(power)要低于参数检验方法。
(2)参数检验中的假设条件不满足;检验中涉及的数据为定类或定序数据;所涉及的问题中并不包含参数;对各种资料的初步分析。
2. 使用“学生调查.sav”文件中的数据检验:(1)能否认为总体中学生的学习兴趣呈均匀分布?(2)能否认为总体中学生的身高服从正态分布?χ拟合优度检验,计算出的2χ统计量的值为2.000,自由答:(1)利用2度为4,相应的p值(渐近显著性)为0.736。
由于0.736大于0.05,所以在5%的显著性水平下不能拒绝原假设,也就是说根据样本数据不能认为总体数据是非均匀的。
表2.1(2)利用单样本K-S检验法,计算出的D统计量的值为0.899,相应的pmax值(渐近显著性)为0.394。
由于0.394大于0.05,所以在5%的显著性水平下不能拒绝原假设,也就是说根据样本数据不能认为总体数据是非正态的。
表2.23. 某企业生产一种钢管,规定长度的中位数是l0米。
现随机地从正在生产的生产线上选取10根进行测量,结果为:9.8,10.1,9.7,9.9,9.8,10.0,9.7,10.0,9.9,9.8。
问该企业的生产过程是否需要调整。
答:单样本中位数的符号检验法检验钢管长度的中位数是否为50,各个数值与中位数比较的结果,有7个值小于10,1个值大于10,2个等于10。
样本量较少,输出双侧检验的p值(精确显著性)为0.070。
显然,这里我们的结论是不能拒绝原假设。
表3.14. 从上海证券交易所的上市公司随机抽取10家,观察其2008年年终财务报告公布前后三日的平均股价(如表6-15),试用参数和非参数方法检验:我国上市公司年报对股价是否有显著性影响?表6-15 10家公司年终财务报告公布前后三日的平均股价序号 1 2 3 4 5 6 7 8 9 10 年报公布前15 21 18 13 35 10 17 23 14 25年报公布后17 18 25 16 40 8 21 31 22 25答:表4.1是Wilcoxon符号秩检验的计算结果。