第三章社会统计资料的整理
- 格式:doc
- 大小:39.00 KB
- 文档页数:3
第三章社会统计资料的整理原始资料杂乱无章,需加整理,才能为人所用。
统计资料的整理,其基础是统计分组。
所谓统计分组.就是按统计研究的目的和要求,将总体单位或全部调查数据按一定的标志划分成若干组,使组内差异尽量小,而组与组之间则有明显差异,从而使原本杂乱无章的资料有序化,以便为在统计分析中提炼各种有用信息打下基础。
第一节统计分组的原则与标准统计分组的标志分为数量标志和品质标志两大类。
按国际惯例,无论采用何种标志进行统计分组,都应遵循以下一般原则:(1)分组应使各类别构成之和等于总体;(2)分组设计应能反映统计总体的分布规律性。
在统计资料搜集的基础上,按分组原则,将总体中所有单位依一定顺序归类整理,即可得到能够表明总体单位总数在各组分配情况的频数(或次数)分布数列,简称数列。
频数分布数列是统计分组工作的产物。
显然,按品质标志进行分组,我们可以得到品质数列;按数量标志进行分组,我们可以得到变量数列。
统计分组的关键在于选择分组标志和划分各组界限。
一般来讲,按品质标志来分组,其差别比较明确,区分也较容易。
按数量标志来分组则不同,对于划分各组界限,变量数列有较大的任意性。
如果划分不当,不仅容易混淆各组的差别,也可能无法反映变量的分布特征。
在统计整理和统计分析中,广泛应用变量数列,借以观察某一数量标志的变动及其分布状况。
因此,如何编制变量数列是我们重点需要掌握的。
第二节统计表统计调查搜集来的资料往往是没有次序的原始资料,使原始资料有序化,列表和作图是两种基本方法,得到的分别就是统计表和统计图。
变量数列是统计表的一种常用形式。
1.统计表的格式、内容与种类统计表是表示统计资料的表格,在由横行、纵栏交叉结合而成的表格上,它能系统地组织和合理地安排大量数字资料。
统计表的主要功用是汇总和积累统计资料,以简捷和有条理的方式表示统计资料的特征,从而使统计资料易于查对、比较、分析和记忆。
统计表通常有一定格式:总标题、横行标题(表侧)、纵栏标题(表头)、统计数值(表身)。
第三章社会统计资料的整理一、填空1.统计表从内容上看,是由()和宾词两部分构成的。
2.主词是统计表要说明的();宾词是用来说明主词的()。
3.统计表通常有一定格式,统计表各部位的名称分别是()、横行标题、纵栏标题、()。
4.统计分组的关键在于()和划分各组界限,统计分组法是统计资料________阶段的基本方法。
5.统计表按主词的分组情况,可分为简单表、简单分组表和()。
6、变量数列中各组标志值出现的次数称________,各组单位数占单位总数的比重称________。
7. 各组频数与组距之比称为__________,频数分配数列按照数量标志分组可以得到__________ 。
8.将全部变量值依次划分为若干个区间,并将每一区间的变量值作为一组,这样的分组方法称为________分组。
9. 变量数列有两个构成要素()和()。
对于连续变量,恰是某一组限的数据应按照____的原则归入相应的组别。
10.若采用异距分组,_______反映单位组距内分布的频数。
2.在频数分布图中,()标示为曲线的最高点所对应的变量值。
11.绘制直方图时,对于___变量和定序变量的分组,矩形的宽度是没有意义的。
6.u型曲线的特征是_______。
12.实际收入分配情况则由洛仑兹曲线表示,一般表现为一条下凹的弧线,下凹程度愈大,收入分配(),反之,则收入分配()。
13.基尼系数为(),表示收入绝对不平均;基尼系数为(),表示收入绝对平均。
二、单项选择题1.统计整理所涉及的资料是( C )。
A.原始资料B.次级资料C.原始资料和次级资料D.统计分析后的资料2. 单项数列分组通常只适用于( ) 的情况。
A.离散变量且变量值较多B.连续变量,但范围较大C.离散变量且变量值较少D.连续变量,但范围较小4.以一、二、三等品来衡量产品质地的优劣,那么该产品等级是()。
A. 品质标志B. 数量标志C. 质量指标D. 数量指标7. (B )的数列属于连续型变量数列。
第三章统计整理学习要求:明确统计整理在统计研究中承前起后的地位;掌握分组的方法和汇总技术;认识统计分布是统计整理的重要表现形式;学会统计表的编制并能熟练地运用。
§1 统计整理的意义和方法一、统计整理的意义统计整理是指根据统计研究任务的要求,对调查所搜索的原始资料进行分组、汇总,使其条理化、系统化的工作过程。
统计整理实现了从个别单位的标志值向说明总体数量特征的指标值过渡,是人们对社会经济现象从感性认识上升到理性认识的过渡阶段,为统计分析提供基础。
二、统计整理的方法:1、统计分组就是根据整理的目的要求,按照规定的标志进行区分若干组成部分的一种统计方法。
(科学的分组是搞好统计整理的前提条件)2、汇总是对分组后的各项指标进行汇总,并计算各组的单位数和合计数,计算出说明总体和各组情况的统计指标数值。
汇总是统计整理的中心内容汇总技术:①手工汇总:划记法、过录法、折叠法、卡片法。
②电子计算机汇总。
3、编表:经过汇总,得出表明社会现象总体和各个组的单位数和一系列标志总量的资料,把这些资料按一定的规则在表格上表现出来。
§2 统计分组一、统计分组的意义:统计分组的含义:指根据统计研究任务的要求和现象总体的内在特点,把统计总体按照某一标志划分为若干性质不同而又联系的几个部分。
统计分组是在总体内部进行的一种定性分类。
①对总体而言是“分”,即将总体区分为性质相异的若干组成部分。
②对个体而言是“合”,即将性质相同的个体组合起来。
(统计分组的关键是分组标志的选择)二、统计分组的种类1、按统计分组任务和作用不同分:类型分组:划分社会经济类型;结构分组:研究同类总体的结构;分析分组:分析被研究现象总体诸标志之间的联系和依存关系。
类型分组、结构分组:现象总体按品质标志分组,多属类型分组(例如工业生产按经济类型分-----国有、私营、集体);现象总体按数量标志分组,多属结构分组(例如企业按职工人数分------1000人以下、1000-5000人、5000人以上)。
《社会统计学》全书目录第一章导论第一节什么是社会统计学社会统计的产生与发展·社会统计学的对象与特点·社会统计的方法·社会统计工作的程序第二节社会统计学的几个基本概念总体与单位·标志与变量·指标与指标体系第二章社会统计资料的搜集第一节统计调查的方法及种类原始资料与次级资料·静态资料与静态资料·全面调查与非全面调查·一般调查与专项调查·经常性调查与一次性调查第二节统计调查的组织形式普查·重点调查·典型调查·抽样调查第三节概念的操作化与测量概念的操作化·定类尺度·定序尺度·定距尺度·定比尺度第四节统计误差登记性误差·代表性误差·抽样误差第三章社会统计资料的整理第一节统计分组的原则与标准“穷举”与“互斥”·频数(或次数)分布数列·品质数列与变量数列第二节统计表统计表的格式、内容与种类·统计表的制作规则第三节变量数列的编制对于离散变量·对于连续变量·组距和组数的确定·累计频数第四节统计图直方图·折线图·曲线图·累计顿数分布曲线·洛仑兹曲线与基尼系数第四章集中趋势测量法第一节算术平均数对于未分组资料的算术平均数计算·对于分组资料的算术平均数计算·算术平均数的性质第二节中位数对于未分组资料的中位数计算·对于分组资料的中位数计算·中位数的性质·其他分割法第三节众数对于未分组资料的众数计算·对于分组资料的众数计算·众数的性质第四节几何平均数、调和平均数及其他几何平均数·调和平均数·各种平均数的关系第五章离中趋势测量法第一节全距与四分位差全距·四分位差第二节平均差对于未分组资料A·D的计算·对于分组资料A·D的计算·平均差的性质第三节标准差对于未分组资科S的计算·对于分组资料S的计算·标准差的性质·标准分第四节相对离势变异系数·异众比率·偏态系数第六章概率与概率分布第一节概率论随机现象和随机事件·事件之间的关系·先验概率·经验概率第二节概率的数学性质概率的数学性质·排列与样本点的计数·运用概率方法进行统计推断的前提第三节概率分布、期望值与变异数离数型随机变量及其概率分布·连续型随机变量的概率分布·分布函数·数学期望·变异数第七章假设检验第一节二项分布二项分布的数学形式·二项分布的讨论第二节统计检验的基本步骤建立假设·求抽样分布·选择显著性水平和否定域·计算检验统计量·判定第三节正态分布正态分布的数学形式·标准正态分布·正态曲线下的面积·二项分布的正态近似法第四节中心极限定理抽样分布·中心极限定理第五节总体均值和成数的单样本检验σ已知,对总体均值的检验·学生t分布(小样本总体均值的检验)·关于总体成数的检验第八章常用统计分布第一节超几何分布超几何分布的数学形式·超几何分布的数学期望与方差·关于超几何分布的近似第二节泊松分布泊松分布的数学形式·泊松分布的性质·关于泊松分布的近似第三节卡方分布(2 分布)卡方分布的数学形式·卡方分布的性质·样本方差的抽样分布第四节F分布F分布数学形式·F分布的性质·关于F分布的近似第九章参数估计第一节点估计无偏性·一致性·有效性第二节区间估计精确性和可靠性·抽样平均误差与概率度·区间估计的步骤第三节其他类型的置信区间σ未知,小样本总体均值的区间估计·总体成数的估计·总体方差的区间估计第四节抽样平均误差简单随机抽祥的抽样误差·分层抽样的抽样误差·整群抽样的抽样误差·等距抽祥的抽样误差第五节样本容量的确定影响样本容量的因素·确定样本容量第十章双样本假设检验及区间估计第一节两总体大样本假设检验大样本均值差检验·大样本成数差检验第二节两总体小样本假设检验小样本均值差检验·小样本方差比检验第三节配对样本的假设检验单一实验组的假设检验·一实验组与一控制组的假设检验·对实验设计与相关检验的评论第四节双样本区间估计σ12和σ22已知,对均值差的区间估计·σ12和σ22未知,对均值差的区间估计·大样本成数区间估计·配对样本均值差的区间估计第十一章非参数检验第一节符号检验配对样本的“符号检验”·符号检验与二项检验·简便检验·“符号检验”的作用第二节配对符号秩检验配对样本的符号秩检验·配对符号秩检验的步骤·符号秩检验的效力第三节秩和检验独立样本的秩和检验·秩和·秩和检验的具体步骤·U检验第四节游程检验独立样本的游程检验·游程·游程检验的具体步骤·差符号游程检验第五节累计频数检验独立样本的累计频数检验·累计频数检验的步骤·没有预测方向和已经预测方向·经验分布与理论分布之比较第十二章相关与回归分析第一节变量之间的相互关系相关程度与方向·因果关系第二节定类变量的相关分析列联表·削减误差比例·λ系数·τ系数第三节定序变量的相关分析同序对、异序对、同分对·G amma系数·肯德尔等级相关系数·萨默斯(d系数)·斯皮尔曼等级相关系数·肯德尔和谐系数第四节定距变量的相关分析相关表和相关图·积差系数的导出和计算·积差系数的性质第五节回归分析线性回归·积差系数的PRE性质·相关指数R第六节曲线相关与回归第十三章2 检验与方差分析第一节拟合优度检验问题的导出·拟合优度检验(比率拟合检验)·正态拟合检验第二节无关联性检验独立性、理论频数及自由度·关于频数比较和连续性修正·列联表的卡方分解·关系强度的量度第三节方差分析总变差及其分解·关于自由度·关于检验统计量F o的计算·相关比率·关于方差分析的几点讨论第四节回归方程与相关系数的检验回归系数的检验·积差系数的检验·回归方程的区间估计第十四章动态分析与指数分析第一节时间数列及其指标分析时间数列的构成与分类·动态比较指标·动态平均指标第二节时间数列的趋势分析随手绘法·移动平均法·半数平均法·最小平方法第三节指数分析法动态指数及其分类·质量指标综合指数·数量指标综合指数·用与个体指数的联系来求综合指数·其他权数形式的质量和数量综合指数·指数体系和因素分析·静态指数。
第三章统计资料的整理教学目的与要求:本章是统计研究活动的第三阶段—统计资料整理阶段,阐述了统计整理的理论与方法,包括分组、汇总和统计表的设计。
重点要求为:1、明确统计资料整理的概念,了解统计整理的步骤。
2、通过学习统计分组理论,能够对不同的社会经济现象进行统计分组。
3、运用分配数列对原始数据进行系统整理。
4、掌握统计表的具体编配方法。
重点掌握:1、统计分组方法。
2、分配数列的编制与汇总教学方式:用多媒体课件讲练结合。
课时安排:理论4学时,实训4学时第一节统计整理的意义和步骤一、统计整理的意义1、定义统计整理,就是根据统计研究的目的,对所搜集到的资料进行科学的加工,使之系统化,条理化的工作过程。
统计整理即包括对统计调查所得到的原始资料进行整理,也包括对加工过的综合资料,即次级资料进行再整理。
2、意义统计整理在整个统计研究中占有重要的地位。
统计整理的正确与否,将直接影响和决定着能否完成整个统计研究的任务。
如果采用不科学不完整的整理方法,即使搜集到准确、全面的统计资料,也往往使这些资料失去应用价值,掩盖客观现象的本质,难以得出正确的结论。
因此,必须十分重视统计整理工作。
二、统计资料整理的步骤第一步,设计和制定统计整理方案。
第二步,对原始资料进行审核。
第三步,对经过审核的资料进行分组、并结合汇总,计算出总体总量指标。
第四步,将汇总计算的结果,以统计表或统计图的形式表现出来。
第五步,对统计资料妥善保存,系统积累。
第二节统计分组一、统计分组的概念统计分组就是根据统计研究的需要,将统计总体按照一定的标志分为若干个组成部分的一种统计方法。
例如,将某一班级的全体同学按照性别划分为男、女两个组;对某市100家大型零售商店按照零售额、职工人数进行分组等。
统计分组具有两个方面的含义:对总体而言,是“分”,即将同质总体区分为性质有别的不同组成部分;对总体单位而言,它是“组”,即将性质相同或相近的不同总体单位组合在一起,构成一个组。
第三章社会统计资料的整理
原始资料杂乱无章,需加整理,才能为人所用。
统计资料的整理,其基础是统计分组。
所谓统计分组.就是按统计研究的目的和要求,将总体单位或全部调查数据按一定的标志划分成若干组,使组内差异尽量小,而组与组之间则有明显差异,从而使原本杂乱无章的资料有序化,以便为在统计分析中提炼各种有用信息打下基础。
第一节统计分组的原则与标准
统计分组的标志分为数量标志和品质标志两大类。
按国际惯例,无论采用何种标志进行统计分组,都应遵循以下一般原则:(1)分组应使各类别构成之和等于总体;(2)分组设计应能反映统计总体的分布规律性。
在统计资料搜集的基础上,按分组原则,将总体中所有单位依一定顺序归类整理,即可得到能够表明总体单位总数在各组分配情况的频数(或次数)分布数列,简称数列。
频数分布数列是统计分组工作的产物。
显然,按品质标志进行分组,我们可以得到品质数列;按数量标志进行分组,我们可以得到变量数列。
统计分组的关键在于选择分组标志和划分各组界限。
一般来讲,按品质标志来分组,其差别比较明确,区分也较容易。
按数量标志来分组则不同,对于划分各组界限,变量数列有较大的任意性。
如果划分不当,不仅容易混淆各组的差别,也可能无法反映变量的分布特征。
在统计整理和统计分析中,广泛应用变量数列,借以观察某一数量标志的变动及其分布状况。
因此,如何编制变量数列是我们重点需要掌握的。
第二节统计表
统计调查搜集来的资料往往是没有次序的原始资料,使原始资料有序化,列表和作图是两种基本方法,得到的分别就是统计表和统计图。
变量数列是统计表的一种常用形式。
1.统计表的格式、内容与种类
统计表是表示统计资料的表格,在由横行、纵栏交叉结合而成的表格上,它能系统地组织和合理地安排大量数字资料。
统计表的主要功用是汇总和积累统计资料,以简捷和有条理的方式表示统计资料的特征,从而使统计资料易于查对、比较、分析和记忆。
统计表通常有一定格式:总标题、横行标题(表侧)、纵栏标题(表头)、统计数值(表身)。
统计表从内容上看,是由主词和宾词两部分构成的。
主词是统计表所要说明的对象,它可以是总体各单位的名称、总体的各个组或总体单位的全部。
宾词是用来说明主词的标志和标志值(或指标名称和指标数值)。
主词通常列于表的左瑞,宾词通常列于表的上端。
但有时为了编排合理和阅读方便,也可以互换位置,将主词置于表的上端,将宾词置于表的左瑞。
统计表的种类是按主词和宾词交叉划分的。
统计表按主词是否分组以及分组的程度,可分为简单表、简单分组表和复合分组表。
统计表按宾词如何表达和配置,可分为简单设计两种。
2.统计表的制作规则
第三节 变量数列的编制
在社会统计学中,总体中各单位的分布特征首先是用统计表来表示的。
能够表示变量分布及其特征的统计表,即变量数列。
它的编制,在社会统计资料的整理中有特殊的意义。
变量数列有两个构成要素;①变量值——用来分组并按大小顺序排列的数量标志的具体数值,用符号i X 表示;②频数——总体单位在各组中出现的次数,用符号i f 表示。
将各组频数除以总体单位总数N (也称总体容量),就得到相对频数,简称频率.用符号i P 表示。
用频率也可以将变量分布的状况清晰地表示出来。
变量数列的编制比较复杂,这不仅因为划分各组界限有较大弹性,而且因为因变量有离散变量和连续变量之别,需分别加以讨论。
1.对于离散变量
离散变量所描述的对象的数量特征,可以按一定次序列出它的整数值,相邻两变量值不会出现小数.因而能编制出单项式和组距式两种变量数列。
所谓单项数列,是指数列中每一个变量值一组,有几个变量值就有几组;所谓组距数列,是指数列中每一组由两个变量值的一个差值范围来表示。
首先,离散变量的整数值如果变动幅度较小,可以将每一个变量值列为一组,编制单项数列。
其次,离散变量的整数值如果变动幅度较大,而且总体单位数N 又很大,则要编制组距数列。
组距数列又有等距和异距两种。
组距数列的首组和末组还有开口组和闭口组之别。
对离散变量编制组距数列的具体做法是:在变量值变动的最大范围内,将全部变量值依次划分为几个区间,一个区间内的所有变量归为一组。
变量值变动的最大范围称为全距(R );区间距离(i h )称为组距;组距两端的数值称为组限;上限与下限之差就是组距;上限和下限之间的中点数值(i m )称为组中值。
2.对于连续变量
连续变量因其数学特征,在一个区间可以有无限多数值,无法按顺序一一列举,所以只能编制组距数列。
与离散变量组距数列不同之处在于,根据连续变量的特征,此时组距数列中相邻两组的上限和下限共有一个组限,即相邻两组交界处的组限重合。
至于恰等于某一组限的数据归于哪一组,应该按照“上限不包括在内”的原则处理。
有了这一规定,就不会在编制连续变量的数列时,发生违背“穷举”与“互斥”这两个基本原则的情况了。
3.组距和组数的确定
显然,组距和组数两者成反比关系。
因为等距分组和闭口组有编制方便、便于计算和便于绘制统计图等优点,因而统计分组应尽量采用等距分组以及闭口组。
但是如果碰到有极端值的情况,就要采取首组“向下开口”或末组“向上开口”的方式来处理。
异距分组主要在变量变动很不均匀而有急剧上升或突然下降之类情况发生时考虑。
有时,为了适应某项专门工作的需要,也采用异距分组。
4.累计频数
累计频数一般用大写字母F来表示。
累计又分向上累计和向下累计。
所谓向上累计,是以变量数列首组的频数为始点,逐个累计各组的频数,每组累计频数展示了小于该组上限的频数合计有多少。
所谓向下累计,则是以变量数列末组的频数为始点,逐个累计各组的频数,每组累计频数展示了大于该组下限的频数合计有多少。
当然,累计也可以根据相对频数分布来进行,得到的便是相对频数累计(或百分数累计)了。
第四节统计图
频数分布不但可以用统计表的形式表现,也可以用统计图的形式表现。
用统计图表示频数分布,较之用统计表,要直观便捷得多。
但缺点是不及统计表精确。
统计图的种类很多,本书使用的统计图有频数(频率)分布图、时间数列的历史曲线、相关关系的散点图等等。
根据编制好的频数分布数列,可以绘制出相应的统计图,最常用的有频数分布直方图、折线图、曲线图以及累计频数分布曲线。
具体方法是:先画直角坐标,横轴代表分组或各组组限,纵轴代表各组频数或频率,然后再根据相应的分配数列作图。
洛仑兹(Lorenz)曲线是一种用来反映社会收入分配平均程度的累计百分数曲线。
洛仑兹曲线的特点是在纵轴和横袖两个方向上都进行累计。
20世纪初意大利经济学家基尼(Gini)根据洛仑兹曲线提出了一种判断社会收入分配平
均程度的指标,用G表示。
设实际收入分配曲线和收入分配绝对平均线之间的面积为A,实际收入分配曲线右下方的面积为B。
并以A除以A+B的商表示不平均程度。
这个数值被称为基尼系数。