当前位置:文档之家› 第八章 虚拟变量回归 思考题

第八章 虚拟变量回归 思考题

第八章  虚拟变量回归   思考题
第八章  虚拟变量回归   思考题

第八章 虚拟变量回归 思考题

8.1 什么是虚拟变量 ? 它在模型中有什么作用 ?

8.2 虚拟变量为何只选 0 、 1, 选 2 、 3 、 4 行吗 ? 为什么 ? 8.3 对 (8.10) 式的模型 , 如果选择一个虚拟变量

1,01D ??

=??-?

大专及大专以上,高中,高中以下

这样的设置方式隐含了什么假定 ? 这一假定合理吗 ?

8.4 引入虚拟解释变量的两种基本方式是什么 ? 它们各适用于什么情况 ? 8.5 四种加法方式引入虚拟变量会产生什么效应?

8.6 引入虚拟被解释变量的背景是什么?含有虚拟被解释变量模型的估计方法有哪些 ? 8.7 设服装消费函数为

12233t i i i i Y D D X u αααβ=++++

其中,i X =收入水平 ;Y = 年服装消费支出 ;

1,30D ?=?

?大专及大学以上

,其他

;1,20D ?=??女性,其他 试写出不同人群组的服装消费函数模型。

8.8 利用月度数据资料 ,为了检验下面的假设,应引入多少个虚拟解释变量 ?

1) 一年里的 12 个月全部表现出季节模式 ;

2) 只有 2 月、 6 月、 8 月、 10 月和 12 月表现出季节模式。 练习题

8.1 1971 年 ,Sen 和 Sztvastava 在研究贫富国之间期望寿命的差异时 , 利用 101 个国家的数据 , 建立了如下回归模型

[]? 2.409.39ln 3.36(ln 7)i i i i

Y X D X =-+-- (4.37)(0.857)(2.42) R2=0.752

其中 ,X 是以美元计的人均收入 ;Y 是以年计的期望寿命 ;

Sen 和 Srimstava 认为人均收入的临界值为 1097 美元 (ln1097=7), 若人均收入超过 1097 美元 , 则被认定为富国 ; 若人均收入低于1097美元 , 被认定为贫穷国。括号内的数值为对应参数估计值的t 值。 1) 解释这些计算结果。 2) 回归方程中引入(ln 7)i i D X =-的原因是什么?如何解释这个回归解释变量?

3) 如何对贫穷国进行回归 ? 又如何对富国进行回归 ? 4)这个回归结果中可得到的一般结论是什么 ?

8.2 表 8.4 给出 1965-1970 年美国制造业利润和销售额的季度数据。假定

利润不仅与

销售额有关 , 而且和季度因素有关。

1) 如果认为季度影响使利润平均值发生变异 , 应如何引入虚拟变量 ?

2) 如果认为季度影响使利润对销售额的变化率发生变异 , 应当如何引入虚

拟变量 ?

3) 如果认为上述两种情况都存在 , 又应当如何引入虚拟变量 ? 的对上述

三种情况分别估计利润模型 , 进行对比分析。

8.3 在统计学教材中 , 采用了方差分析方法分析了不同班次对劳动效率的

试采用虚拟解释变量回归的方法对上述数据进行方差分析。

8.4Joseph Camelld 基于 1961 斗 1966 年的 200 只 Aa 级和 Baa 级债券的数据 ( 截面数据和时间序列数据的合并数据 ), 分别建立了 LPM 和 IAgit 模型 1)LPM

2

122334455i i i i i i Y X X X X u βββββ=+++++

2)IAgit 模型

2

122334455ln 1i

i i i i i i i p

L X X X X u p βββββ??==+++++ ?-??

其中 , i Y =1[ 债券信用等级为a A ( 穆迪信用等级 )];

i L =[债券信用等级为aa B (穆迪信用等级)];

2i X =?长期债券的市值

债券的资本化率(作为杠杆的测度=

100)总资本的市值

3i X =?税后收入

利润率(

100)总资产净值

4i X = 利润率的标准差( 测度利润率的变异性 ): 5i X = 总资产净值 ( 测度规模 ) 。

上述模型中 , 2β和4β事先期望为负值 , 而3β和5β 期望为正值。 对于 LPM,Cappelleri 经过异方差和一阶自相关校正 , 得到以下结果

272345?0.68600.01790.04860.05720.37810i i i i i

Y X X X X -=-+++?

se =(0.1775)(0.0024) (0.0486)(0.0178)(0.039?810-)

20.6933R =

对于LDgit 模型 ,Cappelleri 在没有对异方差进行弥补的情形下用 ML 得以下结果 :

262345ln 1.66220.31850.62480.90410.92101i i i i i i p X X X X p -??=--+-+? ?-?? 试解下列问题 :

1) 为什么要事先期望2β和4β为负值 ? 2) 在 LPM 中 , 当4β>0 是否合理 ? 3) 对 LPM 的估计结果应做什么样的解释 ?

的已知2

2X =9.67%,3X =7.77%,4X =0.5933%,5X =3429000( 元 ), 问债券晋

Aa 信用等级的概率有多大?

8.5 Greene 在分析讲授某门经济学课程采用新的教学方法效应时,搜集了如表 8.5 所示的数据 , 其中 ,GRADE 是学生在接受新教学方法

(PSI,PSI=1,0???接受新教学方法

,没有采用新方法

) 后学习

成绩是否有所提高的虚拟变量 ,GRADE=1,0???

有所提高

,没有提高; 其他变量分别为平均级

点 GPA 、非期末考试成绩分数 TUCE 。试用对数单位模型对此进行估计,并分析

相应的边际效应。

表8.5采用新的教学方法讲授某门经济学课程的数据

obs GRADE

GPA

TUCE

PSI

obs GRADE

GPA

TUCE

1 0 2.66 20 0 17 0 2.75 25

2 0 2.89 22 0 18 0 2.8

3 19 3 0 3.28 2

4 0 19 0 3.12 23 4 0 2.92 12 0 20 1 3.16 2

5 5 1 4 21 0 21 0 2.0

6 22 6 0 2.86 1

7 0 22 1 3.62 2

8 7 0 2.76 17 0 23 0 2.8

9 14 8 0 2.87 21 0 24 0 3.51 26 9 0 3.03 25 0 25 1 3.54 24 10 1 3.92 29 0 26 1 2.83 27 11 0 2.63 20 0 27 1 3.39 17 12 0 3.32 23 0 28 0 2.67 24 13

3.57

23

29

1

3.65

21

14 1 3.26 25 0 30 1 4 23

15 0 3.53 26 0 31 0 3.1 21

16 0 2.74 19 0 32 1 2.39 19

8.6 依据某大型超市的调查数据表8.6,分析股份制因素是否对销售规模产生影

响。

表8.6某大型超市的调查数据

第五章 虚拟变量模型和滞后变量模型

1. 表5.1中给出了中国1980—2001年以城乡储蓄存款新增额代表的居民当年储蓄及以GNP 代表的居民当年收入的数据。以1991年为界,判断1991年前和1991年后的两个时期中国居民的储蓄—收入关系是否已发生变化。 表5.1 1980—2001年中国居民储蓄与收入数据 单位:亿元 年份 储蓄S GNP 年份 储蓄S GNP 1980 118.5 4517.8 1991 2072.8 21662.5 1981 124.2 4860.3 1992 2438.4 26651.9 1982 151.7 5301.8 1993 3217 34560.5 1983 217.1 5957.4 1994 6756.4 46670 1984 322.2 7206.7 1995 8143.5 57494.9 1985 407.9 8989.1 1996 8858.5 66850.5 1986 615 10201.4 1997 7759 73142.7 1987 835.7 11954.5 1998 7127.7 76967.2 1988 728.2 14922.3 1999 6214.3 80579.4 1989 1345.4 16917.8 2000 4710.6 88228.1 1990 1887.3 18598.4 2001 9430 94346.4 估计以下回归模型: 0123()i i i i i i Y X D D X u ββββ=++++ 其中i D 为引入的虚拟变量:1,19910,1991i D ?=?? 年前年后 对上面的模型进行估计,结果如下: 所以表达式为: 15350.0751981.90.032()i i i i i Y X D D X =+-+ (1.40) (4.45) (-1.38) (0.37)

第八章虚拟变量参考答案

练习题8.1参考解答: (1)在其它条件不变的情况下,对数人均收入提高1%,则平均预期寿命可能提高约0.0939年。但从统计检验结果看,对数人均收入lnX 对期望寿命Y 的影响并不显著。方程的拟合情况良好,可进一步进行多重共线性等其他计量经济学的检验。 (2)引入()ln 7i i D X -的原因是想从截距和斜率两个方面考证将人均收入超过1097美元的国家定义为富国的话,贫国和富国的预期寿命是否存在显著的区别。 如果人均收入大于1097美元,那么虚拟变量取值为1,否则为0。即: 1 1097 (l n ()7)0 1097 i i D X ?-=??人均收入大于美元人均收入低于 美元 (3) 对于贫穷国,其回归方程为: 2.409.39ln i X -+ 对于富国,其回归方程为: 2.40(9.39- 3.36)ln 3.36*721.12 6.03ln i i X X -++=+ 习题8.2参考答案 由于有四个季度,因此引入三个季度虚拟变量 1 1 1 1220 0 0 D D D ???===??????一季度二季度三季度其它其它其它 (1)按照加法模型引入三个虚拟变量,模型为:(加法模型的作用是改变了设定模型的截距 水平) i 0112233i i Y =D D D X ααααβμ+++++ 回归结果如下: 123i 22?=6910.449187.7317D 1169.32D 417.1182D 0.038008X t= (3.594792) (-0.28439 (1.835446) 065093256914 R =0.517642 R =0.416093 F=5.097454 DW=0.39625 i Y -+-+)(-.) (.) (2)由于考虑利润对销售额的变化率发生变异,即斜率的改变,因此按照乘法模型引入三 个虚拟变量,模型为: i 01i 1i 12i 23i 3i Y =X X D X D X D ββαααμ+++++ 回归结果如下: i i 1i 2i 322?=7014.7570.037068X -0.000933X D 0.00791X D 0.002385X D t= (3.934394) (3.273896 (-0.216776) 0.0040180.58529 R =0.519733 R =0.418624 F=5.140311 DW=0.429628 i Y ++--)() () (3)按照加法和乘法相结合的方式引入三个虚拟变量,模型为: i 01122331i 2i 13i 24i 3i Y =D D D X X D X D X D ααααββββμ++++++++ 回归结果为: i 123i i 1i 2i 322?Y =10457.394752.26D 3764.21D 4635.46D 0.0159X 0.029X D 0.03X D 0.0266X D t= (2.566) (-0.87 (-0.6860.8320.6280824089960749 R =0.546701 R =0.348383 F=2---++++-)) () () (.) (.)(.).756686 DW=0.464982

第八章 虚拟变量回归 思考题

第八章 虚拟变量回归 思考题 8.1 什么是虚拟变量 ? 它在模型中有什么作用 ? 8.2 虚拟变量为何只选 0 、 1, 选 2 、 3 、 4 行吗 ? 为什么 ? 8.3 对 (8.10) 式的模型 , 如果选择一个虚拟变量 1,01D ?? =??-? 大专及大专以上,高中 ,高中以下 这样的设置方式隐含了什么假定 ? 这一假定合理吗 ? 8.4 引入虚拟解释变量的两种基本方式是什么 ? 它们各适用于什么情况 ? 8.5 四种加法方式引入虚拟变量会产生什么效应? 8.6 引入虚拟被解释变量的背景是什么?含有虚拟被解释变量模型的估计方法有哪些 ? 8.7 设服装消费函数为 12233t i i i i Y D D X u αααβ=++++ 其中, i X =收入水平 ;Y = 年服装消费支出 ; 1,30D ?=? ?大专及大学以上 ,其他 ;1,20D ?=??女性,其他 试写出不同人群组的服装消费函数模型。 8.8 利用月度数据资料 ,为了检验下面的假设,应引入多少个虚拟解释变量 ? 1) 一年里的 12 个月全部表现出季节模式 ; 2) 只有 2 月、 6 月、 8 月、 10 月和 12 月表现出季节模式。 练习题 8.1 1971 年 ,Sen 和 Sztvastava 在研究贫富国之间期望寿命的差异时 , 利用 101 个国家的数据 , 建立了如下回归模型 []? 2.409.39ln 3.36(ln 7)i i i i Y X D X =-+-- (4.37)(0.857)(2.42) R2=0.752 其中 ,X 是以美元计的人均收入 ;Y 是以年计的期望寿命 ; Sen 和 Srimstava 认为人均收入的临界值为 1097 美元 (ln1097=7), 若人均收入超过 1097 美元 , 则被认定为富国 ; 若人均收入低于1097美元 , 被认定为贫穷国。括号内的数值为对应参数估计值的t 值。 1) 解释这些计算结果。 2) 回归方程中引入(ln 7)i i D X =-的原因是什么?如何解释这个回归解释变量? 3) 如何对贫穷国进行回归 ? 又如何对富国进行回归 ? 4)这个回归结果中可得到的一般结论是什么 ?

计量经济学第五章-练习题

计量经济学第五章-练习题

一、单项选择题 1. 某商品需求函数为 u x b b y i i i ++=10,其中y 为需求量, x 为价格。为了考虑“地区”(农村、城市)和“季节”(春、夏、秋、冬)两个因素的影响,拟引入虚拟变量,则应引入虚拟变量的个数为( )。 A.2 B.4 C.5 D.6 2. 根据样本资料建立某消费函数如下: x D t t t C 45.035.5550.100?++=,其中C 为消费,x 为收入,虚拟变量???=农村家庭城镇家庭01? D ,所有参数 均检验显著,则城镇家庭的消费函数为( )。 A.x t t C 45.085.155?+= B.x t t C 45.050.100?+= C.x t t C 35.5550.100?+= D.x t t C 35.5595.100?+=

3 设消费函数为 u x b x b a a y i i i i D D +?+++=1010,其中虚拟变量D=???农村家庭 城镇家庭01,当统计检验表 明下列哪项成立时,表示城镇家庭与农村家庭有一样的消费行为( )。 A.0,011==b a B.0,011≠=b a C.0,011=≠b a D. 0,011≠≠b a 4. 设 消 费函数 u x a a y i i i b D +++=10,其中虚拟 变量 ?? ?= 01南方北方 D ,如果统计检验表明01≠α成立,则北方的消费函数与南方的消费函数是( )。 A.相互平行的 B.相互垂直的

C.相互交叉的 D.相互重叠的 5. 假定月收入水平在1000元以内时,居民边际消费 倾向维持在某一水平,当月收入水平达到或超过1000元时,边际消费倾向将明显下降,则描述消费(C )依收入(I )变动的线性关系宜采用( )。 A. ?? ?≥=+?++=元 元10001 10000 ,210I I D D u I b I b a C t t t t π B. ?? ?≥=+++=元 元10001 10000 ,210I I D D u I b b a C t t t π C. 元1000,)(**10=+-+=I u I I b a C t t t D. u I I b I b a C t t t t D +-++=)(*210,D 、I *同上 6. 下列属于有限分布滞后模型的是( )。 A. u y b y b x b y t t t t t a +++++=--Λ22110

计量经济学:第八章 虚拟变量回归

第八章 虚拟变量回归 第一节 虚拟变量的概念 一、问题的提出 计量经济学模型对变量的要求——可观测、可计量。但在现实经济问题中,存在定性影响因素,比如 1、属性(品质)因素的表达。 在经济活动中,有的经济变量的变动要受到属性因素(或品质因素)的影响。如收入在形成过程中,不同的性别所得到的收入是不一样的;在城乡、不同地区等收入存在差距;再比如,在我国,经济的发展水平对于不同的区域有不同的表现。 2、异常值现象。 当经济运行过程中,可能会受到突发事件的影响,那么,其值有可能出现异常,偏离正常轨迹很远,对这类现象需要加以修正。 3、季节因素的影响。 有的经济现象存在明显的季节特征,如啤酒的消费。那么,在建模过程中,季节变动这一因素怎样考虑? 4、离散选择现象的描述。 如公共交通与私人交通的选择、商品购买与否的决策、求职者对职业的选择等。 第1、2、3种情况属于解释变量为定性变量,第4情况为被解释变量属于定性变量。称前一种情况为虚拟解释变量,后一种为虚拟被解释变量。本章主要介绍虚拟解释变量的内容。 二、虚拟变量的定义 1、定义。设变量D 表示某种属性,该属性有两种类型,即当属性存在时D 取值为1;当属性不存在时D 取值为0。记为 ???=不具有该属性 具有某种属性01D

2、虚拟变量引入的规则。 (1)在模型里存在截距项的条件下,如果一个属性存在m 个相互排斥类型(非此即彼),则在模型里引入m-1个虚拟变量。否则,会出现完全的多重共线性。但要注意,在模型无截距项的情况下,如果一个属性存在m 个类型,即便引入m 个变量,不会出现多重共线性问题。( 请思考为什么?) (2)虚拟变量取值为0,意味着所对应的类型是基础类型。而虚拟变量取值为1,代表与基础类型相比较的类型,称为比较类型。例如“有学历”D 为1,“无学历”D 为0,则“无学历”就是基础类型,“有学历”为比较类型。 (3)当属性有m 个类型时,不能把虚拟变量的取值设成如下情况 D=0, 第一个类型; D=1, 第二个类型; …… D=m-1, 第m 个类型。 原因是上述情况没有反映出属性类型的相互排斥性。 第二节 虚拟解释变量的回归 一、加法引入规则 1、加法引入规则,虚拟解释变量与别的解释变量以相加的关系出现在模型里。加法引入虚拟变量对模型产生的结果是只改变截距项。 设模型为 123i i i i Y X D u βββ=+++ 式中,i D 为虚拟变量,它与其它解释变量是相加的关系。如果虚拟变量按这种方式引入模型,则称虚拟变量按加法类型引入。 2、加法引入虚拟变量的应用。 (1)模型中只有一个定性解释变量。 设模型形式为 12i i i Y D u ββ=++ n i ,,3,2,1 = 其中,i D 为具有两个属性类型的定性变量,如在教材第217页,设i Y 为居民的

第五讲 虚拟变量模型

第七讲 经典单方程计量经济学模型:专门问题 虚拟变量模型 学习目标: 教学基本内容 虚拟变量 许多经济变量是可以定量度量,例如:商品需求量、价格、收入、产量等; 但有一些影响经济变量的因素是无法定量度量。 例如:职业、性别对收入的影响, 战争、自然灾害对 GDP 勺影响,季节对某些产品(如冷饮)销售的影响等。 定性变量:把职业、性别这样无法定量度量的变量称为定性变量。 定量变量:把价格、 收入、 销售额这样可以可以定量度量的变量称为定量变 量。 为了能够在模型中能够反映这些因素的影响, 型的功能,需要将它们“量化”。 这种“量化” 来完成的。 根据这些因素的属性类型, 构造只取 称为虚拟变量( dummy variables ) ,记为 D 。 例如:反映性别的虚拟变量 D 1;男 0;女 1; 本科学历 反映文化程度的虚拟变量 D 0;1非;本本科科学学历历 一般地,基础类型和肯定类型取值为 1;比较类型和否定类型取值为 0。 二、 虚拟变量的设置原则 设置原则: 每一定性变量(qualitative variable )所需的虚拟变量个数要比该定性变量的状 态类别数(categories 少1。即如果有m 种状态,只在模型中引入m-1个虚拟变量。 例如,冷饮的销售量会受到季节变化的影响。季节定性变量有春、夏、秋、 冬 4 种状态,只需要设置 3 个虚拟变量: 1. 2. 3. 4. 了解什么是虚拟变量以及什么是虚拟变量模型; 理解虚拟变量的设置原则; 掌握虚拟变量模型的两种基本引入方式(加法方式和乘法方式) 能够自行设计虚拟变量模型,并能够解释其中蕴含的经济意义; 提高模型的精度, 拓展回归模 通常是通过引入“虚拟变量” 0”或“1”的人工变量, 通常 虚拟变量只作为解释变量。

(精品)第五章-虚拟变量模型和滞后变量模型

第五章虚拟变量模型 1.表5.1中给出了中国1980—2001年以城乡储蓄存款新增额代表的居民当年储蓄及以GNP 代表的居民当年收入的数据。以1991年为界,判断1991年前和1991年后的两个时期中国居民的储蓄—收入关系是否已发生变化。 年份储蓄S GNP 年份储蓄S GNP 1980 118.5 4517.8 1991 2072.8 21662.5 1981 124.2 4860.3 1992 2438.4 26651.9 1982 151.7 5301.8 1993 3217 34560.5 1983 217.1 5957.4 1994 6756.4 46670 1984 322.2 7206.7 1995 8143.5 57494.9 1985 407.9 8989.1 1996 8858.5 66850.5 1986 615 10201.4 1997 7759 73142.7 1987 835.7 11954.5 1998 7127.7 76967.2 1988 728.2 14922.3 1999 6214.3 80579.4 1989 1345.4 16917.8 2000 4710.6 88228.1 1990 1887.3 18598.4 2001 9430 94346.4 估计以下回归模型: 0123 () i i i i i i Y X D D X u ββββ =++++ 其中 i D为引入的虚拟变量: 1,1991 0,1991 i D ? =? ? 年前 年后 对上面的模型进行估计,结果如下: 所以表达式为:

15350.0751981.90.032()i i i i i Y X D D X =+-+ (1.40) (4.45) (-1.38) (0.37) 从2β和3β的t 检验值可以知道,这两个参数显著的为0,所以1991年前和1991年后两个时期的回归结果是相同的。 下面用邹式检验来验证上面对于两个时期的回归结果相同的结论是否正确。 过程如下: 输入要验证的突变点,本例为1991年。 输出结果如下:

第8章 虚拟变量回归

计量经济学课程教案授课题目(教学章、节或主题): 第8章 虚拟变量回归 授课时间 安排 第16周共2课时教学器材与工具多媒体 授 课 类 型(请打√)理论课√讨论课□ 实验课□ 习题课□ 双语课程□ 其他□ 教学目的、要求(分掌握、熟悉、了解三个层次): 1、熟悉虚拟变量的含义; 2、掌握虚拟变量设置原则; 3、掌握虚拟变量回归引入方法; 4、了解虚拟被解释变量模型。 教学重点及难点: 虚拟变量回归引入方法与估计方法 教 学 基 本 内 容 §1 虚拟变量 §2 虚拟解释变量的回归 §3 虚拟被解释变量* §4 案例分析 教学过程设计: 一、引入 二、讲授 三、小结 教学方法及手段(请打√):讲授√、讨论□、多媒体讲解√、模型、实物讲解□、挂图讲解□、音像讲解□等。 作业、讨论题、思考题: 1、什么是虚拟变量?它在模型中有什么作用? 参考资料(含参考书、文献等):《计量经济学》,(美)D.Gujarati 著,林少宫译;《计量经济学》,李子奈编著;《经济计量学精要》,(美)D.Gujarati著,张寿等译。 课后小结:虚拟变量从本质上说是“数据分类器”,它根据样本的属性(性别、婚姻状况、种族、宗教等等)将样本分为各个不同的子群体并对

每个子群体进行回归分析。若模型包含多个定性变量,而且每个定性变量有多种分类,则引入模型的虚拟变量将消耗大量的自由度。因此,应当权衡进入模型的虚拟变量的个数以免超过样本观察值的个数。

第8章 虚拟变量回归 §8.1 虚拟变量 一、虚拟变量的基本含义 许多经济变量是可以定量度量的,如:商品需求量、价格、收入、产量等。 但也有一些影响经济变量的因素无法定量度量,如:职业、性别对收入的影响,战争、自然灾害对GDP的影响,季节对某些产品(如冷饮)销售的影响等等。 为了在模型中能够反映这些因素的影响,并提高模型的精度,需要将它们“量化”, 这种“量化”通常是通过引入“虚拟变量”来完成的。根据这些因素的属性类型,构造只取“0”或“1”的人工变量,通常称为虚拟变量(dummy variables),记为D。 例如,反映文程度的虚拟变量可取为: 1, 本科学历 D= 0, 非本科学历 一般地,在虚拟变量的设置中: 基础类型、肯定类型取值为1; 比较类型,否定类型取值为0。 二、虚拟变量的设置原则 虚拟变量的个数须按以下原则确定: 每一定性变量所需的虚拟变量个数要比该定性变量的类别数少1,即如果有m个定性变量,只在模型中引入m-1个虚拟变量。 例。已知冷饮的销售量Y除受k种定量变量Xk的影响外,还受春、夏、秋、冬四季变化的影响,要考察该四季的影响,只需引入三个虚拟变量即可: 则冷饮销售量的模型为: 在上述模型中,若再引入第四个虚拟变量:

第五章-含虚拟变量的回归模型

Econometrics 第五章虚拟变量回归模型(教材第六章)

第五章虚拟变量回归模型 第一节虚拟变量的性质和引入的意义 第二节虚拟变量的引入 第三节交互作用效应 第四节含虚拟变量的回归模型 学习要点 虚拟变量的性质,虚拟变量的设定

5.1 虚拟变量的性质和引入的意义 虚拟变量的性质 f定性变量 性别(男,女) 婚姻状况(已婚,未婚) 受教育程度(高等教育,其他) 收入水平(高收入,中低收入) 肤色(白人,有色人种) 政治状况(和平时期,战争时期) f引入虚拟变量(Dummy Variables)

1、分离异常因素的影响,例如分析我国GDP的时间序列,必须考虑“文革”因素对国民经济的破坏性影响,剔除不可比的“文革”因素。 2、检验不同属性类型对因变量的作用,例如工资模型中的文化程度、季节对销售额的影响。 3、提高模型的精度,相当与将不同属性的样本合并,扩大了样本量,从而提高了估计精度)。 5.1 虚拟变量的性质和引入的意义

5.2 虚拟变量的引入 虚变量引入的方式主要有两种 f加法方式 虚拟变量与其它解释变量在模型中是相加关系,称为虚拟 变量的加法引入方式。 加法引入方式引起截距变动

5.2 虚拟变量的引入 f 虚拟变量的作用在于把定性变量“定量化”:通过赋值0和1,0表示变量不具备某种性质,1表示具备。 f 例,0代表男性,1代表女性;0代表未婚,1代表已婚;等等。 f 这类取值为0和1的变量称为虚拟变量(dummy variables ),通常用符号D 表示。 f 事实上,模型可以只包括虚拟变量(ANOVA 模型): 其中,0,1,i i D D ==男性;女性。 12i i i Y B B D u =++

计量经济学课件第八章 虚拟变量回归

计量经济学课件第八章虚拟变量回归 第八章虚拟变量回归 1 / 65

计量经济学课件第八章 虚拟变量回归 2 / 65 引子:男女大学生消费真有差异吗? 在对在校学生的消费行为进行的调查中,发现在校 生的消费行为呈现多元化的结构。人际交往消费、 手机类消费、衣着类消费、化妆品类消费、电脑类 消费、旅游类消费占有较大的比例;而食品类消费、 学习用品类消费不突显。 显然,男女生在消费上存在差异。为了了解男、女 生的消费支出结构差异,应当如何建立模型? 面临的问题:如何把男女生这样的非数量变量引

计量经济学课件第八章 虚拟变量回归 3 / 65 问题的一般性描述 在实际建模中,一些定性变量具有不可忽视的重要 影响。例如,研究某个企业的销售水平,产业属性 (制造业、零售业)、所有制(私营、非私营)、 地理位置(东、中、西部)、管理者的素质、不同 的收入水平等是值得考虑的重要影响因素,但这些 因素共同的特征是定性描述的。 如何对非定量因素进行回归分析? 采用“虚拟变量”对定性变量进行量化一种思路。

计量经济学课件第八章 虚拟变量回归 4 / 65 第八章 虚拟变量回归 本章主要讨论: ●虚拟变量 ●虚拟解释变量的回归 ●虚拟被解释变量的回归(选讲,不包括)

计量经济学课件第八章 虚拟变量回归 5 / 65 第一节 虚拟变量 本节基本内容: ●基本概念 ●虚拟变量设置规则

计量经济学课件第八章 虚拟变量回归 6 / 65 一、基本概念 定量因素:可直接测度、数值性的因素。 定性因素:属性因素,表征某种属性存在与否的 非数值性的因素。 基本思想: 直接在回归模型中加入定性因素存在诸多的困难 (那些困难?),是否可将这些定性因素进行量 化,以达到定性因素能与定量因素有着相同作用 之目的。

第五章 离散选择模型(虚拟变量回归)(20140429)

第五章离散选择模型(虚拟变量回归) 第一节虚拟变量的概念 一、问题的提出 计量经济学模型对变量的要求——可观测、可计量。但在现实经济问题中,存在定性影响因素,比如 1、属性(品质)因素的表达 在经济活动中,有的经济变量的变动要受到属性因素(或品质因素)的影响。如收入在形成过程中,不同的性别所得到的收入是不一样的;在城乡、不同地区等收入存在差距;再比如,在我国,经济的发展水平对于不同的区域有不同的表现。 2、异常值现象 当经济运行过程中,可能会受到突发事件的影响,那么,其值有可能出现异常,偏离正常轨迹很远,对这类现象需要加以修正。 3、季节因素的影响 有的经济现象存在明显的季节特征,如啤酒的消费。那么,在建模过程中,季节变动这一因素怎样考虑? 4、离散选择现象的描述 如公共交通与私人交通的选择、商品购买与否的决策、求职者对职业的选择等。 第1、2、3种情况属于解释变量为定性变量,第4情况为被解释变量属于定性变量。称前一种情况为虚拟解释变量,后一种为虚拟被解释变量。本章主要介绍虚拟解释变量的内容。 二、虚拟变量的定义 1、定义 设变量D表示某种属性,该属性有两种类型,即当属性存在时D取值为1;当属性不存在时D取值为0。记为

???=不具有该属性类型 具有某种属性类型0 1D 2、虚拟变量引入的规则 (1)在模型里存在截距项的条件下,如果一个属性存在m 个相互排斥类型(非此即彼),则在模型里引入m-1个虚拟变量。否则,会出现完全的多重共线性。但要注意,在模型无截距项的情况下,如果一个属性存在m 个类型,即便引入m 个变量,不会出现多重共线性问题。( 请思考为什么?) (2)虚拟变量取值为0,意味着所对应的类型是基础类型。而虚拟变量取值为1,代表与基础类型相比较的类型,称为比较类型。例如“有学历”D 为1,“无学历”D 为0,则“无学历”就是基础类型,“有学历”为比较类型。 (3)当属性有m 个类型时,不能把虚拟变量的取值设成如下情况 D=0, 第一个类型; D=1, 第二个类型; …… D=m-1, 第m 个类型。 原因是上述情况没有反映出属性类型的相互排斥性。 第二节 虚拟解释变量的回归 一、加法引入规则 1、加法引入规则,虚拟解释变量与别的解释变量以相加的关系出现在模型里。加法引入虚拟变量对模型产生的结果是只改变截距项。 设模型为 123i i i i Y X D u βββ=+++ 式中,i D 为虚拟变量,它与其它解释变量是相加的关系。如果虚拟变量按这种方式引入模型,则称虚拟变量按加法类型引入。 2、加法引入虚拟变量的应用 (1)模型中只有一个定性解释变量 设模型形式为 12i i i Y D u ββ=++ n i ,,3,2,1 =

第五章 离散选择模型(20140429)

第五章离散选择模型 在初级计量经济学里,我们已经学习了解释变量是虚拟变量的情况,除此之外,在实际问题中,存在需要人们对决策与选择行为的分析与研究,这就是被解释变量为虚拟变量的情况。我们把被解释变量是虚拟变量的线性回归模型称为离散选择模型,本章主要介绍这一类模型的估计与应用。 本章主要介绍以下内容: 1、为什么会有离散选择模型。 2、二元离散选择模型的表示。 3、线性概率模型估计的缺陷。 4、Logit模型和Probit模型的建立与应用。 第一节模型的基础与对应的现象 一、问题的提出 在研究社会经济现象时,常常遇见一些特殊的被解释变量,其表现是选择与决策问题,是定性的,没有观测数据所对应;或者其观测到的是受某种限制的数据。 1、被解释变量是定性的选择与决策问题,可以用离散数据表示,即取值是不连续的。例如,某一事件发生与否,分别用1和0表示;对某一建议持反对、中立和赞成5种观点,分别用0、1、2表示。由离散数据建立的模型称为离散选择模型。 2、被解释变量取值是连续的,但取值的范围受到限制,或者将连续数据转化为类型数据。例如,消费者购买某种商品,当消费者愿意支付的货币数量超过该商品的最低价值时,则表示为购买价格;当消费者愿意支付的货币数量低于该商品的最低价值时,则购买价格为0。这种类型的数据成为审查数据。再例如,在研究居民储蓄时,调查数据只有存款一万元以上的帐户,这时就不能以此代表所有居民储蓄的情况,这种数据称为截断数据。这两种数据所建立的模型称为受限被解释变量模型。有的时候,人们甚至更愿意将连续数据转化为上述类型数据

来度量,例如,高考分数线的设置,就把高出分数线和低于分数线划分为了两类。 下面是几个离散数据的例子。 例5.1 研究家庭是否购买住房。由于,购买住房行为要受到许多因素的影响,不仅有家庭收入、房屋价格,还有房屋的所在环境、人们的购买心理等,所以人们购买住房的心理价位很难观测到,但我们可以观察到是否购买了住房,即 1,0Y ?=??购买,不购买 我们希望研究买房的可能性,即概率(1)P Y =的大小。 例5.2 分析公司员工的跳槽行为。员工是否愿意跳槽到另一家公司,取决于薪资、发展潜力等诸多因素的权衡。员工跳槽的成本与收益是多少,我们无法知道,但我们可以观察到员工是否跳槽,即 1,0Y ?=??跳槽,不跳槽 例5.3 对某项建议进行投票。建议对投票者的利益影响是无法知道的,但可以观察到投票者的行为只有三种,即 1,23Y ??=??? 支持,反对,弃权 研究投票者投什么票的可能性,即(),1,2,3P Y j j ==。 从上述被解释变量所取的离散数据看,如果变量只有两个选择,则建立的模型为二元离散选择模型,又称二元型响应模型;如果变量有多于二个的选择,则为多元选择模型。本章主要介绍二元离散选择模型。 离散选择模型起源于Fechner 于1860年进行的动物条件二元反射研究。1962年,Warner 首次将它应用于经济研究领域,用于研究公共交通工具和私人交通工具的选择问题。70-80年代,离散选择模型被普遍应用于经济布局、企业选点、交通问题、就业问题、购买行为等经济决策领域的研究。模型的估计方法主要发展于20世纪80年代初期。(参见李子奈,高等计量经济学,清华大学出版社,2000年,第155页-第156页) 二、线性概率模型

第五章虚拟变量模型和滞后变量模型

第五章虚拟变量模型和滞后变量模型 以下是为大家整理的第五章虚拟变量模型和滞后变量模型的相关范文,本文关键词为第五,虚拟,变量,模型,滞后,5.1,出了,中国,1980,,您可以从右上方搜索框检索更多相关文章,如果您觉得有用,请继续关注我们并推荐给您的好友,您可以在综合文库中查看更多范文。 1.表5.1中给出了中国1980—20XX年以城乡储蓄存款新增额代表的居民当年储蓄及以gnp代表的居民当年收入的数据。以1991年为界,判断1991年前和1991年后的两个时期中国居民的储蓄—收入关系是否已发生变化。

表5.11980—20XX年中国居民储蓄与收入数据单位:亿元 年份储蓄sgnp年份储蓄s1980118.54517.819912072.81981124.24860.319922438.41982151.753 01.8199332171983217.15957.419946756.41984322.27206.719958143.5 1985407.98989.119968858.5198661510201.4199777591987835.711954 .519987127.71988728.214922.319996214.319891345.416917.82000471 0.61990 1887.3 18598.4 20XX 9430 估计以下回归模型: Yi??0??1xi??2Di??3(Dixi)?ui 其中D?i为引入的虚拟变量:Di??1,1991年前?0,1991年后 对上面的模型进行估计,结果如下: 所以表达式为: Yi?1535?0.075xi?1981.9Di?0.032(Dixi) (1.40)(4.45)(-1.38)(0.37) gnp21662.526651.934560.54667057494.966850.573142.776967.280579

第九章 含虚拟变量的回归模型

第九章含虚拟变量的回归模型 目前为止,在已学习的线性回归模型中,解释变量X都是定量变量。但有时候,解释变量是定性变量。 9.1 虚拟变量的性质 通常在回归分析中,应变量不仅受一些定量变量的影响,还受一些定性变量的影响(性别、种族、肤色、宗教、民族、罢工、政团关系、婚姻状况)。 如: 美国黑人的收入比相应的白人的收入低。 女学生的S.A.T.的数学平均分数比相应的男生低。 定性变量通常表明了具备或不具备某种性质,比如,男性或女性,黑人或白人,佛教徒或非佛教徒,本国公民或非本国公民。 把定性因素“定量化”的一个方法是建立人工变量,并赋值0和1,0表示变量不具备某种属性,1表示变量具备某种属性,该变量称为虚拟变量(dummy variable),用符号D表示。 虚拟变量一样可用于回归分析,一个回归模型的解释变量可以仅仅是虚拟变量,称为方差分析模型( ANOVA )。

Yi = B1 + B2Di + ui ( 9 - 1 ) 其中Y = 初职年薪 Di =1,大学毕业 =0,非大学毕业 假定随机扰动项满足古典线性回归模型的基本假定,根据模型( 9 - 1 )得到: 非大学毕业生的初职年薪的期望为: E(Yi|Di=0) = B1 + B2( 0 ) = B1 ( 9 - 2 ) 大学毕业生的初职年薪的期望为: E(Yi|Di=1) = B1+B2( 1 ) = B1+B2 ( 9 - 3 ) 可以看出: 截距B1表示非大学毕业生的平均初职年薪, “斜率”系数B2表明大学毕业生的平均初职年薪与非大学生的差距是多少; (B1+B2)表示大学毕业生的平均初职年薪。 零假设:大学教育没有任何益处(即B2=0),可根据t检验值

相关主题
文本预览
相关文档 最新文档