第八章__虚拟解释变量回归.doc
- 格式:docx
- 大小:164.13 KB
- 文档页数:32
第八章虚拟变量模型1. 回归模型中引入虚拟变量的作用是什么?答:在模型中引入虚拟变量,主要是为了寻找某(些)定性因素对解释变量的影响。
加法方式与乘法方式是最主要的引入方式,前者主要适用于定性因素对截距项产生影响的情况,后者主要适用于定性因素对斜率项产生影响的情况。
除此外,还可以加法与乘法组合的方式引入虚拟变量,这时可测度定性因素对截距项与斜率项同时产生影响的情况。
2. 虚拟变量有哪几种基本的引入方式? 它们各适用于什么情况?答:在模型中引入虚拟变量的主要方式有加法方式与乘法方式,前者主要适用于定性因素对截距项产生影响的情况,后者主要适用于定性因素对斜率项产生影响的情况。
除此外,还可以加法与乘法组合的方式引入虚拟变量,这时可测度定性因素对截距项与斜率项同时产生影响的情况。
3.什么是虚拟变量陷阱?答:根据虚拟变量的设置原则,一般情况下,如果定性变量有m个类别,则需在模型中引入m-1个变量。
如果引入了m个变量,就会导致模型解释变量出现完全的共线性问题,从而导致模型无法估计。
这种由于引入虚拟变量个数与类别个数相等导致的模型无法估计的问题,称为“虚拟变量陷阱”。
4.在一项对北京某大学学生月消费支出的研究中,认为学生的消费支出除受其家庭的每月收入水平外,还受在学校中是否得到奖学金,来自农村还是城市,是经济发达地区还是欠发达地区,以及性别等因素的影响。
试设定适当的模型,并导出如下情形下学生消费支出的平均水平:(1) 来自欠发达农村地区的女生,未得到奖学金;(2) 来自欠发达城市地区的男生,得到奖学金;(3) 来自发达地区的农村女生,得到奖学金;(4) 来自发达地区的城市男生,未得到奖学金。
解答: 记学生月消费支出为Y,其家庭月收入水平为X,则在不考虑其他因素的影响时,有如下基本回归模型:Y i=β0+β1X i+μi有奖学金1 来自城市无奖学金0 来自农村来自发达地区 1 男性0 来自欠发达地区0 女性Y i=β0+β1X i+α1D1i+α2D2i+α3D3i+α4D4i+μi由此回归模型,可得如下各种情形下学生的平均消费支出:(1) 来自欠发达农村地区的女生,未得到奖学金时的月消费支出:E(Y i|= X i, D1i=D2i=D3i=D4i=0)=β0+β1X i(2) 来自欠发达城市地区的男生,得到奖学金时的月消费支出:E(Y i|= X i, D1i=D4i=1,D2i=D3i=0)=(β0+α1+α4)+β1X i(3) 来自发达地区的农村女生,得到奖学金时的月消费支出:E(Y i |= X i , D 1i =D 3i =1,D 2i =D 4i =0)=(β0+α1+α3)+β1X i (4) 来自发达地区的城市男生,未得到奖学金时的月消费支出: E(Y i |= X i ,D 2i =D 3i =D 4i =1, D 1i =0)= (β0+α2+α3+α4)+β1X i5. 研究进口消费品的数量Y 与国民收入X 的模型关系时,由数据散点图显示1979年前后Y 对X 的回归关系明显不同,进口消费函数发生了结构性变化:基本消费部分下降了,而边际消费倾向变大了。
第八章虚拟解释变量回归第一节虚拟变量一、虚拟变量的差不多概念在前面的分析中,被说明变量要紧受到一些能够直截了当度量的变量阻碍,如收入、产出、商品需求量、价格、成本、资金、人数等。
但现实经济生活中,阻碍被说明变量变动的因素,除了这些能够直截了当获得实际观测数据的定量变量外,还包括一些本质上为定性因素(或称属性因素)的阻碍,例如性别、种族、肤色、职业、季节、文化程度、战争、自然灾难、政府经济政策的变动等因素。
在实际经济分析中,这些定性变量有时具有不可忽视的重要阻碍。
例如,研究某个企业的销售水平,产业部门(制造业、零售业)、所有制(私营、非私营)、地理位置(东、中、西部)、治理者素养的高低等是值得经常考虑的阻碍因素,这些因素有共同的特点,即差不多上表示某种属性的,不能直截了当用数据精确描述的因素。
因此,被说明变量的变动经常是定量因素和属性因素共同作用的结果。
在计量经济模型中,应当同时包含定量和属性两种因素对被说明变量的阻碍作用。
定量因素是指那些可直截了当测度的数值型因素,如GDP、M2等。
定性因素,或称为属性因素,是不能直截了当测度的、说明某种属性或状态存在与否的非数值型因素,如男性或女性、都市居民或非都市居民、气候条件正常或专门、政府经济政策不变与改革等。
在计量经济学的建模中应当将定量因素和定性因素同时纳入模型之内。
为了在模型中反映定性因素,能够将定性因素转化为虚拟变量去表现。
虚拟变量(或称为属性变量、双值变量、类型变量、定性变量、二元型变量等),是人工构造的取值为0和1的作为属性变量代表的变量,一样用字母D(或DUM,英文dummy的缩写)表示。
属性因素通常具有若干类型或水平,通常虚拟变量的取值为0和1,当虚拟变量取值为0,即D=0时,表示某种属性或状态不显现或不存在,即不是某种类型;当虚拟变量取值为1,即D=1时,表示某种属性或状态显现或存在,即是某种类型。
例如,构造政府经济政策人工变量,当经济政策不变时,虚拟变量取值为0,当经济政策改变时,虚拟变量取值为1。
第八章 虚拟变量回归一、判断题1.虚拟变量只能作为解释变量。
(F )2. 引入虚拟变量后,用普通最小二乘法得到的估计量仍是无偏的。
( T )3.引入虚拟变量的个数与模型有无截距项无关。
(F )4.虚拟变量用来表示某些具有若干属性的变量。
(T )5.引入虚拟变量的个数与样本容量大小有关。
(F )二、单项选择题1.设消费函数011t t t y a a D b x u =+++,其中虚拟变量10D ⎧=⎨ ⎩东中部西部,如果统计检验表明10a =成立,则东中部的消费函数与西部的消费函数是( D )。
A. 相互平行的B. 相互垂直的C. 相互交叉的D. 相互重叠的2.虚拟变量( A )A.主要来代表质的因素,但在有些情况下可以用来代表数量因素B.只能代表质的因素C.只能代表数量因素D.只能代表季节影响因素3.分段线性回归模型的几何图形是( D )A. 平行线B. 垂直线C. 光滑曲线D. 折线4.如果一个回归模型中(包含截距项),对一个具有m 个特征的质的因素要引入虚拟变量数目为( B )。
A.mB.m-1C.m-2D.m+15.设某商品需求模型为01t t t y b b x u =++,其中Y 是商品的需求量,X 是商品的价格,为了考虑全年12个月份季节变动的影响,假设模型中引入了12个虚拟变量,则会产生的问题为( D )。
A .异方差性B .序列相关C .不完全的多重共线性D .完全的多重共线性6.设消费函数为i i i 33i 22i 11o i u bx D D D y +++++=αααα,其中y 为消费,x 为收入,虚拟变量⎩⎨⎧=⎩⎨⎧=⎩⎨⎧=其他季度第三季度,其他季度第二季度,其他季度第一季度 0 0 0 321D 1D 1D 1,该模型中包含了几个定性影响因素?( A )。
A.1B. 2C. 3D. 47. 设消费函数为i i i o i u Dx b x b D y ++++=101αα,其中虚拟变量⎩⎨⎧=农村家庭城镇家庭 0 1D ,当统计检验表明下列哪项成立时,表示城镇家庭与农村家庭有一样的消费行为( A )。
第八章 相关分析与回归分析习题参考答案一、名词解释函数关系:函数关系亦称确定性关系,是指变量(现象)之间存在的严格确定的依存关系。
在这种关系中,当一个或几个相互联系的变量取一定的数值时,必定有另一个且只有一个变量有确定的值与之对应。
相关关系:是指变量(现象)之间存在着非严格、不确定的依存关系。
在这种关系中,当一个或几个相互联系的变量取一定的数值时,可以有另一变量的若干数值与之相对应。
这种关系不能用完全确定的函数来表示。
相关分析:相关分析主要是研究两个或者两个以上随机变量之间相互依存关系的方向和密切程度的方法,直线相关用相关系数表示,曲线相关用相关指数表示,多元相关用复相关系数表示。
回归分析:回归分析是研究某一随机变量关于另一个(或多个)非随机变量之间数量关系变动趋势的方法。
其目的在于根据已知非随机变量来估计和预测随机变量的总体均值。
单相关:单相关是指仅涉及两个变量的相关关系。
复相关:复相关是指一个变量对两个或者两个以上其他变量的相关关系。
正相关:正相关是指两个变量的变化方向是一致的,当一个变量的值增加(或减少)时,另一变量的值也随之增加(或减少)。
负相关:负相关是指两个变量的变化方向相反,即当一个变量的值增加(或减少)时,另一个变量的值会随之减少(或增加)。
线性相关:如果相关的两个变量对应值在直角坐标系中的散点图近似呈一条直线,则称为线性相关。
非线性相关:如果相关的两个变量对应值在直角坐标系中的散点图近似呈现出某种曲线形式,则为非线性相关。
相关系数:相关系数是衡量变量之间线性相关密切程度及相关方向的统计分析指标。
取值在-1到1之间。
两个变量之间的简单样本相关系数的计算公式为:()()niix x y y r --∑二、单项选择1.B;2.D;3.D;4.C;5.A;6.D 。
三、判断题(正确的打“√”,错误的打“×”) 1.×; 2.×; 3.√; 4.×; 5.×; 6.×; 7.×; 8.√. 四、简答题1、什么是相关关系?相关关系与函数关系有什么区别?答:相关关系,是指变量(现象)之间存在着非严格、不确定的依存关系。
第八章虚拟变量回归作业及答案一单选题1、设某地区消费函数中,消费支出不仅与收入x有关,而且与消费者的年龄构成有关,若将年龄构成分为小孩、青年人、成年人和老年人4个层次。
假设边际消费倾向不变,考虑上述年龄构成因素的影响时,该消费函数引入虚拟变量的个数为( C )。
A. 1个B. 2个C. 3个D. 4个2、对于含有截距项的计量经济模型,若想将含有m个互斥类型的定性因素引入到模型中,则应该引入虚拟变量个数为( B )。
A.mB.m-1C.m+1D.m-k3、对于一个不包含截距项的回归模型,若将一个具有m个特征的质的因素引入进计量经济模型,则虚拟变量数目为( A ) 。
A.mB.m-1C.m-2D.m+14、在利用月度数据构建计量经济模型时,如果一年里的1、3、5三个月表现出季节模式,则应该引入虚拟变量个数为( A )。
A.3B.12C.11D.75、设某计量经济模型为:Yi=a+b*Di+ui,其中Yi表示大学教授年薪,D为虚拟变量,D=1:男教授;D=0:女教授。
对于参数b的含义,下列解释正确的是( C )。
A. b表示大学女教授的平均年薪B. b表示大学男教授的平均年薪C. b表示大学男教授与女教授平均年薪的差异D. b表示大学男教授和女教授平均年薪6、当质的因素引进经济计量模型时,需要使用( D )。
A.外生变量B.前定变量C.内生变量D.虚拟变量7、某商品需求函数为Yi=a+b*Xi+ui,其中Y为需求量,X为价格。
为了考虑“地区”(农村、城市)和“季节”(春、夏、秋、冬)两个因素的影响,拟引入虚拟变量,则应引入虚拟变量的个数为( B )。
A.2B.4C.5D.6二多选题1、关于虚拟变量,下列表述正确的有( ABC )A.是质的因素的数量化 B.可取值为l和0C.代表质的因素 D.代表数量因素2、虚拟变量的特殊作用有( BCD )A.检验模型结构的显著性 B.检验模型结构的稳定性C.分段回归 D.混合回归3、虚拟变量的取值为0和1,分别代表某种属性的存在与否,其中( BC )A. 0表示存在某种属性B.0表示不存在某种属性C. 1表示存在某种属性D.0和1代表的内容可以随意设定4、下面关于虚拟变量的引入方式的说法,正确的有( AD )A.以加法方式引入虚拟变量,反映的是定性因素对截距的影响B.以加法方式引入虚拟变量,反映的是定性因素对斜率的影响C.以乘法方式引入虚拟变量,反映的是定性因素对截距的影响D.以乘法方式引入虚拟变量,反映的是定性因素对斜率的影响5、关于虚拟变量,下列说法正确的是( AC )。
第八章 虚拟变量回归一、判断题1。
虚拟变量只能作为解释变量.(F)2。
引入虚拟变量后,用普通最小二乘法得到的估计量仍是无偏的。
( T )3.引入虚拟变量的个数与模型有无截距项无关.(F )4。
虚拟变量用来表示某些具有若干属性的变量.(T)5。
引入虚拟变量的个数与样本容量大小有关。
(F )二、单项选择题1.设消费函数011t t t y a a D b x u =+++,其中虚拟变量10D ⎧=⎨⎩东中部西部,如果统计检验表明10a =成立,则东中部的消费函数与西部的消费函数是( D ).A. 相互平行的 B 。
相互垂直的 C. 相互交叉的 D 。
相互重叠的2.虚拟变量( A )A 。
主要来代表质的因素,但在有些情况下可以用来代表数量因素B 。
只能代表质的因素C 。
只能代表数量因素D.只能代表季节影响因素3。
分段线性回归模型的几何图形是( D )A 。
平行线 B. 垂直线 C 。
光滑曲线 D. 折线4.如果一个回归模型中(包含截距项),对一个具有m 个特征的质的因素要引入虚拟变量数目为( B ).A.m B 。
m-1 C 。
m —2 D.m+15.设某商品需求模型为01t t t y b b x u =++,其中Y 是商品的需求量,X 是商品的价格,为了考虑全年12个月份季节变动的影响,假设模型中引入了12个虚拟变量,则会产生的问题为( D )。
A .异方差性B .序列相关C .不完全的多重共线性D .完全的多重共线性6.设消费函数为i i i 33i 22i 11o i u bx D D D y +++++=αααα,其中y 为消费,x 为收入,虚拟变量⎩⎨⎧=⎩⎨⎧=⎩⎨⎧=其他季度第三季度,其他季度第二季度,其他季度第一季度 0 0 0 321D 1D 1D 1,该模型中包含了几个定性影响因素?( A )。
A 。
1B 。
2C 。
3D 。
47。
设消费函数为i i i o i u Dx b x b D y ++++=101αα,其中虚拟变量⎩⎨⎧=农村家庭城镇家庭 0 1D ,当统计检验表明下列哪项成立时,表示城镇家庭与农村家庭有一样的消费行为( A ).A 。
思考题答案第一章绪论思考题1.1怎样理解产生于西方国家的计量经济学能够在中国的经济理论研究和现代化建设中发挥重要作用?答:计量经济学的产生源于对经济问题的定量研究,这是社会经济发展到一定阶段的客观需要。
计量经济学的发展是与现代科学技术成就结合在一起的,它反映了社会化大生产对各种经济因素和经济活动进行数量分析的客观要求。
经济学从定性研究向定量分析的发展,是经济学逐步向更加精密、更加科学发展的表现。
我们只要坚持以科学的经济理论为指导,紧密结合中国经济的实际,就能够使计量经济学的理论与方法在中国的经济理论研究和现代化建设中发挥重要作用。
1.2理论计量经济学和应用计量经济学的区别和联系是什么?答:计量经济学不仅要寻求经济计量分析的方法,而且要对实际经济问题加以研究,分为理论计量经济学和应用计量经济学两个方面。
理论计量经济学是以计量经济学理论与方法技术为研究内容,目的在于为应用计量经济学提供方法论。
所谓计量经济学理论与方法技术的研究,实质上是指研究如何运用、改造和发展数理统计方法,使之成为适合测定随机经济关系的特殊方法。
应用计量经济学是在一定的经济理论的指导下,以反映经济事实的统计数据为依据,用计量经济方法技术研究计量经济模型的实用化或探索实证经济规律、分析经济现象和预测经济行为以及对经济政策作定量评价。
1.3怎样理解计量经济学与理论经济学、经济统计学的关系?答:1、计量经济学与经济学的关系。
联系:计量经济学研究的主体—经济现象和经济关系的数量规律;计量经济学必须以经济学提供的理论原则和经济运行规律为依据;经济计量分析的结果:对经济理论确定的原则加以验证、充实、完善。
区别:经济理论重在定性分析,并不对经济关系提供数量上的具体度量;计量经济学对经济关系要作出定量的估计,对经济理论提出经验的内容。
2、计量经济学与经济统计学的关系。
联系:经济统计侧重于对社会经济现象的描述性计量;经济统计提供的数据是计量经济学据以估计参数、验证经济理论的基本依据;经济现象不能作实验,只能被动地观测客观经济现象变动的既成事实,只能依赖于经济统计数据。
对外经济贸易大学计量经济学I n t r o d u c t i o n t o E c o n o m e t r i c s导论虚拟变量的定义与含单个虚拟变量的回归定性信息在前面的章节中,我们见到的变量都是用来描述定量信息的,比如考试分数,生师比,工资,股本回报率等等;然而,在经济学研究中,往往有很多的定性信息,比如性别,地域,种族,是否实施某项政策等等。
在模型中引入定性信息需要用到虚拟变量。
虚拟变量虚拟变量是值为0或1的变量例1:Male i= 1如果工人i为男性0如果工人i为女性例2:South i= 1如果国家i为南方国家0如果国家i为北方国家因此,虚拟变量也叫二元变量 (Binary Variable)或者哑元变量(Dummy Variable)。
带定性变量的数据名称应反映编码值二元变量的名称应反映变量的定义。
例如,名为“性别”的变量不清楚哪一个是1,而变量名称“Female”则更清楚。
不同的定义方式有不同的解释。
两个组别的定性变量可以使用一个二元变量,多个组别的定性变量应该使用一组二元变量。
含有一个虚拟自变量的回归例:工资的性别差异定义一个虚拟变量femalewage= β0+β1edu+δ0femaleE wage edu,female=0=β0+β1eduE wage edu,female=1=(β0+δ0)+β1edu工资的性别差异δ0可视为给定教育水平的情况下,女性与男性的平均工资之差。
含有一个虚拟自变量的回归一般地,考虑一个带有一个连续变量(x)和一个虚拟(d)的简单模型。
y = b0 + d0d + b1x + uE y x,d=0=β0+β1xE y x,d=1=(β0+δ0)+β1x因此δ0=E y x,d=1−E y x,d=0可以解释成为两个组别的均值之差,其中d =0的组为基准组。
基准组与比较组在上述例子中,female i= 1如果工人i为女性0如果工人i为男性男性是基准组,女性是比较组,δ0可视为给定教育水平的情况下,女性与男性的平均工资之差。
第八章虚拟变量回归第一节虚拟变量一、虚拟变量的基本概念在前面的分析中,被解释变量主要受到一些可以直接度量的变量影响,如收入、产出、商品需求量、价格、成本、资金、人数等。
但现实经济生活中,影响被解释变量变动的因素,除了这些可以直接获得实际观测数据的定量变量外,还包括一些本质上为定性因素(或称属性因素)的影响,例如性别、种族、肤色、职业、季节、文化程度、战争、自然灾害、政府经济政策的变动等因素。
在实际经济分析中,这些定性变量有时具有不可忽视的重要影响。
例如,研究某个企业的销售水平,产业部门(制造业、零售业)、所有制(私营、非私营)、地理位置(东、中、西部)、管理者素质的高低等是值得经常考虑的影响因素,这些因素有共同的特征,即都是表示某种属性的,不能直接用数据精确描述的因素。
因此,被解释变量的变动经常是定量因素和属性因素共同作用的结果。
在计量经济模型中,应当同时包含定量和属性两种因素对被解释变量的影响作用。
定量因素是指那些可直接测度的数值型因素,如GDP、M2 等。
定性因素,或称为属性因素,是不能直接测度的、说明某种属性或状态存在与否的非数值型因素,如男性或女性、城市居民或非城市居民、气候条件正常或异常、政府经济政策不变与改革等。
在计量经济学的建模中应当将定量因素和定性因素同时纳入模型之内。
为了在模型中反映定性因素,可以将定性因素转化为虚拟变量去表现。
虚拟变量(或称为属性变量、双值变量、类型变量、定性变量、二元型变量等),是人工构造的取值为0 和1 的作为属性变量代表的变量,一般用字母D (或DUM ,英文dummy 的缩写)表示。
属性因素通常具有若干类型或水平,通常虚拟变量的取值为0和1,当虚拟变量取值为0,即D=0 时,表示某种属性或状态不出现或不存在,即不是某种类型;当虚拟变量取值为1,即D=1 时,表示某种属性或状态出现或存在,即是某种类型。
例如,构造政府经济政策人工变量,当经济政策不变时,虚拟变量取值为0,当经济政策改变时,虚拟变量取值为1。
这种做法实际上是一种变换或映射,将不能精确计量的定性因素的水平或状态变换为用0 和1 来定量描述。
二、虚拟变量的设置规则在计量经济学模型中引入虚拟变量,可以使我们同时兼顾定量因素和定性因素的影响和作用。
但是,在设置虚拟变量时应遵循一定的规则。
1、虚拟变量数量的设置规则虚拟变量个数的设置规则是:若定性因素有m 个相互排斥的类型(或属性、水平),在有截距项的模型中只能引入m-1 个虚拟变量,否则会陷入所谓“虚拟变量陷阱”,产生完全的多重共线性。
在无截距项的模型中,定性因素有m个相互排斥的类型时,引入m个虚拟变量不会导致完全多重共线性,不过这时虚拟变量参数的估计结果,实际上是D=1 时的样本均值。
例如,城镇居民和农村居民住房消费支出的模型可设定为:其 中 , C i 为 居 民 的 住 房 消 费 支 出 , Y i 为 居 民 的 可 支 配 收 入 , D i 为 虚 拟 变 量 ,D i1 城镇居民,即当 D i 1时为城镇居民; 当 D i 0 时为其他 (农村居民)。
这里区分城Di0 其他i i镇居民和农村居民的定性变量的类型有 m=2 个,按虚拟变量的设置规则应引入m - 1=2-1=1 个虚拟变量。
1 城镇居民 ,1 农村居民,其他D 3i0 其他3D 3i u i( 8.2)这时,当 D 2i =1 时同时有 D 3i =0;反之,当 D 2i =0 时有 D 3i =1。
即对于任何被调查的居民家庭都有D 2i + D 3i =1 , D 2和D 3存在完全的共线性,无法利用OLS 估计其参数,从而陷入“虚 拟变量陷阱” 。
由此,所谓的 “虚拟变量陷阱 ”的实质是出现完全多重共线性。
可见,虚拟变 量有其积极作用的一面, 也有不良影响的一面, 引入的虚拟变量适当, 则发挥了积极的作用, 引入的虚拟变量过度,则会带来负面的影响。
2、虚拟变量的 “0”和“1”的选取原则虚拟变量取“ 1”或“ 0”的原则,应从分析问题的目的出发予以界定。
从理论上讲,虚 拟变量取“ 0”值通常代表为比较的基础类型;而虚拟变量取“1 ”值通常代表为被比较的类型。
例如, 引入政府经济政策的变动对被解释变量的影响时, 由于此时的比较是在政府经济 政策不变的基础上进行的,故虚拟变量确定为:1 基础类型 : 政府经济政策变动D t0 比较类型 : 政府经济政策不变三、虚拟变量的作用 在计量经济模型中,虚拟变量可以发挥多方面的作用: (1) 可以作为属性因素的代表,如性别、所有制等;(2) 作为某些非精确计量的数量因素的代表,如受教育程度、管理者素质等; (3) 作为某些偶然因素或政策因素的代表,如战争、灾害、改革前后等; (4) 还可以作为时间序列分析中季节(月份)的代表;C iY i2D i ui8.1)但是,如果引入了 m=2 个虚假变量: D 2i则有:Ci 1 Yi2D2i(5)可以实现分段回归,研究斜率、截距的变动,或比较两个回归模型的结构差异。
在计量经济学中,把包含有虚拟变量的模型称为虚拟变量模型。
常用的虚拟变量模型有三种类型:(1)解释变量中只包含虚拟变量,作用是在假定其他因素都不变时,只研究定性变量是否使被解释变量表现出显著差异;(2)解释变量中既含定量变量,又含虚拟变量,研究定量变量和虚拟变量同时对被解释变量的影响;(3)被解释变量本身为虚拟变量的模型,是被解释变量本身取值为0或1的模型,适于对某社会经济现象进行“是”与“否”的判断研究。
特别要注意的是,定型或属性变量,通常由1 个以上的虚拟变量描述。
例如,分析考证区域这样一个定性因素的影响时,若将区域因素划分为东、中、西三种属性时,在有截距项的回归模型中,只能引人2 个虚拟变量,而这两个虚拟变量只是描述了1 个定性因素(区域因素),而不是2 个定性因素。
当然,当定性因素为性别因素时,1 个虚拟变量就描述了1 个定性因素。
第二节虚拟解释变量的回归在计量经济模型中,加入虚拟解释变量的途径有两种基本类型:一是加法类型;二是乘法类型。
不同的途径引入虚拟变量有不同的作用,加法方式引入虚拟变量改变的是截距;乘法方式引入虚拟变量改变的是斜率。
一、用虚拟变量表示不同截矩的回归——加法类型以加法类型引入虚拟解释变量的模型,如(8.3)式那样,Y t 1 2X t 3D u t (8.3)在(8.3)所设定的计量经济模型中,虚拟解释变量与其他解释变量是相加关系。
以加法形式引入虚拟解释变量,从计量经济模型的意义看,其作用是改变了设定模型的截距水平。
以加法方式引入虚拟变量时,分为四种情形:(1)解释变量只有一个分为两种相互排斥类型的定性变量而无定量变量;(2)解释变量包含一个定量变量和一个分为两种类型的定性变量;(3)解释变量包含一个定量变量和一个两种以上类型的定性变量;(4)解释变量包含一个定量变量和两个定性变量。
1、解释变量只有一个分为两种相互排斥类型的定性变量而无定量变量的回归这种情况的模型又被称为方差分析模型,例如(8.4)式Y i D i u i 8.4)其中, Y i 为居民的年可支配收入, D i 为虚拟解释变量, D i =1 代表城镇居民; D i =0 代表非 城镇居民。
8.4)式的意义是,假设其他因素(包括文化程度、职业、性别等)保持不变的条件有:其中:Y :消费支出;x :收入;D i 0城镇居民模型( 8.7)的意义在于描述收入和城乡差别对居民消费支出的影响。
量解释变量 X 和一个分为两种类型的虚拟解释变量组成。
注意这里一个定性变量具有两种 类型,只使用了一个虚拟变量。
当( 8.7)式中的 u i 服从古典假定时,有:基础类型: 农村居民消费支出: E Y i |x i ,D i 0 1 x i(8.8)比较类型: 城镇居民消费支出: E Y i |x i ,D i 1 ( 1 2) x i (8.9) 其中 1为差异截距系数。
( 8.7)式可图示为 8.1,表明非城镇居民与城镇居民两种类型收入函数的斜率相同(均 为 ),而截距水平不同。
这说明,城镇居民和非城镇居民在消费支出水平上,存在着规模下,研究城镇居民和非城镇居民的收入是否存在差别。
当u i 满足古典假设时,由式( 8.4)非城镇居民的年平均收入: E (Y i |D i 0)(8.5) 城镇居民的年平均收入:E(Y i | D i 1)8.6)即在( 8.4)式中,截距项给出了非城镇居民的年平均可支配收入水平,而另一系数表明城镇居民年平均可支配水平不同于非城镇居民年平均可支配收入的部分。
由式( 8.5)和(8.6)可知,虚拟解释变量的作用是改变设定模型的截距水平。
为了检验城镇居民和非城镇居民的年均可支配收入是否有显著差别,可构造假设H 0:0 ,即城镇与非城镇居民年均可支配收入无差别。
对式(8.4)回归,依据估计值的 t检验是否显著,可作出接受或不能接受H 0假设的判断。
2、解释变量包含一个定量变量和一个分为两种类型定性变量的回归例如Yi 1 2D iXi i8.7)8.7)式由一个定为1的差异,而由收入因素而产生的平均消费支出水平变化却是相同的。
-a20X图8.1城镇农村居民消费支出水平的差异在H 0 : 1 0的假设下,对参数1估计值的t检验,可以进行消费支出是否存在城乡差异的检验。
3、解释变量包含一个定量变量和一个两种以上类型的定性变量的回归考虑以下模型:显然,模型( 8.9)是描述居民的年医疗保健费用支出与居民可支配收入(定量变量) 和受教育程度(定性变量)间的因果关系。
这里,定性因素(受教育的程度)划分为三种类 型;高中以下、高中、大专及大专以上。
注意这里的定性变量有 3 种类型,依据虚拟变量设 置规则引入了 m - 1=3- 1=2 个虚拟变量,而且一个定性变量多种类型时,虚拟变量可同时 取值为 0,但不能同时取值为 1,因为同一定性变量的各种类型间 “非此即彼 ”。
当式( 8.10)服从古典假定时,有: 基础类型: 高中以下教育:E(Y i | X i ,D 2 0,D 3 0) 1X 1(8.11)比较类型: 高中教育:E(Y i |X i ,D 21,D 30) ( 12)X i (8.12)大专及大专以上 : E(Y i | X i ,D 2 0,D 3 1) ( 13)X i(8.13)这表明,三种不同教育程度居民的医疗保健费用年均支出的起点水平(截距)不同,差异截距系数为 2和3。
对式(8.10)进行回归,检验 H 。
: 2 0和H 。
: , 0的t 检验可 以发现与比较基准组 (高中以下教育水平) 相比, 另两种类型截距的差异在统计上是否存在 显著差异。
关于 2 3 0 的联合假设检验,也可由方差分析或F 检验完成。