计量经济学 · 期末复习
计算题全题型(12种)
一元OLS参数估计第二章 · 必考
- 计算 $\sum X_i$、$\sum Y_i$、$\sum X_i^2$、$\sum Y_i^2$、$\sum X_iY_i$、$n$
- 计算 $\bar{X} = \sum X_i/n$,$\bar{Y} = \sum Y_i/n$
- 代入公式求 $\hat{\beta}_2$(斜率)
- 代入 $\hat{\beta}_1 = \bar{Y} - \hat{\beta}_2\bar{X}$ 求截距
- 写出回归方程:$\hat{Y}_i = \hat{\beta}_1 + \hat{\beta}_2 X_i$
已知 $n=10$,$\sum X=350$,$\sum Y=285$,$\sum X^2=13850$,$\sum XY=10820$。求OLS估计。
β̂₂ = (10×10820 - 350×285) / (10×13850 - 350²) = (108200-99750)/(138500-122500) = 8450/16000 = 0.528
β̂₁ = 285/10 - 0.528×350/10 = 28.5 - 18.48 = 10.02
回归方程:$\hat{Y} = 10.02 + 0.528X$
拟合优度 $R^2$ 与 t检验第二章 · 必考
- 算 $TSS = \sum Y^2 - (\sum Y)^2/n$
- 算残差 $e_i = Y_i - \hat{Y}_i$,求 $RSS = \sum e_i^2$
- $ESS = TSS - RSS$,$R^2 = ESS/TSS$
- $\hat{\sigma}^2 = RSS/(n-2)$(自由度 $n-2$)
- $Se(\hat{\beta}_2) = \sqrt{\hat{\sigma}^2 / \sum(X-\bar{X})^2}$
- $t = \hat{\beta}_2 / Se(\hat{\beta}_2)$,与 $t_{\alpha/2}(n-2)$ 比较
$n=20$,$TSS=500$,$RSS=80$。求 $R^2$,判断 $\hat{\beta}_2=0.8$,$\sum(X-\bar{X})^2=200$ 是否显著($\alpha=0.05$)。
R² = 1 - 80/500 = 0.84
σ̂² = 80/(20-2) = 4.444
Se(β̂₂) = √(4.444/200) = √0.0222 = 0.149
t = 0.8/0.149 = 5.37 > t₀.₀₂₅(18)=2.101 → 显著
多元F检验与调整 $R^2$第三章 · 高频
- 确定 $k$ = 参数总个数(含截距项),一元回归 $k=2$,$n$ = 样本量
- 算 $ESS$、$RSS$,或直接用 $R^2$
- $F = (ESS/(k-1)) / (RSS/(n-k))$
- 与 $F_\alpha(k-1, n-k)$ 比较,或看P值
- $\bar{R}^2 = 1 - (1-R^2)(n-1)/(n-k)$
$n=30$,$k=4$(3个解释变量+截距),$R^2=0.75$。求F统计量和调整 $R^2$,判断方程整体显著性。
F = (0.75/3) / (0.25/26) = 0.25 / 0.00962 = 26.0
R̄² = 1 - (1-0.75)×29/26 = 1 - 0.2788 = 0.721
$F=26.0 > F_{0.05}(3,26)\approx2.98$ → 方程整体显著
DW检验与 $\rho$ 估计第五章 · 必考
- OLS回归得残差 $e_t$
- 算 $DW = \sum(e_t-e_{t-1})^2 / \sum e_t^2$
- $\hat{\rho} \approx 1 - DW/2$
- 查DW表得 $d_L$、$d_U$(由 $n$ 和 $k'$ 查表)
- 按决策区域判断:$DW
4-d_L$ 负自相关;中间为不确定
$n=25$,$k'=2$(解释变量个数),$DW=0.85$。查表 $d_L=1.21$,$d_U=1.55$。判断自相关。
ρ̂ ≈ 1 - 0.85/2 = 0.575(正自相关)
$DW=0.85 < d_L=1.21$ → 存在正自相关
G-Q检验(异方差)第四章 · 高频
- 按解释变量 $X$ 从小到大排序
- 去掉中间 $c = n/4$ 个观测值
- 剩余分两组:小X组($n_1$个)和大X组($n_2$个),$n_1=n_2=(n-c)/2$
- 两组分别做OLS,得 $RSS_1$(小X组)和 $RSS_2$(大X组)
- $F = [RSS_2/(n_2-k)] / [RSS_1/(n_1-k)]$
- $F > F_\alpha$ → 存在递增型异方差
$n=30$,$k=2$(含常数项),排序去中间8个,每组11个。$RSS_1=120$,$RSS_2=450$。$\alpha=0.05$,$F_{0.05}(9,9)=3.18$。
F = [450/(11-2)] / [120/(11-2)] = 50/13.33 = 3.75
$F=3.75 > 3.18$ → 存在递增型异方差
White检验(异方差)第四章 · 高频
- 原模型OLS得残差 $e_i$
- 做辅助回归:$e_i^2$ 对常数项、所有 $X_j$、$X_j^2$、$X_jX_l$(交叉项)回归
- 得辅助回归的 $R^2$
- 统计量 $LM = nR^2$
- $nR^2 > \chi^2_\alpha(q)$ → 存在异方差
模型 $Y=\beta_1+\beta_2X_2+\beta_3X_3+u$,$n=40$。辅助回归 $e^2$ 对 $1,X_2,X_3,X_2^2,X_3^2,X_2X_3$ 回归得 $R^2=0.35$。$q=5$,$\chi^2_{0.05}(5)=11.07$。
nR² = 40×0.35 = 14.0 > 11.07 → 存在异方差
VIF检验(多重共线性)第六章 · 高频
- 对每个解释变量 $X_j$,将其对其他所有解释变量(含常数项)做OLS回归
- 得 $R_j^2$
- 算 $VIF_j = 1/(1-R_j^2)$
- 判断:$VIF > 10$(或 $>5$)→ 存在严重多重共线性
- 容忍度 $Tolerance < 0.1$(或 $<0.2$)同样提示严重共线性
模型含 $X_1,X_2,X_3$。$X_1$ 对 $X_2,X_3$ 回归得 $R_1^2=0.92$;$X_2$ 对 $X_1,X_3$ 回归得 $R_2^2=0.78$;$X_3$ 对 $X_1,X_2$ 回归得 $R_3^2=0.85$。
VIF₁ = 1/(1-0.92) = 12.5 > 10
VIF₂ = 1/(1-0.78) = 4.55 < 10
VIF₃ = 1/(1-0.85) = 6.67 < 10
$VIF_1=12.5>10$ → $X_1$ 存在严重多重共线性,考虑剔除 $X_1$
阶条件判断识别第八章 · 必考
$K$=前定变量总数,$k$=该方程前定变量数,$m$=该方程内生变量数
- 列出模型所有方程,确定 $M$(内生变量总数)和 $K$(前定变量总数)
- 对每个方程,数 $m$(该方程含有的内生变量数)和 $k$(该方程含有的前定变量数)
- 算 $K-k$(该方程不包含的前定变量数)
- 比较 $K-k$ 与 $m-1$:
- $K-k < m-1$ → 不可识别
- $K-k = m-1$ → 恰好识别 → 用ILS估计
- $K-k > m-1$ → 过度识别 → 用2SLS估计
模型:$C_t = \alpha_0 + \alpha_1 Y_t + \mu_{1t}$(消费方程),$I_t = \beta_0 + \beta_1 Y_t + \beta_2 Y_{t-1} + \mu_{2t}$(投资方程),$Y_t = C_t + I_t + G_t$(恒等式)。内生变量 $M=3$($C,I,Y$),前定变量 $K=3$(常数项、$Y_{t-1}$、$G_t$)。
消费方程:$m=2$($C,Y$),$k=1$(常数项),$K-k=2$,$m-1=1$ → $2>1$ → 过度识别 → 2SLS
投资方程:$m=2$($I,Y$),$k=2$(常数项、$Y_{t-1}$),$K-k=1$,$m-1=1$ → $1=1$ → 恰好识别 → ILS
广义差分法(自相关修正)第五章 · 高频
- OLS回归得DW值,算 $\hat{\rho} \approx 1 - DW/2$
- 对所有变量做广义差分变换:$Y_t^* = Y_t - \hat{\rho}Y_{t-1}$,$X_t^* = X_t - \hat{\rho}X_{t-1}$
- 变换后模型:$Y_t^* = \beta_1^* + \beta_2 X_t^* + \varepsilon_t$,其中 $\beta_1^* = \beta_1(1-\hat{\rho})$
- 对变换后模型做OLS,得 $\hat{\beta}_1^*$ 和 $\hat{\beta}_2$
- 还原:$\hat{\beta}_1 = \hat{\beta}_1^* / (1-\hat{\rho})$
- 样本量减少1(第一个观测值丢失),可用普莱斯-温斯特变换补充
$DW=0.6$,$\hat{\rho}=1-0.3=0.7$。原模型 $Y_t=\beta_1+\beta_2X_t+u_t$。变换后:$Y_t^*=Y_t-0.7Y_{t-1}$,$X_t^*=X_t-0.7X_{t-1}$。对 $Y_t^*=\beta_1^*+\beta_2X_t^*+\varepsilon_t$ 做OLS得 $\hat{\beta}_1^*=2.1$,$\hat{\beta}_2=0.45$。
β̂₁ = 2.1/(1-0.7) = 2.1/0.3 = 7.0
最终模型:$\hat{Y}_t = 7.0 + 0.45X_t$
WLS加权最小二乘(异方差修正)第四章 · 高频
- 由Glejser检验确定异方差形式 $Var(u_i)=\sigma^2 f(X_i)$(如 $f(X_i)=X_i^2$)
- 所有权重 $w_i = 1/\sqrt{f(X_i)}$
- 对所有变量做变换:$Y_i^*=Y_i/\sqrt{f(X_i)}$,$X_i^*=X_i/\sqrt{f(X_i)}$,常数项也要变换为 $1/\sqrt{f(X_i)}$
- 对变换后模型 $Y_i^* = \beta_1 X_{0i}^* + \beta_2 X_i^* + u_i^*$ 做OLS(此时 $u_i^*$ 同方差)
- 注意:变换后模型无单独常数项,常数项的系数就是 $\hat{\beta}_1$
Glejser检验得 $|e_i| = 0.5 + 0.3X_i$,近似 $Var(u_i)\propto X_i^2$,即 $f(X_i)=X_i^2$。权重 $w_i=1/X_i$。
变换:$Y_i^*=Y_i/X_i$,$X_i^*=X_i/X_i=1$,常数项变换为 $1/X_i$。
对 $Y_i/X_i = \beta_1(1/X_i) + \beta_2 + u_i/X_i$ 做OLS,注意此时 $\beta_2$ 变成了常数项。
虚拟变量模型第七章 · 高频
$D=0$:$Y=\beta_1+\beta_2X$;$D=1$:$Y=(\beta_1+\alpha)+(\beta_2+\gamma)X$
- 判断模型类型:加法(仅 $\alpha D$,截距不同)、乘法(仅 $\gamma XD$,斜率不同)、混合(都有,截距斜率都不同)
- 分别写出 $D=0$ 和 $D=1$ 时的回归方程
- 解释系数:$\alpha$ = 截距差,$\gamma$ = 斜率差
- 注意虚拟变量陷阱:$m$ 个类别只能引入 $m-1$ 个虚拟变量
- 不设虚拟变量的组为基准组(对照组)
模型 $\hat{Y}=120 + 0.8X + 15D + 0.3(XD)$,$D=1$ 为城镇,$D=0$ 为农村。
农村($D=0$):$\hat{Y}=120+0.8X$
城镇($D=1$):$\hat{Y}=(120+15)+(0.8+0.3)X=135+1.1X$
城镇组截距高15,斜率高0.3(即城镇的X对Y的边际效应更大)。
预测与区间估计第二章 · 一般
- 代入 $X_0$ 做点预测 $\hat{Y}_0$
- 算 $Se(\hat{Y}_0) = \hat{\sigma}\sqrt{1/n + (X_0-\bar{X})^2/\sum(X-\bar{X})^2}$
- 查 $t_{\alpha/2}(n-2)$
- 预测区间:$\hat{Y}_0 \pm t_{\alpha/2}(n-2) \cdot Se(\hat{Y}_0)$
- $X_0$ 越远离 $\bar{X}$,预测区间越宽(预测精度越低)
$n=20$,$\hat{Y}=10+0.5X$,$\hat{\sigma}=2.5$,$\bar{X}=30$,$\sum(X-\bar{X})^2=500$。预测 $X_0=40$ 时 $Y_0$ 的95%置信区间。$t_{0.025}(18)=2.101$。
Ŷ₀ = 10 + 0.5×40 = 30
Se(Ŷ₀) = 2.5×√(1/20 + (40-30)²/500) = 2.5×√(0.05+0.2) = 2.5×0.5 = 1.25
区间:30 ± 2.101×1.25 = 30 ± 2.63 = (27.37, 32.63)
简答题/论述题全题型(12道)
简答1:经典线性回归模型的基本假定(高斯-马尔可夫假定)
▼6条:①线性性(模型对参数线性);②零均值 $E(u_i|X_i)=0$;③同方差 $Var(u_i|X_i)=\sigma^2$;④无自相关 $Cov(u_i,u_j)=0$;⑤解释变量与扰动项不相关 $Cov(X_i,u_i)=0$;⑥正态性 $u_i\sim N(0,\sigma^2)$(小样本检验用)。
简答2:OLS估计量的性质(高斯-马尔可夫定理)
▼在经典假定下,OLS是最佳线性无偏估计量(BLUE):①线性性($\hat{\beta}_2$是$Y_i$的线性函数);②无偏性($E(\hat{\beta}_2)=\beta_2$);③有效性(在线性无偏估计量中方差最小)。正态性假定下还是MVUE。
简答3:拟合优度 $R^2$ 与调整 $\bar{R}^2$
▼$R^2=ESS/TSS=1-RSS/TSS$,衡量模型解释力。$R^2$随变量增加只增不减。$\bar{R}^2=1-(1-R^2)(n-1)/(n-k)$,引入自由度调整,可能下降甚至为负。比较变量数不同的模型用 $\bar{R}^2$。
简答4:t检验与F检验的区别与联系
▼t检验检验单个变量显著性($H_0:\beta_j=0$);F检验检验方程整体显著性($H_0:\beta_2=\cdots=\beta_k=0$)。一元回归中 $F=t^2$ 等价;多元回归F显著不代表每个t都显著。
简答5:异方差的含义、原因、后果、检验与修正(全框架)
▼含义:$Var(u_i|X_i)=\sigma_i^2$,常见于截面数据。原因:省略变量、观测误差、函数形式偏误、个体差异。后果:OLS线性无偏但非有效;t检验失效;预测失效。检验:图示法、G-Q检验、White检验($nR^2\sim\chi^2$)、BP检验、Glejser检验。修正:WLS(权重$1/\sqrt{f(X)}$)、White稳健标准误、对数变换。
简答6:自相关的含义、原因、后果、检验与修正(全框架)
▼含义:$Cov(u_i,u_j)\neq0$,常见于时间序列,一阶自相关 $u_t=\rho u_{t-1}+\varepsilon_t$。原因:经济惯性、模型设定偏误、数据处理、蛛网现象。后果:OLS线性无偏但非有效;正自相关时t被高估→虚假显著;预测失效。检验:图示法、DW检验($DW\approx2(1-\hat{\rho})$,查$d_L,d_U$)、BG检验。修正:广义差分法、Cochrane-Orcutt迭代、Newey-West稳健标准误。
简答7:多重共线性的含义、原因、后果、检验与修正(全框架)
▼含义:解释变量间近似线性关系。原因:共同趋势、滞后变量、样本限制、模型过度。后果:参数方差增大($Var(\hat{\beta}_j)=\sigma^2/\sum x_j^2\cdot VIF_j$);t变小→变量不显著;参数不稳定;OLS仍是BLUE;$R^2$高但t不显著。检验:相关系数法($|r|>0.8$)、VIF法($VIF>10$)、综合判断法。修正:剔除变量、增大样本、变量变换、先验约束、岭回归、主成分回归。
简答8:DW检验的决策规则与局限性
▼$DW\approx2(1-\hat{\rho})$。决策:$DW
简答9:虚拟变量的设置原则与引入方式
▼虚拟变量陷阱:$m$个类别只能引入$m-1$个虚拟变量,否则完全多重共线性。不设虚拟变量的组为基准组。引入方式:①加法($\alpha D$,影响截距,两组平行);②乘法($\gamma XD$,影响斜率);③加法+乘法(截距斜率都不同)。
简答10:联立方程模型的识别(阶条件与秩条件)
▼阶条件(必要):$K-k\geq m-1$。$K-k
简答11:分布滞后模型与自回归模型
▼分布滞后模型:$Y_t=\alpha+\sum\beta_iX_{t-i}+u_t$。短期乘数$\beta_0$,延期乘数$\beta_1,\beta_2,\cdots$,长期乘数$\sum\beta_i$。估计方法:经验加权法、Almon多项式法、Koyck几何法。自回归模型:含滞后被解释变量$Y_{t-1}$,不能用DW检验,应用h检验或BG检验。
简答12:2SLS的步骤与适用条件
▼适用:恰好识别和过度识别的方程。步骤:第一阶段,将方程中的内生解释变量对模型中所有前定变量做OLS回归,得到内生解释变量的估计值 $\hat{Y}_t$;第二阶段,用 $\hat{Y}_t$ 替代原方程中的内生解释变量,再做OLS。性质:2SLS估计量是一致估计量,但小样本下有偏。恰好识别时2SLS=ILS。
第一部分:考试信息
一、题型与分值(老师最后一课公布)
考试注意事项(老师强调):
- 卷面成绩必须≥50分才能及格(老师去年被合格评估查到,今年不能放水)
- 可以带计算器,考试2小时,1小时后才能交卷
- 多选题:少选得1分,多选/错选不得分 → 不确定时宁可少选
- 计算题必须写完整过程(公式+中间步骤),只写结果不得分
- 答案写在答题纸上,写在试卷上无效
二、老师划重点(按教材页码)
| 章节 | 页码 | 重点内容 | 题型 |
|---|---|---|---|
| 第一章 绪论 | p3 | 计量经济学定义 | 名词解释 |
| p5 | 研究步骤(各步骤做什么) | 简答 | |
| p10 | 解释变量/被解释变量、内生/外生变量 | 选择/判断 | |
| p11 | 数据类型(四种)、截面数据定义 | 名词解释 | |
| 第二章 一元回归 | p21 | 总体回归函数(PRF) | 名词解释 |
| p23 | 样本回归函数(SRF) | 名词解释 | |
| p25 | PRF与SRF的区别与联系 | 简答 | |
| p27 | 普通最小二乘法(OLS) | 计算 | |
| p36 | 拟合优度R²(可决系数)计算 | 计算 | |
| p40 | t检验的计算与判断 | 计算 | |
| 第三章 多元回归 | p66 | 多元回归基本假定(6个) | 简答 |
| p74 | F检验的计算与判断(必考) | 计算 | |
| p75 | F检验与t检验的关系 | 选择/判断 | |
| 第四章 多重共线性 | — | 多重共线性定义 | 名词解释 |
| — | 后果(完全/不完全两种) | 简答 | |
| p99 | 简单相关系数检验法(给相关系数判断) | 分析 | |
| p99 | 方差膨胀因子(VIF) | 选择/判断 | |
| — | 补救方法 | 简答 | |
| 第五章 异方差 | p116 | 异方差定义 | 名词解释 |
| — | 产生原因(主观题,要能写出) | 简答 | |
| — | 异方差的后果 | 简答 | |
| — | G-Q检验(具体做法、原假设、构造统计量) | 计算/简答 | |
| — | 怀特检验(基本思想) | 简答 | |
| p125 | 加权最小二乘法(WLS)基本思路 | 简答 | |
| 第六章 自相关 | — | 自相关定义、产生原因 | 名词解释/简答 |
| — | 自相关的后果(对参数估计/检验的影响) | 简答 | |
| p144 | DW检验法(概念、判断准则,给dL/dU和DW值判断) | 计算/分析 | |
| p148 | 科克伦-奥克特迭代法(理论步骤) | 简答 | |
| 第八章 虚拟变量 | — | 虚拟变量在模型中的作用分析 | 分析 |
| p195 | 虚拟变量陷阱 | 名词解释/简答 | |
| p199 | 乘法方式引入虚拟变量的作用 | 简答 | |
| 第十章 联立方程 | p265 | 内生变量/外生变量、前定变量 | 名词解释 |
| — | 参数的经济意义分析(给回归结果解读) | 分析 |
复习策略:计算分析题25分集中在OLS估计、R²计算、t检验、F检验、DW检验、G-Q检验,必须练熟;简答题20分集中在研究步骤、PRF/SRF区别、基本假定、异方差/自相关/多重共线性的原因后果与检验、虚拟变量陷阱;名词解释把上面标"名词解释"的全部背熟。
第二部分:各章考点详解
第一章 绪论
考点1:计量经济学的定义 ★★
计量经济学是以经济理论和经济事实为基础,运用数学、统计学方法和计算机技术,通过建立计量经济模型来研究经济关系和经济活动规律的学科。三大要素:经济理论、数据、方法。
考点2:研究步骤 ★★★
- 理论模型设计:确定变量、设定模型形式、拟定参数期望值
- 样本数据收集:时间序列、截面、面板数据
- 参数估计:OLS、ML、GMM等
- 模型检验:经济意义检验、统计检验、计量经济学检验、预测检验
- 模型应用:结构分析、经济预测、政策评价、检验发展理论
考点3:数据类型 ★★
| 类型 | 定义 | 例子 |
|---|---|---|
| 时间序列 | 按时间排列的同一总体数据 | 2000-2024年GDP |
| 截面数据 | 同一时点不同总体的数据 | 2024年各省GDP |
| 面板数据 | 时间序列+截面结合 | 2000-2024年各省GDP |
第二章 一元线性回归模型
考点4:回归分析基本概念 ★★★★★
- 总体回归函数(PRF):$E(Y|X_i) = \beta_1 + \beta_2 X_i$
- 样本回归函数(SRF):$\hat{Y}_i = \hat{\beta}_1 + \hat{\beta}_2 X_i$
- 随机扰动项:$u_i = Y_i - E(Y|X_i)$
- 残差:$e_i = Y_i - \hat{Y}_i$
理解要点:PRF描述的是总体中X每变化一个单位时Y的条件均值如何变化,是客观存在但未知的"真实"关系;SRF是我们用样本数据估计出来的"近似"关系。$\beta_1,\beta_2$是总体参数(固定常数),$\hat{\beta}_1,\hat{\beta}_2$是样本统计量(随机变量,随样本变化)。随机扰动项$u_i$是Y的实际值与条件均值之差,包含了所有未被X解释的因素;残差$e_i$是Y的实际值与样本拟合值之差,是$u_i$的样本估计量。
考点5:随机扰动项的内容 ★★★
- 代表未知的影响因素
- 代表残缺数据
- 代表众多细小影响因素
- 代表数据观测误差
- 代表模型设定误差
- 变量的内在随机性
理解要点:随机扰动项是计量经济学的核心概念。为什么需要它?因为经济现象不可能像物理实验那样精确控制所有变量。$u_i$本质上是一个"垃圾桶",把所有没放进模型但又影响Y的因素都装进去。第3点"众多细小影响因素"尤其重要——根据中心极限定理,大量独立细小因素的总和近似服从正态分布,这就是为什么我们假定$u_i\sim N(0,\sigma^2)$的理论依据。考试中常考"为什么扰动项要服从正态分布"或"扰动项包含哪些内容"。
考点6:经典线性回归模型基本假定 ★★★★
高斯-马尔可夫假定:①线性性;②零均值 $E(u_i|X_i)=0$;③同方差 $Var(u_i|X_i)=\sigma^2$;④无自相关 $Cov(u_i,u_j)=0$;⑤解释变量与扰动项不相关;⑥正态性 $u_i\sim N(0,\sigma^2)$。
理解要点:这六条假定是OLS估计量具有优良性质(BLUE)的前提条件。零均值意味着扰动项中不包含系统性的偏差,模型没有遗漏重要的解释变量;同方差意味着无论X取什么值,Y围绕回归线的离散程度相同(后面异方差一章就是违反这条);无自相关意味着不同观测点的扰动项之间互不影响(后面自相关一章违反这条);解释变量与扰动项不相关是因果推断的关键,如果相关则OLS有偏(内生性问题)。前5条满足时OLS是BLUE(不需要正态性),第6条正态性是为了进行假设检验(t检验、F检验)。
考点7:普通最小二乘法(OLS) ★★★★★ 计算必考
原理:$\min \sum e_i^2 = \min \sum (Y_i-\hat{Y}_i)^2$
理解要点:OLS的核心思想是让样本回归线"尽可能靠近所有散点",用残差平方和最小来衡量"靠近"。为什么用平方和而不是残差和?因为残差有正有负,直接相加会抵消;用绝对值又不可导。平方和既消除了符号问题,又数学上易处理。
$\hat{\beta}_2$的分子$\sum(X_i-\bar{X})(Y_i-\bar{Y})$是X和Y的协方差(未除以n),分母$\sum(X_i-\bar{X})^2$是X的方差(未除以n),所以$\hat{\beta}_2 = \frac{Cov(X,Y)}{Var(X)}$,直觉上就是"X和Y一起变动的程度除以X自己变动的程度"。$\hat{\beta}_1 = \bar{Y}-\hat{\beta}_2\bar{X}$说明回归线一定经过样本均值点$(\bar{X},\bar{Y})$。
考试计算技巧:先算$\bar{X},\bar{Y}$,再列表计算$X_i-\bar{X}$、$Y_i-\bar{Y}$、乘积、平方,最后代入公式。注意EVIEWS输出中C是截距$\hat{\beta}_1$,X变量对应的系数是$\hat{\beta}_2$。
考点8:OLS估计量的性质 ★★★★
OLS是BLUE:线性性、无偏性、有效性。$Var(\hat{\beta}_2)=\sigma^2/\sum(X-\bar{X})^2$,$\hat{\sigma}^2=RSS/(n-2)$。
理解要点:BLUE = Best Linear Unbiased Estimator(最优线性无偏估计量)。线性性:$\hat{\beta}_2$是Y的线性组合($\hat{\beta}_2=\sum k_iY_i$,其中$k_i=(X_i-\bar{X})/\sum(X_i-\bar{X})^2$),这使得数学推导和统计性质分析变得简单。无偏性:$E(\hat{\beta}_2)=\beta_2$,即反复抽样得到的估计量均值等于真实参数,不会系统性高估或低估。有效性:在所有线性无偏估计量中,OLS的方差最小,即估计最精确。
$Var(\hat{\beta}_2)=\sigma^2/\sum(X-\bar{X})^2$告诉我们:扰动项方差$\sigma^2$越大(数据越分散),估计越不精确;X的变异程度$\sum(X-\bar{X})^2$越大(X取值越分散),估计越精确——这就是为什么做实验时要让自变量取值范围尽量大。$\hat{\sigma}^2=RSS/(n-2)$中自由度是$n-2$因为估计了两个参数(截距和斜率),残差和为0、残差与X不相关两个约束。
考点9:拟合优度检验 $R^2$ ★★★★★
$TSS=ESS+RSS$,$R^2=ESS/TSS=1-RSS/TSS$。$0\leq R^2\leq1$。一元回归中 $r^2=R^2$。
理解要点:拟合优度回答"模型解释了Y变动的百分之多少"。TSS(总离差平方和)=$\sum(Y_i-\bar{Y})^2$,是Y自身的总变异;ESS(解释平方和)=$\sum(\hat{Y}_i-\bar{Y})^2$,是模型能解释的变异;RSS(残差平方和)=$\sum e_i^2$,是模型不能解释的变异。$R^2=ESS/TSS$就是"被解释的比例"。
$R^2$越接近1说明拟合越好,但要注意:$R^2$高不代表模型正确(可能伪回归),$R^2$低也不代表模型没用(横截面数据$R^2$通常较低)。一元回归中$R^2$等于Y和X相关系数$r$的平方,这建立了回归分析和相关分析的联系。
考点10:显著性检验(t检验) ★★★★★
$H_0:\beta_2=0$,$t=\hat{\beta}_2/Se(\hat{\beta}_2)\sim t(n-2)$。$|t|>t_{\alpha/2}$ 或 $P<\alpha$ → 显著。经验法则:$|t|>2$ 通常显著。
理解要点:t检验回答"X对Y有没有影响"。原假设$\beta_2=0$意味着X对Y没有影响(斜率为0,回归线是水平线)。t统计量=估计值/标准误,衡量"估计值离0有几个标准误"。如果离0很远(超过临界值),就拒绝"没有影响"的假设。
EVIEWS输出解读:Coefficient列是$\hat{\beta}$,Std. Error列是标准误,t-Statistic列就是t值,Prob列是p值。p值<0.05(或0.01)就显著。考试常见陷阱:①自由度是$n-k$(k是参数个数,包括截距),一元回归是$n-2$;②双侧检验用$t_{\alpha/2}$,单侧检验用$t_\alpha$;③截距项通常不检验显著性,重点检验斜率系数。
考点11:预测 ★★★
点预测 $\hat{Y}_0=\hat{\beta}_1+\hat{\beta}_2X_0$。区间预测 $\hat{Y}_0\pm t_{\alpha/2}(n-2)\cdot Se(\hat{Y}_0)$。$X_0$ 越远离 $\bar{X}$ 区间越宽。
理解要点:预测分点预测和区间预测。点预测就是把$X_0$代入样本回归方程。区间预测的不确定性有三个来源:①样本量带来的不确定性,n越大越精确;②$X_0$离样本均值$\bar{X}$越远,预测越不精确(这就是为什么预测外推风险大);③被预测变量$Y_0$自身的随机扰动项。
注意区分均值预测(预测$E(Y|X_0)$)和个值预测(预测具体的$Y_0$),个值预测区间更宽。考试常考"为什么$X_0$离$\bar{X}$越远预测区间越宽"。
第三章 多元线性回归模型
考点12:矩阵表示与多元OLS ★★★★★
$\hat{\sigma}^2=\mathbf{e}'\mathbf{e}/(n-k)$,自由度 $n-k$(k含截距,一元回归k=2)。
理解要点:多元回归用矩阵表示后公式极其简洁。$\hat{\beta}=(X'X)^{-1}X'Y$是一元回归公式的矩阵推广——一元中$\hat{\beta}_2=\frac{\sum(X_i-\bar{X})(Y_i-\bar{Y})}{\sum(X_i-\bar{X})^2}$,矩阵形式把所有变量的协方差和方差都装进了$X'X$和$X'Y$里。
$X'X$可逆是OLS可计算的前提,这要求解释变量之间不存在完全的多重共线性(后面第六章专门讲)。残差生成矩阵$M=I-X(X'X)^{-1}X'$是对称幂等矩阵,$MY=e$——M把Y中能被X解释的部分"消灭"掉,剩下的就是残差。
考试要点:多元OLS仍然是BLUE(高斯-马尔可夫定理在多元下成立);$\hat{\sigma}^2=RSS/(n-k)$,k是参数个数(包括截距);$Var(\hat{\beta})=\sigma^2(X'X)^{-1}$。
考点13:偏回归系数的含义 ★★★★
$\hat{\beta}_j$ 表示在其他解释变量保持不变的条件下,$X_j$ 每变化一单位,$Y$ 平均变化 $\hat{\beta}_j$ 单位。
理解要点:这是多元回归最重要的概念之一。"偏"(partial)的意思是"控制其他变量后"的净效应。一元回归中$\hat{\beta}_2$衡量X对Y的总效应;多元回归中$\hat{\beta}_j$衡量的是净效应——把其他解释变量的影响都"控制住"之后,$X_j$自身对Y的独立影响。
数学上,$\hat{\beta}_j$等于先用$X_j$对其他所有X回归得到残差,再用Y对其他所有X回归得到残差,最后$\hat{\beta}_j=\frac{\sum\hat{e}_j\hat{e}_y}{\sum\hat{e}_j^2}$。这就是"偏回归系数"名称的由来。
考试常见:"为什么多元回归系数叫偏回归系数?"或"多元回归系数与简单回归系数有什么区别?"
考点14:调整的可决系数 $\bar{R}^2$ ★★★★★
$\bar{R}^2=1-(1-R^2)(n-1)/(n-k)$。$\bar{R}^2\leq R^2$,可能为负。比较变量数不同的模型用 $\bar{R}^2$。
理解要点:为什么需要调整的$R^2$?因为普通$R^2$有一个严重缺陷:增加解释变量,$R^2$只增不减——即使新加的变量完全不相关,$R^2$也会略微上升。这会诱导人们盲目加变量。
$\bar{R}^2$对自由度进行了调整:增加变量时,如果新变量不能使RSS下降足够多来补偿自由度的减少,$\bar{R}^2$反而会下降。这就是模型选择时常用$\bar{R}^2$而不是$R^2$的原因。
考试要点:①$\bar{R}^2\leq R^2$恒成立;②$\bar{R}^2$可能为负(当模型拟合极差时),此时解释为0;③比较不同模型的拟合优度时,如果解释变量个数不同,必须用$\bar{R}^2$;④EVIEWS输出中R-squared是$R^2$,Adjusted R-squared是$\bar{R}^2$。
考点15:方程显著性检验(F检验) ★★★★★
$F=\frac{ESS/(k-1)}{RSS/(n-k)}\sim F(k-1,n-k)$。$F>F_\alpha$ → 方程整体显著。$F=\frac{R^2/(k-1)}{(1-R^2)/(n-k)}$。一元回归 $F=t^2$。
理解要点:t检验是检验单个系数是否显著,F检验是检验所有斜率系数是否同时为0(即整个方程是否有解释力)。原假设是"所有解释变量联合起来对Y没有影响",如果拒绝,说明至少有一个解释变量对Y有显著影响。
$F=\frac{ESS/(k-1)}{RSS/(n-k)}$的直觉:分子是"平均每个解释变量解释了多少变异",分母是"平均每个自由度残差有多少变异",比值大说明解释力强。
考试要点:①一元回归中F检验和t检验等价($F=t^2$),多元中不等价——可能每个系数单独t检验都不显著但F检验显著(多重共线性的征兆);②EVIEWS输出中F-statistic就是F值,Prob(F-statistic)是p值;③$F$与$R^2$的关系公式要记住,可用来互相换算。
第四章 多重共线性
考点16:多重共线性的定义 ★★★★
完全共线性:$Rank(X) 理解要点:多重共线性是指解释变量之间存在线性相关关系。完全共线性意味着一个解释变量可以被其他解释变量完全线性表示(如$X_3=2X_1+3X_2$),此时$X'X$不可逆,OLS无法计算。不完全共线性(近似共线性)是实际中最常见的情况——解释变量之间高度相关但不是完全线性关系,此时$X'X$可逆但接近奇异矩阵,估计结果不稳定。 注意:多重共线性是样本现象,不是总体特征。同一个模型在不同样本中共线性程度可能不同。
考点17:产生原因 ★★★
- 经济变量共同趋势
- 滞后变量引入
- 样本数据限制
- 模型设定过度
理解要点:①经济变量共同趋势是最常见原因——收入、消费、投资、GDP等宏观经济变量通常都随时间增长,它们之间天然高度相关。②滞后变量引入:如果模型中同时包含$X_t$和$X_{t-1}$,它们通常高度相关(时间序列的惯性)。③样本数据限制:样本量小或解释变量取值范围有限时,容易出现共线性。④模型设定过度:引入了太多相关的解释变量。
考点18:多重共线性的后果 ★★★★★ 简答高频
- 参数方差增大($Var(\hat{\beta}_j)=\frac{\sigma^2}{\sum x_j^2}\cdot VIF_j$)
- t变小→变量不显著
- 参数估计不稳定
- OLS仍是BLUE
- $R^2$高但单个变量不显著
理解要点:这是简答题高频考点,必须理解每一条后果。
①参数方差增大:$Var(\hat{\beta}_j)=\frac{\sigma^2}{\sum x_j^2}\cdot VIF_j$,其中$VIF_j=\frac{1}{1-R_j^2}$($R_j^2$是$X_j$对其他解释变量回归的$R^2$)。共线性越严重,$R_j^2$越接近1,$VIF_j$越大,参数方差越大。
②t变小→变量不显著:t统计量=$\hat{\beta}/SE(\hat{\beta})$,方差增大导致标准误增大,t值减小,可能把实际上显著的变量判断为不显著(第二类错误)。
③参数估计不稳定:增加或减少一个观测值,或增加一个相关变量,参数估计值可能发生剧烈变化。
④OLS仍是BLUE:这是与异方差、自相关的重要区别!多重共线性不违反任何经典假定,所以OLS仍然是BLUE。多重共线性的问题是"估计不精确"(方差大),而不是"估计有偏"。
⑤$R^2$高但单个变量不显著:这是多重共线性的典型征兆——模型整体拟合很好(F检验显著),但每个解释变量单独都不显著(t检验不显著),因为解释变量的影响被"分摊"了。
考点19:多重共线性的检验 ★★★★★
- 简单相关系数法:$|r|>0.8$
- VIF法:$VIF_j=1/(1-R_j^2)$,$VIF>10$严重共线性
- 综合判断法:$R^2$和F大但t不显著
理解要点:①相关系数法:计算解释变量之间的两两相关系数,$|r|>0.8$说明存在严重共线性。但这只能检验两个变量之间的共线性,不能检验多个变量之间的联合共线性。
②VIF法(方差膨胀因子):最常用的检验方法。$VIF_j=\frac{1}{1-R_j^2}$,其中$R_j^2$是第j个解释变量对其他所有解释变量回归的可决系数。判断标准:$VIF>10$(对应$R_j^2>0.9$)说明存在严重共线性;有的教材用$VIF>5$作为标准。EVIEWS中可以通过回归后查看Variance Inflation Factors。
③综合判断法:如果$R^2$很高、F检验显著,但各个解释变量的t检验都不显著(或很多不显著),这是多重共线性的典型表现。
考点20:多重共线性的修正 ★★★★
- 剔除变量法(最常用)
- 增大样本容量
- 变量变换(差分、比率、对数)
- 先验信息约束
- 岭回归
- 主成分回归
理解要点:①剔除变量法是最常用的方法——找出导致共线性的变量,将其从模型中剔除。但要注意:剔除变量可能导致遗漏变量偏误,所以要权衡。通常剔除t检验最不显著且理论上最不重要的变量。
②增大样本容量:更多的数据可以减轻共线性的影响(增加$\sum x_j^2$,减小方差)。但实际中往往难以获得更多数据。
③变量变换:差分法(用$\Delta X_t=X_t-X_{t-1}$代替$X_t$)可以减轻时间序列的共线性;比率法(用两个变量的比率代替两个变量本身);对数变换可以压缩尺度。
④先验信息约束:如果根据经济理论知道某些参数的关系(如生产函数中规模报酬不变$\alpha+\beta=1$),可以施加约束减少待估参数。
⑤岭回归和⑥主成分回归:是更高级的方法,通过有偏估计换取更小的方差,在共线性严重时可以得到更稳定的估计。考试中了解概念即可。
第五章 异方差性
考点21:异方差的定义 ★★★★★
$Var(u_i|X_i)=\sigma_i^2$(随观测值变化),常见于截面数据。同方差为 $\sigma^2$(常数)。
理解要点:同方差假定是$Var(u_i|X_i)=\sigma^2$——无论X取什么值,Y围绕回归线的离散程度都相同。异方差就是这个假定被违反了:不同X值对应的扰动项方差不同。
直观例子:研究收入(X)和消费(Y)的关系,低收入群体的消费差异小(都花在必需品上),高收入群体的消费差异大(有的储蓄有的奢侈消费),这就是典型的异方差——方差随X增大而增大。为什么常见于截面数据:截面数据中不同个体(企业、家庭、地区)的规模差异大,小个体的测量误差和未观测因素变异小,大个体的变异大。时间序列数据通常异方差不明显(但可能有ARCH/GARCH效应)。
考点22:异方差产生的原因 ★★★★
- 省略重要解释变量
- 数据观测误差
- 函数形式设定偏误
- 截面数据个体差异(最常见)
理解要点:第4点"截面数据个体差异"是最常见的原因。比如研究不同规模企业的产出,大企业的产出波动远大于小企业,扰动项方差自然不同。第1点"省略重要解释变量"也很重要——如果省略了一个与X相关的重要变量,这个变量的影响会进入扰动项,导致扰动项方差随X变化。
考试答题技巧:回答"异方差产生的原因"时,先列4点,再展开解释每一点,最后举一个具体例子(如收入-消费模型),这样答案更完整。
考点23:异方差的后果 ★★★★★ 简答高频
- 参数估计量线性无偏但非有效
- t检验失效(统计量被高估或低估)
- 预测失效(区间方差估计有误)
理解要点:这是简答题高频考点,必须理解每一条后果的原因。
①线性无偏但非有效:线性性和无偏性的证明只需要零均值假定和解释变量与扰动项不相关,不需要同方差,所以OLS仍然线性无偏。但有效性(方差最小)的证明需要同方差,异方差时OLS方差不是最小的,存在更有效的估计量(如WLS)。
②t检验失效:t统计量=$\hat{\beta}/SE(\hat{\beta})$,异方差时OLS计算的标准误$SE(\hat{\beta})$是错误的(用了$\hat{\sigma}^2$而不是真实的$\sigma_i^2$),导致t值偏大或偏小,可能把不显著的当成显著(第一类错误),或把显著的当成不显著(第二类错误)。
③预测失效:预测区间依赖于扰动项方差的估计,异方差时方差估计错误,预测区间过宽或过窄。
注意:异方差不影响OLS的无偏性!很多同学误以为异方差会导致有偏,这是错误的。异方差只影响有效性和推断。
考点24:异方差的检验方法 ★★★★★ 计算/简答
| 方法 | 核心思想 | 统计量 |
|---|---|---|
| 图示法 | $e_i^2$与$X_i$散点图,观察喇叭形 | — |
| G-Q检验 | 按X排序,去中间c=n/4个,分两组回归 | $F=RSS_2/RSS_1$ |
| White检验 | $e_i^2$对所有X、X²、交叉项回归 | $nR^2\sim\chi^2(q)$ |
| BP检验 | $e_i^2$对解释变量回归 | $nR^2\sim\chi^2$ |
| Glejser检验 | $|e_i|$对X各种函数形式回归 | t检验 |
理解要点:所有检验的基本思路都是"看残差的方差是否随X变化"——如果存在异方差,那么残差$e_i^2$(作为$\sigma_i^2$的估计)应该与X相关。
G-Q检验(Goldfeld-Quandt)详细步骤:
- 前提:大样本;除同方差外其他经典假定均满足;异方差为单调递增(或递减)型
- 排序:按可能引起异方差的解释变量X从小到大排序
- 删中间:去掉中间 $c$ 个观测值,$c$ 约为 $n/5 \sim n/4$(如 $n=30$ 时 $c=4\sim6$;$n=60$ 时 $c=10\sim14$)
- 分组回归:剩余 $n-c$ 个数据对半分,前组和后组分别用OLS回归
- 原假设:$H_0$:前后两部分同方差($\sigma_1^2=\sigma_2^2$)
- 构造统计量:$F = \frac{RSS_2/(df)}{RSS_1/(df)} = \frac{RSS_2}{RSS_1}$,其中自由度 $df = \frac{n-c}{2} - k$($k$含截距)
- 判断:若 $F > F_\alpha(df, df)$,则拒绝原假设,存在异方差(递增型)
注意:检验递减型异方差时交换 $RSS_1$ 和 $RSS_2$,即 $F=RSS_1/RSS_2$。缺点:去掉中间数据损失信息;只能检验单调异方差,不能检验非单调形式。
White检验:最常用的检验方法。把$e_i^2$对所有解释变量、解释变量平方、交叉项回归,检验联合显著性。$nR^2$服从$\chi^2$分布,自由度q是辅助回归中解释变量个数(不含截距)。优点:不要求异方差的具体形式,能检验任何形式的异方差。缺点:解释变量多时辅助回归变量太多,自由度低,检验功效下降。
EVIEWS操作:回归后点View → Residual Tests → Heteroskedasticity Tests → 选White/Breusch-Pagan等。看Obs*R-squared的p值,p<0.05则存在异方差。
考点25:异方差的修正 ★★★★★
- WLS:权重 $w_i=1/\sqrt{f(X_i)}$,所有变量(含常数项)除以 $\sqrt{f(X_i)}$
- White稳健标准误:不改变参数估计,只修正标准误(最常用)
- 对数变换:压缩异方差
理解要点:三种修正方法的思路不同。
①WLS(加权最小二乘法):核心思想是"方差大的观测点给小权重,方差小的给大权重"。如果知道$Var(u_i)=\sigma^2 f(X_i)$,就把所有变量(Y、X、常数项)都除以$\sqrt{f(X_i)}$,变换后的模型扰动项方差为常数$\sigma^2$,满足同方差假定,再用OLS估计。关键:常数项也要除以$\sqrt{f(X_i)}$,否则变换后的模型没有截距。
②White稳健标准误:不改变参数估计值(仍然用OLS),只修正标准误的计算公式,使其在异方差下仍然有效。优点:不需要知道异方差的具体形式,操作简单(EVIEWS中勾选White标准误即可)。缺点:不是最有效的估计量(WLS更有效),但在不知道异方差形式时是最佳选择。考试常考:"White稳健标准误改变参数估计吗?"——答案是不改变,只改变标准误和t值。
③对数变换:对Y和X取对数后,变量的尺度被压缩,异方差程度通常减轻。适用于经济变量(收入、消费、产值等),因为这些变量通常是正的且异方差与规模成正比。
第六章 自相关性
考点31:自相关的定义 ★★★★★
$Cov(u_i,u_j)\neq0$。一阶自相关 $u_t=\rho u_{t-1}+\varepsilon_t$。$\rho>0$ 正自相关(残差块状),$\rho<0$ 负自相关(锯齿状)。常见于时间序列。
理解要点:自相关就是不同观测点的扰动项之间存在相关性。经典假定要求$Cov(u_i,u_j)=0(i\neq j)$,自相关就是这个假定被违反了。
为什么常见于时间序列:时间序列数据中,本期的经济行为往往受上期影响(惯性),比如本期消费受上期消费影响,本期GDP受上期GDP影响。这种惯性会导致扰动项也存在相关性。正自相关最常见:如果上期扰动项为正(实际值高于拟合值),本期也倾向于为正,残差图呈现"块状"——连续几个正的,连续几个负的。负自相关较少见,残差图呈现"锯齿状"——正负交替。
考点27:自相关产生的原因 ★★★★
- 经济变量惯性
- 模型设定偏误
- 数据处理(移动平均、插值)
- 蛛网现象
理解要点:①经济变量惯性是最主要原因——GDP、消费、投资等经济变量都有惯性,本期值依赖上期值。②模型设定偏误:如果模型中遗漏了一个自相关的重要解释变量,或者用了错误的函数形式(如应该用对数形式却用了线性形式),遗漏的影响会进入扰动项导致自相关。③数据处理:移动平均、插值等数据处理方法会人为制造自相关。④蛛网现象:某些农产品的供给和价格存在周期性波动(本期供给取决于上期价格),导致扰动项自相关。
考点28:自相关的后果 ★★★★★
- OLS线性无偏但非有效
- 正自相关时t被高估→虚假显著
- 预测失效
理解要点:与异方差类似,自相关不影响OLS的线性性和无偏性(这两个性质只需要零均值假定),但影响有效性和推断。
②正自相关时t被高估→虚假显著:这是最重要的后果。正自相关时,OLS计算的标准误偏小(低估了真实方差),导致t值偏大,可能把实际上不显著的变量判断为显著(第一类错误)。这与异方差不同——异方差时t值可能偏大也可能偏小,方向不确定;正自相关时t值系统性偏大。
③预测失效:自相关时扰动项的协方差结构被忽略,预测区间的方差估计错误,预测精度下降。
对比记忆:异方差和自相关的共同后果是"OLS线性无偏但非有效,t检验失效,预测失效"。区别在于异方差时t值方向不定,正自相关时t值系统性偏大。
考点29:DW检验 ★★★★★ 计算必考
$DW=\frac{\sum(e_t-e_{t-1})^2}{\sum e_t^2}\approx2(1-\hat{\rho})$。$DW\approx2$无自相关,$\approx0$正自相关,$\approx4$负自相关。查 $d_L,d_U$ 判断。
局限:只能检验一阶自相关;有不确定区域;不能含滞后被解释变量;需有截距项。
理解要点:DW检验是自相关最常用的检验方法,考试必考计算和判断。
公式直觉:$DW=\frac{\sum(e_t-e_{t-1})^2}{\sum e_t^2}$。如果无自相关,$e_t$和$e_{t-1}$不相关,$(e_t-e_{t-1})^2\approx2e_t^2$,所以$DW\approx2$。如果正自相关($\rho>0$),$e_t$和$e_{t-1}$同号,$e_t-e_{t-1}$小,$DW<2$,极端情况$\rho=1$时$DW\approx0$。如果负自相关($\rho<0$),$e_t$和$e_{t-1}$异号,$e_t-e_{t-1}$大,$DW>2$,极端情况$\rho=-1$时$DW\approx4$。
判断规则(正自相关):$0 $\hat{\rho}$的估计:$\hat{\rho}\approx1-DW/2$,这个公式在广义差分法中要用。 EVIEWS输出:回归结果底部直接给出Durbin-Watson stat值。
考点30:其他自相关检验 ★★★
图示法($e_t$时间序列图);BG检验(可检验高阶,允许滞后被解释变量)。
理解要点:DW检验有局限(只能检验一阶、有不确定区域、不能含滞后被解释变量),所以需要其他检验方法。
BG检验(Breusch-Godfrey检验):把$e_t$对$e_{t-1},e_{t-2},\ldots,e_{t-p}$和原模型解释变量回归,检验滞后残差的联合显著性。统计量$nR^2\sim\chi^2(p)$。优点:可以检验高阶自相关;允许模型中包含滞后被解释变量(这是DW检验做不到的)。EVIEWS中:View → Residual Tests → Serial Correlation LM Test。
考点31:自相关的修正 ★★★★★
- 广义差分法:$\hat{\rho}\approx1-DW/2$,$Y_t^*=Y_t-\hat{\rho}Y_{t-1}$,$X_t^*=X_t-\hat{\rho}X_{t-1}$
- Cochrane-Orcutt迭代法
- Newey-West稳健标准误:同时处理异方差和自相关
理解要点:①广义差分法是最基本的修正方法。核心思想:如果$u_t=\rho u_{t-1}+\varepsilon_t$,把原模型$Y_t=\beta_1+\beta_2X_t+u_t$滞后一期乘$\rho$得$\rho Y_{t-1}=\rho\beta_1+\rho\beta_2X_{t-1}+\rho u_{t-1}$,两式相减得$Y_t-\rho Y_{t-1}=\beta_1(1-\rho)+\beta_2(X_t-\rho X_{t-1})+\varepsilon_t$,变换后的扰动项$\varepsilon_t$满足经典假定,再用OLS估计。注意:截距项变换后是$\beta_1(1-\rho)$,需要还原。第一个观测值要用Prais-Winsten变换($\sqrt{1-\rho^2}$)处理,否则损失一个样本。
②Cochrane-Orcutt迭代法:先用OLS得到残差,估计$\hat{\rho}$,做广义差分,再估计,再估计$\hat{\rho}$,迭代直到收敛。比直接用$1-DW/2$更精确。
③Newey-West稳健标准误:不改变参数估计,只修正标准误,使其在同时存在异方差和自相关时仍然有效。优点:不需要知道自相关的具体形式,操作简单。EVIEWS中勾选Newey-West标准误即可。
第八章 虚拟变量模型
考点32:虚拟变量的设置 ★★★★
虚拟变量陷阱:$m$个类别只能引入$m-1$个虚拟变量。不设虚拟变量的组为基准组。
考点33:虚拟变量的引入方式 ★★★★ 计算
| 方式 | 模型 | 含义 |
|---|---|---|
| 加法 | $Y=\beta_1+\beta_2X+\alpha D+u$ | 影响截距,两组平行 |
| 乘法 | $Y=\beta_1+\beta_2X+\gamma(XD)+u$ | 影响斜率 |
| 加法+乘法 | $Y=\beta_1+\beta_2X+\alpha D+\gamma(XD)+u$ | 截距斜率都不同 |
考点34:分段线性回归 ★★★
$Y_t=\beta_1+\beta_2t+\beta_3(t-t^*)D_t+u_t$,$D_t=0(t\leq t^*)$,$D_t=1(t>t^*)$,在 $t^*$ 处转折。
考点35:分布滞后模型 ★★★
短期乘数 $\beta_0$,延期乘数 $\beta_1,\beta_2,\cdots$,长期乘数 $\sum\beta_i$。估计方法:经验加权法、Almon多项式法、Koyck几何法。
考点36:自回归模型 ★★★
含滞后被解释变量 $Y_{t-1}$。不能用DW检验,应用h检验或BG检验。
第十章 联立方程模型
考点37:基本概念 ★★★ 名词解释
内生变量(系统内决定)、外生变量(系统外决定)、前定变量(外生+滞后内生)、结构式、简化式。
考点38:联立方程偏误 ★★★
内生变量既作被解释变量又作解释变量,导致 $Cov(X,u)\neq0$,OLS估计量有偏且不一致。
考点39:识别问题 ★★★★ 计算/简答
不可识别(无法求结构式参数)、恰好识别(唯一解)、过度识别(多个解)。
考点40:识别的阶条件 ★★★★★ 计算必考
$K-k\geq m-1$:$K-k
秩条件(充要):其他方程所含而该方程不含的变量系数矩阵秩为 $M-1$。
考点41:联立方程估计方法 ★★★★
| 方法 | 适用 | 特点 |
|---|---|---|
| ILS | 恰好识别 | 先简化式OLS,再反推结构式 |
| 2SLS | 恰好/过度识别 | 最常用,两阶段最小二乘 |
| 3SLS | 系统估计 | 考虑方程间扰动相关 |
第三部分:EVIEWS输出解读
一、标准回归输出表
| Variable | Coefficient | Std. Error | t-Statistic | Prob. |
|---|---|---|---|---|
| C | $\hat{\beta}_1$ | $Se(\hat{\beta}_1)$ | $t_1$ | $P_1$ |
| X1 | $\hat{\beta}_2$ | $Se(\hat{\beta}_2)$ | $t_2$ | $P_2$ |
| X2 | $\hat{\beta}_3$ | $Se(\hat{\beta}_3)$ | $t_3$ | $P_3$ |
| 指标 | 含义 | 判断标准 |
|---|---|---|
| R-squared | $R^2$ | 越接近1拟合越好 |
| Adjusted R-squared | $\bar{R}^2$ | 比较不同模型用这个 |
| S.E. of regression | $\hat{\sigma}$ | 越小越好 |
| Sum squared resid | RSS | 用于计算检验统计量 |
| F-statistic | F统计量 | 方程整体显著性 |
| Prob(F-statistic) | F检验P值 | <0.05 → 整体显著 |
| Durbin-Watson stat | DW统计量 | ≈2无自相关,<d_L正自相关 |
| Akaike info criterion | AIC | 越小越好 |
| Schwarz criterion | SC | 越小越好 |
二、分析题答题模板
7步作答:①写出回归方程(代入数值);②经济意义检验(系数符号是否符合理论);③拟合优度检验($R^2$、$\bar{R}^2$);④F检验(方程整体显著性);⑤t检验(单个变量显著性);⑥DW检验(自相关);⑦若存在问题说明后果及修正方法。
冲刺复习建议:
- 计算题:12种计算题型模板反复练,重点练OLS估计、DW检验、F检验、阶条件判断
- 简答题:12道高频简答全背,尤其是三大问题的"原因→后果→检验→修正"四步框架
- 名词解释:重点记BLUE、虚拟变量陷阱、VIF、阶条件、秩条件、联立方程偏误、PRF/SRF
- 分析题:EVIEWS输出表按7步模板作答
- 计算器:考试可带计算器,数值运算用计算器,过程写公式和代入步骤