进阶课程目录 · 路线 D
- ←返回七模块入门课
- ⌂进阶地图
- A静态连续与离散选择
- B动态离散选择
- C进入博弈与多重均衡
- D选择模型、LATE 与 MTE
The selection problem先区分两种“看不见”
样本选择
结果只对被选中的人可见。例如只观察外出务工者工资,留村者的外出工资是缺失的。
处理自选择
所有人的结果可能可见,但参加培训的人与未参加者在潜在收益上不同。我们永远看不到同一人的两种潜在结果。
“控制更多变量”并不自动解决:若未观测能力、风险偏好或预期收益同时影响参与和结果,条件均值回归仍有选择偏误。
Heckman selectionHeckit:先解释谁进入样本,再修正结果方程
选择:S = 1[Zγ + η > 0] ;结果:Y = Xβ + ε,仅在 S=1 时观察
如果 η 与 ε 相关,进入样本的人就带有系统不同的结果误差。经典两步法先用 probit 估计选择概率,再把由此算出的逆米尔斯比率加入结果方程,作为控制函数。
选择方程估计谁会被观察/参与
控制函数把选择带来的误差条件均值写出来
结果方程在选择样本中加入修正项
联合推断修正两步标准误或 bootstrap
为什么最好有排除变量?
Z 中至少有一个变量影响是否进入样本,却不直接影响结果。例如到招工点距离可以影响是否外出,但“距离不直接影响外出后的工资”仍需认真论证。没有排除变量时,识别主要依靠正态分布带来的非线性,通常很脆弱。
控制函数与 IV 的亲缘:两者都试图把内生选择中与结果误差相关的部分隔离出来。控制函数通常比一个线性第一阶段要求更多分布或函数形式,也能回答更细的异质性问题。
From LATE to MTELATE 不是“总体平均”,它是被工具变量推动的那群人
把参与写成一个阈值决定:
D = 1[P(Z) ≥ U] ;P(Z) 是工具变量给出的参与倾向,U∈[0,1] 是未观测参与阻力
在独立性、排除限制和单调性等条件下,提高工具变量只会把阈值附近的人推入项目。二元工具变量把人分成:
| 类型 | Z 低时 | Z 高时 | IV 能看到什么 |
| 总会参加者 | 参加 | 参加 | 只观察其参加结果 |
| 服从者 | 不参加 | 参加 | 两种状态都被工具变化覆盖,形成 LATE |
| 从不参加者 | 不参加 | 不参加 | 只观察其不参加结果 |
| 反向者 | 参加 | 不参加 | 单调性假设排除这一类 |
“鼓励变量显著”不等于排除限制成立;“一阶段很强”也不等于 LATE 能代表目标政策的人群。
Interactive MTE labMTE:沿着参与阻力,逐点问“这类人的处理效应是多少”
MTE(u) = E[Y₁ − Y₀ | U = u]
低 U 的人很容易参加,可能本来就最受益;高 U 的人需要很强激励才参加,效应可能更小。ATE、ATT、ATU 和每个 LATE 都是同一条 MTE 曲线的不同加权平均。
Policy weights同一项目可以有多个都正确、但回答不同问题的处理效应
| 对象 | 主要加权谁 | 典型政策问题 |
| ATE | 总体各类 U | 随机给全体时平均效果怎样 |
| ATT | 当前已经参加者 | 现有项目对实际参与者怎样 |
| ATU | 当前未参加者 | 扩张到未参与者可能怎样 |
| LATE | 某个工具变化推动的服从者 | 这次鼓励/资格变化对边际参与者怎样 |
| PRTE | 具体新政策改变参与概率所覆盖的人 | 从旧规则切换到新规则的政策效果 |
因此,从一个资格阈值的 LATE 推到普惠补贴,必须知道新政策会把 U 分布的哪一段推入项目,并且数据对那一段有支持。
Development application农业培训或服务券:从“有没有效”升级到“扩给谁”
- 先定义政策边际:降低报名距离、提高补贴还是放宽资格,会推动不同阻力的人。
- 解释 U:若工具是价格,U 可能接近支付意愿/净收益阻力;若工具是距离,U 的经济含义可能不同。
- 检查支持:倾向得分是否覆盖计划扩张到的区间?没有数据的高 U 区域只能靠函数形式外推。
- 分开参与与结果:政策可能提高参与率,但新增参与者的平均收益低于原参与者。
- 报告政策相关对象:不仅给 IV/LATE,还要说明目标政策需要 ATE、ATT 还是 PRTE。
MTE 也不是无假设答案:连续工具的支持、单调选择结构、潜在结果关于 U 的函数形式以及工具的排除限制都要接受检验和敏感性分析。
What you should retain进阶四页最后要留下的不是缩写,而是四个判断
选择的形状连续数量还是离散菜单?替代模式是否可信?
时间今天的行动是否改变未来状态和价值?
互动一个人的收益是否取决于其他人的行动?
参与边际政策改变的是哪一群人的选择和处理效应?
计算是在解模型、算目标函数,还是在搜索参数?
证据边界关键参数、均衡和外推区间分别靠什么数据支持?