课程目录 · 已完成 0 / 7 个模块
  1. 课程首页
  2. 1先判断是否需要结构模型
  3. 2从研究问题到可估计模型
  4. 3数学急救包
  5. 4MLE、GMM、SMM
  6. 5发展经济学经典案例
  7. 6机械化服务完整实操
  8. 7学习路线与自测
Module 2 · 约 40 分钟

从研究问题
到可估计模型

模型不是先写一堆公式,而是把“谁在什么约束下、根据什么信息、做什么选择”逐项说清,再把这些对象映射到数据。

Step 0

先把政策问题压成一句可检验的话

主线问题:机械化服务补贴通过降低农户的实际支付价格,能把多少农户从“不购买”推到“购买”?不同经营规模的反应是否不同?

这句话决定模型只需要一个静态二元选择起步。若问题改为“补贴会不会吸引服务商进入并改变市场价格”,就必须再加入供给和进入决策;不能靠同一个静态需求模型硬答。

Model anatomy

入门版八问:先把最小模型说完整

1 · 行动者

谁在决定?

农户决定是否购买机械化服务。教学版暂不让服务商同时定价。

2 · 选择集

能选什么?

购买或不购买。真实项目要确认农户是否还有自有机械、人工、互助等外部选项。

3 · 状态与信息

决策时知道什么?

服务价格、地块规模、距离与质量。动态模型还要加入未来状态及预期。

4 · 收益与约束

为什么这样选?

服务节约劳动、提高作业及时性,但要支付价格和交通/搜寻成本。

5 · 随机项

研究者看不到什么?

未观测偏好或临时冲击。分布假设决定选择概率的形式,不只是“塞一个误差项”。

6 · 参数

要从数据挖什么?

价格敏感度、经营规模收益、距离成本等。参数必须有单位和经济含义。

7 · 数据映射

模型怎样生成可观测量?

给定参数与农户特征,模型生成购买概率;这些概率应能复现采纳率及异质性。

8 · 政策环境

反事实改变什么?

补贴只改变农户净价格。若供给能力和市场价格会响应,必须明确扩展模型。

这八问是便于起步的压缩版,不是所有结构模型的完整目录。进入连续选择、动态模型或博弈前,还要把时间、均衡、异质性和分布选择逐项展开。
Full model audit

完整建模审计:十二个决定缺一项,反事实都可能变

行动者一个农户、家庭成员,还是农户与服务商?
均衡范围价格和进入给定,还是由市场共同决定?
规划期静态、有限期还是无限期?行动者是否前瞻?
时间单位日、季、年怎样对应选择与状态变化?
选择集合连续数量、有限菜单,还是二者组合?
状态与转移什么概括今天,行动怎样改变明天?
目标函数效用、利润、家庭福利或其他目标是什么?
信息行动者看见什么?研究者又看见什么?
可观测异质性规模、性别、地区怎样改变收益或约束?
不可观测异质性永久类型、临时冲击与不确定性要分开。
函数形式线性、对数、CES 等限制为何适合问题?
分布logit、正态或离散类型怎样影响替代与尾部?

如果某项被固定或忽略,也要把它写成假设。例如“静态”不是没想过未来,而是假定未来价值不会因本期选择而改变。

A small model

把故事写成最小可估计模型

令农户购买服务相对于不购买的效用差为:

ΔUᵢ = β₀ + α × 净服务价格ᵢ + β × log(1 + 经营规模ᵢ)
   + γ × 距离ᵢ + δ × 服务质量ᵢ + εᵢ

若 ΔUᵢ > 0,则购买;否则不购买。
  • α 应为负:净价格越高,购买意愿越低。
  • β 通常为正:经营规模越大,使用专业化服务的收益可能越高。
  • γ 通常为负:离服务供给点越远,搜寻与协调成本越高。
  • ε 的分布:教学版采用 logistic 差分对应的 logit 概率;这是一项可检验、可质疑的建模选择。
不能把所有变量都称为“深层参数”。经营规模和距离是状态/特征,补贴是政策变量;α、β、γ、δ 才是模型拟估的行为参数。
Identification map

每个参数靠什么变化识别?

参数—数据—假设对应表
参数主要数据变化关键威胁教学版处理
价格敏感度 α随机发放代金券造成的净价格变化代金券可能同时传递信息或改变服务质量假设代金券只通过价格起作用
规模收益 β不同经营规模农户的采纳差异规模与能力、机械条件等未观测因素相关教学数据中相关变量均由模型生成
距离成本 γ距离与采纳率的梯度服务商可能选择在高需求地区布局教学版把距离视为外生;真实研究需论证
质量偏好 δ服务质量差异与选择质量测量误差、价格与质量共同决定使用可观测质量指标并明确其局限

“两个参数配两个矩”只是计数条件,不是识别证明。真正的问题是:不同参数改变数据分布的方式是否足够不同,且用于识别的变化是否外生或由模型正确解释。

End-to-end workflow

从模型到论文:七步闭环

  1. 事实:用描述统计和设计型估计明确模型必须解释的关键事实。
  2. 模型:写行动者、选择、状态、收益、约束、随机项与均衡概念。
  3. 映射:推导或模拟给定参数时的选择概率、矩或其他可观测结果。
  4. 识别:逐参数说明数据变化和排除性假设,必要时用实验/IV。
  5. 估计:选择 MLE、GMM、SMM 等目标函数,并报告优化和标准误。
  6. 拟合与验证:先看用于估计的事实,再看未使用矩、留出样本或外部政策冲击。
  7. 反事实:改变政策、重新求解,并报告参数/模型不确定性与适用边界。
蒙特卡洛门槛:在真实数据之前,用已知参数生成假数据,检查代码能否估回真值。估不回时先修代码或识别,不要继续解释真实数据。
Fit is not enough

拟合、验证与反事实可信度

样本内拟合

能否复现基本事实?

检查总采纳率、价格梯度、规模异质性。若这些都复现不了,反事实没有基础。

未用矩

能否解释没有拿来估计的事实?

例如用总体采纳率估计,却检验不同距离组的采纳差异。

外部验证

能否预测新环境?

最好使用留出地区、后续时期或实验政策冲击,避免“用同一份数据既出题又判卷”。

敏感性

结论依赖哪些假设?

更换误差分布、允许价格内生、加入供给反应,看政策排序是否稳健。

验收标准:能为一个研究问题写出“行动者—选择—收益—数据—识别—反事实”六行模型草图。