本文是对 Causal Inference and Machine Learning(在线书)第 16 章 Counterfactual Framework 一节的读书笔记,对应 Counterfactual Framework — causalmlbook.com。偏概念串讲:把原书从「什么叫因果问题」到「为什么不能用两组均值直接当 ATE」这条线捋清;具体估计方法(matching、IPW、双稳健等)书里后文还会展开,此处只记框架与记号。
1. 「能谈因果」与可操纵性(manipulability)
原书强调:仅凭两组结果不同或变量与结果相关,不能自然推出因果;混淆、遗漏变量、选择机制等都会驱动观测差异。
更关键的一点是:因果陈述往往针对的是可以施加的干预(treatment / policy)。若某个特征在科学或伦理意义上无法被「操纵」(例如单纯说「年龄本身」或「性别本身」直接造成收入差异),就不宜把它当成可干预的处理去谈「处理效应」——观测差异更可能来自结构因素、混淆或未观测变量。书中用年龄举例:不能直接下结论「更老导致收入更低」;但若讨论的是可实施的干预(例如为年长员工提供特定培训或设备),则可以讨论该干预对结果的因果效应。
2. 潜在结果(Rubin Causal Model, RCM)——记号一层纸
对个体 i:
| 记号 | 含义 |
|---|---|
处理变量 D_i |
是否接受处理(书中常用 0/1;也可推广到多值) |
潜在结果 Y_i(1), Y_i(0) |
若接受 / 未接受处理时,理论上会出现的结果 |
观测结果 Y_i |
实际只看到其中一个世界 |
观测结果与潜在结果的关系(一致性写法的一种紧凑形式):
Y_i = D_i · Y_i(1) + (1 - D_i) · Y_i(0)
基本困难:对每个人而言,Y_i(1) 与 Y_i(0) 不能同时观测到——未发生的那一侧就是反事实(counterfactual),因果推断在数学上很像「带系统缺失的反事实填坑问题」。
3. RCM 里我常记的一条:可忽略性(ignorability)
条件可忽略性(unconfoundedness / conditional independence)可写成:
( Y_i(1), Y_i(0) ) ⊥ D_i | X_i
(读作:在给定 X_i 的条件下,潜在结果与是否处理独立。)
直观理解:在给定事先测得的协变量 X 之后,处理分配「就像随机」一样,不再与潜在结果相关;此时才可以用匹配、加权、回归调整等去模拟随机化。
- RCT:分配机制本身带来(近似)独立性,是可忽略性的强版本。
- 观测数据:往往需要故事 + 设计 + 统计调整;高维时原书也提到可用 LASSO、随机森林 等帮助估计倾向得分或筛选/建模混杂相关结构,但不能单靠算法自动保证因果成立——识别仍依赖假设与场景。
(RCM 还有 SUTVA 等假设,本章后面会系统讲;笔记里我最先抓住的是「可忽略性 + 缺失反事实」这一对。)
4. 为什么「处理组减对照组」≠ ATE:SDO 分解
记 π = P(D_i = 1)(处理组占比)。书中将简单组间结果差(Simple Difference in Outcomes, SDO)
E[ Y_i(1) | D_i = 1 ] − E[ Y_i(0) | D_i = 0 ]
(注意:左边是在处理状态下对处理组的期望,右边是在对照状态下对对照组的期望。)
分解为三项(与 原书 §16.3 一致):
E[Y_i(1)|D=1] − E[Y_i(0)|D=0] ← SDO(朴素组间差)
= E[Y_i(1)] − E[Y_i(0)] ← ATE(平均处理效应)
+ E[Y_i(0)|D=1] − E[Y_i(0)|D=0] ← Selection bias(基线/选择偏差)
+ (1 − π) · (ATT − ATU) ← 效应异质性带来的偏差项
直观读法:
- ATE:全体若都处理 vs 都不处理的平均差异——我们常想估的量。
- Selection bias:即使大家都不处理,处理组与对照组在
Y(0)上也可能本来就不同(谁进处理组往往不是抛硬币)。 (1 − π)(ATT − ATU):处理效应若因人而异,「对处理者的平均效应」ATT 与「对未处理者的平均效应」ATU 不同;朴素组间差会把这种异质性以特定权重混进 SDO。若效应同质(ATT = ATU),这一项为 0。
因此:RCT 下处理分配与潜在结果独立,选择偏差与异质性偏差项在理想情形下可被消除或大幅减弱,故更接近直接识别因果效应;观测研究则需要显式识别策略与估计器去对付后两项。
5. 与后文方法的关系
- ATE、ATT、ATU、CATE 等在个体层面都面临「反事实缺失」,只能作为 estimand(估计目标),用数据 + 假设去 estimate。
- 原书后续章节会从随机化、可观测选择(matching / weighting / doubly robust)、不可观测选择(IV、DiD、RD 等)一路接到 因果机器学习(如 DML、causal forest)——本章的分解解释了为什么要做这些工具:它们都在处理 SDO 里多出来的偏差结构。
SDO 分解的写法与直观解释见同一章 §16.3(与正文同页)。