源自风暴统计网:一键统计分析与绘图的网站

上一篇我们详细讲解了混杂偏倚的来源、判断方法和控制策略。从差异性分析到回归分析,从倾向得分到机器学习,因果推断的方法在不断演进。

今天,我们就来系统介绍因果推断的五种核心方法:回归方法、G计算、倾向得分方法、机器学习方法和双重稳健估计。这些方法各有特点,也各有适用场景。

从“吸烟与肺癌”的因果争议说起

在正式介绍方法之前,我们先回顾一段重要的历史。

20世纪40至50年代,Austin Bradford Hill为首的流行病学家通过一系列研究发现,吸烟与肺癌存在强关联:

  • 吸烟者患肺癌的风险远高于不吸烟者;

  • 吸烟量越大、吸烟时间越长,患癌风险越高;

  • 在不同人群、不同时间、由不同研究者进行的研究中,都得到了相似的结果。

然而,现代统计学的奠基人Fisher提出了尖锐质疑。他认为,观察性研究发现的关联可能由混杂因素导致,提出了基因混杂假说。Fisher的观点掷地有声:“你们的数据只显示了关联,但无法证明因果关系。”

Hill的观点最终胜出,推动了全球控烟运动,但Fisher的质疑留下了深远影响:50至90年代的统计学界普遍认为“相关不等于因果”,随机对照试验被奉为因果推断的“黄金标准”。

那么,观察性研究就真的无法推断因果了吗?20世纪80年代,两个重要的理论框架给出了答案。

因果推断的两大理论框架

20世纪80年代,基于“反事实” 理论,统计学家如Donald Rubin提出潜在结果框架和计算机科学家Judea Pearl提出因果结构模型。

首先我们先简单了解一下反事实框架,该框架由科学哲学家David Lewis提出。

什么是反事实?就是我们无法观测到的事实。

  • 比如,一个患者服用了降压药,我们观测到血压是120mmHg。但我们永远无法知道,如果他没有服用药物,他的血压会是多少——这个无法观测的结果,就是反事实。

潜在结果框架由统计学家Donald Rubin提出。在这个框架中:

  • Y_i(1):个体i如果接受处理时的结果

  • Y_i(0):个体i如果未接受处理时的结果

  • 个体因果效应 = Y_i(1) - Y_i(0)

  • 平均处理效应(ATE)= E[Y(1) - Y(0)]

举个例子,假设我们研究一种新降压药A。

在理想世界里,我们可以同时知道服用药物后的血压(120mmHg)和不服用药物时的血压(140mmHg)。

但在真实世界里,我们只能观测到其中一个——服用了药物的人,我们看不到他没服药时的血压;没服药的人,我们看不到他服药后的血压。

另一个潜在结果,永远是“缺失”的。

ATE (平均处理效应)作为最常用的因果推断估计效应指标,回答的就是:在整个群体中,每个人都接受处理和每个人都不接受处理的平均结果会相差多少?

结构因果模型由图灵奖得主Judea Pearl提出,它的语言是有向无环图(DAG)。

  • DAG是一个带有箭头的、没有回路的图形,表示假设的因果影响的方向(例如,从吸烟到肺癌);

  • 在DAG中,每个节点代表一个变量,每条有向边(箭头)X→Y代表一个直接的因果机制。

DAG的核心价值在于,它迫使研究者基于领域知识,明确提出关于变量之间因果结构的假设。通过DAG,我们可以:

  • 明确识别并控制混杂因素

  • 确定不应控制的碰撞变量以免引入偏倚

  • 理清中介路径和潜在的效应修饰

  • 判断何种变量可用作工具变量

这两个框架——潜在结果框架和结构因果模型——共同构成了现代因果推断的理论基石。

随机化方法通过塑造反事实人群,保证处理组和对照组在所有混杂因素上可比;而观察性研究则需要通过统计方法“创造”出类似随机化的条件。

混杂变量的选择往往基于先验知识以及DAG方法,避免非因果路径的干扰。

因果推断方法1 回归方法

回归是最基础的因果推断方法。其基本公式为:

Y = β₀ + β₁ * X₁ + β₂ * X₂ + β₃ * X₃ + ε

其中,Y是结局(如肺癌),X₁是处理变量(如吸烟),X₂、X₃是协变量(如年龄、性别)。

回归系数β₁的解释是:“在保持其他变量X不变的情况下,A变动一个单位,Y平均变动β个单位”。

根据结局类型的不同,回归可分为:

  • 线性回归:β值

  • 广义线性回归:OR值、RR值(包括Logistic回归、泊松回归等)

  • Cox比例风险模型:HR值

回归的作用包括四个方面:

  • 描述性研究中,回归是一种标准化的方法;

  • 多个“影响因素”研究中,回归用于探索性关联分析,变量相互校正,称之为“独立影响因素”;

  • 临床的诊断与预后预测模型中,预测因子并不需要一定与结局有因果关系;

  • 控制混杂偏倚时,回归是一种因果推断的基本方法。

但需要注意的是,回归不一定推导出因果关系。

风险因素(或保护因素)通常来自关联性研究,或需要事后分析来确认其对结局的作用。而因果因素则要求采用能够确立因果关系的对照实验设计,包括反事实框架设计。

回归可用于关联分析,也可用于因果推断,两者的最大区别在于是否基于领域知识——数据驱动型分析 vs 知识驱动型分析。

那么,回归系数β₁什么时候等于ATE?需要满足两个条件:

假设1:条件可忽略性。所有重要混杂变量都已纳入模型,在给定X的条件下,处理分配A与潜在结果独立。若遗漏任何与A和Y都相关的变量,β₁就是有偏的。

假设2:正确的函数形式。回归假设A对Y的效应是线性的、可加的,无论X是什么值,效应都是恒定的β₁。

这两个条件在实际研究中往往难以完全满足,这就引出了更灵活的方法。

因果推断方法2 G计算

G计算是反事实框架下更直接、更灵活的一种方法。

它的核心思想很直观:如果强制全世界所有人都吸烟,肺癌发病率是多少?如果强制所有人都不吸烟,肺癌发病率又是多少?两个发病率的差值,就是ATE。

G计算分为三步:

第一步:构建结果预测模型

Y ~ β₀ + β₁ * A + β₂ * X₂ + β₂ * X₃² + spline(X₃) + ...

可以选择线性模型、逻辑回归,甚至机器学习模型。

第二步:得到反事实结果

将处理变量A强制设定为1(暴露),保持原始协变量X_i不变,代入模型预测Ŷ_i(1);再将A强制设定为0(未暴露),预测Ŷ_i(0)。

第三步:计算因果效应

E[Y(1)]的估计值 = 所有Ŷ_i(1)的平均值

E[Y(0)]的估计值 = 所有Ŷ_i(0)的平均值

ATE = E[Y(1)] - E[Y(0)]

G计算的优势在于模型灵活:可以包含任意复杂的交互项(如A×年龄 + A×性别),可以使用非线性项(多项式、样条函数),还可以结合机器学习算法。

它将焦点从“解读一个神秘的系数β₁”转移到“构建一个尽可能接近现实的数据生成模型”上来。

因果推断方法3 倾向得分方法

当我们面对几十个甚至上百个混杂变量时,回归和G计算都会遇到挑战。倾向得分方法的核心思想是降维——把多个混杂变量压缩成一个综合指标。

倾向得分(PS)是指在给定协变量条件下,个体接受暴露的概率,是一个0到1之间的值。

PS计算常用Logistic回归,以暴露因素作为因变量,以所有混杂变量作为自变量,拟合后计算预测概率。

把多个协变量(混杂变量用一个指标代替),PS相似的人,协变量分布也相似。

基于这一思想,倾向得分可以构造反事实人群,主要有四种方法:

  • 倾向得分匹配:在对照组中寻找与暴露组倾向得分相近的个体进行匹配;

  • 逆概率加权(IPTW):以所有观察对象为标准人群,暴露组权重=1/PS,对照组权重=1/(1-PS);

  • 标准化死亡比加权(SMRW):以暴露组为标准人群,暴露组权重=1,对照组权重=PS/(1-PS);

  • 重叠加权。

倾向得分方法解决了回归方法的一些痛点:不依赖于结局模型的正确设定,可以处理大量混杂变量,还能直观展示匹配效果。

因果推断方法4 机器学习方法

传统统计方法有其局限:假设较强(线性关系、正态分布),变量多时容易失效,难以灵活处理非线性、交互作用等复杂模式。

机器学习的优势恰恰相反:能自动从数据中学习规律,灵活处理高维、多变量、非线性问题,提升预测能力。

在医学数据分析中,机器学习有三类应用:

  • 描述:发现疾病分布、类别和人群聚集;

  • 预测:疾病诊断与预后预测;

  • 因果推断:评估暴露、干预与结果的因果关系。

机器学习在因果推断中的核心功能是预测:

  • 预测结局时,构建结果模型代替G计算中的预测模型;

  • 预测暴露时,计算倾向得分代替Logistic回归。

通过交叉验证、集成学习、深度学习等策略,预测效果可以大幅提升。

超级学习者(Super Learner)是一种强大的集成学习方法。它将多个候选算法(基学习器)的预测结果作为输入,使用交叉验证和元学习器来学习如何最优地组合这些基预测器。

  • 基学习器:逻辑回归、随机森林、梯度提升树(XGBoost)、支持向量机(SVM)、K-近邻等;

  • 元学习器:基于线性方程,通过交叉验证给不同基学习器分配权重,构建最佳预测模型。

超级学习者解决了常规因果推断方法的核心痛点:倾向得分模型误设(如遗漏非线性关系)和结果模型误设(如错误函数形式)。

在实际应用的时候,我们可以将超级学习者与我们稍后提到的双重稳健估计结合,例如下面这两篇文章。

特邀评论:在causal10研究中使用机器学习时解密统计推断

使用目标最大似然估计估计体重指数和中心性肥胖对糖尿病和非糖尿病患者卒中的影响:社区动脉粥样硬化风险研究

文章中提到

  • The super learner approach is an ensemble machine learning approach that uses cross-validation to select an optimal statistical model from among many candidate models

    超级学习器方法是一种集成机器学习方法,它通过交叉验证从众多候选模型中选择最优统计模型。

  • Double-robust methods have the advantage of using both exposure and outcome models that remain consistent if either exposure or outcome models are estimated consistently. In addition, TMLE can use the super learner machine learningalgorithms that result in protecting against bias。

    双重稳健方法的优势在于同时利用暴露模型和结果模型进行估计——只要其中任一个模型被准确估计,就能保持估计结果的一致性。此外,目标最大似然估计(TMLE)可以结合超级学习器机器学习算法,从而有效防止偏差产生。

使用超级学习者的TMLE的结果如图所示

因果推断方法5 双重稳健估计

双重稳健估计是当前因果推断领域最前沿的方法之一。它结合了两种传统模型:

  • 结果模型:根据协变量X,预测接受或不接受处理时结果Y的期望值,μ_a(X)=E[Y|A=a,X]

  • 暴露模型/倾向评分模型:根据协变量X,估计接受处理的概率,e(X)=P(A=1|X)

双重稳健估计的核心意义在于:只要倾向得分模型或结果模型中有一个被正确建模,就可以得到可靠的因果效应估计。

常见的双重稳健估计方法有三种:

  • 增强逆概率加权法(AIPTW):分别建两个模型,再用残差校正因果效应(R包:drtmle、AIPW)

  • 靶向最大似然估计(TMLE):先估计结果模型,再用聪明变量进行靶向修正(R包:tmle、ltmle)

  • 双重机器学习(DML):采用交叉拟合技术,数学上更“正交”(R包:DoubleML)

其中,TMLE具备五大优势:

  • 双重稳健性:只要一个模型正确,估计即一致

  • 效率最优:可达到理论上最小方差

  • 机器学习兼容性强:可整合任意监督学习模型(如Super Learner),无须依赖参数化假设

  • 靶向校正机制:自动调整预测值,使估计对准因果参数

  • 衍生方法多样:适用于普通、高维、缺失、生存时间等多种场景

实际上,靶向最大似然估计(TMLE)还可衍生出许多种方法

最常见的为以下四种:


我们来看一篇有关靶向最大似然估计(TMLE)的一个综述。

研究结果显示,TMLE相关研究的发文量从2006年起,逐年增长。从下图中,我们可以看到,每年有哪些新的TMLE方法被提出以及应用。

研究团队还探究了各个地区的发文情况,我国大概发文2~3篇。

例如下面这一篇,感兴趣的可以去看一下具体的方法与结果。

本章总结

今天,我们介绍了因果推断的五种核心方法:

方法

核心思想

优点

局限

回归方法

模型调整混杂

简单透明,易于解释

依赖模型正确设定

G计算

反事实预测

模型灵活,可加交互项

依赖结果模型正确

倾向得分

降维匹配/加权

不依赖结局模型

依赖暴露模型正确

机器学习

自动学习规律

灵活处理高维非线性

需结合领域知识

双重稳健

结合两种模型

一个正确即可,高效稳健

实现较复杂

回顾因果推断方法的发展历程:从差异性分析到回归分析,从倾向得分到机器学习,再到双重稳健估计,每一步都是在解决一个核心问题——如何在观察性研究中更准确地估计因果效应。

但无论方法如何演进,有一个观点始终不变:数据驱动不能带来因果关系,现代医学因果推断是预测模型与领域知识的结合。

反事实潜在结果、DAG、倾向得分方法是因果推断的常见组合;而在这个框架下开展机器学习,尤其是机器学习与双稳健估计方法的结合,将产生更大的能量。

正如文献所指出的:That is, we cannot answer causal questions with the data alone, no matter how big the data are and how deep the neural network is.

下一篇我们将介绍,如何绘制一个可信的有向无环图(DAG)!敬请期待!


关于郑老师团队及公众号

郑老师团队统计服务,为医学生、医护工作者学术研究提供统计支持!

1.医院数据真实世界研究

影响因素分析与焦点因素分析策略;倾向性评分方法匹配、逆概率加权(IPTW)、重叠加权及后续效应值估计;亚组分析,交互作用P值及森林图;中介交互分析、因果中介分析;限制性立方样条、阈值效应分析、区段回归分析;

2.临床预测模型(二分类及生存)

基于回归方法的预测模型构建与验证,绘制列线图;机器学习预测模型构建与验证;可解释性SHAP绘图;缺失数据下的预测模型;预测模型在线网站建设;动态预测模型;影像组学预测模型

3.纵向数据分析

重复测量ANOVA、混合线性模型LMM、广义估计方程GEE、广义线性混合效应模型GLMM、潜增长曲线模型LGCM;群组轨迹模型(GBTM)/潜类别增长模型(LCGA)、潜类别混合增长模型(GMM/LGMM)、多轨迹模型(GBMTM);聚类分析;时依协变量模型;多状态模型;

4.高级因果推断方法实践

参数G方法、双重稳健估计进行因果推断:目标最大似然估计(TMLE);机器学习、超级机器学习进行因果推断;治疗效果异质性分析(HTE)与因果森林;

5.公共数据库数据挖掘

NHANES数据挖掘、CHARLS等老年库数据挖掘、MIMIC数据挖掘,多变量孟德尔随机化MR、中介MR、肠道菌群MR、药靶MR、网络药理学结合MR、单细胞RNA测序分析结合MR

需以上统计服务,请联系郑老师团队(微信:sas555777)

图片

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐