项目详情
面向复杂观测数据的抗噪声因果推断深度学习模型优化
背景与动机
观测性数据广泛存在于经济学、医学与运营决策中。与随机对照实验不同,观测数据常面临未观测混杂、选择偏差与测量噪声三重挑战,直接使用深度神经网络估计处理效应容易过拟合噪声、产生有偏因果估计。如何在高维、强噪声的观测数据上获得稳健且可信的因果效应估计,是因果机器学习的关键难题,也是本人本科毕业论文的研究主题。
方法与创新
基于 Dragonnet 的共享表示
以 Dragonnet 为基础架构,通过共享表示层同时建模处理机制与结果机制,降低方差;在其双头输出(处理概率与潜在结果)之上引入多重正则化以增强因果识别的稳健性。
三重鲁棒性增强
- HSIC 独立性约束:在表征层施加 Hilbert-Schmidt 独立性准则约束,迫使隐藏表示与处理分配条件独立,缓解混杂偏倚
- Neyman 正交化:对损失函数进行正交化改造,使处理效应的估计对 nuisance 参数的一阶误差不敏感,提升有限样本稳定性
- 不确定性量化:引入分位回归与贝叶斯式 dropout 估计,输出因果效应的置信区间而非单点估计,支撑风险敏感决策
实验与成果
在 IHDP、ACIC 等基准因果数据集以及注入结构化噪声的合成数据上,相比 Causal Forest、标准 TARNet / Dragonnet,本框架在噪声强度上升时保持更低的 PEHE 与更紧的不确定性区间覆盖率,验证了三重鲁棒性设计的有效性。
该工作形成本科毕业论文,系统梳理了"表征去混杂—损失正交化—不确定性量化"的抗噪声因果推断技术路线,为后续在广告投放 LTV 优化等工业场景落地奠定基础。