网络干扰下基于最优传输的因果效应估计研究-实验

PPT

数据生成机制

合成实验中,处理分配概率依赖个体协变量 XiX_i、邻居协变量 XN(i)\bar{X}_{N(i)}、度数 did_i、社群归属 CiC_i和非线性交互项, γ\gamma 控制网络混杂强度。简化表达为

P(Ti=1|X,G)=logit1{γf(Xi,XN(i),di,Ci)P(T_i=1\mid X,G)=\operatorname{logit}^{-1}\{\gamma \cdot f(X_i,\bar{X}_{N(i)},d_i,C_i)

结果生成模型包含基线结果、邻居影响-暴露效应 λEi\lambda E_i、自身处理效应 TiτiT_i\tau_i 以及处理与协变量、度数、邻居协变量和暴露之间的交互(TiXi,TidiT_iX_i, T_id_i等):

Yi=μ0(Xi,XN(i),di,Ci)+λEi+Tiτi+εiY_i=\mu_0(X_i,\bar{X}_{N(i)},d_i,C_i)+\lambda E_i+T_i\tau_i+\varepsilon_i

τi\tau_i (忽略网络干扰的ITE)在模拟过程中已知,因此可以计算真实的平均处理效应,并进一步计算偏差和均方根误差。

真实拓扑半合成实验中,网络结构取自真实 Facebook 社交网络,did_i 分布长尾且高度数节点存在; 社区结构更明显; 局部聚集性更强; 邻居之间更可能相似;处理变量和结果变量用人工机制生成。

处理概率依赖个体特征、邻居特征、度数和社区结构,从而形成网络混杂;结果模型同时包含自身处理效应和邻居暴露效应,从而体现网络干扰。

对比指标

估计的准确程度

  • 偏差:Bias=E(τ^τ)Bias=E(\hat{\tau}-\tau)
  • 均方根误差:RMSE=E[(τ^τ)2]RMSE=\sqrt{E[(\hat{\tau}-\tau)^2]}

方法诊断与边界分析:

  • 传输成本:判别匹配难度与稳健性(成本高时,表示差异大,依赖外推,不够稳健)
  • 有效对照样本量 ESS:判别重叠/支持度
  • 最大负载:判别最重要的对照样本承担了多少匹配权重(权重集中,估计不稳定)
  • 传输前后标准化均值差 SMD:两个分布的平衡改善情况
  • 拓扑扰动下的估计漂移:网络扰动(边重连)后估计稳定性
  • 未观测混杂敏感性区间:如果还有隐藏混杂,结论是否可靠(远离 0,结论稳健)

对比方法与结果

Naive同一暴露内处理组与对照组直接均值差
IPW固定暴露基于个体协变量的逆概率加权
OR固定暴露使用调整表示的结果回归
OT-no-exp忽略暴露的最优传输匹配
OT-match在暴露内做最优传输,无残差化校正
OT-no-web不使用网络结构表示,仅保留个体协变量
本文方法暴露约束、容量上限传输与残差化校正

重复24次,指标为RMSE(Bias),Variance=MSE2Bias2MSE^2-Bias^2

场景NaiveIPWOROT-no-expOT-matchOT-no-web本文方法
强网络混杂1.763 (1.745)0.544 (0.487)0.455 (0.420)0.803 (0.784)0.851 (0.839)0.637 (0.608)0.369 (0.330)
高同质性1.677 (1.662)0.536 (0.485)0.362 (0.326)0.647 (0.635)0.777 (0.761)0.529 (0.505)0.282 (0.236)
弱重叠消融1.905 (1.882)0.783 (0.726)0.561 (0.522)1.047 (1.023)0.966 (0.951)0.794 (0.759)0.430 (0.370)
真实拓扑半合成1.624 (1.605)0.682 (0.657)0.494 (0.478)0.605 (0.581)0.816 (0.799)0.607 (0.591)0.403 (0.376)
Naive:误差最大,说明网络观测数据中确实存在显著混杂
IPW/OR:能够降低误差,但在网络结构混杂较强时仍不充分
OT-no-exp:跨暴露状态匹配破坏因果对比性
OT-match:存在较大偏差。
OT-no-web:去掉结构表示会导致性能下降
本文方法(暴露约束、网络结构表示、容量上限和残差化校正):在四个场景中均取得最低均方根误差
方差:各类场景下,本文方法方差均小于IPW方法

理论验证诊断:

A:当源分布与目标分布的调整表示偏移增大时,纯传输误差明显增加,本文方法基本稳态
B:估计偏差项与纯传输误差较强对应关系
C:方差代理量与平方误差之间的关系
D:样本量增大时,RMSE下降,趋势接近 n1n^{-1}合理的收敛趋势
E、F:标准化误差的正态近似 和 Wald 覆盖率接近 95%:在稳定设计下可以使用近似推断

合成网络验证:压力测试与消融实验

A:网络混杂强度上升,Naive和OT-match误差快速增大,本文方法保持较低误差
B:随着同质性增强,网络结构相关混杂更明显
C:溢出效应增强时,OT-no-exp 产生明显误差
D:暴露区间数与有效对照样本量之间需要权衡
E:弱重叠场景下的消融实验
F:OT后的表示平衡情况:改善了多个维度上的分布差异

真实拓扑半合成实验

A:网络度分布具有明显长尾特征:大多节点连接边少,连接边集中于少数节点
B:本文方法在真实拓扑场景中仍然取得最低RMSE
C:不同暴露层的处理样本、对照样本和有效对照样本量:高暴露单元支持不足
D:边重连扰动下的估计漂移和暴露标签不稳定性:当拓扑扰动改变暴露状态时,估计目标本身也会发生变化
E:未观测网络混杂的敏感性区间
F:真实拓扑表示上的平衡改善情况

结论

围绕网络干扰下的因果效应估计问题,设计了一种基于暴露约束、最优传输和残差化校正的估计方法:通过暴露映射明确因果对比,在固定暴露状态内使用带容量上限的最优传输构造对照分布,最后通过交叉拟合结果回归进行残差化校正。
实验表明,在强网络混杂、高同质性、弱重叠和真实拓扑半合成场景中,本文方法均取得最低均方根误差。消融实验进一步说明,忽略暴露状态、去掉残差化校正或不使用网络结构表示都会导致性能下降。多面板诊断图表明,该方法不仅能降低估计误差,也能提供有效样本量、平衡性、拓扑稳定性和未观测混杂敏感性等辅助判断。

本方法并不声称可以消除网络因果推断中问题,但能够在明确暴露的前提下,将最优传输的分布平衡能力与因果推断中的残差化校正结合起来,为复杂网络场景下的政策评估和机制分析提供有价值的工具。

IPW与本文方法的比较:

  • 都基于再加权思想,目标都是构造一个更可比的对照分布,来近似RCT
  • 回归结合思想,前者双重稳健估计,后者残差化校正
  • 前者通过倾向得分模型实现平衡,是处理概率校正
  • 后者通过表示空间距离实现平衡,是分布几何对齐

后续方向

  1. 引入图神经网络进行表示学习,提高表示对潜在网络混杂的捕捉能力
  2. 更优秀的暴露映射选择策略,在偏差和样本支持之间自动权衡
  3. 在真实业务数据上进行案例研究

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注