数据生成机制
合成实验中,处理分配概率依赖个体协变量 、邻居协变量 、度数 、社群归属 和非线性交互项, 控制网络混杂强度。简化表达为
结果生成模型包含基线结果、邻居影响-暴露效应 、自身处理效应 以及处理与协变量、度数、邻居协变量和暴露之间的交互():
(忽略网络干扰的ITE)在模拟过程中已知,因此可以计算真实的平均处理效应,并进一步计算偏差和均方根误差。
真实拓扑半合成实验中,网络结构取自真实 Facebook 社交网络, 分布长尾且高度数节点存在; 社区结构更明显; 局部聚集性更强; 邻居之间更可能相似;处理变量和结果变量用人工机制生成。
处理概率依赖个体特征、邻居特征、度数和社区结构,从而形成网络混杂;结果模型同时包含自身处理效应和邻居暴露效应,从而体现网络干扰。
对比指标
估计的准确程度
- 偏差:
- 均方根误差:
方法诊断与边界分析:
- 传输成本:判别匹配难度与稳健性(成本高时,表示差异大,依赖外推,不够稳健)
- 有效对照样本量 ESS:判别重叠/支持度
- 最大负载:判别最重要的对照样本承担了多少匹配权重(权重集中,估计不稳定)
- 传输前后标准化均值差 SMD:两个分布的平衡改善情况
- 拓扑扰动下的估计漂移:网络扰动(边重连)后估计稳定性
- 未观测混杂敏感性区间:如果还有隐藏混杂,结论是否可靠(远离 0,结论稳健)
对比方法与结果
| Naive | 同一暴露内处理组与对照组直接均值差 |
| IPW | 固定暴露基于个体协变量的逆概率加权 |
| OR | 固定暴露使用调整表示的结果回归 |
| OT-no-exp | 忽略暴露的最优传输匹配 |
| OT-match | 在暴露内做最优传输,无残差化校正 |
| OT-no-web | 不使用网络结构表示,仅保留个体协变量 |
| 本文方法 | 暴露约束、容量上限传输与残差化校正 |
重复24次,指标为RMSE(Bias),Variance=
| 场景 | Naive | IPW | OR | OT-no-exp | OT-match | OT-no-web | 本文方法 |
| 强网络混杂 | 1.763 (1.745) | 0.544 (0.487) | 0.455 (0.420) | 0.803 (0.784) | 0.851 (0.839) | 0.637 (0.608) | 0.369 (0.330) |
| 高同质性 | 1.677 (1.662) | 0.536 (0.485) | 0.362 (0.326) | 0.647 (0.635) | 0.777 (0.761) | 0.529 (0.505) | 0.282 (0.236) |
| 弱重叠消融 | 1.905 (1.882) | 0.783 (0.726) | 0.561 (0.522) | 1.047 (1.023) | 0.966 (0.951) | 0.794 (0.759) | 0.430 (0.370) |
| 真实拓扑半合成 | 1.624 (1.605) | 0.682 (0.657) | 0.494 (0.478) | 0.605 (0.581) | 0.816 (0.799) | 0.607 (0.591) | 0.403 (0.376) |
IPW/OR:能够降低误差,但在网络结构混杂较强时仍不充分
OT-no-exp:跨暴露状态匹配破坏因果对比性
OT-match:存在较大偏差。
OT-no-web:去掉结构表示会导致性能下降
本文方法(暴露约束、网络结构表示、容量上限和残差化校正):在四个场景中均取得最低均方根误差
方差:各类场景下,本文方法方差均小于IPW方法
理论验证诊断:

B:估计偏差项与纯传输误差较强对应关系
C:方差代理量与平方误差之间的关系
D:样本量增大时,RMSE下降,趋势接近 ,合理的收敛趋势
E、F:标准化误差的正态近似 和 Wald 覆盖率接近 95%:在稳定设计下可以使用近似推断
合成网络验证:压力测试与消融实验

B:随着同质性增强,网络结构相关混杂更明显
C:溢出效应增强时,OT-no-exp 产生明显误差
D:暴露区间数与有效对照样本量之间需要权衡
E:弱重叠场景下的消融实验
F:OT后的表示平衡情况:改善了多个维度上的分布差异
真实拓扑半合成实验

B:本文方法在真实拓扑场景中仍然取得最低RMSE
C:不同暴露层的处理样本、对照样本和有效对照样本量:高暴露单元支持不足
D:边重连扰动下的估计漂移和暴露标签不稳定性:当拓扑扰动改变暴露状态时,估计目标本身也会发生变化
E:未观测网络混杂的敏感性区间
F:真实拓扑表示上的平衡改善情况
结论
围绕网络干扰下的因果效应估计问题,设计了一种基于暴露约束、最优传输和残差化校正的估计方法:通过暴露映射明确因果对比,在固定暴露状态内使用带容量上限的最优传输构造对照分布,最后通过交叉拟合结果回归进行残差化校正。
实验表明,在强网络混杂、高同质性、弱重叠和真实拓扑半合成场景中,本文方法均取得最低均方根误差。消融实验进一步说明,忽略暴露状态、去掉残差化校正或不使用网络结构表示都会导致性能下降。多面板诊断图表明,该方法不仅能降低估计误差,也能提供有效样本量、平衡性、拓扑稳定性和未观测混杂敏感性等辅助判断。
本方法并不声称可以消除网络因果推断中问题,但能够在明确暴露的前提下,将最优传输的分布平衡能力与因果推断中的残差化校正结合起来,为复杂网络场景下的政策评估和机制分析提供有价值的工具。
IPW与本文方法的比较:
- 都基于再加权思想,目标都是构造一个更可比的对照分布,来近似RCT
- 回归结合思想,前者双重稳健估计,后者残差化校正
- 前者通过倾向得分模型实现平衡,是处理概率校正
- 后者通过表示空间距离实现平衡,是分布几何对齐
后续方向
- 引入图神经网络进行表示学习,提高表示对潜在网络混杂的捕捉能力
- 更优秀的暴露映射选择策略,在偏差和样本支持之间自动权衡
- 在真实业务数据上进行案例研究