稳健的推理

为了确定观察到的提升效果是否具有统计显著性,Meridian GeoX 配备了稳健的推理方法,能够支持当前及未来的分析方法。

Meridian GeoX 分配机制

GeoX 研究依赖于高度受限且经过数学优化的算法来确定地理区域分配。令 \(Z \in \Omega = \lbrace 0, 1 \rbrace^N\) 为实验组分配向量,其中 \(N\) 是测试中包含的地理区域单元数量,并令 \(X\) 为测试前协变量矩阵。在分层抽样中, \(X\) 包括历史转化量、趋势和季节性规律。设计算法通常会应用约束函数或最小化成本函数 \(C(Z, X)\) ,从而生成高度受限的分配:

$$Z^* = \arg\min_{Z \in \Omega} C(Z, X)$$

您无需选择精确的最小值,因为该值很可能陷入过拟合解。或者,只需从可接受设计的有效子集中均匀选择地理区域分配 \(Z\) 即可:

$$\Omega_D = \{Z \in \Omega \mid C(Z, X) \le \epsilon\}$$

推理问题

为了使用因果估计量(例如基于时间的回归 [TBR])评估处理效应,分析会针对每个实验组单元 \(i\)检验严格零假设\(H_0:Y_i(1)=Y_i(0)\) 。在精确随机化推理中,p 值表示在实际分配机制下,根据所有可能分配的分布计算得出的、观察到的检验统计量 \(T\) 至少与观测值一样极端的概率。

设计感知型推理的优势

设计感知型推理旨在客观评估 GeoX 中增量发现的真实显著性。这种方法解决了常见的推理难题,即许多传统推理方法(例如 t 检验或滑动窗口检验)通常无法控制错误发现率。与这些方法相比,设计感知型推理检测到虚假显著增量效应的可能性要低得多。如需了解详细的方法和发现结果,请参阅我们的研究论文

设计感知型推理也优于标准安慰剂方法,因为它解决了地理区域实验评估方式中存在的根本性错配问题。标准方法假设测试组地理区域是完全随机选择的,而大多数 GeoX 研究则依赖于高度受限且经过数学优化的算法来确定地理区域分配。

设计感知型推理如何解决标准方法的特定局限性:

  • 标准安慰剂检验通过随机打乱实验组标签,从 \(Ω\)中均匀抽取分配 \(Z\) ,以构建反映估计量噪声的经验零分布。请注意,在安慰剂检验中, \(Z\) 和\(Ω\) 都只能使用对照组地理区域。然而,由于标准检验忽略了研究的设计约束,该程序经常会产生“不当拆分”,例如将仅由高转化量大型都市圈组成的实验组与由低转化量小型地理区域组成的对照组进行比较。这些无法匹配的拆分会产生严重误差,从而污染经验零分布。这种不准确性不仅会推高第一类错误率,还会增加检测真实增量提升的难度。

  • 设计感知型推理通过从\(\Omega_D\)中均匀抽取分配 \(Z\) ,将安慰剂的生成严格限制在原始实验设计的拓扑结构内。安慰剂是使用相同的目标函数、预算限制和设计约束条件生成的。因此,每一个安慰剂都是一次有效且高质量的拆分,其零分布完美反映了推理问题真实的基准不确定性。与标准方法相比,这种零分布在结构上的收窄显著降低了最低可检测效果 (MDE),从而提高了统计功效。

实现设计感知型推理

实现设计感知型推理需要设计阶段与后续分析之间进行正式同步。

以下各部分介绍了实现设计感知型推理的步骤。

正式确定分配机制: \(P(Z \mid X)\)

优化问题会将您的设计配置转化为可编程的约束函数。假设采用优化启发式算法(例如贪婪匹配)来分配单元,令 \(\pi(\cdot)\) 表示通过从 \(\Omega_D\)中均匀抽样来生成分配 \(Z\) 的设计算法。

设计感知型推理需要访问生成算法\(\pi(\cdot)\) 或缓存的子空间 \(\Omega_D\)。

生成设计感知型安慰剂向量

安慰剂矩阵并非依靠均匀打乱,而是直接从 \(\Omega_D\)中抽取样本构建而成。

  1. 为所有对照组单元初始化原始测试前协变量矩阵 \(X\) 。
  2. 运行设计算法 \( \pi(X) \) ,其方式与实验设置阶段完全相同,并使用唯一的随机种子来探索有效设计的空间。
  3. 收集 \(K\) 个安慰剂分配 \(\{Z^{(1)}, Z^{(2)},\dots,Z^{(K)}\}\),使每个 \(Z^{(k)}\) 都符合结构性约束,包括分层、预算限制和测试前质量过滤。

计算经验零分布

如需估计每个有效安慰剂分配 \(Z^{(k)}\)的因果效应,请按以下步骤操作:

  1. 仅使用分配\(Z^{(k)}\)的测试前数据拟合反事实模型。
  2. 预测在实际测试阶段中,\(Z^{(k)}\) 中定义的实验组单元的反事实结果。
  3. 计算安慰剂检验统计量 \(T^{(k)}\),即\(Z^{(k)} : T^{(k)} = \sum_{t > t_0} (Y_t^{(k)} - \widehat{Y_t^{(k)}(0)})\)中定义的实验组单元的总增量效应。

由于每个 \(Z^{(k)}\) 在设计上都是高质量的拆分,因此估计器会在实际设计中生成观察到的效应 \(T_{\text{obs} }\)的稳健合成匹配。 \(T^{(k)}\) 的所得分布表示在严格零假设下的不确定性水平。

计算 p 值和置信区间(有效的精确推理)

在严格零假设下,p 值是安慰剂拆分产生至少与观测效应\(T_{\text{obs}}\)一样极端的检验统计量的概率。为了考虑基准模型拟合程度的差异,您可以改用学生化检验统计量。学生化检验统计量定义为测试后效应与测试前均方根误差 (RMSE) 的比率:

$$\tilde{T}^{(k)} = \frac{T^{(k)}}{RMSE_{\text{pre}}^{(k)}}$$

优化后的 p 值计算公式定义如下:

$$p = \frac{1}{K+1} \left\{ 1 + \sum_{k=1}^K \mathbb{I} \left( \tilde{T}^{(k)} \text{ is more extreme than } \tilde{T}_{\text{obs}} \right) \right\}$$

后续可通过对这些 p 值进行反演,推导出增量效应的置信区间。