観測されたリフトが統計的に有意かどうかを判断するため、Meridian GeoX には、現在および将来の分析手法に対応する堅牢な推論手法が備わっています。
Meridian GeoX の割り当てメカニズム
GeoX 調査では、厳密な制約が設けられ数学的に最適化されたアルゴリズムを使用して、地域割り当てを決定します。 \(Z \in \Omega = \lbrace 0, 1 \rbrace^N\) を介入群の割り当てベクトル( \(N\) はテストに含まれる地域ユニットの数)、 \(X\) をテスト前の共変量の行列とします。層化サンプリングでは、 \(X\) に過去のコンバージョン数、トレンド、季節性のパターンが含まれます。通常、設計アルゴリズムは制約関数を適用するか、コスト関数 \(C(Z, X)\) を最小化して、厳しく制限された割り当てを生成します。
過学習のソリューションに陥る可能性が高いため、厳密な最小値を選択する必要はありません。あるいは、許容可能な設計の有効なサブセットから、地域割り当て \(Z\) を均一に選択するだけで十分です。
推論の問題
因果推定手法(時間ベース回帰(TBR)など)により介入群の効果を評価するため、分析では、各介入群 \(i\)について、シャープ帰無仮説\(H_0:Y_i(1)=Y_i(0)\) をテストします。厳密なランダム化推論では、p 値は、観測値と同じかそれ以上に極端な検定統計量 \(T\) が観測される確率を表します。これは、実際の割り当てメカニズムの下で起こりうるすべての割り当ての分布全体にわたって計算されます。
設計を考慮した推論の利点
設計を考慮した推論は、GeoX のインクリメンタリティ測定結果の真の有意性を客観的に評価するように設計されています。このアプローチは、従来の多くの推論手法(t 検定やスライディング ウィンドウ検定など)で偽発見率を制御できないという、一般的な推論の課題を解決します。これらの手法と比較すると、設計を考慮した推論では、誤った有意なインクリメンタリティ効果が検出される可能性がはるかに低くなります。詳細な手法と調査結果については、研究論文をご覧ください。
また、設計を考慮した推論は、地域テストの評価方法における根本的な不一致を解決するので、標準的なプラセボ手法よりも優れています。標準的な手法では、テスト地域が完全にランダムに選択されたと想定しますが、ほとんどの GeoX 調査では、厳密な制約が設けられ数学的に最適化されたアルゴリズムを使用して地域割り当てを決定します。
設計を考慮した推論が、標準的な手法の特定の制限にどのように対処するかは次のとおりです。
標準的なプラセボテストでは、 \(Ω\)から(介入群ラベルをシャッフルすることで)割り当て \(Z\) を均一に抽出し、推定量のノイズを反映する経験的帰無分布を構築します。プラセボテストでは、 \(Z\) と\(Ω\) の両方で、対照群の地域のみを使用するように制限されます。しかし、標準的なテストでは調査の設計制約が無視されるため、この手順では「不適切なグループ分け」が頻繁に発生します。たとえば、大都市圏の大量の介入群と、小規模な地域の少量の対照群を比較することになります。このような比較不能なグループ分けは、経験的帰無分布に膨大な誤差をもたらします。この不正確さは、第一種過誤の割合を増加させるだけでなく、真の増分リフトの検出を困難にします。
設計を考慮した推論では、\(\Omega_D\)から割り当て \(Z\) を均一に抽出することで、プラセボの生成が元のテスト設計の正確なトポロジに限定されます。プラセボは、同じ目的関数、予算上限、設計制約を使用して生成されます。したがって、すべてのプラセボテストは有効で良質なグループ分けとなり、帰無分布は推論問題の真のベースラインの不確実性を完全に反映します。標準的なアプローチと比較すると、帰無分布に対するこの構造的な引き締めにより、最小検出可能効果(MDE)が大幅に低下し、統計的検出力が高まります。
設計を考慮した推論を実装する
設計を考慮した推論を実装するには、設計フェーズとその後の分析を形式的に同期する必要があります。
以降のセクションでは、設計を考慮した推論を実装する手順について説明します。
割り当てメカニズムを定式化する: \(P(Z \mid X)\)
最適化問題は、設計構成をプログラム可能な制約関数に変換します。ユニットの割り当てに、貪欲マッチングなどの最適化ヒューリスティック手法が使用されていると仮定します。 \(\pi(\cdot)\) は、 \(\Omega_D\)から均一にサンプリングして割り当て \(Z\) を生成する設計アルゴリズムを表します。
設計を考慮した推論では、生成アルゴリズム\(\pi(\cdot)\) またはキャッシュに保存された部分空間 \(\Omega_D\)へのアクセスが必要です。
設計を考慮したプラセボ ベクトルを生成する
プラセボ行列は、均一なシャッフルに依存するのではなく、 \(\Omega_D\)から直接抽出して作成されます。
- すべての対照群ユニットの元の介入前期間の共変量行列 \(X\) を初期化します。
- テスト設定フェーズと同じように設計アルゴリズム \( \pi(X) \) を実行し、一意のランダムシードを使用して有効な設計の空間を探索します。
- すべての \(Z^{(k)}\) が層化、予算上限、テスト前品質フィルタリングなどの構造上の制約を遵守するように、 \(K\) 個のプラセボ割り当て \(\{Z^{(1)}, Z^{(2)},\dots,Z^{(K)}\}\)を取得します。
経験的帰無分布を計算する
有効なプラセボ割り当て \(Z^{(k)}\)ごとに因果効果を推定する手順は次のとおりです。
- 割り当て\(Z^{(k)}\)のテスト前データのみを使用して、反事実モデルを適合させます。
- 実際のテストフェーズ中に\(Z^{(k)}\) で定義された介入群の反事実的な結果を予測します。
- プラセボテストの統計量 \(T^{(k)}\)を計算します。これは、\(Z^{(k)} : T^{(k)} = \sum_{t > t_0} (Y_t^{(k)} - \widehat{Y_t^{(k)}(0)})\)で定義された介入群に対する合計増分効果です。
各 \(Z^{(k)}\) は設計により高品質にグループ分けされているため、この推定手法は、実設計で観測された効果 \(T_{\text{obs} }\)の堅牢な合成マッチを生成します。結果として得られる \(T^{(k)}\) の分布は、シャープ帰無仮説の下での不確実性のレベルを表します。
p 値と信頼区間を計算する(有効で厳密な推論)
シャープ帰無仮説の下では、p 値とは、プラセボテストにおけるグループ分けによって観測された効果\(T_{\text{obs}}\)と同じくらい極端な検定統計量が得られる確率のことです。ベースライン モデルの適合度のばらつきを考慮するために、代わりにスチューデント化された検定統計量を使用することも可能です。スチューデント化された検定統計量は、事後期間の効果と事前期間の二乗平均平方根誤差(RMSE)の比として定義されます。
改良された p 値の計算は次のように定義されます。
その後、これらの p 値の逆数から、増分効果の信頼区間を取得できます。