Modélisation contrefactuelle

Ce document explique comment le framework Meridian GeoX utilise la modélisation contrefactuelle pour mesurer avec précision l'incrémentalité réelle de vos interventions marketing.

Effet moyen du traitement sur les zones géographiques traitées

La modélisation contrefactuelle ou des résultats potentiels est une approche standard de l'inférence causale. Il est essentiel de mesurer l'effet moyen du traitement sur les zones géographiques traitées (ATT) ou l'impact incrémental réel de vos interventions marketing.

Mathématiquement, l'impact incrémental attendu sur le résultat de conversion \( Y \)suite à une intervention marketing est défini comme suit :

$$ATT = E[Y (1) - Y (0)|D = 1]$$

Dans l'équation :

  • \( D = 1 \) indique les zones géographiques traitées en fonction de la règle d'attribution des zones géographiques de l'étude.
  • \( Y (1) \) est le résultat potentiel de ces zones géographiques avec traitement (factuel).
  • \( Y (0) \) est le résultat potentiel sans traitement (contrefactuel).

Pendant la période de test de GeoX, seul \( Y (1) \) peut être observé. \( Y (0) \) n'est pas observé et est prédit par les approches de modélisation de GeoX.

Problème de machine learning dans un contexte d'activité normale

L'hypothèse clé de GeoX est que, sans nouvelle intervention marketing, toutes les zones géographiques devraient conserver leur dynamique habituelle (BAU), même si leurs données de conversion au niveau géographique peuvent connaître des fluctuations naturelles, telles que la saisonnalité.

À l'aide de la condition BAU, GeoX crée un modèle de machine learning qui prédit la conversion des zones géographiques traitées à partir du groupe de contrôle. Ce modèle peut également aider à prédire la métrique contrefactuelle \( Y (0) \) à l'aide des zones géographiques de contrôle conservant leur dynamique habituelle, même après l'intervention marketing sur les zones géographiques traitées. Ainsi, la fonction de perte dans le problème d'apprentissage est calculée comme suit :

$$\sum_{t \in \text{pretest}} \|f(Y_{t, T}(0)) - g(Y_{t, C}(0))\|_2{ }^2$$

Dans l'équation :

  • \( Y_{t,T} \) et \( Y_{t,C} \) sont des vecteurs de conversion au moment \( t \) de toutes les zones géographiques traitées et de contrôle, respectivement. La fonction de perte additionne la norme L2 des résidus en comparant la différence entre les unités traitées et les unités de contrôle avec uniquement les données de prétest.
  • La fonction \( f \) est généralement définie manuellement, en prenant une conversion moyenne au même moment \( t \) dans toutes les zones géographiques traitées.
  • La fonction \( g \) peut être apprise à partir des données de prétest en minimisant la fonction de perte totale. Différentes méthodologies d'analyse permettent d'obtenir différentes valeurs de\( g \). Dans la régression temporelle,\( g \) est une transformation linéaire appliquée à la conversion moyenne dans les zones géographiques de contrôle.

Comme pour les problèmes classiques de machine learning classiques, il est parfois très utile d'ajouter le terme de régularisation L1 ou L2 dans la fonction de perte.

Le principe fondamental du module d'analyse est le suivant : GeoX prédit ce qu'auraient été vos nombres de conversions ou vos revenus pour le groupe de traitement si vous n'aviez effectué aucune intervention marketing, puis estime l'effet incrémental en conséquence. Les interventions marketing incluent l'activation d'une nouvelle campagne, l'arrêt des publicités dans les médias et l'augmentation des dépenses.