In diesem Dokument finden Sie umfassende Antworten auf häufig gestellte Fragen zu Meridian GeoX.
Allgemeine Konzepte von Meridian GeoX
Was ist der Unterschied zwischen GeoX und nutzerbasierten Lösungen zur Analyse der Anzeigenwirkung?
Bei GeoX und nutzerbasierten Messmethoden werden grundlegend unterschiedliche Ansätze verwendet, um die Messgenauigkeit und den Datenschutz für Nutzerinnen und Nutzer in Einklang zu bringen:
- Bei GeoX werden Zielgruppen nach geografischen Regionen (Geos) geordnet und aggregierte Daten verwendet. Die Attribution auf Nutzerebene wird vollständig ignoriert.
- Bei der nutzerbasierten Conversion-Steigerung werden einzelne Cookies oder Anzeigenimpressionen erfasst, um Conversions zuzuordnen.
Warum sollte ich GeoX verwenden?
Meridian GeoX bietet folgende Vorteile:
- Publisher-übergreifende Messung zur Steigerung der Conversions: Durch die Einrichtung von Mehrzellendesigns ermöglicht GeoX die Publisher-übergreifende Messung zur Steigerung der Conversions, wie beispielsweise Google-Medien im Vergleich zu Nicht-Google-Medien. Dies wird in der Regel nicht von Publisher-spezifischen nutzerbasierten Conversion-Steigerungen unterstützt.
- Offline- und Omni-Channel-Messung: GeoX ist die primäre Methode zur Messung von Offline- und Omni-Channel-Auswirkungen, beispielsweise Verkäufe im Geschäft und über CRM erfasste Conversions. Da aggregierte regionale Verkaufsdaten verwendet werden, entfällt die Schwierigkeit, Online-Anzeigenimpressionen auf Nutzerebene mit Offline-Transaktionen im Geschäft zu verknüpfen.
- Datenschutzfreundlicher Ansatz: GeoX basiert auf aggregierten, nicht zugeordneten Conversions in einer bestimmten Region, nicht auf dem Tracking einzelner Personen. Daher ist GeoX immun gegen Messlücken, die moderne Datenschutzprobleme wie die Einstellung von Cookies und iOS-Einschränkungen verursachen.
Meridian GeoX im Vergleich zu älteren Google GeoX-Bibliotheken
Was ist der Unterschied zwischen der Open-Source-Bibliothek von Meridian GeoX und anderer GeoX-Open-Source-Software von Google wie TBRMM (Time-Based Regression Matched Markets)?
Die Meridian GeoX-Bibliothek ist ein umfassendes, einheitliches Upgrade mit folgenden Funktionen und Features:
- Alles aus einer Hand: Meridian ist eine zentrale Bibliothek für das Studiendesign (Planung vor dem Test) und die Analyse (Inferenz nach dem Test), die mehrere Methoden abdeckt. GeoX unterstützt die Methodik zur zeitbasierten Regression (TBR).
- Direkter Designvergleich: Enthält eine
compare_designs-Funktion, mit der Sie verschiedene Studiendesigns direkt nebeneinander vergleichen können, um zu sehen, welches am besten zu den Budgetanforderungen und den Anforderungen für einen minimal nachweisbaren Effekt (Minimum Detectable Effect, MDE) passt. - Moderner statistischer Ansatz: Verwendet JAX-optimierte Berechnungen für eine schnelle Kandidatengenerierung und designorientierte Placebo-Inferenz. Dadurch verbessert sich die Aussagekraft und Genauigkeit bei der Schätzung von Konfidenzintervallen.
- Mehrere Zellen und Flexibilität: Unterstützt nativ Designs mit mehreren Zellen und ermöglicht flexible Beschränkungen, beispielsweise das Ausschließen bestimmter Regionen oder das Erzwingen von Regionen als Kontrollgruppe.
Warum empfiehlt Meridian GeoX ein deutlich höheres Budget und einen größeren minimal nachweisbaren Effekt (Minimum Detectable Effect, MDE) als TBRMM?
Die Unterschiede bei den Empfehlungen ergeben sich aus den unterschiedlichen Designphilosophien und Validierungstechniken von TBRMM und Meridian GeoX:
- TBRMM schätzt die Aussagekraft anhand der Anpassung innerhalb der Stichprobe im Vorabtest. Dieselben Verlaufsdaten werden verwendet, um das Modell anzupassen und seine Varianz zu schätzen. Im Idealfall sollte die mit diesem Verfahren geschätzte Varianz gegen die tatsächliche Varianz konvergieren. In der Praxis wird die Varianz vor dem Test jedoch im Vergleich zu der während des Tests auftretenden oft unterschätzt. Wenn sich die tatsächliche Varianz nach dem Test als höher herausstellt, kann es sein, dass die Studie eine geringe Aussagekraft aufweist. Diese historische Optimierung kann daher zu optimistischen oder zu niedrigen Empfehlungen für das Budget und den MDE führen.
- Meridian GeoX löst dieses Problem, indem Validierung außerhalb der Stichprobe oder Honest Data Splitting und Placebo-Tests in die Designphase einbezogen werden. Die Bewertung der Stabilität des Designs in Validierungszeiträumen, die nicht für die Modellanpassung verwendet wurden, ermöglicht eine realistischere Schätzung der Varianz nach dem Test. Das führt zu konservativeren Budget- und MDE-Empfehlungen.
Jede Methode ist unter ihren eigenen technischen Annahmen gültig. Meridian GeoX ist jedoch so konzipiert, dass ein Puffer gegen realistischere Volatilität nach dem Design hinzugefügt wird, damit die Tests mit hoher Wahrscheinlichkeit aussagekräftige Ergebnisse liefern.
Datenanforderungen und -aufnahme
Kann ich den Nettoumsatz, der aufgrund von Erstattungen auch negative Werte enthalten kann, als Messwert für Conversions verwenden?
Nein. Die Schemavalidierung verhindert zwar nicht ausdrücklich negative Conversions, sondern prüft nur, ob die Gesamtzahl der Conversions positiv ist. Negative Conversion-Werte können jedoch die Kandidatengenerierung („Greedy Assignment") und die statistische Modellierung beeinträchtigen. Es wird empfohlen, nicht negative, absolute Werte wie Bruttoeinnahmen oder die Bruttoanzahl der Conversions zu verwenden. Wenn die Erstattungen erheblich sind, führen Sie die Analyse für den Bruttoumsatz durch und wenden Sie nach dem Test ein historisches Netto-Brutto-Verhältnis an.
Sind Daten zu Kampagnenausgaben in der Designphase immer erforderlich und wie erhalte ich sie?
Die Anforderungen an die Daten zu Kampagnenausgaben hängen vom Testtyp ab:
- Go-dark- und Heavy-up-Tests: Tägliche Ausgabendaten auf geografischer Ebene sind erforderlich, um die Baseline-Ausgaben zu berechnen und Testbudgets zu planen. Die Validierung schlägt fehl, wenn die Spalte „Ausgaben“ für diese Testtypen fehlt.
- Holdback-Tests: Optional für neue Kampagnenstarts während der Designphase. Sie sollten jedoch einen Referenzwert für die Kosten pro zusätzlicher Conversion (Cost per Incremental Conversion, CpIC) angeben, um die Budgetanforderungen zu schätzen.
Die extrahierten Ausgabendaten müssen täglich erhoben und auf derselben geografischen Ebene wie Ihre Conversions aggregiert sein, zum Beispiel DMA, Bundesland oder Postleitzahl.
- Google Ads: Mit der Google Ads API können Sie die täglichen Ausgaben nach Region aus Berichten wie
campaign_location_target_reportextrahieren. - Andere Publisher: Verwenden Sie Publisher-spezifische APIs oder Exporte aus der Berichtsbenutzeroberfläche, um die Ausgaben pro Tag nach geografischem Ziel abzurufen.
Achten Sie darauf, dass die geografischen Kennungen in Ihren Conversion- und Ausgabendatensätzen genau übereinstimmen. Wenn Sie Postleitzahlen verwenden, achten Sie darauf, dass vorangestellte Nullen bei der Extraktion und beim Export als Strings beibehalten werden, um Fehler bei der Validierung zu vermeiden. Beispielsweise sollte die Postleitzahl als „02138“ statt „2138“ angegeben werden.
Weitere Informationen finden Sie unter Vortestdaten vorbereiten.
Unsere täglichen Conversion-Daten sind sehr volatil. Können wir stattdessen wöchentliche Daten hochladen, um das Rauschen zu reduzieren?
Nein. GeoX erfordert tägliche Zeitreihenverlaufsdaten. Wöchentliche Daten werden nicht unterstützt und führen zu Validierungsfehlern. So können Sie die tägliche Volatilität berücksichtigen:
- Verlängern Sie die Testdauer, beispielsweise von vier auf sechs oder acht Wochen, um mehr Datenpunkte zu erfassen und so den MDE potenziell zu senken.
- Verwenden Sie einen KPI für Conversions im oberen Trichterbereich, beispielsweise „In den Einkaufswagen“ oder „Anmeldungen“, der ein höheres Volumen und weniger Tage ohne Conversions hat.
- Vergrößern Sie die Testgruppe oder den maximalen Conversion-Prozentsatz.
Können in der Meridian GeoX-Bibliothek mehrere KPIs berücksichtigt werden?
Nein. Die Meridian GeoX-Bibliothek unterstützt nur einen Conversion-KPI pro Ausführung, und zwar die Spalte conversions im Datenschema. Das bedeutet, dass Sie ein Design nicht gleichzeitig für mehrere unterschiedliche Messwerte optimieren können, wie etwa:
- Segmentierte Conversions, wie das Erfassen von neuen und zurückkehrenden Käuferinnen und Käufern als separate Ziel-KPIs im selben Durchlauf.
- Verschiedene Conversion-Aktionen, wie gleichzeitiges Erfassen von Ladenbesuchen und Verkäufen oder von Anmeldungen und Käufen.
Für jeden KPI ist ein separates Design erforderlich, da jeder KPI ein eigenes historisches Volumen, einen eigenen Trend und eine eigene Volatilität aufweist. Wenn Sie die Design-Engine für jeden KPI separat ausführen, werden wahrscheinlich unterschiedliche geografische Aufteilungen und Budgets empfohlen.
Studiendesign und Beschränkungen
Können wir der Test- oder der Kontrollgruppe gezielt einen bestimmten Markt zuweisen und wie wirkt sich das auf das Studiendesign aus?
- Kontrollgruppe erzwingen: Sie können mit
included_control_geosinConstraintsgeografische Regionen angeben, die in die Kontrollgruppe aufgenommen werden sollen. - Regionen ausschließen: Sie können geografische Regionen vollständig aus dem Test ausschließen, zum Beispiel um wichtige Umsatzmärkte zu schützen oder Media-Beeinträchtigungen zu vermeiden. Verwenden Sie dazu
excluded_geosinConstraints. - Erzwingen von Regionen: Wird in der Kernbibliothek nicht unterstützt.
Wenn es keine geschäftsspezifischen Gründe oder Ausreißerregionen gibt, schränkt das Erzwingen von Regionen für die Kontrollgruppe oder das Ausschließen von Regionen den Randomisierungspool ein und kann die Modellanpassung beeinträchtigen. Dies kann zu einem größeren MDE führen, um statistische Signifikanz zu erreichen.
Verfüge ich über zu wenige Regionen, um GeoX effektiv zu nutzen?
Bei einem Einzelzellendesign sollten Sie mindestens 10 Regionen einbeziehen.
- Zufallsstichproben für 10 bis 20 Regionen verwenden: Bei Designs mit weniger als 20 Regionen sind geschichtete Stichproben weniger effektiv, da das Clustering in Schichten eingeschränkt ist. Wenn die geschichtete Stichprobenerhebung kein zufriedenstellendes Design liefert, sollten Sie ein Design mit einer einfacheren zufälligen Zuweisung verwenden.
- Geschichtete Stichproben für mehr als 20 Regionen verwenden: Wenn Ihr Design nur wenige Regionen umfasst, ist die statistische Aussagekraft wahrscheinlich gering. Das führt zu hohen MDEs oder erfordert sehr große Budgets. Für optimale Ergebnisse wird eine größere Anzahl von Regionen empfohlen, etwa zwischen 50 und mehr als 100, um eine effektive Schichtung und einen zuverlässigen Abgleich zu ermöglichen.
Wie gehe ich vor, wenn ich ein flexibles Budget habe und einen Ziel-iCPA oder Ziel-iROAS eingeben und ein erforderliches Budget erhalten möchte?
Das hängt vom verwendeten Testtyp ab:
- Holdback-Tests: Geben Sie die Ziel-CpIC mit
cost_per_incremental_conversioninDesignConfigein. Wenn Conversions Umsatz darstellen, entspricht die CpIC1/iROAS. Die Bibliothek berechnet dann das erforderliche Budget, um den MDE mit der bevorzugten Leistung zu erkennen. - Go-dark- und Heavy-up-Tests: Geben Sie die Ziel-CpIC nicht ein. Das Budget wird jedoch anhand der bisherigen Ausgaben in den ausgewählten Testregionen bestimmt. Sie können eine
budget_pct-Beschränkung anwenden, wie beispielsweise -100 % für Go-dark-Tests oder eine prozentuale Erhöhung für Heavy-up-Tests. Die Bibliothek prognostiziert dann die CpIC, die sich aus dem Design ergibt und die Sie mit diesem Budget erkennen können.
Erläuterung zu Budget und MDE
Der statistische MDE (die minimale prozentuale Änderung der Conversions, die im Test erkannt werden kann) wird ausschließlich durch die historische Volatilität und den geografischen Abgleich bestimmt. Wenn Sie das Budget ändern, wird dieses statistische Limit nicht geändert.
Der MDE bleibt zwar konstant, aber die Effizienzziele, die Sie messen können, ändern sich mit dem Budget:
- Höheres Budget: Damit können Sie höhere, weniger effiziente CpIC oder einen niedrigeren, konservativeren iROAS erkennen. So erhöht sich die Wahrscheinlichkeit eines aussagekräftigen Tests für Kampagnen mit mäßiger Leistung.
- Niedrigeres Budget: Sie können nur Kampagnen mit sehr niedrigen CpIC oder einem sehr hohen iROAS messen. Wenn die tatsächliche Kampagnenleistung mäßig ist, ist der Test möglicherweise nicht aussagekräftig.
Wonach sollten wir entscheiden, ob ein Design realisierbar ist, abgesehen vom erforderlichen Budget und dem MDE?
Bewerten Sie die Machbarkeit anhand der folgenden Punkte:
- R-Quadrat (\(R^2\)): \(R^2\) ≥ 0,8 wird empfohlen. Ein niedriger \(R^2\) -Wert, beispielsweise unter 0,5, weist darauf hin, dass die Kontrollregionen die Testregionen nicht gut vorhersagen, was die Analyse nach dem Test unzuverlässig macht.
- AA-Test-p-Wert: Die Bibliothek filtert Designs mithilfe von Placebo-Simulationen. Achten Sie darauf, dass das ausgewählte Design den A/A-Test besteht (p-Wert ≥\(\alpha\)), um das Risiko falsch positiver Ergebnisse zu minimieren.
- Machbarkeit des MDE: Der prognostizierte MDE muss geschäftlich realisierbar sein. Sie müssen also davon ausgehen, dass mit der Kampagne tatsächlich eine Steigerung erzielt werden kann, die über dem MDE liegt.
R-Quadrat-Anpassung
Die Mindestanforderung an \(R^2\) wird durch den Parameter min_r2 in geox.DesignConfig gesteuert. Der erforderliche Mindestwert für \(R^2\) ist standardmäßig 0,8. Wenn die Designsuche bei 0,8 keine geeigneten Kandidaten zurückgibt, können Sie den Schwellenwert flexibel anpassen, beispielsweise auf 0,75 oder 0,70:
design_config = geox.DesignConfig( experiment_duration=datetime.timedelta(days=28), experiment_types=geox.ExperimentType.HEAVY_UP, methodology=geox.Methodology.TBR, min_r2=0.7, # Adjust threshold if 0.8 yields no candidate designs )
Implementierung des Tests und Analyse nach Abschluss
Welche allgemeinen Richtlinien gelten für die Implementierung meines Tests, wenn ich GeoX zum ersten Mal verwende?
Für GeoX-Einsteigerinnen und -Einsteiger gelten folgende allgemeinen Hinweise:
- Wählen Sie die gewünschte Einrichtungsmethode aus:
- Plattform-UI (manuelle Einrichtung): Am besten für Standardstudien geeignet.
- Plattform-Editor (Bulk-Einrichtung): Am besten für komplexe Studien oder Studien mit mehreren Kampagnen geeignet. Hierfür muss eine Editor-Sicherungsdatei generiert und importiert werden.
- Platform API (automatisiert): Am besten für die programmatische Verwaltung auf Unternehmensebene geeignet. Das Targeting auf Postleitzahlen wird über die API nicht unterstützt.
- Strategie für die Kampagneneinrichtung festlegen:
- Direkt ändern (Kampagne beibehalten): Verwenden Sie diese Option, wenn die Budgets nicht begrenzt sind. Wenn Sie geografische Regionen direkt einschränken, bleibt das bisherige maschinelle Lernen intakt.
- Duplizieren (Kampagne kopieren und einfügen): Erforderlich, wenn Kampagnen ein begrenztes Tagesbudget haben. Wenn Sie die geografischen Regionen einer Kampagne mit Budgetobergrenze einfach einschränken, gibt der Algorithmus das eingesparte Budget in den verbleibenden Kontrollregionen aus, was die Kontrollgruppe verfälscht. Durch die Duplizierung werden die Budgets isoliert.
- Targeting-Konfiguration: Wenden Sie die geografischen Aufteilungen strikt mit Targeting auf die Präsenz an, damit Anzeigen nur in Testregionen ausgeliefert und von Kontrollregionen ausgeschlossen werden.
- Wartefrist einplanen: Nach dem Ende des Tests sollten Sie eine Wartefrist von ein bis zwei Wochen einplanen, bevor Sie zum Business-as-Usual-Bedingungen (BAU) zurückkehren, um verzögerte Conversions zu erfassen.
Eine detaillierte Anleitung zum Durchführen von Tests auf der Google-Plattform finden Sie im Schritt-für-Schritt-Leitfaden zur Implementierung von Kampagnen in der Google Ads-Hilfe.
Können wir während eines GeoX-Tests für dieselben Kampagnen Tests auf Nutzerebene aktiv lassen?
Nein. Alle Studien zur Messung auf Nutzerebene, zum Beispiel zur Conversion-Steigerung und zur Anzeigenwirkung auf die Markenbekanntheit, sollten während des Tests für die zu bewertenden Kampagnen deaktiviert werden. Studien auf Nutzerebene erstellen in Ihren Regionen versteckte randomisierte Holdouts. Dadurch wird die Aufteilung in Test- und Kontrollgruppen verfälscht, die statistische Aussagekraft verringert und die Analyse nach dem Test verzerrt.
Kann ich mit einem Mehrzellendesign die statistische Signifikanz des Unterschieds zwischen zwei aktiven Testgruppen testen?
Nein. Die Ergebnisse für jede Testzelle werden unabhängig anhand der gemeinsamen Kontrollgruppe ausgewertet. Die Bibliothek bietet keinen direkten statistischen Messwert, um zu testen, ob der Unterschied zwischen zwei aktiven Testgruppen signifikant ist.