Quelle auf GitHub anzeigen
|
Designmodul
Im Designmodul werden Testparameter festgelegt und optimierte geografische Aufteilungen (Testgruppe und Kontrollgruppe) basierend auf Verlaufsdaten generiert. In den folgenden Abschnitten sind die Datenklassen, die Eingabe- und Ausgabeparameter definieren, sowie die primären Funktionen zum Generieren, Vergleichen und Visualisieren von Designs aufgeführt.
DesignConfig
Eine Konfigurationsklasse, mit der die Kernparameter eines Tests in Meridian GeoX definiert werden.
@dataclasses.dataclass
class DesignConfig:
experiment_duration: datetime.timedelta
experiment_types: Union[
ExperimentType,
dict[str, ExperimentType],
] = ExperimentType.HOLDBACK
methodology: Methodology = Methodology.TBR
geo_assignment_rule: GeoAssignmentRule = GeoAssignmentRule.STRATIFIED_SAMPLING
cell_count: int = 1
alpha: float = 0.1
power: float = 0.8
test_type: TestType = TestType.TWO_SIDED
design_output_count: int = 10
cost_per_incremental_conversion: Union[float, dict[str, float]] = 1.0
n_candidates: int = 100_000
n_ranked_candidates: int = 100
max_candidate_generation_retries: int = 10
seed: int = 42
slope_tolerance: float = 0.2
min_r2: float = 0.8
num_strata: int = 4
k_means_iterations: int = 10
| Attribute | Beschreibung |
|---|---|
experiment_duration
|
Dauer des Tests, angegeben als datetime.timedelta. Unterstützte Einheiten sind weeks und days. |
experiment_types
|
Definiert die Art des Tests, zum Beispiel Holdback, Go-dark oder Heavy-up. Bei Mehrzellentests können den einzelnen Zellen über ein Dictionary verschiedene Testtypen zugewiesen werden. Wird nur ein Typ angegeben, wird dieser Typ auf alle Zellen angewendet. |
methodology
|
Methode, die für die Designauswahl gewählt wurde, zum Beispiel TBR. |
geo_assignment_rule
|
Regel, auf deren Grundlage geografische Gebiete den verschiedenen Gruppen zugewiesen werden, zum Beispiel RANDOM oder STRATIFIED_SAMPLING. |
cell_count
|
Gesamtzahl der Testzellen. Verwenden Sie cell_count > 1 für Szenarien mit mehreren Testgruppen, die eine gemeinsame Kontrollgruppe haben. |
alpha
|
Signifikanzniveau für den Test. Der Standardwert ist 0.1 (90 % Konfidenz). |
power
|
Gewünschte Teststärke (Wahrscheinlichkeit, einen tatsächlichen Effekt zu erkennen). Der Standardwert ist 0.8. |
test_type
|
Typ von statistischem Test, der durchgeführt werden soll, zum Beispiel ONE_SIDED oder TWO_SIDED. Der Standardwert ist TWO_SIDED. |
design_output_count
|
Anzahl der empfohlenen Designs, die in einem Ranking zurückgegeben werden sollen. Der Standardwert ist 10. |
cost_per_incremental_conversion
|
Entspricht 1 / Ziel-iROAS, wenn Umsatzdaten verwendet werden. Wird verwendet, um die Budgetanforderungen für Holdback-Tests (Zelle) zu schätzen. Optional (und ignoriert) für Go-dark- und Heavy-up-Tests (Zelle). Bei Tests mit mehreren Zellen können den einzelnen Holdback-Zellen über ein Dictionary unterschiedliche Werte zugewiesen werden. Wenn für ein Mehrzellendesign eine einzelne Gleitkommazahl angegeben wird, wird diese Zahl auf alle Holdback-Zellen angewendet. Der Standardwert ist 1.0. |
Erweiterte Parameter für die Designsuche
| Attribute | Beschreibung |
|---|---|
n_candidates
|
Anzahl der Kandidaten für die Schnellbewertung. Der Standardwert ist 100,000. |
n_ranked_candidates
|
Anzahl der vollständig bewerteten Kandidaten. Der Standardwert ist 100. |
max_candidate_generation_retries
|
Maximale Anzahl von Wiederholungsversuchen für die Kandidatengenerierung. Der Standardwert ist 10. |
seed
|
Seed für den Zufallszahlengenerator. Der Standardwert ist 42. |
slope_tolerance
|
Maximal zulässige symmetrische Differenz für die Steigungsprüfung. Der Standardwert ist 0.2. |
min_r2
|
Kleinster zulässiger R2-Wert für das Design. Der Standardwert ist 0.8. |
num_strata
|
Anzahl der Schichten für die geschichtete Stichprobenerhebung. Der Standardwert ist 4. |
k_means_iterations
|
Anzahl der Iterationen für K-Means-Clustering. Der Standardwert ist 10. |
Budget
Budgetbeschränkung für eine einzelne Zelle.
@dataclasses.dataclass
class Budget:
budget: Optional[float] = None
budget_pct: Optional[float] = None
| Attribute | Beschreibung |
|---|---|
budget
|
Maximales Budget für das Testdesign (pro Zelle), angegeben als Gesamtbudgetbetrag. Sollte für Holdback-Zellen angegeben werden. |
budget_pct
|
Maximale prozentuale Budgetänderung für das Testdesign (pro Zelle). Sollte für Go-dark- und Heavy-up-Zellen angegeben werden. Muss für Go-dark-Zellen negativ und für Heavy-up-Zellen positiv sein. |
Constraints
Definiert optionale operative Beschränkungen für den Designalgorithmus.
@dataclasses.dataclass
class Constraints:
included_control_geos: Set[str]
excluded_geos: Set[str]
excluded_dates: Set[pd.Timestamp]
budget_constraint: Union[Budget, dict[str, Budget], None] = None
max_conversions_percent: Optional[float] = 0.3
| Attribute | Beschreibung |
|---|---|
included_control_geos
|
Geografische Gebiete, die in die Kontrollgruppe aufgenommen werden müssen. |
excluded_geos
|
Geografische Gebiete, die vom Testdesign ausgeschlossen werden sollen. |
excluded_dates
|
Datumswerte, die nicht im Testdesign berücksichtigt werden sollen. |
budget_constraint
|
Budgetbeschränkung für das Testdesign (pro Zelle). Das kann ein Gesamtbudgetbetrag oder eine prozentuale Budgetänderung sein. Bei Mehrzellentests können den einzelnen Zellen über ein Dictionary unterschiedliche Werte zugewiesen werden. Wird nur ein Wert angegeben, wird dieser Wert auf alle Zellen angewendet. Wenn die prozentuale Budgetänderung für eine Go-dark-Zelle nicht angegeben ist, wird der Standardwert -100% verwendet. Für Heavy-up-Zellen ist der Standardwert 100%. |
max_conversions_percent
|
Maximal zulässiges Conversion-Volumen für die Testgruppe. Bei Mehrzellendesigns bezieht sich dieser Prozentsatz auf die Gesamtzahl aller Testzellen. Der Standardwert ist 0.3. |
DesignSet
Eine Sammlung generierter Testdesigns und ihrer Vergleichsmesswerte.
@dataclasses.dataclass
class DesignSet:
designs: dict[str, Design]
design_metrics: pd.DataFrame
| Attribute | Beschreibung |
|---|---|
designs
|
Dictionary, das Design-IDs einzelnen Objekten vom Typ Design zuordnet. |
design_metrics
|
Objekt vom Typ DataFrame mit Designs in einem Ranking und den zugehörigen Messwerten wie MDE und Budget. |
DataFrame-Spalten für Design-Messwerte
| Spalte | Beschreibung |
|---|---|
design_id |
Eindeutige Kennung des Designs. |
cell |
ID der Testzelle. |
design_methodology |
Methode, die für das Design verwendet wird. |
r2
|
R2 außerhalb der Stichprobe, berechnet durch Testen der Vorhersagegenauigkeit des Modells anhand von Verlaufsdaten, die nicht in der ersten Trainingsphase verwendet wurden. |
mde
|
Minimaler nachweisbarer Effekt (Minimum Detectable Effect, MDE). Stellt die kleinste Steigerung des primären KPI dar, die der Test mit statistischer Signifikanz erkennen kann. Ein geringerer MDE deutet auf ein Design mit höherer Sensitivität hin. |
mde_abs
|
Erforderliche Mindestanzahl von inkrementellen Conversions.
Wird mit folgender Formel berechnet:
mde × treatment_conversion_volume. |
p_value (AA)
|
Ergebnis einer Robustheitsprüfung, bei der das Modell auf einen Zeitraum ohne bekannte Maßnahme angewendet wird. Ein p-Wert, der über dem Signifikanzniveau (normalerweise 0.1) liegt, bedeutet, dass das Design den A/A-Test besteht und nicht anfällig für falsch-positive Ergebnisse ist. |
budget
|
Prognostizierte erforderliche Änderung der Marketingausgaben insgesamt. In Go-dark- oder Heavy-up-Studien wird sie anhand der Ausgabendaten und der nutzerseitig eingegebenen prozentualen Budgetänderung berechnet. In Holdback-Studien verwenden wir den CpIC-Wert, um das erforderliche Budget zu schätzen. |
design_implied_cpic
|
Kosten pro inkrementeller Conversion (CpIC), die durch das Design impliziert werden, berechnet als das Budget geteilt durch die mindestens erforderlichen inkrementellen Conversions. |
treatment_conversions_pct |
Conversion-Prozentsatz der Testgruppe. |
treatment_geo_count |
Anzahl der geografischen Einheiten in der Testgruppe. |
Design
Stellt ein einzelnes Testdesign dar, einschließlich geografischer Zuweisungen und der verwendeten Konfiguration.
@dataclasses.dataclass
class Design:
designs: dict[str, PerCellDesign]
control_geos: Set[str]
excluded_geos: Set[str]
excluded_dates: Set[pd.Timestamp]
design_config: Optional[DesignConfig] = None
constraints: Optional[Constraints] = None
quality_check_result: Optional[QualityCheckResult] = None
geo_stratum_labels: Optional[JnpArray] = None
data: Optional[pd.DataFrame] = None
def export_to_json(self) -> str
@classmethod
def load_from_json(cls, json_str: str) -> 'Design'
| Attribute | Beschreibung |
|---|---|
designs
|
Dictionary, das Testzellen-IDs den jeweiligen PerCellDesign-Ergebnissen zuordnet. |
control_geos
|
Geografische Gebiete, die der Kontrollgruppe zugewiesen sind. |
excluded_geos
|
Geografische Gebiete, die vom Test ausgeschlossen wurden. Enthält manuell ausgeschlossene geografische Einheiten und Ausreißereinheiten, die durch Datenqualitätsprüfungen erkannt wurden (sofern konfiguriert ist, dass diese automatisch entfernt werden sollen). |
excluded_dates
|
Aus dem Design ausgeschlossene Datumswerte. Enthält manuell ausgeschlossene Datumswerte und Ausreißerdatumswerte, die durch Datenqualitätsprüfungen erkannt wurden (sofern konfiguriert ist, dass diese automatisch entfernt werden sollen). |
design_config
|
Objekt vom Typ DesignConfig, das zum Erstellen des Designs verwendet wurde. |
constraints
|
Objekt vom Typ Constraints, das während der Designsuche angewendet wurde. |
quality_check_result
|
Ergebnis der Datenqualitätsprüfungen, die für die Eingabedaten durchgeführt wurden. |
geo_stratum_labels
|
Schicht-Labels der verschiedenen geografischen Einheiten, sortiert nach dem Namen der geografischen Einheiten. Werden für Analysen herangezogen. |
data
|
Daten, die für das Design verwendet werden. Werden für Analysen herangezogen. |
| Methode | Beschreibung |
|---|---|
export_to_json |
Exportiert das Designobjekt in eine JSON-Datei. |
load_from_json |
Lädt ein Designobjekt aus einer JSON-Datei. |
PerCellDesign
Enthält die Zuweisungen und statistischen Messwerte für eine einzelne Testzelle innerhalb eines Designs.
@dataclasses.dataclass
class PerCellDesign:
treatment_geos: Set[str]
minimum_detectable_effect: float
design_implied_cpic: float
p_value: float
budget: float
counterfactual_conversions: Optional[pd.DataFrame] = None
| Attribute | Beschreibung |
|---|---|
treatment_geos
|
Geografische Gebiete, die der Testgruppe für diese Zelle zugewiesen sind. |
minimum_detectable_effect
|
Kleinste Effektgröße, die das Design erkennen kann. |
design_implied_cpic
|
Kosten pro inkrementeller Conversion (CpIC), die durch das Design impliziert werden, berechnet als das Budget geteilt durch die mindestens erforderlichen inkrementellen Conversions. |
p_value
|
Signifikanzniveau eines A/A-Tests, mit dem überprüft wird, ob die Test- und Kontrollgruppen vor Beginn des Tests ausgewogen strukturiert sind. |
budget
|
Geschätzte Kosten für die Testzelle basierend auf den Testparametern. |
counterfactual_conversions
|
Kontrafaktische Conversion-Zeitreihe. Enthält Datum, erfasste Conversions und kontrafaktische Conversions. Wird für die grafische Darstellung verwendet. |
run_design()
Die primäre Funktion zum Generieren und Ranken potenzieller Testdesigns.
def run_design(
data: pd.DataFrame,
design_config: DesignConfig,
constraints: Constraints,
data_quality_check_config: QualityCheckConfig = QualityCheckConfig()
)-> DesignSet
| Parameter | Beschreibung |
|---|---|
data
|
Zeitreihe mit Pretest-Verlaufsdaten mit date, location, conversions und (optional) spend. |
design_config |
Parameter für das Testdesign. |
constraints
|
Operative Einschränkungen für das Testdesign. |
data_quality_check_config
|
Option zum Konfigurieren automatischer Datenqualitätsprüfungen. Standardmäßig werden geografische Einheiten ohne Response und Ausreißerdatumswerte automatisch entfernt. |
Rückgabe: Objekt vom Typ DesignSet mit einer gerankten Liste von Objekten vom Typ Design und zugehörigen Messwerten wie MDE und Budget.
compare_designs()
Vergleicht mehrere Testdesigns hinsichtlich unterschiedlicher Methoden, Zuweisungsregeln oder Konfigurationen.
def compare_designs(
data: pd.DataFrame,
design_requirements: list[tuple[DesignConfig, Constraints]],
design_output_count: int = 10,
) -> DesignSet
| Parameter | Beschreibung |
|---|---|
data |
Zeitreihe mit Pretest-Verlaufsdaten. |
design_requirements
|
Liste von Tupeln, die jeweils ein Objekt vom Typ DesignConfig und ein Objekt vom Typ Constraints enthalten. |
design_output_count |
Anzahl der zurückzugebenden Designs. Der Standardwert ist 10. |
Rückgabe: vereinheitlichtes Objekt vom Typ DesignSet mit den Designs aus allen bereitgestellten Konfigurationen in einem Ranking.
concat_design_reports()
Verkettet mehrere Objekte vom Typ DesignSet zu einem einzelnen Objekt vom Typ DesignSet mit Ranking.
def concat_design_reports(
design_sets: list[DesignSet], design_output_count: int = 10
) -> DesignSet
| Parameter | Beschreibung |
|---|---|
design_sets
|
Liste von Objekten vom Typ DesignSet, die zusammengeführt werden sollen. |
design_output_count
|
Anzahl der am besten gerankten Designs, die im zusammengeführten Set zurückgegeben werden soll. Der Standardwert ist 10. |
Rückgabe: einzelnes Objekt vom Typ DesignSet, das alle Designs enthält, in einem neuen Ranking basierend auf ihren Messwerten.
plot_design()
Generiert eine visuelle Darstellung eines bestimmten Designs.
def plot_design(
design_to_plot: Design
)
| Parameter | Beschreibung |
|---|---|
design_to_plot |
Objekt vom Typ Design, das visualisiert werden soll. |
Beschreibung: Stellt die Zeitreihe der Conversions grafisch dar. Die Testgruppe wird mit dem kontrafaktischen Szenario verglichen, um die Effektivität der geografischen Aufteilung zu visualisieren.
Analysemodul
Im Analysemodul wird die inkrementelle Wirkung eines abgeschlossenen Tests mithilfe von kontrafaktischer Modellierung und robuster Inferenz berechnet. In den folgenden Abschnitten sind die Datenklassen, die Eingabe- und Ausgabeparameter definieren, sowie die primären Funktionen zum Generieren und Visualisieren von Testberichten aufgeführt.
AnalysisConfig
Parameter, die zum Ausführen einer Steigerungsanalyse für eine abgeschlossene GeoX-Studie erforderlich sind.
@dataclasses.dataclass
class AnalysisConfig:
design: Design
analysis_start_date: pd.Timestamp
analysis_end_date: pd.Timestamp
pretest_end_date: Optional[pd.Timestamp] = None
excluded_dates: Set[pd.Timestamp]
alpha: Optional[float] = None
test_type: Optional[TestType] = None
n_placebo_candidates: int = 100_000
n_top_placebos: int = 500
min_placebo_r2: float = 0.6
min_placebo_count_warning: int = 100
min_placebo_count_error: int = 10
| Attribute | Beschreibung |
|---|---|
design
|
Informationen zur geografischen Aufteilung und Herkunft, die während der Designphase verwendet wurden. |
analysis_start_date |
Startdatum der Analyse. |
analysis_end_date
|
Enddatum der Analyse, optional mit einer Cool-down-Phase. |
pretest_end_date
|
Enddatum des Vortestzeitraums. Wenn kein Datum angegeben ist, umfasst der Vortestzeitraum alle Datumswerte vor dem Wert für analysis_start_date. |
excluded_dates
|
Datumswerte, die von der Analyse ausgeschlossen werden sollen, zum Beispiel Ausreißertage. |
alpha
|
Signifikanzniveau. Wenn kein Wert angegeben wird, wird es aus der Designkonfiguration abgeleitet. |
test_type
|
Typ des auszuführenden statistischen Tests. Wenn kein Wert angegeben wird, wird er aus der Designkonfiguration abgeleitet. |
Erweiterte Analyseparameter
| Attribute | Beschreibung |
|---|---|
n_placebo_candidates
|
Anzahl der anfänglichen Placebo-Kandidaten, die vor der Auswahl generiert wurden. Der Standardwert ist 100,000. |
n_top_placebos
|
Anzahl der am höchsten gerankten gültigen Placebo-Kandidaten für die Analyse. Der Standardwert ist 500. |
min_placebo_r2
|
Mindestwert für den R-Quadrat-Wert außerhalb der Stichprobe, der erforderlich ist, damit ein Placebo-Design für die Analyse beibehalten wird. Der Standardwert ist 0.6. |
min_placebo_count_warning
|
Anzahl der gültigen Placebo-Kandidaten, unter der eine Warnung protokolliert wird. Der Standardwert ist 100. |
min_placebo_count_error
|
Anzahl der gültigen Placebo-Kandidaten, unter der ein Fehler ausgegeben wird. Der Standardwert ist 10. |
AnalysisResult
Enthält die aggregierte statistische Ausgabe eines GeoX-Tests für alle Zellen.
@dataclasses.dataclass
class AnalysisResult:
results: dict[str, AnalysisMetrics]
analysis_config: AnalysisConfig
excluded_geos: Set[str]
excluded_dates: Set[pd.Timestamp]
quality_check_result: Optional[QualityCheckResult] = None
| Attribute | Beschreibung |
|---|---|
results
|
Dictionary, das jede Testzelle dem entsprechenden Objekt vom Typ AnalysisMetrics zuordnet. |
analysis_config
|
Konfiguration, die für die Analyse verwendet wird. |
excluded_geos
|
Geografische Einheiten, die von der Analyse ausgeschlossen werden sollen. Umfasst alle geografischen Einheiten, die während der Designphase ausgeschlossen wurden. |
excluded_dates
|
Datumswerte, die von der Analyse ausgeschlossen werden sollen. Enthält manuell ausgeschlossene Datumswerte aus der Analysekonfiguration und Ausreißerdatumswerte aus der Analysephase (sofern konfiguriert ist, dass diese automatisch entfernt werden sollen). |
quality_check_result
|
Ergebnis der Datenqualitätsprüfungen, die für die Eingabedaten durchgeführt wurden. |
AnalysisMetrics
Enthält Messwerte für eine Einzelzellenanalyse.
@dataclasses.dataclass
class AnalysisMetrics:
lift: Estimate
percent_lift: Estimate
cumulative_lift: pd.DataFrame
counterfactual_conversions: pd.DataFrame
pointwise_difference: pd.DataFrame
icpd: Optional[Estimate] = None
cumulative_icpd: Optional[pd.DataFrame] = None
descriptive_metrics: Optional[DescriptiveMetrics] = None
| Attribute | Beschreibung |
|---|---|
lift
|
Punktschätzung und Konfidenzintervalle für absolute inkrementelle Conversions. |
percent_lift
|
Geschätzte prozentuale Steigerung mit Konfidenzintervallen. |
cumulative_lift
|
Zeitreihe der Schätzungen für die Steigerung der inkrementellen Conversions im Analysezeitraum. |
counterfactual_conversions
|
Kontrafaktische Conversion-Zeitreihe. Enthält das Datum, erfasste Conversions, kontrafaktische Conversions und Konfidenzintervalle (nur Testzeitraum). |
pointwise_difference
|
Punktweise Differenz zwischen erfassten und kontrafaktischen Conversions. Enthält Datum, Differenz und Konfidenzintervalle (nur Testzeitraum). |
icpd
|
Inkrementelle Conversions pro Währungseinheit. Entspricht dem iROAS, wenn Umsatzdaten verwendet werden. Wird angegeben, wenn Ausgabendaten verfügbar sind. |
cumulative_icpd
|
Zeitreihe der Schätzungen für die inkrementellen Conversions pro Währungseinheit (iCPD) im Analysezeitraum. Wird nur angegeben, wenn Ausgabendaten verfügbar sind. |
descriptive_metrics
|
Beschreibende Messwerte für eine Einzelzellenanalyse. Werden für die Einbindung in Meridian herangezogen. |
Estimate
Eine Schätzung mit ihrem Konfidenzintervall.
@dataclasses.dataclass
class Estimate:
point_estimate: float
lower_bound: float
upper_bound: float
standard_deviation: float
p_value: float
| Attribute | Beschreibung |
|---|---|
point_estimate |
Primärer Schätzwert. |
lower_bound |
Untere Grenze des Konfidenzintervalls. |
upper_bound |
Obere Grenze des Konfidenzintervalls. |
standard_deviation |
Standardabweichung der Schätzung. |
p_value |
Signifikanzniveau, das der Schätzung zugeordnet ist. |
DescriptiveMetrics
Beschreibende Messwerte für eine Einzelzellenanalyse.
@dataclasses.dataclass
class DescriptiveMetrics:
estimated_bau_spend: Optional[float] = None
| Attribut | Beschreibung |
|---|---|
estimated_bau_spend
|
Stellt die geschätzten BAU-Ausgaben für die geografischen Einheiten dar, die in der Analyse der Zelle enthalten sind (geografische Testeinheiten und geografische Kontrolleinheiten der Zelle). Umfasst nicht die Ausgaben anderer Testzellen oder nicht im Test berücksichtigter geografischer Einheiten und stellt daher nicht die gesamten nationalen Ausgaben des Werbetreibenden dar. |
analyze()
Führt die Steigerungsanalyse aus.
def analyze(
data: pd.DataFrame,
analysis_config: AnalysisConfig,
data_quality_check_config: QualityCheckConfig = QualityCheckConfig()
)-> AnalysisResult
| Parameter | Beschreibung |
|---|---|
data
|
Vollständige Zeitreihe mit Vortest- und Testdaten für alle geografischen Einheiten. |
analysis_config
|
Konfiguration, die die Methode und die Zeiträume definiert. |
data_quality_check_config
|
Option zum Konfigurieren automatischer Datenqualitätsprüfungen. Standardmäßig werden Ausreißerdatumswerte automatisch entfernt. |
Rückgabe: Objekt vom Typ AnalysisResult mit Messwerten für jede Testzelle.
plot_analysis()
Generiert eine Visualisierung der Testanalyse.
def plot_analysis(
analysis_result: AnalysisResult
)
| Parameter | Beschreibung |
|---|---|
analysis_result
|
Statistische Ausgabe der Funktion analyze(). |
Beschreibung: Erstellt Zeitreihendiagramme für kontrafaktische Conversions, punktweise Differenz, kumulative Steigerung und kumulative iCPD, um die geschätzte inkrementelle Wirkung für jede Testzelle zu visualisieren.
Datenqualitätsmodul
QualityCheckConfig
@dataclasses.dataclass
class QualityCheckConfig:
exclude_geos_no_response: bool = True
exclude_outlier_dates: bool = True
| Attribute | Beschreibung |
|---|---|
exclude_geos_no_response
|
Legt fest, ob geografische Einheiten ohne Response während der Designphase automatisch ausgeschlossen werden sollen.
Standardwert ist True. |
exclude_outlier_dates
|
Legt fest, ob Ausreißerdatumswerte während der Design- oder Analysephase automatisch ausgeschlossen werden sollen. Standardwert ist True. |
QualityCheckResult
@dataclasses.dataclass
class QualityCheckResult:
quality_check_config: QualityCheckConfig
quality_metrics: pd.DataFrame
outlier_geos: Set[str]
outlier_dates: Set[pd.Timestamp]
| Attribute | Beschreibung |
|---|---|
quality_check_config
|
Konfigurationseinstellungen, die für die Qualitätsprüfung verwendet werden. |
quality_metrics
|
Objekt vom Typ DataFrame mit detaillierten Messwerten aus der Qualitätsprüfung. |
outlier_geos
|
Gruppe der identifizierten geografischen Ausreißergebiete ohne Response. |
outlier_dates
|
Gruppe der identifizierten Ausreißerdatumswerte, die während der Qualitätsprüfung erkannt wurden. |
check_design_data_quality()
def check_design_data_quality(
data: pd.DataFrame,
design_config: DesignConfig,
quality_check_config: QualityCheckConfig
) -> QualityCheckResult
Beschreibung: Prüft die Qualität der Eingabedaten für die Designphase. Diese Prüfung ist direkt in die Methode run_design() eingebunden. Das bedeutet, dass die Datenqualitätsprüfungen bei der Designgenerierung automatisch ausgeführt werden.
Rückgabe: Objekt vom Typ QualityCheckResult.
check_analysis_data_quality()
def check_analysis_data_quality(
data: pd.DataFrame,
analysis_config: AnalysisConfig,
quality_check_config: QualityCheckConfig
) -> QualityCheckResult
Beschreibung: Prüft die Qualität der Eingabedaten für die Analysephase.
Diese Prüfung ist direkt in die Methode analyze() eingebunden. Das bedeutet, dass Datenqualitätsprüfungen während der Analyse automatisch durchgeführt werden.
Rückgabe: Objekt vom Typ QualityCheckResult.
Quelle auf GitHub anzeigen