Perguntas frequentes

Este documento fornece respostas abrangentes para perguntas frequentes sobre o Meridian GeoX.

Conceitos gerais do Meridian GeoX

Qual é a diferença entre o GeoX e as soluções de medição de Lift com base no usuário?

Para equilibrar a precisão das medições e a privacidade do usuário, o GeoX e os métodos de solução de medição com base no usuário dependem de abordagens fundamentalmente diferentes:

  • O GeoX agrupa os públicos-alvo por regiões geográficas (geos) e usa dados agregados, ignorando completamente a atribuição no nível do usuário.
  • O Lift com base no usuário rastreia cookies individuais ou impressões de anúncios para atribuir conversões.

Por que usar o GeoX?

O uso do Meridian GeoX oferece os seguintes benefícios:

  • Medição de incrementalidade entre publishers: ao configurar designs de várias células, o GeoX permite medir a incrementalidade entre publishers, como mídia do Google x mídia que não é do Google, o que geralmente não é compatível com o Conversion Lift com base no usuário específico do publisher.
  • Medição off-line e omnichannel: o GeoX é a principal metodologia para medir o impacto off-line e omnichannel, como vendas na loja e conversões rastreadas pelo CRM. Como usa dados agregados de vendas regionais, ele evita a dificuldade de vincular impressões de anúncios on-line no nível do usuário a transações off-line na loja.
  • Abordagem que protege a privacidade: os GeoX dependem de conversões agregadas e não atribuídas em uma região específica, em vez de rastrear indivíduos. Por isso, o GeoX é imune a lacunas de medição causadas por desafios modernos de privacidade, como a descontinuação de cookies e as restrições do iOS.

Meridian GeoX x bibliotecas legadas do Google GeoX

Qual é a diferença entre a biblioteca de código aberto do Meridian GeoX e outros softwares de código aberto do Google GeoX, como os mercados de matching com regressão baseada em tempo (TBRMM, na sigla em inglês)?

A biblioteca do Meridian GeoX é um upgrade abrangente e unificado que oferece os seguintes recursos:

  • Tudo em um só lugar: funciona como uma biblioteca única para o design do estudo (planejamento pré-teste) e a análise (inferência pós-teste), abrangendo várias metodologias. O GeoX é compatível com a metodologia de regressão com base em tempo (TBR, na sigla em inglês).
  • Comparação direta de design: inclui um recurso compare_designs para comparar diretamente diferentes designs de estudo lado a lado e ver qual se adapta melhor aos requisitos de orçamento e efeito mínimo detectável (MDE, na sigla em inglês).
  • Abordagem estatística moderna: usa cálculos otimizados pelo JAX para geração rápida de candidatos e inferência de placebo com reconhecimento de design, melhorando a potência e a precisão na estimativa do intervalo de confiança.
  • Várias células e flexibilidade: oferece suporte nativo a designs de várias células e permite restrições flexíveis, como excluir regiões específicas ou forçar regiões a controlar.

Por que o Meridian GeoX recomenda um orçamento significativamente maior e um MDE maior em comparação com o TBRMM?

As diferenças nas recomendações vêm de filosofias de design e técnicas de validação distintas do TBRMM e do Meridian GeoX:

  • O TBRMM estima a potência do design com base no ajuste dentro da amostra do pré-teste. Os mesmos dados históricos são usados para ajustar o modelo e estimar a variância dele. Em situações ideais, a variância estimada usando esse procedimento deve convergir para a variância verdadeira. No entanto, na realidade, a variância do pré-teste pode ser subestimada em comparação com o que é observado durante o teste real. Quando a variância real pós-teste é maior, o estudo pode acabar sem poder estatístico. Portanto, essa otimização histórica pode levar a recomendações de orçamento e MDE otimistas ou mais baixas.
  • O Meridian GeoX resolve isso incorporando a validação fora da amostra ou a divisão honesta de dados e o teste de placebo durante a fase de design. Ao avaliar a estabilidade do design em períodos de validação que não foram usados para o ajuste do modelo, ele captura uma estimativa mais realista da variância pós-teste, o que resulta em recomendações de orçamento e MDE mais conservadoras.

Cada método é válido de acordo com as próprias premissas técnicas, mas o Meridian GeoX foi projetado para criar uma proteção contra a volatilidade pós-design mais realista, garantindo que os experimentos tenham alta probabilidade de gerar resultados conclusivos.

Requisitos e ingestão de dados

A receita líquida pode ser usada como métrica de conversão, considerando que ela pode incluir valores negativos devido a reembolsos?

Não. Embora a validação do esquema não bloqueie explicitamente as conversões negativas e apenas verifique se o total de conversões é positivo, os valores de conversão negativos podem atrapalhar a geração de candidatos (atribuição gananciosa) e a modelagem estatística. Recomendamos usar valores absolutos não negativos, como receita bruta ou contagens brutas de conversões. Se os reembolsos forem significativos, faça a análise das vendas brutas e aplique uma proporção histórica de líquido para bruto após o teste.

Os dados de gastos da campanha são sempre obrigatórios durante a fase de design? Como faço para encontrá-los?

O requisito de dados de gastos da campanha depende do tipo de experimento:

  • Estratégias de retirada de anúncios e de investimento em regiões específicas: os dados diários de gastos por região são obrigatórios para calcular os valores de referência de gastos e projetar os orçamentos de teste. A validação vai falhar se a coluna de gastos estiver ausente para esses tipos de experimento.
  • Experimentos de retenção: opcional para lançamentos de campanhas totalmente novas durante a fase de design. No entanto, é necessário fornecer uma referência de custo por conversão incremental (CpIC, na sigla em inglês) para estimar os requisitos de orçamento.

Os dados de gastos extraídos precisam ser diários e agregados no mesmo nível geográfico das conversões, como DMA, estado ou código postal.

  • Google Ads: extraia os gastos diários por região usando a API Google Ads com relatórios como campaign_location_target_report.
  • Outros publishers: use APIs específicas do publisher ou exportações da interface de relatórios para recuperar os gastos diários por segmentação geográfica.

Verifique se os identificadores geográficos correspondem exatamente entre os conjuntos de dados de conversões e de gastos. Se você estiver usando códigos postais ou CEPs, verifique se os zeros à esquerda são preservados como strings durante a extração e a exportação para evitar falhas de correspondência de validação. Por exemplo, os códigos postais ou CEPs precisam ser "02138" em vez de "2138".

Para mais informações, consulte Preparar seus dados de pré-teste.

Nossos dados diários de conversão são muito voláteis. Podemos fazer upload semanal dos dados para suavizar o ruído?

Não. O GeoX exige dados diários de série temporal. Os dados semanais não são compatíveis e vão acionar erros de validação. Para lidar com a volatilidade diária, considere o seguinte:

  • Estender a duração do teste, por exemplo, de quatro para seis ou oito semanas, para acumular mais pontos de dados e, possivelmente, reduzir o MDE.
  • Usar um KPI de conversão mais superficial, como adicionar ao carrinho ou inscrições, que tenha um volume maior e menos dias com contagem zero.
  • Aumentar o tamanho do grupo experimental desejado ou a porcentagem máxima de conversão.

A biblioteca do Meridian Geox permite incluir mais de um KPI?

Não. A biblioteca Meridian GeoX só aceita um KPI de conversão por execução, que é a coluna conversions no esquema de dados. Isso significa que não é possível otimizar simultaneamente um design para várias métricas distintas, como:

  • Conversões segmentadas, como o acompanhamento de compradores novos e recorrentes como KPIs de segmentação separados na mesma execução.
  • Diferentes ações de conversão, como acompanhamento simultâneo de visitas à loja e vendas, ou inscrições e compras.

É necessário um design separado para cada KPI, já que cada um tem o próprio volume histórico, tendência e volatilidade. Se você executar o mecanismo de design separadamente para cada KPI, ele provavelmente vai recomendar diferentes divisões geográficas e orçamentos.

Design do estudo e restrições

Podemos forçar um mercado específico para o grupo de tratamento ou de controle? Como isso afeta o design do estudo?

  • Forçar para o controle: é possível especificar as regiões geográficas que serão forçadas a entrar no grupo de controle usando included_control_geos em Constraints.
  • Excluir regiões: você pode excluir regiões inteiras do experimento em cenários como proteger os principais mercados de receita ou evitar interrupções de mídia usando excluded_geos em Constraints.
  • Forçar para tratamento: indisponível na biblioteca principal.

Se não houver motivos específicos para o negócio ou regiões geográficas com outliers, forçar regiões geográficas a controlar ou excluí-las restringe o pool de randomização e pode prejudicar o ajuste do modelo. Isso pode resultar em um MDE maior para alcançar significância estatística.

Será que tenho poucas unidades geográficas para conseguir aproveitar bem o GeoX?

Inclua pelo menos 10 regiões geográficas para um design de célula única.

  • Use amostragem aleatória para 10 a 20 regiões: em designs com menos de 20 unidades geográficas, a amostragem estratificada é menos eficaz porque o agrupamento em estratos é restrito. Se a amostragem estratificada não produzir um design satisfatório, use uma atribuição aleatória mais simples.
  • Use a amostragem estratificada para mais de 20 regiões: quando seu design tem poucas regiões, o poder estatístico provavelmente é baixo, o que leva a MDEs altos ou exige orçamentos muito grandes. Para resultados ideais, recomendamos um número maior de regiões, por exemplo, de 50 a mais de 100, para permitir uma estratificação eficaz e uma correspondência robusta.

Se eu tiver um orçamento flexível, posso inserir um iCPA ou iROAS desejado e receber um orçamento obrigatório?

Isso depende do tipo de experimento:

  • Experimentos de retenção: você insere o CpIC desejado usando cost_per_incremental_conversion em DesignConfig. Se as conversões representarem receita, o CpIC será equivalente a 1/iROAS. Em seguida, a biblioteca calcula o orçamento necessário para detectar o MDE com o poder preferido.
  • Experimentos de estratégia de retirada de anúncios e de estratégia de investimento em regiões específicas: você não insere o CpIC desejado. No entanto, o orçamento é determinado pelo gasto histórico nas regiões de tratamento selecionadas. É possível aplicar uma restrição de budget_pct, por exemplo, -100% para experimentos de interrupção ou um aumento percentual para experimentos de aumento de investimento em regiões específicas, e a biblioteca projeta o CpIC implícito do design que você pode detectar com esse orçamento.

Esclarecimento sobre orçamento e MDE

O MDE estatístico ou a mudança percentual mínima nas conversões que o experimento pode detectar é determinado apenas pela volatilidade histórica e pela correspondência das regiões. Mudar o orçamento não altera esse limite estatístico.

Embora o MDE permaneça constante, as metas de eficiência que você pode medir mudam com o orçamento:

  • Orçamento maior: permite detectar um CpIC mais alto e menos eficiente ou um iROAS mais baixo e mais conservador. Isso aumenta a probabilidade de um teste conclusivo para campanhas com performance moderada.
  • Orçamento menor: restringe a medição a campanhas com um CpIC muito baixo ou um iROAS muito alto. Se a performance real da campanha for moderada, o teste poderá ser inconclusivo.

Como decidir se um design é viável além do orçamento necessário e do MDE?

Avalie a viabilidade usando o seguinte:

  • R ao quadrado (\(R^2\)): \(R^2\) recomenda-se ≥ 0,8. Um \(R^2\) baixo, como menos de 0,5, indica que as regiões de controle não preveem bem as regiões de tratamento, o que torna a análise pós-teste não confiável.
  • Valor p do teste AA: a biblioteca filtra os designs usando simulações de placebo. Verifique se o design selecionado passa no teste A/A (valor p ≥\(\alpha\)) para minimizar o risco de falsos positivos.
  • Viabilidade do MDE: verifique se o MDE projetado é viável para os negócios, ou seja, se você acredita que a campanha pode realmente alcançar um aumento maior do que o MDE.

Ajuste do R ao quadrado

O \(R^2\) mínimo necessário é controlado pelo parâmetro min_r2 em geox.DesignConfig. Por padrão, o valor mínimo obrigatório de \(R^2\) é 0,8. Se a pesquisa de design não retornar opções viáveis em 0,8, você poderá flexibilizar o limite, por exemplo, ajustando-o para 0,75 ou 0,70:

      design_config = geox.DesignConfig(
        experiment_duration=datetime.timedelta(days=28),
        experiment_types=geox.ExperimentType.HEAVY_UP,
        methodology=geox.Methodology.TBR,
        min_r2=0.7,  # Adjust threshold if 0.8 yields no candidate designs
        )
    

Implementação do experimento e análise pós-teste

Se eu estiver executando o GeoX pela primeira vez, quais são as diretrizes gerais para implementar meu experimento?

Para usuários iniciantes do GeoX, consulte as seguintes orientações gerais:

  • Selecione o caminho de configuração:
    • IU da plataforma (configuração manual): ideal para estudos padrão.
    • Editor de plataforma (configuração em massa): ideal para estudos complexos ou com várias campanhas. Para isso, é preciso gerar e importar um arquivo de backup do Editor.
    • API Platform (automatizada): ideal para gerenciamento programático em nível empresarial. A segmentação por CEP não é compatível com a API.
  • Determine a estratégia de configuração da campanha:
    • Modificar diretamente (manter a mesma campanha): use quando os orçamentos não forem limitados. Restringir as regiões diretamente mantém intacto o histórico de aprendizado de máquina.
    • Duplicar (copiar e colar campanha): obrigatório quando as campanhas têm orçamentos diários limitados. A simples restrição de regiões geográficas em uma campanha limitada fará com que o algoritmo gaste o orçamento economizado nas regiões geográficas de controle restantes, contaminando o grupo de controle. A duplicação isola os orçamentos.
  • Configuração de segmentação: aplique as divisões geográficas usando estritamente a segmentação por presença para garantir que os anúncios sejam veiculados apenas nas regiões de tratamento e excluídos das regiões de controle.
  • Planeje um período de espera: após o término do teste, mantenha um período de espera de 1 a 2 semanas antes de voltar às atividades normais para capturar conversões atrasadas.

Para instruções detalhadas sobre como executar seu experimento no Google, consulte o guia de implementação da campanha na Central de Ajuda do Google Ads.

Podemos manter os testes no nível do usuário ativos nas mesmas campanhas durante um experimento GeoX?

Não. Todos os estudos de medição no nível do usuário, como Conversion Lift e Brand Lift, precisam ser desativados nas campanhas em avaliação durante o experimento. Os estudos no nível do usuário criam grupos de controle aleatórios ocultos nas suas regiões geográficas, o que contamina a divisão de tratamento e controle, dilui o poder estatístico e distorce a análise pós-teste.

Um design de várias células permite testar a significância estatística da diferença entre dois grupos de tratamento ativos?

Não. Os resultados de cada célula de tratamento são avaliados de forma independente em relação ao controle compartilhado. A biblioteca não fornece uma métrica estatística direta para testar se a diferença entre dois grupos de tratamento ativos é significativa.