Sobre os dados de insights sobre dinâmica da população

Entender os dados

Embora os embeddings estejam disponíveis para vários países, o esquema permanece consistente em todos os conjuntos de dados. Os embeddings são organizados em listagens separadas do BigQuery para cada país.

Anatomia do vetor de embedding

A coluna features é um vetor de 330 dimensões (armazenado como uma matriz REPEATED FLOAT no BigQuery). Cada seção da matriz corresponde a um sinal de dados específico extraído pelo modelo de dinâmica populacional.

Entender essa estrutura permite a ablação de recursos (por exemplo, determinar o quanto o comportamento de pesquisa prevê as vendas em comparação com o clima).

Índices vetoriais Fonte de dados Descrição
0 a 127 Tendências de pesquisa agregadas Captura interesses e preocupações regionais (por exemplo, pesquisas por "academia", "sintomas de gripe", "bens de luxo").
128 a 255 Mapas e movimento Captura o ambiente construído (PDIs como hospitais, parques, escolas) e a densidade da atividade humana.
256 a 329 Clima e qualidade do ar Captura o contexto ambiental (temperatura, precipitação, IQA, vento).

Principais colunas e metadados

A tabela de embeddings contém metadados espaciais que permitem análise geoespacial, filtragem e interoperabilidade com outros serviços da Plataforma Google Maps.

  • geo_id: o identificador principal da região. Para conjuntos de dados de células S2, esse é o token de célula S2 representado como uma string hexadecimal (por exemplo, '80ead45'). Use isso como sua chave de junção principal.
  • geo_name: o nome legível da região. Observação: para conjuntos de dados de grade S2, as células matemáticas não têm nomes padrão. Portanto, essa coluna vai conter o mesmo token que geo_id. Isso é proposital para manter uma estrutura de coluna consistente em todas as ofertas de dinâmica populacional.
  • administrative_area_level_1_id: o ID de lugar exclusivo do Google Maps para o limite administrativo de nível superior (por exemplo, estado ou província).
  • administrative_area_level_1_name: o nome legível do limite de nível superior (por exemplo, 'California').
  • administrative_area_level_2_id: o ID de lugar exclusivo do Google Maps para o limite administrativo secundário (por exemplo, condado ou distrito).
  • administrative_area_level_2_name: o nome legível do limite secundário (por exemplo, 'Tulare County').
  • features: o vetor de embedding principal de 330 dimensões, armazenado nativamente como um ARRAY<FLOAT64>. O carregamento na biblioteca Pandas Python exige o nivelamento ou a conversão em uma matriz NumPy.

Perguntas frequentes

Posso acessar os dados de entrada brutos (por exemplo, consultas de pesquisa específicas ou rastros de mobilidade)?

Não. Os embeddings do Population Dynamics Insights são gerados a partir de indicadores agregados que preservam a privacidade. Para garantir a privacidade do usuário, não fornecemos rastros específicos do usuário, históricos de pesquisa individuais ou padrões de movimento brutos. Os embeddings fornecem uma representação latente desses comportamentos, otimizada para modelagem e previsão, em vez de análises brutas.

As dimensões do vetor são interpretáveis (por exemplo, a dimensão 5 é "Café")?

Os vetores são representações latentes, o que significa que capturam padrões abstratos em vez de rótulos específicos e legíveis. Embora saibamos que os índices de 0 a 127 são derivados das tendências de pesquisa, um índice específico (como o índice 5) não é mapeado individualmente para uma única palavra-chave, como "Café". Em vez disso, ele representa um recurso complexo do comportamento de pesquisa aprendido pelo modelo.

O conjunto de dados inclui limites de polígonos (Shapefiles)?

O conjunto de dados fornece tokens de células S2 (geo_id) e IDs de lugares para identificadores geográficos (como regiões administrativas 1 e 2), mas não inclui geometria de polígonos brutos (WKT/Shapefiles) para as regiões de células S2. A omissão de geometrias brutas evita o inchaço do armazenamento e reduz os custos de verificação do BigQuery para pipelines de ML que exigem apenas vetores de recursos. Além disso, a junção em tokens de string S2 é significativamente mais rápida e eficiente do ponto de vista computacional do que a execução de interseções de polígonos espaciais.

  • Para coordenadas de pontos: para unir dados de pontos (como locais de PDIs ou centroides de lojas) com o Population Dynamics Insights, converta as coordenadas de latitude/longitude em tokens de células S2 de nível 12 usando S2_CELLIDFROMPOINT combinado com ST_GEOGPOINT (consulte Converter coordenadas de pontos em tokens hexadecimais de nível 12 S2).
  • Para limites de área:se você precisar cruzar limites personalizados com o Population Dynamics Insights, recomendamos converter seus polígonos personalizados em tokens de células S2 de nível 12 usando S2_COVERINGCELLIDS. Consulte Gerar tokens de células S2 de nível 12 para um polígono ou unir esse conjunto de dados com conjuntos de dados de limites públicos disponíveis no BigQuery Public Data.
  • Para visualização e conversão de geometria:as funções geográficas integradas do BigQuery realizam a conversão unidirecional (geometria → ID de célula S2). Para converter tokens de células S2 em geometrias de polígonos para ferramentas de mapeamento ou GIS, você pode usar bibliotecas do lado do cliente, como s2sphere do Python. Para exemplos de código e instruções, consulte Receber a geometria de células S2 de um token hexadecimal de nível 12 S2.