Comprendre les données
Bien que les embeddings soient disponibles pour plusieurs pays, le schéma reste cohérent dans tous les ensembles de données. Les embeddings sont organisés dans des fiches BigQuery distinctes pour chaque pays.
Anatomie du vecteur d'embedding
La colonne features est un vecteur à 330 dimensions (stocké sous forme de tableau REPEATED FLOAT dans BigQuery). Chaque section du tableau correspond à un signal de données spécifique extrait par le modèle Population Dynamics.
Comprendre cette structure permet l'ablation de fonctionnalités (par exemple, déterminer dans quelle mesure le comportement de recherche prédit les ventes par rapport à la météo).
| Index vectoriels | Source de données | Description |
|---|---|---|
| 0 à 127 | Tendances de recherche agrégées | Capture les intérêts et les préoccupations régionaux (par exemple, les recherches sur "salle de sport", "symptômes de la grippe" ou "produits de luxe"). |
| 128 à 255 | Maps et affluence | Capture l'environnement bâti (POI tels que les hôpitaux, les parcs et les écoles) et la densité d'activité humaine. |
| 256 à 329 | Météo et qualité de l'air | Capture le contexte environnemental (température, précipitations, indice de qualité de l'air et vent). |
Colonnes clés et métadonnées
Le tableau d'embeddings contient des métadonnées spatiales permettant l'analyse géospatiale, le filtrage et l'interopérabilité avec d'autres services Google Maps Platform.
geo_id: identifiant principal de la région. Pour les ensembles de données de cellules S2 , il s'agit du jeton de cellule S2 représenté sous forme de chaîne hexadécimale (par exemple,'80ead45'). Utilisez-le comme clé de jointure principale.geo_name: nom lisible de la région. Remarque : Pour les ensembles de données de grille S2, les cellules mathématiques n'ont pas de nom standard. Cette colonne contient donc exactement le même jeton quegeo_id. Cette conception permet de maintenir une structure de colonne cohérente dans toutes les offres Population Dynamics.administrative_area_level_1_id: ID de lieu Google Maps unique pour la limite administrative de premier niveau (par exemple, un État ou une province).administrative_area_level_1_name: nom lisible de la limite de premier niveau (par exemple,'California').administrative_area_level_2_id: ID de lieu Google Maps unique pour la limite administrative secondaire (par exemple, un comté ou un district).administrative_area_level_2_name: nom lisible de la limite secondaire (par exemple,'Tulare County').features: vecteur d'embedding de base à 330 dimensions, stocké de manière native sous forme deARRAY<FLOAT64>. Pour le charger dans la bibliothèque Python Pandas, vous devez l'aplatir ou le convertir en matrice NumPy.
Questions fréquentes (FAQ)
Puis-je accéder aux données d'entrée brutes (par exemple, des requêtes de recherche spécifiques ou des traces de mobilité) ?
Non. Les embeddings Population Dynamics Insights sont générés à partir de signaux agrégés qui préservent la confidentialité. Pour garantir la confidentialité des utilisateurs, nous ne fournissons pas de traces d'utilisateurs spécifiques, d'historiques de recherche individuels ni de schémas de déplacement bruts. Les embeddings fournissent une représentation latente de ces comportements, optimisée pour la modélisation et la prédiction, plutôt que pour l'analyse brute.
Les dimensions vectorielles sont-elles interprétables (par exemple, la dimension 5 est-elle "Café") ?
Les vecteurs sont des représentations latentes, ce qui signifie qu'ils capturent des schémas abstraits plutôt que des libellés spécifiques et lisibles. Bien que nous sachions que les indices 0 à 127 proviennent des tendances de recherche, un index spécifique (comme l'index 5) ne correspond pas directement à un seul mot clé comme "Café". Il représente plutôt une fonctionnalité complexe du comportement de recherche apprise par le modèle.
L'ensemble de données inclut-il des limites de polygones (fichiers de formes) ?
L'ensemble de données fournit des jetons de cellule S2 (geo_id) et des ID de lieu pour les identifiants géographiques (tels que les régions administratives de niveau 1 et 2), mais il n'inclut pas la géométrie de polygone brute (WKT/fichiers de formes) pour les régions de cellule S2. L'omission des géométries brutes évite le gonflement du stockage et réduit les coûts d'analyse BigQuery pour les pipelines de ML qui ne nécessitent que des vecteurs de caractéristiques. En outre, la jointure sur des jetons de chaîne S2 est beaucoup plus rapide et plus efficace en termes de calcul que l'exécution d'intersections de polygones spatiaux.
- Pour les coordonnées de points : pour associer des données de points (telles que des emplacements de POI ou des
centroïdes de magasins) à Population Dynamics Insights, convertissez les coordonnées de latitude/longitude en jetons de cellule S2 de
niveau 12 à l'aide de
S2_CELLIDFROMPOINTcombiné àST_GEOGPOINT(consultez Convertir des coordonnées de points en jetons hexadécimaux S2 de niveau 12). - Pour les limites de zones : si vous devez croiser des limites personnalisées avec
Population Dynamics Insights, nous vous recommandons de convertir vos polygones personnalisés en
jetons de cellule S2 de niveau 12 à l'aide de
S2_COVERINGCELLIDS(consultez Générer des jetons de cellule S2 de niveau 12 pour un polygone) ou d'associer cet ensemble de données à des ensembles de données de limites publiques disponibles dans BigQuery Public Data. - Pour la visualisation et la conversion de géométries : les fonctions de géographie intégrées de BigQuery effectuent une conversion unidirectionnelle (géométrie → ID de cellule S2). Pour
convertir des jetons de cellule S2 en géométries de polygones pour les outils de cartographie ou de SIG, vous
pouvez utiliser des bibliothèques côté client, comme
s2spherede Python. Pour obtenir des exemples de code et des instructions, consultez Obtenir la géométrie d'une cellule S2 à partir d'un jeton hexadécimal S2 de niveau 12.