Informazioni sui dati
Sebbene gli embedding siano disponibili per più paesi, lo schema rimane coerente in tutti i set di dati. Gli embedding sono organizzati in schede di BigQuery separate per ogni paese.
Anatomia del vettore di embedding
La colonna features è un vettore a 330 dimensioni (memorizzato come array REPEATED FLOAT in BigQuery). Ogni sezione dell'array corrisponde a un segnale di dati specifico estratto dal modello di dinamiche della popolazione.
La comprensione di questa struttura consente l'ablazione delle funzionalità (ad esempio, la determinazione della misura in cui il comportamento di ricerca prevede le vendite rispetto al meteo).
| Indici dei vettori | Origine dati | Descrizione |
|---|---|---|
| 0 – 127 | Tendenze di ricerca aggregate | Acquisisce gli interessi e le preoccupazioni regionali (ad esempio, ricerche di "palestra", "sintomi influenzali", "beni di lusso"). |
| 128 – 255 | Mappe e affollamento | Acquisisce l'ambiente costruito (PDI come ospedali, parchi, scuole) e la densità dell'attività umana. |
| 256 – 329 | Meteo e qualità dell'aria | Acquisisce il contesto ambientale (temperatura, precipitazioni, indice di qualità dell'aria, vento). |
Colonne e metadati principali
La tabella degli embedding contiene metadati spaziali che consentono l'analisi geospaziale, il filtraggio e l'interoperabilità con altri servizi di Google Maps Platform.
geo_id: l'identificatore principale della regione. Per i set di dati delle celle S2, questo è il token della cella S2 rappresentato come stringa esadecimale (ad esempio,'80ead45'). Utilizzalo come chiave di join principale.geo_name: il nome della regione leggibile. Nota: per i set di dati della griglia S2, le celle matematiche non hanno nomi standard, quindi questa colonna conterrà lo stesso token digeo_id. Questa è una scelta progettuale per mantenere una struttura di colonne coerente in tutte le offerte di dinamiche della popolazione.administrative_area_level_1_id: l'ID luogo di Google Maps univoco per il confine amministrativo di primo livello (ad esempio, stato o provincia).administrative_area_level_1_name: il nome leggibile del confine di primo livello (ad esempio,'California').administrative_area_level_2_id: l'ID luogo di Google Maps univoco per il confine amministrativo secondario (ad esempio, contea o distretto).administrative_area_level_2_name: il nome leggibile del confine secondario (ad esempio,'Tulare County').features: il vettore di embedding principale a 330 dimensioni, memorizzato in modo nativo comeARRAY<FLOAT64>. Il caricamento nella libreria Python Pandas richiede l'appiattimento o la conversione in una matrice NumPy.
Domande frequenti
Posso accedere ai dati di input non elaborati (ad esempio, query di ricerca specifiche o tracce di mobilità)?
No. Gli embedding di informazioni sulle dinamiche della popolazione vengono generati da segnali aggregati che tutelano la privacy. Per garantire la privacy degli utenti, non forniamo tracce specifiche degli utenti, cronologie di ricerca individuali o pattern di movimento non elaborati. Gli embedding forniscono una rappresentazione latente di questi comportamenti, ottimizzata per la modellazione e la previsione, anziché per l'analisi non elaborata.
Le dimensioni dei vettori sono interpretabili (ad esempio, la dimensione 5 è "Caffè")?
I vettori sono rappresentazioni latenti, il che significa che acquisiscono pattern astratti anziché etichette specifiche e leggibili. Sebbene sappiamo che gli indici 0-127 derivano dalle tendenze di ricerca, un indice specifico (come l'indice 5) non esegue il mapping uno a uno a una singola parola chiave come "Caffè". Rappresenta invece una funzionalità complessa del comportamento di ricerca appresa dal modello.
Il set di dati include i confini dei poligoni (file di forma)?
Il set di dati fornisce token di celle S2 (geo_id) e ID luogo per gli identificatori geografici (ad esempio, regioni amministrative di livello 1 e 2), ma non include la geometria dei poligoni non elaborati (WKT/file di forma) per le regioni delle celle S2. L'omissione delle geometrie non elaborate impedisce l'aumento dello spazio di archiviazione e riduce i costi di scansione di BigQuery per le pipeline di ML che richiedono solo vettori di funzionalità. Inoltre, l'unione dei token di stringhe S2 è notevolmente più veloce ed efficiente dal punto di vista computazionale rispetto all'esecuzione di intersezioni di poligoni spaziali.
- Per le coordinate dei punti: per unire i dati dei punti (ad esempio, le posizioni dei PDI o i centroidi dei negozi) con le informazioni sulle dinamiche della popolazione, converti le coordinate di latitudine/longitudine in token di celle S2 di livello 12 utilizzando
S2_CELLIDFROMPOINTin combinazione conST_GEOGPOINT(vedi Convertire le coordinate dei punti in token esadecimali S2 di livello 12). - Per i confini delle aree: se devi intersecare i confini personalizzati con
le informazioni sulle dinamiche della popolazione, ti consigliamo di convertire i poligoni personalizzati in
token di celle S2 di livello 12 utilizzando
S2_COVERINGCELLIDS(vedi Generare token di celle S2 di livello 12 di copertura per un poligono) o di unire questo set di dati con i set di dati dei confini pubblici disponibili in BigQuery Public Data. - Per la visualizzazione e la conversione della geometria: le funzioni geografiche integrate di BigQuery eseguono la conversione unidirezionale (Geometry → ID cella S2). Per
convertire i token di celle S2 in geometrie di poligoni per gli strumenti di mappatura o GIS, puoi
utilizzare librerie lato client, come `s2sphere` di Python
s2sphere. Per esempi di codice e istruzioni, vedi Ottenere la geometria delle celle S2 da un token esadecimale S2 di livello 12.