Informacje o danych Statystyk dotyczących dynamiki populacji

Informacje o danych

Osadzenia są dostępne w wielu krajach, ale schemat pozostaje spójny we wszystkich zbiorach danych. Osadzenia są uporządkowane w osobnych listach BigQuery dla każdego kraju.

Anatomia wektora osadzenia

Kolumna features to wektor 330-wymiarowy (przechowywany w BigQuery jako tablica REPEATED FLOAT). Każda sekcja tablicy odpowiada konkretnemu sygnałowi danych wyodrębnionemu przez model dynamiki populacji.

Zrozumienie tej struktury umożliwia ablację cech (np. określenie, w jakim stopniu zachowania związane z wyszukiwaniem przewidują sprzedaż w porównaniu z pogodą).

Indeksy wektorów Źródło danych Opis
0 – 127 Zagregowane trendy wyszukiwania Rejestruje zainteresowania i obawy regionalne (np. wyszukiwania fraz „siłownia”, „objawy grypy”, „towary luksusowe”).
128 – 255 Mapy i ruch Rejestruje środowisko zabudowane (miejsca takie jak szpitale, parki, szkoły) i gęstość aktywności ludzi.
256 – 329 Pogoda i jakość powietrza Rejestruje kontekst środowiskowy (temperatura, opady, wskaźnik jakości powietrza, wiatr).

Kluczowe kolumny i metadane

Tabela osadzeń zawiera metadane przestrzenne umożliwiające analizę geoprzestrzenną, filtrowanie i interoperacyjność z innymi usługami Google Maps Platform.

  • geo_id: podstawowy identyfikator regionu. W przypadku zbiorów danych komórek S2 cell jest to token komórki S2 reprezentowany jako ciąg szesnastkowy (np. '80ead45'). Użyj go jako podstawowego klucza łączenia.
  • geo_name: nazwa regionu czytelna dla człowieka. Uwaga: w przypadku zbiorów danych siatki S2 komórki matematyczne nie mają standardowych nazw, więc ta kolumna będzie zawierać dokładnie ten sam token co geo_id. Jest to celowe, aby zachować spójną strukturę kolumn we wszystkich ofertach dynamiki populacji.
  • administrative_area_level_1_id: unikalny identyfikator miejsca w Mapach Google dla granicy administracyjnej najwyższego poziomu (np. województwa lub prowincji).
  • administrative_area_level_1_name: nazwa granicy najwyższego poziomu czytelna dla człowieka (np. 'California').
  • administrative_area_level_2_id: unikalny identyfikator miejsca w Mapach Google dla granicy administracyjnej drugiego poziomu (np. powiatu lub okręgu).
  • administrative_area_level_2_name: nazwa granicy drugiego poziomu czytelna dla człowieka (np. 'Tulare County').
  • features: podstawowy wektor osadzenia 330-wymiarowy, przechowywany natywnie jako ARRAY<FLOAT64>. Wczytanie go do biblioteki Python Pandas wymaga spłaszczenia lub przekonwertowania na macierz NumPy.

Najczęstsze pytania

Czy mogę uzyskać dostęp do nieprzetworzonych danych wejściowych (np. konkretnych zapytań lub śladów mobilności)?

Nie. Osadzenia statystyk dynamiki populacji są generowane na podstawie zagregowanych sygnałów chroniących prywatność. Aby zapewnić prywatność użytkowników, nie udostępniamy konkretnych śladów użytkowników, indywidualnych historii wyszukiwania ani nieprzetworzonych wzorców ruchu. Osadzenia stanowią utajoną reprezentację tych zachowań, zoptymalizowaną pod kątem modelowania i przewidywania, a nie nieprzetworzonych analiz.

Czy wymiary wektorów są interpretowalne (np. czy wymiar 5 to „Kawa”)?

Wektory są utajonymi reprezentacjami, co oznacza, że rejestrują abstrakcyjne wzorce, a nie konkretne etykiety czytelne dla człowieka. Wiemy, że indeksy 0–127 pochodzą z trendów wyszukiwania, ale konkretny indeks (np. indeks 5) nie jest powiązany z pojedynczym słowem kluczowym, takim jak „Kawa”. Reprezentuje on raczej złożoną cechę zachowania związanego z wyszukiwaniem, której model się nauczył.

Czy zbiór danych zawiera granice wielokątów (pliki Shapefile)?

Zbiór danych zawiera tokeny komórek S2 (geo_id) i identyfikatory miejsc dla identyfikatorów geograficznych (takich jak regiony administracyjne 1 i 2), ale nie zawiera nieprzetworzonej geometrii wielokątów (WKT/Shapefile) dla regionów komórek S2. Pomijanie nieprzetworzonych geometrii zapobiega nadmiernemu wykorzystaniu miejsca na dane i zmniejsza koszty skanowania BigQuery w przypadku potoków ML, które wymagają tylko wektorów cech. Ponadto łączenie na podstawie tokenów ciągów S2 jest znacznie szybsze i bardziej wydajne obliczeniowo niż wykonywanie przestrzennych przecięć wielokątów.

  • W przypadku współrzędnych punktów: aby połączyć dane punktowe (takie jak lokalizacje miejsc lub środki sklepów) ze statystykami dynamiki populacji, przekonwertuj współrzędne szerokości i długości geograficznej na tokeny komórek S2 poziomu 12 za pomocą funkcji S2_CELLIDFROMPOINT w połączeniu z funkcją ST_GEOGPOINT (zobacz Konwertowanie współrzędnych punktów na tokeny szesnastkowe S2 poziomu 12).
  • W przypadku granic obszarów: jeśli chcesz przecinać niestandardowe granice ze statystykami dynamiki populacji, zalecamy przekonwertowanie niestandardowych wielokątów na obejmujące tokeny komórek S2 poziomu 12 za pomocą funkcji S2_COVERINGCELLIDS (zobacz Generowanie obejmujących tokenów komórek S2 poziomu 12 dla wielokąta) lub połączenie tego zbioru danych z publicznymi zbiorami danych granic dostępnymi w publicznych danych BigQuery.
  • W przypadku wizualizacji i konwersji geometrii: wbudowane funkcje geograficzne BigQuery wykonują konwersję jednokierunkową (geometria → identyfikator komórki S2). Aby przekonwertować tokeny komórek S2 na geometrie wielokątów na potrzeby mapowania lub narzędzi GIS, możesz użyć bibliotek po stronie klienta, takich jak `s2sphere` w Pythonie s2sphere. Przykłady kodu i instrukcje znajdziesz w artykule Pobieranie geometrii komórki S2 z tokena szesnastkowego S2 poziomu 12 token.