Nüfus Dinamikleri Analizleri verileri hakkında

Verileri anlama

Yerleştirmeler birden fazla ülkede kullanılabilirken şema tüm veri kümelerinde tutarlı kalır. Yerleştirmeler, her ülke için ayrı BigQuery listelemeleri halinde düzenlenir.

Yerleştirme Vektörünün Anatomisi

features sütunu, 330 boyutlu bir vektördür (BigQuery'de REPEATED FLOAT dizisi olarak depolanır). Dizinin her bölümü, nüfus dinamikleri modeli tarafından çıkarılan belirli bir veri sinyaline karşılık gelir.

Bu yapıyı anlamak, özelliklerin çıkarılmasına (ör. arama davranışının satışları hava durumuna kıyasla ne kadar öngördüğünü belirleme) olanak tanır.

Vektör dizinleri Veri kaynağı Açıklama
0-127 Toplu Arama Trendleri Bölgesel ilgi alanlarını ve endişeleri (örneğin, "spor salonu", "grip belirtileri", "lüks ürünler" aramaları) yakalar.
128-255 Haritalar ve Yoğunluk Yerleşim alanlarını (hastaneler, parklar, okullar gibi ÖY'ler) ve insan faaliyetlerinin yoğunluğunu gösterir.
256-329 Hava Durumu ve Hava Kalitesi Çevresel bağlamı (sıcaklık, yağış, HKİ, rüzgar) yakalar.

Önemli sütunlar ve meta veriler

Yerleştirme tablosu, coğrafi analiz, filtreleme ve diğer Google Haritalar Platformu hizmetleriyle birlikte çalışabilirliği sağlayan mekansal meta verileri içerir.

  • geo_id: Bölgenin birincil tanımlayıcısı. S2 hücresi veri kümeleri için bu, onaltılık dize olarak gösterilen S2 hücresi jetonudur (örneğin, '80ead45'). Bunu birincil birleştirme anahtarınız olarak kullanın.
  • geo_name: Bölgenin insan tarafından okunabilir adı. Not: S2 ızgara veri kümelerinde matematiksel hücrelerin standart adları yoktur. Bu nedenle bu sütun, geo_id ile aynı jetonu içerir. Bu, tüm Nüfus Dinamikleri tekliflerinde tutarlı bir sütun yapısı sağlamak için tasarlanmıştır.
  • administrative_area_level_1_id: En üst düzey idari sınır için benzersiz Google Haritalar Yer Kimliği (ör. eyalet veya il).
  • administrative_area_level_1_name: En üst düzey sınıra ait, insan tarafından okunabilen ad (ör. 'California').
  • administrative_area_level_2_id: İkincil idari sınır için benzersiz Google Haritalar Yer Kimliği (ör. ilçe).
  • administrative_area_level_2_name: İkincil sınırın kullanıcılar tarafından okunabilen adı (örneğin, 'Tulare County').
  • features: Temel 330 boyutlu yerleştirme vektörü, yerel olarak ARRAY<FLOAT64> olarak depolanır. Bunu Pandas Python kitaplığına yüklemek için düzleştirilmesi veya NumPy matrisine dönüştürülmesi gerekir.

Sık sorulan sorular (SSS)

Ham giriş verilerine (örneğin, belirli arama sorguları veya hareketlilik izleri) erişebilir miyim?

Hayır. Nüfus Dinamikleri Analizleri yerleştirmeleri, gizliliği koruyan toplu sinyallerden oluşturulur. Kullanıcı gizliliğini sağlamak için belirli kullanıcı izleri, bireysel arama geçmişleri veya ham hareket kalıpları sağlamayız. Yerleştirmeler, bu davranışların ham analizler yerine modelleme ve tahmin için optimize edilmiş bir gizli gösterimini sağlar.

Vektör boyutları yorumlanabilir mi? (Örneğin, 5. boyut "Kahve" mi?)

Vektörler, belirli ve kullanıcılar tarafından okunabilen etiketler yerine soyut kalıpları yakalayan gizli temsillerdir. 0-127 arasındaki indekslerin Arama Trendleri'nden türediğini biliyoruz ancak belirli bir indeks (ör. 5. indeks), "Kahve" gibi tek bir anahtar kelimeyle bire bir eşleşmez. Bunun yerine, modelin öğrendiği karmaşık bir arama davranışı özelliğini temsil eder.

Veri kümesi poligon sınırları (şekil dosyaları) içeriyor mu?

Veri kümesi, coğrafi tanımlayıcılar (ör. 1. ve 2. düzey yönetici bölgeleri) için S2 hücresi jetonları (geo_id) ve yer kimlikleri sağlar ancak S2 hücresi bölgeleri için ham poligon geometrisi (WKT/Shapefile) içermez. Ham geometrilerin atlanması, depolama alanının gereksiz büyümesini önler ve yalnızca özellik vektörleri gerektiren makine öğrenimi işlem hatları için BigQuery tarama maliyetlerini azaltır. Ayrıca, S2 dize jetonlarıyla birleştirme, mekansal poligon kesişimlerini yürütmekten çok daha hızlıdır ve hesaplama açısından daha verimlidir.

  • Nokta koordinatları için: Nokta verilerini (ör. ÖY konumları veya mağaza merkezleri) Demografi Dinamikleri Analizleri ile birleştirmek için enlem/boylam koordinatlarını S2_CELLIDFROMPOINT ile birlikte ST_GEOGPOINT kullanarak S2 12. Düzey hücre jetonlarına dönüştürün (Nokta koordinatlarını S2 12. Düzey onaltılık jetonlarına dönüştürme başlıklı makaleyi inceleyin).
  • Alan Sınırları İçin: Özel sınırları nüfus dinamikleri analizleriyle kesiştirmeniz gerekiyorsa özel poligonlarınızı S2_COVERINGCELLIDS kullanarak kapsayan S2 Seviye 12 hücre jetonlarına dönüştürmenizi (bkz. Poligon için kapsayan S2 Seviye 12 hücre jetonları oluşturma) veya bu veri kümesini BigQuery Public Data'da bulunan herkese açık sınır veri kümeleriyle birleştirmenizi öneririz.
  • Görselleştirme ve Geometri Dönüşümü İçin: BigQuery'nin yerleşik coğrafya işlevleri tek yönlü dönüşüm (Geometri → S2 Hücre Kimliği) gerçekleştirir. S2 hücre jetonlarını haritalama veya coğrafi bilgi sistemi araçları için poligon geometrilerine dönüştürmek üzere Python'ın s2sphere gibi istemci tarafı kitaplıklarını kullanabilirsiniz. Kod örnekleri ve talimatlar için S2 Level 12 altıgen jetonundan S2 hücre geometrisi alma başlıklı makaleyi inceleyin.