जनसंख्या में बदलाव से जुड़ी अहम जानकारी के डेटा के बारे में जानकारी

डेटा को समझना

हालांकि, एम्बेडिंग कई देशों के लिए उपलब्ध हैं, लेकिन स्कीमा सभी डेटासेट में एक जैसा रहता है. हर देश के लिए, एम्बेड किए गए डेटा को अलग-अलग BigQuery लिस्टिंग में व्यवस्थित किया जाता है.

एंबेडिंग से मिले वेक्टर की बनावट

features कॉलम, 330 डाइमेंशन वाला वेक्टर है. इसे BigQuery में REPEATED FLOAT ऐरे के तौर पर सेव किया जाता है. ऐरे का हर सेक्शन, जनसंख्या के रुझानों के मॉडल से निकाले गए किसी खास डेटा सिग्नल से मेल खाता है.

इस स्ट्रक्चर को समझने से, फ़ीचर एब्लेशन (उदाहरण के लिए, यह तय करना कि मौसम की तुलना में खोज के व्यवहार से कितनी बिक्री का अनुमान लगाया जा सकता है) किया जा सकता है.

वेक्टर इंडेक्स डेटा सोर्स ब्यौरा
0 – 127 खोज के रुझानों का एग्रीगेट किया गया डेटा यह कुकी, इलाके के हिसाब से लोगों की दिलचस्पी और उनकी समस्याओं के बारे में जानकारी इकट्ठा करती है. उदाहरण के लिए, "जिम," "फ़्लू के लक्षण," "लग्ज़री सामान" के लिए की गई खोजें.
128 – 255 मैप और व्यस्तता इससे, इमारतों (जैसे, अस्पताल, पार्क, स्कूल) और मानवीय गतिविधियों की जानकारी मिलती है.
256 – 329 मौसम और एयर क्वालिटी यह एनवायरमेंट के कॉन्टेक्स्ट को कैप्चर करता है (तापमान, बारिश, एक्यूआई, हवा).

मुख्य कॉलम और मेटाडेटा

एम्बेडिंग टेबल में स्पैटियल मेटाडेटा होता है. इससे जियोस्पेशल विश्लेषण, फ़िल्टर करने, और Google Maps Platform की अन्य सेवाओं के साथ इंटरऑपरेबिलिटी की सुविधा मिलती है.

  • geo_id: यह क्षेत्र का प्राइमरी आइडेंटिफ़ायर होता है. S2 सेल डेटासेट के लिए, यह S2 सेल टोकन है. इसे हेक्साडेसिमल स्ट्रिंग के तौर पर दिखाया जाता है (उदाहरण के लिए, '80ead45'). इसका इस्तेमाल प्राइमरी जॉइन की के तौर पर करें.
  • geo_name: क्षेत्र का नाम, जिसे आसानी से पढ़ा जा सकता है. ध्यान दें: S2 ग्रिड वाले डेटासेट के लिए, गणितीय सेल के स्टैंडर्ड नाम नहीं होते. इसलिए, इस कॉलम में वही टोकन होगा जो geo_id में है. ऐसा इसलिए किया गया है, ताकि सभी पॉप्युलेशन डायनामिक ऑफ़रिंग में कॉलम का स्ट्रक्चर एक जैसा बना रहे.
  • administrative_area_level_1_id: यह टॉप-लेवल की प्रशासनिक सीमा (जैसे, राज्य या प्रांत) के लिए, Google Maps का यूनीक प्लेस आईडी होता है.
  • administrative_area_level_1_name: टॉप-लेवल की सीमा का ऐसा नाम जिसे आसानी से पढ़ा जा सके. उदाहरण के लिए, 'California'.
  • administrative_area_level_2_id: यह Google Maps का यूनीक प्लेस आईडी है. यह आईडी, एडमिनिस्ट्रेटिव बाउंड्री (जैसे, काउंटी या ज़िला) के लिए होता है.
  • administrative_area_level_2_name: सेकंडरी बाउंड्री का ऐसा नाम जिसे आसानी से पढ़ा जा सके. उदाहरण के लिए, 'Tulare County'.
  • features: यह 330 डाइमेंशन वाला कोर एम्बेडिंग वेक्टर है. इसे नेटिव तौर पर ARRAY<FLOAT64> के तौर पर सेव किया जाता है. इसे Pandas Python लाइब्रेरी में लोड करने के लिए, इसे फ़्लैट करना या NumPy मैट्रिक्स में बदलना ज़रूरी है.

अक्सर पूछे जाने वाले सवाल

क्या मुझे रॉ इनपुट डेटा (जैसे, खोज क्वेरी या मोबिलिटी ट्रेस) ऐक्सेस करने की अनुमति है?

नहीं. जनसंख्या में बदलाव से जुड़ी अहम जानकारी के एम्बेड किए गए डेटा को, निजता बनाए रखने वाले एग्रीगेट किए गए सिग्नल से जनरेट किया जाता है. उपयोगकर्ता की निजता का ध्यान रखने के लिए, हम उपयोगकर्ता के खास ट्रेस, खोज इतिहास या मूवमेंट के रॉ पैटर्न की जानकारी नहीं देते. एम्बेडिंग, इन व्यवहारों का लेटेंट प्रज़ेंटेशन उपलब्ध कराती हैं. इन्हें रॉ ऐनलिटिक्स के बजाय, मॉडलिंग और अनुमान लगाने के लिए ऑप्टिमाइज़ किया जाता है.

क्या वेक्टर डाइमेंशन को समझा जा सकता है? उदाहरण के लिए, क्या डाइमेंशन 5 "कॉफ़ी" है?

वेक्टर, लेटेंट रिप्रेजेंटेशन होते हैं. इसका मतलब है कि वे खास, इंसानों के पढ़ने लायक लेबल के बजाय, ऐब्स्ट्रैक्ट पैटर्न कैप्चर करते हैं. हमें पता है कि इंडेक्स 0–127, Search Trends से मिलते हैं. हालांकि, कोई खास इंडेक्स (जैसे कि इंडेक्स 5), "कॉफ़ी" जैसे किसी एक कीवर्ड से एक-से-एक मैप नहीं होता. इसके बजाय, यह खोज के व्यवहार की एक जटिल सुविधा को दिखाता है. इसे मॉडल ने सीखा है.

क्या डेटासेट में पॉलीगॉन बाउंड्री (शेपफ़ाइल) शामिल हैं?

डेटासेट में, भौगोलिक आइडेंटिफ़ायर (जैसे कि एडमिन 1 और एडमिन 2 क्षेत्र) के लिए S2 सेल टोकन (geo_id) और जगह के आईडी दिए गए हैं. हालांकि, इसमें S2 सेल क्षेत्रों के लिए रॉ पॉलीगॉन ज्यामिति (WKT/शेपफ़ाइलें) शामिल नहीं हैं. raw geometries को शामिल न करने से, स्टोरेज की समस्या नहीं होती. साथ ही, इससे एमएल पाइपलाइन के लिए BigQuery स्कैनिंग की लागत कम हो जाती है. इन पाइपलाइन को सिर्फ़ फ़ीचर वेक्टर की ज़रूरत होती है. इसके अलावा, S2 स्ट्रिंग टोकन पर शामिल होने की प्रोसेस, स्पैटियल पॉलीगॉन इंटरसेक्शन को लागू करने की तुलना में काफ़ी तेज़ होती है और इसमें कम कंप्यूटेशनल पावर लगती है.

  • पॉइंट कोऑर्डिनेट के लिए: पॉइंट डेटा (जैसे, लोकप्रिय जगहों की लोकेशन या स्टोर के सेंट्रॉइड) को जनसंख्या के रुझानों की अहम जानकारी के साथ जोड़ने के लिए, lat/lng कोऑर्डिनेट को S2 लेवल 12 सेल टोकन में बदलें. इसके लिए, S2_CELLIDFROMPOINT के साथ ST_GEOGPOINT का इस्तेमाल करें (पॉइंट कोऑर्डिनेट को S2 लेवल 12 हेक्स टोकन में बदलना लेख पढ़ें).
  • क्षेत्र की सीमाओं के लिए: अगर आपको कस्टम सीमाओं को जनसंख्या के आंकड़ों से जुड़ी अहम जानकारी के साथ इंटरसेक्ट करना है, तो हमारा सुझाव है कि आप अपने कस्टम पॉलीगॉन को S2 लेवल 12 सेल टोकन में बदलें. इसके लिए, S2_COVERINGCELLIDS का इस्तेमाल करें. (देखें किसी पॉलीगॉन के लिए S2 लेवल 12 सेल टोकन जनरेट करना) या इस डेटासेट को BigQuery Public Data में उपलब्ध सार्वजनिक सीमा वाले डेटासेट के साथ जोड़ें.
  • विज़ुअलाइज़ेशन और ज्यामिति कन्वर्ज़न के लिए: BigQuery के बिल्ट-इन जियोग्राफ़ी फ़ंक्शन, एकतरफ़ा कन्वर्ज़न (ज्यामिति → S2 सेल आईडी) करते हैं. मैपिंग या GIS टूल के लिए, S2 सेल टोकन को पॉलीगॉन ज्यामिति में बदलने के लिए, क्लाइंट-साइड लाइब्रेरी का इस्तेमाल किया जा सकता है. जैसे, Python की s2sphere. कोड के सैंपल और निर्देशों के लिए, S2 लेवल 12 के हेक्स टोकन से S2 सेल की ज्यामिति पाना लेख पढ़ें.