डेटा के बारे में जानकारी
एम्बेडिंग कई देशों के लिए उपलब्ध हैं. हालांकि, सभी डेटासेट में स्कीमा एक जैसा रहता है. हर देश के लिए, एम्बेडिंग को अलग-अलग BigQuery लिस्टिंग में व्यवस्थित किया जाता है.
एम्बेडिंग वेक्टर कैसे काम करता है
features कॉलम, 330 डाइमेंशन वाला वेक्टर है. इसे BigQuery में REPEATED FLOAT कलेक्शन के तौर पर सेव किया जाता है. कलेक्शन का हर सेक्शन, जनसंख्या में बदलाव से जुड़ी अहम जानकारी के मॉडल से निकाले गए किसी खास डेटा सिग्नल से जुड़ा होता है.
इस स्ट्रक्चर को समझने से, फ़ीचर एब्लेशन की सुविधा मिलती है. उदाहरण के लिए, यह पता लगाना कि मौसम की तुलना में, खोज के पैटर्न से बिक्री का कितना अनुमान लगाया जा सकता है.
| वेक्टर इंडेक्स | डेटा सोर्स | ब्यौरा |
|---|---|---|
| 0 – 127 | खोज के रुझानों का इकट्ठा किया गया डेटा | इसमें, इलाके के हिसाब से लोगों की दिलचस्पी और चिंताएं शामिल होती हैं. जैसे, "जिम," "फ़्लू के लक्षण," "लग्ज़री सामान" के लिए की गई खोजें. |
| 128 – 255 | Maps और व्यस्तता | इसमें, बनावटी एनवायरमेंट (पीओआई, जैसे कि अस्पताल, पार्क, स्कूल) और लोगों की गतिविधि की डेंसिटी शामिल होती है. |
| 256 – 329 | मौसम और एयर क्वालिटी | इसमें, एनवायरमेंट के हिसाब से कॉन्टेक्स्ट (तापमान, बारिश, एक्यूआई, हवा) शामिल होता है. |
मुख्य कॉलम और मेटाडेटा
एम्बेडिंग टेबल में, स्पेस से जुड़ा मेटाडेटा शामिल होता है. इससे जियोस्पेशल विश्लेषण, फ़िल्टर करने, और Google Maps Platform की अन्य सेवाओं के साथ इंटरऑपरेबिलिटी की सुविधा मिलती है.
geo_id: इलाके के लिए प्राइमरी आइडेंटिफ़ायर. S2 सेल डेटासेट के लिए, यह S2 सेल टोकन है. इसे हेक्साडेसिमल स्ट्रिंग के तौर पर दिखाया जाता है. जैसे,'80ead45'. इसे प्राइमरी जॉइन की के तौर पर इस्तेमाल करें.geo_name: इलाके के लिए, ऐसा नाम जिसे आसानी से पढ़ा जा सके. ध्यान दें: S2 ग्रिड डेटासेट के लिए, गणितीय सेल के स्टैंडर्ड नाम नहीं होते. इसलिए, इस कॉलम में वही टोकन होगा जोgeo_idमें है. ऐसा इसलिए किया गया है, ताकि जनसंख्या में बदलाव से जुड़ी अहम जानकारी के सभी ऑफ़र में कॉलम का स्ट्रक्चर एक जैसा रहे.administrative_area_level_1_id: सबसे बड़े एडमिन बाउंड्री (जैसे, राज्य या प्रांत) के लिए, Google Maps Place ID.administrative_area_level_1_name: सबसे बड़े एडमिन बाउंड्री (जैसे,'California') के लिए, ऐसा नाम जिसे आसानी से पढ़ा जा सके.administrative_area_level_2_id: दूसरे नंबर की एडमिन बाउंड्री (जैसे, काउंटी या ज़िला) के लिए, Google Maps Place ID.administrative_area_level_2_name: दूसरे नंबर की एडमिन बाउंड्री (जैसे,'Tulare County') के लिए, ऐसा नाम जिसे आसानी से पढ़ा जा सके.features: मुख्य 330 डाइमेंशन वाला एम्बेडिंग वेक्टर. इसे नेटिव तौर परARRAY<FLOAT64>के तौर पर सेव किया जाता है. इसे Pandas Python लाइब्रेरी में लोड करने के लिए, फ़्लैटनिंग या NumPy मैट्रिक्स में बदलने की ज़रूरत होती है.
अक्सर पूछे जाने वाले सवाल
क्या मैं रॉ इनपुट डेटा (उदाहरण के लिए, खोज क्वेरी या मोबिलिटी ट्रेस) ऐक्सेस कर सकता/सकती हूं?
नहीं. जनसंख्या में बदलाव से जुड़ी अहम जानकारी के एम्बेडिंग, इकट्ठा किए गए और निजता को सुरक्षित रखने वाले सिग्नल से जनरेट किए जाते हैं. उपयोगकर्ता की निजता को सुरक्षित रखने के लिए, हम उपयोगकर्ता के ट्रेस, खोज के इतिहास या मूवमेंट के पैटर्न नहीं दिखाते. एम्बेडिंग, इन पैटर्न को दिखाने के लिए, रॉ ऐनलिटिक्स के बजाय, मॉडलिंग और अनुमान लगाने के लिए ऑप्टिमाइज़ किए गए हैं.
क्या वेक्टर डाइमेंशन को समझा जा सकता है? उदाहरण के लिए, क्या डाइमेंशन 5 "कॉफ़ी" है?
वेक्टर, पैटर्न को दिखाने के लिए इस्तेमाल किए जाते हैं. इसका मतलब है कि ये खास और आसानी से पढ़े जा सकने वाले लेबल के बजाय, अमूर्त पैटर्न को कैप्चर करते हैं. हमें पता है कि इंडेक्स 0–127, खोज के रुझानों से मिलते हैं. हालांकि, कोई खास इंडेक्स (जैसे, इंडेक्स 5) "कॉफ़ी" जैसे किसी एक कीवर्ड से मैप नहीं होता. इसके बजाय, यह मॉडल से सीखे गए खोजने के तरीके की जटिल सुविधा को दिखाता है.
क्या डेटासेट में पॉलीगॉन बाउंड्री (शेपफ़ाइल) शामिल हैं?
डेटासेट में, S2 सेल टोकन (geo_id) और भौगोलिक आइडेंटिफ़ायर (जैसे, एडमिन 1 और एडमिन 2 के इलाके) के लिए Place ID शामिल होते हैं. हालांकि, इसमें S2 सेल के इलाकों के लिए, रॉ पॉलीगॉन ज्यामिति (WKT/शेपफ़ाइल) शामिल नहीं होती. रॉ ज्यामिति को शामिल न करने से, स्टोरेज की ज़रूरत कम हो जाती है. साथ ही, एमएल पाइपलाइन के लिए BigQuery स्कैनिंग की लागत कम हो जाती है. एमएल पाइपलाइन के लिए सिर्फ़ फ़ीचर वेक्टर की ज़रूरत होती है. इसके अलावा, S2 स्ट्रिंग टोकन पर जॉइन करना, स्पेस से जुड़े पॉलीगॉन इंटरसेक्शन को लागू करने की तुलना में ज़्यादा तेज़ और कंप्यूटेशन के हिसाब से ज़्यादा कारगर होता है.
- पॉइंट कोऑर्डिनेट के लिए: पॉइंट डेटा (जैसे, पीओआई की जगहें या
स्टोर सेंट्रॉइड) को जनसंख्या में बदलाव से जुड़ी अहम जानकारी के साथ जोड़ने के लिए, अक्षांश/देशांतर कोऑर्डिनेट को S2
लेवल 12 सेल टोकन में बदलें. इसके लिए,
S2_CELLIDFROMPOINTकोST_GEOGPOINTके साथ इस्तेमाल करें. ज़्यादा जानकारी के लिए, पॉइंट कोऑर्डिनेट को S2 लेवल 12 हेक्स टोकन में बदलना लेख पढ़ें. - इलाके की बाउंड्री के लिए: अगर आपको कस्टम बाउंड्री को
जनसंख्या में बदलाव से जुड़ी अहम जानकारी के साथ इंटरसेक्ट करना है, तो हमारा सुझाव है कि अपने कस्टम पॉलीगॉन को
S2 लेवल 12 सेल टोकन में बदलें. इसके लिए,
S2_COVERINGCELLIDSका इस्तेमाल करें. ज़्यादा जानकारी के लिए, किसी पॉलीगॉन के लिए S2 लेवल 12 सेल टोकन जनरेट करना लेख पढ़ें.) इसके अलावा, इस डेटासेट को BigQuery Public Data में उपलब्ध, सार्वजनिक बाउंड्री वाले डेटासेट के साथ जोड़ा जा सकता है. - विज़ुअलाइज़ेशन और ज्यामिति कन्वर्ज़न के लिए: BigQuery के बिल्ट-इन जियोग्राफ़िक फ़ंक्शन, एकतरफ़ा कन्वर्ज़न (ज्यामिति → S2 सेल आईडी) करते हैं. मैपिंग या जीआईएस टूल के लिए, S2 सेल टोकन को पॉलीगॉन ज्यामिति में बदलने के लिए, क्लाइंट-साइड लाइब्रेरी का इस्तेमाल किया जा सकता है. जैसे, Python की
s2sphere. कोड के सैंपल और निर्देशों के लिए, S2 लेवल 12 हेक्स टोकन से S2 सेल ज्यामिति पाना लेख पढ़ें.