הסבר על הנתונים
ההטמעות זמינות לכמה מדינות, אבל הסכימה נשארת עקבית בכל מערכי הנתונים. ההטמעות מאורגנות בדפי מוצר נפרדים ב-BigQuery לכל מדינה.
המבנה של וקטור הטמעה
העמודה features היא וקטור תלת-ממדי (מאוחסן כמערך REPEATED FLOAT ב-BigQuery). כל חלק במערך מתאים לאות נתונים ספציפי שחולץ על ידי המודל של דינמיקת האוכלוסייה.
הבנת המבנה הזה מאפשרת לבצע ניתוח של תכונות (לדוגמה, אפשר לקבוע עד כמה התנהגות החיפוש חוזה את המכירות בהשוואה למזג האוויר).
| אינדקסים של וקטורים | מקור נתונים | תיאור |
|---|---|---|
| 0 – 127 | מגמות חיפוש מצטברות | מציג את תחומי העניין והחששות באזור מסוים (למשל, חיפושים של 'חדר כושר', 'תסמינים של שפעת', 'מוצרי יוקרה'). |
| 128 – 255 | מפות Google ומידת העומס | השכבה הזו כוללת את הסביבה הבנויה (נקודות עניין כמו בתי חולים, פארקים ובתי ספר) ואת צפיפות הפעילות האנושית. |
| 256 – 329 | מזג האוויר ואיכות האוויר | תיעוד של ההקשר הסביבתי (טמפרטורה, משקעים, מדד איכות האוויר, רוח). |
עמודות מרכזיות ומטא-נתונים
טבלת ההטמעות מכילה מטא-נתונים מרחביים שמאפשרים ניתוח גיאוגרפי, סינון ואינטראופרביליות עם שירותים אחרים של Google Maps Platform.
-
geo_id: המזהה הראשי של האזור. במערכי נתונים של תא S2, זהו אסימון תא S2 שמיוצג כמחרוזת הקסדצימלית (לדוגמה,'80ead45'). משתמשים בו כמפתח הצירוף הראשי. -
geo_name: השם של האזור שקריא לאנשים. הערה: במערכי נתונים של רשת S2, לתאים מתמטיים אין שמות סטנדרטיים, ולכן העמודה הזו תכיל את אותו הטוקן בדיוק כמוgeo_id. העיצוב הזה נועד לשמור על מבנה עמודות עקבי בכל המוצרים של Population Dynamics. -
administrative_area_level_1_id: מזהה המקום הייחודי במפות Google לגבול המנהלי ברמה העליונה (לדוגמה, מדינה או מחוז). -
administrative_area_level_1_name: שם קריא לאנשים של הגבול ברמה העליונה (לדוגמה,'California'). -
administrative_area_level_2_id: מזהה המקום הייחודי ב-Google Maps של הגבול המנהלי המשני (לדוגמה, מחוז או נפה). -
administrative_area_level_2_name: שם קריא לאנשים של הגבול המשני (לדוגמה,'Tulare County'). -
features: וקטור ההטמעה המרכזי בתלת-ממד, שמאוחסן באופן מקורי כ-ARRAY<FLOAT64>. כדי לטעון את הנתונים האלה לספריית Pandas Python, צריך לשטח אותם או להמיר אותם למטריצת NumPy.
שאלות נפוצות
האם יש לי גישה לנתוני הקלט הגולמיים (לדוגמה, שאילתות חיפוש ספציפיות או נתוני ניידות)?
לא. ההטמעות של תובנות לגבי דינמיקה של האוכלוסייה נוצרות מאותות מצטברים ששומרים על הפרטיות. כדי להבטיח את פרטיות המשתמשים, אנחנו לא מספקים נתונים ספציפיים על המשתמשים, היסטוריית חיפושים אישית או דפוסי תנועה לא מעובדים. ההטמעות מספקות ייצוג סמוי של ההתנהגויות האלה, שעבר אופטימיזציה לצורך יצירת מודלים ותחזיות, ולא לצורך ניתוח גולמי.
האם אפשר לפרש את המאפיינים של הווקטור (לדוגמה, האם מאפיין 5 הוא 'קפה')?
הווקטורים הם ייצוגים סמויים, כלומר הם מתעדים דפוסים מופשטים ולא תוויות ספציפיות שניתנות לקריאה על ידי בני אדם. אנחנו יודעים שהאינדקסים 0 עד 127 מגיעים מ-Google Trends, אבל אינדקס ספציפי (כמו אינדקס 5) לא תואם באופן חד-חד-ערכי למילת מפתח יחידה כמו 'קפה'. במקום זאת, הוא מייצג תכונה מורכבת של התנהגות החיפוש שנלמדה על ידי המודל.
האם מערך הנתונים כולל גבולות של מצולעים (קובצי Shapefile)?
קבוצת הנתונים מספקת טוקנים של תאי S2 (geo_id) ומזהי מקומות למזהים גיאוגרפיים (כמו אזורים אדמיניסטרטיביים ברמה 1 וברמה 2), אבל היא לא כוללת גיאומטריה של מצולעים גולמיים (WKT/Shapefiles) לאזורי תאי S2. השמטה של גיאומטריות גולמיות מונעת ניפוח של נפח האחסון ומפחיתה את עלויות הסריקה ב-BigQuery של צינורות ML שנדרשים רק לווקטורים של תכונות. בנוסף, הצטרפות לאסימוני מחרוזת S2 מהירה ויעילה מבחינת חישובים באופן משמעותי בהשוואה להפעלת חיתוכי מצולעים מרחביים.
- לגבי קואורדינטות של נקודות: כדי לצרף נתוני נקודות (כמו מיקומי נקודות עניין או מרכזי חנויות) לתובנות לגבי דינמיקת אוכלוסייה, צריך להמיר קואורדינטות של קווי רוחב ואורך לטוקנים של תאים ברמה 12 של S2 באמצעות
S2_CELLIDFROMPOINTבשילוב עםST_GEOGPOINT(ראו המרת קואורדינטות של נקודות לטוקנים הקסדצימליים ברמה 12 של S2). - לגבי גבולות אזורים: אם אתם צריכים לבצע חיתוך של גבולות מותאמים אישית עם נתונים מתוך התובנות לגבי דינמיקת אוכלוסייה, מומלץ להמיר את המצולעים המותאמים אישית לטוקנים של תאים ברמה 12 של S2 באמצעות
S2_COVERINGCELLIDS(ראו יצירת טוקנים של תאים ברמה 12 של S2 עבור מצולע) או לשלב את מערך הנתונים הזה עם מערכי נתונים של גבולות ציבוריים שזמינים בנתונים הציבוריים של BigQuery. - לצורך המרה של נתונים חזותיים וגיאומטריים: פונקציות הגיאוגרפיה המובנות של BigQuery מבצעות המרה חד-כיוונית (Geometry → S2 Cell ID). כדי להמיר טוקנים של תאי S2 לצורות גיאומטריות של מצולעים למיפוי או לכלים של GIS, אפשר להשתמש בספריות בצד הלקוח, כמו
s2sphereשל Python. דוגמאות קוד והוראות זמינות במאמר קבלת גיאומטריית תא S2 מאסימון הקסדצימלי של S2 ברמה 12.