יחידה 2 / 11

איסוף נתונים כלכליים ואימות מקור: TURKSTAT, EVDS, IMF, Bank World, FRED

רווחים:

  • יכולת להשוות בין מקורות נתונים כלכליים עיקריים (TURKSTAT, CBRT EVDS, IMF WEO, הבנק העולמי, Eurostat, FRED) לפי מטרה, היקף, תדירות עדכון ואמינות ולבחור את המקור הנכון
  • יכולת להשתמש בבינה מלאכותית לאיתור מקור נתונים, התאמת קוד/תיאור סדרתי ויצירת קוד הורדה, ולאשר כל תוצאה עם המקור הרשמי
  • יכולת לראות כיצד הבדלי גרסה (עדכון), שנת בסיס, יחידה והגדרה משבשים את הניתוח ומקבלים הרגל לאמת מטא נתונים

כל ניתוח כלכלי מתחיל בנתונים, ואיכות הניתוח לעולם לא תעלה על איכות הנתונים. העיקרון של "זבל פנימה, זבל החוצה" פועל ללא הרף בכלכלה: אפילו המודל האלגנטי ביותר, המבוסס על בסיס שגוי, הגדרה שגויה או תקופה שגויה, שגוי. ביחידה זו, נשתמש בבינה מלאכותית כדי למצוא את הנתונים הנכונים, להתאים קודים סדרתיים ולכתוב את קוד ההורדה; אבל כלל זהב אחד לא ישתנה: הדמות מגיעה מהמקור הראשוני הרשמי, לא מבינה מלאכותית. AI יכול להראות לך את הדרך אל המקור; אתה מקבל את הנתונים עצמם מהמקור הזה.

בואו להכיר את המקורות העיקריים

מצפן של כלכלן כולל את המשאבים הבאים. המטרה, ההיקף ומקצב העדכון של כל אחד מהם שונים.

TURKSTAT (המכון הסטטיסטי הטורקי). הרשות הסטטיסטית הרשמית של טורקיה. אינפלציה (CPI/PPI), תוצר, כוח עבודה, סחר חוץ, ייצור תעשייתי, אוכלוסייה. זהו המקור העיקרי לדמויות ספציפיות לטורקיה.

CBRT EVDS (מערכת הפצת נתונים אלקטרונית). פורטל הנתונים של הבנק המרכזי. שער חליפין, ריבית, היצע כסף, מאזן תשלומים, מאזן שוטף, רזרבות, סקרי ציפיות. התחנה הראשונה לנתונים פיננסיים וכספים.

IMF (קרן המטבע הבינלאומית). במיוחד מסד הנתונים של WEO (World Economic Outlook): תוצר השוואתי בין מדינות, אינפלציה, חוב, מאזן חשבון עו"ש ותחזיות. אידיאלי להשוואה בינלאומית; אבל תחזיות הן תחזיות, לא מימושים.

הבנק העולמי (הבנק העולמי - WDI). מדדי פיתוח עולמיים: מדדי פיתוח, עוני, חינוך, בריאות, תשתיות; סדרות היסטוריות ארוכות והשוואות בין מדינות.

Eurostat. המשרד הסטטיסטי של האיחוד האירופי; נתונים מותאמים (בהשוואה) עבור מדינות האיחוד האירופי. סדרות כגון HICP (אינפלציה הרמונית) משמשות בהשוואת האיחוד האירופי.

FRED (נתונים כלכליים של הפדרל ריזרב). הסדרה המאסיבית של סנט לואיס פד; מציע גישה מהירה וניתנת לתכנות (API) לנתונים מאקרו פיננסיים בארה"ב ובגלובליות.

OECD. אינדיקטורים השוואתיים, אינדיקטורים מובילים, סדרות פריון ורווחה לכלכלות מפותחות.

טיפ: התשובה לשאלת "המקור הנכון" תלויה במטרה. TURKSTAT לאינפלציה הרשמית של טורקיה; קרן המטבע הבינלאומית/בנק העולמי להשוות את טורקיה עם 30 מדינות; FRED לעניין ארה"ב. לקחת את אותו מחוון מהמקור הלא נכון זו טעות שקטה.

מקורות שגיאה שקטים: גרסה, שנת בסיס, יחידה, תיאור

השגיאות המסוכנות ביותר בנתונים הכלכליים הן חסרות רעש. הכירו ארבעה:

  • גרסה (גרסה). אינדיקטורים רבים (תוצר, מאזן תשלומים) מתוקנים חודשים לאחר הכרזתם לראשונה. הנתון ה"זמני" כיום, הנתון ה"סופי" לאחר שלושה חודשים יהיה שונה. דע באיזה וינטג' (גרסה) אתה משתמש.
  • שנת בסיס. מדדים נקבעים על בסיס שנת בסיס (=100). זה לא נכון להשוות ישירות בין שתי סדרות עם שנות בסיס שונות.
  • יְחִידָה. מיליון או מיליארד, TL או דולר, מחיר נוכחי או קבוע? בלבול יחידה הוא שגיאת הניתוח הנפוצה ביותר.
  • הגדרה/היקף. מהי ההגדרה של "אבטלה"? אילו סעיפים אינה כוללת "אינפלציית הליבה"? שתי סדרות עם אותו שם עשויות למדוד דברים שונים.
זהירות: אם הנתון של אותו אינדיקטור משני מקורות אינו תואם, ההנחה הראשונה שלך לא צריכה להיות "מישהו משקר" אלא "יש הבדל בהגדרה/בסיס/היקף/תיקון". ישר את המטא נתונים (ציטוט נתונים) תחילה.

שלב אחר שלב: איסוף נתונים מבוסס בינה מלאכותית

  1. הבהירו את הצורך. איזה אינדיקטור, איזו מדינה/מחוז, איזו תקופה, באיזו תדירות (חודשי/רבעוני/שנתי), איזו הגדרה?
  2. בחר מקור. הסבירו את המטרה של ה-AI והצעו את המקור העיקרי המתאים ואת שם הסדרה המלא.
  3. אמת מטא נתונים. אשר את היחידה, שנת הבסיס, התיאור ותאריך העדכון של הסדרה שנבחרה בעמוד הרשמי.
  4. צור את קוד ההורדה. עבור אלה עם API, כמו FRED/בנק העולמי, כתוב קוד Python ל-AI; הסר את שלבי ההורדה עבור TURKSTAT/EVDS.
  5. בדיקה ראשונה. לאחר הגעת הנתונים, בדוק את מספר השורות/עמודות, ערכים חסרים, חריגים וטווח תאריכים.
  6. אישור מקור. השווה לפחות כמה תצפיות עם הפרסום הרשמי; האם זה מתאים בדיוק?

שלושה מיני תיקים

מקרה 1 - מלכודת שנת בסיס. אנליסט אחד השיג מדד ייצור תעשייתי משני מחקרים נפרדים; האחד התבסס על 2015=100 והשני התבסס על 2021=100. "לשלב את אלה," הוא אמר לבינה המלאכותית. אם הוא דילג על בדיקת המטא נתונים, הוא ישים את המדדים זה לצד זה ויראה קפיצה מזויפת. הוא תפס את ההבדל הבסיסי בשלב הבקרה, הפך את השניים לבסיס משותף ואז שילב אותם. ההקפצה המזויפת נעלמה.

מקרה 2 - פלט API מיוצר. חוקר אמר לבינה מלאכותית, "שאב את התמ"ג של טורקיה לנפש מהבנק העולמי"; ה-AI החזיר גם את הקוד וגם את טבלת המספרים כ"פלט לדוגמה". החוקר לא השתמש בטבלה; פשוט הרץ את הקוד והביא את הנתונים מה-API האמיתי. ואז הוא הבין שהמספרים שכתבה הבינה המלאכותית כ"דוגמאות" היו למעשה 10-15 אחוז הנחה. כלי קוד, לא מספר; זו הייתה ההתנהגות הנכונה.

מקרה 3 - הבדל תיקון. במכתב שפורסם לפני חצי שנה כתב מוסד כי הצמיחה הרבעונית הייתה 4.0 אחוזים; בנתוני TÜİK הנוכחיים, אותו רבעון תוקן ל-3.5 אחוזים. בדו"ח החדש, האנליסט ציין בהערת שוליים באיזו גרסה השתמש והסביר את ההבדל בין שני הנתונים בתיקון. השקיפות שמרה על האמינות.

טבלת בחירת מקור

מטרה

מקור ראשוני מתאים

תשומת לב

אינפלציה בטורקיה (CPI/PPI)

TURKSTAT

שנת בסיס, הבחנה ליבה/כותרת

שער חליפין, ריבית, יתרה שוטפת, רזרבות

CBRT EVDS

עדכון, הגדרת סדרה

השוואת תוצר/אינפלציה בין מדינות

IMF WEO

השלכה ≠ מימוש

פיתוח/סדרות היסטוריות ארוכות

הבנק העולמי WDI

כיסוי, שנים חסרות

אינדיקטורים מותאמים באיחוד האירופי

Eurostat

הגדרת HICP

מימון מאקרו ארה"ב/גלובלי, API

פרד

מצב התאמה עונתית

ארבע תבניות הניתנות להעתקה

1) התאמת מקור וסדרה:

אני צריך את המחוון הבא: [אינדיקטור, מדינה/מחוז, תקופה, תדירות, תיאור]. המלץ על המקור הרשמי הראשי המתאים ביותר ועל שם הסדרה המלא עבור זה. רשום את הנקודות שאני צריך לאמת לגבי היחידה, שנת הבסיס והתיאור של הסדרה. אל תיתן מספרים; רק תגיד לי איפה ואיך לקנות את זה.

2) קוד הורדה של FRED/בנק עולמי:

כתוב קוד בפייתון עם ה-API של [FRED/בנק עולמי] שמוריד את הסדרה הבאה: [קוד/שם סדרה], [טווח תאריכים]. הקוד לוקח את הנתונים לתוך pandasDataFrame, מדפיס את 5 השורות הראשונות/אחרונות ואת מספר הערכים החסרים. אל תתנו לי דוגמה/דמות מאופרת; רק תן קוד עובד.

3) רשימת אימות מטא נתונים:

אני אשתמש בסדרה הבאה: [סדרה]. צור רשימת בדיקה של מטא נתונים שאתה צריך לאמת לפני השימוש: נפח, שנת בסיס, סטטוס התאמה עונתית, הגדרה/היקף, תאריך עדכון, סטטוס עדכון. עבור כל פריט, כתוב "מה ואיפה לאשר" במשפט אחד.

4) שתי אבחנות של אי התאמה של משאבים:

קיבלתי את אותו אינדיקטור משני מקורות והמספרים שונים: מקור א': [ערך, חותם]. מקור ב': [ערך, חותם]. רשום סיבות תמימות אפשריות להבדל זה (הגדרה, בסיס, היקף, התאמה עונתית, עדכון, מטבע) וספר לי כיצד לבדוק עבור כל אחת מהן. אל תגיד "אחד טועה"; ראשית עזור לי להסביר את הפער.

הנחיה חלשה / הנחיה חזקה

הנחיה חלשה:

תן לי את נתוני הצמיחה של טורקיה עבור 10 השנים האחרונות.

ה-AI שופך תמונה מזיכרונו, אולי ישנה ומיוצרת בחלקה; אין מקור או חותם.

הנחיה עוצמתית:

אני אשתמש בצמיחת התמ"ג הריאלי השנתי של טורקיה 2014-2023. ספר לי את המקור העיקרי לכך (TURKSTAT) ואת שם הסדרה המלא; ספר לי אם הסדרה היא במחיר קבוע ואיפה לחפש כדי לאמת את שנת הבסיס. תן גם את השלבים/קודים להורדת נתונים אלה. אל תייצר את המספרים בעצמם.

טעויות נפוצות

  • טעות בטבלת "פלט מדגם" של בינה מלאכותית לנתונים אמיתיים. המספרים הללו עשויים להיות מפוברקים; פשוט השתמש בקוד/הנחיה.
  • השוואה בין שתי סדרות ללא יישור מטא נתונים. הבדל בבסיס/יחידה/הגדרה מייצר תוצאות מזויפות.
  • טעות בהקרנה למציאות. הנתון של השנה הבאה ב-IMF WEO הוא אומדן.
  • התעלמות מהתיקון. לא מציין באיזו גרסה אתה משתמש.
  • אי התאמה של תדר. שילוב של סדרה חודשית עם סדרה רבעונית ללא תיקון.
  • לא מצטט את המקור בהערות שוליים. דמות שאינה ניתנת למעקב היא דמות שאינה ברת קיימא.

לסיכום

כוח הניתוח הוא כוח הנתונים. השתמש ב-AI כדי למצוא את המקור הנכון, להתאים את הסדרה ולכתוב קוד הורדה; אבל תמיד קבל את הנתון מהמקור הרשמי העיקרי (TURKSTAT, EVDS, IMF, Bank World, Eurostat, FRED). נטרל מקורות שגיאה שקטים כגון עדכון, שנת בסיס, נפח ותיאור על ידי יישור מטא נתונים. אם שני מקורות מתנגשים, השווה תחילה את הייחוס.

משימת יישום

בחר אינדיקטור שאתה משתמש בו לעתים קרובות בעסק שלך. בקש מה-AI לחלץ את רשימת המקורות והמטא נתונים עם תבניות 1 ו-3 לעיל. לאחר מכן מצא את אותו אינדיקטור משני מקורות שונים (למשל TURKSTAT והבנק העולמי) והשוו את הנתונים; אם יש הבדל, אבחן את הסיבה באמצעות תבנית 4 וציין את הממצא שלך בשלושה משפטים.

רשימת בדיקה

  • [ ] בחרתי את המקור העיקרי המתאים למטרה שלי (עשיתי את ההבחנה בין ההשוואה הרשמית/בינלאומית של טורקיה).
  • [ ] אימתתי את היחידה, שנת הבסיס, התיאור ותאריך העדכון של הסדרה מהעמוד הרשמי.
  • [ ] השתמשתי בנתונים שלקחתי מהמקור האמיתי, לא ב"נתונים לדוגמה" שניתנו על ידי בינה מלאכותית.
  • [ ] השוויתי לפחות כמה תצפיות מילה במילה עם הפרסום הרשמי.
  • [ ] בדקתי את סטטוס הגרסה/גרסה ושמתי לב לגרסה שבה השתמשתי.
  • [ ] הסברתי את שני התנגשויות המקורות על ידי יישור המטא נתונים.
  • [ ] הפכתי את המקור של כל דמות שבה השתמשתי לניתן למעקב עם הערת שוליים.