רווחים:
- יכולת לנקות נתונים כלכליים גולמיים (תצפיות חסרות, בלבול יחידות, אי התאמה בתדירות) והכנתם לניתוח בעזרת בינה מלאכותית
- יכולת להדפיס טרנספורמציות כלכליות סטנדרטיות כמו המרה ריאלית נומינלית, הצמדה לאינדקס, קצב צמיחה, התאמה עונתית כקוד לבינה מלאכותית ולאמת אותן באופן ידני
- יכולת לזהות נתונים באמצעות ניתוח נתונים חקרני (סטטיסטיקות סיכום, הפצה, חריגים, מתאם) וקריאה ביקורתית של סיכומי בינה מלאכותית
נתונים כלכליים כמעט ולא מגיעים מוכנים לניתוח. בטבלה שהורדת מ-TURKSTAT חסרים כמה חודשים, עמודה אחת מגיעה כטקסט עם אלף סוגריים, שער החליפין הוא בפורמט טורקי כמו "1.234,56", סדרה אחת היא חודשית והשנייה היא רבעונית. רוב זמנו של הכלכלן מושקע לא בניתוח, אלא בהכנת הנתונים לניתוח. זה המקום שבו בינה מלאכותית היא מאיץ אמיתי עם סיכון נמוך: היא מציעה שלבי ניקוי, כותבת פנדות (ספריית עיבוד הנתונים של פייתון), מקודדת טרנספורמציות כלכליות סטנדרטיות. אבל ליחידה הזו יש גם כלל בלתי משתנה: אתה קורא כל טרנספורמציה שנכתבה על ידי בינה מלאכותית ומאמת אותה ידנית בתצפית אחת לפחות. אם המחזור האמיתי-נומינלי נמצא על בסיס שגוי, כל הניתוח מתפורר בשקט.
ניקיון: אילו בעיות, איך לפתור אותן?
הבעיות הנפוצות ביותר בנתונים כלכליים וההיגיון שלהן:
- תצפית לא מלאה. חודש/רבעון ריק. הפתרון תלוי בהקשר: אם הוא לא קיים בפועל, הוא נותר ריק; אם יש פער טכני, נעשה אינטרפולציה זהירה - אבל הגבול בין ייצור הוא דק.
- בלבול בין יחידות ופורמטים. יש להמיר את הטקסט "12.345.6" למספר; מיליון/מיליארד צריכים להיות עקביים.
- אי התאמה של תדר. כדי לשלב סדרה חודשית ורבעונית, אחת מצטברת (חודשי עד רבעוני) - אם היא ממוצעת, כוללת או סוף תקופה תלויה באופי המדד (הבחנה בין מלאי/זרימה).
- ערכים חריגים (קיצוניים). אם תצפית סוטה בפראות: האם מדובר באירוע אמיתי (משבר, עליית מחירים), או שגיאת נתונים? זה מובן לפני המחיקה.
- יישור תאריכים. פורמטים של תאריכים והגדרות תקופה של סדרות שונות מסונכרנים.
שימו לב: מילוי הנתונים החסרים נראה תמים, אבל זו החלטה כלכלית. מילוי חודש משבר ב"ממוצע החודשים השכנים" פירושו מחיקת המשבר הזה מהניתוח. לפני מילוי, שאל "מדוע הפער הזה קיים?" ענה על השאלה.
תמורות כלכליות סטנדרטיות
תמורות והגדרותיהן ברפרטואר היומיומי של כלכלן:
- נומינלי → אמיתי. התאמה להשפעת המחיר: ערך ריאלי = ערך נומינלי / מדד מחירים × 100. שנת הבסיס של הדפלטור (מדד ההתאמה) קובעת את בסיס התוצאה.
- יצירת אינדקס. שינוי קנה מידה של סדרה כך שתקופה נבחרת = 100; זה שימושי להשוואת סדרות בגדלים שונים.
- קצב צמיחה. שנתי: (אותה תקופה זו / שנה שעברה - 1) × 100. שיעור תקופתי ושנתי הם דברים שונים; לבלבל היא טעות נפוצה.
- תיקון עונתי. טיהור השפעות עונתיות קבועות (תיירות קיץ, חגים); הסדרות הגולמיות והסדרות המותאמת לעונתיות מספרות סיפורים שונים.
- ממוצע נע. להחליק את הרעש ולהפיכת המגמה לגלויה.
- לוגריתמים והבדלים. לבחון דינמיקת צמיחה ונייצוניות (יעמיק ביחידת סדרת הזמן).
טיפ: בכל הסבה תישאל "מה קרה ליחידה ולבסיס?" לִשְׁאוֹל. הבסיס של הסדרה האמיתית הוא הבסיס של הדפלטור; הבסיס של הסדרה הצמודה היא התקופה שתבחר. שמירה על כתובה זו מונעת טעויות עתידיות.
ניתוח נתונים חקרניים (EDA)
יש צורך לזהות את הנתונים לפני הכנסתם למודל. ניתוח נתונים חקרניים (EDA) כולל: סטטיסטיקות סיכום (ממוצע, חציון, סטיית תקן, min-max), צורת ההתפלגות, מהלך לאורך זמן, חריגים ומתאם בין סדרות. AI מייצר במהירות את הקוד עבור שלבים אלה; התפקיד שלך הוא לקרוא את הפלט בעין כלכלית: "האם הממוצע הזה סביר? האם המתאם הזה הוא צירוף מקרים או קשר ידוע?"
זהירות: מתאם הוא רק אמצעי זיהוי כאן, לא הוכחה לקשר סיבתי. העובדה ששתי סדרות נעות יחד (למשל, מכירת גלידה וטביעות - שניהם מופעלים בקיץ) לא בהכרח מעידה על כך שאחת מובילה לשני. נעמיק את ההבחנה הזו ביחידה 7.
שלושה מיני תיקים
מקרה 1 - בסיס דפלטור שגוי. לאנליסט היה הבינה המלאכותית לכתוב קוד כדי לממש את סדרת השכר. הקוד עבד, התוצאה נראתה סבירה - אבל האנליסט חישב ידנית את 2020 בשלב CALCULATE וזה לא עבד. בעיה: הבינה המלאכותית השתמשה בדפלטור עם בסיס של 2003=100 וביקשה את סדרת השכר עם מחירי 2015; הבסיסים היו סותרים. הקוד תוקן עם תיקון שורה אחת, כל הסדרה נפלה למקומה.
מקרה 2 - שגיאת עוצמת קול שקטה. מוסד צמצם את נתוני היצוא באלפי דולרים ואת היבוא במיליוני דולרים. כשהבינה המלאכותית הסירה את השניים ל"מאזן סחר החוץ", התוצאה הייתה גירעון אבסורדי. תצוגת המינימום-מקס ב-EDA חשפה את השגיאה: סדר הגודל של שתי הסדרות היה שונה בפקטור של 1000. ברגע שהיחידה הושווה האיזון היה נכון.
מקרה 3 - אי מחיקת החריג. חודש אחד בסדרה היה נמוך במיוחד. AI הציע "חריג, בוא ננקה את זה". האנליסט חקר: הייצור למעשה הופסק עקב אסון טבע באותו חודש. הערך היה אמיתי; מחיקתו תעוות את ההיסטוריה. במקום מחיקה, הוזכרה הערת שוליים. ההמלצה ה"ברורה" של ה-AI לא בוצעה באופן עיוור.
טבלת אימות ההמרות
המרה
מהות נוסחה
מחסום ידני
מימוש
מדד נומינלי / מחיר × 100
בסיס דפלטור = בסיס תוצאה?
צמיחה שנתית
(t / t-12 חודש − 1)×100
חשב תקופה על הנייר
אינדקס
סדרה/תקופת בסיס × 100
האם ערך תקופת הבסיס הוא 100?
חודשי → רבעוני
זרימה: איסוף / מלאי: סוף תקופה
שיטת איסוף נכונה?
ממוצע נע
ממוצע n התקופה האחרונה
האם אורך החלון נכון?
ארבע תבניות הניתנות להעתקה
1) תוכנית ניקיון:
יש לי את הנתונים הגולמיים הבאים: [עמודות ושורות לדוגמה]. בוא עם תוכנית ניקיון כדי להתכונן לניתוח: ערך חסר, בעיה ביחידה/פורמט, יישור תאריכים, יישור תדרים, חריגים אפשריים. הסבירו במשפט אחד מדוע כל שלב נחוץ. אל תכתוב קוד עדיין; תן לי לאשר את התוכנית קודם.
2) קוד ניקוי פנדות:
כתוב קוד פנדות לפי התוכנית שאישרתי. תן לקוד לציין מה הוא עושה בכל שלב עם שורת הערה; הוא מדפיס את מספר השורות והערכים החסרים לאחר ההמרה. אל תמחק בשקט כל תצפית; דווח על כל שורה שאתה מוחק.
3) מימוש (ניתן לאימות):
מימש את הסדרה הנומינלית הזו עם [מדד מחירים]. כתוב בבירור את שנת הבסיס של הדפלטור כאשר אתה משתמש בו; ציין מהו הבסיס של הסדרה המתקבלת. הראה לי את החשבון שלב אחר שלב לתקופה בודדת כדי שאוכל לאמת אותו באופן ידני.
4) סיכום ניתוח חקרני:
כתוב קוד ניתוח חקרני עבור הנתונים הנוקים הבאים: סטטיסטיקות סיכום, עלילת סדרות זמן, סריקת חריגים ומטריצת מתאם. בפירוש התוצאות, הבהירו שהמתאמים שאתם מוצאים אינם סיבתיים ורשמו 3 נקודות בולטות בעיני.
הנחיה חלשה / הנחיה חזקה
הנחיה חלשה:
נקה את הנתונים האלה.
בינה מלאכותית פועלת עם הנחות בלי לדעת מה לנקות; אתה יכול למחוק תצפיות, לשנות יחידות, לא תשים לב.
הנחיה עוצמתית:
בנתוני סחר חוץ חודשיים אלה, היצוא הוא ב-"אלף דולר" והיבוא הוא ב-"מיליון דולר". הפוך את השניים לשווים ב"מיליון דולר", סמן את החודשים החסרים אך אל תמלא, יישר את התאריכים לסוף החודש. הדפס כמה שורות מושפעות בכל שלב; אין למחוק שורות בשקט. לאחר מכן הראה את היתרה לחודש בודד באופן שאוכל לבדוק ידנית.
טעויות נפוצות
- הפעלת קוד ההמרה מבלי לקרוא אותו. הבסיס/היחידה הלא נכונה משחיתים בשקט את כל הניתוח.
- מילוי נתונים חסרים מבלי לחשוב. מחיקת תקופת המשבר/אסון עם הממוצע.
- בטל אוטומטית חריגים. טעות באירוע אמיתי בשגיאת נתונים.
- צמיחה עונתית ושנתית מבלבלת. השניים בגדלים שונים.
- שילוב תדרים לא נכון. איסוף סדרת המניות ועיבודה כזרימה.
- טעות בקורלציה ב-EDA לסיבתיות. טעות בכלי ההכרה כראיה.
לסיכום
ניקוי נתונים וטרנספורמציה הם 80 האחוזים הבלתי נראים אך המכריעים של הניתוח הכלכלי. בינה מלאכותית מזרזת באופן דרמטי את העבודה המכנית הזו; אבל זה תלוי בך לקרוא כל שלב ניקוי וכל טרנספורמציה ולאמת ידנית לפחות תצפית אחת. החלטות בסיס, יחידה, תדירות והחלטות חריגות הן החלטות כלכליות ואי אפשר להשאיר אותן באופן עיוור לבינה מלאכותית. ניתוח חקרני מציג נתונים, אך מתאם אין סיבתיות.
משימת יישום
הורד סדרה גולמית בפועל (למשל מדד המחירים לצרכן חודשי וסדרת שכר/הכנסה נומינלית). צור תוכנית ניקיון עם התבנית הראשונה, צור את הקוד עם התבנית השנייה ותממש את הסדרה עם התבנית השלישית. לאחר מכן חשב את הערך האמיתי של תקופה בודדת על הנייר והשווה אותו עם הפלט של בינה מלאכותית. אם אתה מוצא חוסר התאמה, אבחן ותקן את המקור שלו (בסיס/יחידה) וציין את ההתקדמות.
רשימת בדיקה
- [ ] בדקתי ואישרתי את תוכנית הניקוי לפני כתיבת הקוד.
- [ ] דיווחתי על כל שורה שנמחקה/שונתה על ידי הבינה המלאכותית; אין מחיקה שקטה.
- [ ] בעת מילוי נתונים חסרים אתה עשוי לשאול "למה הוא ריק?" עניתי על השאלה.
- [ ] בדקתי אם החריג הוא אירוע אמיתי או שגיאת נתונים.
- [ ] במימוש, וידאתי שבסיס הדפלטור ובסיס התוצאה תואמים.
- [ ] חישבתי מחדש באופן ידני את ההמרה של תקופה אחת לפחות.
- [ ] לא הצגתי קורלציות ב-EDA כסיבתיות.