רווחים:
- יכולת להבחין בין זרימת העבודה בת שישה שלבים של מדעי הנתונים (הגדרת בעיה, איסוף, ניקוי, גילוי, מודלים, תקשורת) והסמכות לפיה פועלת בינה מלאכותית בכל שלב, בהתאם לרמת הסיכון של המשימה
- יכולת ליישם דיסציפלינה המאמתת כל פלט של בינה מלאכותית על ידי חיבורו למקור, הרצתו והשוואתו והעברתו דרך סינון מומחה.
- יכולת להפוך עקרונות שחזור ופרטיות (כתיבה לקוד, אנונימיזציה) להרגלי ניתוח מהיום הראשון
נתונים גולמיים, מבולגנים ולעתים קרובות "שקרים" נוחתים על שולחנו של מדען נתונים מדי יום. בטבלת המכירות, עמודת התאריך כתובה בשלושה פורמטים שונים; מספרי לקוחות ריקים בשורות מסוימות; שם העמודה הוא "הכנסה", אך היא מכילה ערכי TL ו-USD. תפקידו של מדע הנתונים הוא לקבל החלטה מהימנה מתוך הכאוס הזה: לאסוף את הנתונים, לנקות אותם, לחקור אותם, לבנות מודל, לאמת את התוצאה ולהפוך אותם לסיפור. בינה מלאכותית (AI, או בקיצור AI - מערכות מחשב שיכולות ליצור טקסט וקוד, לזהות דפוסים, לסכם ולבצע תחזיות) יכולות לגעת בכל חוליה בשרשרת הזו: כתיבת קוד ניקוי תוך דקות, המלצה על גרפים לניתוח חקרני, פירוש מדד של מודל, תיקון שאילתת SQL. אבל אותו בינה מלאכותית יכולה גם לתת לך המצאה בטוחה כמו "מתאם 0.72" עבור נתונים שהוא מעולם לא ראה.
יחידה ראשונה זו אינה מבוא לספריה. מטרתו היא להבהיר היכן לשים AI בזרימת העבודה של מדעי הנתונים ואיפה לעולם לא לשים אותו. בואו נפתור את העיקרון הבסיסי מההתחלה: AI הוא עוזר, לא מדען נתונים. ההחלטה על אילו נתונים לאסוף, על איזה מדד להחליט, האם להכניס דגם לייצור והיכן לשרטט גבולות אתיים נתונה בידי המומחה המוסמך. פלט AI לא מאומת הוא מסוכן, וכך גם דוח ניתוח לא חתום.
זרימת עבודה במדעי הנתונים: מפה מקצה לקצה
כדי להבין פרויקט נתונים, כדאי לחלק אותו לשישה שלבים. כל המודול הזה עוקב אחר המפה הזו.
1. הגדרת הבעיה: מה אנחנו מודדים, למה, כדי לתמוך באיזו החלטה? שלב זה אינו מואצל ל-AI; האדם הוא זה שמגדיר את התפקיד.
2. איסוף נתונים: זיהוי מקורות, הוצאת נתונים, דגימה. (יחידה 2)
3. ניקוי נתונים ועיבוד מקדים: ערך חסר, חריג, המרת סוג. (יחידה 3)
4. ניתוח נתונים חקרניים (EDA - Exploratory Data Analysis, שלב הזיהוי של התפלגות ויחסי הנתונים "לפי העין"): (יחידה 4)
5. הנדסת תכונות ומידול: יצירת משתנים, בחירת אלגוריתמים, הדרכה, הערכה. (יחידה 5, 6, 7)
6. תקשורת והפקה: ויזואליזציה, סיפור, MLOps (משמעת לקיחת המודל בשידור חי ומעקב אחריו). (יחידה 8, 11)
בינה מלאכותית פועלת עם סמכות שונה בכל אחד מששת השלבים הללו. הטבלה שלהלן מסכמת חלוקת סמכויות זו; זוהי הטבלה החשובה ביותר של המודול.
במה
תפקיד של AI
רמת סיכון
מי מאשר
הגדרת בעיה
שותף לסיעור מוחות
נמוך
מדען נתונים + בעל עניין
כתוב קוד ניקוי
מחולל סקיצות קוד
בינוני
מדען נתונים (קורא קוד)
הערת EDA
מציע דפוס
בינוני
מדען נתונים
יצירת תכונות
מחולל רעיון וקוד
בינוני-גבוה
בקרת דליפות היא חובה
בחירת דגם/מדד
יועץ
גבוה
מדען נתונים
החלטה להוציא לייצור
קלט עזר
גבוה מאוד
צוות + בעל עסק
אישור אתיקה/פרטיות
ממריץ
גבוה מאוד
אנושי, תמיד
זכור את המשפט האחד מהתרשים הזה: ככל שההימור עולה, תפקידו של הבינה המלאכותית מצטמצם והאישור האנושי גדל.
למה אימות הוא הלב של העסק הזה
מודלים של שפות בינה מלאכותית נראים בטוחים, אבל אולי הם לא בטוחים. בשפה הטכנית קוראים לזה הזיה: זוהי המצאה של המודל של מידע לא קיים במשפט שוטף כאילו הוא נכון. במדעי הנתונים, זה מגיע בשלוש צורות. הראשון הוא מספר מזויף: אם תשאלו את הדגם "מהו כמות ההזמנה הממוצעת" מבלי לתת שום נתונים, הוא יגיד לכם מספר בביטחון, למרות שהוא מעולם לא ראה את הנתונים שלכם. השנייה היא פונקציה שאינה קיימת: המודל עשוי להציע פונקציה שאינה קיימת כלל, כגון pandas.read_excel_fast(). שלישית, פרשנות סטטיסטית שגויה: המודל יכול לחזור בצורה חלקה על שגיאה סטטיסטית קלאסית כגון "ערך p הוא 0.04, כך שההשערה נכונה ב-96%.
דיסציפלינת האימות מורכבת משלושה שלבים:
- קישור למקור: כל מספר, קצב ומגמה צריכים להגיע מהנתונים שלך, לא מהזיכרון של ה-AI. השתמש ב-AI עבור קוד שפועל על נתונים, לא כדי שהוא יזכור נתונים.
- הרץ והשווה: הפעל כל פיסת קוד שניתן על ידי ה-AI בעצמך; השווה כל מדד שהוא מייצר לקו בסיס עצמאי.
- מסנן מומחים: בדוק בעצמך האם הפלט סותר סטטיסטיקה וידע בתחום.
זהירות: הכנסת ניתוח שנכתב על ידי ה-AI למצגת מבלי להפעיל ולקרוא אותה זה כמו הצגת דוח לא חתום. זה שהקוד עובד לא אומר שהוא נכון; קוד שמסכם את העמודה הלא נכונה עובד גם ללא שגיאות.
יכולת שחזור: יכולת להפיק את אותה תוצאה פעמיים
העיקרון השקט אך הקריטי של מדעי הנתונים הוא יכולת השחזור: כאשר אתה מריץ ניתוח שוב שישה חודשים לאחר מכן או במחשב אחר, אתה מקבל את אותה תוצאה. הסיכון הזה גדל בעת עבודה עם AI, מכיוון שכשאתה אומר ל-AI "ליצור את הגרף הזה" ולשחק בו ידנית, השלבים נעלמים. כלל: כל שלב חייב להיות רשום בקוד ובבקרת גרסאות (כמו Git); בשלבים הכוללים אקראיות, יש לתקן את הזרע האקראי (הערך ההתחלתי של מחולל המספרים האקראיים; אם הוא קבוע, התוצאה תהיה ניתנת לחזרה). נעמיק בנושא זה ביחידה 10; לעת עתה, הכנס להרגל הזה: "אל תלחץ ביד, תכתוב בקוד".
שלושה מיני תיקים
מקרה 1 - האצה בטוחה. אנליסט מסחר אלקטרוני היה בדרך כלל מבלה חצי יום בניקוי טבלת הזמנות של 240 אלף שורות. הוא נתן את שמות העמודות ואת 5 השורות הראשונות (ללא נתונים אישיים) ל-AI וביקש את קוד הניקוי של הפנדות. בינה מלאכותית הפיקה טיוטה תוך 8 שניות; האנליסט קרא את הקוד שורה אחר שורה, תיקן שגיאה בניתוח התאריך והריץ אותו. משך: 35 דקות במקום 4 שעות. AI סיפק קוד, האימות נשאר אצל האדם.
מקרה 2 - המלכודת המטרית המורכבת. מתמחה שאל את הבינה המלאכותית, "עד כמה מדויק יער אקראי בנתונים האלה?" בלי להכשיר את הדוגמנית בכלל. "בערך 89%", אמר AI. המתמחה הכניס את זה למצגת; כאשר המודל האמיתי הוכשר, הדיוק היה 71%. טעות: המתנה למדדים מבלי לתת נתונים ומודלים לבינה מלאכותית.
מקרה 3 - דליפה שקטה. צוות אחד יישם את הרעיון המוצע על ידי AI של "הוסף את הממוצע של משתנה היעד כתכונה" מבלי לפקפק בו. הדגם ביצע 98% בסט הבדיקה אך קרס בייצור מכיוון שהתכונה הדלפה מידע עתידי (דליפת נתונים, יחידה 10). טעות: לא מסנן סטטיסטית את המלצת AI.
הנחיה חלשה / הנחיה חזקה
הנחיה חלשה:
נתח את נתוני המכירות האלה וספר לי את ההכנסה הממוצעת.
טענה זו פגומה: ה-AI לא קיבל נתונים, כך שניתן רק להמציא את "ההכנסה הממוצעת". לא העמודות, לא התקופה ולא המטבע ברורים.
הנחיה עוצמתית:
תפקידך: עוזר עוזר למדען נתונים. יש לי פנדה DataFrame: df. עמודות:- order_date (טקסט, בפורמט "2024-03-01")- amount_tl (עשרוני, NaN בשורות מסוימות)- customer_id (מספר שלם) משימה: (1) לכתוב קוד pandas שמחשב את הכמות הממוצעת,(2) להסביר כיצד הוא מטפל בערכי NaN,(3) לרשום את ההנחות שהקוד מניח. אל תמציא את תוכן הנתונים; פשוט צור קוד ואני ארוץ ואאמת את התוצאה.
בבקשה זו ברורים התכנית, הציפייה ו"איסור המצאה". אתה עדיין רץ ומאמת את הפלט בעצמך.
ההתחלה של אתיקה ופרטיות
מדע הנתונים עובד לרוב עם נתונים אישיים: רישומי לקוחות, מטופלים, עובדים. KVKK (חוק הגנת נתונים אישיים) בטורקיה ו-GDPR באירופה מגנים על נתונים אלה. הדבקת שמך האמיתי, תעודת הזהות, האימייל או הכתובת שלך בכלי AI ציבורי היא הפרה. כלל: אנונימיז את הנתונים לפני השיתוף, ספק רק סכימה (שמות עמודות, סוגים) ושורה לדוגמה דמה במידת הצורך. נעמיק את נושא האתיקה ביחידה 11; בואו נשים את העיקרון מההתחלה: כדי להבין את הנתונים, שיתוף המבנה שלו, לא התוכן שלו, מספיק לעתים קרובות.
טעויות נפוצות
- מחכה למספרים/מדדים מבלי לתת נתונים ל-AI. המודל לא יכול לגשת לנתונים; המספר שהוא נותן מזויף. תמיד יש לחשב את התוצאה ולהפעיל.
- חושב שהקוד הפועל נכון. הקוד שמתמרן את העמודה הלא נכונה פועל גם ללא שגיאות; אל תאמין בלי לקרוא את ההיגיון.
- הדבקת נתונים אישיים אמיתיים לתוך הכלי הפתוח. שם, מספר תעודת זהות, דואר אלקטרוני לעולם אינם משותפים; הדיאגרמה מספיקה.
- עושים את השלבים באופן ידני ולא כותבים אותם לקוד. ניתוח שאינו ניתן לשחזור אינו אמין.
- קבלת הפרשנות של AI לסטטיסטיקה ללא עוררין. AI יכול לחזור על טעויות קלאסיות במושגים כמו p-value ומתאם.
טיפ: כלול "שורת כללים" קצרה בכל מפגשי AI שלך: "אל תמציא את תוכן הנתונים; פשוט צור קוד/ניתוח ואני ארוץ ואאמת את התוצאה; ציין 'לא בטוח' איפה אתה לא בטוח." המשפט הבודד הזה מפחית משמעותית את הסיכון להזיות.
לסיכום
AI הוא עוזר רב עוצמה במדעי הנתונים: הוא מאיץ קוד ניקוי, פרשנות EDA, המלצת מודלים והדמיה. אבל הגדרת הבעיה, הבחירה המטרית, החלטת הייצור והגבולות האתיים שייכים לבני אדם. לזרימת העבודה יש שישה שלבים, והתפקיד של ה-AI הופך קטן יותר ככל שהסיכון עולה. שלושה הרגלים הם הבסיס לכל דבר: קישור מקור (אימות), שחזור (קידוד) ואנונימיזציה (סודיות). ברגע שאתה מפנים את שלושת אלה, כל כלי בשאר המודול הופך למאיץ בטוח עבורך.
משימת יישום
פשוט צור סכימה של טבלה קטנה שיש לך (או אחת היפותטית): שמות עמודות, סוגים ו-2-3 שורות דמה לדוגמה (ללא נתונים אישיים אמיתיים). בקש מה-AI קוד סיכום נתונים סטטיסטי באמצעות תבנית "הנחיה עוצמתית" למעלה. הפעל את הקוד, השווה את הפלט לערך ידני, בדוק אם יש הנחות מזויפות, וציין את הממצאים שלך ב-5 נקודות תבליטים.
רשימת בדיקה
- [ ] האם פשוט נתתי ל-AI סכימה ומדגם מזויף במקום נתונים אישיים אמיתיים?
- [ ] האם קראתי והרצתי את הקוד שהוא הפיק שורה אחר שורה?
- [ ] האם אימתתי באופן עצמאי כל מספר בפלט?
- [ ] האם כתבתי כל שלב בניתוח לתוך הקוד והפכתי אותו לחזרה?
- [ ] האם קבעתי את רמת הסיכון של המשימה והקציתי את ההחלטה הסופית לאדם?