רווחים:
- להיות מסוגל לזהות מדוע בינה מלאכותית עושה טעויות במתמטיקה (בהיותה מודל שפה, לא בודק לוגיקה) ואת שבעת סוגי השגיאות העיקריים
- יכולת להסביר מדוע הכרחי לאמת כל שלב על ידי הבנה שהטעות מופצת והדיוק הוא בינארי במתמטיקה.
- יכולת ליישם דיסציפלינת אימות רב-שכבתית באמצעות בדיקות שכל ישר, בדיקת סדר גודל, סיכומי בדיקה, הצלבה ושיטות עצמאיות
יחידה זו מעמיקה את הרעיון שבלב המודול: מדוע וכיצד עושה בינה מלאכותית טעויות במתמטיקה, מהם סוגי הטעויות הללו וכיצד אנו תופסים אותן באופן שיטתי? ביחידות קודמות ראינו שיטות אימות לכל נושא; כאן אנו אוספים את האנטומיה של השגיאות תחת קורת גג אחת. הנקודה היא שכאשר אתה מסתכל על פלט AI אתה תוהה "מה יכולה להיות טעות כאן?" זה להשיג מנטליות אימות שחשבת ברפלקסיביות.
תזכורת: הזיה היא כאשר בינה מלאכותית מייצרת בביטחון מידע שאינו נכון בפועל. במתמטיקה, הזיה מופיעה לעתים קרובות בצורה של "משכנע אך שקרי". מדוע AI עושה טעויות? מכיוון שהוא מודל שפה, לא מנוע לוגי - כלומר, הוא מייצר טקסט עם דפוסים סטטיסטיים, הוא לא בודק את התוקף הלוגי של השלבים. "כפל 3 ספרות" ו"הוכחה תקפה" הם עבורו המשימה של הפקת אותו סוג של טקסט; אין לו מנגנון פנימי כדי להבטיח דיוק.
אנטומיה של טעויות מתמטיות: שבעה סוגים
רשימת הסוגים הבאה מסכמת את השגיאות הנפוצות ביותר שתתקל בהן בפלט AI ואת התרופה לכל אחת מהן.
סוג שגיאה
איך זה נראה
תרופה נגד
טעות אריתמטית
שגיאת מספר כמו 7×8=54
מחשבון/SymPy
שגיאת סימן
−(a−b)=−a−b
פתח את השם שלי באופן ידני
משפט מורכב
שם משפט לא קיים
אישור מהמקור
יישום שגוי של כלל
אל תשכח את כלל השרשרת
"איזה כלל?" שאלה
סטטוס דילוג
התעלם מהשורש השלילי
רשום את כל הסטטוסים
פער ההוכחה
"לכן" ללא הצדקה
מטיל ספק בכל מעבר
נתונים ישנים/שגויים
מידע מיושן
המקור
מדוע מתמטיקה דורשת תשומת לב מיוחדת?
ברוב התחומים, לטעות קטנה יש תוצאה קטנה. במתמטיקה השגיאות מתפשטות וגדלות. שגיאת סימן בשורה הראשונה של משוואה הופכת את עשרת השורות הבאות והתוצאה הסופית לשגויה לחלוטין. פער באמצע הוכחה הופך את ההוכחה כולה לפסולה. "שבריריות" זו מחייבת לאמת כל שלב במתמטיקה - "באופן כללי נראה נכון" זה לא מספיק.
יתרה מכך, האמת במתמטיקה היא בינארית: תוצאה היא או נכונה או שקרית, אין ביניהן. "שמונים אחוז מדויק" עשוי להיחשב מקובל בסיכום טקסט; אין דבר כזה "נכון של שמונים אחוז" באינטגרל - או שזו התוצאה הנכונה או שלא. הטבע הכפול הזה הופך את האימות גם לקריטי יותר וגם (למרבה המזל) אפשרי יותר: התוצאה עוברת אימות או שלא.
צעד אחר צעד: דיסציפלינה של אימות שיטתי
1. אשר כל תוצאה מספרית עם כלי. לעולם אל תעזוב את החשבון כדי להסתמך על AI; SymPy, מחשבון או ביד.
2. בדוק כל תוצאה סמלית עם SymPy. אינטגרל, נגזרת, פשט, משוואה - ניתן לאמת את כולם עם SymPy.
3. אשר כל משפט/נוסחה מהמקור. האם השם והביטוי נכונים? משפטים מומצאים הם המלכודת הערמומית ביותר.
4. הטילו ספק בכל התרחשות בכל הוכחה. "האם זה באמת נובע מהשלב הקודם?" מקרה בסיס, הנחה מרומזת, בדיקת פערים.
5. בדוק ובדיקה נגדית. פעולה הפוכה, החלפה, מצבי גבול, ניתוח ממדים.
6. העמידו אותו למבחן השכל הישר. האם התוצאה סבירה? אם ההסתברות גדולה מ-1, יש שגיאה אם האורך שלילי.
רמז: מבחן השכל הישר המהיר ביותר הוא בדיקת "סדר גודל". האם התוצאה בערך בטווח הצפוי? אם ממוצע הכיתה הוא 250 (מתוך 100), או שההסתברות היא 3.5, תדע שיש שגיאה מבלי להסתכל על הפרטים. בדיקה זו של 5 שניות מבטלת תוצאות מגוחכות רבות בפתח.
שלושה מיני תיקים
מקרה 1 - טעות בסימן שרשרת. תלמיד אחד מצא שבפישוט אלגברי בן 8 שורות, שגיאת סימן שה-AI עשה בשורה 2 התפשטה ל-6 השורות הבאות. התוצאה הסופית הייתה שגויה לחלוטין, אבל ה-AI הציג אותה בביטחון מלא. כאשר התלמיד פישט את זה מאפס עם SymPy, התוצאה הנכונה התקבלה ואפשרה ל-AI למצוא את השגיאה בשורה השנייה. שלט בודד הפריך 6 קווים.
מקרה 2 - השכל הישר הציל את המבחן. למורה היה AI לפתור בעיית הסתברות; התוצאה הייתה 1.4. מבלי להסתכל על הפרטים, המורה אמר "ההסתברות לא יכולה להיות גדולה מ-1" וחיפשה את השגיאה: ה-AI אסף אירועים לא בדידים כאילו הם בדידים. מבחן השכל הישר הצביע על השגיאה תוך שניות.
מקרה 3 - נוסחה מורכבת. מהנדס ביקש מה-AI "נוסחה סגורה" עבור סכום סדרה. AI נתן נוסחה משכנעת. המהנדס בדק את הנוסחה עבור ערך קטן של n (n=3) הן בנוסחה והן בתוספת ידנית; התוצאות לא התאימו. הנוסחה הומצאה. כוונון קטן מנע שעות של שימוש לרעה.
ארבע תבניות הניתנות להעתקה
1) בקשת אימות רב-שכבתית:
מצאת: [תוצאה]. כעת אמת את זה בשלוש דרכים שונות: (1) גיבוב הפוך, (2) בדיקת ערך מותאם אישית פשוט, (3) קצת קוד לבדוק עם SymPy (אני אראה את הפלט). אמור לי אם כל שלוש הדרכים עקביות; אם לא, הראה באיזה שלב יש שגיאה.
2) מבחן השכל הישר/דרגה:
מצאת: [תוצאה]. שים את זה למבחן השכל הישר כדי לראות אם התוצאה הזו סבירה: מהו סדר הגודל הצפוי, האם הסימן נכון, האם הוא בגבולות (למשל הסתברות 0-1)? אם זה לא סביר, בדוק היכן עשויה להיות טעות.
3) אישור משפט/נוסחה:
האם [המשפט/נוסחה] שאתה משתמש בו באמת סטנדרטי ונכון? כתוב את הביטוי והתנאים הסטנדרטיים שלו. הצג חשבון שבודק זאת עם מדגם קטן (למשל n=3). אם זו פורמולה מורכבת או משהו שאתה לא בטוח לגביו, אמור את זה בצורה ברורה.
4) אבחון מצב שגיאה:
אני יודע שיש באג בפתרון למטה. בדוק את סוגי השגיאות האלה בזה אחר זה: חשבון, סימן, כלל שגוי, מצב שדילג, תחום. ספר לי באיזה סוג שגיאה מדובר ובאיזה שלב. פתרון: [כאן]
הנחיה חלשה / הנחיה חזקה
חלש: "האם המסקנה הזו נכונה?" [הדבק את התוצאה]
תוצאה: AI אומר לעתים קרובות "כן נכון" (נטייה לאשר את הפלט של עצמו); לא אמין כי אין ביקורת עצמאית.
חזק: "בדוק את התוצאה הזו בצורה עצמאית: השתמש בפתרון אחר או בדוק עם קוד SymPy (אני אפעיל את הקוד). אל תגיד רק 'true/false'; הראה איזו בדיקה ביצעת ואת התוצאה. אם סכום הבדיקה נכשל, מצא את השגיאה."
תוצאה: שיטת בקרה עצמאית מאותגרת; ה-AI נמנע מלאשר באופן עיוור את הפלט שלו.
טעויות נפוצות
- לגרום ל-AI לאמת את הפלט שלו. "האם זה נכון?" בינה מלאכותית מאשרת לעתים קרובות את הטעות שלה; נדרשת שיטה עצמאית.
- דילוג על מבחן השכל הישר. שטויות כמו הסתברות גדולה מ-1 ואורך שלילי אפשר לתפוס בלי להסתכל על הפרטים.
- מסתמכים על אימות יחיד. השתמש במספר נתיבים עצמאיים (hashs + SymPy + ערך מותאם אישית) לתוצאות קריטיות.
- לא בודק נוסחאות עם דוגמאות קטנות. נוסחאות מורכבות קורסות מיד בערכים קטנים כגון n=2, n=3.
- שוכחים שהבאג מופץ. שגיאה בשורה הראשונה משחית את התוצאה כולה; אם אתה מוצא שגיאה, בדוק אותה מההתחלה.
זהירות: אין מתאם בין הביטחון של ה-AI לבין הדיוק שלו. המשפט שנראה הכי נחרץ, הכי קולח, הכי "בטוח" יכול מאוד להיות שגוי לחלוטין. אמון באימות עצמאי, לא בטון. שקול תוצאה כ"אמיתית" רק כאשר אתה מאשר אותה ביד או בכלי דטרמיניסטי - לא בגלל שה-AI אומר "בטוח".
לסיכום
AI עושה טעויות במתמטיקה כי זה מודל שפה שמייצר טקסט באופן סטטיסטי, לא מנוע ששולט בלוגיקה. שגיאות מתחלקות לשבעה סוגים עיקריים: חשבון, סימן, משפט מורכב, יישום שגוי של כללים, רישיות שהושמטה, פער הוכחה, נתונים מיושנים. במתמטיקה, השגיאות מתפשטות וצומחות, האמת היא בינארית - אז יש לאמת כל שלב. דיסציפלינה שיטתית: אמת כל כלי מספרי, כל תוצאה סמלית עם SymPy, כל משפט מהמקור, כל הוכחה עוברת בחקירה; החל בדיקה, בדיקה נגדית ובדיקות השכל הישר. הביטחון העצמי של AI אינו עדות לדיוק.
משימת יישום
בחר בעיה עם פתרון באורך בינוני (לפחות 6-8 שלבים) ובקש מה-AI לפתור אותה. לאחר מכן בצע אימות רב-שכבתי באמצעות דפוסים 1 ו-4 מיחידה זו: (א) בדיקת שכל ישר/דרגה, (ב) בדיקה עם SymPy, (ג) בדיקה על ערך מיוחד. לאחר מכן עברו על הפתרון שורה אחר שורה עם עין "ציד באגים" מכוונת ובדקו אילו משבעת סוגי השגיאות עלולים להתרחש. רשום כל שגיאה שתמצא יחד עם הסוג שלה.
רשימת בדיקה
- [ ] אישרתי כל תוצאה מספרית בכלי דטרמיניסטי.
- [ ] בדקתי כל תוצאה סמלית עם SymPy.
- [ ] אימתתי את המשפט/נוסחה המשמשת מהמקור או עם דוגמה קטנה.
- [ ] יישמתי את מבחן השכל הישר/סדר גודל.
- [ ] ביקרתי אותו באופן עצמאי (מבלי להסתמך על אישור ה-AI עצמו).
- [ ] כשמצאתי שגיאה, בדקתי מחדש את הפתרון מההתחלה.