רווחים:
- יכולת לנסח מדידות קורפוס כגון תדירות מילים, שיתוף פעולה, עושר אוצר מילים ומילות מפתח עם בינה מלאכותית
- לדעת שבינה מלאכותית אינה אמינה בספירה מדויקת ויכולת לאמת כל ספירה עם כלי נפרד
- יכולת להבין שמספר אינו אומר דבר בפני עצמו ושהפרשנות הלשונית הקובעת את המשמעות שייכת לבני אדם.
לימודי ספרות ולשון אינם רק "פרשנות"; יש לו גם היבט מדיד וניתן לספירה. בכמה מילים שונות משתמש מחבר, באילו מילים הוא אוהב להשתמש עם אילו מילים, אילו מילים הופכות להיות נפוצות בתקופה - אלה נחקרות באמצעות הבלשנות (המדע החוקר את הצליל, המבנה, המשמעות והשימוש בשפה) ובעיקר בלשנות הקורפוס. קורפוס הוא אוסף של טקסטים, כגון יצירות שלמות של סופר, ארכיון שנתי של עיתון או שירי תקופה. ניתוח קורפוס מחפש דפוסים מספריים בנתח זה.
ביחידה זו, נלמד להשתמש בבינה מלאכותית כעוזר לניתוח קורפוס: חילוץ מהיר של מדדים כמו תדירות מילים (מספר הפעמים שמילה מופיעה בטקסט), קולוקציה (צמדי מילים המופיעים לעתים קרובות יחד, למשל "שחור" + "ההון שלי"), עושר אוצר מילים ושונות עונתית. אבל אזהרה מההתחלה: AI יכול לעשות טעויות כשסופרים לבד; יש צורך בכלים מיוחדים לספירות גדולות ומדויקות, ואתה הבלשן הקובע את המשמעות של כל מספר.
איפה AI חזק ואיפה הוא חלש בניתוח קורפוס?
החוזקות שלו הן: זיהוי דפוסים בטקסטים קטנים ובינוניים, הפקת השערות לגבי אוצר המילים של טקסט, הצעת מועמדים לקולוקציות, פירוש תוצאה, תיאור מתודולוגיה. בינה מלאכותית שואלת "אילו ביטויים בולטים בסופר הזה?" זה נותן התחלה מהירה לשאלה.
חולשה: ספירה מדויקת. AI הוא מודל שפה, לא מחשבון; יכול לתת תשובה משוערת ולפעמים לא נכונה לשאלה "כמה פעמים זה קרה" בטקסט ארוך. עבור תדירות מדויקת, סטטיסטיקות מיקום מדויקות או סריקת קורפוסים גדולה של אלפי מילים, נעשה שימוש בתוכנה מיוחדת (למשל כלי קורפוס כגון AntConc או גיליון אלקטרוני). AI הוא בעל ערך בפירוש התפוקה של הכלים הללו; אבל אל תגרמו לו לעשות את הספירה הגולמית בצורה עיוורת.
טיפ: אם אתה צריך מספר מדויק, השתמש בשתי דרכים: בקש מכלי לעשות את הספירה בטקסט קטן ובקש מה-AI לפרש אותו; או בקש את ספירת הבינה המלאכותית ואמת אותה בדרך אחרת. לעולם אל תשתמש במשפט "AI אמר שזה מתרחש 47 פעמים" ללא אישור.
מחקר קורפוס שלב אחר שלב
- שים שאלה. "איך מופצות מילות צבע אצל המשורר הזה?" ספירה היא חסרת משמעות ללא שאלה ברורה כמו:
- הגדר את הקורפוס. אילו טקסטים? איזו מהדורה? איזו תקופה? הגבול חייב להיות ברור.
- בחר את המדידה. תדירות, שיתוף פעולה, עושר של אוצר מילים?
- למדוד ולוודא. בצע את הספירה, ולאחר מכן אשר דרך שנייה.
- הֶעָרָה. המספר לבדו לא אומר כלום; ההערה שלך היא שהופכת את הממצא ש"מילים צבע הוכפלו בתקופה השנייה" למשמעותית.
מדד בשימוש תכוף לעושר אוצר המילים הוא היחס בין מספר המילים השונות למספר הכולל של המילים (יחס סוג/אסימון). אם היחס הזה גבוה, הטקסט הוא מגוון מילים, ואם הוא נמוך, זה אומר שהוא חוזר על עצמו. אבל היחס הזה מושפע מאורך הטקסט; היזהר בעת השוואת טקסטים קצרים וארוכים ישירות.
שלושה מיני תיקים
מקרה 1 - קולוקציה הדגים סגנון. חוקר בחן זיווג של שם תואר-שם עצם בשלושה רומנים של סופר. AI הציע שהמילה "חיוור" תואמת 5 שמות עצם שונים; החוקר אימת 4 מהטקסטים וביטל 1 כפי שהוא מפוברק. הדפוס המאושר הפך להצהרת תזה על סגנון התיאור של המחבר.
מקרה 2 - נתפסה שגיאת ספירה. תלמיד שאל בינה מלאכותית כמה פעמים הופיעה המילה "לילה" בטקסט בן 2,000 מילים; ה-AI אמר "23". כאשר התלמיד זרק את הטקסט לגיליון אלקטרוני וסיפר אותו, המספר האמיתי היה 17. התברר שהספירה הגולמית של AI אינה אמינה.
מקרה 3 - שינוי תקופתי עורר מחלוקת. קבוצה אחת השוותה את שיעור המילים המופשטות בשיריו המוקדמים והמאוחרים של משורר. הטיוטה הראשונה של AI הציעה מגמה; כשהקבוצה חזרה לטקסט ואימתה את הספירה, התברר שהמגמה היא אמיתית, אבל ה"סיבות" שהציעה ה-AI היו ספקולציות בלתי ניתנות לאימות ובוטלו.
ארבע תבניות הניתנות להעתקה
1) מתאר תדירות מילים (עם אימות):
רשום את 15 מילות התוכן הנפוצות ביותר (אל תכלול מילות פונקציה כגון מילות חיבור ומילות יחס) בטקסט למטה, עם התדרים המשוערים שלהן. אזהרה: שים לב שייתכן שהספירות לא יהיו מדויקות ושימו לב "כדי להיות מדויקים, יש לאמת אותן עם כלי ספירה נפרד". טקסט: [הדבק טקסט כאן]
2) מועמדים לקולוקיישן:
הצע צמדי מילים (קולוקציות) המופיעים לעתים קרובות יחד בטקסט למטה. תנו לפחות ציטוט אחד מהטקסט עבור כל זוג. בדיה כפולה שאין לה מקבילה בטקסט; אם אינך בטוח, סמן אותו כ"צריך אימות". טקסט: [הדבק טקסט]
3) השוואת אוצר מילים:
אני אתן לך שני טקסטים. לכל אחד מהם: סה"כ מילים משוערות, תצפיות על זני מילים שונים ותחומי מילים בולטים (למשל צבע, טבע, רגש). ציינו שהמספרים משוערים. השאר את פרשנות ההשוואה לאימות שלי. טקסט א': [...] טקסט ב': [...]
4) פרשנות התוצאה:
קיבלתי את התוצאות הבאות מכלי ספירה: [הדבק תוצאות]. צור 2-3 השערות לגבי המשמעות של המספרים הללו מבחינה לשונית. סמן כל השערה כ"דורש ראיות" ותגיד לי איך אני יכול לבדוק אותה. הימנע מהערות מוגזמות.
הנחיה חלשה / הנחיה חזקה
חלש: "איזו מילה מופיעה הכי הרבה בטקסט הזה?"
חזק: "רשום את מילות התוכן השכיחות ביותר בטקסט זה עם התדירות המשוערת שלהן; אל תכלול מילות פונקציה. הבהיר שהמספרים אינם מדויקים ויש לאמת אותם עם כלי נפרד. תן משפט לדוגמה לכל מילה".
ההנחיה העוצמתית גורמת ל-AI לקבל את מגבלת הספירה ואומרת לך מראש שנדרש אימות. בהנחיה החלשה, ה-AI נותן מספר בודד ואתה לא יודע שזה יכול להיות שגוי.
טבלת מדידות ואמינות
מדידה
מה מראה
AI לבד
דרך נכונה
תדירות מילים
מילים תכופות
בערך, מסוכן
פרשנות מונה + AI
colocation
אלה שעברו יחד
מייצר מועמדים
אישור מהטקסט
יחס סוג/אסימון
גיוון מילולי
יכול להיות מטעה
חשבון עם כלי
שינוי עונתי
מגמה לאורך זמן
מייצר השערות
למדוד ולוודא
הערה מסכמת
משמעות
חזק אבל מגזים
שיפוט אנושי
מושגי מילות מפתח ו-n-גרם
שני מושגים מקלים על העבודה שלך בניתוח קורפוס. הראשונה היא מילת המפתח (מילת מפתח באנגלית - המילה המופיעה בטקסט או במחבר בתדירות גבוהה הרבה יותר מהצפוי בהשוואה לשפה הכללית, מה שמעניק לאותו טקסט את ה"אופי"). מילות מפתח של מחבר חושפות את תחומי העניין והסגנון שלו; למשל, אם "ים" ו"הפרדה" מתרחשים בתדירות גבוהה מהצפוי אצל משורר, בליטה סטטיסטית זו הופכת לנקודת המוצא לפרשנות. כדי לזהות מילות מפתח, יש צורך להשוות את התדרים של טקסט עם התדרים של קורפוס התייחסות (גוף טקסט כללי וגדול המשמש להשוואה); ההשוואה הזו היא עבודת כלים מוחלטת, היא חישוב שבינה מלאכותית לא יכולה לבצע באופן אמין בעצמו.
השני הוא n-גרם (רצף של n מילים רצופות בטקסט; רצף של שתי מילים נקרא "ביגרם", רצף של שלוש מילים נקרא "טריגרם"). ניתוח N-גרם חושף ביטויים נוסחתיים של מחבר וביטויים בשימוש תכוף. לדוגמה, אם סופר משתמש בביטויים כמו "סוג של" או "עם זאת" בתדירות גבוהה ביותר, זה מעיד על הרגל שלו ליצור משפטים. ה-AI יכול להציע ביטויים אלה כמועמדים; אבל בשביל תדירות אמיתית ומובהקות סטטיסטית יש צורך לחזור לכלי הספירה.
רמז: אמור ל-AI, "רשום את הביטויים הבולטים (שתיים או שלוש מילים) בטקסט הזה כמועמדים, ותן דוגמה מהטקסט עבור כל אחד מהם." קח את רשימת המועמדים ומדוד את התדירות בפועל עם כלי נפרד. הצב את ה-AI כ"מבחין", את הסוכן כ"נגד" ואת עצמך כ"מתורגמן".
טעויות נפוצות
- בהסתמך על הספירה הגולמית של ה-AI. AI אינו מחשבון; אמת את המספר המדויק באמצעות כלי נפרד.
- הצגת המספר ללא הערה. "עבר 47 פעמים" לא אומר כלום; אתה יוצר את המשמעות.
- התעלמות מאורך הטקסט. שיעורי הגיוון הלירי רגישים לאורך.
- ביצוע תזה מבלי לאמת את השיתוף. זוגות שאינם בינה מלאכותית עשויים להציע; אשר מהטקסט.
- הערה קיצונית. אל תקבל את "הסיבות" שהוצעו על ידי ה-AI ללא ראיות.
לסיכום
ניתוח קורפוס פותח את הפן הניתן לספור של הספרות: תדירות, שיתוף פעולה, אוצר מילים, שינוי תקופתי. AI רב עוצמה בתחום זה בזיהוי דפוסים ובפירוש תוצאות; אבל זה לא אמין בספירה מוחלטת. אמת את המספר בעזרת הכלי הנפרד, אשר את הקולוקציות מהטקסט, וקבע את המשמעות של כל מספר בעצמך. מספר אינו ראיה, הוא הדלת לראיות.
משימת יישום
בחר טקסט קצר (500-1000 מילים). זהה מילת תוכן (למשל "לילה" או "כביש"). ראשית, ספר את עצמך בטקסט. אז תבקש מה-AI לספור את זה. השוו בין שתי התוצאות; אם יש הבדל, בדוק את הסיבה. לאחר מכן כתוב הערה של פסקה אחת על הפונקציה של המילה הזו בטקסט - הפיכת המספר למשמעות.
רשימת בדיקה
- [ ] שמתי שאלה לשונית ברורה.
- [ ] הגדרתי את גבולות הקורפוס (טקסט, מהדורה, נקודה).
- [ ] אימתתי את ספירת הבינה המלאכותית בדרך שנייה.
- [ ] אישרתי את הקולוקציות מהטקסט.
- [ ] לא השארתי את המספר ללא הערה; את המשמעות יצרתי בעצמי.