יחידה 8 / 12

ניתוח תוכן וגילוי דפוסים

רווחים:

  • יכולת לחלץ דפוסים מקבוצות גדולות של טקסט באמצעות טכניקות כגון NER, מיצוי קשרים, ציר זמן וניתוח רשת
  • היכולת לראות את הדפוס כהשערה ולא ראיה, לקשר ישויות למקור ולנרמל אותן באישור אנושי
  • יכולת להבין כיצד מספרים יכולים להטעות עקב נתונים חסרים והטיית דגימה, ולהימנע ממערכות יחסים וכרונולוגיות מתוכננות.

מחקר היסטורי אינו רק קריאת מסמכים בודדים; לעתים קרובות מחפש דפוסים בקבוצות גדולות של מסמכים. באילו הקשרים מופיע שם מסוים במהלך השנים? אילו אנשים קשורים ליישוב? איך נושא משתנה עם הזמן? מי מתכתב עם מי? שאלות כאלה דורשות הסתכלות לא במסמך אחד, אלא במאות מסמכים ביחד. זה נקרא לעתים קרובות מדעי הרוח הדיגיטליים - יישום שיטות חישוביות בתחומים כמו היסטוריה וספרות.

AI רב עוצמה בחילוץ מידע מובנה מקבוצות גדולות של טקסט. ביחידה זו תלמדו NER (זיהוי ישות בשם), מיצוי דפוסים ומערכות יחסים, היגיון של דוגמנות נושא ויצירת ציר זמן; אבל נדון גם במלכודת המסוכנת ביותר של הטכניקות הללו - הבינה המלאכותית מציגה את עצמה כמי ש"מצאה" דפוס שאינו קיים.

טכניקות בסיסיות

  • NER (זיהוי ישות בשם): חילוץ אוטומטי של ישויות כגון אדם, מקום, מוסד, תאריך מהטקסט. זה מייצר רשימה כמו "כל שמות המקומות המוזכרים ב-500 המסמכים האלה" תוך דקות.
  • הסקת קשרים: סימון קשרים בין ישויות ("אדם X במקום Y", "A מתכתב עם B").
  • מודלים של נושאים: איתור סטטיסטי של אשכולות של נושאים חוזרים בקבוצה גדולה של טקסט. זה מראה אילו נושאים מרוכזים באיזו תקופה.
  • הסקת ציר זמן: סידור אירועים מתוארכים במסמכים לפי סדר כרונולוגי.
  • ניתוח רשת: הדמיית יחסים בין-אדם/מוסדיים כרשת (מי המרכז, מי נקודת החיבור).

המטרה המשותפת של כל אלה היא לחשוף מבנים שאינם מופיעים במסמך אחד אלא מופיעים בכל האוסף. טכניקות אלו מייצרות דפוסים גלויים שלעולם לא יהיו גלויים דרך קריאה בלבד. אבל כל אחד מהם הוא "סימן", לא "ראיה"; חיוני לוודא מה נמצא במסמך המקורי.

מושג נפוץ בתחום זה הוא ההבחנה בין קריאה מקרוב (קריאת טקסט לעומק, שורה אחר שורה) לבין קריאה מרוחקת (הסתכלות על מאות/אלפי טקסטים באופן קולקטיבי, סטטיסטית). בינה מלאכותית מאפשרת קריאה מרחוק: אתה רואה דפוסים בגוף גדול מספיק כדי להחזיק מעמד לכל החיים של אדם אחד. אבל כאשר קריאה מרוחקת מצביעה על תבנית, יש צורך לחזור לקריאה קרובה, כלומר למסמך המקורי, כדי להבין אותה. שתי השיטות אינן ניתנות להחלפה; אחד מראה את התבנית, השני נותן את המשמעות שלו. המחקר החזק ביותר משתמש בשניהם יחד.

טיפ: השתמש בניתוח דפוסים כמחולל השערות: "ה-AI זיהה כאן דפוס, האם הוא אמיתי?" לאחר מכן בדוק את הדפוס הזה במסמכים אחד אחד. הדפוס הוא נקודת המוצא של המחקר שלך, לא התוצאה.

זרימת עבודה: צעד אחר צעד

1. הבהרו את השאלה. "אילו אנשים מופיעים יחד בתדירות הגבוהה ביותר באוסף הזה?" שאלה דפוס ברור כמו.

2. הכן ותווית את הנתונים. ארגן טקסט עם הפניות מקור כך שניתן לקשר את כל הנכסים שנמצאו בחזרה למסמך.

3. מופיעה הישות/תבנית. צור NER, מערכת יחסים או ציר זמן עם AI.

4. נרמל. שלב איותים שונים של אותו אדם/מקום ("איסטנבול / איסטנבול / קוסטנטינייה" באותו מקום?). שלב זה הוא קריטי; אם הוא מושמט, התבנית תתפרק.

5. אמת במסמך. בדוק את המסמכים בפועל עבור כל דפוסים משמעותיים המסומנים. ודא שה-AI אינו מוסיף קישור מורכב.

6. הערה. משמעות התבנית היא שיקול דעתו של ההיסטוריון; AI רק מסמן את הדפוס.

מלכודת מספר וסטטיסטיקה

ניתוח דפוסים מייצר לעתים קרובות מספרים: "שם X מופיע 47 פעמים", "נושא זה קיים ב-30% מהמסמכים". המספרים האלה נראים אובייקטיביים אבל יכולים להטעות:

  • נתונים חסרים: אם האיסוף כבר לא שלם (מסמכים אבדו, קבוצה מעולם לא נרשמה), המספר משקף מסמכים ששרדו, לא מציאות.
  • שגיאת נורמליזציה: אם אותו אדם מאוית אחרת ונספר בנפרד, המספר יהיה שגוי.
  • אובדן הקשר: "מתרחש 47 פעמים" לא אומר כלום; איך זה מועבר (חיובי/שלילי, נושא/אובייקט) חשוב.

פלט דפוס

משמעות לכאורה

סיכון אמיתי

"X מתרחש 47 פעמים"

אדם חשוב

אוסף לא שלם, וריאציה באיות

"נושא 30%"

נושא דומיננטי

הטיית דגימה

"A-B לעתים קרובות ביחד"

מערכת יחסים אינטימית

צירוף מקרים, הקשר חסר

"ציר זמן"

כרונולוגיה מדויקת

מסמכים ללא תאריך, צו מפוברק

שלושה מיני תיקים

מקרה 1 - ניתוח רשת גילה מתווך נסתר. חוקר בחן אוסף התכתבויות של 800 מכתבים. עם AI, מי כתב למי נקבע ונוצרה רשת. הרשת הראתה שאדם חסר חשיבות לכאורה במבט ראשון היה למעשה נקודת המגע המרכזית בין שתי הקבוצות. החוקר התמקד במכתביו של אדם זה והגיע לממצא חדש. אבל קודם כל אימת את כל הקישורים במסמכים.

מקרה 2 - שגיאת נורמליזציה השחיתה את המספר. תלמיד ביקש מהם לספור את מספר הפעמים שמקום הופיע במסמכים. מכיוון שה-AI מנה שלושה איותים שונים של אותו מקום בנפרד, התברר שהמספר הוא שליש מהמספר האמיתי. כאשר שולבו האיותים, המקום היה למעשה במקום השלישי בשכיחותו. שיעור: ללא נורמליזציה לא ניתן לסמוך על המספר.

מקרה 3 - ציר זמן מורכב. חוקר יצר ציר זמן ממסמכים ללא תאריך. AI סידרה את האירועים הלא ידועים בסדר "הגיוני" והציגה כרונולוגיה מדויקת. עם זאת, הרצף הזה לא היה במסמכים, AI המציא אותו. שיעור: ציר הזמן בנוי רק מאירועים שיש להם תאריך במסמך; השאר נשאר "ללא תאריך".

ארבע תבניות הניתנות להעתקה

1) NER (הסקת ישות):

האנשים, המקומות, המוסדות והתאריכים המוזכרים במסמכים להלן מופיעים כרשימות נפרדות. ציין באיזה מסמך (הפניה) כל ישות מוזכרת. קח רק את מה שכתוב בצורה ברורה בטקסט; להוסיף לפי ניחוש. סמן [?] אם אינך בטוח בהגייה. מסמכים: [כאן]

2) נורמליזציה של ישות:

ברשימת הישויות למטה, קבץ איותים שונים שיכולים להיות אותו אדם/מקום (למשל "איסטנבול / Kostantiniyye"). הצע את הפורמט המשותף האפשרי לכל קבוצה אך אל תטיל את השילוב המדויק; הוסף הערה "אולי אותו דבר, תן לאנשים לאמת". השאר את זה בשקט אם אתה לא בטוח. רשימה: [כאן]

3) מתווה מערכת יחסים/רשת:

חלץ את הקישורים "מי קשור למי" מקבוצת ההתכתבויות/המסמכים הבאים. לכל קישור יש לציין על איזה מסמך (הפניה) הוא מבוסס. הרכיב מערכת יחסים שאינה ברורה במסמך. סמן קישורים מעורפלים [לא ברורים]. תיעוד: [כאן]

4) ציר זמן מתוארך:

רשום בסדר כרונולוגי רק את האירועים המצוינים בבירור במסמכים הבאים; קשר כל אירוע למקור שלו. רשום בנפרד את האירועים עם תאריכים לא ברורים תחת הכותרת "ללא תאריך", אל תסדר אותם. אל תמציא את התאריך המשוער. תיעוד: [כאן]

הנחיה חלשה / הנחיה חזקה

חלש:

נתח מסמכים אלה וחלץ דפוסים, מערכות יחסים וקווי זמן חשובים.

"חלץ דפוסים חשובים" דוחף את הבינה המלאכותית להמציא קשרים לא קיימים וכרונולוגיות מדויקות, תוך הצגת מספרים ללא נורמליזציה.

חָזָק:

מחלץ את ישויות האדם/מקום/מוסד מהמסמכים הבאים על ידי חיבור כל אחד מהם להפניה למסמך. סמן איותים שונים שעשויים להיות זהים ל"ייתכן שיתמזגו", אך אל תמזג. קשרים שאינם מצוינים בבירור במסמך ואירועים עם תאריכים לא ברורים אינם מזייפים; שמור את אלה ללא תאריכים נפרדים. תיעוד: [כאן]

ההבדל: ייחוס למקור, השארת נורמליזציה לבני אדם, איסור על קשרים/היסטוריה פיקטיביים והפרדה בין אירועים ללא תאריך הופכים את הדפוס להגנה.

טעויות נפוצות

  • טועה בדפוס להוכחות. התבנית היא ההשערה; מאומת במסמך.
  • דילוג על נורמליזציה. איותים שונים של אותה ישות מעוותים את המספר ואת הרשת.
  • אמון עיוור במספרים. איסוף לא שלם והטיית דגימה הופכים את המספר למטעה.
  • ציר זמן מורכב. אירועים ללא תאריך אינם נכללים בכרונולוגיה.
  • התעלמות מהקשר. זה לא "כמה פעמים זה הועבר", אלא "איך זה הועבר" שחשוב.

לסיכום

ניתוח תוכן וגילוי דפוסים הוא תחום רב עוצמה שבו בינה מלאכותית מייצרת מבנים גלויים שלא יהיו גלויים באמצעות קריאה בלבד: מיצוי ישויות, רשתות יחסים, אשכולות נושאים, צירי זמן. אבל כל דפוס הוא השערה, לא ראיה. קשר נכסים למקור, נרמל בזהירות ועם אימות אנושי, בצע שאילתות על נתונים חסרים והטיה, הימנע ממערכות יחסים וכרונולוגיות מתוכננות. AI מסמן את הדפוס; מה זה אומר והאם זה נכון הוא שיקול דעתו של ההיסטוריון.

משימת יישום

אסוף לפחות 15 חלקים של תיעוד (עם הפניות). חלץ ישויות של אדם ומקום עם התבנית "NER". לאחר מכן קבץ את האיותים השונים עם "נורמליזציה של ישות" ואמת את הקבוצות בעצמך. לבסוף, הפעל את תבנית "ציר הזמן מתוארך" וראה כמה אירועים נותרו "לא מתוארכים". השווה כמה קישורים או כרונולוגיות רקחו ה-AI היה מייצר עם הנחיה גרועה.

רשימת בדיקה

  • [ ] הגדרתי בבירור את שאלת הדפוס שלי.
  • [ ] יש לי כל ישות מקושרת להפניה למסמך.
  • [ ] נרמלתי הקלדת ישויות ושילבתי אותה עם אישור אנושי.
  • [ ] שאלתי את המספרים על נתונים חסרים והטיה.
  • [ ] לא הכנסתי את האירועים ללא תאריך לכרונולוגיה, שמרתי אותם בנפרד.