רווחים:
- יכולת להגדיר את זרימת העבודה של HTR ותעתיק ולהסביר מדוע הטיוטה הגולמית דורשת בדיקת מומחה שורה אחר שורה
- יכולת להגן על אזורים בלתי קריאים על ידי בקשת חלופות במקום הטלת קריאה מדויקת במקרה של אי בהירות תנועות/אותיות בטורקית עות'מאנית
- יכולת להפריד את התעתיק המקורי משכבה נפרדת של פישוט, תוך שמירה על אחריות מדעית סופית עם הפליאוגרף
אולי החלק התובעני ביותר במחקר ההיסטורי הוא תמלול כתבי יד ומסמכים כתובים ישנים לטקסט קריא. מכתב, מחברת, פרוטוקול בית משפט או מסמך עות'מאני הופכים לחיפוש רק לאחר שתומללו. תמלול הוא הפעולה של העברת תוכן מסמך (לרוב בכתב יד או כתב עתיק) לטקסט כתוב וקריא. במקרה של עות'מאנית, זה מלווה לעתים קרובות בתעתיק: העברת הטקסט באותיות ערביות לאלפבית הלטיני עם מקבילות האותיות שלו.
השתמשנו ב-OCR עבור טקסטים מודפסים; כתב יד דורש טכנולוגיה אחרת: HTR (זיהוי טקסט בכתב יד). HTR היא טכנולוגיה דומה ל-OCR אך מאתגרת הרבה יותר הממירה מסמכים בכתב יד לטקסט מכונה. ביחידה זו נראה כיצד להשתמש ב-HTR וב-AI בתעתוק עות'מאני וכתבי יד, את שולי השגיאה ומדוע האימות הוא אפילו יותר קריטי כאן.
למה כתב יד כל כך קשה?
כתב היד משתנה הרבה יותר מטקסט מודפס: לכל כותב יש יד ייחודית, אותיות מקושרות זו לזו, משתמשים בקיצורים וסימנים מיוחדים, הדיו מדמם, הנייר נשחק. בטורקית עות'מאנית הקושי מוכפל:
- צורות אותיות קונטקסטואליות: אותה אות נכתבת בצורה שונה בתחילת המילה, באמצע ובסוף.
- אי כתיבת תנועות: תנועות קצרות לרוב לא נכתבות; הקורא משלים מההקשר. זה יוצר אי בהירות כמו "קבלה או דחייה?"
- סגנונות כתיבה שונים: ישנם סגנונות כתב יד שונים כגון ריקא, דיבני, תליק; כל אחד דורש מומחיות אחרת בקריאה.
- אוצר מילים עות'מאני: מילים מערבית ופרסית שלא קיימות בטורקית של היום.
לכן, HTR ו-AI עובדים עם מרווח שגיאה גבוה בהרבה בטורקית עות'מאנית מאשר OCR מודפס. עינו של פליאוגרף מומחה (פליאוגרפיה - מדע קריאת כתבים עתיקים) אינה כלי כאן, אלא הכרח.
זרימת עבודה: צעד אחר צעד
1. הכן איכות מסמך. כמו עם OCR, רזולוציה גבוהה וניגודיות טובה הם חיוניים. זה אפילו יותר קריטי בכתב יד.
2. בחר דגם HTR. דגמי כתב עות'מאני, ערבי או HTR שהוכשרו במיוחד לתקופה מסוימת מצליחים הרבה יותר מדגמים כלליים. בדוק איזה דגם עובד היטב לתקופה ולסגנון כתיבה.
3. צור תמלול גולמי. דגם HTR מייצר מתאר. בטורקית עות'מאנית, הטיוטה הזו היא התחלה מלאה בשגיאות שעין מנוסה חייבת לבדוק היטב.
4. שיפור הקשר עם AI. אתה יכול לקבל חוסר עקביות בדגל AI, חלופות קריאה אפשריות ומיקומים חשודים בפלט הגולמי. אבל "תיקון" הבינה המלאכותית מסוכן במיוחד כאן: הוא יכול להציע קריאה מתוכננת.
5. תעתיק ופישוט (שכבתי). התעתיק של הטקסט באותיות ערביות לאותיות לטיניות, ואחריו הקריאה הפשוטה שלו לטורקית של היום, מופק כשכבות נפרדות. המקור אף פעם לא נשבר.
6. אימות מומחה. התמלול הסופי מאושר על ידי מומחה בעל ידע בפליאוגרפיה וידע תקופתי על ידי השוואתו למסמך.
שימו לב: בטורקית עות'מאנית, כאשר "מנחשים" מילה עם תנועה לא כתובה מההקשר, ה-AI יכול לייצר קריאה שגויה לחלוטין ולהציג אותה בשפה בטוחה. הבדל באותיות, כמו "כבול" במקום "כביל" או "עלם" במקום "עלים", משנה לחלוטין את המשמעות. יש להציג לכל קריאה לא ודאית אלטרנטיבות, ואין להטיל קריאה חד-משמעית אחת.
שכבות ואחריות עם שולחן
שכבה
תוכן
תפקיד של AI
תפקיד המומחה
תמונה
מסמך מקורי
—
מקור
טיוטת HTR
קריאת מכונה גולמית
מייצרת
שליטה מההתחלה ועד הסוף
תעתיק
המרת אותיות לטינית
הטיוטה מציעה
מתקן, מתקן
הערות של אי ודאות
[?] וחלופות
סימנים
מחליט
פישוט
הטורקית של היום
הטיוטה מציעה
אישורים
פרסום מדעי
טקסט סופי + הערות
—
מומחה בלבד
שלושה מיני תיקים
מקרה 1 - HTR האיץ את הטיוטה הראשונה פי 5. דוקטורנט היה מתמלל מחברת עות'מאנית בת 200 עמודים. תמלול ידני מלא נאמד ב-60 ימי עסקים. עם דגם HTR שהוכשר לתקופה, הטיוטה הגולמית יצאה תוך מספר שעות; התלמיד תיקן טיוטה זו וצמצם את העבודה ל-12 ימי עבודה. אבל היה עליו להשוות כל עמוד למסמך, שורה אחר שורה; כ-30% מהטיוטה לא הייתה נכונה.
מקרה 2 - אות אחת, משמעות אחת. חוקר אחד הסתמך על מילה שה-AI קרא כ"מושל". בפיקוח מומחים, הובנה שהמילה היא למעשה "אפוטרופוס" (אחראי על ילד/אדם), ומכיוון שהתנועה לא סומנה, הבינה המלאכותית ניחשה את זה לא נכון. המשמעות המשפטית של המסמך השתנתה לחלוטין. שיעור: בטורקית עות'מאנית, הבדל של אות/תנועות בודדת גורם לפירוש המסמך מההתחלה; נדרש מומחה.
מקרה 3 - השלמה מתוכננת. בשורה שהדיו שלה אזל ומילה אחת ממנה לא הייתה קריאה, ה-AI מילא את החסר במילה "הגיונית". המומחה הבין שהפער הזה הוא למעשה שם מקום ושה-AI סידר אותו. מקום שנותר כ[בלתי קריא]. שיעור: מקום בלתי קריא אינו מולא, הוא מסומן.
ארבע תבניות הניתנות להעתקה
1) תעתיק ששומר על עמימות:
להלן פלט/תעתיק HTR הגולמי של מסמך עות'מאני. המשימה שלך היא לסקור את הטקסט ולסמן שגיאות קריאה אפשריות. כללים: (1) הציעו 2-3 חלופות קריאה אפשריות לכל מילה שאינכם בטוחים לגביה, אל תטיל אחת. (2) השאירו [לא קריא] באזורים הלא קריאים, אין למלא אותם. (3) הוספת מילים שאינן קיימות בטקסט. (4) הצג חלופות במילים עם תנועות דו-משמעיות. טקסט: [כאן]
2) קריאה בשכבות (מקור + פישוט):
צור שתי עמודות עבור התעתיק העות'מאני המאומת הבא: (1) תעתיק מקורי (מגע), (2) קריאה פשוטה לטורקית של היום. הוספת משמעות, הוספת פרשנות בפשטות; פשוט תעדכן את השפה. סמן מקומות בעלי משמעות מעורפלת [לא ברורה]. תעתיק: [כאן]
3) חילוץ מונח ואדם:
השמות האישיים, שמות המקומות, הכותרות והמונחים התקופתיים המוזכרים בתמלול להלן מופיעים ברשימות נפרדות. קח רק את אלה המוזכרים בבירור בטקסט; אין להוסיף על ידי ניחוש. סמן ב-[?] אם אינך בטוח בהגייה. טקסט: [כאן]
4) בקרת קריאה חשודה:
בקר פליוגרפיה מנוסה בתפקיד. בתעתיק למטה, סמן את המילים שאינן עקביות במשמעותן, אינן מתאימות לתקופה או אינן מתאימות להקשר, וכתוב מדוע הן חשודות. הטלת תיקון מוחלט; צור רשימה של חשדות שהמומחה האנושי ישווה למסמך. טקסט: [כאן]
הנחיה חלשה / הנחיה חזקה
חלש:
קרא את הטקסט העות'מאני הזה ותן לי את התרגום שלו.
זה דוחף את הבינה המלאכותית לייצר קריאה חד-משמעית, מסתירה אי בהירות והתאמה של פערים. בטורקית עות'מאנית זו כמעט טעות מובטחת.
חָזָק:
בדוק את התעתיק העות'מאני למטה. קריאה נחרצת: הטלה. ספק חלופות אפשריות לכל מילה דו-משמעית, השאר חלקים [לא קריאים], אל תוסיף שום דבר שאינו בטקסט. תן את הקריאה הפשוטה לטורקית של היום בטור נפרד, אבל שמור את המקור. סמן כל דבר שאינך בטוח לגביו עם [?] כדי שהמומחה יוכל להשוות אותו עם המסמך. טקסט: [כאן]
ההבדל: איסור קריאה קפדני, בקשת חלופות, שמירה על רווח לבן ופלט שכבות מאפשרים אימות מומחה.
טעויות נפוצות
- טעות בטיוטת HTR כנכונה. בטורקית עות'מאנית, חלק ניכר מהטיוטה הגולמית עשוי להיות לא מדויק; שליטה שורה אחר שורה היא חובה.
- הקריאה המוחלטת היחידה היא לכפות. אם חלופות מסתתרות במילים שהתנועות שלהן לא כתובות, תירשם המשמעות השגויה.
- מילוי האזור הבלתי קריא. זה צריך להיות מוגן על ידי רווח לבן [לא קריא], לא מורכב.
- מערבבים את המקור בפשטות. הפישוט צריך להיות שכבה נפרדת; אין לעוות את התעתיק המקורי.
- השבתת המומחה. ללא ידע בפליוגרפיה ובתקופה, קריאת הבינה המלאכותית היא ניחוש ללא ערך מדעי.
לסיכום
ניתן להאיץ מאוד את התמלול העות'מאני וכתב היד בשלב הטיוטה הגולמית עם HTR ו-AI; אתה מקבל תפוקה ראשונה שמצמצמת ימי עבודה לשעות. אבל דווקא בתחום הזה אות בודדת, הבדל תנועות בודד משנה את המשמעות; AI נוטה להסתיר אי ודאות ולהשלים את החסר. השיטה הנכונה מרובדת: מתאר גולמי, הערות חלופיות של עמימות, שכבה נפרדת של פישוט ובעיקר אימות שורה אחר שורה של המסמך על ידי מומחה הבקיא בפליוגרפיה. AI מאיץ את הקריאה הראשונית; האחריות המדעית היא של המומחה.
משימת יישום
השג תעתיק של מסמך עות'מאני או כתב יד (הפקה משלך או עותק שפורסם). בקש מה-AI קריאה חלופית עם תבנית "תעתיק משמר העמימות". לאחר מכן צור את שכבת הפישוט בנפרד עם "קריאה שכבתית". השווה כל מילה מסומנת במעורפל עם מקור מומחה או מילון; שימו לב כמה שגיאות ה-AI היה מייצר אם הוא יטיל קריאה אחת.
רשימת בדיקה
- [ ] השתמשתי בדגם HTR המתאים לתקופה ולסגנון הכתיבה.
- [ ] ביקשתי מה-AI חלופות לקריאה המדויקת.
- [ ] הגנתי על החלקים הבלתי קריאים עם [לא קריא].
- [ ] שמרתי את התעתיק המקורי בנפרד מהפשט.
- [ ] אימתתי את הטקסט הסופי על ידי מומחה/סרט תיעודי שיודע פליוגרפיה.