רווחים:
- יכולת להגדיר את זרימת העבודה של הדיגיטציה ו- OCR (סריקה, עיבוד מקדים, זיהוי, תיקון, אימות) צעד אחר צעד
- יכולת להשתמש ב-AI כדי לתקן שגיאות OCR עם הקשר תוך שמירה על קו התיקון והשכתוב וסימון אי בהירות עם [?]
- הבן מדוע מספרים, תאריכים ושמות פרטיים חייבים להיות מאומתים ויזואלית ואת תפקידה של בקרת האיכות.
מיליוני הדפים על המדפים הפיזיים של ארכיון או ספריה נפתחים באמת בפני החוקר רק כשהם הופכים לדיגיטאליים וניתנים לחיפוש. דיגיטציה היא המרת מסמך פיזי לתמונה דיגיטלית על ידי סריקה או צילום שלו. אבל תצלום של דף עדיין אינו "טקסט"; למחשב זו עדיין תמונה, אי אפשר לחפש בה. כאן נכנס לתמונה OCR.
OCR (זיהוי תווים אופטי) היא טכנולוגיה המזהה אותיות מודפסות בתמונת מסמך וממירה אותן לטקסט קריא במכונה וניתן לחיפוש. ביחידה זו תלמדו כיצד לבצע דיגיטציה של מסמכים מודפסים היסטוריים באמצעות OCR, כיצד AI מסייע לתקן שגיאות OCR בתהליך זה, והיכן העין האנושית חיונית. (טקסטים בכתב יד דורשים טכנולוגיה אחרת; נסקור זאת ביחידה הבאה.)
זרימת עבודה של דיגיטציה: צעד אחר צעד
1. הכנה והקרנה. סרוק את המסמך באיכות הגבוהה ביותר האפשרית. כלל אצבע כללי למחקר היסטורי הוא רזולוציה של לפחות 300-400 DPI (נקודות לאינץ'). רזולוציה נמוכה מרקיעה שחקים את שיעור השגיאות בשלב ה-OCR שלאחר מכן.
2. עיבוד מקדים של תמונה. שיפור התמונה לפני OCR מגדיל מאוד את ההצלחה: ביטול הטיה של הדף הסרוק, הסרת פגמים, הגדלת ניגודיות, המרה לשחור-לבן. כלים מודרניים מבוססי בינה מלאכותית יכולים להפוך את השלב הזה לאוטומטי.
3. יישום OCR. אתה מזין את התמונה למנוע OCR; המנוע מזהה אותיות ומפיק טקסט. הפלט מורכב בדרך כלל משתי שכבות: תמונת המסמך הגלויה ו"שכבת טקסט מוסתר ניתנת לחיפוש" מתחתיה.
4. תיקון (אחרי תיקון). פלט OCR גולמי לעולם אינו מושלם. תווים נקראים בצורה שגויה עקב גופנים ישנים, נייר מצהיב, מריחת דיו ושגיאות סריקה. זה המקום שבו AI הוא עוזר רב עוצמה: הוא מציע ומתקן שגיאות OCR באמצעות הקשר.
5. אימות ובקרת איכות. הטקסט המתוקן נבדק על ידי האדם על בסיס מדגם או לחלוטין. אזורים קריטיים במיוחד כמו שמות, תאריכים ומספרים חייבים להיות מאומתים ויזואלית.
למה OCR עושה טעויות, איך AI עוזר
בעיות אופייניות המאתגרות OCR במסמכים היסטוריים: גופנים ישנים ומהודרים, צורות אותיות מיושנות כגון "s" ארוכות (ſ), פריסת עמודים דו עמודים, הערות שוליים, תוספות בכתב יד, חותמות ודיו דהוי. מכיוון שמנוע OCR "רואה" אותיות אחת לאחת, הוא מבלבל לעתים קרובות את ה-"rn" הבינארי כ-"m", את האות "l" כמספר "1", ואת האות "O" כ-"0".
מודלים של שפות בינה מלאכותית מציעים כאן כוח שונה: הם מבינים את ההקשר. אם מנוע OCR כתב "1stanbu1", ה-AI יכול להסיק מהקשר שהוא צריך להיות "Istanbul". אבל יש כאן סכנה גדולה: בעת "תיקון" ה-AI יכול גם לשנות את הטקסט. הוא יכול להוסיף "תיקנתי" מילה שלא קיימת או למלא מקום לא ברור בניחוש משלו. זה משבש את הנאמנות של התמלול.
זהירות: כלל הזהב בתיקון OCR הוא זה: AI צריך לתקן רק שגיאות זיהוי ברורות, לא לפרש או להשלים את תוכן הטקסט. "1stanbu1 → איסטנבול" הוא לגיטימי; זה לא על מילוי מילה בלתי קריאה בניחושים. יש לסמן מקומות לא בטוחים ב-[?] ואין להמציא אותם.
סוגי שגיאות OCR וגישה עם טבלה
סוג שגיאה
דוגמה
האם AI יכול לתקן את זה?
שליטה אנושית
ערבוב דמויות
rn↔m, l↔1, O↔0
כן, זה בטוח
מדגם
צורת אותיות ישנה
ארוך ſ → s
כן, זה בטוח
מדגם
מילה דהויה/לא ניתנת לקריאה
"ka___n"
לא, צריך לשים [?]
חובה
שם תקין/שם מקום
"קונסטנטינייה"
זהיר
חובה
מספר/תאריך
"1867" מול "1857"
מסוכן
חובה
פריסת עמוד (עמודה/הערת שוליים)
זרימה מעורבת
באופן חלקי
חובה
לסיכום התמונה במשפט אחד: AI מנקה בצורה מהימנה שגיאות אופי רגילות; אבל עיניים אנושיות נדרשות לשמות מיוחדים, מספרים, תאריכים ומקומות בלתי קריאים.
שלושה מיני תיקים
מקרה 1 - ארכיוני העיתונים הפכו לניתנים לחיפוש. ספריית אוניברסיטה דיגיטתה 12,000 עמודים של עיתונים מקומיים משנות ה-30. דיוק ה-OCR הגולמי היה מוערך ב-82% (18 מכל 100 תווים היו שגויים). תיקון מבוסס בינה מלאכותית העלה את הדיוק ל-96% עם מילון והקשר המתאימים לשפה של העיתון. עבור שאר השגיאות, בוצעה בדיקה לדוגמה ולא הטקסט המלא; האוסף הפך לחיפוש תוך 3 שבועות.
מקרה 2 - AI "תוקן" ועיוות היסטוריה. ארכיונאי הורה ל-AI לתקן את התאריך "1863" בתדפיס ה-OCR. ה-AI "תיקנה" את התאריך ל-"1868" על ידי הסתכלות על אירוע אחר בהקשר - למרות שהמסמך אמר בבירור 1863. אם הארכיונאי לא היה מסתכל על התמונה המקורית, הקטלוג היה נכנס עם התאריך הלא נכון. לקח: מספרים ותאריכים לעולם אינם נשארים ל-AI, הם מאומתים עם התמונה.
מקרה 3 - עמוד דו עמודות מבולבל. עמודי שני העמודים של ספר שנתון מהמאה ה-19 עורבבו לזרם אחד ב-OCR והמשפטים היו שזורים זה בזה. הפלט הגולמי לא היה קריא. הטקסט השתפר כאשר חילקתי לראשונה את פריסת העמוד לאזורים (פילוח) ועיבוד כל עמודה בנפרד. שיעור: בפריסת עמוד מורכבת, ראשית מבנה, שנית טקסט.
ארבע תבניות הניתנות להעתקה
1) תיקון OCR מאובטח:
להלן פלט OCR גולמי של מסמך היסטורי. המשימה שלך היא לתקן שגיאות זיהוי אופטי ברורות בלבד (למשל rn→m,1→l, 0→O, ſ→s ארוכות). כללים: (1) לפרש את משמעות הטקסט. (2) תקן מילים בלתי קריאות/דו-משמעיות, השאר כפי שהן וסמן ב-[?]. (3) אין להוסיף, להסיר או להשלים משפטים. (4) שנה מספרים ותאריכים; סמן [מספר?] אם יש ספק. OCR גולמי: [כאן]
2) דוח איכות OCR:
בדוק את פלט ה-OCR להלן והפק דוח איכות: (1) רשום מילים עם שגיאות זיהוי אפשריות, (2) סמן אזורים שנראים בלתי קריאים/לא ברורים, (3) רשום שמות, תאריכים ומספרים ספציפיים הדורשים בדיקה אנושית. אל תתקן; צור רשימת בדיקה בלבד. טקסט: [כאן]
3) עזרה בניתוח עמודות/מבנה:
מכיוון שטקסט ה-OCR למטה מגיע מדף בן שתי עמודות, הזרימה עלולה להתבלבל. סדר מחדש את הטקסט לפסקאות הגיוניות אך אל תשנה, הוסף או מחק אף מילה. פשוט תקן את הסדר. סמן את ההזמנה שאינך בטוח בה באמצעות [הזמנה?]. טקסט: [כאן]
4) נורמליזציה לשפה סטנדרטית (אופציונלי, שכבה נפרדת):
הפק גרסת קריאה פשוטה באיות של היום, בטור נפרד, מעל הטקסט ההיסטורי המתוקן למטה. לעולם אל תשנה את הטקסט המקורי; תן לפישוט להיות שכבה נפרדת. פשוט עדכן איות/הגייה מבלי להוסיף משמעות. מקור: [כאן]
הנחיה חלשה / הנחיה חזקה
חלש:
תקן ולייפות את טקסט ה-OCR הזה.
"Beautify" מאפשר ל-AI לשכתב את הטקסט, להמציא השמטות ולפרש את התוכן; שובר נאמנות.
חזק:
תקן רק שגיאות זיהוי אופטי בפלט OCR גולמי זה. אין לפרש משמעות, להוסיף/למחוק מילים, להשאיר חלקים בלתי קריאים עם [?], לשנות מספרים ותאריכים. הצג כל תיקון שאתה עושה ברשימה נפרדת בפורמט "מקורי → תיקון" כדי שאוכל לאמת אותו. טקסט: [כאן]
ההבדל: חובה מוגבלת, איסור ייצור, אי בהירות סימון ורשימת תיקונים ניתנת למעקב הופכים את הפלט לביקורת.
טעויות נפוצות
- סריקה ברזולוציה נמוכה. רוב שגיאות ה-OCR נגרמות על ידי תמונות גרועות; סריקה איכותית היא ההשקעה הזולה ביותר.
- קורא AI "לעשות יפה". זה מייצר שטף ולא נאמנות; המסמך נכתב מחדש.
- משאירים את המספרים והתאריכים ל-AI. אלה מושחתים בשקט כאשר "מתוקנים" מההקשר; יש לאמת באמצעות תמונה.
- מילוי האזור הבלתי קריא בניחוש. זה צריך להיות מוגן על ידי אי ודאות [?], לא להמציא.
- לא שולט בכלל במקום דגימה. אפילו 96% דיוק אומר אלפי שגיאות ב-12,000 עמודים; אזורים קריטיים נסרקים.
לסיכום
OCR פותח ארכיונים לחוקרים על ידי המרת מסמכים היסטוריים מודפסים לטקסט הניתן לחיפוש. AI הוא כלי עזר רב עוצמה בתיקון שגיאות תווים בפלט OCR גולמי עם הקשר; אבל אתה חייב למתוח את הגבול בין עריכה לשכתוב. סריקה איכותית, הוראת תיקון בטוחה, שימור אי בהירות עם [?] ואימות שמות/תאריכים/מספרים בעין אנושית הופכים את הדיגיטציה למהירה ומהימנה כאחד. AI מנקה טקסט; אתה שומר הנאמנות.
משימת יישום
סרוק מסמך היסטורי מודפס (עיתון ישן, מכתב רשמי, דף ספר) או בצע תדפיס OCR. תקן את הטקסט באמצעות תבנית "תיקון OCR מאובטח" ובקש תיקונים באמצעות רשימת "המקורי → תיקון". לאחר מכן, הסר את האזורים הדורשים שליטה אנושית באמצעות "דוח איכות OCR". השווה כל תאריך ושם תקין ברשימה לתמונה בפועל; שימו לב כמה "תוקנו" בצורה שגויה.
רשימת בדיקה
- [ ] סרקתי את המסמך עם לפחות 300 DPI וניגודיות טובה.
- [ ] ביקשתי מה-AI רק תיקון שגיאות אופטי, לא שכתוב.
- [ ] הגנתי על החלקים הבלתי קריאים עם [?].
- [ ] אימתתי את כל המספרים, התאריכים והשמות הפרטיים עם התמונה.
- [ ] ביצעתי דגימה או בדיקה מלאה באזורים קריטיים.