יחידה 6 / 11

ארכיון דיגיטלי, דיגיטציה, OCR ושימור לטווח ארוך

רווחים:

  • יכולת לתקן מסמכים סרוקים על ידי המרתם לטקסט עם OCR ו-HTR והשוואת הפלט לתמונה בפועל
  • יכולת לשמר את המקוריות והשלמות של מסמך הארכיון ולמנוע מ-AI לשנות את התוכן ושחזור מפוברק
  • יכולת לתכנן שימור דיגיטלי לטווח ארוך עם מידע מוצא ופורמטים עמידים

על ארכיונאי מוטלת המשימה לשאת כרכים בני חמישים שנה, מכתבים בכתב יד או תצלומים ישנים אל העתיד. מסמכים אלו נשחקים עם הזמן; גם כדי לשמר וגם להנגיש אותם, מתבצעת דיגיטציה: פעולת סריקת מסמך פיזי והמרתו לעותק דיגיטלי. אבל ההקרנה לבדה אינה מספיקה; על האובייקט הדיגיטלי להיות ניתן למצוא, קריא וניתן לתחזוקה בטווח הארוך. ביחידה זו תלמדו כיצד להשתמש בבינה מלאכותית בתהליך העבודה של דיגיטציה, תמלול ושימור דיגיטלי; אבל תלמד מדוע אתה נושא באחריות למקוריות ולדיוק.

כמה מושגים. OCR (זיהוי תווים אופטי) היא טכנולוגיה הממירה את הטקסט בתמונה של מסמך לטקסט הניתן לעריכה במכונה. HTR (זיהוי טקסט בכתב יד) עושה את אותה עבודה עבור מסמכים בכתב יד וקשה הרבה יותר. שימור דיגיטלי הוא מאמץ מתוכנן להבטיח שאובייקטים דיגיטליים יישארו קריאים במשך עשרות שנים, גם כאשר פורמטים של קבצים מתיישנים ושינויים בתוכנה. AI הוא עוזר חזק אך פגום בכל שלושת התחומים.

צעד אחר צעד: מדיגיטציה לשימור

1. תעדוף. אי אפשר לעשות דיגיטציה של הכל בבת אחת. המסמכים השבריריים, המבוקשים והייחודיים ביותר מונחים במקום הראשון. מדובר בהחלטה שיפוטית; AI עוזר בעריכת רשימה, אבל המוסד קובע את העדיפות.

2. סרוק והחל OCR/HTR. סרוק את המסמך ברזולוציה גבוהה, ולאחר מכן השתמש ב-OCR או HTR כדי לחלץ את הטקסט. כלים מבוססי AI הולכים ומשתפרים כאן, אפילו עם טקסטים ישנים וקשים.

3. תקן ואמת את הטקסט. פלט OCR/HTR לעולם אינו מושלם. שגיאות נפוצות, במיוחד אם יש כתב ישן, דפים מוכתמים או כתב יד. חיוני להשוות את הפלט לתמונה בפועל ולתקן אותה.

4. הוסף מטא נתונים ומידע הגנה. הוסף לאובייקט הדיגיטלי את מקורו, תנאי הסריקה, מידע הפורמט ומקורו - מאיפה הגיע המסמך וכיצד הוא עובד. מידע זה קריטי לאימות והגנה עתידיים.

5. תוכנית להגנה לטווח ארוך. בחר פורמטים של קבצים פתוחים, נפוצים ועמידים; לְגַבּוֹת; ערכו תוכנית הגירה למקרה שהפורמטים יתיישנו.

טיפ: אל תקבל את פלט ה-OCR כ"טקסט ברור". אם מערכת חיפוש הייתה עובדת דרך הטקסט הזה, מילים מזוהות בצורה שגויה יגרמו לא למצוא את המקור. עבור אוספים קריטיים, תיקון פלט ה-OCR לעין האנושית קובע את האיכות של כל הגישה העוקבת.

אותנטיות ושלמות האובייקט הדיגיטלי

בלב עבודת הארכיון עומדות אותנטיות ויושרה: הבטחה שמסמך באמת מגיע מהמקור הנטען ושתוכנו לא השתנה. בשלב זה, AI יוצר איום דו-כיווני. ראשית, במהלך תיקון OCR/HTR או "שיפור", ה-AI יכול לשנות את הטקסט בשקט; יכול להוסיף מילה שלא קיימת בשם "תיקון". שנית, אם "תיקון" או "שחזור" תמונה נעשים עם AI, ייתכן שייווצרו פרטים לא מקוריים.

הכלל של הארכיונאי ברור: עותק השימור הדיגיטלי חייב להיות נאמן למקור. יש לתעד כל שיפור שנעשה עם AI ולשמור תמיד על הסריקה בפועל (הגולמית). "ייפוי" מסמך יכול להרוס את ערכו הראייתי ההיסטורי.

זהירות: זה עשוי להיות מפתה "לשפר" תמונה או מסמך ישן עם AI; אבל AI ממלא את החלקים החסרים על ידי איפור. במסמך ארכיוני, משמעות הדבר היא יצירת ראיות היסטוריות כוזבות. פלט השחזור לעולם אינו מחליף את המקור המקורי; מאוחסן כגרסה נפרדת, מסומנת בבירור.

שלושה מיני תיקים

מקרה 1 - ארכיוני העיתונים הפכו לניתנים לחיפוש. ספרייה עשתה דיגיטציה של אוסף העיתונים המקומיים שלה בן 30 השנים. עם OCR, 90,000 דפים תומללו והפכו לניתנים לחיפוש; חיפוש נושא שנמשך בעבר ימים הצטמצם כעת לשניות. עם זאת, הצוות שם לב שדיוק ה-OCR ירד ל-80% בדפים ישנים ומוכתמים ונתן עדיפות לתיקון השנים המובילות בעין האנושית.

מקרה 2 - HTR פתח את כתב היד. ארכיון החיל HTR על אוסף מכתבים קשים לקריאה מהמאה ה-19. המערכת צברה מהירות רבה על פי חודשים של קריאה של מומחים; אבל כל עמוד של התדפיס הושווה למקור על ידי פליאוגרף מומחה (מומחה לכתיבה עתיקה), כי היו שגיאות בשמות של אנשים ומקומות.

מקרה 3 - "שיקום" מזויף נדחה. צוות אחד שקל "לתקן" תמונה היסטורית קרועה עם AI. בינה מלאכותית השלימה את חלקי הפנים החסרים על ידי התאמתם. הארכיונאי הבין שפרטים מפוברקים אלה יעוותו את העדויות ההיסטוריות; התמונה המתוקנת אוחסנה בנפרד לצד המקור, רק עם תווית ברורה "נגזרת AI".

עותק גישה, עותק שימור והחלטת פורמט

שיטה טובה בדיגיטציה היא להפריד עותקים של אותו אובייקט למטרות שונות. מאסטר לשימור הוא האובייקט הדיגיטלי בפועל שיינשא לעתיד, מאוחסן ברזולוציה הגבוהה ביותר, לא דחוס או בפורמט נטול אובדן; רק לעתים רחוקות נוגעים בו. עותק Access הוא גרסה קטנה יותר הנפתחת בקלות המוצגת למשתמש. הבחנה זו חשובה מכיוון שהפורמט המעשי לשימוש (קטן, דחוס) עשוי שלא להתאים לשימור לטווח ארוך; הפורמט האידיאלי לשימור (גדול, ללא אובדן) הוא מסורבל לשימוש יומיומי. בזרימת עבודה זו, AI יכול לעזור במלאי של קבצים, זיהוי גרסאות חסרות ושמירה על עקביות של מטא נתונים בין שני עותקים. עם זאת, הבחירה בפורמט היא החלטת שימור: יש להעדיף פורמטים פתוחים, מתועדים ורבים ועמידים (ולא פורמטים קנייניים וסגורים), ויש לשמור על תוכנית הגירה מוכנה למקרה שהפורמטים מתיישנים עם הזמן. גם אם AI מציע פורמט, למדיניות השימור ארוכת הטווח של המוסד יש את המילה האחרונה.

טיפ: לכל אובייקט דיגיטלי, שמור רישום קצר שעונה על השאלות "היכן נמצא המקור המקורי, באיזה פורמט עותק השימור, באיזה פורמט עותק הגישה, ואיזה זמין למשתמש?" ערבוב שלוש השכבות הללו גורם לא ברור איזה קובץ הוא המאסטר המהימן בהמשך.

ארבע תבניות הניתנות להעתקה

1) עזרה לתיקון פלט OCR:

להלן טקסט OCR ותיאור של הדף בפועל. תקן רק שגיאות OpenOCR (תווים גרועים, מילים מורכבות/פיצולות). אין לשנות תוכן, להוסיף או להסיר מילים. אם אינך בטוח, סמן ב-"[?]". טקסט OCR: [כאן]

2) בדיקת עקביות טקסט-תמונה:

האם ישנן תוספות בטקסט המתוקן למטה שלא היו צפויות להיות במסמך המקורי (שאולי הומצא)? סמן כל חלק חשוד וכתוב מדוע הוא חשוד. טקסט: [כאן]

3) טיוטת מטא נתונים להגנה:

צור את מתווה המטא-נתונים לשימור עבור האובייקט הדיגיטלי הבא: מקור, מקור, תאריך/רזולוציה של סריקה, פורמט קובץ, היסטוריית עסקאות. פשוט השתמש במידע שסיפקתי, השאר את השדה החסר ריק. מידע: [כאן]

4) עזרה בתעדוף:

להלן רשימת האוספים הממתינים לדיגיטציה; סיוע בתעדוף על בסיס שבריריות, ביקוש וייחודיות. תנו נימוק קצר לכל משאב; השאר לי את ההחלטה הסופית. רשימה: [כאן]

הנחיה חלשה / הנחיה חזקה

הנחיה חלשה:

תקן ולייפות את הטקסט הסרוק הזה.

"Beautify" מזמינה את AI לשנות את התוכן, לפצות על ההשמטות; מקוריות מסמך הארכיון פגומה.

הנחיה עוצמתית:

תפקידך: עוזר עורך דיגיטציה. בטקסט ה-OCR הבא, תקן רק שגיאות זיהוי מפורשות (תו רע, מילה שגויה מפוצלת). אין להוסיף, להסיר או לשנות מילים כלשהן. השאר את "[?]" במקום שבו אתה לא בטוח. הצג כל תיקון שביצעת ברשימה נפרדת. טקסט: [כאן]

ההנחיה העוצמתית מגבילה את ה-AI לזיהוי שגיאות בלבד, אוסרת עליו לגעת בתוכן, והופכת את התיקונים לניתנים למעקב.

זרימת עבודה וטבלת סיכונים

במה

תרומה של AI

סיכון עיקרי

אמצעי הגנה

סריקה

איכות ירודה

רזולוציה גבוהה

OCR/HTR

המר לטקסט

שגיאות זיהוי

תיקון אנושי

תיקון

הצעת שגיאה

שינוי תוכן

השוואה למקור

שיקום

נגזרת תמונה

פרט מתאים

שמור את המקור הגולמי, סמן אותו

הגנה

טיוטה של מטא נתונים

אובדן מוצא

תיעוד מקור

טעויות נפוצות

  • קבלת פלט OCR ללא תיקון. שגיאות משבשות את החיפוש והגישה.
  • קורא AI "לעשות יפה". זה משנה את התוכן והורס את המקוריות.
  • החלפת שחזור בינה מלאכותית בעדויות ממשיות. פירוט מפוברק יוצר היסטוריה כוזבת.
  • לא מאחסן את הסריקה הגולמית. לא ניתן לאמת תיקון ללא המקור.
  • השמטת מידע מוצא. מהימנות המסמך הופכת לבלתי ניתנת לאיתור.

לסיכום

AI בארכיונים דיגיטליים ודיגיטציה; זהו עזר רב ערך שמאיץ את תמלול OCR/HTR, ניסוח מטא נתונים ותעדוף. אבל המהות של עבודת ארכיון היא אותנטיות ושלמות: פלט OCR צריך להיות מתוקן על ידי העין האנושית, בינה מלאכותית לעולם לא צריכה להחליף תוכן בשקט, נגזרות שחזור לא צריכות להחליף את העדויות המקוריות, ותמיד יש לשמור מידע גולמי על סריקה ומקור. השתמש ב-AI ככלי שאינו "משפר" את המסמך, אלא הופך אותו לנגיש תוך שמירה על נאמנות אליו.

משימת יישום

קבל דוגמה קצרה של פלט OCR (או ייצור משלך או מסריקה בפועל). תקן רק את שגיאות הזיהוי באמצעות תבנית "עזרה לתיקון פלט OCR", ולאחר מכן בדוק אם ה-AI הוסיף תוכן עם התבנית "בדיקת עקביות טקסט-תמונה". לאחר מכן צור רשומה עם פרטי המקור והפורמט של האובייקט באמצעות התבנית "טיוטת מטא נתונים לשימור".

רשימת בדיקה

  • [ ] השוויתי את פלט OCR/HTR עם התמונה בפועל ותיקנתי אותה.
  • [ ] בדקתי שה-AI אינו מוסיף/משנה תוכן.
  • [ ] שמרתי את הסריקה הגולמית (מאסטר) בנפרד וללא שינוי.
  • [ ] הוספתי מידע על מקור ופורמט למטא נתונים.
  • [ ] תייגתי בבירור גרסאות שחזור כ"נגזרת AI".