יחידה 4 / 12

מטא נתונים, קטלוג וסיווג

רווחים:

  • יכולת לייצר טיוטות מטא נתונים בהתאם לתקנים כמו ISAD(G) או Dublin Core עם בינה מלאכותית
  • יכולת למנוע הזיות ולמפות מונחי נושא לאוצר מילים מבוקר עם רשות ריקה
  • יכולת להבחין אילו שדות, כגון תאריך, שם אדם וקוד סימוכין, דורשים אישור אנושי ואילו יש להקצות רק על ידי המוסד

לא ניתן למצוא ארכיון או ספרייה, לא משנה כמה הם עשירים, אלא אם הם מוגדרים היטב. מה שהופך מסמך ל"ניתן למצוא" הוא המידע התיאורי עליו: מי כתב אותו, מתי, איפה, מה הנושא שלו, לאיזה אוסף הוא שייך. מידע זה נקרא מטא נתונים (מטא נתונים - נתונים תיאוריים על מסמך; "נתונים על נתונים"). קטלוג הוא תהליך של זיהוי מסמכים עם מטא נתונים אלה ושמירתם במערכת הניתנת לחיפוש. סיווג הוא לארגן מסמכים לפי קריטריונים כמו נושא, סוג או מקור.

יצירת מטא נתונים גוזלת זמן רב; הזנת מידע על תאריך, נושא, אדם ומקום בנפרד עבור אלפי מסמכים באוספים גדולים עשויה להימשך שנים. AI הוא מחולל טיוטה חזק בעסק הזה. ביחידה זו, נראה כיצד לייצר מטא נתונים עם AI, קיטלוג בהתאם לתקנים (ISAD(G), Dublin Core), ואת הכוח והמלכודות של הסיווג האוטומטי.

תקני ארכיון: מדוע הם נחוצים

מטא נתונים אינם מוזנים באופן אקראי; ישנם תקנים בינלאומיים כך שרשומות ממוסדות שונים יכולים לדבר זה עם זה:

  • ISAD(G) (General International Standard Archival Description): כללים לתיאור חומר ארכיוני באופן היררכי (ברמת הקרן, הסדרה, הקובץ, המסמך). הוא מכיל שדות כגון קוד התייחסות, כותרת, תאריך, היקף, יוצר.
  • Dublin Core: תקן משותף המורכב מ-15 שדות ליבה לתיאור משאבים דיגיטליים (כותרת, יוצר, נושא, תאריך, ז'אנר, פורמט, מקור, שפה וכו').
  • קופות: אוסף רשומות שנוצר באופן טבעי כתוצאה מפעילות של אדם בודד, משפחה או מוסד בודד. זוהי היחידה המארגנת הבסיסית של ארכיון.
  • מקור (מקור): מידע על מי מגיע המסמך ואיזו יד הוא עבר. בארכיון, מסמכים נשמרים יחד לפי מקורם.

ציון מפורש של תקן היעד כאשר ה-AI מייצר מטא נתונים מבטיח שהפלט ניתן לקלט ישירות בארגון.

מושג מפתח נוסף הוא רישום סמכות - רשומה המגדירה טופס יחיד, סטנדרטי ומאושר של שם של אדם, מקום או מוסד. במסמכים היסטוריים, אותו אדם או מקום עשויים להופיע באיותים שונים; רשומת הרשות מחייבת את כולם לפורמט אחד מאושר כדי שלא יתפזרו בחיפוש. AI מציע שמות ממסמך; אבל מיפוי השם הזה לטופס הסטנדרטי ברשומת הרשות היא עבודת אנוש. קישור בין מה שה-AI אומר "Ahmed" ל-"Ahmed Bey (1840-1912)" ברשומת הסמכות של המוסד שומר על עקביות הקטלוג.

זרימת עבודה: צעד אחר צעד

1. הכינו את המקור. אסוף תמליל או תמונה של המסמך וכל מידע הקשר.

2. זהה את התקן והתחומים. ספר ל-AI איזה תקן (ISAD(G), Dublin Core) ולפי אילו שדות הוא יפיק פלט.

3. צור מטא נתונים של טיוטה. AI ממלא שדות שניתן לחלץ מהמסמך (תאריך, אדם, מקום, נושא, שפה, ז'אנר); זה משאיר ריקים את האזורים שהוא לא יכול להסיר.

4. מפה לאוצר מילים מבוקר. שמות נושאים ומקומות אינם חופשיים ברוב המוסדות, אלא קשורים לרשימה מוגדרת מראש (אוצר מילים מבוקר / תזאורוס). מפה את מונחי הנושא שהוצעו על ידי ה-AI לרשימה זו.

5. אמת ואשר. כל שדה, במיוחד תאריך, שם ונושא, מושווה על ידי בני אדם עם מסמכים ורישומי סמכות.

טיפ: תן במפורש ל-AI הרשאה "להשאיר ריק". אחרת, הוא "ינחש" ימלא תאריך או יוצר שאינם במסמך ויכניס מטא נתונים מזויפים לקטלוג שלך. ההוראה "השאירו שדה זה ריק אם הוא לא במסמך" היא המגן החזק ביותר מפני הזיות.

שדות ורמת אמון בטבלה

שדה מטא נתונים

עד כמה AI אמין?

אימות

שפה

גבוה

מדגם

סוג מסמך

בינוני-גבוה

שליטה

שמות אדם/מקומות

בינוני (שגיאת קריאה)

חובה

תאריך

נמוך-בינוני (סיכון לייצור)

חובה

תנאי הנושא

בינוני (יצירת חינם)

מפה לרשימת בדיקה

היקף/סיכום

בינוני-גבוה

השווה עם מקור

קוד התייחסות

אין (המוסד נותן)

זריקות אנושיות

תקציר: AI מהיר ואמין בתחומים כמו שפה וז'אנר; יוצר טיוטות בשדות כמו תאריך, שם ונושאי, אך נדרש אישור אנושי; בינה מלאכותית אף פעם לא מייצרת תחומים מוסדיים כמו קוד התייחסות.

שלושה מיני תיקים

מקרה 1 - טיוטה של מטא נתונים עבור 8,000 תמונות. ארכיון עירוני קיטלג 8,000 תצלומים היסטוריים. ההערות בגב כל תמונה הועתקו ונמסרו ל-AI; בינה מלאכותית שנוצרה בתאריך, מיקום ומתאר נושא. הצוות האנושי אימת אותו שדה אחר שדה ומייפה אותו לרשימה המבוקרת. משרה מוערכת של 10 חודשים צומצמה ל-3 חודשים; אבל כל תאריך ושם מקום נבדקו ויזואלית.

מקרה 2 - היסטוריה מומצאת. ארכיונאי עשה קטלוג של AI מכתב ללא תאריך. י.ז. עיין בתוכן המכתב וכתב את התאריך "1912" במדויק. עם זאת, לא היה תאריך במסמך; AI חזו. אם הארכיונאי לא היה מוסיף את ההוראה "להשאיר ריק אם לא במסמך", הקטלוג היה מתמלא בתאריך מורכב. שיעור: הרשאה ריקה היא חובה.

מקרה 3 - מונחי נושא חופשיים יצרו בלבול. AI הקצתה מונחים חופשיים דומים אך שונים כגון "הגירה", "הגירה", "התיישבות" למסמכים דומים. כאשר הוא לא מופה לאוצר המילים המבוקר, אותו נושא תויג בשלושה מונחים שונים ופוזר בחיפוש. עקביות הושגה על ידי מיפוי המונחים לרשימת סמכות אחת. שיעור: מונחי נושא אינם מתפרסמים, הם מקושרים לרשימה.

ארבע תבניות הניתנות להעתקה

1) מתווה ליבת דבלין:

חלץ את טיוטת המטא נתונים של Dublin Core מתמלול המסמך למטה. שדות: כותרת, יוצר, נושא, תיאור, תאריך, ז'אנר, שפה, היקף (מיקום/תקופה). כללים: (1) השתמש רק במידע בצורה ברורה בטקסט. (2) השאר את השדה שאינו בטקסט BLANK, אל תנחש. (3) סמן את הערך שאינך בטוח בו ב-[?]. תמלול: [כאן]

2) טיוטת הגדרה ISAD(G):

צור טיוטה עבור המסמך הבא בשדות ISAD(G): כותרת, תאריכים, רמת תיאור (מסמך/קובץ), היקף ותוכן (סיכום קצר), יוצר, שפה. השאר את קוד האסמכתה BLANK (המוסד יספק אותו). אין להוסיף מידע שאינו בטקסט; השאר את השדה הלא קיים ריק. מסמך: [כאן]

3) הצעה למונח נושא (מבוקרת):

הצע 3-5 מונחי נושא המתאימים למסמך למטה. ראשית, הסתמכו על העובדות במסמך. להלן רשימת המינוחים המבוקרת של המוסד שלנו; ראשית, בחר אותו מרשימה זו, אם הוא אינו ברשימה, סמן בנפרד את הצעת המונח החדש שלך. רשימה: [תנאים]. מסמך: [כאן]

4) בדיקת עקביות בתפזורת:

להלן רשומות מטא נתונים עבור מסמכים מאותו אוסף. חוסר עקביות בדגל: רשומות מאייתות שונה של אותו מקום/אדם, פורמטים שונים של תאריכים, מונחים שונים לאותו נושא. תיקון הטלת; פשוט צור רשימה של חוסר עקביות כדי שהאדם יוכל לעיין בו. רשומות: [כאן]

הנחיה חלשה / הנחיה חזקה

חלש:

צור רשומת קטלוג מלאה עבור מסמך זה.

ההוראה "השלמה" דוחפת את ה-AI למלא כל חלל, כלומר, להמציא היסטוריה ויוצרים שאינם קיימים.

חזק:

ליבת דבלין מנוסחת עבור מסמך זה. השתמש רק במידע הכלול בבירור בתמלול; השאר את השדה הלא קיים ריק, אל תנחש. בחר מונחי נושא מהרשימה המבוקרת הזו: [רשימה]. סמן את התאריך ושמות האנשים ב-[?] כדי שאוכל לאמת זאת עם המסמך. תמלול: [כאן]

הבדל: הרשאת "להשאיר ריק" במקום מהדורה "שלמה", עמידה מבוקרת ברשימה וסימני אימות מגנים על הקטלוג מפני ייצור.

טעויות נפוצות

  • זה אומר "למלא אותו לגמרי". זה מוביל לשדות לא קיימים מתאימים; יש לתת הרשאה "להשאיר ריק".
  • שחרור תנאי נושא. מונחים שאינם ממופים לאוצר המילים המבוקר יסיח את דעת החיפוש.
  • לאחר AI לחזות היסטוריה. הזנת תאריך פיקטיבי למסמך ללא תאריך מלכלכת את הקטלוג.
  • קוד ההתייחסות שנוצר על ידי AI. זהו חלל תאגידי וייחודי; אנשים זורקים.
  • לא מפרט את התקן. אם התקן לא מוזכר, הפלט יהיה טיוטה מבולגנת שלא ניתן להזין למוסד.

לסיכום

מטא נתונים וקיטלוג הם התשתית הבלתי נראית שפותחת את הארכיון בפני החוקר, וזה דורש מאמץ רב. מהתמלול, AI מייצר מתאר מהיר לתחומים כמו תאריך, אדם, מקום, נושא וז'אנר; זה יכול לעבוד על פי תקנים כמו ISAD(G) או Dublin Core. אבל הלחץ "להתמלא לגמרי" דוחף את הבינה המלאכותית להמציא דברים; הרשאת "להשאיר ריק", מיפוי לאוצר מילים מבוקר ואישור אנושי של תאריכים/שמות שומרים על אמינותו של הקטלוג. AI מכין את הטיוטה; אתה אחראי על דיוק הקטלוג.

משימת יישום

קח תמלול מסמך ובקש מטא נתונים מה-AI עם תבנית "טיוטת ליבת דובלין"; בדוק שהוא משאיר שדות ריקים שאינם קיימים. לאחר מכן הפעל את התבנית "הצעה למונח נושא" עם רשימת בדיקה משלך (או לדוגמה). לבסוף, בדוק כמה רשומות עם "בדיקת עקביות בכמות גדולה". שימו לב כמה שדות הבינה המלאכותית מנסה לאכלס בחיזוי וכמה מונחי נושא צריך למפות לרשימה.

רשימת בדיקה

  • [ ] ציינתי בבירור את תקן היעד (ISAD(G)/Dublin Core).
  • [ ] נתתי את ההרשאה "להשאיר שדה ריק ריק".
  • [ ] מיפיתי את מונחי הנושא לרשימה המבוקרת.
  • [ ] אימתתי את התאריך ושמות האנשים עם המסמך/רשומה.
  • [ ] השארתי את קוד ההתייחסות למוסד, לא ל-AI.