רווחים:
- יכולת לקצר את זמן הקטלוג על ידי הפקת טיוטה של מטא נתונים בהתאם לסטנדרטים כמו MARC ו-Dublin Core ממידע חותם אמיתי
- יכולת לאמת שדות עם סיכון גבוה לייצור, כגון שנת פרסום, ISBN, שם המחבר, עם המקור המקורי ומונחי הנושא של המפה מאוצר המילים המבוקר
- יכולת להפוך פורמטים של מחבר ונושא לאישור יחיד עם בקרת סמכות ולשמור על עקביות קטלוגית
קטלוג הוא התפקיד הבלתי נראה אך הבסיסי ביותר של ספרנות. גילוי של משאב (ספר, מאמר, מפה, הקלטת קול, קובץ דיגיטלי) אפשרי עם המטא נתונים הנכונים. מטא נתונים פירושם "נתונים על נתונים": מידע מובנה המתאר את כותרת המשאב, המחבר, שנת הפרסום, הנושא, השפה והמאפיינים הפיזיים של משאב. אם המטא נתונים טובים, המשתמש מוצא את המשאב; אם הוא רע או לא שלם, המשאב הולך לאיבוד גם אם הוא קיים. ביחידה זו תלמד כיצד להשתמש בבינה מלאכותית ביצירת טיוטה של מטא נתונים, אך כיצד להבטיח תאימות ודיוק בתקנים.
תחילה נגדיר את שני המושגים. MARC (Machine-Readable Cataloging) הוא פורמט רשומות שספריות השתמשו בו במשך עשרות שנים שממקם כל פיסת מידע בשדות ממוספרים; לדוגמה, שדה 245 מכיל את הכותרת ושדה 100 מכיל את המחבר הראשי. Dublin Core הוא תקן מטא נתונים מפושט למשאבים דיגיטליים, המורכב מ-15 שדות בסיסיים (כותרת, יוצר, נושא, תאריך, ז'אנר וכו'). תקנים אלה מבטיחים שרשומות מספריות שונות יכולות לדבר זה עם זה.
שלב אחר שלב: יצירת טיוטה של מטא נתונים עם בינה מלאכותית
1. אסוף את פרטי הזהות של המקור. כריכת הספר, עמוד השער, התוכן או הטקסט של קובץ דיגיטלי. AI עובד רק מהמידע שאתה נותן לו; אם אתה מספק מידע חלקי, הוא מייצר מטא נתונים חלקיים או מפוברקים.
2. ציין את תקן היעד. תן ל-AI יעד ברור, כגון "לפי שדות ליבה של דבלין" או "לפי MARC 245, 100, 260, 650 שדות." אם אינך מציין תקן, הוא מייצר פורמט שרירותי.
3. הפק את הטיוטה. AI מנסח את הכותרת, הצהרת האחריות, מידע הפרסום והצעת הנושא מהמידע שאתה מספק.
4. הפעלת בקרת סמכות. תיעוד סמכותי הוא כזה שמקבע את הצורה היחידה והסטנדרטית של שם, מוסד או נושא של מחבר (למשל, "אטטורק, מוסטפא כמאל, 1881-1938"). AI יכול לכתוב שם בדרכים שונות; אתה בודק ומתקן את פורמט הרשות המאושרת.
5. אמת ואשר. השווה כל שדה למקור המקורי. בפרט, מידע מדויק כגון שנת פרסום, ISBN ושם המחבר רגישים מאוד לזיוף על ידי AI.
רמז: תן ל-AI תמונה או טקסט של דף הקרדיט בפועל של המקור; אל תגיד "נחש את שם הספר". מטא נתונים חזויים מערערים את מהימנות הקטלוג. AI כותב בביטחון בעת ביצוע תחזיות, וזה יטעה אותך.
אוצר מילים מבוקר ועקביות
עקביות היא הכל בקטלוג. אם אותו נושא נכתב עם שני מונחים שונים בשתי רשומות שונות, המשתמש ימצא אחד ויחמיץ את השני. זו הסיבה שספריות משתמשות באוצר מילים מבוקר - רשימה מאושרת וסטנדרטית של מונחים. כאשר מציעים מונחים מטקסט חופשי, בינה מלאכותית יכולה לבחור את המקבילה הדיבורית שלו ולא את המונח הרשמי ברשימה זו. לדוגמה, ה-AI עשוי לכתוב "התקף לב"; ואילו המונח המאושר עשוי להיות "אוטם שריר הלב".
הפתרון הוא לתת ל-AI את אוצר המילים הנשלט ולהגיד "פשוט בחר מהרשימה הזו". אז במקום להמציא תנאים באופן חופשי, הבינה המלאכותית תואמת את המתאים ביותר מהרשימה המאושרת.
זהירות: אם מונח נושא שהוצע על ידי AI אינו נמצא באוצר המילים המבוקר, אל תוסיף מונח זה לקטלוג. ההחלטה על הוספת תנאים חדשים נתונה בידי המומחה האחראי על ניהול הרשות; הוספת מונחים שרירותיים משבשת את העקביות של הקטלוג.
שלושה מיני תיקים
מקרה 1 - איסוף תרומות מואץ. ספרייה ציבורית קיבלה תרומה של 1,200 ספרים. מומחה הקטלוג גרם ל-AI לקרוא את דף ההחתמה של כל ספר ולהפיק טיוטה של ליבת דבלין; זמן הקלטה ירד מ-9 דקות ל-3.5 דקות. המומחה הקדיש את יתרת הזמן לבדיקת סמכות ואימות; הזמן הכולל צומצם בכ-55%, אך אף רשומה לא נכנסה למערכת ללא אימות.
מקרה 2 - נתפס ISBN מזויף. מומחה גרם לבינה מלאכותית לייצר טיוטות של 30 ספרים. במהלך הבדיקה הוא גילה שה-ISBN ב-4 רשומות מזויף: AI כתב מספר בן 13 ספרות שנראה הגיוני, למרות שהוא לא ידע את המספר האמיתי של הספר. שלב האימות מנע מארבעה מספרי ISBN שגויים להיות מתמידים בקטלוג.
מקרה 3 - חוסר עקביות ברשות תוקנה. ספרייה מצאה מחבר בשם "J. Smith" בחלק מהרשומות, "John Smith" באחרים, "Smith, John" באחרים. בינה מלאכותית הותאמה לקובץ הסמכות, והביאה את כל הרשומות לפורמט אחד מאושר ("סמית, ג'ון, 1965-"); אם העבודה הזו הייתה מבוצעת באופן ידני, זה היה לוקח ימים, אבל עם הצעת הבינה המלאכותית, זה צומצם לכמה שעות, אבל כל התאמה אושרה על ידי המומחה.
המרה בדיעבד ורשומות ישנות
לספריות רבות יש רשומות לא שלמות או מיושנות שהוזנו לפני שנים עם כללים שונים. העברת אלה לתקן הנוכחי נקראת המרה רטרוספקטיבית והיא מייגעת מאוד כאשר היא נעשית באופן ידני. ה-AI יכול לקרוא רשומה ישנה וליצור טיוטה כדי להעביר אותה למבנה השדות הנוכחי: למשל, הוא יכול לנתח ציטוט בטקסט חופשי ולהפיץ אותו לשדות הנכונים. עם זאת, יש כאן שתי סכנות. ראשית, AI יכול להמציא מידע חסר כדי "להשלים"; שנית, הוא עשוי להנציח שגיאה ברשומה הישנה על ידי העתקתה לפורמט חדש במקום לתקן אותה. לכן, בטרנספורמציה בדיעבד, יש לבדוק את הפלט של AI באופן שיטתי, לא על ידי דגימה, אלא על ידי שדות קריטיים (מחבר, שנה, מספרים מזהים). תרגול טוב הוא להציג רשומות לפני ואחרי המרה זו לצד זו, מה שהופך כל שינוי לגלוי; כך שהמומחה יכול לראות במבט חטוף מה הוזז, מה השתנה ומה עשוי להיות מפוברק.
שימו לב: אין להעביר את טיוטת המטא-נתונים המיוצרים על ידי ה-AI למערכת כאצווה מבלי לבדוק אותם אחד אחד. שגיאה המונית משחיתה מאות רשומות בבת אחת, והשליפה היא הרבה יותר מטרידה מהפקה. הכי בטוח לייצר ולאמת במנות קטנות.
ארבע תבניות הניתנות להעתקה
1) מתווה ליבת דבלין:
תפקידך: עוזר מקטלג. מלא את השדות של Dublin Core מתוך הטקסט הבא: כותרת, יוצר, נושא, תיאור, מוציא לאור, תאריך, ז'אנר, פורמט, שפה. השתמש רק במידע ברור בטקסט; השאר את השדה החסר "[אין מידע]", אל תנחש. טקסט חותם: [כאן]
2) מתאר שדה MARC:
הצע קווי מתאר לשדות MARC הבאים ממידע הספר להלן: 245 (כותרת/קרדיט), 100 (מחבר ראשי), 260/264 (פרסום),300 (תיאור פיזי), 650 (נושא). סמן כל שדה שאינך בטוח בו כ"[דרוש אימות]". מידע: [כאן]
3) התאמת נושאים מאוצר מילים מבוקר:
להלן תקציר המקור ורשימת מונחי נושא מאושרים. התאימו רק את 3-5 המונחים המתאימים ביותר מהרשימה למקור. אם אין מונח מתאים ברשימה, כתוב "אין מונח מתאים ברשימה", אל תמציא מונחים חדשים. סיכום: [כאן] / רשימת מונחים: [כאן]
4) בקרת טופס רשות:
התאם את שמות המחבר למטה עם הטפסים המאושרים ברשימת הסמכות שסיפקתי. לכל שם: פורמט ברשומה -> פורמט מאושר. אם אין מקבילה ברשימה, כתוב "אין רשומת סמכות". שמות: [כאן] / רשימת סמכויות: [כאן]
הנחיה חלשה / הנחיה חזקה
הנחיה חלשה:
חלץ את מידע הקטלוג של הספר הבא: "בינה מלאכותית וחברה".
רק הכותרת ניתנת; ה-AI נאלץ להרכיב את המחבר, השנה, המוציא לאור וה-ISBN. אין תקן יעד. תוצאה: שיא משכנע אך כנראה שקרי.
הנחיה עוצמתית:
תפקידך: עוזר מקטלג. להלן הטקסט המלא של דף ההטבעה של הספר. מלא את השדות של Dublin Core מכאן. השתמש רק במידע שצוין בבירור בטקסט; השאר את השדה הלא-טקסט ריק וכתוב "[אין מידע]". אין תאריכים, שמות או מספרי ISBN. טקסט חותם: [טקסט מלא כאן]
ההנחיה העוצמתית מגבילה את הבינה המלאכותית למידע אמיתי ומאלצת אותו להשאיר בכנות ריקים במקום להמציא אותם.
שדה מטא נתונים וטבלת אימות
אזור
סכנת ייצור
איך לאמת
כותרת
נמוך
השווה עם דף הטבעה
פורמט מחבר/רשות
בינוני
חפש בתיק סמכות
שנת פרסום
גבוה
אשר באמצעות חותם/קולופון
ISBN
גבוה מאוד
שליטה אחד על אחד עם ברקוד/מקור
מונח נושא
גבוה
התאמה באוצר מילים מבוקר
טעויות נפוצות
- רק מבקש מטא נתונים מהכותרת. מידע לא שלם מניע את AI להמציא דברים.
- לא מפרט את תקן היעד. עיצוב שרירותי משבש את ההרמוניה של הרשומות.
- קבלת ה-ISBN והשנה מבלי לאמת זאת. אזורים אלה נושאים את הסיכון הגבוה ביותר לייצור.
- לקיחת מונח הנושא מחוץ לאוצר המילים הנשלט. עקביות וזמינות נפגעים.
- עקיפת בקרת סמכות. אותו מחבר מתפזר בפורמטים שונים, המשתמש מפספס את המקור.
לסיכום
ביצירת מטא נתונים, בינה מלאכותית היא עוזר רב עוצמה המחלץ במהירות מידע טביעה ומקצר משמעותית את זמן הקטלוג. אבל מחיר הפרודוקטיביות הוא אימות קפדני מול הסיכונים של ייצור: הפוך את תקן היעד (MARC, Dublin Core) ברור, הפעל את ה-AI רק עם ידע אמיתי של מילות מילה, מפה מונחי נושא מאוצר מילים מבוקרים, ותקף טפסי סמכות. במקום להשלים את הפערים, ה-AI צריך להשאיר אותו ריק בכנות; אתה שומר את האישור הסופי.
משימת יישום
תן את הטקסט של דף ההחתמה של ספר אמיתי שיש לך ל-AI עם תבנית "טיוטת ליבת דובלין" וקבל טיוטה. לאחר מכן, הפקו את אותו ספר רק עם הכותרת ("הנחיה חלשה") והשוו בין שתי התפוקות: אילו שדות יוצרו? לאחר מכן, עם התבנית "מיפוי נושא מאוצר מילים מבוקר", תן רשימה קצרה של מונחים מאושרים כדי להתאים את הנושא ולבדוק אם ה-AI יוצא מהרשימה.
רשימת בדיקה
- [ ] נתתי את מידע הזהות האמיתי של המקור ל-AI, לא השארתי את זה לניחוש.
- [ ] ציינתי בבירור את תקן המטא נתונים של היעד (MARC/Dublin Core).
- [ ] אימתתי את שנת הפרסום ואת ISBN מילה במילה עם המקור המקורי.
- [ ] מיפיתי את מונחי הנושא מתוך אוצר המילים המבוקר.
- [ ] אישרתי את צורות הסמכות עם הרשומה המאושרת.