единица 2 / 11

Изкуствен интелект в каталогизирането и генерирането на метаданни

Печалби:

  • Възможност за съкращаване на времето за каталогизиране чрез създаване на чернови на метаданни в съответствие със стандарти като MARC и Dublin Core от реална информация за отпечатъци
  • Възможност за проверка на полета с висок риск от измисляне, като година на публикуване, ISBN, име на автор, с оригиналния източник и картографиране на предметни термини от контролирания речник
  • Възможност за създаване на авторски и тематични формати с единично одобрение с контрол на авторитета и поддържане на последователност на каталога

Каталогизирането е невидимата, но най-фундаменталната работа на библиотекарството. Откриването на ресурс (книга, статия, карта, звукозапис, цифров файл) е възможно с правилните метаданни. Метаданните означават „данни за данните“: структурирана информация, която описва заглавието на ресурса, автора, годината на публикуване, темата, езика и физическите атрибути. Ако метаданните са добри, потребителят намира ресурса; Ако е лош или непълен, ресурсът се губи, дори и да съществува. В този модул ще научите как да използвате изкуствения интелект при генерирането на чернови на метаданни, но и как да гарантирате съответствие и точност на стандартите.

Нека първо дефинираме двете понятия. MARC (Machine-Readable Cataloging) е формат на запис, който библиотеките използват от десетилетия, който поставя всяка част от информацията в номерирани полета; Например поле 245 съдържа заглавието, а поле 100 съдържа основния автор. Dublin Core е опростен стандарт за метаданни за цифрови ресурси, състоящ се от 15 основни полета (заглавие, създател, тема, дата, жанр и т.н.). Тези стандарти гарантират, че записите от различни библиотеки могат да общуват помежду си.

Стъпка по стъпка: генериране на чернови на метаданни с изкуствен интелект

1. Съберете информация за самоличността на източника. Корицата на книгата, заглавната страница, съдържанието или текстът на цифров файл. AI работи само от информацията, която му давате; Ако предоставите непълна информация, това създава непълни или изфабрикувани метаданни.

2. Посочете целевия стандарт. Дайте на AI ясна цел, като например „по полета на Dublin Core“ или „по полета MARC 245, 100, 260, 650“. Ако не посочите стандарт, той създава произволен формат.

3. Изгответе черновата. AI съставя заглавие, декларация за отговорност, информация за публикация и предложение за тема от информацията, която предоставяте.

4. Упражнявайте авторитетен контрол. Достоверен запис е този, който установява единната, стандартна форма на името на автора, институцията или темата (напр. „Ататюрк, Мустафа Кемал, 1881-1938“). AI може да напише име по различни начини; Вие проверявате и коригирате одобрения формат на пълномощията.

5. Проверете и потвърдете. Сравнете всяко поле с оригиналния източник. По-специално, точна информация като година на издаване, ISBN и име на автора са много податливи на фалшифициране от AI.

Подсказка: дайте на AI снимка или текст на действителната кредитна страница на източника; Не казвайте „познайте името на книгата“. Предсказуемите метаданни подкопават надеждността на каталога. AI пише уверено, когато прави прогнози и това ще ви подведе.

Контролиран речник и последователност

Последователността е всичко в каталогизирането. Ако една и съща тема е написана с два различни термина в два различни записа, потребителят ще намери единия и ще пропусне другия. Ето защо библиотеките използват контролиран речник — одобрен, стандартен списък с термини. Когато предлага термини от свободен текст, AI може да избере техния разговорен еквивалент, а не официалния термин в този списък. Например AI може да напише „сърдечен удар“; като има предвид, че одобреният термин може да бъде „инфаркт на миокарда“.

Решението е да дадете на AI контролирания речник и да кажете „просто изберете от този списък“. Така че вместо да измисля условия свободно, AI съвпада с най-подходящия от одобрения списък.

Внимание: Ако предметен термин, предложен от AI, не е в контролирания речник, не добавяйте този термин към каталога. Решението за добавяне на нови термини е на експерта, отговорен за управлението на авторитета; Добавянето на произволни термини нарушава последователността на каталога.

три мини калъфа

Случай 1 — Ускорено събиране на дарения. Обществена библиотека получи дарение от 1200 книги. Специалистът по каталогизиране накара AI да прочете отпечатъка на всяка книга и да създаде чернова на Дъблинското ядро; Времето за запис намаля от 9 минути на 3,5 минути. Експертът посвети оставащото време на авторитетна проверка и проверка; Общото време е намалено с приблизително 55%, но нито един запис не е влязъл в системата, без да бъде проверен.

Случай 2 — Хванат фалшив ISBN номер. Експерт накара AI да създаде чернови на 30 книги. По време на проверката той установи, че ISBN в 4 записа е фалшив: AI е написал 13-цифрено число, което изглежда разумно, въпреки че не знае истинския номер на книгата. Стъпката на проверка предотврати четири неправилни ISBN номера да станат постоянни в каталога.

Случай 3 — Коригирано несъответствие в органа. Библиотека откри автор като „J. Smith“ в някои записи, „John Smith“ в други, „Smith, John“ в трети. AI беше съпоставен с авторитетния файл, привеждайки всички записи в един одобрен формат („Smith, John, 1965-“); Ако тази работа се извършваше ръчно, щеше да отнеме дни, но с предложението на AI беше намалена до няколко часа, но всяко съвпадение беше одобрено от експерта.

Ретроспективно преобразуване и стари записи

Много библиотеки имат непълни или остарели записи, които са въведени преди години с различни правила. Преместването им към текущия стандарт се нарича ретроспективно преобразуване и е много трудоемко, когато се извършва ръчно. AI може да прочете стар запис и да генерира чернова, за да го премести в текущата структура на полето: например може да анализира цитат в свободен текст и да го разпространи в правилните полета. Тук обаче има две опасности. Първо, AI може да компенсира липсващата информация, за да „навакса“; второ, може да увековечи грешка в стария запис, като го копира в нов формат, вместо да го коригира. Следователно при ретроспективна трансформация изходът от AI трябва да се проверява систематично, не чрез извадка, а чрез критични полета (автор, година, идентификационни номера). Добра практика е записите преди и след преобразуването да се показват един до друг, правейки всяка промяна видима; така че експертът може да види с един поглед какво е преместено, какво се е променило и какво може да е изфабрикувано.

Внимание: Черновите метаданни, произведени от AI не трябва да се прехвърлят към системата като партида, без да са прегледани един по един. Масова грешка поврежда стотици записи наведнъж и извличането е много по-обезпокоително от създаването. Най-безопасно е да се произвежда и проверява в малки партиди.

Четири копируеми шаблона

1) Очертание на Dublin Core:

Вашата роля: помощник каталогизатор. Попълнете полетата на Dublin Core от следния авторски текст: Заглавие, Създател, Тема, Описание, Издател, Дата, Жанр, Формат, Език. Използвайте само информация, която е ясна в текста; Оставете липсващото поле "[няма информация]", не предполагайте. Текст на отпечатъка: [тук]

2) Очертание на MARC полето:

Предложете очертания за следните MARC полета от информацията за книгата по-долу: 245 (заглавие/авторство), 100 (основен автор), 260/264 (публикация), 300 (физическо описание), 650 (тема). Маркирайте всяко поле, за което не сте сигурни, като „[нуждае се от проверка]“. Информация: [тук]

3) Съвпадение на теми от контролиран речник:

По-долу има резюме на източника и списък с одобрени термини по теми. Свържете само 3-5 най-подходящи термина от списъка с източника. Ако в списъка няма подходящ термин, напишете "няма подходящ термин в списъка", не измисляйте нови термини. Резюме: [тук] / Списък с термини: [тук]

4) Контрол на формата за пълномощия:

Свържете имената на авторите по-долу с одобрените формуляри в списъка с авторитети, който предоставих. За всяко име: формат в запис -> одобрен формат. Ако в списъка няма еквивалент, напишете „няма авторитетен запис“. Имена: [тук] / Списък на органите: [тук]

Слаба подкана / Силна подкана

Слаба подкана:

Извлечете каталожната информация за следната книга: „Изкуствен интелект и общество“.

Дава се само заглавието; AI ​​е принуден да състави автора, годината, издателя и ISBN. Няма целеви стандарт. Резултат: убедителен, но вероятно фалшив запис.

Мощна подкана:

Вашата роля: помощник каталогизатор. По-долу е пълният текст на началната страница на книгата. Попълнете полетата на Dublin Core от това. Използвайте само информация, която е ясно посочена в текста; Оставете полето без текст празно и напишете „[няма информация]“. Не са измислени дати, имена или ISBN номера. Текст на отпечатъка: [пълният текст тук]

Мощната подкана ограничава изкуствения интелект до информация за реалния автор и го принуждава честно да оставя празни места, вместо да ги измисля.

Поле за метаданни и валидираща таблица

площ

Риск от фабрикуване

Как да проверите

Заглавие

ниско

Сравнете със страницата на отпечатъка

Формат на автор/орган

среден

Търсене в авторитетен файл

Година на издаване

високо

Потвърдете с отпечатък/колофон

ISBN

много високо

Едно към едно управление с баркод/източник

Предметен термин

високо

Съвпадение в контролирания речник

Често срещани грешки

  • Просто искане на метаданни от заглавието. Непълната информация кара AI да измисля нещата.
  • Без уточняване на целевия стандарт. Произволното форматиране нарушава хармонията на записите.
  • Приемане на ISBN и година без проверка. Тези области носят най-висок риск от фабрикуване.
  • Вземане на предметния термин извън контролирания речник. Съгласуваността и достъпността са компрометирани.
  • Заобикаляйки контрола на властта. Един и същи автор се разпръсква в различни формати, потребителят пропуска източника.

В обобщение

При генерирането на метаданни AI е мощен помощник, който бързо извлича информация за отпечатъци и значително съкращава времето за каталогизиране. Но цената на производителността е стриктно валидиране срещу рисковете от фабрикуване: направете целевия стандарт (MARC, Dublin Core) ясен, стартирайте AI само с реални познания на думи, картографирайте предметни термини от контролирани речници и валидирайте авторитетни формуляри. Вместо да компенсира пропуските, AI трябва честно да го остави празно; Вие запазвате окончателното одобрение.

Задача за приложение

Дайте текста на страницата с отпечатъци на истинска книга, която имате, на AI с шаблона „Dublin Core draft“ и получете чернова. След това създайте същата книга само със заглавието („Слаба подкана“) и сравнете двата резултата: кои полета са били измислени? След това с шаблона „Картографиране на теми от контролиран речник“ дайте кратък списък с одобрени термини, за да съвпаднете с темата и проверете дали AI изчезва от списъка.

контролен списък

  • [ ] Дадох истинската информация за самоличността на източника на AI, не го оставих на отгатване.
  • [ ] Ясно посочих целевия стандарт за метаданни (MARC/Dublin Core).
  • [ ] Проверих годината на издаване и ISBN дословно с оригиналния източник.
  • [ ] Картографирах термините на темата от контролирания речник.
  • [ ] Потвърдих формите на пълномощията с одобрения запис.