Прибуток:
- Можливість створення чернеток метаданих відповідно до таких стандартів, як ISAD(G) або Dublin Core зі штучним інтелектом
- Здатність запобігати галюцинаціям і відображати предметні терміни в контрольованому словниковому запасі, не заповнюючи дозвіл
- Можливість розрізняти, які поля, такі як дата, ім’я особи та контрольний код, потребують схвалення людини, а які має призначати лише установа
Архів чи бібліотеку, якими б багатими вони не були, неможливо знайти, якщо вони чітко не визначені. Що робить документ «доступним для пошуку», так це описова інформація про нього: хто його написав, коли, де, яка його тема, до якої колекції він належить. Ця інформація називається метаданими (метадані — описові дані про документ; «дані про дані»). Каталогізація — це процес ідентифікації документів із цими метаданими та збереження їх у пошуковій системі. Класифікація полягає в упорядкуванні документів за такими критеріями, як предмет, тип або походження.
Створення метаданих займає надзвичайно багато часу; Введення інформації про дату, тему, особу та місце окремо для тисяч документів у великих колекціях може зайняти роки. ШІ є потужним генератором проектів у цьому бізнесі. У цьому розділі ми побачимо, як генерувати метадані за допомогою штучного інтелекту, каталогізувати відповідно до стандартів (ISAD(G), Dublin Core), а також розглянемо потужність і недоліки автоматичної класифікації.
Архівні стандарти: навіщо вони потрібні
Метадані не вводяться випадково; Існують міжнародні стандарти, завдяки яким записи з різних установ можуть спілкуватися між собою:
- ISAD(G) (Загальний міжнародний стандартний архівний опис): Правила ієрархічного опису архівних матеріалів (на рівні фонду, серії, справи, документа). Він містить такі поля, як код посилання, назва, дата, обсяг, творець.
- Dublin Core: загальний стандарт, що складається з 15 основних полів для опису цифрових ресурсів (назва, автор, тема, дата, жанр, формат, джерело, мова тощо).
- Фонди: Набір записів, природним чином сформованих у результаті діяльності однієї особи, сім’ї чи установи. Це основна організаційна одиниця архівної справи.
- Походження (походження): інформація про те, від кого походить документ і через кого він перейшов. В архіві документи зберігаються разом за походженням.
Явне вказівка цільового стандарту, коли штучний інтелект створює метадані, гарантує, що результати можна буде безпосередньо ввести в підприємство.
Іншим ключовим поняттям є авторитетний запис — запис, який визначає єдину стандартну затверджену форму назви особи, місця чи установи. В історичних документах одна й та сама особа чи місце можуть з’являтися по-різному; Авторитетний запис об’єднує їх усіх в єдиний затверджений формат, щоб вони не розпорошувалися під час пошуку. AI пропонує імена з документа; але зіставлення цього імені зі стандартною формою в авторитетному записі є людською роботою. Пов’язування того, що AI каже «Ахмед» з «Ахмед-бей (1840-1912)» в авторитетному записі установи зберігає узгодженість каталогу.
Хід роботи: крок за кроком
1. Підготуйте джерело. Зберіть стенограму або зображення документа та будь-яку контекстну інформацію.
2. Визначте стандарт і області. Скажіть ШІ, який стандарт (ISAD(G), Dublin Core) і відповідно до яких полів він вироблятиме вихід.
3. Створіть чернетку метаданих. ШІ заповнює поля, які можна витягти з документа (дата, особа, місце, тема, мова, жанр); Він залишає порожніми ті області, які не може видалити.
4. Карта до контрольованого словника. Назви предметів і місць не є безкоштовними в більшості закладів, але прив’язані до попередньо визначеного списку (контрольований словник / тезаурус). Зіставте предметні терміни, запропоновані ШІ, до цього списку.
5. Перевірити та підтвердити. Кожне поле, особливо дата, ім’я та тема, порівнюються людьми з документами та авторитетними записами.
Порада: явно дайте ШІ дозвіл «залишити порожнім». Інакше він «вгадає» дату чи автора, якого немає в документі, і вставляє підроблені метадані у ваш каталог. Вказівка «Залиште це поле порожнім, якщо його немає в документі» — найсильніший щит від галюцинацій.
Поля та рівень довіри в таблиці
Поле метаданих
Наскільки надійний ШІ?
перевірка
мова
висока
зразок
Тип документа
середньо-високий
контроль
Назви осіб/місць
Середній (помилка читання)
обов'язковий
дата
Низький-середній (ризик фабрикації)
обов'язковий
Тематичні умови
Середній (вільне генерування)
Карта до контрольного списку
Обсяг/резюме
середньо-високий
Порівняйте з джерелом
Довідковий код
Жодного (заклад надає)
людські кидки
Підсумок: штучний інтелект швидкий і надійний у таких сферах, як мова та жанр; створює чернетки в таких полях, як дата, ім’я та тема, але потрібне схвалення людини; ШІ ніколи не створює інституційні поля, такі як довідковий код.
три міні-чохла
Випадок 1 — Чернетки метаданих для 8000 фотографій. Міський архів каталогізував 8000 історичних фотографій. Примітки на звороті кожної фотографії були переписані та передані ШІ; AI створив дату, місце та план теми. Команда людей перевіряла це поле за полем і відображала його в контрольованому списку. Приблизну 10-місячну роботу скоротили до 3 місяців; але кожну дату та назву місця перевіряли візуально.
Випадок 2 — Вигадана історія. Архіваріус мав ШІ каталог недатованого листа. Ю. З. подивився на зміст листа і точно написав дату «1912». Проте дати в документі не було; AI передбачив. Якби архіваріус не додав вказівку «залишити порожнім, якщо немає в документі», каталог був би заповнений вигаданою датою. Урок: порожній дозвіл обов’язковий.
Випадок 3. Безкоштовні предметні терміни створили плутанину. AI присвоїв подібним документам подібні, але різні безкоштовні терміни, такі як «імміграція», «імміграція», «поселення». Якщо вона не була зіставлена з контрольованим словником, та сама тема була позначена трьома різними термінами та розкидана під час пошуку. Узгодженості було досягнуто шляхом відображення термінів у єдиному авторитетному списку. Урок: терміни теми не розголошуються, вони за посиланням у списку.
Чотири шаблони, які можна копіювати
1) Структура Дублінського ядра:
Витягніть чернетку метаданих Dublin Core із наведеної нижче транскрипції документа. Поля: Назва, Творець, Тема, Опис, Дата, Жанр, Мова, Сфера (місце/період). Правила: (1) Використовуйте інформацію в тексті лише ЧІТКО. (2) Залиште поле, якого немає в тексті, ПУСТИМ, не вгадуйте. (3) Позначте значення, у якому ви не впевнені, [?]. Транскрипція: [тут]
2) Проект визначення ISAD(G):
Створіть чернетку для такого документа в полях ISAD(G): Назва, Дата(и), Рівень опису (документ/файл), Область і зміст (коротке резюме), Творець, Мова. Код посилання залиште ПУСТИМ (його надасть установа). Не додавайте інформацію, якої немає в тексті; Залиште неіснуюче поле порожнім. Документ: [тут]
3) Пропозиція терміна теми (контрольована):
Запропонуйте 3-5 тематичних термінів, які відповідають наведеному нижче документу. По-перше, спирайтеся на факти в документі. Нижче наведено список контрольованої термінології нашої установи; СПОЧАТКУ виберіть його з цього списку, якщо його немає в списку, позначте свій новий термін окремо. Список: [терміни]. Документ: [тут]
4) Масова перевірка узгодженості:
Нижче наведено записи метаданих для документів із однієї колекції. Неузгодженість прапорців: записи, де те саме місце/особа написані по-різному, різні формати дати, різні терміни для тієї самої теми. Корекція НАВ'ЯЗАННЯ; Просто створіть список невідповідностей для перегляду людиною. Записи: [тут]
Слабка підказка / Сильна підказка
Слабкий:
Створіть повний каталожний запис для цього документа.
«Повна» інструкція змушує ШІ заповнювати кожне місце, тобто вигадувати історію та творців, яких не існує.
Сильний:
Дублінське ядро розроблено для цього документа. Використовуйте лише інформацію, ЧІТКО включену в транскрипцію; залиште неіснуюче поле порожнім, не вгадуйте. Виберіть терміни теми з цього контрольованого списку: [список]. Позначте дату та імена осіб [?], щоб я міг перевірити це за допомогою документа. Транскрипція: [тут]
Відмінність: дозвіл «залишити порожнім» замість «повного» видання, контрольоване дотримання списку та позначки перевірки захищають каталог від фальсифікації.
Поширені помилки
- Це означає «заповнити його повністю». Це призводить до підгонки неіснуючих полів; має бути надано дозвіл «залишити порожнім».
- Звільнення предметних умов. Терміни, які не відповідають контрольованому словнику, відволікатимуть пошук.
- Наявність ШІ передбачення історії. Введення фіктивної дати в недатований документ забруднює каталог.
- Наявність еталонного коду, згенерованого ШІ. Це корпоративний, унікальний простір; люди кидають.
- Не вказуючи стандарт. Якщо стандарт не буде згадано, на виході буде брудна чернетка, яку неможливо ввести в установу.
Підсумовуючи
Метадані та каталогізація — це невидима інфраструктура, яка відкриває архів для дослідника, і для цього потрібно багато зусиль. З транскрипції ШІ створює швидкий план для таких полів, як дата, особа, місце, тема та жанр; Він може працювати відповідно до таких стандартів, як ISAD(G) або Dublin Core. Але тиск «повністю заповнити» штовхає ШІ виправляти речі; Дозвіл «залишити порожнім», зіставлення з контрольованим словником і підтвердження дат/імен людиною забезпечують надійність каталогу. АІ готує проект; Ви несете відповідальність за достовірність каталогу.
Аплікаційне завдання
Зробити транскрипцію документа та запитати метадані в ШІ за допомогою шаблону «Dublin Core draft»; Переконайтеся, що він залишає порожні поля, яких не існує. Потім запустіть шаблон «пропозиція терміна теми» з вашим власним (або зразком) контрольним списком. Нарешті перевірте кілька записів за допомогою «масової перевірки узгодженості». Зверніть увагу, скільки полів штучний інтелект намагається заповнити прогнозом і скільки предметних термінів потрібно відобразити в списку.
контрольний список
- [ ] Я чітко вказав цільовий стандарт (ISAD(G)/Dublin Core).
- [ ] Я надав дозвіл «Залишити порожнє поле порожнім».
- [ ] Я зіставив терміни теми з контрольованим списком.
- [ ] Я перевірив дату та імена осіб у документі/записі органу влади.
- [ ] Я залишив довідковий код установі, а не ШІ.