Единица 4 / 12

Метаданные, каталогизация и классификация

Прибыль:

  • Возможность создавать проекты метаданных в соответствии с такими стандартами, как ISAD(G) или Dublin Core, с использованием искусственного интеллекта.
  • Способность предотвращать галлюцинации и сопоставлять предметные термины с контролируемым словарным запасом с разрешением оставлять пустыми.
  • Способность различать, какие поля, такие как дата, имя человека и ссылочный код, требуют одобрения человека, а какие должны назначаться только учреждением.

Архив или библиотеку, какими бы богатыми они ни были, невозможно найти, если они не определены четко. Что делает документ «обнаружимым», так это описательная информация о нем: кто его написал, когда, где, какова его тема, к какой коллекции он принадлежит. Эта информация называется метаданными (metadata — описательные данные о документе; «данные о данных»). Каталогизация — это процесс идентификации документов с помощью этих метаданных и сохранения их в системе с возможностью поиска. Классификация заключается в организации документов по таким критериям, как предмет, тип или происхождение.

Создание метаданных занимает чрезвычайно много времени; Ввод даты, темы, лица и места по отдельности для тысяч документов в больших коллекциях может занять годы. ИИ — сильный генератор тяги в этом бизнесе. В этом модуле мы увидим, как генерировать метаданные с помощью ИИ, каталогизировать их в соответствии со стандартами (ISAD(G), Dublin Core), а также возможности и недостатки автоматической классификации.

Архивные стандарты: зачем они нужны

Метаданные не вводятся случайным образом; Существуют международные стандарты, позволяющие записям из разных учреждений общаться друг с другом:

  • ISAD(G) (Общий международный стандарт архивного описания): Правила иерархического описания архивного материала (на уровне фонда, серии, файла, документа). Он содержит такие поля, как ссылочный код, название, дата, область применения, создатель.
  • Дублинское ядро: общий стандарт, состоящий из 15 основных полей для описания цифровых ресурсов (название, создатель, тема, дата, жанр, формат, источник, язык и т. д.).
  • Фонды: совокупность записей, естественным образом образовавшаяся в результате деятельности одного человека, семьи или учреждения. Это основная организационная единица архивирования.
  • Провенанс (происхождение): информация о том, от кого исходит документ и через какие руки он прошел. При архивировании документы хранятся вместе в соответствии с их происхождением.

Явное указание целевого стандарта при создании метаданных ИИ гарантирует, что выходные данные будут напрямую введены в предприятие.

Еще одним ключевым понятием является авторитетная запись — запись, определяющая единую стандартную утвержденную форму имени человека, места или учреждения. В исторических документах один и тот же человек или место могут фигурировать в разном написании; Авторитетная запись связывает их все в единый утвержденный формат, чтобы они не разбрасывались при поиске. ИИ предлагает имена из документа; но сопоставление этого имени со стандартной формой авторитетной записи — это человеческая работа. Связывание того, что ИИ говорит «Ахмед» с «Ахмед-беем (1840-1912)» в авторитетной записи учреждения, сохраняет согласованность каталога.

Рабочий процесс: шаг за шагом

1. Подготовьте исходник. Соберите расшифровку или изображение документа и любую контекстную информацию.

2. Определите стандарт и области. Сообщите ИИ, какой стандарт (ISAD(G), Dublin Core) и по каким полям он будет выдавать выходные данные.

3. Создайте черновой вариант метаданных. ИИ заполняет поля, которые можно извлечь из документа (дата, персона, место, тема, язык, жанр); Он оставляет пустыми области, которые не может удалить.

4. Карта контролируемого словарного запаса. Названия предметов и топонимов в большинстве учреждений не являются бесплатными, а привязаны к заранее определенному списку (контролируемому словарю/тезаурусу). Сопоставьте с этим списком предметные термины, предложенные ИИ.

5. Проверьте и подтвердите. Каждое поле, особенно дата, имя и тема, сравниваются людьми с документами и авторитетными записями.

Совет: Явно дайте ИИ разрешение «оставить пустым». В противном случае он «угадает» дату или автора, которых нет в документе, и вставит поддельные метаданные в ваш каталог. Инструкция «Оставьте это поле пустым, если его нет в документе» — сильнейший щит от галлюцинаций.

Поля и уровень доверия в таблице

Поле метаданных

Насколько надежен ИИ?

проверка

язык

высокий

образец

Тип документа

средне-высокий

контроль

Названия людей/мест

Средний (ошибка чтения)

обязательный

дата

Низкая-средняя (риск подделки)

обязательный

Предметные условия

Средний (бесплатная генерация)

Карта для контрольного списка

Область применения/резюме

средне-высокий

Сравнить с источником

Справочный код

Нет (предоставляет учреждение)

человеческие броски

Краткое описание: ИИ быстр и надежен в таких областях, как язык и жанр; генерирует черновики в таких полях, как дата, имя и тема, но требуется одобрение человека; ИИ никогда не создает институциональные поля, такие как ссылочный код.

три мини-кейса

Вариант 1. Проект метаданных для 8000 фотографий. Городской архив каталогизировал 8000 исторических фотографий. Примечания на обороте каждой фотографии были расшифрованы и переданы ИИ; AI сгенерировал дату, место и схему темы. Команда людей проверила его поле за полем и внесла в контролируемый список. Предполагаемая 10-месячная работа была сокращена до 3 месяцев; но каждая дата и название места проверялись визуально.

Случай 2 — Выдуманная история. Архивариус поручил ИИ каталогизировать недатированное письмо. Ю.З. просмотрел содержание письма и точно написал дату «1912». Однако в документе не было даты; ИИ предсказал. Если бы архивариус не добавил указание «если нет в документе, оставить пустым», каталог был бы заполнен вымышленной датой. Урок: пустое разрешение является обязательным.

Случай 3. Бесплатные предметные термины создали путаницу. МА присвоила схожим документам схожие, но разные свободные термины, такие как «иммиграция», «иммиграция», «поселение». Когда одна и та же тема не была сопоставлена ​​с контролируемым словарем, она была помечена тремя разными терминами и разбросана по поиску. Согласованность была достигнута за счет сопоставления терминов в едином авторитетном списке. Урок: термины темы не раскрываются, они привязаны к списку.

Четыре копируемых шаблона

1) Схема Дублинского ядра:

Извлеките черновик метаданных Dublin Core из транскрипции документа ниже. Поля: Название, Автор, Тема, Описание, Дата, Жанр, Язык, Область применения (место/период). Правила: (1) Используйте информацию в тексте только ЧЕТКО. (2) Оставьте поле, которого нет в тексте, ПУСТЫМ, не угадывайте. (3) Отметьте значение, в котором вы не уверены, знаком [?]. Транскрипция: [здесь]

2) Проект определения ISAD(G):

Создайте черновик для следующего документа в полях ISAD(G): Название, Дата(ы), Уровень описания (документ/файл), Область и содержание (краткое описание), Создатель, Язык. Оставьте ссылочный код ПУСТЫМ (его предоставит учреждение). Не добавляйте никакой информации, которой нет в тексте; Несуществующее поле оставьте пустым. Документ: [здесь]

3) Предложение термина по теме (контролируется):

Предложите 3–5 терминов, соответствующих приведенному ниже документу. Во-первых, опирайтесь на факты, содержащиеся в документе. Ниже приведен список контролируемой терминологии нашего учреждения; СНАЧАЛА выберите его из этого списка, если его нет в списке, отметьте новое предложение термина отдельно. Список: [термины]. Документ: [здесь]

4) Массовая проверка согласованности:

Ниже приведены записи метаданных для документов из той же коллекции. Несоответствия флагов: записи одного и того же места/человека пишутся по-разному, разные форматы дат, разные термины для одного и того же предмета. Корректирующее НАЛОЖЕНИЕ; Просто создайте список несоответствий, чтобы человек мог его просмотреть. Записи: [здесь]

Слабая подсказка / Сильная подсказка

Слабый:

Создайте полную запись каталога для этого документа.

Инструкция «завершить» подталкивает ИИ заполнить каждое пространство, т.е. изобретать историю и создателей, которых нет.

Сильный:

Дублинское ядро составлено для этого документа. Используйте только информацию, ЧЕТКО включенную в транскрипцию; оставьте несуществующее поле пустым, не гадайте. Выберите термины темы из этого контролируемого списка: [список]. Отметьте дату и имена людей знаком [?], чтобы я мог сверить их с документом. Транскрипция: [здесь]

Отличие: разрешение «оставить пустым» вместо «полного» издания, контролируемое соблюдение списка и отметки о проверке защищают каталог от подделки.

Распространенные ошибки

  • Это означает «заполнить его полностью». Это приводит к подгонке несуществующих полей; Должно быть дано разрешение «оставить пустым».
  • Раскрытие предметных терминов. Термины, которые не соответствуют контролируемому словарю, будут отвлекать поиск.
  • Наличие ИИ предсказывает историю. Ввод вымышленной даты в недатированный документ загрязняет каталог.
  • Наличие ссылочного кода, сгенерированного ИИ. Это корпоративное, уникальное пространство; люди бросают.
  • Не указывая стандарт. Если стандарт не упомянут, на выходе получится грязный проект, который невозможно будет внести в учреждение.

В итоге

Метаданные и каталогизация — это невидимая инфраструктура, открывающая архив исследователю, и требующая больших усилий. На основе транскрипции ИИ создает быструю схему таких полей, как дата, человек, место, тема и жанр; Он может работать в соответствии с такими стандартами, как ISAD(G) или Dublin Core. Но необходимость «заполнить полностью» заставляет ИИ придумывать что-то; Разрешение «оставлять пустым», сопоставление с контролируемым словарем и подтверждение дат/имен человеком обеспечивают надежность каталога. ИИ готовит проект; Вы несете ответственность за достоверность каталога.

Задача приложения

Возьмите транскрипцию документа и запросите метаданные у ИИ с помощью шаблона «Dublin Core Draft»; Убедитесь, что поля, которых не существует, остаются пустыми. Затем запустите шаблон «Предложение термина по теме» со своим собственным (или образцом) контрольным списком. Наконец, протестируйте несколько записей с помощью «массовой проверки согласованности». Обратите внимание, сколько полей ИИ пытается заполнить предсказанием и сколько предметных терминов необходимо сопоставить со списком.

контрольный список

  • [ ] Я четко указал целевой стандарт (ISAD(G)/Dublin Core).
  • [ ] Я дал разрешение «Оставить пустое поле пустым».
  • [ ] Я сопоставил термины темы с контролируемым списком.
  • [ ] Я сверил дату и имена людей с документом/авторитетной записью.
  • [ ] Я оставил ссылочный код учреждению, а не AI.