Прибыль:
- Возможность создавать проекты метаданных в соответствии с такими стандартами, как ISAD(G) или Dublin Core, с использованием искусственного интеллекта.
- Способность предотвращать галлюцинации и сопоставлять предметные термины с контролируемым словарным запасом с разрешением оставлять пустыми.
- Способность различать, какие поля, такие как дата, имя человека и ссылочный код, требуют одобрения человека, а какие должны назначаться только учреждением.
Архив или библиотеку, какими бы богатыми они ни были, невозможно найти, если они не определены четко. Что делает документ «обнаружимым», так это описательная информация о нем: кто его написал, когда, где, какова его тема, к какой коллекции он принадлежит. Эта информация называется метаданными (metadata — описательные данные о документе; «данные о данных»). Каталогизация — это процесс идентификации документов с помощью этих метаданных и сохранения их в системе с возможностью поиска. Классификация заключается в организации документов по таким критериям, как предмет, тип или происхождение.
Создание метаданных занимает чрезвычайно много времени; Ввод даты, темы, лица и места по отдельности для тысяч документов в больших коллекциях может занять годы. ИИ — сильный генератор тяги в этом бизнесе. В этом модуле мы увидим, как генерировать метаданные с помощью ИИ, каталогизировать их в соответствии со стандартами (ISAD(G), Dublin Core), а также возможности и недостатки автоматической классификации.
Архивные стандарты: зачем они нужны
Метаданные не вводятся случайным образом; Существуют международные стандарты, позволяющие записям из разных учреждений общаться друг с другом:
- ISAD(G) (Общий международный стандарт архивного описания): Правила иерархического описания архивного материала (на уровне фонда, серии, файла, документа). Он содержит такие поля, как ссылочный код, название, дата, область применения, создатель.
- Дублинское ядро: общий стандарт, состоящий из 15 основных полей для описания цифровых ресурсов (название, создатель, тема, дата, жанр, формат, источник, язык и т. д.).
- Фонды: совокупность записей, естественным образом образовавшаяся в результате деятельности одного человека, семьи или учреждения. Это основная организационная единица архивирования.
- Провенанс (происхождение): информация о том, от кого исходит документ и через какие руки он прошел. При архивировании документы хранятся вместе в соответствии с их происхождением.
Явное указание целевого стандарта при создании метаданных ИИ гарантирует, что выходные данные будут напрямую введены в предприятие.
Еще одним ключевым понятием является авторитетная запись — запись, определяющая единую стандартную утвержденную форму имени человека, места или учреждения. В исторических документах один и тот же человек или место могут фигурировать в разном написании; Авторитетная запись связывает их все в единый утвержденный формат, чтобы они не разбрасывались при поиске. ИИ предлагает имена из документа; но сопоставление этого имени со стандартной формой авторитетной записи — это человеческая работа. Связывание того, что ИИ говорит «Ахмед» с «Ахмед-беем (1840-1912)» в авторитетной записи учреждения, сохраняет согласованность каталога.
Рабочий процесс: шаг за шагом
1. Подготовьте исходник. Соберите расшифровку или изображение документа и любую контекстную информацию.
2. Определите стандарт и области. Сообщите ИИ, какой стандарт (ISAD(G), Dublin Core) и по каким полям он будет выдавать выходные данные.
3. Создайте черновой вариант метаданных. ИИ заполняет поля, которые можно извлечь из документа (дата, персона, место, тема, язык, жанр); Он оставляет пустыми области, которые не может удалить.
4. Карта контролируемого словарного запаса. Названия предметов и топонимов в большинстве учреждений не являются бесплатными, а привязаны к заранее определенному списку (контролируемому словарю/тезаурусу). Сопоставьте с этим списком предметные термины, предложенные ИИ.
5. Проверьте и подтвердите. Каждое поле, особенно дата, имя и тема, сравниваются людьми с документами и авторитетными записями.
Совет: Явно дайте ИИ разрешение «оставить пустым». В противном случае он «угадает» дату или автора, которых нет в документе, и вставит поддельные метаданные в ваш каталог. Инструкция «Оставьте это поле пустым, если его нет в документе» — сильнейший щит от галлюцинаций.
Поля и уровень доверия в таблице
Поле метаданных
Насколько надежен ИИ?
проверка
язык
высокий
образец
Тип документа
средне-высокий
контроль
Названия людей/мест
Средний (ошибка чтения)
обязательный
дата
Низкая-средняя (риск подделки)
обязательный
Предметные условия
Средний (бесплатная генерация)
Карта для контрольного списка
Область применения/резюме
средне-высокий
Сравнить с источником
Справочный код
Нет (предоставляет учреждение)
человеческие броски
Краткое описание: ИИ быстр и надежен в таких областях, как язык и жанр; генерирует черновики в таких полях, как дата, имя и тема, но требуется одобрение человека; ИИ никогда не создает институциональные поля, такие как ссылочный код.
три мини-кейса
Вариант 1. Проект метаданных для 8000 фотографий. Городской архив каталогизировал 8000 исторических фотографий. Примечания на обороте каждой фотографии были расшифрованы и переданы ИИ; AI сгенерировал дату, место и схему темы. Команда людей проверила его поле за полем и внесла в контролируемый список. Предполагаемая 10-месячная работа была сокращена до 3 месяцев; но каждая дата и название места проверялись визуально.
Случай 2 — Выдуманная история. Архивариус поручил ИИ каталогизировать недатированное письмо. Ю.З. просмотрел содержание письма и точно написал дату «1912». Однако в документе не было даты; ИИ предсказал. Если бы архивариус не добавил указание «если нет в документе, оставить пустым», каталог был бы заполнен вымышленной датой. Урок: пустое разрешение является обязательным.
Случай 3. Бесплатные предметные термины создали путаницу. МА присвоила схожим документам схожие, но разные свободные термины, такие как «иммиграция», «иммиграция», «поселение». Когда одна и та же тема не была сопоставлена с контролируемым словарем, она была помечена тремя разными терминами и разбросана по поиску. Согласованность была достигнута за счет сопоставления терминов в едином авторитетном списке. Урок: термины темы не раскрываются, они привязаны к списку.
Четыре копируемых шаблона
1) Схема Дублинского ядра:
Извлеките черновик метаданных Dublin Core из транскрипции документа ниже. Поля: Название, Автор, Тема, Описание, Дата, Жанр, Язык, Область применения (место/период). Правила: (1) Используйте информацию в тексте только ЧЕТКО. (2) Оставьте поле, которого нет в тексте, ПУСТЫМ, не угадывайте. (3) Отметьте значение, в котором вы не уверены, знаком [?]. Транскрипция: [здесь]
2) Проект определения ISAD(G):
Создайте черновик для следующего документа в полях ISAD(G): Название, Дата(ы), Уровень описания (документ/файл), Область и содержание (краткое описание), Создатель, Язык. Оставьте ссылочный код ПУСТЫМ (его предоставит учреждение). Не добавляйте никакой информации, которой нет в тексте; Несуществующее поле оставьте пустым. Документ: [здесь]
3) Предложение термина по теме (контролируется):
Предложите 3–5 терминов, соответствующих приведенному ниже документу. Во-первых, опирайтесь на факты, содержащиеся в документе. Ниже приведен список контролируемой терминологии нашего учреждения; СНАЧАЛА выберите его из этого списка, если его нет в списке, отметьте новое предложение термина отдельно. Список: [термины]. Документ: [здесь]
4) Массовая проверка согласованности:
Ниже приведены записи метаданных для документов из той же коллекции. Несоответствия флагов: записи одного и того же места/человека пишутся по-разному, разные форматы дат, разные термины для одного и того же предмета. Корректирующее НАЛОЖЕНИЕ; Просто создайте список несоответствий, чтобы человек мог его просмотреть. Записи: [здесь]
Слабая подсказка / Сильная подсказка
Слабый:
Создайте полную запись каталога для этого документа.
Инструкция «завершить» подталкивает ИИ заполнить каждое пространство, т.е. изобретать историю и создателей, которых нет.
Сильный:
Дублинское ядро составлено для этого документа. Используйте только информацию, ЧЕТКО включенную в транскрипцию; оставьте несуществующее поле пустым, не гадайте. Выберите термины темы из этого контролируемого списка: [список]. Отметьте дату и имена людей знаком [?], чтобы я мог сверить их с документом. Транскрипция: [здесь]
Отличие: разрешение «оставить пустым» вместо «полного» издания, контролируемое соблюдение списка и отметки о проверке защищают каталог от подделки.
Распространенные ошибки
- Это означает «заполнить его полностью». Это приводит к подгонке несуществующих полей; Должно быть дано разрешение «оставить пустым».
- Раскрытие предметных терминов. Термины, которые не соответствуют контролируемому словарю, будут отвлекать поиск.
- Наличие ИИ предсказывает историю. Ввод вымышленной даты в недатированный документ загрязняет каталог.
- Наличие ссылочного кода, сгенерированного ИИ. Это корпоративное, уникальное пространство; люди бросают.
- Не указывая стандарт. Если стандарт не упомянут, на выходе получится грязный проект, который невозможно будет внести в учреждение.
В итоге
Метаданные и каталогизация — это невидимая инфраструктура, открывающая архив исследователю, и требующая больших усилий. На основе транскрипции ИИ создает быструю схему таких полей, как дата, человек, место, тема и жанр; Он может работать в соответствии с такими стандартами, как ISAD(G) или Dublin Core. Но необходимость «заполнить полностью» заставляет ИИ придумывать что-то; Разрешение «оставлять пустым», сопоставление с контролируемым словарем и подтверждение дат/имен человеком обеспечивают надежность каталога. ИИ готовит проект; Вы несете ответственность за достоверность каталога.
Задача приложения
Возьмите транскрипцию документа и запросите метаданные у ИИ с помощью шаблона «Dublin Core Draft»; Убедитесь, что поля, которых не существует, остаются пустыми. Затем запустите шаблон «Предложение термина по теме» со своим собственным (или образцом) контрольным списком. Наконец, протестируйте несколько записей с помощью «массовой проверки согласованности». Обратите внимание, сколько полей ИИ пытается заполнить предсказанием и сколько предметных терминов необходимо сопоставить со списком.
контрольный список
- [ ] Я четко указал целевой стандарт (ISAD(G)/Dublin Core).
- [ ] Я дал разрешение «Оставить пустое поле пустым».
- [ ] Я сопоставил термины темы с контролируемым списком.
- [ ] Я сверил дату и имена людей с документом/авторитетной записью.
- [ ] Я оставил ссылочный код учреждению, а не AI.