Прибыль:
- Возможность сократить время каталогизации за счет создания черновых метаданных в соответствии с такими стандартами, как MARC и Dublin Core, на основе реальной выходной информации.
- Возможность сверки полей с высоким риском фальсификации, таких как год публикации, ISBN, имя автора, с первоисточником и сопоставлением предметных терминов из контролируемого словаря.
- Возможность единообразно утверждать авторские и тематические форматы с авторитетным контролем и поддерживать согласованность каталога.
Каталогизация — невидимая, но самая фундаментальная работа библиотечного дела. Обнаружение ресурса (книги, статьи, карты, звукозаписи, цифрового файла) возможно при наличии правильных метаданных. Метаданные означают «данные о данных»: структурированная информация, описывающая название ресурса, автора, год публикации, тему, язык и физические атрибуты. Если метаданные хорошие, пользователь находит ресурс; Если он плохой или неполный, ресурс теряется, даже если он существует. В этом модуле вы узнаете, как использовать искусственный интеллект при создании черновых метаданных, а также как обеспечить соответствие стандартам и точность.
Давайте сначала определим эти два понятия. MARC (машиночитаемый каталог) — это формат записей, который библиотеки использовали на протяжении десятилетий, в котором каждая часть информации помещается в пронумерованные поля; Например, поле 245 содержит название, а поле 100 — основного автора. Dublin Core — это упрощенный стандарт метаданных для цифровых ресурсов, состоящий из 15 основных полей (название, создатель, тема, дата, жанр и т. д.). Эти стандарты гарантируют, что записи из разных библиотек могут взаимодействовать друг с другом.
Шаг за шагом: создание черновых метаданных с помощью искусственного интеллекта
1. Соберите идентификационную информацию источника. Обложка книги, титульный лист, содержимое или текст цифрового файла. ИИ работает только на основе той информации, которую вы ему предоставляете; Если вы предоставляете неполную информацию, это создает неполные или сфабрикованные метаданные.
2. Укажите целевой стандарт. Дайте ИИ четкую цель, например «по полям Dublin Core» или «по полям MARC 245, 100, 260, 650». Если вы не укажете стандарт, он создаст произвольный формат.
3. Подготовьте черновик. ИИ составляет название, заявление об ответственности, информацию о публикации и предложение темы на основе предоставленной вами информации.
4. Осуществлять авторитетный контроль. Авторитетная запись — это запись, устанавливающая единую стандартную форму имени автора, учреждения или предмета (например, «Ататюрк, Мустафа Кемаль, 1881–1938»). ИИ может написать имя по-разному; Вы проверяете и исправляете утвержденный формат полномочий.
5. Проверьте и подтвердите. Сравните каждое поле с исходным источником. В частности, ИИ может подделать точную информацию, такую как год публикации, ISBN и имя автора.
Подсказка: дайте ИИ фотографию или текст фактической кредитной страницы источника; Не говорите «угадай название книги». Прогнозирующие метаданные подрывают надежность каталога. ИИ пишет уверенно, делая прогнозы, и это введет вас в заблуждение.
Контролируемый словарный запас и последовательность
Последовательность – это все в каталогизации. Если одна и та же тема написана двумя разными терминами в двух разных записях, пользователь найдет одну и пропустит другую. Вот почему библиотеки используют контролируемый словарь — утвержденный стандартный список терминов. Предлагая термины из свободного текста, ИИ может выбрать его разговорный эквивалент, а не официальный термин из этого списка. Например, ИИ может написать «сердечный приступ»; тогда как утвержденным термином может быть «инфаркт миокарда».
Решение состоит в том, чтобы дать ИИ контролируемый словарь и сказать «просто выберите из этого списка». Таким образом, вместо того, чтобы свободно придумывать термины, ИИ подбирает наиболее подходящий из утвержденного списка.
Внимание: если тематический термин, предложенный ИИ, отсутствует в контролируемом словаре, не добавляйте этот термин в каталог. Решение о добавлении новых терминов принимает эксперт, ответственный за управление полномочиями; Добавление произвольных терминов нарушает согласованность каталога.
три мини-кейса
Случай 1 — Ускорен сбор пожертвований. Публичная библиотека получила в дар 1200 книг. Специалист по каталогизации поручил ИИ прочитать выходные данные каждой книги и подготовить черновик Дублинского ядра; Время одной записи уменьшилось с 9 минут до 3,5 минут. Оставшееся время эксперт посвятил проверке и проверке полномочий; Общее время сократилось примерно на 55%, но ни одна запись не попадала в систему без проверки.
Случай 2. Обнаружен поддельный ISBN. Эксперт поручил ИИ подготовить черновики 30 книг. В ходе проверки он обнаружил, что ISBN в 4-х записях был поддельным: ИИ написал 13-значный номер, который показался разумным, хотя настоящего номера книги он не знал. Этап проверки предотвратил появление в каталоге четырех неправильных номеров ISBN.
Случай 3 — Исправлено несоответствие полномочий. Библиотека нашла автора как «Дж. Смит» в некоторых записях, «Джон Смит» в других, «Смит, Джон» в других. ИИ был сопоставлен с авторитетным файлом, в результате чего все записи были приведены в единый утвержденный формат («Смит, Джон, 1965-»); Если бы эта работа выполнялась вручную, она заняла бы дни, но с подсказкой ИИ она сократилась до нескольких часов, но каждое совпадение одобрялось экспертом.
Ретроспективная конверсия и старые записи
Во многих библиотеках имеются неполные или устаревшие записи, которые были внесены много лет назад по другим правилам. Перенос их в текущий стандарт называется ретроспективным преобразованием и очень трудоемким, если выполняется вручную. ИИ может прочитать старую запись и сгенерировать черновик, чтобы переместить ее в текущую структуру полей: например, он может проанализировать свободную текстовую цитату и распределить ее по нужным полям. Однако здесь есть две опасности. Во-первых, ИИ может восполнить недостающую информацию; во-вторых, он может закрепить ошибку в старой записи, копируя ее в новый формат, а не исправляя. Поэтому при ретроспективном преобразовании выходные данные ИИ следует проверять систематически, не путем выборки, а по критическим полям (автор, год, идентификационные числа). Хорошей практикой является отображение записей до и после преобразования рядом, делая каждое изменение видимым; поэтому эксперт может сразу увидеть, что было перемещено, что изменено и что могло быть сфабриковано.
Внимание: проект метаданных, созданный ИИ, не следует передавать в систему пакетом без рассмотрения его по одному. Массовая ошибка повреждает сразу сотни записей, и восстановить их гораздо сложнее, чем создать. Безопаснее всего производить и проверять небольшими партиями.
Четыре копируемых шаблона
1) Схема Дублинского ядра:
Ваша роль: помощник каталогизатора. Заполните поля Dublin Core следующим текстом подписи: Название, Автор, Тема, Описание, Издатель, Дата, Жанр, Формат, Язык. Используйте только ту информацию, которая понятна из текста; Оставьте пропущенное поле «[нет информации]», не догадывайтесь. Текст выходных данных: [здесь]
2) Схема поля MARC:
Предложите контуры для следующих полей MARC из приведенной ниже информации о книге: 245 (название/авторство), 100 (главный автор), 260/264 (публикация), 300 (физическое описание), 650 (тема). Отметьте любое поле, в котором вы не уверены, как «[требуется проверка]». Информация: [здесь]
3) Сопоставление тем из контролируемой лексики:
Ниже приводится краткое изложение источника и список утвержденных терминов темы. Сопоставьте с источником только 3-5 наиболее подходящих терминов из списка. Если подходящего термина в списке нет, напишите «Нет подходящего термина в списке», новые термины не придумывайте. Краткое описание: [здесь] / Список терминов: [здесь]
4) Полномочный контроль формы:
Сопоставьте имена авторов ниже с утвержденными формами в предоставленном мной списке авторитетов. Для каждого имени: формат в записи -> утвержденный формат. Если эквивалента в списке нет, напишите «нет авторитетной записи». Имена: [здесь] / Список авторитетов: [здесь]
Слабая подсказка / Сильная подсказка
Слабая подсказка:
Извлеките каталожную информацию для следующей книги: «Искусственный интеллект и общество».
Дается только название; ИИ вынужден придумать автора, год, издательство и ISBN. Целевого стандарта не существует. Результат: убедительная, но, возможно, ложная запись.
Мощная подсказка:
Ваша роль: помощник каталогизатора. Ниже приведен полный текст выходной страницы книги. Заполните поля Dublin Core отсюда. Используйте только ту информацию, которая четко изложена в тексте; Нетекстовое поле оставьте пустым и напишите «[нет информации]». Никакие даты, имена или ISBN не выдуманы. Текст выходных данных: [полный текст здесь]
Мощная подсказка ограничивает ИИ реальной информацией об авторстве и заставляет его честно оставлять пробелы, а не заполнять их.
Поле метаданных и таблица проверки
площадь
Риск изготовления
Как проверить
Название
низкий
Сравнить со страницей выходных данных
Формат автора/авторитета
средний
Поиск в авторитетном файле
Год издания
высокий
Подтвердите с помощью выходных данных/колофона
ISBN
очень высокий
Индивидуальный контроль со штрих-кодом/источником
Тематический термин
высокий
Соответствие в контролируемой лексике
Распространенные ошибки
- Просто запрашиваю метаданные из заголовка. Неполная информация заставляет ИИ придумывать что-то.
- Не указан целевой стандарт. Произвольное форматирование нарушает гармонию записей.
- Принятие ISBN и года без его проверки. Эти области несут самый высокий риск фальсификации.
- Взятие предметного термина из-за пределов контролируемой лексики. Согласованность и доступность нарушены.
- Обход авторитетного контроля. Один и тот же автор расходится в разных форматах, пользователь упускает источник.
В заключение
При создании метаданных ИИ является мощным помощником, который быстро извлекает выходные данные и значительно сокращает время каталогизации. Но ценой производительности является строгая проверка на предмет рисков фальсификации: четко проясните целевой стандарт (MARC, Dublin Core), запускайте ИИ только с реальным знанием пословиц, сопоставляйте предметные термины из контролируемых словарей и проверяйте авторитетные формы. Вместо того, чтобы восполнять пробелы, ИИ должен честно оставить это поле пустым; Окончательное одобрение остается за вами.
Задача приложения
Передайте текст выходной страницы реальной книги, которая у вас есть, ИИ с шаблоном «Dublin Core Draft» и получите черновик. Затем создайте ту же книгу только с названием («Слабая подсказка») и сравните два результата: какие поля были сфабрикованы? Затем с помощью шаблона «Сопоставление тем из контролируемого словаря» дайте краткий список утвержденных терминов, чтобы тема соответствовала, и проверьте, не уходит ли ИИ из списка.
контрольный список
- [ ] Я передал ИИ реальную идентификационную информацию об источнике, не оставляя ее на усмотрение.
- [ ] Я четко указал целевой стандарт метаданных (MARC/Dublin Core).
- [ ] Я дословно сверил год публикации и ISBN с первоисточником.
- [ ] Я сопоставил термины темы из контролируемого словаря.
- [ ] Формы полномочий я подтвердил утвержденной записью.