Прибыль:
- Возможность исправлять отсканированные документы путем преобразования их в текст с помощью оптического распознавания символов и HTR и сравнения вывода с реальным изображением.
- Возможность сохранить оригинальность и целостность архивного документа и предотвратить изменение содержимого и фальсифицированную реставрацию ИИ.
- Возможность планировать долгосрочное цифровое хранение с использованием информации о происхождении и долговечных форматах.
Архивариусу поручено перенести в будущее тома газет пятидесятилетней давности, рукописные письма или старые фотографии. Эти документы со временем изнашиваются; Чтобы сохранить и сделать их доступными, выполняется оцифровка: процесс сканирования физического документа и преобразования его в цифровую копию. Но одного только скрининга недостаточно; Цифровой объект должен быть доступным для поиска, чтения и обслуживания в долгосрочной перспективе. В этом модуле вы узнаете, как использовать искусственный интеллект в рабочем процессе оцифровки, транскрипции и цифрового сохранения; но вы узнаете, почему вы будете нести ответственность за оригинальность и точность.
Несколько концепций. OCR (оптическое распознавание символов) — это технология, которая преобразует текст изображения документа в текст, редактируемый машиной. HTR (распознавание рукописного текста) выполняет ту же работу для рукописных документов, но гораздо сложнее. Цифровое сохранение — это запланированная попытка гарантировать, что цифровые объекты останутся читабельными на протяжении десятилетий, даже если форматы файлов устаревают и программное обеспечение меняется. ИИ — мощный, но несовершенный помощник во всех трех областях.
Шаг за шагом: от оцифровки к сохранению
1. Расставьте приоритеты. Невозможно оцифровать все сразу. На первое место ставятся самые хрупкие, самые востребованные и самые уникальные документы. Это судебное решение; ИИ помогает редактировать списки, но приоритет определяет учреждение.
2. Отсканируйте и примените OCR/HTR. Отсканируйте документ в высоком разрешении, затем используйте OCR или HTR, чтобы извлечь текст. Инструменты на основе искусственного интеллекта здесь становятся все лучше и лучше, даже со старыми и сложными текстами.
3. Исправьте и проверьте текст. Вывод OCR/HTR никогда не бывает идеальным. Ошибки встречаются часто, особенно если это старые записи, страницы с пятнами или рукопись. Очень важно сравнить результат с реальным изображением и исправить его.
4. Добавьте метаданные и информацию о защите. Добавьте к цифровому объекту его происхождение, условия сканирования, информацию о формате и происхождение — откуда взялся документ и как он был обработан. Эта информация имеет решающее значение для будущей проверки и защиты.
5. Планируйте долгосрочную защиту. Выбирайте открытые, распространенные и долговечные форматы файлов; резервное копирование; Составьте план миграции на случай, если форматы устареют.
Совет: Не принимайте вывод OCR как «открытый текст». Если бы поисковая система работала по этому тексту, неправильно распознанные слова привели бы к тому, что источник не был найден. Для критически важных коллекций коррекция результатов оптического распознавания символов для человеческого глаза определяет качество всего последующего доступа.
Подлинность и целостность цифрового объекта
В основе архивной работы лежат подлинность и целостность: гарантия того, что документ действительно получен из заявленного источника и что его содержание не было изменено. На этом этапе ИИ создает двустороннюю угрозу. Во-первых, во время коррекции или «улучшения» OCR/HTR ИИ может незаметно изменять текст; под названием «коррекция» можно добавить несуществующее слово. Во-вторых, если «ремонт» или «восстановление» изображения выполняется с помощью ИИ, могут быть созданы неоригинальные детали.
Правило архивариуса ясно: цифровая копия должна соответствовать оригиналу. Каждое улучшение, сделанное с помощью ИИ, должно быть документировано, а фактическое (необработанное) сканирование всегда должно сохраняться. «Украшение» документа может разрушить его историческую доказательную ценность.
Внимание: может возникнуть соблазн «улучшить» старую фотографию или документ с помощью ИИ; но ИИ восполняет недостающие части, создавая их. В архивном документе это означает создание ложных исторических свидетельств. Выходные данные восстановления никогда не заменяют исходный источник; хранится как отдельный, четко обозначенный вариант.
три мини-кейса
Случай 1. Архивы газет стали доступны для поиска. Библиотека оцифровала свою 30-летнюю коллекцию местных газет. С помощью OCR было расшифровано и доступно для поиска 90 000 страниц; Поиск по теме, который раньше занимал несколько дней, теперь сократился до секунд. Однако команда заметила, что точность оптического распознавания символов на старых и испачканных страницах упала до 80%, и поставила приоритетом исправление ошибок за последние годы человеческим глазом.
Случай 2 — HTR открыла рукопись. Архив применил HTR к коллекции трудночитаемых писем XIX века. Судя по месяцам чтения экспертами, система набрала большую скорость; Но каждую страницу распечатки сравнивал с оригиналом эксперт-палеограф (знаток древней письменности), поскольку в названиях людей и мест были ошибки.
Случай 3 — Фейковое «восстановление» отклонено. Одна команда рассматривала возможность «починить» порванную историческую фотографию с помощью ИИ. ИИ дополнил недостающие части лица, подобрав их. Архивариус понял, что эти сфабрикованные детали исказят исторические свидетельства; Восстановленное изображение хранилось отдельно рядом с оригиналом, только с четкой пометкой «Производное AI».
Копия доступа, копия сохранения и решение о формате
Хорошей практикой оцифровки является разделение копий одного и того же объекта для разных целей. Мастер сохранения — это реальный цифровой объект, который будет перенесен в будущее и сохранен в высочайшем разрешении, без сжатия или в формате без потерь; его редко трогают. Копия Access — это уменьшенный, легко открываемый вариант, предоставляемый пользователю. Это различие важно, поскольку формат, который практичен для использования (небольшой, сжатый), может оказаться непригодным для долгосрочного хранения; Идеальный формат сохранения (большой, без потерь) громоздок для повседневного использования. В этом рабочем процессе ИИ может помочь в инвентаризации файлов, обнаружении недостающих вариантов и обеспечении согласованности метаданных между двумя копиями. Однако выбор формата — это решение о сохранении: следует отдавать предпочтение открытым, широко документированным и надежным форматам (а не проприетарным закрытым форматам), а также следует иметь наготове план миграции на случай, если форматы со временем устареют. Даже если ИИ предложит формат, последнее слово останется за политикой долгосрочного сохранения данных учреждения.
Совет: Для каждого цифрового объекта ведите краткую запись, отвечающую на вопросы «где находится исходный источник, в каком формате хранится копия, в каком формате доступна копия и какой из них доступен пользователю?» Смешение этих трех слоев делает неясным, какой файл является доверенным мастером в дальнейшем.
Четыре копируемых шаблона
1) Помощь по коррекции вывода OCR:
Ниже приведен текст OCR и описание фактической страницы. Исправляйте только ошибки openOCR (неправильные символы, составные/разделенные слова). Не меняйте содержание, не добавляйте и не удаляйте слова. Если вы не уверены, отметьте знаком «[?]». Текст OCR: [здесь]
2) Проверка целостности текста и изображения:
Есть ли в исправленном тексте, приведенном ниже, какие-либо дополнения, которых не должно было быть в исходном документе (который мог быть выдуманным)? Отметьте каждую подозрительную деталь и напишите, почему она подозрительна. Текст: [здесь]
3) Проект метаданных защиты:
Создайте схему метаданных сохранения для следующего оцифрованного объекта: источник, происхождение, дата/разрешение сканирования, формат файла, история транзакций. Просто используйте предоставленную мной информацию, оставьте недостающее поле пустым. Информация: [здесь]
4) Помощь в расстановке приоритетов:
Ниже приведен список коллекций, ожидающих оцифровки; Помогите расставить приоритеты на основе хрупкости, спроса и уникальности. Дайте краткое обоснование для каждого ресурса; Оставьте окончательное решение за мной. Список: [здесь]
Слабая подсказка / Сильная подсказка
Слабая подсказка:
Исправьте и украсьте этот отсканированный текст.
«Beautify» предлагает ИИ изменить контент, восполнить упущения; Оригинальность архивного документа нарушена.
Мощная подсказка:
Ваша роль: помощник редактора по оцифровке. В следующем тексте OCR исправьте ТОЛЬКО явные ошибки распознавания (неправильный символ, неправильное разделение слова). Не добавляйте, не удаляйте и не меняйте слова. Оставьте «[?]» там, где вы не уверены. Покажите каждое внесенное вами исправление в отдельном списке. Текст: [здесь]
Мощная подсказка ограничивает ИИ только распознаванием ошибок, запрещает ему трогать контент и позволяет отслеживать исправления.
Таблица рабочих процессов и рисков
Этап
Вклад ИИ
Основной риск
мера защиты
сканировать
—
плохое качество
высокое разрешение
оптическое распознавание символов/HTR
Преобразовать в текст
Ошибки распознавания
человеческая коррекция
исправление
Предложение об ошибке
Изменение контента
Сравнение с оригиналом
восстановление
Производное изображения
подходящая деталь
Сохраните необработанный оригинал, пометьте его
защита
Проект метаданных
потеря происхождения
Запись о провенансе
Распространенные ошибки
- Принятие вывода OCR без коррекции. Ошибки мешают поиску и доступу.
- Призыв ИИ «сделать красивым». Это меняет содержание и уничтожает оригинальность.
- Замена реальных доказательств восстановлением ИИ. Выдуманные детали создают ложную историю.
- Не сохранять необработанное сканирование. Никакая поправка не может быть проверена без оригинала.
- Упущение информации о происхождении. Достоверность документа становится неотслеживаемой.
В итоге
ИИ в цифровых архивах и оцифровке; Это ценная помощь, которая ускоряет транскрипцию OCR/HTR, составление метаданных и определение приоритетов. Но суть архивной работы заключается в аутентичности и целостности: результаты оптического распознавания символов должны корректироваться человеческим глазом, искусственный интеллект никогда не должен молча заменять контент, производные реставрации не должны заменять оригинальные доказательства, а необработанная информация о сканировании и происхождении всегда должна сохраняться. Используйте ИИ как инструмент, который не «улучшает» документ, а делает его доступным, сохраняя при этом его соответствие.
Задача приложения
Получите небольшой образец вывода OCR (собственного производства или фактического сканирования). Исправьте только ошибки распознавания с помощью шаблона «Помощь по исправлению вывода OCR», затем проверьте, добавил ли ИИ контент с помощью шаблона «Проверка согласованности текста и изображения». Затем создайте запись с информацией о происхождении и формате объекта с помощью шаблона «Черновик метаданных сохранения».
контрольный список
- [ ] Я сравнил результат OCR/HTR с реальным изображением и исправил его.
- [ ] Я проверил, что ИИ не добавляет/меняет контент.
- [ ] Я сохранил необработанный (основной) скан отдельно и без изменений.
- [ ] Я добавил в метаданные информацию о происхождении и формате.
- [ ] Я четко обозначил варианты восстановления как «производные ИИ».