Единица 2 / 12

Оцифровка документов и распознавание текста: преобразование печатного текста в машинный текст

Прибыль:

  • Возможность пошаговой настройки рабочего процесса оцифровки и оптического распознавания символов (сканирование, предварительная обработка, распознавание, коррекция, проверка).
  • Возможность использовать ИИ для исправления ошибок оптического распознавания с учетом контекста, сохраняя при этом исправление и перезапись строки и отмечая неоднозначность с помощью [?]
  • Понять, почему числа, даты и имена собственные необходимо проверять визуально, а также роль контроля качества.

Миллионы страниц на физических полках архива или библиотеки по-настоящему открываются для исследователя только тогда, когда они становятся оцифрованными и доступными для поиска. Оцифровка — это преобразование физического документа в цифровое изображение путем его сканирования или фотографирования. Но фотография страницы еще не является «текстом»; Для компьютера это все еще изображение, по нему нельзя искать. Здесь в игру вступает OCR.

OCR (оптическое распознавание символов) — это технология, которая распознает печатные буквы на изображении документа и преобразует их в машиночитаемый текст с возможностью поиска. В этом модуле вы узнаете, как оцифровывать исторические печатные документы с помощью оптического распознавания символов, как искусственный интеллект помогает исправлять ошибки оптического распознавания в этом процессе и где человеческий глаз важен. (Рукописные тексты требуют другой технологии; мы рассмотрим ее в следующем разделе.)

Рабочий процесс оцифровки: шаг за шагом

1. Подготовка и проверка. Отсканируйте документ в максимально возможном качестве. Общее правило исторических исследований — разрешение не менее 300–400 DPI (точек на дюйм). Низкое разрешение резко увеличивает количество ошибок на последующем этапе оптического распознавания символов.

2. Предварительная обработка изображения. Улучшение изображения перед распознаванием текста значительно увеличивает успех: выравнивание отсканированной страницы, удаление дефектов, увеличение контрастности, преобразование в черно-белое изображение. Современные инструменты на базе искусственного интеллекта могут автоматизировать этот шаг.

3. Приложение OCR. Вы передаете изображение в механизм оптического распознавания символов; Движок распознает буквы и выдает текст. Вывод обычно состоит из двух слоев: видимого изображения документа и «слоя скрытого текста с возможностью поиска» под ним.

4. Коррекция (посткоррекция). Необработанный результат OCR никогда не бывает идеальным. Символы читаются некорректно из-за старых шрифтов, пожелтевшей бумаги, размазывания чернил и ошибок сканирования. Здесь ИИ может оказаться мощным помощником: он подсказывает и исправляет ошибки оптического распознавания символов, используя контекст.

5. Проверка и контроль качества. Исправленный текст проверяется человеком выборочно или полностью. Особенно важные области, такие как имена, даты и номера, необходимо проверять визуально.

Почему OCR допускает ошибки, как помогает ИИ

Типичные проблемы, с которыми сталкивается OCR в исторических документах: старые и причудливые шрифты, устаревшие формы букв, такие как длинная буква «s» (ſ), макет страницы в две колонки, сноски, рукописные вставки, печати и выцветшие чернила. Поскольку механизм оптического распознавания символов «видит» буквы одну за другой, он часто путает двоичную букву «rn» с «m», букву «l» с цифрой «1», а букву «O» с «0».

Языковые модели искусственного интеллекта здесь обладают другой силой: они понимают контекст. Если бы механизм оптического распознавания символов написал «1stanbu1», ИИ мог бы сделать вывод из контекста, что это должно быть «Стамбул». Но здесь есть большая опасность: при «исправлении» ИИ может изменить и текст. Он может добавить «Я исправил» несуществующее слово или заполнить непонятное место собственной догадкой. Это нарушает точность транскрипции.

Внимание: золотое правило OCR-коррекции заключается в следующем: ИИ должен исправлять только очевидные ошибки распознавания, а не интерпретировать или дополнять содержание текста. «1stanbu1 → Стамбул» является законным; Речь не идет о заполнении нечитаемого слова догадками. Неопределенные места должны быть отмечены знаком [?] и не должны заполняться.

Типы ошибок OCR и подход с помощью таблицы

Тип ошибки

пример

Сможет ли ИИ это исправить?

человеческий контроль

смешение персонажей

рн↔м, л↔1, О↔0

Да, это безопасно

образец

старая буква

длинный ſ → с

Да, это безопасно

образец

Выцветшее/нечитаемое слово

"ка___н"

Нет, следует поставить [?]

обязательный

имя собственное/местное название

"Константинийе"

осторожный

обязательный

Номер/дата

«1867» против «1857»

рискованный

обязательный

Макет страницы (столбец/сноска)

смешанный поток

частично

обязательный

Подытожим картину в одном предложении: ИИ надежно исправляет обычные ошибки символов; Но для особых имен, цифр, дат и нечитаемых мест требуются человеческие глаза.

три мини-кейса

Случай 1. Архивы газет стали доступны для поиска. Университетская библиотека оцифровала 12 000 страниц местных газет 1930-х годов. Точность первичного распознавания текста составила примерно 82% (18 из каждых 100 символов были неправильными). Коррекция на основе искусственного интеллекта повысила точность до 96 % благодаря словарю и контексту, соответствующему газетному языку. По остальным ошибкам проводилась выборочная проверка, а не полный текст; Коллекция стала доступна для поиска через 3 недели.

Случай 2 — ИИ «исправил» и исказил историю. Архивариус попросил ИИ исправить дату «1863» на распечатке OCR. ИИ «исправил» дату на «1868 год», взглянув на другое событие в контексте — хотя в документе четко указано 1863 год. Если бы архивариус не посмотрел на исходное изображение, в каталог вошел бы с неправильной датой. Урок: числа и даты никогда не оставляются на усмотрение ИИ, они сверяются с изображением.

Случай 3. Страница с двумя столбцами перепутана. Страницы ежегодника XIX века в две колонки были смешаны в один поток в OCR, и предложения переплелись. Необработанный вывод был нечитаемым. Текст улучшился, когда я впервые разделил макет страницы на регионы (сегментацию) и обработал каждый столбец отдельно. Урок: в сложной верстке страницы сначала структура, потом текст.

Четыре копируемых шаблона

1) Безопасная коррекция OCR:

Ниже приведен необработанный результат распознавания исторического документа. Ваша задача — исправить ТОЛЬКО явные ошибки оптического распознавания (например, rn→m,1→l, 0→O, длинные ſ→s). Правила: (1) Интерпретируйте смысл текста. (2) Исправьте нечитаемые/двусмысленные слова, оставьте как есть и пометьте знаком [?]. (3) НЕ добавлять, удалять или завершать предложения. (4) ИЗМЕНИТЬ числа и даты; отметьте [число?], если сомневаетесь. Raw OCR: [здесь]

2) Отчет о качестве OCR:

Изучите результаты оптического распознавания текста ниже и подготовьте отчет о качестве: (1) Перечислите слова с возможными ошибками распознавания, (2) Отметьте области, которые кажутся нечитаемыми/неразборчивыми, (3) Перечислите конкретные имена, даты и числа, которые требуют проверки человеком. НЕ исправлять; создать только контрольный список. Текст: [здесь]

3) Помощь по разбору столбца/структуры:

Поскольку приведенный ниже текст OCR взят со страницы с двумя столбцами, поток может запутаться. Разбейте текст на логические абзацы, НО не меняйте, не добавляйте и не удаляйте слова. Просто исправьте порядок. Отметьте заказ, в котором вы не уверены, знаком [order?]. Текст: [здесь]

4) Нормализация на стандартный язык (опционально, отдельный слой):

Создайте упрощенную версию для чтения в современном написании в отдельной колонке НАД исправленным историческим текстом ниже. НИКОГДА не изменяйте ОРИГИНАЛЬНЫЙ текст; Пусть упрощение будет отдельным слоем. Просто обновите орфографию/произношение, не добавляя смысла. Оригинал: [здесь]

Слабая подсказка / Сильная подсказка

Слабый:

Исправьте и украсьте этот текст OCR.

«Украсить» позволяет ИИ переписывать текст, восполнять пропуски и интерпретировать контент; нарушает лояльность.

Сильный:

Исправьте ТОЛЬКО ошибки оптического распознавания в этих необработанных результатах OCR. Не интерпретируйте смысл, не добавляйте/удаляйте слова, не оставляйте нечитаемые части с [?], меняйте цифры и даты. Каждое вносимое вами исправление покажите отдельным списком в формате «исходное → исправление», чтобы я мог его проверить. Текст: [здесь]

Разница: ограниченная пошлина, запрет на изготовление, двусмысленность маркировки и отслеживаемый список исправлений делают выходные данные проверяемыми.

Распространенные ошибки

  • Сканирование в низком разрешении. Большинство ошибок оптического распознавания вызваны плохими изображениями; Качественное сканирование — самая дешевая инвестиция.
  • Призыв ИИ «сделать красивым». Это обеспечивает беглость, а не точность; Документ переписан.
  • Оставляя цифры и даты ИИ. Они незаметно искажаются, когда «исправляются» из контекста; необходимо подтвердить по изображению.
  • Заполнение нечитаемой области догадкой. Оно должно быть защищено неопределенностью [?], а не выдумано.
  • Не контроль вообще, а выборка. Даже точность 96% означает тысячи ошибок на 12 000 страницах; сканируются критические области.

В заключение

OCR открывает архивы исследователям, преобразуя печатные исторические документы в текст с возможностью поиска. ИИ — мощный помощник в исправлении ошибок символов в необработанных результатах OCR с учетом контекста; Но вы должны провести грань между редактированием и переписыванием. Высококачественное сканирование, безопасная инструкция по исправлению, сохранение двусмысленности с помощью [?] и проверка имен/дат/номеров человеческим глазом делают оцифровку быстрой и надежной. ИИ очищает текст; Вы — хранитель верности.

Задача приложения

Отсканируйте распечатанный исторический документ (старую газету, официальное письмо, страницу книги) или сделайте распечатку OCR. Исправьте текст с помощью шаблона «Безопасное распознавание текста» и запросите исправления через список «оригинал → исправление». Затем удалите области, требующие человеческого контроля, с помощью «Отчета о качестве OCR». Сравните каждую дату и имя собственное в списке с реальным изображением; Обратите внимание, сколько из них было «исправлено» неправильно.

контрольный список

  • [ ] Я отсканировал документ с разрешением не менее 300 точек на дюйм и хорошим контрастом.
  • [ ] Я просил ИИ только об исправлении оптических ошибок, а не о переписывании.
  • [ ] Я защитил нечитаемые части с помощью [?].
  • [ ] Я сверил все числа, даты и имена собственные с изображением.
  • [ ] Я сделал выборочную или полную проверку в критических областях.