одиниця 2 / 12

Оцифрування документів і OCR: перетворення друкованого тексту в машинний текст

Прибуток:

  • Можливість крок за кроком налаштувати робочий процес оцифрування та OCR (сканування, попередня обробка, розпізнавання, виправлення, перевірка)
  • Можливість використовувати штучний інтелект для виправлення помилок оптичного розпізнавання тексту за допомогою контексту, зберігаючи рядок виправлення та перезапису та позначаючи неоднозначність [?]
  • Зрозуміти, чому числа, дати та власні назви необхідно візуально перевіряти, а також роль контролю якості.

Мільйони сторінок на фізичних полицях архіву чи бібліотеки по-справжньому відкриті для дослідника лише тоді, коли вони оцифровані та доступні для пошуку. Оцифрування — це перетворення фізичного документа в цифрове зображення шляхом його сканування або фотографування. Але фотографія сторінки ще не є «текстом»; Для комп’ютера це все ще зображення, ви не можете шукати в ньому. Ось де OCR вступає в гру.

OCR (оптичне розпізнавання символів) — це технологія, яка розпізнає друковані літери на зображенні документа та перетворює їх на машиночитаний текст із можливістю пошуку. У цьому розділі ви дізнаєтеся, як оцифровувати історичні друковані документи за допомогою оптичного розпізнавання тексту, як штучний інтелект допомагає виправляти помилки оптичного розпізнавання символів у цьому процесі та де людське око є важливим. (Для рукописних текстів потрібна інша технологія; ми розглянемо це в наступному розділі.)

Процес оцифрування: крок за кроком

1. Підготовка та скринінг. Відскануйте документ у найвищій якості. Загальним емпіричним правилом для історичних досліджень є роздільна здатність щонайменше 300-400 DPI (точок на дюйм). Низька роздільна здатність різко підвищує рівень помилок на наступному етапі OCR.

2. Попередня обробка зображення. Покращення зображення перед оптичним розпізнаванням значно підвищує успіх: виправляє перекіс відсканованої сторінки, видаляє плями, збільшує контраст, перетворює на чорно-білий. Сучасні інструменти на основі ШІ можуть автоматизувати цей крок.

3. Додаток OCR. Ви передаєте зображення механізму OCR; Двигун розпізнає букви і видає текст. Вихід зазвичай складається з двох шарів: видимого зображення документа та «шару прихованого тексту з можливістю пошуку» під ним.

4. Корекція (посткорекція). Необроблений вихід OCR ніколи не буває ідеальним. Символи читаються неправильно через старі шрифти, пожовклий папір, розмазування чорнила та помилки сканування. Саме тут штучний інтелект є потужним помічником: він пропонує та виправляє помилки OCR за допомогою контексту.

5. Перевірка та контроль якості. Виправлений текст перевіряється людиною вибірково або повністю. Особливо критичні місця, такі як імена, дати та номери, повинні бути перевірені візуально.

Чому OCR робить помилки, як AI допомагає

Типові проблеми, які заважають OCR в історичних документах: старі та модні шрифти, застарілі форми літер, такі як довгі «s» (ſ), макет сторінки у дві колонки, виноски, рукописні вставки, печатки та вицвіле чорнило. Оскільки механізм OCR «бачить» літери одну за одною, він часто плутає двійковий «rn» як «m», літеру «l» як число «1», а літеру «O» як «0».

Мовні моделі штучного інтелекту пропонують тут іншу силу: вони розуміють контекст. Якби система OCR написала «1stanbu1», ШІ міг би зробити висновок із контексту, що це має бути «Istanbul». Але тут криється велика небезпека: при «правленні» AI може змінити і текст. Він може додати «Я виправив» неіснуюче слово або заповнити незрозуміле місце своєю здогадкою. Це порушує точність транскрипції.

Застереження: золоте правило виправлення OCR таке: штучний інтелект повинен виправляти лише очевидні помилки розпізнавання, а не інтерпретувати чи доповнювати вміст тексту. "1stanbu1 → Стамбул" є законним; Йдеться не про те, щоб заповнити нечитабельне слово відгадками. Невизначені місця слід позначати [?] і не вигадувати.

Типи помилок OCR і підхід із таблицею

Тип помилки

приклад

Чи може ШІ це виправити?

контроль людини

змішування символів

rn↔m, l↔1, O↔0

Так, це безпечно

зразок

стара літера

довгий ſ → с

Так, це безпечно

зразок

Вицвіле/нечитабельне слово

"ka___n"

Ні, слід поставити [?]

обов'язковий

власна назва/назва місця

"Константинійє"

обережний

обов'язковий

Номер/дата

"1867" проти "1857"

ризиковано

обов'язковий

Макет сторінки (стовпець/виноска)

змішаний потік

частково

обов'язковий

Узагальнюючи картину одним реченням: AI надійно очищає звичайні помилки символів; Але для спеціальних імен, чисел, дат і нечитабельних місць потрібні людські очі.

три міні-чохла

Випадок 1 — Архіви газет стали доступними для пошуку. Університетська бібліотека оцифрувала 12 000 сторінок місцевих газет 1930-х років. Точність необробленого OCR становила приблизно 82% (18 із кожних 100 символів були неправильними). Корекція на основі штучного інтелекту підвищила точність до 96% за допомогою словника та контексту, що відповідають мові газети. Для решти помилок була виконана перевірка зразка, а не повного тексту; Колекція стала доступною для пошуку через 3 тижні.

Випадок 2 — ШІ «виправив» і спотворив історію. Архівіст доручив ШІ виправити дату «1863» на роздруківці OCR. ШІ «виправив» дату на «1868», подивившись на іншу подію в контексті — хоча в документі чітко вказано 1863. Якби архіваріус не подивився на оригінальне зображення, каталог увійшов би з неправильною датою. Урок: числа та дати ніколи не залишаються на розсуд ШІ, вони звіряються із зображенням.

Випадок 3 — Переплутана сторінка з двома колонками. Двоколонкові сторінки щорічника 19 століття були змішані в єдиний потік в OCR, а речення перепліталися. Необроблений вихід був нечитабельним. Текст покращився, коли я вперше розділив макет сторінки на області (сегментація) і обробив кожен стовпець окремо. Урок: складна верстка сторінки, спочатку структура, потім текст.

Чотири шаблони, які можна копіювати

1) Безпечна корекція OCR:

Нижче наведено вихідний вихід OCR історичного документа. Ваше завдання полягає в тому, щоб виправити ЛИШЕ очевидні помилки оптичного розпізнавання (наприклад, rn→m,1→l, 0→O, довгі ſ→s). Правила: (1) Витлумачте зміст тексту. (2) Виправте нечитабельні/двозначні слова, залиште як є та позначте [?]. (3) НЕ додавання, видалення або завершення речень. (4) ЗМІНИТИ числа та дати; позначте [номер?], якщо сумніваєтеся. Raw OCR: [тут]

2) Звіт про якість OCR:

Перегляньте наведені нижче результати OCR і створіть звіт про якість: (1) Перелічіть слова з можливими помилками розпізнавання, (2) Позначте області, які здаються нерозбірливими/нечіткими, (3) Перелічіть конкретні імена, дати та числа, які потребують перевірки людиною. НЕ виправляти; створити лише контрольний список. Текст: [тут]

3) Довідка щодо аналізу стовпця/структури:

Оскільки наведений нижче текст OCR походить із сторінки з двома колонками, потік може бути заплутаним. Переставте текст на логічні абзаци, АЛЕ не змінюйте, не додавайте та не видаляйте жодних слів. Просто виправте порядок. Позначте замовлення, у якому ви не впевнені, за допомогою [порядок?]. Текст: [тут]

4) Нормалізація до стандартної мови (необов’язково, окремий рівень):

Створіть спрощену версію читання сучасним правописом в окремій колонці НАД виправленим історичним текстом нижче. НІКОЛИ не змінюйте ОРИГІНАЛЬНИЙ текст; Нехай спрощення буде окремим шаром. Просто оновіть орфографію/вимову, не додаючи значення. Оригінал: [тут]

Слабка підказка / Сильна підказка

Слабкий:

Виправте та прикрасьте цей OCR-текст.

«Beautify» дозволяє ШІ переписувати текст, виправляти пропуски та інтерпретувати вміст; порушує вірність.

Сильний:

Виправте ЛИШЕ помилки оптичного розпізнавання в цьому необробленому OCR-виході. Не тлумачіть значення, додавайте/вилучайте слова, залишайте нечитабельні частини з [?], змінюйте числа та дати. Показуйте кожне внесене вами виправлення в окремому списку у форматі «оригінал → виправлення», щоб я міг це перевірити. Текст: [тут]

Відмінність: обмежений обов’язок, заборона на виготовлення, неоднозначність маркування та відстежуваний список виправлень роблять результат аудитом.

Поширені помилки

  • Сканування з низькою роздільною здатністю. Більшість помилок розпізнавання викликано поганими зображеннями; Якісне сканування – найдешевша інвестиція.
  • Виклик ШІ «робити красивим». Це створює швидше плавність, ніж точність; Документ переписується.
  • Залишаючи цифри та дати ШІ. Вони мовчки пошкоджуються, коли "виправляються" з контексту; має бути підтверджено зображенням.
  • Заповнення нечитабельної області припущенням. Це має бути захищене невизначеністю [?], а не вигадане.
  • Зовсім не контроль, а не вибірка. Навіть 96% точності означає тисячі помилок на 12 000 сторінках; критичні ділянки скануються.

Підсумовуючи

OCR відкриває архіви для дослідників, перетворюючи друковані історичні документи в текст для пошуку. AI є потужним помічником у виправленні помилок символів у необробленому оптичному розпізнаванні тексту з контекстом; Але ви повинні провести межу між редагуванням і переписуванням. Високоякісне сканування, безпечні інструкції з виправлення, збереження неоднозначності з [?] і перевірка імен/дат/чисел людським оком роблять оцифрування швидким і надійним. AI очищає текст; Ти – берегиня вірності.

Аплікаційне завдання

Відскануйте друкований історичний документ (стару газету, офіційний лист, сторінку книги) або роздрукуйте OCR. Виправте текст за допомогою шаблону «Безпечне виправлення OCR» і надішліть запит на виправлення через список «оригінал → виправлення». Потім видаліть області, які потребують контролю людини, за допомогою «Звіту про якість OCR». Порівняйте кожну дату та власне ім’я у списку з реальним зображенням; Зверніть увагу, скільки було «виправлено» неправильно.

контрольний список

  • [ ] Я сканував документ із принаймні 300 точок на дюйм і хорошим контрастом.
  • [ ] Я попросив ШІ лише оптичне виправлення помилок, а не переписування.
  • [ ] Я захистив нечитабельні частини за допомогою [?].
  • [ ] Я перевірив усі числа, дати та власні назви із зображенням.
  • [ ] Я зробив вибірку або повну перевірку в критичних областях.