единица 2 / 12

Дигитализация на документи и OCR: Преобразуване на печатен текст в машинен текст

Печалби:

  • Възможност за настройка на работния процес за дигитализация и OCR (сканиране, предварителна обработка, разпознаване, корекция, проверка) стъпка по стъпка
  • Възможност за използване на AI за коригиране на OCR грешки с контекст, като същевременно се поддържа редът за корекция и пренаписване и маркиране на двусмислието с [?]
  • Разберете защо числата, датите и собствените имена трябва да бъдат визуално проверени и ролята на контрола на качеството.

Милионите страници на физическите рафтове на архив или библиотека се отварят истински за изследователя само когато станат дигитализирани и в тях може да се търси. Дигитализацията е превръщането на физически документ в цифрово изображение чрез сканиране или фотографиране. Но снимка на страница все още не е "текст"; За компютъра това все още е изображение, не можете да търсите в него. Тук OCR влиза в действие.

OCR (Optical Character Recognition) е технология, която разпознава отпечатани букви в изображение на документ и ги преобразува в машинно четим текст с възможност за търсене. В този модул ще научите как да дигитализирате исторически отпечатани документи с OCR, как AI помага за коригирането на OCR грешки в този процес и къде човешкото око е от съществено значение. (Ръкописните текстове изискват различна технология; ще разгледаме това в следващата част.)

Работен процес по дигитализация: стъпка по стъпка

1. Подготовка и отсяване. Сканирайте документа с възможно най-високо качество. Общо правило за исторически изследвания е разделителна способност от поне 300-400 DPI (точки на инч). Ниската разделителна способност повишава честотата на грешките в следващия етап на OCR.

2. Предварителна обработка на изображението. Подобряването на изображението преди OCR значително увеличава успеха: изкривяване на сканираната страница, премахване на петна, увеличаване на контраста, конвертиране в черно и бяло. Съвременните базирани на AI инструменти могат да автоматизират тази стъпка.

3. OCR приложение. Подавате изображението към OCR двигателя; Двигателят разпознава букви и извежда текст. Резултатът обикновено се състои от два слоя: видимото изображение на документа и „скрит текстов слой с възможност за търсене“ отдолу.

4. Корекция (посткорекция). Суровият OCR резултат никога не е перфектен. Знаците се четат неправилно поради стари шрифтове, пожълтяла хартия, размазване на мастило и грешки при сканиране. Това е мястото, където AI е мощен помощник: той предлага и коригира OCR грешки, използвайки контекст.

5. Проверка и контрол на качеството. Коригираният текст се проверява от човека извадково или изцяло. Особено критични области като имена, дати и номера трябва да бъдат проверени визуално.

Защо OCR прави грешки, как AI помага

Типични проблеми, които предизвикват OCR в исторически документи: стари и модни шрифтове, остарели форми на букви като дълги "s" (ſ), оформление на страница с две колони, бележки под линия, ръкописни вложки, печати и избледняло мастило. Тъй като машината за OCR "вижда" буквите една по една, тя често бърка двоичното "rn" като "m", буквата "l" като числото "1" и буквата "O" като "0".

Езиковите модели на AI предлагат различна сила тук: те разбират контекста. Ако OCR машина напише „1stanbu1“, AI би могъл да заключи от контекста, че трябва да е „Истанбул“. Но тук има голяма опасност: когато "коригира" AI може също да промени текста. Може да добави „Коригирах“ несъществуваща дума или да попълни неясно място със собствено предположение. Това нарушава верността на транскрипцията.

Внимание: Златното правило при корекцията на OCR е следното: AI трябва да коригира само очевидни грешки при разпознаване, а не да интерпретира или допълва съдържанието на текста. „1stanbu1 → Истанбул“ е легитимен; Не става въпрос за запълване на нечетлива дума с предположения. Несигурните места се отбелязват с [?] и не трябва да се измислят.

OCR типове грешки и подход с таблица

Тип грешка

пример

Може ли AI да го поправи?

човешки контрол

смесване на знаци

rn↔m, l↔1, O↔0

Да, безопасно е

проба

стара буквена форма

дълго ſ → s

Да, безопасно е

проба

Избледняла/нечетлива дума

"ka___n"

Не, трябва да сложа [?]

задължително

собствено име/име на място

"Константинийе"

внимателен

задължително

Номер/дата

"1867" срещу "1857"

рисковано

задължително

Оформление на страницата (колона/бележка под линия)

смесен поток

частично

задължително

За да обобщим картината в едно изречение: AI надеждно почиства обикновените грешки в знаците; Но човешките очи са необходими за специални имена, числа, дати и нечетливи места.

три мини калъфа

Случай 1 — Архивите на вестниците станаха достъпни за търсене. Университетска библиотека дигитализира 12 000 страници от местни вестници от 30-те години на миналия век. Суровата точност на OCR беше приблизително 82% (18 от всеки 100 знака бяха неправилни). Корекцията, базирана на AI, повиши точността до 96% с речник и контекст, подходящи за езика на вестника. За оставащите грешки е извършена проверка на извадка, а не пълния текст; Колекцията стана достъпна за търсене след 3 седмици.

Случай 2 — AI „коригирана“ и изкривена история. Един архивист накара AI да коригира датата "1863" на OCR разпечатката. AI "коригира" датата на "1868", като разгледа друго събитие в контекста - въпреки че документът ясно казва 1863. Ако архивистът не беше погледнал оригиналното изображение, каталогът щеше да влезе с грешна дата. Урок: числата и датите никога не се оставят на AI, те се проверяват с изображението.

Случай 3 — Объркана страница с две колони. Страниците с две колони на годишник от 19-ти век бяха смесени в един поток в OCR и изреченията бяха преплетени. Суровият изход беше нечетлив. Текстът се подобри, когато за първи път разделих оформлението на страницата на региони (сегментиране) и обработих всяка колона отделно. Урок: при сложно оформление на страницата, първо структурата, след това текстът.

Четири копируеми шаблона

1) Сигурна OCR корекция:

По-долу е необработеният OCR резултат на исторически документ. Вашата задача е да коригирате САМО очевидни грешки при оптично разпознаване (напр. rn→m,1→l, 0→O, дълги ſ→s). Правила: (1) Тълкувайте смисъла на текста. (2) Коригирайте нечетливи/двусмислени думи, оставете както е и маркирайте с [?]. (3) НЕ добавяне, премахване или допълване на изречения. (4) ПРОМЯНА на номера и дати; маркирайте [число?], ако се съмнявате. Суров OCR: [тук]

2) OCR отчет за качеството:

Разгледайте OCR изхода по-долу и създайте отчет за качеството: (1) Избройте думи с възможни грешки при разпознаване, (2) Маркирайте области, които изглеждат нечетливи/неясни, (3) Избройте конкретни имена, дати и числа, които изискват човешка проверка. НЕ коригирайте; генерира само контролен списък. Текст: [тук]

3) Помощ за анализ на колона/структура:

Тъй като OCR текстът по-долу идва от страница с две колони, потокът може да е объркан. Пренаредете текста в логични абзаци, НО не променяйте, добавяйте или изтривайте думи. Просто коригирайте реда. Маркирайте поръчката, в която не сте сигурни, с [поръчка?]. Текст: [тук]

4) Нормализиране към стандартен език (по избор, отделен слой):

Създайте опростена версия за четене в днешния правопис, в отделна колона, НАД коригирания исторически текст по-долу. НИКОГА не променяйте ОРИГИНАЛНИЯ текст; Нека опростяването е отделен слой. Просто актуализирайте правописа/произношението, без да добавяте смисъл. Оригинал: [тук]

Слаба подкана / Силна подкана

Слаб:

Коригирайте и разкрасете този OCR текст.

„Beautify“ позволява на AI да пренапише текста, да компенсира пропуските и да интерпретира съдържанието; нарушава лоялността.

Силен:

Коригирайте САМО грешки при оптично разпознаване в този необработен OCR изход. Не интерпретирайте смисъла, добавяйте/изтривайте думи, оставяйте нечетливи части с [?], променяйте числата и датите. Показвайте всяка корекция, която правите, в отделен списък във формат „оригинал → корекция“, за да мога да я проверя. Текст: [тук]

Разликата: ограничено мито, забрана за производство, двусмисленост на маркировката и проследим списък с корекции правят изхода подлежащ на проверка.

Често срещани грешки

  • Сканиране при ниска резолюция. Повечето OCR грешки са причинени от лоши изображения; Качественото сканиране е най-евтината инвестиция.
  • Наричай AI „направи красив“. Това произвежда по-скоро плавност, отколкото вярност; Документът е пренаписан.
  • Оставяйки числата и датите на AI. Те се повреждат тихо, когато се „коригират“ от контекста; трябва да се провери чрез изображение.
  • Попълване на нечетливата област с предположение. Тя трябва да бъде защитена от несигурност [?], а не измислена.
  • Изобщо без контрол вместо вземане на проби. Дори 96% точност означава хиляди грешки в 12 000 страници; критичните зони се сканират.

В обобщение

OCR отваря архивите за изследователите, като преобразува отпечатани исторически документи в текст с възможност за търсене. AI е мощна помощ при коригиране на грешки в знаци в необработен OCR изход с контекст; Но трябва да начертаете границата между редактиране и пренаписване. Висококачественото сканиране, инструкциите за безопасна корекция, запазването на двусмислието с [?] и проверката с човешко око на имена/дати/номера правят дигитализацията едновременно бърза и надеждна. AI почиства текста; Вие сте пазител на верността.

Задача за приложение

Сканирайте отпечатан исторически документ (стар вестник, официално писмо, страница от книга) или вземете OCR разпечатка. Коригирайте текста с шаблона „Сигурна OCR корекция“ и поискайте корекции чрез списъка „оригинал → корекция“. След това премахнете областите, които изискват човешки контрол с „OCR отчет за качество“. Сравнете всяка дата и собствено име в списъка с действителното изображение; Обърнете внимание колко са били "коригирани" неправилно.

контролен списък

  • [ ] Сканирах документа с поне 300 DPI и добър контраст.
  • [ ] Поисках от AI само оптична корекция на грешки, а не пренаписване.
  • [ ] Защитих нечетливите части с [?].
  • [ ] Проверих всички числа, дати и собствени имена с изображението.
  • [ ] Направих проба или пълна проверка в критични зони.