Печалби:
- Възможност за настройка на работния процес за дигитализация и OCR (сканиране, предварителна обработка, разпознаване, корекция, проверка) стъпка по стъпка
- Възможност за използване на AI за коригиране на OCR грешки с контекст, като същевременно се поддържа редът за корекция и пренаписване и маркиране на двусмислието с [?]
- Разберете защо числата, датите и собствените имена трябва да бъдат визуално проверени и ролята на контрола на качеството.
Милионите страници на физическите рафтове на архив или библиотека се отварят истински за изследователя само когато станат дигитализирани и в тях може да се търси. Дигитализацията е превръщането на физически документ в цифрово изображение чрез сканиране или фотографиране. Но снимка на страница все още не е "текст"; За компютъра това все още е изображение, не можете да търсите в него. Тук OCR влиза в действие.
OCR (Optical Character Recognition) е технология, която разпознава отпечатани букви в изображение на документ и ги преобразува в машинно четим текст с възможност за търсене. В този модул ще научите как да дигитализирате исторически отпечатани документи с OCR, как AI помага за коригирането на OCR грешки в този процес и къде човешкото око е от съществено значение. (Ръкописните текстове изискват различна технология; ще разгледаме това в следващата част.)
Работен процес по дигитализация: стъпка по стъпка
1. Подготовка и отсяване. Сканирайте документа с възможно най-високо качество. Общо правило за исторически изследвания е разделителна способност от поне 300-400 DPI (точки на инч). Ниската разделителна способност повишава честотата на грешките в следващия етап на OCR.
2. Предварителна обработка на изображението. Подобряването на изображението преди OCR значително увеличава успеха: изкривяване на сканираната страница, премахване на петна, увеличаване на контраста, конвертиране в черно и бяло. Съвременните базирани на AI инструменти могат да автоматизират тази стъпка.
3. OCR приложение. Подавате изображението към OCR двигателя; Двигателят разпознава букви и извежда текст. Резултатът обикновено се състои от два слоя: видимото изображение на документа и „скрит текстов слой с възможност за търсене“ отдолу.
4. Корекция (посткорекция). Суровият OCR резултат никога не е перфектен. Знаците се четат неправилно поради стари шрифтове, пожълтяла хартия, размазване на мастило и грешки при сканиране. Това е мястото, където AI е мощен помощник: той предлага и коригира OCR грешки, използвайки контекст.
5. Проверка и контрол на качеството. Коригираният текст се проверява от човека извадково или изцяло. Особено критични области като имена, дати и номера трябва да бъдат проверени визуално.
Защо OCR прави грешки, как AI помага
Типични проблеми, които предизвикват OCR в исторически документи: стари и модни шрифтове, остарели форми на букви като дълги "s" (ſ), оформление на страница с две колони, бележки под линия, ръкописни вложки, печати и избледняло мастило. Тъй като машината за OCR "вижда" буквите една по една, тя често бърка двоичното "rn" като "m", буквата "l" като числото "1" и буквата "O" като "0".
Езиковите модели на AI предлагат различна сила тук: те разбират контекста. Ако OCR машина напише „1stanbu1“, AI би могъл да заключи от контекста, че трябва да е „Истанбул“. Но тук има голяма опасност: когато "коригира" AI може също да промени текста. Може да добави „Коригирах“ несъществуваща дума или да попълни неясно място със собствено предположение. Това нарушава верността на транскрипцията.
Внимание: Златното правило при корекцията на OCR е следното: AI трябва да коригира само очевидни грешки при разпознаване, а не да интерпретира или допълва съдържанието на текста. „1stanbu1 → Истанбул“ е легитимен; Не става въпрос за запълване на нечетлива дума с предположения. Несигурните места се отбелязват с [?] и не трябва да се измислят.
OCR типове грешки и подход с таблица
Тип грешка
пример
Може ли AI да го поправи?
човешки контрол
смесване на знаци
rn↔m, l↔1, O↔0
Да, безопасно е
проба
стара буквена форма
дълго ſ → s
Да, безопасно е
проба
Избледняла/нечетлива дума
"ka___n"
Не, трябва да сложа [?]
задължително
собствено име/име на място
"Константинийе"
внимателен
задължително
Номер/дата
"1867" срещу "1857"
рисковано
задължително
Оформление на страницата (колона/бележка под линия)
смесен поток
частично
задължително
За да обобщим картината в едно изречение: AI надеждно почиства обикновените грешки в знаците; Но човешките очи са необходими за специални имена, числа, дати и нечетливи места.
три мини калъфа
Случай 1 — Архивите на вестниците станаха достъпни за търсене. Университетска библиотека дигитализира 12 000 страници от местни вестници от 30-те години на миналия век. Суровата точност на OCR беше приблизително 82% (18 от всеки 100 знака бяха неправилни). Корекцията, базирана на AI, повиши точността до 96% с речник и контекст, подходящи за езика на вестника. За оставащите грешки е извършена проверка на извадка, а не пълния текст; Колекцията стана достъпна за търсене след 3 седмици.
Случай 2 — AI „коригирана“ и изкривена история. Един архивист накара AI да коригира датата "1863" на OCR разпечатката. AI "коригира" датата на "1868", като разгледа друго събитие в контекста - въпреки че документът ясно казва 1863. Ако архивистът не беше погледнал оригиналното изображение, каталогът щеше да влезе с грешна дата. Урок: числата и датите никога не се оставят на AI, те се проверяват с изображението.
Случай 3 — Объркана страница с две колони. Страниците с две колони на годишник от 19-ти век бяха смесени в един поток в OCR и изреченията бяха преплетени. Суровият изход беше нечетлив. Текстът се подобри, когато за първи път разделих оформлението на страницата на региони (сегментиране) и обработих всяка колона отделно. Урок: при сложно оформление на страницата, първо структурата, след това текстът.
Четири копируеми шаблона
1) Сигурна OCR корекция:
По-долу е необработеният OCR резултат на исторически документ. Вашата задача е да коригирате САМО очевидни грешки при оптично разпознаване (напр. rn→m,1→l, 0→O, дълги ſ→s). Правила: (1) Тълкувайте смисъла на текста. (2) Коригирайте нечетливи/двусмислени думи, оставете както е и маркирайте с [?]. (3) НЕ добавяне, премахване или допълване на изречения. (4) ПРОМЯНА на номера и дати; маркирайте [число?], ако се съмнявате. Суров OCR: [тук]
2) OCR отчет за качеството:
Разгледайте OCR изхода по-долу и създайте отчет за качеството: (1) Избройте думи с възможни грешки при разпознаване, (2) Маркирайте области, които изглеждат нечетливи/неясни, (3) Избройте конкретни имена, дати и числа, които изискват човешка проверка. НЕ коригирайте; генерира само контролен списък. Текст: [тук]
3) Помощ за анализ на колона/структура:
Тъй като OCR текстът по-долу идва от страница с две колони, потокът може да е объркан. Пренаредете текста в логични абзаци, НО не променяйте, добавяйте или изтривайте думи. Просто коригирайте реда. Маркирайте поръчката, в която не сте сигурни, с [поръчка?]. Текст: [тук]
4) Нормализиране към стандартен език (по избор, отделен слой):
Създайте опростена версия за четене в днешния правопис, в отделна колона, НАД коригирания исторически текст по-долу. НИКОГА не променяйте ОРИГИНАЛНИЯ текст; Нека опростяването е отделен слой. Просто актуализирайте правописа/произношението, без да добавяте смисъл. Оригинал: [тук]
Слаба подкана / Силна подкана
Слаб:
Коригирайте и разкрасете този OCR текст.
„Beautify“ позволява на AI да пренапише текста, да компенсира пропуските и да интерпретира съдържанието; нарушава лоялността.
Силен:
Коригирайте САМО грешки при оптично разпознаване в този необработен OCR изход. Не интерпретирайте смисъла, добавяйте/изтривайте думи, оставяйте нечетливи части с [?], променяйте числата и датите. Показвайте всяка корекция, която правите, в отделен списък във формат „оригинал → корекция“, за да мога да я проверя. Текст: [тук]
Разликата: ограничено мито, забрана за производство, двусмисленост на маркировката и проследим списък с корекции правят изхода подлежащ на проверка.
Често срещани грешки
- Сканиране при ниска резолюция. Повечето OCR грешки са причинени от лоши изображения; Качественото сканиране е най-евтината инвестиция.
- Наричай AI „направи красив“. Това произвежда по-скоро плавност, отколкото вярност; Документът е пренаписан.
- Оставяйки числата и датите на AI. Те се повреждат тихо, когато се „коригират“ от контекста; трябва да се провери чрез изображение.
- Попълване на нечетливата област с предположение. Тя трябва да бъде защитена от несигурност [?], а не измислена.
- Изобщо без контрол вместо вземане на проби. Дори 96% точност означава хиляди грешки в 12 000 страници; критичните зони се сканират.
В обобщение
OCR отваря архивите за изследователите, като преобразува отпечатани исторически документи в текст с възможност за търсене. AI е мощна помощ при коригиране на грешки в знаци в необработен OCR изход с контекст; Но трябва да начертаете границата между редактиране и пренаписване. Висококачественото сканиране, инструкциите за безопасна корекция, запазването на двусмислието с [?] и проверката с човешко око на имена/дати/номера правят дигитализацията едновременно бърза и надеждна. AI почиства текста; Вие сте пазител на верността.
Задача за приложение
Сканирайте отпечатан исторически документ (стар вестник, официално писмо, страница от книга) или вземете OCR разпечатка. Коригирайте текста с шаблона „Сигурна OCR корекция“ и поискайте корекции чрез списъка „оригинал → корекция“. След това премахнете областите, които изискват човешки контрол с „OCR отчет за качество“. Сравнете всяка дата и собствено име в списъка с действителното изображение; Обърнете внимание колко са били "коригирани" неправилно.
контролен списък
- [ ] Сканирах документа с поне 300 DPI и добър контраст.
- [ ] Поисках от AI само оптична корекция на грешки, а не пренаписване.
- [ ] Защитих нечетливите части с [?].
- [ ] Проверих всички числа, дати и собствени имена с изображението.
- [ ] Направих проба или пълна проверка в критични зони.