Добивки:
- Способност за поставување на дигитализација и OCR работниот тек (скенирање, претходна обработка, препознавање, корекција, верификација) чекор по чекор
- Способност да се користи вештачка интелигенција за да се поправат грешките на OCR со контекст, додека се одржува линијата за корекција и препишување и означување на двосмисленоста со [?]
- Разберете зошто броевите, датумите и соодветните имиња мора да бидат визуелно потврдени и улогата на контрола на квалитетот.
Милиони страници на физичките полици на архивата или библиотеката се вистински отворени за истражувачот само кога ќе станат дигитализирани и може да се пребаруваат. Дигитализацијата е конвертирање на физички документ во дигитална слика со скенирање или фотографирање. Но, фотографијата на страница сè уште не е „текст“; За компјутерот тоа е сè уште слика, не можете да пребарувате во неа. Ова е местото каде што OCR влегува во игра.
OCR (Optical Character Recognition) е технологија која препознава отпечатени букви во слика на документ и ги претвора во машински читлив текст што може да се пребарува. Во оваа единица, ќе научите како да ги дигитализирате историските печатени документи со OCR, како вештачката интелигенција помага да се поправат грешките на OCR во овој процес и каде е неопходно човечкото око. (Ракописните текстови бараат различна технологија; тоа ќе го покриеме во следната единица.)
Работен тек на дигитализација: чекор по чекор
1. Подготовка и скрининг. Скенирајте го документот со највисок можен квалитет. Општо правило за историско истражување е резолуција од најмалку 300-400 DPI (точки по инч). Ниската резолуција ја зголемува стапката на грешка во следната фаза на OCR.
2. Претходна обработка на слики. Подобрувањето на сликата пред OCR значително го зголемува успехот: отстранување на скенираната страница, отстранување на флеки, зголемување на контрастот, претворање во црно-бело. Современите алатки засновани на вештачка интелигенција можат да го автоматизираат овој чекор.
3. Апликација за OCR. Ја внесувате сликата во моторот OCR; Моторот препознава букви и произведува текст. Излезот обично се состои од два слоја: видливата слика на документот и „слој со скриен текст што може да се пребарува“ одоздола.
4. Корекција (пост-корекција). Суровиот OCR излез никогаш не е совршен. Знаците се читаат погрешно поради стари фонтови, пожолтена хартија, размачкана мастило и грешки при скенирање. Ова е местото каде што вештачката интелигенција е моќен помошник: сугерира и коригира грешки во OCR користејќи контекст.
5. Верификација и контрола на квалитетот. Поправениот текст го проверува човекот на примерок или целосно. Особено критичните области како што се имињата, датумите и броевите мора да се проверат визуелно.
Зошто OCR прави грешки, како вештачката интелигенција помага
Типични проблеми што го предизвикуваат OCR во историските документи: стари и фантастични фонтови, застарени букви како долги „s“ (ſ), распоред на страници со две колони, фусноти, рачно напишани инсерти, печати и избледено мастило. Бидејќи OCR моторот „гледа“ букви една по една, често ги меша бинарните „rn“ како „m“, буквата „l“ како број „1“ и буквата „O“ како „0“.
Јазичните модели на вештачка интелигенција овде нудат поинаква моќ: тие го разбираат контекстот. Ако некој OCR мотор напише „1stanbu1“, вештачката интелигенција би можела од контекстот да заклучи дека треба да биде „Истанбул“. Но, тука постои голема опасност: кога се „поправа“ вештачката интелигенција, исто така, може да го промени текстот. Може да додаде „Поправив“ непостоечки збор или да пополни нејасно место со сопствена претпоставка. Ова ја нарушува верноста на транскрипцијата.
Внимание: Златното правило во корекција на OCR е ова: ВИ треба да ги коригира само очигледните грешки при препознавање, а не да ја толкува или дополнува содржината на текстот. „1станбу1 → Истанбул“ е легитимно; Не станува збор за пополнување на нечитлив збор со претпоставки. Неизвесните места треба да бидат означени со [?] и не треба да се измислуваат.
Видови на грешки во OCR и пристап со табела
Тип на грешка
пример
Дали вештачката интелигенција може да го поправи?
човечка контрола
мешање на карактери
rn↔m, l↔1, O↔0
Да, безбедно е
примерок
стара буква
долго ſ → s
Да, безбедно е
примерок
Изблед/нечитлив збор
"ka___n"
Не, треба да се стави [?]
задолжително
соодветно име/место
„Константинија“
внимателен
задолжително
Број/датум
„1867“ наспроти „1857“
ризично
задолжително
Распоред на страницата (колона/фуснота)
мешан тек
делумно
задолжително
Да ја сумираме сликата во една реченица: вештачката интелигенција сигурно ги чисти обичните грешки во знаците; Но, човечките очи се потребни за посебни имиња, бројки, датуми и нечитливи места.
три мини футроли
Случај 1 - Архивите на весниците станаа достапни за пребарување. Универзитетска библиотека дигитализираше 12.000 страници локални весници од 1930-тите. Необработената OCR точност беше околу 82% (18 од секои 100 знаци беа неточни). Корекцијата заснована на вештачка интелигенција ја зголеми точноста на 96% со речник и контекст соодветен на јазикот на весниците. За преостанатите грешки, беше извршена проверка на примерокот наместо целосниот текст; Колекцијата стана пребарлива за 3 недели.
Случај 2 - вештачката интелигенција ја „поправи“ и ја искриви историјата. Еден архивар побарал вештачката интелигенција да го поправи датумот „1863“ на отпечатокот за OCR. Вештачката интелигенција го „коригирала“ датумот на „1868“ гледајќи друг настан во контекст - иако во документот јасно пишувало 1863 година. Ако архиварот не ја погледнал оригиналната слика, каталогот би бил внесен со погрешен датум. Лекција: броевите и датумите никогаш не се препуштаат на вештачката интелигенција, тие се проверуваат со сликата.
Случај 3 - страница со две колони збунета. Страниците со две колони на годишник од 19 век беа измешани во еден тек во OCR и речениците беа испреплетени. Суровиот излез беше нечитлив. Текстот се подобри кога првпат го поделив распоредот на страницата во региони (сегментација) и ја обработив секоја колона посебно. Лекција: во сложен распоред на страница, прво структура, второ текст.
Четири шаблони за копирање
1) Безбедна корекција на OCR:
Подолу е необработен OCR излез од историски документ. Ваша задача е да ги исправите САМО очигледните грешки во оптичкото препознавање (на пр. rn→m,1→l, 0→O, долги ſ→s). Правила: (1) Толкувајте го значењето на текстот. (2) Поправете нечитливи/двосмислени зборови, оставете како што е и означете со [?]. (3) НЕ додавање, отстранување или завршување реченици. (4) ПРОМЕНИ ги броевите и датумите; означете [број?] ако се сомневате. Необработен OCR: [тука]
2) Извештај за квалитет на OCR:
Испитајте го излезот на OCR подолу и изгответе извештај за квалитет: (1) Наведете зборови со можни грешки во препознавањето, (2) Обележете ги областите што изгледаат нечитливи/нејасни, (3) Наведете конкретни имиња, датуми и броеви за кои е потребна проверка од луѓе. НЕ корегирајте; генерира само листа за проверка. Текст: [тука]
3) Помош за парсирање на колона/структура:
Бидејќи текстот за OCR подолу доаѓа од страница со две колони, протокот може да биде збунет. Преуредете го текстот во логички параграфи НО не менувајте, додавајте или бришете зборови. Само поправете го редоследот. Обележете ја нарачката за која не сте сигурни со [нарачка?]. Текст: [тука]
4) Нормализација на стандарден јазик (опционално, посебен слој):
Направете поедноставена верзија за читање во денешниот правопис, во посебна колона, НАД поправениот историски текст подолу. НИКОГАШ не го менувајте ОРИГИНАЛНИОТ текст; Нека поедноставувањето е посебен слој. Само ажурирајте го правописот/изговорот без додавање значење. Оригинал: [тука]
Слаб промпт / Силен промпт
Слаб:
Поправете го и разубавете го овој OCR текст.
„Beautify“ и овозможува на вештачката интелигенција да го преработи текстот, да направи пропусти и да ја толкува содржината; ја нарушува лојалноста.
Силно:
Поправете ги САМО грешките во оптичкото препознавање на овој необработен OCR излез. Не го толкувајте значењето, не додавајте/бришете зборови, не оставајте нечитливи делови со [?], менувајте броеви и датуми. Секоја корекција што ја правите прикажете ја во посебна листа во формат „оригинал → корекција“ за да можам да ја потврдам. Текст: [тука]
Разликата: ограничена должност, забрана за изработка, двосмисленост на означување и список на корекции што може да се следат, го прават резултатот за ревизија.
Вообичаени грешки
- Скенирање со мала резолуција. Повеќето OCR грешки се предизвикани од лоши слики; Квалитетното скенирање е најевтината инвестиција.
- Повикувајќи ја вештачката интелигенција „направи убава“. Ова произведува флуентност наместо верност; Документот е препишан.
- Оставајќи ги броевите и датумите на вештачката интелигенција. Овие се тивко корумпирани кога се „поправаат“ од контекстот; мора да се потврди со слика.
- Пополнување на нечитливата област со погодување. Треба да се заштити со неизвесност [?], а не да се измислува.
- Воопшто не се контролира наместо земање примероци. Дури и 96% точност значи илјадници грешки на 12.000 страници; се скенираат критичните области.
Сумирано
OCR отвора архиви за истражувачите со претворање на печатените историски документи во текст што може да се пребарува. Вештачката интелигенција е моќна помош за корекција на грешките на знаците во сировиот OCR излез со контекст; Но, мора да ја повлечете границата помеѓу уредувањето и препишувањето. Висококвалитетното скенирање, инструкциите за безбедна корекција, зачувувањето на двосмисленоста со [?] и проверката на имиња/датуми/броеви од човечко око ја прават дигитализацијата брза и сигурна. ВИ го чисти текстот; Вие сте чувар на верноста.
Задача за апликација
Скенирајте отпечатен историски документ (стар весник, службено писмо, страница со книга) или отпечатете OCR. Текстот нека се коригира со шаблонот „Безбедна корекција на OCR“ и побарајте корекции преку списокот „оригинал → корекција“. Потоа, отстранете ги областите за кои е потребна човечка контрола со „Извештајот за квалитет на OCR“. Споредете го секој датум и соодветно име во списокот со вистинската слика; Забележете колку се „поправени“ погрешно.
листа за проверка
- [ ] Го скенирав документот со најмалку 300 DPI и добар контраст.
- [ ] Побарав од вештачката интелигенција само корекција на оптичка грешка, а не препишување.
- [ ] Ги заштитив нечитливите делови со [?].
- [ ] Ги потврдив сите броеви, датуми и соодветни имиња со сликата.
- [ ] Направив примерок или целосна проверка во критичните области.