Unitate 2 / 12

Digitalizarea documentelor și OCR: conversia textului tipărit în text automat

Câștiguri:

  • Abilitatea de a configura fluxul de lucru de digitalizare și OCR (scanare, preprocesare, recunoaștere, corectare, verificare) pas cu pas
  • Abilitatea de a utiliza AI pentru a corecta erorile OCR cu context, menținând în același timp linia de corecție și rescrie și marcând ambiguitatea cu [?]
  • Înțelegeți de ce numerele, datele și numele proprii trebuie verificate vizual și rolul controlului calității.

Milioanele de pagini de pe rafturile fizice ale unei arhive sau biblioteci sunt deschise cu adevărat cercetătorului doar atunci când devin digitalizate și căutate. Digitalizarea înseamnă convertirea unui document fizic într-o imagine digitală prin scanarea sau fotografierea acestuia. Dar o fotografie a unei pagini nu este încă „text”; Pentru computer este încă o imagine, nu poți căuta în ea. Aici intervine OCR.

OCR (Optical Character Recognition) este o tehnologie care recunoaște literele tipărite dintr-o imagine a documentului și le convertește în text care poate fi citit de mașină și care poate fi căutat. În această unitate, veți învăța cum să digitalizați documente istorice tipărite cu OCR, cum AI ajută la corectarea erorilor OCR în acest proces și unde ochiul uman este esențial. (Textele scrise de mână necesită o tehnologie diferită; vom trata asta în unitatea următoare.)

Flux de lucru de digitizare: pas cu pas

1. Pregătire și screening. Scanați documentul la cea mai înaltă calitate posibilă. O regulă generală pentru cercetarea istorică este o rezoluție de cel puțin 300-400 DPI (puncte pe inch). Rezoluția scăzută crește vertiginos rata de eroare în etapa OCR ulterioară.

2. Preprocesarea imaginii. Îmbunătățirea imaginii înainte de OCR crește foarte mult succesul: declinarea paginii scanate, eliminarea defectelor, creșterea contrastului, conversia în alb-negru. Instrumentele moderne bazate pe inteligență artificială pot automatiza acest pas.

3. Aplicație OCR. Alimentați imaginea motorului OCR; Motorul recunoaște literele și produce text. Ieșirea constă de obicei din două straturi: imaginea documentului vizibil și un „strat de text ascuns care poate fi căutat” dedesubt.

4. Corecție (post-corecție). Ieșirea OCR brută nu este niciodată perfectă. Caracterele sunt citite incorect din cauza fonturilor vechi, a hârtiei îngălbenite, a petelor de cerneală și a erorilor de scanare. Aici AI este un ajutor puternic: sugerează și corectează erorile OCR folosind context.

5. Verificare și control al calității. Textul corectat este verificat de om pe bază de eșantion sau complet. În special zonele critice, cum ar fi numele, datele și numerele, trebuie verificate vizual.

De ce face greșeli OCR, cum ajută AI

Probleme tipice care provoacă OCR în documentele istorice: fonturi vechi și fanteziste, forme de litere învechite, cum ar fi „s” lung (ſ), aspect de pagină în două coloane, note de subsol, inserții scrise de mână, sigilii și cerneală decolorată. Deoarece un motor OCR „vede” literele una câte una, deseori confundă binarul „rn” cu „m”, litera „l” ca număr „1” și litera „O” cu „0”.

Modelele de limbaj AI oferă o putere diferită aici: ele înțeleg contextul. Dacă un motor OCR a scris „1stanbu1”, AI ​​ar putea deduce din context că ar trebui să fie „Istanbul”. Dar există un mare pericol aici: atunci când „corectează” AI ​​poate schimba și textul. El poate adăuga „am corectat” un cuvânt inexistent sau poate completa un loc neclar cu propria sa presupunere. Acest lucru perturbă fidelitatea transcripției.

Atenție: regula de aur în corectarea OCR este următoarea: AI ar trebui să corecteze numai erorile evidente de recunoaștere, nu să interpreteze sau să completeze conținutul textului. „1stanbu1 → Istanbul” este legitim; Nu este vorba de a umple un cuvânt ilizibil cu presupuneri. Locurile incerte trebuie marcate cu [?] și nu ar trebui inventate.

Tipuri de erori OCR și abordare cu un tabel

Tip de eroare

exemplu

Poate AI să o repare?

controlul uman

amestecarea caracterelor

rn↔m, l↔1, O↔0

Da, este sigur

probă

forma de literă veche

lung ſ → s

Da, este sigur

probă

Cuvânt estompat/izibil

"ka___n"

Nu, ar trebui să pun [?]

obligatoriu

nume propriu/numele locului

"Constantiniyye"

atent

obligatoriu

Număr/data

„1867” vs „1857”

riscant

obligatoriu

Aspectul paginii (coloană/notă de subsol)

flux mixt

parțial

obligatoriu

Pentru a rezuma imaginea într-o singură propoziție: AI curăță în mod fiabil erorile obișnuite de caractere; Dar ochii umani sunt necesari pentru nume speciale, numere, date și locuri imposibil de citit.

trei mini cutii

Cazul 1 — Arhivele de ziare au devenit căutabile. O bibliotecă universitară a digitizat 12.000 de pagini de ziare locale din anii 1930. Precizia OCR brut a fost estimată la 82% (18 din 100 de caractere erau incorecte). Corecția bazată pe inteligență artificială a crescut acuratețea la 96% cu un dicționar și un context adecvat pentru limbajul ziarului. Pentru erorile rămase, a fost efectuată o verificare eșantion, mai degrabă decât textul complet; Colecția a devenit căutată în 3 săptămâni.

Cazul 2 – AI „corectat” și a distorsionat istoricul. Un arhivar a cerut AI să corecteze data „1863” de pe imprimarea OCR. AI „a corectat” data la „1868” analizând un alt eveniment în context – chiar dacă documentul spunea clar 1863. Dacă arhivistul nu s-ar fi uitat la imaginea originală, catalogul ar fi intrat cu o dată greșită. Lecție: numerele și datele nu sunt niciodată lăsate în seama AI, ele sunt verificate cu imaginea.

Cazul 3 — Pagina cu două coloane confuză. Paginile cu două coloane ale unui anuar din secolul al XIX-lea au fost amestecate într-un singur flux în OCR, iar propozițiile au fost împletite. Ieșirea brută a fost ilizibilă. Textul s-a îmbunătățit când am împărțit pentru prima dată aspectul paginii în regiuni (segmentare) și am procesat fiecare coloană separat. Lecție: în aspectul complex al paginii, structura întâi, textul în al doilea rând.

Patru șabloane copiabile

1) Corecție OCR sigură:

Mai jos este rezultatul brut OCR a unui document istoric. Sarcina dvs. este să corectați NUMAI erorile evidente de recunoaștere optică (de exemplu, rn→m,1→l, 0→O, long ſ→s). Reguli: (1) Interpretați sensul textului. (2) Corectați cuvintele ilizibile/ambigue, lăsați așa cum sunt și marcați cu [?]. (3) NU adăugarea, eliminarea sau completarea propozițiilor. (4) SCHIMBA numerele și datele; marcați [numărul?] dacă aveți îndoieli.OCR brut: [aici]

2) Raport de calitate OCR:

Examinați rezultatul OCR de mai jos și produceți un raport de calitate: (1) Listați cuvintele cu posibile erori de recunoaștere, (2) Marcați zonele care par necizibile/neclare, (3) Listați nume, date și numere specifice care necesită verificare umană. NU corectați; generați numai lista de verificare.Text: [aici]

3) Ajutor pentru analiza coloanelor/structurii:

Deoarece textul OCR de mai jos provine dintr-o pagină cu două coloane, fluxul poate fi confuz. Rearanjați textul în paragrafe logice DAR nu modificați, adăugați sau ștergeți niciun cuvânt. Doar corectează comanda. Marcați comanda de care nu sunteți sigur cu [comandă?]. Text: [aici]

4) Normalizare la limbajul standard (opțional, strat separat):

Produceți o versiune simplificată de lectură în ortografia de astăzi, într-o coloană separată, DEASUPRA textului istoric corectat de mai jos. NU modificați NICIODATĂ textul ORIGINAL; Lăsați simplificarea să fie un strat separat. Doar actualizați ortografia/pronunția fără a adăuga sens.Original: [aici]

Prompt slab / Prompt puternic

slab:

Corectați și înfrumusețați acest text OCR.

„Beautify” permite AI să rescrie textul, să compenseze omisiunile și să interpreteze conținutul; rupe loialitatea.

Puternic:

Remediați NUMAI erorile de recunoaștere optică din această ieșire OCR brută. Nu interpretați sensul, adăugați/ștergeți cuvinte, lăsați părți de necitit cu [?], schimbați numerele și datele. Afișați fiecare corecție pe care o faceți într-o listă separată în formatul „original → corecție” pentru a putea verifica. Text: [aici]

Diferența: taxă limitată, interdicția de fabricare, ambiguitatea de marcare și lista de corecții care poate fi urmărită fac rezultatul auditabil.

Greșeli comune

  • Scanare la rezoluție scăzută. Majoritatea erorilor OCR sunt cauzate de imagini proaste; Scanarea de calitate este cea mai ieftină investiție.
  • Numirea AI „face frumos”. Aceasta produce mai degrabă fluență decât fidelitate; Documentul este rescris.
  • Lăsând numerele și datele în seama AI. Acestea sunt corupte în tăcere atunci când sunt „corectate” din context; trebuie verificat prin imagine.
  • Completarea zonei de necitit cu o ghicire. Ar trebui protejat de incertitudine [?], nu inventat.
  • Nu controlează deloc în loc de eșantionare. Chiar și o precizie de 96% înseamnă mii de erori în 12.000 de pagini; zonele critice sunt scanate.

Pe scurt

OCR deschide arhivele cercetătorilor prin conversia documentelor istorice tipărite în text care poate fi căutat. AI este un ajutor puternic în corectarea erorilor de caractere în rezultatul OCR brut cu context; Dar trebuie să tragi limita dintre editare și rescriere. Scanarea de înaltă calitate, instrucțiunile de corectare sigure, păstrarea ambiguității cu [?] și verificarea cu ochiul uman a numelor/datelor/numerelor fac digitizarea atât rapidă, cât și fiabilă. AI curăță textul; Tu ești gardianul fidelității.

Sarcina de aplicare

Scanați un document istoric tipărit (ziar vechi, scrisoare oficială, pagină de carte) sau luați o imprimare OCR. Solicitați corectarea textului cu șablonul „Corectare OCR sigură” și solicitați corecții prin lista „original → corecție”. Apoi, eliminați zonele care necesită control uman cu „raportul de calitate OCR”. Comparați fiecare dată și nume propriu din listă cu imaginea reală; Observați câte au fost „corectate” incorect.

lista de verificare

  • [ ] Am scanat documentul cu cel puțin 300 DPI și un contrast bun.
  • [ ] Am cerut AI doar corectarea erorilor optice, nu o rescriere.
  • [ ] Am protejat părțile care nu pot fi citite cu [?].
  • [ ] Am verificat toate numerele, datele și numele proprii cu imaginea.
  • [ ] Am făcut o probă sau o verificare completă în zone critice.