Vienība 2 / 12

Dokumentu digitalizācija un OCR: drukātā teksta konvertēšana mašīntekstā

Ieguvumi:

  • Iespēja soli pa solim iestatīt digitalizācijas un OCR darbplūsmu (skenēšana, pirmapstrāde, atpazīšana, labošana, verifikācija).
  • Iespēja izmantot AI, lai labotu OCR kļūdas ar kontekstu, vienlaikus saglabājot labošanas un pārrakstīšanas līniju un atzīmējot neskaidrības ar [?]
  • Izprotiet, kāpēc skaitļi, datumi un īpašvārdi ir vizuāli jāpārbauda un kāda ir kvalitātes kontroles loma.

Miljoniem lappušu arhīva vai bibliotēkas fiziskajos plauktos pētniekam patiesi tiek atvērtas tikai tad, kad tās kļūst digitalizētas un ar tām var meklēt. Digitalizācija ir fiziska dokumenta pārvēršana digitālā attēlā, to skenējot vai fotografējot. Bet lapas fotogrāfija vēl nav "teksts"; Datoram tas joprojām ir attēls, tajā nevar meklēt. Šeit tiek izmantota OCR.

OCR (optiskā rakstzīmju atpazīšana) ir tehnoloģija, kas atpazīst drukātos burtus dokumenta attēlā un pārvērš tos mašīnlasāmā, meklējamā tekstā. Šajā nodaļā jūs uzzināsit, kā digitalizēt vēsturiskus drukātus dokumentus, izmantojot OCR, kā AI palīdz izlabot OCR kļūdas šajā procesā un kur cilvēka acs ir būtiska. (Ar roku rakstītiem tekstiem nepieciešama cita tehnoloģija; mēs to aplūkosim nākamajā nodaļā.)

Digitalizācijas darbplūsma: soli pa solim

1. Sagatavošana un skrīnings. Skenējiet dokumentu visaugstākajā iespējamajā kvalitātē. Vispārīgs vēstures izpētes noteikums ir izšķirtspēja vismaz 300–400 DPI (punkti collā). Zema izšķirtspēja paaugstina kļūdu līmeni nākamajā OCR posmā.

2. Attēla pirmapstrāde. Attēla uzlabošana pirms OCR ievērojami palielina panākumus: skenētās lapas izlīdzināšana, plankumu noņemšana, kontrasta palielināšana, pārveidošana melnbaltā. Mūsdienu uz mākslīgā intelekta bāzes rīki var automatizēt šo darbību.

3. OCR lietojumprogramma. Jūs padodat attēlu OCR dzinējam; Dzinējs atpazīst burtus un veido tekstu. Izvade parasti sastāv no diviem slāņiem: redzamā dokumenta attēla un "meklējamā slēptā teksta slāņa" zem tā.

4. Korekcija (pēckorekcija). Neapstrādāta OCR izvade nekad nav perfekta. Rakstzīmes tiek nolasītas nepareizi veco fontu, dzeltenīga papīra, tintes izsmērēšanās un skenēšanas kļūdu dēļ. Šeit AI ir spēcīgs palīgs: tas iesaka un labo OCR kļūdas, izmantojot kontekstu.

5. Pārbaude un kvalitātes kontrole. Izlaboto tekstu cilvēks pārbauda izlases veidā vai pilnībā. Īpaši kritiskās vietas, piemēram, nosaukumi, datumi un skaitļi, ir jāpārbauda vizuāli.

Kāpēc OCR pieļauj kļūdas, kā AI palīdz

Tipiskas problēmas, kas izaicina OCR vēsturiskos dokumentos: veci un izdomāti fonti, novecojušas burtu formas, piemēram, garas "s" (ſ), divu sleju lappušu izkārtojums, zemsvītras piezīmes, ar roku rakstīti ieliktņi, zīmogi un izbalējusi tinte. Tā kā OCR programma "redz" burtus pa vienam, tas bieži sajauc bināro "rn" kā "m", burtu "l" kā skaitli "1" un burtu "O" kā "0".

AI valodas modeļi piedāvā atšķirīgu spēku: tie saprot kontekstu. Ja OCR dzinējs uzrakstīja "1stanbu1", AI no konteksta varēja secināt, ka tam vajadzētu būt "Stambulai". Bet šeit pastāv lielas briesmas: "labojot" AI var arī mainīt tekstu. Viņš var pievienot "Es laboju" neesošu vārdu vai aizpildīt neskaidru vietu ar savu minējumu. Tas izjauc transkripcijas precizitāti.

Uzmanību: OCR korekcijas zelta likums ir šāds: AI jālabo tikai acīmredzamas atpazīšanas kļūdas, nevis jāinterpretē vai jāpapildina teksta saturs. "1stanbu1 → Istanbul" ir likumīgs; Runa nav par nelasāma vārda piepildīšanu ar minējumiem. Nenoteiktas vietas ir jāatzīmē ar [?], un tās nedrīkst izdomāt.

OCR kļūdu veidi un pieeja ar tabulu

Kļūdas veids

piemērs

Vai AI to var salabot?

cilvēka kontrole

rakstzīmju sajaukšana

rn↔m, l↔1, O↔0

Jā, tas ir droši

paraugs

vecā vēstules forma

garš ſ → s

Jā, tas ir droši

paraugs

Izbalējis/nesalasāms vārds

"ka___n"

Nē, jāieliek [?]

obligāti

īpašvārds/vietas nosaukums

"Konstantīnije"

uzmanīgi

obligāti

Numurs/datums

"1867" pret "1857"

riskanti

obligāti

Lapas izkārtojums (kolonna/zemsvītras piezīme)

jaukta plūsma

daļēji

obligāti

Apkopojot attēlu vienā teikumā: AI droši notīra parastās rakstzīmju kļūdas; Bet cilvēka acis ir nepieciešamas īpašiem vārdiem, skaitļiem, datumiem un nesalasāmām vietām.

trīs mini futrāļi

1. gadījums — avīžu arhīvos kļuva iespējams meklēt. Universitātes bibliotēka ir digitalizējusi 12 000 lappušu vietējo laikrakstu no pagājušā gadsimta 30. gadiem. Neapstrādāta OCR precizitāte bija aptuveni 82% (18 no katrām 100 rakstzīmēm bija nepareizas). Uz AI balstīta korekcija palielināja precizitāti līdz 96%, izmantojot laikraksta valodai atbilstošu vārdnīcu un kontekstu. Atlikušajām kļūdām tika veikta izlases pārbaude, nevis pilna teksta pārbaude; Kolekcija kļuva meklējama 3 nedēļu laikā.

2. gadījums — AI “labota” un izkropļota vēsture. Arhivārs lika AI izlabot OCR izdrukas datumu "1863". AI “izlaboja” datumu uz “1868”, aplūkojot citu notikumu kontekstā – lai gan dokumentā skaidri bija norādīts 1863. gads. Ja arhivārs nebūtu apskatījis oriģinālo attēlu, katalogā būtu ievadīts nepareizs datums. Nodarbība: skaitļi un datumi nekad netiek atstāti AI ziņā, tie tiek pārbaudīti ar attēlu.

3. gadījums — divu kolonnu lapa ir sajaukta. 19. gadsimta gadagrāmatas divu sleju lapas tika sajauktas vienā straumē OCR, un teikumi bija savstarpēji saistīti. Neapstrādātā izvade nebija nolasāma. Teksts uzlabojās, kad pirmo reizi sadalīju lapas izkārtojumu reģionos (segmentācija) un apstrādāju katru kolonnu atsevišķi. Nodarbība: sarežģītā lapas izkārtojumā, vispirms struktūra, otrajā vietā teksts.

Četras kopējamas veidnes

1) Droša OCR korekcija:

Tālāk ir sniegta neapstrādāta vēsturiska dokumenta OCR izvade. Jūsu uzdevums ir labot TIKAI acīmredzamas optiskās atpazīšanas kļūdas (piem., rn→m,1→l, 0→O, long ſ→s). Noteikumi: (1) Interpretējiet teksta nozīmi. (2) Izlabojiet nelasāmos/neskaidros vārdus, atstājiet kā ir un atzīmējiet ar [?]. (3) NAV pievienot, noņemt vai pabeigt teikumus. (4) MAINĪT numurus un datumus; atzīmējiet [numurs?], ja rodas šaubas. Neapstrādāta OCR: [šeit]

2) OCR kvalitātes ziņojums:

Pārbaudiet tālāk norādīto OCR izvadi un izveidojiet kvalitātes ziņojumu: (1) uzskaitiet vārdus ar iespējamām atpazīšanas kļūdām, (2) atzīmējiet apgabalus, kas šķiet nelasāmi/neskaidri, (3) norādiet konkrētus nosaukumus, datumus un numurus, kuriem nepieciešama cilvēka pārbaude. NELABO; ģenerēt tikai kontrolsarakstu.Teksts: [šeit]

3) Kolonnu/struktūru parsēšanas palīdzība:

Tā kā tālāk redzamais OCR teksts nāk no divu sleju lapas, plūsma var būt neskaidra. Pārkārtojiet tekstu loģiskās rindkopās, BET nemainiet, nepievienojiet vai neizdzēsiet nevienu vārdu. Vienkārši izlabojiet secību. Atzīmējiet pasūtījumu, par kuru neesat pārliecināts, izmantojot [order?]. Teksts: [šeit]

4) Normalizācija uz standarta valodu (pēc izvēles, atsevišķs slānis):

Izveidojiet vienkāršotu lasīšanas versiju šodienas pareizrakstībā, atsevišķā slejā VIRS tālāk labotā vēsturiskā teksta. NEKAD nemainiet ORIĢINĀLO tekstu; Lai vienkāršošana būtu atsevišķs slānis. Vienkārši atjauniniet pareizrakstību/izrunu, nepievienojot nozīmi. Oriģināls: [šeit]

Vāja uzvedne / spēcīga uzvedne

Vāji:

Izlabojiet un izdaiļojiet šo OCR tekstu.

“Izdaiļot” ļauj AI pārrakstīt tekstu, labot izlaidumus un interpretēt saturu; lauž lojalitāti.

Spēcīgs:

Labojiet TIKAI optiskās atpazīšanas kļūdas šajā neapstrādātajā OCR izvadē. Neinterpretējiet nozīmi, nepievienojiet/izdzēsiet vārdus, neatstājiet nelasāmas daļas ar [?], nemainiet skaitļus un datumus. Parādiet katru veikto labojumu atsevišķā sarakstā formātā "oriģināls → labojums", lai es varētu to pārbaudīt. Teksts: [šeit]

Atšķirība: ierobežots pienākums, izgatavošanas aizliegums, marķējuma neskaidrība un izsekojamais labojumu saraksts padara rezultātu auditējamu.

Biežas kļūdas

  • Skenēšana ar zemu izšķirtspēju. Lielāko daļu OCR kļūdu izraisa slikti attēli; Kvalitatīva skenēšana ir lētākais ieguldījums.
  • AI sauc par “padarīt skaistu”. Tas rada plūdumu, nevis uzticamību; Dokuments tiek pārrakstīts.
  • Ciparus un datumus atstājot AI ziņā. Tie tiek klusi sabojāti, kad tiek "laboti" no konteksta; ir jāpārbauda pēc attēla.
  • Nelasāmā laukuma aizpildīšana ar minējumu. To vajadzētu aizsargāt ar nenoteiktību [?], nevis izdomāt.
  • Izlases vietā vispār nekontrolē. Pat 96% precizitāte nozīmē tūkstošiem kļūdu 12 000 lappusēs; tiek skenētas kritiskās zonas.

Rezumējot

OCR atver arhīvus pētniekiem, pārvēršot drukātos vēsturiskos dokumentus meklējamā tekstā. AI ir spēcīgs palīglīdzeklis, lai labotu rakstzīmju kļūdas neapstrādātā OCR izvadē ar kontekstu; Bet jums ir jānovelk robeža starp rediģēšanu un pārrakstīšanu. Augstas kvalitātes skenēšana, drošas korekcijas instrukcijas, neskaidrības saglabāšana ar [?] un vārdu/datumu/skaitļu pārbaude cilvēka acīm padara digitalizāciju gan ātru, gan uzticamu. AI notīra tekstu; Jūs esat uzticības sargs.

Lietojumprogrammas uzdevums

Skenējiet drukātu vēsturisku dokumentu (vecu laikrakstu, oficiālu vēstuli, grāmatas lapu) vai izņemiet OCR izdruku. Izlabojiet tekstu, izmantojot veidni “Droša OCR labošana” un pieprasiet labojumus, izmantojot sarakstu “oriģināls → labojums”. Pēc tam noņemiet apgabalus, kuros nepieciešama cilvēka kontrole, izmantojot OCR kvalitātes pārskatu. Salīdziniet katru datumu un īpašvārdu sarakstā ar faktisko attēlu; Ņemiet vērā, cik daudzi tika "izlaboti" nepareizi.

kontrolsaraksts

  • [ ] Es skenēju dokumentu ar vismaz 300 DPI un labu kontrastu.
  • [ ] Es prasīju AI tikai optisko kļūdu labošanu, nevis pārrakstīšanu.
  • [ ] Es aizsargāju nelasāmās daļas ar [?].
  • [ ] Es pārbaudīju visus skaitļus, datumus un īpašvārdus ar attēlu.
  • [ ] Es veicu paraugu vai pilnu pārbaudi kritiskajās vietās.