Egység 2 / 12

Dokumentumok digitalizálása és OCR: Nyomtatott szöveg konvertálása gépi szöveggé

Nyereség:

  • Lehetőség a digitalizálás és az OCR munkafolyamat (szkennelés, előfeldolgozás, felismerés, javítás, ellenőrzés) lépésről lépésre történő beállítására
  • Képes mesterséges intelligencia segítségével kijavítani az OCR hibákat a kontextussal, miközben megtartja a korrekciós és újraírási vonalat, és megjelöli a kétértelműséget [?]
  • Megérteni, miért kell a számokat, dátumokat és tulajdonneveket vizuálisan ellenőrizni, és a minőség-ellenőrzés szerepét.

Egy archívum vagy könyvtár fizikai polcain található több millió oldal csak akkor nyílik meg igazán a kutató előtt, ha digitalizálódik és kereshetővé válik. A digitalizálás egy fizikai dokumentum digitális képpé alakítása szkenneléssel vagy fényképezéssel. De egy oldal fényképe még nem „szöveg”; A számítógép számára ez még mindig kép, nem lehet benne keresni. Itt jön képbe az OCR.

Az OCR (Optical Character Recognition) egy olyan technológia, amely felismeri a nyomtatott betűket a dokumentum képében, és géppel olvasható, kereshető szöveggé alakítja azokat. Ebben az egységben megtudhatja, hogyan digitalizálhat nyomtatott történelmi dokumentumokat OCR-rel, hogyan segíti az AI az OCR-hibák kijavítását ebben a folyamatban, és hol fontos az emberi szem. (A kézzel írt szövegek más technológiát igényelnek; ezzel a következő részben foglalkozunk.)

Digitalizálási munkafolyamat: lépésről lépésre

1. Előkészítés és szűrés. Szkennelje be a dokumentumot a lehető legjobb minőségben. A történeti kutatások általános ökölszabálya a legalább 300-400 DPI (dots per inch) felbontás. Az alacsony felbontás az egekbe emeli a hibaarányt a következő OCR szakaszban.

2. Kép ​​előfeldolgozása. A kép javítása az OCR előtt nagymértékben növeli a sikert: a beolvasott oldal elferdítése, foltok eltávolítása, kontraszt növelése, fekete-fehérré konvertálás. A modern AI-alapú eszközök automatizálhatják ezt a lépést.

3. OCR alkalmazás. Ön betáplálja a képet az OCR motorba; A motor felismeri a betűket és szöveget állít elő. A kimenet általában két rétegből áll: a látható dokumentum képéből és egy "kereshető rejtett szövegrétegből" az alatta.

4. Javítás (utókorrekció). A nyers OCR kimenet soha nem tökéletes. A karakterek olvasása hibásan történik a régi betűtípusok, a megsárgult papír, a tinta elkenődése és a szkennelési hibák miatt. Itt az AI hatékony segítő: kontextus felhasználásával javasolja és kijavítja az OCR hibákat.

5. Ellenőrzés és minőségellenőrzés. A javított szöveget az ember minta alapján vagy teljesen ellenőrzi. A különösen kritikus területeket, például a neveket, dátumokat és számokat vizuálisan kell ellenőrizni.

Miért hibázik az OCR, hogyan segít az AI?

Tipikus problémák, amelyek kihívást jelentenek az OCR-ben a történelmi dokumentumokban: régi és divatos betűtípusok, elavult betűformák, például hosszú „s” (ſ), kétoszlopos oldalelrendezés, lábjegyzetek, kézzel írt betétek, pecsétek és fakó tinta. Mivel az OCR motor egyesével "látja" a betűket, gyakran összekeveri a bináris "rn"-t "m"-ként, az "l" betűt "1" számmal, az "O" betűt pedig "0"-val.

Az AI nyelvi modellek itt más hatalmat kínálnak: megértik a kontextust. Ha egy OCR-motor „1stanbu1”-et írt, az AI a szövegkörnyezetből arra következtethetett, hogy „Isztambulnak” kell lennie. De itt van egy nagy veszély: "javításkor" az AI megváltoztathatja a szöveget is. Hozzáadhat "javítottam" egy nem létező szót, vagy kitölthet egy tisztázatlan helyet saját sejtésével. Ez megzavarja az átírás hűségét.

Vigyázat: Az OCR-javítás aranyszabálya a következő: a mesterséges intelligencia csak a nyilvánvaló felismerési hibákat javíthatja ki, nem értelmezheti vagy egészítheti ki a szöveg tartalmát. "1stanbu1 → Istanbul" jogos; Nem arról van szó, hogy egy olvashatatlan szót találgatásokkal töltünk meg. A bizonytalan helyeket [?]-vel kell jelölni, és nem szabad pótolni.

OCR hibatípusok és megközelítés táblázattal

Hiba típusa

példa

Meg tudja javítani az AI-t?

emberi kontroll

karakterkeverés

rn↔m, l↔1, O↔0

Igen, biztonságos

minta

régi levélforma

hosszú ſ → s

Igen, biztonságos

minta

Elhalványult/olvashatatlan szó

"ka___n"

Nem, fel kell tenni [?]

kötelező

tulajdonnév/helynév

"Constantiniyye"

óvatos

kötelező

Szám/dátum

"1867" vs "1857"

kockázatos

kötelező

Oldalelrendezés (oszlop/lábjegyzet)

vegyes áramlás

részben

kötelező

Egy mondatban összefoglalva a képet: A mesterséges intelligencia megbízhatóan kitisztítja a hétköznapi karakterhibákat; De emberi szem kell a különleges nevekhez, számokhoz, dátumokhoz és olvashatatlan helyekhez.

három mini tok

1. eset – Az újságok archívumai kereshetővé váltak. Egy egyetemi könyvtár 12 000 oldalnyi helyi újságot digitalizált az 1930-as évekből. A nyers OCR pontossága becslések szerint 82% volt (minden 100 karakterből 18 volt hibás). A mesterséges intelligencia alapú javítás 96%-ra növelte a pontosságot egy újságnyelvnek megfelelő szótár és kontextus segítségével. A fennmaradó hibák esetében a teljes szöveg helyett mintaellenőrzést végeztünk; A gyűjtemény 3 hét alatt kereshetővé vált.

2. eset – A mesterséges intelligencia „javított” és eltorzította az előzményeket. Egy levéltáros a mesterséges intelligencia javította az „1863” dátumot az OCR-nyomaton. Az AI „korrigálta” a dátumot „1868-ra”, egy másik eseményt szemlélve a szövegkörnyezetben – annak ellenére, hogy a dokumentum egyértelműen 1863-at írt. Ha a levéltáros nem nézte volna meg az eredeti képet, a katalógus rossz dátummal került volna be. Tanulság: a számokat és a dátumokat soha nem bízzák az MI-re, azokat a kép ellenőrzi.

3. eset – Kéthasábos oldal zavaros. Egy 19. századi évkönyv kéthasábos oldalait OCR-ben egyetlen folyamba keverték, és a mondatok összefonódtak. A nyers kimenet olvashatatlan volt. A szöveg javult, amikor először osztottam fel az oldalelrendezést régiókra (szegmentálás), és minden oszlopot külön dolgoztam fel. Tanulság: összetett oldalelrendezésben, első a struktúra, második a szöveg.

Négy másolható sablon

1) Biztonságos OCR-korrekció:

Az alábbiakban egy történelmi dokumentum nyers OCR kimenete látható. Az Ön feladata CSAK a nyilvánvaló optikai felismerési hibák kijavítása (pl. rn→m,1→l, 0→O, long ſ→s). Szabályok: (1) Értelmezze a szöveg jelentését! (2) Javítsa ki az olvashatatlan/kétértelmű szavakat, hagyja úgy, ahogy van, és jelölje meg [?]-vel. (3) TILOS mondatok hozzáadása, eltávolítása vagy kiegészítése. (4) MÓDOSÍTSA a számokat és a dátumokat; jelölje meg a [számot?], ha kétségei vannak. Nyers OCR: [itt]

2) OCR minőségi jelentés:

Vizsgálja meg az alábbi OCR kimenetet, és készítsen minőségi jelentést: (1) Sorolja fel a lehetséges felismerési hibákat tartalmazó szavakat, (2) Jelölje meg azokat a területeket, amelyek olvashatatlannak/nem egyértelműnek tűnnek, (3) Sorolja fel azokat a konkrét neveket, dátumokat és számokat, amelyek emberi ellenőrzést igényelnek. NE javítsa; csak ellenőrzőlista létrehozása. Szöveg: [itt]

3) Oszlop/struktúra elemzési súgó:

Mivel az alábbi OCR-szöveg kétoszlopos oldalról származik, a folyamat zavaros lehet. Rendezd át a szöveget logikai bekezdésekbe, DE ne változtass, adj hozzá vagy törölj szavakat. Csak javítsd ki a sorrendet. Jelölje be azt a rendelést, amelyben nem biztos a [rendelés?] lehetőséggel. Szöveg: [itt]

4) Normalizálás szabványos nyelvre (opcionális, külön réteg):

Készítsen egyszerűsített olvasmányos változatot mai helyesírással, külön rovatban, az alábbi javított történelmi szöveg FELÜTT. SOHA ne változtassa meg az EREDETI szöveget; Legyen az egyszerűsítés egy külön réteg. Csak frissítse a helyesírást/kiejtést jelentés hozzáadása nélkül. Eredeti: [itt]

Gyenge felszólítás / Erős felszólítás

Gyenge:

Javítsa és szépítse ezt az OCR-szöveget.

A „szépítés” lehetővé teszi a mesterséges intelligencia számára a szöveg átírását, a kihagyások pótlását és a tartalom értelmezését; megtöri a hűséget.

Erős:

CSAK az optikai felismerési hibákat javítsa ki ebben a nyers OCR-kimenetben. Ne értelmezzen jelentést, ne adjon hozzá/töröljön szavakat, ne hagyjon olvashatatlan részeket [?]-vel, ne változtasson számokat és dátumokat. Minden elvégzett javítást külön listában mutasson meg "eredeti → javítás" formátumban, hogy ellenőrizhessem. Szöveg: [itt]

A különbség: a korlátozott kötelesség, a gyártási tilalom, a jelölési kétértelműség és a korrekciók nyomon követhető listája auditálhatóvá teszi a kimenetet.

Gyakori hibák

  • Szkennelés alacsony felbontással. A legtöbb OCR-hibát rossz képek okozzák; A minőségi szkennelés a legolcsóbb befektetés.
  • A mesterséges intelligencia „szépít” elnevezése. Ez inkább folyékonyságot, mint hűséget eredményez; A dokumentumot újraírják.
  • A számokat és a dátumokat az AI-ra hagyjuk. Ezek csendben megsérülnek, ha a szövegkörnyezetből "kijavítják" őket; képpel kell igazolni.
  • Az olvashatatlan terület kitöltése találgatással. Bizonytalansággal kell védeni [?], nem kitalálni.
  • Egyáltalán nem kontrollál mintavétel helyett. Még a 96%-os pontosság is több ezer hibát jelent 12 000 oldalon; kritikus területeket szkennelnek.

Összefoglalva

Az OCR megnyitja az archívumokat a kutatók előtt a nyomtatott történelmi dokumentumok kereshető szöveggé alakításával. Az AI hatékony segítség a karakterhibák kijavításában a nyers OCR kimenetben a kontextussal együtt; De meg kell húzni a határt a szerkesztés és az újraírás között. A kiváló minőségű szkennelés, a biztonságos korrekciós utasítás, a kétértelműség megőrzése [?]-vel, valamint a nevek/dátumok/számok emberszem-ellenőrzése gyorssá és megbízhatóvá teszi a digitalizálást. Az AI megtisztítja a szöveget; Te vagy a hűség őre.

Pályázati feladat

Szkenneljen be egy nyomtatott történelmi dokumentumot (régi újság, hivatalos levél, könyvoldal), vagy készítsen OCR-nyomatot. Javítsa ki a szöveget a „Biztonságos OCR javítás” sablonnal, és kérjen javításokat az „eredeti → javítás” listán keresztül. Ezután távolítsa el az emberi ellenőrzést igénylő területeket az „OCR minőségi jelentés” segítségével. Hasonlítsa össze a listában szereplő dátumokat és tulajdonneveket a tényleges képpel; Jegyezze meg, hányat "javítottak" hibásan.

ellenőrző lista

  • [ ] A dokumentumot legalább 300 DPI-vel és jó kontraszttal szkenneltem.
  • [ ] Csak optikai hibajavítást kértem az AI-tól, átírást nem.
  • [ ] Az olvashatatlan részeket [?]-vel védtem.
  • [ ] Minden számot, dátumot és tulajdonnevet ellenőriztem a képpel.
  • [ ] A kritikus területeken mintát vagy teljes ellenőrzést végeztem.