Nyereség:
- Lehetőség a digitalizálás és az OCR munkafolyamat (szkennelés, előfeldolgozás, felismerés, javítás, ellenőrzés) lépésről lépésre történő beállítására
- Képes mesterséges intelligencia segítségével kijavítani az OCR hibákat a kontextussal, miközben megtartja a korrekciós és újraírási vonalat, és megjelöli a kétértelműséget [?]
- Megérteni, miért kell a számokat, dátumokat és tulajdonneveket vizuálisan ellenőrizni, és a minőség-ellenőrzés szerepét.
Egy archívum vagy könyvtár fizikai polcain található több millió oldal csak akkor nyílik meg igazán a kutató előtt, ha digitalizálódik és kereshetővé válik. A digitalizálás egy fizikai dokumentum digitális képpé alakítása szkenneléssel vagy fényképezéssel. De egy oldal fényképe még nem „szöveg”; A számítógép számára ez még mindig kép, nem lehet benne keresni. Itt jön képbe az OCR.
Az OCR (Optical Character Recognition) egy olyan technológia, amely felismeri a nyomtatott betűket a dokumentum képében, és géppel olvasható, kereshető szöveggé alakítja azokat. Ebben az egységben megtudhatja, hogyan digitalizálhat nyomtatott történelmi dokumentumokat OCR-rel, hogyan segíti az AI az OCR-hibák kijavítását ebben a folyamatban, és hol fontos az emberi szem. (A kézzel írt szövegek más technológiát igényelnek; ezzel a következő részben foglalkozunk.)
Digitalizálási munkafolyamat: lépésről lépésre
1. Előkészítés és szűrés. Szkennelje be a dokumentumot a lehető legjobb minőségben. A történeti kutatások általános ökölszabálya a legalább 300-400 DPI (dots per inch) felbontás. Az alacsony felbontás az egekbe emeli a hibaarányt a következő OCR szakaszban.
2. Kép előfeldolgozása. A kép javítása az OCR előtt nagymértékben növeli a sikert: a beolvasott oldal elferdítése, foltok eltávolítása, kontraszt növelése, fekete-fehérré konvertálás. A modern AI-alapú eszközök automatizálhatják ezt a lépést.
3. OCR alkalmazás. Ön betáplálja a képet az OCR motorba; A motor felismeri a betűket és szöveget állít elő. A kimenet általában két rétegből áll: a látható dokumentum képéből és egy "kereshető rejtett szövegrétegből" az alatta.
4. Javítás (utókorrekció). A nyers OCR kimenet soha nem tökéletes. A karakterek olvasása hibásan történik a régi betűtípusok, a megsárgult papír, a tinta elkenődése és a szkennelési hibák miatt. Itt az AI hatékony segítő: kontextus felhasználásával javasolja és kijavítja az OCR hibákat.
5. Ellenőrzés és minőségellenőrzés. A javított szöveget az ember minta alapján vagy teljesen ellenőrzi. A különösen kritikus területeket, például a neveket, dátumokat és számokat vizuálisan kell ellenőrizni.
Miért hibázik az OCR, hogyan segít az AI?
Tipikus problémák, amelyek kihívást jelentenek az OCR-ben a történelmi dokumentumokban: régi és divatos betűtípusok, elavult betűformák, például hosszú „s” (ſ), kétoszlopos oldalelrendezés, lábjegyzetek, kézzel írt betétek, pecsétek és fakó tinta. Mivel az OCR motor egyesével "látja" a betűket, gyakran összekeveri a bináris "rn"-t "m"-ként, az "l" betűt "1" számmal, az "O" betűt pedig "0"-val.
Az AI nyelvi modellek itt más hatalmat kínálnak: megértik a kontextust. Ha egy OCR-motor „1stanbu1”-et írt, az AI a szövegkörnyezetből arra következtethetett, hogy „Isztambulnak” kell lennie. De itt van egy nagy veszély: "javításkor" az AI megváltoztathatja a szöveget is. Hozzáadhat "javítottam" egy nem létező szót, vagy kitölthet egy tisztázatlan helyet saját sejtésével. Ez megzavarja az átírás hűségét.
Vigyázat: Az OCR-javítás aranyszabálya a következő: a mesterséges intelligencia csak a nyilvánvaló felismerési hibákat javíthatja ki, nem értelmezheti vagy egészítheti ki a szöveg tartalmát. "1stanbu1 → Istanbul" jogos; Nem arról van szó, hogy egy olvashatatlan szót találgatásokkal töltünk meg. A bizonytalan helyeket [?]-vel kell jelölni, és nem szabad pótolni.
OCR hibatípusok és megközelítés táblázattal
Hiba típusa
példa
Meg tudja javítani az AI-t?
emberi kontroll
karakterkeverés
rn↔m, l↔1, O↔0
Igen, biztonságos
minta
régi levélforma
hosszú ſ → s
Igen, biztonságos
minta
Elhalványult/olvashatatlan szó
"ka___n"
Nem, fel kell tenni [?]
kötelező
tulajdonnév/helynév
"Constantiniyye"
óvatos
kötelező
Szám/dátum
"1867" vs "1857"
kockázatos
kötelező
Oldalelrendezés (oszlop/lábjegyzet)
vegyes áramlás
részben
kötelező
Egy mondatban összefoglalva a képet: A mesterséges intelligencia megbízhatóan kitisztítja a hétköznapi karakterhibákat; De emberi szem kell a különleges nevekhez, számokhoz, dátumokhoz és olvashatatlan helyekhez.
három mini tok
1. eset – Az újságok archívumai kereshetővé váltak. Egy egyetemi könyvtár 12 000 oldalnyi helyi újságot digitalizált az 1930-as évekből. A nyers OCR pontossága becslések szerint 82% volt (minden 100 karakterből 18 volt hibás). A mesterséges intelligencia alapú javítás 96%-ra növelte a pontosságot egy újságnyelvnek megfelelő szótár és kontextus segítségével. A fennmaradó hibák esetében a teljes szöveg helyett mintaellenőrzést végeztünk; A gyűjtemény 3 hét alatt kereshetővé vált.
2. eset – A mesterséges intelligencia „javított” és eltorzította az előzményeket. Egy levéltáros a mesterséges intelligencia javította az „1863” dátumot az OCR-nyomaton. Az AI „korrigálta” a dátumot „1868-ra”, egy másik eseményt szemlélve a szövegkörnyezetben – annak ellenére, hogy a dokumentum egyértelműen 1863-at írt. Ha a levéltáros nem nézte volna meg az eredeti képet, a katalógus rossz dátummal került volna be. Tanulság: a számokat és a dátumokat soha nem bízzák az MI-re, azokat a kép ellenőrzi.
3. eset – Kéthasábos oldal zavaros. Egy 19. századi évkönyv kéthasábos oldalait OCR-ben egyetlen folyamba keverték, és a mondatok összefonódtak. A nyers kimenet olvashatatlan volt. A szöveg javult, amikor először osztottam fel az oldalelrendezést régiókra (szegmentálás), és minden oszlopot külön dolgoztam fel. Tanulság: összetett oldalelrendezésben, első a struktúra, második a szöveg.
Négy másolható sablon
1) Biztonságos OCR-korrekció:
Az alábbiakban egy történelmi dokumentum nyers OCR kimenete látható. Az Ön feladata CSAK a nyilvánvaló optikai felismerési hibák kijavítása (pl. rn→m,1→l, 0→O, long ſ→s). Szabályok: (1) Értelmezze a szöveg jelentését! (2) Javítsa ki az olvashatatlan/kétértelmű szavakat, hagyja úgy, ahogy van, és jelölje meg [?]-vel. (3) TILOS mondatok hozzáadása, eltávolítása vagy kiegészítése. (4) MÓDOSÍTSA a számokat és a dátumokat; jelölje meg a [számot?], ha kétségei vannak. Nyers OCR: [itt]
2) OCR minőségi jelentés:
Vizsgálja meg az alábbi OCR kimenetet, és készítsen minőségi jelentést: (1) Sorolja fel a lehetséges felismerési hibákat tartalmazó szavakat, (2) Jelölje meg azokat a területeket, amelyek olvashatatlannak/nem egyértelműnek tűnnek, (3) Sorolja fel azokat a konkrét neveket, dátumokat és számokat, amelyek emberi ellenőrzést igényelnek. NE javítsa; csak ellenőrzőlista létrehozása. Szöveg: [itt]
3) Oszlop/struktúra elemzési súgó:
Mivel az alábbi OCR-szöveg kétoszlopos oldalról származik, a folyamat zavaros lehet. Rendezd át a szöveget logikai bekezdésekbe, DE ne változtass, adj hozzá vagy törölj szavakat. Csak javítsd ki a sorrendet. Jelölje be azt a rendelést, amelyben nem biztos a [rendelés?] lehetőséggel. Szöveg: [itt]
4) Normalizálás szabványos nyelvre (opcionális, külön réteg):
Készítsen egyszerűsített olvasmányos változatot mai helyesírással, külön rovatban, az alábbi javított történelmi szöveg FELÜTT. SOHA ne változtassa meg az EREDETI szöveget; Legyen az egyszerűsítés egy külön réteg. Csak frissítse a helyesírást/kiejtést jelentés hozzáadása nélkül. Eredeti: [itt]
Gyenge felszólítás / Erős felszólítás
Gyenge:
Javítsa és szépítse ezt az OCR-szöveget.
A „szépítés” lehetővé teszi a mesterséges intelligencia számára a szöveg átírását, a kihagyások pótlását és a tartalom értelmezését; megtöri a hűséget.
Erős:
CSAK az optikai felismerési hibákat javítsa ki ebben a nyers OCR-kimenetben. Ne értelmezzen jelentést, ne adjon hozzá/töröljön szavakat, ne hagyjon olvashatatlan részeket [?]-vel, ne változtasson számokat és dátumokat. Minden elvégzett javítást külön listában mutasson meg "eredeti → javítás" formátumban, hogy ellenőrizhessem. Szöveg: [itt]
A különbség: a korlátozott kötelesség, a gyártási tilalom, a jelölési kétértelműség és a korrekciók nyomon követhető listája auditálhatóvá teszi a kimenetet.
Gyakori hibák
- Szkennelés alacsony felbontással. A legtöbb OCR-hibát rossz képek okozzák; A minőségi szkennelés a legolcsóbb befektetés.
- A mesterséges intelligencia „szépít” elnevezése. Ez inkább folyékonyságot, mint hűséget eredményez; A dokumentumot újraírják.
- A számokat és a dátumokat az AI-ra hagyjuk. Ezek csendben megsérülnek, ha a szövegkörnyezetből "kijavítják" őket; képpel kell igazolni.
- Az olvashatatlan terület kitöltése találgatással. Bizonytalansággal kell védeni [?], nem kitalálni.
- Egyáltalán nem kontrollál mintavétel helyett. Még a 96%-os pontosság is több ezer hibát jelent 12 000 oldalon; kritikus területeket szkennelnek.
Összefoglalva
Az OCR megnyitja az archívumokat a kutatók előtt a nyomtatott történelmi dokumentumok kereshető szöveggé alakításával. Az AI hatékony segítség a karakterhibák kijavításában a nyers OCR kimenetben a kontextussal együtt; De meg kell húzni a határt a szerkesztés és az újraírás között. A kiváló minőségű szkennelés, a biztonságos korrekciós utasítás, a kétértelműség megőrzése [?]-vel, valamint a nevek/dátumok/számok emberszem-ellenőrzése gyorssá és megbízhatóvá teszi a digitalizálást. Az AI megtisztítja a szöveget; Te vagy a hűség őre.
Pályázati feladat
Szkenneljen be egy nyomtatott történelmi dokumentumot (régi újság, hivatalos levél, könyvoldal), vagy készítsen OCR-nyomatot. Javítsa ki a szöveget a „Biztonságos OCR javítás” sablonnal, és kérjen javításokat az „eredeti → javítás” listán keresztül. Ezután távolítsa el az emberi ellenőrzést igénylő területeket az „OCR minőségi jelentés” segítségével. Hasonlítsa össze a listában szereplő dátumokat és tulajdonneveket a tényleges képpel; Jegyezze meg, hányat "javítottak" hibásan.
ellenőrző lista
- [ ] A dokumentumot legalább 300 DPI-vel és jó kontraszttal szkenneltem.
- [ ] Csak optikai hibajavítást kértem az AI-tól, átírást nem.
- [ ] Az olvashatatlan részeket [?]-vel védtem.
- [ ] Minden számot, dátumot és tulajdonnevet ellenőriztem a képpel.
- [ ] A kritikus területeken mintát vagy teljes ellenőrzést végeztem.