Dobici:
- Mogućnost ispravljanja skeniranih dokumenata pretvaranjem u tekst s OCR i HTR i usporedbom izlaza sa stvarnom slikom
- Sposobnost očuvanja izvornosti i cjelovitosti arhivskog dokumenta i sprječavanja umjetne inteligencije da mijenja sadržaj i tvorničku restauraciju
- Sposobnost planiranja dugoročnog digitalnog očuvanja s informacijama o porijeklu i trajnim formatima
Arhivist ima zadatak prenijeti pedeset godina stare sveske novina, rukom pisana pisma ili stare fotografije u budućnost. Ti se dokumenti s vremenom troše; Kako bi se sačuvali i učinili dostupnima, provodi se digitalizacija: čin skeniranja fizičkog dokumenta i njegova pretvorba u digitalnu kopiju. Ali sam pregled nije dovoljan; Digitalni objekt mora biti moguće pronaći, čitljiv i održavati dugoročno. U ovoj ćete jedinici naučiti kako koristiti umjetnu inteligenciju u tijeku rada digitalizacije, prijepisa i digitalnog očuvanja; ali naučit ćete zašto ćete vi snositi odgovornost za originalnost i točnost.
Nekoliko koncepata. OCR (Optical Character Recognition) je tehnologija koja pretvara tekst na slici dokumenta u tekst koji se može strojno uređivati. HTR (Handwritten Text Recognition) radi isti posao za dokumente pisane rukom, ali je mnogo teži. Digitalno očuvanje je planirani napor da se osigura da digitalni objekti ostanu čitljivi desetljećima, čak i kada formati datoteka postanu zastarjeli i softver se promijeni. AI je moćan, ali manjkav pomoćnik u sva tri područja.
Korak po korak: od digitalizacije do očuvanja
1. Odredite prioritete. Ne možete digitalizirati sve odjednom. Najosjetljiviji, najtraženiji i najunikatniji dokumenti stavljaju se na prvo mjesto. Ovo je sudska odluka; AI pomaže u uređivanju popisa, ali ustanova određuje prioritet.
2. Skenirajte i primijenite OCR/HTR. Skenirajte dokument u visokoj rezoluciji, a zatim upotrijebite OCR ili HTR za izdvajanje teksta. Alati temeljeni na umjetnoj inteligenciji ovdje postaju sve bolji i bolji, čak i sa starim i teškim tekstovima.
3. Ispravite i provjerite tekst. OCR/HTR ispis nikada nije savršen. Pogreške su uobičajene, osobito ako postoji stari tekst, zamrljane stranice ili rukopis. Bitno je usporediti izlaz sa stvarnom slikom i ispraviti je.
4. Dodajte metapodatke i informacije o zaštiti. Dodajte digitalnom objektu njegovo podrijetlo, uvjete skeniranja, podatke o formatu i podrijetlo — odakle dokument dolazi i kako je obrađen. Ove su informacije ključne za buduću provjeru i zaštitu.
5. Plan dugoročne zaštite. Odaberite formate datoteka koji su otvoreni, uobičajeni i trajni; back up; Napravite plan migracije u slučaju da formati zastare.
Savjet: Ne prihvaćajte OCR izlaz kao "čisti tekst". Kad bi sustav za pretraživanje radio kroz ovaj tekst, netočno prepoznate riječi uzrokovale bi da izvor ne bude pronađen. Za kritične zbirke, ispravljanje OCR izlaza ljudskom oku određuje kvalitetu svih naknadnih pristupa.
Autentičnost i cjelovitost digitalnog objekta
U središtu arhivskog rada su autentičnost i cjelovitost: sigurnost da dokument doista potječe iz izvora za koji se tvrdi i da njegov sadržaj nije mijenjan. U ovom trenutku AI stvara dvosmjernu prijetnju. Prvo, tijekom OCR/HTR korekcije ili "poboljšanja", AI može tiho modificirati tekst; može pod nazivom "ispravak" dodati riječ koja ne postoji. Drugo, ako se "popravak" ili "restauracija" slike radi pomoću umjetne inteligencije, mogu se proizvesti neoriginalni detalji.
Pravilo arhivista je jasno: digitalna sačuvana kopija mora biti vjerna izvorniku. Svako poboljšanje učinjeno pomoću umjetne inteligencije treba dokumentirati, a stvarno (neobrađeno) skeniranje treba uvijek sačuvati. “Uljepšavanje” dokumenta može uništiti njegovu povijesnu dokaznu vrijednost.
Oprez: moglo bi biti primamljivo "poboljšati" staru fotografiju ili dokument AI; ali umjetna inteligencija nadoknađuje dijelove koji nedostaju. U arhivskom dokumentu to znači stvaranje lažnih povijesnih dokaza. Rezultat obnove nikada ne zamjenjuje izvorni izvor; pohranjuje se kao zasebna, jasno označena varijanta.
tri mini kućišta
Slučaj 1 — Arhive novina postale su pretražive. Knjižnica je digitalizirala svoju 30 godina staru zbirku lokalnih novina. S OCR-om, 90.000 stranica je transkribirano i omogućeno pretraživanje; Pretraživanje teme koje je prije trajalo danima sada je smanjeno na sekunde. Međutim, tim je primijetio da je točnost OCR-a pala na 80% na starim i zamrljanim stranicama te je prioritet dao ispravljanju najboljih godina ljudskim okom.
Slučaj 2 — HTR je otvorio rukopis. Arhiv je primijenio HTR na zbirku teško čitljivih pisama iz 19. stoljeća. Sustav je dobio veliku brzinu prema mjesecima čitanja stručnjaka; No, svaku stranicu ispisa usporedio je s originalom stručnjak paleograf (stručnjak za drevna pisma), jer je bilo pogrešaka u imenima ljudi i mjesta.
Slučaj 3 — Lažna "restauracija" odbijena. Jedan tim je razmišljao o "popravljanju" poderane povijesne fotografije pomoću umjetne inteligencije. AI je dovršio nedostajuće dijelove lica tako što ih je prilagodio. Arhivist je shvatio da će ti izmišljeni detalji iskriviti povijesne dokaze; Popravljena slika pohranjena je odvojeno uz original, samo jasno označena kao "izvedena umjetna inteligencija".
Pristupna kopija, kopija za očuvanje i odluka o formatu
Dobra praksa u digitalizaciji je odvajanje kopija istog objekta za različite svrhe. Master za očuvanje je stvarni digitalni objekt koji se prenosi u budućnost, pohranjen u najvišoj rezoluciji, nekomprimiranom formatu ili formatu bez gubitaka; rijetko se dira. Access kopija je manja, lako otvarajuća varijanta koja se prezentira korisniku. Ova je razlika važna jer format koji je praktičan za upotrebu (mali, komprimirani) možda nije prikladan za dugotrajno čuvanje; Idealan format za očuvanje (veliki, bez gubitaka) težak je za svakodnevnu upotrebu. U ovom tijeku rada, AI može pomoći u popisivanju datoteka, otkrivanju varijanti koje nedostaju i održavanju dosljednosti metapodataka između dvije kopije. Međutim, izbor formata je odluka o očuvanju: otvoreni, opširno dokumentirani i trajni formati trebali bi imati prednost (umjesto vlasničkih, zatvorenih formata), a plan migracije trebao bi biti spreman u slučaju da formati s vremenom zastare. Čak i ako umjetna inteligencija predloži format, politika dugoročne zaštite institucije ima posljednju riječ.
Savjet: Za svaki digitalni objekt vodite kratku evidenciju koja odgovara na pitanja "gdje je izvorni izvor, u kojem je formatu kopija za očuvanje, u kojem je formatu kopija za pristup i koja je dostupna korisniku?" Miješanje ova tri sloja čini nejasnim koja je datoteka pouzdana glavna u budućnosti.
Četiri predloška za kopiranje
1) Pomoć za korekciju OCR izlaza:
Ispod je OCR tekst i opis stvarne stranice. Ispravljajte samo openOCR pogreške (loši znakovi, složenice/razdvojene riječi). Nemojte mijenjati sadržaj, dodavati ili uklanjati riječi. Ako niste sigurni, označite s "[?]". OCR tekst: [ovdje]
2) Provjera dosljednosti teksta i slike:
Postoje li dodaci u ispravljenom tekstu u nastavku za koje se nije očekivalo da će biti u izvornom dokumentu (koji je možda izmišljen)? Označite svaki sumnjivi dio i napišite zašto je sumnjiv. Tekst: [ovdje]
3) Nacrt metapodataka o zaštiti:
Generirajte nacrt metapodataka o očuvanju za sljedeći digitalizirani objekt: izvor, porijeklo, datum/rezolucija skeniranja, format datoteke, povijest transakcija. Samo upotrijebite podatke koje sam dao, polje koje nedostaje ostavite praznim. Informacije: [ovdje]
4) Pomoć pri određivanju prioriteta:
Dolje je popis zbirki koje čekaju digitalizaciju; Pomozite u određivanju prioriteta na temelju krhkosti, potražnje i jedinstvenosti. Dajte kratko obrazloženje za svaki resurs; Konačnu odluku prepustite meni. Popis: [ovdje]
Slab upit / Jak upit
Slab upit:
Ispravite i uljepšajte ovaj skenirani tekst.
“Beautify” poziva AI da promijeni sadržaj, nadoknadi propuste; Izvornost arhivskog dokumenta je oštećena.
Snažan upit:
Vaša uloga: pomoćnik urednika digitalizacije. U sljedećem OCR tekstu popravite SAMO eksplicitne pogreške prepoznavanja (loš znak, netočno podijeljena riječ). Nemojte dodavati, uklanjati ili mijenjati riječi. Ostavite "[?]" tamo gdje niste sigurni. Prikažite svaki ispravak koji ste napravili na posebnom popisu. Tekst: [ovdje]
Moćni prompt ograničava AI samo na prepoznavanje pogrešaka, zabranjuje mu dodirivanje sadržaja i omogućuje praćenje ispravaka.
Tablica tijeka rada i rizika
Pozornica
Doprinos AI
Glavni rizik
mjera zaštite
skenirati
—
loše kvalitete
visoke rezolucije
OCR/HTR
Pretvori u tekst
Greške prepoznavanja
ljudski ispravak
ispravak
Prijedlog pogreške
Mijenjanje sadržaja
Usporedba s originalom
obnova
Izvedenica slike
detalj uklapanja
Sačuvajte neobrađeni original, označite ga
zaštita
Skica metapodataka
gubitak porijekla
Zapis provenijencije
Uobičajene greške
- Prihvaćanje OCR izlaza bez ispravka. Pogreške ometaju pretraživanje i pristup.
- Pozivanje umjetne inteligencije "učini lijepim". Mijenja sadržaj i uništava originalnost.
- Zamjena AI restauracije za stvarne dokaze. Izmišljeni detalj stvara lažnu povijest.
- Ne pohranjuje neobrađeni sken. Ispravak se ne može provjeriti bez originala.
- Izostavljanje informacija o porijeklu. Pouzdanost dokumenta postaje nedostupna.
Ukratko
AI u digitalnim arhivama i digitalizaciji; To je dragocjena pomoć koja ubrzava OCR/HTR transkripciju, izradu metapodataka i određivanje prioriteta. Ali suština arhivskog rada je autentičnost i integritet: OCR izlaz treba ispraviti ljudsko oko, umjetna inteligencija nikada ne bi smjela tiho zamijeniti sadržaj, izvedenice restauracije ne bi trebale zamijeniti izvorne dokaze, a neobrađene informacije o skeniranju i porijeklu uvijek bi trebale biti sačuvane. Koristite umjetnu inteligenciju kao alat koji ne "poboljšava" dokument, već ga čini dostupnim dok mu ostaje vjeran.
Zadatak aplikacije
Dobijte kratki uzorak OCR izlaza (bilo vlastite proizvodnje ili iz stvarnog skeniranja). Ispravite samo pogreške prepoznavanja s predloškom "OCR output correction help", zatim provjerite je li AI dodao sadržaj s predloškom "Text-image consistency check". Zatim izradite zapis s informacijama o podrijetlu i formatu za objekt s predloškom "Nacrt metapodataka o očuvanju".
popis za provjeru
- [ ] Usporedio sam OCR/HTR izlaz sa stvarnom slikom i ispravio je.
- [ ] Provjerio sam da AI ne dodaje/mijenja sadržaj.
- [ ] Zadržao sam sirovo (glavno) skeniranje zasebno i nepromijenjeno.
- [ ] Metapodacima sam dodao podatke o podrijetlu i formatu.
- [ ] Jasno sam označio varijante obnove kao "izvedene umjetne inteligencije".