Zyski:
- Możliwość skonfigurowania procesu digitalizacji i OCR (skanowanie, wstępne przetwarzanie, rozpoznawanie, korekta, weryfikacja) krok po kroku
- Możliwość wykorzystania sztucznej inteligencji do poprawiania błędów OCR z kontekstem, przy jednoczesnym zachowaniu korekty i przepisaniu linii oraz oznaczaniu niejednoznaczności za pomocą [?]
- Zrozumienie, dlaczego liczby, daty i nazwy własne należy weryfikować wizualnie oraz rolę kontroli jakości.
Miliony stron na półkach archiwum lub biblioteki stają się naprawdę otwarte dla badacza dopiero wtedy, gdy zostaną zdigitalizowane i będzie można je przeszukiwać. Digitalizacja polega na przekształceniu fizycznego dokumentu w obraz cyfrowy poprzez jego zeskanowanie lub fotografowanie. Ale zdjęcie strony nie jest jeszcze „tekstem”; Dla komputera jest to nadal obraz, nie można w nim wyszukiwać. Tutaj z pomocą przychodzi OCR.
OCR (Optical Character Recognition) to technologia, która rozpoznaje drukowane litery w obrazie dokumentu i konwertuje je na tekst nadający się do odczytu maszynowego i przeszukiwania. W tym module dowiesz się, jak digitalizować historyczne dokumenty drukowane za pomocą OCR, jak sztuczna inteligencja pomaga korygować błędy OCR w tym procesie i gdzie ludzkie oko jest niezbędne. (Teksty pisane odręcznie wymagają innej technologii; omówimy to w następnej części.)
Proces digitalizacji: krok po kroku
1. Przygotowanie i selekcja. Zeskanuj dokument w najwyższej możliwej jakości. Ogólną zasadą przy badaniach historycznych jest rozdzielczość co najmniej 300–400 DPI (punktów na cal). Niska rozdzielczość gwałtownie zwiększa poziom błędów na kolejnym etapie OCR.
2. Wstępne przetwarzanie obrazu. Poprawa obrazu przed OCR znacznie zwiększa sukces: prostowanie zeskanowanej strony, usuwanie przebarwień, zwiększanie kontrastu, konwersja do czerni i bieli. Nowoczesne narzędzia oparte na sztucznej inteligencji mogą zautomatyzować ten krok.
3. Aplikacja OCR. Przesyłasz obraz do silnika OCR; Silnik rozpoznaje litery i generuje tekst. Dane wyjściowe zwykle składają się z dwóch warstw: widocznego obrazu dokumentu i znajdującej się pod nim „ukrytej warstwy tekstowej z możliwością przeszukiwania”.
4. Korekta (postkorekta). Surowy wynik OCR nigdy nie jest doskonały. Znaki są odczytywane nieprawidłowo z powodu starych czcionek, pożółkłego papieru, rozmazywania się atramentu i błędów skanowania. W tym miejscu sztuczna inteligencja jest potężnym pomocnikiem: sugeruje i koryguje błędy OCR na podstawie kontekstu.
5. Weryfikacja i kontrola jakości. Poprawiony tekst jest sprawdzany przez człowieka na zasadzie próbki lub w całości. Szczególnie krytyczne obszary, takie jak nazwiska, daty i numery, należy sprawdzić wizualnie.
Dlaczego OCR popełnia błędy, jak AI pomaga
Typowe problemy, które stanowią wyzwanie dla OCR w dokumentach historycznych: stare i fantazyjne czcionki, przestarzałe formy literowe, takie jak długie „s” (ſ), dwukolumnowy układ strony, przypisy, odręczne wstawki, pieczęcie i wyblakły atrament. Ponieważ silnik OCR „widzi” litery jedna po drugiej, często myli binarne „rn” z „m”, literę „l” z liczbą „1”, a literę „O” z „0”.
Modele językowe AI oferują tutaj inną moc: rozumieją kontekst. Jeśli silnik OCR napisałby „1stanbu1”, sztuczna inteligencja mogłaby wywnioskować z kontekstu, że powinno to być „Stambuł”. Ale istnieje tu duże niebezpieczeństwo: podczas „poprawiania” sztuczna inteligencja może również zmienić tekst. Może dodać „poprawiłem” nieistniejące słowo lub wypełnić niejasne miejsce własnym domysłem. Zaburza to wierność transkrypcji.
Uwaga: Złota zasada w korekcji OCR brzmi: AI powinna korygować jedynie oczywiste błędy rozpoznawania, a nie interpretować ani uzupełniać treści tekstu. „1stanbu1 → Stambuł” jest uzasadnione; Nie chodzi o zapełnianie nieczytelnego słowa domysłami. Niepewne miejsca należy zaznaczyć [?] i nie należy ich uzupełniać.
Typy błędów OCR i podejście z tabelą
Typ błędu
przykład
Czy sztuczna inteligencja może to naprawić?
kontrola ludzka
mieszanie postaci
rn↔m, l↔1, O↔0
Tak, jest bezpiecznie
próbka
stara forma pisma
długie ſ → s
Tak, jest bezpiecznie
próbka
Wyblakłe/nieczytelne słowo
„ka___n”
Nie, należy umieścić [?]
obowiązkowe
imię własne/nazwa miejscowości
„Constantinyye”
ostrożny
obowiązkowe
Numer/data
„1867” kontra „1857”
ryzykowne
obowiązkowe
Układ strony (kolumna/przypis)
przepływ mieszany
częściowo
obowiązkowe
Podsumowując obraz w jednym zdaniu: AI niezawodnie czyści zwykłe błędy znakowe; Ale ludzkie oczy są potrzebne do specjalnych nazw, liczb, dat i nieczytelnych miejsc.
trzy mini etui
Przypadek 1 — Archiwa gazet stały się dostępne do przeszukiwania. Biblioteka uniwersytecka zdigitalizowała 12 000 stron lokalnych gazet z lat 30. XX wieku. Dokładność pierwotnego OCR oszacowano na 82% (18 na 100 znaków było nieprawidłowych). Korekcja oparta na sztucznej inteligencji zwiększyła dokładność do 96% dzięki słownikowi i kontekstowi dostosowanemu do języka gazety. W przypadku pozostałych błędów przeprowadzono kontrolę wyrywkową, a nie pełnego tekstu; Kolekcję można było przeszukiwać po 3 tygodniach.
Przypadek 2 — AI „poprawiła” i zniekształciła historię. Archiwista kazał AI poprawić datę „1863” na wydruku OCR. Sztuczna inteligencja „poprawiła” datę na „1868”, patrząc na inne wydarzenie w kontekście – mimo że w dokumencie wyraźnie widniał rok 1863. Gdyby archiwista nie spojrzał na oryginalny obraz, w katalogu wpisanoby niewłaściwą datę. Lekcja: liczby i daty nigdy nie są pozostawione sztucznej inteligencji, są weryfikowane za pomocą obrazu.
Przypadek 3 — Pomieszana strona dwukolumnowa. Dwukolumnowe strony XIX-wiecznego rocznika zostały w OCR zmieszane w jeden strumień, a zdania przeplatały się. Surowy wynik był nieczytelny. Tekst poprawił się, gdy po raz pierwszy podzieliłem układ strony na regiony (segmentacja) i przetworzyłem każdą kolumnę osobno. Lekcja: w złożonym układzie strony najpierw struktura, potem tekst.
Cztery szablony do kopiowania
1) Bezpieczna korekta OCR:
Poniżej znajduje się surowy wynik OCR dokumentu historycznego. Twoim zadaniem jest poprawienie TYLKO oczywistych błędów rozpoznawania optycznego (np. rn → m, 1 → l, 0 → O, długie ſ → s). Zasady: (1) Interpretuj znaczenie tekstu. (2) Popraw nieczytelne/niejednoznaczne słowa, pozostaw bez zmian i zaznacz [?]. (3) NIE dodawaj, usuwaj ani uzupełniaj zdań. (4) ZMIEŃ numery i daty; w razie wątpliwości zaznacz [numer?]. Surowy OCR: [tutaj]
2) Raport jakości OCR:
Sprawdź wyniki OCR poniżej i sporządź raport dotyczący jakości: (1) Wypisz słowa z możliwymi błędami w rozpoznawaniu, (2) Zaznacz obszary, które wydają się nieczytelne/niejasne, (3) Wypisz konkretne nazwy, daty i numery, które wymagają sprawdzenia przez człowieka. NIE poprawiaj; wygeneruj tylko listę kontrolną. Tekst: [tutaj]
3) Pomoc w analizie kolumn/struktur:
Ponieważ poniższy tekst OCR pochodzi ze strony składającej się z dwóch kolumn, przepływ może być zdezorientowany. Zmień układ tekstu na logiczne akapity, ALE nie zmieniaj, nie dodawaj ani nie usuwaj żadnych słów. Po prostu popraw kolejność. Oznacz zamówienie, którego nie jesteś pewien za pomocą [zamówienie?]. Tekst: [tutaj]
4) Normalizacja do języka standardowego (opcjonalnie, osobna warstwa):
Utwórz uproszczoną wersję do czytania w dzisiejszej pisowni, w osobnej kolumnie, PONAD poprawionym tekstem historycznym poniżej. NIGDY nie zmieniaj ORYGINALNEGO tekstu; Niech uproszczenie będzie osobną warstwą. Po prostu zaktualizuj pisownię/wymowę bez dodawania znaczenia. Oryginał: [tutaj]
Słaba zachęta/silna zachęta
Słabe:
Popraw i upiększ ten tekst OCR.
„Upiększanie” pozwala sztucznej inteligencji przepisać tekst, uzupełnić pominięcia i zinterpretować treść; łamie lojalność.
Mocny:
Napraw TYLKO błędy rozpoznawania optycznego w tym surowym wyjściu OCR. Nie interpretuj znaczenia, nie dodawaj/usuwaj słów, nie pozostawiaj nieczytelnych fragmentów znakiem [?], zmieniaj liczby i daty. Każdą korektę, którą wprowadzasz, pokaż na osobnej liście w formacie „oryginał → korekta”, abym mógł ją zweryfikować. Tekst: [tutaj]
Różnica: ograniczony obowiązek, zakaz fabrykacji, niejednoznaczność oznakowania i możliwa do prześledzenia lista poprawek umożliwiają kontrolę wyników.
Typowe błędy
- Skanowanie w niskiej rozdzielczości. Większość błędów OCR jest spowodowana złymi obrazami; Wysokiej jakości skanowanie to najtańsza inwestycja.
- Nazywanie sztucznej inteligencji „czyń piękną”. Daje to raczej płynność niż wierność; Dokument jest przepisany.
- Liczby i daty pozostawiamy AI. Są one po cichu uszkodzone, gdy zostaną „poprawione” z kontekstu; należy zweryfikować obrazem.
- Wypełnianie nieczytelnego obszaru za pomocą domysłu. Należy ją chronić niepewnością [?], a nie wymyślać.
- W ogóle nie kontroluję, zamiast samplować. Nawet 96% dokładność oznacza tysiące błędów na 12 000 stron; skanowane są obszary krytyczne.
Podsumowując
OCR otwiera archiwa dla badaczy, konwertując drukowane dokumenty historyczne na tekst, który można przeszukiwać. Sztuczna inteligencja jest potężną pomocą w korygowaniu błędów znakowych w nieprzetworzonych wynikach OCR z uwzględnieniem kontekstu; Ale musisz wytyczyć granicę pomiędzy edytowaniem a przepisywaniem. Wysokiej jakości skanowanie, bezpieczna instrukcja korekty, zachowanie niejednoznaczności za pomocą [?] i weryfikacja nazwisk/dat/numerów okiem ludzkim sprawiają, że digitalizacja jest szybka i niezawodna. AI czyści tekst; Jesteś strażnikiem wierności.
Zadanie aplikacji
Zeskanuj wydrukowany dokument historyczny (stara gazeta, list urzędowy, strona książki) lub wykonaj wydruk OCR. Popraw tekst za pomocą szablonu „Bezpieczna korekta OCR” i poproś o poprawki za pośrednictwem listy „oryginał → poprawka”. Następnie usuń obszary wymagające kontroli człowieka za pomocą „raportu jakości OCR”. Porównaj każdą datę i imię własne na liście z rzeczywistym obrazem; Zwróć uwagę, ile z nich zostało „poprawionych” nieprawidłowo.
lista kontrolna
- [ ] Zeskanowałem dokument z rozdzielczością co najmniej 300 DPI i dobrym kontrastem.
- [ ] Poprosiłem AI jedynie o korekcję błędów optycznych, a nie o przepisanie.
- [ ] Zabezpieczyłem nieczytelne części za pomocą [?].
- [ ] Wszystkie numery, daty i nazwy własne zweryfikowałem z obrazem.
- [ ] Zrobiłem próbkę lub pełną kontrolę w krytycznych obszarach.