Κέρδη:
- Δυνατότητα ρύθμισης της ροής εργασιών ψηφιοποίησης και OCR (σάρωση, προεπεξεργασία, αναγνώριση, διόρθωση, επαλήθευση) βήμα προς βήμα
- Δυνατότητα χρήσης AI για τη διόρθωση σφαλμάτων OCR με το περιβάλλον, διατηρώντας παράλληλα τη γραμμή διόρθωσης και επανεγγραφής και επισήμανση της ασάφειας με [?]
- Κατανοήστε γιατί οι αριθμοί, οι ημερομηνίες και τα σωστά ονόματα πρέπει να επαληθεύονται οπτικά και ο ρόλος του ποιοτικού ελέγχου.
Οι εκατομμύρια σελίδες στα φυσικά ράφια ενός αρχείου ή βιβλιοθήκης ανοίγονται αληθινά στον ερευνητή μόνο όταν ψηφιοποιηθούν και γίνουν αναζητήσιμες. Ψηφιοποίηση είναι η μετατροπή ενός φυσικού εγγράφου σε ψηφιακή εικόνα με σάρωση ή φωτογράφηση του. Αλλά μια φωτογραφία μιας σελίδας δεν είναι ακόμα «κείμενο». Για τον υπολογιστή είναι ακόμα μια εικόνα, δεν μπορείτε να κάνετε αναζήτηση σε αυτόν. Αυτό είναι όπου το OCR μπαίνει στο παιχνίδι.
Το OCR (Optical Character Recognition) είναι μια τεχνολογία που αναγνωρίζει τυπωμένα γράμματα σε μια εικόνα εγγράφου και τα μετατρέπει σε κείμενο αναγνώσιμο από μηχανή, με δυνατότητα αναζήτησης. Σε αυτήν την ενότητα, θα μάθετε πώς να ψηφιοποιείτε ιστορικά έντυπα έγγραφα με OCR, πώς η τεχνητή νοημοσύνη βοηθά στη διόρθωση σφαλμάτων OCR σε αυτή τη διαδικασία και πού είναι απαραίτητο το ανθρώπινο μάτι. (Τα χειρόγραφα κείμενα απαιτούν διαφορετική τεχνολογία· θα το καλύψουμε στην επόμενη ενότητα.)
Ροή εργασιών ψηφιοποίησης: βήμα προς βήμα
1. Προετοιμασία και διαλογή. Σαρώστε το έγγραφο στην υψηλότερη δυνατή ποιότητα. Ένας γενικός εμπειρικός κανόνας για την ιστορική έρευνα είναι η ανάλυση τουλάχιστον 300-400 DPI (κουκκίδες ανά ίντσα). Η χαμηλή ανάλυση εκτοξεύει στα ύψη το ποσοστό σφάλματος στο επόμενο στάδιο OCR.
2. Προεπεξεργασία εικόνας. Η βελτίωση της εικόνας πριν από την OCR αυξάνει σημαντικά την επιτυχία: αποστράγγιση της σαρωμένης σελίδας, αφαίρεση ελαττωμάτων, αύξηση της αντίθεσης, μετατροπή σε ασπρόμαυρη. Τα σύγχρονα εργαλεία που βασίζονται σε AI μπορούν να αυτοματοποιήσουν αυτό το βήμα.
3. Εφαρμογή OCR. Τροφοδοτείτε την εικόνα στον κινητήρα OCR. Ο κινητήρας αναγνωρίζει γράμματα και παράγει κείμενο. Η έξοδος αποτελείται συνήθως από δύο επίπεδα: την ορατή εικόνα του εγγράφου και ένα "στρώμα κρυφού κειμένου με δυνατότητα αναζήτησης" από κάτω.
4. Διόρθωση (μεταδιόρθωση). Η ακατέργαστη έξοδος OCR δεν είναι ποτέ τέλεια. Οι χαρακτήρες διαβάζονται λανθασμένα λόγω παλιών γραμματοσειρών, κιτρινισμένου χαρτιού, κηλίδων μελανιού και σφαλμάτων σάρωσης. Εδώ η τεχνητή νοημοσύνη είναι ένας ισχυρός βοηθός: προτείνει και διορθώνει σφάλματα OCR χρησιμοποιώντας το πλαίσιο.
5. Επαλήθευση και ποιοτικός έλεγχος. Το διορθωμένο κείμενο ελέγχεται από τον άνθρωπο σε δειγματοληπτική βάση ή πλήρως. Ιδιαίτερα κρίσιμες περιοχές όπως ονόματα, ημερομηνίες και αριθμοί πρέπει να επαληθεύονται οπτικά.
Γιατί το OCR κάνει λάθη, πώς βοηθά το AI
Τυπικά προβλήματα που προκαλούν το OCR σε ιστορικά έγγραφα: παλιές και φανταχτερές γραμματοσειρές, παρωχημένες γράμματα όπως μεγάλα "s" (ſ), διάταξη σελίδας δύο στηλών, υποσημειώσεις, χειρόγραφα ένθετα, σφραγίδες και ξεθωριασμένο μελάνι. Επειδή ένας κινητήρας OCR "βλέπει" τα γράμματα ένα προς ένα, συχνά συγχέει το δυαδικό "rn" ως "m", το γράμμα "l" ως τον αριθμό "1" και το γράμμα "O" ως "0".
Τα μοντέλα γλώσσας AI προσφέρουν μια διαφορετική δύναμη εδώ: κατανοούν το πλαίσιο. Εάν ένας κινητήρας OCR έγραφε "1stanbu1", το AI θα μπορούσε να συμπεράνει από το πλαίσιο ότι θα έπρεπε να είναι "Istanbul". Αλλά υπάρχει ένας μεγάλος κίνδυνος εδώ: κατά τη "διόρθωση" του AI μπορεί επίσης να αλλάξει το κείμενο. Μπορεί να προσθέσει «διόρθωσα» μια ανύπαρκτη λέξη ή να συμπληρώσει ένα ασαφές μέρος με τη δική του εικασία. Αυτό διαταράσσει την πιστότητα της μεταγραφής.
Προσοχή: Ο χρυσός κανόνας στη διόρθωση OCR είναι ο εξής: Η τεχνητή νοημοσύνη πρέπει να διορθώνει μόνο προφανή σφάλματα αναγνώρισης και όχι να ερμηνεύει ή να συμπληρώνει το περιεχόμενο του κειμένου. Το "1stanbu1 → Istanbul" είναι νόμιμο. Δεν πρόκειται να γεμίσουμε μια αδιάβαστη λέξη με εικασίες. Οι αβέβαιες θέσεις πρέπει να επισημαίνονται με [?] και δεν πρέπει να φτιάχνονται.
Τύποι σφαλμάτων OCR και προσέγγιση με πίνακα
Τύπος σφάλματος
παράδειγμα
Μπορεί το AI να το διορθώσει;
ανθρώπινος έλεγχος
ανάμειξη χαρακτήρων
rn↔m, l↔1, O↔0
Ναι, είναι ασφαλές
δείγμα
παλιό γράμμα
μακρύς ſ → s
Ναι, είναι ασφαλές
δείγμα
Ξεθωριασμένη/αδιάβαστη λέξη
"ka___n"
Όχι, πρέπει να βάλετε [?]
υποχρεωτική
κατάλληλο όνομα/τοπωνύμιο
"Constantiniyye"
προσεκτικός
υποχρεωτική
Αριθμός/ημερομηνία
"1867" εναντίον "1857"
επικίνδυνο
υποχρεωτική
Διάταξη σελίδας (στήλη/υποσημείωση)
μικτή ροή
εν μέρει
υποχρεωτική
Για να συνοψίσουμε την εικόνα σε μία πρόταση: Η τεχνητή νοημοσύνη καθαρίζει αξιόπιστα τα συνηθισμένα σφάλματα χαρακτήρων. Αλλά τα ανθρώπινα μάτια απαιτούνται για ειδικά ονόματα, αριθμούς, ημερομηνίες και μη αναγνώσιμα μέρη.
τρεις μίνι θήκες
Περίπτωση 1 — Τα αρχεία των εφημερίδων έγιναν αναζητήσιμα. Μια πανεπιστημιακή βιβλιοθήκη έχει ψηφιοποιήσει 12.000 σελίδες τοπικών εφημερίδων από τη δεκαετία του 1930. Η ακατέργαστη ακρίβεια OCR ήταν περίπου 82% (18 στους 100 χαρακτήρες ήταν λανθασμένοι). Η διόρθωση βάσει τεχνητής νοημοσύνης αύξησε την ακρίβεια στο 96% με ένα κατάλληλο λεξικό και πλαίσιο στη γλώσσα της εφημερίδας. Για τα υπόλοιπα σφάλματα, πραγματοποιήθηκε δειγματοληπτικός έλεγχος αντί για το πλήρες κείμενο. Η συλλογή έγινε αναζητήσιμη σε 3 εβδομάδες.
Περίπτωση 2 — Η τεχνητή νοημοσύνη «διόρθωσε» και παραμόρφωσε την ιστορία. Ένας αρχειονόμος ζήτησε από την AI να διορθώσει την ημερομηνία "1863" στην εκτύπωση OCR. Το AI «διόρθωσε» την ημερομηνία στο «1868» εξετάζοντας ένα άλλο γεγονός στο πλαίσιο — παρόλο που το έγγραφο έλεγε ξεκάθαρα το 1863. Εάν ο αρχειονόμος δεν είχε κοιτάξει την αρχική εικόνα, ο κατάλογος θα είχε εισαχθεί με λάθος ημερομηνία. Μάθημα: οι αριθμοί και οι ημερομηνίες δεν αφήνονται ποτέ στο AI, επαληθεύονται με την εικόνα.
Περίπτωση 3 — Η σελίδα δύο στηλών είναι μπερδεμένη. Οι σελίδες δύο στηλών μιας επετηρίδας του 19ου αιώνα αναμειγνύονται σε ένα ενιαίο ρεύμα σε OCR και οι προτάσεις μπλέκονται μεταξύ τους. Το ακατέργαστο αποτέλεσμα ήταν δυσανάγνωστο. Το κείμενο βελτιώθηκε όταν χώρισα για πρώτη φορά τη διάταξη της σελίδας σε περιοχές (τμηματοποίηση) και επεξεργαζόμουν κάθε στήλη ξεχωριστά. Μάθημα: σε περίπλοκη διάταξη σελίδας, δομή πρώτα, κείμενο δεύτερο.
Τέσσερα πρότυπα με δυνατότητα αντιγραφής
1) Ασφαλής διόρθωση OCR:
Παρακάτω είναι η ακατέργαστη έξοδος OCR ενός ιστορικού εγγράφου. Η αποστολή σας είναι να διορθώσετε ΜΟΝΟ προφανή σφάλματα οπτικής αναγνώρισης (π.χ. rn→m,1→l, 0→O, long ſ→s). Κανόνες: (1) Ερμηνεύστε το νόημα του κειμένου. (2) Διορθώστε τις δυσανάγνωστες/διφορούμενες λέξεις, αφήστε ως έχουν και σημειώστε με [?]. (3) ΟΧΙ προσθήκη, αφαίρεση ή συμπλήρωση προτάσεων. (4) ΑΛΛΑΓΗ αριθμών και ημερομηνιών. επισημάνετε [αριθμός;] εάν έχετε αμφιβολίες. Raw OCR: [εδώ]
2) Έκθεση ποιότητας OCR:
Εξετάστε την έξοδο OCR παρακάτω και δημιουργήστε μια αναφορά ποιότητας: (1) Καταγράψτε λέξεις με πιθανά σφάλματα αναγνώρισης, (2) Επισημάνετε περιοχές που φαίνονται δυσανάγνωστες/ασαφείς, (3) Καταχωρίστε συγκεκριμένα ονόματα, ημερομηνίες και αριθμούς που απαιτούν ανθρώπινο έλεγχο. ΜΗΝ διορθώσετε? δημιουργία μόνο λίστας ελέγχου. Κείμενο: [εδώ]
3) Βοήθεια ανάλυσης στηλών/δομών:
Επειδή το παρακάτω κείμενο OCR προέρχεται από μια σελίδα δύο στηλών, η ροή μπορεί να συγχέεται. Αναδιάταξη του κειμένου σε λογικές παραγράφους ΑΛΛΑ μην αλλάξετε, προσθέσετε ή διαγράψετε καμία λέξη. Απλώς διορθώστε τη σειρά. Σημειώστε την παραγγελία για την οποία δεν είστε σίγουροι με [παραγγελία;]. Κείμενο: [εδώ]
4) Κανονοποίηση σε τυπική γλώσσα (προαιρετικό, ξεχωριστό επίπεδο):
Δημιουργήστε μια απλοποιημένη αναγνωστική έκδοση στη σημερινή ορθογραφία, σε ξεχωριστή στήλη, ΠΑΝΩ από το διορθωμένο ιστορικό κείμενο παρακάτω. ΜΗΝ αλλάζετε ΠΟΤΕ το ΠΡΩΤΟΤΥΠΟ κείμενο. Αφήστε την απλοποίηση να είναι ένα ξεχωριστό επίπεδο. Απλώς ενημερώστε την ορθογραφία/προφορά χωρίς να προσθέσετε νόημα. Πρωτότυπο: [εδώ]
Αδύναμη προτροπή / Ισχυρή προτροπή
Αδύναμο:
Διορθώστε και ωραιοποιήστε αυτό το κείμενο OCR.
Το "Beautify" επιτρέπει στο AI να ξαναγράψει το κείμενο, να κάνει παραλείψεις και να ερμηνεύσει το περιεχόμενο. σπάει την πίστη.
Δυνατό:
Διορθώστε ΜΟΝΟ σφάλματα οπτικής αναγνώρισης σε αυτήν την πρωτογενή έξοδο OCR. Μην ερμηνεύετε νόημα, μην προσθέτετε/διαγράφετε λέξεις, μην αφήνετε μη αναγνώσιμα μέρη με [?], αλλάζετε αριθμούς και ημερομηνίες. Δείξτε κάθε διόρθωση που κάνετε σε ξεχωριστή λίστα με τη μορφή "πρωτότυπο → διόρθωση" για να μπορώ να την επαληθεύσω. Κείμενο: [εδώ]
Η διαφορά: ο περιορισμένος φόρος, η απαγόρευση κατασκευής, η ασάφεια σήμανσης και η ανιχνεύσιμη λίστα διορθώσεων καθιστούν το αποτέλεσμα ελεγχόμενο.
Συνήθη λάθη
- Σάρωση σε χαμηλή ανάλυση. Τα περισσότερα σφάλματα OCR προκαλούνται από κακές εικόνες. Η ποιοτική σάρωση είναι η φθηνότερη επένδυση.
- Ονομάζοντας την τεχνητή νοημοσύνη «κάντε όμορφο». Αυτό παράγει ευχέρεια και όχι πιστότητα. Το έγγραφο ξαναγράφεται.
- Αφήνοντας τους αριθμούς και τις ημερομηνίες στο AI. Αυτά αλλοιώνονται σιωπηλά όταν "διορθώνονται" από το πλαίσιο. πρέπει να επαληθευτεί με εικόνα.
- Συμπλήρωση της αδιάβαστης περιοχής με μια εικασία. Θα πρέπει να προστατεύεται από την αβεβαιότητα [?], όχι να δημιουργείται.
- Καθόλου έλεγχος αντί για δειγματοληψία. Ακόμη και 96% ακρίβεια σημαίνει χιλιάδες λάθη σε 12.000 σελίδες. κρίσιμες περιοχές σαρώνονται.
Συνοπτικά
Το OCR ανοίγει αρχεία σε ερευνητές μετατρέποντας έντυπα ιστορικά έγγραφα σε κείμενο με δυνατότητα αναζήτησης. Το AI είναι ένα ισχυρό βοήθημα για τη διόρθωση σφαλμάτων χαρακτήρων στην ακατέργαστη έξοδο OCR με βάση το πλαίσιο. Αλλά πρέπει να τραβήξετε τη γραμμή μεταξύ επεξεργασίας και επανεγγραφής. Η σάρωση υψηλής ποιότητας, οι οδηγίες ασφαλούς διόρθωσης, η διατήρηση της ασάφειας με [?] και η επαλήθευση ονομάτων/ημερομηνιών/αριθμών με ανθρώπινο μάτι καθιστούν την ψηφιοποίηση τόσο γρήγορη όσο και αξιόπιστη. Το AI καθαρίζει το κείμενο. Είστε ο φύλακας της πιστότητας.
Εργασία εφαρμογής
Σαρώστε ένα έντυπο ιστορικό έγγραφο (παλιά εφημερίδα, επίσημη επιστολή, σελίδα βιβλίου) ή τραβήξτε μια εκτύπωση OCR. Διορθώστε το κείμενο με το πρότυπο "Secure OCR correction" και ζητήστε διορθώσεις μέσω της λίστας "original → correction". Στη συνέχεια, αφαιρέστε τις περιοχές που απαιτούν ανθρώπινο έλεγχο με την "αναφορά ποιότητας OCR". Συγκρίνετε κάθε ημερομηνία και το σωστό όνομα στη λίστα με την πραγματική εικόνα. Σημειώστε πόσα «διορθώθηκαν» λανθασμένα.
λίστα ελέγχου
- [ ] Σάρωσα το έγγραφο με τουλάχιστον 300 DPI και καλή αντίθεση.
- [ ] Ζήτησα από το AI μόνο διόρθωση οπτικού σφάλματος, όχι επανεγγραφή.
- [ ] Προστάτεψα τα μη αναγνώσιμα μέρη με [?].
- [ ] Επιβεβαίωσα όλους τους αριθμούς, τις ημερομηνίες και τα σωστά ονόματα με την εικόνα.
- [ ] Έκανα δείγμα ή πλήρη έλεγχο σε κρίσιμες περιοχές.