Κέρδη:
- Δυνατότητα διόρθωσης σαρωμένων εγγράφων μετατρέποντάς τα σε κείμενο με OCR και HTR και συγκρίνοντας την έξοδο με την πραγματική εικόνα
- Δυνατότητα διατήρησης της πρωτοτυπίας και ακεραιότητας του εγγράφου αρχειοθέτησης και αποτροπής της τεχνητής νοημοσύνης από την αλλαγή του περιεχομένου και την κατασκευασμένη αποκατάσταση
- Δυνατότητα προγραμματισμού μακροπρόθεσμης ψηφιακής διατήρησης με πληροφορίες προέλευσης και ανθεκτικές μορφές
Ένας αρχειονόμος έχει την αποστολή να μεταφέρει στο μέλλον τόμους εφημερίδων πενήντα ετών, χειρόγραφες επιστολές ή παλιές φωτογραφίες. Αυτά τα έγγραφα φθείρονται με την πάροδο του χρόνου. Για να διατηρηθούν και να γίνουν προσβάσιμα, γίνεται η ψηφιοποίηση: η πράξη της σάρωσης ενός φυσικού εγγράφου και της μετατροπής του σε ψηφιακό αντίγραφο. Αλλά ο έλεγχος από μόνος του δεν αρκεί. Το ψηφιακό αντικείμενο πρέπει να μπορεί να βρεθεί, να είναι ευανάγνωστο και να διατηρηθεί μακροπρόθεσμα. Σε αυτή την ενότητα, θα μάθετε πώς να χρησιμοποιείτε την τεχνητή νοημοσύνη στη ροή εργασιών ψηφιοποίησης, μεταγραφής και ψηφιακής διατήρησης. αλλά θα μάθετε γιατί θα έχετε την ευθύνη για την πρωτοτυπία και την ακρίβεια.
Μερικές έννοιες. Το OCR (Optical Character Recognition) είναι μια τεχνολογία που μετατρέπει το κείμενο στην εικόνα ενός εγγράφου σε κείμενο επεξεργάσιμο από μηχανή. Το HTR (Handwritten Text Recognition) κάνει την ίδια δουλειά για χειρόγραφα έγγραφα και είναι πολύ πιο δύσκολο. Η ψηφιακή διατήρηση είναι μια προγραμματισμένη προσπάθεια για να διασφαλιστεί ότι τα ψηφιακά αντικείμενα παραμένουν αναγνώσιμα για δεκαετίες, ακόμη και όταν οι μορφές αρχείων γίνονται παρωχημένες και το λογισμικό αλλάζει. Το AI είναι ένας ισχυρός αλλά ελαττωματικός βοηθός και στους τρεις τομείς.
Βήμα προς βήμα: από την ψηφιοποίηση στη συντήρηση
1. Δώστε προτεραιότητα. Δεν μπορείς να ψηφιοποιήσεις τα πάντα ταυτόχρονα. Τα πιο εύθραυστα, τα πιο απαιτητικά και τα πιο μοναδικά έγγραφα τοποθετούνται πρώτα. Αυτή είναι μια δικαστική απόφαση. Η τεχνητή νοημοσύνη βοηθά στην επεξεργασία της λίστας, αλλά το ίδρυμα καθορίζει την προτεραιότητα.
2. Σαρώστε και εφαρμόστε OCR/HTR. Σαρώστε το έγγραφο σε υψηλή ανάλυση και, στη συνέχεια, χρησιμοποιήστε OCR ή HTR για να εξαγάγετε το κείμενο. Τα εργαλεία που βασίζονται στην τεχνητή νοημοσύνη γίνονται όλο και καλύτερα εδώ, ακόμη και με παλιά και δύσκολα κείμενα.
3. Διορθώστε και επαληθεύστε το κείμενο. Η έξοδος OCR/HTR δεν είναι ποτέ τέλεια. Τα λάθη είναι κοινά, ειδικά εάν υπάρχει παλιά γραφή, λεκιασμένες σελίδες ή χειρόγραφο. Είναι απαραίτητο να συγκρίνετε την έξοδο με την πραγματική εικόνα και να τη διορθώσετε.
4. Προσθέστε μεταδεδομένα και πληροφορίες προστασίας. Προσθέστε στο ψηφιακό αντικείμενο την προέλευσή του, τις συνθήκες σάρωσης, τις πληροφορίες μορφής και την προέλευση — από πού προήλθε το έγγραφο και πώς υποβλήθηκε η επεξεργασία του. Αυτές οι πληροφορίες είναι κρίσιμες για μελλοντική επαλήθευση και προστασία.
5. Σχέδιο για μακροπρόθεσμη προστασία. Επιλέξτε μορφές αρχείων που είναι ανοιχτές, κοινές και ανθεκτικές. υποβοηθώ; Κάντε ένα σχέδιο μετεγκατάστασης σε περίπτωση που οι μορφές καταστούν παρωχημένες.
Συμβουλή: Μην αποδεχτείτε την έξοδο OCR ως "καθαρό κείμενο". Εάν ένα σύστημα αναζήτησης επρόκειτο να λειτουργήσει μέσω αυτού του κειμένου, οι λέξεις που δεν αναγνωρίζονταν σωστά θα προκαλούσαν τη μη εύρεση της πηγής. Για κρίσιμες συλλογές, η διόρθωση της εξόδου OCR στο ανθρώπινο μάτι καθορίζει την ποιότητα κάθε επακόλουθης πρόσβασης.
Αυθεντικότητα και ακεραιότητα του ψηφιακού αντικειμένου
Στο επίκεντρο της αρχειακής εργασίας βρίσκεται η αυθεντικότητα και η ακεραιότητα: η διαβεβαίωση ότι ένα έγγραφο προέρχεται πραγματικά από την αξιωμένη πηγή και ότι το περιεχόμενό του δεν έχει αλλοιωθεί. Σε αυτό το σημείο, η τεχνητή νοημοσύνη δημιουργεί μια απειλή με δύο σκέλη. Πρώτον, κατά τη διόρθωση OCR/HTR ή "βελτίωση", το AI μπορεί να τροποποιήσει σιωπηλά το κείμενο. μπορεί να προσθέσει μια λέξη που δεν υπάρχει με το όνομα "διόρθωση". Δεύτερον, εάν η "επισκευή" ή η "αποκατάσταση" της εικόνας γίνει με τεχνητή νοημοσύνη, ενδέχεται να παραχθούν μη πρωτότυπες λεπτομέρειες.
Ο κανόνας του αρχειονόμου είναι σαφής: το ψηφιακό αντίγραφο συντήρησης πρέπει να είναι πιστό στο πρωτότυπο. Κάθε βελτίωση που γίνεται με την τεχνητή νοημοσύνη θα πρέπει να τεκμηριώνεται και η πραγματική (ακατέργαστη) σάρωση θα πρέπει πάντα να διατηρείται. Η «ωραιοποίηση» ενός εγγράφου μπορεί να καταστρέψει την ιστορική αποδεικτική του αξία.
Προσοχή: Μπορεί να είναι δελεαστικό να "βελτιωθεί" μια παλιά φωτογραφία ή έγγραφο με τεχνητή νοημοσύνη. αλλά η τεχνητή νοημοσύνη συμπληρώνει τα μέρη που λείπουν συμπληρώνοντάς τα. Σε ένα αρχειακό έγγραφο, αυτό σημαίνει τη δημιουργία ψευδών ιστορικών στοιχείων. Η έξοδος αποκατάστασης δεν αντικαθιστά ποτέ την αρχική πηγή. αποθηκεύεται ως ξεχωριστή παραλλαγή με σαφή σήμανση.
τρεις μίνι θήκες
Περίπτωση 1 — Τα αρχεία των εφημερίδων έγιναν αναζητήσιμα. Μια βιβλιοθήκη έχει ψηφιοποιήσει τη συλλογή τοπικών εφημερίδων, ηλικίας 30 ετών. Με το OCR, 90.000 σελίδες μεταγράφηκαν και έγιναν αναζητήσιμες. Μια αναζήτηση θέματος που προηγουμένως διαρκούσε μέρες έχει πλέον μειωθεί σε δευτερόλεπτα. Ωστόσο, η ομάδα παρατήρησε ότι η ακρίβεια OCR έπεσε στο 80% σε παλιές και λεκιασμένες σελίδες και έδωσε προτεραιότητα στη διόρθωση των κορυφαίων ετών με το ανθρώπινο μάτι.
Περίπτωση 2 — Η HTR άνοιξε το χειρόγραφο. Ένα αρχείο εφάρμοσε το HTR σε μια συλλογή δυσανάγνωστων επιστολών του 19ου αιώνα. Το σύστημα απέκτησε μεγάλη ταχύτητα σύμφωνα με μήνες ανάγνωσης από ειδικούς. Αλλά κάθε σελίδα της εκτύπωσης συγκρίθηκε με την αρχική από έναν ειδικό παλαιογράφο (ειδικό στην αρχαία γραφή), επειδή υπήρχαν λάθη στα ονόματα των ανθρώπων και των τόπων.
Περίπτωση 3 — Η ψεύτικη «αποκατάσταση» απορρίφθηκε. Μια ομάδα σκέφτηκε να «επισκευάσει» μια σκισμένη ιστορική φωτογραφία με AI. Η τεχνητή νοημοσύνη συμπλήρωσε τα μέρη του προσώπου που έλειπαν προσαρμόζοντάς τα. Ο αρχειονόμος συνειδητοποίησε ότι αυτές οι κατασκευασμένες λεπτομέρειες θα παραμόρφωσαν τα ιστορικά στοιχεία. Η επισκευασμένη εικόνα αποθηκεύτηκε χωριστά μαζί με την αρχική, μόνο με σαφή ένδειξη "Παραγωγή AI".
Πρόσβαση στο αντίγραφο, το αντίγραφο διατήρησης και την απόφαση μορφής
Μια καλή πρακτική στην ψηφιοποίηση είναι ο διαχωρισμός αντιγράφων του ίδιου αντικειμένου για διαφορετικούς σκοπούς. Η κύρια μονάδα συντήρησης είναι το πραγματικό ψηφιακό αντικείμενο που θα μεταφερθεί στο μέλλον, αποθηκευμένο στην υψηλότερη ανάλυση, ασυμπίεστη ή χωρίς απώλειες μορφή. σπάνια αγγίζεται. Το αντίγραφο πρόσβασης είναι μια μικρότερη παραλλαγή που ανοίγει εύκολα και παρουσιάζεται στον χρήστη. Αυτή η διάκριση είναι σημαντική επειδή η μορφή που είναι πρακτική για χρήση (μικρή, συμπιεσμένη) μπορεί να μην είναι κατάλληλη για μακροχρόνια διατήρηση. Η ιδανική μορφή για συντήρηση (μεγάλη, χωρίς απώλειες) είναι δυσκίνητη για καθημερινή χρήση. Σε αυτήν τη ροή εργασίας, η τεχνητή νοημοσύνη μπορεί να βοηθήσει στην απογραφή αρχείων, στον εντοπισμό παραλλαγών που λείπουν και στη διατήρηση των μεταδεδομένων συνεπή μεταξύ δύο αντιγράφων. Ωστόσο, η επιλογή της μορφής είναι μια απόφαση διατήρησης: θα πρέπει να προτιμώνται ανοιχτές, ευρέως τεκμηριωμένες και ανθεκτικές μορφές (και όχι αποκλειστικές, κλειστές μορφές) και ένα σχέδιο μετεγκατάστασης θα πρέπει να διατηρείται έτοιμο σε περίπτωση που οι μορφές καταστούν παρωχημένες με την πάροδο του χρόνου. Ακόμα κι αν η τεχνητή νοημοσύνη προτείνει μια μορφή, η πολιτική μακροπρόθεσμης διατήρησης του ιδρύματος έχει τον τελευταίο λόγο.
Συμβουλή: Για κάθε ψηφιακό αντικείμενο, κρατήστε ένα σύντομο αρχείο που απαντά στις ερωτήσεις "πού είναι η αρχική πηγή, σε ποια μορφή είναι το αντίγραφο διατήρησης, σε ποια μορφή είναι το αντίγραφο πρόσβασης και ποιο είναι διαθέσιμο στο χρήστη;" Η ανάμειξη αυτών των τριών επιπέδων καθιστά ασαφές ποιο αρχείο είναι το αξιόπιστο κύριο στη συνέχεια.
Τέσσερα πρότυπα με δυνατότητα αντιγραφής
1) Βοήθεια διόρθωσης εξόδου OCR:
Παρακάτω είναι ένα κείμενο OCR και περιγραφή της πραγματικής σελίδας. Διορθώστε μόνο σφάλματα openOCR (κακοί χαρακτήρες, σύνθετες/δισπασμένες λέξεις). Μην αλλάζετε περιεχόμενο, μην προσθέτετε ή αφαιρείτε λέξεις. Εάν δεν είστε σίγουροι, σημειώστε με "[?]". Κείμενο OCR: [εδώ]
2) Έλεγχος συνέπειας κειμένου-εικόνας:
Υπάρχουν προσθήκες στο παρακάτω διορθωμένο κείμενο που δεν αναμενόταν να υπάρχουν στο αρχικό έγγραφο (το οποίο μπορεί να έχει κατασκευαστεί); Σημειώστε κάθε ύποπτο μέρος και γράψτε γιατί είναι ύποπτο. Κείμενο: [εδώ]
3) Προσχέδιο μεταδεδομένων προστασίας:
Δημιουργήστε το περίγραμμα μεταδεδομένων διατήρησης για το ακόλουθο ψηφιοποιημένο αντικείμενο: πηγή, προέλευση, ημερομηνία/ανάλυση σάρωσης, μορφή αρχείου, ιστορικό συναλλαγών. Απλώς χρησιμοποιήστε τις πληροφορίες που έδωσα, αφήστε το πεδίο που λείπει κενό. Πληροφορίες: [εδώ]
4) Βοήθεια κατά προτεραιότητα:
Παρακάτω είναι ο κατάλογος των συλλογών που αναμένουν ψηφιοποίηση. Βοηθήστε στην ιεράρχηση προτεραιοτήτων με βάση την ευθραυστότητα, τη ζήτηση και τη μοναδικότητα. Δώστε σύντομη αιτιολόγηση για κάθε πόρο. Αφήστε την τελική απόφαση σε μένα. Λίστα: [εδώ]
Αδύναμη προτροπή / Ισχυρή προτροπή
Αδύναμη προτροπή:
Διορθώστε και ωραιοποιήστε αυτό το σαρωμένο κείμενο.
Το "Beautify" προσκαλεί την τεχνητή νοημοσύνη να αλλάξει το περιεχόμενο, να αναπληρώσει τις παραλείψεις. Η πρωτοτυπία του αρχειακού εγγράφου είναι κατεστραμμένη.
Ισχυρή προτροπή:
Ο ρόλος σας: βοηθός συντάκτη ψηφιοποίησης. Στο ακόλουθο κείμενο OCR, διορθώστε ΜΟΝΟ σφάλματα ρητής αναγνώρισης (κακός χαρακτήρας, λανθασμένη διαίρεση λέξης). Μην προσθέτετε, αφαιρείτε ή αλλάζετε καμία λέξη. Αφήστε το "[?]" όπου δεν είστε σίγουροι. Εμφάνιση κάθε διόρθωσης που κάνατε σε ξεχωριστή λίστα. Κείμενο: [εδώ]
Η ισχυρή προτροπή περιορίζει το AI στην αναγνώριση μόνο σφαλμάτων, του απαγορεύει να αγγίζει περιεχόμενο και καθιστά τις διορθώσεις ανιχνεύσιμες.
Πίνακας ροής εργασιών και κινδύνου
Σκηνή
Συνεισφορά του AI
Κύριος κίνδυνος
μέτρο προστασίας
σάρωση
—
κακής ποιότητας
υψηλή ανάλυση
OCR/HTR
Μετατροπή σε κείμενο
Σφάλματα αναγνώρισης
ανθρώπινη διόρθωση
διόρθωση
Πρόταση σφάλματος
Αλλαγή περιεχομένου
Σύγκριση με πρωτότυπο
αποκατάσταση
Παράγωγο εικόνας
λεπτομέρεια εφαρμογής
Κρατήστε το ακατέργαστο πρωτότυπο, βάλτε το με ετικέτα
προστασία
Προσχέδιο μεταδεδομένων
απώλεια προέλευσης
Ρεκόρ προέλευσης
Συνήθη λάθη
- Αποδοχή της εξόδου OCR χωρίς διόρθωση. Τα σφάλματα διακόπτουν την αναζήτηση και την πρόσβαση.
- Ονομάζοντας την τεχνητή νοημοσύνη «κάντε όμορφο». Αλλάζει το περιεχόμενο και καταστρέφει την πρωτοτυπία.
- Αντικατάσταση της αποκατάστασης AI για τα πραγματικά στοιχεία. Η κατασκευασμένη λεπτομέρεια δημιουργεί ψευδές ιστορικό.
- Δεν αποθηκεύεται η ακατέργαστη σάρωση. Καμία διόρθωση δεν μπορεί να επαληθευτεί χωρίς το πρωτότυπο.
- Παράλειψη πληροφοριών προέλευσης. Η αξιοπιστία του εγγράφου καθίσταται μη ανιχνεύσιμη.
Συνοπτικά
AI σε ψηφιακά αρχεία και ψηφιοποίηση. Είναι ένα πολύτιμο βοήθημα που επιταχύνει τη μεταγραφή OCR/HTR, τη σύνταξη μεταδεδομένων και την ιεράρχηση προτεραιοτήτων. Αλλά η ουσία της αρχειακής εργασίας είναι η αυθεντικότητα και η ακεραιότητα: η έξοδος OCR θα πρέπει να διορθώνεται από το ανθρώπινο μάτι, η τεχνητή νοημοσύνη δεν πρέπει ποτέ να αντικαθιστά σιωπηλά το περιεχόμενο, τα παράγωγα αποκατάστασης δεν πρέπει να αντικαθιστούν τα πρωτότυπα στοιχεία και οι ακατέργαστες πληροφορίες σάρωσης και προέλευσης θα πρέπει πάντα να διατηρούνται. Χρησιμοποιήστε την τεχνητή νοημοσύνη ως εργαλείο που δεν «βελτιώνει» το έγγραφο, αλλά το καθιστά προσιτό ενώ παραμένει πιστό σε αυτό.
Εργασία εφαρμογής
Λάβετε ένα σύντομο δείγμα εξόδου OCR (είτε δική σας παραγωγή είτε από πραγματική σάρωση). Διορθώστε μόνο τα σφάλματα αναγνώρισης με το πρότυπο "Βοήθεια διόρθωσης εξόδου OCR" και, στη συνέχεια, ελέγξτε εάν το AI έχει προσθέσει περιεχόμενο με το πρότυπο "Έλεγχος συνέπειας κειμένου-εικόνας". Στη συνέχεια, δημιουργήστε μια εγγραφή με τις πληροφορίες προέλευσης και μορφής για το αντικείμενο με το πρότυπο "Πρόχειρο διατήρησης μεταδεδομένων".
λίστα ελέγχου
- [ ] Σύγκρισα την έξοδο OCR/HTR με την πραγματική εικόνα και τη διόρθωσα.
- [ ] Έχω ελέγξει ότι το AI δεν προσθέτει/αλλάζει περιεχόμενο.
- [ ] Κράτησα την ακατέργαστη (κύρια) σάρωση χωριστά και αμετάβλητη.
- [ ] Πρόσθεσα πληροφορίες προέλευσης και μορφής στα μεταδεδομένα.
- [ ] Έχω χαρακτηρίσει ξεκάθαρα τις παραλλαγές αποκατάστασης ως "παράγωγο AI".