Lợi nhuận:
- Khả năng thiết lập quy trình số hóa và OCR (quét, tiền xử lý, nhận dạng, hiệu chỉnh, xác minh) từng bước
- Khả năng sử dụng AI để sửa lỗi OCR theo ngữ cảnh trong khi vẫn duy trì dòng sửa và viết lại cũng như đánh dấu sự mơ hồ bằng [?]
- Hiểu lý do tại sao các con số, ngày tháng và tên riêng phải được xác minh bằng trực quan và vai trò của việc kiểm soát chất lượng.
Hàng triệu trang trên kệ vật lý của kho lưu trữ hoặc thư viện chỉ thực sự được mở ra cho nhà nghiên cứu khi chúng được số hóa và có thể tìm kiếm được. Số hóa là chuyển đổi một tài liệu vật lý thành hình ảnh kỹ thuật số bằng cách quét hoặc chụp ảnh nó. Nhưng bức ảnh chụp một trang giấy vẫn chưa phải là “văn bản”; Với máy tính nó vẫn là hình ảnh, bạn không thể tìm kiếm trong đó. Đây là lúc OCR phát huy tác dụng.
OCR (Nhận dạng ký tự quang học) là công nghệ nhận dạng các chữ cái được in trong hình ảnh tài liệu và chuyển đổi chúng thành văn bản có thể đọc được bằng máy và có thể tìm kiếm được. Trong phần này, bạn sẽ tìm hiểu cách số hóa các tài liệu in lịch sử bằng OCR, cách AI giúp sửa lỗi OCR trong quy trình này và vị trí cần thiết của mắt người. (Văn bản viết tay yêu cầu công nghệ khác; chúng tôi sẽ đề cập đến công nghệ đó trong bài tiếp theo.)
Quy trình số hóa: từng bước
1. Chuẩn bị và sàng lọc. Quét tài liệu ở chất lượng cao nhất có thể. Nguyên tắc chung cho nghiên cứu lịch sử là độ phân giải ít nhất 300-400 dpi (điểm trên mỗi inch). Độ phân giải thấp làm tăng tỷ lệ lỗi trong giai đoạn OCR tiếp theo.
2. Tiền xử lý ảnh. Cải thiện hình ảnh trước OCR làm tăng đáng kể thành công: làm mờ trang được quét, loại bỏ nhược điểm, tăng độ tương phản, chuyển sang đen trắng. Các công cụ dựa trên AI hiện đại có thể tự động hóa bước này.
3. Ứng dụng OCR. Bạn đưa hình ảnh vào công cụ OCR; Công cụ nhận dạng các chữ cái và tạo ra văn bản. Đầu ra thường bao gồm hai lớp: hình ảnh tài liệu hiển thị và "lớp văn bản ẩn có thể tìm kiếm" bên dưới.
4. Correction (hậu sửa lỗi). Đầu ra OCR thô không bao giờ hoàn hảo. Ký tự đọc không chính xác do phông chữ cũ, giấy ố vàng, lem mực, lỗi quét. Đây là lúc AI trở thành người trợ giúp đắc lực: nó gợi ý và sửa lỗi OCR bằng ngữ cảnh.
5. Xác minh và kiểm soát chất lượng. Văn bản đã sửa được con người kiểm tra trên cơ sở mẫu hoặc toàn bộ. Đặc biệt các lĩnh vực quan trọng như tên, ngày tháng và con số phải được xác minh bằng trực quan.
Tại sao OCR mắc lỗi, AI giúp ích như thế nào
Các vấn đề điển hình thách thức OCR trong các tài liệu lịch sử: phông chữ cũ và lạ mắt, dạng chữ lỗi thời như chữ "s" (ſ) dài, bố cục trang hai cột, chú thích cuối trang, phần chèn viết tay, con dấu và mực mờ. Bởi vì công cụ OCR "nhìn thấy" từng chữ cái một nên nó thường nhầm lẫn giữa nhị phân "rn" là "m", chữ "l" là số "1" và chữ "O" là "0".
Các mô hình ngôn ngữ AI mang lại một sức mạnh khác ở đây: chúng hiểu ngữ cảnh. Nếu một công cụ OCR viết "1stanbu1", AI có thể suy ra từ ngữ cảnh rằng nó phải là "Istanbul". Nhưng có một mối nguy hiểm lớn ở đây: khi “sửa” AI cũng có thể thay đổi văn bản. Anh ta có thể thêm "Tôi đã sửa" một từ không tồn tại hoặc điền vào chỗ trống bằng suy đoán của chính mình. Điều này làm gián đoạn tính trung thực của bản phiên âm.
Thận trọng: Nguyên tắc vàng trong chỉnh sửa OCR là: AI chỉ nên sửa các lỗi nhận dạng rõ ràng, không diễn giải hay bổ sung nội dung văn bản. "1stanbu1 → Istanbul" là hợp pháp; Nó không phải là điền vào một từ không thể đọc được bằng những suy đoán. Những chỗ không chắc chắn nên được đánh dấu bằng [?] và không nên bịa đặt.
Các loại lỗi OCR và cách tiếp cận với bảng
Loại lỗi
ví dụ
AI có thể sửa nó không?
sự kiểm soát của con người
trộn ký tự
rn↔m, l↔1, O↔0
Vâng, nó an toàn
mẫu vật
mẫu chữ cũ
dài ſ → s
Vâng, nó an toàn
mẫu vật
Từ bị mờ/không thể đọc được
"ka___n"
Không, nên đặt [?]
bắt buộc
tên riêng/tên địa danh
"Constantiniyye"
cẩn thận
bắt buộc
Số/ngày
"1867" so với "1857"
nguy hiểm
bắt buộc
Bố cục trang (cột/chú thích cuối trang)
dòng chảy hỗn hợp
một phần
bắt buộc
Tóm tắt bức tranh trong một câu: AI sẽ loại bỏ các lỗi ký tự thông thường một cách đáng tin cậy; Nhưng mắt người cần những cái tên đặc biệt, những con số, ngày tháng và những địa điểm không thể đọc được.
ba trường hợp nhỏ
Trường hợp 1 - Kho lưu trữ báo chí có thể tìm kiếm được. Một thư viện của trường đại học đã số hóa 12.000 trang báo địa phương từ những năm 1930. Độ chính xác của OCR thô ước tính là 82% (cứ 100 ký tự thì có 18 ký tự không chính xác). Tính năng chỉnh sửa dựa trên AI đã tăng độ chính xác lên 96% với từ điển và ngữ cảnh phù hợp với ngôn ngữ báo chí. Đối với các lỗi còn lại, việc kiểm tra mẫu được thực hiện thay vì toàn văn; Bộ sưu tập có thể được tìm kiếm sau 3 tuần.
Trường hợp 2 - AI “sửa chữa” và bóp méo lịch sử. Một nhà lưu trữ đã nhờ AI sửa ngày "1863" trên bản in OCR. AI đã “sửa” ngày thành “1868” bằng cách xem xét một sự kiện khác trong bối cảnh - mặc dù tài liệu ghi rõ ràng là năm 1863. Nếu người lưu trữ không xem ảnh gốc, danh mục sẽ nhập sai ngày. Bài học: các con số và ngày tháng không bao giờ được để lại cho AI, chúng được xác minh bằng hình ảnh.
Trường hợp 3 - Trang hai cột bị nhầm lẫn. Các trang hai cột của cuốn kỷ yếu thế kỷ 19 được trộn thành một luồng duy nhất trong OCR và các câu được đan xen vào nhau. Đầu ra thô không thể đọc được. Văn bản được cải thiện khi lần đầu tiên tôi chia bố cục trang thành các vùng (phân đoạn) và xử lý từng cột riêng biệt. Bài học: trong bố cục trang phức tạp, cấu trúc trước tiên, văn bản thứ hai.
Bốn mẫu có thể sao chép
1) Hiệu chỉnh OCR an toàn:
Dưới đây là đầu ra OCR thô của một tài liệu lịch sử. Nhiệm vụ của bạn CHỈ là sửa các lỗi nhận dạng quang học rõ ràng (ví dụ: rn→m,1→l, 0→O, ſ→s dài). Quy tắc: (1) Giải thích ý nghĩa của văn bản. (2) Sửa những từ khó đọc/mơ hồ, giữ nguyên và đánh dấu [?]. (3) KHÔNG thêm, bớt, hoàn thiện câu. (4) THAY ĐỔI số và ngày; đánh dấu [số?] nếu nghi ngờ. OCR thô: [tại đây]
2) Báo cáo chất lượng OCR:
Kiểm tra đầu ra OCR bên dưới và tạo báo cáo chất lượng: (1) Liệt kê các từ có thể có lỗi nhận dạng, (2) Đánh dấu các khu vực có vẻ khó đọc/không rõ ràng, (3) Liệt kê tên, ngày tháng và số cụ thể cần con người kiểm tra. KHÔNG sửa; chỉ tạo danh sách kiểm tra.Văn bản: [tại đây]
3) Trợ giúp phân tích cú pháp cột/cấu trúc:
Vì văn bản OCR bên dưới xuất phát từ một trang có hai cột nên luồng có thể bị nhầm lẫn. Sắp xếp lại văn bản thành các đoạn hợp lý NHƯNG không thay đổi, thêm bớt bất kỳ từ nào. Chỉ cần sửa lại thứ tự. Đánh dấu thứ tự bạn không chắc chắn bằng [order?]. Văn bản: [tại đây]
4) Chuẩn hóa thành ngôn ngữ tiêu chuẩn (tùy chọn, lớp riêng):
Tạo một phiên bản đọc đơn giản theo cách đánh vần ngày nay, trong một cột riêng biệt, TRÊN văn bản lịch sử đã sửa bên dưới. KHÔNG BAO GIỜ thay đổi văn bản GỐC; Hãy để sự đơn giản hóa là một lớp riêng biệt. Chỉ cần cập nhật chính tả/phát âm mà không thêm nghĩa.Bản gốc: [tại đây]
Dấu nhắc yếu / Dấu nhắc mạnh
yếu:
Chỉnh sửa và làm đẹp văn bản OCR này.
“Làm đẹp” cho phép AI viết lại văn bản, bù đắp những thiếu sót và diễn giải nội dung; phá vỡ lòng trung thành.
Mạnh mẽ:
CHỈ khắc phục lỗi nhận dạng quang học ở đầu ra OCR thô này. Không diễn giải nghĩa, thêm/xóa từ, để lại những phần không đọc được bằng [?], thay đổi số và ngày tháng. Hiển thị từng chỉnh sửa bạn thực hiện trong một danh sách riêng ở định dạng "gốc → chỉnh sửa" để tôi có thể xác minh. Văn bản: [tại đây]
Sự khác biệt: thuế giới hạn, cấm chế tạo, đánh dấu sự mơ hồ và danh sách điều chỉnh có thể theo dõi làm cho đầu ra có thể kiểm tra được.
Những lỗi thường gặp
- Quét ở độ phân giải thấp Hầu hết các lỗi OCR đều do hình ảnh xấu gây ra; Quét chất lượng là khoản đầu tư rẻ nhất.
- Gọi AI là “làm đẹp”. Điều này tạo ra sự trôi chảy hơn là sự trung thực; Tài liệu được viết lại.
- Để lại những con số và ngày tháng cho AI. Chúng bị lỗi âm thầm khi được "sửa" khỏi ngữ cảnh; phải được xác minh bằng hình ảnh.
- Điền vào khu vực không thể đọc được bằng một phỏng đoán. Nó cần được bảo vệ bởi sự không chắc chắn [?], không bịa đặt.
- Không kiểm soát gì cả thay vì lấy mẫu. Thậm chí độ chính xác 96% cũng có nghĩa là có hàng nghìn lỗi trong 12.000 trang; các khu vực quan trọng được quét.
Tóm lại
OCR mở kho lưu trữ cho các nhà nghiên cứu bằng cách chuyển đổi các tài liệu lịch sử được in thành văn bản có thể tìm kiếm được. AI là công cụ hỗ trợ đắc lực trong việc sửa lỗi ký tự ở đầu ra OCR thô theo ngữ cảnh; Nhưng bạn phải vạch ra ranh giới giữa chỉnh sửa và viết lại. Tính năng quét chất lượng cao, hướng dẫn chỉnh sửa an toàn, tránh sự mơ hồ với [?] và xác minh bằng mắt người về tên/ngày/số giúp cho quá trình số hóa vừa nhanh vừa đáng tin cậy. AI dọn dẹp văn bản; Bạn là người bảo vệ sự chung thủy.
Nhiệm vụ ứng dụng
Quét tài liệu lịch sử đã in (báo cũ, thư chính thức, trang sách) hoặc lấy bản in OCR. Yêu cầu sửa văn bản bằng mẫu “Chỉnh sửa OCR an toàn” và yêu cầu chỉnh sửa thông qua danh sách “bản gốc → chỉnh sửa”. Sau đó, loại bỏ những khu vực cần sự kiểm soát của con người bằng "báo cáo chất lượng OCR". So sánh từng ngày và tên riêng trong danh sách với hình ảnh thực tế; Lưu ý có bao nhiêu đã được "sửa" sai.
danh sách kiểm tra
- [ ] Tôi đã quét tài liệu với độ phân giải ít nhất là 300 dpi và độ tương phản tốt.
- [ ] Tôi chỉ yêu cầu AI sửa lỗi quang học chứ không yêu cầu viết lại.
- [ ] Tôi đã bảo vệ những phần không thể đọc được bằng [?].
- [ ] Tôi đã xác minh tất cả các con số, ngày tháng và tên riêng kèm theo hình ảnh.
- [ ] Tôi đã thực hiện kiểm tra mẫu hoặc kiểm tra đầy đủ các khu vực quan trọng.