Lợi nhuận:
- Khả năng sửa tài liệu được quét bằng cách chuyển đổi chúng thành văn bản bằng OCR và HTR và so sánh đầu ra với hình ảnh thực tế
- Khả năng duy trì tính nguyên bản và toàn vẹn của tài liệu lưu trữ và ngăn AI thay đổi nội dung và khôi phục giả tạo
- Khả năng lập kế hoạch bảo quản kỹ thuật số lâu dài với thông tin xuất xứ và định dạng lâu bền
Một nhà lưu trữ được giao nhiệm vụ mang những tập báo, những bức thư viết tay hoặc những bức ảnh cũ vào tương lai. Những tài liệu này bị hao mòn theo thời gian; Để bảo tồn và làm cho chúng có thể truy cập được, quá trình số hóa được thực hiện: hành động quét tài liệu vật lý và chuyển đổi nó thành bản sao kỹ thuật số. Nhưng chỉ sàng lọc thôi là chưa đủ; Đối tượng kỹ thuật số phải có thể tìm thấy, có thể đọc được và có thể bảo trì lâu dài. Trong phần này, bạn sẽ học cách sử dụng trí tuệ nhân tạo trong quy trình số hóa, sao chép và bảo quản kỹ thuật số; nhưng bạn sẽ biết được lý do tại sao bạn phải chịu trách nhiệm về tính nguyên gốc và tính chính xác.
Một vài khái niệm. OCR (Nhận dạng ký tự quang học) là công nghệ chuyển đổi văn bản trong hình ảnh của tài liệu thành văn bản có thể chỉnh sửa bằng máy. HTR (Nhận dạng văn bản viết tay) thực hiện công việc tương tự đối với tài liệu viết tay và khó khăn hơn nhiều. Bảo quản kỹ thuật số là một nỗ lực có kế hoạch nhằm đảm bảo rằng các đối tượng kỹ thuật số vẫn có thể đọc được trong nhiều thập kỷ, ngay cả khi các định dạng tệp trở nên lỗi thời và các thay đổi về phần mềm. AI là một trợ lý đắc lực nhưng có nhiều thiếu sót trong cả ba lĩnh vực.
Từng bước: từ số hóa đến bảo quản
1. Ưu tiên. Bạn không thể số hóa mọi thứ cùng một lúc. Những tài liệu dễ vỡ nhất, được yêu cầu nhiều nhất và độc đáo nhất sẽ được ưu tiên hàng đầu. Đây là một quyết định tư pháp; AI giúp chỉnh sửa danh sách nhưng cơ quan sẽ xác định mức độ ưu tiên.
2. Quét và áp dụng OCR/HTR. Quét tài liệu ở độ phân giải cao, sau đó sử dụng OCR hoặc HTR để trích xuất văn bản. Các công cụ dựa trên AI ngày càng trở nên tốt hơn ở đây, ngay cả với những văn bản cũ và khó.
3. Chỉnh sửa và xác minh văn bản. Đầu ra OCR/HTR không bao giờ hoàn hảo. Lỗi thường xảy ra, đặc biệt nếu có chữ viết cũ, trang bị ố màu hoặc bản thảo. Điều cần thiết là phải so sánh đầu ra với hình ảnh thực tế và sửa nó.
4. Thêm siêu dữ liệu và thông tin bảo vệ. Thêm vào đối tượng kỹ thuật số nguồn gốc, điều kiện quét, thông tin định dạng và nguồn gốc - tài liệu đến từ đâu và cách xử lý tài liệu. Thông tin này rất quan trọng để xác minh và bảo vệ trong tương lai.
5. Kế hoạch bảo vệ lâu dài. Chọn các định dạng tệp mở, phổ biến và bền vững; hỗ trợ; Lập kế hoạch di chuyển trong trường hợp các định dạng trở nên lỗi thời.
Mẹo: Không chấp nhận đầu ra OCR là "văn bản rõ ràng". Nếu một hệ thống tìm kiếm hoạt động thông qua văn bản này, các từ được nhận dạng không chính xác sẽ khiến không tìm thấy nguồn. Đối với các bộ sưu tập quan trọng, việc hiệu chỉnh đầu ra OCR đối với mắt người sẽ xác định chất lượng của tất cả các lần truy cập tiếp theo.
Tính xác thực và tính toàn vẹn của đối tượng kỹ thuật số
Trọng tâm của công việc lưu trữ là tính xác thực và tính toàn vẹn: sự đảm bảo rằng tài liệu thực sự đến từ nguồn được xác nhận và nội dung của nó không bị thay đổi. Tại thời điểm này, AI tạo ra mối đe dọa theo hai hướng. Đầu tiên, trong quá trình chỉnh sửa hoặc “nâng cao” OCR/HTR, AI có thể âm thầm sửa đổi văn bản; có thể thêm một từ không tồn tại dưới tên "sửa". Thứ hai, nếu việc "sửa chữa" hoặc "khôi phục" hình ảnh được thực hiện bằng AI, các chi tiết không còn nguyên bản có thể được tạo ra.
Quy tắc của nhà lưu trữ rất rõ ràng: bản sao bảo quản kỹ thuật số phải trung thành với bản gốc. Mọi cải tiến được thực hiện bằng AI phải được ghi lại và bản quét thực tế (thô) phải luôn được giữ nguyên. Việc “làm đẹp” một tài liệu có thể phá hủy giá trị chứng cứ lịch sử của nó.
Thận trọng: Việc "cải thiện" một bức ảnh hoặc tài liệu cũ bằng AI có thể rất hấp dẫn; nhưng AI sẽ lấp đầy những phần còn thiếu bằng cách bù đắp chúng. Trong tài liệu lưu trữ, điều này có nghĩa là tạo ra bằng chứng lịch sử sai lệch. Đầu ra khôi phục không bao giờ thay thế nguồn ban đầu; được lưu trữ dưới dạng một biến thể riêng biệt, được dán nhãn rõ ràng.
ba trường hợp nhỏ
Trường hợp 1 - Kho lưu trữ báo chí có thể tìm kiếm được. Một thư viện đã số hóa bộ sưu tập báo địa phương 30 năm tuổi của mình. Với OCR, 90.000 trang đã được sao chép và có thể tìm kiếm được; Việc tìm kiếm chủ đề trước đây mất nhiều ngày giờ đã giảm xuống còn vài giây. Tuy nhiên, nhóm nghiên cứu nhận thấy độ chính xác OCR giảm xuống 80% trên các trang cũ và ố màu và ưu tiên hiệu chỉnh những năm trên cùng bằng mắt người.
Trường hợp 2 - HTR mở bản thảo. Một kho lưu trữ đã áp dụng HTR cho một bộ sưu tập các chữ cái khó đọc của thế kỷ 19. Hệ thống đạt tốc độ vượt trội sau nhiều tháng đọc của các chuyên gia; Nhưng mỗi trang bản in đều được một chuyên gia cổ cổ học (chuyên gia về chữ viết cổ) so sánh với bản gốc vì có sai sót về tên người và địa điểm.
Trường hợp 3 - Việc “khôi phục” giả bị từ chối. Một nhóm đã cân nhắc việc "sửa chữa" một bức ảnh lịch sử bị rách bằng AI. AI đã hoàn thiện các bộ phận còn thiếu trên khuôn mặt bằng cách lắp chúng vào. Nhà lưu trữ nhận ra rằng những chi tiết bịa đặt này sẽ làm sai lệch bằng chứng lịch sử; Hình ảnh đã sửa chữa được lưu trữ riêng biệt cùng với hình ảnh gốc, chỉ được dán nhãn rõ ràng là "dẫn xuất AI".
Truy cập bản sao, bản bảo quản và quyết định định dạng
Một cách thực hành tốt trong số hóa là tách các bản sao của cùng một đối tượng cho các mục đích khác nhau. Bản gốc bảo quản là đối tượng kỹ thuật số thực tế sẽ được đưa vào tương lai, được lưu trữ ở độ phân giải cao nhất, định dạng không nén hoặc không mất dữ liệu; nó hiếm khi được chạm vào. Bản sao truy cập là một biến thể nhỏ hơn, dễ mở hơn được trình bày cho người dùng. Sự khác biệt này rất quan trọng vì định dạng thực tế để sử dụng (nhỏ, nén) có thể không phù hợp để bảo quản lâu dài; Định dạng lý tưởng để bảo quản (lớn, không mất dữ liệu) sẽ cồng kềnh khi sử dụng hàng ngày. Trong quy trình làm việc này, AI có thể giúp kiểm kê tệp, phát hiện các biến thể bị thiếu và giữ siêu dữ liệu nhất quán giữa hai bản sao. Tuy nhiên, việc lựa chọn định dạng là một quyết định bảo toàn: nên ưu tiên các định dạng mở, được ghi chép rộng rãi và lâu bền (thay vì các định dạng đóng, độc quyền) và phải chuẩn bị sẵn kế hoạch di chuyển trong trường hợp các định dạng này trở nên lỗi thời theo thời gian. Ngay cả khi AI đề xuất một định dạng, chính sách bảo tồn lâu dài của tổ chức sẽ có tiếng nói cuối cùng.
Mẹo: Đối với mỗi đối tượng kỹ thuật số, hãy lưu giữ một bản ghi ngắn gọn để trả lời các câu hỏi "nguồn gốc ở đâu, bản sao lưu ở định dạng nào, bản sao truy cập ở định dạng nào và bản nào được cung cấp cho người dùng?" Việc trộn ba lớp này sẽ làm cho không rõ tệp nào là tệp chính đáng tin cậy trong tương lai.
Bốn mẫu có thể sao chép
1) Trợ giúp hiệu chỉnh đầu ra OCR:
Dưới đây là văn bản OCR và mô tả của trang thực tế. Chỉ sửa lỗi openOCR (ký tự xấu, từ ghép/ngắt). Không thay đổi nội dung, thêm bớt từ ngữ. Nếu bạn không chắc chắn, hãy đánh dấu bằng "[?]". Văn bản OCR: [tại đây]
2) Kiểm tra tính nhất quán của văn bản và hình ảnh:
Có bất kỳ bổ sung nào trong văn bản đã sửa dưới đây mà dự kiến sẽ không có trong tài liệu gốc (có thể đã được bịa ra) không? Đánh dấu từng phần đáng ngờ và viết lý do tại sao nó đáng ngờ. Văn bản: [tại đây]
3) Dự thảo siêu dữ liệu bảo vệ:
Tạo phác thảo siêu dữ liệu bảo quản cho đối tượng số hóa sau: nguồn, xuất xứ, ngày/độ phân giải quét, định dạng tệp, lịch sử giao dịch. Chỉ cần sử dụng thông tin tôi cung cấp, để trống trường còn thiếu. Thông tin: [tại đây]
4) Trợ giúp về mức độ ưu tiên:
Dưới đây là danh sách các bộ sưu tập đang chờ số hóa; Hỗ trợ sắp xếp thứ tự ưu tiên dựa trên tính mong manh, nhu cầu và tính độc đáo. Đưa ra lời giải thích ngắn gọn cho từng tài nguyên; Hãy để tôi quyết định cuối cùng. Danh sách: [tại đây]
Dấu nhắc yếu / Dấu nhắc mạnh
Dấu nhắc yếu:
Chỉnh sửa và làm đẹp văn bản được quét này.
“Làm đẹp” mời AI thay đổi nội dung, bù đắp những thiếu sót; Tính nguyên gốc của tài liệu lưu trữ bị hư hỏng.
Lời nhắc mạnh mẽ:
Vai trò của bạn: trợ lý biên tập số hóa. Trong văn bản OCR sau, CHỈ sửa các lỗi nhận dạng rõ ràng (ký tự xấu, phân tách từ không chính xác). Không thêm, bớt, thay đổi bất kỳ từ nào. Để lại "[?]" ở nơi bạn không chắc chắn. Hiển thị mỗi chỉnh sửa bạn đã thực hiện trong một danh sách riêng. Văn bản: [tại đây]
Lời nhắc mạnh mẽ giới hạn AI chỉ nhận ra lỗi, cấm nó chạm vào nội dung và thực hiện các chỉnh sửa có thể theo dõi được.
Bảng quy trình làm việc và rủi ro
Sân khấu
Đóng góp của AI
Rủi ro chính
biện pháp bảo vệ
quét
—
chất lượng kém
độ phân giải cao
OCR/HTR
Chuyển đổi thành văn bản
Lỗi nhận dạng
sự điều chỉnh của con người
sự sửa chữa
Đề xuất lỗi
Thay đổi nội dung
So sánh với bản gốc
phục hồi
Đạo hàm hình ảnh
chi tiết phù hợp
Giữ nguyên bản gốc, dán nhãn
bảo vệ
Bản nháp siêu dữ liệu
mất nguồn gốc
Hồ sơ xuất xứ
Những lỗi thường gặp
- Chấp nhận đầu ra OCR mà không cần hiệu chỉnh. Lỗi làm gián đoạn việc tìm kiếm và truy cập.
- Gọi AI là “làm đẹp”. Nó thay đổi nội dung và phá hủy tính độc đáo.
- Thay thế việc khôi phục AI bằng bằng chứng thực tế. Chi tiết bịa đặt tạo ra lịch sử sai lệch.
- Không lưu trữ bản quét thô. Không có sự sửa chữa nào có thể được xác nhận nếu không có bản gốc.
- Bỏ sót thông tin xuất xứ. Độ tin cậy của tài liệu trở nên không thể theo dõi được.
Tóm lại
AI trong lưu trữ kỹ thuật số và số hóa; Đây là một công cụ hỗ trợ có giá trị giúp tăng tốc độ sao chép OCR/HTR, soạn thảo và ưu tiên siêu dữ liệu. Nhưng bản chất của công việc lưu trữ là tính xác thực và toàn vẹn: đầu ra OCR phải được sửa chữa bằng mắt người, AI không bao giờ được âm thầm thay thế nội dung, các dẫn xuất phục hồi không được thay thế bằng chứng gốc và thông tin quét thô và xuất xứ phải luôn được bảo tồn. Sử dụng AI như một công cụ không "cải thiện" tài liệu mà giúp nó có thể truy cập được trong khi vẫn giữ nguyên bản chất của nó.
Nhiệm vụ ứng dụng
Nhận một mẫu đầu ra OCR ngắn (do chính bạn sản xuất hoặc từ bản quét thực tế). Chỉ sửa các lỗi nhận dạng bằng mẫu "Trợ giúp sửa đầu ra OCR", sau đó kiểm tra xem AI đã thêm nội dung bằng mẫu "Kiểm tra tính nhất quán của hình ảnh văn bản" hay chưa. Sau đó, tạo bản ghi có thông tin về nguồn gốc và định dạng cho đối tượng bằng mẫu "Bản nháp siêu dữ liệu bảo tồn".
danh sách kiểm tra
- [ ] Tôi đã so sánh đầu ra OCR/HTR với hình ảnh thực tế và sửa nó.
- [ ] Tôi đã kiểm tra rằng AI không thêm/thay đổi nội dung.
- [ ] Tôi giữ bản quét thô (chính) riêng biệt và không thay đổi.
- [ ] Tôi đã thêm thông tin xuất xứ và định dạng vào siêu dữ liệu.
- [ ] Tôi đã dán nhãn rõ ràng các biến thể khôi phục là "dẫn xuất AI".