Lợi nhuận:
- Khả năng tách biệt và đánh dấu ký tự đã đọc và phần hoàn thành ước tính khi chuyển chữ khắc và bản thảo thành văn bản nháp bằng OCR/HTR
- Khả năng nhận biết các dạng ảo giác như hoàn thành văn bản bị mờ, dịch sai và ghi công bịa đặt, đồng thời kiểm tra bản dịch dựa trên nguồn và bản dịch ngược.
- Khả năng hiểu bối cảnh ngôn ngữ, chữ viết và thể loại quyết định độ tin cậy của trí tuệ nhân tạo như thế nào và việc đọc và giải thích cuối cùng thuộc về chuyên gia ngữ văn
Một trong những âm thanh trực tiếp nhất để lại cho chúng ta từ quá khứ là các nguồn viết: chữ khắc trên đá, bảng đất sét, giấy cói, bản thảo bằng giấy da, bia mộ và con dấu. Trong phần này, chúng ta sẽ tìm hiểu cách chữ khắc (khoa học nghiên cứu các chữ khắc trên bề mặt cứng như đá, kim loại, gốm sứ), cổ điển học (chuyên môn về đọc và xác định niên đại của chữ viết cổ) và AI tăng tốc việc đọc, dịch và chỉnh sửa các văn bản này, nhưng tại sao mọi cách đọc đều phải được xác nhận bởi một nhà ngữ văn chuyên nghiệp.
Nguyên tắc cơ bản: AI giúp đọc văn bản mờ, dịch ngôn ngữ và đề xuất những bổ sung có thể có; nhưng việc đọc cuối cùng của dòng chữ, việc hoàn thiện các chữ cái còn thiếu và ý nghĩa là quyết định của chuyên gia biết ngôn ngữ và thời kỳ. Chính trong lĩnh vực này, AI có nguy cơ bị ảo giác cao nhất, vì mô hình này rất dễ điền vào văn bản bị thiếu hoặc mờ bằng thứ gì đó “hợp lý” nhưng bịa đặt.
Các bước làm việc với nguồn văn bản
1. Tài liệu. Dòng chữ hoặc bản thảo được hiển thị ở định dạng có độ phân giải cao, tăng cường độ tương phản. Đối với các bề mặt bị che khuất, ánh sáng đặc biệt (ánh sáng bên) và các kỹ thuật như RTI được sử dụng; AI giúp làm sắc nét độ tương phản và cạnh chữ.
2. Nhận dạng ký tự. OCR (Nhận dạng ký tự quang học) được sử dụng cho văn bản in và HTR (Nhận dạng văn bản viết tay) được sử dụng cho chữ viết tay. HTR dựa trên AI có khả năng sao chép các bản thảo cũ một cách hiệu quả.
3. Phiên âm và hoàn thiện. Đối với những phần bị mờ hoặc bị hỏng, chuyên gia gợi ý khả năng phục hồi dựa trên ngữ pháp và văn bản song song. Các chữ cái đã hoàn thành luôn được biểu thị bằng các dấu như dấu ngoặc vuông; Những gì được đọc và những gì được dự đoán không bao giờ bị nhầm lẫn.
4. Dịch thuật. Văn bản được dịch từ ngôn ngữ nguồn (tiếng Latin, tiếng Hy Lạp cổ, tiếng Ottoman, ngôn ngữ hình nêm, v.v.). AI đưa ra bản dịch nháp đầu tiên; sắc thái chuyên môn điều chỉnh thuật ngữ và bối cảnh lịch sử.
5. Bình luận. Văn bản nói gì, ai viết và đề cập đến sự kiện gì đều là những diễn giải lịch sử và thuộc về chuyên gia.
Mẹo: Nếu bạn yêu cầu AI "đọc và hoàn thành" văn bản khó hiểu, nó sẽ lấp đầy các khoảng trống một cách an toàn. Thay vào đó, hãy nói "chỉ cung cấp những ký tự dễ đọc, để trống và đánh dấu những chỗ bạn không chắc chắn". Yêu cầu hoàn thành trong một bước riêng biệt, kèm theo lý do chính đáng và đảm bảo được chuyên gia xác nhận.
Ảo giác: mối nguy hiểm lớn nhất của khu vực này
Sai lầm nghiêm trọng nhất của AI trong nhân văn là sự chế tạo. Có 4 hình thức điển hình trong lĩnh vực này:
- Chế tạo văn bản: “Hoàn thành” phần không tồn tại của dòng chữ mờ nhạt, thêm một từ không tồn tại.
- Dịch giả: Dịch một từ mình không hiểu trôi chảy nhưng không chính xác; Người đọc không thể nhận ra vì không biết nguồn.
- Tài liệu tham khảo bịa đặt: Nó nói "Dòng chữ này đã được xuất bản trong ấn phẩm đó", nhưng ấn phẩm đó không tồn tại.
- Ghi sai/ghi sai: Tự tin đặt phong cách viết sai thời kỳ.
Tất cả những điều này không bao giờ có thể được sử dụng nếu không có sự xác nhận của một chuyên gia nhìn thấy nguồn và biết ngôn ngữ.
Lưu ý: Chỉ vì bản dịch trôi chảy và thuyết phục không có nghĩa là nó đúng. AI thậm chí có thể biến một dấu hiệu hình nêm mà nó không hiểu thành một câu đầy tự tin. Một người không thể đọc được văn bản nguồn sẽ không bao giờ có thể tự mình xác minh tính chính xác của bản dịch AI.
ba trường hợp nhỏ
Trường hợp 1 - HTR đã mở kho lưu trữ. Một kho lưu trữ đã giữ kín hàng nghìn trang bản thảo của Ottoman đối với các nhà nghiên cứu vì việc đọc chúng đòi hỏi phải có chuyên môn và thời gian. HTR dựa trên AI chuyển đổi sổ ghi chép thành văn bản nháp có thể tìm kiếm được; Các chuyên gia đã sửa lại bản nháp và những chỗ không đọc được đã được đánh dấu. Nó không phải là toàn văn nhưng đã xuất hiện một công cụ quét mạnh mẽ.
Trường hợp 2 - Hoàn thành bịa đặt bị bắt. Một học sinh được AI đọc một tấm bia mộ bằng tiếng Latinh bị vỡ; AI “hoàn thiện” dòng còn thiếu bằng một câu trôi chảy. Người viết kịch bản cho thấy rằng việc hoàn thành được đề xuất là không thể thực hiện được vì không còn chỗ trống trong đá. Việc hoàn thành đã được xây dựng lại và đánh dấu dựa trên các dòng chữ song song.
Trường hợp 3 - Đã sửa bản dịch giả. Một nhóm sẽ báo cáo bản dịch của AI về một dòng chữ Hy Lạp cổ đại; Khi nhà ngữ văn kiểm tra, ông phát hiện AI đã dịch sai một động từ, đảo ngược ý nghĩa của văn bản (dù đó là lễ vật hay tưởng niệm). Quay lại nguồn đã lưu bình luận.
Bốn mẫu có thể sao chép
1) Phiên âm bảo thủ:
Vai trò của bạn: trợ lý phiên âm. Trong hình ảnh dòng chữ/bản thảo này, CHỈ cung cấp các ký tự rõ ràng có thể đọc được. Không đọc những phần không rõ ràng, bị hỏng hoặc không chắc chắn; Đánh dấu nó là "[không thể đọc được]". HOÀN THÀNH CÁC PHẦN THIẾU. Cũng lưu ý các ký tự bạn nghi ngờ.
2) Đề xuất hoàn thành hợp lý:
Dưới đây là văn bản có phần đọc chính xác và [dấu cách]. Đề xuất CÓ THỂ bổ sung cho các khoảng trống, nhưng đối với mỗi đề xuất: (a) giải thích (ngữ pháp, văn bản song song), (b) khoảng trống có phù hợp với số lượng chữ cái hay không, (c) các lựa chọn thay thế. Đây là những gợi ý; Không phải là một bài đọc dứt khoát. Nêu rõ rằng cần phải có sự chấp thuận của chuyên gia.
3) Bản dịch nháp (được bảo vệ nguồn):
Dịch văn bản [ngôn ngữ] bên dưới. Giữ văn bản nguồn bên cạnh mỗi câu (căn chỉnh từng dòng). Đánh dấu những từ bạn không chắc chắn và đưa ra cách dịch khác. KHÔNG tạo nên các điều khoản; Nếu bạn không biết, hãy viết "không chắc chắn". Đây là bản nháp; Các chuyên gia ngữ văn sẽ kiểm tra.
4) Xác minh bản dịch (dịch ngược):
Dịch bản dịch này TRỞ LẠI sang ngôn ngữ nguồn và so sánh nó với văn bản nguồn gốc. Đánh dấu những phần ý nghĩa được thay đổi, thêm vào hoặc bỏ bớt. Đặc biệt kiểm tra thì, chủ đề và số lượng.
Dấu nhắc yếu / Dấu nhắc mạnh
Dấu nhắc yếu:
Hãy đọc dòng chữ cổ này và cho chúng tôi biết nó nói gì.
Trong một dòng chữ mờ nhạt, AI sẽ tạo ra những khoảng trống, có thể dịch sai ngôn ngữ, người không xem nguồn sẽ không nhận ra điều này.
Lời nhắc mạnh mẽ:
Trong hình ảnh dòng chữ này, trước tiên CHỈ phiên âm những ký tự có thể đọc được rõ ràng, để lại những phần bị che khuất "[không thể đọc được]". Sau đó RIÊNG, đề xuất những phần bổ sung có thể có cho những khoảng trống có căn cứ nhưng không đưa ra bất kỳ lời giải thích rõ ràng nào. Cuối cùng, cung cấp bản dịch nháp và đánh dấu những từ bạn không chắc chắn. Tất cả đều phải được sự chấp thuận của chuyên gia.
Sự khác biệt: cái đầu tiên đưa ra một "cách đọc" hư cấu; cái sau giữ cho các lớp đọc, dự đoán và dịch tách biệt và có thể kiểm chứng được.
Ngôn ngữ, chữ viết và biên giới tri thức của AI
Các văn bản khảo cổ trải rộng trên nhiều loại ngôn ngữ và chữ viết: chữ khắc tiếng Latinh và tiếng Hy Lạp cổ đại, bản thảo Ottoman và tiếng Ả Rập, bảng chữ nêm, chữ tượng hình Ai Cập, chữ khắc runic, v.v. Trình độ AI trên các ngôn ngữ và tập lệnh này rất không đồng đều. Mặc dù bản dịch nháp có thể hợp lý đối với các ngôn ngữ có nhiều văn bản kỹ thuật số, chẳng hạn như tiếng Latinh và tiếng Hy Lạp cổ, đối với các văn bản ít được ghi chép, giải mã hoặc đọc bởi một số ít chuyên gia, nhưng AI gần như hoàn toàn không đáng tin cậy; tạo ra những "bản dịch" thuyết phục nhưng hoàn toàn bịa đặt trong các lĩnh vực này.
Ngoài ra còn có vấn đề về bối cảnh và thể loại. Cùng một từ có thể có nhiều ý nghĩa khác nhau trong một văn bản pháp luật, một văn bản cầu nguyện và một tấm bia mộ. Nhà ngữ văn chuyên nghiệp nhận ra loại văn bản (sự sùng kính, tượng đài, khế ước, lá thư) và đọc từ đó trong ngữ cảnh chính xác; AI thiếu độ nhạy chung này và áp đặt ý nghĩa phổ biến nhất. Các chữ viết tắt, công thức và biểu thức gốc (đặc biệt rất phổ biến trong các dòng chữ) dễ dàng đánh lừa AI.
Vì vậy nguyên tắc vàng là: sử dụng AI làm công cụ tăng tốc cho những ngôn ngữ bạn biết, những ngôn ngữ bạn có thể kiểm soát; Đừng bao giờ chỉ dựa vào bản dịch AI bằng ngôn ngữ mà bạn không thể đọc được. Người không đọc được nguồn sẽ không thể xác minh tính chính xác của bản dịch và do đó không thể biến bản dịch đó thành một tuyên bố khoa học.
Mẹo: Khi đưa văn bản cho AI, hãy chỉ định ngôn ngữ, khoảng thời gian ước tính và loại (dòng chữ/thư/tài liệu). Kiến thức về bối cảnh làm giảm một phần sự thiên vị của AI đối với cách đọc phổ biến nhất nhưng không chính xác — nhưng không loại bỏ nhu cầu xác nhận.
Bảng nhiệm vụ tài nguyên bằng văn bản
Nhiệm vụ
Vai trò của AI
quyết định của con người
xác minh
nâng cao hình ảnh
Độ tương phản/cạnh
Tiêu chí lựa chọn
So sánh với bản gốc
OCR/HTR
văn bản dự thảo
ký tự không xác định
hiệu đính chuyên gia
hoàn thành
Khuyến nghị (lý do)
Chấp nhận/từ chối
Văn bản song song, kiểm soát vị trí
Dịch thuật
dự thảo
sắc thái, thuật ngữ
Bản dịch ngược, nguồn
Bình luận
Tóm tắt bối cảnh
ý nghĩa lịch sử
chuyên gia, văn học
Những lỗi thường gặp
- Hoàn thành văn bản mờ nhạt. AI phù hợp với những khoảng trống; Việc đọc và dự đoán nên được tách biệt và đánh dấu.
- Tin tưởng vào bản dịch mà không nhìn thấy nguồn. Dịch trôi chảy không phải là dịch chính xác.
- Chấp nhận thuộc tính tạo nên. Việc nói "Đang trên chương trình phát sóng đó" cần phải được xác nhận.
- Không kiểm tra vị trí thực tế của việc hoàn thành. Đề xuất phải phù hợp với không gian bị hỏng.
- Hãy để việc giải thích cho AI. Ý nghĩa lịch sử của văn bản là vấn đề của nhà ngữ văn chuyên nghiệp.
Tóm lại
AI trong văn khắc và văn bản cổ; Nó tăng tốc đáng kể việc cải thiện hình ảnh, bản nháp HTR/OCR, đề xuất hoàn thiện và bản dịch nháp, đồng thời mở các kho lưu trữ kín để nghiên cứu. Nhưng đây là lĩnh vực có nguy cơ ảo giác cao nhất: việc đọc được tách biệt khỏi dự đoán, phần bổ sung được đánh dấu, bản dịch được kiểm tra dựa trên nguồn và dịch ngược, còn việc đọc và diễn giải cuối cùng thuộc về chuyên gia ngữ văn.
Nhiệm vụ ứng dụng
Chọn một dòng chữ hoặc hình ảnh bản thảo (từ bộ sưu tập truy cập mở). Chỉ trích xuất các ký tự rõ ràng bằng mẫu "Phiên âm thận trọng", sau đó nhận đề xuất cho khoảng trắng bằng "Đề xuất hoàn thành hợp lý". Tạo bản dịch nháp và dịch ngược lại bằng mẫu "Xác minh bản dịch" và đánh dấu nơi ý nghĩa đã thay đổi. So sánh với bài đọc đã xuất bản nếu có thể.
danh sách kiểm tra
- [ ] Tôi đã đánh dấu riêng việc đọc ký tự và việc hoàn thành dự đoán.
- [ ] Tôi đã kiểm tra xem phần hoàn thiện có khớp với khu vực bị hỏng hay không.
- [ ] Tôi đã kiểm tra bản dịch với văn bản nguồn và bản dịch ngược.
- [ ] Tôi đã xác nhận các ấn phẩm/trích dẫn do YZ đưa ra trong danh mục thực tế.
- [ ] Tôi để phần đọc và diễn giải cuối cùng cho chuyên gia phê duyệt.