Lợi nhuận:
- Khả năng thiết lập quy trình chuyển ngữ và HTR cũng như giải thích lý do tại sao bản nháp thô yêu cầu chuyên gia kiểm tra từng dòng một
- Khả năng bảo vệ các khu vực không thể đọc được bằng cách yêu cầu các lựa chọn thay thế thay vì áp đặt cách đọc chính xác trong trường hợp mơ hồ về nguyên âm/chữ cái trong tiếng Thổ Nhĩ Kỳ Ottoman
- Khả năng tách phiên âm gốc khỏi một lớp đơn giản hóa riêng biệt, giữ trách nhiệm khoa học cuối cùng với nhà cổ điển học
Có lẽ phần đòi hỏi khắt khe nhất của nghiên cứu lịch sử là chép lại các bản thảo và tài liệu viết cũ thành văn bản có thể đọc được. Một lá thư, một cuốn sổ tay, một hồ sơ tòa án hoặc một tài liệu Ottoman chỉ có thể tìm kiếm được sau khi nó đã được chép lại. Phiên âm là hành động chuyển nội dung của một tài liệu (thường là chữ viết tay hoặc chữ cổ) thành văn bản viết, có thể đọc được. Trong trường hợp của Ottoman, điều này thường đi kèm với phiên âm: chuyển văn bản bằng các chữ cái Ả Rập sang bảng chữ cái Latinh với các ký tự tương đương từng chữ cái.
Chúng tôi đã sử dụng OCR cho văn bản in; Chữ viết tay yêu cầu một công nghệ khác: HTR (Nhận dạng văn bản viết tay). HTR là một công nghệ tương tự như OCR nhưng khó khăn hơn nhiều khi chuyển đổi tài liệu viết tay thành văn bản máy. Trong phần này, chúng ta sẽ xem cách sử dụng HTR và AI trong phiên âm tiếng Ottoman và bản thảo, tỷ lệ sai sót và lý do tại sao việc xác minh ở đây thậm chí còn quan trọng hơn.
Tại sao viết tay lại khó đến thế?
Chữ viết tay có nhiều biến đổi hơn so với văn bản in: mỗi người viết có một bàn tay riêng, các chữ cái được liên kết với nhau, sử dụng chữ viết tắt và ký hiệu đặc biệt, chảy mực, giấy bị mòn. Trong tiếng Thổ Nhĩ Kỳ Ottoman, độ khó được nhân lên gấp bội:
- Các dạng chữ cái theo ngữ cảnh: Cùng một chữ cái được viết khác nhau ở đầu, giữa và cuối của từ.
- Không viết nguyên âm: Nguyên âm ngắn thường không được viết; người đọc hoàn thành từ ngữ cảnh. Điều này tạo ra sự mơ hồ như "chấp nhận hay từ chối?"
- Các kiểu viết khác nhau: Có nhiều kiểu viết khác nhau như rik'a, divani, ta'lik; Mỗi người đòi hỏi một chuyên môn đọc khác nhau.
- Từ vựng tiếng Ottoman: Các từ từ tiếng Ả Rập và tiếng Ba Tư không tồn tại trong tiếng Thổ Nhĩ Kỳ ngày nay.
Do đó, HTR và AI hoạt động với tỷ lệ sai sót trong tiếng Thổ Nhĩ Kỳ Ottoman cao hơn nhiều so với OCR in. Con mắt của một nhà cổ điển học lão luyện (paleography - khoa học đọc các tác phẩm cổ) ở đây không phải là một công cụ mà là một điều cần thiết.
Quy trình làm việc: từng bước
1. Chuẩn bị chất lượng hồ sơ. Cũng như OCR, độ phân giải cao và độ tương phản tốt là điều cần thiết. Điều này thậm chí còn quan trọng hơn trong chữ viết tay.
2. Chọn mẫu HTR. Các mô hình viết tay kiểu Ottoman, tiếng Ả Rập hoặc HTR được đào tạo đặc biệt cho một thời kỳ cụ thể sẽ thành công hơn nhiều so với các mô hình chung. Kiểm tra xem mô hình nào hoạt động tốt trong một khoảng thời gian và phong cách viết.
3. Tạo bản ghi thô. Mô hình HTR tạo ra một phác thảo. Trong tiếng Thổ Nhĩ Kỳ Ottoman, bản thảo này là một khởi đầu đầy sai sót mà một con mắt có kinh nghiệm phải kiểm tra kỹ lưỡng.
4. Cải thiện bối cảnh với AI. Bạn có thể thấy cờ AI không nhất quán, các lựa chọn thay thế đọc có thể có và các vị trí đáng ngờ trong đầu ra thô. Nhưng việc “chỉnh sửa” AI đặc biệt rủi ro ở đây: nó có thể gợi ý một cách đọc giả tạo.
5. Chuyển ngữ và đơn giản hóa (phân lớp). Việc chuyển ngữ văn bản bằng các chữ cái Ả Rập sang các chữ cái Latinh, sau đó là cách đọc đơn giản sang tiếng Thổ Nhĩ Kỳ ngày nay, được tạo thành các lớp riêng biệt. Bản gốc không bao giờ bị hỏng.
6. Xác minh của chuyên gia. Bản ghi âm cuối cùng được phê duyệt bởi một chuyên gia có kiến thức về cổ điển và thời kỳ bằng cách so sánh nó với tài liệu.
Lưu ý: Trong tiếng Thổ Nhĩ Kỳ Ottoman, khi "đoán" một từ có nguyên âm không viết từ ngữ cảnh, AI có thể tạo ra cách đọc sai hoàn toàn và trình bày nó bằng một ngôn ngữ tự tin. Sự khác biệt về các chữ cái, chẳng hạn như "kabul" thay vì "kabil" hoặc "alem" thay vì "alim", sẽ thay đổi hoàn toàn ý nghĩa. Mỗi cách đọc không chắc chắn nên được trình bày với các lựa chọn thay thế và không nên áp đặt cách đọc dứt khoát duy nhất.
Các lớp và trách nhiệm với một bảng
lớp
Nội dung
Vai trò của AI
Vai trò của chuyên gia
Hình ảnh
tài liệu gốc
—
Nguồn
dự thảo HTR
Đọc máy thô
sản xuất
Kiểm soát từ đầu đến cuối
phiên âm
Chuyển đổi chữ cái Latinh
dự thảo gợi ý
Sửa, sửa
Ghi chú về sự không chắc chắn
[?] và các lựa chọn thay thế
dấu hiệu
quyết định
Đơn giản hóa
Tiếng Thổ Nhĩ Kỳ ngày nay
dự thảo gợi ý
Phê duyệt
công bố khoa học
Văn bản cuối cùng + ghi chú
—
Chỉ chuyên gia
ba trường hợp nhỏ
Trường hợp 1 - HTR tăng tốc bản nháp đầu tiên lên gấp 5 lần. Một nghiên cứu sinh tiến sĩ sẽ chép lại một cuốn sổ tay Ottoman 200 trang. Phiên âm thủ công đầy đủ được ước tính là 60 ngày làm việc. Với mô hình HTR được đào tạo trong thời kỳ đó, bản phác thảo thô sẽ xuất hiện sau vài giờ; Sinh viên đã sửa lại bản thảo này và giảm thời gian làm việc xuống còn 12 ngày làm việc. Nhưng anh phải so sánh từng trang với tài liệu, từng dòng một; Khoảng 30% bản dự thảo là sai.
Trường hợp 2 - Một chữ cái, một ý nghĩa. Một nhà nghiên cứu đã dựa vào từ mà AI đọc là "thống đốc". Dưới sự kiểm soát của chuyên gia, người ta hiểu rằng từ này thực chất là "người giám hộ" (có trách nhiệm đối với một đứa trẻ/người) và do nguyên âm không được đánh dấu nên AI đã đoán sai. Ý nghĩa pháp lý của tài liệu đã thay đổi hoàn toàn. Bài học: Trong tiếng Thổ Nhĩ Kỳ Ottoman, một sự khác biệt duy nhất giữa một chữ cái/nguyên âm khiến tài liệu phải được giải thích ngay từ đầu; cần có chuyên gia.
Trường hợp 3 - Hoàn thành giả định. Trong một dòng đã hết mực và có một từ không đọc được, AI sẽ lấp đầy khoảng trống bằng một từ “hợp lý”. Chuyên gia nhận ra rằng khoảng trống đó thực chất là một địa danh và AI đã bịa ra. Chỗ trống còn lại là [không thể đọc được]. Bài học: chỗ trống không đọc được không được lấp đầy, nó được đánh dấu.
Bốn mẫu có thể sao chép
1) Phiên âm duy trì sự mơ hồ:
Dưới đây là đầu ra/phiên âm thô HTR của một tài liệu Ottoman. Nhiệm vụ của bạn là xem lại văn bản và đánh dấu các lỗi đọc có thể xảy ra. Quy tắc: (1) Đưa ra 2-3 phương án đọc có thể áp dụng cho mỗi từ mà bạn không chắc chắn, đừng áp đặt một từ. (2) Để [không đọc được] ở những chỗ khó đọc, không điền vào. (3) THÊM những từ không tồn tại trong văn bản. (4) Chỉ ra các từ thay thế bằng những từ có nguyên âm mơ hồ. Văn bản: [tại đây]
2) Đọc theo lớp (bản gốc + đơn giản hóa):
Tạo HAI cột cho phiên âm tiếng Ottoman đã được xác minh sau: (1) Phiên âm gốc (chạm), (2) Đọc đơn giản sang tiếng Thổ Nhĩ Kỳ ngày nay. THÊM ý nghĩa, thêm cách hiểu theo cách đơn giản hóa; chỉ cần cập nhật ngôn ngữ. Đánh dấu những địa điểm có ý nghĩa mơ hồ[không rõ ràng]. Phiên âm: [tại đây]
3) Khai thác thời hạn và người:
Tên riêng, địa danh, chức danh và các thuật ngữ định kỳ được đề cập trong phần phiên âm bên dưới xuất hiện trong các danh sách riêng biệt. Chỉ lấy những thứ được đề cập RÕ RÀNG trong văn bản; Đừng thêm bằng cách đoán. Đánh dấu [?] nếu bạn không chắc về cách phát âm. Văn bản: [tại đây]
4) Kiểm soát đọc đáng ngờ:
Một người kiểm soát cổ điển có kinh nghiệm đảm nhận vai trò này. Trong phần phiên âm dưới đây, hãy đánh dấu những từ không nhất quán về nghĩa, không khớp với dấu chấm hoặc không phù hợp với ngữ cảnh và viết lý do tại sao chúng đáng nghi ngờ. Áp dụng biện pháp chấn chỉnh dứt điểm; Tạo danh sách nghi ngờ mà chuyên gia con người sẽ so sánh với tài liệu. Văn bản: [tại đây]
Dấu nhắc yếu / Dấu nhắc mạnh
yếu:
Đọc văn bản Ottoman này và đưa cho tôi bản dịch của nó.
Điều này thúc đẩy AI tạo ra một cách đọc duy nhất, dứt khoát, che giấu những điểm mơ hồ và khớp vào những khoảng trống. Trong tiếng Thổ Nhĩ Kỳ Ottoman, đây gần như là một sai lầm chắc chắn.
Mạnh:
Kiểm tra phiên âm tiếng Ottoman dưới đây. Một cách đọc dứt khoát: Áp đặt. Đưa ra những lựa chọn thay thế khả thi cho từng từ mơ hồ, bỏ đi những phần [không đọc được], không thêm bất cứ thứ gì không có trong văn bản. Đưa cách đọc đơn giản cho tiếng Thổ Nhĩ Kỳ ngày nay vào một cột riêng, nhưng giữ nguyên bản gốc. Đánh dấu bất cứ điều gì bạn không chắc chắn bằng [?] để chuyên gia có thể so sánh với tài liệu. Văn bản: [tại đây]
Sự khác biệt: cấm đọc nghiêm ngặt, yêu cầu các lựa chọn thay thế, giữ nguyên khoảng trắng và đầu ra theo lớp cho phép xác minh của chuyên gia.
Những lỗi thường gặp
- Nhầm bản thảo HTR là đúng. Trong tiếng Thổ Nhĩ Kỳ Ottoman, phần lớn bản thảo thô có thể không chính xác; Kiểm soát từng dòng là phải.
- Cách đọc dứt khoát duy nhất là áp đặt. Nếu các từ thay thế bị ẩn trong những từ không viết nguyên âm thì sẽ ghi sai nghĩa.
- Điền vào khu vực không thể đọc được. Nó cần được bảo vệ bằng khoảng trắng [không đọc được], không bịa đặt.
- Trộn bản gốc với sự đơn giản hóa. Đơn giản hóa nên là một lớp riêng biệt; Phiên âm gốc không được bóp méo.
- Vô hiệu hóa chuyên gia. Nếu không có kiến thức về cổ điển học và thời kỳ, việc đọc của AI chỉ là phỏng đoán không có giá trị khoa học.
Tóm lại
Quá trình sao chép bản thảo và Ottoman có thể được tăng tốc đáng kể ở giai đoạn phác thảo thô với HTR và AI; Bạn nhận được kết quả đầu tiên giúp giảm số ngày làm việc xuống còn hàng giờ. Nhưng chính trong lĩnh vực này mà một chữ cái, một sự khác biệt nguyên âm sẽ thay đổi ý nghĩa; AI có xu hướng che giấu sự không chắc chắn và lấp đầy những khoảng trống. Phương pháp đúng được xếp theo từng lớp: phác thảo thô, các ghi chú thay thế về sự mơ hồ, một lớp đơn giản hóa riêng biệt và trên hết là xác minh từng dòng tài liệu bởi một chuyên gia quen thuộc với cổ điển. AI tăng tốc độ đọc ban đầu; Trách nhiệm khoa học thuộc về chuyên gia.
Nhiệm vụ ứng dụng
Nhận phiên âm của một tài liệu Ottoman hoặc bản thảo (sản phẩm của chính bạn hoặc bản sao đã xuất bản). Yêu cầu AI cung cấp cách đọc thay thế bằng mẫu “chuyển ngữ duy trì sự mơ hồ”. Sau đó tạo lớp đơn giản hóa riêng biệt bằng "đọc theo lớp". So sánh từng từ được đánh dấu mơ hồ với nguồn chuyên môn hoặc từ điển; Lưu ý rằng AI sẽ tạo ra bao nhiêu lỗi nếu áp dụng một lần đọc.
danh sách kiểm tra
- [ ] Tôi đã sử dụng HTR/mô hình phù hợp với thời kỳ và phong cách viết.
- [ ] Tôi đã yêu cầu AI đưa ra các lựa chọn thay thế cho việc đọc chính xác.
- [ ] Tôi đã bảo vệ những phần không thể đọc được bằng [unreadable].
- [ ] Tôi giữ nguyên bản phiên âm riêng biệt với bản đơn giản hóa.
- [ ] Tôi đã nhờ một chuyên gia/người làm phim tài liệu am hiểu về cổ điển học xác minh văn bản cuối cùng.