Lợi nhuận:
- Khả năng phân biệt giữa lớp QA tự động và lớp LQA ngôn ngữ và áp dụng cả hai theo đúng thứ tự
- Khả năng đánh giá khách quan bản dịch theo thể loại và trọng lượng (nghiêm trọng/chính/nhỏ) với khung lỗi như MQM
- Có thể đưa ra quyết định cuối cùng khi sử dụng AI làm kiểm toán viên, biết rằng nó mù quáng trước bản dịch của chính mình, nguy cơ mắc lỗi và giới hạn của các số liệu tự động
Thời điểm bạn nói bản dịch đã "hoàn thành", đó là một nửa công việc; Nửa còn lại là để chứng minh rằng bản dịch đó thực sự đáng tin cậy. Trong phần này, bạn sẽ tìm hiểu các cách có hệ thống để đo lường chất lượng bản dịch: kiểm tra QA tự động, khung lỗi LQA dựa trên con người, số liệu chất lượng và cách sử dụng AI làm “người kiểm tra” - và các giới hạn của nó. Mục đích là thoát khỏi tính chủ quan “Tôi nghĩ nó tốt” và trở thành một chuyên gia xác định, đo lường và chứng minh chất lượng.
Hai loại kiểm soát chất lượng: tự động và ngôn ngữ
QA (Đảm bảo chất lượng) hoạt động theo hai lớp trong dịch thuật:
QA tự động: Các lỗi về văn phong mà các công cụ và tập lệnh CAT phát hiện - số không khớp, thiếu/thừa khoảng trắng, thuật ngữ không nhất quán, phân đoạn chưa được dịch, phần giữ chỗ/thẻ sai, dấu cách kép, dấu câu. Chúng được quét nhanh chóng và hoàn toàn bằng máy; Nó thoát khỏi tầm mắt của con người, nhưng chiếc xe đã bắt được nó.
LQA (Đảm bảo chất lượng ngôn ngữ): Đây là lớp mà người đánh giá con người kiểm tra ý nghĩa, thuật ngữ, văn phong, ngữ pháp và sự phù hợp của địa phương. QA tự động "số có khớp không?" nhìn vào câu hỏi; LQA “ý nghĩa có đúng không, giọng điệu có phù hợp không, có phù hợp về mặt văn hóa không?” Anh ấy nhìn vào câu hỏi. Cả hai bổ sung cho nhau; Cái này không thay thế cái kia.
Mẹo: Luôn chạy Auto QA trước; Việc loại bỏ các lỗi hình thức cho phép người đánh giá dành sự chú ý cho các vấn đề ngôn ngữ thực sự. Người phê bình bận tâm đến lỗi số sẽ bỏ sót lỗi âm.
Khung lỗi: MQM và DQF
Các loại lỗi tiêu chuẩn được sử dụng để làm cho chất lượng có thể đo lường được thay vì “tốt/xấu”. Phổ biến nhất là MQM (Đo lường chất lượng đa chiều): nó gán từng lỗi cho một danh mục (độ chính xác, tính lưu loát, thuật ngữ, phong cách, vị trí, định dạng) và trọng số (quan trọng, chính, phụ). Một khung khác là DQF (Khung chất lượng động) và được đề cập cùng với MQM.
Tại sao nó quan trọng? Bởi vì với khung này, bạn có thể đưa ra điểm lỗi cho bản dịch, so sánh khách quan các trình dịch/công cụ khác nhau và hỏi "văn bản này có thể được gửi được không?" Bạn trả lời câu hỏi bằng một ngưỡng số. Ví dụ: lỗi nghiêm trọng = 10 điểm, lỗi nặng = 5, lỗi nhỏ = 1; văn bản dưới một ngưỡng nhất định sẽ vượt qua mỗi từ nhất định.
Lỗi nghiêm trọng: lỗi đảo ngược ý nghĩa, tạo ra rủi ro về an ninh/pháp lý, gây tổn hại đến thương hiệu (sai liều lượng, “không chịu trách nhiệm” thay vì “có trách nhiệm”). Thiếu tá: quậy phá nhưng vô hại. Nhỏ: đáng chú ý nhưng không làm giảm ý nghĩa (kiểu dáng/dấu câu nhỏ).
Sử dụng AI làm bộ điều khiển - và những giới hạn của nó
AI rất nhanh chóng và hữu ích trong việc kiểm tra bản dịch theo khung lỗi: bạn có thể nói “đánh dấu tính chính xác, thuật ngữ, lỗi trôi chảy trong bản dịch này bằng các danh mục MQM”. Nó làm giảm điểm mù của bạn và mang lại cho bạn "con mắt thứ hai" nhanh chóng.
Nhưng có ba giới hạn quan trọng: (1) AI có thể bị mù khi kiểm tra bản dịch mà nó tạo ra - vừa mắc phải vừa xác nhận cùng một lỗi; kiểm tra chéo với một mô hình khác hoặc quay lại nguồn. (2) AI cũng có thể tạo ra những “lỗi” ảo giác - báo cáo một lỗi không tồn tại; Xác nhận từng cảnh báo. (3) AI có thể không nắm bắt đầy đủ mức độ nghiêm trọng trong thế giới thực của một lỗi nghiêm trọng (sai sót về liều lượng có thể gây tử vong); Chuyên gia thực hiện việc cân đo. Vì vậy, AI tăng tốc độ QA, nhưng quyết định chất lượng cuối cùng và phê duyệt giao hàng thuộc về con người.
Thận trọng: Nói "AI đã vượt qua QA, nó sạch sẽ" là một cảm giác tự tin sai lầm. Kiểm toán AI không phải là sự thay thế cho LQA của con người và so sánh với nguồn; đó là lớp sàng lọc trước giúp họ tăng tốc.
ba trường hợp nhỏ
Trường hợp 1 - QA tự động tìm thấy 40 lỗi số. Trong bản dịch báo cáo tài chính, QA tự động đã phát hiện 40 số/định dạng không khớp giữa nguồn và đích (dấu phân cách hàng nghìn, số thập phân, tiền tệ). Mắt người sẽ bỏ sót hầu hết những thứ này; xe được liệt kê trong vài giây.
Trường hợp 2 - Điểm MQM dẫn đến lựa chọn động cơ. Một văn phòng MQM đã xếp hạng đầu ra của hai động cơ MT khác nhau ở mức 2.000 từ: Động cơ A có 12 điểm lỗi, Động cơ B là 31. Phép đo khách quan đã giải quyết cuộc tranh luận "cái nào tốt hơn" bằng điểm số; Cục đã lấy Động cơ A làm tiêu chuẩn và lập kế hoạch ngân sách sau sửa đổi cho phù hợp.
Trường hợp 3 - Kiểm toán AI đã bỏ sót sai lầm của chính mình. Một dịch giả có bản dịch LLM được giám sát bởi cùng một LLM; Người mẫu nói "không vấn đề gì", một lỗi thuật ngữ mà cô ấy tự mắc phải. Lỗi được phát hiện khi người dịch kiểm tra chéo với một mô hình và nguồn khác; Nhóm đã áp dụng quy tắc "cùng một mô hình không nên tự kiểm soát".
Bốn mẫu có thể sao chép
1) Kiểm tra lỗi dựa trên MQM:
Vai trò của bạn: Người đánh giá LQA. So sánh nguồn và bản dịch bên dưới. Cung cấp từng lỗi bạn tìm thấy theo định dạng sau: [danh mục: độ chính xác/thuật ngữ/lưu loát/kiểu/định dạng] [trọng lượng: nghiêm trọng/lớn/nhỏ] [vị trí] [nhận xét] [sửa]. Đánh dấu cảnh báo mà bạn không chắc chắn là "cần xác nhận"; lỗi chế tạo. Nguồn: [...] | Bản dịch: […]
2) Quét lỗi nghiêm trọng (rủi ro cao):
CHỈ tìm các lỗi nghiêm trọng trong bản dịch bên dưới: nghĩa đảo ngược, lỗi số/liều/ngày, mất phủ định, thay thế nghĩa vụ pháp lý, lỗi cảnh báo an toàn. Bỏ qua các vấn đề nhỏ về kiểu dáng. Trích dẫn nguồn cho mỗi phát hiện quan trọng. Nguồn: [...] | Bản dịch: […]
3) Kiểm soát bổ sung QA tự động:
Liệt kê sự không nhất quán chính thức trong các cặp nguồn-đích sau: số không khớp, phần giữ chỗ hoặc thẻ bị thiếu/thêm, thuật ngữ không nhất quán, phân đoạn chưa được dịch, chênh lệch đơn vị/tiền tệ. Chỉ cần đưa ra các vấn đề với vị trí của họ. Các cặp: […]
4) Con mắt thứ hai độc lập (kiểm tra chéo):
Đánh giá bản dịch này KHÔNG CÓ ĐỊNH VỊ; Đừng cho rằng bạn đã viết nó. Cung cấp cho nguồn đánh giá chất lượng (1-5) về độ trung thực, thuật ngữ và tính tự nhiên, đồng thời liệt kê 3 vấn đề hàng đầu. Tùy tôi quyết định. Nguồn: [...] | Bản dịch: […]
Dấu nhắc yếu / Dấu nhắc mạnh
Yếu: "Bản dịch này có tốt không?" (Không có tiêu chí; AI trả về một câu trả lời vô ích như "nói chung là tốt.")
Mạnh: "Kiểm tra bản dịch này dựa trên nguồn. Dán nhãn cho từng lỗi với danh mục (độ chính xác/thuật ngữ/sự lưu loát) và mức độ nghiêm trọng (nghiêm trọng/chính/thứ yếu). Đặc biệt tập trung vào các lỗi về số, phủ định và thuật ngữ. Đừng bịa đặt lỗi; đánh dấu 'cần xác nhận' nếu bạn không chắc chắn."
Sự khác biệt: dấu nhắc mạnh đưa ra khung lỗi và tiêu điểm; Đầu ra là một báo cáo chất lượng có thể so sánh và có thể thực hiện được.
Bảng lớp chất lượng
lớp
cái gì bắt được
Ai/cái gì làm
Kiểm tra chất lượng tự động
Số lượng, nhãn, tính nhất quán
Công cụ/tập lệnh
điều khiển AI
Có thể có lỗi về ý nghĩa/thuật ngữ
LLM (có xác nhận)
LQA của con người
Ý nghĩa, giọng điệu, văn hóa, trọng lượng
chuyên gia đánh giá
Điểm MQM/DQF
Điểm lỗi khách quan
con người với khung
Xác nhận giao hàng
trách nhiệm cuối cùng
dịch giả có năng lực
Những lỗi thường gặp
- Bỏ qua QA tự động và chuyển thẳng sang đọc. Lỗi phong cách làm phân tán sự chú ý.
- Thay thế việc kiểm tra AI bằng LQA của con người. AI sàng lọc trước, không phê duyệt.
- Có cùng một mô hình kiểm tra bản dịch của chính nó. Điểm mù; cần phải kiểm tra chéo.
- Không có lỗi cân. Việc xem quan trọng và thứ yếu giống nhau sẽ làm gián đoạn mức độ ưu tiên.
- Sửa các “lỗi” do AI tạo ra mà không xác nhận chúng. Bạn có thể bóp méo câu đúng.
Số liệu tự động: BLEU, COMET và giới hạn
Ngoài ra còn có một thế giới các thước đo tự động trong đo lường chất lượng. BLEU (Nghiên cứu đánh giá song ngữ) so sánh bản dịch máy với bản dịch tham khảo của con người và cho điểm từ 0-100 dựa trên sự trùng lặp từ; Đó là tiêu chuẩn để so sánh các hệ thống MT trong một thời gian dài. Một số liệu mới hơn, COMET, dựa trên mạng thần kinh và nắm bắt được sự tương đồng về ngữ nghĩa tốt hơn BLEU. Các số liệu này có giá trị để so sánh nhanh chóng và tự động hai công cụ trên dữ liệu lớn.
Nhưng giới hạn của nó rất rõ ràng: Các số liệu như BLEU xem xét sự chồng chéo của các từ chứ không thực sự hiểu nghĩa. Bản dịch khác với tài liệu tham khảo nhưng chính xác có thể bị điểm thấp; Bản dịch giống với tài liệu tham khảo nhưng sai có thể nhận được điểm cao. Lỗi tiêu cực nghiêm trọng chỉ là một từ duy nhất nên nó ít ảnh hưởng đến chỉ số nhưng thực tế lại rất thảm khốc. Đó là lý do tại sao số liệu tự động đo lường xu hướng ở cấp hệ thống chứ không quyết định khả năng gửi của từng văn bản. Đánh giá của con người dựa trên MQM và đánh giá của chuyên gia quyết định liệu bản dịch có được gửi đến khách hàng hay không chứ không phải là điểm tự động. Sử dụng số liệu làm la bàn chứ không phải là thước đo.
Tóm lại
Chất lượng bản dịch không phải là cảm nhận chủ quan mà là thứ có thể đo lường được. QA tự động quét kỹ lưỡng các lỗi chính thức; LQA của con người đánh giá ý nghĩa, giọng điệu và văn hóa; Các khung lỗi như MQM định lượng chất lượng theo danh mục và trọng số, cho phép so sánh khách quan. AI là con mắt thứ hai mạnh mẽ giúp tăng tốc khả năng kiểm soát này, nhưng nó có thể mù quáng trước cách dịch của chính mình, mắc sai lầm và không hoàn toàn nắm bắt được sức nặng của thế giới thực; Vì vậy, quyết định cuối cùng về chất lượng, trọng lượng và phê duyệt giao hàng thuộc về người dịch có thẩm quyền.
Nhiệm vụ ứng dụng
Nhận kết quả dịch máy. Liệt kê các lỗi chính thức trước tiên bằng "kiểm tra bổ sung QA tự động", sau đó liệt kê các lỗi ngôn ngữ theo danh mục và trọng số bằng "kiểm tra lỗi dựa trên MQM". Tôi đánh giá từng lỗi (nghiêm trọng 10, lỗi chính 5, lỗi nhỏ 1) bằng ngưỡng cho mỗi từ và hỏi "lỗi đó có thể chuyển được không?" Trả lời câu hỏi. Cuối cùng, hãy xác nhận với nguồn xem có bao nhiêu lỗi được AI gắn cờ là có thật và bao nhiêu lỗi là bịa đặt.
danh sách kiểm tra
- [ ] Tôi đã chạy QA tự động và xóa mọi lỗi chính thức.
- [ ] Tôi đã đánh dấu các lỗi ngôn ngữ bằng một ô (danh mục + trọng số).
- [ ] Tôi đã quét các lỗi nghiêm trọng trong một vòng ưu tiên riêng biệt.
- [ ] Tôi đã tìm nguồn điều khiển AI và kiểm tra chéo nó bằng một mẫu khác nếu cần.
- [ ] Tôi đã đưa ra quyết định giao hàng dựa trên ngưỡng số và đánh giá chuyên môn của riêng tôi.