Lợi nhuận:
- Hiểu các khái niệm về bộ nhớ dịch (TM), các phân đoạn và kết quả khớp mờ cũng như có thể sử dụng những điểm khác biệt trong các kết quả khớp mờ bằng cách điều chỉnh chúng thay vì mù quáng.
- Khả năng áp dụng nguyên tắc chỉ viết các bản dịch đã được phê duyệt cho TM, tách biệt TM của khách hàng và thực hiện bảo trì TM
- Khả năng bảo vệ quyền riêng tư bằng cách kiểm soát dữ liệu đi đâu khi tích hợp MT/LLM trong CAT
Bản dịch chuyên nghiệp thường được thực hiện bằng công cụ CAT chứ không phải bằng trình soạn thảo văn bản thuần túy. Trong phần này, bạn sẽ tìm hiểu các công cụ CAT, bộ nhớ dịch thuật (TM) là trung tâm của dịch thuật, cách chúng hoạt động cùng với dịch máy và LLM cũng như cách sử dụng hệ sinh thái này một cách hiệu quả và an toàn. Mục tiêu là trở thành người dùng công nghệ dịch thuật quản lý toàn bộ dự án chứ không phải từng câu một cách nhất quán, nhanh chóng và có thể theo dõi.
Các khái niệm cơ bản
CAT tool (Computer-Assisted Translation) là phần mềm chuyên nghiệp (như Trados, memoQ, Phrase, MateCat) tổ chức việc dịch theo từng câu (đoạn) và kết nối bộ nhớ dịch và cơ sở thuật ngữ. Hiển thị nguồn và đích cạnh nhau, bắt lỗi lặp lại, giữ nguyên định dạng.
TM (Bộ nhớ dịch) là cơ sở dữ liệu lưu trữ các cặp câu nguồn-đích mà bạn đã dịch trước đó. Khi có câu mới, nếu trong TM có câu tương tự thì nhân viên sẽ gợi ý cho bạn. Khái niệm chính ở đây là kết hợp mờ: sự giống nhau của câu mới với một câu trong TM (100% = giống hệt nhau, 85% = tương tự phần lớn). Độ trùng khớp cao sẽ tăng tốc công việc vì bạn sử dụng lại bản dịch trước đó của mình.
Đoạn là đơn vị dịch cơ bản—thường là một câu. Công cụ CAT chia văn bản thành các đoạn và chỉnh sửa từng đoạn riêng biệt.
Tầm quan trọng của TM: MT tạo ra bản nháp thô, nhưng TM trả lại các bản dịch trước đây đạt chất lượng con người đã được phê duyệt của bạn. Hai cái này khác nhau: MT là dự đoán, TM là ký ức.
Mẹo: Đừng nhầm lẫn giữa TM và MT. Sự trùng khớp 100% TM (bản dịch đã được phê duyệt trước đó của bạn) nhìn chung là đáng tin cậy; Khuyến nghị MT phải luôn được xác minh. Công cụ CAT hiển thị cả hai với màu sắc/nhãn khác nhau; luôn thấy sự khác biệt này.
Tích hợp MT và LLM vào CAT
Các công cụ CAT hiện đại gọi các công cụ MT và ngày càng có nhiều LLM trong nội bộ: nếu không có kết quả trùng khớp trong TM, đại lý sẽ tự động trả về đề xuất MT cho phân khúc; bạn chỉnh sửa sau (tức là MTPE chảy trong CAT). Các công cụ thế hệ mới nhất cũng tích hợp LLM: bạn có thể thực hiện các thao tác như "viết lại đoạn này bằng giọng điệu này", "sửa thuật ngữ này thành cơ sở thuật ngữ", v.v. trong công cụ.
Ưu điểm của việc tích hợp này: TM, termbase, MT và LLM được kết hợp trong một màn hình; Đối với mỗi câu, quy trình "xem TM trước, nếu không thì đề xuất MT, thuật ngữ QA tự động" được thiết lập. Nhược điểm và thận trọng: dữ liệu đi đâu? Tích hợp MT/LLM dựa trên đám mây có thể gửi văn bản đến các máy chủ bên ngoài; Trong công việc bí mật, điều này có thể là vi phạm hợp đồng. Đảm bảo biết xe được kết nối với động cơ nào và với chính sách dữ liệu nào.
Cung cấp và xóa bộ nhớ dịch
Giá trị của TM phụ thuộc vào chất lượng của các bản dịch trong đó. Rác vào, rác ra. Hai môn học:
- Chỉ cần viết bản dịch có chứng thực vào TM. Nếu bạn lưu đầu ra MT thô vào TM mà không xác thực nó, nó sẽ trở lại các công việc trong tương lai của bạn dưới dạng "bộ nhớ" kém.
- Thực hiện bảo trì TM. Theo thời gian, các điều khoản thay đổi và xuất hiện lỗi. Định kỳ vệ sinh TM, sửa lại các cặp bị mòn/không đúng. Trong công việc này, tôi đang sử dụng LLM để hỏi "có bất kỳ sự không nhất quán/sai lệch thuật ngữ nào trong các cặp TM này không?" Bạn có thể sử dụng nó như một kiểm toán viên.
Thận trọng: Việc sử dụng TM của một khách hàng trong hoạt động kinh doanh của khách hàng khác vừa vi phạm tính bảo mật vừa có nguy cơ gây nhầm lẫn về thuật ngữ. TM được giữ riêng biệt trên cơ sở khách hàng/dự án. Một "mọi thứ TM" hỗn hợp sẽ phá hủy cả tính bảo mật và chất lượng.
ba trường hợp nhỏ
Trường hợp 1 - TM đã phát lại các bản phát lại. Một nhà sản xuất đang có một dòng sản phẩm được dịch trong đó 70% sách hướng dẫn sử dụng vẫn được giữ nguyên từ năm này sang năm khác. Nhờ có TM, các kết quả trùng khớp 100% và có độ mờ cao sẽ tự động xuất hiện trong mọi phiên bản mới; Chỉ có ~9.000 từ trong số 30.000 từ là bản dịch mới thực sự. Thời gian và chi phí đã giảm đi một phần ba.
Trường hợp 2 - Dirty TM đã truyền lỗi. Một nhóm đã lưu đầu ra MT thô vào TM mà không cần xác minh. Một năm sau, bản dịch sai tương tự vẫn lặp đi lặp lại, có vẻ “đáng tin cậy” như khớp 100%; Lỗi đã lan rộng trên 14 tài liệu khác nhau. Nhóm đã thiết lập quy tắc "chỉ dịch được chứng nhận sang TM" và một chuyến tham quan dọn dẹp.
Trường hợp 3 - Tính bảo mật bị rò rỉ trong quá trình tích hợp. Một dịch giả đã thực hiện công việc bí mật trong dự án CAT được tự động kết nối với đám mây MT; Văn bản được chuyển đến một công cụ bên ngoài có chính sách dữ liệu không rõ ràng. Sau khi được nhận thấy, tính năng tích hợp MT cho các dự án bí mật đã bị tắt và chỉ sử dụng các công cụ doanh nghiệp "không lưu trữ/huấn luyện dữ liệu".
Bốn mẫu có thể sao chép
1) Đánh giá kết quả khớp mờ (đến LLM):
Dưới đây là câu nguồn mới, câu tương tự trong TM và bản dịch đã được phê duyệt. Hãy cho tôi biết chính xác những gì tôi cần thay đổi để bản dịch TM phù hợp với câu mới; Đừng đề xuất những thay đổi không cần thiết. Thể hiện sự khác biệt về ý nghĩa một cách rõ ràng. Nguồn mới: [...] | Nguồn TM: [...] | Bản dịch TM: […]
2) Kiểm tra tính nhất quán của TM:
Dưới đây là các cặp nguồn-đích từ TM. Đánh dấu những điểm không nhất quán và sai lệch về thuật ngữ trong đó các câu nguồn giống nhau hoặc rất giống nhau được dịch KHÁC NHAU. Chỉ cần liệt kê các vấn đề. Các cặp đôi: […]
3) Viết lại giai điệu phân đoạn (LLM trong CAT):
Tạo đoạn mục tiêu sau đây [âm mong muốn] MÀ KHÔNG THAY ĐỔI ý nghĩa. Tuân thủ danh sách các điều khoản: […]. Giữ số và tên. Chỉ xuất phân đoạn được viết lại. Phân đoạn: […]
4) Kiểm tra trước quyền riêng tư/tích hợp:
Tôi sẽ sử dụng tích hợp MT/LLM trong dự án CAT. Tôi sẽ mô tả loại văn bản trong dự án này; Cho tôi biết liệu có phù hợp khi gửi văn bản này đến công cụ bên ngoài dựa trên đám mây hay không, tôi nên hỏi nhà cung cấp những câu hỏi nào (lưu giữ dữ liệu, đào tạo, vị trí). Loại văn bản/trạng thái quyền riêng tư: [...]
Dấu nhắc yếu / Dấu nhắc mạnh
Yếu: "Sử dụng bản dịch trong TM." (Không rõ tỷ lệ đối sánh là bao nhiêu và điều gì cần điều chỉnh; việc sao chép mù quáng sẽ gây ra lỗi.)
Strong: "Câu mới này khớp với câu trong TM 90% thời gian. Dựa trên bản dịch TM nhưng phản ánh sự khác biệt này: nguồn có 'hàng năm' thay vì 'hàng tháng', vì vậy nó phải là 'hàng năm' thay vì 'hàng tháng'. Đừng thay đổi bất cứ điều gì khác."
Sự khác biệt: lời nhắc mạnh mẽ xác định chính xác sự khác biệt của trận đấu; Nó ngăn cản việc "giữ nguyên bản dịch cũ", đây là lỗi phổ biến nhất của việc so khớp mờ.
Bảng thành phần hệ sinh thái CAT
thành phần
làm gì
mối quan hệ với AI
TM (bộ nhớ dịch)
Trả về các bản dịch trước đây đã được phê duyệt
Đáng tin cậy; trước MT
Cơ sở thuật ngữ
Đảm bảo tính nhất quán về thuật ngữ
Nó được đưa ra như một lời nhắc tới LLM
khuyến nghị MT
Bản phác thảo thô thành đoạn trống
Phải được chỉnh sửa sau
Tích hợp LLM
Giai điệu/thuật ngữ/viết lại
Kiểm soát, chú ý đến quyền riêng tư
mô-đun đảm bảo chất lượng
Lỗi quét số/thuật ngữ/thẻ
điều khiển tự động
Những lỗi thường gặp
- Chấp nhận một cách mù quáng sự phù hợp mờ nhạt. Sự trùng khớp 85% có thể che giấu sự khác biệt 15% về ý nghĩa.
- Ghi đầu ra MT thô vào TM. Dirty TM mang lỗi vào tương lai và làm nó phát triển.
- Trộn các TM khách hàng/dự án. Tính bảo mật và nguy cơ nhầm lẫn thuật ngữ.
- Không biết dữ liệu tích hợp đi đâu. Văn bản ẩn có thể bị rò rỉ ra ngoài mà bạn không hề hay biết.
- Quên sự khác biệt TM/MT. MT là ước tính; TM là một kỷ niệm. Cả hai đều không an toàn như nhau.
Dịch trước và căn chỉnh
Hai chức năng CAT nâng cao giúp tăng tốc hơn nữa quy trình làm việc trong kỷ nguyên AI. Đầu tiên là dịch trước: khi bắt đầu dự án, công cụ sẽ tự động điền TM và MT vào tất cả các phân đoạn; Thay vì một tệp trống, bạn bắt đầu với một tệp trong đó 100% kết quả trùng khớp được phê duyệt, các kết quả khớp mờ đang chờ điều chỉnh và các tệp trống là bản nháp MT. Điều này thay đổi công việc từ “viết từ đầu” sang “xem xét và chỉnh sửa” - nhưng bạn cần đánh giá từng phân đoạn thay vì phê duyệt một cách mù quáng bản dịch trước.
Thứ hai là căn chỉnh: nếu bạn có cặp tài liệu nguồn-đích đã được dịch trước đó nhưng chưa nhập TM, công cụ căn chỉnh sẽ khớp chúng theo từng phân đoạn và chuyển đổi chúng thành TM. Do đó, các bản dịch trước đây của bạn sẽ được thêm vào "bộ nhớ". Thận trọng trong việc căn chỉnh: việc khớp tự động không phải lúc nào cũng đúng; trượt một đoạn làm gián đoạn toàn bộ sự liên kết. Việc xem xét các cặp đã căn chỉnh trước khi TMing sẽ ngăn chặn nguy cơ TM bị bẩn ngay từ đầu. Hai chức năng này biến tài sản hiện tại của bạn (bản dịch trước đây) thành khoản đầu tư vào hoạt động kinh doanh trong tương lai.
Tóm lại
công cụ CAT; Nó kết hợp bộ nhớ dịch, cơ sở thuật ngữ, dịch máy và LLM vào một dây chuyền sản xuất duy nhất. TM là bộ nhớ truy xuất các bản dịch đã được phê duyệt trước đây của bạn và cung cấp tốc độ cao trong các tác vụ lặp đi lặp lại; MT là một dự đoán luôn cần được kiểm chứng. Người dùng hiểu biết sẽ điều chỉnh cẩn thận sự khác biệt trong các kết quả khớp mờ, chỉ viết các bản dịch đã được phê duyệt vào TM, tách biệt các TM của khách hàng và bảo vệ quyền riêng tư bằng cách biết dữ liệu sẽ đi đến đâu trong quá trình tích hợp.
Nhiệm vụ ứng dụng
Thiết lập một dự án nhỏ trong công cụ CAT (CAT trực tuyến miễn phí cũng hoạt động): thêm cơ sở thuật ngữ và TM trống. Dịch đoạn văn 10 câu, lưu bản dịch đã duyệt vào TM. Sau đó dịch văn bản thứ hai rất giống với văn bản đầu tiên và điều chỉnh các kết quả khớp mờ do TM trả về bằng mẫu "đánh giá kết quả khớp mờ"; Hãy để ý xem bạn sẽ mắc lỗi bao nhiêu câu nếu chấp nhận TM một cách mù quáng.
danh sách kiểm tra
- [ ] Tôi đã kết nối TM và cơ sở dữ liệu thuật ngữ với dự án.
- [ ] Tôi sử dụng sự khác biệt trong các kết quả khớp mờ một cách thích ứng thay vì mù quáng.
- [ ] Tôi chỉ viết cho TM bản dịch được chứng thực mà tôi đã xác minh.
- [ ] Tôi đã tách biệt các TM của khách hàng/dự án.
- [ ] Tôi đã kiểm tra xem dữ liệu sẽ đi đâu trong quá trình tích hợp MT/LLM.