Keuntungan:
- Memahami konsep memori terjemahan (TM), padanan kabur dan segmen, dan dapat menggunakan perbezaan pada padanan kabur dengan menyesuaikannya dan bukannya secara membuta tuli.
- Keupayaan untuk menerapkan disiplin penulisan hanya terjemahan yang diluluskan kepada TM, memastikan TM pelanggan berasingan, dan melaksanakan penyelenggaraan TM
- Keupayaan untuk melindungi privasi dengan mengawal ke mana data pergi dalam penyepaduan MT/LLM dalam CAT
Terjemahan profesional paling kerap dilakukan dalam alat CAT, bukan dalam editor teks biasa. Dalam unit ini, anda akan mempelajari alatan CAT, memori terjemahan (TM) di tengah-tengah terjemahan, cara ia berfungsi bersama-sama dengan terjemahan mesin dan LLM, dan cara menggunakan ekosistem ini dengan cekap dan selamat. Matlamatnya adalah untuk menjadi pengguna teknologi terjemahan yang menguruskan keseluruhan projek, bukan ayat individu, dengan cara yang konsisten, pantas dan boleh dikesan.
Konsep asas
Alat CAT (Computer-Assisted Translation) ialah perisian profesional (seperti Trados, memoQ, Frasa, MateCat) yang menyusun ayat terjemahan demi ayat (segmen) dan menghubungkan memori terjemahan dan pangkalan istilah. Menunjukkan sumber dan sasaran sebelah menyebelah, menangkap ulangan, mengekalkan pemformatan.
TM (Memori Terjemahan) ialah pangkalan data yang menyimpan pasangan ayat sasaran sumber yang telah anda terjemah sebelum ini. Apabila ayat baru tiba, jika ada ayat yang serupa di TM, ejen mencadangkannya kepada anda. Konsep utama di sini ialah padanan kabur: persamaan ayat baharu dengan ayat dalam TM (100% = betul-betul sama, 85% = hampir sama). Padanan tinggi mempercepatkan kerja kerana anda menggunakan semula terjemahan anda yang terdahulu.
Segmen ialah unit asas terjemahan—biasanya ayat. Alat CAT membahagikan teks kepada segmen dan mengedit setiap satu secara berasingan.
Kepentingan TM: MT menghasilkan draf mentah, tetapi TM mengembalikan terjemahan lepas anda yang diluluskan dan berkualiti manusia. Kedua-duanya berbeza: MT adalah ramalan, TM adalah ingatan.
Petua: Jangan mengelirukan TM dan MT. Padanan TM 100% (terjemahan anda yang diluluskan sebelum ini) secara amnya boleh dipercayai; Syor MT hendaklah sentiasa disahkan. Alat CAT menunjukkan kedua-duanya dengan warna/label yang berbeza; sentiasa nampak perbezaan ini.
Integrasi MT dan LLM ke dalam CAT
Alat CAT moden memanggil enjin MT dan semakin LLM secara dalaman: jika tiada padanan dalam TM, ejen secara automatik mengembalikan pengesyoran MT untuk segmen tersebut; anda menyuntingnya (iaitu MTPE mengalir dalam CAT). Alat generasi terkini juga menyepadukan LLM: anda boleh melakukan operasi seperti "tulis semula segmen ini dengan nada ini", "betulkan istilah ini kepada termbase" dsb. dalam alat.
Kelebihan penyepaduan ini: TM, termbase, MT dan LLM digabungkan dalam satu skrin; Untuk setiap ayat, aliran "lihat TM dahulu, jika tidak cadangkan MT, istilah QA secara automatik" diwujudkan. Kelemahan dan berhati-hati: ke mana perginya data? Penyepaduan MT/LLM berasaskan awan boleh menghantar teks ke pelayan luaran; Dalam kerja sulit, ini mungkin pelanggaran kontrak. Pastikan anda mengetahui enjin kenderaan itu disambungkan dan dengan dasar data yang mana.
Memberi makan dan mengosongkan memori terjemahan
Nilai TM adalah sama dengan kualiti terjemahan di dalamnya. Sampah masuk, sampah keluar. Dua disiplin:
- Tulis sahaja terjemahan yang diperakui kepada TM. Jika anda menyimpan keluaran MT mentah ke TM tanpa mengesahkannya, ia akan kembali ke pekerjaan masa hadapan anda sebagai "ingatan" buruk.
- Lakukan penyelenggaraan TM. Lama kelamaan, terma berubah dan ralat masuk. Bersihkan TM secara berkala, pasangkan haus/salah yang betul. Dalam kerja ini, saya menggunakan LLM untuk bertanya "adakah terdapat sebarang ketidakkonsistenan/kecenderungan istilah dalam pasangan TM ini?" Anda boleh menggunakannya sebagai juruaudit.
Awas: Menggunakan TM seorang pelanggan dalam perniagaan pelanggan lain adalah pelanggaran kerahsiaan dan risiko kekeliruan istilah. TM disimpan berasingan berdasarkan pelanggan/projek. Campuran "segala-galanya TM" memusnahkan kedua-dua kerahsiaan dan kualiti.
tiga kes mini
Kes 1 — TM melancarkan tayangan semula. Pengilang telah menerjemahkan keluarga produk yang mana 70% manualnya kekal sama tahun demi tahun. Terima kasih kepada TM, padanan kabur 100% dan tinggi datang secara automatik dalam setiap versi baharu; Hanya ~9,000 perkataan daripada 30,000 perkataan kerja adalah terjemahan baharu sebenar. Masa dan kos dikurangkan sebanyak satu pertiga.
Kes 2 — Dirty TM menyebarkan ralat. Satu pasukan telah menyimpan keluaran MT mentah ke dalam TM tanpa pengesahan. Setahun kemudian terjemahan yang sama berulang berulang kali, kelihatan "dipercayai" sebagai padanan 100%; Ralat itu tersebar di 14 dokumen berbeza. Pasukan itu memulakan peraturan "terjemahan diperakui kepada TM sahaja" dan lawatan pembersihan.
Kes 3 — Kerahsiaan bocor dalam penyepaduan. Seorang penterjemah melakukan kerja sulit dalam projek CAT yang disambungkan secara automatik ke awan MT; Teks itu dihantar ke enjin luaran yang dasar datanya tidak jelas. Setelah diperhatikan, penyepaduan MT untuk projek rahsia telah dimatikan dan hanya enjin perusahaan yang "tidak menyimpan/melatih data" digunakan.
Empat templat yang boleh disalin
1) Penilaian padanan kabur (kepada LLM):
Di bawah ialah ayat sumber baharu, ayat serupa dalam TM dan terjemahannya yang diluluskan. Beritahu saya apa yang perlu saya ubah untuk menyesuaikan terjemahan TM kepada ayat baharu; Jangan cadangkan perubahan yang tidak perlu. Tunjukkan perbezaan makna dengan jelas. Sumber baharu: [...] | Sumber TM: [...] | Terjemahan TM: [...]
2) Semakan konsistensi TM:
Di bawah ialah pasangan sasaran sumber daripada TM. Tandakan ketidakkonsistenan dan sisihan istilah di mana ayat sumber yang sama atau hampir serupa diterjemahkan secara BERBEZA. Senaraikan sahaja masalahnya.Pasangan: [...]
3) Penulisan semula nada segmen (LLM dalam CAT):
Buat segmen sasaran berikut [nada yang dikehendaki] TANPA MENGUBAH maksud. Mematuhi senarai syarat: [...]. Simpan nombor dan nama. Eksport hanya segmen yang ditulis semula. Segmen: [...]
4) Pra-semakan privasi/integrasi:
Saya akan menggunakan penyepaduan MT/LLM dalam projek CAT. Saya akan menerangkan jenis teks dalam projek ini; Beritahu saya sama ada sesuai untuk menghantar teks ini kepada enjin luaran berasaskan awan, apakah soalan (pengekalan data, latihan, lokasi) yang harus saya tanyakan kepada pembekal. Jenis teks/status privasi: [...]
Gesaan lemah / Gesaan kuat
Lemah: "Gunakan terjemahan dalam TM." (Tidak jelas apakah kadar padanan dan apa yang perlu disesuaikan; penyalinan buta memperkenalkan ralat.)
Kuat: "Ayat baharu ini sepadan dengan ayat dalam TM 90% pada setiap masa. Bina pada terjemahan TM tetapi tunjukkan perbezaan ini: sumbernya mempunyai 'tahunan' bukannya 'bulanan', jadi ia sepatutnya 'tahunan' dan bukannya 'bulanan'. Jangan ubah apa-apa lagi."
Perbezaan: gesaan kuat menentukan perbezaan perlawanan; Ia menghalang "meninggalkan terjemahan lama seperti sedia ada", yang merupakan kesilapan paling biasa pada padanan kabur.
Jadual komponen ekosistem CAT
komponen
Apa yang boleh
hubungan dengan AI
TM (memori terjemahan)
Mengembalikan terjemahan lepas yang diluluskan
Boleh dipercayai; mendahului MT
Termbase
Memastikan konsistensi terma
Ia diberikan sebagai gesaan kepada LLM
Syor MT
Lakaran mentah kepada segmen kosong
Mesti diedit selepas
Penyepaduan LLM
Nada/istilah/penulisan semula
Terkawal, perhatian kepada privasi
modul QA
Mengimbas ralat nombor/istilah/tag
kawalan automatik
Kesilapan biasa
- Membuta tuli menerima perlawanan kabur. Padanan 85% boleh menyembunyikan 15% perbezaan makna.
- Menulis output MT mentah kepada TM. TM yang kotor membawa kesilapan itu ke masa hadapan dan membiaknya.
- Mencampurkan TM pelanggan/projek. Kerahsiaan dan risiko kekeliruan istilah.
- Tidak tahu ke mana perginya data integrasi. Teks tersembunyi mungkin bocor tanpa anda sedari.
- Melupakan perbezaan TM/MT. MT adalah anggaran; TM adalah kenangan. Kedua-duanya tidak sama selamat.
Praterjemahan dan penjajaran
Dua fungsi CAT lanjutan mempercepatkan lagi aliran kerja dalam era AI. Yang pertama ialah pra-terjemahan: pada permulaan projek, alat ini secara automatik mengisi semua segmen dengan TM dan MT; Daripada fail kosong, anda bermula dengan fail yang 100% padanan diluluskan, padanan kabur menunggu untuk disesuaikan dan yang kosong ialah draf MT. Ini mengubah tugas daripada "menulis dari awal" kepada "menyemak dan mengedit" — tetapi anda perlu menilai setiap segmen dan bukannya meluluskan praterjemahan secara membuta tuli.
Yang kedua ialah penjajaran: jika anda mempunyai pasangan dokumen sasaran sumber yang telah diterjemahkan sebelum ini tetapi belum memasuki TM, alat penjajaran memadankannya segmen demi segmen dan menukarkannya kepada TM. Oleh itu, terjemahan masa lalu anda ditambahkan pada "memori". Berhati-hati dalam penjajaran: pemadanan automatik tidak selalu betul; gelinciran satu segmen mengganggu keseluruhan penjajaran. Mengkaji pasangan sejajar sebelum TMing menghalang risiko TM kotor di tempat pertama. Kedua-dua fungsi ini menjadikan aset semasa anda (terjemahan lalu) kepada pelaburan dalam perniagaan masa hadapan.
Secara ringkasnya
alat CAT; Ia menggabungkan memori terjemahan, termbase, terjemahan mesin dan LLM ke dalam satu barisan pengeluaran. TM ialah memori yang mendapatkan semula terjemahan lepas anda yang diluluskan dan memberikan kelajuan yang hebat dalam tugasan berulang; MT adalah ramalan yang sentiasa perlu disahkan. Pengguna yang bijak menyesuaikan dengan teliti perbezaan dalam padanan kabur, menulis hanya terjemahan yang diluluskan kepada TM, memastikan TM pelanggan berasingan, dan melindungi privasi dengan mengetahui ke mana perginya data dalam penyepaduan.
Tugasan permohonan
Sediakan projek kecil dalam alat CAT (CAT dalam talian percuma juga berfungsi): tambah termbase dan TM kosong. Terjemah teks 10 ayat, simpan terjemahan yang diluluskan ke TM. Kemudian terjemah teks kedua yang hampir sama dengan teks pertama dan sesuaikan padanan kabur yang dikembalikan oleh TM dengan templat "penilaian padanan kabur"; Perhatikan berapa banyak ayat yang akan anda lakukan jika anda menerima TM secara membuta tuli.
senarai semak
- [ ] Saya menyambungkan TM dan termbase kepada projek.
- [ ] Saya menggunakan perbezaan dalam padanan kabur secara adaptif dan bukannya secara membuta tuli.
- [ ] Saya hanya menulis kepada TM terjemahan yang diperakui yang telah saya sahkan.
- [ ] Saya memisahkan TM pelanggan/projek.
- [ ] Saya menyemak ke mana perginya data dalam penyepaduan MT/LLM.