Satuan 5 / 11

Integrasi AI dengan Alat CAT dan Memori Terjemahan (TM)

Keuntungan:

  • Memahami konsep memori terjemahan (TM), kecocokan fuzzy dan segmen, serta mampu menggunakan perbedaan dalam kecocokan fuzzy dengan mengadaptasinya daripada membabi buta.
  • Kemampuan untuk menerapkan disiplin menulis hanya terjemahan yang disetujui ke TM, memisahkan TM pelanggan, dan melakukan pemeliharaan TM
  • Kemampuan untuk melindungi privasi dengan mengontrol kemana data masuk dalam integrasi MT/LLM dalam CAT

Terjemahan profesional paling sering dilakukan di alat CAT, bukan di editor teks biasa. Dalam unit ini, Anda akan mempelajari alat CAT, memori terjemahan (TM) yang menjadi inti penerjemahan, cara keduanya bekerja sama dengan terjemahan mesin dan LLM, serta cara menggunakan ekosistem ini secara efisien dan aman. Tujuannya adalah menjadi pengguna teknologi terjemahan yang mengelola keseluruhan proyek, bukan kalimat individual, secara konsisten, cepat, dan dapat dilacak.

Konsep dasar

Alat CAT (Computer-Assisted Translation) adalah perangkat lunak profesional (seperti Trados, memoQ, Phrase, MateCat) yang mengatur terjemahan kalimat demi kalimat (segmen) dan menghubungkan memori terjemahan dan termbase. Menampilkan sumber dan target secara berdampingan, menangkap pengulangan, mempertahankan format.

TM (Translation Memory) merupakan database yang menyimpan pasangan kalimat sumber-target yang telah Anda terjemahkan sebelumnya. Ketika ada kalimat baru, jika ada kalimat serupa di TM, agen menyarankannya kepada Anda. Konsep kuncinya di sini adalah pencocokan fuzzy: kesamaan kalimat baru dengan kalimat di TM (100% = persis sama, 85% = sangat mirip). Kecocokan tinggi mempercepat pekerjaan karena Anda menggunakan kembali terjemahan sebelumnya.

Segmen adalah unit dasar terjemahan—biasanya berupa kalimat. Alat CAT membagi teks menjadi beberapa segmen dan mengeditnya secara terpisah.

Pentingnya TM: MT menghasilkan draf mentah, tetapi TM mengembalikan terjemahan Anda yang telah disetujui dan berkualitas manusia. Keduanya berbeda: MT adalah prediksi, TM adalah memori.

Tip: Jangan bingung antara TM dan MT. Kecocokan TM 100% (terjemahan Anda yang disetujui sebelumnya) umumnya dapat diandalkan; Rekomendasi MT harus selalu diverifikasi. Alat CAT menunjukkan keduanya dengan warna/label berbeda; selalu melihat perbedaan ini.

Integrasi MT dan LLM ke dalam CAT

Alat CAT modern memanggil mesin MT dan semakin banyak LLM secara internal: jika tidak ada kecocokan di TM, agen secara otomatis mengembalikan rekomendasi MT untuk segmen tersebut; Anda pasca-edit (yaitu aliran MTPE di CAT). Alat generasi terbaru juga mengintegrasikan LLM: Anda dapat melakukan operasi seperti "tulis ulang segmen ini dengan nada ini", "perbaiki istilah ini ke termbase", dll. di dalam alat tersebut.

Keuntungan integrasi ini: TM, termbase, MT dan LLM digabungkan dalam satu layar; Untuk setiap kalimat, alur "lihat TM dulu, jika tidak sarankan MT, istilah QA otomatis" dibuat. Kelemahan dan peringatan: kemana perginya data? Integrasi MT/LLM berbasis cloud dapat mengirim teks ke server eksternal; Dalam pekerjaan rahasia, hal ini mungkin merupakan pelanggaran kontrak. Pastikan untuk mengetahui mesin mana yang terhubung dengan kendaraan dan dengan kebijakan data yang mana.

Memberi makan dan membersihkan memori terjemahan

Nilai TM sama besarnya dengan kualitas terjemahan di dalamnya. Sampah masuk, sampah keluar. Dua disiplin ilmu:

  1. Tulis saja terjemahan bersertifikat ke TM. Jika Anda menyimpan keluaran MT mentah ke TM tanpa memvalidasinya, keluaran tersebut akan kembali ke pekerjaan Anda di masa mendatang sebagai "memori" yang buruk.
  2. Lakukan pemeliharaan TM. Seiring waktu, istilah berubah dan kesalahan masuk. Bersihkan TM secara berkala, perbaiki pasangan yang aus/salah. Dalam karya ini saya menggunakan LLM untuk bertanya "apakah ada inkonsistensi/bias istilah pada pasangan TM ini?" Anda dapat menggunakannya sebagai auditor.
Perhatian: Menggunakan TM satu pelanggan di bisnis pelanggan lain merupakan pelanggaran kerahasiaan dan risiko kebingungan istilah. TM disimpan terpisah berdasarkan klien/proyek. Campuran "semuanya TM" menghancurkan kerahasiaan dan kualitas.

tiga kasus mini

Kasus 1 — TM memutar ulang. Sebuah pabrikan sedang menerjemahkan rangkaian produknya dan 70% manualnya tetap sama dari tahun ke tahun. Berkat TM, kecocokan fuzzy 100% dan tinggi hadir secara otomatis di setiap versi baru; Hanya ~9.000 kata dari 30.000 kata yang merupakan terjemahan baru yang sebenarnya. Waktu dan biaya berkurang sepertiga.

Kasus 2 — Dirty TM menyebarkan kesalahan. Satu tim telah menyimpan keluaran MT mentah ke TM tanpa verifikasi. Setahun kemudian, kesalahan penerjemahan yang sama terjadi lagi dan lagi, tampak “dapat diandalkan” karena 100% cocok; Kesalahan itu tersebar di 14 dokumen berbeda. Tim menerapkan aturan "terjemahan bersertifikat ke TM saja" dan tur pembersihan.

Kasus 3 — Kerahasiaan bocor dalam integrasi. Seorang penerjemah melakukan pekerjaan rahasia dalam proyek CAT yang secara otomatis terhubung ke cloud MT; Teks tersebut masuk ke mesin eksternal yang kebijakan datanya tidak jelas. Setelah diketahui, integrasi MT untuk proyek rahasia dimatikan dan hanya mesin perusahaan yang "tidak menyimpan/melatih data" yang digunakan.

Empat templat yang dapat disalin

1) Evaluasi pertandingan fuzzy (ke LLM):

Di bawah ini adalah kalimat sumber baru, kalimat serupa di TM dan terjemahannya yang disetujui. Beri tahu saya apa yang perlu saya ubah untuk menyesuaikan terjemahan TM ke kalimat baru; Jangan menyarankan perubahan yang tidak diperlukan. Tunjukkan perbedaan makna dengan jelas. Sumber baru: [...] | Sumber TM: [...] | Terjemahan TM: [...]

2) Pemeriksaan konsistensi TM:

Di bawah ini adalah pasangan sumber-target dari TM. Tandai ketidakkonsistenan dan penyimpangan istilah ketika kalimat sumber yang sama atau sangat mirip diterjemahkan secara BERBEDA. Cantumkan saja masalahnya. Pasangan: [...]

3) Penulisan ulang nada segmen (LLM di CAT):

Buatlah segmen sasaran berikut [nada yang diinginkan] TANPA MENGUBAH artinya. Patuhi daftar ketentuan: [...]. Simpan nomor dan nama. Ekspor hanya segmen yang ditulis ulang. Segmen: [...]

4) Pra-pemeriksaan privasi/integrasi:

Saya akan menggunakan integrasi MT/LLM dalam proyek CAT. Saya akan menjelaskan jenis teks dalam proyek ini; Beri tahu saya apakah pantas mengirim teks ini ke mesin eksternal berbasis cloud, pertanyaan apa (retensi data, pelatihan, lokasi) yang harus saya tanyakan kepada penyedia. Jenis teks/status privasi: [...]

Perintah lemah / Perintah kuat

Lemah: "Gunakan terjemahan dalam TM." (Tidak jelas berapa tingkat kecocokan dan apa yang harus diadaptasi; penyalinan buta menimbulkan kesalahan.)

Kuat: "Kalimat baru ini 90% cocok dengan kalimat di TM. Dibuat berdasarkan terjemahan TM tetapi mencerminkan perbedaan ini: sumbernya memiliki 'tahunan', bukan 'bulanan', jadi seharusnya 'tahunan', bukan 'bulanan'. Jangan ubah apa pun."

Perbedaan: perintah kuat menunjukkan dengan tepat perbedaan kecocokan; Ini mencegah "membiarkan terjemahan lama apa adanya", yang merupakan kesalahan paling umum dalam pencocokan fuzzy.

Tabel komponen ekosistem CAT

komponen

Apa artinya?

hubungan dengan AI

TM (memori terjemahan)

Pengembalian menyetujui terjemahan sebelumnya

Dapat diandalkan; mendahului MT

Termbase

Memastikan konsistensi istilah

Hal ini diberikan sebagai prompt untuk LLM

Rekomendasi MT

Sketsa mentah menjadi segmen kosong

Harus pasca-edit

Integrasi LLM

Nada/istilah/penulisan ulang

Terkendali, memperhatikan privasi

modul QA

Kesalahan pemindaian nomor/istilah/tag

kontrol otomatis

Kesalahan umum

  • Menerima pertandingan fuzzy secara membabi buta. Kecocokan 85% dapat menyembunyikan perbedaan makna sebesar 15%.
  • Menulis keluaran MT mentah ke TM. Dirty TM membawa kesalahan ke masa depan dan memperbanyaknya.
  • Mencampur TM pelanggan/proyek. Kerahasiaan dan risiko kebingungan istilah.
  • Tidak mengetahui kemana perginya data integrasi. Teks tersembunyi mungkin bocor tanpa Anda sadari.
  • Melupakan perbedaan TM/MT. MT adalah perkiraan; TM adalah kenangan. Keduanya tidak sama amannya.

Pra-terjemahan dan penyelarasan

Dua fungsi CAT tingkat lanjut semakin mempercepat alur kerja di era AI. Yang pertama adalah pra-terjemahan: di awal proyek, alat secara otomatis mengisi semua segmen dengan TM dan MT; Alih-alih file kosong, Anda memulai dengan file yang 100% kecocokannya disetujui, kecocokan fuzzy menunggu untuk diadaptasi, dan yang kosong adalah draf MT. Hal ini mengubah pekerjaan dari “menulis dari awal” menjadi “meninjau dan mengedit” — tetapi Anda perlu mengevaluasi setiap segmen daripada menyetujui pra-terjemahan secara membabi buta.

Yang kedua adalah penyelarasan: jika Anda memiliki pasangan dokumen sumber-target yang telah diterjemahkan sebelumnya tetapi belum masuk ke TM, alat penyelarasan mencocokkannya segmen demi segmen dan mengubahnya menjadi TM. Dengan demikian, terjemahan Anda yang lalu ditambahkan ke "memori". Perhatian dalam penyelarasan: pencocokan otomatis tidak selalu benar; slippage satu segmen mengganggu keseluruhan keselarasan. Meninjau pasangan yang selaras sebelum TMing mencegah risiko TM kotor. Kedua fungsi ini mengubah aset Anda saat ini (terjemahan sebelumnya) menjadi investasi di bisnis masa depan.

Singkatnya

alat CAT; Ini menggabungkan memori terjemahan, termbase, terjemahan mesin, dan LLM ke dalam satu lini produksi. TM adalah memori yang mengambil terjemahan sebelumnya yang Anda setujui dan memberikan kecepatan tinggi dalam tugas yang berulang; MT adalah prediksi yang selalu perlu diverifikasi. Pengguna yang cerdas secara hati-hati menyesuaikan perbedaan dalam pencocokan fuzzy, hanya menulis terjemahan yang disetujui ke TM, memisahkan TM pelanggan, dan melindungi privasi dengan mengetahui ke mana data pergi dalam integrasi.

Tugas aplikasi

Siapkan proyek kecil di alat CAT (CAT online gratis juga berfungsi): tambahkan termbase dan TM kosong. Terjemahkan teks 10 kalimat, simpan terjemahan yang disetujui ke TM. Kemudian terjemahkan teks kedua yang sangat mirip dengan teks pertama dan sesuaikan kecocokan fuzzy yang dikembalikan oleh TM dengan templat "evaluasi kecocokan fuzzy"; Catat berapa banyak kalimat yang akan membuat kesalahan jika Anda menerima TM secara membabi buta.

daftar periksa

  • [] Saya menghubungkan TM dan termbase ke proyek.
  • [ ] Saya menggunakan perbedaan dalam pencocokan fuzzy secara adaptif, bukan secara membabi buta.
  • [ ] Saya hanya menulis ke TM terjemahan bersertifikat yang telah saya verifikasi.
  • [ ] Saya memisahkan TM pelanggan/proyek.
  • [ ] Saya memeriksa ke mana perginya data dalam integrasi MT/LLM.