Ünite 5 / 11

CAT Araçları ve Çeviri Belleği (TM) ile Yapay Zeka Entegrasyonu

Kazanimlar:

  • Çeviri belleği (TM), fuzzy eşleşme ve segment kavramlarını kavrayıp fuzzy eşleşmelerdeki farkı körlemesine değil uyarlayarak kullanabilme
  • TM'ye yalnızca onaylı çeviri yazma, müşteri TM'lerini ayrı tutma ve TM bakımı yapma disiplinini uygulayabilme
  • CAT içindeki MT/LLM entegrasyonunda verinin nereye gittiğini kontrol ederek gizliliği koruyabilme

Profesyonel çeviri, düz bir metin editöründe değil, çoğunlukla bir CAT aracında yapılır. Bu ünitede CAT araçlarını, çevirinin kalbindeki çeviri belleğini (TM), bunların makine çevirisi ve LLM ile nasıl birlikte çalıştığını ve bu ekosistemi verimli-güvenli kullanmayı öğreneceksiniz. Amaç, tek tek cümleleri değil, tüm bir projeyi tutarlı, hızlı ve izlenebilir biçimde yöneten bir çeviri teknolojisi kullanıcısı olmaktır.

Temel kavramlar

CAT aracı (Computer-Assisted Translation — bilgisayar destekli çeviri), çeviriyi cümle cümle (segment) düzenleten, çeviri belleği ve termbase'i bağlayan profesyonel yazılımdır (Trados, memoQ, Phrase, MateCat gibi). Kaynağı ve hedefi yan yana gösterir, tekrarları yakalar, biçimlendirmeyi korur.

TM (Translation Memory — çeviri belleği), daha önce çevirdiğiniz kaynak-hedef cümle çiftlerini saklayan bir veri tabanıdır. Yeni bir cümle geldiğinde, TM'de benzer bir cümle varsa aracı size onu önerir. Buradaki anahtar kavram fuzzy match (bulanık eşleşme): yeni cümlenin TM'deki bir cümleye benzerlik oranıdır (%100 = tam aynı, %85 = büyük ölçüde benzer). Yüksek eşleşmeler işi hızlandırır çünkü önceki çevirinizi yeniden kullanırsınız.

Segment, çevirinin temel birimidir — genellikle bir cümle. CAT aracı metni segmentlere böler ve her birini ayrı düzenletir.

TM'in önemi: MT ham taslak üretir, ama TM sizin onaylı, insan kalitesindeki geçmiş çevirilerinizi geri getirir. İkisi farklıdır: MT bir tahmindir, TM bir hafızadır.

İpucu: TM ve MT'yi karıştırmayın. %100 TM eşleşmesi (sizin daha önce onayladığınız çeviri) genellikle güvenilirdir; MT önerisi ise her zaman doğrulanmalıdır. CAT araçları ikisini farklı renk/etiketle gösterir; bu farkı her zaman görün.

MT ve LLM'in CAT içine yerleşmesi

Modern CAT araçları MT motorlarını ve giderek LLM'leri içeriden çağırır: TM'de eşleşme yoksa, aracı segment için otomatik bir MT önerisi getirir; siz onu son-düzenlersiniz (yani MTPE, CAT içinde akar). Son nesil araçlar LLM'i de entegre eder: "bu segmenti şu tonla yeniden yaz", "bu terimi termbase'e göre düzelt" gibi işlemleri araç içinde yapabilirsiniz.

Bu entegrasyonun avantajı: TM, termbase, MT ve LLM tek ekranda birleşir; her cümle için "önce TM'ye bak, yoksa MT öner, terim QA otomatik" akışı kurulur. Dezavantajı ve dikkat noktası: veri nereye gidiyor? Bulut tabanlı MT/LLM entegrasyonu, metni dış sunuculara gönderebilir; gizli işlerde bu, sözleşme ihlali olabilir. Aracın hangi motora, hangi veri politikasıyla bağlandığını mutlaka bilin.

Çeviri belleğini besleme ve temizleme

TM'in değeri, içindeki çevirilerin kalitesi kadardır. Çöp girer, çöp çıkar. İki disiplin:

  1. Sadece onaylı çeviriyi TM'ye yaz. Ham MT çıktısını doğrulamadan TM'ye kaydederseniz, gelecekteki işlerinize hatalı "hafıza" olarak döner.
  2. TM bakımı yap. Zamanla terim değişir, hata girer. Periyodik olarak TM'yi temizleyin, eskiyen/yanlış çiftleri düzeltin. Bu işte LLM'i "bu TM çiftlerinde tutarsızlık/terim sapması var mı?" diye bir denetçi olarak kullanabilirsiniz.
Dikkat: Bir müşterinin TM'sini başka müşterinin işinde kullanmak hem gizlilik ihlali hem de terim karışması riskidir. TM'ler müşteri/proje bazında ayrı tutulur. Karışık bir "her şey TM'si" hem gizliliği hem kaliteyi bozar.

Üç mini vaka

Vaka 1 — TM tekrarları uçurdu. Bir üretici, her yıl kılavuzunun %70'i aynı kalan bir ürün ailesini çevirtiyordu. TM sayesinde her yeni sürümde %100 ve yüksek fuzzy eşleşmeler otomatik geldi; 30.000 kelimelik işin sadece ~9.000 kelimesi gerçek yeni çeviriydi. Süre ve maliyet üçte bire indi.

Vaka 2 — Kirli TM hatayı çoğalttı. Bir ekip, doğrulamadan ham MT çıktısını TM'ye kaydetmişti. Bir yıl sonra aynı yanlış çeviri, %100 eşleşme olarak "güvenilir" görünüp defalarca geri geldi; hata 14 farklı belgeye yayılmıştı. Ekip, "sadece onaylı çeviri TM'ye" kuralını ve bir temizlik turu başlattı.

Vaka 3 — Gizlilik entegrasyonda sızdı. Bir çevirmen, gizli bir işi bulut MT'ye otomatik bağlı bir CAT projesinde yaptı; metin, veri politikası belirsiz bir dış motora gitti. Fark edilince, gizli projeler için MT entegrasyonu kapatıldı ve yalnızca "veriyi saklamayan/eğitmeyen" kurumsal motorlar kullanıldı.

Dört kopyalanabilir şablon

1) Fuzzy eşleşme değerlendirme (LLM'e):

Aşağıda yeni kaynak cümle, TM'deki benzer cümle ve onunonaylı çevirisi var. TM çevirisini yeni cümleye uyarlamakiçin tam olarak neyi değiştirmem gerektiğini söyle; gereksizdeğişiklik önerme. Anlam farkını net göster.Yeni kaynak: [...] | TM kaynak: [...] | TM çeviri: [...]

2) TM tutarlılık denetimi:

Aşağıda TM'den kaynak-hedef çiftleri var. Aynı veya çokbenzer kaynak cümlelerin FARKLI çevrildiği tutarsızlıklarıve terim sapmalarını işaretle. Sadece sorunları listele.Çiftler: [...]

3) Segment tonu yeniden yazma (CAT içi LLM):

Aşağıdaki hedef segmenti anlamı DEĞİŞTİRMEDEN [istenen ton]yap. Terim listesine uy: [...]. Sayı ve adları koru.Sadece yeniden yazılmış segmenti ver.Segment: [...]

4) Gizlilik/entegrasyon ön kontrolü:

Bir CAT projesinde MT/LLM entegrasyonu kullanacağım.Bu projedeki metnin türünü tarif edeceğim; bana bu metninbulut tabanlı bir dış motora gönderilmesinin uygun olupolmadığını, hangi soruları (veri saklama, eğitim, konum)sağlayıcıya sormam gerektiğini söyle.Metin türü/gizlilik durumu: [...]

Zayıf prompt / Güçlü prompt

Zayıf: "TM'deki çeviriyi kullan." (Hangi eşleşme oranı, neyin uyarlanacağı belirsiz; körlemesine kopyalama hata getirir.)

Güçlü: "Bu yeni cümle TM'deki cümleyle %90 eşleşiyor. TM çevirisini temel al ama şu farkı yansıt: kaynakta 'monthly' yerine 'annual' var, dolayısıyla 'aylık' yerine 'yıllık' olmalı. Başka hiçbir şeyi değiştirme."

Fark: güçlü prompt eşleşme farkını nokta atışı belirtir; fuzzy eşleşmenin en sık hatası olan "eski çeviriyi olduğu gibi bırakma"yı önler.

CAT ekosistemi bileşenleri tablosu

Bileşen

Ne yapar

YZ ile ilişki

TM (çeviri belleği)

Onaylı geçmiş çevirileri getirir

Güvenilir; MT'den önce gelir

Termbase

Terim tutarlılığını sağlar

LLM'e prompt olarak verilir

MT önerisi

Boş segmente ham taslak

Mutlaka son-düzenlenir

LLM entegrasyonu

Ton/terim/yeniden yazım

Kontrollü, gizliliğe dikkat

QA modülü

Sayı/terim/etiket hatası tarar

Otomatik denetim

Sık yapılan hatalar

  • Fuzzy eşleşmeyi körlemesine kabul etmek. %85 eşleşme, %15'lik anlam farkını gizleyebilir.
  • Ham MT çıktısını TM'ye yazmak. Kirli TM, hatayı geleceğe taşır ve çoğaltır.
  • Müşteri/proje TM'lerini karıştırmak. Gizlilik ve terim karışması riski.
  • Entegrasyonun veri gittiği yeri bilmemek. Gizli metin farkında olmadan dışarı sızabilir.
  • TM/MT farkını unutmak. MT bir tahmindir; TM bir hafıza. İkisi aynı güvende değildir.

Ön-çeviri ve hizalama (alignment)

İki ileri CAT işlevi, YZ çağında iş akışını daha da hızlandırır. Birincisi ön-çeviri (pre-translation): proje başında araç, tüm segmentleri otomatik olarak TM ve MT ile doldurur; siz boş bir dosya yerine, %100 eşleşmelerin onaylı, fuzzy eşleşmelerin uyarlanmayı bekleyen, boşların MT taslağı olduğu bir dosyayla başlarsınız. Bu, işi "sıfırdan yazma"dan "gözden geçirip düzeltme"ye çevirir — ama ön-çeviriyi körlemesine onaylamak yerine her segmenti değerlendirmeniz gerekir.

İkincisi hizalama (alignment): elinizde daha önce çevrilmiş ama TM'ye girmemiş bir kaynak-hedef belge çifti varsa, hizalama aracı bunları segment segment eşleştirip TM'ye dönüştürür. Böylece geçmiş çevirileriniz "hafızaya" katılır. Hizalamada dikkat: otomatik eşleştirme her zaman doğru değildir; bir segment kayması tüm hizalamayı bozar. Hizalanmış çiftleri TM'ye almadan önce gözden geçirmek, kirli TM riskini baştan önler. Bu iki işlev, mevcut varlıklarınızı (geçmiş çeviriler) geleceğin işlerine yatırıma dönüştürür.

Özetle

CAT araçları; çeviri belleği, termbase, makine çevirisi ve LLM'i tek bir üretim hattında birleştirir. TM sizin onaylı geçmiş çevirilerinizi geri getiren bir hafızadır ve tekrarlı işlerde büyük hız sağlar; MT ise her zaman doğrulanması gereken bir tahmindir. Usta kullanıcı, fuzzy eşleşmelerdeki farkı dikkatle uyarlar, TM'ye yalnızca onaylı çeviri yazar, müşteri TM'lerini ayrı tutar ve entegrasyonda verinin nereye gittiğini bilerek gizliliği korur.

Uygulama görevi

Bir CAT aracında (ücretsiz bir çevrimiçi CAT de olur) küçük bir proje kurun: bir termbase ve boş bir TM ekleyin. 10 cümlelik bir metni çevirin, onaylı çevirileri TM'ye kaydedin. Sonra ilk metne çok benzeyen ikinci bir metni çevirin ve TM'in getirdiği fuzzy eşleşmeleri "fuzzy eşleşme değerlendirme" şablonuyla uyarlayın; kaç cümlede TM'i körlemesine kabul etseydiniz hata yapacağınızı not edin.

Kontrol listesi

  • [ ] TM ve termbase'i projeye bağladım.
  • [ ] Fuzzy eşleşmelerdeki farkı körlemesine değil, uyarlayarak kullandım.
  • [ ] TM'ye yalnızca doğruladığım, onaylı çeviriyi yazdım.
  • [ ] Müşteri/proje TM'lerini ayrı tuttum.
  • [ ] MT/LLM entegrasyonunda verinin nereye gittiğini kontrol ettim.