Kazanimlar:
- Otomatik QA ve dilsel LQA katmanlarını ayırt edip her ikisini doğru sırayla uygulayabilme
- MQM gibi bir hata çerçevesiyle çeviriyi kategori ve ağırlığa (kritik/majör/minör) göre objektif değerlendirebilme
- Yapay zekayı bir denetçi olarak kullanırken kendi çevirisine körlüğünü, hata uydurma riskini ve otomatik metriklerin sınırlarını bilerek nihai kararı verebilme
Bir çeviri "bitti" dediğiniz an, işin yarısıdır; diğer yarısı, o çevirinin gerçekten güvenilir olduğunu kanıtlamaktır. Bu ünitede çeviri kalitesini ölçmenin sistemli yollarını öğreneceksiniz: otomatik QA kontrolleri, insan temelli LQA hata çerçeveleri, kalite metrikleri ve YZ'nin bir "denetçi" olarak nasıl kullanılacağı — ve sınırları. Amaç, "bence iyi oldu" öznelliğinden çıkıp kaliteyi tanımlayan, ölçen ve kanıtlayan bir uzman olmaktır.
İki tür kalite kontrolü: otomatik ve dilsel
QA (Quality Assurance — kalite güvence) çeviride iki katmanda çalışır:
Otomatik QA: CAT araçlarının ve betiklerin yakaladığı biçimsel hatalar — sayı uyuşmazlığı, eksik/fazla boşluk, tutarsız terim, çevrilmemiş segment, bozuk placeholder/etiket, çift boşluk, noktalama. Bunlar makine ile hızlı ve eksiksiz taranır; insanın gözünden kaçar ama araç yakalar.
LQA (Linguistic Quality Assurance — dilsel kalite güvence): Bir insan değerlendiricinin anlam, terim, üslup, dil bilgisi ve yerel uygunluğu incelediği katmandır. Otomatik QA "sayı uyuşuyor mu?" sorusuna bakar; LQA "anlam doğru mu, ton uygun mu, kültürel olarak yerinde mi?" sorusuna bakar. İkisi birbirini tamamlar; biri diğerinin yerine geçmez.
İpucu: Otomatik QA'yı her zaman önce çalıştırın; biçimsel hataları temizlemek insan değerlendiricinin dikkatini gerçek dilsel sorunlara ayırmasını sağlar. Sayı hatasıyla uğraşan bir gözden geçiren, ton hatasını kaçırır.
Hata çerçeveleri: MQM ve DQF
Kaliteyi "iyi/kötü" yerine ölçülebilir kılmak için standart hata tipolojileri kullanılır. En yaygını MQM'dir (Multidimensional Quality Metrics — çok boyutlu kalite metrikleri): her hatayı bir kategoriye (doğruluk, akıcılık, terminoloji, stil, yerellik, biçim) ve bir ağırlığa (kritik, majör, minör) atar. Bir başka çerçeve DQF (Dynamic Quality Framework)'tür ve MQM ile birlikte anılır.
Neden önemli? Çünkü bu çerçeveyle bir çeviriye hata puanı verebilir, farklı çevirmenleri/motorları objektif karşılaştırabilir ve "bu metin teslim edilebilir mi?" sorusuna sayısal eşikle cevap verirsiniz. Örneğin: kritik hata = 10 puan, majör = 5, minör = 1; belirli kelime başına belirli eşiğin altındaki metin geçer.
Kritik hata: anlamı ters çeviren, güvenlik/hukuk riski doğuran, markayı zedeleyen hata (yanlış doz, "sorumludur" yerine "sorumlu değildir"). Majör: anlamı bozan ama tehlikesiz. Minör: fark edilir ama anlamı bozmayan (küçük stil/noktalama).
YZ'yi bir denetçi olarak kullanmak — ve sınırları
YZ, bir çeviriyi hata çerçevesine göre denetlemekte hızlı ve yararlıdır: "bu çeviride doğruluk, terim, akıcılık hatalarını MQM kategorileriyle işaretle" diyebilirsiniz. Kör noktalarınızı azaltır, hızlı bir "ikinci göz" verir.
Ama üç kritik sınır vardır: (1) YZ kendi ürettiği çeviriyi denetlerken kör olabilir — aynı yanlışı hem yapıp hem onaylar; farklı bir modelle veya kaynağa dönerek çapraz kontrol edin. (2) YZ halüsinasyonlu "hata" da uydurabilir — olmayan bir hatayı raporlayabilir; her uyarıyı teyit edin. (3) YZ, kritik hatanın gerçek dünyadaki ağırlığını (bir doz hatasının ölümcül olabileceğini) tam kavramayabilir; ağırlıklandırmayı uzman yapar. Yani YZ QA'yı hızlandırır, ama nihai kalite kararı ve teslim onayı insanındır.
Dikkat: "YZ QA'dan geçti, temizdir" demek yanlış bir güven duygusudur. YZ denetimi, insan LQA'sının ve kaynakla karşılaştırmanın yerine geçmez; onları hızlandıran bir ön eleme katmanıdır.
Üç mini vaka
Vaka 1 — Otomatik QA 40 sayı hatası buldu. Bir finans raporu çevirisinde otomatik QA, kaynak ve hedef arasında 40 sayı/biçim uyuşmazlığı yakaladı (binlik ayraç, ondalık, para birimi). İnsan gözü bunların çoğunu kaçırırdı; araç saniyeler içinde listeledi.
Vaka 2 — MQM puanı motor seçtirdi. Bir büro, iki farklı MT motorunun çıktısını 2.000 kelimede MQM ile puanladı: Motor A 12 hata puanı, Motor B 31. Objektif ölçüm, "hangisi daha iyi" tartışmasını sayıyla bitirdi; büro Motor A'yı standart yaptı ve son-düzenleme bütçesini buna göre planladı.
Vaka 3 — YZ denetimi kendi hatasını atladı. Bir çevirmen, LLM'in çevirisini aynı LLM'e denetletti; model kendi yaptığı bir terim hatasını "sorun yok" dedi. Çevirmen farklı bir modelle ve kaynakla çapraz kontrol yapınca hata ortaya çıktı; ekip "aynı model kendini denetlemesin" kuralını benimsedi.
Dört kopyalanabilir şablon
1) MQM temelli hata denetimi:
Rolün: LQA değerlendiricisi.Aşağıdaki kaynak ve çeviriyi karşılaştır. Bulduğun her hatayışu formatta ver: [kategori: doğruluk/terim/akıcılık/stil/biçim][ağırlık: kritik/majör/minör] [yer] [açıklama] [düzeltme].Emin olmadığın uyarıyı "teyit gerekli" diye işaretle; hatauydurma.Kaynak: [...] | Çeviri: [...]
2) Kritik hata taraması (yüksek riskli):
Aşağıdaki çeviride SADECE kritik hataları ara: anlamı tersçeviren, sayı/doz/tarih hatası, olumsuzluk kaybı, hukukiyükümlülük değişimi, güvenlik uyarısı hatası. Minör stilsorunlarını yok say. Her kritik bulguyu kaynakla göster.Kaynak: [...] | Çeviri: [...]
3) Otomatik QA tamamlayıcı kontrol:
Aşağıdaki kaynak-hedef çiftlerinde biçimsel tutarsızlıklarılistele: sayı uyuşmazlığı, eksik/fazla placeholder veya etiket,tutarsız terim, çevrilmemiş segment, birim/para farkı.Sadece sorunları, yerleriyle ver.Çiftler: [...]
4) Bağımsız ikinci göz (çapraz kontrol):
Bu çeviriyi ÖNYARGISIZ değerlendir; onu senin yazdığınıvarsayma. Kaynağa sadakat, terim ve doğallık açısından birkalite notu (1-5) ver ve en önemli 3 sorunu sırala. Kesinkarar bende.Kaynak: [...] | Çeviri: [...]
Zayıf prompt / Güçlü prompt
Zayıf: "Bu çeviri iyi mi?" (Kriter yok; YZ "genel olarak iyi" gibi işe yaramaz bir yanıt verir.)
Güçlü: "Bu çeviriyi kaynağa göre denetle. Her hatayı kategori (doğruluk/terim/akıcılık) ve ağırlık (kritik/majör/minör) ile etiketle. Özellikle sayı, olumsuzluk ve terim hatalarına odaklan. Hata uydurma; emin olmadığını 'teyit gerekli' işaretle."
Fark: güçlü prompt bir hata çerçevesi ve odak verir; çıktı, karşılaştırılabilir ve eyleme dönük bir kalite raporu olur.
Kalite katmanları tablosu
Katman
Neyi yakalar
Kim/ne yapar
Otomatik QA
Sayı, etiket, tutarlılık
Araç/betik
YZ denetimi
Olası anlam/terim hataları
LLM (teyitle)
İnsan LQA
Anlam, ton, kültür, ağırlık
Uzman değerlendirici
MQM/DQF puanı
Objektif hata skoru
Çerçeveyle insan
Teslim onayı
Nihai sorumluluk
Yetkin çevirmen
Sık yapılan hatalar
- Otomatik QA'yı atlayıp doğrudan okumaya başlamak. Biçimsel hatalar dikkati dağıtır.
- YZ denetimini insan LQA'nın yerine koymak. YZ ön eleme yapar, onay vermez.
- Aynı modele kendi çevirisini denetletmek. Kör nokta; çapraz kontrol gerekir.
- Hataları ağırlıklandırmamak. Kritik ile minörü aynı görmek, önceliği bozar.
- YZ'nin uydurduğu "hataları" teyit etmeden düzeltmek. Doğru cümleyi bozabilirsiniz.
Otomatik metrikler: BLEU, COMET ve sınırları
Kalite ölçümünde bir de otomatik metrikler dünyası vardır. BLEU (Bilingual Evaluation Understudy), bir makine çevirisini bir insan referans çevirisiyle karşılaştırıp kelime örtüşmesine göre 0-100 arası bir puan verir; MT sistemlerini karşılaştırmakta uzun süre standart oldu. Daha yeni bir metrik olan COMET, sinir ağı temelli olup anlam benzerliğini BLEU'dan daha iyi yakalar. Bu metrikler, iki motoru büyük veride hızlı ve otomatik karşılaştırmak için değerlidir.
Ama sınırları nettir: BLEU gibi metrikler kelime örtüşmesine bakar, anlamı gerçekten anlamaz. Referanstan farklı ama doğru bir çeviri düşük puan alabilir; referansa benzeyen ama yanlış bir çeviri yüksek puan alabilir. Kritik bir olumsuzluk hatası tek kelime olduğu için metriği çok az etkiler ama gerçekte felakettir. Bu yüzden otomatik metrikler sistem düzeyinde eğilim ölçer, tek bir metnin teslim edilebilirliğine karar vermez. Bir çevirinin müşteriye gidip gitmeyeceğine, otomatik puan değil, MQM temelli insan değerlendirmesi ve uzman yargısı karar verir. Metrikleri bir pusula olarak kullanın, hakim olarak değil.
Özetle
Çeviri kalitesi öznel bir his değil, ölçülebilir bir şeydir. Otomatik QA biçimsel hataları eksiksiz tarar; insan LQA anlam, ton ve kültürü değerlendirir; MQM gibi hata çerçeveleri kaliteyi kategori ve ağırlıkla sayısallaştırıp objektif karşılaştırma sağlar. YZ, bu denetimi hızlandıran güçlü bir ikinci gözdür ama kendi çevirisine kör olabilir, hata uydurabilir ve gerçek dünya ağırlığını tam kavramaz; bu yüzden nihai kalite kararı, ağırlıklandırma ve teslim onayı yetkin çevirmene aittir.
Uygulama görevi
Bir makine çevirisi çıktısı alın. Önce "otomatik QA tamamlayıcı kontrol" ile biçimsel hataları, sonra "MQM temelli hata denetimi" ile dilsel hataları kategori ve ağırlıkla listeleyin. Her hataya puan verip (kritik 10, majör 5, minör 1) kelime başına bir eşikle "teslim edilebilir mi?" sorusunu cevaplayın. Son olarak YZ'nin işaretlediği hatalardan kaçının gerçek, kaçının uydurma olduğunu kaynakla teyit edin.
Kontrol listesi
- [ ] Otomatik QA'yı çalıştırıp biçimsel hataları temizledim.
- [ ] Dilsel hataları bir çerçeveyle (kategori + ağırlık) işaretledim.
- [ ] Kritik hataları ayrı ve öncelikli bir turla taradım.
- [ ] YZ denetimini kaynakla ve gerekirse farklı modelle çapraz kontrol ettim.
- [ ] Teslim kararını sayısal eşik ve kendi uzman yargımla verdim.