Birlik 8 / 11

Sifat nazorati (QA), baholash ko'rsatkichlari va LQA

Daromadlar:

  • Avtomatik QA va lingvistik LQA qatlamlarini farqlash va ikkalasini ham to'g'ri tartibda qo'llash qobiliyati
  • Tarjimani toifa va og'irlik (tanqidiy / asosiy / kichik) bo'yicha MQM kabi xatolik tizimi bilan ob'ektiv baholash qobiliyati
  • AIdan auditor sifatida foydalanishda yakuniy qarorni qabul qila olish, uning o'z tarjimasiga ko'rligini, xato qilish xavfini va avtomatlashtirilgan o'lchovlar chegaralarini bilish

Tarjima “bajarildi” desangiz, ishning yarmi bo‘ladi; Ikkinchi yarmi esa tarjimaning haqiqatda ishonchli ekanligini isbotlashdir. Ushbu bo'limda siz tarjima sifatini o'lchashning tizimli usullarini o'rganasiz: avtomatlashtirilgan QA tekshiruvlari, odamlarga asoslangan LQA xatolik asoslari, sifat ko'rsatkichlari va AIdan "inspektor" sifatida qanday foydalanish - va uning chegaralari. Maqsad – “Menimcha, bu yaxshi” degan subyektivlikdan uzoqlashib, sifatni aniqlaydigan, o‘lchaydigan va isbotlovchi mutaxassis bo‘lish.

Ikki turdagi sifat nazorati: avtomatik va lingvistik

QA (Quality Assurance) tarjimada ikki qatlamda ishlaydi:

Avtomatlashtirilgan QA: CAT vositalari va skriptlari ushlaydigan stilistik xatolar — raqamlarning mos kelmasligi, etishmayotgan/ortiqcha boʻsh joy, nomuvofiq atama, tarjima qilinmagan segment, notoʻgʻri toʻldiruvchi/teg, juft boʻshliq, tinish belgilari. Ular mashinada tez va to'liq skanerdan o'tkaziladi; U inson ko'zidan qochib ketadi, lekin transport vositasi uni ushlaydi.

LQA (Lingvistik sifat kafolati): Bu inson baholovchisi ma'no, terminologiya, uslub, grammatika va mahalliy muvofiqlikni tekshiradigan qatlamdir. Avtomatlashtirilgan QA "raqam mos keladimi?" savolga qaraydi; LQA "ma'nosi to'g'rimi, ohang mosmi, madaniy jihatdan mosmi?" U savolga qaraydi. Ikkalasi bir-birini to'ldiradi; Biri ikkinchisini almashtirmaydi.

Maslahat: Har doim avval avtomatik QA ni ishga tushiring; Rasmiy xatolarni tozalash inson baholovchiga haqiqiy lingvistik muammolarga e'tibor berishga imkon beradi. Raqam xatosi bilan bezovta bo'lgan sharhlovchi ohang xatosini o'tkazib yuboradi.

Xato ramkalari: MQM va DQF

Standart xato tipologiyalari sifatni "yaxshi/yomon" emas, balki o'lchanadigan qilish uchun ishlatiladi. Eng keng tarqalgani MQM (Ko'p o'lchovli sifat ko'rsatkichlari): u har bir xatoni toifaga (aniqlik, ravonlik, terminologiya, uslub, joylashuv, format) va vaznga (tanqidiy, asosiy, kichik) belgilaydi. Yana bir ramka DQF (Dynamic Quality Framework) bo'lib, MQM bilan birga tilga olinadi.

Nima uchun bu muhim? Chunki bu ramka yordamida siz tarjimaga xato ball berishingiz, turli tarjimonlar/motorlarni xolisona taqqoslashingiz va "bu matnni yetkazib berish mumkinmi?" Siz savolga raqamli chegara bilan javob berasiz. Masalan: kritik xato = 10 ball, katta = 5, kichik = 1; ma'lum bir chegaradan past matn har bir so'z uchun o'tadi.

Kritik xato: ma'noni o'zgartiradigan, xavfsizlik/huquqiy xavf tug'diradigan, brendga zarar etkazadigan xato (noto'g'ri doza, "mas'uliyatli" o'rniga "mas'ul emas"). Asosiy: buzg'unchi, ammo zararsiz. Minor: sezilarli, ammo ma'noni buzmaydi (minor uslub / tinish belgilari).

AIdan nazoratchi sifatida foydalanish - va uning chegaralari

AI tez va xatolik doirasi bilan tarjimani tekshirishda yordam beradi: siz “MQM toifalari bilan ushbu tarjimadagi toʻgʻrilik, terminologiya, ravonlik xatolarini belgilash” deyishingiz mumkin. Bu sizning ko'r nuqtalaringizni kamaytiradi va sizga tez "ikkinchi ko'z" beradi.

Ammo uchta muhim chegara mavjud: (1) AI o'zi ishlab chiqargan tarjimani tekshirishda ko'r bo'lishi mumkin - bir xil xatoni qilish va tasdiqlash; boshqa model bilan o'zaro tekshiring yoki manbaga qayting. (2) AI, shuningdek, gallyutsinatsion "xatolar" ni yaratishi mumkin - mavjud bo'lmagan xato haqida xabar bering; Har bir ogohlantirishni tasdiqlang. (3) AI tanqidiy xatoning haqiqiy jiddiyligini to'liq tushuna olmasligi mumkin (doza xatosi halokatli bo'lishi mumkin); Mutaxassis og'irlikni aniqlaydi. Shunday qilib, AI QAni tezlashtiradi, ammo yakuniy sifat qarori va etkazib berishni tasdiqlash insonga tegishli.

Diqqat: "AI QAdan o'tdi, u toza" deyish yolg'on ishonch hissidir. AI auditi insonning LQA o'rnini bosmaydi va manba bilan taqqoslash emas; bu ularni tezlashtiradigan oldingi skrining qatlami.

uchta mini holat

1-holat - Avtomatlashtirilgan QA 40 ta raqam xatosini topdi. Moliyaviy hisobotni tarjima qilishda avtomatlashtirilgan QA manba va maqsad o'rtasida 40 ta raqam/format nomuvofiqligini aniqladi (minglik ajratuvchi, kasr, valyuta). Inson ko'zi bularning ko'pini o'tkazib yuboradi; soniyalarda ro'yxatga olingan avtomobil.

2-holat - MQM balli dvigatelni tanlashga olib keldi. Bitta MQM byurosi ikki xil MT dvigatelining chiqishini 2000 so'z bilan baholadi: Dvigatel A 12 xato ball, Dvigatel B 31. Ob'ektiv o'lchov "qaysi biri yaxshiroq" degan bahsni ball bilan hal qildi; Byuro A Dvigatelini standartga aylantirdi va shunga mos ravishda qayta ko'rib chiqishdan keyingi byudjetini rejalashtirdi.

3-holat - AI auditi o'z xatosini o'tkazib yubordi. Tarjimon LLM tarjimasini xuddi shu LLM tomonidan nazorat qilgan; Model "muammo yo'q" dedi, bu o'zi qilgan terminologik xato. Xato tarjimon boshqa model va manba bilan o‘zaro tekshirilganda aniqlandi; Jamoa "bir xil model o'zini o'zi boshqarmasligi kerak" qoidasini qabul qildi.

To'rt nusxa ko'chirish shablonlari

1) MQM asosidagi xatolarni tekshirish:

Sizning rolingiz: LQA eksperti. Quyidagi manba va tarjimani solishtiring. Topilgan har bir xatoni quyidagi formatda taqdim eting: [toifa: aniqlik/terminologiya/ravonlik/uslub/format][vazn: tanqidiy/asosiy/kichik] [joylashuv] [izoh] [tuzatish]. Siz ishonchingiz komil bo'lmagan ogohlantirishni "tasdiqlash kerak" deb belgilang; xato ishlab chiqarish.Manba: [...] | Tarjima: [...]

2) Kritik xatolarni skanerlash (yuqori xavf):

FAQAT quyidagi tarjimada tanqidiy xatolarni qidiring: ma'no inversiyasi, raqam/doza/sana xatosi, inkor etishning yo'qolishi, qonuniy majburiyatni almashtirish, xavfsizlik haqida ogohlantirish xatosi. Kichkina uslub muammolariga e'tibor bermang. Har bir tanqidiy xulosa uchun manbani keltiring.Manba: [...] | Tarjima: [...]

3) Avtomatik QA qo'shimcha nazorati:

Quyidagi manba-maqsad juftliklarida rasmiy nomuvofiqliklarni sanab o'ting: raqam mos kelmasligi, etishmayotgan/qo'shimcha to'ldiruvchi yoki teg, nomuvofiq atama, tarjima qilinmagan segment, birlik/valyuta farqi. Faqat ularning joylashuvi bilan bog'liq muammolarni bering. Juftliklar: [...]

4) Mustaqil ikkinchi ko'z (o'zaro tekshirish):

Tarjimani XARAFSIZ baholang; Siz yozgan deb o'ylamang. Manbaga sodiqlik, terminologiya va tabiiylik uchun sifat bahosini (1-5) bering va eng yaxshi 3 ta muammoni sanab o'ting. Men qaror qabul qilishim kerak. Manba: [...] | Tarjima: [...]

Zaif taklif / Kuchli taklif

Zaif: "Bu tarjima yaxshimi?" (Hech qanday mezon yo'q; AI "umuman yaxshi" kabi foydasiz javobni qaytaradi.)

Kuchli: "Ushbu tarjimani manbaga qaratib tekshiring. Har bir xatoni toifa (aniqlik/terminologiya/ravonlik) va jiddiylik (muhim/katta/mayda) bilan belgilang. Ayniqsa, son, inkor va terminologik xatolarga eʼtibor qarating. Xatolarni oʻylab topmang; ishonchingiz komil boʻlmasa, “tasdiqlash zarur” deb belgilang."

Farqi: kuchli so'rov xato ramka va diqqatni beradi; Chiqarish - taqqoslanadigan va harakatga keltiriladigan sifat hisoboti.

Sifatli qatlamlar jadvali

qatlam

nima tutadi

Kim/nima qiladi

Avtomatik QA

Raqam, yorliq, mustahkamlik

Asbob/skript

AI nazorati

Mumkin ma'no/terminologiya xatolari

LLM (tasdiqlash bilan)

Insonning LQA

Ma’nosi, ohangi, madaniyati, vazni

ekspert baholovchi

MQM/DQF ball

Ob'ektiv xatolik reytingi

ramka bilan inson

Yetkazib berishni tasdiqlash

yakuniy javobgarlik

malakali tarjimon

Umumiy xatolar

  • Avtomatlashtirilgan QAni o'tkazib yuborish va to'g'ridan-to'g'ri o'qishga kirish. Stilistik xatolar diqqatni chalg'itadi.
  • AI tekshiruvini inson LQA bilan almashtirish. AI oldindan ko'rishadi, tasdiqlamaydi.
  • Xuddi shu modelga ega bo'lish o'z tarjimasini tekshiring. Ko'r nuqta; o'zaro tekshirish talab qilinadi.
  • Og'irlikdagi xatolar emas. Tanqidiy va kichikni bir xil ko'rish ustuvorlikni buzadi.
  • AI tomonidan tuzilgan "xatolarni" ularni tasdiqlamasdan tuzatish. Siz to'g'ri jumlani buzishingiz mumkin.

Avtomatik ko'rsatkichlar: BLEU, COMET va chegaralar

Sifatni o'lchashda avtomatlashtirilgan o'lchovlar dunyosi ham mavjud. BLEU (Bilingual Evaluation Understudy) mashina tarjimasini insoniy maʼlumot tarjimasi bilan solishtiradi va soʻzlarning oʻzaro kelishiga qarab 0-100 ball beradi; Bu uzoq vaqt davomida MT tizimlarini taqqoslash uchun standart edi. Yangi ko'rsatkich, COMET, neyron tarmoqqa asoslangan va semantik o'xshashlikni BLEUga qaraganda yaxshiroq aniqlaydi. Ushbu ko'rsatkichlar ikkita dvigatelni katta ma'lumotlarda tez va avtomatik ravishda solishtirish uchun qimmatlidir.

Ammo uning chegaralari aniq: BLEU kabi ko'rsatkichlar so'zlarning bir-biriga mos kelishiga qaraydi, lekin aslida ma'noni tushunmaydi. Ma'lumotnomadan farqli, ammo aniq tarjima past ball olishi mumkin; Malumotga o'xshash, lekin noto'g'ri tarjima yuqori ball olishi mumkin. Muhim salbiy xato - bu bitta so'z, shuning uchun u metrikaga ozgina ta'sir qiladi, lekin aslida halokatli. Shuning uchun avtomatlashtirilgan o'lchovlar tizim darajasidagi tendentsiyalarni o'lchaydi, individual matnning etkazib berilishini hal qilmaydi. MQM-ga asoslangan insoniy baholash va ekspert xulosasi tarjimaning avtomatik baho emas, balki mijozga borishini hal qiladi. O'lchovlarni sudya emas, balki kompas sifatida foydalaning.

qisqa bayoni; yakunida

Tarjima sifati sub'ektiv tuyg'u emas, u o'lchanadigan narsadir. Avtomatik QA rasmiy xatolarni yaxshilab tekshiradi; inson LQA ma'no, ohang va madaniyatni baholaydi; MQM kabi xato ramkalar sifatni toifa va vazn bo'yicha aniqlaydi, bu esa ob'ektiv taqqoslash imkonini beradi. AI bu nazoratni tezlashtiradigan kuchli ikkinchi ko'zdir, lekin u o'z tarjimasiga ko'r bo'lishi, xato qilishi va haqiqiy dunyo vaznini to'liq tushuna olmasligi mumkin; Shu sababli, yakuniy sifat qarori, tortish va etkazib berishni tasdiqlash vakolatli tarjimonga tegishli.

Ilova vazifasi

Mashina tarjimasi natijasini oling. Rasmiy xatolarni avval “avtomatik QA qoʻshimcha tekshiruvi” bilan roʻyxatlang, soʻngra “MQM asosidagi xatolarni tekshirish” yordamida lingvistik xatolarni toifa va vazn boʻyicha sanab chiqing. Men har bir xatoni (tanqidiy 10, asosiy 5, kichik 1) har bir so'z uchun chegara bilan baholayman va "uni yetkazib berish mumkinmi?" Savolga javob bering. Nihoyat, AI tomonidan belgilangan xatolarning qanchasi haqiqiy va qanchasi uydirma ekanligini manba bilan tasdiqlang.

nazorat ro'yxati

  • [ ] Men avtomatik QA ni ishga tushirdim va barcha rasmiy xatolarni tozaladim.
  • [ ] Men lingvistik xatolarni quti bilan belgiladim (toifa + vazn).
  • [ ] Men muhim xatolarni alohida, ustuvor turda skanerladim.
  • [ ] Men sun'iy intellekt boshqaruvini oldim va agar kerak bo'lsa, uni boshqa model bilan o'zaro tekshirdim.
  • [ ] Raqamli chegara va oʻz ekspert xulosam asosida yetkazib berish qarorini qabul qildim.