Kitengo 8 / 11

Udhibiti wa Ubora (QA), Vipimo vya Tathmini na LQA

Faida:

  • Uwezo wa kutofautisha kati ya tabaka za kiotomatiki za QA na LQA za lugha na kuzitumia zote kwa mpangilio sahihi
  • Uwezo wa kutathmini tafsiri kulingana na kategoria na uzito (muhimu/kubwa/ndogo) na mfumo wa makosa kama vile MQM.
  • Kuwa na uwezo wa kufanya uamuzi wa mwisho wakati wa kutumia AI kama mkaguzi, kujua upofu wake kwa tafsiri yake mwenyewe, hatari ya kufanya makosa, na mipaka ya metriki za kiotomatiki.

Wakati unaposema tafsiri "imefanywa", hiyo ni nusu ya kazi; Nusu nyingine ni kuthibitisha kwamba tafsiri hiyo kweli inategemeka. Katika kitengo hiki, utajifunza njia za utaratibu za kupima ubora wa tafsiri: ukaguzi wa kiotomatiki wa QA, mifumo ya hitilafu ya LQA inayotegemea binadamu, vipimo vya ubora, na jinsi ya kutumia AI kama "mkaguzi" - na mipaka yake. Kusudi ni kuachana na mada ya "Nadhani ni nzuri" na kuwa mtaalamu anayefafanua, kupima na kuthibitisha ubora.

Aina mbili za udhibiti wa ubora: otomatiki na lugha

QA (Uhakikisho wa Ubora) hufanya kazi katika tabaka mbili katika tafsiri:

QA otomatiki: Hitilafu za kimtindo ambazo zana na hati za CAT hupata — nambari kutolingana, kukosa/nafasi kupita kiasi, neno lisilolingana, sehemu isiyotafsiriwa, kishika nafasi/lebo mbaya, nafasi mbili, uakifishaji. Hizi huchanganuliwa haraka na kabisa na mashine; Huepuka jicho la mwanadamu, lakini gari huipata.

LQA (Uhakikisho wa Ubora wa Lugha): Hili ni safu ambapo mtathmini binadamu huchunguza maana, istilahi, mtindo, sarufi na ufaafu wa kimaeneo. QA otomatiki "je nambari inalingana?" angalia swali; LQA "maana ni sahihi, toni inafaa, inafaa kitamaduni?" Anaangalia swali. Vyote viwili vinakamilishana; Moja haibadilishi nyingine.

Kidokezo: Daima endesha Auto QA kwanza; Kusafisha makosa rasmi humruhusu mtathmini binadamu kujishughulisha na matatizo halisi ya lugha. Mkaguzi anayejisumbua na hitilafu ya nambari atakosa hitilafu ya sauti.

Fremu za hitilafu: MQM na DQF

Aina za makosa ya kawaida hutumika kufanya ubora kupimika badala ya "nzuri/mbaya." Inayojulikana zaidi ni MQM (Metriki za Ubora za Multidimensional): huweka kila kosa kwa kategoria (usahihi, ufasaha, istilahi, mtindo, eneo, umbizo) na uzani (muhimu, kuu, ndogo). Mfumo mwingine ni DQF (Dynamic Quality Framework) na imetajwa pamoja na MQM.

Kwa nini ni muhimu? Kwa sababu kwa mfumo huu, unaweza kutoa alama ya makosa kwa tafsiri, kulinganisha kwa ukamilifu wafasiri/injini mbalimbali na kuuliza "je maandishi haya yanaweza kuwasilishwa?" Unajibu swali kwa kizingiti cha nambari. Kwa mfano: kosa muhimu = pointi 10, kubwa = 5, ndogo = 1; maandishi chini ya kizingiti fulani hupita kwa neno fulani.

Hitilafu muhimu: hitilafu ambayo inageuza maana, inaleta hatari ya kiusalama/kisheria, inaharibu chapa (kipimo kisicho sahihi, "si kuwajibika" badala ya "kuwajibika"). Kubwa: inasumbua lakini haina madhara. Ndogo: inaonekana lakini haipunguzi maana (mtindo mdogo/uakifishaji).

Kutumia AI kama kidhibiti - na mipaka yake

AI ni ya haraka na inasaidia katika kukagua tafsiri dhidi ya mfumo wa hitilafu: unaweza kusema "alama ya usahihi, istilahi, makosa ya ufasaha katika tafsiri hii kwa kategoria za MQM". Inapunguza upofu wako na kukupa "jicho la pili" la haraka.

Lakini kuna vikomo vitatu muhimu: (1) AI inaweza kuwa kipofu wakati wa kuangalia tafsiri inayotoa - kufanya na kuthibitisha kosa sawa; angalia na modeli tofauti au urudi kwenye chanzo. (2) AI inaweza pia kutengeneza "makosa" ya kuogofya - kuripoti hitilafu ambayo haipo; Thibitisha kila onyo. (3) AI inaweza isielewe kikamilifu ukali wa ulimwengu halisi wa kosa muhimu (hitilafu ya kipimo inaweza kusababisha kifo); Mtaalam hufanya uzani. Kwa hivyo AI huharakisha QA, lakini uamuzi wa mwisho wa ubora na idhini ya uwasilishaji iko kwa mwanadamu.

Tahadhari: Kusema "AI imepita QA, ni safi" ni hisia ya uwongo ya kujiamini. Ukaguzi wa AI sio mbadala wa LQA ya binadamu na kulinganisha na chanzo; ni safu ya uchunguzi wa awali ambayo inawafanya waongeze kasi.

kesi tatu ndogo

Kesi ya 1 - QA ya kiotomatiki ilipata hitilafu 40 za nambari. Katika tafsiri ya ripoti ya fedha, QA otomatiki ilipata kutolingana kwa nambari/umbizo kati ya chanzo na lengwa (kitenganishi elfu, desimali, sarafu). Jicho la mwanadamu lingekosa mengi ya haya; gari iliyoorodheshwa kwa sekunde.

Kesi ya 2 - Alama ya MQM ilisababisha uteuzi wa injini. Ofisi moja ya MQM ilikadiria matokeo ya injini mbili tofauti za MT kwa maneno 2,000: Injini A pointi 12 za hitilafu, Injini B 31. Kipimo cha lengo kilisuluhisha mjadala wa "kipi ni bora" kwa alama; Ofisi hiyo iliifanya Injini A kuwa ya kiwango na ikapanga bajeti yake ya baada ya marekebisho ipasavyo.

Kesi ya 3 - Ukaguzi wa AI ulikosa makosa yake yenyewe. Mfasiri alikuwa na tafsiri ya LLM isimamiwe na LLM hiyohiyo; Mwanamitindo alisema "hakuna shida", kosa la istilahi alilofanya mwenyewe. Hitilafu ilifichuliwa wakati mfasiri alipokagua kwa kutumia modeli na chanzo tofauti; Timu ilipitisha sheria kwamba "mfano sawa haupaswi kujidhibiti".

Violezo vinne vinavyoweza kunakiliwa

1) ukaguzi wa makosa ya msingi wa MQM:

Jukumu lako: Mtathmini wa LQA. Linganisha chanzo na tafsiri hapa chini. Toa kila kosa unalopata katika umbizo lifuatalo: [aina: usahihi/istilahi/ufasaha/mtindo/umbizo][uzito: muhimu/kubwa/madogo] [eneo] [maoni] [kusahihisha]. Weka alama kwenye onyo ambalo huna uhakika nalo kama "uthibitisho unahitajika"; errorfabrication.Chanzo: [...] | Tafsiri: [...]

2) Uchanganuzi wa makosa muhimu (hatari kubwa):

Tafuta makosa muhimu TU katika tafsiri iliyo hapa chini: ubadilishaji wa maana, hitilafu ya nambari/dozi/tarehe, kupoteza kukanusha, uingizwaji wa wajibu wa kisheria, hitilafu ya onyo la usalama. Puuza masuala madogo ya mitindo. Taja chanzo cha kila utafutaji muhimu.Chanzo: [...] | Tafsiri: [...]

3) Udhibiti wa ziada wa QA otomatiki:

Orodhesha kutofautiana rasmi katika jozi za lengwa zifuatazo: nambari kutolingana, kukosa/kishika nafasi cha ziada au lebo, neno lisilolingana, sehemu isiyotafsiriwa, tofauti ya kitengo/fedha. Toa tu shida na eneo lao. Jozi: [...]

4) Jicho la pili linalojitegemea (angalia-angalia):

Tathmini tafsiri hii BILA UBAGUZI; Usidhani uliandika. Ipe chanzo ukadiriaji wa ubora (1-5) wa uaminifu, istilahi na uasilia, na uorodheshe matatizo 3 makuu. Ni juu yangu kuamua. Chanzo: [...] | Tafsiri: [...]

Mwongozo dhaifu / Mwongozo thabiti

Dhaifu: "Je, tafsiri hii ni nzuri?" (Hakuna vigezo; AI inarudisha jibu lisilo na maana kama "nzuri kwa ujumla.")

Imara: "Angalia tafsiri hii dhidi ya chanzo. Weka kila kosa lebo kwa kategoria (usahihi/istilahi/ufasaha) na ukali (muhimu/kubwa/ndogo). Lenga hasa makosa ya nambari, ukanushaji na istilahi. Usitunge makosa; weka alama 'uthibitisho unahitajika' ikiwa huna uhakika."

Tofauti: haraka haraka inatoa sura ya makosa na kuzingatia; Matokeo ni ripoti ya ubora inayoweza kulinganishwa na inayoweza kutekelezeka.

Jedwali la tabaka za ubora

safu

kinachoshika

Nani/nini anafanya

Auto QA

Nambari, lebo, uthabiti

Chombo/script

Udhibiti wa AI

Makosa ya maana/istilahi zinazowezekana

LLM (pamoja na uthibitisho)

LQA ya binadamu

Maana, sauti, utamaduni, uzito

mtaalam wa tathmini

Alama ya MQM/DQF

Alama ya kosa la lengo

binadamu mwenye sura

Uthibitishaji wa utoaji

wajibu wa mwisho

mfasiri stadi

Makosa ya kawaida

  • Kuruka QA ya kiotomatiki na kuanza kusoma moja kwa moja. Makosa ya kimtindo huvuruga umakini.
  • Kubadilisha ukaguzi wa AI na LQA ya binadamu. Skrini za awali za AI, haziidhinishi.
  • Kuwa na muundo sawa angalia tafsiri yake mwenyewe. Mahali pa upofu; ukaguzi wa msalaba unahitajika.
  • Sio makosa ya uzani. Kuona muhimu na ndogo kama sawa huvuruga kipaumbele.
  • Kurekebisha "makosa" yaliyoundwa na AI bila kuyathibitisha. Unaweza kupotosha sentensi sahihi.

Vipimo otomatiki: BLEU, COMET na vikomo

Pia kuna ulimwengu wa vipimo vya kiotomatiki katika kipimo cha ubora. BLEU (Bilingual Evaluation Understudy) inalinganisha tafsiri ya mashine na tafsiri ya marejeleo ya binadamu na inatoa alama 0-100 kulingana na mwingiliano wa maneno; Ilikuwa kiwango cha kulinganisha mifumo ya MT kwa muda mrefu. Kipimo kipya zaidi, COMET, ni msingi wa mtandao wa neva na hunasa mfanano wa kimaana bora kuliko BLEU. Vipimo hivi ni muhimu kwa kulinganisha kwa haraka na kiotomatiki injini mbili kwenye data kubwa.

Lakini mipaka yake ni wazi: Vipimo kama vile BLEU hutazama mwingiliano wa maneno, bila kuelewa maana kabisa. Tafsiri ambayo inatofautiana na marejeleo lakini ni sahihi inaweza kupokea alama ya chini; Tafsiri inayofanana na marejeleo lakini isiyo sahihi inaweza kupokea alama za juu. Hitilafu kubwa ya uhasidi ni neno moja kwa hivyo ina athari kidogo kwenye kipimo, lakini kwa kweli ni janga. Ndiyo maana vipimo vya kiotomatiki hupima mitindo katika kiwango cha mfumo, na si kuamua uwasilishaji wa maandishi mahususi. Tathmini ya kibinadamu inayotegemea MQM na uamuzi wa kitaalamu huamua kama tafsiri iende kwa mteja, wala si alama ya kiotomatiki. Tumia vipimo kama dira, si mwamuzi.

Kwa muhtasari

Ubora wa kutafsiri sio hisia ya kibinafsi, ni kitu kinachoweza kupimika. QA otomatiki huchanganua kabisa makosa rasmi; binadamu LQA kutathmini maana, tone, na utamaduni; Miundo ya hitilafu kama vile MQM inakadiria ubora kwa kategoria na uzito, kuwezesha ulinganisho wa lengo. AI ni jicho la pili lenye nguvu ambalo huharakisha udhibiti huu, lakini linaweza kuwa kipofu kwa tafsiri yake yenyewe, kufanya makosa, na kushindwa kufahamu kikamilifu uzito wa ulimwengu halisi; Kwa hivyo, uamuzi wa mwisho wa ubora, uzani na idhini ya uwasilishaji ni ya mtafsiri anayefaa.

Jukumu la maombi

Pata toleo la tafsiri ya mashine. Orodhesha makosa rasmi kwanza kwa "ukaguzi wa ziada wa QA otomatiki", kisha orodhesha makosa ya lugha kwa kategoria na uzani kwa "ukaguzi wa makosa kulingana na MQM". Ninakadiria kila kosa (muhimu 10, kuu 5, ndogo 1) kwa kizingiti kwa kila neno na kuuliza "je inaweza kutolewa?" Jibu swali. Mwishowe, thibitisha na chanzo ni makosa mangapi yaliyoalamishwa na AI ni ya kweli na ni mangapi yametungwa.

orodha ya ukaguzi

  • [ ] Niliendesha QA kiotomatiki na nikasafisha makosa yoyote rasmi.
  • [ ] Nilitia alama makosa ya lugha kwa kisanduku (aina + uzito).
  • [ ] Nilichanganua makosa muhimu katika duru tofauti, iliyopewa kipaumbele.
  • [ ] Nilitoa kidhibiti cha AI na kukikagua kwa modeli tofauti ikiwa ni lazima.
  • [ ] Nilifanya uamuzi wa uwasilishaji kulingana na kiwango cha nambari na uamuzi wangu mwenyewe wa kitaalamu.