Njësia 8 / 11

Kontrolli i Cilësisë (QA), Metrikat e Vlerësimit dhe LQA

Fitimet:

  • Aftësia për të dalluar midis shtresave automatike të QA dhe LQA gjuhësore dhe për t'i zbatuar të dyja në rendin e duhur
  • Aftësia për të vlerësuar objektivisht përkthimin sipas kategorisë dhe peshës (kritike / madhore / e vogël) me një kornizë gabimi si MQM
  • Të jesh në gjendje të marrësh vendimin përfundimtar kur përdor AI si auditor, duke ditur verbërinë e tij ndaj përkthimit të tij, rrezikun e bërjes së gabimeve dhe kufijtë e metrikës së automatizuar

Në momentin që thua se një përkthim është "mbaruar", kjo është gjysma e punës; Gjysma tjetër është për të vërtetuar se ai përkthim është në të vërtetë i besueshëm. Në këtë njësi, do të mësoni mënyra sistematike për të matur cilësinë e përkthimit: kontrollet e automatizuara të cilësisë së cilësisë, kornizat e gabimeve LQA të bazuara në njerëz, metrikat e cilësisë dhe si të përdorni AI si "inspektor" - dhe kufijtë e saj. Synimi është të largohemi nga subjektiviteti i "mendoj se është mirë" dhe të bëhemi një ekspert që përcakton, mat dhe provon cilësinë.

Dy lloje të kontrollit të cilësisë: automatik dhe gjuhësor

QA (Sigurimi i Cilësisë) funksionon në dy shtresa në përkthim:

QA e automatizuar: Gabimet stilistike që kapin mjetet dhe skriptet CAT — mospërputhja e numrave, hapësira e munguar/e tepërt, termi jokonsistent, segmenti i papërkthyer, mbajtës/etiketimi i keq, hapësira e dyfishtë, shenja pikësimi. Këto skanohen shpejt dhe plotësisht me makinë; I ikën syrit të njeriut, por automjeti e kap.

LQA (Linguistic Quality Assurance): Kjo është shtresa ku një vlerësues njerëzor shqyrton kuptimin, terminologjinë, stilin, gramatikën dhe përshtatshmërinë lokale. QA e automatizuar "a përputhet numri?" shikon pyetjen; LQA "a është kuptimi i saktë, a është toni i përshtatshëm, a është i përshtatshëm kulturalisht?" Ai shikon pyetjen. Të dyja plotësojnë njëra-tjetrën; Njëra nuk zëvendëson tjetrën.

Këshillë: Drejtoni gjithmonë në fillim Auto QA; Pastrimi i gabimeve formale i lejon vlerësuesit njerëzor t'i kushtojë vëmendje problemeve reale gjuhësore. Një recensues që shqetësohet me gabimin e numrave do të humbasë gabimin e tonit.

Kornizat e gabimit: MQM dhe DQF

Tipologjitë standarde të gabimeve përdoren për ta bërë cilësinë të matshme në vend të "mirë/keq". Më i zakonshmi është MQM (Multidimensional Quality Metrics): ai cakton çdo gabim në një kategori (saktësia, rrjedhshmëria, terminologjia, stili, lokaliteti, formati) dhe një peshë (kritike, kryesore, e vogël). Një kornizë tjetër është DQF (Dynamic Quality Framework) dhe përmendet së bashku me MQM.

Pse është e rëndësishme? Sepse me këtë kornizë, ju mund t'i jepni një rezultat gabimi një përkthimi, të krahasoni objektivisht përkthyes/motorë të ndryshëm dhe të pyesni "a mund të dorëzohet ky tekst?" Ju i përgjigjeni pyetjes me një prag numerik. Për shembull: gabim kritik = 10 pikë, madhor = 5, minor = 1; teksti nën një prag të caktuar kalon për fjalë të caktuar.

Gabim kritik: gabim që përmbys kuptimin, krijon siguri/rrezik ligjor, dëmton markën (dozë e gabuar, "jo përgjegjës" në vend të "përgjegjës"). Kryesorja: përçarëse, por e padëmshme. E vogël: e dukshme, por jo e pakësuar nga kuptimi (stili i vogël/shenja e pikësimit).

Përdorimi i AI si një kontrollues - dhe kufijtë e tij

AI është i shpejtë dhe i dobishëm në kontrollimin e një përkthimi kundrejt kornizës së gabimit: mund të thoni "shënoni saktësinë, terminologjinë, gabimet e rrjedhshmërisë në këtë përkthim me kategoritë MQM". Redukton pikat tuaja të verbëra dhe ju jep një “sy të dytë” të shpejtë.

Por ka tre kufij kritikë: (1) AI mund të jetë i verbër kur kontrollon përkthimin që prodhon - si duke bërë ashtu edhe duke konfirmuar të njëjtin gabim; kontrolloni me një model tjetër ose kthehuni te burimi. (2) AI gjithashtu mund të krijojë "gabime" halucinative - raportoni një gabim që nuk ekziston; Konfirmoni çdo paralajmërim. (3) AI mund të mos e kuptojë plotësisht ashpërsinë e botës reale të një gabimi kritik (një gabim dozë mund të jetë fatal); Eksperti bën peshimin. Kështu që AI përshpejton sigurimin e cilësisë, por vendimi përfundimtar i cilësisë dhe miratimi i dorëzimit i takon njeriut.

Kujdes: Të thuash "AI ka kaluar QA, është i pastër" është një ndjenjë e rreme besimi. Auditimi i UA nuk është një zëvendësim për LQA njerëzore dhe krahasimi me burimin; është një shtresë para-skanimi që i bën ato të shpejta.

tre mini kuti

Rasti 1 - QA e automatizuar gjeti 40 gabime numrash. Në një përkthim të raportit financiar, QA e automatizuar kapi 40 mospërputhje numrash/format midis burimit dhe objektivit (ndarësi i mijë, dhjetore, monedhë). Syrit të njeriut do t'i mungonte shumica e këtyre; automjeti i listuar në sekonda.

Rasti 2 - Rezultati MQM çoi në zgjedhjen e motorit. Një zyrë MQM vlerësoi prodhimin e dy motorëve të ndryshëm MT me 2000 fjalë: Motori A 12 pikë gabimi, Motori B 31. Matja objektive e zgjidhi debatin "cili është më mirë" me një rezultat; Byroja e bëri Motorin A standard dhe planifikoi buxhetin e tij pas rishikimit në përputhje me rrethanat.

Rasti 3 - Auditimi i AI humbi gabimin e vet. Një përkthyes kishte përkthimin e LLM-së të mbikëqyrur nga e njëjta LLM; Modelja tha “nuk ka problem”, një gabim terminologjik që e bëri vetë. Gabimi u zbulua kur përkthyesi kontrolloi një model dhe burim tjetër; Ekipi miratoi rregullin se "i njëjti model nuk duhet të kontrollojë veten".

Katër shabllone të kopjueshëm

1) Kontrollimi i gabimeve të bazuara në MQM:

Roli juaj: vlerësues i LQA. Krahasoni burimin dhe përkthimin më poshtë. Jepni çdo gabim që gjeni në formatin e mëposhtëm: [kategoria: saktësia/terminologjia/rrjedhshmëria/stili/formati][pesha: kritike/i madh/i vogël] [vendndodhja] [koment] [korrigjim]. Shënoni paralajmërimin për të cilin nuk jeni të sigurt si "kërkohet konfirmim"; errorfabrication.Burimi: [...] | Përkthimi: [...]

2) Skanimi i gabimeve kritike (rrezik i lartë):

Kërkoni për gabime kritike VETËM në përkthimin e mëposhtëm: kuptimi i përmbysjes, numri/doza/gabimi i datës, humbja e mohimit, zëvendësimi i detyrimit ligjor, gabimi i paralajmërimit të sigurisë. Injoroni problemet e vogla të stilit. Citoni burimin për çdo gjetje kritike.Burimi: [...] | Përkthimi: [...]

3) Kontrolli suplementar automatik i QA:

Rendisni mospërputhjet formale në çiftet e mëposhtme burim-objektiv: mospërputhja e numrave, vendmbajtësi ose etiketa që mungon/shtesë, termi jo konsistent, segmenti i papërkthyer, diferenca njësi/monedhe. Thjesht jepni problemet me vendndodhjen e tyre. Çiftet: [...]

4) Syri i dytë i pavarur (kontroll i kryqëzuar):

Vlerëso këtë përkthim PA PARAGJYKIM; Mos supozoni se e keni shkruar. Jepini burimit një vlerësim të cilësisë (1-5) për besnikërinë, terminologjinë dhe natyrshmërinë dhe renditni 3 problemet kryesore. Më takon mua të vendos. Burimi: [...] | Përkthimi: [...]

Prompt i dobët / Prompt i fortë

Dobët: "A është i mirë ky përkthim?" (Pa kriter; AI kthen një përgjigje të padobishme si "përgjithësisht mirë.")

Strong: "Kontrollo këtë përkthim nga burimi. Etiketo çdo gabim me kategorinë (saktësinë/terminologji/rrjedhshmëri) dhe ashpërsinë (kritike/të mëdha/të vogla). Përqendrohuni veçanërisht te gabimet e numrave, mohimit dhe terminologjisë. Mos fabrikoni gabime; shënoni "konfirmimi i nevojshëm" nëse nuk jeni të sigurt."

Dallimi: prompti i fortë jep një kornizë gabimi dhe fokus; Rezultati është një raport cilësor i krahasueshëm dhe i zbatueshëm.

Tabela e shtresave cilësore

shtresë

çfarë kap

Kush/çfarë bën

Auto QA

Numri, etiketa, konsistenca

Mjet/skrip

Kontrolli i AI

Gabime të mundshme kuptimore/terminologjike

LLM (me konfirmim)

LQA njerëzore

Kuptimi, toni, kultura, pesha

ekspert vlerësues

Rezultati i MQM/DQF

Rezultati i gabimit objektiv

njeri me kornizë

Konfirmimi i dorëzimit

përgjegjësia përfundimtare

përkthyes kompetent

Gabimet e zakonshme

  • Duke anashkaluar QA-në e automatizuar dhe duke hyrë direkt në lexim. Gabimet stilistike shpërqendrojnë vëmendjen.
  • Zëvendësimi i inspektimit të AI me LQA njerëzore. AI para-ekranet, nuk miratohet.
  • Duke pasur të njëjtin model, kontrolloni përkthimin e tij. Pika e verbër; kërkohet një kontroll i kryqëzuar.
  • Jo gabime peshimi. Të shohësh të njëjtën gjë kritike dhe të vogël e prish prioritetin.
  • Korrigjimi i "gabimeve" të bëra nga AI pa i konfirmuar ato. Ju mund të shtrembëroni fjalinë e duhur.

Metrikë automatike: BLEU, COMET dhe kufijtë

Ekziston gjithashtu një botë metrikash të automatizuara në matjen e cilësisë. BLEU (Dylingual Evaluation Understudy) krahason një përkthim automatik me një përkthim referimi njerëzor dhe jep një rezultat 0-100 bazuar në mbivendosjen e fjalëve; Ishte standardi për krahasimin e sistemeve MT për një kohë të gjatë. Një metrikë më e re, COMET, bazohet në rrjetin nervor dhe kap ngjashmërinë semantike më mirë se BLEU. Këto metrika janë të vlefshme për krahasimin e shpejtë dhe automatik të dy motorëve në të dhëna të mëdha.

Por kufijtë e saj janë të qartë: Metrikat si BLEU shikojnë mbivendosjen e fjalëve, duke mos kuptuar vërtet kuptimin. Një përkthim që ndryshon nga referenca, por është i saktë, mund të marrë një rezultat të ulët; Një përkthim që është i ngjashëm me referencën, por i pasaktë, mund të marrë një rezultat të lartë. Një gabim kritik negativiteti është një fjalë e vetme, kështu që ka pak ndikim në metrikë, por në të vërtetë është katastrofik. Kjo është arsyeja pse metrikat e automatizuara masin tendencat në nivel sistemi, jo vendosin për ofrimin e një teksti individual. Vlerësimi njerëzor i bazuar në MQM dhe gjykimi i ekspertëve vendosin nëse një përkthim i shkon klientit, jo një rezultat automatik. Përdorni metrikën si busull, jo si gjyqtar.

Në përmbledhje

Cilësia e përkthimit nuk është një ndjenjë subjektive, është diçka e matshme. QA automatike skanon tërësisht për gabime formale; LQA njerëzore vlerëson kuptimin, tonin dhe kulturën; Kornizat e gabimeve si MQM përcaktojnë cilësinë sipas kategorisë dhe peshës, duke mundësuar krahasimin objektiv. AI është një sy i dytë i fuqishëm që e përshpejton këtë kontroll, por mund të jetë i verbër ndaj përkthimit të vet, të bëjë gabime dhe të mos arrijë të kuptojë plotësisht peshën e botës reale; Prandaj, vendimi përfundimtar i cilësisë, peshimi dhe miratimi i dorëzimit i takon përkthyesit kompetent.

Detyra e aplikimit

Merrni një rezultat përkthimi me makinë. Listoni gabimet formale fillimisht me "kontrollin plotësues automatik të QA", më pas renditni gabimet gjuhësore sipas kategorisë dhe peshës me "kontrollin e gabimeve të bazuara në MQM". Unë e vlerësoj çdo gabim (kritik 10, i madh 5, i vogël 1) me një prag për fjalë dhe pyes "a mund të dorëzohet?" Përgjigjuni pyetjes. Më në fund, konfirmoni me burimin se sa nga gabimet e shënuara nga AI janë reale dhe sa janë të fabrikuara.

listë kontrolli

  • [ ] Kam ekzekutuar QA automatike dhe kam pastruar çdo gabim formal.
  • [ ] I shënova gabimet gjuhësore me një kuti (kategori + peshë).
  • [ ] I skanova gabimet kritike në një raund të veçantë, me prioritet.
  • [ ] Kam marrë kontrollin e AI dhe e kontrollova atë me një model tjetër nëse ishte e nevojshme.
  • [ ] Unë e mora vendimin e dorëzimit bazuar në pragun numerik dhe gjykimin tim të ekspertit.