Üksus 8 / 11

Kvaliteedikontroll (QA), hindamismõõdikud ja LQA

Kasu:

  • Oskus eristada automaatset kvaliteedikontrolli ja keelelist LQA kihte ning rakendada mõlemat õiges järjekorras
  • Võimalus tõlget objektiivselt hinnata vastavalt kategooriale ja kaalule (kriitiline/suur/väikse tähtsusega) vearaamistikuga nagu MQM
  • Võimalus teha tehisintellekti audiitorina kasutamisel lõplik otsus, teades selle pimedust oma tõlke suhtes, vigade tegemise ohtu ja automatiseeritud mõõdikute piire

Hetkel, kui ütlete, et tõlge on "tehtud", on see pool tööd; Teine pool on tõestada, et see tõlge on tegelikult usaldusväärne. Selles õppetükis õpite süstemaatilisi viise tõlkekvaliteedi mõõtmiseks: automatiseeritud kvaliteedikontrolli kontrollid, inimpõhised LQA vearaamistikud, kvaliteedimõõdikud ja kuidas kasutada tehisintellekti "inspektorina" – ja selle piire. Eesmärk on eemalduda subjektiivsusest "ma arvan, et see on hea" ja saada eksperdiks, kes määratleb, mõõdab ja tõestab kvaliteeti.

Kaht tüüpi kvaliteedikontrolli: automaatne ja keeleline

Kvaliteedi tagamine (QA) toimib tõlkimisel kahes kihis:

Automatiseeritud kvaliteedi tagamine: stiilivead, mida CAT-tööriistad ja skriptid tabavad – numbrite mittevastavus, puuduv/liigne tühik, ebajärjekindel termin, tõlkimata segment, halb kohahoidja/silt, topelttühik, kirjavahemärgid. Need skannitakse kiiresti ja täielikult masinaga; See pääseb inimsilma eest, kuid sõiduk püüab selle kinni.

LQA (lingvistilise kvaliteedi tagamine): see on kiht, kus hindaja uurib tähendust, terminoloogiat, stiili, grammatikat ja kohalikku sobivust. Automaatne QA "kas number sobib?" vaatab küsimust; LQA "kas tähendus on õige, kas toon on sobiv, kas see on kultuuriliselt sobiv?" Ta vaatab küsimust. Need kaks täiendavad üksteist; Üks ei asenda teist.

Näpunäide. Käivitage alati esmalt Auto QA; Vormivigade kõrvaldamine võimaldab hindajal pöörata tähelepanu tegelikele keeleprobleemidele. Arvustaja, kes viitsib numbriveaga, jätab tooniviga märkamata.

Vearaamid: MQM ja DQF

Kvaliteedi „hea/halva” asemel mõõdetavaks muutmiseks kasutatakse standardsete vigade tüpoloogiaid. Kõige levinum on MQM (Multidimensional Quality Metrics): see määrab iga vea kategooria (täpsus, sujuvus, terminoloogia, stiil, asukoht, formaat) ja kaalu (kriitiline, suur, kõrvaline). Teine raamistik on DQF (Dynamic Quality Framework) ja seda mainitakse koos MQM-iga.

Miks see oluline on? Sest selle raamistikuga saab anda tõlkele veahinde, võrrelda objektiivselt erinevaid tõlkijaid/mootoreid ja küsida "kas seda teksti saab edastada?" Vastate küsimusele numbrilise lävega. Näiteks: kriitiline viga = 10 punkti, suur = 5, väike = 1; tekst, mis jääb alla teatud läve, möödub teatud sõna kohta.

Kriitiline viga: viga, mis muudab tähenduse, loob turvalisuse/õigusliku riski, kahjustab kaubamärki (vale doos, "ei vastuta" asemel "vastutab"). Peamine: häiriv, kuid kahjutu. Minor: märgatav, kuid ei vähenda tähendust (väiksem stiil/kirjavahemärgid).

AI kasutamine kontrollerina – ja selle piirid

Tehisintellekt on kiire ja abiks tõlke kontrollimisel vearaamistiku suhtes: võite öelda "märkige selle tõlke korrektsus, terminoloogia, sujuvusvead MQM-kategooriatega". See vähendab teie pimealasid ja annab teile kiire "teise silma".

Kuid on kolm kriitilist piiri: (1) tehisintellekt võib oma toodetud tõlke kontrollimisel olla pime – nii teeb sama viga kui ka kinnitab seda; ristkontrollige mõne muu mudeliga või pöörduge tagasi allika juurde. (2) AI võib välja mõelda ka hallutsinatoorseid "vigu" – teatage veast, mida pole olemas; Kinnitage iga hoiatus. (3) tehisintellekt ei pruugi täielikult hoomata kriitilise vea tõsidust tegelikust maailmast (doosiviga võib lõppeda surmaga); Ekspert teeb kaalumise. Seega kiirendab tehisintellekt kvaliteedi tagamist, kuid lõpliku kvaliteediotsuse ja tarnimise heakskiidu teeb inimene.

Ettevaatust: ütlus "AI on läbinud kvaliteedikontrolli, see on puhas" on vale enesekindlustunne. AI auditeerimine ei asenda inimese LQA-d ja võrdlust allikaga; see on eelsõelumiskiht, mis kiirendab neid.

kolm minikarpi

Juhtum 1 – automaatne kvaliteedikontroll leidis 40 numbriviga. Finantsaruannete tõlkes tuvastas automaatne kvaliteedikontroll 40 numbri/vormingu mittevastavust allika ja sihtmärgi vahel (tuhande eraldaja, kümnendkoht, valuuta). Inimsilm tunneks enamikust neist puudust; sõiduki loendis sekundites.

Juhtum 2 – MQM skoor viis mootori valikuni. Üks büroo MQM hindas kahe erineva MT mootori väljundit 2000 sõnaga: Mootor A 12 veapunkti, Mootor B 31. Objektiivne mõõtmine lahendas arutluse "kumb on parem" tulemusega; Büroo muutis mootori A standardiks ja kavandas vastavalt oma läbivaatamisjärgse eelarve.

Juhtum 3 – AI audit jättis oma vea märkamata. Tõlkija lasi LLM-i tõlke üle juhendada sama LLM; Modell ütles "pole probleemi", terminoloogiavea tegi ta ise. Viga ilmnes, kui tõlkija tegi ristkontrolli teise mudeli ja allikaga; Meeskond võttis kasutusele reegli, et "sama mudel ei tohiks ennast kontrollida".

Neli kopeeritavat malli

1) MQM-põhine veakontroll:

Teie roll: LQA hindaja. Võrrelge allolevat allikat ja tõlget. Esitage kõik leitud vead järgmises vormingus: [kategooria: täpsus/terminoloogia/sujuvus/stiil/vorming][kaal: kriitiline/oluline/väike] [asukoht] [kommentaar] [parandus]. Märkige hoiatus, milles te pole kindel, kui "vajalik kinnitus"; vigade valmistamine.Allikas: [...] | Tõlge: [...]

2) Kriitiliste vigade skannimine (suur risk):

Otsige kriitilisi vigu AINULT allolevast tõlkest: tähendus inversioon, arvu/annuse/kuupäeva viga, eituse kadu, juriidilise kohustuse asendamine, ohutushoiatuse viga. Ignoreeri väiksemaid stiiliprobleeme. Viidake iga kriitilise leiu allikale.Allikas: [...] | Tõlge: [...]

3) Automaatne kvaliteedikontrolli lisajuhtimine:

Loetlege formaalsed vastuolud järgmistes allika-sihtmärgi paarides: numbrite mittevastavus, puuduv/liigne kohahoidja või silt, vastuoluline termin, tõlkimata segment, ühiku/valuuta erinevus. Lihtsalt kirjeldage nende asukohaga seotud probleeme. Paarid: [...]

4) Sõltumatu teine silm (ristkontroll):

Hinda seda tõlget ILMA eelarvamusteta; Ärge arvake, et olete selle kirjutanud. Andke allikale kvaliteedihinnang (1–5) truuduse, terminoloogia ja loomulikkuse kohta ning loetlege kolm peamist probleemi. See on minu otsustada. Allikas: [...] | Tõlge: [...]

Nõrk viip / Tugev viip

Nõrk: "Kas see tõlge on hea?" (Kriteeriumid puuduvad; tehisintellekt annab kasutu vastuse nagu "üldiselt hea.")

Tugev: "Kontrollige seda tõlget allika suhtes. Märkige igale veale kategooria (täpsus/terminoloogia/sujuvus) ja tõsidus (kriitiline/oluline/väike). Keskenduge eelkõige arvu-, eitus- ja terminoloogiavigadele. Ärge tehke vigu; kui te pole kindel, märkige "vajalik kinnitus".

Erinevus: tugev viip annab vearaami ja fookuse; Väljund on võrreldav ja teostatav kvaliteediaruanne.

Kvaliteetsete kihtide tabel

kiht

mis püüab

Kes/mida teeb

Auto QA

Arv, silt, konsistents

Tööriist/skript

AI juhtimine

Võimalikud tähendus-/terminoloogiavead

LLM (kinnitusega)

Inimese LQA

Tähendus, toon, kultuur, kaal

asjatundlik hindaja

MQM/DQF skoor

Objektiivne veaskoor

raamiga inimene

Kohaletoimetamise kinnitus

lõplik vastutus

pädev tõlkija

Levinud vead

  • Jättes vahele automaatse kvaliteedikontrolli ja asuge otse lugemisse. Stiilivead hajutavad tähelepanu.
  • AI kontrolli asendamine inimese LQA-ga. AI eelekraanid, ei kiida heaks.
  • Kui teil on sama mudel, kontrollige selle tõlget. Pimepunkt; nõutav ristkontroll.
  • Mitte kaalumisvigu. Kriitilise ja alaealise samana nägemine häirib prioriteetsust.
  • AI tehtud "vigade" parandamine ilma neid kinnitamata. Saate õiget lauset moonutada.

Automaatsed mõõdikud: BLEU, COMET ja piirangud

Kvaliteedi mõõtmisel on olemas ka automatiseeritud mõõdikute maailm. BLEU (Bilingual Evaluation Understudy) võrdleb masintõlget inimese võrdlustõlkega ja annab sõnade kattuvuse põhjal hindeks 0–100; See oli pikka aega MT-süsteemide võrdlemise standard. Uuem mõõdik COMET on närvivõrgupõhine ja kajastab semantilist sarnasust paremini kui BLEU. Need mõõdikud on väärtuslikud kahe mootori kiireks ja automaatseks võrdlemiseks suurandmete põhjal.

Kuid selle piirid on selged: sellised mõõdikud nagu BLEU vaatavad sõnade kattumist, kuid ei mõista tegelikult tähendust. Tõlge, mis erineb viitest, kuid on täpne, võib saada madala hinde; Tõlge, mis sarnaneb viitega, kuid on vale, võib saada kõrge hinde. Kriitiline negatiivsusviga koosneb ühest sõnast, nii et see mõjutab mõõdikut vähe, kuid on tegelikult katastroofiline. Seetõttu mõõdavad automatiseeritud mõõdikud suundumusi süsteemi tasemel, mitte ei otsusta üksiku teksti edastatavuse üle. MQM-põhine inimhindamine ja eksperthinnang otsustavad, kas tõlge läheb kliendile, mitte automaatne hinde. Kasutage mõõdikuid kompassina, mitte kohtunikuna.

Kokkuvõttes

Tõlke kvaliteet ei ole subjektiivne tunne, see on midagi mõõdetavat. Automaatne kvaliteedikontroll otsib põhjalikult vormivigu; inimese LQA hindab tähendust, tooni ja kultuuri; Vearaamistikud, nagu MQM, määravad kvaliteedi kategooria ja kaalu järgi, võimaldades objektiivset võrdlust. AI on võimas teine ​​silm, mis kiirendab seda kontrolli, kuid see võib olla oma tõlke suhtes pime, teha vigu ega suuda pärismaailma kaalust täielikult aru saada; Seetõttu kuulub lõplik kvaliteediotsus, kaalumine ja tarne kinnitamine pädevale tõlkijale.

Rakenduse ülesanne

Hankige masintõlke väljund. Loetlege vormivead esmalt valikuga "Automaatne kvaliteedikontrolli täiendav kontroll", seejärel loetlege keelelised vead kategooriate ja kaalu järgi "MQM-põhise veakontrolliga". Hindan iga viga (kriitiline 10, oluline 5, väike 1) sõna lävega ja küsin "kas seda saab teha?" Vastake küsimusele. Lõpuks kinnitage allikaga, kui paljud AI märgistatud vead on tõelised ja kui paljud on väljamõeldud.

kontrollnimekiri

  • [ ] Käivitasin automaatse kvaliteedikontrolli ja puhastasin kõik vormilised vead.
  • [ ] Keelevead märkisin lahtriga (kategooria + kaal).
  • [ ] Skaneerisin kriitilisi vigu eraldi prioritiseeritud voorus.
  • [ ] Ostsin tehisintellekti juhtimise ja vajadusel kontrollisin seda mõne teise mudeliga.
  • [ ] Tegin tarneotsuse arvulise läve ja oma eksperthinnangu põhjal.