Fitimet:
- Aftësia për të dalluar midis shtresave automatike të QA dhe LQA gjuhësore dhe për t'i zbatuar të dyja në rendin e duhur
- Aftësia për të vlerësuar objektivisht përkthimin sipas kategorisë dhe peshës (kritike / madhore / e vogël) me një kornizë gabimi si MQM
- Të jesh në gjendje të marrësh vendimin përfundimtar kur përdor AI si auditor, duke ditur verbërinë e tij ndaj përkthimit të tij, rrezikun e bërjes së gabimeve dhe kufijtë e metrikës së automatizuar
Në momentin që thua se një përkthim është "mbaruar", kjo është gjysma e punës; Gjysma tjetër është për të vërtetuar se ai përkthim është në të vërtetë i besueshëm. Në këtë njësi, do të mësoni mënyra sistematike për të matur cilësinë e përkthimit: kontrollet e automatizuara të cilësisë së cilësisë, kornizat e gabimeve LQA të bazuara në njerëz, metrikat e cilësisë dhe si të përdorni AI si "inspektor" - dhe kufijtë e saj. Synimi është të largohemi nga subjektiviteti i "mendoj se është mirë" dhe të bëhemi një ekspert që përcakton, mat dhe provon cilësinë.
Dy lloje të kontrollit të cilësisë: automatik dhe gjuhësor
QA (Sigurimi i Cilësisë) funksionon në dy shtresa në përkthim:
QA e automatizuar: Gabimet stilistike që kapin mjetet dhe skriptet CAT — mospërputhja e numrave, hapësira e munguar/e tepërt, termi jokonsistent, segmenti i papërkthyer, mbajtës/etiketimi i keq, hapësira e dyfishtë, shenja pikësimi. Këto skanohen shpejt dhe plotësisht me makinë; I ikën syrit të njeriut, por automjeti e kap.
LQA (Linguistic Quality Assurance): Kjo është shtresa ku një vlerësues njerëzor shqyrton kuptimin, terminologjinë, stilin, gramatikën dhe përshtatshmërinë lokale. QA e automatizuar "a përputhet numri?" shikon pyetjen; LQA "a është kuptimi i saktë, a është toni i përshtatshëm, a është i përshtatshëm kulturalisht?" Ai shikon pyetjen. Të dyja plotësojnë njëra-tjetrën; Njëra nuk zëvendëson tjetrën.
Këshillë: Drejtoni gjithmonë në fillim Auto QA; Pastrimi i gabimeve formale i lejon vlerësuesit njerëzor t'i kushtojë vëmendje problemeve reale gjuhësore. Një recensues që shqetësohet me gabimin e numrave do të humbasë gabimin e tonit.
Kornizat e gabimit: MQM dhe DQF
Tipologjitë standarde të gabimeve përdoren për ta bërë cilësinë të matshme në vend të "mirë/keq". Më i zakonshmi është MQM (Multidimensional Quality Metrics): ai cakton çdo gabim në një kategori (saktësia, rrjedhshmëria, terminologjia, stili, lokaliteti, formati) dhe një peshë (kritike, kryesore, e vogël). Një kornizë tjetër është DQF (Dynamic Quality Framework) dhe përmendet së bashku me MQM.
Pse është e rëndësishme? Sepse me këtë kornizë, ju mund t'i jepni një rezultat gabimi një përkthimi, të krahasoni objektivisht përkthyes/motorë të ndryshëm dhe të pyesni "a mund të dorëzohet ky tekst?" Ju i përgjigjeni pyetjes me një prag numerik. Për shembull: gabim kritik = 10 pikë, madhor = 5, minor = 1; teksti nën një prag të caktuar kalon për fjalë të caktuar.
Gabim kritik: gabim që përmbys kuptimin, krijon siguri/rrezik ligjor, dëmton markën (dozë e gabuar, "jo përgjegjës" në vend të "përgjegjës"). Kryesorja: përçarëse, por e padëmshme. E vogël: e dukshme, por jo e pakësuar nga kuptimi (stili i vogël/shenja e pikësimit).
Përdorimi i AI si një kontrollues - dhe kufijtë e tij
AI është i shpejtë dhe i dobishëm në kontrollimin e një përkthimi kundrejt kornizës së gabimit: mund të thoni "shënoni saktësinë, terminologjinë, gabimet e rrjedhshmërisë në këtë përkthim me kategoritë MQM". Redukton pikat tuaja të verbëra dhe ju jep një “sy të dytë” të shpejtë.
Por ka tre kufij kritikë: (1) AI mund të jetë i verbër kur kontrollon përkthimin që prodhon - si duke bërë ashtu edhe duke konfirmuar të njëjtin gabim; kontrolloni me një model tjetër ose kthehuni te burimi. (2) AI gjithashtu mund të krijojë "gabime" halucinative - raportoni një gabim që nuk ekziston; Konfirmoni çdo paralajmërim. (3) AI mund të mos e kuptojë plotësisht ashpërsinë e botës reale të një gabimi kritik (një gabim dozë mund të jetë fatal); Eksperti bën peshimin. Kështu që AI përshpejton sigurimin e cilësisë, por vendimi përfundimtar i cilësisë dhe miratimi i dorëzimit i takon njeriut.
Kujdes: Të thuash "AI ka kaluar QA, është i pastër" është një ndjenjë e rreme besimi. Auditimi i UA nuk është një zëvendësim për LQA njerëzore dhe krahasimi me burimin; është një shtresë para-skanimi që i bën ato të shpejta.
tre mini kuti
Rasti 1 - QA e automatizuar gjeti 40 gabime numrash. Në një përkthim të raportit financiar, QA e automatizuar kapi 40 mospërputhje numrash/format midis burimit dhe objektivit (ndarësi i mijë, dhjetore, monedhë). Syrit të njeriut do t'i mungonte shumica e këtyre; automjeti i listuar në sekonda.
Rasti 2 - Rezultati MQM çoi në zgjedhjen e motorit. Një zyrë MQM vlerësoi prodhimin e dy motorëve të ndryshëm MT me 2000 fjalë: Motori A 12 pikë gabimi, Motori B 31. Matja objektive e zgjidhi debatin "cili është më mirë" me një rezultat; Byroja e bëri Motorin A standard dhe planifikoi buxhetin e tij pas rishikimit në përputhje me rrethanat.
Rasti 3 - Auditimi i AI humbi gabimin e vet. Një përkthyes kishte përkthimin e LLM-së të mbikëqyrur nga e njëjta LLM; Modelja tha “nuk ka problem”, një gabim terminologjik që e bëri vetë. Gabimi u zbulua kur përkthyesi kontrolloi një model dhe burim tjetër; Ekipi miratoi rregullin se "i njëjti model nuk duhet të kontrollojë veten".
Katër shabllone të kopjueshëm
1) Kontrollimi i gabimeve të bazuara në MQM:
Roli juaj: vlerësues i LQA. Krahasoni burimin dhe përkthimin më poshtë. Jepni çdo gabim që gjeni në formatin e mëposhtëm: [kategoria: saktësia/terminologjia/rrjedhshmëria/stili/formati][pesha: kritike/i madh/i vogël] [vendndodhja] [koment] [korrigjim]. Shënoni paralajmërimin për të cilin nuk jeni të sigurt si "kërkohet konfirmim"; errorfabrication.Burimi: [...] | Përkthimi: [...]
2) Skanimi i gabimeve kritike (rrezik i lartë):
Kërkoni për gabime kritike VETËM në përkthimin e mëposhtëm: kuptimi i përmbysjes, numri/doza/gabimi i datës, humbja e mohimit, zëvendësimi i detyrimit ligjor, gabimi i paralajmërimit të sigurisë. Injoroni problemet e vogla të stilit. Citoni burimin për çdo gjetje kritike.Burimi: [...] | Përkthimi: [...]
3) Kontrolli suplementar automatik i QA:
Rendisni mospërputhjet formale në çiftet e mëposhtme burim-objektiv: mospërputhja e numrave, vendmbajtësi ose etiketa që mungon/shtesë, termi jo konsistent, segmenti i papërkthyer, diferenca njësi/monedhe. Thjesht jepni problemet me vendndodhjen e tyre. Çiftet: [...]
4) Syri i dytë i pavarur (kontroll i kryqëzuar):
Vlerëso këtë përkthim PA PARAGJYKIM; Mos supozoni se e keni shkruar. Jepini burimit një vlerësim të cilësisë (1-5) për besnikërinë, terminologjinë dhe natyrshmërinë dhe renditni 3 problemet kryesore. Më takon mua të vendos. Burimi: [...] | Përkthimi: [...]
Prompt i dobët / Prompt i fortë
Dobët: "A është i mirë ky përkthim?" (Pa kriter; AI kthen një përgjigje të padobishme si "përgjithësisht mirë.")
Strong: "Kontrollo këtë përkthim nga burimi. Etiketo çdo gabim me kategorinë (saktësinë/terminologji/rrjedhshmëri) dhe ashpërsinë (kritike/të mëdha/të vogla). Përqendrohuni veçanërisht te gabimet e numrave, mohimit dhe terminologjisë. Mos fabrikoni gabime; shënoni "konfirmimi i nevojshëm" nëse nuk jeni të sigurt."
Dallimi: prompti i fortë jep një kornizë gabimi dhe fokus; Rezultati është një raport cilësor i krahasueshëm dhe i zbatueshëm.
Tabela e shtresave cilësore
shtresë
çfarë kap
Kush/çfarë bën
Auto QA
Numri, etiketa, konsistenca
Mjet/skrip
Kontrolli i AI
Gabime të mundshme kuptimore/terminologjike
LLM (me konfirmim)
LQA njerëzore
Kuptimi, toni, kultura, pesha
ekspert vlerësues
Rezultati i MQM/DQF
Rezultati i gabimit objektiv
njeri me kornizë
Konfirmimi i dorëzimit
përgjegjësia përfundimtare
përkthyes kompetent
Gabimet e zakonshme
- Duke anashkaluar QA-në e automatizuar dhe duke hyrë direkt në lexim. Gabimet stilistike shpërqendrojnë vëmendjen.
- Zëvendësimi i inspektimit të AI me LQA njerëzore. AI para-ekranet, nuk miratohet.
- Duke pasur të njëjtin model, kontrolloni përkthimin e tij. Pika e verbër; kërkohet një kontroll i kryqëzuar.
- Jo gabime peshimi. Të shohësh të njëjtën gjë kritike dhe të vogël e prish prioritetin.
- Korrigjimi i "gabimeve" të bëra nga AI pa i konfirmuar ato. Ju mund të shtrembëroni fjalinë e duhur.
Metrikë automatike: BLEU, COMET dhe kufijtë
Ekziston gjithashtu një botë metrikash të automatizuara në matjen e cilësisë. BLEU (Dylingual Evaluation Understudy) krahason një përkthim automatik me një përkthim referimi njerëzor dhe jep një rezultat 0-100 bazuar në mbivendosjen e fjalëve; Ishte standardi për krahasimin e sistemeve MT për një kohë të gjatë. Një metrikë më e re, COMET, bazohet në rrjetin nervor dhe kap ngjashmërinë semantike më mirë se BLEU. Këto metrika janë të vlefshme për krahasimin e shpejtë dhe automatik të dy motorëve në të dhëna të mëdha.
Por kufijtë e saj janë të qartë: Metrikat si BLEU shikojnë mbivendosjen e fjalëve, duke mos kuptuar vërtet kuptimin. Një përkthim që ndryshon nga referenca, por është i saktë, mund të marrë një rezultat të ulët; Një përkthim që është i ngjashëm me referencën, por i pasaktë, mund të marrë një rezultat të lartë. Një gabim kritik negativiteti është një fjalë e vetme, kështu që ka pak ndikim në metrikë, por në të vërtetë është katastrofik. Kjo është arsyeja pse metrikat e automatizuara masin tendencat në nivel sistemi, jo vendosin për ofrimin e një teksti individual. Vlerësimi njerëzor i bazuar në MQM dhe gjykimi i ekspertëve vendosin nëse një përkthim i shkon klientit, jo një rezultat automatik. Përdorni metrikën si busull, jo si gjyqtar.
Në përmbledhje
Cilësia e përkthimit nuk është një ndjenjë subjektive, është diçka e matshme. QA automatike skanon tërësisht për gabime formale; LQA njerëzore vlerëson kuptimin, tonin dhe kulturën; Kornizat e gabimeve si MQM përcaktojnë cilësinë sipas kategorisë dhe peshës, duke mundësuar krahasimin objektiv. AI është një sy i dytë i fuqishëm që e përshpejton këtë kontroll, por mund të jetë i verbër ndaj përkthimit të vet, të bëjë gabime dhe të mos arrijë të kuptojë plotësisht peshën e botës reale; Prandaj, vendimi përfundimtar i cilësisë, peshimi dhe miratimi i dorëzimit i takon përkthyesit kompetent.
Detyra e aplikimit
Merrni një rezultat përkthimi me makinë. Listoni gabimet formale fillimisht me "kontrollin plotësues automatik të QA", më pas renditni gabimet gjuhësore sipas kategorisë dhe peshës me "kontrollin e gabimeve të bazuara në MQM". Unë e vlerësoj çdo gabim (kritik 10, i madh 5, i vogël 1) me një prag për fjalë dhe pyes "a mund të dorëzohet?" Përgjigjuni pyetjes. Më në fund, konfirmoni me burimin se sa nga gabimet e shënuara nga AI janë reale dhe sa janë të fabrikuara.
listë kontrolli
- [ ] Kam ekzekutuar QA automatike dhe kam pastruar çdo gabim formal.
- [ ] I shënova gabimet gjuhësore me një kuti (kategori + peshë).
- [ ] I skanova gabimet kritike në një raund të veçantë, me prioritet.
- [ ] Kam marrë kontrollin e AI dhe e kontrollova atë me një model tjetër nëse ishte e nevojshme.
- [ ] Unë e mora vendimin e dorëzimit bazuar në pragun numerik dhe gjykimin tim të ekspertit.