Ieguvumi:
- Spēja atšķirt automātisko QA un lingvistisko LQA slāņus un piemērot abus pareizā secībā
- Spēja objektīvi novērtēt tulkojumu atbilstoši kategorijai un svaram (kritiska/svarīga/mazsvarīga) ar kļūdu ietvaru, piemēram, MQM
- Spēja pieņemt galīgo lēmumu, izmantojot AI kā auditoru, zinot tā aklumu pret savu tulkojumu, kļūdu iespējamību un automatizētās metrikas robežas
Brīdī, kad sakāt, ka tulkojums ir "pabeigts", tā ir puse no darba; Otra puse ir pierādīt, ka tulkojums patiešām ir uzticams. Šajā nodaļā jūs apgūsit sistemātiskus veidus, kā izmērīt tulkojumu kvalitāti: automatizētas kvalitātes nodrošināšanas pārbaudes, cilvēku balstītas LQA kļūdu sistēmas, kvalitātes metriku un to, kā izmantot AI kā “inspektoru” un tās robežas. Mērķis ir attālināties no subjektivitātes "es domāju, ka tas ir labi" un kļūt par ekspertu, kas definē, mēra un pierāda kvalitāti.
Divu veidu kvalitātes kontrole: automātiskā un lingvistiskā
QA (Kvalitātes nodrošināšana) tulkošanā darbojas divos slāņos:
Automatizēta kvalitātes nodrošināšana: stilistiskās kļūdas, ko uztver CAT rīki un skripti — skaitļu neatbilstība, trūkst/pārmērīga atstarpe, nekonsekvents termins, netulkots segments, nepareizs vietturis/atzīme, dubultā atstarpe, pieturzīmes. Tos ātri un pilnībā skenē mašīna; Tas izkļūst no cilvēka acs, bet transportlīdzeklis to noķer.
LQA (lingvistiskās kvalitātes nodrošināšana): šis ir slānis, kurā cilvēka vērtētājs pārbauda nozīmi, terminoloģiju, stilu, gramatiku un vietējo piemērotību. Automatizētā QA "vai numurs atbilst?" aplūko jautājumu; LQA "vai nozīme ir pareiza, vai tonis ir piemērots, vai tas ir piemērots kultūrai?" Viņš skatās uz jautājumu. Abi papildina viens otru; Viens neaizstāj otru.
Padoms. Vienmēr vispirms palaidiet Auto QA; Formālo kļūdu novēršana ļauj vērtētājam pievērst uzmanību reālām valodas problēmām. Recenzents, kurš uztraucas ar numura kļūdu, palaidīs garām toņa kļūdu.
Kļūdu rāmji: MQM un DQF
Standarta kļūdu tipoloģijas tiek izmantotas, lai padarītu izmērāmu kvalitāti, nevis “labu/sliktu”. Visizplatītākā ir MQM (Multidimensional Quality Metrics): tā katrai kļūdai piešķir kategoriju (precizitāte, plūstamība, terminoloģija, stils, atrašanās vieta, formāts) un svaru (kritiska, galvenā, mazsvarīga). Vēl viens ietvars ir DQF (Dynamic Quality Framework) un tiek minēts kopā ar MQM.
Kāpēc tas ir svarīgi? Jo ar šo ietvaru jūs varat piešķirt tulkojumam kļūdas punktu, objektīvi salīdzināt dažādus tulkotājus/programmas un jautāt "vai šo tekstu var piegādāt?" Jūs atbildat uz jautājumu ar skaitlisko slieksni. Piemēram: kritiskā kļūda = 10 punkti, galvenā = 5, neliela = 1; teksts zem noteikta sliekšņa pāriet uz noteiktu vārdu.
Kritiska kļūda: kļūda, kas apvērš nozīmi, rada drošību/juridisku risku, bojā zīmolu (nepareiza deva, “nav atbildīgs”, nevis “atbildīgs”). Galvenais: traucējošs, bet nekaitīgs. Mazsvarīgs: pamanāms, bet nenovērš nozīmi (mazsvarīgs stils/pieturzīmes).
AI kā kontroliera izmantošana un tās ierobežojumi
AI ir ātrs un noderīgs, lai pārbaudītu tulkojuma atbilstību kļūdu ietvaram: jūs varat teikt: “Atzīmējiet pareizību, terminoloģiju, rašanās kļūdas šajā tulkojumā ar MQM kategorijām”. Tas samazina aklās zonas un nodrošina ātru "otro aci".
Taču ir trīs kritiskās robežas: (1) AI var būt akls, pārbaudot tā radīto tulkojumu — gan pieļaujot, gan apstiprinot vienu un to pašu kļūdu; pārbaudiet citu modeli vai atgriezieties pie avota. (2) AI var radīt arī halucinācijas “kļūdas” — ziņot par kļūdu, kas neeksistē; Apstipriniet katru brīdinājumu. (3) mākslīgais intelekts var pilnībā nesaprast kritiskās kļūdas nopietnību reālajā pasaulē (devas kļūda var būt letāla); Eksperts veic svēršanu. Tātad mākslīgais intelekts paātrina kvalitātes nodrošināšanu, bet galīgais lēmums par kvalitāti un piegādes apstiprinājums ir cilvēka ziņā.
Uzmanību! Sakot: “AI ir izturējis QA, tas ir tīrs” ir nepatiesa pārliecības sajūta. AI audits neaizstāj cilvēka LQA un salīdzinājumu ar avotu; tas ir iepriekšējas pārbaudes slānis, kas tos paātrina.
trīs mini futrāļi
1. gadījums — automatizētā kvalitātes nodrošināšanas sistēma konstatēja 40 skaitļu kļūdas. Finanšu pārskata tulkojumā automatizētā kvalitātes nodrošināšanas sistēma konstatēja 40 skaitļu/formātu neatbilstības starp avotu un mērķi (tūkstošatdalītājs, decimāldaļa, valūta). Cilvēka acs palaidīs garām lielāko daļu no tiem; transportlīdzeklis uzskaitīts sekundēs.
2. gadījums — MQM rezultāts noteica dzinēja izvēli. Viens birojs MQM novērtēja divu dažādu MT dzinēju jaudu ar 2000 vārdiem: dzinējs A 12 kļūdas punkti, dzinējs B 31. Objektīvs mērījums atrisināja debates par "kurš ir labāks" ar rezultātu; Birojs noteica A dzinēju par standartu un attiecīgi plānoja savu budžetu pēc pārskatīšanas.
3. gadījums — AI audits palaida garām savu kļūdu. Tulkotājs LLM tulkojumu uzraudzīja tas pats LLM; Modele teica "nav problēmu", terminoloģijas kļūdu viņa pati pieļāva. Kļūda tika atklāta, kad tulkotājs salīdzināja ar citu modeli un avotu; Komanda pieņēma noteikumu, ka "tas pats modelis nedrīkst sevi kontrolēt".
Četras kopējamas veidnes
1) Uz MQM balstīta kļūdu pārbaude:
Jūsu loma: LQA vērtētājs. Salīdziniet tālāk norādīto avotu un tulkojumu. Norādiet katru atrasto kļūdu šādā formātā: [kategorija: precizitāte/terminoloģija/plūstamība/stils/formāts][svars: kritisks/svarīgs/mazsvarīgs] [atrašanās vieta] [komentārs] [labojums]. Atzīmējiet brīdinājumu, par kuru neesat pārliecināts, kā "nepieciešams apstiprinājums"; kļūdu izgatavošana.Avots: [...] | Tulkojums: [...]
2) Kritisku kļūdu skenēšana (augsts risks):
Kritiskās kļūdas meklējiet TIKAI zemāk esošajā tulkojumā: nozīmē inversija, skaitļa/devas/datuma kļūda, nolieguma zaudēšana, juridiskā pienākuma aizstāšana, drošības brīdinājuma kļūda. Ignorējiet nelielas stila problēmas. Nosauciet katra kritiskā atraduma avotu.Avots: [...] | Tulkojums: [...]
3) Automātiskā kvalitātes nodrošināšanas papildu kontrole:
Uzskaitiet formālās neatbilstības šādos avota un mērķa pāros: skaitļu neatbilstība, trūkstošs/papildu vietturis vai tags, nekonsekvents termins, netulkots segments, vienības/valūtas atšķirība. Vienkārši norādiet problēmas ar to atrašanās vietu. Pāri: [...]
4) Neatkarīga otrā acs (savstarpējā pārbaude):
Novērtējiet šo tulkojumu BEZ aizspriedumiem; Nedomājiet, ka jūs to uzrakstījāt. Piešķiriet avotam kvalitātes novērtējumu (1–5) attiecībā uz precizitāti, terminoloģiju un dabiskumu un uzskaitiet 3 galvenās problēmas. Tas ir manā ziņā. Avots: [...] | Tulkojums: [...]
Vāja uzvedne / spēcīga uzvedne
Vājš: "Vai šis tulkojums ir labs?" (Nav kritēriju; AI sniedz bezjēdzīgu atbildi, piemēram, "vispār labi.")
Spēcīgs: "Pārbaudiet šo tulkojumu attiecībā pret avotu. Apzīmējiet katru kļūdu ar kategoriju (precizitāte/terminoloģija/raidums) un nopietnību (kritiska/svarīga/mazsvarīga). Īpaši koncentrējieties uz skaitļu, noliegumu un terminoloģijas kļūdām. Neveidojiet kļūdas; ja neesat pārliecināts, atzīmējiet "nepieciešams apstiprinājums".
Atšķirība: spēcīga uzvedne parāda kļūdas rāmi un fokusu; Rezultāts ir salīdzināms un izmantojams kvalitātes ziņojums.
Kvalitatīvu slāņu tabula
slānis
kas nozvejas
Kas/ko dara
Auto QA
Skaitlis, etiķete, konsistence
Rīks/skripts
AI kontrole
Iespējamas nozīmes/terminoloģijas kļūdas
LLM (ar apstiprinājumu)
Cilvēka LQA
Nozīme, tonis, kultūra, svars
eksperts vērtētājs
MQM/DQF rezultāts
Objektīvs kļūdu rādītājs
cilvēks ar rāmi
Piegādes apstiprinājums
galīgā atbildība
kompetents tulks
Biežas kļūdas
- Automātiskās kvalitātes nodrošināšanas izlaišana un tūlītēja lasīšana. Stilistiskas kļūdas novērš uzmanību.
- AI pārbaudes aizstāšana ar cilvēka LQA. AI iepriekš pārbauda, neapstiprina.
- Izmantojot vienu un to pašu modeli, pārbaudiet tā tulkojumu. Aklā vieta; nepieciešama savstarpēja pārbaude.
- Nav svēršanas kļūdas. Uzskatot kritisku un maznozīmīgu vienu un to pašu, tiek traucēta prioritāte.
- AI radīto "kļūdu" labošana, tās neapstiprinot. Jūs varat sagrozīt pareizo teikumu.
Automātiskie rādītāji: BLEU, COMET un ierobežojumi
Kvalitātes mērīšanā ir arī automatizētu metrikas pasaule. BLEU (Bilingual Evaluation Understudy) salīdzina mašīntulkojumu ar cilvēku veiktu atsauces tulkojumu un piešķir punktu skaitu no 0 līdz 100, pamatojoties uz vārdu pārklāšanos; Tas ilgu laiku bija standarts MT sistēmu salīdzināšanai. Jaunāka metrika COMET ir balstīta uz neironu tīklu un uztver semantisko līdzību labāk nekā BLEU. Šie rādītāji ir vērtīgi, lai ātri un automātiski salīdzinātu divus lielus datus.
Taču tās robežas ir skaidras: tādi rādītāji kā BLEU aplūko vārdu pārklāšanos, īsti nesaprotot nozīmi. Tulkojums, kas atšķiras no atsauces, bet ir precīzs, var saņemt zemu punktu skaitu; Tulkojums, kas ir līdzīgs atsaucei, bet ir nepareizs, var iegūt augstu punktu skaitu. Kritiska negatīvisma kļūda ir tikai viens vārds, tāpēc tai ir maza ietekme uz metriku, bet patiesībā tā ir katastrofāla. Tāpēc automatizētie rādītāji mēra tendences sistēmas līmenī, nevis nosaka atsevišķa teksta piegādājamību. Uz MQM balstīts cilvēku novērtējums un ekspertu spriedums izlemj, vai klientam tiek nosūtīts tulkojums, nevis automātisks vērtējums. Izmantojiet metriku kā kompasu, nevis tiesnesi.
Rezumējot
Tulkojuma kvalitāte nav subjektīva sajūta, tā ir kaut kas izmērāms. Automātiskā kvalitātes nodrošināšana rūpīgi pārbauda formālas kļūdas; cilvēka LQA novērtē nozīmi, toni un kultūru; Kļūdu sistēmas, piemēram, MQM, nosaka kvalitāti pēc kategorijas un svara, ļaujot objektīvi salīdzināt. AI ir spēcīga otrā acs, kas paātrina šo kontroli, taču tā var būt akla pret savu tulkojumu, kļūdīties un pilnībā neizprast reālās pasaules nozīmi; Tāpēc gala lēmumu par kvalitāti, svērumu un piegādes apstiprinājumu pieņem kompetentais tulks.
Lietojumprogrammas uzdevums
Iegūstiet mašīntulkošanas izvadi. Vispirms uzskaitiet formālas kļūdas, izmantojot “automātisko kvalitātes nodrošināšanas papildu pārbaudi”, pēc tam uzskaitiet valodas kļūdas pēc kategorijas un svara, izmantojot “kļūdu pārbaudi uz MQM”. Es novērtēju katru kļūdu (kritiska 10, galvenā 5, neliela 1) ar slieksni katram vārdam un jautāju “vai to var nodrošināt?” Atbildi uz jautājumu. Visbeidzot, apstipriniet ar avotu, cik daudz no AI atzīmētajām kļūdām ir patiesas un cik daudzas ir izdomātas.
kontrolsaraksts
- [ ] Palaidu automātisko kvalitātes nodrošināšanu un notīrīju visas formālas kļūdas.
- [ ] Valodas kļūdas atzīmēju ar lodziņu (kategorija + svars).
- [ ] Es skenēju kritiskās kļūdas atsevišķā prioritārā kārtā.
- [ ] Es ieguvu AI vadību un, ja nepieciešams, to pārbaudīju ar citu modeli.
- [ ] Piegādes lēmumu pieņēmu, pamatojoties uz skaitlisko slieksni un savu eksperta vērtējumu.