Enhed 8 / 11

Kvalitetskontrol (QA), Evaluation Metrics og LQA

Gevinster:

  • Evne til at skelne mellem automatiske QA- og sproglige LQA-lag og anvende begge i den rigtige rækkefølge
  • Evne til objektivt at vurdere oversættelsen efter kategori og vægt (kritisk/major/minor) med en fejlramme såsom MQM
  • At være i stand til at træffe den endelige beslutning, når man bruger AI som revisor, at kende sin blindhed over for sin egen oversættelse, risikoen for at begå fejl og grænserne for automatiserede målinger

I det øjeblik du siger, at en oversættelse er "færdig", er det halvdelen af arbejdet; Den anden halvdel er at bevise, at den oversættelse faktisk er pålidelig. I denne enhed lærer du systematiske måder at måle oversættelseskvalitet på: automatiserede QA-tjek, menneskebaserede LQA-fejlrammer, kvalitetsmålinger og hvordan man bruger AI som en "inspektør" - og dets grænser. Målet er at komme væk fra subjektiviteten i "jeg synes det er godt" og blive en ekspert, der definerer, måler og beviser kvalitet.

To typer kvalitetskontrol: automatisk og sproglig

QA (Quality Assurance) fungerer i to lag i oversættelse:

Automatiseret QA: Stilistiske fejl, som CAT-værktøjer og scripts fanger - talmismatch, manglende/overskydende plads, inkonsekvent term, uoversat segment, dårlig pladsholder/tag, dobbelt mellemrum, tegnsætning. Disse scannes hurtigt og fuldstændigt af maskinen; Det undslipper det menneskelige øje, men køretøjet fanger det.

LQA (Linguistic Quality Assurance): Dette er det lag, hvor en menneskelig evaluator undersøger betydning, terminologi, stil, grammatik og lokal hensigtsmæssighed. Automatiseret QA "matches antallet?" ser på spørgsmålet; LQA "er betydningen korrekt, er tonen passende, er den kulturelt passende?" Han kigger på spørgsmålet. De to supplerer hinanden; Det ene erstatter ikke det andet.

Tip: Kør altid Auto QA først; At rydde op i formelle fejl giver den menneskelige evaluator mulighed for at fokusere på reelle sproglige problemer. En anmelder, der bøvler med nummerfejlen, vil savne tonefejlen.

Fejlrammer: MQM og DQF

Standard fejltypologier bruges til at gøre kvalitet målbar frem for "god/dårlig". Den mest almindelige er MQM (Multidimensional Quality Metrics): den tildeler hver fejl til en kategori (nøjagtighed, flydende, terminologi, stil, lokalitet, format) og en vægt (kritisk, større, mindre). En anden ramme er DQF (Dynamic Quality Framework) og omtales sammen med MQM.

Hvorfor er det vigtigt? For med denne ramme kan du give en fejlscore til en oversættelse, objektivt sammenligne forskellige oversættere/motorer og spørge "kan denne tekst leveres?" Du besvarer spørgsmålet med en numerisk tærskel. For eksempel: kritisk fejl = 10 point, større = 5, mindre = 1; tekst under en vis grænse passerer pr. bestemt ord.

Kritisk fejl: fejl, der inverterer mening, skaber sikkerhed/juridisk risiko, skader brand (forkert dosis, "ikke ansvarlig" i stedet for "ansvarlig"). Major: forstyrrende, men harmløs. Mindre: mærkbar, men ikke forringende fra betydningen (mindre stil/tegnsætning).

Brug af AI som controller - og dets grænser

AI er hurtig og hjælpsom til at kontrollere en oversættelse i forhold til fejlrammen: du kan sige "markér korrekthed, terminologi, flydende fejl i denne oversættelse med MQM-kategorier". Det reducerer dine blinde vinkler og giver dig et hurtigt "second eye".

Men der er tre kritiske grænser: (1) AI kan være blind, når man kontrollerer den oversættelse, den producerer - både begår og bekræfter den samme fejl; krydstjek med en anden model eller vend tilbage til kilden. (2) AI kan også lave hallucinatoriske "fejl" - rapporter en fejl, der ikke eksisterer; Bekræft hver advarsel. (3) AI'en forstår muligvis ikke fuldt ud alvoren af ​​en kritisk fejl i den virkelige verden (en dosisfejl kan være fatal); Eksperten foretager vægtningen. Så AI fremskynder QA, men den endelige kvalitetsbeslutning og leveringsgodkendelse ligger hos mennesket.

Forsigtig: At sige "AI har bestået QA, det er rent" er en falsk følelse af selvtillid. AI-auditering er ikke en erstatning for menneskelig LQA og sammenligning med kilden; det er et pre-screening-lag, der får dem op til hastighed.

tre minisager

Case 1 — Automatiseret QA fandt 40 talfejl. I en økonomisk rapportoversættelse fangede automatiseret QA 40 tal/format-uoverensstemmelser mellem kilde og mål (tusind-separator, decimal, valuta). Det menneskelige øje ville savne de fleste af disse; køretøj opført på få sekunder.

Tilfælde 2 - MQM-score førte til motorvalg. Et bureau MQM vurderede output fra to forskellige MT-motorer til 2.000 ord: Engine A 12 fejlpunkter, Engine B 31. Objektiv måling afgjorde "hvilket er bedre"-debatten med en score; Bureauet gjorde Engine A til standarden og planlagde sit budget efter revision i overensstemmelse hermed.

Case 3 — AI-revision gik glip af sin egen fejl. En oversætter fik LLM's oversættelse overvåget af den samme LLM; Modellen sagde "intet problem", en terminologifejl, hun selv lavede. Fejlen blev afsløret, da oversætteren krydstjekkede med en anden model og kilde; Holdet vedtog reglen om, at "den samme model ikke bør kontrollere sig selv".

Fire kopierbare skabeloner

1) MQM baseret fejlkontrol:

Din rolle: LQA assessor. Sammenlign kilden og oversættelsen nedenfor. Angiv hver fejl, du finder, i følgende format: [kategori: nøjagtighed/terminologi/fluency/stil/format][vægt: kritisk/større/mindre] [placering] [kommentar] [korrektion]. Markér den advarsel, du er usikker på, som "bekræftelse påkrævet"; fejlfabrikation.Kilde: [...] | Oversættelse: [...]

2) Kritisk fejlscanning (høj risiko):

Se KUN efter kritiske fejl i oversættelsen nedenfor: betyder inversion, tal/dosis/dato fejl, tab af negation, erstatning af juridisk forpligtelse, sikkerhedsadvarselsfejl. Ignorer mindre stylingproblemer. Angiv kilden for hvert kritisk fund.Kilde: [...] | Oversættelse: [...]

3) Automatisk QA supplerende kontrol:

Angiv de formelle uoverensstemmelser i følgende kilde-mål-par: tal uoverensstemmelse, manglende/ekstra pladsholder eller tag, inkonsekvent udtryk, uoversat segment, enhed/valuta forskel. Bare giv problemerne med deres placering. Par: [...]

4) Uafhængigt andet øje (krydstjek):

Vurder denne oversættelse UDEN FORDOMME; Gå ikke ud fra, at du har skrevet det. Giv kilden en kvalitetsvurdering (1-5) for troskab, terminologi og naturlighed, og angiv top 3 problemer. Det er op til mig at bestemme. Kilde: [...] | Oversættelse: [...]

Svag prompt / Stærk prompt

Svag: "Er denne oversættelse god?" (Ingen kriterier; AI returnerer et ubrugeligt svar som "generelt godt.")

Stærk: "Tjek denne oversættelse i forhold til kilden. Mærk hver fejl med kategori (nøjagtighed/terminologi/flydende) og sværhedsgrad (kritisk/major/minor). Fokuser især på tal-, negations- og terminologifejl. Opstil ikke fejl; marker 'bekræftelse nødvendig', hvis du er usikker."

Forskel: stærk prompt giver en fejlramme og fokus; Outputtet er en sammenlignelig og handlingsvenlig kvalitetsrapport.

Kvalitet lag bord

lag

hvad fanger

Hvem/hvad gør

Auto QA

Antal, etiket, konsistens

Værktøj/script

AI kontrol

Mulige betydnings-/terminologifejl

LLM (med bekræftelse)

Menneskelig LQA

Mening, tone, kultur, vægt

ekspert evaluator

MQM/DQF-score

Objektiv fejlscore

menneske med ramme

Leveringsbekræftelse

ultimative ansvar

kompetent oversætter

Almindelige fejl

  • Springer den automatiserede QA over og går direkte i gang med at læse. Stilistiske fejl distraherer opmærksomheden.
  • Udskiftning af AI-inspektion med menneskelig LQA. AI pre-screens, godkender ikke.
  • At have den samme model kontrollere sin egen oversættelse. Blind vinkel; krydstjek påkrævet.
  • Ikke vægtningsfejl. At se kritisk og mindre som det samme forstyrrer prioriteringen.
  • Ret "fejl" lavet af AI uden at bekræfte dem. Du kan fordreje den rigtige sætning.

Automatiske målinger: BLEU, COMET og grænser

Der er også en verden af automatiserede målinger inden for kvalitetsmåling. BLEU (Bilingual Evaluation Understudy) sammenligner en maskinoversættelse med en menneskelig referenceoversættelse og giver en score på 0-100 baseret på ordoverlapning; Det var standarden for at sammenligne MT-systemer i lang tid. En nyere metrik, COMET, er neuralt netværksbaseret og fanger semantisk lighed bedre end BLEU. Disse målinger er værdifulde til hurtigt og automatisk at sammenligne to motorer på big data.

Men dets grænser er klare: Målinger som BLEU ser på ordoverlapning og forstår ikke rigtig betydning. En oversættelse, der adskiller sig fra referencen, men er nøjagtig, kan få en lav score; En oversættelse, der ligner referencen, men som er forkert, kan få en høj score. En kritisk negativitetsfejl er et enkelt ord, så den har ringe indflydelse på metrikken, men er faktisk katastrofal. Det er derfor, automatiserede metrics måler tendenser på systemniveau, ikke bestemmer leveringsdygtigheden af ​​en individuel tekst. MQM-baseret menneskelig evaluering og ekspertvurdering afgør, om en oversættelse går til kunden, ikke en automatisk score. Brug metrics som et kompas, ikke en dommer.

Sammenfattende

Oversættelseskvalitet er ikke en subjektiv følelse, det er noget, der kan måles. Automatisk QA scanner grundigt for formelle fejl; menneskelig LQA evaluerer mening, tone og kultur; Fejlrammer såsom MQM kvantificerer kvalitet efter kategori og vægt, hvilket muliggør objektiv sammenligning. AI er et kraftfuldt andet øje, der accelererer denne kontrol, men det kan være blindt for sin egen oversættelse, begå fejl og ikke fuldt ud fatte den virkelige verdens vægt; Derfor tilhører den endelige kvalitetsbeslutning, vægtning og leveringsgodkendelse den kompetente oversætter.

Ansøgningsopgave

Få et maskinoversættelsesoutput. Angiv formelle fejl først med "automatisk QA supplerende kontrol", angiv derefter sproglige fejl efter kategori og vægt med "MQM-baseret fejlkontrol". Jeg vurderer hver fejl (kritisk 10, større 5, mindre 1) med en tærskel pr. ord og spørger "kan det leveres?" Besvar spørgsmålet. Bekræft endelig med kilden, hvor mange af de fejl, der er markeret af AI, der er reelle, og hvor mange der er fremstillet.

tjekliste

  • [ ] Jeg kørte automatisk QA og ryddede op i alle formelle fejl.
  • [ ] Jeg markerede sproglige fejl med et felt (kategori + vægt).
  • [ ] Jeg scannede kritiske fejl i en separat, prioriteret runde.
  • [ ] Jeg købte AI-kontrollen og krydstjekkede den med en anden model, hvis det var nødvendigt.
  • [ ] Jeg tog leveringsbeslutningen baseret på den numeriske tærskel og min egen ekspertvurdering.