Winst:
- Vermogen om onderscheid te maken tussen automatische QA- en taalkundige LQA-lagen en beide in de juiste volgorde toe te passen
- Mogelijkheid om de vertaling objectief te evalueren op basis van categorie en gewicht (kritiek/major/minor) met een foutenframework zoals MQM
- In staat zijn om de uiteindelijke beslissing te nemen bij het gebruik van AI als auditor, wetende dat het blind is voor zijn eigen vertaling, het risico op fouten en de beperkingen van geautomatiseerde statistieken
Op het moment dat je zegt dat een vertaling “klaar” is, is dat al het halve werk; De andere helft is om te bewijzen dat die vertaling daadwerkelijk betrouwbaar is. In dit onderdeel leert u systematische manieren om de kwaliteit van vertalingen te meten: geautomatiseerde QA-controles, op mensen gebaseerde LQA-foutframeworks, kwaliteitsstatistieken en hoe u AI als ‘inspecteur’ kunt gebruiken – en de grenzen ervan. Het doel is om afstand te nemen van de subjectiviteit van ‘ik vind het goed’ en een expert te worden die kwaliteit definieert, meet en bewijst.
Twee soorten kwaliteitscontrole: automatisch en taalkundig
QA (Quality Assurance) werkt bij de vertaling in twee lagen:
Geautomatiseerde QA: stilistische fouten die door CAT-tools en -scripts worden opgemerkt: niet-overeenkomende getallen, ontbrekende/overtollige spaties, inconsistente termen, onvertaald segment, slechte tijdelijke aanduiding/tag, dubbele spatie, interpunctie. Deze worden snel en volledig machinaal gescand; Het ontsnapt aan het menselijk oog, maar het voertuig vangt het op.
LQA (Linguistic Quality Assurance): Dit is de laag waar een menselijke beoordelaar de betekenis, terminologie, stijl, grammatica en lokale geschiktheid onderzoekt. Geautomatiseerde QA "komt het nummer overeen?" kijkt naar de vraag; LQA “is de betekenis correct, is de toon passend, is deze cultureel passend?” Hij kijkt naar de vraag. De twee vullen elkaar aan; Het een vervangt het ander niet.
Tip: voer altijd eerst Auto QA uit; Door formele fouten op te ruimen, kan de menselijke beoordelaar aandacht besteden aan echte taalproblemen. Een recensent die zich druk maakt over de nummerfout, zal de toonfout missen.
Foutframes: MQM en DQF
Standaardfouttypologieën worden gebruikt om kwaliteit meetbaar te maken in plaats van ‘goed/slecht’. De meest voorkomende is MQM (Multidimensional Quality Metrics): het wijst elke fout toe aan een categorie (nauwkeurigheid, vloeiendheid, terminologie, stijl, plaats, formaat) en een gewicht (kritiek, groot, klein). Een ander raamwerk is DQF (Dynamic Quality Framework) en wordt samen met MQM genoemd.
Waarom is het belangrijk? Want met dit raamwerk kun je een foutscore aan een vertaling geven, objectief verschillende vertalers/engines vergelijken en vragen: "kan deze tekst geleverd worden?" U beantwoordt de vraag met een numerieke drempel. Bijvoorbeeld: kritische fout = 10 punten, grote = 5, kleine = 1; tekst onder een bepaalde drempel passeert per bepaald woord.
Kritieke fout: fout die de betekenis omkeert, veiligheids-/juridisch risico creëert, het merk schaadt (verkeerde dosis, “niet verantwoordelijk” in plaats van “verantwoordelijk”). Groot: storend maar onschadelijk. Minor: opvallend maar doet geen afbreuk aan de betekenis (minor stijl/interpunctie).
Het gebruik van AI als controller – en de grenzen ervan
AI is snel en behulpzaam bij het controleren van een vertaling aan de hand van het foutenframework: je kunt zeggen “markeer correctheid, terminologie en vloeiendheidsfouten in deze vertaling met MQM-categorieën”. Het verkleint uw blinde vlekken en geeft u snel een “tweede oog”.
Maar er zijn drie kritische grenzen: (1) AI kan blind zijn bij het controleren van de vertaling die het produceert – zowel het maken als het bevestigen van dezelfde fout; controleer het met een ander model of ga terug naar de bron. (2) AI kan ook hallucinante ‘fouten’ verzinnen – een fout rapporteren die niet bestaat; Bevestig elke waarschuwing. (3) de AI begrijpt mogelijk niet volledig de werkelijke ernst van een kritieke fout (een dosisfout kan fataal zijn); De deskundige doet de weging. AI versnelt dus de kwaliteitscontrole, maar de uiteindelijke kwaliteitsbeslissing en goedkeuring van de levering ligt bij de mens.
Let op: Zeggen "AI heeft QA doorstaan, het is schoon" is een vals gevoel van vertrouwen. AI-auditing is geen vervanging voor menselijke LQA en vergelijking met de bron; het is een pre-screeninglaag die ze op snelheid brengt.
drie minikoffers
Geval 1: Automatische QA heeft 40 getalfouten gevonden. Bij de vertaling van een financieel rapport heeft geautomatiseerde QA veertig mismatches in getal/formaat tussen bron en doel opgespoord (scheidingsteken voor duizendtallen, decimaalteken, valuta). Het menselijk oog zou de meeste hiervan missen; voertuig vermeld in seconden.
Geval 2: MQM-score leidde tot motorselectie. Eén bureau MQM schatte de output van twee verschillende MT-engines op 2.000 woorden: Engine A 12 foutpunten, Engine B 31. Objectieve meting beslechtte het debat "wat is beter" met een score; Het bureau maakte van Engine A de standaard en plande het budget na de revisie dienovereenkomstig.
Geval 3 – AI-audit heeft zijn eigen fout gemist. Een vertaler liet de vertaling van de LLM begeleiden door dezelfde LLM; Het model zei "geen probleem", een terminologiefout die ze zelf maakte. De fout kwam aan het licht toen de vertaler een kruiscontrole uitvoerde met een ander model en een andere bron; Het team hanteerde de regel dat "hetzelfde model zichzelf niet mag beheersen".
Vier kopieerbare sjablonen
1) Op MQM gebaseerde foutcontrole:
Jouw rol: LQA-beoordelaar. Vergelijk de bron en vertaling hieronder. Geef elke gevonden fout op in de volgende indeling: [categorie: nauwkeurigheid/terminologie/vloeiendheid/stijl/formaat][gewicht: kritisch/groot/klein] [locatie] [opmerking] [correctie]. Markeer de waarschuwing waarvan u niet zeker bent als "bevestiging vereist"; errorfabrication.Bron: [...] | Vertaling: [...]
2) Scannen van kritieke fouten (hoog risico):
Zoek ALLEEN naar kritische fouten in de onderstaande vertaling: dit betekent inversie, getal-/dosis-/datumfout, verlies van negatie, vervanging van wettelijke verplichting, veiligheidswaarschuwingsfout. Negeer kleine stijlproblemen. Vermeld de bron voor elke kritische bevinding.Bron: [...] | Vertaling: [...]
3) Automatische aanvullende QA-controle:
Noem de formele inconsistenties in de volgende bron-doelparen: nummer komt niet overeen, ontbrekende/extra tijdelijke aanduiding of tag, inconsistente term, onvertaald segment, verschil in eenheid/valuta. Geef gewoon de problemen met hun locatie. Paren: [...]
4) Onafhankelijk tweede oog (kruiscontrole):
Beoordeel deze vertaling ZONDER VOOROORDEEL; Ga er niet vanuit dat je het geschreven hebt. Geef de bron een kwaliteitsbeoordeling (1-5) voor trouw, terminologie en natuurlijkheid, en noteer de drie belangrijkste problemen. Het is aan mij om te beslissen. Bron: [...] | Vertaling: [...]
Zwakke prompt/sterke prompt
Zwak: "Is deze vertaling goed?" (Geen criteria; de AI retourneert een nutteloos antwoord zoals 'over het algemeen goed'.)
Strong: "Controleer deze vertaling aan de hand van de bron. Label elke fout met categorie (nauwkeurigheid/terminologie/vloeiing) en ernst (kritiek/groot/klein). Focus vooral op fouten in aantallen, ontkenningen en terminologie. Verzin geen fouten; markeer 'bevestiging nodig' als je het niet zeker weet."
Verschil: sterke prompt geeft een foutframe en focus; De output is een vergelijkbaar en bruikbaar kwaliteitsrapport.
Kwaliteitslagentabel
laag
wat vangt
Wie/wat doet
Automatische kwaliteitscontrole
Aantal, label, consistentie
Gereedschap/script
AI-controle
Mogelijke betekenis-/terminologiefouten
LLM (met bevestiging)
Menselijke LQA
Betekenis, toon, cultuur, gewicht
deskundige beoordelaar
MQM/DQF-score
Objectieve foutscore
mens met frame
Leveringsbevestiging
uiteindelijke verantwoordelijkheid
competente vertaler
Veel voorkomende fouten
- Sla de geautomatiseerde QA over en ga direct aan de slag met lezen. Stilistische fouten leiden de aandacht af.
- Vervanging van AI-inspectie door menselijke LQA. AI pre-screent, keurt het niet goed.
- Hetzelfde model zijn eigen vertaling laten controleren. Blinde vlek; kruiscontrole vereist.
- Geen wegingsfouten. Kritisch en klein als hetzelfde beschouwen, verstoort de prioriteit.
- Het corrigeren van ‘fouten’ die door de AI zijn gemaakt zonder deze te bevestigen. Je kunt de juiste zin verdraaien.
Automatische statistieken: BLEU, COMET en limieten
Er bestaat ook een wereld van geautomatiseerde statistieken op het gebied van kwaliteitsmeting. BLEU (Bilingual Evaluation Understudy) vergelijkt een machinevertaling met een menselijke referentievertaling en geeft een score van 0-100 op basis van woordoverlap; Het was lange tijd de standaard voor het vergelijken van MT-systemen. Een nieuwere metriek, COMET, is gebaseerd op een neuraal netwerk en legt semantische gelijkenis beter vast dan BLEU. Deze statistieken zijn waardevol voor het snel en automatisch vergelijken van twee motoren op basis van big data.
Maar de grenzen zijn duidelijk: metrieken zoals BLEU kijken naar woordoverlap, maar begrijpen de betekenis niet echt. Een vertaling die afwijkt van de referentie maar wel accuraat is, kan een lage score krijgen; Een vertaling die vergelijkbaar is met de referentie maar onjuist is, kan een hoge score krijgen. Een kritische negativiteitsfout bestaat uit één woord en heeft dus weinig invloed op de metriek, maar is feitelijk catastrofaal. Daarom meten geautomatiseerde statistieken trends op systeemniveau en bepalen ze niet de leverbaarheid van een individuele tekst. Op MQM gebaseerde menselijke evaluatie en deskundig oordeel bepalen of een vertaling naar de klant gaat, en niet automatisch een score. Gebruik statistieken als kompas, niet als oordeel.
Samengevat
Vertaalkwaliteit is geen subjectief gevoel, het is iets meetbaars. Automatische QA scant grondig op formele fouten; menselijke LQA evalueert betekenis, toon en cultuur; Foutenkaders zoals MQM kwantificeren kwaliteit per categorie en gewicht, waardoor objectieve vergelijking mogelijk wordt. AI is een krachtig tweede oog dat deze controle versnelt, maar kan blind zijn voor zijn eigen vertaling, fouten maken en er niet in slagen het werkelijke gewicht volledig te begrijpen; Daarom behoort de uiteindelijke kwaliteitsbeslissing, weging en goedkeuring van de levering toe aan de bevoegde vertaler.
Applicatie taak
Ontvang een machinevertalingsuitvoer. Maak eerst een lijst van formele fouten met "automatische aanvullende QA-controle", en vermeld vervolgens taalfouten per categorie en gewicht met "MQM-gebaseerde foutcontrole". Ik beoordeel elke fout (kritiek 10, groot 5, klein 1) met een drempelwaarde per woord en vraag: "Kan deze worden geleverd?" Beantwoord de vraag. Bevestig ten slotte bij de bron hoeveel van de door de AI gemarkeerde fouten reëel zijn en hoeveel verzonnen zijn.
controlelijst
- [ ] Ik heb automatische QA uitgevoerd en eventuele formele fouten opgeschoond.
- [ ] Taalfouten heb ik gemarkeerd met een vakje (categorie + gewicht).
- [ ] Kritieke fouten heb ik in een aparte, geprioriteerde ronde gescand.
- [ ] Ik heb de AI-controle overgenomen en indien nodig vergeleken met een ander model.
- [ ] Ik heb de leveringsbeslissing genomen op basis van de numerieke drempel en mijn eigen deskundig oordeel.