Vinster:
- Förmåga att skilja mellan automatiska QA och språkliga LQA-lager och tillämpa båda i rätt ordning
- Förmåga att objektivt utvärdera översättningen efter kategori och vikt (kritisk/dur/moll) med ett felramverk som MQM
- Att kunna fatta det slutgiltiga beslutet när man använder AI som revisor, känna till dess blindhet för sin egen översättning, risken att göra misstag och gränserna för automatiserade mätvärden
I det ögonblick du säger att en översättning är "klar" är det halva arbetet; Den andra hälften är att bevisa att den översättningen faktiskt är tillförlitlig. I den här enheten kommer du att lära dig systematiska sätt att mäta översättningskvalitet: automatiska QA-kontroller, mänskliga baserade LQA-felramverk, kvalitetsmått och hur man använder AI som en "inspektör" - och dess begränsningar. Syftet är att komma bort från subjektiviteten "jag tycker det är bra" och bli en expert som definierar, mäter och bevisar kvalitet.
Två typer av kvalitetskontroll: automatisk och språklig
QA (Quality Assurance) fungerar i två lager vid översättning:
Automatiserad QA: Stilistiska fel som CAT-verktyg och skript fångar upp — nummerfelmatchning, saknat/överskott av utrymme, inkonsekvent term, oöversatt segment, dålig platshållare/tagg, dubbelt mellanslag, skiljetecken. Dessa skannas snabbt och fullständigt maskinellt; Den slipper det mänskliga ögat, men fordonet fångar den.
LQA (Linguistic Quality Assurance): Detta är det lager där en mänsklig utvärderare undersöker mening, terminologi, stil, grammatik och lokal lämplighet. Automatiserad QA "matchar antalet?" tittar på frågan; LQA "är innebörden korrekt, är tonen lämplig, är den kulturellt lämplig?" Han tittar på frågan. De två kompletterar varandra; Det ena ersätter inte det andra.
Tips: Kör alltid Auto QA först; Att rensa upp formella fel gör att den mänskliga utvärderaren kan ägna uppmärksamhet åt verkliga språkliga problem. En recensent som stör sig på nummerfelet missar tonfelet.
Felramar: MQM och DQF
Standardfeltypologier används för att göra kvalitet mätbar snarare än "bra/dålig". Det vanligaste är MQM (Multidimensional Quality Metrics): det tilldelar varje fel till en kategori (noggrannhet, flyt, terminologi, stil, lokalitet, format) och en vikt (kritisk, större, mindre). Ett annat ramverk är DQF (Dynamic Quality Framework) och nämns tillsammans med MQM.
Varför är det viktigt? För med detta ramverk kan du ge en felpoäng till en översättning, objektivt jämföra olika översättare/motorer och fråga "kan den här texten levereras?" Du svarar på frågan med en numerisk tröskel. Till exempel: kritiskt fel = 10 poäng, större = 5, mindre = 1; text under en viss tröskel passerar per visst ord.
Kritiskt fel: fel som inverterar mening, skapar säkerhet/rättslig risk, skadar varumärke (fel dos, "inte ansvarig" istället för "ansvarig"). Major: störande men ofarlig. Mindre: märkbar men inte förringande av betydelsen (mollstil/interpunktion).
Att använda AI som en kontroller – och dess begränsningar
AI är snabb och hjälpsam för att kontrollera en översättning mot felramverket: du kan säga "markera korrekthet, terminologi, flytande fel i denna översättning med MQM-kategorier". Det minskar dina blinda fläckar och ger dig ett snabbt "andra öga".
Men det finns tre kritiska gränser: (1) AI kan vara blind när man kontrollerar översättningen den producerar – både gör och bekräftar samma misstag; krysskolla med en annan modell eller gå tillbaka till källan. (2) AI kan också hitta på hallucinatoriska "fel" — rapportera ett fel som inte existerar; Bekräfta varje varning. (3) AI:n kanske inte helt förstår den verkliga allvarlighetsgraden av ett kritiskt fel (ett dosfel kan vara dödligt); Experten gör viktningen. Så AI påskyndar QA, men det slutliga kvalitetsbeslutet och leveransgodkännandet ligger hos människan.
Varning: Att säga "AI har klarat QA, det är rent" är en falsk känsla av självförtroende. AI-revision är inte en ersättning för mänsklig LQA och jämförelse med källan; det är ett förscreeningslager som sätter fart på dem.
tre minifodral
Fall 1 — Automatiserad kvalitetskontroll hittade 40 nummerfel. I en finansiell rapportöversättning fångade automatiserad QA 40 nummer/format-felmatchningar mellan källa och mål (tusenavgränsare, decimal, valuta). Det mänskliga ögat skulle missa de flesta av dessa; fordonet listat i sekunder.
Fall 2 – MQM-poäng ledde till motorval. En byrå MQM-bedömde produktionen från två olika MT-motorer till 2 000 ord: Motor A 12 felpunkter, motor B 31. Objektiv mätning avgjorde "vilket är bättre"-debatten med en poäng; Byrån gjorde Engine A till standard och planerade budgeten efter revisionen därefter.
Fall 3 – AI-revision missade sitt eget misstag. En översättare fick LLM:s översättning övervakad av samma LLM; Modellen sa "inga problem", ett terminologifel hon gjorde själv. Felet avslöjades när översättaren korskontrollerade med en annan modell och källa; Teamet antog regeln att "samma modell inte ska kontrollera sig själv".
Fyra kopierbara mallar
1) MQM-baserad felkontroll:
Din roll: LQA-bedömare. Jämför källan och översättningen nedan. Ange varje fel du hittar i följande format: [kategori: noggrannhet/terminologi/flytande/stil/format][vikt: kritisk/stor/mindre] [plats] [kommentar] [korrigering]. Markera varningen du är osäker på som "bekräftelse krävs"; errorfabrication.Källa: [...] | Översättning: [...]
2) Skanning av kritiska fel (hög risk):
Leta efter kritiska fel ENDAST i översättningen nedan: betyder inversion, antal/dos/datumfel, förlust av negation, ersättning av juridisk skyldighet, säkerhetsvarningsfel. Ignorera mindre stylingproblem. Ange källan för varje kritiskt fynd.Källa: [...] | Översättning: [...]
3) Kompletterande automatisk QA-kontroll:
Lista de formella inkonsekvenserna i följande käll-målpar: nummerfelmatch, saknad/extra platshållare eller tagg, inkonsekvent term, oöversatt segment, enhet/valutaskillnad. Ge bara problemen med deras plats. Par: [...]
4) Oberoende andra öga (krysskontroll):
Utvärdera denna översättning UTAN FÖRDOMAR; Anta inte att du skrev det. Ge källan ett kvalitetsbetyg (1-5) för trohet, terminologi och naturlighet, och lista de tre bästa problemen. Det är upp till mig att bestämma. Källa: [...] | Översättning: [...]
Svag prompt / Stark prompt
Svag: "Är den här översättningen bra?" (Inga kriterier, AI:n returnerar ett värdelöst svar som "allmänt bra.")
Starkt: "Kontrollera den här översättningen mot källan. Märk varje fel med kategori (noggrannhet/terminologi/flytande) och svårighetsgrad (kritisk/stor/moll). Fokusera särskilt på siffer-, negations- och terminologifel. Fabrikera inte fel, markera 'bekräftelse behövs' om du är osäker."
Skillnad: stark prompt ger en felram och fokus; Resultatet är en jämförbar och handlingsbar kvalitetsrapport.
Kvalitet lager bord
lager
vad som fångar
Vem/vad gör
Auto QA
Antal, etikett, konsistens
Verktyg/skript
AI-kontroll
Eventuella betydelse-/terminologifel
LLM (med bekräftelse)
Mänsklig LQA
Mening, ton, kultur, vikt
expert utvärderare
MQM/DQF-poäng
Objektiv felpoäng
människa med ram
Leveransbekräftelse
yttersta ansvaret
kompetent översättare
Vanliga misstag
- Hoppa över den automatiserade QA och börja läsa direkt. Stilistiska fel distraherar uppmärksamheten.
- Ersätter AI-inspektion med mänsklig LQA. AI förskärmar, godkänner inte.
- Att ha samma modell kontrollera sin egen översättning. Döda vinkeln; korskontroll krävs.
- Inte viktningsfel. Att se kritiskt och mindre som detsamma stör prioriteringen.
- Korrigera "fel" som skapats av AI utan att bekräfta dem. Du kan förvränga den korrekta meningen.
Automatiska mätvärden: BLEU, COMET och limits
Det finns också en värld av automatiserade mätvärden inom kvalitetsmätning. BLEU (Bilingual Evaluation Understudy) jämför en maskinöversättning med en mänsklig referensöversättning och ger en poäng på 0-100 baserat på ordöverlappning; Det var länge standarden för att jämföra MT-system. En nyare måttenhet, COMET, är neurala nätverksbaserade och fångar semantisk likhet bättre än BLEU. Dessa mätvärden är värdefulla för att snabbt och automatiskt jämföra två motorer på big data.
Men dess gränser är tydliga: mått som BLEU ser på ordöverlappning, förstår inte riktigt innebörden. En översättning som skiljer sig från referensen men är korrekt kan få ett lågt betyg; En översättning som liknar referensen men felaktig kan få ett högt betyg. Ett kritiskt negativitetsfel är ett enda ord så det har liten inverkan på måttet, men är faktiskt katastrofalt. Det är därför automatiserade mätvärden mäter trender på systemnivå, inte bestämmer leveransbarheten för en enskild text. MQM-baserad mänsklig utvärdering och expertbedömning avgör om en översättning går till kunden, inte en automatisk poäng. Använd mått som en kompass, inte en domare.
Sammanfattningsvis
Översättningskvalitet är inte en subjektiv känsla, det är något mätbart. Automatisk QA skannar noggrant efter formella fel; mänsklig LQA utvärderar mening, ton och kultur; Felramverk som MQM kvantifierar kvalitet efter kategori och vikt, vilket möjliggör objektiv jämförelse. AI är ett kraftfullt andra öga som accelererar denna kontroll, men det kan vara blind för sin egen översättning, göra misstag och misslyckas med att helt förstå den verkliga vikten; Det slutliga kvalitetsbeslutet, viktningen och leveransgodkännandet tillhör därför den behöriga översättaren.
Applikationsuppgift
Få en maskinöversättning. Lista formella fel först med "automatisk QA kompletterande kontroll", lista sedan språkliga fel efter kategori och vikt med "MQM-baserad felkontroll". Jag betygsätter varje fel (kritiskt 10, större 5, mindre 1) med en tröskel per ord och frågar "kan det levereras?" Svara på frågan. Slutligen, bekräfta med källan hur många av de fel som flaggats av AI är verkliga och hur många som är tillverkade.
checklista
- [ ] Jag körde automatisk QA och rensade upp alla formella fel.
- [ ] Jag markerade språkliga fel med en ruta (kategori + vikt).
- [ ] Jag skannade kritiska fel i en separat, prioriterad omgång.
- [ ] Jag köpte AI-kontrollen och korskontrollerade den med en annan modell vid behov.
- [ ] Jag fattade leveransbeslutet baserat på den numeriska tröskeln och min egen expertbedömning.