Jednotka 8 / 11

Kontrola kvality (QA), metriky hodnocení a LQA

zisky:

  • Schopnost rozlišovat mezi automatickou QA a lingvistickou LQA vrstvami a aplikovat obě ve správném pořadí
  • Schopnost objektivně vyhodnotit překlad podle kategorie a váhy (kritická/hlavní/menší) s chybovým rámcem, jako je MQM
  • Být schopen učinit konečné rozhodnutí při použití AI jako auditor, znát její slepotu vůči vlastnímu překladu, riziko chyb a limity automatických metrik

Ve chvíli, kdy řeknete, že překlad je „hotový“, je to polovina práce; Druhá polovina je dokázat, že tento překlad je skutečně spolehlivý. V této jednotce se naučíte systematické způsoby měření kvality překladu: automatizované kontroly kvality, chybové rámce LQA založené na lidech, metriky kvality a jak používat umělou inteligenci jako „inspektora“ – a její limity. Cílem je odklonit se od subjektivity „myslím, že je to dobré“ a stát se odborníkem, který kvalitu definuje, měří a dokazuje.

Dva typy kontroly kvality: automatická a lingvistická

QA (Quality Assurance) funguje v překladu ve dvou vrstvách:

Automatizovaná kontrola kvality: Stylistické chyby, které zachycují nástroje a skripty CAT – nesoulad čísel, chybějící/nadbytečné mezery, nekonzistentní termín, nepřeložený segment, špatný zástupný symbol/značka, dvojitá mezera, interpunkce. Ty jsou rychle a kompletně naskenovány strojově; Lidskému oku unikne, ale vozidlo jej zachytí.

LQA (Linguistic Quality Assurance): Toto je vrstva, kde lidský hodnotitel zkoumá význam, terminologii, styl, gramatiku a místní přiměřenost. Automatizované QA "odpovídá číslo?" dívá se na otázku; LQA "je význam správný, je vhodný tón, je kulturně vhodný?" Podívá se na otázku. Oba se doplňují; Jedno nenahrazuje druhé.

Tip: Vždy nejprve spusťte Auto QA; Očištění formálních chyb umožňuje lidskému hodnotiteli věnovat pozornost skutečným jazykovým problémům. Recenzent, který se trápí chybou v počtech, chybou tónu přehlédne.

Chybové rámce: MQM a DQF

Standardní chybové typologie se používají k tomu, aby byla kvalita měřitelná, spíše než „dobrá/špatná“. Nejběžnější je MQM (Multidimensional Quality Metrics): přiřazuje každé chybě kategorii (přesnost, plynulost, terminologie, styl, lokalita, formát) a váhu (kritická, hlavní, vedlejší). Dalším frameworkem je DQF (Dynamic Quality Framework) a je zmíněn společně s MQM.

Proč je to důležité? Protože s tímto rámcem můžete překladu přidělit chybové skóre, objektivně porovnat různé překladatele/enginy a zeptat se „lze tento text dodat?“ Na otázku odpovídáte číselným prahem. Například: kritická chyba = 10 bodů, hlavní = 5, vedlejší = 1; text pod určitou prahovou hodnotou projde za určité slovo.

Kritická chyba: chyba, která převrací význam, vytváří bezpečnostní/právní riziko, poškozuje značku (špatná dávka, „neodpovědný“ místo „odpovědný“). Major: rušivý, ale neškodný. Drobné: patrné, ale neubírající na významu (drobný styl/interpunkce).

Používání umělé inteligence jako ovladače – a jeho limity

Umělá inteligence je rychlá a užitečná při kontrole překladu proti chybovému rámci: můžete říci „označit chyby v tomto překladu za správnost, terminologii, plynulost pomocí kategorií MQM“. Snižuje vaše slepá místa a poskytuje vám rychlé „druhé oko“.

Existují však tři kritická omezení: (1) AI může být slepá při kontrole překladu, který vytváří – jak dělat, tak potvrzovat stejnou chybu; křížově zkontrolujte s jiným modelem nebo se vraťte ke zdroji. (2) AI může také vymýšlet halucinační „chyby“ – hlásit chybu, která neexistuje; Potvrďte každé varování. (3) AI nemusí plně pochopit skutečnou závažnost kritické chyby (chyba dávky může být fatální); Expert provádí vážení. Umělá inteligence tedy urychluje kontrolu kvality, ale konečné rozhodnutí o kvalitě a schválení dodávky leží na člověku.

Upozornění: Tvrzení „AI prošla QA, je čisté“ je falešný pocit sebevědomí. Audit AI nenahrazuje lidské LQA a srovnání se zdrojem; je to vrstva předběžného prověřování, která je dostane do tempa.

tři mini pouzdra

Případ 1 – Automatická kontrola kvality nalezla 40 číselných chyb. V překladu finanční zprávy zachytila ​​automatická kontrola kvality 40 neshod čísel/formátů mezi zdrojem a cílem (oddělovač tisíců, desetinné číslo, měna). Lidské oko by většinu z nich minulo; vozidlo uvedené v sekundách.

Případ 2 – skóre MQM vedlo k výběru motoru. Jedna kancelář MQM ohodnotila výkon dvou různých motorů MT na 2 000 slov: motor A 12 chybových bodů, motor B 31. Objektivní měření ustálilo debatu „co je lepší“ skóre; Předsednictvo učinilo motor A standardem a podle toho naplánovalo svůj rozpočet po revizi.

Případ 3 – Audit AI propásl vlastní chybu. Překladatel nechal na překlad LLM dohlížet stejnou LLM; Modelka řekla „žádný problém“, což byla chyba v terminologii, kterou sama udělala. Chyba byla odhalena, když překladatel provedl křížovou kontrolu s jiným modelem a zdrojem; Tým přijal pravidlo, že „stejný model by se neměl ovládat“.

Čtyři kopírovatelné šablony

1) Kontrola chyb založená na MQM:

Vaše role: LQA posuzovatel. Porovnejte zdroj a překlad níže. Každou chybu, kterou najdete, uveďte v následujícím formátu: [kategorie: přesnost/terminologie/plynulost/styl/formát][váha: kritická/hlavní/menší] [umístění] [komentář] [oprava]. Označte varování, kterým si nejste jisti, jako „potřebné potvrzení“; errorfabrication.Zdroj: [...] | Překlad: [...]

2) Skenování kritických chyb (vysoké riziko):

Kritické chyby hledejte POUZE v níže uvedeném překladu: význam inverze, chyba číslo/dávka/datum, ztráta negace, nahrazení právní povinnosti, chyba bezpečnostního varování. Ignorujte drobné stylizační problémy. U každého kritického nálezu uveďte zdroj.Zdroj: [...] | Překlad: [...]

3) Automatické doplňkové ovládání QA:

Uveďte formální nekonzistence v následujících dvojicích zdroj-cíl: neshoda čísla, chybějící/nadbytečný zástupný symbol nebo značka, nekonzistentní termín, nepřeložený segment, rozdíl jednotka/měna. Stačí dát problémy s jejich umístěním. Páry: [...]

4) Nezávislé druhé oko (křížová kontrola):

Zhodnoťte tento překlad BEZ PŘEDSUDKŮ; Nepředpokládejte, že jste to napsal. Dejte zdroji hodnocení kvality (1–5) pro věrnost, terminologii a přirozenost a uveďte 3 hlavní problémy. Je na mně, jak se rozhodnu. Zdroj: [...] | Překlad: [...]

Slabá výzva / Silná výzva

Slabý: "Je tento překlad dobrý?" (Žádná kritéria; AI vrací zbytečnou odpověď jako "obecně dobře.")

Strong: "Porovnejte tento překlad se zdrojem. Každou chybu označte kategorií (přesnost/terminologie/plynulost) a závažností (kritická/hlavní/menší). Zaměřte se zejména na chyby v počtu, negaci a terminologii. Nevytvářejte chyby; pokud si nejste jisti, označte 'potřebné potvrzení'."

Rozdíl: silná výzva dává chybový rámec a zaměření; Výstupem je srovnatelná a využitelná zpráva o kvalitě.

Tabulka vrstev kvality

vrstva

co chytá

Kdo/co dělá

Auto QA

Číslo, štítek, konzistence

Nástroj/skript

ovládání AI

Možné chyby ve významu/terminologii

LLM (s potvrzením)

Lidské LQA

Význam, tón, kultura, váha

odborný hodnotitel

Skóre MQM/DQF

Objektivní skóre chyb

člověk s rámem

Potvrzení doručení

konečnou odpovědnost

kompetentní překladatel

Časté chyby

  • Přeskočte automatizovanou kontrolu kvality a rovnou se pusťte do čtení. Stylistické chyby odvádějí pozornost.
  • Nahrazení inspekce AI lidskou LQA. AI předběžně kontroluje, neschvaluje.
  • Nechat stejný model zkontrolovat svůj vlastní překlad. Slepý úhel; nutná křížová kontrola.
  • Chyby při vážení. Vidět kritické a vedlejší jako totéž narušuje prioritu.
  • Oprava „chyb“ vytvořených AI, aniž by je potvrdila. Správnou větu můžete překroutit.

Automatické metriky: BLEU, COMET a limity

V měření kvality existuje také svět automatizovaných metrik. BLEU (Bilingual Evaluation Understudy) porovnává strojový překlad s lidským referenčním překladem a dává skóre 0-100 na základě překrývání slov; Dlouho to byl standard pro srovnávání MT systémů. Novější metrika, COMET, je založena na neuronové síti a zachycuje sémantickou podobnost lépe než BLEU. Tyto metriky jsou cenné pro rychlé a automatické porovnávání dvou motorů na velkých datech.

Ale jeho limity jsou jasné: Metriky jako BLEU se dívají na překrývání slov, ve skutečnosti nerozumí významu. Překlad, který se liší od reference, ale je přesný, může získat nízké skóre; Překlad, který je podobný odkazu, ale nesprávný, může získat vysoké skóre. Kritická chyba negativity je jediné slovo, takže má malý dopad na metriku, ale ve skutečnosti je katastrofální. To je důvod, proč automatizované metriky měří trendy na systémové úrovni, nikoli rozhodují o doručitelnosti jednotlivého textu. O tom, zda se překlad dostane ke klientovi, rozhoduje lidské hodnocení a odborný úsudek na základě MQM, nikoli automatické hodnocení. Používejte metriky jako kompas, ne jako soudce.

V souhrnu

Kvalita překladu není subjektivní pocit, je to něco měřitelného. Automatická kontrola kvality důkladně vyhledává formální chyby; lidská LQA hodnotí význam, tón a kulturu; Chybové rámce, jako je MQM, kvantifikují kvalitu podle kategorie a váhy, což umožňuje objektivní srovnání. Umělá inteligence je mocné druhé oko, které toto ovládání urychluje, ale může být slepé k vlastnímu překladu, dělat chyby a nedokáže plně pochopit váhu skutečného světa; Konečné rozhodnutí o kvalitě, vážení a schválení dodávky tedy náleží kompetentnímu překladateli.

Aplikační úkol

Získejte výstup strojového překladu. Nejprve uveďte formální chyby pomocí „automatické doplňkové kontroly kvality“, poté uveďte jazykové chyby podle kategorie a váhy pomocí „kontroly chyb na základě MQM“. Každou chybu (kritická 10, hlavní 5, vedlejší 1) hodnotím prahovou hodnotou na slovo a ptám se „může být doručena?“ Odpovězte na otázku. Nakonec u zdroje potvrďte, kolik chyb označených AI je skutečných a kolik je vymyšlených.

kontrolní seznam

  • [ ] Spustil jsem automatickou kontrolu kvality a vyčistil všechny formální chyby.
  • [ ] Jazykové chyby jsem označil rámečkem (kategorie + váha).
  • [ ] Zkontroloval jsem kritické chyby v samostatném kole s prioritou.
  • [ ] Pořídil jsem ovládací prvek AI a v případě potřeby jsem jej zkontroloval s jiným modelem.
  • [ ] Rozhodnutí o doručení jsem učinil na základě číselného prahu a vlastního odborného úsudku.