Jednotka 8 / 11

Kontrola kvality (QA), metriky hodnotenia a LQA

zisky:

  • Schopnosť rozlišovať medzi automatickou QA a lingvistickou LQA vrstvami a aplikovať obe v správnom poradí
  • Schopnosť objektívne vyhodnotiť preklad podľa kategórie a váhy (kritická/hlavná/malá) s chybovým rámcom, ako je MQM
  • Byť schopný urobiť konečné rozhodnutie pri používaní AI ako audítor, poznať jej slepotu voči vlastnému prekladu, riziko chýb a limity automatických metrík

Vo chvíli, keď poviete, že preklad je „hotový“, je to polovica práce; Druhá polovica je dokázať, že tento preklad je skutočne spoľahlivý. V tejto lekcii sa naučíte systematické spôsoby merania kvality prekladu: automatizované kontroly kvality, rámce chýb LQA založené na ľudských zdrojoch, metriky kvality a ako používať AI ako „inšpektora“ – a jej limity. Cieľom je vzdialiť sa od subjektivity „myslím, že je to dobré“ a stať sa odborníkom, ktorý kvalitu definuje, meria a dokazuje.

Dva typy kontroly kvality: automatická a lingvistická

QA (Quality Assurance) funguje v dvoch vrstvách v preklade:

Automatizovaná kontrola kvality: Štylistické chyby, ktoré zachytia nástroje a skripty CAT – nezhoda čísel, chýbajúce/nadbytočné medzery, nekonzistentný výraz, nepreložený segment, zlý zástupný symbol/značka, dvojitá medzera, interpunkcia. Tieto sú rýchlo a kompletne naskenované strojovo; Ľudskému oku unikne, no vozidlo ho zachytí.

LQA (Linguistic Quality Assurance): Toto je vrstva, kde ľudský hodnotiteľ skúma význam, terminológiu, štýl, gramatiku a miestnu primeranosť. Automatizovaná kontrola kvality "zhoduje sa číslo?" pozrie sa na otázku; LQA "je význam správny, je vhodný tón, je vhodný z hľadiska kultúry?" Pozerá sa na otázku. Tieto dve sa navzájom dopĺňajú; Jedno nenahrádza druhé.

Tip: Vždy najskôr spustite funkciu Auto QA; Očistenie formálnych chýb umožňuje hodnotiteľovi venovať pozornosť skutočným jazykovým problémom. Recenzent, ktorý sa trápi s chybou v počte, prehliadne chybu tónu.

Chybové rámce: MQM a DQF

Štandardné chybové typológie sa používajú na to, aby bola kvalita merateľná, a nie „dobrá/zlá“. Najbežnejšia je MQM (Multidimensional Quality Metrics): priraďuje každej chybe kategóriu (presnosť, plynulosť, terminológia, štýl, lokalita, formát) a váhu (kritická, hlavná, vedľajšia). Ďalším rámcom je DQF (Dynamic Quality Framework) a spomína sa spolu s MQM.

Prečo je to dôležité? Pretože s týmto rámcom môžete prideliť chybové skóre prekladu, objektívne porovnať rôznych prekladateľov/motorov a opýtať sa „môže byť tento text doručený?“ Na otázku odpovedáte číselným prahom. Napríklad: kritická chyba = 10 bodov, hlavná = 5, menšia = 1; text pod určitou hranicou prejde za určité slovo.

Kritická chyba: chyba, ktorá prevracia význam, vytvára bezpečnostné/právne riziko, poškodzuje značku (nesprávna dávka, „nezodpovedný“ namiesto „zodpovedný“). Major: rušivý, ale neškodný. Malé: nápadné, ale neznižujúce význam (malá sloha/interpunkcia).

Používanie AI ako ovládača – a jeho limity

Umelá inteligencia je rýchla a nápomocná pri kontrole prekladu oproti chybovému rámcu: môžete povedať „označte chyby v tomto preklade za správnosť, terminológiu, plynulosť pomocou kategórií MQM“. Znižuje vaše slepé uhly a poskytuje vám rýchle „druhé oko“.

Existujú však tri kritické limity: (1) AI môže byť slepá pri kontrole prekladu, ktorý vytvára – robí aj potvrdzuje rovnakú chybu; krížovo skontrolujte s iným modelom alebo sa vráťte k zdroju. (2) AI môže tiež vymýšľať halucinačné „chyby“ – nahlásiť chybu, ktorá neexistuje; Potvrďte každé varovanie. (3) AI nemusí úplne pochopiť skutočnú závažnosť kritickej chyby (chyba dávky môže byť fatálna); Zváženie vykoná odborník. Umelá inteligencia teda zrýchľuje kontrolu kvality, ale konečné rozhodnutie o kvalite a schválenie dodávky je na človeku.

Upozornenie: Tvrdenie „AI prešla kontrolou kvality, je čisté“ je falošný pocit dôvery. Audit AI nie je náhradou za ľudské LQA a porovnanie so zdrojom; je to predbežná skríningová vrstva, ktorá ich dostane do tempa.

tri mini prípady

Prípad 1 – Automatická kontrola kvality našla 40 číselných chýb. V preklade finančnej správy automatizovaná kontrola kvality zachytila ​​40 nezhôd čísel/formátov medzi zdrojom a cieľom (oddeľovač tisícok, desatinné číslo, mena). Ľudskému oku by väčšina z nich unikla; vozidlo uvedené v sekundách.

Prípad 2 – skóre MQM viedlo k výberu motora. Jedna kancelária MQM ohodnotila výkon dvoch rôznych motorov MT na 2 000 slov: motor A 12 chybových bodov, motor B 31. Objektívne meranie urovnalo debatu o tom, čo je lepšie, skóre; Predsedníctvo urobilo z motora A štandard a podľa toho naplánovalo svoj rozpočet po revízii.

Prípad 3 – Audit AI prehliadol svoju vlastnú chybu. Prekladateľ mal pod dohľadom toho istého LLM preklad LLM; Modelka povedala „žiadny problém“, čo je terminologická chyba, ktorej sa sama dopustila. Chyba bola odhalená, keď prekladateľ vykonal krížovú kontrolu s iným modelom a zdrojom; Tým prijal pravidlo, že „rovnaký model by sa nemal ovládať sám“.

Štyri kopírovateľné šablóny

1) Kontrola chýb založená na MQM:

Vaša úloha: posudzovateľ LQA. Porovnajte zdroj a preklad nižšie. Každú chybu, ktorú nájdete, uveďte v nasledujúcom formáte: [kategória: presnosť/terminológia/plynulosť/štýl/formát][váha: kritická/hlavná/malá] [umiestnenie] [komentár] [oprava]. Označte varovanie, ktorým si nie ste istí, ako „vyžaduje sa potvrdenie“; errorfabrication.Zdroj: [...] | Preklad: [...]

2) Skenovanie kritických chýb (vysoké riziko):

Kritické chyby hľadajte LEN v preklade nižšie: čo znamená inverzia, chyba číslo/dávka/dátum, strata negácie, nahradenie zákonnej povinnosti, chyba bezpečnostného varovania. Ignorujte menšie problémy so štýlom. Pri každom kritickom náleze uveďte zdroj.Zdroj: [...] | Preklad: [...]

3) Automatická doplnková kontrola kvality:

Uveďte formálne nezrovnalosti v nasledujúcich pároch zdroj-cieľ: nesúlad čísla, chýbajúci/nadbytočný zástupný symbol alebo značka, nekonzistentný výraz, nepreložený segment, rozdiel jednotka/mena. Stačí uviesť problémy s ich umiestnením. Páry: [...]

4) Nezávislé druhé oko (krížová kontrola):

Zhodnoťte tento preklad BEZ PREDSUDKOV; Nepredpokladajte, že ste to napísal. Dajte zdroju hodnotenie kvality (1-5) z hľadiska vernosti, terminológie a prirodzenosti a uveďte 3 hlavné problémy. Je len na mne, ako sa rozhodnem. Zdroj: [...] | Preklad: [...]

Slabá výzva / Silná výzva

Slabý: "Je tento preklad dobrý?" (Žiadne kritériá; AI vráti zbytočnú odpoveď ako „vo všeobecnosti dobre.“)

Silný: „Porovnajte tento preklad so zdrojom. Každú chybu označte kategóriou (presnosť/terminológia/plynulosť) a závažnosťou (kritická/hlavná/nepodstatná). Zamerajte sa najmä na chyby v počte, negácii a terminológii. Nevymýšľajte chyby; ak si nie ste istý, označte „potrebné potvrdenie“.

Rozdiel: silná výzva dáva chybový rámec a zameranie; Výstupom je porovnateľná a použiteľná správa o kvalite.

Tabuľka kvalitných vrstiev

vrstva

čo chytá

Kto/čo robí

Auto QA

Číslo, označenie, konzistencia

Nástroj/skript

AI ovládanie

Možné chyby vo význame/terminológii

LLM (s potvrdením)

Ľudské LQA

Význam, tón, kultúra, váha

odborný hodnotiteľ

Skóre MQM/DQF

Skóre objektívnej chyby

človek s rámom

Potvrdenie doručenia

konečná zodpovednosť

kompetentný prekladateľ

Časté chyby

  • Preskočte automatizovanú kontrolu kvality a pustite sa priamo do čítania. Štylistické chyby odvádzajú pozornosť.
  • Nahradenie inšpekcie AI ľudským LQA. AI predbežne kontroluje, neschvaľuje.
  • Ak má rovnaký model skontrolovať svoj vlastný preklad. Slepý uhol; potrebná krížová kontrola.
  • Chyby pri vážení. Vidieť kritické a menšie ako to isté narúša prioritu.
  • Oprava „chýb“ vytvorených AI bez ich potvrdenia. Správnu vetu môžete skomoliť.

Automatické metriky: BLEU, COMET a limity

V meraní kvality existuje aj svet automatizovaných metrík. BLEU (Bilingual Evaluation Understudy) porovnáva strojový preklad s ľudským referenčným prekladom a dáva skóre 0-100 na základe prekrývania slov; Dlho to bol štandard na porovnávanie MT systémov. Novšia metrika, COMET, je založená na neurónovej sieti a zachytáva sémantickú podobnosť lepšie ako BLEU. Tieto metriky sú cenné pre rýchle a automatické porovnávanie dvoch motorov na veľkých dátach.

Ale jeho limity sú jasné: Metriky ako BLEU sa pozerajú na prekrývanie slov, v skutočnosti nechápu význam. Preklad, ktorý sa líši od referencie, ale je presný, môže získať nízke skóre; Preklad, ktorý je podobný odkazu, ale je nesprávny, môže získať vysoké skóre. Kritická chyba negativity je jedno slovo, takže má malý vplyv na metriku, ale v skutočnosti je katastrofálna. To je dôvod, prečo automatizované metriky merajú trendy na systémovej úrovni, nie rozhodujú o doručiteľnosti jednotlivého textu. O tom, či sa preklad dostane ku klientovi, rozhoduje ľudské hodnotenie založené na MQM a odborné posúdenie, nie automatické hodnotenie. Metriky používajte ako kompas, nie ako sudcu.

V súhrne

Kvalita prekladu nie je subjektívny pocit, je to niečo merateľné. Automatická kontrola kvality dôkladne kontroluje formálne chyby; ľudské LQA hodnotí význam, tón a kultúru; Chybové rámce, ako je MQM, kvantifikujú kvalitu podľa kategórie a váhy, čo umožňuje objektívne porovnanie. AI je silné druhé oko, ktoré urýchľuje túto kontrolu, ale môže byť slepé voči svojmu vlastnému prekladu, robiť chyby a nedokáže plne pochopiť váhu skutočného sveta; Preto konečné rozhodnutie o kvalite, váženie a schválenie dodávky patrí kompetentnému prekladateľovi.

Aplikačná úloha

Získajte výstup strojového prekladu. Najprv uveďte formálne chyby pomocou „automatickej doplnkovej kontroly kvality“, potom uveďte jazykové chyby podľa kategórie a váhy pomocou „kontroly chýb na základe MQM“. Každú chybu (kritických 10, významnú 5, vedľajšiu 1) hodnotím prahovou hodnotou na slovo a pýtam sa „môže byť doručená?“ Odpovedzte na otázku. Nakoniec potvrďte so zdrojom, koľko chýb označených AI je skutočných a koľko je vymyslených.

kontrolný zoznam

  • [ ] Spustil som automatickú kontrolu kvality a vyčistil som všetky formálne chyby.
  • [ ] Jazykové chyby som označil rámčekom (kategória + váha).
  • [ ] Skontroloval som kritické chyby v samostatnom kole s prioritou.
  • [ ] Získal som ovládanie AI a v prípade potreby som ho skontroloval s iným modelom.
  • [ ] Rozhodnutie o doručení som urobil na základe číselného prahu a vlastného odborného posúdenia.