Jedinica 8 / 11

Kontrola kvalitete (QA), metrika evaluacije i LQA

Dobici:

  • Sposobnost razlikovanja između automatskih QA i jezičnih LQA slojeva i primjene oba u ispravnom redoslijedu
  • Sposobnost objektivnog ocjenjivanja prijevoda prema kategoriji i težini (kritično/glavno/manje) s okvirom pogrešaka kao što je MQM
  • Biti u mogućnosti donijeti konačnu odluku pri korištenju umjetne inteligencije kao revizora, svjestan njezine sljepoće za vlastiti prijevod, rizik od pogrešaka i ograničenja automatizirane metrike

Onog trenutka kada kažete da je prijevod "gotov", to je pola posla; Druga polovica je dokazati da je taj prijevod zapravo pouzdan. U ovoj jedinici naučit ćete sustavne načine mjerenja kvalitete prijevoda: automatizirane provjere kvalitete, LQA okvire pogrešaka temeljene na ljudima, metriku kvalitete i kako koristiti AI kao "inspektora" — i njegova ograničenja. Cilj je odmaknuti se od subjektivnosti "ja mislim da je dobro" i postati stručnjak koji definira, mjeri i dokazuje kvalitetu.

Dvije vrste kontrole kvalitete: automatska i lingvistička

QA (osiguranje kvalitete) radi u dva sloja u prijevodu:

Automatizirani QA: Stilske pogreške koje hvataju CAT alati i skripte — nepodudaranje brojeva, nedostajući/višak prostora, nedosljedan pojam, nepreveden segment, loše rezervirano mjesto/oznaka, dvostruki razmak, interpunkcija. Oni se brzo i potpuno strojno skeniraju; Izmiče ljudskom oku, ali vozilo ga hvata.

LQA (Linguistic Quality Assurance): Ovo je sloj na kojem ljudski evaluator ispituje značenje, terminologiju, stil, gramatiku i lokalnu prikladnost. Automatizirani QA "odgovara li broj?" gleda na pitanje; LQA "je li značenje ispravno, je li ton prikladan, je li kulturološki prikladan?" Gleda pitanje. Njih dvoje se nadopunjuju; Jedno ne zamjenjuje drugo.

Savjet: Uvijek prvo pokrenite Auto QA; Čišćenje formalnih pogrešaka omogućuje ljudskom ocjenjivaču da posveti pozornost stvarnim jezičnim problemima. Recenzent koji se gnjavi greškom u broju, propustit će grešku u tonu.

Okviri grešaka: MQM i DQF

Standardne tipologije pogrešaka koriste se kako bi kvaliteta bila mjerljiva, a ne "dobra/loša". Najčešći je MQM (Multidimensional Quality Metrics): on svakoj pogrešci dodjeljuje kategoriju (točnost, tečnost, terminologija, stil, lokalitet, format) i težinu (kritična, velika, sporedna). Drugi okvir je DQF (Dynamic Quality Framework) i spominje se zajedno s MQM-om.

Zašto je to važno? Budući da s ovim okvirom možete dati ocjenu pogreške prijevodu, objektivno usporediti različite prevoditelje/motore i pitati "može li se ovaj tekst isporučiti?" Na pitanje odgovarate numeričkim pragom. Na primjer: kritična pogreška = 10 bodova, velika = 5, sporedna = 1; tekst ispod određenog praga prolazi po određenoj riječi.

Kritična pogreška: pogreška koja izvrće značenje, stvara sigurnosni/pravni rizik, šteti robnoj marki (pogrešna doza, "nije odgovoran" umjesto "odgovoran"). Glavni: razoran, ali bezopasan. Manji: primjetan, ali ne umanjuje značenje (sporedni stil/interpunkcija).

Korištenje umjetne inteligencije kao kontrolera — i njezina ograničenja

AI je brz i koristan u provjeri prijevoda u odnosu na okvir pogrešaka: možete reći "označite pogreške u ispravnosti, terminologiji, tečnosti u ovom prijevodu s MQM kategorijama". Smanjuje vaše slijepe točke i daje vam brzo "drugo oko".

Ali postoje tri kritična ograničenja: (1) umjetna inteligencija može biti slijepa kada provjerava prijevod koji proizvodi - i čineći i potvrđujući istu pogrešku; provjerite s drugim modelom ili se vratite na izvor. (2) AI također može izmisliti halucinantne "pogreške" — prijaviti pogrešku koja ne postoji; Potvrdite svako upozorenje. (3) AI možda neće u potpunosti shvatiti ozbiljnost kritične pogreške u stvarnom svijetu (pogreška doze može biti kobna); Stručnjak vrši ponderiranje. Dakle, umjetna inteligencija ubrzava provjeru kvalitete, ali konačna odluka o kvaliteti i odobrenje isporuke leži na čovjeku.

Oprez: Reći "AI je prošao QA, čist je" lažan je osjećaj samopouzdanja. AI audit nije zamjena za ljudski LQA i usporedbu s izvorom; to je sloj prethodnog pregleda koji ih ubrzava.

tri mini kućišta

Slučaj 1 — Automatizirani QA pronašao je 40 brojčanih pogrešaka. U prijevodu financijskog izvješća, automatizirani QA uhvatio je 40 nepodudarnosti brojeva/formata između izvora i cilja (razdjelnik tisućica, decimalni broj, valuta). Ljudskom bi oku većina ovih promakla; vozilo navedeno u sekundama.

Slučaj 2 — MQM rezultat doveo je do odabira motora. Jedan biro MQM ocijenio je izlaz dvaju različitih MT motora na 2000 riječi: Motor A 12 točaka pogreške, Engine B 31. Objektivno mjerenje riješilo je raspravu "koji je bolji" rezultatom; Ured je napravio motor A standardom i u skladu s tim planirao svoj proračun nakon revizije.

Slučaj 3 — AI revizija je promašila vlastitu grešku. Prevoditelj je dao LLM-ov prijevod pod nadzorom istog LLM-a; Manekenka je rekla "nema problema", što je terminološka pogreška koju je sama napravila. Pogreška je otkrivena kada je prevoditelj provjerio s drugim modelom i izvorom; Tim je usvojio pravilo da "isti model ne treba sam sebe kontrolirati".

Četiri predloška za kopiranje

1) Provjera pogrešaka temeljena na MQM-u:

Vaša uloga: LQA procjenitelj. Usporedite izvor i prijevod ispod. Navedite svaku pogrešku koju pronađete u sljedećem formatu: [kategorija: točnost/terminologija/fluentnost/stil/format][težina: kritična/veća/manja] [lokacija] [komentar] [ispravak]. Označite upozorenje za koje niste sigurni kao "potrebna potvrda"; errorfabrication.Izvor: [...] | Prijevod: [...]

2) Skeniranje kritične pogreške (visoki rizik):

Potražite kritične pogreške SAMO u donjem prijevodu: inverzija značenja, pogreška broja/doze/datuma, gubitak negacije, zamjena zakonske obveze, pogreška sigurnosnog upozorenja. Zanemarite manje probleme sa stilom. Navedite izvor za svaki kritični nalaz.Izvor: [...] | Prijevod: [...]

3) Dodatna automatska kontrola kvalitete:

Navedite formalne nedosljednosti u sljedećim parovima izvor-cilj: nepodudaranje broja, nedostajuće/dodatno rezervirano mjesto ili oznaka, nedosljedni izraz, neprevedeni segment, razlika jedinica/valuta. Samo navedite probleme s njihovom lokacijom. Parovi: [...]

4) Samostalno drugo oko (provjera):

Ocijenite ovaj prijevod BEZ PREDRASUDA; Nemojte pretpostavljati da ste to vi napisali. Dajte izvoru ocjenu kvalitete (1-5) za vjernost, terminologiju i prirodnost i navedite 3 glavna problema. Na meni je da odlučim. Izvor: [...] | Prijevod: [...]

Slab upit / Jak upit

Slab: "Je li ovaj prijevod dobar?" (Nema kriterija; AI vraća beskoristan odgovor poput "općenito dobro.")

Jako: "Provjerite ovaj prijevod prema izvoru. Označite svaku pogrešku kategorijom (točnost/terminologija/fluentnost) i ozbiljnošću (kritično/veliko/manje). Posebno se usredotočite na pogreške u broju, negaciji i terminologiji. Nemojte izmišljati pogreške; označite 'potrebna potvrda' ako niste sigurni."

Razlika: snažan prompt daje okvir pogreške i fokus; Rezultat je usporedivo i djelotvorno izvješće o kvaliteti.

Tablica slojeva kvalitete

sloj

što hvata

Tko/što radi

Automatski QA

Broj, oznaka, dosljednost

Alat/skripta

AI kontrola

Moguće pogreške u značenju/terminologiji

LLM (uz potvrdu)

Ljudski LQA

Značenje, ton, kultura, težina

stručni ocjenjivač

MQM/DQF rezultat

Objektivna ocjena pogreške

ljudski s okvirom

Potvrda isporuke

krajnja odgovornost

kompetentan prevoditelj

Uobičajene greške

  • Preskočite automatizirani QA i prijeđite izravno na čitanje. Stilske pogreške odvlače pažnju.
  • Zamjena AI inspekcije ljudskim LQA. AI unaprijed provjerava, ne odobrava.
  • Imajući isti model provjerite vlastiti prijevod. Slijepa mrlja; potrebna unakrsna provjera.
  • Bez ponderiranja pogrešaka. Gledanje kritičnog i manjeg kao istog narušava prioritet.
  • Ispravljanje "pogreški" koje je napravio AI bez potvrđivanja istih. Možete iskriviti ispravnu rečenicu.

Automatska metrika: BLEU, COMET i ograničenja

Postoji i svijet automatiziranih metrika u mjerenju kvalitete. BLEU (Bilingual Evaluation Understudy) uspoređuje strojni prijevod s ljudskim referentnim prijevodom i daje ocjenu 0-100 na temelju preklapanja riječi; Dugo je to bio standard za usporedbu MT sustava. Novija metrika, COMET, temelji se na neuronskoj mreži i bolje bilježi semantičku sličnost od BLEU. Ove metrike su vrijedne za brzo i automatsko uspoređivanje dvaju motora na velikim podacima.

Ali njegove su granice jasne: metrike kao što je BLEU promatraju preklapanje riječi, a zapravo ne razumiju značenje. Prijevod koji se razlikuje od reference, ali je točan može dobiti nisku ocjenu; Prijevod koji je sličan referenci, ali je netočan može dobiti visoku ocjenu. Kritična negativna pogreška je jedna riječ pa ima mali utjecaj na metriku, ali je zapravo katastrofalna. Zato automatizirana metrika mjeri trendove na razini sustava, a ne odlučuje o isporučivosti pojedinačnog teksta. Ljudska procjena i stručna procjena temeljena na MQM-u odlučuju hoće li prijevod ići klijentu, a ne automatski rezultat. Koristite metriku kao kompas, a ne sudca.

Ukratko

Kvaliteta prijevoda nije subjektivan osjećaj, to je nešto mjerljivo. Automatski QA temeljito skenira formalne pogreške; ljudski LQA procjenjuje značenje, ton i kulturu; Okviri pogrešaka kao što je MQM kvantificiraju kvalitetu prema kategoriji i težini, omogućujući objektivnu usporedbu. AI je moćno drugo oko koje ubrzava ovu kontrolu, ali može biti slijepo za vlastiti prijevod, činiti pogreške i ne uspjeti u potpunosti shvatiti težinu stvarnog svijeta; Stoga konačna odluka o kvaliteti, težini i odobrenju isporuke pripada nadležnom prevoditelju.

Zadatak aplikacije

Dobijte izlaz strojnog prijevoda. Najprije navedite formalne pogreške s "automatskom dodatnom provjerom kvalitete", a zatim navedite jezične pogreške po kategoriji i težini s "provjerom pogrešaka temeljenom na MQM-u". Svaku pogrešku ocjenjujem (kritično 10, velika 5, manja 1) s pragom po riječi i pitam "može li se isporučiti?" Odgovorite na pitanje. Na kraju, potvrdite s izvorom koliko je grešaka koje je AI označio stvarnih, a koliko izmišljenih.

popis za provjeru

  • [ ] Pokrenuo sam automatsku provjeru kvalitete i očistio sve formalne pogreške.
  • [ ] Jezične pogreške označio sam kvadratićem (kategorija + težina).
  • [ ] Skenirao sam kritične pogreške u zasebnom, prioritetnom krugu.
  • [ ] Nabavio sam AI kontrolu i po potrebi je unakrsno provjerio s drugim modelom.
  • [ ] Odluku o isporuci donio sam na temelju brojčanog praga i vlastite stručne prosudbe.