Jedinica 8 / 11

Kontrola kvaliteta (QA), metrika evaluacije i LQA

Dobici:

  • Sposobnost razlikovanja između automatskih QA i jezičkih LQA slojeva i primjene oba u ispravnom redoslijedu
  • Sposobnost objektivne evaluacije prijevoda prema kategoriji i težini (kritično/glavno/malo) s okvirom grešaka kao što je MQM
  • Biti u stanju donijeti konačnu odluku kada koristite AI kao revizor, poznavanje njegove sljepoće za vlastiti prijevod, rizik od grešaka i ograničenja automatiziranih metrika

U trenutku kada kažete da je prevod "gotov", to je pola posla; Druga polovina je dokazati da je taj prijevod zapravo pouzdan. U ovoj cjelini naučit ćete sistematske načine mjerenja kvaliteta prijevoda: automatizirane provjere kvalitete, okvire grešaka LQA zasnovane na ljudima, metriku kvaliteta i kako koristiti AI kao „inspektora“ – i njegove granice. Cilj je odmaknuti se od subjektivnosti "mislim da je dobro" i postati stručnjak koji definira, mjeri i dokazuje kvalitet.

Dvije vrste kontrole kvaliteta: automatska i jezička

QA (Quality Assurance) radi u dva sloja u prijevodu:

Automatizirani QA: stilske greške koje CAT alati i skripte hvataju — nepodudaranje brojeva, nedostatak/višak razmaka, nedosljedan termin, neprevedeni segment, loš čuvar mjesta/oznaka, dvostruki razmak, interpunkcija. Oni se skeniraju brzo i potpuno mašinski; Izmiče ljudskom oku, ali ga vozilo uhvati.

LQA (Linguistic Quality Assurance): Ovo je sloj na kojem ljudski evaluator ispituje značenje, terminologiju, stil, gramatiku i lokalnu prikladnost. Automatski QA "da li se broj podudara?" gleda na pitanje; LQA „da li je značenje ispravno, je li prikladan ton, da li je kulturološki primjeren?“ On gleda na pitanje. To dvoje se međusobno nadopunjuju; Jedno ne zamjenjuje drugo.

Savjet: Uvijek prvo pokrenite Auto QA; Čišćenje formalnih grešaka omogućava ljudskom evaluatoru da posveti pažnju stvarnim lingvističkim problemima. Recenzent koji se zamara sa greškom u broju, propustit će grešku u tonu.

Okviri grešaka: MQM i DQF

Standardne tipologije grešaka se koriste kako bi kvalitet bio mjerljiv, a ne „dobar/loš“. Najčešći je MQM (Multidimensional Quality Metrics): on svakoj grešci dodeljuje kategoriju (tačnost, tečnost, terminologija, stil, lokalitet, format) i težinu (kritična, glavna, manja). Drugi okvir je DQF (Dynamic Quality Framework) i spominje se zajedno sa MQM.

Zašto je to važno? Jer s ovim okvirom možete dati ocjenu greške prijevodu, objektivno uporediti različite prevodioce/mašine i pitati "može li se ovaj tekst dostaviti?" Na pitanje odgovarate numeričkim pragom. Na primjer: kritična greška = 10 bodova, velika = 5, manja = 1; tekst ispod određenog praga prolazi po određenoj riječi.

Kritična greška: greška koja izokreće značenje, stvara sigurnosni/pravni rizik, šteti brendu (pogrešna doza, „nije odgovoran“ umjesto „odgovoran“). Glavni: ometajući, ali bezopasan. Manji: primjetan, ali ne umanjuje značenje (mali stil/interpunkcija).

Korištenje AI kao kontrolera — i njegova ograničenja

AI je brz i od pomoći u provjeravanju prijevoda u odnosu na okvir grešaka: možete reći „označite ispravnost, terminologiju, greške u tečnosti u ovom prijevodu pomoću MQM kategorija“. Smanjuje vaše slijepe uglove i daje vam brzo "drugo oko".

Ali postoje tri kritična ograničenja: (1) AI može biti slijep pri provjeravanju prijevoda koji proizvodi – i da napravi i potvrdi istu grešku; provjerite s drugim modelom ili se vratite izvoru. (2) AI takođe može da izmisli halucinantne „greške“ — prijavi grešku koja ne postoji; Potvrdite svako upozorenje. (3) AI možda neće u potpunosti shvatiti ozbiljnost kritične greške u stvarnom svijetu (greška doze može biti fatalna); Ekspert vrši merenje težine. Dakle, AI ubrzava QA, ali konačna odluka o kvaliteti i odobrenje isporuke leži na čovjeku.

Oprez: Reći "AI je prošao QA, čist je" je lažni osjećaj samopouzdanja. AI revizija nije zamjena za ljudski LQA i poređenje sa izvorom; to je sloj prethodnog pregleda koji ih dovodi do brzine.

tri mini kofera

Slučaj 1 — Automatski QA je pronašao 40 grešaka u broju. U prijevodu finansijskog izvještaja, automatizirani QA je uhvatio 40 neusklađenosti broja/formata između izvora i cilja (razdjelnik hiljada, decimala, valuta). Ljudsko oko bi propustilo većinu ovih; vozilo navedeno u sekundama.

Slučaj 2 — MQM rezultat je doveo do izbora motora. Jedan biro MQM je ocenio izlaz dva različita MT motora na 2.000 reči: motor A 12 tačaka greške, motor B 31. Objektivno merenje je rešilo debatu „šta je bolje“ rezultatom; Biro je napravio motor A kao standard i u skladu s tim planirao svoj budžet nakon revizije.

Slučaj 3 — AI revizija je propustila sopstvenu grešku. Prevodilac je imao prevod LLM-a pod nadzorom istog LLM; Manekenka je rekla "nema problema", što je terminološka greška koju je sama napravila. Greška je otkrivena kada je prevodilac unakrsno provjerio s drugim modelom i izvorom; Tim je usvojio pravilo da "isti model ne treba da kontroliše sam sebe".

Četiri šablona za kopiranje

1) Provjera grešaka zasnovana na MQM:

Vaša uloga: LQA procjenitelj. Uporedite izvor i prevod ispod. Navedite svaku grešku koju nađete u sljedećem formatu: [kategorija: tačnost/terminologija/tečnost/stil/format][težina: kritična/veća/manja] [lokacija] [komentar] [ispravka]. Označite upozorenje za koje niste sigurni kao "potrebna je potvrda"; errorfabrication.Izvor: [...] | Prijevod: [...]

2) Skeniranje kritične greške (visok rizik):

Potražite kritične greške SAMO u donjem prevodu: inverzija značenja, greška broja/doze/datuma, gubitak negacije, zamena zakonske obaveze, greška sigurnosnog upozorenja. Zanemarite manje probleme sa stilom. Navedite izvor za svaki kritični nalaz. Izvor: [...] | Prijevod: [...]

3) Automatska dodatna kontrola QA:

Navedite formalne nedosljednosti u sljedećim parovima izvor-cilj: nepodudaranje broja, nedostajući/dodatni čuvar mjesta ili oznaka, nedosljedan termin, neprevedeni segment, razlika u jedinici/valuti. Samo navedite probleme s njihovom lokacijom. Parovi: [...]

4) Nezavisno drugo oko (unakrsna provjera):

Procijenite ovaj prijevod BEZ PREDRASUDA; Nemojte pretpostavljati da ste to napisali. Dajte izvoru ocjenu kvaliteta (1-5) za vjernost, terminologiju i prirodnost i navedite 3 najveća problema. Na meni je da odlučim. Izvor: [...] | Prijevod: [...]

Slaba prompt / Jaka prompt

Slabo: "Je li ovaj prijevod dobar?" (Nema kriterija; AI vraća beskorisni odgovor poput "generalno dobro.")

Jaka: "Provjerite ovaj prijevod u odnosu na izvor. Označite svaku grešku kategorijom (preciznost/terminologija/tečnost) i ozbiljnošću (kritična/veća/manja). Fokusirajte se posebno na greške u broju, negaciji i terminologiji. Nemojte izmišljati greške; označite 'potrebna je potvrda' ako niste sigurni."

Razlika: jak prompt daje okvir greške i fokus; Rezultat je uporediv i djelotvoran izvještaj o kvaliteti.

Tabela kvalitetnih slojeva

sloj

šta hvata

Ko/šta radi

Auto QA

Broj, oznaka, konzistencija

Alat/skripta

AI kontrola

Moguće greške u značenju/terminologiji

LLM (sa potvrdom)

LQA za ljude

Značenje, ton, kultura, težina

stručni evaluator

MQM/DQF rezultat

Rezultat objektivne greške

čovek sa okvirom

Potvrda isporuke

krajnja odgovornost

kompetentan prevodilac

Uobičajene greške

  • Preskakanje automatizovanog QA i prelazak direktno na čitanje. Stilske greške odvlače pažnju.
  • Zamjena AI inspekcije ljudskim LQA. AI pre-screens, ne odobrava.
  • Imajući isti model provjerite vlastiti prijevod. Blind spot; potrebna unakrsna provjera.
  • Nisu greške u ponderiranju. Gledanje na kritične i minorne kao iste narušava prioritet.
  • Ispravljanje "grešaka" koje je napravila AI bez njihove potvrđivanja. Možete iskriviti tačnu rečenicu.

Automatska metrika: BLEU, COMET i limiti

Postoji i svijet automatiziranih metrika u mjerenju kvaliteta. BLEU (Bilingual Evaluation Understudy) upoređuje mašinski prevod sa ljudskim referentnim prevodom i daje rezultat od 0-100 na osnovu preklapanja reči; To je bio standard za poređenje MT sistema dugo vremena. Novija metrika, COMET, bazirana je na neuronskim mrežama i bilježi semantičku sličnost bolje od BLEU. Ove metrike su vrijedne za brzo i automatsko poređenje dva motora na velikim podacima.

Ali njegove granice su jasne: metrike kao što je BLEU gledaju na preklapanje riječi, ne razumiju zapravo značenje. Prijevod koji se razlikuje od reference, ali je tačan, može dobiti nisku ocjenu; Prijevod koji je sličan referenci, ali netačan može dobiti visoku ocjenu. Greška kritične negativnosti je jedna riječ tako da ima mali utjecaj na metriku, ali je zapravo katastrofalna. Zato automatska metrika mjeri trendove na nivou sistema, a ne odlučuje o isporučivosti pojedinačnog teksta. Ljudska evaluacija i stručna prosudba zasnovana na MQM odlučuju da li prevod ide klijentu, a ne automatski rezultat. Koristite metriku kao kompas, a ne kao sudiju.

Ukratko

Kvalitet prijevoda nije subjektivan osjećaj, to je nešto mjerljivo. Automatski QA temeljno skenira formalne greške; ljudski LQA procjenjuje značenje, ton i kulturu; Okviri grešaka kao što je MQM kvantifikuju kvalitet po kategoriji i težini, omogućavajući objektivno poređenje. AI je moćno drugo oko koje ubrzava ovu kontrolu, ali može biti slijepo za vlastiti prijevod, praviti greške i ne uspijeva u potpunosti shvatiti težinu u stvarnom svijetu; Dakle, konačna odluka o kvaliteti, ponderisanje i odobrenje isporuke pripada nadležnom prevodiocu.

Zadatak aplikacije

Nabavite izlaz strojnog prijevoda. Navedite formalne greške prvo s "automatskom dodatnom provjerom QA", a zatim navedite jezičke greške po kategoriji i težini s "provjerom grešaka zasnovanom na MQM". Ocjenjujem svaku grešku (kritičnih 10, velikih 5, manjih 1) pragom po riječi i pitam "može li se isporučiti?" Odgovori na pitanje. Konačno, potvrdite sa izvorom koliko je grešaka koje je označila AI stvarne, a koliko izmišljene.

kontrolna lista

  • [ ] Pokrenuo sam automatski QA i ispravio sve formalne greške.
  • [ ] Jezičke greške sam označio kvadratićem (kategorija + težina).
  • [ ] Skenirao sam kritične greške u zasebnom krugu sa prioritetima.
  • [ ] Dobio sam AI kontrolu i provjerio je s drugim modelom ako je potrebno.
  • [ ] Odluku o isporuci sam donio na osnovu brojčanog praga i vlastite stručne procjene.