Unitate 8 / 11

Controlul calității (QA), Măsurile de evaluare și LQA

Câștiguri:

  • Abilitatea de a distinge între straturile automate de QA și LQA lingvistică și de a aplica ambele în ordinea corectă
  • Abilitatea de a evalua obiectiv traducerea în funcție de categorie și pondere (critică/major/minor) cu un cadru de eroare precum MQM
  • Fiind capabil să ia decizia finală atunci când folosește AI ca auditor, cunoașterea orbirii sale față de propria sa traducere, riscul de a face greșeli și limitele metricilor automate

În momentul în care spui că o traducere este „terminată”, asta este jumătate din muncă; Cealaltă jumătate este pentru a demonstra că acea traducere este de fapt de încredere. În această unitate, veți învăța modalități sistematice de a măsura calitatea traducerii: verificări automate de QA, cadre de eroare LQA bazate pe oameni, metrici de calitate și cum să utilizați AI ca „inspector” – și limitele acesteia. Scopul este să te îndepărtezi de subiectivitatea „cred că e bine” și să devii un expert care definește, măsoară și dovedește calitatea.

Două tipuri de control al calității: automat și lingvistic

QA (Asigurarea calității) funcționează în două straturi în traducere:

QA automatizat: erori stilistice pe care instrumentele CAT și scripturile le captează — nepotrivirea numerelor, lipsa/excesul de spațiu, termenul inconsecvent, segmentul netradus, substituent/etichetă prost, spațiu dublu, punctuație. Acestea sunt scanate rapid și complet de mașină; Scăpă de ochiul uman, dar vehiculul îl prinde.

LQA (Asigurarea calității lingvistice): Acesta este nivelul în care un evaluator uman examinează semnificația, terminologia, stilul, gramatica și adecvarea locală. QA automatizat „se potrivește numărul?” se uită la întrebare; LQA „este sensul corect, este tonul potrivit, este adecvat din punct de vedere cultural?” Se uită la întrebare. Cele două se completează reciproc; Unul nu îl înlocuiește pe celălalt.

Sfat: rulați întotdeauna mai întâi Auto QA; Curățarea erorilor formale permite evaluatorului uman să dedice atenția problemelor lingvistice reale. Un evaluator care se deranjează cu eroarea numărului va rata eroarea de ton.

Cadre de eroare: MQM și DQF

Tipologiile standard de eroare sunt folosite pentru a face calitatea măsurabilă, mai degrabă decât „bună/rău”. Cel mai comun este MQM (Multidimensional Quality Metrics): atribuie fiecare eroare unei categorii (acuratețe, fluență, terminologie, stil, localitate, format) și o pondere (critică, majoră, minoră). Un alt cadru este DQF (Dynamic Quality Framework) și este menționat împreună cu MQM.

De ce este important? Pentru că, cu acest cadru, puteți da un scor de eroare unei traduceri, puteți compara în mod obiectiv diferiți traducători/motoare și puteți întreba „poate fi livrat acest text?” Răspunzi la întrebare cu un prag numeric. De exemplu: eroare critică = 10 puncte, majoră = 5, minoră = 1; textul sub un anumit prag trece pentru un anumit cuvânt.

Eroare critică: eroare care inversează sensul, creează un risc de securitate/legal, dăunează mărcii (doză greșită, „neresponsabil” în loc de „responsabil”). Major: perturbator, dar inofensiv. Minor: vizibil, dar care nu slăbește sensul (stil minor/punctuație).

Folosirea AI ca controler - și limitele sale

AI este rapid și util în verificarea unei traduceri în raport cu cadrul de eroare: puteți spune „marcați corectitudinea, terminologia, erorile de fluență în această traducere cu categorii MQM”. Vă reduce punctele oarbe și vă oferă un „al doilea ochi” rapid.

Dar există trei limite critice: (1) AI poate fi oarbă atunci când verifică traducerea pe care o produce - atât făcând, cât și confirmând aceeași greșeală; verificați cu un alt model sau reveniți la sursă. (2) AI poate, de asemenea, inventa „erori” halucinatorii - raportează o eroare care nu există; Confirmați fiecare avertisment. (3) AI poate să nu înțeleagă pe deplin gravitatea reală a unei erori critice (o eroare de doză poate fi fatală); Expertul face ponderarea. Deci AI accelerează QA, dar decizia finală privind calitatea și aprobarea livrării revine omului.

Atenție: a spune „AI a trecut QA, este curat” este un fals sentiment de încredere. Auditul AI nu este un înlocuitor pentru LQA uman și comparație cu sursa; este un strat de pre-screening care îi pune la curent.

trei mini cutii

Cazul 1 — QA automatizat a găsit 40 de erori de numere. Într-o traducere a raportului financiar, QA automatizat a detectat 40 de nepotriviri de numere/format între sursă și țintă (separator de mii, zecimală, monedă). Ochiul uman ar rata majoritatea acestora; vehicul listat în câteva secunde.

Cazul 2 – Scorul MQM a condus la selectarea motorului. Un birou MQM a evaluat producția a două motoare MT diferite la 2.000 de cuvinte: Motor A 12 puncte de eroare, Motor B 31. Măsurarea obiectivă a rezolvat dezbaterea „care este mai bine” cu un scor; Biroul a făcut ca Motorul A să fie standard și și-a planificat bugetul după revizuire în consecință.

Cazul 3 – Auditul AI a ratat propria greșeală. Un traducător a avut traducerea LLM supravegheată de același LLM; Modelul a spus „nicio problemă”, o eroare de terminologie pe care a făcut-o ea însăși. Eroarea a fost dezvăluită atunci când traducătorul a verificat cu un alt model și sursă; Echipa a adoptat regula că „același model nu ar trebui să se controleze”.

Patru șabloane copiabile

1) Verificarea erorilor bazată pe MQM:

Rolul dumneavoastră: evaluator LQA. Comparați sursa și traducerea de mai jos. Furnizați fiecare eroare pe care o găsiți în următorul format: [categorie: acuratețe/terminologie/fluență/stil/format][greutate: critică/major/minor] [locație] [comentare] [corecție]. Marcați avertismentul de care nu sunteți sigur drept „confirmare necesară”; errorfabrication.Sursa: [...] | Traducere: [...]

2) Scanare cu erori critice (risc ridicat):

Căutați erori critice NUMAI în traducerea de mai jos: sens invers, eroare număr/doză/dată, pierdere a negației, înlocuire a obligației legale, eroare de avertizare de siguranță. Ignorați problemele minore de stil. Citează sursa pentru fiecare constatare critică.Sursa: [...] | Traducere: [...]

3) Control suplimentar automat QA:

Enumerați inconsecvențele formale din următoarele perechi sursă-țintă: nepotrivire de număr, substituent sau etichetă lipsă/în plus, termen inconsecvent, segment netradus, diferență de unitate/valută. Doar dați problemele cu locația lor. Perechi: [...]

4) Al doilea ochi independent (verificare încrucișată):

Evaluează această traducere FĂRĂ PREJUDICII; Nu presupune că ai scris-o. Acordați sursei un rating de calitate (1-5) pentru fidelitate, terminologie și naturalețe și enumerați primele 3 probleme. Depinde de mine să decid. Sursa: [...] | Traducere: [...]

Prompt slab / Prompt puternic

Slab: „Este bună această traducere?” (Fără criterii; AI-ul returnează un răspuns inutil precum „în general bun.”)

Puternic: „Verificați această traducere față de sursă. Etichetați fiecare eroare cu categoria (acuratețe/terminologie/fluență) și severitate (critică/major/minor). Concentrați-vă în special pe erorile de număr, negație și terminologie. Nu fabricați erori; marcați „necesită confirmare” dacă nu sunteți sigur.”

Diferență: promptul puternic oferă un cadru de eroare și focalizare; Rezultatul este un raport de calitate comparabil și acționabil.

Tabel de straturi de calitate

strat

ce prinde

Cine/ce face

QA automat

Număr, etichetă, consistență

Instrument/script

Control AI

Posibile erori de sens/terminologie

LLM (cu confirmare)

LQA uman

Sens, ton, cultură, greutate

expert evaluator

scor MQM/DQF

Scorul de eroare obiectiv

om cu cadru

Confirmare de livrare

responsabilitatea supremă

traducător competent

Greșeli comune

  • Omiterea automată a QA și trecerea directă la citire. Erorile de stil distrag atentia.
  • Înlocuirea inspecției AI cu LQA umană. AI pre-ecranează, nu aprobă.
  • Având același model, își verifică propria traducere. Punctul mort; este necesară verificarea încrucișată.
  • Nu erori de ponderare. Privind critice și minore ca aceleași, perturbă prioritatea.
  • Corectarea „erorilor” alcătuite de AI fără a le confirma. Puteți distorsiona propoziția corectă.

Metrici automate: BLEU, COMET și limite

Există, de asemenea, o lume de metrici automate în măsurarea calității. BLEU (Bilingual Evaluation Understudy) compară o traducere automată cu o traducere de referință umană și oferă un scor de 0-100 pe baza suprapunerii cuvintelor; A fost standardul pentru compararea sistemelor MT pentru o lungă perioadă de timp. O metrică mai nouă, COMET, se bazează pe rețeaua neuronală și surprinde asemănarea semantică mai bine decât BLEU. Aceste valori sunt valoroase pentru a compara rapid și automat două motoare pe date mari.

Dar limitele sale sunt clare: valorile precum BLEU privesc suprapunerea cuvintelor, fără a înțelege cu adevărat sensul. O traducere care diferă de referință, dar este exactă, poate primi un scor scăzut; O traducere care este similară cu referința, dar incorectă poate primi un scor mare. O eroare critică de negativitate este un singur cuvânt, așa că are un impact redus asupra valorii, dar este de fapt catastrofală. De aceea, valorile automate măsoară tendințele la nivel de sistem, nu decid capacitatea de livrare a unui text individual. Evaluarea umană bazată pe MQM și judecata experților decid dacă o traducere ajunge la client, nu un scor automat. Folosește metrica ca busolă, nu ca judecător.

În concluzie

Calitatea traducerii nu este un sentiment subiectiv, este ceva măsurabil. QA automat scanează temeinic erorile formale; LQA umană evaluează sensul, tonul și cultura; Cadrele de eroare precum MQM cuantifică calitatea în funcție de categorie și greutate, permițând compararea obiectivă. AI este un al doilea ochi puternic care accelerează acest control, dar poate fi orb la propria sa traducere, poate face greșeli și nu reușește să înțeleagă pe deplin greutatea lumii reale; Prin urmare, decizia finală privind calitatea, ponderarea și aprobarea livrării aparține traducătorului competent.

Sarcina de aplicare

Obțineți o traducere automată. Mai întâi enumerați erorile formale cu „verificare suplimentară automată a QA”, apoi enumerați erorile lingvistice după categorie și pondere cu „Verificarea erorilor bazată pe MQM”. Evaluez fiecare eroare (critică 10, majoră 5, minoră 1) cu un prag pe cuvânt și întreb „poate fi livrat?” Răspunde la întrebare. În cele din urmă, confirmați cu sursa câte dintre erorile semnalate de AI sunt reale și câte sunt fabricate.

lista de verificare

  • [ ] Am rulat QA automat și am curățat orice erori formale.
  • [ ] Am marcat erorile lingvistice cu o casetă (categorie + greutate).
  • [ ] Am scanat erori critice într-o rundă separată, prioritizată.
  • [ ] Am obținut controlul AI și l-am verificat încrucișat cu un alt model, dacă este necesar.
  • [ ] Am luat decizia de livrare pe baza pragului numeric și a propriei mele expertize.