Egység 8 / 11

Minőségellenőrzés (QA), értékelési metrikák és LQA

Nyereség:

  • Képes megkülönböztetni az automatikus minőségbiztosítási és a nyelvi LQA rétegeket, és mindkettőt a megfelelő sorrendben alkalmazni
  • Képes objektíven értékelni a fordítást kategória és súly (kritikus/nagy/kisebb) szerint olyan hibakeret segítségével, mint például az MQM
  • Képes meghozni a végső döntést az AI auditorként való használatakor, ismerve annak vakságát a saját fordításával szemben, a hibák elkövetésének kockázatát és az automatizált mérőszámok korlátait

Abban a pillanatban, amikor azt mondod, hogy a fordítás „elkészült”, az már a munka fele; A másik fele annak bizonyítása, hogy a fordítás valóban megbízható. Ebben a részben a fordítási minőség mérésének szisztematikus módszereit tanulja meg: automatizált minőségbiztosítási ellenőrzéseket, emberi alapú LQA hibakereteket, minőségi mérőszámokat, valamint az AI „ellenőrként” való használatát – és annak korlátait. A cél az, hogy eltávolodjunk a „szerintem jó” szubjektivitásától, és olyan szakértővé váljunk, aki meghatározza, méri és bizonyítja a minőséget.

Kétféle minőségellenőrzés: automatikus és nyelvi

A minőségbiztosítás (Quality Assurance) a fordításban két rétegben működik:

Automatizált minőségbiztosítás: Stiláris hibák, amelyeket a CAT-eszközök és a szkriptek észlelnek – szám-eltérés, hiányzó/túlzott szóköz, inkonzisztens kifejezés, le nem fordított szegmens, rossz helyőrző/címke, kettős szóköz, írásjelek. Ezeket a gép gyorsan és teljesen beszkenneli; Kikerül az emberi szemből, de a jármű elkapja.

LQA (Linguistic Quality Assurance): Ez az a réteg, ahol az emberi értékelő a jelentést, a terminológiát, a stílust, a nyelvtant és a helyi megfelelőséget vizsgálja. Automatikus minőségbiztosítás "egyezik a szám?" ránéz a kérdésre; LQA „helyes-e a jelentés, megfelelő-e a hangnem, megfelelő-e kulturálisan?” Megnézi a kérdést. A kettő kiegészíti egymást; Az egyik nem helyettesíti a másikat.

Tipp: Először mindig futtassa az Auto QA-t; A formai hibák kiküszöbölése lehetővé teszi az értékelő számára, hogy a valódi nyelvi problémákra fordítsa a figyelmet. Az a bíráló, aki a számhibával bajlódik, figyelmen kívül hagyja a hangszínhibát.

Hibakeretek: MQM és DQF

A szabványos hibatipológiákat a „jó/rossz” helyett a minőség mérhetővé tételére használják. A legelterjedtebb az MQM (Multidimensional Quality Metrics): minden hibát kategóriához (pontosság, gördülékenység, terminológia, stílus, lokalitás, formátum) és súlyt (kritikus, fő, mellék) rendel. Egy másik keretrendszer a DQF (Dynamic Quality Framework), és az MQM-mel együtt szerepel.

Miért fontos? Mert ezzel a keretrendszerrel hibapontszámot adhat egy fordításra, objektíven összehasonlíthatja a különböző fordítókat/motorokat, és megkérdezheti, hogy "átadható ez a szöveg?" A kérdésre numerikus küszöbértékkel válaszol. Például: kritikus hiba = 10 pont, fő = 5, kisebb = 1; egy bizonyos küszöb alatti szöveg bizonyos szónként átmegy.

Kritikus hiba: olyan hiba, amely megfordítja a jelentést, biztonságot/jogi kockázatot teremt, károsítja a márkát (rossz adag, „nem felelős” a „felelős” helyett). Major: bomlasztó, de ártalmatlan. Kisebb: észrevehető, de nem rontja a jelentést (apró stílus/központozás).

Az AI használata vezérlőként – és annak korlátai

A mesterséges intelligencia gyors és segítőkész a fordítás hibakeret-ellenőrzésében: mondhatja, hogy „jelölje meg a fordítás helyességét, terminológiáját és gördülékenységi hibáit MQM kategóriákkal”. Csökkenti a vakfoltokat, és gyors "második szemet" biztosít.

De van három kritikus határ: (1) A mesterséges intelligencia vak lehet az általa készített fordítás ellenőrzésekor – ugyanazt a hibát követve el és megerősítve; keresztellenőrzés egy másik modellel, vagy térjen vissza a forráshoz. (2) A mesterséges intelligencia hallucinációs „hibákat” is kitalálhat – olyan hibát jelent, amely nem létezik; Erősítsen meg minden figyelmeztetést. (3) előfordulhat, hogy a mesterséges intelligencia nem képes teljesen felfogni egy kritikus hiba valós súlyosságát (a dózishiba végzetes lehet); A szakértő elvégzi a súlyozást. Tehát a mesterséges intelligencia felgyorsítja a minőségbiztosítást, de a végső minőségi döntés és a szállítás jóváhagyása az emberen múlik.

Vigyázat: Ha azt mondjuk, hogy „A mesterséges intelligencia átment a minőségbiztosításon, tiszta” – hamis önbizalomérzet. Az AI auditálása nem helyettesíti az emberi LQA-t és a forrással való összehasonlítást; ez egy előszűrő réteg, amely felgyorsítja őket.

három mini tok

1. eset – Az automatikus minőségellenőrzés 40 számhibát talált. Egy pénzügyi jelentés fordításában az automatizált minőségellenőrzés 40 szám/formátum eltérést észlelt a forrás és a cél között (ezres elválasztó, tizedesjegy, pénznem). Az emberi szemnek ezek közül a legtöbb hiányzik; másodpercben felsorolt ​​jármű.

2. eset – MQM pontszám vezetett a motor kiválasztásához. Az egyik MQM iroda két különböző MT motor teljesítményét 2000 szóra értékelte: A motor 12 hibaponttal, B motor 31. Az objektív mérés pontozással eldöntötte a „melyik jobb” vitát; Az iroda szabványossá tette az A motort, és ennek megfelelően tervezte meg a felülvizsgálat utáni költségvetését.

3. eset – A mesterséges intelligencia ellenőrzése elvétette a saját hibáját. Egy fordító az LLM fordítását ugyanazzal az LLM-mel felügyelte; A modell azt mondta, hogy "nincs probléma", terminológiai hibát ő követett el. A hiba akkor derült ki, amikor a fordító egy másik modellel és forrással keresztezett; A csapat elfogadta azt a szabályt, hogy "ugyanaz a modell nem irányíthatja magát".

Négy másolható sablon

1) MQM alapú hibaellenőrzés:

Az Ön szerepe: LQA értékelő. Hasonlítsa össze az alábbi forrást és fordítást. Adjon meg minden talált hibát a következő formátumban: [kategória: pontosság/terminológia/folyékonyság/stílus/formátum][súly: kritikus/fő/kisebb] [hely] [megjegyzés] [javítás]. Jelölje meg azt a figyelmeztetést, amelyben nem biztos, hogy "megerősítés szükséges"; hibagyártás.Forrás: [...] | Fordítás: [...]

2) Kritikus hibakeresés (nagy kockázat):

A kritikus hibákat CSAK az alábbi fordításban keresse: jelentése inverzió, szám/dózis/dátum hiba, tagadás elvesztése, jogi kötelezettség helyettesítése, biztonsági figyelmeztetési hiba. Hagyja figyelmen kívül a kisebb stílusproblémákat. Minden kritikus megállapítás forrását idézze.Forrás: [...] | Fordítás: [...]

3) Automatikus minőségbiztosítási kiegészítő vezérlés:

Sorolja fel a formai következetlenségeket a következő forrás-cél párokban: szám eltérés, hiányzó/extra helyőrző vagy címke, inkonzisztens kifejezés, le nem fordított szegmens, egység/pénznem különbség. Csak adja meg a problémákat a helyükkel. Párok: [...]

4) Független második szem (keresztellenőrzés):

Értékelje ezt a fordítást ELŐÍTÉLETEK NÉLKÜL; Ne hidd, hogy te írtad. Adjon a forrásnak minőségi besorolást (1-5) a hűség, a terminológia és a természetesség tekintetében, és sorolja fel a 3 legfontosabb problémát. Ezt én döntöm el. Forrás: [...] | Fordítás: [...]

Gyenge felszólítás / Erős felszólítás

Gyenge: "Jó ez a fordítás?" (Nincsenek kritériumok; a mesterséges intelligencia haszontalan választ ad, például "általában jó".)

Erős: "Ellenőrizze ezt a fordítást a forráshoz képest. Minden hibát jelöljön meg kategóriával (pontosság/terminológia/folyékonyság) és súlyossággal (kritikus/nagy/kisebb). Fókuszáljon különösen a szám-, tagadás- és terminológiai hibákra. Ne gyártson hibákat; ha nem biztos benne, jelölje be a "megerősítés szükséges" kifejezést."

Különbség: az erős felszólítás hibakeretet és fókuszt ad; Az eredmény egy összehasonlítható és használható minőségi jelentés.

Minőségi rétegtáblázat

réteg

ami megfog

Ki/mit csinál

Automatikus minőségbiztosítás

Szám, címke, konzisztencia

Eszköz/szkript

AI vezérlés

Lehetséges jelentés-/terminológiai hibák

LLM (visszaigazolással)

Emberi LQA

Jelentés, hangnem, kultúra, súly

szakértő értékelő

MQM/DQF pontszám

Objektív hibapontszám

emberi kerettel

Szállítási visszaigazolás

végső felelősség

hozzáértő fordító

Gyakori hibák

  • Az automatizált minőségellenőrzés kihagyása és az olvasás azonnali megkezdése. A stilisztikai hibák elvonják a figyelmet.
  • Az AI-vizsgálat felváltása emberi LQA-ra. A mesterséges intelligencia előszűri, nem hagyja jóvá.
  • Ugyanazzal a modellel ellenőrizze a saját fordítását. vakfolt; keresztellenőrzés szükséges.
  • Nem súlyozási hibák. A kritikus és a csekély azonosnak látása megzavarja a prioritást.
  • Az AI által kitalált "hibák" javítása azok megerősítése nélkül. Elferdítheti a megfelelő mondatot.

Automatikus mérőszámok: BLEU, COMET és határértékek

A minőségmérésben az automatizált mérőszámok világa is létezik. A BLEU (Bilingual Evaluation Understudy) a gépi fordítást egy emberi referenciafordításhoz hasonlítja, és a szavak átfedése alapján 0-100 pontot ad; Ez volt az MT rendszerek összehasonlításának szabványa sokáig. Egy újabb mérőszám, a COMET, neurális hálózat alapú, és jobban rögzíti a szemantikai hasonlóságot, mint a BLEU. Ezek a mutatók értékesek két motor gyors és automatikus összehasonlításához nagy adatokon.

De a határai egyértelműek: az olyan mérőszámok, mint a BLEU, a szavak átfedését nézik, nem igazán értik a jelentést. A hivatkozástól eltérő, de pontos fordítás alacsony pontszámot kaphat; A hivatkozáshoz hasonló, de hibás fordítás magas pontszámot kaphat. A kritikus negativitási hiba egyetlen szóból áll, így csekély hatással van a mérőszámra, de valójában katasztrofális. Ezért az automatizált mérőszámok rendszerszinten mérik a trendeket, nem pedig az egyes szövegek kézbesíthetőségét határozzák meg. Az MQM-alapú emberi értékelés és szakértői megítélés dönti el, hogy egy fordítás kerül-e az ügyfélhez, nem pedig egy automatikus pontszám. Használja a mérőszámokat iránytűként, ne bíróként.

Összefoglalva

A fordítás minősége nem szubjektív érzés, hanem valami mérhető. Az automatikus minőségellenőrzés alaposan megvizsgálja a formai hibákat; Az emberi LQA értékeli a jelentést, a hangot és a kultúrát; Az olyan hibakeretrendszerek, mint az MQM, kategória és súly szerint számszerűsítik a minőséget, lehetővé téve az objektív összehasonlítást. A mesterséges intelligencia egy erőteljes második szem, amely felgyorsítja ezt az irányítást, de vak lehet saját fordítására, hibázhat, és nem képes teljesen felfogni a valós világ súlyát; Ezért a végső minőségi döntés, a súlyozás és a kézbesítés jóváhagyása az illetékes fordítóé.

Pályázati feladat

Szerezzen gépi fordítási kimenetet. Először sorolja fel a formai hibákat az "automatikus minőségbiztosítási kiegészítő ellenőrzéssel", majd a nyelvi hibákat sorolja fel kategória és súly szerint az "MQM-alapú hibaellenőrzés" segítségével. Minden hibát (kritikus 10, fontos 5, kisebb 1) minősítek egy szavankénti küszöbértékkel, és megkérdezem, hogy "átadható?" Válaszolj a kérdésre. Végül erősítse meg a forrással, hogy az AI által megjelölt hibák közül hány valós, és hány fabrikált.

ellenőrző lista

  • [ ] Lefuttattam az automatikus minőségellenőrzést, és kitisztítottam a formai hibákat.
  • [ ] A nyelvi hibákat négyzettel jelöltem (kategória + súly).
  • [ ] A kritikus hibákat külön, prioritási körben vizsgáltam.
  • [ ] Beszereztem az AI-vezérlőt, és szükség esetén átellenőriztem egy másik modellel.
  • [ ] A kézbesítési döntést a számszerű küszöb és saját szakértői megítélésem alapján hoztam meg.