Nyereség:
- Képes megkülönböztetni az NMT és LLM alapú fordítás erősségeit és gyengeségeit, és kiválasztani a megfelelő motort az üzlet típusának megfelelően
- Képes előre besorolni egy szöveg géphez való alkalmasságát, és előre értékelni azt reális időre és árra
- Képes gyorsan mérni a nyers gépi teljesítmény minőségét öt dimenzióban, és megjelölni a kockázatokat anélkül, hogy összekeverné a simaságot a pontossággal
Fordítóként a legerősebb gyorsító a gépi fordítás (MT) – de egy eszköz tudatos használata azt jelenti, hogy a megfelelő munkára, a megfelelő nyelvpáron és a megfelelő elvárások mellett alkalmazzák. Ebben az egységben megismerkedhet az MT két nagy családjával (NMT és LLM alapú fordítás), megtudhatja, melyik a jobb melyik munkához, hogyan mérhető gyorsan egy fordítás nyers kimeneti minősége a kézbesítés előtt, és hogyan válasszuk ki a munkakörnek megfelelő motort. A cél az, hogy eltávolodjunk a "mindegy, illessze-fordítsd" gondolatától, és olyan szakértővé váljunk, aki előre tudja, melyik szöveg illik a géphez, és mely emberigényes munkát igényel.
Két család: NMT és LLM alapú fordítás
Az NMT (Neural Machine Translation) olyan rendszerek, amelyek több millió kétnyelvű mondatból tanultak, és a mondat egészét fordítják le; Ilyen például a Google Translate, a DeepL, a Microsoft Translator. Erősségek: nagyon gyors, következetes, folyékonyan beszél rövid mondatokban. Gyengeség: gyakran nem lát kontextust a mondathatáron túl (értsd a teljes szövegből); A bekezdés alapján nehéz eldönteni, hogy a "part" szó partot vagy folyópartot jelent-e, és nem illik a megadott kifejezések listájához.
Az LLM-alapú fordítás (Large Language Model) olyan utasítás-vezérelt modellek, mint például a ChatGPT, Claude, Gemini használata fordításhoz. Erősség: elfogadja az utasításokat – megérti az olyan utasításokat, mint „használjon formális hangnemet”, „kövesse ezt a kifejezéslistát”, „a célközönség gyerekek”; látja a tágabb összefüggéseket; jobban rögzíti az idiómát és a hangszínt. Gyengeség: néha "túl kreatív" lehet, és hozzáadódik a forráshoz (hallucinációk kockázata), elveszti a koherenciát a hosszú szövegekben, és a költségek/sebesség a munkától függően változik.
Ökölszabály: az egyenes, ismétlődő, szaknyelvi szövegekben az NMT általában gyors és megfelelő; Az LLM rugalmasabb azokkal a szövegekkel, amelyek hangnemben, kontextusban, szókincsben és oktatásban fegyelmet igényelnek. Manapság a legtöbb szakember a kettőt együtt használja: gyors vázlat az NMT-től, hangszín/kifejezés korrekció az LLM-től.
Tipp: Egy nyelvpár gépi minősége (pl. török→angol) eltérhet az ellenkező iránytól (angol→török). Az agglutinatív, rugalmas szintaxisú nyelvek, például a török, általában nagyobb kihívást jelentenek az MT számára. Döntsd el magad, melyik motor a jobb a saját párodban néhány minta szöveggel.
A szöveg gépi kompatibilitása: először ezt kérdezze meg
Nem minden szöveg egyformán alkalmas a gépre. A fordítás megkezdése előtt engedje át a szöveget egy "alkalmassági" szűrőn:
- Jól illeszkedik a géphez: műszaki kézikönyv, termékleírás, ismétlődő interfész szöveg, szabványos levelezés, táblázat/lista. A nyelv egyszerű, a terminológia fix, a kreativitás szűkös.
- Közepes alkalmas: hírek, céges tartalom, oktatási anyagok. A gép jó körvonalakat produkál, de komoly utószerkesztést igényel a hangszín és az áramlás érdekében.
- Gépre nem alkalmas (nagy kockázatú): jogi szerződés, orvosi szöveg, reklám/szlogen, irodalmi szöveg, humor, költészet. Itt a gép csak ötleteket ad; A munka nagyrészt az emberekre hárul.
Ha ezt a különbséget már a kezdetektől megteszi, akkor egyszerre megadja a megfelelő időt/árat az ügyfélnek, és megvédi magát attól, hogy vakon bízzon a nyers kimenetben.
Gyorsan mérje meg a nyers kimeneti minőséget
Amikor egy MT kimenetet lát, azon tűnődik, hogy "jó vagy rossz?" Válaszoljon a kérdésre egy gyors ellenőrzőlistával, ne az intuícióval. Nézze meg ezt az öt dimenziót: pontosság (forráshű-e a jelentés?), teljesség (a mondat kimaradt vagy kiegészítve?), terminológia (helyes és konzisztens?), folyékonyság (a célnyelvben természetes?), formátum (megőrizték-e a címkéket, számokat, formázást?). Ezeket a dimenziókat a következő minőségi egységben elmélyítjük; Egyelőre ez legyen a szülés előtti reflex.
Figyelem: Az MT kimenet legveszélyesebb hibái a "folyékony, de helytelen" hibái. Lehet, hogy a mondat tökéletes törökül van, de lehet, hogy a forrásban szereplő "15% kedvezmény" "50% kedvezmény"-re módosult. Ne tántorítsa el a folyékonyság; Mindig külön nézze meg a számot, a negatívot és a tulajdonnevet.
három mini tok
1. eset – A jobb oldali motor felére csökkentette az időt. Az egyik fordító úgy döntött, hogy lefordít egy 12 000 szavas szoftverfelületet az NMT-vel és egy ugyanilyen volumenű marketingfüzetet az LLM-mel. Az NMT konzisztenciája a felületen felgyorsította a munkát; Az LLM tonális rugalmassága a füzetben 40%-kal csökkentette az újraírási terhet. Ha mindkét feladatot ugyanannak a motornak adnák, időpazarlás lenne.
2. eset – Az előzetes értékelés megmentette az árat. Egy iroda éppen jogi szöveget akart ajánlani, mert "meg lehet csinálni gépekkel, olcsó lesz". Az előértékelésben egy 500 szavas mintát fordítottak le; A gép két jogi kifejezést adott vissza a rendszer rossz megfelelőjével. Az iroda "súlyos utószerkesztésként" értékelte a munkát, és reális határidőt adott; Elkerülte a pénzveszteséget a rossz ajánlat miatt.
3. eset – Nyelvpár különbség. Egy csapat úgy gondolta, hogy az angol→német nyelven kiválóan működő motor ugyanolyan minőségű török→arab nyelven. A 300 szavas teszt azt mutatta, hogy az arab kimenet sokkal több korrekciót igényel. A csapat a nyelvpártól függően különböző motorokat és különböző utólagos szerkesztési költségvetéseket osztott ki.
Négy másolható sablon
1) Szöveg alkalmassági értékelés:
Az Ön szerepköre: vezető MTPE szakember. Értékelje a következő szöveget a gépi fordításra való alkalmasság szempontjából: szó szerinti/technikai vagy kreatív/kontextus szerinti? Minősítse (1) nagyon gépbarát, (2) közepes, (3) magas kockázatú kategóriába, és írja meg az indoklást. A várható szerkesztés utáni terhelés becslése: könnyű/közepes/nehéz. Szöveges példa: [200-300 szó beillesztése]
2) Utasított LLM fordítás (terminológiával és hangszínszabályozással):
Fordítsa le ezt a szöveget [forrás]→[cél].Közönség: [ki]. Hangszín: [pl. hivatalos]. Mező: [pl. pénzügy].Kifejezések listája (feltétlenül használd): [A→a, B→b].Szabályok: ne adjunk hozzá olyat, ami nincs a forrásban, tartsuk meg a számokat/dátumokat/neveket, minden mondatot cseréljünk mondatra. Jelölje meg, ahol nem vagy biztos a következővel: [?]. Szöveg: [...]
3) Két motor összehasonlítása:
Az alábbiakban ugyanannak a forrásmondatnak két különböző fordítása látható (A és B). Hasonlítsa össze mindegyiket a helyesség, a terminológia és a természetesség tekintetében, és mondja meg, melyik igényel kevesebb javítást az indoklással együtt. Forrás: [...] | A fordítás: [...] | B fordítás: [...]
4) Nyers kimenet gyors ellenőrzése:
Az alábbiakban a forrás és a gépi fordítás található. Csak jelölje be a következőket: (1) kihagyott/hozzáadott információ, (2) helytelen szám/dátum/név, (3) tagadás hiba, (4) inkonzisztens kifejezés. Ne írjon javításokat, csak sorolja fel a kockázatos területeket.Forrás: [...] | Fordítás: [...]
Gyenge felszólítás / Erős felszólítás
Gyenge: "Fordítsa le ezt a szöveget, és jó lesz." (A motor esetében a "jó" nem definiált; nincs hang, nincs kifejezés, nincs tömeg.)
Güçlü: "Fordítsa le ezt a termékleírást angolról törökre. Terület: e-kereskedelem. Közönség: fiatal fogyasztó. Hangnem: barátságos, de megnyugtató. 'pénztáros' → 'pénztári lépés', 'kívánságlista' → 'kívánságlista'. Változtasd meg a számokat és a márkanevet. Folyékony török nyelv, fordításszag nélkül."
Különbség: az erős felszólítás mérhető célt ad a motornak; a kimenet közvetlenül közelíti az utólag szerkesztett piszkozatot.
NMT vs LLM összehasonlító táblázat
Méret
NMT (Google, DeepL)
LLM (ChatGPT, Claude)
sebesség
nagyon gyors
közepes
Kapjon utasítást/hangot
gyenge
erős
Tartsa be a kifejezések listáját
korlátozott
Jó (kéréssel)
Tág kontextus
gyenge
jó
Hallucinációk veszélye
alacsony
Közepes (kontroll szükséges)
legmegfelelőbb munkakör
Egyenes/technikai/ismétlődő
Hangszín/kontextus/kreatív
Gyakori hibák
- Ugyanazt a motort használja minden munkához. Nem a munka típusának megfelelő motor kiválasztása idő- és minőségveszteséget okoz.
- Ár/idő megadása előzetes értékelés nélkül. Egy 200-300 szavas teszt a kezdetektől felfedi a meglepetéseket.
- A folyékonyságot összetéveszti a pontossággal. Egy szép mondat nem jelent helyes mondatot.
- A nyelvpár és az iránykülönbség figyelmen kívül hagyása. Egy jó motor az egyik párban gyenge lehet a másikban.
- Nem vettem észre az LLM kiegészítéseit. Az LLM néha olyan mondatokat ad hozzá, amelyek nem szerepelnek a forrásban: „segítségként”; ezt nézd meg.
Kontextus ablak és konzisztencia
Ha hosszú szöveget fordít LLM-mel, ismerni kell egy technikai korlátot: a kontextusablakot – azt a szövegmennyiséget, amelyet a modell egyszerre „láthat” és észben tarthat. Ha a szöveg nagyobb, mint ez az ablak, akkor darabokra kell osztania, és a modell a következő részletben "elfelejtheti" az előző részekben hozott döntést vagy hangot. Tehát ahelyett, hogy egy hosszú könyvet vagy dokumentumot egy darabban lefordítana, az egyes részekre emlékeztetve a terminus- és stílusösszefoglalót megőrzi a következetesség. Ez a probléma nem fordul elő rövid szövegekben; A hosszú művekben, például regényekben és kézikönyvekben azonban szükség van a szövegrészek konzisztenciájának további ellenőrzésére. Gyakorlati megoldás: készítsünk egy "projektmemóriát" (kifejezések + karakterek + hangszín döntések), és add hozzá minden darab elejéhez, és a fordítás végén vizsgáld meg a konzisztenciát a darabok között. Az NMT-ben ez a probléma másképp tapasztalható: Mivel az NMT mondatról mondatra fordít, a bekezdéshosszúság már gyenge, ezért a terminus felvállalja a fegyelem kifejezést.
Összefoglalva
A gépi fordításnak két családja létezik: az NMT, amely gyors és következetes, és az LLM, amely elfogadja az utasításokat, és jobban látja a kontextust és a hangot. A mesterfordító előre besorolja a szöveg géphez való alkalmasságát, a munkának megfelelően kiválasztja a motort, a kiszállítás előtt gyorsan méri a nyers kimenet minőségét, és soha nem keveri össze a folyékonyságot a pontossággal. Ez az előzetes értékelési reflex lehetővé teszi, hogy reális időt/árat adjon, és megvédje magát a vak bizalomtól.
Pályázati feladat
Fordítsa le ugyanazt a 200 szavas szöveget mind NMT-eszközzel, mind LLM-mel. Hasonlítsa össze a két kimenetet öt dimenzióban (pontosság, teljesség, terminológia, gördülékenység, formátum), és írja meg az indoklást, hogy melyiknek van szüksége kevesebb utólagos szerkesztésre ehhez a szöveghez. Ezután mindkét esetben jelölje meg a probléma/esetlegesség/távú kockázatokat a „nyers kimenet gyorsellenőrzése” sablonnal.
ellenőrző lista
- [ ] Besoroltam a szöveg géphez való alkalmasságát (alacsony/közepes/magas kockázat).
- [ ] A munka típusától függően döntöttem el, hogy NMT-t vagy LLM-et használok.
- [ ] Előzetes értékelést készítettem kis mintával, és ennek megfelelően határoztam meg az időtartamot/árat.
- [ ] Gyorsan megvizsgáltam a nyers kimenetet öt dimenzióban.
- [ ] Külön ellenőriztem a számot, a dátumot, a nevet és a negatívokat, anélkül, hogy a folyékonyság megtévesztett volna.