Egység 5 / 11

AI integráció CAT eszközökkel és fordítási memóriával (TM)

Nyereség:

  • A fordítási memória (TM), a fuzzy egyezések és a szegmensek fogalmának megértése, valamint a fuzzy egyezések különbségeinek kihasználása azok adaptálásával, nem pedig vakon.
  • Képes alkalmazni azt a fegyelmet, hogy csak jóváhagyott fordításokat írjon a TM-re, tartsa elkülönítve az ügyfél TM-eket és végezzen TM-karbantartást
  • Képes a magánélet védelmére azáltal, hogy szabályozza, hová kerüljenek az adatok az MT/LLM integrációban a CAT-n belül

A professzionális fordítás leggyakrabban CAT-eszközben történik, nem egyszerű szövegszerkesztőben. Ebben az egységben megtanulja a CAT-eszközöket, a fordítás középpontjában álló fordítási memóriát (TM), hogyan működnek együtt a gépi fordítással és az LLM-mel, és hogyan kell hatékonyan és biztonságosan használni ezt az ökoszisztémát. A cél az, hogy olyan fordítástechnikai felhasználóvá váljunk, aki egy teljes projektet kezel, nem pedig egyes mondatokat, következetesen, gyorsan és követhetően.

Alapfogalmak

A CAT eszköz (Computer-Assisted Translation) egy professzionális szoftver (például Trados, memoQ, Phrase, MateCat), amely mondatonként (szegmensenként) rendezi a fordítást, és összekapcsolja a fordítási memóriát és a terminusbázist. Egymás mellett mutatja a forrást és a célt, elkapja az ismétléseket, megőrzi a formázást.

A TM (Translation Memory) egy adatbázis, amely a korábban lefordított forrás-cél mondatpárokat tárolja. Amikor új mondat érkezik, ha van hasonló mondat a TM-ben, az ügynök javasolja Önnek. A kulcsfogalom itt a fuzzy match: az új mondat hasonlósága egy mondathoz a TM-ben (100% = pontosan ugyanaz, 85% = nagymértékben hasonló). A magas egyezések felgyorsítják a munkát, mert újra felhasználja korábbi fordítását.

A szegmens a fordítás alapegysége – általában egy mondat. A CAT eszköz szegmensekre osztja a szöveget, és mindegyiket külön szerkeszti.

A TM fontossága: Az MT nyers piszkozatokat készít, de a TM visszaküldi az Ön jóváhagyott, emberi minőségű múltbeli fordításait. A kettő különbözik: az MT egy előrejelzés, a TM egy memória.

Tipp: Ne keverje össze a TM-et és az MT-t. A 100%-os TM egyezés (az Ön korábban jóváhagyott fordítása) általában megbízható; Az MT ajánlást mindig ellenőrizni kell. A CAT eszközök a kettőt különböző színekkel/címkékkel mutatják; mindig látni ezt a különbséget.

Az MT és az LLM integrálása a CAT-be

A modern CAT-eszközök belsőleg hívják az MT-motorokat és egyre inkább az LLM-eket: ha nincs egyezés a TM-ben, az ügynök automatikusan visszaküld egy MT-ajánlást a szegmenshez; utólag szerkeszted (azaz az MTPE CAT-ben folyik). A legújabb generációs eszközök integrálják az LLM-et is: olyan műveleteket hajthat végre az eszközben, mint például "ezt a szegmenst ezzel a hanggal írja át", "ezt a kifejezést javítsa ki terminusba" stb.

Ennek az integrációnak az előnye: a TM, a terminálbázis, az MT és az LLM egy képernyőn egyesül; Minden egyes mondatnál létrejön a "először nézd meg a TM-et, ellenkező esetben javasold az MT-t, a QA kifejezés automatikusan" folyamat jön létre. Hátránya és óvatosság: hova kerülnek az adatok? A felhő alapú MT/LLM integráció képes szöveget küldeni külső szerverekre; Bizalmas munkában ez szerződésszegést jelenthet. Győződjön meg arról, hogy a jármű melyik motorhoz van csatlakoztatva, és milyen adatszabályzattal.

A fordítási memória betáplálása és törlése

A TM értéke annyi, mint a benne lévő fordítások minősége. Szemet be, szemét ki. Két tudományág:

  1. Csak írja meg a hiteles fordítást a TM-nek. Ha a nyers MT kimenetet érvényesítés nélkül menti a TM-be, akkor az rossz "memóriaként" fog visszatérni a jövőbeli jobokhoz.
  2. Végezze el a TM karbantartását. Idővel a kifejezések változnak, és hibák lépnek fel. Rendszeresen tisztítsa meg a TM-et, javítsa ki a kopott/nem megfelelő párokat. Ebben a munkában az LLM-et arra használom, hogy megkérdezzem: "van-e inkonzisztencia/kifejezés torzítás ezekben a TM-párokban?" Használhatja auditorként.
Vigyázat: Egy ügyfél TM-jének használata egy másik ügyfél vállalkozásában a titoktartás megsértését és a kifejezések összetévesztésének kockázatát is jelenti. A TM-eket ügyfél/projekt alapon elkülönítve tartják. A vegyes "mindent TM" tönkreteszi a bizalmasságot és a minőséget.

három mini tok

1. eset – A TM repítette az ismétléseket. Egy gyártó olyan termékcsaládot fordított le, ahol a kézikönyv 70%-a évről évre ugyanaz maradt. A TM-nek köszönhetően a 100%-os és magas fuzzy egyezések automatikusan megjelentek minden új verzióban; A 30 000 szavas műből mindössze ~9000 szó volt tényleges új fordítás. Az idő és a költségek egyharmadával csökkentek.

2. eset – A Dirty TM továbbította a hibát. Az egyik csapat ellenőrzés nélkül elmentette a nyers MT kimenetet a TM-be. Egy évvel később ugyanaz a félrefordítás újra és újra visszatért, és „megbízhatónak” tűnt, mint 100%-os egyezés; A hiba 14 különböző dokumentumra terjedt ki. A csapat bevezette a "hiteles fordítás csak TM-re" szabályt és egy takarítási körutat.

3. eset – Az integráció során kiszivárgott titok. Egy fordító bizalmas munkát végzett egy CAT-projektben, amely automatikusan csatlakozott a felhőalapú MT-hez; A szöveg egy külső motorhoz került, amelynek adatpolitikája nem egyértelmű. Miután észrevették, az MT-integrációt a titkos projektekhez kikapcsolták, és csak olyan vállalati motorokat használtak, amelyek "nem tárolnak/tanítanak adatokat".

Négy másolható sablon

1) Fuzzy meccsértékelés (LLM-nek):

Alább látható az új forrásmondat, a TM hasonló mondata és annak jóváhagyott fordítása. Mondja meg, hogy pontosan mit kell változtatnom ahhoz, hogy a TM fordítást az új mondathoz igazítsam; Ne javasoljon szükségtelen változtatásokat. Mutasd világosan a jelentésbeli különbséget. Új forrás: [...] | TM forrás: [...] | TM fordítás: [...]

2) TM konzisztencia ellenőrzése:

Alább láthatók a TM forrás-cél párjai. Jelölje meg azokat az inkonzisztenciákat és kifejezéseltéréseket, ahol az azonos vagy nagyon hasonló forrásmondatokat MÁSKÉPPEN fordítják le. Csak sorold fel a problémákat.Párok: [...]

3) Szegmenshang átírása (LLM CAT-ben):

Készítse el a következő célszegmenst [kívánt hang] A jelentés megváltoztatása nélkül. Tartsa be a kifejezések listáját: [...]. Tartsa meg a számokat és a neveket. Csak az újraírt szegmenst exportálja. Szegmens: [...]

4) Az adatvédelem/integráció előzetes ellenőrzése:

MT/LLM integrációt fogok használni egy CAT projektben. Leírom a szöveg típusát ebben a projektben; Mondja meg, hogy célszerű-e felhő alapú külső motorba küldeni ezt a szöveget, milyen kérdéseket (adatmegőrzés, képzés, helymeghatározás) tegyek fel a szolgáltatónak. Szöveg típusa/adatvédelmi állapota: [...]

Gyenge felszólítás / Erős felszólítás

Gyenge: "Használja a fordítást TM-ben." (Nem világos, hogy mekkora egyezési arány és mit kell igazítani; a vakmásolás hibákhoz vezet.)

Erős: "Ez az új mondat az esetek 90%-ában megegyezik a TM-beli mondattal. Építsen a TM-fordításra, de tükrözze ezt a különbséget: a forrásban az "annual" szerepel a "havi" helyett, ezért az "évi" legyen a "havi" helyett. Ne változtasson semmi máson."

Különbség: az erős felszólítás pontosan meghatározza a mérkőzés különbségét; Megakadályozza, hogy „a régi fordítást úgy hagyjuk, ahogy van”, ami a fuzzy matching leggyakoribb hibája.

CAT ökoszisztéma-összetevők táblázata

komponens

Mit tesz

kapcsolat az AI-val

TM (fordítási memória)

Visszaadja a jóváhagyott korábbi fordításokat

Megbízható; megelőzi az MT-t

Termbase

Biztosítja a kifejezés konzisztenciáját

Az LLM felszólításként kapja meg

MT ajánlás

Nyers vázlat üres szegmensbe

Utólag szerkeszteni kell

LLM integráció

Hangszín/kifejezés/újraírás

Ellenőrzött, figyelem a magánéletre

minőségbiztosítási modul

Szám/kifejezés/címke hiba ellenőrzése

automatikus vezérlés

Gyakori hibák

  • Vakon elfogadva a fuzzy egyezést. A 85%-os egyezés 15%-os jelentésbeli különbséget rejthet.
  • Nyers MT kimenet írása a TM-be. A Dirty TM a hibát a jövőbe viszi és elszaporítja.
  • Vevői/projekt TM-ek keverése. Titoktartás és a kifejezések összetévesztésének veszélye.
  • Nem tudni, hová mennek az integrációs adatok. A rejtett szöveg kiszivároghat anélkül, hogy tudatában lenne.
  • Elfelejtve a TM/MT különbséget. MT egy becslés; A TM egy emlék. A kettő nem egyformán biztonságos.

Előfordítás és igazítás

Két fejlett CAT-funkció tovább gyorsítja a munkafolyamatot az AI-korszakban. Az első az előfordítás: a projekt elején az eszköz automatikusan kitölti az összes szegmenst TM-mel és MT-vel; Üres fájl helyett egy olyan fájllal kezd, ahol a 100%-os egyezések jóváhagyva vannak, a fuzzy egyezések adaptálásra várnak, az üresek pedig MT piszkozatok. Ez megváltoztatja a munkát az „újról való írásról” az „áttekintésre és szerkesztésre” – de az előfordítás vakon jóváhagyása helyett minden egyes részt értékelnie kell.

A második az igazítás: ha van egy forrás-cél dokumentumpár, amelyet korábban lefordítottak, de nem került be a TM-be, akkor az igazító eszköz szegmensenként egyezteti őket, és konvertálja őket TM-be. Így a múltbeli fordításai bekerülnek a „memóriába”. Figyelem az igazításnál: az automatikus illesztés nem mindig helyes; egy szegmens elcsúszása megzavarja a teljes igazítást. Az igazított párok TMing előtti áttekintése elsősorban a koszos TM kockázatát megelőzi. Ez a két funkció a jelenlegi eszközöket (múltbeli fordítások) jövőbeli vállalkozásokba történő befektetésekké alakítja.

Összefoglalva

CAT szerszámok; A fordítási memóriát, a terminálbázist, a gépi fordítást és az LLM-et egyetlen gyártósoron egyesíti. A TM egy memória, amely visszakeresi a jóváhagyott múltbeli fordításokat, és nagy sebességet biztosít az ismétlődő feladatokban; Az MT egy előrejelzés, amelyet mindig ellenőrizni kell. A hozzáértő felhasználó gondosan alkalmazkodik a homályos egyezések különbségéhez, csak jóváhagyott fordításokat ír a TM-be, elkülöníti az ügyfél TM-eket, és védi a magánéletet azáltal, hogy tudja, hová kerülnek az adatok az integráció során.

Pályázati feladat

Állítson be egy kis projektet egy CAT-eszközben (az ingyenes online CAT is működik): adjon hozzá egy termbázist és egy üres TM-et. Fordítson le egy 10 mondatos szöveget, és mentse el a jóváhagyott fordításokat a TM-be. Ezután fordítson le egy, az első szöveghez nagyon hasonló második szöveget, és adaptálja a TM által visszaadott homályos egyezéseket a "fuzzy match assessment" sablonnal; Jegyezze meg, hány mondatot hibázna, ha vakon elfogadná a TM-et.

ellenőrző lista

  • [ ] A TM-et és a terminálbázist összekapcsoltam a projekttel.
  • [ ] A fuzzy egyezések különbségét adaptívan használtam, nem pedig vakon.
  • [ ] Csak azt a hiteles fordítást írtam a TM-nek, amelyet ellenőriztem.
  • [ ] Az ügyfél/projekt TM-eket külön tartottam.
  • [ ] Megnéztem, hogy hova kerülnek az adatok az MT/LLM integrációban.