Dobički:
- Razumevanje konceptov prevajalskega pomnilnika (TM), mehkega ujemanja in segmentov ter sposobnost uporabe razlik v mehkem ujemanju z njihovim prilagajanjem namesto na slepo.
- Sposobnost izvajanja discipline pisanja samo odobrenih prevodov v TM, ohranjanja TM strank ločeno in izvajanja vzdrževanja TM
- Zmožnost varovanja zasebnosti z nadzorom, kam gredo podatki v integraciji MT/LLM znotraj CAT
Profesionalno prevajanje se najpogosteje izvaja v orodju CAT, ne v urejevalniku navadnega besedila. V tej enoti se boste naučili orodij CAT, prevajalskega pomnilnika (TM) v središču prevajanja, kako delujejo skupaj s strojnim prevajanjem in LLM ter kako učinkovito in varno uporabljati ta ekosistem. Cilj je postati uporabnik prevajalske tehnologije, ki konsistentno, hitro in sledljivo upravlja celoten projekt in ne posameznih stavkov.
Osnovni pojmi
Orodje CAT (Računalniško podprto prevajanje) je profesionalna programska oprema (kot so Trados, memoQ, Phrase, MateCat), ki organizira stavek prevoda po stavku (segmentu) ter povezuje pomnilnik prevodov in terminsko bazo. Prikaže vir in cilj drug ob drugem, ujame ponovitve, ohrani oblikovanje.
TM (Translation Memory) je baza podatkov, ki shranjuje pare stavkov vir-cilj, ki ste jih predhodno prevedli. Ko prispe nov stavek, če obstaja podoben stavek v TM, vam ga agent predlaga. Ključni koncept tukaj je mehko ujemanje: podobnost novega stavka s stavkom v TM (100 % = popolnoma enako, 85 % = v veliki meri podobno). Visoka ujemanja pospešijo delo, ker ponovno uporabite prejšnji prevod.
Segment je osnovna enota prevoda – običajno stavek. Orodje CAT razdeli besedilo na segmente in vsakega posebej ureja.
Pomen TM: MT izdela neobdelane osnutke, vendar TM vrne vaše odobrene pretekle prevode človeške kakovosti. Oba sta različna: MT je napoved, TM je spomin.
Nasvet: Ne zamenjujte TM in MT. 100-odstotno ujemanje TM (vaš predhodno odobren prevod) je na splošno zanesljivo; Priporočilo MT je treba vedno preveriti. Orodja CAT prikazujejo oba z različnimi barvami/oznakami; vedno vidi to razliko.
Integracija MT in LLM v CAT
Sodobna orodja CAT interno kličejo motorje MT in vedno bolj LLM: če v TM ni ujemanja, agent samodejno vrne priporočilo MT za segment; ga naknadno uredite (tj. MTPE teče v CAT). Orodja najnovejše generacije integrirajo tudi LLM: v orodju lahko izvajate operacije, kot so "prepiši ta segment s tem tonom", "popravi ta izraz v bazo izrazov" itd.
Prednost te integracije: TM, termbase, MT in LLM so združeni na enem zaslonu; Za vsak stavek je vzpostavljen tok "najprej poglej TM, drugače predlagaj MT, izraz QA samodejno". Slaba stran in previdnost: kam gredo podatki? Integracija MT/LLM v oblaku lahko pošilja besedilo zunanjim strežnikom; Pri zaupnem delu je to lahko kršitev pogodbe. Ne pozabite vedeti, s katerim motorjem je vozilo povezano in s katerim pravilnikom o podatkih.
Hranjenje in brisanje prevodnega pomnilnika
Vrednost TM je tolikšna, kot je kakovost prevodov v njej. Smeti noter, smeti ven. Dve disciplini:
- Preprosto napišite overjeni prevod v TM. Če neobdelani izhod MT shranite v TM, ne da bi ga preverili, se bo vrnil v vaša prihodnja opravila kot slab "spomin".
- Izvedite vzdrževanje TM. Sčasoma se pogoji spreminjajo in prihajajo napake. Občasno očistite TM, popravite obrabljene/nepravilne pare. V tem delu uporabljam LLM, da vprašam, "ali obstajajo nedoslednosti/pristranskost izrazov v teh parih TM?" Lahko ga uporabite kot revizorja.
Pozor: uporaba blagovne znamke ene stranke v poslu druge stranke je hkrati kršitev zaupnosti in tveganje zamenjave izrazov. TM-ji se hranijo ločeno glede na stranko/projekt. Mešano "vse TM" uniči tako zaupnost kot kakovost.
trije mini kovčki
Primer 1 — TM je preletel ponovitve. Proizvajalec je dal prevesti družino izdelkov, pri čemer je 70 % njegovega priročnika leto za letom ostalo enakega. Zahvaljujoč TM so 100-odstotna in visoka mehka ujemanja samodejno prišla v vsako novo različico; Le približno 9000 besed od 30.000 besed je bilo dejanski nov prevod. Čas in stroški so se zmanjšali za tretjino.
Primer 2 – Dirty TM je razširil napako. Ena ekipa je neobdelane rezultate MT shranila v TM brez preverjanja. Leto kasneje se je isti napačen prevod znova in znova pojavil in se je zdel "zanesljiv" kot 100-odstotno ujemanje; Napaka je bila razširjena na 14 različnih dokumentih. Ekipa je uvedla pravilo "samo overjen prevod v TM" in čistilno turnejo.
Primer 3 – Zaupnost je ušla pri integraciji. Prevajalec je opravil zaupno delo v projektu CAT, ki je bil samodejno povezan z oblakom MT; Besedilo je šlo v zunanji mehanizem, katerega podatkovna politika ni jasna. Ko so opazili, je bila integracija MT za skrivne projekte izklopljena in uporabljeni so bili samo motorji podjetij, ki "ne shranjujejo/usposabljajo podatkov".
Štiri predloge za kopiranje
1) Evalvacija mehkega ujemanja (do LLM):
Spodaj je nov izvorni stavek, podoben stavek v TM in njegov odobreni prevod. Povejte mi, kaj točno moram spremeniti, da prilagodim prevod TM novemu stavku; Ne predlagajte nepotrebnih sprememb. Jasno pokažite razliko v pomenu. Nov vir: [...] | Vir TM: [...] | TM prevod: [...]
2) Preverjanje doslednosti TM:
Spodaj so pari izvor-cilj iz TM. Označite nedoslednosti in odstopanja od izrazov, kjer so enaki ali zelo podobni izvorni stavki prevedeni RAZLIČNO. Samo naštejte težave. Pari: [...]
3) Prepisovanje segmentnega tona (LLM v CAT):
Naredite naslednji ciljni segment [želeni ton] BREZ SPREMEMBE pomena. Upoštevajte seznam pogojev: [...]. Shranite številke in imena. Izvozi samo prepisani segment. Segment: [...]
4) Predhodno preverjanje zasebnosti/integracije:
Uporabil bom integracijo MT/LLM v projektu CAT. Opisal bom vrsto besedila v tem projektu; Povejte mi, ali je primerno poslati to besedilo zunanjemu mehanizmu v oblaku, katera vprašanja (hramba podatkov, usposabljanje, lokacija) naj postavim ponudniku. Vrsta besedila/status zasebnosti: [...]
Šibek poziv/močan poziv
Slabo: "Uporabi prevod v TM." (Ni jasno, kakšno stopnjo ujemanja in kaj prilagoditi; slepo kopiranje povzroča napake.)
Močno: "Ta novi stavek se 90 % časa ujema s stavkom v TM. Gradite na prevodu TM, vendar upoštevajte to razliko: vir ima 'letno' namesto 'mesečno', zato bi moral biti 'letno' namesto 'mesečno'. Ne spreminjajte ničesar drugega."
Razlika: močan poziv natančno določi razliko ujemanja; Preprečuje "puščanje starega prevoda, kot je", kar je najpogostejša napaka pri mehkem ujemanju.
Tabela komponent ekosistema CAT
komponento
Kaj počne
odnos z AI
TM (pomnilnik prevodov)
Vrne odobrene pretekle prevode
Zanesljiv; pred MT
Termbase
Zagotavlja doslednost izrazov
Podan je kot poziv LLM
MT priporočilo
Neobdelana skica v prazen segment
Mora biti naknadno urejeno
LLM integracija
Ton/izraz/prepisovanje
Nadzorovan, pozornost do zasebnosti
QA modul
Skenira napako številke/izraza/oznake
avtomatsko krmiljenje
Pogoste napake
- Slepo sprejemanje mehkega ujemanja. 85-odstotno ujemanje lahko skrije 15-odstotno razliko v pomenu.
- Zapisovanje neobdelanega izhoda MT v TM. Dirty TM prenaša napako v prihodnost in jo širi.
- Mešanje TM strank/projektov. Zaupnost in nevarnost zamenjave izrazov.
- Ne vem, kam gredo integracijski podatki. Skrito besedilo lahko uhaja, ne da bi se tega zavedali.
- Pozabimo na razliko TM/MT. MT je ocena; TM je spomin. Oba nista enako varna.
Predhodni prevod in uskladitev
Dve napredni funkciji CAT dodatno pospešita potek dela v dobi AI. Prvi je predprevajanje: na začetku projekta orodje samodejno zapolni vse segmente z TM in MT; Namesto prazne datoteke začnete z datoteko, kjer so odobrena 100-odstotna ujemanja, mehka ujemanja čakajo na prilagoditev, prazna pa so osnutki MT. To spremeni delo iz "pisanja iz nič" v "pregledovanje in urejanje" - vendar morate ovrednotiti vsak segment, namesto da slepo odobrite predprevod.
Drugi je poravnava: če imate par dokumentov izvor-cilj, ki je bil že preveden, vendar ni vstopil v pomnilnik prevodov, ju orodje za poravnavo ujema segment za segmentom in ju pretvori v pomnilnik prevodov. Tako se vaši pretekli prevodi dodajo v "spomin". Previdnost pri poravnavi: samodejno ujemanje ni vedno pravilno; en zdrs segmenta poruši celotno poravnavo. Pregled poravnanih parov pred TMingom prepreči tveganje umazanega TM. Ti dve funkciji spremenita vaša trenutna sredstva (pretekle prevode) v naložbe v prihodnja podjetja.
Če povzamem
CAT orodja; Združuje prevajalski pomnilnik, terminsko bazo, strojno prevajanje in LLM v eno proizvodno linijo. TM je pomnilnik, ki pridobi vaše odobrene pretekle prevode in zagotavlja veliko hitrost pri ponavljajočih se opravilih; MT je napoved, ki jo je treba vedno preveriti. Spreten uporabnik skrbno prilagodi razliko v mehkih ujemanjih, v TM zapiše samo odobrene prevode, pomnilnike pomnilnika strank hrani ločene in ščiti zasebnost tako, da ve, kam gredo podatki v integraciji.
Aplikacijska naloga
Nastavite majhen projekt v orodju CAT (deluje tudi brezplačni spletni CAT): dodajte terminsko bazo in prazno TM. Prevedite 10-stavčno besedilo, shranite odobrene prevode v TM. Nato prevedite drugo besedilo, ki je zelo podobno prvemu besedilu, in prilagodite mehka ujemanja, ki jih vrne TM s predlogo "vrednotenje mehkega ujemanja"; Upoštevajte, koliko stavkov bi naredili napako, če bi slepo sprejeli TM.
kontrolni seznam
- [ ] V projekt sem povezal TM in terminsko bazo.
- [ ] Razliko v mehkih ujemanjih sem uporabil prilagodljivo in ne na slepo.
- [ ] Na TM sem napisal samo overjen prevod, ki sem ga preveril.
- [ ] PM stranke/projekt sem hranil ločeno.
- [ ] Preveril sem, kam gredo podatki v integraciji MT/LLM.