Kasu:
- Tõlkemälu (TM), ähmaste vastete ja segmentide mõistete mõistmine ning hägusate vastete erinevuste kasutamine neid kohandades, mitte pimesi.
- Võimalus rakendada TM-i ainult heakskiidetud tõlgete kirjutamise, kliendi TM-ide eraldi hoidmise ja TM-i hoolduse distsipliini
- Võimalus kaitsta privaatsust, kontrollides, kuhu CAT-i MT/LLM-i integreerimisel andmed lähevad
Professionaalne tõlge tehakse enamasti CAT-tööriistaga, mitte lihttekstiredaktoris. Selles õppetükis õpite kasutama CAT-tööriistu, tõlkimise keskmes olevat tõlkemälu (TM), kuidas need töötavad koos masintõlke ja LLM-iga ning kuidas seda ökosüsteemi tõhusalt ja ohutult kasutada. Eesmärk on saada tõlketehnoloogia kasutajaks, kes haldab järjepidevalt, kiiresti ja jälgitavalt tervet projekti, mitte üksikuid lauseid.
Põhimõisted
CAT-tööriist (Computer-Assisted Translation) on professionaalne tarkvara (nagu Trados, memoQ, Phrase, MateCat), mis korraldab tõlke lause lause (segmendi) kaupa ning ühendab tõlkemälu ja terminibaasi. Näitab allikat ja sihtmärki kõrvuti, püüab kinni kordused, säilitab vormingu.
TM (Translation Memory) on andmebaas, mis salvestab varem tõlgitud allika-sihtlausete paare. Uue lause saabumisel, kui TM-is on sarnane lause, soovitab agent seda teile. Võtmekontseptsioon on siin hägune vaste: uue lause sarnasus TM-i lausega (100% = täpselt sama, 85% = suures osas sarnane). Kõrged vasted kiirendavad tööd, kuna kasutate oma eelmist tõlget uuesti.
Segment on tõlke põhiüksus – tavaliselt lause. CAT-tööriist jagab teksti segmentideks ja redigeerib neid eraldi.
TM-i tähtsus: MT toodab töötlemata mustandeid, kuid TM tagastab teie heakskiidetud inimkvaliteediga varasemad tõlked. Need kaks on erinevad: MT on ennustus, TM on mälu.
Näpunäide: ärge ajage TM-i ja MT-d segamini. 100% TM-i vaste (teie varem kinnitatud tõlge) on üldiselt usaldusväärne; MT soovitust tuleks alati kontrollida. CAT-tööriistad näitavad neid kahte erineva värvi/sildiga; alati näha seda erinevust.
MT ja LLM integreerimine CAT-i
Kaasaegsed CAT-tööriistad kutsuvad sisemiselt MT-mootoreid ja üha enam LLM-i: kui TM-is vastet pole, tagastab agent automaatselt segmendi MT-soovituse; muudate seda järel (st MTPE voolab CAT-is). Viimase põlvkonna tööriistad integreerivad ka LLM-i: tööriistas saate teha selliseid toiminguid nagu "see segment selle tooniga ümber kirjutada", "parandage see termin terminibaasi" jne.
Selle integratsiooni eelised: TM, terminibaas, MT ja LLM on ühendatud ühel ekraanil; Iga lause jaoks luuakse voog "vaadake esmalt TM-i, muidu soovitage MT-d, termin QA automaatselt". Negatiivne külg ja ettevaatus: kuhu andmed kaovad? Pilvepõhine MT/LLM integratsioon võib saata teksti välistele serveritele; Konfidentsiaalses töös võib see olla lepingurikkumine. Kindlasti teadke, millise mootoriga sõiduk on ühendatud ja millise andmepoliitikaga.
Tõlkemälu söötmine ja tühjendamine
TM väärtus on sama suur kui selles sisalduvate tõlgete kvaliteet. Prügi sisse, prügi välja. Kaks distsipliini:
- Lihtsalt kirjutage kinnitatud tõlge TM-i. Kui salvestate töötlemata MT väljundi TM-i ilma seda kinnitamata, naaseb see teie tulevaste töökohtade juurde halva "mäluna".
- Tehke TM-i hooldust. Aja jooksul terminid muutuvad ja vead tulevad sisse. Perioodiliselt puhas TM, õiged kulunud/valed paarid. Selles töös kasutan LLM-i, et küsida "kas nendes TM-paarides on ebakõlasid/terminite kõrvalekaldeid?" Saate seda kasutada audiitorina.
Ettevaatust: ühe kliendi TM-i kasutamine teise kliendi ettevõttes on nii konfidentsiaalsuse rikkumine kui ka terminite segiajamise oht. TM-e hoitakse eraldi kliendi/projektipõhiselt. Segatud "kõik TM" hävitab nii konfidentsiaalsuse kui ka kvaliteedi.
kolm minikarpi
Juhtum 1 — TM lendas kordused. Tootja lasi tõlkida tootepere, kus 70% kasutusjuhendist jäi aasta-aastalt samaks. Tänu TM-ile tulid 100% ja kõrged hägused vasted automaatselt igas uues versioonis; Ainult ~9000 sõna 30 000-sõnalisest tööst olid tegelik uustõlge. Aeg ja kulud vähenesid kolmandiku võrra.
Juhtum 2 – Dirty TM levitas vea. Üks meeskond oli salvestanud töötlemata MT väljundi TM-i ilma kontrollimiseta. Aasta hiljem tuli sama vale tõlge ikka ja jälle tagasi, näides 100% vastena "usaldusväärne"; Viga levis 14 erineva dokumendi vahel. Meeskond kehtestas reegli "ainult TM-i kinnitatud tõlge" ja puhastusretke.
Juhtum 3 – integratsioonis lekkis konfidentsiaalsus. Tõlkija tegi konfidentsiaalset tööd CAT-projektis, mis oli automaatselt ühendatud pilve-MT-ga; Tekst läks välisele mootorile, mille andmepoliitika on ebaselge. Kui seda märgati, lülitati salaprojektide MT-integratsioon välja ja kasutati ainult ettevõtte mootoreid, mis "ei salvesta/treeni andmeid".
Neli kopeeritavat malli
1) Hägune vaste hindamine (LLM-ile):
Allpool on uus lähtelause, sarnane lause TM-is ja selle kinnitatud tõlge. Ütle mulle täpselt, mida ma pean muutma, et kohandada TM tõlget uue lausega; Ärge soovitage tarbetuid muudatusi. Näidake selgelt tähenduste erinevust. Uus allikas: [...] | TM allikas: [...] | TM tõlge: [...]
2) TM järjepidevuse kontroll:
Allpool on TM-i allika-sihtmärgi paarid. Märkige ebakõlad ja terminite kõrvalekalded, kus samu või väga sarnaseid lähtelauseid tõlgitakse ERINEVALT. Lihtsalt loetlege probleemid. Paarid: [...]
3) Segmendi toonide ümberkirjutamine (LLM CAT-is):
Tehke järgmine sihtsegment [soovitud toon] ILMA tähendust MUUTAMATA. Järgige terminite loetelu: [...]. Hoidke numbrid ja nimed alles. Ekspordi ainult ümberkirjutatud segment. Segment: [...]
4) Privaatsuse/integratsiooni eelkontroll:
Kasutan CAT-projektis MT/LLM integratsiooni. Kirjeldan selle projekti tekstitüüpi; Öelge, kas see tekst on sobilik saata pilvepõhisesse välismootorisse, milliseid küsimusi (andmete säilitamine, koolitus, asukoht) peaksin pakkujalt küsima.Teksti tüüp/privaatsusolek: [...]
Nõrk viip / Tugev viip
Nõrk: "Kasuta tõlget TM-is." (On ebaselge, milline vastemäär ja mida kohandada; pimekopeerimine toob kaasa vigu.)
Tugev: "See uus lause ühtib TM-i lausega 90% ajast. Toetuge TM-i tõlkele, kuid kajastage seda erinevust: allikas on sõna "igakuine" asemel "aastane", seega peaks see olema "igakuine" asemel "iga-aastane". Ärge muutke midagi muud."
Erinevus: tugev viip määrab mängu erinevuse; See takistab "vana tõlke jätmist nii nagu on", mis on häguse sobitamise kõige levinum viga.
CAT ökosüsteemi komponentide tabel
komponent
Mis teeb
suhe AI-ga
TM (tõlkemälu)
Tagastab varasemad kinnitatud tõlked
Usaldusväärne; eelneb MT-le
Termbaas
Tagab termini järjepidevuse
See antakse juhina LLM-ile
MT soovitus
Toores visand tühjaks segmendiks
Peab olema järeltoimetatud
LLM-i integreerimine
Toon/termin/ümberkirjutamine
Kontrollitud, tähelepanu privaatsusele
QA moodul
Skannib numbri/termini/sildi viga
automaatjuhtimine
Levinud vead
- Pimesi nõustumine häguse vastega. 85% vaste võib varjata 15% tähenduse erinevust.
- Toores MT väljundi kirjutamine TM-i. Dirty TM kannab vea tulevikku ja levitab seda.
- Kliendi/projekti TM-ide segamine. Konfidentsiaalsus ja terminite segiajamise oht.
- Ei tea, kuhu integratsiooniandmed lähevad. Peidetud tekst võib välja lekkida, ilma et te sellest teadlik oleksite.
- Unustades TM/MT erinevuse. MT on hinnanguline; TM on mälestus. Need kaks pole võrdselt ohutud.
Eeltõlge ja joondus
Kaks täiustatud CAT-funktsiooni kiirendavad tehisintellekti ajastul töövoogu veelgi. Esimene on eeltõlge: projekti alguses täidab tööriist automaatselt kõik segmendid TM-i ja MT-ga; Tühja faili asemel alustatakse failiga, kus 100% vasted on kinnitatud, hägused vasted ootavad kohandamist ja tühjad on MT mustandid. See muudab töö "nullist kirjutamisest" "ülevaatamiseks ja redigeerimiseks" - kuid eeltõlke pimesi kinnitamise asemel peate hindama iga segmenti.
Teine on joondamine: kui teil on allika-sihtdokumendi paar, mis on varem tõlgitud, kuid pole TM-i sisestatud, sobitab joondustööriist need segmentide kaupa ja teisendab need TM-i. Seega lisatakse teie varasemad tõlked "mällu". Ettevaatust joondamisel: automaatne sobitamine ei ole alati õige; ühe segmendi libisemine rikub kogu joonduse. Joondatud paaride ülevaatamine enne TM-i kasutamist hoiab ära määrdunud TM-i ohu. Need kaks funktsiooni muudavad teie käibevara (varasemad tõlked) investeeringuteks tulevastesse ettevõtetesse.
Kokkuvõttes
CAT-tööriistad; See ühendab tõlkemälu, terminibaasi, masintõlke ja LLM-i üheks tootmisliiniks. TM on mälu, mis otsib teie heakskiidetud varasemaid tõlkeid ja tagab korduvate ülesannete täitmisel suure kiiruse; MT on ennustus, mida tuleb alati kontrollida. Arukas kasutaja kohandab hoolikalt hägusate vastete erinevust, kirjutab TM-i ainult heakskiidetud tõlkeid, hoiab klientide TM-id eraldi ja kaitseb privaatsust, teades, kuhu andmed integreerimisel lähevad.
Rakenduse ülesanne
Seadistage CAT-tööriistas väike projekt (töötab ka tasuta veebipõhine CAT): lisage terminibaas ja tühi TM. Tõlkige 10-lauseline tekst, salvestage kinnitatud tõlked TM-i. Seejärel tõlkige teine tekst, mis on väga sarnane esimese tekstiga, ja kohandage TM-i poolt tagastatud hägused vasted malliga "Fuzzy match assessment"; Pange tähele, mitu lauset teeksite vea, kui võtaksite TM-i pimesi vastu.
kontrollnimekiri
- [ ] Ühendasin TM-i ja terminibaasi projektiga.
- [ ] Kasutasin hägusate vastete erinevust pigem adaptiivselt kui pimesi.
- [ ] Kirjutasin TM-ile ainult kinnitatud tõlke, mille olen kontrollinud.
- [ ] Hoidsin klientide/projektide automaate eraldi.
- [ ] Kontrollisin, kuhu MT/LLM-integratsioonis andmed lähevad.