Ieguvumi:
- Izpratne par tulkošanas atmiņas (TM), izplūdušo sakritību un segmentu jēdzieniem un spēja izmantot izplūdušo sakritību atšķirības, tos pielāgojot, nevis akli.
- Spēja piemērot disciplīnu TM rakstīt tikai apstiprinātus tulkojumus, turēt klientu TM atsevišķi un veikt TM apkopi
- Spēja aizsargāt privātumu, kontrolējot, kur dati tiek nodoti MT/LLM integrācijā CAT
Profesionālā tulkošana visbiežāk tiek veikta CAT rīkā, nevis vienkārša teksta redaktorā. Šajā nodaļā jūs uzzināsit par CAT rīkiem, tulkošanas atmiņu (TM), kas ir tulkošanas pamatā, kā tie darbojas kopā ar mašīntulkošanu un LLM un kā efektīvi un droši izmantot šo ekosistēmu. Mērķis ir kļūt par tulkošanas tehnoloģiju lietotāju, kas konsekventi, ātri un izsekojami pārvalda visu projektu, nevis atsevišķus teikumus.
Pamatjēdzieni
CAT rīks (Computer-Assisted Translation) ir profesionāla programmatūra (piemēram, Trados, memoQ, Phrase, MateCat), kas organizē tulkošanas teikumu pa teikumam (segmentam) un savieno tulkošanas atmiņu un terminu bāzi. Rāda avotu un mērķi blakus, uztver atkārtojumus, saglabā formatējumu.
TM (Translation Memory) ir datu bāze, kurā tiek glabāti avota un mērķa teikumu pāri, kurus esat iepriekš tulkojis. Kad pienāk jauns teikums, ja TM ir līdzīgs teikums, aģents jums to iesaka. Galvenais jēdziens šeit ir neskaidra atbilstība: jaunā teikuma līdzība TM teikumam (100% = tieši tāds pats, 85% = lielā mērā līdzīgs). Augstas atbilstības paātrina darbu, jo jūs atkārtoti izmantojat savu iepriekšējo tulkojumu.
Segments ir tulkošanas pamatvienība — parasti teikums. CAT rīks sadala tekstu segmentos un rediģē katru atsevišķi.
TM nozīme: MT izstrādā neapstrādātus melnrakstus, bet TM atgriež jūsu apstiprinātos, cilvēka kvalitātes pagātnes tulkojumus. Tie ir atšķirīgi: MT ir prognoze, TM ir atmiņa.
Padoms: nejauciet TM un MT. 100% TM atbilstība (jūsu iepriekš apstiprinātais tulkojums) parasti ir uzticams; MT ieteikums vienmēr ir jāpārbauda. CAT rīki parāda abus ar dažādām krāsām/uzlīmēm; vienmēr redzi šo atšķirību.
MT un LLM integrācija CAT
Mūsdienu CAT rīki iekšēji izsauc MT dzinējus un arvien vairāk LLM: ja TM nav atbilstības, aģents automātiski atgriež MT ieteikumu segmentam; jūs to rediģējat pēc tam (t.i., MTPE plūst CAT). Jaunākās paaudzes rīki arī integrē LLM: rīkā varat veikt tādas darbības kā "pārrakstīt šo segmentu ar šo signālu", "labot šo terminu terminu bāzē" utt.
Šīs integrācijas priekšrocības: TM, terminu bāze, MT un LLM ir apvienoti vienā ekrānā; Katram teikumam tiek izveidota plūsma "vispirms apskatiet TM, pretējā gadījumā ieteiktu MT, termins QA automātiski". Negatīvā puse un piesardzība: kur paliek dati? Mākoņos balstīta MT/LLM integrācija var nosūtīt tekstu ārējiem serveriem; Konfidenciālā darbā tas var būt līguma pārkāpums. Noteikti zināt, kuram dzinējam transportlīdzeklis ir pieslēgts un ar kādu datu politiku.
Tulkošanas atmiņas padeve un dzēšana
TM vērtība ir tikpat liela kā tajā esošo tulkojumu kvalitāte. Atkritumi iekšā, atkritumi ārā. Divas disciplīnas:
- Vienkārši uzrakstiet sertificētu tulkojumu TM. Ja saglabājat neapstrādāto MT izvadi TM, to neapstiprinot, tā atgriezīsies jūsu turpmākajos darbos kā slikta "atmiņa".
- Veikt TM apkopi. Laika gaitā termini mainās un parādās kļūdas. Periodiski tīrīt TM, labot nolietotos/nepareizos pārus. Šajā darbā es izmantoju LLM, lai jautātu "vai šajos TM pāros ir kādas neatbilstības/terminu novirzes?" Varat to izmantot kā auditoru.
Uzmanību: viena klienta TM izmantošana cita klienta biznesā ir gan konfidencialitātes pārkāpums, gan terminu sajaukšanas risks. TM tiek glabāti atsevišķi, pamatojoties uz klientu/projektu. Jaukta "viss TM" grauj gan konfidencialitāti, gan kvalitāti.
trīs mini futrāļi
1. gadījums — TM veica atkārtojumus. Kāds ražotājs lika tulkot produktu saimi, kur 70% rokasgrāmatas gadu no gada palika nemainīgas. Pateicoties TM, 100% un augsta izplūduma atbilstība tika automātiski parādīta katrā jaunajā versijā; Tikai aptuveni 9000 vārdu no 30 000 vārdu darba bija īsts jauns tulkojums. Laiks un izmaksas tika samazinātas par vienu trešdaļu.
2. gadījums — Dirty TM izplatīja kļūdu. Viena komanda bija saglabājusi neapstrādātu MT izvadi TM bez pārbaudes. Gadu vēlāk tas pats nepareizs tulkojums atkārtojās atkal un atkal, šķiet, ka "uzticams" kā 100% atbilst; Kļūda tika izplatīta 14 dažādos dokumentos. Komanda ieviesa noteikumu "apliecināts tulkojums tikai TM" un tīrīšanas tūri.
3. gadījums — integrācijas laikā noplūda konfidencialitāte. Tulkotājs veica konfidenciālu darbu CAT projektā, kas tika automātiski savienots ar mākoņa MT; Teksts tika nosūtīts uz ārēju programmu, kuras datu politika nav skaidra. Tiklīdz tika pamanīts, MT integrācija slepenajiem projektiem tika izslēgta un tika izmantoti tikai uzņēmuma dzinēji, kas "neuzglabā/neapmāca datus".
Četras kopējamas veidnes
1) Izplūdušo spēļu novērtējums (uz LLM):
Zemāk ir jaunais avota teikums, līdzīgs teikums TM un tā apstiprinātais tulkojums. Pastāstiet man, kas tieši ir jāmaina, lai pielāgotu TM tulkojumu jaunajam teikumam; Neiesakiet nevajadzīgas izmaiņas. Skaidri parādiet nozīmes atšķirību. Jauns avots: [...] | TM avots: [...] | TM tulkojums: [...]
2) TM konsekvences pārbaude:
Tālāk ir norādīti TM avota un mērķa pāri. Atzīmējiet neatbilstības un terminu novirzes, ja vieni un ļoti līdzīgi avota teikumi tiek tulkoti ATŠĶIRĪGI. Vienkārši uzskaitiet problēmas. Pāri: [...]
3) Segmenta toņu pārrakstīšana (LLM CAT):
Izveidojiet šādu mērķa segmentu [vēlamais tonis], NEMAINOT nozīmi. Ievērot terminu sarakstu: [...]. Saglabājiet numurus un vārdus. Eksportēt tikai pārrakstīto segmentu. Segments: [...]
4) Privātuma/integrācijas iepriekšēja pārbaude:
Es izmantošu MT/LLM integrāciju CAT projektā. Es aprakstīšu teksta veidu šajā projektā; Pastāstiet man, vai ir pareizi nosūtīt šo tekstu uz mākoņa bāzes ārēju dzinēju, kādus jautājumus (datu saglabāšana, apmācība, atrašanās vieta) man vajadzētu uzdot pakalpojumu sniedzējam.Teksta veids/konfidencialitātes statuss: [...]
Vāja uzvedne / spēcīga uzvedne
Vāji: "Izmantojiet tulkojumu TM." (Nav skaidrs, kāds atbilstības līmenis un ko pielāgot; aklā kopēšana rada kļūdas.)
Spēcīgs: "Šis jaunais teikums atbilst teikumam TM 90% laika. Veidojiet TM tulkojumu, taču atspoguļojiet šo atšķirību: avotā ir "ikmēneša", nevis "ikmēneša", tāpēc tam vajadzētu būt "ik gadu", nevis "ik mēnesi". Neko citu nemainiet."
Atšķirība: spēcīga uzvedne precīzi norāda spēles atšķirību; Tas novērš "vecā tulkojuma atstāšanu tādu, kāds tas ir", kas ir visizplatītākā izplūdušās atbilstības kļūda.
CAT ekosistēmas komponentu tabula
sastāvdaļa
Ko dara
attiecības ar AI
TM (tulkošanas atmiņa)
Atgriež apstiprinātos iepriekšējos tulkojumus
Uzticams; pirms MT
Terminu bāze
Nodrošina termiņa konsekvenci
Tas tiek sniegts kā uzvedne LLM
MT ieteikums
Neapstrādāta skice tukšā segmentā
Jārediģē pēc tam
LLM integrācija
Tonis/termiņš/pārrakstīšana
Kontrolēta, uzmanība privātumam
QA modulis
Skenē numura/termina/birkas kļūdu
automātiskā vadība
Biežas kļūdas
- Akli pieņemot izplūdušo sakritību. 85% atbilstība var slēpt 15% nozīmes atšķirību.
- Notiek neapstrādātas MT izvades rakstīšana uz TM. Dirty TM pārnes kļūdu nākotnē un pavairo to.
- Klientu/projektu TM miksēšana. Konfidencialitāte un terminu sajaukšanas risks.
- Nezinot, kur nonāk integrācijas dati. Slēpts teksts var izplūst, jums par to nezinot.
- Aizmirstot TM/MT atšķirību. MT ir aplēse; TM ir atmiņa. Abi nav vienlīdz droši.
Iepriekšēja tulkošana un saskaņošana
Divas uzlabotas CAT funkcijas vēl vairāk paātrina darbplūsmu mākslīgā intelekta laikmetā. Pirmā ir pirmstulkošana: projekta sākumā rīks automātiski aizpilda visus segmentus ar TM un MT; Tukša faila vietā jūs sākat ar failu, kurā ir apstiprinātas 100% atbilstības, izplūdušās atbilstības gaida pielāgošanu, bet tukšās ir MT melnraksti. Tas maina darbu no “rakstīšanas no nulles” uz “pārskatīšanu un rediģēšanu”, taču jums ir jānovērtē katrs segments, nevis akli jāapstiprina iepriekšējais tulkojums.
Otrais ir līdzinājums: ja jums ir avota un mērķa dokumenta pāris, kas ir iepriekš tulkots, bet nav ievadīts TM, līdzināšanas rīks saskaņo tos segmentos pēc segmenta un pārvērš tos TM. Tādējādi jūsu pagātnes tulkojumi tiek pievienoti "atmiņai". Uzmanību izlīdzināšanā: automātiskā saskaņošana ne vienmēr ir pareiza; viena segmenta izslīdēšana izjauc visu izlīdzināšanu. Izlīdzināto pāru pārskatīšana pirms TMing vispirms novērš netīras TM risku. Šīs divas funkcijas pārvērš jūsu pašreizējos līdzekļus (pagātnes tulkojumus) par ieguldījumiem nākotnes uzņēmumos.
Rezumējot
CAT instrumenti; Tas apvieno tulkošanas atmiņu, terminu bāzi, mašīntulkošanu un LLM vienā ražošanas līnijā. TM ir atmiņa, kas izgūst jūsu apstiprinātos iepriekšējos tulkojumus un nodrošina lielu ātrumu, veicot atkārtotus uzdevumus; MT ir prognoze, kas vienmēr ir jāpārbauda. Atjautīgs lietotājs rūpīgi pielāgo atšķirības neskaidrajās atbilstībās, TM ieraksta tikai apstiprinātus tulkojumus, klientu TM nošķir atsevišķi un aizsargā privātumu, zinot, kur integrācijā tiek novirzīti dati.
Lietojumprogrammas uzdevums
Iestatiet nelielu projektu CAT rīkā (darbojas arī bezmaksas tiešsaistes CAT): pievienojiet terminu bāzi un tukšu TM. Tulkojiet 10 teikumu garu tekstu, saglabājiet apstiprinātos tulkojumus TM. Pēc tam tulkojiet otru tekstu, kas ir ļoti līdzīgs pirmajam tekstam, un pielāgojiet TM atgrieztās izplūdušās atbilstības, izmantojot veidni "neskaidras atbilstības novērtēšana"; Ņemiet vērā, cik teikumos jūs pieļautu kļūdu, ja jūs akli pieņemtu TM.
kontrolsaraksts
- [ ] Es pievienoju projektam TM un terminu bāzi.
- [ ] Es izmantoju izplūdušo sakritību atšķirību adaptīvi, nevis akli.
- [ ] Es uzrakstīju TM tikai apstiprināto tulkojumu, ko esmu pārbaudījis.
- [ ] Es turēju klientu/projektu TM atsevišķi.
- [ ] Es pārbaudīju, kur MT/LLM integrācijā nonāk dati.