Ieguvumi:
- Spēja atšķirt NMT un LLM balstītas tulkošanas stiprās un vājās puses un izvēlēties pareizo dzinēju atbilstoši uzņēmējdarbības veidam
- Spēja iepriekš klasificēt teksta piemērotību iekārtai un iepriekš novērtēt to par reālu laiku un cenu
- Iespēja ātri izmērīt neapstrādātas mašīnas produkcijas kvalitāti piecās dimensijās un atzīmēt riskus, nejaucot gludumu ar precizitāti
Visspēcīgākais paātrinātājs, kas jums ir kā tulkotājam, ir mašīntulkošana (MT), taču apzināta rīka izmantošana nozīmē to piemērot pareizajam darbam, pareizajā valodu pārī un ar pareizajām cerībām. Šajā nodaļā jūs iepazīsities ar divām galvenajām MT saimēm (uz NMT un LLM balstītu tulkojumu), uzzināsiet, kura no tām ir labāka kādam darbam, kā ātri izmērīt tulkojuma neapstrādāto izvades kvalitāti pirms piegādes un kā izvēlēties dzinēju atbilstoši darbam. Mērķis ir attālināties no idejas "viss tas pats, ielīmēt-tulkot" un kļūt par ekspertu, kurš var paredzēt, kurš teksts ir piemērots iekārtai un kurš prasa cilvēkietilpīgu darbu.
Divas ģimenes: NMT un LLM balstīta tulkošana
NMT (Neiral Machine Translation) ir sistēmas, kas ir mācījušās no miljoniem bilingvālu teikumu un tulko teikumu kopumā; To piemēri ir Google Translate, DeepL, Microsoft Translator. Stiprās puses: ļoti ātrs, konsekvents, brīvi runā īsos teikumos. Vājums: bieži neredz kontekstu ārpus teikuma robežas (nozīmē no visa teksta); Var būt grūti izlemt, vai vārds "krasts" nozīmē krastu vai upes krastu, skatoties rindkopā, un tas neatbilst sniegtajam terminu sarakstam.
Uz LLM balstīta tulkošana (Large Language Model) ir tādu instrukciju modeļu kā ChatGPT, Claude, Gemini izmantošana tulkošanai. Spēks: uztver norādījumus — saprot tādus norādījumus kā “izmantojiet formālu signālu”, “seko šim terminu sarakstam”, “mērķauditorija ir bērni”; redz plašāku kontekstu; labāk uztver idiomu un toni. Vājums: dažkārt var būt "pārāk radošs" un papildināt avotu (halucināciju risks), garos tekstos zaudē saskaņotību, un izmaksas/ātrums mainās atkarībā no darba.
Īkšķis: taisnos, atkārtotos, tehniskos tekstos NMT parasti ir ātrs un adekvāts; LLM ir elastīgāka ar tekstiem, kuriem nepieciešama disciplīna toņa, konteksta, vārdu krājuma un norādījumu ziņā. Lielākā daļa profesionāļu mūsdienās izmanto abus kopā: ātrs melnraksts no NMT, toņa/termiņa korekcija no LLM.
Padoms. Valodu pāra mašīnas kvalitāte (piemēram, turku → angļu) var atšķirties no pretējā virziena (angļu → turku). Valodas ar aglutinatīvu, elastīgu sintaksi, piemēram, turku valoda, parasti ir grūtākas MT. Novērtējiet paši, kurš dzinējs ir labāks jūsu pārī, izmantojot dažus tekstu paraugus.
Teksta saderība ar mašīnu: vispirms uzdodiet šo jautājumu
Ne katrs teksts ir vienlīdz piemērots iekārtai. Pirms tulkošanas sākšanas izlaidiet tekstu caur "piemērotības" filtru:
- Labi piemērota iekārtai: tehniskā rokasgrāmata, produkta apraksts, interfeisa teksts, kas atkārtojas, standarta atbilstība, tabula/saraksts. Valoda ir vienkārša, terminoloģija ir fiksēta, radošuma ir maz.
- Vidēji piemērots: ziņas, korporatīvais saturs, izglītojoši materiāli. Iekārta rada labas kontūras, taču nepieciešama nopietna toņa un plūsmas pēcrediģēšana.
- Nav piemērots mašīnai (augsts risks): juridisks līgums, medicīnisks teksts, reklāma/sauklis, literārs teksts, humors, dzeja. Šeit mašīna dod tikai idejas; Darbs lielākoties gulstas uz cilvēkiem.
Ja jūs izdarīsit šo atšķirību no paša sākuma, jūs gan piešķirsit klientam pareizo laiku/cenu, gan pasargāsit sevi no aklas uzticēšanās neapstrādātai produkcijai.
Ātri izmērīt neapstrādātas produkcijas kvalitāti
Kad redzat MT izvadi, rodas jautājums: "Vai tas ir labi vai slikti?" Atbildiet uz jautājumu, izmantojot ātru kontrolsarakstu, nevis intuīciju. Apskatiet šīs piecas dimensijas: precizitāte (vai nozīme ir uzticīga avotam?), pilnīgums (vai teikums ir izlaists vai pievienots?), terminoloģija (vai tā ir pareiza un konsekventa?), raitums (vai tas ir dabiski mērķa valodā?), formāts (vai tagi, skaitļi, formatējums ir saglabāts?). Šīs dimensijas padziļināsim nākamajā kvalitātes vienībā; Pagaidām lai tas ir jūsu reflekss pirms piegādes.
Uzmanību: visbīstamākās MT izvades kļūdas ir "plūstošas, bet nepareizas". Teikums var būt perfektā turku valodā, bet avotā "15% atlaide", iespējams, ir mainīta uz "50% atlaide". Neļaujiet sevi atbaidīt ar plūdumu; Vienmēr apskatiet skaitli, negatīvo un īpašvārdu atsevišķi.
trīs mini futrāļi
1. gadījums — labais dzinējs samazināja laiku uz pusi. Viens tulkotājs izvēlējās tulkot 12 000 vārdu programmatūras saskarni ar NMT un tāda paša apjoma mārketinga bukletu ar LLM. NMT konsekvence saskarnē padarīja darbu ātrāku; LLM tonālā elastība bukletā samazināja pārrakstīšanas slogu par 40%. Piešķirot abus darbus vienam dzinējam, tiktu zaudēts laiks.
2. gadījums — iepriekšēja novērtēšana ietaupīja cenu. Kāds birojs grasījās piedāvāt juridisku tekstu, jo "to var izgatavot ar mašīnām, tas būs lēti". Priekšvērtējumā tika tulkots 500 vārdu paraugs; Iekārta atgrieza divus juridiskos terminus ar nepareizu sistēmas ekvivalentu. Birojs novērtēja darbu kā "smagu pēcrediģēšanu" un noteica reālu termiņu; Viņš izvairījās zaudēt naudu nepareizā piedāvājuma dēļ.
3. gadījums — valodu pāru atšķirība. Kāda komanda uzskatīja, ka dzinējs, kas lieliski darbojās angļu → vācu valodā, bija tādas pašas kvalitātes turku → arābu valodā. 300 vārdu tests parādīja, ka arābu izvade prasa daudz lielāku korekciju. Komanda piešķīra dažādus dzinējus un dažādus pēcrediģēšanas budžetus atkarībā no valodu pāra.
Četras kopējamas veidnes
1) Teksta piemērotības novērtējums:
Jūsu loma: MTPE vecākais speciālists. Novērtējiet, vai šāds teksts ir piemērots mašīntulkošanai: burtisks/tehnisks vai radošs/kontekstuāls? Klasificējiet to kā (1) ļoti iekārtām draudzīgu, (2) vidēju, (3) augstu risku un uzrakstiet savu pamatojumu. Aprēķiniet paredzamo pēcrediģēšanas slodzi kā vieglu/vidēju/smagu.Teksta piemērs: [ielīmējiet 200–300 vārdus]
2) Instruētais LLM tulkojums (ar terminoloģiju un toņu kontroli):
Tulkot šo tekstu [avots]→[mērķis].Mērķauditorija: [kurš]. Tonis: [piem. oficiāla]. Lauks: [piem. finanses].Terminu saraksts (noteikti lieto): [A→a, B→b].Noteikumi: nepievienot to, kas nav avotā, saglabāt skaitļus/datumus/nosaukumus, katru teikumu aizstāt ar teikumu. Atzīmējiet vietu, kur neesat pārliecināts, izmantojot [?]. Teksts: [...]
3) Divu dzinēju salīdzinājums:
Zemāk ir divi dažādi viena un tā paša avota teikuma tulkojumi (A un B). Salīdziniet katru pēc pareizības, terminoloģijas un dabiskuma un sakiet, kurš no tiem prasīs mazāk labojumu, ar pamatojumu. Avots: [...] | Tulkojums A: [...] | Tulkojums B: [...]
4) Neapstrādātas produkcijas ātrā pārbaude:
Tālāk ir norādīts avots un mašīntulkošana. Vienkārši atzīmējiet: (1) izlaista/pievienota informācija, (2) nepareizs numurs/datums/nosaukums, (3) nolieguma kļūda, (4) nekonsekvents termins. Nerakstiet nekādus labojumus, vienkārši uzskaitiet riskantās jomas.Avots: [...] | Tulkojums: [...]
Vāja uzvedne / spēcīga uzvedne
Vāji: "Tulkojiet šo tekstu, un tas būs labi." (Dzinējam "labs" nav definēts; nav toņa, nav termina, nav masas.)
Güçlü: "Tulkot šo produkta aprakstu no angļu valodas uz turku. Joma: e-komercija. Auditorija: jauns patērētājs. Tonis: draudzīgs, bet pārliecinošs. "izrakstīšanās" → "izrakstīšanās solis", "vēlmju saraksts" → "vēlmju saraksts". Mainiet numurus un zīmola nosaukumu. Brīvi runājiet turku valodā bez tulkojuma smakas."
Atšķirība: spēcīga uzvedne dod dzinējam izmērāmu mērķi; izvade tieši tuvina pēcrediģēto melnrakstu.
NMT vs LLM salīdzināšanas diagramma
Izmērs
NMT (Google, DeepL)
LLM (ChatGPT, Klods)
ātrumu
ļoti ātri
vidējs
Saņemt norādījumus/signālu
vājš
stiprs
Ievērojiet terminu sarakstu
ierobežots
Labi (ar uzvedni)
Plašs konteksts
vājš
labi
Halucināciju risks
zems
Vidējs (nepieciešama kontrole)
piemērotāko darbu
Taisni/tehniski/atkārtoti
Tonis/konteksts/radošs
Biežas kļūdas
- Katram darbam izmanto vienu un to pašu dzinēju. Neizvēloties dzinēju atbilstoši darba veidam, tiek zaudēts laiks un kvalitāte.
- Cenas/laika norādīšana bez iepriekšēja novērtējuma. 200-300 vārdu tests atklāj pārsteigumus jau no paša sākuma.
- Plūsmu sajauc ar precizitāti. Skaists teikums nenozīmē pareizu teikumu.
- Valodu pāra un virziena atšķirības ignorēšana. Labs dzinējs vienā pārī var būt vājš citā.
- Nemanot LLM papildinājumus. LLM dažreiz pievieno teikumus, kas nav avotā "lai palīdzētu"; pārbaudiet šo.
Konteksta logs un konsekvence
Tulkojot garu tekstu ar LLM, ir jāzina viens tehniskais ierobežojums: konteksta logs — teksta apjoms, ko modelis var "redzēt" un paturēt prātā vienlaikus. Ja teksts ir lielāks par šo logu, jums tas būs jāsadala gabalos, un modelis var "aizmirst" nākamajā daļā termina lēmumu vai toni, ko pieņēmāt iepriekšējās daļās. Tātad, tā vietā, lai tulkotu garu grāmatu vai dokumentu vienā gabalā, atgādinot par katru terminu bāzes un stila kopsavilkuma daļu, tiek saglabāta konsekvence. Šī problēma nerodas īsos tekstos; Tomēr garos darbos, piemēram, romānos un rokasgrāmatās, ir nepieciešams papildus pārbaudīt fragmentu konsekvenci. Praktisks risinājums: sagatavot "projekta atmiņu" (termi + rakstzīmes + toņu lēmumi) un pievienot to katra gabala sākumam un tulkojuma beigās skenēt konsekvenci starp daļām. NMT šī problēma tiek piedzīvota citādi: tā kā NMT tulko teikumu pa teikumam, rindkopas garuma konsekvence jau ir vāja, tāpēc terminu bāze izmanto terminu disciplīna.
Rezumējot
Ir divas mašīntulkošanas saimes: NMT, kas ir ātrs un konsekvents, un LLM, kas saņem norādījumus un labāk redz kontekstu un toni. Meistars tulkotājs iepriekš novērtē teksta piemērotību iekārtai, izvēlas dzinēju atbilstoši darbam, ātri izmēra neapstrādātās produkcijas kvalitāti pirms piegādes un nekad nejauc raitumu ar precizitāti. Šis iepriekšējas novērtēšanas reflekss ļauj gan norādīt reālu laiku/cenu, gan pasargāt sevi no aklas uzticības.
Lietojumprogrammas uzdevums
Tulko vienu un to pašu 200 vārdu tekstu gan ar NMT rīku, gan LLM. Salīdziniet abus rezultātus piecās dimensijās (precizitāte, pilnīgums, terminoloģija, plūstamība, formāts) un uzrakstiet iemeslus, kādēļ šim tekstam ir nepieciešams mazāk pēcrediģēšanas. Pēc tam atzīmējiet problēmu/paredzētu situāciju/termiņa riskus abos gadījumos, izmantojot veidni “neapstrādātas produkcijas ātrā pārbaude”.
kontrolsaraksts
- [ ] Es klasificēju teksta piemērotību iekārtai (zems/vidējs/augsts risks).
- [ ] Atkarībā no darba veida es nolēmu izmantot NMT vai LLM.
- [ ] Veicu provizorisko novērtējumu ar nelielu izlasi un atbilstoši noteicu ilgumu/cenu.
- [ ] Es ātri pārbaudīju izejvielu piecās dimensijās.
- [ ] Es pārbaudīju numuru, datumu, vārdu un negatīvus atsevišķi, nemaldinot raitumu.