Enota 2 / 11

Osnove strojnega prevajanja: NMT, LLM, izbira mehanizma in predhodna ocena

Dobički:

  • Sposobnost razlikovanja prednosti in slabosti prevajanja, ki temelji na NMT in LLM, ter izbrati pravi mehanizem glede na vrsto posla
  • Sposobnost vnaprejšnjega razvrščanja primernosti besedila za stroj in njegove predhodne ocene za realen čas in ceno
  • Sposobnost hitrega merjenja kakovosti surovega strojnega izhoda v petih dimenzijah in označevanja tveganj, ne da bi zamenjali gladkost z natančnostjo

Najmočnejši pospeševalnik, ki ga imate kot prevajalec, je strojno prevajanje (MT) — vendar uporaba orodja zavestno pomeni, da ga uporabite za pravo delo, v pravem jezikovnem paru in s pravimi pričakovanji. V tej enoti boste spoznali dve veliki družini MT (prevajanje na osnovi NMT in LLM), se naučili, kateri je boljši za katero delo, kako hitro izmeriti kakovost neobdelanega izpisa prevoda pred dostavo in kako izbrati motor glede na delo. Cilj je odmakniti se od ideje "vse enako, prilepi-prevedi" in postati strokovnjak, ki lahko predvidi, katero besedilo je primerno za stroj in katero zahteva človeško intenzivno delo.

Dve družini: prevajanje na osnovi NMT in LLM

NMT (Neural Machine Translation) so sistemi, ki so se učili iz milijonov dvojezičnih stavkov in prevajajo stavek kot celoto; Google Translate, DeepL, Microsoft Translator so primeri teh. Prednosti: zelo hiter, dosleden, tekoč v kratkih stavkih. Slabost: pogosto ne vidi konteksta onkraj stavčne meje (pomeni iz celotnega besedila); Morda se je težko odločiti, ali beseda "breg" pomeni breg ali rečni breg, če pogledamo odstavek in ne ustreza navedenemu seznamu izrazov.

Prevajanje na podlagi LLM (Large Language Model) je uporaba modelov, ki temeljijo na navodilih, kot so ChatGPT, Claude, Gemini za prevajanje. Moč: sprejema navodila — razume navodila, kot so »uporabi formalen ton«, »upoštevaj ta seznam izrazov«, »ciljna publika so otroci«; vidi širši kontekst; bolje zajame idiom in ton. Slabost: včasih je lahko "preveč kreativen" in prispeva k viru (nevarnost halucinacij), izgubi koherenco v dolgih besedilih, stroški/hitrost pa se razlikujejo glede na delo.

Osnovno pravilo: v jasnih, ponavljajočih se tehničnih besedilih je NMT običajno hiter in ustrezen; LLM je bolj prilagodljiv pri besedilih, ki zahtevajo disciplino v tonu, kontekstu, besedišču in navodilih. Večina strokovnjakov danes uporablja oboje skupaj: hitri osnutek iz NMT, korekcijo tona/term iz LLM.

Nasvet: strojna kakovost jezikovnega para (npr. turščina→angleščina) se lahko razlikuje od nasprotne smeri (angleščina→turščina). Jeziki z aglutinativno, prilagodljivo sintakso, kot je turščina, so na splošno bolj zahtevni za MT. Sami presodite, kateri motor je v vašem paru boljši z nekaj vzorčnimi besedili.

Strojna združljivost besedila: najprej vprašajte to

Vsako besedilo ni enako primerno za stroj. Preden začnete s prevodom, prenesite besedilo skozi filter "primernosti":

  • Primerno za stroj: tehnični priročnik, opis izdelka, ponavljajoče se besedilo vmesnika, standardna korespondenca, tabela/seznam. Jezik je preprost, terminologija je ustaljena, ustvarjalnost je redka.
  • Srednje primerno: novice, korporativne vsebine, izobraževalno gradivo. Stroj ustvari dobre obrise, vendar zahteva resno naknadno urejanje za ton in tok.
  • Ni primerno za stroj (visoko tveganje): pravna pogodba, medicinsko besedilo, oglas/slogan, literarno besedilo, humor, poezija. Tukaj stroj daje samo ideje; Delo v veliki meri pripada ljudem.

Če to ločite od začetka, boste stranki zagotovili pravi čas/ceno in se zaščitili pred slepim zaupanjem neobdelanemu rezultatu.

Hitro izmerite kakovost neobdelanega izhoda

Ko vidite rezultat MT, se sprašujete, ali je dober ali slab? Na vprašanje odgovorite s hitrim kontrolnim seznamom, ne z intuicijo. Poglejte teh pet razsežnosti: natančnost (ali je pomen zvest viru?), popolnost (je stavek izpuščen ali dodan?), terminologija (ali je pravilna in dosledna?), tekočnost (ali je naravna v ciljnem jeziku?), oblika (ali so oznake, številke, oblikovanje ohranjeni?). Te razsežnosti bomo poglobili v naslednji enoti kakovosti; Za zdaj naj bo to vaš refleks pred porodom.

Pozor: najbolj nevarne napake izpisa MT so "tekoče, a nepravilne". Stavek je morda v popolni turščini, vendar je bil "15% popust" v viru morda spremenjen v "50% popust". Naj vas ne odvrne tekoče govorjenje; Število, zanikalnico in lastno ime vedno glejte ločeno.

trije mini kovčki

Primer 1 — Desni motor je čas prepolovil. En prevajalec se je odločil prevesti programski vmesnik z 12.000 besedami z NMT in marketinško knjižico enakega obsega z LLM. Doslednost NMT na vmesniku je delo pospešila; LLM-jeva tonska prilagodljivost v knjižici je zmanjšala breme prepisovanja za 40 %. Če bi obe nalogi dodelili istemu motorju, bi izgubili čas.

2. primer – Predhodna cenitev je prihranila ceno. Nek urad je bil tik pred tem, da ponudi pravno besedilo, ker "lahko ga naredijo stroji, bo poceni". V predevalvaciji je bil preveden 500-besedni vzorec; Stroj je vrnil dva pravna izraza z napačnim sistemskim ekvivalentom. Urad je delo ocenil kot "težko naknadno urejanje" in dal realen rok; Izognil se je izgubi denarja zaradi napačne ponudbe.

Primer 3 – razlika v jezikovnem paru. Ekipa je menila, da je motor, ki odlično deluje v angleščini → nemščini, enake kakovosti v turščini → arabščini. Preizkus s 300 besedami je pokazal, da arabski izpis zahteva veliko več popravkov. Ekipa je dodelila različne mehanizme in različne proračune za naknadno urejanje, odvisno od jezikovnega para.

Štiri predloge za kopiranje

1) Ocena primernosti besedila:

Vaša vloga: višji specialist za MTPE. Ocenite naslednje besedilo glede primernosti za strojno prevajanje: dobesedno/tehnično ali ustvarjalno/kontekstualno? Razvrstite ga kot (1) zelo strojno prijazno, (2) srednje, (3) visoko tveganje in napišite svojo utemeljitev. Ocenite pričakovano obremenitev po urejanju kot lahka/srednja/težka. Primer besedila: [prilepite 200–300 besed]

2) Prevajanje LLM z navodili (s terminologijo in nadzorom tona):

Prevedi to besedilo [vir]→[cilj].Občinstvo: [kdo]. Ton: [npr. uradni]. Polje: [npr. finance].Seznam pojmov (obvezno uporabiti): [A→a, B→b].Pravila: ne dodajajte tistega, česar ni v viru, obdržite številke/datume/imena, vsak stavek zamenjajte s stavkom. Kjer niste prepričani, označite z [?]. Besedilo: [...]

3) Primerjava dveh motorjev:

Spodaj sta dva različna prevoda istega izvornega stavka (A in B). Vsakega primerjaj po pravilnosti, izrazoslovju in naravnosti ter povej, kateri bo zahteval manj popravkov z utemeljitvijo. Vir: [...] | Prevod A: [...] | Prevod B: [...]

4) Hitri pregled surovega izhoda:

Spodaj je vir in strojni prevod. Samo označite naslednje: (1) izpuščen/dodan podatek, (2) napačna številka/datum/ime, (3) napaka zanikanja, (4) nedosleden izraz. Ne piši popravkov, le naštej tvegana področja. Vir: [...] | Prevod: [...]

Šibek poziv/močan poziv

Slabo: "Prevedite to besedilo in dobro bo." (Za motor je "dobro" nedefinirano; brez tona, brez izraza, brez mase.)

Güçlü: "Prevedi ta opis izdelka iz angleščine v turščino. Področje: e-trgovina. Občinstvo: mladi potrošnik. Ton: prijazen, a pomirjujoč. 'na blagajni' → 'korak na blagajni', 'seznam želja' → 'seznam želja'. Spremenite številke in ime blagovne znamke. Tekoča turščina brez vonja po prevodu."

Razlika: močan poziv daje motorju merljiv cilj; rezultat se neposredno približa naknadno urejenemu osnutku.

Primerjalni grafikon NMT in LLM

Velikost

NMT (Google, DeepL)

LLM (ChatGPT, Claude)

hitrost

zelo hitro

srednje

Prejmi navodilo/ton

šibka

močan

Upoštevajte terminski seznam

omejeno

Dobro (s pozivom)

Širok kontekst

šibka

dobro

Nevarnost halucinacij

nizka

Srednje (potreben nadzor)

najprimernejše delo

Ravno/tehnično/ponavljajoče se

Ton/kontekst/kreativno

Pogoste napake

  • Uporaba istega motorja za vsako delo. Neizbira motorja glede na vrsto dela povzroča izgubo časa in kakovosti.
  • Navedba cene/časa brez predhodne ocene. Test 200-300 besed razkrije presenečenja od začetka.
  • Tekočnost zamenjuje za natančnost. Lep stavek ne pomeni pravilnega stavka.
  • Ignoriranje jezikovnega para in razlike v smeri. Dober motor v enem paru je lahko šibek v drugem.
  • Ne opazim LLM-jevih dodatkov. LLM včasih doda stavke, ki niso v viru "v pomoč"; poglej to.

Kontekstno okno in doslednost

Pri prevajanju dolgega besedila z LLM je treba poznati eno tehnično omejitev: kontekstno okno — količino besedila, ki ga lahko model "vidi" in si ga hkrati zapomni. Če je besedilo večje od tega okna, ga boste morali razdeliti na dele in model lahko v naslednjem delu »pozabi« odločitev ali ton, ki ste ga sprejeli v prejšnjih delih. Namesto prevajanja dolge knjige ali dokumenta v enem kosu, opominjanje vsakega dela na izrazno zbirko in slogovni povzetek ohranja doslednost. Ta težava se ne pojavi v kratkih besedilih; Pri daljših delih, kot so romani in priročniki, pa je treba dodatno preveriti doslednost v odlomkih. Praktična rešitev: pripraviti "projektni spomin" (izrazi + znaki + tonske odločitve) in ga dodati na začetek vsakega dela ter na koncu prevoda pregledati skladnost med deli. V NMT se ta težava doživlja na drugačen način: ker NMT prevaja stavek za stavkom, je doslednost dolžine odstavka že šibka, zato izrazna baza prevzame izraz disciplina.

Če povzamem

Obstajata dve družini strojnega prevajanja: NMT, ki je hiter in dosleden, ter LLM, ki sprejema navodila in bolje vidi kontekst in ton. Mojster prevajalec vnaprej oceni primernost besedila za stroj, izbere mehanizem glede na delo, hitro izmeri kakovost surovega izpisa pred dostavo in nikoli ne zamenja tekočnosti z natančnostjo. Ta refleks predocenjevanja vam omogoča, da navedete realen čas/ceno in se zaščitite pred slepim zaupanjem.

Aplikacijska naloga

Prevedite isto 200-besedno besedilo z orodjem NMT in LLM. Primerjajte dva izhoda na petih dimenzijah (natančnost, popolnost, terminologija, tekočnost, oblika) in napišite razloge, zaradi katerih je za to besedilo potrebno manj naknadnega urejanja. Nato označite tveganja za izdajo/nepredvidene dogodke/termin na obeh s predlogo »hitro preverjanje surovega izhoda«.

kontrolni seznam

  • [ ] Razvrstil sem primernost besedila za stroj (nizko/srednje/visoko tveganje).
  • [ ] Glede na vrsto dela sem se odločil, ali bom uporabil NMT ali LLM.
  • [ ] Preliminarno oceno sem opravil na majhnem vzorcu in temu primerno določil trajanje/ceno.
  • [ ] Na hitro sem pregledal neobdelane rezultate v petih dimenzijah.
  • [ ] Ločeno sem preveril številko, datum, ime in negative, ne da bi me prevarala tekočnost.