Jednotka 2 / 11

Základy strojového překladu: NMT, LLM, výběr motoru a předběžné vyhodnocení

zisky:

  • Schopnost rozlišit silné a slabé stránky překladu založeného na NMT a LLM a vybrat ten správný engine podle typu podnikání
  • Schopnost předem klasifikovat vhodnost textu pro stroj a předem jej vyhodnotit na realistický čas a cenu
  • Schopnost rychle měřit kvalitu surového výstupu stroje v pěti dimenzích a označit rizika, aniž by došlo k záměně hladkosti s přesností

Nejvýkonnějším akcelerátorem, který jako překladatel máte, je strojový překlad (MT) – ale používat nástroj vědomě znamená použít jej na správnou práci, ve správném jazykovém páru a se správnými očekáváními. V této lekci se seznámíte se dvěma hlavními rodinami MT (překlad založený na NMT a LLM), naučíte se, která z nich je pro kterou zakázku lepší, jak rychle změřit nezpracovanou výstupní kvalitu překladu před dodáním a jak vybrat stroj podle zakázky. Cílem je opustit myšlenku „vše stejné, vložit-přeložit“ a stát se odborníkem, který dokáže předvídat, který text je vhodný pro stroj a který vyžaduje lidskou práci.

Dvě rodiny: překlad založený na NMT a LLM

NMT (Neural Machine Translation) jsou systémy, které se naučily z milionů dvojjazyčných vět a překládají větu jako celek; Google Translate, DeepL, Microsoft Translator jsou příklady těchto. Silné stránky: velmi rychlý, důsledný, plynulý v krátkých větách. Slabost: často nevidí kontext za hranicí věty (myšleno z celého textu); Při pohledu na odstavec může být obtížné rozhodnout, zda slovo „břeh“ znamená břeh nebo břeh řeky a nezapadá do seznamu uvedených pojmů.

Překlad založený na LLM (Large Language Model) je použití modelů řízených instrukcemi, jako jsou ChatGPT, Claude, Gemini pro překlad. Síla: přijímá pokyny — rozumí pokynům jako „použij formální tón“, „postupuj podle tohoto seznamu pojmů“, „cílovým publikem jsou děti“; vidí širší souvislosti; lépe zachycuje idiom a tón. Slabost: někdy může být „příliš kreativní“ a přidat ke zdroji (riziko halucinací), u dlouhých textů ztrácí koherenci a náklady/rychlost se liší v závislosti na zakázce.

Základní pravidlo: v přímých, opakujících se technických textech je NMT obvykle rychlá a přiměřená; LLM je flexibilnější s texty, které vyžadují disciplínu v tónu, kontextu, slovní zásobě a výuce. Většina profesionálů dnes používá obojí dohromady: rychlý návrh z NMT, korekci tón/term z LLM.

Tip: Strojová kvalita jazykového páru (např. turečtina→angličtina) se může lišit od opačného směru (angličtina→turečtina). Jazyky s aglutinační, flexibilní syntaxí, jako je turečtina, jsou pro MT obecně náročnější. Posuďte sami, který engine je lepší ve vlastní dvojici s pár ukázkovými texty.

Strojová kompatibilita textu: nejprve se zeptejte

Ne každý text je pro stroj stejně vhodný. Před zahájením překladu nechte text projít filtrem „vhodnosti“:

  • Dobře se hodí ke stroji: technická příručka, popis produktu, opakující se text rozhraní, standardní korespondence, tabulka/seznam. Jazyk je jasný, terminologie ustálená, kreativita vzácná.
  • Střední vhodné: zprávy, firemní obsah, vzdělávací materiál. Stroj vytváří dobré obrysy, ale vyžaduje seriózní následné úpravy pro tón a tok.
  • Nevhodné pro stroj (vysoké riziko): právní smlouva, lékařský text, reklama/slogan, literární text, humor, poezie. Zde stroj pouze dává nápady; Práce z velké části připadá na lidi.

Pokud toto rozlišujete od začátku, jednak poskytnete zákazníkovi správný čas/cenu, jednak se ochráníte před slepou důvěrou v surový výstup.

Rychle změřte kvalitu surového výstupu

Když vidíte výstup MT, ptáte se "je to dobré nebo špatné?" Odpovězte na otázku pomocí rychlého kontrolního seznamu, nikoli intuice. Podívejte se na těchto pět dimenzí: přesnost (je význam věrný zdroji?), úplnost (je věta vynechána nebo přidána?), terminologie (je správná a konzistentní?), plynulost (je v cílovém jazyce přirozená?), formát (jsou zachovány značky, čísla, formátování?). Tyto rozměry prohloubíme v dalším jakostním celku; Zatím ať je to váš reflex před porodem.

Pozor: Nejnebezpečnější chyby výstupu MT jsou ty "plynulé, ale nesprávné". Věta může být v dokonalé turečtině, ale „15% sleva“ ve zdroji mohla být změněna na „50% sleva“. Nenechte se odradit plynulostí; Vždy se podívejte na číslo, záporné a vlastní podstatné jméno zvlášť.

tři mini pouzdra

Případ 1 — Pravý motor zkrátil čas na polovinu. Jeden překladatel se rozhodl přeložit softwarové rozhraní s 12 000 slovy pomocí NMT a marketingovou brožuru stejného objemu pomocí LLM. Důslednost rozhraní NMT urychlila práci; Tonální flexibilita LLM v brožuře snížila zátěž při přepisování o 40 %. Dávat obě práce stejnému motoru by ztrácelo čas.

Případ 2 – Předběžný odhad zachránil cenu. Kancelář se chystala nabídnout právní text, protože „může být vyroben stroji, bude to levné“. V předběžném hodnocení byl přeložen vzorek 500 slov; Stroj vrátil dva právní termíny s ekvivalentem nesprávného systému. Kancelář ocenila práci jako „náročné následné úpravy“ a stanovila realistický termín; Vyhnul se ztrátě peněz kvůli špatné nabídce.

Případ 3 – Rozdíl jazykových párů. Jeden tým si myslel, že motor, který skvěle funguje v angličtině → němčině, má stejnou kvalitu v turečtině → arabštině. Test o 300 slovech ukázal, že arabský výstup vyžaduje mnohem více korekcí. Tým alokoval různé nástroje a různé rozpočty po úpravách v závislosti na jazykovém páru.

Čtyři kopírovatelné šablony

1) Hodnocení vhodnosti textu:

Vaše role: senior specialista na MTPE. Ohodnoťte následující text z hlediska vhodnosti pro strojový překlad: doslovný/technický nebo kreativní/kontextový? Klasifikujte jej jako (1) velmi strojový, (2) střední, (3) vysoce rizikový a napište své odůvodnění. Odhadněte očekávané zatížení po úpravách jako lehké/střední/těžké. Příklad textu: [vložte 200–300 slov]

2) Instruovaný překlad LLM (s terminologií a ovládáním tónu):

Přeložte tento text [zdroj]→[cíl]. Publikum: [kdo]. Tón: [např. oficiální]. Pole: [např. finance].Seznam pojmů (nezapomeňte použít): [A→a, B→b].Pravidla: nepřidávejte, co není ve zdroji, ponechte čísla/data/jména, každou větu nahraďte větou. Označte, kde si nejste jisti, pomocí [?]. Text: [...]

3) Porovnání dvou motorů:

Níže jsou uvedeny dva různé překlady stejné zdrojové věty (A a B). Porovnejte každý z hlediska správnosti, terminologie a přirozenosti a řekněte mi, který z nich bude vyžadovat méně oprav, s odůvodněním. Zdroj: [...] | Překlad A: [...] | Překlad B: [...]

4) Rychlá kontrola surového výstupu:

Níže je uveden zdroj a strojový překlad. Stačí označit následující: (1) vynechané/přidané informace, (2) nesprávné číslo/datum/název, (3) chyba negace, (4) nekonzistentní termín. Nepište žádné opravy, pouze vyjmenujte rizikové oblasti.Zdroj: [...] | Překlad: [...]

Slabá výzva / Silná výzva

Slabý: "Přeložte tento text a bude to dobré." (Pro motor není "dobré" definováno; žádný tón, žádný výraz, žádná hmotnost.)

Güçlü: "Přeložte tento popis produktu z angličtiny do turečtiny. Oblast: e-commerce. Publikum: mladý spotřebitel. Tón: přátelský, ale uklidňující. 'pokladna' → 'krok pokladny', 'seznam přání' → 'seznam přání'. Změňte čísla a název značky. Plynulá turečtina bez zápachu překladu."

Rozdíl: silná výzva dává motoru měřitelný cíl; výstup se přímo přibližuje posteditovanému návrhu.

Srovnávací tabulka NMT vs LLM

Velikost

NMT (Google, DeepL)

LLM (ChatGPT, Claude)

rychlost

velmi rychle

střední

Přijmout pokyn/tón

slabý

silný

Dodržujte seznam termínů

omezené

Dobré (s výzvou)

Široký kontext

slabý

dobrý

Riziko halucinací

nízká

Střední (vyžadováno ovládání)

nejvhodnější zaměstnání

Přímé/technické/opakující se

Tón/kontext/kreativa

Časté chyby

  • Použití stejného motoru pro každou práci. Nevolba motoru podle druhu práce způsobuje ztrátu času a kvality.
  • Uvedení ceny/času bez předběžného hodnocení. Test o 200-300 slovech odhalí překvapení od začátku.
  • Záměna plynulosti za přesnost. Krásná věta neznamená správnou větu.
  • Ignorování jazykového páru a rozdílu směru. Dobrý motor v jednom páru může být slabý v jiném.
  • Nevšímat si dodatků LLM. LLM někdy přidává věty, které nejsou ve zdroji "to help"; zkontrolovat toto.

Kontextové okno a konzistence

Při překladu dlouhého textu pomocí LLM je nutné znát jeden technický limit: kontextové okno — množství textu, které model může „vidět“ a uchovat si ho v paměti najednou. Pokud je text větší než toto okno, budete jej muset rozdělit na části a model může v dalším bloku „zapomenout“ na termínové rozhodnutí nebo tón, který jste učinili v předchozích částech. Namísto překládání dlouhé knihy nebo dokumentu v jednom kuse si tedy připomenutí každého kusu terminologie a shrnutí stylu zachovává konzistenci. Tento problém se nevyskytuje v krátkých textech; U dlouhých děl, jako jsou romány a příručky, je však nutné dodatečně kontrolovat konzistenci v pasážích. Praktické řešení: připravit "projektovou paměť" (pojmy + znaky + rozhodnutí o tónu) a přidat ji na začátek každého dílu a na konci překladu naskenovat konzistenci mezi díly. V NMT je tento problém zažíván jiným způsobem: Protože NMT překládá větu po větě, konzistence délky odstavce je již slabá, takže termbase přebírá termín disciplína.

V souhrnu

Existují dvě rodiny strojového překladu: NMT, který je rychlý a konzistentní, a LLM, který přijímá instrukce a lépe vidí kontext a tón. Mistr překladatel předem vyhodnotí vhodnost textu pro stroj, vybere motor podle zakázky, rychle změří kvalitu surového výstupu před dodáním a nikdy si neplete plynulost s přesností. Tento reflex předběžného hodnocení vám umožňuje poskytnout realistický čas/cenu a zároveň se chránit před slepou důvěrou.

Aplikační úkol

Přeložte stejný 200slovný text pomocí nástroje NMT a LLM. Porovnejte dva výstupy v pěti dimenzích (přesnost, úplnost, terminologie, plynulost, formát) a napište důvody, pro které jeden vyžaduje méně posteditací pro tento text. Poté označte problémová/nepředvídatelná/termínová rizika u obou pomocí šablony „Rychlá kontrola surového výstupu“.

kontrolní seznam

  • [ ] Klasifikoval jsem vhodnost textu pro stroj (nízké/střední/vysoké riziko).
  • [ ] Podle typu práce jsem se rozhodoval, zda použít NMT nebo LLM.
  • [ ] Udělal jsem předběžné hodnocení s malým vzorkem a podle toho určil dobu trvání/cenu.
  • [ ] Rychle jsem si prohlédl surový výstup v pěti rozměrech.
  • [ ] Zkontroloval jsem samostatně číslo, datum, jméno a zápory, aniž bych se nechal zmást plynulostí.