Üksus 2 / 11

Masintõlke põhialused: NMT, LLM, mootori valik ja eelhindamine

Kasu:

  • Oskus eristada NMT- ja LLM-põhise tõlke tugevusi ja nõrkusi ning valida õige mootor vastavalt ettevõtte tüübile
  • Võimalus eelnevalt klassifitseerida teksti sobivust masinale ja hinnata seda realistliku aja ja hinna jaoks
  • Võimalus kiiresti mõõta toormasina väljundi kvaliteeti viies mõõtmes ja märgistada riske ilma, et sujuvust täpsusega segi ajama

Kõige võimsam kiirendi, mis teil tõlkijana on, on masintõlge (MT) — kuid tööriista teadlik kasutamine tähendab selle rakendamist õiges töös, õiges keelepaaris ja õigete ootustega. Selles üksuses saate tutvuda MT kahe suurema perekonnaga (NMT- ja LLM-põhine tõlge), saate teada, milline neist on millise töö jaoks parem, kuidas kiiresti mõõta tõlke toorväljundkvaliteeti enne tarnimist ja kuidas valida mootor vastavalt tööle. Eesmärk on eemalduda ideest "kõik sama, kleebi-tõlgi" ja saada eksperdiks, kes oskab ette näha, milline tekst masinale sobib ja mis nõuab inimmahukat tööd.

Kaks perekonda: NMT ja LLM-põhine tõlge

NMT (Neural Machine Translation) on süsteemid, mis on õppinud miljonitest kakskeelsetest lausetest ja tõlgivad lause tervikuna; Nende näideteks on Google Translate, DeepL, Microsoft Translator. Tugevused: väga kiire, järjekindel, valdab lühikesi lauseid. Nõrkus: sageli ei näe konteksti väljaspool lausepiiri (tähendab kogu tekstist); Lõikest vaadates võib olla raske otsustada, kas sõna "pank" tähendab kallast või jõe kallast, ja see ei sobi esitatud terminite loendisse.

LLM-põhine tõlge (Large Language Model) on käsupõhiste mudelite (nt ChatGPT, Claude, Gemini) kasutamine tõlkimiseks. Tugevus: võtab juhiseid — saab aru sellistest juhistest nagu „kasutage ametlikku tooni“, „järgige seda terminite loendit“, „sihtrühm on lapsed“; näeb laiemat konteksti; tabab idioomi ja tooni paremini. Nõrkus: võib mõnikord olla "liiga loominguline" ja lisada allikale (hallutsinatsioonide oht), kaotab pikkade tekstide sidususe ja kulud/kiirus varieeruvad sõltuvalt tööst.

Rusikareegel: sirgetes, korduvates tehnilistes tekstides on NMT tavaliselt kiire ja adekvaatne; LLM on paindlikum tekstidega, mis nõuavad distsipliini tooni, konteksti, sõnavara ja juhendamise osas. Enamik professionaale kasutab tänapäeval mõlemat koos: kiire mustand NMT-lt, tooni/termini parandus LLM-ilt.

Näpunäide: keelepaari (nt türgi → inglise) masina kvaliteet võib erineda vastupidisest suunast (inglise → türgi). Aglutinatiivse ja paindliku süntaksiga keeled, näiteks türgi keel, on MT jaoks üldiselt keerulisemad. Mõne näidisteksti abil hinnake ise, milline mootor on teie enda paaris parem.

Teksti masinaga ühilduvus: kõigepealt küsige seda

Iga tekst ei sobi masinale ühtviisi. Enne tõlkimise alustamist laske tekst läbi "sobivuse" filtri:

  • Masinale hästi sobiv: tehniline juhend, tootekirjeldus, korduv liidese tekst, standardne kirjavahetus, tabel/loend. Keel on selge, terminoloogia on fikseeritud, loovust napib.
  • Keskmine sobiv: uudised, ettevõtte sisu, õppematerjalid. Masin annab häid piirjooni, kuid nõuab tooni ja voolu jaoks tõsist järeltöötlust.
  • Masinale ei sobi (kõrge riskiga): juriidiline leping, meditsiinitekst, reklaam/loosung, kirjandustekst, huumor, luule. Siin annab masin ainult ideid; Töö langeb suures osas inimestele.

Kui teed seda vahet algusest peale, annad nii kliendile õige aja/hinna kui ka kaitsed end toortoodangu pimesi usaldamise eest.

Mõõtke kiiresti töötlemata toodangu kvaliteeti

Kui näete MT väljundit, mõtlete, kas see on hea või halb? Vastake küsimusele kiire kontrollnimekirjaga, mitte intuitsiooniga. Vaadake neid viit mõõdet: täpsus (kas tähendus on allikatruu?), terviklikkus (kas lause on välja jäetud või lisatud?), terminoloogia (kas see on õige ja järjepidev?), ladusus (kas see on sihtkeeles loomulik?), formaat (kas sildid, numbrid, vorming on säilinud?). Süvendame neid mõõtmeid järgmises kvaliteediüksuses; Praegu olgu see teie tarneeelne refleks.

Ettevaatust: MT väljundi kõige ohtlikumad vead on "sujuvad, kuid valed". Lause võib olla täiuslikus türgi keeles, kuid allikas võib olla "15% allahindlus" muudetud "50% allahindluseks". Ärge laske end heidutada sujumisest; Vaadake alati arvu, eitavat ja pärisnime eraldi.

kolm minikarpi

Juhtum 1 – parem mootor lühendas aja poole võrra. Üks tõlkija otsustas tõlkida 12 000-sõnalise tarkvaraliidese NMT-ga ja samas mahus turundusvihiku LLM-iga. NMT järjepidevus liideses muutis töö kiiremaks; LLM-i tonaalne paindlikkus brošüüris vähendas ümberkirjutamiskoormust 40%. Mõlema töö ühele mootorile andmine raiskaks aega.

Juhtum 2 – eelhindamine päästis hinna. Üks kontor hakkas pakkuma juriidilist teksti, sest "selle saab masinatega teha, see tuleb odav". Eelhindamises tõlgiti 500-sõnaline näidis; Masin tagastas kaks juriidilist terminit vale süsteemi vastega. Büroo hindas töö kui "raske järeltoimetamise" ja andis realistliku tähtaja; Ta vältis raha kaotamist vale pakkumise tõttu.

3. juhtum – keelepaaride erinevus. Meeskond arvas, et mootor, mis töötas suurepäraselt inglise → saksa keeles, oli sama kvaliteediga türgi → araabia keeles. 300-sõnaline test näitas, et araabia väljund vajas palju rohkem korrigeerimist. Meeskond eraldas sõltuvalt keelepaarist erinevad mootorid ja erinevad redigeerimisjärgsed eelarved.

Neli kopeeritavat malli

1) Teksti sobivuse hindamine:

Sinu roll: MTPE vanemspetsialist. Hinda järgmise teksti sobivust masintõlkeks: sõnasõnaline/tehniline või loominguline/kontekstuaalne? Liigitage see kategooriasse (1) väga masinasõbralik, (2) keskmine, (3) kõrge risk ja kirjutage oma põhjendus. Hinnanguline eeldatav redigeerimisjärgne koormus on kerge/keskmine/raske. Tekstinäide: [kleepige 200–300 sõna]

2) Juhendatud LLM-i tõlge (terminoloogia ja toonikontrolliga):

Tõlgi see tekst [allikas]→[sihtmärk].Vaatajaskond: [kes]. Toon: [nt. ametlik]. Väli: [nt. rahandus].Merimuste loetelu (kasuta kindlasti): [A→a, B→b].Reeglid: ära lisa seda, mida allikas ei ole, säilita numbrid/kuupäevad/nimed, iga lause asenda lausega. Märkige kohad, kus te pole kindel, märgiga [?]. Tekst: [...]

3) Kahe mootori võrdlus:

Allpool on kaks erinevat tõlget sama lähtelause kohta (A ja B). Võrrelge mõlemat korrektsuse, terminoloogia ja loomulikkuse osas ning öelge, kumb vajab vähem parandust, koos põhjendusega. Allikas: [...] | Tõlge A: [...] | Tõlge B: [...]

4) Toorväljundi kiirkontroll:

Allpool on allikas ja masintõlge. Märkige lihtsalt järgmine: (1) välja jäetud/lisatud teave, (2) vale number/kuupäev/nimi, (3) eitusviga, (4) vastuoluline termin. Ärge kirjutage parandusi, vaid loetlege riskantsed valdkonnad.Allikas: [...] | Tõlge: [...]

Nõrk viip / Tugev viip

Nõrk: "Tõlkige see tekst ja see on hea." (Mootori puhul on "hea" määratlemata; pole tooni, terminit ega massi.)

Güçlü: "Tõlgige see tootekirjeldus inglise keelest türgi keelde. Valdkond: e-kaubandus. Publik: noor tarbija. Toon: sõbralik, kuid rahustav. "Kassa" → "Kassasse jõudmine", "Soovinimekiri" → "Soovinimekiri". Muutke numbreid ja kaubamärgi nime. Ladus türgi keel ilma igasuguse tõlkelõhnata."

Erinevus: tugev viip annab mootorile mõõdetava eesmärgi; väljund sarnaneb vahetult pärast redigeeritud mustandit.

NMT vs LLM võrdlustabel

Suurus

NMT (Google, DeepL)

LLM (ChatGPT, Claude)

kiirust

väga kiire

keskmine

Saate juhiseid/toone

nõrk

tugev

Järgige terminite loendit

piiratud

Hea (koos viipega)

Lai kontekst

nõrk

hea

Hallutsinatsioonide oht

madal

Keskmine (vajalik kontroll)

kõige sobivam töö

Sirge/tehniline/korduv

Toon/kontekst/looming

Levinud vead

  • Sama mootori kasutamine iga töö jaoks. Mootori valimata jätmine töö liigi järgi põhjustab aja- ja kvaliteedikaotust.
  • Hind/aeg ilma eelhindamiseta. 200-300 sõna test paljastab üllatused algusest peale.
  • Segi ajab sujuvust täpsusega. Ilus lause ei tähenda õiget lauset.
  • Keelepaari ja suuna erinevuse ignoreerimine. Hea mootor ühes paaris võib teises olla nõrk.
  • Ei märka LLM-i täiendusi. LLM lisab mõnikord lauseid, mis ei ole allikas "abiks"; vaadake seda.

Kontekstikaken ja järjepidevus

Pika teksti tõlkimisel LLM-iga on vaja teada üht tehnilist piirangut: konteksti aken — tekstihulk, mida mudel suudab korraga "näha" ja meeles pidada. Kui tekst on sellest aknast suurem, peate selle tükkideks jagama ja mudel võib järgmises tükis "unustada" termini otsuse või tooni, mille tegite eelmistes tükkides. Seega, selle asemel, et tõlkida pikka raamatut või dokumenti ühes tükis, säilitab terminibaasi ja stiili kokkuvõtte iga osa meelde tuletamine järjepidevuse. Lühitekstides seda probleemi ei esine; Pikkades teostes, nagu romaanid ja käsiraamatud, on aga vaja täiendavalt kontrollida lõikude järjepidevust. Praktiline lahendus: valmistada ette "projektimälu" (terminid + märgid + tooniotsused) ja lisada see iga pala algusesse ning tõlke lõpus skannida tükkide vahelist ühtsust. NMT-s kogetakse seda probleemi erinevalt: kuna NMT tõlgib lause lause haaval, on lõigu pikkuse järjepidevus juba nõrk, mistõttu terminibaas kasutab terminit distsipliin.

Kokkuvõttes

Masintõlkeid on kaks perekonda: NMT, mis on kiire ja järjepidev, ja LLM, mis võtab juhiseid ning näeb konteksti ja tooni paremini. Meistertõlk hindab eelnevalt teksti sobivust masinale, valib mootori töökoha järgi, mõõdab enne tarnimist kiiresti toortoodangu kvaliteeti ega aja ladusust kunagi segamini täpsusega. See eelhindamise refleks võimaldab teil anda nii realistliku aja/hinna kui ka kaitsta end pimeda usalduse eest.

Rakenduse ülesanne

Tõlkige sama 200-sõnaline tekst nii NMT-tööriista kui ka LLM-iga. Võrrelge kahte väljundit viies mõõtmes (täpsus, täielikkus, terminoloogia, sujuvus, vorming) ja kirjutage põhjused, miks üks vajab selle teksti jaoks vähem järeltoimetamist. Seejärel märgistage probleem/ettenägematus/tähtaja riskid mõlema puhul malliga „tooresväljundi kiirkontroll”.

kontrollnimekiri

  • [ ] Klassifitseerisin teksti sobivuse masinale (madal/keskmine/kõrge risk).
  • [ ] Olenevalt töö tüübist otsustasin, kas kasutada NMT-d või LLM-i.
  • [ ] Tegin väikese valimiga eelhinnangu ja määrasin selle järgi kestuse/hinna.
  • [ ] Kontrollisin kiiresti toorväljundit viies mõõtmes.
  • [ ] Kontrollisin numbrit, kuupäeva, nime ja negatiivisid eraldi, ilma, et ladusus oleks petnud.