Hagnaður:
- Hæfni til að greina styrkleika og veikleika NMT og LLM byggða þýðingar og velja réttu vélina í samræmi við tegund viðskipta
- Hæfni til að forflokka hæfi texta fyrir vélina og fyrirframmeta hann fyrir raunhæfan tíma og verð
- Hæfni til að mæla gæði hrávélaframleiðslu fljótt í fimm víddum og flagga áhættu án þess að rugla saman sléttleika og nákvæmni
Öflugasti hraðallinn sem þú hefur sem þýðandi er vélþýðing (MT) - en að nota verkfæri þýðir meðvitað að nota það í rétta starfið, á réttu tungumálapörinu og með réttum væntingum. Í þessari einingu munt þú kynnast tveimur helstu fjölskyldum MT (NMT og LLM-undirstaða þýðing), læra hver þeirra hentar betur fyrir hvaða starf, hvernig á að mæla hráframleiðslugæði þýðingar á fljótlegan hátt fyrir afhendingu og hvernig á að velja vél í samræmi við starfið. Markmiðið er að hverfa frá hugmyndinni um „allt eins, paste-translate“ og verða sérfræðingur sem getur séð fyrir hvaða texti hentar vélinni og hver krefst mannfrekrar vinnu.
Tvær fjölskyldur: NMT og LLM byggð þýðing
NMT (Neural Machine Translation) eru kerfi sem hafa lært af milljónum tvítyngdra setninga og þýða setninguna í heild sinni; Google Translate, DeepL, Microsoft Translator eru dæmi um þetta. Styrkleikar: mjög fljótur, stöðugur, reiprennandi í stuttum setningum. Veikleiki: sér oft ekki samhengi út fyrir setningamörk (sem þýðir út frá öllum textanum); Erfitt getur verið að ákveða hvort orðið „bakki“ þýði bakki eða árbakka með því að skoða málsgreinina og hún passar ekki við upptalningu hugtaka.
LLM-undirstaða þýðing (Large Language Model) er notkun kennsludrifna líkana eins og ChatGPT, Claude, Gemini fyrir þýðingar. Styrkur: tekur leiðbeiningum — skilur leiðbeiningar eins og „notaðu formlegan tón,“ „fylgdu þessum hugtakalista,“ „markhópurinn er börn“; sér víðara samhengi; fangar orðalag og tón betur. Veikleiki: getur stundum verið „of skapandi“ og bætt við upprunann (hætta á ofskynjunum), missir samhengi í löngum textum og kostnaður/hraði er mismunandi eftir starfi.
Þumalfingursregla: í beinum, endurteknum, tæknilegum texta er NMT venjulega hratt og fullnægjandi; LLM er sveigjanlegra með texta sem krefjast aga í tóni, samhengi, orðaforða og kennslu. Flestir fagmenn í dag nota bæði saman: hraðuppkast frá NMT, tón-/tímaleiðréttingu frá LLM.
Ábending: Vélargæði tungumálapars (t.d. tyrkneska→enska) geta verið frábrugðin gagnstæðri átt (enska→tyrkneska). Tungumál með agglutinative, sveigjanlega setningafræði, eins og tyrkneska, eru almennt meira krefjandi fyrir MT. Dæmdu sjálfur hvaða vél er betri í þínu eigin pari með nokkrum sýnishornstextum.
Vélarsamhæfni texta: spurðu þetta fyrst
Ekki er hver texti jafn hentugur fyrir vélina. Áður en þú byrjar á þýðingunni skaltu láta textann fara í gegnum „suitability“ síu:
- Hentar vel fyrir vélina: tæknihandbók, vörulýsing, endurtekinn viðmótstexti, staðlað bréfaskipti, tafla/listi. Tungumálið er látlaust, hugtökin föst, sköpunarkrafturinn af skornum skammti.
- Miðill hentugur: fréttir, fyrirtækjaefni, fræðsluefni. Vélin framleiðir góðar útlínur en krefst alvarlegrar eftirvinnslu fyrir tón og flæði.
- Hentar ekki fyrir vél (mikil áhætta): lagasamningur, læknatexti, auglýsing/slagorð, bókmenntatexti, húmor, ljóð. Hér gefur vélin aðeins hugmyndir; Starfið er að miklu leyti í höndum fólks.
Ef þú gerir þennan greinarmun frá upphafi muntu bæði gefa viðskiptavinum réttan tíma/verð og vernda þig gegn því að treysta í blindni hráframleiðslunni.
Mældu hrá framleiðslugæði fljótt
Þegar þú sérð MT úttak spyrðu þig "er það gott eða slæmt?" Svaraðu spurningunni með skjótum gátlista, ekki innsæi. Skoðaðu þessar fimm víddir: nákvæmni (er merkingin trú upprunanum?), heilleika (er setningunni sleppt eða bætt við?), hugtök (er hún rétt og samkvæm?), reiprennsli (er það eðlilegt í markmálinu?), snið (eru merkingar, tölur, snið varðveitt?). Við munum dýpka þessar víddir í næstu gæðaeiningu; Í bili láttu það vera viðbragð þitt fyrir afhendingu.
Varúð: Hættulegustu villurnar í MT-úttakinu eru þær „rennandi en rangar“. Setningin gæti verið á fullkominni tyrknesku, en "15% afsláttur" í heimildinni gæti hafa verið breytt í "50% afsláttur". Látið ekki bugast af málkunnáttu; Skoðaðu alltaf töluna, neikvæða og sérnafnið sérstaklega.
þrjú smámál
Tilfelli 1 — Hægri vélin minnkaði tímann um helming. Einn þýðandi valdi að þýða 12.000 orða hugbúnaðarviðmót með NMT og markaðsbækling í sama bindi með LLM. Samkvæmni NMT við viðmótið gerði vinnuna hraðari; Tónsveigjanleiki LLM í bæklingnum dró úr endurritunarbyrði um 40%. Að gefa sömu vélina bæði störfin myndi sóa tíma.
Mál 2 - Format sparaði verðið. Skrifstofa ætlaði að bjóða upp á lagatexta vegna þess að „það er hægt að búa til með vélum, það verður ódýrt“. Í formatinu var 500 orða sýnishorn þýtt; Vélin skilaði tveimur lagaskilmálum með ígildi rangs kerfis. Skrifstofan verðlagði verkið sem „þunga eftirklippingu“ og gaf raunhæfan frest; Hann forðaðist að tapa peningum vegna rangs tilboðs.
Mál 3 — Munur á tungumálapörum. Hópur taldi að vél sem virkaði frábærlega á ensku→þýsku væri af sömu gæðum á tyrknesku→arabísku. 300 orða prófið sýndi að arabíska úttakið þurfti mun meiri leiðréttingu. Teymið úthlutaði mismunandi vélum og mismunandi fjárhagsáætlunum eftir klippingu eftir tungumálaparinu.
Fjögur afritanleg sniðmát
1) Mat á hæfi texta:
Hlutverk þitt: háttsettur MTPE sérfræðingur. Gefðu eftirfarandi texta einkunn fyrir hæfi fyrir vélþýðingu: bókstaflega/tæknilega eða skapandi/samhengislega? Flokkaðu það sem (1) mjög vélvænt, (2) miðlungs, (3) áhættusamt og skrifaðu rökstuðning þinn. Áætlaðu væntanlegt álag eftir klippingu sem létt/miðlungs/þungt.Textadæmi: [líma 200-300 orð]
2) Leiðbeinandi LLM þýðing (með hugtökum og tónstýringu):
Þýddu þennan texta [heimild]→[markmið].Áhorfendur: [hver]. Tónn: [t.d. embættismaður]. Reitur: [t.d. fjármál].Listi yfir hugtök (vertu viss um að nota): [A→a, B→b].Reglur: ekki bæta við því sem er ekki í heimildinni, halda tölum/dagsetningum/nöfnum, skiptu hverri setningu út fyrir setningu. Merktu hvar þú ert ekki viss með [?]. Texti: [...]
3) Samanburður á tveimur vélum:
Hér að neðan eru tvær mismunandi þýðingar á sömu upprunasetningu (A og B). Berðu saman hvort um sig hvað varðar réttmæti, hugtök og eðlilegleika og segðu mér hvor þeirra mun krefjast minni leiðréttingar, með rökstuðningi. Heimild: [...] | Þýðing A: [...] | Þýðing B: [...]
4) Raw framleiðsla fljótleg skoðun:
Hér að neðan er heimild og vélþýðing. Merktu bara við eftirfarandi: (1) sleppt/bætt við upplýsingum, (2) rangt númer/dagsetning/nafn, (3) afneitununarvilla, (4) ósamræmi. Ekki skrifa neinar leiðréttingar, bara skrá áhættusvæðin.Heimild: [...] | Þýðing: [...]
Veik kvaðning / Sterk kvaðning
Veik: "Þýddu þennan texta og hann verður góður." (Fyrir vélina er „gott“ óskilgreint; enginn tónn, ekkert hugtak, enginn massi.)
Güçlü: "Þýddu þessa vörulýsingu úr ensku yfir á tyrknesku. Svæði: rafræn viðskipti. Áhorfendur: ungur neytandi. Tónn: vingjarnlegur en traustvekjandi. 'útskráning' → 'afgreiðsluskref', 'óskalisti' → 'óskalisti'. Breyttu númerum og vöruheiti. Reiprennandi tyrkneska án þýðingarlykt."
Mismunur: sterk hvetja gefur vélinni mælanlegt markmið; úttakið líkir beint eftir breyttu uppkasti.
NMT vs LLM samanburðarrit
Stærð
NMT (Google, DeepL)
LLM (ChatGPT, Claude)
hraða
mjög hratt
miðlungs
Fá leiðbeiningar/tón
veikburða
sterkur
Farið eftir hugtakalistanum
takmörkuð
Gott (með hvetjandi)
Víðtækt samhengi
veikburða
gott
Hætta á ofskynjunum
lágt
Miðlungs (stýring krafist)
heppilegasta starfið
Beint/tæknilegt/endurtekið
Tónn/samhengi/skapandi
Algeng mistök
- Að nota sömu vélina fyrir hvert verk. Að velja ekki vél eftir tegund vinnu veldur tíma- og gæðatapi.
- Gefa upp verð/tíma án fyrirframmats. 200-300 orða próf sýnir hvað kemur á óvart frá upphafi.
- Misvísandi reiprennsli fyrir nákvæmni. Falleg setning þýðir ekki rétta setningu.
- Hunsa tungumálaparið og stefnumun. Góð vél í einu pari getur verið veik í öðru.
- Tek ekki eftir viðbótum LLM. LLM bætir stundum við setningum sem eru ekki í heimildinni "til að hjálpa"; athugaðu þetta.
Samhengisgluggi og samkvæmni
Þegar langur texti er þýddur með LLM er nauðsynlegt að þekkja eitt tæknilegt takmörk: samhengisgluggann — magn texta sem líkanið getur "séð" og haldið í huga í einu. Ef textinn er stærri en þessi gluggi verður þú að skipta honum í bita og líkanið gæti "gleymt" í næsta bita hugtaksákvörðuninni eða tóninum sem þú tókst í fyrri bitunum. Þannig að í stað þess að þýða langa bók eða skjal í einu lagi, heldur það samræmi við að minna hvert stykki á hugtakagrunninn og stílyfirlitið. Þetta vandamál kemur ekki fyrir í stuttum texta; Hins vegar, í löngum verkum eins og skáldsögum og handbókum, er nauðsynlegt að athuga samkvæmni í köflum. Hagnýt lausn: að útbúa "verkefnisminni" (hugtök + stafir + tónákvarðanir) og bæta því við upphaf hvers verks og skanna að samræmi milli verkanna í lok þýðingarinnar. Í NMT er þetta vandamál upplifað á annan hátt: Þar sem NMT þýðir setningu fyrir setningu er samkvæmni málsgreinalengdar þegar veik, svo termbase tekur á sig hugtakið aga.
Í stuttu máli
Það eru tvær fjölskyldur vélþýðinga: NMT, sem er hratt og stöðugt, og LLM, sem tekur kennslu og sér samhengi og tón betur. Þýðandinn metur hæfi textans fyrir vélina fyrirfram, velur vélina í samræmi við starfið, mælir fljótt gæði hráefnisins fyrir afhendingu og ruglar aldrei saman málkunnáttu og nákvæmni. Þetta formatsviðbragð gerir þér bæði kleift að gefa raunhæfan tíma/verð og vernda þig gegn blindu trausti.
Umsóknarverkefni
Þýddu sama 200 orða textann með bæði NMT tóli og LLM. Berðu saman þessar tvær úttakstegundir á fimm víddum (nákvæmni, heilleika, hugtök, reiprennandi, snið) og skrifaðu ástæður sem krefjast minni eftirvinnslu fyrir þennan texta. Flagaðu síðan vandamál/viðbúnaðaráhættu/tímaáhættu á báðum með „raw output quick check“ sniðmátinu.
gátlisti
- [ ] Ég flokkaði hæfi textans fyrir vélina (lítil/miðlungs/mikil áhætta).
- [ ] Það fer eftir starfstegundinni, ég ákvað hvort ég ætti að nota NMT eða LLM.
- [ ] Ég gerði bráðabirgðamat með litlu úrtaki og ákvað tímalengd/verð í samræmi við það.
- [ ] Ég skoðaði fljótt hráframleiðsluna í fimm víddum.
- [ ] Ég athugaði númerið, dagsetninguna, nafnið og neikvæðnirnar sérstaklega án þess að láta blekkjast af reiprenninni.