Gevinster:
- Evne til at skelne styrkerne og svaghederne ved NMT og LLM-baseret oversættelse og vælge den rigtige motor i henhold til typen af virksomhed
- Evne til at forhåndsklassificere en teksts egnethed til maskinen og forhåndsevaluere den til realistisk tid og pris
- Evne til hurtigt at måle kvaliteten af rå maskinoutput i fem dimensioner og markere risici uden at forveksle glathed med nøjagtighed
Den mest kraftfulde accelerator, du har som oversætter, er maskinoversættelse (MT) - men at bruge et værktøj betyder bevidst at anvende det til det rigtige job, i det rigtige sprogpar og med de rigtige forventninger. I denne enhed vil du lære de to store familier af MT (NMT- og LLM-baseret oversættelse) at kende), lære, hvilken der er bedst til hvilket job, hvordan du hurtigt kan måle den rå outputkvalitet af en oversættelse før levering, og hvordan du vælger motoren i henhold til jobbet. Målet er at komme væk fra tanken om "alligevel, indsæt-oversæt" og blive en ekspert, der kan forudse, hvilken tekst der passer til maskinen, og som kræver menneskeintensiv arbejdskraft.
To familier: NMT og LLM-baseret oversættelse
NMT (Neural Machine Translation) er systemer, der har lært af millioner af tosprogede sætninger og oversætter sætningen som en helhed; Google Translate, DeepL, Microsoft Translator er eksempler på disse. Styrker: meget hurtig, konsekvent, flydende i korte sætninger. Svaghed: ser ofte ikke sammenhæng ud over sætningsgrænsen (betyder fra hele teksten); Det kan være vanskeligt at afgøre, om ordet "banke" betyder bred eller flodbred ved at se på afsnittet, og det passer ikke på listen over udtryk.
LLM-baseret oversættelse (Large Language Model) er brugen af instruktionsdrevne modeller som ChatGPT, Claude, Gemini til oversættelse. Styrke: tager instruktioner — forstår instruktioner såsom "brug en formel tone", "følg denne liste over termer", "målgruppen er børn"; ser den bredere sammenhæng; fanger idiom og tone bedre. Svaghed: kan nogle gange være "for kreativ" og tilføje kilden (risiko for hallucinationer), mister sammenhæng i lange tekster, og omkostninger/hastighed varierer afhængigt af jobbet.
Tommelfingerregel: i lige, gentagne, tekniske tekster er NMT normalt hurtigt og tilstrækkeligt; LLM er mere fleksibel med tekster, der kræver disciplin i tone, kontekst, ordforråd og instruktion. De fleste fagfolk bruger i dag begge sammen: hurtig udkast fra NMT, tone/term korrektion fra LLM.
Tip: Maskinkvaliteten af et sprogpar (f.eks. tyrkisk→engelsk) kan afvige fra den modsatte retning (engelsk→tyrkisk). Sprog med agglutinativ, fleksibel syntaks, såsom tyrkisk, er generelt mere udfordrende for MT. Vurder selv, hvilken motor der er bedst i dit eget par med et par eksempeltekster.
Maskinkompatibilitet af tekst: spørg først
Ikke alle tekster er lige velegnede til maskinen. Før du starter oversættelsen, skal du sende teksten gennem et "egnetheds"-filter:
- Velegnet til maskinen: teknisk manual, produktbeskrivelse, gentagen grænsefladetekst, standardkorrespondance, tabel/liste. Sproget er almindeligt, terminologien er fast, kreativiteten er knap.
- Medium egnet: nyheder, virksomhedsindhold, undervisningsmateriale. Maskinen producerer gode konturer, men kræver seriøs efterredigering for tone og flow.
- Ikke egnet til maskine (høj risiko): juridisk kontrakt, medicinsk tekst, reklame/slogan, litterær tekst, humor, poesi. Her giver maskinen kun ideer; Jobbet tilfalder i høj grad mennesker.
Hvis du foretager denne skelnen fra begyndelsen, vil du både give kunden den rigtige tid/pris og beskytte dig mod blindt at stole på det rå output.
Mål hurtigt rå outputkvalitet
Når du ser et MT-output, spekulerer du på "er det godt eller dårligt?" Besvar spørgsmålet med en hurtig tjekliste, ikke intuition. Se på disse fem dimensioner: nøjagtighed (er betydningen tro mod kilden?), fuldstændighed (er sætningen udeladt eller tilføjet?), terminologi (er den korrekt og konsistent?), flydende (er det naturligt i målsproget?), format (er tags, tal, formatering bevaret?). Vi vil uddybe disse dimensioner i den næste kvalitetsenhed; Lad det indtil videre være din før-leveringsrefleks.
Forsigtig: De farligste fejl i MT-output er de "flydende, men ukorrekte". Sætningen kan være på perfekt tyrkisk, men "15% rabat" i kilden kan være blevet ændret til "50% rabat". Lad dig ikke afskrække af flydende sprog; Se altid på tallet, minus og egennavne separat.
tre minisager
Tilfælde 1 — Den højre motor halverede tiden. En oversætter valgte at oversætte en 12.000-ords softwaregrænseflade med NMT og et marketinghæfte af samme volumen med LLM. NMT's konsistens ved grænsefladen gjorde arbejdet hurtigere; LLM's tonale fleksibilitet i hæftet reducerede omskrivningsbyrden med 40 %. At give begge job til den samme motor ville spilde tid.
Case 2 — Forhåndsvurdering sparede prisen. Et kontor var ved at tilbyde en lovtekst, fordi "det kan laves af maskiner, det bliver billigt". I præ-evalueringen blev en prøve på 500 ord oversat; Maskinen returnerede to juridiske termer med det forkerte systems ækvivalent. Kontoret prissatte værket som "tung efterredigering" og gav en realistisk deadline; Han undgik at tabe penge på grund af det forkerte tilbud.
Tilfælde 3 — Sprogparforskel. Et hold mente, at en motor, der fungerede godt på engelsk→tysk, var af samme kvalitet på tyrkisk→arabisk. Testen på 300 ord viste, at det arabiske output krævede meget mere korrektion. Holdet tildelte forskellige motorer og forskellige budgetter efter redigering afhængigt af sprogparret.
Fire kopierbare skabeloner
1) Evaluering af tekstegnethed:
Din rolle: senior MTPE-specialist. Vurder følgende tekst for egnethed til maskinoversættelse: bogstavelig/teknisk eller kreativ/kontekstuel? Klassificer det som (1) meget maskinvenligt, (2) medium, (3) høj risiko og skriv din begrundelse. Estimer forventet belastning efter redigering som let/medium/tung. Teksteksempel: [indsæt 200-300 ord]
2) Instrueret LLM-oversættelse (med terminologi og tonekontrol):
Oversæt denne tekst [kilde]→[mål].Publikum: [hvem]. Tone: [f.eks. officiel]. Felt: [f.eks. finans].Liste over termer (sørg for at bruge): [A→a, B→b].Regler: Tilføj ikke det der ikke står i kilden, behold tal/datoer/navne, erstat hver sætning med en sætning. Marker, hvor du ikke er sikker med [?]. Tekst: [...]
3) Sammenligning af to motorer:
Nedenfor er to forskellige oversættelser af den samme kildesætning (A og B). Sammenlign hver med hensyn til korrekthed, terminologi og naturlighed, og fortæl mig, hvilken der vil kræve mindre korrektion, med begrundelsen. Kilde: [...] | Oversættelse A: [...] | Oversættelse B: [...]
4) Raw output hurtig inspektion:
Nedenfor er kilden og maskinoversættelsen. Du skal blot markere følgende: (1) udeladt/tilføjet information, (2) forkert nummer/dato/navn, (3) negationsfejl, (4) inkonsistent udtryk. Skriv ikke nogen rettelser, bare angiv de risikable områder. Kilde: [...] | Oversættelse: [...]
Svag prompt / Stærk prompt
Svag: "Oversæt denne tekst, så bliver det godt." (For motoren er "god" udefineret; ingen tone, ingen term, ingen masse.)
Güçlü: "Oversæt denne produktbeskrivelse fra engelsk til tyrkisk. Område: e-handel. Publikum: ung forbruger. Tone: venlig, men beroligende. 'kasse' → 'kassetrin', 'ønskeseddel' → 'ønskeseddel'. Skift numre og mærkenavn. Flydende tyrkisk uden nogen oversættelseslugt."
Forskel: stærk prompt giver motoren et målbart mål; outputtet svarer direkte til det efterredigerede udkast.
NMT vs LLM sammenligningsdiagram
Størrelse
NMT (Google, DeepL)
LLM (ChatGPT, Claude)
hastighed
meget hurtigt
medium
Modtag instruktion/tone
svag
stærk
Overhold termlisten
begrænset
God (med prompt)
Bred kontekst
svag
godt
Risiko for hallucinationer
lav
Medium (kontrol påkrævet)
mest passende job
Lige/teknisk/gentagende
Tone/kontekst/kreativ
Almindelige fejl
- Bruger den samme motor til hver opgave. Hvis man ikke vælger en motor i henhold til typen af arbejde, medfører det tab af tid og kvalitet.
- Giver pris/tid uden forudgående vurdering. En test på 200-300 ord afslører overraskelserne fra begyndelsen.
- Forkert flydende for nøjagtighed. En smuk sætning betyder ikke en korrekt sætning.
- Ignorerer sprogparret og retningsforskellen. En god motor i et par kan være svag i et andet.
- Læg ikke mærke til LLM's tilføjelser. LLM tilføjer nogle gange sætninger, der ikke er i kilden "for at hjælpe"; tjek dette ud.
Kontekstvindue og konsistens
Når du oversætter lang tekst med LLM, er det nødvendigt at kende én teknisk grænse: kontekstvinduet — mængden af tekst, som modellen kan "se" og beholde i tankerne ad gangen. Hvis teksten er større end dette vindue, bliver du nødt til at opdele den i bidder, og modellen kan "glemme" i næste stykke den termbeslutning eller -tone, du tog i de foregående bidder. Så i stedet for at oversætte en lang bog eller et dokument i ét stykke, bevares konsistensen ved at minde hvert stykke om termbasen og stilresuméet. Dette problem opstår ikke i korte tekster; Men i lange værker som romaner og manualer er det nødvendigt yderligere at kontrollere konsistensen i passager. Praktisk løsning: at forberede en "projekthukommelse" (termer + tegn + tonebeslutninger) og tilføje den til begyndelsen af hvert stykke og scanne for overensstemmelse mellem stykkerne i slutningen af oversættelsen. I NMT opleves dette problem på en anden måde: Da NMT oversætter sætning for sætning, er afsnitslængdekonsistensen allerede svag, så termbase påtager sig udtrykket disciplin.
Sammenfattende
Der er to familier af maskinoversættelse: NMT, som er hurtig og konsekvent, og LLM, som tager instruktion og ser sammenhæng og tone bedre. Mesteroversætteren vurderer tekstens egnethed til maskinen på forhånd, vælger motoren i henhold til opgaven, måler hurtigt kvaliteten af det rå output før levering og forveksler aldrig flydende med nøjagtighed. Denne præ-evalueringsrefleks giver dig mulighed for både at give en realistisk tid/pris og beskytte dig selv mod blind tillid.
Ansøgningsopgave
Oversæt den samme tekst på 200 ord med både et NMT-værktøj og et LLM. Sammenlign de to output på fem dimensioner (nøjagtighed, fuldstændighed, terminologi, flydende, format) og skriv årsager til, hvorfor man kræver mindre efterredigering af denne tekst. Markér derefter problem-/kontingent-/sigtrisici på begge med skabelonen "raw output quick check".
tjekliste
- [ ] Jeg klassificerede tekstens egnethed til maskinen (lav/middel/høj risiko).
- [ ] Afhængigt af jobtypen besluttede jeg, om jeg skulle bruge NMT eller LLM.
- [ ] Jeg lavede en foreløbig evaluering med en lille prøve og bestemte varigheden/prisen i overensstemmelse hermed.
- [ ] Jeg inspicerede hurtigt det rå output i fem dimensioner.
- [ ] Jeg tjekkede nummer, dato, navn og negativer separat uden at blive narre af det flydende.