Enhed 5 / 11

AI-integration med CAT-værktøjer og oversættelseshukommelse (TM)

Gevinster:

  • Forståelse af begreberne translation memory (TM), fuzzy matches og segmenter og være i stand til at bruge forskellene i fuzzy matches ved at tilpasse dem i stedet for blindt.
  • Evne til at anvende disciplinen kun at skrive godkendte oversættelser til TM, holde kunde-TM'er adskilte og udføre TM-vedligeholdelse
  • Evne til at beskytte privatlivets fred ved at kontrollere, hvor data går hen i MT/LLM-integration inden for CAT

Professionel oversættelse udføres oftest i et CAT-værktøj, ikke i en almindelig teksteditor. I denne enhed lærer du CAT-værktøjer, oversættelseshukommelsen (TM) i hjertet af oversættelse, hvordan de arbejder sammen med maskinoversættelse og LLM, og hvordan du bruger dette økosystem effektivt og sikkert. Målet er at blive en bruger af oversættelsesteknologi, der styrer et helt projekt, ikke individuelle sætninger, på en konsekvent, hurtig og sporbar måde.

Grundlæggende begreber

CAT-værktøj (Computer-Assisted Translation) er professionel software (såsom Trados, memoQ, Phrase, MateCat), der organiserer oversættelsen sætning for sætning (segment) og forbinder oversættelseshukommelsen og termbasen. Viser kilde og mål side om side, fanger gentagelser, bevarer formatering.

TM (Translation Memory) er en database, der gemmer de kilde-målsætningspar, du tidligere har oversat. Når der kommer en ny sætning, hvis der er en lignende sætning i TM, foreslår agenten dig den. Nøglekonceptet her er fuzzy match: ligheden mellem den nye sætning og en sætning i TM (100% = nøjagtigt det samme, 85% = stort set ens). Høje matches fremskynder arbejdet, fordi du genbruger din tidligere oversættelse.

Et segment er den grundlæggende enhed for oversættelse - normalt en sætning. CAT-værktøjet opdeler teksten i segmenter og redigerer hver enkelt segmenter.

Vigtigheden af ​​TM: MT producerer rå udkast, men TM returnerer dine godkendte tidligere oversættelser af menneskelig kvalitet. De to er forskellige: MT er en forudsigelse, TM er en hukommelse.

Tip: Forveksle ikke TM og MT. Et 100 % TM-match (din tidligere godkendte oversættelse) er generelt pålideligt; MT-anbefaling skal altid verificeres. CAT-værktøjer viser de to med forskellige farver/etiketter; altid se denne forskel.

Integration af MT og LLM i CAT

Moderne CAT-værktøjer kalder MT-motorer og i stigende grad LLM'er internt: hvis der ikke er nogen match i TM'en, returnerer agenten automatisk en MT-anbefaling for segmentet; du efterredigerer det (dvs. MTPE-flows i CAT). Seneste generationsværktøjer integrerer også LLM: du kan udføre operationer som "omskriv dette segment med denne tone", "korriger dette udtryk til termbase" osv. i værktøjet.

Fordel ved denne integration: TM, termbase, MT og LLM er kombineret i én skærm; For hver sætning etableres flowet "se på TM først, ellers foreslå MT, term QA automatisk". Ulemper og forsigtighed: hvor bliver dataene af? Cloud-baseret MT/LLM-integration kan sende tekst til eksterne servere; I fortroligt arbejde kan dette være et kontraktbrud. Sørg for at vide, hvilken motor køretøjet er tilsluttet og med hvilken datapolitik.

Fodring og sletning af oversættelseshukommelse

Værdien af TM er lige så meget som kvaliteten af oversættelserne i den. Skrald ind, skrald ud. To discipliner:

  1. Bare skriv den certificerede oversættelse til TM. Hvis du gemmer det rå MT-output til TM uden at validere det, vil det vende tilbage til dine fremtidige job som dårlig "hukommelse".
  2. Udfør TM-vedligeholdelse. Over tid ændres vilkårene, og der kommer fejl. Rengør TM jævnligt, ret slidte/forkerte par. I dette arbejde bruger jeg LLM til at spørge "er der nogen uoverensstemmelser/term bias i disse TM-par?" Du kan bruge den som revisor.
Forsigtig: Brug af en kundes TM i en anden kundes virksomhed er både et brud på fortroligheden og en risiko for termforvirring. TM'er holdes adskilt på kunde-/projektbasis. En blandet "alt-TM" ødelægger både fortrolighed og kvalitet.

tre minisager

Case 1 - TM fløj gentagelserne. En producent fik oversat en produktfamilie, hvor 70 % af dens manual forblev den samme år efter år. Takket være TM kom 100 % og høje fuzzy matches automatisk i hver ny version; Kun ~9.000 ord af de 30.000 ord var egentlige nyoversættelser. Tid og omkostninger blev reduceret med en tredjedel.

Tilfælde 2 — Dirty TM udbredte fejlen. Et hold havde gemt det rå MT-output i TM uden verifikation. Et år senere kom den samme fejloversættelse tilbage igen og igen og virkede "pålidelig" som et 100% match; Fejlen var spredt på 14 forskellige dokumenter. Holdet indførte en "certificeret oversættelse til kun TM"-regel og en oprydningstur.

Sag 3 — Fortrolighed lækket i integration. En oversætter udførte fortroligt arbejde i et CAT-projekt, der automatisk blev forbundet til cloud MT; Teksten gik til en ekstern motor, hvis datapolitik er uklar. Når først det blev bemærket, blev MT-integration til hemmelige projekter slået fra, og kun virksomhedsmotorer, der "ikke gemmer/træner data" blev brugt.

Fire kopierbare skabeloner

1) Fuzzy match-evaluering (til LLM):

Nedenfor er den nye kildesætning, den lignende sætning i TM og dens godkendte oversættelse. Fortæl mig præcis, hvad jeg skal ændre for at tilpasse TM-oversættelsen til den nye sætning; Foreslå ikke unødvendige ændringer. Vis forskellen i betydning tydeligt. Ny kilde: [...] | TM-kilde: [...] | TM-oversættelse: [...]

2) TM-konsistenstjek:

Nedenfor er kilde-mål-parrene fra TM. Marker uoverensstemmelser og termafvigelser, hvor de samme eller meget lignende kildesætninger er oversat FORSKELLIGE. Bare angiv problemerne. Par: [...]

3) Omskrivning af segmenttoner (LLM i CAT):

Lav følgende målsegment [ønsket tone] UDEN at ÆNDRE betydningen. Overhold listen over vilkår: [...]. Behold numre og navne. Eksporter kun det omskrevne segment. Segment: [...]

4) Forhåndskontrol af fortrolighed/integration:

Jeg vil bruge MT/LLM integration i et CAT projekt. Jeg vil beskrive typen af ​​tekst i dette projekt; Fortæl mig, om det er passende at sende denne tekst til en cloud-baseret ekstern motor, hvilke spørgsmål (dataopbevaring, træning, placering) jeg skal stille udbyderen.Teksttype/privatlivsstatus: [...]

Svag prompt / Stærk prompt

Svag: "Brug oversættelsen i TM." (Det er uklart, hvilken matchrate og hvad der skal tilpasses; blind kopiering introducerer fejl.)

Stærk: "Denne nye sætning matcher sætningen i TM 90 % af tiden. Byg på TM-oversættelsen, men afspejle denne forskel: kilden har 'årlig' i stedet for 'månedlig', så den skal være 'årlig' i stedet for 'månedlig'. Ændre ikke andet."

Forskel: stærk prompt udpeger matchforskellen; Det forhindrer "at efterlade den gamle oversættelse som den er", hvilket er den mest almindelige fejl ved fuzzy matching.

Tabel over CAT-økosystemkomponenter

komponent

Hvad gør

forhold til AI

TM (oversættelseshukommelse)

Returnerer godkendte tidligere oversættelser

Pålidelig; går forud for MT

Termbase

Sikrer terminskonsistens

Det gives som en prompt til LLM

MT anbefaling

Rå skitse i tomt segment

Skal efterredigeres

LLM integration

Tone/term/omskrivning

Kontrolleret, opmærksomhed på privatlivets fred

QA modul

Scanner nummer/term/tag fejl

automatisk kontrol

Almindelige fejl

  • Accepterer blindt den uklare kamp. Et 85% match kan skjule en 15% forskel i betydning.
  • Skriver rå MT output til TM. Dirty TM fører fejlen ind i fremtiden og spreder den.
  • Blanding af kunde/projekt TM'er. Fortrolighed og risiko for terminsforveksling.
  • Ikke at vide, hvor integrationsdataene går hen. Skjult tekst kan sive ud, uden at du er klar over det.
  • Glemmer TM/MT forskellen. MT er et skøn; TM er et minde. De to er ikke lige sikre.

Foroversættelse og justering

To avancerede CAT-funktioner accelererer arbejdsgangen yderligere i AI-æraen. Den første er præ-oversættelse: i begyndelsen af ​​projektet udfylder værktøjet automatisk alle segmenter med TM og MT; I stedet for en tom fil, starter du med en fil, hvor 100% matches er godkendt, fuzzy matches venter på at blive tilpasset, og tomme er MT-kladder. Dette ændrer jobbet fra "at skrive fra bunden" til "gennemgang og redigering" - men du skal evaluere hvert segment i stedet for blindt at godkende præ-oversættelsen.

Den anden er justering: Hvis du har et kilde-måldokumentpar, der er blevet oversat før, men ikke er gået ind i TM, matcher justeringsværktøjet dem segment for segment og konverterer dem til TM. Dine tidligere oversættelser tilføjes således til "hukommelsen". Forsigtig ved justering: automatisk matchning er ikke altid korrekt; én segmentglidning forstyrrer hele justeringen. Gennemgang af justerede par før TMing forhindrer risikoen for snavset TM i første omgang. Disse to funktioner gør dine nuværende aktiver (tidligere oversættelser) til investeringer i fremtidige virksomheder.

Sammenfattende

CAT værktøjer; Den kombinerer oversættelseshukommelse, termbase, maskinoversættelse og LLM i en enkelt produktionslinje. TM er en hukommelse, der henter dine godkendte tidligere oversættelser og giver stor hastighed i gentagne opgaver; MT er en forudsigelse, der altid skal verificeres. Den kyndige bruger tilpasser omhyggeligt forskellen i fuzzy matches, skriver kun godkendte oversættelser til TM'en, holder kunde TM'er adskilt og beskytter privatlivets fred ved at vide, hvor dataene går hen i integrationen.

Ansøgningsopgave

Opsæt et lille projekt i et CAT-værktøj (en gratis online CAT virker også): tilføj en termbase og en tom TM. Oversæt en tekst på 10 sætninger, gem de godkendte oversættelser til TM. Oversæt derefter en anden tekst, der ligner den første tekst, og tilpas de fuzzy matches returneret af TM med "fuzzy match evaluation" skabelonen; Bemærk, hvor mange sætninger du ville lave en fejl, hvis du blindt accepterede TM.

tjekliste

  • [ ] Jeg koblede TM og termbase til projektet.
  • [ ] Jeg brugte forskellen i fuzzy matches adaptivt i stedet for blindt.
  • [ ] Jeg skrev kun til TM den bekræftede oversættelse, som jeg har bekræftet.
  • [ ] Jeg holdt kunde/projekt TM'er adskilt.
  • [ ] Jeg tjekkede, hvor dataene går hen i MT/LLM-integrationen.