Eenheid 5 / 11

AI-integratie met CAT Tools en vertaalgeheugen (TM)

Winst:

  • De concepten van vertaalgeheugen (TM), fuzzy matches en segmenten begrijpen, en de verschillen in fuzzy matches kunnen gebruiken door ze aan te passen in plaats van blindelings.
  • Mogelijkheid om de discipline toe te passen om alleen goedgekeurde vertalingen op TM te schrijven, klant-TM's gescheiden te houden en TM-onderhoud uit te voeren
  • Mogelijkheid om privacy te beschermen door te bepalen waar gegevens naartoe gaan in MT/LLM-integratie binnen CAT

Professionele vertalingen worden meestal gedaan in een CAT-tool, niet in een gewone teksteditor. In deze unit leer je CAT-tools, het vertaalgeheugen (TM) dat de kern vormt van vertalingen, hoe ze samenwerken met machinevertaling en LLM, en hoe je dit ecosysteem efficiënt en veilig kunt gebruiken. Het doel is om een ​​gebruiker van vertaaltechnologie te worden die een heel project, en niet individuele zinnen, op een consistente, snelle en traceerbare manier beheert.

Basisconcepten

CAT-tool (Computer-Assisted Translation) is professionele software (zoals Trados, memoQ, Phrase, MateCat) die de vertaling zin voor zin (segment) organiseert en het vertaalgeheugen en de termenbank met elkaar verbindt. Toont bron en doel naast elkaar, vangt herhalingen op en behoudt de opmaak.

TM (Vertaalgeheugen) is een database waarin de bron-doelzinparen worden opgeslagen die u eerder hebt vertaald. Wanneer er een nieuwe zin binnenkomt en er een soortgelijke zin in TM staat, stelt de agent u deze voor. Het sleutelconcept hier is fuzzy match: de gelijkenis van de nieuwe zin met een zin in het TM (100% = exact hetzelfde, 85% = grotendeels vergelijkbaar). Hoge matches versnellen het werk omdat u uw eerdere vertaling hergebruikt.

Een segment is de basiseenheid van de vertaling, meestal een zin. De CAT-tool verdeelt de tekst in segmenten en bewerkt deze afzonderlijk.

Belang van TM: MT produceert ruwe concepten, maar TM retourneert uw goedgekeurde eerdere vertalingen van menselijke kwaliteit. De twee zijn verschillend: MT is een voorspelling, TM is een herinnering.

Tip: Verwar TM en MT niet. Een 100% TM-match (uw eerder goedgekeurde vertaling) is over het algemeen betrouwbaar; MT-aanbevelingen moeten altijd worden geverifieerd. CAT-tools tonen de twee met verschillende kleuren/labels; zie altijd dit verschil.

Integratie van MT en LLM in CAT

Moderne CAT-tools roepen MT-engines en steeds vaker LLM's intern aan: als er geen match is in het TM, retourneert de agent automatisch een MT-aanbeveling voor het segment; u bewerkt het achteraf (dat wil zeggen MTPE-stromen in CAT). De tools van de nieuwste generatie integreren ook LLM: u kunt in de tool bewerkingen uitvoeren zoals "herschrijf dit segment met deze toon", "corrigeer deze term naar de termbase" enz.

Voordeel van deze integratie: TM, termbase, MT en LLM worden gecombineerd in één scherm; Voor elke zin wordt de stroom "eerst naar TM kijken, anders MT voorstellen, term QA automatisch" ingesteld. Nadeel en voorzichtigheid: waar gaan de gegevens naartoe? Cloudgebaseerde MT/LLM-integratie kan tekst naar externe servers sturen; Bij vertrouwelijk werk kan dit contractbreuk zijn. Zorg ervoor dat u weet op welke motor het voertuig is aangesloten en met welk databeleid.

Het vertaalgeheugen voeden en wissen

De waarde van TM is net zoveel als de kwaliteit van de vertalingen erin. Vuilnis erin, afval eruit. Twee vakgebieden:

  1. Schrijf gewoon de beëdigde vertaling naar TM. Als u de onbewerkte MT-uitvoer in TM opslaat zonder deze te valideren, zal deze als slecht "geheugen" terugkeren naar uw toekomstige taken.
  2. Voer TM-onderhoud uit. Na verloop van tijd veranderen de termen en komen er fouten binnen. Reinig TM regelmatig, corrigeer versleten/onjuiste paren. In dit werk gebruik ik de LLM om te vragen: "Zijn er inconsistenties/termafwijkingen in deze TM-paren?" Je kunt het gebruiken als auditor.
Let op: het gebruik van het TM van een klant in het bedrijf van een andere klant is zowel een inbreuk op de vertrouwelijkheid als een risico op termverwarring. TM's worden op klant-/projectbasis gescheiden gehouden. Een gemengd "alles-TM" vernietigt zowel de vertrouwelijkheid als de kwaliteit.

drie minikoffers

Geval 1 – TM vloog de herhalingen. Een fabrikant liet een productfamilie vertalen waarbij 70% van de handleiding jaar na jaar hetzelfde bleef. Dankzij TM kwamen 100% en hoge fuzzy-matches automatisch in elke nieuwe versie; Slechts ~9.000 woorden van het 30.000 woorden tellende werk waren daadwerkelijke nieuwe vertalingen. Tijd en kosten werden met een derde verminderd.

Geval 2: Dirty TM verspreidde de fout. Eén team had de onbewerkte MT-uitvoer zonder verificatie in TM opgeslagen. Een jaar later kwam dezelfde verkeerde vertaling keer op keer terug en leek ‘betrouwbaar’ als een 100% match; De fout was verspreid over 14 verschillende documenten. Het team voerde een regel "gecertificeerde vertaling naar alleen TM" in en voerde een opruimrondleiding in.

Geval 3 — Vertrouwelijkheid lekte bij de integratie. Een vertaler deed vertrouwelijk werk in een CAT-project dat automatisch was gekoppeld aan cloud MT; De tekst ging naar een externe engine waarvan het databeleid onduidelijk is. Toen het eenmaal werd opgemerkt, werd de MT-integratie voor geheime projecten uitgeschakeld en werden alleen bedrijfsmotoren gebruikt die "geen gegevens opslaan/trainen".

Vier kopieerbare sjablonen

1) Fuzzy match-evaluatie (voor LLM):

Hieronder vindt u de nieuwe bronzin, de soortgelijke zin in TM en de goedgekeurde vertaling ervan. Vertel me precies wat ik moet veranderen om de TM-vertaling aan te passen aan de nieuwe zin; Stel geen onnodige wijzigingen voor. Laat het verschil in betekenis duidelijk zien. Nieuwe bron: [...] | TM-bron: [...] | TM-vertaling: [...]

2) TM-consistentiecontrole:

Hieronder staan de bron-doelparen van TM. Markeer inconsistenties en termafwijkingen waarbij dezelfde of zeer vergelijkbare bronzinnen ANDERS worden vertaald. Noem gewoon de problemen. Paren: [...]

3) Herschrijven van segmenttoon (LLM in CAT):

Maak het volgende doelsegment [gewenste toon] ZONDER de betekenis te veranderen. Houd u aan de lijst met termen: [...]. Bewaar nummers en namen. Exporteer alleen het herschreven segment. Segment: [...]

4) Voorafgaande controle van privacy/integratie:

Ik zal MT/LLM-integratie gebruiken in een CAT-project. Ik zal het type tekst in dit project beschrijven; Vertel mij of het gepast is om deze tekst naar een cloudgebaseerde externe engine te sturen, welke vragen (gegevensopslag, training, locatie) ik aan de provider moet stellen. Teksttype/privacystatus: [...]

Zwakke prompt/sterke prompt

Zwak: "Gebruik de vertaling in TM." (Het is onduidelijk welk matchpercentage en wat moet worden aangepast; blind kopiëren brengt fouten met zich mee.)

Strong: "Deze nieuwe zin komt 90% van de tijd overeen met de zin in TM. Bouw voort op de TM-vertaling, maar geef dit verschil weer: de bron heeft 'jaarlijks' in plaats van 'maandelijks', dus het zou 'jaarlijks' moeten zijn in plaats van 'maandelijks'. Verander verder niets."

Verschil: sterke prompt geeft het wedstrijdverschil aan; Het voorkomt dat "de oude vertaling ongewijzigd blijft", wat de meest voorkomende fout is bij fuzzy matching.

Tabel met CAT-ecosysteemcomponenten

bestanddeel

Wat doet

relatie met AI

TM (vertaalgeheugen)

Retourneert goedgekeurde eerdere vertalingen

Betrouwbaar; gaat vooraf aan MT

Termbasis

Zorgt voor termconsistentie

Het wordt als prompt aan LLM gegeven

MT-aanbeveling

Ruwe schets in leeg segment

Moet achteraf worden bewerkt

LLM-integratie

Toon/term/herschrijven

Gecontroleerd, aandacht voor privacy

QA-module

Scant nummer/term/tag-fout

automatische controle

Veel voorkomende fouten

  • Het blindelings accepteren van de vage match. Een match van 85% kan een betekenisverschil van 15% verbergen.
  • Ruwe MT-uitvoer naar TM schrijven. Dirty TM draagt ​​de fout mee naar de toekomst en verspreidt deze.
  • Mengen van klant-/project-TM's. Vertrouwelijkheid en risico op termverwarring.
  • Niet weten waar de integratiegegevens naartoe gaan. Verborgen tekst kan uitlekken zonder dat u zich daarvan bewust bent.
  • Het TM/MT-verschil vergeten. MT is een schatting; TM is een herinnering. De twee zijn niet even veilig.

Voorvertaling en uitlijning

Twee geavanceerde CAT-functies versnellen de workflow in het AI-tijdperk nog verder. De eerste is pre-vertaling: aan het begin van het project vult de tool automatisch alle segmenten met TM en MT; In plaats van een leeg bestand begin je met een bestand waarin 100% matches zijn goedgekeurd, fuzzy matches wachten om te worden aangepast en lege MT-concepten zijn. Dit verandert de taak van “vanaf het begin schrijven” naar “reviewen en redigeren” – maar u moet elk segment evalueren in plaats van de voorvertaling blindelings goed te keuren.

De tweede is uitlijning: als u een bron-doeldocumentpaar hebt dat al eerder is vertaald maar nog niet in het TM is ingevoerd, vergelijkt de uitlijningstool ze segment voor segment en converteert ze naar TM. Zo worden uw eerdere vertalingen toegevoegd aan het "geheugen". Let op bij het uitlijnen: automatisch matchen is niet altijd correct; één segmentverschuiving verstoort de gehele uitlijning. Het beoordelen van uitgelijnde paren vóór TMing voorkomt in de eerste plaats het risico van vuile TM. Deze twee functies zetten uw huidige bezittingen (vertalingen uit het verleden) om in investeringen in toekomstige bedrijven.

Samengevat

CAT-tools; Het combineert vertaalgeheugen, termenbank, automatische vertaling en LLM in één enkele productielijn. TM is een geheugen dat uw goedgekeurde eerdere vertalingen ophaalt en grote snelheid biedt bij repetitieve taken; MT is een voorspelling die altijd geverifieerd moet worden. De slimme gebruiker past het verschil zorgvuldig aan in fuzzy matches, schrijft alleen goedgekeurde vertalingen naar het TM, houdt klant-TM's gescheiden en beschermt de privacy door te weten waar de gegevens naartoe gaan in de integratie.

Applicatie taak

Zet een klein project op in een CAT-tool (een gratis online CAT werkt ook): voeg een termenbank en een leeg TM toe. Vertaal een tekst van 10 zinnen en sla de goedgekeurde vertalingen op in TM. Vertaal vervolgens een tweede tekst die erg lijkt op de eerste tekst en pas de fuzzy matches terug die door TM worden geretourneerd met het sjabloon "fuzzy match evaluatie"; Merk op hoeveel zinnen je fout zou maken als je TM blindelings zou accepteren.

controlelijst

  • [ ] Ik heb TM en termbase aan het project gekoppeld.
  • [ ] Ik heb het verschil in fuzzy matches adaptief gebruikt in plaats van blindelings.
  • [ ] Ik heb alleen de beëdigde vertaling die ik heb geverifieerd naar TM geschreven.
  • [ ] Ik heb klant-/project-TM's gescheiden gehouden.
  • [ ] Ik heb gecontroleerd waar de gegevens naartoe gaan in de MT/LLM-integratie.