Gewinne:
- Die Konzepte von Translation Memory (TM), Fuzzy-Matches und Segmenten verstehen und in der Lage sein, die Unterschiede in Fuzzy-Matches zu nutzen, indem man sie anpasst, statt sie blindlings anzupassen.
- Fähigkeit, die Disziplin anzuwenden, nur genehmigte Übersetzungen in TM zu schreiben, Kunden-TMs getrennt zu halten und TM-Wartung durchzuführen
- Möglichkeit zum Schutz der Privatsphäre durch Kontrolle, wohin Daten bei der MT/LLM-Integration in CAT gelangen
Professionelle Übersetzungen werden meist mit einem CAT-Tool und nicht mit einem einfachen Texteditor erstellt. In dieser Einheit lernen Sie CAT-Tools kennen, das Translation Memory (TM) als Herzstück der Übersetzung, wie sie mit maschineller Übersetzung und LLM zusammenarbeiten und wie Sie dieses Ökosystem effizient und sicher nutzen. Ziel ist es, ein Anwender von Übersetzungstechnologie zu werden, der ein gesamtes Projekt und nicht einzelne Sätze konsistent, schnell und nachvollziehbar verwaltet.
Grundlegende Konzepte
CAT-Tool (Computer-Assisted Translation) ist eine professionelle Software (wie Trados, memoQ, Phrase, MateCat), die die Übersetzung Satz für Satz (Segment) organisiert und das Übersetzungsgedächtnis und die Terminologiedatenbank verbindet. Zeigt Quelle und Ziel nebeneinander an, fängt Wiederholungen ab und behält die Formatierung bei.
TM (Translation Memory) ist eine Datenbank, die die zuvor übersetzten Quell-Ziel-Satzpaare speichert. Wenn ein neuer Satz eintrifft und es in TM einen ähnlichen Satz gibt, schlägt Ihnen der Agent diesen vor. Das Schlüsselkonzept hierbei ist der Fuzzy-Match: die Ähnlichkeit des neuen Satzes mit einem Satz im TM (100 % = genau gleich, 85 % = weitgehend ähnlich). Hohe Übereinstimmungen beschleunigen die Arbeit, da Sie Ihre vorherige Übersetzung wiederverwenden.
Ein Segment ist die Grundeinheit der Übersetzung – normalerweise ein Satz. Das CAT-Tool unterteilt den Text in Segmente und bearbeitet diese einzeln.
Bedeutung von TM: MT erstellt Rohentwürfe, TM gibt jedoch Ihre genehmigten früheren Übersetzungen in menschlicher Qualität zurück. Die beiden sind unterschiedlich: MT ist eine Vorhersage, TM ist eine Erinnerung.
Tipp: Verwechseln Sie TM und MT nicht. Eine 100-prozentige TM-Übereinstimmung (Ihre zuvor genehmigte Übersetzung) ist im Allgemeinen zuverlässig; Die MT-Empfehlung sollte immer überprüft werden. CAT-Tools zeigen die beiden mit unterschiedlichen Farben/Beschriftungen an; sehe immer diesen Unterschied.
Integration von MT und LLM in CAT
Moderne CAT-Tools rufen MT-Engines und zunehmend auch LLMs intern auf: Wenn es keine Übereinstimmung im TM gibt, gibt der Agent automatisch eine MT-Empfehlung für das Segment zurück; Sie bearbeiten es nachträglich (d. h. MTPE fließt in CAT). Tools der neuesten Generation integrieren auch LLM: Sie können im Tool Vorgänge wie „Dieses Segment mit diesem Ton umschreiben“, „Diesen Begriff in Termbank korrigieren“ usw. ausführen.
Vorteil dieser Integration: TM, Termbank, MT und LLM werden in einer Maske zusammengefasst; Für jeden Satz wird der Ablauf „Zuerst TM ansehen, andernfalls MT vorschlagen, Begriff QA automatisch“ eingerichtet. Nachteil und Vorsicht: Wohin gehen die Daten? Die cloudbasierte MT/LLM-Integration kann Text an externe Server senden; Bei vertraulichen Arbeiten kann dies einen Vertragsbruch darstellen. Stellen Sie sicher, dass Sie wissen, mit welchem Motor das Fahrzeug verbunden ist und mit welcher Datenrichtlinie.
Einspeisen und Löschen des Übersetzungsspeichers
Der Wert von TM liegt ebenso in der Qualität der darin enthaltenen Übersetzungen. Müll rein, Müll raus. Zwei Disziplinen:
- Schreiben Sie einfach die beglaubigte Übersetzung an TM. Wenn Sie die MT-Rohausgabe ohne Validierung in TM speichern, wird sie als fehlerhafter „Speicher“ an Ihre zukünftigen Jobs zurückgegeben.
- Führen Sie eine TM-Wartung durch. Im Laufe der Zeit ändern sich Begriffe und es treten Fehler auf. Reinigen Sie das TM regelmäßig und korrigieren Sie abgenutzte/falsche Paare. In dieser Arbeit verwende ich das LLM, um zu fragen: „Gibt es Inkonsistenzen/Begriffsverzerrungen in diesen TM-Paaren?“ Sie können es als Auditor verwenden.
Achtung: Die Verwendung des TM eines Kunden im Unternehmen eines anderen Kunden stellt sowohl einen Verstoß gegen die Vertraulichkeit als auch die Gefahr einer Begriffsverwechslung dar. TMs werden auf Kunden-/Projektbasis getrennt gehalten. Ein gemischtes „Alles-TM“ zerstört sowohl Vertraulichkeit als auch Qualität.
drei Mini-Koffer
Fall 1 – TM flog die Wiederholungen. Ein Hersteller ließ eine Produktfamilie übersetzen, wobei 70 % seines Handbuchs Jahr für Jahr gleich blieben. Dank TM kam es in jeder neuen Version automatisch zu 100 % und zu hohen Fuzzy-Matches; Nur etwa 9.000 Wörter des 30.000 Wörter umfassenden Werkes waren echte Neuübersetzungen. Zeit und Kosten konnten um ein Drittel reduziert werden.
Fall 2 – Dirty TM hat den Fehler weitergegeben. Ein Team hatte die rohe MT-Ausgabe ohne Überprüfung in TM gespeichert. Ein Jahr später kam die gleiche Fehlübersetzung immer wieder vor und schien als 100-prozentige Übereinstimmung „zuverlässig“ zu sein; Der Fehler verteilte sich auf 14 verschiedene Dokumente. Das Team führte eine „beglaubigte Übersetzung nur in TM“-Regel und eine Aufräumtour ein.
Fall 3 – Vertraulichkeitsverlust bei der Integration. Ein Übersetzer führte vertrauliche Arbeiten in einem CAT-Projekt durch, das automatisch mit Cloud MT verbunden war; Der Text ging an eine externe Engine, deren Datenrichtlinie unklar ist. Sobald dies auffiel, wurde die MT-Integration für geheime Projekte deaktiviert und es wurden nur Enterprise-Engines verwendet, die „keine Daten speichern/trainieren“.
Vier kopierbare Vorlagen
1) Fuzzy-Match-Auswertung (zu LLM):
Nachfolgend finden Sie den neuen Quellsatz, den ähnlichen Satz in TM und seine genehmigte Übersetzung. Sagen Sie mir genau, was ich ändern muss, um die TM-Übersetzung an den neuen Satz anzupassen; Schlagen Sie keine unnötigen Änderungen vor. Zeigen Sie den Bedeutungsunterschied deutlich auf. Neue Quelle: [...] | TM-Quelle: [...] | TM-Übersetzung: [...]
2) TM-Konsistenzprüfung:
Nachfolgend sind die Quelle-Ziel-Paare von TM aufgeführt. Markieren Sie Inkonsistenzen und Begriffsabweichungen, wenn gleiche oder sehr ähnliche Ausgangssätze UNTERSCHIEDLICH übersetzt werden. Listen Sie einfach die Probleme auf.Paare: [...]
3) Umschreiben des Segmenttons (LLM in CAT):
Erstellen Sie das folgende Zielsegment [gewünschter Ton], OHNE die Bedeutung zu VERÄNDERN. Beachten Sie die Liste der Begriffe: [...]. Behalten Sie Nummern und Namen. Exportieren Sie nur das neu geschriebene Segment. Segment: [...]
4) Datenschutz-/Integrationsvorprüfung:
Ich werde die MT/LLM-Integration in einem CAT-Projekt verwenden. Ich werde die Art des Textes in diesem Projekt beschreiben; Sagen Sie mir, ob es angemessen ist, diesen Text an eine cloudbasierte externe Engine zu senden, welche Fragen (Datenspeicherung, Schulung, Standort) ich dem Anbieter stellen sollte.Texttyp/Datenschutzstatus: [...]
Schwache Eingabeaufforderung / Starke Eingabeaufforderung
Schwach: „Verwenden Sie die Übersetzung in TM.“ (Es ist unklar, welche Übereinstimmungsrate vorliegt und was angepasst werden muss; blindes Kopieren führt zu Fehlern.)
Strong: „Dieser neue Satz stimmt in 90 % der Fälle mit dem Satz im TM überein. Bauen Sie auf der TM-Übersetzung auf, berücksichtigen Sie aber diesen Unterschied: Die Quelle hat „jährlich“ statt „monatlich“, also sollte es „jährlich“ statt „monatlich“ lauten. Ändern Sie sonst nichts.“
Unterschied: Eine starke Eingabeaufforderung zeigt den Übereinstimmungsunterschied genau an. Dadurch wird verhindert, dass die alte Übersetzung unverändert bleibt, was der häufigste Fehler beim Fuzzy-Matching ist.
Tabelle mit Komponenten des CAT-Ökosystems
Komponente
Was bedeutet
Beziehung zur KI
TM (Translation Memory)
Gibt genehmigte frühere Übersetzungen zurück
Zuverlässig; steht vor MT
Terminologiedatenbank
Stellt die Konsistenz der Begriffe sicher
Es wird LLM als Aufforderung gegeben
MT-Empfehlung
Rohskizze in leeres Segment
Muss nachbearbeitet werden
LLM-Integration
Ton/Begriff/Umschreibung
Kontrolliert, Beachtung der Privatsphäre
QA-Modul
Scannt Nummern-/Begriffs-/Tag-Fehler
automatische Steuerung
Häufige Fehler
- Blindes Akzeptieren des Fuzzy-Matches. Eine Übereinstimmung von 85 % kann einen Bedeutungsunterschied von 15 % verbergen.
- Rohe MT-Ausgabe in TM schreiben. Dirty TM trägt den Fehler in die Zukunft und verbreitet ihn.
- Mischen von Kunden-/Projekt-TMs. Vertraulichkeit und Gefahr der Begriffsverwechslung.
- Ich weiß nicht, wohin die Integrationsdaten gehen. Versteckter Text kann nach außen dringen, ohne dass Sie sich dessen bewusst sind.
- Den TM/MT-Unterschied vergessen. MT ist eine Schätzung; TM ist eine Erinnerung. Die beiden sind nicht gleichermaßen sicher.
Vorübersetzung und Ausrichtung
Zwei fortschrittliche CAT-Funktionen beschleunigen den Arbeitsablauf im KI-Zeitalter zusätzlich. Die erste ist die Vorübersetzung: Zu Beginn des Projekts füllt das Tool automatisch alle Segmente mit TM und MT; Anstelle einer leeren Datei beginnen Sie mit einer Datei, in der 100 %-Matches genehmigt sind, Fuzzy-Matches auf die Anpassung warten und leere MT-Entwürfe sind. Dadurch ändert sich der Job von „von Grund auf neu schreiben“ zu „Überprüfen und Bearbeiten“ – Sie müssen jedoch jedes Segment bewerten, anstatt die Vorübersetzung blind zu genehmigen.
Die zweite Möglichkeit ist die Ausrichtung: Wenn Sie über ein Quell-Ziel-Dokumentpaar verfügen, das bereits übersetzt, aber nicht in das TM eingegeben wurde, ordnet das Ausrichtungstool sie Segment für Segment zu und wandelt sie in TM um. Somit werden Ihre bisherigen Übersetzungen dem „Speicher“ hinzugefügt. Vorsicht bei der Ausrichtung: Die automatische Zuordnung ist nicht immer korrekt; Ein Verrutschen eines Segments stört die gesamte Ausrichtung. Durch die Überprüfung ausgerichteter Paare vor dem TMing wird das Risiko eines Dirty TM von vornherein verhindert. Diese beiden Funktionen verwandeln Ihr aktuelles Vermögen (vergangene Übersetzungen) in Investitionen in zukünftige Unternehmen.
Zusammenfassend
CAT-Tools; Es vereint Translation Memory, Terminologiedatenbank, maschinelle Übersetzung und LLM in einer einzigen Produktionslinie. TM ist ein Speicher, der Ihre genehmigten früheren Übersetzungen abruft und für eine hohe Geschwindigkeit bei sich wiederholenden Aufgaben sorgt; MT ist eine Vorhersage, die immer überprüft werden muss. Der versierte Benutzer passt den Unterschied bei Fuzzy-Matches sorgfältig an, schreibt nur genehmigte Übersetzungen in das TM, hält Kunden-TMs getrennt und schützt die Privatsphäre, indem er weiß, wohin die Daten in der Integration gehen.
Anwendungsaufgabe
Richten Sie ein kleines Projekt in einem CAT-Tool ein (ein kostenloses Online-CAT funktioniert auch): Fügen Sie eine Terminologiedatenbank und ein leeres TM hinzu. Übersetzen Sie einen Text mit 10 Sätzen und speichern Sie die genehmigten Übersetzungen in TM. Übersetzen Sie dann einen zweiten Text, der dem ersten Text sehr ähnlich ist, und passen Sie die von TM zurückgegebenen Fuzzy-Matches mit der Vorlage „Fuzzy-Match-Auswertung“ an; Beachten Sie, wie viele Sätze Sie falsch machen würden, wenn Sie TM blind akzeptieren würden.
Checkliste
- [ ] Ich habe TM und Terminologiedatenbank mit dem Projekt verbunden.
- [ ] Ich habe den Unterschied bei Fuzzy-Matches adaptiv und nicht blind genutzt.
- [ ] Ich habe TM nur die beglaubigte Übersetzung geschrieben, die ich überprüft habe.
- [ ] Ich habe Kunden-/Projekt-TMs getrennt gehalten.
- [ ] Ich habe überprüft, wohin die Daten in der MT/LLM-Integration gehen.