Unité 5 / 11

Intégration de l'IA avec les outils de TAO et la mémoire de traduction (TM)

Gains :

  • Comprendre les concepts de mémoire de traduction (TM), de correspondances floues et de segments, et être capable d'utiliser les différences entre les correspondances floues en les adaptant plutôt qu'aveuglément.
  • Capacité à appliquer la discipline consistant à rédiger uniquement des traductions approuvées dans la MT, à séparer les MT des clients et à effectuer la maintenance des MT
  • Possibilité de protéger la confidentialité en contrôlant où vont les données dans l'intégration MT/LLM au sein de CAT

La traduction professionnelle est le plus souvent effectuée dans un outil de TAO et non dans un éditeur de texte brut. Dans cette unité, vous apprendrez les outils de TAO, la mémoire de traduction (MT) au cœur de la traduction, comment ils fonctionnent avec la traduction automatique et le LLM, et comment utiliser cet écosystème de manière efficace et sûre. L'objectif est de devenir un utilisateur de technologie de traduction qui gère un projet dans son ensemble, et non des phrases individuelles, de manière cohérente, rapide et traçable.

Notions de base

L'outil de TAO (Traduction Assistée par Ordinateur) est un logiciel professionnel (tel que Trados, memoQ, Phrase, MateCat) qui organise la traduction phrase par phrase (segment) et connecte la mémoire de traduction et la base terminologique. Affiche la source et la cible côte à côte, capture les répétitions, préserve le formatage.

TM (Translation Memory) est une base de données qui stocke les paires de phrases source-cible que vous avez précédemment traduites. Lorsqu'une nouvelle phrase arrive, s'il existe une phrase similaire dans TM, l'agent vous la propose. Le concept clé ici est la correspondance floue : la similarité de la nouvelle phrase avec une phrase de la MT (100 % = exactement la même, 85 % = largement similaire). Les correspondances élevées accélèrent le travail car vous réutilisez votre traduction précédente.

Un segment est l'unité de base de la traduction, généralement une phrase. L'outil CAT divise le texte en segments et les modifie séparément.

Importance de la MT : la MT produit des brouillons bruts, mais la MT renvoie vos traductions antérieures approuvées et de qualité humaine. Les deux sont différents : MT est une prédiction, TM est un souvenir.

Astuce : Ne confondez pas TM et MT. Une correspondance à 100 % avec la MT (votre traduction préalablement approuvée) est généralement fiable ; La recommandation MT doit toujours être vérifiée. Les outils de TAO affichent les deux avec des couleurs/étiquettes différentes ; je vois toujours cette différence.

Intégration de MT et LLM dans CAT

Les outils de TAO modernes appellent des moteurs MT et de plus en plus des LLM en interne : s'il n'y a pas de correspondance dans la MT, l'agent renvoie automatiquement une recommandation MT pour le segment ; vous le post-éditez (c'est-à-dire les flux MTPE dans CAT). Les outils de dernière génération intègrent également LLM : vous pouvez faire des opérations comme « réécrire ce segment avec ce ton », « corriger ce terme dans la base terminologique » etc. dans l'outil.

Avantage de cette intégration : TM, base terminologique, MT et LLM sont combinés sur un seul écran ; Pour chaque phrase, le flux "regardez d'abord TM, sinon suggérez MT, terme QA automatiquement" est établi. Inconvénient et prudence : où vont les données ? L'intégration MT/LLM basée sur le cloud peut envoyer du texte à des serveurs externes ; Dans le cadre d'un travail confidentiel, cela peut constituer une rupture de contrat. Assurez-vous de savoir à quel moteur le véhicule est connecté et avec quelle politique de données.

Alimenter et effacer la mémoire de traduction

La valeur de la MT est aussi grande que la qualité des traductions qu'elle contient. Déchets entrants, déchets sortants. Deux disciplines :

  1. Écrivez simplement la traduction certifiée sur TM. Si vous enregistrez la sortie MT brute dans TM sans la valider, elle reviendra dans vos futurs travaux sous forme de mauvaise "mémoire".
  2. Effectuer la maintenance de la MT. Au fil du temps, les termes changent et des erreurs apparaissent. Nettoyer périodiquement le TM, corriger les paires usées/incorrectes. Dans ce travail, j'utilise le LLM pour demander « y a-t-il des incohérences/biais de termes dans ces paires de MT ? » Vous pouvez l'utiliser comme auditeur.
Attention : Utiliser la MT d'un client dans l'activité d'un autre client constitue à la fois une violation de la confidentialité et un risque de confusion des termes. Les MT sont conservées séparément sur une base client/projet. Une MT mixte « tout » détruit à la fois la confidentialité et la qualité.

trois mini-cases

Cas 1 — TM a effectué les rediffusions. Un fabricant faisait traduire une famille de produits dont 70 % de son manuel restait le même année après année. Grâce à TM, les correspondances 100 % et hautement floues sont arrivées automatiquement dans chaque nouvelle version ; Seulement environ 9 000 mots sur les 30 000 mots du travail étaient de véritables nouvelles traductions. Le temps et les coûts ont été réduits d'un tiers.

Cas 2 — Dirty TM a propagé l'erreur. Une équipe avait enregistré la sortie brute de MT dans TM sans vérification. Un an plus tard, la même erreur de traduction revenait encore et encore, paraissant « fiable » comme une correspondance à 100 % ; L'erreur s'est répandue sur 14 documents différents. L'équipe a institué une règle de « traduction certifiée vers TM uniquement » et une tournée de nettoyage.

Cas 3 — La confidentialité a été divulguée lors de l'intégration. Un traducteur a effectué un travail confidentiel dans un projet de TAO automatiquement connecté au cloud MT ; Le texte est allé vers un moteur externe dont la politique en matière de données n'est pas claire. Une fois remarquée, l'intégration MT pour les projets secrets a été désactivée et seuls les moteurs d'entreprise qui « ne stockent/n'entraînent pas de données » ont été utilisés.

Quatre modèles copiables

1) Évaluation de la correspondance floue (vers LLM) :

Vous trouverez ci-dessous la nouvelle phrase source, la phrase similaire dans TM et sa traduction approuvée. Dites-moi exactement ce que je dois changer pour adapter la traduction de la MT à la nouvelle phrase ; Ne suggérez pas de changements inutiles. Montrez clairement la différence de sens. Nouvelle source : [...] | Source MT : [...] | Traduction de MT : [...]

2) Contrôle de cohérence TM :

Vous trouverez ci-dessous les paires source-cible de TM. Marquez les incohérences et les écarts de termes lorsque des phrases sources identiques ou très similaires sont traduites DIFFÉREMMENT. Énumérez simplement les problèmes.Couples : [...]

3) Réécriture de tonalité de segment (LLM en CAT) :

Créez le segment cible suivant [ton souhaité] SANS CHANGER le sens. Respecter la liste des termes : [...]. Conservez les numéros et les noms. Exportez uniquement le segment réécrit. Segment : [...]

4) Pré-vérification de confidentialité/intégration :

J'utiliserai l'intégration MT/LLM dans un projet CAT. Je décrirai le type de texte dans ce projet ; Dites-moi s'il est approprié d'envoyer ce texte à un moteur externe basé sur le cloud, quelles questions (conservation des données, formation, localisation) je dois poser au fournisseur.Type de texte/statut de confidentialité : [...]

Invite faible/Invite forte

Faible : "Utilisez la traduction dans la MT." (On ne sait pas exactement quel taux de correspondance et quoi adapter ; la copie aveugle introduit des erreurs.)

Strong : "Cette nouvelle phrase correspond à la phrase de la MT 90 % du temps. S'appuie sur la traduction de la MT mais reflète cette différence : la source contient "annuel" au lieu de "mensuel", elle devrait donc être "annuelle" au lieu de "mensuelle". Ne changez rien d'autre. "

Différence : une invite forte identifie la différence de correspondance ; Cela évite de « laisser l’ancienne traduction telle quelle », qui est l’erreur la plus courante de correspondance floue.

Tableau des composants de l'écosystème CAT

composant

Qu'est-ce que

relation avec l'IA

MT (mémoire de traduction)

Renvoie les traductions antérieures approuvées

Fiable ; précède MT

Base terminologique

Garantit la cohérence des termes

Il est donné comme invite à LLM

Recommandation MT

Esquisse brute dans un segment vide

Doit être post-édité

Intégration LLM

Ton/terme/réécriture

Contrôlé, attention à la vie privée

Module d'assurance qualité

Erreur de numéro/terme/étiquette d'analyse

contrôle automatique

Erreurs courantes

  • Accepter aveuglément la correspondance floue. Une correspondance de 85 % peut cacher une différence de signification de 15 %.
  • Écriture de la sortie MT brute dans TM. Dirty TM transporte l'erreur dans le futur et la fait proliférer.
  • Mixage des MT client/projet. Confidentialité et risque de confusion des termes.
  • Ne pas savoir où vont les données d’intégration. Du texte masqué peut s'échapper sans que vous vous en rendiez compte.
  • Oublier la différence TM/MT. MT est une estimation ; La MT est un souvenir. Les deux ne sont pas également en sécurité.

Pré-traduction et alignement

Deux fonctions CAT avancées accélèrent encore le flux de travail à l'ère de l'IA. La première est la pré-traduction : au début du projet, l'outil remplit automatiquement tous les segments avec TM et MT ; Au lieu d'un fichier vide, vous commencez avec un fichier dans lequel 100 % des correspondances sont approuvées, des correspondances floues attendent d'être adaptées et les vides sont des brouillons MT. Cela fait passer le travail de « écrire à partir de zéro » à « réviser et éditer » – mais vous devez évaluer chaque segment plutôt que d'approuver aveuglément la pré-traduction.

La seconde est l'alignement : si vous disposez d'une paire de documents source-cible qui a déjà été traduite mais qui n'est pas entrée dans la MT, l'outil d'alignement les fait correspondre segment par segment et les convertit en MT. Ainsi, vos traductions passées sont ajoutées à la « mémoire ». Attention à l'alignement : la correspondance automatique n'est pas toujours correcte ; le glissement d'un segment perturbe tout l'alignement. L'examen des paires alignées avant la TMing évite le risque de TM sale en premier lieu. Ces deux fonctions transforment vos actifs actuels (traductions passées) en investissements dans des activités futures.

En résumé

Outils de TAO ; Il combine mémoire de traduction, base terminologique, traduction automatique et LLM en une seule ligne de production. TM est une mémoire qui récupère vos traductions antérieures approuvées et offre une grande rapidité dans les tâches répétitives ; MT est une prédiction qui doit toujours être vérifiée. L'utilisateur averti adapte soigneusement la différence dans les correspondances floues, écrit uniquement les traductions approuvées dans la MT, sépare les MT des clients et protège la confidentialité en sachant où vont les données dans l'intégration.

Tâche de candidature

Créez un petit projet dans un outil de TAO (un TAO en ligne gratuit fonctionne également) : ajoutez une base terminologique et une MT vide. Traduisez un texte de 10 phrases, enregistrez les traductions approuvées dans TM. Traduisez ensuite un deuxième texte très similaire au premier texte et adaptez les correspondances floues renvoyées par TM avec le modèle « évaluation des correspondances floues » ; Notez combien de phrases vous feriez une erreur si vous acceptiez aveuglément la MT.

liste de contrôle

  • [ ] J'ai connecté la MT et la base terminologique au projet.
  • [ ] J'ai utilisé la différence dans les correspondances floues de manière adaptative plutôt qu'aveuglément.
  • [ ] J'ai seulement écrit à TM la traduction certifiée que j'ai vérifiée.
  • [ ] J'ai séparé les MT client/projet.
  • [ ] J'ai vérifié où vont les données dans l'intégration MT/LLM.