Unidad 5 / 11

Integración de IA con herramientas CAT y memoria de traducción (TM)

Ganancias:

  • Comprender los conceptos de memoria de traducción (TM), coincidencias aproximadas y segmentos, y ser capaz de utilizar las diferencias en las coincidencias aproximadas adaptándolas en lugar de hacerlo a ciegas.
  • Capacidad para aplicar la disciplina de escribir solo traducciones aprobadas para TM, mantener las TM de los clientes separadas y realizar el mantenimiento de las TM.
  • Capacidad de proteger la privacidad controlando dónde van los datos en la integración MT/LLM dentro de CAT

La traducción profesional suele realizarse con una herramienta TAO, no con un editor de texto plano. En esta unidad, aprenderá las herramientas TAO, la memoria de traducción (TM) en el corazón de la traducción, cómo funcionan junto con la traducción automática y el LLM, y cómo utilizar este ecosistema de manera eficiente y segura. El objetivo es convertirse en un usuario de tecnología de traducción que gestione un proyecto completo, no frases individuales, de forma coherente, rápida y rastreable.

Conceptos básicos

La herramienta CAT (traducción asistida por computadora) es un software profesional (como Trados, memoQ, Phrase, MateCat) que organiza la traducción oración por oración (segmento) y conecta la memoria de traducción y la base terminológica. Muestra el origen y el destino uno al lado del otro, detecta repeticiones y conserva el formato.

TM (Memoria de traducción) es una base de datos que almacena los pares de oraciones fuente-destino que ha traducido previamente. Cuando llega una nueva frase, si hay una frase similar en la MT, el agente te la sugiere. El concepto clave aquí es la coincidencia difusa: la similitud de la nueva oración con una oración en la MT (100% = exactamente igual, 85% = muy similar). Las coincidencias altas aceleran el trabajo porque reutilizas tu traducción anterior.

Un segmento es la unidad básica de traducción, generalmente una oración. La herramienta TAO divide el texto en segmentos y edita cada uno por separado.

Importancia de la MT: MT produce borradores sin procesar, pero la MT devuelve sus traducciones anteriores aprobadas y de calidad humana. Los dos son diferentes: MT es una predicción, TM es un recuerdo.

Consejo: No confunda TM y MT. Una coincidencia 100% de la MT (su traducción previamente aprobada) es generalmente confiable; La recomendación de MT siempre debe verificarse. Las herramientas CAT muestran los dos con diferentes colores/etiquetas; Siempre veo esta diferencia.

Integración de MT y LLM en CAT

Las herramientas CAT modernas llaman internamente a los motores de MT y, cada vez más, a los LLM: si no hay ninguna coincidencia en la TM, el agente devuelve automáticamente una recomendación de MT para el segmento; lo edita posteriormente (es decir, MTPE fluye en CAT). Las herramientas de última generación también integran LLM: puedes realizar operaciones como "reescribir este segmento con este tono", "corregir este término en la base terminológica", etc. en la herramienta.

Ventaja de esta integración: TM, base terminológica, MT y LLM se combinan en una sola pantalla; Para cada oración, se establece el flujo "mirar primero la TM; de lo contrario, sugerir la TM, término QA automáticamente". Desventajas y precaución: ¿a dónde van los datos? La integración MT/LLM basada en la nube puede enviar texto a servidores externos; En el trabajo confidencial, esto puede ser un incumplimiento de contrato. Asegúrate de saber a qué motor está conectado el vehículo y con qué política de datos.

Alimentar y borrar la memoria de traducción

El valor de la MT es tanto como la calidad de las traducciones que contiene. Basura entra, basura sale. Dos disciplinas:

  1. Simplemente escriba la traducción jurada a TM. Si guarda la salida de MT sin procesar en TM sin validarla, volverá a sus trabajos futuros como "memoria" mala.
  2. Realice el mantenimiento de la TM. Con el tiempo, los términos cambian y aparecen errores. Limpie periódicamente el TM y corrija los pares desgastados/incorrectos. En este trabajo, estoy usando el LLM para preguntar "¿hay alguna inconsistencia/sesgo de término en estos pares de MT?" Puedes usarlo como auditor.
Precaución: El uso de la memoria de traducción de un cliente en el negocio de otro cliente constituye una violación de la confidencialidad y un riesgo de confusión de términos. Las memorias de traducción se mantienen separadas según el cliente y el proyecto. Una MT mixta de "todo" destruye tanto la confidencialidad como la calidad.

tres mini casos

Caso 1: TM voló en las repeticiones. Un fabricante estaba traduciendo una familia de productos donde el 70% de su manual permanecía igual año tras año. Gracias a TM, las coincidencias 100% y altas se produjeron automáticamente en cada nueva versión; Sólo ~9.000 palabras del trabajo de 30.000 palabras fueron traducciones nuevas reales. El tiempo y el coste se redujeron en un tercio.

Caso 2: Dirty TM propagó el error. Un equipo había guardado la salida de MT sin procesar en TM sin verificación. Un año después, el mismo error de traducción volvió una y otra vez, pareciendo “confiable” como una coincidencia del 100%; El error se distribuyó en 14 documentos diferentes. El equipo instituyó una norma de "traducción certificada únicamente a MT" y un recorrido de limpieza.

Caso 3: Se filtró la confidencialidad en la integración. Un traductor realizó un trabajo confidencial en un proyecto CAT que se conectó automáticamente a la MT en la nube; El texto llegó a un motor externo cuya política de datos no está clara. Una vez notado, la integración de MT para proyectos secretos se desactivó y solo se utilizaron motores empresariales que "no almacenan ni entrenan datos".

Cuatro plantillas copiables

1) Evaluación de coincidencia difusa (para LLM):

A continuación se muestra la nueva oración fuente, la oración similar en TM y su traducción aprobada. Dime exactamente qué necesito cambiar para adaptar la traducción de la MT a la nueva oración; No sugiera cambios innecesarios. Muestre claramente la diferencia de significado. Nueva fuente: [...] | Fuente de la MT: [...] | Traducción de MT: [...]

2) Verificación de coherencia de la MT:

A continuación se muestran los pares fuente-destino de TM. Marque las inconsistencias y las desviaciones de términos cuando oraciones fuente iguales o muy similares se traducen DE FORMA DIFERENTE. Simplemente enumere los problemas. Parejas: [...]

3) Reescritura del tono del segmento (LLM en CAT):

Realiza el siguiente segmento objetivo [tono deseado] SIN CAMBIAR el significado. Cumplir con la lista de términos: [...]. Mantenga números y nombres. Exporte solo el segmento reescrito. Segmento: [...]

4) Verificación previa de privacidad/integración:

Usaré la integración MT/LLM en un proyecto CAT. Describiré el tipo de texto en este proyecto; Dígame si es apropiado enviar este texto a un motor externo basado en la nube, qué preguntas (retención de datos, capacitación, ubicación) debo hacer al proveedor. Tipo de texto/estado de privacidad: [...]

Aviso débil / Aviso fuerte

Débil: "Usa la traducción en TM". (No está claro qué tasa de coincidencia y qué adaptar; la copia ciega introduce errores).

Strong: "Esta nueva oración coincide con la oración en TM el 90% del tiempo. Desarrolla la traducción de TM pero refleja esta diferencia: la fuente tiene 'anual' en lugar de 'mensual', por lo que debería ser 'anual' en lugar de 'mensual'. No cambies nada más".

Diferencia: un mensaje fuerte señala la diferencia de coincidencia; Evita "dejar la traducción anterior como está", que es el error más común de coincidencia aproximada.

Tabla de componentes del ecosistema CAT

componente

¿Qué hace?

relación con la IA

TM (memoria de traducción)

Devuelve traducciones anteriores aprobadas

Confiable; precede a MT

Base de datos terminológica

Garantiza la coherencia de los términos

Se da como un aviso para LLM.

recomendación de MT

Boceto sin formato en segmento vacío

Debe ser poseditado

Integración del Máster en Derecho

Tono/término/reescritura

Controlado, atención a la privacidad.

módulo de control de calidad

Error de número/término/etiqueta de escaneos

control automático

Errores comunes

  • Aceptar ciegamente la coincidencia difusa. Una coincidencia del 85% puede ocultar una diferencia de significado del 15%.
  • Escribir salida MT sin procesar en TM. Dirty TM lleva el error al futuro y lo prolifera.
  • Mezclar memorias de usuario de cliente/proyecto. Confidencialidad y riesgo de confusión de términos.
  • Sin saber a dónde van los datos de integración. El texto oculto puede filtrarse sin que usted se dé cuenta.
  • Olvidando la diferencia TM/MT. MT es una estimación; La MT es un recuerdo. Los dos no son igualmente seguros.

Pretraducción y alineación

Dos funciones CAT avanzadas aceleran aún más el flujo de trabajo en la era de la IA. La primera es la pretraducción: al comienzo del proyecto, la herramienta llena automáticamente todos los segmentos con TM y MT; En lugar de un archivo vacío, se comienza con un archivo en el que se aprueban el 100% de las coincidencias, las coincidencias aproximadas esperan ser adaptadas y las vacías son borradores MT. Esto cambia el trabajo de “escribir desde cero” a “revisar y editar”, pero es necesario evaluar cada segmento en lugar de aprobar ciegamente la pretraducción.

El segundo es la alineación: si tiene un par de documentos de origen y de destino que se ha traducido anteriormente pero no ha ingresado a la TM, la herramienta de alineación los compara segmento por segmento y los convierte en TM. Por lo tanto, sus traducciones pasadas se agregan a la "memoria". Precaución al alinear: la coincidencia automática no siempre es correcta; El deslizamiento de un segmento interrumpe toda la alineación. Revisar los pares alineados antes de realizar una MT evita, en primer lugar, el riesgo de una MT sucia. Estas dos funciones convierten sus activos actuales (traducciones pasadas) en inversiones en negocios futuros.

En resumen

herramientas TAO; Combina memoria de traducción, base terminológica, traducción automática y LLM en una única línea de producción. TM es una memoria que recupera tus traducciones pasadas aprobadas y proporciona gran velocidad en tareas repetitivas; MT es una predicción que siempre necesita ser verificada. El usuario inteligente adapta cuidadosamente la diferencia en coincidencias aproximadas, escribe solo traducciones aprobadas en la memoria de traducción, mantiene separadas las memorias de usuario de los clientes y protege la privacidad al saber dónde van los datos en la integración.

Tarea de aplicación

Configure un pequeño proyecto en una herramienta CAT (también funciona un CAT en línea gratuito): agregue una base de datos terminológica y una memoria de traducción vacía. Traduce un texto de 10 oraciones, guarda las traducciones aprobadas en TM. Luego traduzca un segundo texto muy similar al primero y adapte las coincidencias aproximadas devueltas por TM con la plantilla "evaluación de coincidencias aproximadas"; Tenga en cuenta cuántas oraciones cometería un error si aceptara ciegamente la MT.

lista de verificación

  • [] Conecté TM y la base de datos terminológica al proyecto.
  • [] Utilicé la diferencia en coincidencias difusas de forma adaptativa en lugar de ciegamente.
  • [ ] Sólo escribí a TM la traducción jurada que he verificado.
  • [] Mantuve las memorias de traducción de cliente/proyecto separadas.
  • [] Verifiqué dónde van los datos en la integración MT/LLM.