Unidad 8 / 11

Control de Calidad (QA), Métricas de Evaluación y LQA

Ganancias:

  • Capacidad para distinguir entre capas automáticas de control de calidad y capas lingüísticas de control de calidad y aplicar ambas en el orden correcto
  • Capacidad para evaluar objetivamente la traducción según categoría y peso (crítico/mayor/menor) con un marco de error como MQM
  • Ser capaz de tomar la decisión final a la hora de utilizar la IA como auditor, conociendo su ceguera ante su propia traducción, el riesgo de cometer errores y los límites de las métricas automatizadas.

En el momento en que dices que una traducción está "hecha", ya es la mitad del trabajo; La otra mitad es para demostrar que esa traducción es realmente fiable. En esta unidad, aprenderá formas sistemáticas de medir la calidad de la traducción: controles de calidad automatizados, marcos de error de LQA basados ​​en humanos, métricas de calidad y cómo utilizar la IA como "inspector" y sus límites. El objetivo es alejarse de la subjetividad del “me parece bueno” y convertirse en un experto que define, mide y demuestra la calidad.

Dos tipos de control de calidad: automático y lingüístico

El control de calidad (control de calidad) funciona en dos capas:

Control de calidad automatizado: errores de estilo que detectan las herramientas CAT y los scripts: números no coincidentes, falta o exceso de espacio, términos inconsistentes, segmento no traducido, marcador de posición/etiqueta incorrectos, doble espacio, puntuación. Estos se escanean rápida y completamente por máquina; Se escapa al ojo humano, pero el vehículo lo capta.

LQA (Garantía de calidad lingüística): esta es la capa donde un evaluador humano examina el significado, la terminología, el estilo, la gramática y la idoneidad local. Control de calidad automatizado "¿coincide el número?" mira la pregunta; LQA “¿Es correcto el significado, es apropiado el tono, es culturalmente apropiado?” Él mira la pregunta. Los dos se complementan; Uno no reemplaza al otro.

Consejo: ejecute siempre primero el control de calidad automático; Limpiar errores formales permite al evaluador humano dedicar atención a problemas lingüísticos reales. Un crítico que se moleste con el error numérico se perderá el error de tono.

Marcos de error: MQM y DQF

Se utilizan tipologías de error estándar para hacer que la calidad sea mensurable en lugar de “buena/mala”. El más común es MQM (Multidimensional Quality Metrics): asigna cada error a una categoría (precisión, fluidez, terminología, estilo, localidad, formato) y un peso (crítico, mayor, menor). Otro marco es DQF (Marco Dinámico de Calidad) y se menciona junto con MQM.

¿Por qué es importante? Porque con este marco, puedes dar una puntuación de error a una traducción, comparar objetivamente diferentes traductores/motores y preguntar "¿se puede entregar este texto?" Respondes la pregunta con un umbral numérico. Por ejemplo: error crítico = 10 puntos, mayor = 5, menor = 1; el texto por debajo de un cierto umbral pasa por determinada palabra.

Error crítico: error que invierte significado, crea riesgo de seguridad/legal, daña la marca (dosis equivocada, “no responsable” en lugar de “responsable”). Mayor: disruptivo pero inofensivo. Menor: perceptible pero que no resta valor al significado (estilo/puntuación menor).

El uso de la IA como controlador y sus límites

La IA es rápida y útil para comparar una traducción con el marco de errores: puede decir "marcar errores de corrección, terminología y fluidez en esta traducción con categorías MQM". Reduce sus puntos ciegos y le brinda un "segundo ojo" rápido.

Pero existen tres límites críticos: (1) la IA puede ser ciega al verificar la traducción que produce, cometiendo y confirmando el mismo error; verifique con un modelo diferente o regrese a la fuente. (2) La IA también puede inventar “errores” alucinatorios: informar un error que no existe; Confirme cada advertencia. (3) es posible que la IA no comprenda completamente la gravedad de un error crítico en el mundo real (un error de dosis puede ser fatal); El experto hace la ponderación. Por lo tanto, la IA acelera el control de calidad, pero la decisión final sobre la calidad y la aprobación de la entrega recae en el ser humano.

Precaución: Decir "La IA pasó el control de calidad, está limpia" es una falsa sensación de confianza. La auditoría de IA no reemplaza la LQA humana ni la comparación con la fuente; es una capa de preselección que los pone al día.

tres mini casos

Caso 1: el control de calidad automatizado encontró 40 errores numéricos. En la traducción de un informe financiero, el control de calidad automatizado detectó 40 discrepancias entre números y formatos entre el origen y el destino (separador de miles, decimal, moneda). El ojo humano pasaría por alto la mayoría de estos; vehículo listado en segundos.

Caso 2: la puntuación MQM condujo a la selección del motor. Una oficina MQM calificó el rendimiento de dos motores MT diferentes en 2000 palabras: el motor A con 12 puntos de error, el motor B con 31. La medición objetiva resolvió el debate sobre "cuál es mejor" con una puntuación; La oficina convirtió al motor A en el estándar y planificó su presupuesto posterior a la revisión en consecuencia.

Caso 3: La auditoría de IA no cometió su propio error. Un traductor hizo que la traducción del LLM fuera supervisada por el mismo LLM; La modelo dijo "no hay problema", un error de terminología que ella misma cometió. El error se reveló cuando el traductor cotejó con un modelo y fuente diferentes; El equipo adoptó la regla de que "el mismo modelo no debe controlarse a sí mismo".

Cuatro plantillas copiables

1) Comprobación de errores basada en MQM:

Su función: evaluador de LQA. Compare la fuente y la traducción a continuación. Proporcione cada error que encuentre en el siguiente formato: [categoría: precisión/terminología/fluidez/estilo/formato][peso: crítico/mayor/menor] [ubicación] [comentario] [corrección]. Marque la advertencia de la que no está seguro como "se requiere confirmación"; errorfabrication.Fuente: [...] | Traducción: [...]

2) Escaneo de errores críticos (alto riesgo):

Busque errores críticos SÓLO en la traducción a continuación: inversión de significado, error de número/dosis/fecha, pérdida de negación, sustitución de obligación legal, error de advertencia de seguridad. Ignore los problemas menores de estilo. Cite la fuente de cada hallazgo crítico. Fuente: [...] | Traducción: [...]

3) Control suplementario automático de calidad:

Enumere las inconsistencias formales en los siguientes pares fuente-destino: falta de coincidencia de números, marcador de posición o etiqueta faltante/extra, término inconsistente, segmento no traducido, diferencia de unidad/moneda. Sólo da los problemas con su ubicación. Parejas: [...]

4) Segundo ojo independiente (verificación cruzada):

Evalúe esta traducción SIN PREJUICIO; No asumas que lo escribiste. Otorgue a la fuente una calificación de calidad (1-5) por fidelidad, terminología y naturalidad, y enumere los 3 problemas principales. Depende de mí decidir. Fuente: [...] | Traducción: [...]

Aviso débil / Aviso fuerte

Débil: "¿Es buena esta traducción?" (Sin criterios; la IA devuelve una respuesta inútil como "en general bien").

Fuerte: "Compruebe esta traducción con la fuente. Etiquete cada error con categoría (precisión/terminología/fluidez) y gravedad (crítico/mayor/menor). Concéntrese especialmente en los errores numéricos, de negación y de terminología. No invente errores; marque 'se necesita confirmación' si no está seguro".

Diferencia: un aviso fuerte proporciona un marco y un enfoque de error; El resultado es un informe de calidad comparable y procesable.

Tabla de capas de calidad

capa

que atrapa

¿Quién/qué hace?

Control de calidad automático

Número, etiqueta, consistencia

Herramienta/script

control de IA

Posibles errores de significado/terminología

LLM (con confirmación)

LQA humana

Significado, tono, cultura, peso.

evaluador experto

Puntuación MQM/DQF

Puntuación de error objetivo

humano con marco

Confirmación de entrega

responsabilidad final

traductor competente

Errores comunes

  • Saltándose el control de calidad automatizado y pasando directamente a la lectura. Los errores de estilo distraen la atención.
  • Reemplazar la inspección de IA con LQA humano. Pre-pantallas de IA, no aprueba.
  • Hacer que el mismo modelo verifique su propia traducción. Punto ciego; Se requiere verificación cruzada.
  • No errores de ponderación. Ver lo crítico y lo menor como lo mismo altera la prioridad.
  • Corregir "errores" cometidos por la IA sin confirmarlos. Puedes distorsionar la oración correcta.

Métricas automáticas: BLEU, COMET y límites

También existe un mundo de métricas automatizadas en la medición de la calidad. BLEU (estudiante de evaluación bilingüe) compara una traducción automática con una traducción de referencia humana y otorga una puntuación de 0 a 100 según la superposición de palabras; Fue el estándar para comparar sistemas MT durante mucho tiempo. Una métrica más nueva, COMET, se basa en redes neuronales y captura la similitud semántica mejor que BLEU. Estas métricas son valiosas para comparar rápida y automáticamente dos motores en big data.

Pero sus límites son claros: métricas como BLEU analizan la superposición de palabras, sin comprender realmente el significado. Una traducción que difiere de la referencia pero que es precisa puede recibir una puntuación baja; Una traducción similar a la referencia pero incorrecta puede recibir una puntuación alta. Un error crítico de negatividad es una sola palabra, por lo que tiene poco impacto en la métrica, pero en realidad es catastrófico. Es por eso que las métricas automatizadas miden las tendencias a nivel del sistema, no deciden la capacidad de entrega de un texto individual. La evaluación humana basada en MQM y el juicio de expertos deciden si una traducción llega al cliente, no una puntuación automática. Utilice las métricas como brújula, no como juez.

En resumen

La calidad de la traducción no es un sentimiento subjetivo, es algo que se puede medir. El control de calidad automático analiza exhaustivamente en busca de errores formales; el LQA humano evalúa el significado, el tono y la cultura; Los marcos de error como MQM cuantifican la calidad por categoría y peso, lo que permite una comparación objetiva. La IA es un poderoso segundo ojo que acelera este control, pero puede ser ciega a su propia traducción, cometer errores y no captar completamente el peso del mundo real; Por lo tanto, la decisión final sobre la calidad, la ponderación y la aprobación de la entrega corresponde al traductor competente.

Tarea de aplicación

Obtenga un resultado de traducción automática. Enumere primero los errores formales con la "verificación complementaria automática de control de calidad", luego enumere los errores lingüísticos por categoría y peso con la "verificación de errores basada en MQM". Califico cada error (crítico 10, mayor 5, menor 1) con un umbral por palabra y pregunto "¿se puede entregar?". Responde la pregunta. Finalmente, confirme con la fuente cuántos de los errores señalados por la IA son reales y cuántos son inventados.

lista de verificación

  • [] Ejecuté un control de calidad automático y limpié cualquier error formal.
  • [ ] Marqué los errores lingüísticos con un cuadro (categoría + peso).
  • [] Analicé los errores críticos en una ronda separada y priorizada.
  • [] Obtuve el control de IA y lo verifiqué con un modelo diferente si era necesario.
  • [ ] Tomé la decisión de entrega basándome en el umbral numérico y en mi propio juicio experto.