Cómo medir la calidad de los sistemas de TA: la evaluación humana como criterio de referencia

En el artículo anterior vimos cómo las métricas automáticas y los LLM como jueces permiten evaluar la traducción automática de forma rápida y a gran escala. Pero cuando necesitamos saber si un sistema responde realmente a nuestras necesidades —especialmente antes de tomar decisiones importantes, como lanzar un producto o cambiar de proveedor de traducción—, la evaluación humana sigue siendo el referente para evaluar la calidad de la traducción automática, del mismo modo que en otras tareas del procesamiento del lenguaje natural (PLN).

En este artículo damos un paso más y nos centramos en los principales métodos de evaluación humana: qué mide cada uno, qué ventajas y limitaciones presenta y qué buenas prácticas debemos seguir para obtener resultados fiables. 

 

1. Tipos de evaluación humana

1.1. Ranking

Los métodos de ranking no miden la calidad absoluta de una traducción, sino su calidad relativa en comparación con otras. La forma más sencilla es la evaluación por pares: se presenta una frase original junto con dos traducciones —una de un sistema de referencia y otra de un sistema nuevo— y la persona evaluadora decide cuál considera mejor o si ambas tienen una calidad equivalente (Mukherjee, 2025).

El Relative Ranking (RR) amplía esta idea: las personas evaluadoras ven el texto original, una traducción de referencia y cinco traducciones generadas por distintos sistemas, y las ordenan de la mejor a la peor, permitiendo empates. Para simplificar la tarea, las traducciones idénticas producidas por sistemas diferentes se agrupan en una única opción.

Existen también variantes a un nivel más fino. En el constituent ranking se ordena únicamente un constituyente sintáctico seleccionado automáticamente, en lugar de la frase completa. En el constituent judgement, en cambio, la persona evaluadora decide mediante un sí o un no si ese constituyente es aceptable. La puntuación final corresponde al porcentaje de constituyentes considerados aceptables (Mukherjee, 2025).

Por último, el método DARR (Direct Assessment Relative Ranking) deriva clasificaciones a partir de puntuaciones de evaluación directa. Obtener puntuaciones fiables de DA a nivel de segmento requiere que cada traducción sea evaluada por varias personas, algo que no siempre es posible. DARR resuelve esta limitación generando todos los pares posibles de traducciones de una misma frase y considerando que una es mejor que otra solo cuando sus puntuaciones se diferencian en al menos 25 puntos. Los pares con una diferencia menor se consideran empates y se descartan para el ranking (Mukherjee, 2025).

La principal ventaja del ranking es que resulta sencillo y económico: comparar traducciones suele ser más fácil que asignarles una puntuación absoluta. Su principal limitación es que solo permite establecer preferencias. Saber que una traducción es mejor que otra no nos indica si alguna de ellas alcanza un nivel de calidad suficiente. Por eso, resulta especialmente adecuado para comparar sistemas, pero menos para medir la calidad de las traducciones de forma absoluta. 

1.2. Categorización de errores

Los métodos de categorización de errores buscan no solo medir la calidad de una traducción, sino también explicar dónde y por qué falla. El marco de referencia es MQM (Multidimensional Quality Metrics), empleado en WMT desde 2020 (Lommel et al., 2013; Lommel et al., 2024).

En MQM, personal experto identifica los errores a nivel de segmento, los clasifica según una taxonomía —que puede incluir categorías como precisión, fluidez, estilo, terminología o convenciones locales— y les asigna una gravedad: crítica, mayor, menor o neutra. Cada nivel de gravedad tiene asociado un peso, y la suma ponderada de los errores permite obtener una puntuación para el segmento o para el sistema. Las categorías pueden añadirse, eliminarse o adaptarse a las necesidades de cada tarea, y el método puede aplicarse tanto a la traducción humana como a la automática.

MQM ofrece un nivel elevado de información y explicabilidad, pero también implica un mayor coste de evaluación. Requiere personas con formación específica, y la clasificación de cada error dentro de una taxonomía detallada puede resultar lenta y cognitivamente exigente.

Como respuesta a esta limitación surgió la Error Span Annotation (ESA), adoptada como método principal de evaluación humana en WMT en 2024 (Kocmi et al., 2024). La ESA combina la identificación de errores con la puntuación en dos pasos.

Primero, la persona evaluadora marca los fragmentos de la traducción que contienen errores e indica su gravedad —neutra, menor o mayor—, sin clasificarlos por tipo. También puede señalar el contenido omitido. Después, teniendo delante los errores identificados, asigna una puntuación global de 0 a 100 al segmento.

Al obligar a identificar primero los errores concretos, la puntuación final se basa en evidencias y puede resultar más consistente que una evaluación directa. Al mismo tiempo, al prescindir de la taxonomía de errores, el proceso es más rápido que MQM y reduce los requisitos de formación de las personas evaluadoras. La ESA busca así un equilibrio entre la explicabilidad de MQM y la eficiencia de la evaluación directa.

1.3. Puntuación

Los métodos de puntuación asignan a cada traducción un valor numérico que representa su calidad absoluta. Uno de los enfoques más clásicos son las escalas Likert (Joshi et al., 2015), en las que las personas evaluadoras puntúan, normalmente de 1 a 5 o de 1 a 7, aspectos como la fluidez —la corrección lingüística en la lengua de destino— y la adecuación —la fidelidad al significado del original—.

La Evaluación Directa (DA) estima la calidad absoluta de una traducción en una escala de 0 a 100, teniendo en cuenta la adecuación y la fluidez. Las puntuaciones brutas se convierten posteriormente en z-scores, normalizadas según la media y la desviación típica de cada persona evaluadora. De este modo, se intenta compensar el hecho de que unas personas puedan puntuar sistemáticamente de forma más generosa o más estricta que otras.

Existen tres variantes principales. La ref-DA, monolingüe, compara la traducción con una referencia; la src-DA, bilingüe, la compara con el texto original, lo que reduce el sesgo que puede introducir una referencia concreta; y la DA contrastiva, en la que se presentan simultáneamente traducciones de varios sistemas para evaluarlas de forma comparada (Stanchev et al., 2020).

El SQM (Scalar Quality Metric) emplea una escala de siete puntos y evalúa cada segmento dentro del contexto del documento al que pertenece. Las puntuaciones pueden proceder de personas colaboradoras sin formación específica (cSQM) o de traductores profesionales (pSQM).

La variante DA+SQM combina ambos enfoques: mantiene la escala de 0 a 100 de la evaluación directa, pero incorpora siete puntos de referencia etiquetados que sirven como guía para la evaluación. Esto permite estabilizar las puntuaciones entre las personas evaluadoras en comparación con la DA simple (Mukherjee et al., 2025).

La puntuación es más costosa y exigente que el ranking, pero presenta una ventaja fundamental: permite cuantificar la calidad. Además, a partir de una puntuación es posible derivar una clasificación, como hace DARR, mientras que obtener una puntuación absoluta a partir de un ranking resulta mucho más difícil.

Por este motivo, Mukherjee et al. (2025) proponen que, siempre que los recursos lo permitan, la puntuación sea preferible al ranking. Los autores presentan además un árbol de decisión que clasifica los métodos según su explicabilidad, carga cognitiva y coste, y que ayuda a seleccionar el más adecuado en función de la granularidad de la evaluación, el tipo de valoración, la disponibilidad de referencias y el perfil de las personas evaluadoras. 

 

2. Buenas prácticas en la evaluación humana

Una evaluación humana mal diseñada puede llevar a conclusiones engañosas. Independientemente del método escogido, hay una serie de factores que determinan la fiabilidad de los resultados y que deben tenerse en cuenta a lo largo de todo el proceso. 

2.1. Acuerdo entre personas anotadoras

Las evaluaciones deberían realizarse, al menos, con dos personas evaluadoras. En general, contar con más personas permite obtener resultados más robustos. El acuerdo entre personas anotadoras mide hasta qué punto coinciden al evaluar las mismas traducciones. Un acuerdo bajo puede indicar que la tarea es ambigua, que las guías no son suficientemente claras o que las personas evaluadoras no están bien formadas, lo que pone en duda la fiabilidad de los resultados.

Para medirlo se utilizan coeficientes que tienen en cuenta el acuerdo esperado por azar, como la kappa de Cohen, para dos personas (Cohen, 1960); la kappa de Fleiss, para más de dos (Fleiss, 1971); o el alfa de Krippendorff, que admite distintos tipos de datos, más de dos personas anotadoras y anotaciones incompletas (Krippendorff, 2011). En las puntuaciones continuas, como las de DA, también se emplean medidas de correlación entre las personas evaluadoras, como los coeficientes de Pearson (Pearson, 1895) o Spearman (Spearman, 1961).

En las tareas de anotación de errores, como MQM y ESA, la situación es más compleja y no existe un método estandarizado para medir el acuerdo. Cada persona puede marcar un número diferente de errores, los fragmentos señalados pueden solaparse solo parcialmente y, en el caso de MQM, un mismo problema puede clasificarse en categorías diferentes igualmente defendibles. Ya los primeros estudios sobre anotación de errores basada en MQM detectaron un acuerdo bajo tanto en la identificación como en la clasificación de errores concretos (Lommel et al., 2014), y trabajos posteriores mostraron que muchas discrepancias no se deben necesariamente a errores de las personas evaluadoras, sino a interpretaciones diferentes, pero igualmente válidas, de un mismo fenómeno (Popović, 2021).

Por eso, la opción más recomendable es medir el acuerdo a varios niveles, de más estricto a más laxo. En primer lugar, puede medirse el acuerdo en la detección de errores, es decir, si las personas coinciden en qué segmentos contienen errores (Castilho, 2021). En segundo lugar, en el caso de MQM, puede medirse el acuerdo en las categorías asignadas a los fragmentos marcados por cada persona evaluadora (Popović y Belz, 2022). En tercer lugar, puede medirse el acuerdo en la puntuación a nivel de segmento, es decir, en la puntuación derivada de los errores en MQM o en la puntuación de 0 a 100 en ESA, mediante correlaciones o el alfa de Krippendorff para datos de intervalo (Freitag et al., 2021). Por último, puede medirse el acuerdo en el ranking a nivel de segmento: dadas dos traducciones de la misma frase, se comprueba si las personas coinciden en cuál es mejor, cuál es peor o si hay empate —algo que se puede cuantificar mediante el alfa de Krippendorff (Song et al., 2025).

Estos niveles ofrecen información complementaria. Es frecuente que dos personas discrepen en los fragmentos exactos que señalan o en las categorías que les asignan y, sin embargo, coincidan en la valoración global o en la ordenación de las traducciones, que es, en última instancia, lo que interesa para comparar sistemas. Así lo mostraron, por ejemplo, Freitag et al. (2021) al analizar la anotación MQM a gran escala, y Kocmi et al. (2024) al comparar ESA con MQM. Informar del acuerdo en varios niveles permite, por lo tanto, interpretar mejor la solidez de los resultados e identificar en qué parte de la tarea se concentran las discrepancias.

2.2. Concordancia intra-anotador

La concordancia intra-anotador mide la coherencia de una misma persona consigo misma: si evalúa la misma traducción dos veces, debería proporcionar una valoración similar. Para comprobarlo, suelen incluirse segmentos repetidos en el conjunto de evaluación sin informar previamente a la persona evaluadora.

En DA, además, se emplea un control de calidad basado en elementos trampa: traducciones deliberadamente degradadas que deberían recibir una puntuación claramente inferior a la original. Las personas que no superan estos controles son descartadas. Una baja concordancia intra-anotador puede indicar fatiga, falta de atención o criterios poco estables, y resulta especialmente relevante en las evaluaciones realizadas con personas colaboradoras no expertas. 

2.3. Tipo de personas evaluadoras

El perfil de las personas evaluadoras influye directamente en los resultados. Una primera distinción es entre personas monolingües, que conocen solo la lengua de destino y comparan la traducción con una referencia, y bilingües, que pueden compararla directamente con el texto original. La evaluación monolingüe es más económica, pero depende de la calidad de la referencia y puede heredar sus sesgos.

Otra distinción importante es entre personas colaboradoras no expertas (crowdsourcing) y profesionales de la traducción o lingüistas. Las primeras permiten evaluar grandes volúmenes a bajo coste, pero requieren un mayor número de personas por segmento —en el caso de la DA, al menos quince para garantizar la reproducibilidad— y controles de calidad estrictos. Las personas profesionales son más costosas, pero pueden detectar errores sutiles que pasan desapercibidos para personas evaluadoras no expertas, algo cada vez más relevante a medida que los sistemas de traducción mejoran y sus errores son menos evidentes.

Métodos como MQM requieren necesariamente personal experto, mientras que ESA fue diseñada, entre otras cosas, para reducir esta exigencia.

2.4. Creación de las guías

Las guías de anotación son fundamentales para que todas las personas evaluadoras interpreten la tarea del mismo modo. Unas buenas guías deben definir con claridad cada criterio —por ejemplo, qué se entiende por adecuación, fluidez o error mayor—, explicar el significado de cada punto de la escala e incluir ejemplos concretos, especialmente para los casos límite.

Es recomendable realizar una fase piloto con un pequeño conjunto de datos, analizar los desacuerdos y revisar las guías antes de comenzar la evaluación completa. También conviene ofrecer una sesión de formación y, si es posible, habilitar un espacio para resolver dudas durante el proceso. Las guías deberían publicarse junto con los resultados para facilitar la reproducibilidad de la evaluación (Hovy y Lavid, 2010). 

2.5. Cantidad de texto a evaluar

La cantidad de texto evaluado determina en buena medida la fiabilidad estadística de los resultados (Lommel et al., 2024). Si se evalúan pocos segmentos, las diferencias observadas entre sistemas pueden deberse al azar, por lo que es necesario contar con un volumen suficiente para aplicar pruebas de significación. Al mismo tiempo, un volumen excesivo por persona puede provocar fatiga y reducir la calidad de las anotaciones. Por eso, conviene repartir el trabajo en bloques suficientemente cortos.

Otro aspecto relevante, como vimos en el primer artículo de esta serie sobre los datasets de evaluación, es el contexto. Evaluar frases aisladas es más rápido, pero impide detectar errores que solo se hacen visibles a nivel de documento (Castilho, 2021), como incoherencias terminológicas, pronombres mal resueltos o cambios de registro. Por eso, métodos recientes como SQM, DA+SQM o MQM en WMT evalúan los segmentos dentro del contexto del documento.

El equilibrio adecuado dependerá de los recursos disponibles, del número de sistemas que se comparan y del nivel de granularidad que se quiera obtener en la evaluación. 

 

3. Conclusiones

Del mismo modo que vimos en los dos artículos anteriores de esta serie —y especialmente en el primero, dedicado a los datasets—, una evaluación humana fiable requiere un diseño cuidado y decisiones metodológicas bien fundamentadas.

En primer lugar, conviene determinar qué queremos medir, ya que de ello dependerá el método más adecuado. Si el objetivo es comparar sistemas entre sí, un método de ranking puede ser suficiente; si necesitamos cuantificar la calidad, podemos recurrir a métodos de puntuación como DA o SQM; y si queremos entender dónde y por qué fallan las traducciones, la categorización de errores mediante MQM o ESA ofrece información más detallada.

En segundo lugar, hay que tener en cuenta los recursos disponibles y, en particular, el perfil de las personas evaluadoras. No es lo mismo contar con profesionales de la traducción que con personas colaboradoras no expertas, ni evaluar con referencia que sin ella. Cada una de estas decisiones condiciona tanto el coste como el tipo de errores que se pueden detectar y la fiabilidad de los resultados.

En tercer lugar, la evaluación debe prepararse con cuidado: unas guías claras, con ejemplos y probadas en una fase piloto; un volumen de texto suficiente para que las diferencias sean significativas, pero sin provocar fatiga; y, siempre que sea posible, la evaluación de los segmentos en su contexto.

Por último, los resultados solo son fiables si podemos demostrar su consistencia. Para ello es fundamental contar con varias personas evaluadoras, medir su acuerdo —idealmente a distintos niveles— y disponer de datos suficientes para extraer conclusiones significativas.

Solo cuando se cuidan todos estos aspectos puede la evaluación humana cumplir su papel como criterio de referencia y proporcionar una base sólida para tomar decisiones sobre los sistemas de traducción automática.

 


BIBLIOGRAFÍA

Lommel, Arle, et al. "The Multi-Range Theory of Translation Quality Measurement: MQM Scoring Models and Statistical Quality Control." Proceedings of the 16th Conference of the Association for Machine Translation in the Americas (Volume 2: Presentations), edited by Marianna Martindale et al., Association for Machine Translation in the Americas, 2024, pp. 75-94. ACL Anthology, aclanthology.org/2024.amta-presentations.6/.

Lommel, Arle Richard, et al. "Multidimensional Quality Metrics: A Flexible System for Assessing Translation Quality." Proceedings of Translating and the Computer 35, Aslib, 28-29 Nov. 2013. ACL Anthology.

Lommel, Arle, et al. "Multidimensional Quality Metrics (MQM): A Framework for Declaring and Describing Translation Quality Metrics." Revista tradumàtica: traducció i tecnologies de la informació i la comunicació, no. 12, 2014.

Kocmi, Tom, et al. "Error span annotation: A balanced approach for human evaluation of machine translation." Proceedings of the Ninth Conference on Machine Translation. 2024.

Mukherjee, Ananya, and Manish Shrivastava. "Lost in translation? Found in evaluation: A comprehensive survey on sentence-level translation evaluation." ACM Computing Surveys 58.1 (2025): 1-47.

Joshi, Ankur, et al. "Likert scale: Explored and explained." British journal of applied science & technology 7.4 (2015): 396.

Stanchev, Peter, Weiyue Wang, and Hermann Ney. "Towards a better evaluation of metrics for machine translation." Proceedings of the Fifth Conference on Machine Translation. 2020.

Cohen, Jacob. "A coefficient of agreement for nominal scales." Educational and psychological measurement 20.1 (1960): 37-46.

Fleiss, Joseph L. "Measuring nominal scale agreement among many raters." Psychological bulletin 76.5 (1971): 378.

Krippendorff, Klaus. "Computing Krippendorff's alpha-reliability." (2011).

Pearson, Karl. "Note on regression and inheritance in the case of two parents." Proceedings of the royal society of London 58 (1895): 240-242.

Spearman, Charles. "The proof and measurement of association between two things." (1961).

Popović, M. (2021). Agree to disagree: Analysis of inter-annotator disagreements in human evaluation of machine translation output. En Proceedings of CoNLL 2021.

Song, Yixiao, et al. "Enhancing human evaluation in machine translation with comparative judgement." Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2025.

Popović, Maja, and Anja Belz. "On reporting scores and agreement for error annotation tasks." Proceedings of the Second Workshop on Natural Language Generation, Evaluation, and Metrics (GEM). 2022.

Castilho, Sheila. "Towards document-level human MT evaluation: On the issues of annotator agreement, effort and misevaluation." Proceedings of the workshop on human evaluation of NLP systems (HumEval). 2021.

Freitag, Markus, et al. "Experts, errors, and context: A large-scale study of human evaluation for machine translation." Transactions of the Association for Computational Linguistics 9 (2021): 1460-1474.

Hovy, Eduard, and Julia Lavid. "Towards a ‘science’ of corpus annotation: a new methodological challenge for corpus linguistics." International journal of translation 22.1 (2010): 13-36. 

¿Tienes un proyecto?

Pídenos presupuesto sin compromiso.