En el artículo anterior de esta serie vimos que una evaluación fiable de la traducción automática comienza por la construcción de un buen dataset: hay que definir qué queremos medir, elegir el nivel de análisis adecuado y asegurarse de que los datos representan realmente el contexto en el que se utilizará el sistema.
Una vez que disponemos de estos datos, la siguiente pregunta es: ¿cómo medimos la calidad de las traducciones?
Hoy en día, la evaluación humana sigue siendo la referencia para determinar la calidad de una traducción, tanto automática como humana. Sin embargo, es un proceso costoso, tanto en tiempo como en recursos, y no siempre es posible disponer de profesionales, tiempo o medios técnicos suficientes para evaluar grandes volúmenes de datos. Por eso, en la práctica, las métricas automáticas desempeñan un papel fundamental, especialmente cuando se necesita evaluar sistemas a escala.
En este artículo repasamos los principales tipos de métricas automáticas, sus ventajas y limitaciones, algunas buenas prácticas para evitar conclusiones erróneas y el papel cada vez más relevante de los LLM como jueces.
1. Tipos de métricas
Las métricas automáticas pueden clasificarse atendiendo a dos criterios principales: si necesitan o no una referencia humana y qué tipo de información emplean para comparar las traducciones, desde la coincidencia superficial entre textos hasta su representación semántica.
1.1. Dependientes y no dependientes de una referencia
Métricas dependientes de referencia (reference-based): comparan la salida del sistema con una o varias traducciones de referencia realizadas por personas. Es el enfoque más habitual e incluye métricas como BLEU (Papineni et al., 2002), chrF (Popović, 2015) o COMET (Rei et al., 2020).
Su principal punto débil es evidente: necesitan una traducción de referencia de calidad. Como vimos en el artículo anterior, la construcción de estas referencias es un aspecto fundamental de la evaluación y no siempre es posible disponer de ellas.
Métricas no dependientes de referencia (reference-free o quality estimation): estiman la calidad de la traducción comparando directamente el texto de origen con la traducción producida, sin necesitar una referencia humana. Estas métricas están entrenadas con datos procedentes de evaluaciones humanas. Algunos ejemplos son COMETKiwi (Rei et al., 2022) y MetricX-QE (Juraska et al., 2025).
Este tipo de métricas resulta especialmente útil cuando:
- no existen referencias humanas, por ejemplo, en dominios muy especializados;
- se quiere evaluar en producción o en tiempo real, sin referencias disponibles;
- se quieren detectar traducciones de baja calidad antes de que pasen por revisión humana —lo que se conoce como quality estimation aplicada—, por ejemplo, en flujos de posedición.
Su principal riesgo es que, al no contar con una referencia humana como punto de comparación, pueden ser más sensibles a los errores sistemáticos del propio modelo, a los sesgos presentes en los datos con los que fueron entrenadas o a la falta de recursos para determinadas lenguas, especialmente las de pocos recursos.
1.2. Métricas léxicas: de tokens y caracteres a la distancia de edición
Las métricas léxicas comparan la salida del sistema y la referencia a nivel de superficie textual, sin representar directamente el significado. Dentro de este grupo encontramos diferentes enfoques:
- Basadas en n-gramas de tokens (palabras): comparan secuencias de palabras entre la traducción y la referencia. El ejemplo más conocido es BLEU, que mide la coincidencia de n-gramas. Existen también variantes como METEOR (Banerjee et al., 2005), que añade correspondencias por sinónimos y raíces léxicas.
- Basadas en caracteres: métricas como chrF trabajan con n-gramas de caracteres en lugar de palabras. Esto puede hacerlas más robustas ante lenguas morfológicamente ricas o con alta variación flexiva, en las que pequeños cambios en la forma de una palabra —por ejemplo, de género, número o tiempo verbal— podrían ser penalizados injustamente por una métrica basada en tokens.
- Basadas en medidas de distancia: métricas como TER (Translation Edit Rate) (Snover et al., 2006) calculan el número mínimo de ediciones —inserciones, borrados, sustituciones o reordenaciones— necesarias para convertir la salida del sistema en la referencia. Cuantas menos ediciones sean necesarias, mejor será la puntuación.
El problema común a estas métricas es que miden principalmente la coincidencia superficial: una traducción correcta pero formulada con palabras diferentes a las de la referencia puede recibir una puntuación baja, mientras que una traducción que comparte los mismos términos puede obtener una buena puntuación aunque presente problemas sintácticos.
Además, tradicionalmente ha resultado difícil comparar resultados de BLEU obtenidos en diferentes estudios, ya que pequeñas diferencias en la implementación —especialmente en la tokenización— podían provocar variaciones importantes en la puntuación final. Por este motivo, para calcular BLEU, chrF y TER se recomienda emplear SacreBLEU (Post, 2018), que estandariza las condiciones de cálculo y facilita la comparación entre resultados.
1.3. Métricas basadas en embeddings
Para superar algunas de las limitaciones de las métricas léxicas, surgieron métricas que buscan comparar el significado en lugar de la forma superficial, empleando representaciones vectoriales (embeddings) generadas por modelos de lenguaje.
Ejemplos conocidos son BERTScore (Zhang et al., 2020), COMET o BLEURT (Sellam et al., 2020). Estas métricas representan la traducción y la referencia —y, en algunos casos, también el texto de origen— mediante vectores y calculan su similitud en ese espacio.
Esto permite, entre otras cosas:
- detectar paráfrasis correctas aunque no compartan exactamente las mismas palabras que la referencia;
- ser más sensibles a determinados errores de significado que una comparación puramente léxica podría pasar por alto;
- obtener, en determinados contextos, una mayor correlación con los juicios humanos.
2. Ventajas y limitaciones de las métricas automáticas
Las métricas automáticas tienen un papel claro y útil en la evaluación, pero no ofrecen por sí solas una visión completa de la calidad.
Ventajas
- Velocidad: permiten evaluar miles o incluso millones de segmentos en muy poco tiempo, algo que no sería viable mediante evaluación humana.
- Reproducibilidad: dado el mismo sistema y el mismo dataset, el resultado es consistente, lo que facilita comparar sistemas, versiones o configuraciones a lo largo del tiempo.
- Coste: no requieren movilizar a personas evaluadoras para cada ejecución, por lo que permiten evaluar grandes volúmenes de datos con pocos recursos.
Limitaciones
- Opacidad: una puntuación no siempre permite saber por qué un sistema obtuvo ese resultado. Esto dificulta el diagnóstico de problemas concretos.
- Dificultad para identificar errores específicos: una métrica puede proporcionar una puntuación global, pero no indicar si los problemas están relacionados con la concordancia de género, la terminología, las omisiones u otros tipos de error. Así, una buena puntuación puede esconder problemas relevantes para la puesta en producción. Para abordar parcialmente esta limitación, en los últimos años surgieron métricas como xCOMET (Guerreiro et al., 2024), que además de proporcionar una puntuación pueden detectar errores y clasificarlos según su gravedad.
- Sensibilidad a la calidad de la referencia: en las métricas reference-based, una referencia deficiente puede distorsionar directamente el resultado.
- Correlación imperfecta con los juicios humanos: incluso las métricas más avanzadas no sustituyen completamente la evaluación humana, especialmente cuando entran en juego aspectos como los matices estilísticos, la adecuación cultural o la coherencia discursiva a largo plazo.
En definitiva, las métricas automáticas son especialmente útiles para hacer seguimiento, comparar sistemas y detectar posibles problemas a gran escala, pero no deberían interpretarse como un sustituto definitivo del juicio humano cuando se trata de tomar decisiones de alto impacto.
3. Buenas prácticas en la evaluación automática
No basta con elegir una métrica y calcular una puntuación. La forma de diseñar e interpretar la evaluación también determina la validez de los resultados.
En 2021, Marie et al. analizaron 769 artículos científicos sobre evaluación de traducción automática publicados entre 2010 y 2020. El estudio identificó varias deficiencias recurrentes en las metodologías empleadas y en las conclusiones extraídas, entre ellas el uso exclusivo de BLEU, la ausencia de pruebas de significación estadística o la comparación con resultados de trabajos anteriores obtenidos en condiciones diferentes.
A partir de estas cuestiones, pueden destacarse varias recomendaciones:
- No depender exclusivamente de BLEU o de una única métrica. Es recomendable combinar diferentes métricas o complementarlas con evaluación humana, especialmente cuando se quieren obtener conclusiones sólidas sobre la calidad de un sistema.
- Realizar pruebas de significación estadística. Al comparar dos sistemas, una diferencia de puntuación no implica necesariamente que uno de ellos sea significativamente mejor. Las pruebas estadísticas permiten determinar si la diferencia observada podría deberse al azar.
- No comparar directamente puntuaciones tomadas de otros estudios. Los resultados obtenidos en trabajos anteriores solo deberían compararse cuando las condiciones de cálculo son equivalentes y se dispone de la información necesaria para reproducirlas.
- Comparar sistemas en igualdad de condiciones. Cuando se quiere atribuir una diferencia de resultados a los propios sistemas o métodos, es necesario controlar factores como los datos de entrenamiento, validación y prueba y el preprocesamiento empleado.
Estas prácticas —variedad de métricas, rigor estadístico y comparación en condiciones equivalentes— son fundamentales para interpretar correctamente los resultados de una evaluación automática.
4. Los LLM como jueces
Una de las tendencias más recientes en la evaluación es el empleo de modelos de lenguaje de gran tamaño (LLM) para evaluar la calidad de la traducción, junto con las métricas tradicionales. Este enfoque, conocido habitualmente como LLM-as-a-judge, está ganando presencia en diferentes tareas de procesamiento del lenguaje natural.
¿Qué opciones hay?
- LLM genéricos empleados directamente como jueces, mediante prompts que les indican que deben evaluar determinados aspectos de la traducción, como la adecuación, la fluidez o la gravedad de los errores, sin necesidad de entrenamiento adicional (Kocmi y Federmann, 2023a; Kocmi y Federmann, 2023b; Fu et al., 2024).
- Modelos ajustados específicamente para evaluación (fine-tuned), entrenados con juicios humanos para predecir puntuaciones próximas a las de personas evaluadoras expertas (Treviso et al., 2024).
- Enfoques agénticos, en los que se combinan las salidas de varios LLM, bien porque cada uno evalúa un aspecto concreto de la traducción —como la adecuación, la fluidez, el estilo o la terminología— (Feng et al., 2025), bien porque las diferentes salidas se emplean de manera contrastiva para identificar aquellas que aportan más información o captan mejor determinados matices (Wang et al., 2025).
Ventajas
- Pueden generar explicaciones de los errores y no solo una puntuación, lo que puede hacerlos útiles para el diagnóstico.
- Pueden ayudar a identificar determinados errores críticos que las métricas tradicionales no detectan fácilmente.
Limitaciones
- Coste y latencia: son más lentos y caros de ejecutar que muchas métricas tradicionales, especialmente a gran escala.
- Reproducibilidad: los resultados pueden variar en función del modelo, del prompt o incluso del orden en el que se presentan las traducciones (Ye et al., 2025; Lin et al., 2025).
- Sesgos del modelo: un LLM puede presentar preferencias sistemáticas que no necesariamente corresponden con una mayor calidad de la traducción.
- Correlación con los juicios humanos: aunque pueden mostrar una buena correlación a nivel de sistema, el comportamiento puede ser diferente a nivel de segmento, por lo que los resultados agregados pueden ocultar diferencias relevantes (Gain et al., 2026).
Los LLM como jueces representan, por lo tanto, una herramienta prometedora para ampliar y agilizar la evaluación. Pero, al igual que las métricas automáticas tradicionales, no eliminan la necesidad de evaluación humana en contextos en los que las decisiones tienen un impacto elevado.
5. Conclusión
La evaluación automática es fundamental cuando se necesita evaluar traducción automática a gran escala, pero obtener una puntuación no es suficiente.
Una evaluación sólida requiere combinar métricas de diferente naturaleza, emplear datasets representativos, aplicar métodos estadísticos adecuados y conocer las limitaciones de cada herramienta. Los nuevos enfoques basados en LLM amplían las posibilidades de análisis, pero también introducen nuevos retos que deben tenerse en cuenta.
En definitiva, evaluar no consiste simplemente en obtener una puntuación, sino en saber qué significa esa puntuación y qué información necesitamos para tomar una decisión. Esta perspectiva será especialmente importante cuando comparemos diferentes sistemas y modelos de traducción automática y tengamos que decidir cuál se adapta mejor a cada contexto de uso.
BIBLIOGRAFÍA
Papineni, Kishore, et al. "Bleu: a method for automatic evaluation of machine translation." Proceedings of the 40th annual meeting of the Association for Computational Linguistics. 2002.
Popović, Maja. "chrF: character n-gram F-score for automatic MT evaluation." Proceedings of the tenth workshop on statistical machine translation. 2015.
Rei, Ricardo, et al. "COMET: A neural framework for MT evaluation." Proceedings of the 2020 conference on empirical methods in natural language processing (emnlp). 2020.
Rei, Ricardo, et al. "COMET-22: Unbabel-IST 2022 submission for the metrics shared task." Proceedings of the Seventh Conference on Machine Translation (WMT). 2022.
Juraska, Juraj, et al. "Metricx-25 and gemspaneval: Google translate submissions to the wmt25 evaluation shared task." Proceedings of the Tenth Conference on Machine Translation. 2025.
Banerjee, Satanjeev, and Alon Lavie. "METEOR: An automatic metric for MT evaluation with improved correlation with human judgments." Proceedings of the acl workshop on intrinsic and extrinsic evaluation measures for machine translation and/or summarization. 2005.
Snover, Matthew, et al. "A study of translation edit rate with targeted human annotation." Proceedings of the 7th Conference of the Association for Machine Translation in the Americas: Technical Papers. 2006.
Post, Matt. "A call for clarity in reporting BLEU scores." Proceedings of the third conference on machine translation: Research papers. 2018.
Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, and Yoav Artzi. 2020. Bertscore: Evaluating text generation with bert.
Sellam, Thibault, Dipanjan Das, and Ankur Parikh. "BLEURT: Learning robust metrics for text generation." Proceedings of the 58th annual meeting of the association for computational linguistics. 2020.
Marie, Benjamin, Atsushi Fujita, and Raphael Rubino. "Scientific credibility of machine translation research: A meta-evaluation of 769 papers." Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers). 2021.
Guerreiro, Nuno M., Ricardo Rei, Daan van Stigt, Luisa Coheur, Pierre Colombo, and André F. T. Martins. "xCOMET: Transparent Machine Translation Evaluation through Fine-grained Error Detection." Transactions of the Association for Computational Linguistics 12. 2024. 979–995.
Kocmi, Tom, and Christian Federmann. "Large language models are state-of-the-art evaluators of translation quality." Proceedings of the 24th Annual Conference of the European Association for Machine Translation. 2023a.
Kocmi, Tom, and Christian Federmann. "GEMBA-MQM: Detecting translation quality error spans with GPT-4." Proceedings of the Eighth Conference on Machine Translation. 2023b.
Treviso, Marcos V., et al. "xtower: A multilingual llm for explaining and correcting translation errors." Findings of the Association for Computational Linguistics: EMNLP 2024. 2024.
Fu, Jinlan, et al. "Gptscore: Evaluate as you desire." Proceedings of the 2024 conference of the north american chapter of the association for computational linguistics: Human language technologies (volume 1: Long papers). 2024.
Feng, Zhaopeng, et al. "M-MAD: Multidimensional multi-agent debate for advanced machine translation evaluation." Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2025.
Wang, Xiao, et al. "ContrastScore: Towards higher quality, less biased, more efficient evaluation metrics with contrastive evaluation." Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics. 2025.
Shi, Lin, et al. "Judging the judges: A systematic study of position bias in llm-as-a-judge." Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics. 2025.
Gain, Baban, et al. "Bridging the linguistic divide: a survey on leveraging large language models for machine translation." Language Resources and Evaluation 60.2 (2026): 40.