A lo largo de esta serie de artículos hemos visto que evaluar correctamente un sistema de traducción automática (TA) implica tomar distintas decisiones: qué datasets emplear, qué métricas automáticas utilizar y cómo interpretar sus resultados, cuándo recurrir a la evaluación humana y con qué metodología, y cómo comprobar que los resultados son fiables.
Llegados a este punto, queda una pregunta más práctica: ¿cómo integrar todo este proceso en un flujo de trabajo real?
En este último artículo de la serie repasamos algunas de las herramientas que existen para facilitar la evaluación de la traducción automática y presentamos Vera (González et al., 2026), nuestra plataforma de evaluación de TA, que reúne en un único entorno la evaluación automática, la evaluación humana y el análisis comparativo de los resultados.
El problema: flujos de trabajo fragmentados
Existen herramientas que abordan diferentes aspectos de la evaluación de la traducción automática, pero cada una suele centrarse en una parte concreta del proceso. MATEO (Vanroy et al., 2023)¹, por ejemplo, se centra en el cálculo de métricas automáticas —como BLEU, chrF, TER, COMET o BLEURT— a través de una interfaz web. MT-LENS (Gilabert et al., 2025)² amplía el análisis a aspectos como el sesgo o la robustez, mientras que Pearmut (Zouhar y Kocmi, 2026)³ está orientada a la evaluación humana mediante marcos como MQM, DA o ESA, que vimos con más detalle en el artículo dedicado a la evaluación humana.
En la práctica, esto puede implicar trabajar con diferentes herramientas, formatos y flujos de trabajo según el tipo de evaluación que se quiera realizar. Vera parte precisamente de esta necesidad de integrar estos diferentes enfoques en un único entorno y, además, permite analizar la relación entre los resultados de las métricas automáticas y el juicio humano.
Evaluación automática
Vera calcula algunas de las métricas basadas en referencia más utilizadas: BLEU, chrF++ y TER, a través de SacreBLEU, y COMET.
Para comparar sistemas con mayor rigor, la plataforma también permite analizar la significación estadística de las diferencias entre modelos mediante bootstrap resampling para cada métrica. De este modo, no solo podemos saber qué sistema obtiene una puntuación más alta, sino también determinar si la diferencia observada es estadísticamente significativa.
Como vimos en el artículo dedicado a la evaluación automática, comprobar la significación estadística es una de las buenas prácticas que deben tenerse en cuenta al comparar sistemas de traducción.
Evaluación humana con MQM Core
Para la evaluación humana, Vera utiliza MQM Core, un subconjunto del marco MQM ampliamente empleado en la industria.
La plataforma permite que varias personas anotadoras trabajen en paralelo sobre un mismo proyecto, lo que facilita el cálculo del acuerdo entre ellas (Inter-Annotator Agreement, IAA). Esta medida permite analizar hasta qué punto las personas evaluadoras coinciden en sus anotaciones y, por lo tanto, aporta información sobre la consistencia de los resultados.
Además, para que el proceso sea más eficiente, Vera integra estrategias de muestreo (Zouhar et al., 2025). La persona usuaria puede indicar qué proporción del corpus quiere evaluar y la plataforma selecciona automáticamente los segmentos más representativos e informativos. De este modo, es posible reducir el esfuerzo de anotación sin tener que evaluar manualmente todo el corpus, manteniendo una muestra adecuada para obtener información relevante sobre el rendimiento de los sistemas.
Creación y edición de referencias
La evaluación basada en referencia requiere disponer de traducciones humanas de referencia. Por eso, Vera también permite trabajar con los propios corpus de referencia desde la misma interfaz.
Las referencias existentes se pueden editar directamente y, cuando no hay una referencia disponible, se puede crear una nueva a partir de la salida de un sistema de traducción automática y su posterior posedición.
Esto permite preparar y revisar los datos necesarios para la evaluación sin tener que trasladarlos entre diferentes herramientas.
Resultados, correlaciones e informes
Una vez realizadas las evaluaciones, Vera permite consultar los resultados de la evaluación automática y humana desde la propia plataforma y comparar el rendimiento de los diferentes sistemas.
La plataforma también permite analizar la correlación entre las métricas automáticas y la evaluación humana, tanto a nivel de segmento como de sistema, mediante los coeficientes de Pearson y Spearman. Este análisis permite estudiar hasta qué punto las métricas automáticas se corresponden con el juicio humano en un determinado contexto.
Es precisamente aquí donde entra la metaevaluación: no se trata solo de saber qué sistema obtiene una puntuación más alta, sino de entender qué métricas ofrecen información más próxima a la evaluación humana y en qué situaciones pueden ser necesarias otras formas de evaluación.
Por último, Vera permite generar informes en PDF y exportar los resultados, las referencias y los corpus anotados en formatos CSV y JSON para utilizarlos en otros flujos de análisis.
Conclusiones
A lo largo de esta serie hemos recorrido las principales piezas que intervienen en la evaluación de la traducción automática: desde la construcción de los datasets hasta las métricas automáticas y la evaluación humana.
Como hemos visto, ninguno de estos enfoques ofrece por sí solo toda la información necesaria para evaluar un sistema de TA. La elección de los datos, los métodos de evaluación y la forma de interpretar los resultados forman parte de un mismo proceso.
Vera reúne estas diferentes etapas en un único flujo de trabajo, permitiendo combinar evaluación automática y humana, comparar sistemas y analizar la relación entre los resultados obtenidos por ambos enfoques.
Si quieres conocer la plataforma y ver cómo funciona, puedes solicitar una demo de Vera.
NOTAS
¹ Fuente: https://huggingface.co/spaces/BramVanroy/mateo-demo
² Fuente: https://github.com/langtech-bsc/mt-evaluation
³ Fuente: https://github.com/zouharvi/pearmut
BIBLIOGRAFÍA
Vanroy, Bram, Arda Tezcan, and Lieve Macken. "MATEO: MAchine translation evaluation online." Proceedings of the 24th Annual Conference of the European Association for Machine Translation. 2023.
Gilabert, Javier García, et al. "MT-LENS: An all-in-one toolkit for better machine translation evaluation." Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies (System Demonstrations). 2025.
Zouhar, Vilém, and Tom Kocmi. "Pearmut: Human evaluation of translation made trivial." arXiv preprint arXiv:2601.02933 (2026).
Zouhar, Vilém, Peng Cui, and Mrinmaya Sachan. "How to Select Datapoints for Efficient Human Evaluation of NLG Models?". Transactions of the Association for Computational Linguistics 13 (2025): 1789-1811.
González, Sofía García, et al. "VERA: A Platform for Automatic and Human Evaluation of Machine Translation." Proceedings of the 26th Annual Conference of the European Association for Machine Translation (Volume 2). 2026.