Ao longo desta serie de artigos vimos que avaliar correctamente un sistema de tradución automática (TA) implica tomar diferentes decisións: que datasets empregar, que métricas automáticas utilizar e como interpretar os seus resultados, cando recorrer á avaliación humana e con que metodoloxía, e como comprobar que os resultados son fiables.
Chegados a este punto, queda unha pregunta máis práctica: como integrar todo este proceso nun fluxo de traballo real?
Neste último artigo da serie repasamos algunhas das ferramentas que existen para facilitar a avaliación da tradución automática e presentamos Vera (González et al., 2026), a nosa plataforma de avaliación de TA, que reúne nun único contorno a avaliación automática, a avaliación humana e a análise comparativa dos resultados.
O problema: fluxos de traballo fragmentados
Existen ferramentas que abordan diferentes aspectos da avaliación da tradución automática, pero cada unha adoita centrarse nunha parte concreta do proceso. MATEO (Vanroy et al., 2023)¹, por exemplo, céntrase no cálculo de métricas automáticas —como BLEU, chrF, TER, COMET ou BLEURT— a través dunha interface web. MT-LENS (Gilabert et al., 2025)² amplía a análise a aspectos como o nesgo ou a robustez, mentres que Pearmut (Zouhar e Kocmi, 2026)³ está orientada á avaliación humana mediante marcos como MQM, DA ou ESA, que vimos con máis detalle no artigo dedicado á avaliación humana.
Na práctica, isto pode implicar traballar con diferentes ferramentas, formatos e fluxos de traballo segundo o tipo de avaliación que se queira realizar. Vera parte precisamente desta necesidade de integrar estes diferentes enfoques nun único contorno e, ademais, permite analizar a relación entre os resultados das métricas automáticas e o xuízo humano.
Avaliación automática
Vera calcula algunhas das métricas baseadas en referencia máis utilizadas: BLEU, chrF++ e TER, a través de SacreBLEU, e COMET.
Para comparar sistemas con maior rigor, a plataforma tamén permite analizar a significación estatística das diferenzas entre modelos mediante bootstrap resampling para cada métrica. Deste xeito, non só podemos saber que sistema obtén unha puntuación máis alta, senón tamén determinar se a diferenza observada é estatisticamente significativa.
Como vimos no artigo dedicado á avaliación automática, comprobar a significación estatística é unha das boas prácticas que deben terse en conta ao comparar sistemas de tradución.
Avaliación humana con MQM Core
Para a avaliación humana, Vera utiliza MQM Core, un subconxunto do marco MQM amplamente empregado na industria.
A plataforma permite que varias persoas anotadoras traballen en paralelo sobre un mesmo proxecto, o que facilita o cálculo do acordo entre elas (Inter-Annotator Agreement, IAA). Esta medida permite analizar ata que punto as persoas avaliadoras coinciden nas súas anotacións e, polo tanto, achega información sobre a consistencia dos resultados.
Ademais, para que o proceso sexa máis eficiente, Vera integra estratexias de mostraxe (Zouhar et al., 2025). A persoa usuaria pode indicar que proporción do corpus quere avaliar e a plataforma selecciona automaticamente os segmentos máis representativos e informativos. Deste xeito, é posible reducir o esforzo de anotación sen ter que avaliar manualmente todo o corpus, mantendo unha mostra adecuada para obter información relevante sobre o rendemento dos sistemas.
Creación e edición de referencias
A avaliación baseada en referencia require dispoñer de traducións humanas de referencia. Por iso, Vera tamén permite traballar cos propios corpus de referencia desde a mesma interface.
As referencias existentes pódense editar directamente e, cando non hai unha referencia dispoñible, pódese crear unha nova a partir da saída dun sistema de tradución automática e a súa posterior postedición.
Isto permite preparar e revisar os datos necesarios para a avaliación sen ter que trasladalos entre diferentes ferramentas.
Resultados, correlacións e informes
Unha vez realizadas as avaliacións, Vera permite consultar os resultados da avaliación automática e humana desde a propia plataforma e comparar o rendemento dos diferentes sistemas.
A plataforma tamén permite analizar a correlación entre as métricas automáticas e a avaliación humana, tanto a nivel de segmento como de sistema, mediante os coeficientes de Pearson e Spearman. Esta análise permite estudar ata que punto as métricas automáticas se corresponden co xuízo humano nun determinado contexto.
É precisamente aquí onde entra a metaavaliación: non se trata só de saber que sistema obtén unha puntuación máis alta, senón de entender que métricas ofrecen información máis próxima á avaliación humana e en que situacións poden ser necesarias outras formas de avaliación.
Finalmente, Vera permite xerar informes en PDF e exportar os resultados, as referencias e os corpus anotados en formatos CSV e JSON para utilizalos noutros fluxos de análise.
Conclusións
Ao longo desta serie percorremos as principais pezas que interveñen na avaliación da tradución automática: desde a construción dos datasets ata as métricas automáticas e a avaliación humana.
Como vimos, ningunha destas aproximacións ofrece por si soa toda a información necesaria para avaliar un sistema de TA. A elección dos datos, os métodos de avaliación e a forma de interpretar os resultados forman parte dun mesmo proceso.
Vera reúne estas diferentes etapas nun único fluxo de traballo, permitindo combinar avaliación automática e humana, comparar sistemas e analizar a relación entre os resultados obtidos por ambos os enfoques.
Se queres coñecer a plataforma e ver como funciona, podes solicitar unha demo de Vera.
NOTAS
¹ Fonte: https://huggingface.co/spaces/BramVanroy/mateo-demo
² Fonte: https://github.com/langtech-bsc/mt-evaluation
³ Fonte: https://github.com/zouharvi/pearmut
BIBLIOGRAFÍA
Vanroy, Bram, Arda Tezcan, and Lieve Macken. "MATEO: MAchine translation evaluation online." Proceedings of the 24th Annual Conference of the European Association for Machine Translation. 2023.
Gilabert, Javier García, et al. "MT-LENS: An all-in-one toolkit for better machine translation evaluation." Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies (System Demonstrations). 2025.
Zouhar, Vilém, and Tom Kocmi. "Pearmut: Human evaluation of translation made trivial." arXiv preprint arXiv:2601.02933 (2026).
Zouhar, Vilém, Peng Cui, and Mrinmaya Sachan. "How to Select Datapoints for Efficient Human Evaluation of NLG Models?". Transactions of the Association for Computational Linguistics 13 (2025): 1789-1811.
González, Sofía García, et al. "VERA: A Platform for Automatic and Human Evaluation of Machine Translation." Proceedings of the 26th Annual Conference of the European Association for Machine Translation (Volume 2). 2026.