Como medir a calidade dos sistemas de TA: integrar a avaliación na empresa

Ao longo desta serie de artigos vimos que avaliar correctamente un sistema de tradución automática (TA) implica tomar diferentes decisións: que datasets empregar, que métricas automáticas utilizar e como interpretar os seus resultados, cando recorrer á avaliación humana e con que metodoloxía, e como comprobar que os resultados son fiables.

Chegados a este punto, queda unha pregunta máis práctica: como integrar todo este proceso nun fluxo de traballo real?

Neste último artigo da serie repasamos algunhas das ferramentas que existen para facilitar a avaliación da tradución automática e presentamos Vera (González et al., 2026), a nosa plataforma de avaliación de TA, que reúne nun único contorno a avaliación automática, a avaliación humana e a análise comparativa dos resultados. 

 

O problema: fluxos de traballo fragmentados

Existen ferramentas que abordan diferentes aspectos da avaliación da tradución automática, pero cada unha adoita centrarse nunha parte concreta do proceso. MATEO (Vanroy et al., 2023)¹, por exemplo, céntrase no cálculo de métricas automáticas —como BLEU, chrF, TER, COMET ou BLEURT— a través dunha interface web. MT-LENS (Gilabert et al., 2025)² amplía a análise a aspectos como o nesgo ou a robustez, mentres que Pearmut (Zouhar e Kocmi, 2026)³ está orientada á avaliación humana mediante marcos como MQM, DA ou ESA, que vimos con máis detalle no artigo dedicado á avaliación humana.

Na práctica, isto pode implicar traballar con diferentes ferramentas, formatos e fluxos de traballo segundo o tipo de avaliación que se queira realizar. Vera parte precisamente desta necesidade de integrar estes diferentes enfoques nun único contorno e, ademais, permite analizar a relación entre os resultados das métricas automáticas e o xuízo humano. 

 

Avaliación automática

Vera calcula algunhas das métricas baseadas en referencia máis utilizadas: BLEU, chrF++ e TER, a través de SacreBLEU, e COMET.

Para comparar sistemas con maior rigor, a plataforma tamén permite analizar a significación estatística das diferenzas entre modelos mediante bootstrap resampling para cada métrica. Deste xeito, non só podemos saber que sistema obtén unha puntuación máis alta, senón tamén determinar se a diferenza observada é estatisticamente significativa.

Como vimos no artigo dedicado á avaliación automática, comprobar a significación estatística é unha das boas prácticas que deben terse en conta ao comparar sistemas de tradución. 

 

Avaliación humana con MQM Core

Para a avaliación humana, Vera utiliza MQM Core, un subconxunto do marco MQM amplamente empregado na industria.

A plataforma permite que varias persoas anotadoras traballen en paralelo sobre un mesmo proxecto, o que facilita o cálculo do acordo entre elas (Inter-Annotator Agreement, IAA). Esta medida permite analizar ata que punto as persoas avaliadoras coinciden nas súas anotacións e, polo tanto, achega información sobre a consistencia dos resultados.

Ademais, para que o proceso sexa máis eficiente, Vera integra estratexias de mostraxe (Zouhar et al., 2025). A persoa usuaria pode indicar que proporción do corpus quere avaliar e a plataforma selecciona automaticamente os segmentos máis representativos e informativos. Deste xeito, é posible reducir o esforzo de anotación sen ter que avaliar manualmente todo o corpus, mantendo unha mostra adecuada para obter información relevante sobre o rendemento dos sistemas. 

 

Creación e edición de referencias

A avaliación baseada en referencia require dispoñer de traducións humanas de referencia. Por iso, Vera tamén permite traballar cos propios corpus de referencia desde a mesma interface.

As referencias existentes pódense editar directamente e, cando non hai unha referencia dispoñible, pódese crear unha nova a partir da saída dun sistema de tradución automática e a súa posterior postedición.

Isto permite preparar e revisar os datos necesarios para a avaliación sen ter que trasladalos entre diferentes ferramentas. 

 

Resultados, correlacións e informes

Unha vez realizadas as avaliacións, Vera permite consultar os resultados da avaliación automática e humana desde a propia plataforma e comparar o rendemento dos diferentes sistemas.

A plataforma tamén permite analizar a correlación entre as métricas automáticas e a avaliación humana, tanto a nivel de segmento como de sistema, mediante os coeficientes de Pearson e Spearman. Esta análise permite estudar ata que punto as métricas automáticas se corresponden co xuízo humano nun determinado contexto.

É precisamente aquí onde entra a metaavaliación: non se trata só de saber que sistema obtén unha puntuación máis alta, senón de entender que métricas ofrecen información máis próxima á avaliación humana e en que situacións poden ser necesarias outras formas de avaliación.

Finalmente, Vera permite xerar informes en PDF e exportar os resultados, as referencias e os corpus anotados en formatos CSV e JSON para utilizalos noutros fluxos de análise. 

 

Conclusións

Ao longo desta serie percorremos as principais pezas que interveñen na avaliación da tradución automática: desde a construción dos datasets ata as métricas automáticas e a avaliación humana.

Como vimos, ningunha destas aproximacións ofrece por si soa toda a información necesaria para avaliar un sistema de TA. A elección dos datos, os métodos de avaliación e a forma de interpretar os resultados forman parte dun mesmo proceso.

Vera reúne estas diferentes etapas nun único fluxo de traballo, permitindo combinar avaliación automática e humana, comparar sistemas e analizar a relación entre os resultados obtidos por ambos os enfoques.

Se queres coñecer a plataforma e ver como funciona, podes solicitar unha demo de Vera. 

 


NOTAS

¹ Fonte: https://huggingface.co/spaces/BramVanroy/mateo-demo 

² Fonte: https://github.com/langtech-bsc/mt-evaluation 

³ Fonte: https://github.com/zouharvi/pearmut 

 


BIBLIOGRAFÍA

Vanroy, Bram, Arda Tezcan, and Lieve Macken. "MATEO: MAchine translation evaluation online." Proceedings of the 24th Annual Conference of the European Association for Machine Translation. 2023.

Gilabert, Javier García, et al. "MT-LENS: An all-in-one toolkit for better machine translation evaluation." Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies (System Demonstrations). 2025.

Zouhar, Vilém, and Tom Kocmi. "Pearmut: Human evaluation of translation made trivial." arXiv preprint arXiv:2601.02933 (2026).

Zouhar, Vilém, Peng Cui, and Mrinmaya Sachan. "How to Select Datapoints for Efficient Human Evaluation of NLG Models?". Transactions of the Association for Computational Linguistics 13 (2025): 1789-1811.

González, Sofía García, et al. "VERA: A Platform for Automatic and Human Evaluation of Machine Translation." Proceedings of the 26th Annual Conference of the European Association for Machine Translation (Volume 2). 2026. 

Tes un proxecto?

Pídenos orzamento sen compromiso.