Como medir a calidade dos sistemas de TA: o papel das métricas automáticas

No artigo anterior desta serie vimos que unha avaliación fiable da tradución automática comeza pola construción dun bo dataset: hai que definir que queremos medir, escoller o nivel de análise axeitado e asegurarse de que os datos representan realmente o contexto no que se utilizará o sistema.

Unha vez dispoñemos destes datos, a seguinte pregunta é: como medimos a calidade das traducións?

Hoxe en día, a avaliación humana segue sendo a referencia para determinar a calidade dunha tradución, tanto automática como humana. Porén, é un proceso custoso, tanto en tempo como en recursos, e non sempre é posible dispoñer de profesionais, tempo ou medios técnicos suficientes para avaliar grandes volumes de datos. Por iso, na práctica, as métricas automáticas desempeñan un papel fundamental, especialmente cando se necesita avaliar sistemas a escala.

Neste artigo repasamos os principais tipos de métricas automáticas, as súas vantaxes e limitacións, algunhas boas prácticas para evitar conclusións erradas e o papel cada vez máis relevante dos LLM como xuíces.

 

1. Tipos de métricas

As métricas automáticas pódense clasificar atendendo a dous criterios principais: se necesitan ou non unha referencia humana e que tipo de información empregan para comparar as traducións, desde a coincidencia superficial entre textos ata a súa representación semántica.

1.1. Dependentes e non dependentes dunha referencia

Métricas dependentes de referencia (reference-based): comparan a saída do sistema cunha ou varias traducións de referencia realizadas por persoas. É o enfoque máis habitual e inclúe métricas como BLEU (Papineni et al., 2002), chrF (Popović, 2015) ou COMET (Rei et al., 2020).

O seu principal punto débil é evidente: necesitan unha tradución de referencia de calidade. Como vimos no artigo anterior, a construción destas referencias é un aspecto fundamental da avaliación e non sempre é posible dispoñer delas.

Métricas non dependentes de referencia (reference-free ou quality estimation): estiman a calidade da tradución comparando directamente o texto de orixe coa tradución producida, sen necesitar unha referencia humana. Estas métricas están adestradas con datos procedentes de avaliacións humanas. Algúns exemplos son COMETKiwi (Rei et al., 2022) e MetricX-QE (Juraska et al., 2025).

Este tipo de métricas resulta especialmente útil cando:

  • non existen referencias humanas, por exemplo, en dominios moi especializados; 
  • se quere avaliar en produción ou en tempo real, sen referencias dispoñibles;  
  • se queren detectar traducións de baixa calidade antes de que pasen por revisión humana —o que se coñece como quality estimation aplicada—, por exemplo, en fluxos de postedición.  

O seu principal risco é que, ao non contar cunha referencia humana como punto de comparación, poden ser máis sensibles aos erros sistemáticos do propio modelo, aos nesgos presentes nos datos cos que foron adestradas ou á falta de recursos para determinadas linguas, especialmente as de poucos recursos.

1.2. Métricas léxicas: de tokens e caracteres á distancia de edición

As métricas léxicas comparan a saída do sistema e a referencia a nivel de superficie textual, sen representar directamente o significado. Dentro deste grupo atopamos diferentes enfoques:

  • Baseadas en n-gramas de tokens (palabras): comparan secuencias de palabras entre a tradución e a referencia. O exemplo máis coñecido é BLEU, que mide a coincidencia de n-gramas. Existen tamén variantes como METEOR (Banerjee et al., 2005), que engade correspondencias por sinónimos e raíces léxicas.
  • Baseadas en caracteres: métricas como chrF traballan con n-gramas de caracteres en lugar de palabras. Isto pode facelas máis robustas ante linguas morfoloxicamente ricas ou con alta variación flexiva, nas que pequenos cambios na forma dunha palabra —por exemplo, de xénero, número ou tempo verbal— poderían ser penalizados inxustamente por unha métrica baseada en tokens. 
  • Baseadas en medidas de distancia: métricas como TER (Translation Edit Rate) (Snover et al., 2006) calculan o número mínimo de edicións —insercións, borrados, substitucións ou reordenacións— necesarias para converter a saída do sistema na referencia. Cantas menos edicións sexan necesarias, mellor será a puntuación.

O problema común a estas métricas é que miden principalmente a coincidencia superficial: unha tradución correcta pero formulada con palabras diferentes ás da referencia pode recibir unha puntuación baixa, mentres que unha tradución que comparte os mesmos termos pode obter unha boa puntuación mesmo se presenta problemas sintácticos. 

Ademais, tradicionalmente resultou difícil comparar resultados de BLEU obtidos en diferentes estudos, xa que pequenas diferenzas na implementación —especialmente na tokenización— podían provocar variacións importantes na puntuación final. Por este motivo, para calcular BLEU, chrF e TER recoméndase empregar SacreBLEU (Post, 2018), que estandariza as condicións de cálculo e facilita a comparación entre resultados.

1.3. Métricas baseadas en embeddings

Para superar algunhas das limitacións das métricas léxicas, xurdiron métricas que buscan comparar o significado en lugar da forma superficial, empregando representacións vectoriais (embeddings) xeradas por modelos de linguaxe.

Exemplos coñecidos son BERTScore (Zhang et al., 2020), COMET ou BLEURT (Sellam et al., 2020). Estas métricas representan a tradución e a referencia —e, nalgúns casos, tamén o texto de orixe— mediante vectores e calculan a súa similitude nese espazo.

Isto permite, entre outras cousas:

  • detectar paráfrases correctas aínda que non compartan exactamente as mesmas palabras que a referencia;  
  • ser máis sensibles a determinados erros de significado que unha comparación puramente léxica podería pasar por alto;  
  • obter, en determinados contextos, unha maior correlación cos xuízos humanos.

 

2. Vantaxes e limitacións das métricas automáticas

As métricas automáticas teñen un papel claro e útil na avaliación, pero non ofrecen por si soas unha visión completa da calidade.

Vantaxes
  • Velocidade: permiten avaliar miles ou mesmo millóns de segmentos en moi pouco tempo, algo que non sería viable mediante avaliación humana.  
  • Reproducibilidade: dado o mesmo sistema e o mesmo dataset, o resultado é consistente, o que facilita comparar sistemas, versións ou configuracións ao longo do tempo.  
  • Custo: non requiren mobilizar persoas avaliadoras para cada execución, polo que permiten avaliar grandes volumes de datos con poucos recursos.
Limitacións
  • Opacidade: unha puntuación non sempre permite saber por que un sistema obtivo ese resultado. Isto dificulta o diagnóstico de problemas concretos.  
  • Dificultade para identificar erros específicos: unha métrica pode proporcionar unha puntuación global, pero non indicar se os problemas están relacionados coa concordancia de xénero, coa terminoloxía, coas omisións ou con outros tipos de erro. Así, unha boa puntuación pode esconder problemas relevantes para a posta en produción. Para abordar parcialmente esta limitación, nos últimos anos xurdiron métricas como xCOMET (Guerreiro et al., 2024), que ademais de proporcionar unha puntuación poden detectar erros e clasificalos segundo a súa gravidade.
  • Sensibilidade á calidade da referencia: nas métricas reference-based, unha referencia deficiente pode distorcer directamente o resultado.  
  • Correlación imperfecta cos xuízos humanos: mesmo as métricas máis avanzadas non substitúen completamente a avaliación humana, especialmente cando entran en xogo aspectos como os matices estilísticos, a adecuación cultural ou a coherencia discursiva a longo prazo.

En definitiva, as métricas automáticas son especialmente útiles para facer seguimento, comparar sistemas e detectar posibles problemas a grande escala, pero non deberían interpretarse como un substituto definitivo do xuízo humano cando se trata de tomar decisións de alto impacto.

 

3. Boas prácticas na avaliación automática

Non abonda con escoller unha métrica e calcular unha puntuación. A forma de deseñar e interpretar a avaliación tamén determina a validez dos resultados.

En 2021, Marie et al. analizaron 769 artigos científicos sobre avaliación de tradución automática publicados entre 2010 e 2020. O estudo identificou varias deficiencias recorrentes nas metodoloxías empregadas e nas conclusións extraídas, entre elas o uso exclusivo de BLEU, a ausencia de probas de significación estatística ou a comparación con resultados de traballos anteriores obtidos en condicións diferentes.

A partir destas cuestións, pódense destacar varias recomendacións:

  • Non depender exclusivamente de BLEU ou dunha única métrica. É recomendable combinar diferentes métricas ou complementalas con avaliación humana, especialmente cando se queren obter conclusións sólidas sobre a calidade dun sistema.  
  • Realizar probas de significación estatística. Ao comparar dous sistemas, unha diferenza de puntuación non implica necesariamente que un deles sexa significativamente mellor. As probas estatísticas permiten determinar se a diferenza observada podería deberse ao azar.
  • Non comparar directamente puntuacións tomadas doutros estudos. Os resultados obtidos en traballos anteriores só deberían compararse cando as condicións de cálculo son equivalentes e se dispón da información necesaria para reproducilas.  
  • Comparar sistemas en igualdade de condicións. Cando se quere atribuír unha diferenza de resultados aos propios sistemas ou métodos, é necesario controlar factores como os datos de adestramento, validación e proba e o preprocesamento empregado.  

Estas prácticas —variedade de métricas, rigor estatístico e comparación en condicións equivalentes— son fundamentais para interpretar correctamente os resultados dunha avaliación automática.

 

4. Os LLM como xuíces

Unha das tendencias máis recentes na avaliación é o emprego de modelos de linguaxe de grande tamaño (LLM) par avaliar a calidade da tradución, xunto coas métricas tradicionais. Este enfoque, coñecido habitualmente como LLM-as-a-judge, está a gañar presenza en diferentes tarefas de procesamento da linguaxe natural.

Que opcións hai?

  • LLM xenéricos empregados directamente como xuíces, mediante prompts que lles indican que deben avaliar determinados aspectos da tradución, como a adecuación, a fluidez ou a gravidade dos erros, sen necesidade de adestramento adicional (Kocmi e Federmann, 2023b; Kocmi e Federmann, 2023a; Fu et al., 2024).
  • Modelos afinados especificamente para avaliación (fine-tuned), adestrados con xuízos humanos para predicir puntuacións próximas ás de persoas avaliadoras expertas (Treviso et al., 2024).
  • Enfoques axénticos, nos que se combinan as saídas de varios LLM, ben porque cada un avalía un aspecto concreto da tradución —como a adecuación, a fluidez, o estilo ou a terminoloxía— (Feng et al., 2025), ben porque as diferentes saídas se empregan de maneira contrastiva para identificar aquelas que achegan máis información ou captan mellor determinados matices (Wang et al., 2025).
Vantaxes
  • Poden xerar explicacións dos erros e non só unha puntuación, o que pode facelos útiles para o diagnóstico.
  • Poden axudar a identificar determinados erros críticos que as métricas tradicionais non detectan facilmente.
Limitacións
  • Custo e latencia: son máis lentos e caros de executar que moitas métricas tradicionais, especialmente a grande escala.  
  • Reproducibilidade: os resultados poden variar en función do modelo, do prompt ou mesmo da orde na que se presentan as traducións (Ye et al., 2025; Lin et al., 2025).
  • Nesgos do modelo: un LLM pode presentar preferencias sistemáticas que non necesariamente correspondan cunha maior calidade da tradución.  
  • Correlación cos xuízos humanos: aínda que poden mostrar unha boa correlación a nivel de sistema, o comportamento pode ser diferente a nivel de segmento, polo que os resultados agregados poden ocultar diferenzas relevantes (Gain et al., 2026).

Os LLM como xuíces representan, polo tanto, unha ferramenta prometedora para ampliar e axilizar a avaliación. Pero, do mesmo xeito que as métricas automáticas tradicionais, non eliminan a necesidade de avaliación humana en contextos nos que as decisións teñen un impacto elevado.

 

5. Conclusión

A avaliación automática é fundamental cando se necesita avaliar tradución automática a grande escala, pero obter unha puntuación non é suficiente.

Unha avaliación sólida require combinar métricas de diferente natureza, empregar datasets representativos, aplicar métodos estatísticos axeitados e coñecer as limitacións de cada ferramenta. As novas aproximacións baseadas en LLM amplían as posibilidades de análise, pero tamén introducen novos retos que deben terse en conta.

En definitiva, avaliar non consiste simplemente en obter unha puntuación, senón en saber que significa esa puntuación e que información necesitamos para tomar unha decisión. Esta perspectiva será especialmente importante cando comparemos diferentes sistemas e modelos de tradución automática e teñamos que decidir cal se adapta mellor a cada contexto de uso.

 


BIBLIOGRAFÍA

Papineni, Kishore, et al. "Bleu: a method for automatic evaluation of machine translation." Proceedings of the 40th annual meeting of the Association for Computational Linguistics. 2002.

Popović, Maja. "chrF: character n-gram F-score for automatic MT evaluation." Proceedings of the tenth workshop on statistical machine translation. 2015.

Rei, Ricardo, et al. "COMET: A neural framework for MT evaluation." Proceedings of the 2020 conference on empirical methods in natural language processing (emnlp). 2020.

Rei, Ricardo, et al. "COMET-22: Unbabel-IST 2022 submission for the metrics shared task." Proceedings of the Seventh Conference on Machine Translation (WMT). 2022.

Juraska, Juraj, et al. "Metricx-25 and gemspaneval: Google translate submissions to the wmt25 evaluation shared task." Proceedings of the Tenth Conference on Machine Translation. 2025.

Banerjee, Satanjeev, and Alon Lavie. "METEOR: An automatic metric for MT evaluation with improved correlation with human judgments." Proceedings of the acl workshop on intrinsic and extrinsic evaluation measures for machine translation and/or summarization. 2005.

Snover, Matthew, et al. "A study of translation edit rate with targeted human annotation." Proceedings of the 7th Conference of the Association for Machine Translation in the Americas: Technical Papers. 2006.

Post, Matt. "A call for clarity in reporting BLEU scores." Proceedings of the third conference on machine translation: Research papers. 2018.

Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, and Yoav Artzi. 2020. Bertscore: Evaluating text generation with bert.

Sellam, Thibault, Dipanjan Das, and Ankur Parikh. "BLEURT: Learning robust metrics for text generation." Proceedings of the 58th annual meeting of the association for computational linguistics. 2020.

Marie, Benjamin, Atsushi Fujita, and Raphael Rubino. "Scientific credibility of machine translation research: A meta-evaluation of 769 papers." Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers). 2021.

Guerreiro, Nuno M., Ricardo Rei, Daan van Stigt, Luisa Coheur, Pierre Colombo, and André F. T. Martins. "xCOMET: Transparent Machine Translation Evaluation through Fine-grained Error Detection." Transactions of the Association for Computational Linguistics 12. 2024. 979–995.

Kocmi, Tom, and Christian Federmann. "Large language models are state-of-the-art evaluators of translation quality." Proceedings of the 24th Annual Conference of the European Association for Machine Translation. 2023a.

Kocmi, Tom, and Christian Federmann. "GEMBA-MQM: Detecting translation quality error spans with GPT-4." Proceedings of the Eighth Conference on Machine Translation. 2023b.

Treviso, Marcos V., et al. "xtower: A multilingual llm for explaining and correcting translation errors." Findings of the Association for Computational Linguistics: EMNLP 2024. 2024.

Fu, Jinlan, et al. "Gptscore: Evaluate as you desire." Proceedings of the 2024 conference of the north american chapter of the association for computational linguistics: Human language technologies (volume 1: Long papers). 2024.

Feng, Zhaopeng, et al. "M-MAD: Multidimensional multi-agent debate for advanced machine translation evaluation." Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). 2025.

Wang, Xiao, et al. "ContrastScore: Towards higher quality, less biased, more efficient evaluation metrics with contrastive evaluation." Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics. 2025.

Shi, Lin, et al. "Judging the judges: A systematic study of position bias in llm-as-a-judge." Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics. 2025.

Gain, Baban, et al. "Bridging the linguistic divide: a survey on leveraging large language models for machine translation." Language Resources and Evaluation 60.2 (2026): 40. 

Tes un proxecto?

Pídenos orzamento sen compromiso.