As métricas de avaliação detectam erros em traduções do chinês clássico para o inglês?

arXiv:2608.08283v1 Tipo de anúncio: novo Resumo: Embora os grandes modelos de linguagem consigam traduzir alguns idiomas históricos surpreendentemente bem, sua utilidade em fluxos de trabalho de humanidades digitais é limitada pela falta de uma avaliação confiável. Investigamos se as métricas de avaliação automática existentes, desenvolvidas para idiomas modernos, são confiáveis nesse contexto, usando a tradução do chinês clássico para o inglês como um estudo de caso. Apresentamos um arcabouço de diagnóstico baseado em pares mínimos que capturam t...

arXiv cs.CL ·Osvaldo Quinjica, Eric Bennett, Xinchen Yang, Andrew Schonebaum, Marine Carpuat ·
compartilhar: