SurveyReview: Um benchmark alinhado a revisores para avaliadores de surveys

arXiv:2608.07641v1 Tipo de anúncio: novo Resumo: O rápido avanço dos grandes modelos de linguagem transformou a escrita de surveys, que antes era um esforço manual de meses, em um processo automatizado. À medida que a geração ganha escala, a avaliação confiável se torna o gargalo, e os LLMs são cada vez mais usados como avaliadores de surveys. No entanto, as abordagens existentes dependem em grande parte de métodos prontos de LLM como juiz, sem um alinhamento sistemático aos revisores humanos, e ainda há uma carência de arcabouços sistemáticos para quantifica...

arXiv cs.CL ·Yuheng Zhang, Yuanchun Wang, Fanjin Zhang, Ruyu Zhao, Juanzi Li, Jie Tang, Jing Zhang ·
compartilhar: