SurveyReview: Um benchmark alinhado a revisores para avaliadores de surveys
arXiv:2608.07641v1 Tipo de anúncio: novo Resumo: O rápido avanço dos grandes modelos de linguagem transformou a escrita de surveys, que antes era um esforço manual de meses, em um processo automatizado. À medida que a geração ganha escala, a avaliação confiável se torna o gargalo, e os LLMs são cada vez mais usados como avaliadores de surveys. No entanto, as abordagens existentes dependem em grande parte de métodos prontos de LLM como juiz, sem um alinhamento sistemático aos revisores humanos, e ainda há uma carência de arcabouços sistemáticos para quantifica...
arXiv cs.CL
·Yuheng Zhang, Yuanchun Wang, Fanjin Zhang, Ruyu Zhao, Juanzi Li, Jie Tang, Jing Zhang
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo