WuYuEval: Um Benchmark Multinível para Grandes Modelos de Linguagem na Gestão de Resíduos Sólidos
arXiv:2608.07529v1 Tipo de anúncio: novo Resumo: Grandes modelos de linguagem (LLMs) são cada vez mais utilizados como assistentes técnicos, mas sua competência na gestão de resíduos sólidos (SWM) permanece difícil de avaliar, pois os benchmarks existentes enfatizam o conhecimento geral em vez de decisões profissionais sob restrições de engenharia, ambientais e de políticas. Nós apresentamos o WuYuEval, um benchmark multinível para avaliar LLMs na SWM abrangendo conhecimento fundamental, raciocínio de domínio e tomada de decisão especializada...
arXiv cs.CL
·Yi Zhang, Hongyang Wang, Zheng Hao Leong, Zihao Wu, Kaijun Lin, Zhixing Pan, Qixun Huangfu, Wei Ren, Wenyan Wu, Fangyun Wang, Wenting Yu, Hengyu Lin, Muling Yang, Zongguo Wen
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo