WuYuEval: Um Benchmark Multinível para Grandes Modelos de Linguagem na Gestão de Resíduos Sólidos

arXiv:2608.07529v1 Tipo de anúncio: novo Resumo: Grandes modelos de linguagem (LLMs) são cada vez mais utilizados como assistentes técnicos, mas sua competência na gestão de resíduos sólidos (SWM) permanece difícil de avaliar, pois os benchmarks existentes enfatizam o conhecimento geral em vez de decisões profissionais sob restrições de engenharia, ambientais e de políticas. Nós apresentamos o WuYuEval, um benchmark multinível para avaliar LLMs na SWM abrangendo conhecimento fundamental, raciocínio de domínio e tomada de decisão especializada...

arXiv cs.CL ·Yi Zhang, Hongyang Wang, Zheng Hao Leong, Zihao Wu, Kaijun Lin, Zhixing Pan, Qixun Huangfu, Wei Ren, Wenyan Wu, Fangyun Wang, Wenting Yu, Hengyu Lin, Muling Yang, Zongguo Wen ·
compartilhar: