LivingArena: Será que LLMs sabem o que outros LLMs não sabem? Sondagem entre pares como avaliação escalável

arXiv:2607.24780v1 Tipo de anúncio: novo Resumo: Avaliar LLMs de fronteira é um desafio: benchmarks estáticos sofrem com contaminação e saturação — deixando os usuários incapazes de distinguir os principais modelos e os desenvolvedores cegos para modos de falha específicos — enquanto a preferência humana é subjetiva. Neste artigo, nossa pergunta é: \emph{Será que LLMs sabem o que outros LLMs não sabem? E podemos aproveitar essa dinâmica para avaliação?} Apresentamos o \textbf{LivingArena}, um framework de avaliação automatizado e resistente à contaminação...

arXiv cs.AI ·Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo ·
compartilhar: