LivingArena: Será que LLMs sabem o que outros LLMs não sabem? Sondagem entre pares como avaliação escalável
arXiv:2607.24780v1 Tipo de anúncio: novo Resumo: Avaliar LLMs de fronteira é um desafio: benchmarks estáticos sofrem com contaminação e saturação — deixando os usuários incapazes de distinguir os principais modelos e os desenvolvedores cegos para modos de falha específicos — enquanto a preferência humana é subjetiva. Neste artigo, nossa pergunta é: \emph{Será que LLMs sabem o que outros LLMs não sabem? E podemos aproveitar essa dinâmica para avaliação?} Apresentamos o \textbf{LivingArena}, um framework de avaliação automatizado e resistente à contaminação...
arXiv cs.AI
·Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo
·
// relacionados
Leia também
Blog
Liquid AI lança LFM2.5-Encoder-230M e LFM2.5-Encoder-350M: codificadores bidirecionais que permanecem rápidos com contexto de 8K na CPU
Blog
Memory for Large Language Models
Blog
When Does Deep Representation Learning Help Single-Cell Clustering? A Sensitivity-Aware Diagnostic Benchmark for Biomedical AI Pipelines
Blog