Quem verifica o benchmark? Descentralizando a confiança na avaliação de grandes modelos de linguagem

arXiv:2608.07762v1 Tipo de anúncio: novo Resumo: Benchmarks de LLM podem construir a reputação de uma organização e atrair clientes, mas somente quando os resultados são transparentes e verificáveis. Alegações não verificadas de que o DeepSeek R1 teria superado o o1 da OpenAI contribuíram para o pânico no mercado em 27 de janeiro de 2025, quando a Nvidia perdeu US$ 589 bilhões em valor de mercado. No entanto, os benchmarks de fornecedores muitas vezes dependem de um sistema de honra. Reavaliações acadêmicas e placares de liderança independentes encontraram mudanças não divulgadas em modelos proprietários, co...

arXiv cs.AI ·Sahil Pardasani, Madhusudan Singh ·
compartilhar: