Quem verifica o benchmark? Descentralizando a confiança na avaliação de grandes modelos de linguagem
arXiv:2608.07762v1 Tipo de anúncio: novo Resumo: Benchmarks de LLM podem construir a reputação de uma organização e atrair clientes, mas somente quando os resultados são transparentes e verificáveis. Alegações não verificadas de que o DeepSeek R1 teria superado o o1 da OpenAI contribuíram para o pânico no mercado em 27 de janeiro de 2025, quando a Nvidia perdeu US$ 589 bilhões em valor de mercado. No entanto, os benchmarks de fornecedores muitas vezes dependem de um sistema de honra. Reavaliações acadêmicas e placares de liderança independentes encontraram mudanças não divulgadas em modelos proprietários, co...
arXiv cs.AI
·Sahil Pardasani, Madhusudan Singh
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo