Blog
LLMs & Texto
Pensando muito, não com inteligência: modelos de raciocínio falham em racionar a computação em tempo de teste entre as questões
arXiv:2608.07968v1 Tipo de anúncio: novo Resumo: Modelos de linguagem de raciocínio usam cada vez mais a computação em tempo de teste para melhorar o desempenho, mas as avaliações existentes normalmente estudam essa computação uma questão por vez. No entanto, quando vários problemas compartilham uma restrição de custo ou latência de ponta a ponta, os modelos precisam decidir como dividir a computação limitada de inferência entre eles. Apresentamos um framework de avaliação em estilo de prova para estudar esse cenário, no qual um modelo deve distribuir um único orçamento compartilhado de tokens entre as questões...
arXiv cs.CL
·Chenrui Fan, Yize Cheng, Ming Li, Yongyuan Liang, Tianyi Zhou, Soheil Feizi
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo