Pensando muito, não com inteligência: modelos de raciocínio falham em racionar a computação em tempo de teste entre as questões

arXiv:2608.07968v1 Tipo de anúncio: novo Resumo: Modelos de linguagem de raciocínio usam cada vez mais a computação em tempo de teste para melhorar o desempenho, mas as avaliações existentes normalmente estudam essa computação uma questão por vez. No entanto, quando vários problemas compartilham uma restrição de custo ou latência de ponta a ponta, os modelos precisam decidir como dividir a computação limitada de inferência entre eles. Apresentamos um framework de avaliação em estilo de prova para estudar esse cenário, no qual um modelo deve distribuir um único orçamento compartilhado de tokens entre as questões...

arXiv cs.CL ·Chenrui Fan, Yize Cheng, Ming Li, Yongyuan Liang, Tianyi Zhou, Soheil Feizi ·
compartilhar: