Das probabilidades de tokens à confiança calibrada: Um estudo empírico sobre respostas a perguntas matemáticas

arXiv:2608.07827v1 Tipo de anúncio: novo Resumo: A estimativa de confiança para grandes modelos de linguagem (LLMs) visa estimar a probabilidade de que uma resposta gerada esteja correta, enquanto a calibração alinha essas estimativas com a acurácia empírica. Trabalhos anteriores mostraram que as probabilidades de tokens são frequentemente superconfiantes; investigamos se esses sinais prontamente disponíveis podem, ainda assim, fornecer uma estimativa de confiança bem calibrada para respostas a perguntas matemáticas. Comparamos estimadores de passagem única, ...

arXiv cs.LG ·Avery Ma, Lorne Schell, Vin Bhaskara, Leila Pishdad ·
compartilhar: