Thinking vs. NoThinking: rumo à interpretação dos mecanismos de raciocínio de grandes modelos de linguagem por meio de autoencoders esparsos
arXiv:2608.08168v1 Tipo de anúncio: novo Resumo: Embora os LLMs que empregam a Cadeia de Pensamento (CoT) exibam capacidades de raciocínio superiores, os mecanismos neurais que distinguem esse modo explícito de Pensamento (Thinking) da geração direta de respostas (modo NoThinking) permanecem pouco compreendidos. Para desconstruir esse processo cognitivo, aplicamos autoencoders esparsos Top-K (SAEs) às representações intermediárias do DeepSeek-R1-Distill-Qwen-7B e examinamos os comportamentos divergentes do modelo em problemas de matemática-...
arXiv cs.CL
·Bo Cheng, Qiaolin Lu, Yi Chang, Yuan Wu
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo