Blog
LLMs & Texto
Os modelos fingem alinhamento mesmo sem consequências claras?
arXiv:2607.24758v1 Tipo de anúncio: novo Resumo: Os grandes modelos de linguagem são capazes de reconhecer contextos de avaliação e de alterar seu comportamento para refletir as expectativas dos avaliadores, em vez dos comportamentos típicos de implantação, um fenômeno conhecido como fingimento de alinhamento. As razões pelas quais os modelos fingem alinhamento, no entanto, não são totalmente compreendidas. Exemplos canônicos de fingimento de alinhamento ocorreram em cenários que conectam explicitamente a avaliação a consequências para o modelo, como retreinar o modelo ou...
arXiv cs.AI
·Cole Alexander Niblett, Alexander Chabot Nanni, Anita K. Rao
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo