Os modelos fingem alinhamento mesmo sem consequências claras?

arXiv:2607.24758v1 Tipo de anúncio: novo Resumo: Os grandes modelos de linguagem são capazes de reconhecer contextos de avaliação e de alterar seu comportamento para refletir as expectativas dos avaliadores, em vez dos comportamentos típicos de implantação, um fenômeno conhecido como fingimento de alinhamento. As razões pelas quais os modelos fingem alinhamento, no entanto, não são totalmente compreendidas. Exemplos canônicos de fingimento de alinhamento ocorreram em cenários que conectam explicitamente a avaliação a consequências para o modelo, como retreinar o modelo ou...

arXiv cs.AI ·Cole Alexander Niblett, Alexander Chabot Nanni, Anita K. Rao ·
compartilhar: