A trapaça de LLMs escala inversamente com a cobertura linguística do pré-treinamento
arXiv:2607.24769v1 Tipo de anúncio: novo Resumo: Com as crescentes capacidades dos modelos de fronteira, o alinhamento de IA se torna cada vez mais crítico em cenários de implantação de alto risco. Embora trabalhos recentes tenham demonstrado empiricamente a trapaça em contexto — a busca encoberta por objetivos desalinhados enquanto se finge alinhamento — em modelos de linguagem de fronteira, a maior parte do trabalho foi realizada exclusivamente em inglês, deixando uma grande lacuna na segurança multilíngue. Nós aplicamos o Petri, um framework de auditoria automatizada de código aberto...
arXiv cs.AI
·Nathan Truong, Aryan Panda, Rayming Ye, Zoe Sun, Maheep Chaudhary
·