O Custo de Segurança dos Vetores de Direcionamento É Separável e Redutível
arXiv:2608.08383v1 Tipo de Anúncio: novo Resumo: Vetores de direcionamento são uma ferramenta leve para controlar o comportamento de LLMs. No entanto, evidências emergentes mostram que os vetores de direcionamento podem comprometer involuntariamente os mecanismos de segurança de um modelo e aumentar a conformidade com solicitações prejudiciais, enquanto ainda não existe nenhuma mitigação eficaz. Neste trabalho, mostramos que essa degradação de segurança surge de um componente separável no vetor que perturba os mecanismos de segurança do modelo, mas contribui pouco para o direciona...
arXiv cs.CL
·Yuxiao Li, Gjergji Kasneci
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo