Prompt Embedding Probes (PEP): Detecção de Alucinações em LLMs a Partir de Estados Ocultos
arXiv:2608.08024v1 Tipo de Anúncio: novo Resumo: Grandes modelos de linguagem (LLMs) conseguem gerar respostas fluentes e úteis, mas continuam propensos a alucinações. Nós apresentamos os Prompt Embedding Probes (PEP), um método white-box para detecção de alucinações em nível de resposta a partir dos estados ocultos de um LLM congelado. O PEP estende os probes lineares padrão ao ampliar a entrada com um pequeno número de prompt embeddings aprendíveis. Nós avaliamos o PEP no TriviaQA, no GSM8K e no MedQA usando modelos Qwen3 em múltiplas escalas. O PEP im...
arXiv cs.CL
·Zakhar Mrykhin, Valentin Malykh
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo