Prompt Embedding Probes (PEP): Detecção de Alucinações em LLMs a Partir de Estados Ocultos

arXiv:2608.08024v1 Tipo de Anúncio: novo Resumo: Grandes modelos de linguagem (LLMs) conseguem gerar respostas fluentes e úteis, mas continuam propensos a alucinações. Nós apresentamos os Prompt Embedding Probes (PEP), um método white-box para detecção de alucinações em nível de resposta a partir dos estados ocultos de um LLM congelado. O PEP estende os probes lineares padrão ao ampliar a entrada com um pequeno número de prompt embeddings aprendíveis. Nós avaliamos o PEP no TriviaQA, no GSM8K e no MedQA usando modelos Qwen3 em múltiplas escalas. O PEP im...

arXiv cs.CL ·Zakhar Mrykhin, Valentin Malykh ·
compartilhar: