When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles
Paper LLMs & Texto

When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles

Activation Oracles can become concept-specific anti-readers that selectively fail to recover internally represented hidden concepts, revealing reliability concerns for learned inte…

Hugging Face · Daily Papers ·Tobias Bersia, Tatiana Gaintseva · ·▲ 10 upvotes

Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.

Autores: Tobias Bersia, Tatiana Gaintseva

  • 10 upvotes da comunidade
  • Temas: Activation Oracles, internal activations, fine-tuned, Taboo Word Guessing, LogitLens, layer-ablation

Resumo

Resumo original (em inglês), extraído do paper:

Activation Oracles can become concept-specific anti-readers that selectively fail to recover internally represented hidden concepts, revealing reliability concerns for learned interpretability interfaces.

Onde ler

compartilhar: