HarmProfile: Characterizing Harmful Distributions in Frontier LLMs

HarmProfile: Characterizing Harmful Distributions in Frontier LLMs

HarmProfile is a benchmark dataset that characterizes frontier LLM safety failures through content analysis, revealing that harmfulness and diversity increase with model capability…

Hugging Face · Daily Papers ·Zhouyuan Ma, Yutao Wu · ·▲ 19 upvotes

Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.

Autores: Zhouyuan Ma, Yutao Wu, Hanxun Huang, Xiang Zheng, Xiao Liu, Yixin Cao

  • 19 upvotes da comunidade
  • Temas: large language models, safety evaluation, harmful generation, HarmProfile, risk profile, harm categories

Resumo

Resumo original (em inglês), extraído do paper:

HarmProfile is a benchmark dataset that characterizes frontier LLM safety failures through content analysis, revealing that harmfulness and diversity increase with model capability.

Onde ler

compartilhar: