HarmProfile: Characterizing Harmful Distributions in Frontier LLMs
HarmProfile is a benchmark dataset that characterizes frontier LLM safety failures through content analysis, revealing that harmfulness and diversity increase with model capability…
Hugging Face · Daily Papers
·Zhouyuan Ma, Yutao Wu
·
·▲ 19 upvotes
Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.
Autores: Zhouyuan Ma, Yutao Wu, Hanxun Huang, Xiang Zheng, Xiao Liu, Yixin Cao
- 19 upvotes da comunidade
- Temas: large language models, safety evaluation, harmful generation, HarmProfile, risk profile, harm categories
Resumo
Resumo original (em inglês), extraído do paper:
HarmProfile is a benchmark dataset that characterizes frontier LLM safety failures through content analysis, revealing that harmfulness and diversity increase with model capability.