Evo-Bench: Can Language Models Improve Agent Harness?

Evo-Bench: Can Language Models Improve Agent Harness?

Evo-Bench evaluates autonomous harness optimization across agent domains using sensitivity-aware task construction and reveals strong but domain-dependent evolution gains.

Hugging Face · Daily Papers ·Lisheng Huang, Chen Yang · ·▲ 7 upvotes

Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.

Autores: Lisheng Huang, Chen Yang, Hao Zhou, Huatong Song, Zongchao Chen, Ran Le

  • 7 upvotes da comunidade
  • Temas: harness evolution, autonomous agents, Evo-Bench, harness-guided construction, auxiliary-task evolution, sensitivity-aware stratified splitting

Resumo

Resumo original (em inglês), extraído do paper:

Evo-Bench evaluates autonomous harness optimization across agent domains using sensitivity-aware task construction and reveals strong but domain-dependent evolution gains.

Onde ler

compartilhar: