SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

SWE-Bench ProMax is a rigorously curated multilingual benchmark of large-scale code refactoring tasks that reveals substantial unsolved challenges for current AI coding agents.

Hugging Face · Daily Papers ·Yuling Shi, Jinghan Xu · ·▲ 75 upvotes

Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.

Autores: Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang

  • 75 upvotes da comunidade
  • Temas: SWE-Bench ProMax, code refactoring, multilingual benchmark, cross-file refactoring, agent scaffolds, resolve rate

Resumo

Resumo original (em inglês), extraído do paper:

SWE-Bench ProMax is a rigorously curated multilingual benchmark of large-scale code refactoring tasks that reveals substantial unsolved challenges for current AI coding agents.

Onde ler

compartilhar: