UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
UniClawBench introduces a capability-driven benchmark for evaluating proactive agents in real-world environments using live Docker container evaluation and closed-loop assessment w…
Hugging Face · Daily Papers
·Zhekai Chen, Chengqi Duan
·
·▲ 31 upvotes
Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.
Autores: Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang
- 31 upvotes da comunidade
- Temas: large language models, multimodal large language models, proactive agents, real-world environments, capability-driven benchmark, skill usage
Resumo
Resumo original (em inglês), extraído do paper:
UniClawBench introduces a capability-driven benchmark for evaluating proactive agents in real-world environments using live Docker container evaluation and closed-loop assessment with multiple agent roles.