Dataset
LLMs & Texto
Qwen/AgentWorldBench
Dataset em destaque no Hugging Face — 2.4 mil downloads. AgentWorldBench AgentWorldBench is a comprehensive evaluation benchmark for language world models, constructed from real-world observations of frontie…
Hugging Face · Datasets
·Qwen
·
·↓ 2441
·♥ 79
O dataset Qwen/AgentWorldBench está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.
Ficha do dataset
- Tarefas: geração de texto
- Idiomas: inglês
- Licença: Apache 2.0
- Downloads: 2.4 mil · Curtidas: 79
Sobre o dataset
AgentWorldBench AgentWorldBench is a comprehensive evaluation benchmark for language world models, constructed from real-world observations of frontier model trajectories on established benchmarks such as Tool Decathlon, Terminal-Bench 1.
Como carregar
Use a biblioteca datasets do Hugging Face:
pip install -U datasets
from datasets import load_dataset
ds = load_dataset("Qwen/AgentWorldBench")
print(ds)
print(ds["train"][0])Tags
text-generation world-model agent benchmark evaluation environment-simulation qwen