Dataset LLMs & Texto

Qwen/AgentWorldBench

Dataset em destaque no Hugging Face — 2.4 mil downloads. AgentWorldBench AgentWorldBench is a comprehensive evaluation benchmark for language world models, constructed from real-world observations of frontie…

Hugging Face · Datasets ·Qwen · ·↓ 2441 ·♥ 79

O dataset Qwen/AgentWorldBench está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.

Ficha do dataset

  • Tarefas: geração de texto
  • Idiomas: inglês
  • Licença: Apache 2.0
  • Downloads: 2.4 mil · Curtidas: 79

Sobre o dataset

AgentWorldBench AgentWorldBench is a comprehensive evaluation benchmark for language world models, constructed from real-world observations of frontier model trajectories on established benchmarks such as Tool Decathlon, Terminal-Bench 1.

Como carregar

Use a biblioteca datasets do Hugging Face:

pip install -U datasets

from datasets import load_dataset

ds = load_dataset("Qwen/AgentWorldBench")
print(ds)
print(ds["train"][0])

Tags

text-generation world-model agent benchmark evaluation environment-simulation qwen

Explorar o dataset no Hugging Face →

compartilhar: