Dataset LLMs & Texto

r0b0tlab/qwen3.8-max-glm5.2-kimi-k3-distillation

Dataset com 10 mil – 100 mil exemplos — 1.5 mil downloads no Hugging Face. Multi-Teacher Distillation Dataset (57,937 traces) A quality-filtered, deduplicated, multi-teacher SFT corpus combining traces from three frontier mod…

Hugging Face · Datasets ·r0b0tlab · ·↓ 1486 ·♥ 57

O dataset r0b0tlab/qwen3.8-max-glm5.2-kimi-k3-distillation está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.

Ficha do dataset

  • Tamanho: 10 mil – 100 mil exemplos
  • Tarefas: geração de texto, conversational, text2text generation
  • Idiomas: inglês, chinês, espanhol, francês, alemão, japonês, …
  • Licença: proprietária / outra
  • Downloads: 1.5 mil · Curtidas: 57

Sobre o dataset

Multi-Teacher Distillation Dataset (57,937 traces) A quality-filtered, deduplicated, multi-teacher SFT corpus combining traces from three frontier models across math, code, reasoning, instruction-following, tool-use, science, long-context, multilingual, and creative dialogue domains.

Como carregar

Use a biblioteca datasets do Hugging Face:

pip install -U datasets

from datasets import load_dataset

ds = load_dataset("r0b0tlab/qwen3.8-max-glm5.2-kimi-k3-distillation")
print(ds)
print(ds["train"][0])

Tags

text-generation conversational text2text-generation distillation sft reasoning tool-use multi-turn

Explorar o dataset no Hugging Face →

compartilhar: