Dataset LLMs & Texto

HuggingFaceH4/ultrachat_200k

Dataset com 100 mil – 1 milhão de exemplos — 73.3 mil downloads no Hugging Face. Dataset Card for UltraChat 200k Dataset Description This is a heavily filtered version of the UltraChat dataset and was used to train Zephyr-7B-β, a…

Hugging Face · Datasets ·HuggingFaceH4 · ·↓ 73327 ·♥ 867

O dataset HuggingFaceH4/ultrachat_200k está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.

Ficha do dataset

  • Tamanho: 100 mil – 1 milhão de exemplos
  • Tarefas: geração de texto
  • Idiomas: inglês
  • Licença: MIT
  • Downloads: 73.3 mil · Curtidas: 867

Sobre o dataset

Dataset Card for UltraChat 200k Dataset Description This is a heavily filtered version of the UltraChat dataset and was used to train Zephyr-7B-β, a state of the art 7b chat model.

Como carregar

Use a biblioteca datasets do Hugging Face:

pip install -U datasets

from datasets import load_dataset

ds = load_dataset("HuggingFaceH4/ultrachat_200k")
print(ds)
print(ds["train"][0])

Tags

text-generation

Explorar o dataset no Hugging Face →

compartilhar: