Dataset LLMs & Texto

nvidia/Nemotron-SFT-Math-v4

Dataset com 100 mil – 1 milhão de exemplos — 4.5 mil downloads no Hugging Face. Nemotron-SFT-Math-v4 Dataset Description: Nemotron-SFT-Math-v4 is a large-scale mathematical reasoning dataset containing model-generated reasoning tr…

Hugging Face · Datasets ·nvidia · ·↓ 4464 ·♥ 38

O dataset nvidia/Nemotron-SFT-Math-v4 está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.

Ficha do dataset

  • Tamanho: 100 mil – 1 milhão de exemplos
  • Tarefas: geração de texto
  • Formato/modalidade: texto
  • Idiomas: inglês
  • Licença: CC BY 4.0
  • Downloads: 4.5 mil · Curtidas: 38

Sobre o dataset

Nemotron-SFT-Math-v4 Dataset Description: Nemotron-SFT-Math-v4 is a large-scale mathematical reasoning dataset containing model-generated reasoning trajectories.

Como carregar

Use a biblioteca datasets do Hugging Face:

pip install -U datasets

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-SFT-Math-v4")
print(ds)
print(ds["train"][0])

Tags

text-generation math mathematical-reasoning text blend Nemotron_3_Ultra supervised-fine-tuning

Explorar o dataset no Hugging Face →

compartilhar: