Dataset
LLMs & Texto
wikimedia/wikipedia
Dataset com menos de mil exemplos — 228.6 mil downloads no Hugging Face. Dataset Card for Wikimedia Wikipedia Dataset Summary Wikipedia dataset containing cleaned articles of all languages.
Hugging Face · Datasets
·wikimedia
·
·↓ 228617
·♥ 1365
O dataset wikimedia/wikipedia está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.
Ficha do dataset
- Tamanho: menos de mil exemplos
- Tarefas: geração de texto, fill mask
- Idiomas: ab, ace, ady, af, alt, am, …
- Licença: CC-BY-SA-3.0
- Downloads: 228.6 mil · Curtidas: 1.4 mil
Sobre o dataset
Dataset Card for Wikimedia Wikipedia Dataset Summary Wikipedia dataset containing cleaned articles of all languages.
Como carregar
Use a biblioteca datasets do Hugging Face:
pip install -U datasets
from datasets import load_dataset
ds = load_dataset("wikimedia/wikipedia")
print(ds)
print(ds["train"][0])Tags
text-generation fill-mask
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo