Dataset LLMs & Texto

AuthenticIlm/Shamela4_Full_DB

Dataset com 10 – 100 milhões de exemplos — 10.0 mil downloads no Hugging Face. Shamela 4 — Full Islamic Library Corpus A complete extraction of al-Maktaba al-Shamela (الشاملة) v4, containing 8,589 books across 40 categor…

Hugging Face · Datasets ·AuthenticIlm · ·↓ 10006 ·♥ 18

O dataset AuthenticIlm/Shamela4_Full_DB está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.

Ficha do dataset

  • Tamanho: 10 – 100 milhões de exemplos
  • Tarefas: geração de texto, fill mask, extração de entidades, perguntas e respostas, recuperação de texto
  • Idiomas: árabe
  • Licença: MIT
  • Downloads: 10.0 mil · Curtidas: 18

Sobre o dataset

Shamela 4 — Full Islamic Library Corpus A complete extraction of al-Maktaba al-Shamela (الشاملة) v4, containing 8,589 books across 40 categories of classical Islamic sciences.

Como carregar

Use a biblioteca datasets do Hugging Face:

pip install -U datasets

Como é um dataset grande, vale carregar em modo streaming (sem baixar tudo):

from datasets import load_dataset

ds = load_dataset("AuthenticIlm/Shamela4_Full_DB", split="train", streaming=True)
for exemplo in ds.take(3):
    print(exemplo)

Tags

text-generation fill-mask token-classification question-answering text-retrieval islamic-studies arabic classical-arabic

Explorar o dataset no Hugging Face →

compartilhar: