AuthenticIlm/Shamela4_Full_DB
Dataset com 10 – 100 milhões de exemplos — 10.0 mil downloads no Hugging Face. Shamela 4 — Full Islamic Library Corpus A complete extraction of al-Maktaba al-Shamela (الشاملة) v4, containing 8,589 books across 40 categor…
O dataset AuthenticIlm/Shamela4_Full_DB está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.
Ficha do dataset
- Tamanho: 10 – 100 milhões de exemplos
- Tarefas: geração de texto, fill mask, extração de entidades, perguntas e respostas, recuperação de texto
- Idiomas: árabe
- Licença: MIT
- Downloads: 10.0 mil · Curtidas: 18
Sobre o dataset
Shamela 4 — Full Islamic Library Corpus A complete extraction of al-Maktaba al-Shamela (الشاملة) v4, containing 8,589 books across 40 categories of classical Islamic sciences.
Como carregar
Use a biblioteca datasets do Hugging Face:
pip install -U datasets
Como é um dataset grande, vale carregar em modo streaming (sem baixar tudo):
from datasets import load_dataset
ds = load_dataset("AuthenticIlm/Shamela4_Full_DB", split="train", streaming=True)
for exemplo in ds.take(3):
print(exemplo)Tags
text-generation fill-mask token-classification question-answering text-retrieval islamic-studies arabic classical-arabic
Leia também
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos