Dataset LLMs & Texto

ajibawa-2023/Shell-Code-Large

Dataset com 100 mil – 1 milhão de exemplos — 299 downloads no Hugging Face. Shell-Code-Large Shell-Code-Large is a large-scale corpus of Shell scripting source code comprising approximately 640,000 code samples stored in JSON…

Hugging Face · Datasets ·ajibawa-2023 · ·↓ 299 ·♥ 19

O dataset ajibawa-2023/Shell-Code-Large está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.

Ficha do dataset

  • Tamanho: 100 mil – 1 milhão de exemplos
  • Tarefas: geração de texto
  • Idiomas: inglês
  • Licença: MIT
  • Downloads: 299 · Curtidas: 19

Sobre o dataset

Shell-Code-Large Shell-Code-Large is a large-scale corpus of Shell scripting source code comprising approximately 640,000 code samples stored in JSON Lines (.

Como carregar

Use a biblioteca datasets do Hugging Face:

pip install -U datasets

from datasets import load_dataset

ds = load_dataset("ajibawa-2023/Shell-Code-Large")
print(ds)
print(ds["train"][0])

Tags

text-generation Shell Code LLM Training

Explorar o dataset no Hugging Face →

compartilhar: