Dataset LLMs & Texto

averoo/low_resource_parallel_corpora

Dataset com 1 mil – 10 mil exemplos — 46 downloads no Hugging Face. The Little Prince — multiparallel corpus (22 languages, RU pivot) A sentence-level multiparallel corpus of Antoine de Saint-Exupéry's The Little Pr…

Hugging Face · Datasets ·averoo · ·↓ 46 ·♥ 9

O dataset averoo/low_resource_parallel_corpora está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.

Ficha do dataset

  • Tamanho: 1 mil – 10 mil exemplos
  • Tarefas: tradução
  • Idiomas: russo, sah, ba, tt, kv, krc, …
  • Licença: proprietária / outra
  • Downloads: 46 · Curtidas: 9

Sobre o dataset

The Little Prince — multiparallel corpus (22 languages, RU pivot) A sentence-level multiparallel corpus of Antoine de Saint-Exupéry's The Little Prince, built around the classic Russian translation by Nora Gal as the pivot and covering 21 further editions, most of them in low-resource minority languages of Russia.

Como carregar

Use a biblioteca datasets do Hugging Face:

pip install -U datasets

from datasets import load_dataset

ds = load_dataset("averoo/low_resource_parallel_corpora")
print(ds)
print(ds["train"][0])

Tags

translation parallel-corpus low-resource minority-languages languages-of-russia literature

Explorar o dataset no Hugging Face →

compartilhar: