averoo/low_resource_parallel_corpora
Dataset com 1 mil – 10 mil exemplos — 46 downloads no Hugging Face. The Little Prince — multiparallel corpus (22 languages, RU pivot) A sentence-level multiparallel corpus of Antoine de Saint-Exupéry's The Little Pr…
O dataset averoo/low_resource_parallel_corpora está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.
Ficha do dataset
- Tamanho: 1 mil – 10 mil exemplos
- Tarefas: tradução
- Idiomas: russo, sah, ba, tt, kv, krc, …
- Licença: proprietária / outra
- Downloads: 46 · Curtidas: 9
Sobre o dataset
The Little Prince — multiparallel corpus (22 languages, RU pivot) A sentence-level multiparallel corpus of Antoine de Saint-Exupéry's The Little Prince, built around the classic Russian translation by Nora Gal as the pivot and covering 21 further editions, most of them in low-resource minority languages of Russia.
Como carregar
Use a biblioteca datasets do Hugging Face:
pip install -U datasets
from datasets import load_dataset
ds = load_dataset("averoo/low_resource_parallel_corpora")
print(ds)
print(ds["train"][0])Tags
translation parallel-corpus low-resource minority-languages languages-of-russia literature
Leia também
Hugging Face says an AI agent hacked its infrastructure, and it used AI to fight back
Cura 1T: um modelo que aprende medicina treinando a si mesmo, sob supervisão humana
Beyond grep: The case for a context-rich AI coding harness