ai4bharat/IndicVoices

Dataset em destaque no Hugging Face — 18.6 mil downloads. IndicVoices: Towards building an Inclusive Multilingual Speech Dataset for Indian Languages Updates [23 December 2025] We now have 11,200 hours of tra…

Hugging Face · Datasets ·ai4bharat · ·↓ 18581 ·♥ 91

O dataset ai4bharat/IndicVoices está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.

Ficha do dataset

  • Licença: CC BY 4.0
  • Downloads: 18.6 mil · Curtidas: 91

Sobre o dataset

IndicVoices: Towards building an Inclusive Multilingual Speech Dataset for Indian Languages Updates [23 December 2025] We now have 11,200 hours of transcribed data! 🎉 Overview INDICVOICES is a dataset of natural and spontaneous speech containing a total of 23.

Como carregar

Use a biblioteca datasets do Hugging Face:

pip install -U datasets

from datasets import load_dataset

ds = load_dataset("ai4bharat/IndicVoices")
print(ds)
print(ds["train"][0])

Explorar o dataset no Hugging Face →

compartilhar: