ASLP-lab/WSC-Train
Dataset em destaque no Hugging Face — 489 downloads. WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus With Rich Annotation For Dialectal Speech Processing Yuhang Dai1,*, Ziyu Zhang1,*, Shuai Wang4,5, L…
O dataset ASLP-lab/WSC-Train está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.
Ficha do dataset
- Licença: Apache 2.0
- Downloads: 489 · Curtidas: 146
Sobre o dataset
WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus With Rich Annotation For Dialectal Speech Processing Yuhang Dai1,*, Ziyu Zhang1,*, Shuai Wang4,5, Longhao Li1, Zhao Guo1, Tianlun Zuo1, Shuiyuan Wang1, Hongfei Xue1, Chengyou Wang1, Qing Wang3, Xin Xu2, Hui Bu2, Jie Li3, Jian Kang3, Binbin Zhang5, Lei Xie1,╀ 1 Audio, Speech and Language Processing Group (ASLP@NPU), Northwestern Polytechnical University 2 Beijing AISHELL Technology Co.
Como carregar
Use a biblioteca datasets do Hugging Face:
pip install -U datasets
from datasets import load_dataset
ds = load_dataset("ASLP-lab/WSC-Train")
print(ds)
print(ds["train"][0])
Leia também
Flight attendants freaked out that Google is buying tons of Spirit employee data