allenai/olmOCR-bench
Dataset com 1 mil – 10 mil exemplos — 8.2 mil downloads no Hugging Face. olmOCR-bench olmOCR-bench is a dataset of 1,403 PDF files, plus 7,010 unit test cases that capture properties of the output that a good OCR system sho…
Hugging Face · Datasets
·allenai
·
·↓ 8197
·♥ 258
O dataset allenai/olmOCR-bench está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.
Ficha do dataset
- Tamanho: 1 mil – 10 mil exemplos
- Formato/modalidade: texto
- Idiomas: inglês
- Licença: ODC-BY
- Downloads: 8.2 mil · Curtidas: 258
Sobre o dataset
olmOCR-bench olmOCR-bench is a dataset of 1,403 PDF files, plus 7,010 unit test cases that capture properties of the output that a good OCR system should have.
Como carregar
Use a biblioteca datasets do Hugging Face:
pip install -U datasets
from datasets import load_dataset
ds = load_dataset("allenai/olmOCR-bench")
print(ds)
print(ds["train"][0])Tags
text
// relacionados
Leia também
Blog
Unicorn, pelican, Middle-earth: OpenAI co-founder Karpathy is looking for the next AI vibe test
Editorial
CAPA: o benchmark que mede se o assistente de código aprende com você — ou repete a mesma pergunta
Blog
Why biological data matters more in AI drug discovery
Blog