allenai/olmOCR-bench

Dataset com 1 mil – 10 mil exemplos — 8.2 mil downloads no Hugging Face. olmOCR-bench olmOCR-bench is a dataset of 1,403 PDF files, plus 7,010 unit test cases that capture properties of the output that a good OCR system sho…

Hugging Face · Datasets ·allenai · ·↓ 8197 ·♥ 258

O dataset allenai/olmOCR-bench está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.

Ficha do dataset

  • Tamanho: 1 mil – 10 mil exemplos
  • Formato/modalidade: texto
  • Idiomas: inglês
  • Licença: ODC-BY
  • Downloads: 8.2 mil · Curtidas: 258

Sobre o dataset

olmOCR-bench olmOCR-bench is a dataset of 1,403 PDF files, plus 7,010 unit test cases that capture properties of the output that a good OCR system should have.

Como carregar

Use a biblioteca datasets do Hugging Face:

pip install -U datasets

from datasets import load_dataset

ds = load_dataset("allenai/olmOCR-bench")
print(ds)
print(ds["train"][0])

Tags

text

Explorar o dataset no Hugging Face →

compartilhar: