Dataset Multimodal

PaddlePaddle/Real5-OmniDocBench

Dataset com 1 mil – 10 mil exemplos — 4.3 mil downloads no Hugging Face. Real5-OmniDocBench A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild Leaderboard | Overview | Dataset | Evaluatio…

Hugging Face · Datasets ·PaddlePaddle · ·↓ 4334 ·♥ 34

O dataset PaddlePaddle/Real5-OmniDocBench está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.

Ficha do dataset

  • Tamanho: 1 mil – 10 mil exemplos
  • Tarefas: descrição de imagem
  • Formato/modalidade: imagem
  • Idiomas: chinês, inglês
  • Licença: Apache 2.0
  • Downloads: 4.3 mil · Curtidas: 34

Sobre o dataset

Real5-OmniDocBench A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild Leaderboard | Overview | Dataset | Evaluation | Submit Results | Citation Real5-OmniDocBench measures the robustness of document parsing systems under five physical acquisition conditions: Scanning, Warping, Screen-Photography, Illumination, and Skew.

Como carregar

Use a biblioteca datasets do Hugging Face:

pip install -U datasets

from datasets import load_dataset

ds = load_dataset("PaddlePaddle/Real5-OmniDocBench")
print(ds)
print(ds["train"][0])

Tags

image-to-text ocr document-parsing benchmark multimodal document image

Explorar o dataset no Hugging Face →

compartilhar: