Dataset
Dados & Embeddings
llamaindex/ExtractBench
Dataset com menos de mil exemplos — 4.8 mil downloads no Hugging Face. ExtractBench Quick links: [🌐 Website] [📜 Paper] [💻 Code] Given a document and a schema, a system returns structured data with evidence.
Hugging Face · Datasets
·llamaindex
·
·↓ 4840
·♥ 16
O dataset llamaindex/ExtractBench está entre os destaques do Hugging Face — dados que alimentam o treinamento e a avaliação dos modelos do momento.
Ficha do dataset
- Tamanho: menos de mil exemplos
- Idiomas: inglês
- Licença: Apache 2.0
- Downloads: 4.8 mil · Curtidas: 16
Sobre o dataset
ExtractBench Quick links: [🌐 Website] [📜 Paper] [💻 Code] Given a document and a schema, a system returns structured data with evidence.
Como carregar
Use a biblioteca datasets do Hugging Face:
pip install -U datasets
from datasets import load_dataset
ds = load_dataset("llamaindex/ExtractBench")
print(ds)
print(ds["train"][0])Tags
document-extraction structured-extraction information-extraction pdf benchmark evaluation json-schema visual-grounding
// relacionados
Leia também
Blog
Flight attendants freaked out that Google is buying tons of Spirit employee data
Blog
Anthropic says any lab can now let a language model agent run the whole protein design stack
Blog
Valid Per-Field Selective Risk Control for Document Extraction: Three Failure Modes, a Validity Ladder, and When Conditioning Pays
Blog