HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
HunyuanOCR-1.5 is a lightweight end-to-end vision-language model that enhances OCR capabilities through improved efficiency via DFlash and enhanced capability via Agentic Data Flow…
Hugging Face · Daily Papers
·Gengluo Li, Xingyu Wan
·
·▲ 4 upvotes
Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.
Autores: Gengluo Li, Xingyu Wan, Shangpin Peng, Weinong Wang, Hao Feng, Yongkun Du
- 4 upvotes da comunidade
- Temas: vision-language model, OCR, DFlash, Agentic Data Flow, end-to-end model, inference speedup
Resumo
Resumo original (em inglês), extraído do paper:
HunyuanOCR-1.5 is a lightweight end-to-end vision-language model that enhances OCR capabilities through improved efficiency via DFlash and enhanced capability via Agentic Data Flow, achieving fast inference and broad task coverage.