Texto de OCR antigo prejudica o treinamento de modelos de linguagem, e o FineBooks quer resolver isso em larga escala

Texto de OCR antigo prejudica o treinamento de modelos de linguagem, e o FineBooks quer resolver isso em larga escala

O projeto FineBooks, da Hugging Face e da EleutherAI, testou 14 modelos de OCR de código aberto em mais de 2.000 páginas de livros históricos. O melhor modelo, o dots.mocr, atinge 97,6 por cento de precisão de caracteres a menos de dois dólares por mil páginas. Isso é bom o suficiente para dados de treinamento de IA, mas ainda não para transcrições acadêmicas, afirma a equipe. O artigo Texto de OCR antigo prejudica o treinamento de modelos de linguagem, e o FineBooks quer resolver isso em larga escala apareceu primeiro em The Decoder.

The Decoder ·Matthias Bastian ·
compartilhar: