Texto de OCR antigo prejudica o treinamento de modelos de linguagem, e o FineBooks quer resolver isso em larga escala
O projeto FineBooks, da Hugging Face e da EleutherAI, testou 14 modelos de OCR de código aberto em mais de 2.000 páginas de livros históricos. O melhor modelo, o dots.mocr, atinge 97,6 por cento de precisão de caracteres a menos de dois dólares por mil páginas. Isso é bom o suficiente para dados de treinamento de IA, mas ainda não para transcrições acadêmicas, afirma a equipe. O artigo Texto de OCR antigo prejudica o treinamento de modelos de linguagem, e o FineBooks quer resolver isso em larga escala apareceu primeiro em The Decoder.
The Decoder
·Matthias Bastian
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo