Subtoken Vision Transformer para Reconhecimento de Granularidade Fina
arXiv:2607.09086v1 Tipo de anúncio: novo Resumo: Apresentamos o Subtoken Vision Transformer (SubViT), um método de tokenização seletiva de imagens para reconhecimento visual de granularidade fina. Os Vision Transformers padrão comprimem cada patch de tamanho fixo em um único token, embora as distinções de granularidade fina frequentemente dependam de variações localizadas em apenas alguns poucos patches. O SubViT aborda essa incompatibilidade representando patches discriminativos com múltiplos subtokens, ao mesmo tempo em que retém a sequência original de tokens para o contexto global...
arXiv cs.CV
·Jie Zhu, Ivy Zhang, Minchul Kim, Xiaoming Liu
·
// relacionados
Leia também
Blog
Meta ran ads for an app promising to nudify female politicians
Blog
Relativity Networks raises $22 million to bring a faster kind of fiber to data centers
Blog
Iterative Grasp Pose Refinement: A Deep Reinforcement Learning Approach for 2D Vision
Blog