TMI: Texto-para-Imagem Encontra Imagem-para-Imagem para Síntese Complementar de Dados a fim de Impulsionar a Segmentação de Instâncias de Cauda Longa
arXiv:2607.08201v1 Tipo de anúncio: novo Resumo: A segmentação de instâncias com vocabulário amplo é limitada por distribuições de categorias de cauda longa e pela ambiguidade fina entre classes. Embora a síntese de dados ofereça uma alternativa promissora, os paradigmas atuais têm limitações complementares: os métodos de texto-para-imagem (T2I) herdam pseudorrótulos ruidosos e têm dificuldade com classes raras, enquanto os métodos de copiar-e-colar comprometem o realismo contextual. Para enfrentar esses problemas, propomos um pipeline híbrido que acopla geração T2I...
arXiv cs.CV
·Hyeonseop Song, Seokhun Choi, Hoseok Do
·
// relacionados
Leia também
Editorial
EditBridge: edição de imagem em 4K sem inventar o que não estava lá
Blog
Coarse-to-Fine Multi-Resolution Diffusion Models for Trajectory Generation in Urban Systems
Blog
DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization
Blog