Paper
Multimodal
Vision-Language Grounding as Bidirectional Concept Correspondence
ConCor-1 treats vision-language grounding as bidirectional concept correspondence, jointly predicting text spans, image segments, and cross-modal matches without prespecified phras…
Hugging Face · Daily Papers
·Jieyu Zhang, Ziqi Gao
·
·▲ 1 upvotes
Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.
Autores: Jieyu Zhang, Ziqi Gao, Luke Zettlemoyer, Ranjay Krishna
- 1 upvotes da comunidade
- Temas: vision-language grounding, bidirectional concept correspondence, bridge tokens, cross-modal alignment, phrase grounding, referring expression grounding
Resumo
Resumo original (em inglês), extraído do paper:
ConCor-1 treats vision-language grounding as bidirectional concept correspondence, jointly predicting text spans, image segments, and cross-modal matches without prespecified phrases.Onde ler
// relacionados
Leia também
Editorial
Muse Glimmer: a Meta volta ao código aberto com um agente de 30B que cabe numa GPU
Blog
NeuPAT: Ajuste de Alocação de Plasticidade Ciente de Neurônios para MLLMs que Preservam a Linguagem
Blog
Classificação Multimodal de Lesões de Pele com Swin Transformer e Fusão de Metadados Clínicos
Blog