// radar de ia

Multimodal

Papers, modelos e datasets em alta no Hugging Face, além do blog oficial — com leitura editorial em português.

Blog LLMs & Texto

VTaMo: Modelo de Alinhamento Vídeo-Texto para Tradução de Língua de Sinais

arXiv:2607.09126v1 Tipo de anúncio: cross Resumo: A tradução de língua de sinais (SLT) converte vídeos contínuos de sinais em texto de língua falada. Abordagens sem glosas (gloss-free) aproveitam codificadores visuais e modelos de linguagem pré-treinados, mas dependem de um alinhamento intermodal implícito obtido apenas por meio da supervisão de tradução. Apresentamos o VTaMo, um framework que introduz alinhamento explícito em múltiplas granularidades em três níveis: (1) alinhamento local por meio de transporte ótimo regularizado por entropia com um token nulo aprendível para fina-gr...

13.07.2026
Blog LLMs & Texto

C-GAP: Prompting consciente de classe e online melhora modelos de visão e linguagem em classes desbalanceadas

arXiv:2607.09008v1 Tipo de anúncio: novo Resumo: Sistemas de percepção críticos para a segurança precisam detectar de forma confiável classes de objetos raras dentro de pequenos espaços de rótulos, um cenário que os métodos de detecção de cauda longa, projetados para centenas de classes com anotação densa, fundamentalmente não abordam. Detectores de vocabulário aberto oferecem uma alternativa promissora, pois utilizam consultas em linguagem natural no momento da inferência, tornando a qualidade do prompt uma alavanca de primeira classe para o desempenho da detecção. Exploramos essa propriedade para abordar...

13.07.2026
Blog LLMs & Texto

SAGEAgent: Um Agente Autoevolutivo para Aquisição de Modalidades com Consciência de Custo na Predição de Sobrevivência Multimodal

arXiv:2607.09521v1 Tipo de Anúncio: novo Resumo: Será que todo paciente com câncer realmente precisa de uma investigação diagnóstica completa para uma predição precisa de sobrevivência? Na oncologia clínica multimodal, as modalidades diagnósticas seguem uma ordem clinicamente estabelecida de sobrecarga crescente — desde dados demográficos coletados no atendimento inicial até o perfil genômico, que exige análise especializada de tecido. Os métodos multimodais atuais de predição de sobrevivência ou assumem que todas as modalidades estão disponíveis ou lidam passivamente com dados faltantes, mas nenhum raciocina ativamente sobre...

13.07.2026
Blog Robótica & RL

Relatório Técnico do Infinity-Parser2

arXiv:2607.07836v1 Tipo de anúncio: novo Resumo: Apresentamos o Infinity-Parser2, um grande modelo multimodal que combina um pipeline controlável de síntese de dados com aprendizado por reforço multitarefa para análise de documentos de ponta a ponta, enfrentando a persistente escassez de corpora de análise anotados com fidelidade. Nossas contribuições são três. Primeiro, construímos um mecanismo de síntese escalável, associando uma estrutura de renderização controlável a um ciclo iterativo de refinamento, e o utilizamos para construir e disponibilizar em código aberto In...

11.07.2026
Blog Multimodal

LEEVLA: Enxergando o Que Importa na Evolução do Ambiente Latente para Visão-Linguagem-Ação

arXiv:2607.08182v1 Tipo de Anúncio: novo Resumo: Os modelos de visão-linguagem-ação (VLA) buscam mapear entradas multimodais para ações de robôs. No entanto, a maioria das abordagens existentes tem dificuldade em cobrir cenários dinâmicos complexos por tratar todos os tokens visuais de maneira uniforme e raciocinar com fatores selecionados por humanos, o que carece de mecanismos para enfatizar evidências críticas para a tarefa e ignora fatores subjacentes. Para resolver esse problema, propomos o LEEVLA, uma arquitetura VLA para enxergar o que importa na Evolução do Ambiente Latente...

10.07.2026
467 itens no radar