// radar de ia

Multimodal

Papers, modelos e datasets em alta no Hugging Face, além do blog oficial — com leitura editorial em português.

Blog Multimodal

Fusão Multimodal Adaptativa com Atenção Esparsa para Previsão da Intenção de Travessia de Pedestres

arXiv:2607.12293v1 Tipo de anúncio: novo Resumo: Prever a intenção de travessia de pedestres é uma tarefa crítica para a segurança na condução autônoma, mas as abordagens existentes muitas vezes dependem de entradas de modalidade única ou de estratégias de fusão multimodal densa que capturam de forma inadequada informações visuais e cinemáticas complementares, ao mesmo tempo em que introduzem interações intermodais redundantes. Nós propomos o ADAPT (Adaptive Domain-Aware Pedestrian Crossing Transformer), um framework multimodal que modela conjuntamente o visu... local e global

15.07.2026
Blog LLMs & Texto

O Que Mede a Pontuação de um Benchmark Temporal? Decompondo o Uso de Canais na Avaliação de VLMs de Vídeo

arXiv:2607.12304v1 Tipo de Anúncio: novo Resumo: Uma pontuação em um benchmark de perguntas e respostas temporais sobre vídeo tem o objetivo de medir se um modelo possui compreensão temporal, mas ela mistura duas questões. 1. A questão da tarefa: a pergunta é de fato temporal, ela precisa de vários frames e da ordem deles? e 2. A questão do canal: quando ela precisa, o modelo recupera a ordem a partir dos pixels ou a lê a partir da codificação posicional (RoPE)? A maior parte de uma pontuação temporal não responde a nenhuma das duas, um único frame e uma resp...

15.07.2026
Blog Multimodal

Detecção de Quadros Anômalos Usando Comparação de Descrições Baseada em VLM para Extrair Ações Específicas de Especialistas e Cenas de Tomada de Decisão Contextual com Autossimilaridade Intravídeo

arXiv:2607.11957v1 Tipo de Anúncio: novo Resumo: A manutenção de infraestruturas críticas, como ferrovias e usinas de energia, é essencial para garantir a segurança e a confiabilidade operacional. No entanto, o número decrescente de trabalhadores de manutenção qualificados evidencia a necessidade de transferir o conhecimento dos especialistas para trabalhadores menos experientes. Estudos anteriores tentaram extrair candidatos ao conhecimento especializado comparando vídeos de trabalho baseado em manuais com vídeos de trabalhadores especialistas, focando principalmente nas diferenças ...

15.07.2026
Blog Multimodal

TSCA-Net: Atenção por Clique Temporal-Espacial para Previsão Multimodal e Interpretável de Trajetórias de Pedestres

arXiv:2607.11939v1 Tipo de anúncio: novo Resumo: A previsão precisa de trajetórias de pedestres em ambientes lotados continua sendo um desafio devido à incerteza multimodal do movimento humano e à complexidade variável da dinâmica de movimento em diferentes contextos de cena. Os modelos condicionados por objetivo existentes dependem de estruturas de deslocamento estáticas que atribuem peso igual a todos os passos de tempo históricos, mecanismos padrão de atenção em grafos e decodificadores de movimento de capacidade fixa que não conseguem se adaptar à previsão local...

15.07.2026
Blog LLMs & Texto

Uma Análise Empírica do Aprendizado Contínuo para Respostas a Perguntas Visuais Médicas Heterogêneas

arXiv:2607.12048v1 Tipo de anúncio: novo Resumo: A implantação de sistemas de respostas a perguntas visuais médicas (MedVQA) em ambientes clínicos do mundo real exige modelos que se adaptem a novas tarefas clínicas sem esquecer o conhecimento adquirido anteriormente. O aprendizado contínuo (CL) oferece um arcabouço prático para esse cenário. Apesar do rápido progresso nos modelos médicos de visão e linguagem, o comportamento dos métodos de CL ao treinar esses modelos em tarefas heterogêneas de MedVQA permanece pouco explorado. Este trabalho apresenta...

15.07.2026
467 itens no radar