// radar de ia

Multimodal

Papers, modelos e datasets em alta no Hugging Face, além do blog oficial — com leitura editorial em português.

Blog LLMs & Texto

Quantização Simétrica com Sinal para Inteiros de Poucos Bits

arXiv:2607.08779v1 Tipo de anúncio: novo Resumo: O alfabeto de inteiros com sinal contém um valor negativo representável a mais do que positivos. No entanto, por convenção, o quantizador de inteiros simétrico padrão fixa sua escala como estritamente positiva, o que atribui esse valor representável extra à cauda negativa e pode forçar o recorte de outliers positivos. Neste trabalho, mostramos que, em precisão de poucos bits, tal recorte é uma fonte não trivial de erro de quantização. A quantização assimétrica aborda isso...

13.07.2026
Blog LLMs & Texto

Mistura de Sondas: Aprendendo com Modalidades Privilegiadas em LLMs Multimodais Através de Sondagem

arXiv:2607.08839v1 Tipo de Anúncio: novo Resumo: Os Grandes Modelos de Linguagem Multimodais (MLLMs) são normalmente projetados sob a suposição de que todas as modalidades disponíveis durante o treinamento também estarão acessíveis na inferência. No entanto, muitos cenários do mundo real violam essa suposição, exigindo que os modelos operem sob uma configuração de modalidade privilegiada, na qual as modalidades auxiliares estão disponíveis apenas durante o treinamento. Embora essas modalidades contenham informações valiosas, os MLLMs existentes em grande parte não conseguem aproveitar as...

13.07.2026
Blog LLMs & Texto

Escalonamento em Tempo de Teste para VLMs Pequenos em Questões Visuais de Múltipla Escolha Multilíngues

arXiv:2607.09438v1 Tipo de anúncio: novo Resumo: O escalonamento em tempo de teste (TTS) melhora de forma confiável o raciocínio em grandes modelos de linguagem, mas não está claro se isso se transfere para pequenos modelos abertos de visão e linguagem. Examinamos essa questão no EXAMS-V, um benchmark visual multilíngue de múltipla escolha, comparando autoconsistência, descrever-então-raciocinar com busca em feixe guiada por PRM e dois seletores post-hoc entre o Qwen2.5-VL-7B-Instruct e o Qwen3.5-4B. O que importa são as condições sob as quais o TTS é executado, não a busca...

13.07.2026
Blog LLMs & Texto

GeoTrace: Compressão de Tokens de Trajetória com Consciência Geométrica para Modelos de Linguagem de Grande Escala de Vídeo

arXiv:2607.09080v1 Tipo de Anúncio: novo Resumo: Embora os Modelos de Linguagem de Grande Escala de Vídeo (Video LLMs) tenham demonstrado forte desempenho na compreensão de vídeos, sua eficiência ainda é limitada pelo grande número de tokens visuais. Os métodos existentes de compressão de tokens de vídeo geralmente dependem de saliência quadro a quadro ou de fusão heurística de tokens, o que pode concentrar-se em excesso em regiões localmente salientes e produzir características fundidas ambíguas. Para resolver essas questões, propomos o GeoTrace, um espaço-temporal de tokens sem treinamento ...

13.07.2026
Blog Multimodal

CLAP: Adaptação Direta de VLM para VLA via Ancoragem entre Linguagem e Ação

arXiv:2607.08974v1 Tipo de anúncio: novo Resumo: Os modelos de visão-linguagem-ação (VLAs) herdam capacidades semânticas de VLMs pré-treinados, mas o pós-treinamento em larga escala com dados de robôs e as modificações arquiteturais podem remodelar o backbone de forma tão extensa que se torna difícil isolar o que o VLM contribui para o controle. Converter diretamente VLMs pré-treinados em VLAs com o mínimo de mudança arquitetural oferece um caminho mais transparente para entender como as capacidades dos VLMs se transferem entre escalas de modelo...

13.07.2026
Blog LLMs & Texto

MOSAIC: Composição Adaptativa Entre Camadas para Modelos de Visão e Linguagem Heterogêneos e Eficientes

arXiv:2607.09029v1 Tipo de anúncio: novo Resumo: Os Modelos de Visão e Linguagem (VLMs) alcançaram sucesso ao usar Transformers homogêneos para processar dados multimídia. Estudos recentes mostram que estruturas heterogêneas, que intercalam mecanismos eficientes como a atenção linear, melhoram tanto o desempenho quanto a latência de inferência em relação aos designs homogêneos. No entanto, esses esforços dependem de padrões de mistura estáticos e feitos manualmente, que são subótimos e difíceis de adaptar a hardware específico. Para preencher essa lacuna, nós pro...

13.07.2026
Blog LLMs & Texto

MedRealMM: Um benchmark multimodal do mundo real para consultas médicas online em chinês

arXiv:2607.09142v1 Tipo de anúncio: novo Resumo: Os grandes modelos de linguagem (LLMs) estão sendo cada vez mais utilizados em consultas médicas online, mas os benchmarks existentes continuam mal alinhados com a prática clínica real. Muitos deles se apoiam em conversas sintéticas ou simuladores de pacientes, omitem imagens médicas enviadas pelos próprios pacientes ou avaliam respostas clínicas abertas usando métricas de múltipla escolha ou de sobreposição léxica que refletem mal a qualidade clínica. Nós apresentamos o \textbf{MedRealMM}, um benchmark de larga escala para mu...

13.07.2026
Blog LLMs & Texto

TSRouter: Seleção Dinâmica de Modalidade e Modelo para Raciocínio sobre Séries Temporais

arXiv:2607.08940v1 Tipo de anúncio: novo Resumo: O raciocínio sobre séries temporais é essencial para a resolução de problemas do mundo real. Embora tanto os Large Language Models (LLMs) quanto os Vision-Language Models (VLMs) sejam capazes de raciocinar sobre dados de séries temporais, suas capacidades são complementares: os LLMs processam séries temporais como sequências de texto e, portanto, preservam uma compreensão numérica exata, mas têm dificuldade com padrões globais, enquanto os VLMs capturam esses padrões de forma eficiente ao visualizar séries temporais, mas podem perder detalhes de granularidade fina. M...

13.07.2026
Blog Robótica & RL

Validando a Realidade Virtual para o Estudo da Interação Multimodal Humano-Robô na Navegação Robótica Socialmente Consciente

arXiv:2607.09261v1 Tipo de anúncio: novo Resumo: A Realidade Virtual (VR) oferece uma plataforma flexível e controlável para estudar a interação humano-robô. Trabalhos anteriores exploraram a VR para a navegação robótica socialmente consciente. No entanto, ainda não se compreende suficientemente se a VR captura a dinâmica de interação multimodal observada na conavegação humano-robô no mundo real. Neste trabalho, apresentamos um protótipo de VR e avaliamos sua adequação para o estudo da interação multimodal humano-robô (HRI) em ambientes socialmente a...

13.07.2026
Blog LLMs & Texto

Agentes de Perguntas e Respostas Multimodais Específicos para Tarefas via Calibração de Confiança e Raciocínio Incremental para o QANTA 2026

arXiv:2607.09623v1 Tipo de Anúncio: novo Resumo: Apresentamos nossa submissão ao desafio compartilhado QANTA 2026 no Workshop do ICML 2026 sobre Perguntas e Respostas Multimodais Eficientes (EMM-QA). O Quanta avalia sistemas de quizbowl multimodais que respondem a perguntas em estilo pirâmide a partir de textos revelados incrementalmente e imagens que os acompanham, ao mesmo tempo em que operam sob restrições realistas de eficiência. O desafio consiste em duas tarefas distintas: perguntas do tipo Tossup, que exigem decidir quando responder sob incerteza...

13.07.2026
Blog LLMs & Texto

Super-resolução HAT e um conjunto de votação PARSeq+CLIP4STR para reconhecimento extremo de placas de veículos em ambientes reais

arXiv:2607.08896v1 Tipo de anúncio: novo Resumo: Descrevemos nossa participação no ICIP 2026 Grand Challenge sobre Super-resolução Extrema de Placas de Veículos em Ambientes Reais (XLPSR), que obteve 9,73 wECR no ranking público de validação. O sistema combina um front-end de super-resolução Hybrid Attention Transformer (HAT) com um conjunto de dois reconhecedores de texto em cena (PARSeq-S e CLIP4STR-B) e um esquema de votação de caracteres ponderado por confiança que se abstém em posições incertas. Tratamos o XLPSR como um reconhecimento...

13.07.2026
Blog Dados & Embeddings

MultiView-Bench: Um Benchmark de Diagnóstico para Integração Multivista Centrada no Mundo em VLMs

arXiv:2607.08970v1 Tipo de anúncio: novo Resumo: Benchmarks recentes para VLMs avaliam, em grande parte, a percepção de vista única ou de vistas limitadas, deixando sem teste a capacidade cognitiva central de integrar observações entre diferentes pontos de vista em um modelo mental 3D coerente e centrado no mundo (alocêntrico). Apresentamos o MultiView-Bench, um benchmark de diagnóstico expressamente projetado para avaliar a integração multivista para a compreensão holística de cenas 3D. Diferentemente dos conjuntos de dados existentes, que se concentram no mapeamento em nível de pixel ou em na...

13.07.2026
467 itens no radar