// radar de ia

Multimodal

Papers, modelos e datasets em alta no Hugging Face, além do blog oficial — com leitura editorial em português.

Blog LLMs & Texto

A Importância da Escolha do Codificador: Um Estudo entre Tabelas e Imagens

arXiv:2607.07756v1 Tipo de anúncio: novo Resumo: O aprendizado multimodal normalmente exige um codificador dedicado para cada modalidade. Quando uma modalidade tabular está envolvida, trabalhos anteriores têm usado majoritariamente um \emph{MLP simples} como codificador. No entanto, se fosse um codificador forte, o domínio tabular não seria "o último castelo não conquistado do aprendizado profundo". Este estudo avalia, pela primeira vez, modelos tabulares de última geração como codificadores no cenário imagem-tabela. Um obstáculo se destaca. Modelos de Aprendizado em Contexto mo...

10.07.2026
Blog Multimodal

APIVOT: Planejamento Adaptativo com Pensamentos Intercalados de Visão e Linguagem

arXiv:2607.08024v1 Tipo de anúncio: novo Resumo: O planejamento robótico de longo horizonte exige raciocinar conjuntamente sobre a estrutura semântica da tarefa e a viabilidade geométrica. Para executar uma tarefa com sucesso, um robô precisa decompor objetivos, selecionar objetos relevantes para a tarefa e sequenciar ações, ao mesmo tempo em que garante que os planos satisfaçam restrições espaciais, como espaço livre limitado e colisões entre objetos. Neste trabalho, propomos o APIVOT, um planejador baseado em VLM que intercala de forma adaptativa pensamentos de linguagem e visuais para o longo hori...

10.07.2026
Blog Multimodal

Desaprendizado multimodal em visão, linguagem, vídeo e áudio: um levantamento de métodos, conjuntos de dados e benchmarks

arXiv:2607.07907v1 Tipo de anúncio: novo Resumo: Com a crescente adoção de VLMs, DMs, LLMs e AFMs, esses modelos de fundação multimodais podem, sem intenção, codificar associações intermodais sensíveis, protegidas por direitos autorais, enviesadas ou inseguras que se originam de seus dados de treinamento. Retreinar após solicitações de exclusão ou atualizações de políticas costuma ser inviável, e o esquecimento direcionado continua sendo difícil porque o conhecimento está distribuído por representações compartilhadas. O desaprendizado multimodal aborda esse desafio ...

10.07.2026
Blog Multimodal

Modelos de Fundação Escaláveis e Confiáveis para Observação da Terra

arXiv:2607.07758v1 Tipo de Anúncio: novo Resumo: Os modelos de fundação (FMs) transformaram o aprendizado de máquina, que deixou de ser um desenvolvimento isolado de modelos específicos para cada tarefa e passou a adotar modelos de propósito geral, pré-treinados em dados amplos e adaptados a múltiplas tarefas subsequentes. A observação da Terra (EO) é um domínio importante para esse paradigma, porque os arquivos de satélites e aeronaves são grandes, com alta frequência de revisita e cada vez mais multimodais, enquanto rótulos de campo confiáveis costumam ser escassos. Os modelos de fundação para sensoriamento remoto (RSFMs) não conseguem...

10.07.2026
Blog Multimodal

FabriVLA: Um Modelo Visão-Linguagem-Ação Leve para Manipulação Multitarefa Precisa

arXiv:2607.08575v1 Tipo de Anúncio: novo Resumo: Apresentamos o FabriVLA, um modelo Visão-Linguagem-Ação leve para Manipulação Multitarefa Precisa. O FabriVLA combina uma espinha dorsal visão-linguagem InternVL3.5 com uma cabeça de ação por flow-matching que apresenta autoatenção com portões entre tokens de ação e fusão de camadas rasas do VLM para um contexto espacial enriquecido. O modelo é treinado por otimização conjunta em estágio único a partir de um VLM pré-treinado e de uma cabeça de ação inicializada aleatoriamente. No benchmark Meta-World MT50...

10.07.2026
Blog LLMs & Texto

Mergulhe nos Vieses Implícitos do Alinhamento Visão-Linguagem de Baixo Posto

arXiv:2607.08194v1 Tipo de anúncio: novo Resumo: O alinhamento visão-linguagem, a etapa que faz a ponte entre codificadores visuais pré-treinados e grandes modelos de linguagem, é amplamente tratado como uma forma de pré-treinamento que exige a atualização de todos os parâmetros. Nós contestamos essa visão e investigamos o que acontece quando, em vez disso, a adaptação de baixo posto é aplicada ao LLM durante essa etapa. Descobrimos que o alinhamento de baixo posto não apenas reduz os custos computacionais, como também supera o alinhamento com todos os parâmetros na maioria dos benchmarks. Para entend...

10.07.2026
Blog Multimodal

Pós-Treinamento na Direção Autônoma de Ponta a Ponta

arXiv:2607.08072v1 Tipo de Anúncio: novo Resumo: Modelos de ponta a ponta que mapeiam entradas multimodais diretamente para trajetórias/manobras futuras surgiram como um paradigma de pesquisa cada vez mais proeminente na direção autônoma. Essa classe de modelos inclui tanto modelos de Visão-Linguagem-Ação quanto planejadores generativos de trajetórias. Diferentemente das aplicações clássicas de aprendizado de máquina, os veículos autônomos operam em ambientes críticos de segurança e intensivos em interação, onde a imitação tradicional em malha aberta de um especialista d...

10.07.2026
Blog LLMs & Texto

FSD-VLN: Modelagem de Sistema Duplo Rápido-Lento para Navegação Aérea Visão-Linguagem de Longo Horizonte

arXiv:2607.08359v1 Tipo de anúncio: novo Resumo: A Navegação Visão-Linguagem (VLN) permite a navegação autônoma de UAVs em ambientes desconhecidos ao mapear instruções em linguagem para entradas visuais em tempo real. Em comparação com a navegação dependente de GPS ou pré-programada, a VLN oferece suporte a uma interação humano-máquina intuitiva e maior adaptabilidade ao ambiente, exigindo uma integração estreita entre o raciocínio semântico de alto nível e o controle de voo de baixa latência. Os métodos existentes sofrem com o desalinhamento estrutural entre...

10.07.2026
Blog Robótica & RL

D-CLIPSE: Localização Distribuída Baseada em Consenso com Escuta Passiva na Troca de Estados Compartilhados

arXiv:2607.07995v1 Tipo de anúncio: novo Resumo: A localização multirrobô que seja precisa e consistente é imprescindível para tarefas subsequentes como planejamento e controle. Abordagens de filtragem centralizada fundem de forma ótima todas as medições de sensores disponíveis da equipe. No entanto, uma solução centralizada raramente é implementável devido a restrições de hardware, comunicação e computação. Abordagens distribuídas empregam um filtro em cada robô para estimar seu próprio estado e os estados dos vizinhos usando inter-...

10.07.2026
Blog Geração de Imagem

Omni-Sleep: Um Modelo Fundamental do Sono via Aprendizado Contrastivo Hierárquico da Dinâmica SNC–SNA

arXiv:2607.07720v1 Tipo de anúncio: novo Resumo: A fisiologia do sono surge da dinâmica coordenada do sistema nervoso central (SNC) e do sistema nervoso autônomo (SNA), como refletido por sinais multimodais de polissonografia, incluindo EEG, EOG, EMG, ECG e respiração. No entanto, os modelos fundamentais do sono existentes frequentemente fundem biossinais heterogêneos de maneira indiferente à topologia, ignorando sua organização fisiológica. Apresentamos o Omni-Sleep, um modelo fundamental do sono que usa a p... do SNC/SNA

10.07.2026
467 itens no radar