// radar de ia

Multimodal

Papers, modelos e datasets em alta no Hugging Face, além do blog oficial — com leitura editorial em português.

Blog Robótica & RL

GaitSpan: Cultivando a locomoção de humanoides, do andar ao correr

arXiv:2607.12114v1 Tipo de anúncio: novo Resumo: Um humanoide que consegue andar não deveria ter que reaprender a locomoção do zero para trotar ou correr. No entanto, as abordagens atuais costumam obter diversidade de marcha ao prescrever cronogramas de marcha, imitar trechos de movimento, treinar especialistas para alternar entre habilidades ou destilar habilidades em uma única política. Essas estratégias podem produzir comportamentos impressionantes, mas oferecem flexibilidade limitada diante de comandos contínuos de velocidade, terrenos e morfologias. Estudamos o crescimento de habilidades com o GaitSpan, um framewor...

15.07.2026
Blog Robótica & RL

Inferência Variacional de Stein com Restrições Globalizada para Planejamento Diversificado de Movimentos Robóticos Viáveis

arXiv:2607.12732v1 Tipo de Anúncio: novo Resumo: O planejamento de movimentos robóticos é inerentemente multimodal, mas os planejadores clássicos normalmente retornam apenas uma única solução. As formulações probabilísticas abordam essa limitação ao manter uma distribuição sobre os movimentos, permitindo que o planejador raciocine sobre múltiplas alternativas de baixo custo. Na robótica, no entanto, as amostras de movimento também precisam satisfazer restrições rigorosas, incluindo prevenção de colisões, limites das juntas, condições de contato e consistência dinâmica. Essas restrições rígidas ...

15.07.2026
Blog Multimodal

Além do rastreamento paralelo: a fusão interativa de múltiplas características impulsiona a reconstrução semântica a partir de registros cerebrais não invasivos

arXiv:2607.12071v1 Tipo de anúncio: novo Resumo: A reconstrução semântica contínua a partir de registros neurais não invasivos continua limitada pelo descompasso representacional entre os espaços de características semânticas e os padrões de codificação neural, o que dificulta severamente o alinhamento cross-modal entre sinais neurais de alto ruído e as características semânticas-alvo. Os decodificadores semânticos anteriores dependiam predominantemente de representações lexicais estáticas ou de representações contextualizadas dinâmicas de forma isolada. Essa abordagem de dimensão única...

15.07.2026
Blog Robótica & RL

Jetson-PI: Rumo ao Controle de Robôs em Tempo Real Embarcado por Meio de Inferência Assíncrona Alinhada à Antecipação

arXiv:2607.12659v1 Tipo de Anúncio: novo Resumo: Os modelos de Visão-Linguagem-Ação (VLA) alcançaram um desempenho impressionante em diversas tarefas incorporadas. No entanto, implantar modelos VLA em dispositivos embarcados de baixo consumo de energia, como o Jetson Orin, continua sendo um desafio devido à sua alta complexidade computacional, o que leva a uma latência de inferência substancial e a uma baixa frequência de controle. A inferência assíncrona pode mascarar parcialmente essa latência ao paralelizar a execução da ação e a inferência subsequente, mas ela introdu...

15.07.2026
Blog LLMs & Texto

PFAdapter: Decomposição Hierárquica de LoRA para MLLMs Federados Personalizados

arXiv:2607.12111v1 Tipo de anúncio: novo Resumo: Sistemas de IA agêntica estão remodelando as comunicações e as redes ao implantar agentes inteligentes autônomos capazes de aprendizado colaborativo enquanto mantêm a privacidade dos dados nas bordas da rede. Dentro de ambientes de rede distribuídos, os Multimodal Large Language Models (MLLMs) funcionam como motores cognitivos para dispositivos de borda, mas o ajuste fino federado enfrenta desafios substanciais para equilibrar a agregação de conhecimento global com a adaptação local sob condições heterogêne...

15.07.2026
Blog Multimodal

Auditando o Vazamento de Dados em Benchmarks Multimodais de Imagens de Lâminas Inteiras

arXiv:2607.12278v1 Tipo de anúncio: novo Resumo: Modelos de visão e linguagem (VLMs) recentes voltados à patologia computacional relatam um desempenho zero-shot impressionante em benchmarks de perguntas e respostas visuais (VQA) sobre imagens de lâminas inteiras (WSI). Auditamos essas afirmações e as consideramos fundamentalmente comprometidas por vazamento de dados em dois níveis hierárquicos: vazamento em nível de paciente, no qual lâminas de um mesmo caso aparecem tanto nos conjuntos de treinamento quanto nos de teste, e vazamento em nível institucional, no qual casos diferentes ainda assim compartilham stai...

15.07.2026
Blog Robótica & RL

TrustVLA: Defesa em Tempo de Inferência Guiada por Mecanismo Contra Backdoors em Modelos de Visão-Linguagem-Ação

arXiv:2607.12571v1 Tipo de Anúncio: novo Resumo: Modelos de Visão-Linguagem-Ação (VLA) são implantados por meio de pipelines que os usuários finais não conseguem auditar, e um VLA envenenado pode se comportar normalmente diante de observações limpas, enquanto um pequeno gatilho visual redireciona uma política robótica de longo horizonte antes que qualquer falha se torne observável. As defesas existentes de visão ou linguagem raramente explicam como é a aparência de uma representação de VLA acionada por gatilho ou como recuperar o comportamento sem retreinamento. Estudamos essa lacuna por meio de dois independentemente...

15.07.2026
Blog LLMs & Texto

Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs

arXiv:2607.09697v1 Announce Type: new Abstract: Existing safety mechanisms for multimodal large language models (MLLMs) face a fundamental trade-off between safety and utility. Model fine-tuning achieves robust safety but compromises general utility. Input-side safety guardrails offer a lightweight alternative, yet they suffer from severe over-refusal, indiscriminately blocking benign queries or those the model could have safely answered through refusal or advisory responses. We identify that th...

14.07.2026
Blog LLMs & Texto

EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents

arXiv:2607.09773v1 Announce Type: new Abstract: Computer-use agents must solve long-horizon tasks through repeated interaction with partially observable, multimodal desktop environments. Although imitation learning and offline trajectory refinement provide strong priors, static traces cannot cover the causal feedback loop of real computer use: each action changes the screen state, future action space, and recovery options. EvoCUA-1.5 extends self-evolving computer-use agents from offline experie...

14.07.2026
Blog LLMs & Texto

PolyInterview: An LLM-based Platform for Immersive Mock Interview Practice with Comprehensive Multimodal Assessment

arXiv:2607.10310v1 Announce Type: new Abstract: Preparing for job interviews is important for securing desired positions, yet realistic practice remains difficult to access: real interviews are infrequent, expert mock coaching is costly, and self-practice offers neither adaptive dialogue nor structured assessment. Existing systems typically address only parts of this need through fixed question sequences, limited communication channels, or feedback with little supporting evidence. We present Pol...

14.07.2026
Blog LLMs & Texto

UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp

arXiv:2607.10557v1 Announce Type: new Abstract: Multimodal BrowseComp tasks require agents to combine perception, tool use, and long-horizon reasoning over dynamic web content, challenging their ability to handle compositional structure, open-world uncertainty, and multimodal integration across extended interactions. Crucially, real-world multimodal browsing involves three distinct information-flow patterns: text-only, image-to-text, and text-to-image, yet existing data construction methods cove...

14.07.2026
467 itens no radar