// radar de ia

Visão Computacional

Papers, modelos e datasets em alta no Hugging Face, além do blog oficial — com leitura editorial em português.

Blog Robótica & RL

Adaptação Biomecânica de Marcha Guiada pela Física para Locomoção de Humanoides em Terrenos com Inclinações Extremas

arXiv:2607.07830v1 Tipo de anúncio: novo Resumo: O aprendizado por reforço sem modelo tem possibilitado uma locomoção humanoide impressionante; no entanto, o controle em encostas íngremes permanece amplamente inexplorado. Ao contrário de terrenos planos ou discretos, os terrenos inclinados impõem um viés gravitacional persistente que exige controle simultâneo de estabilidade e de postura. Consequentemente, sob formulações genéricas de recompensa, as políticas podem convergir para marchas agachadas lentas, conservadoras e de baixo centro de massa (CoM). Neste trabalho, propomos um novo ...

10.07.2026
Blog Dados & Embeddings

Aproveitando a Nomeação de Cores para o Aprimoramento de Imagens

arXiv:2607.08185v1 Tipo de Anúncio: novo Resumo: Aprimorar imagens para torná-las visualmente atraentes é um desafio persistente na visão computacional. Muitos métodos de aprendizado profundo treinam modelos em conjuntos de dados pareados para replicar estilos de edição de especialistas. No entanto, essas abordagens enfrentam dificuldades com duas questões principais: (1) a interpretabilidade e (2) uma parametrização adequada para ajustes do usuário. Para enfrentar esses desafios, apresentamos o NamedCurves+, uma abordagem inspirada no conceito de Nomeação de Cores, um conjunto universal de fa...

10.07.2026
Blog Geração de Imagem

TMI: Texto-para-Imagem Encontra Imagem-para-Imagem para Síntese Complementar de Dados a fim de Impulsionar a Segmentação de Instâncias de Cauda Longa

arXiv:2607.08201v1 Tipo de anúncio: novo Resumo: A segmentação de instâncias com vocabulário amplo é limitada por distribuições de categorias de cauda longa e pela ambiguidade fina entre classes. Embora a síntese de dados ofereça uma alternativa promissora, os paradigmas atuais têm limitações complementares: os métodos de texto-para-imagem (T2I) herdam pseudorrótulos ruidosos e têm dificuldade com classes raras, enquanto os métodos de copiar-e-colar comprometem o realismo contextual. Para enfrentar esses problemas, propomos um pipeline híbrido que acopla geração T2I...

10.07.2026
Blog Áudio & Voz

Adaptação do Qwen-ASR Guiada por Diarização para Fala Conversacional Multilíngue de Dois Falantes

arXiv:2607.08208v1 Tipo de anúncio: novo Resumo: Este artigo descreve nosso sistema de projeto próprio para a Tarefa 1 do Desafio MLC-SLM 2026, voltado à fala conversacional multilíngue de dois falantes. O sistema combina um front end modular de diarização de falantes com um reconhecedor Qwen3-ASR-1.7B adaptado ao desafio. O front end de diarização realiza detecção de atividade de voz, geração de subsegmentos, extração de embeddings de falante CAMPPlus, agrupamento espectral de dois falantes e segmentação de áudio baseada em RTTM. O result...

10.07.2026
Blog Robótica & RL

ContactMimic: Interação de Humanoides com Objetos por meio de Controle de Contato

arXiv:2607.08742v1 Tipo de anúncio: novo Resumo: O rastreamento de pontos-chave por si só é insuficiente para tarefas de interação com objetos, como sentar em uma cadeira, limpar um quadro ou empurrar móveis, nas quais o robô pode alcançar a pose correta sem fazer contato físico significativo com o objeto. Apresentamos o CONTACTMIMIC, um framework de aprendizado que rastreia comandos binários de contato explícitos em nível de parte junto com trajetórias de pontos-chave. O CONTACTMIMIC é viabilizado por meio do uso de recompensas de acompanhamento de contato e de um...

10.07.2026
Blog Visão Computacional

Explorando o Ajuste de Resolução de Entrada para Detecção de Objetos em LiDAR em Tempo Flexível

arXiv:2607.08391v1 Tipo de anúncio: novo Resumo: Fazer compromissos entre a latência de execução e a utilidade do resultado (ou seja, computação em tempo flexível) para se adaptar a requisitos operacionais dinâmicos já se mostrou capaz de aprimorar o desempenho de sistemas ciberfísicos. Neste trabalho, focamos em viabilizar a computação em tempo flexível para redes neurais profundas (DNNs) que processam nuvens de pontos LiDAR para detecção de objetos em 3D. Propomos um método inovador que possibilita a inferência em múltiplas resoluções para modelos que processam nuvens de pontos a...

10.07.2026
Blog Visão Computacional

Iscas Adversariais: Enganando Defesas Baseadas em Atenção em ViT

arXiv:2607.07922v1 Tipo de Anúncio: novo Resumo: Os Vision Transformers (ViTs) continuam vulneráveis a ataques adversariais localizados, por exemplo, patches adversariais, enquanto defesas recentes aplicadas no momento do teste os mitigam ao suprimir tokens de imagem com pontuações de atenção anormalmente altas. Essas defesas exploram um forte acoplamento entre a atenção e a eficácia adversarial: os tokens adversariais frequentemente precisam atrair uma atenção substancial para influenciar a predição. Nós introduzimos as iscas adversariais, otimizadas de forma independente...

10.07.2026
Blog Visão Computacional

Como Sei o Que Dizer em Seguida? A Teoria Autogenerativa de Barenholtz como um Enriquecimento do Integracionismo Harrisiano

arXiv:2607.07891v1 Tipo de anúncio: novo Resumo: A linguística integracionista de Roy Harris oferece uma crítica convincente à tradição referencialista enraizada profundamente no cerne das abordagens computacionais da linguagem, argumentando que a linguagem não é um código que se mapeia sobre um mundo pré-dado, mas uma atividade situada e bipartite orientada para a ação conjunta prospectiva. No entanto, o Integracionismo deixa certas lacunas explicativas: ele não dá conta plenamente do mecanismo estrutural pelo qual os signos sustentam prospec...

10.07.2026
Blog LLMs & Texto

Competição HIPE-OCRepair do ICDAR 2026 sobre Pós-Correção de OCR Assistida por LLM para Documentos Históricos

arXiv:2607.08143v1 Tipo de anúncio: novo Resumo: Apresentamos os resultados do HIPE-OCRepair-2026, uma competição do ICDAR sobre pós-correção de OCR assistida por LLM em documentos históricos. A pós-correção de OCR continua sendo um desafio de longa data no patrimônio digital: coleções em larga escala de documentos digitalizados são afetadas por erros herdados de OCR, enquanto a redigitalização em escala continua sendo impraticável. Os grandes modelos de linguagem (LLMs) oferecem uma grande oportunidade para revisitar esse desafio, embora sua eficácia ao longo de l...

10.07.2026
Blog Visão Computacional

LDFE: bloco de aprimoramento de características desacopladas por Laplaciano para detecção de objetos RGB-IR baseada em CNN de fluxo duplo

arXiv:2607.08076v1 Tipo de anúncio: novo Resumo: A informação complementar entre imagens RGB e IR pode aprimorar significativamente o desempenho da detecção de objetos sob condições extremas. Os métodos existentes preferem backbones CNN de fluxo duplo construídos sobre o YOLO para a extração de características e se concentram no design da fusão de características. Neste artigo, apresentamos o bloco de aprimoramento de características desacopladas por Laplaciano (LDFE) para fundir características de diferentes estágios do backbone CNN de fluxo duplo. Por concepção, o LDFE simultaneo...

10.07.2026
350 itens no radar