// radar de ia

Geração de Imagem

Papers, modelos e datasets em alta no Hugging Face, além do blog oficial — com leitura editorial em português.

Blog Geração de Imagem

IB-Flow: destilação de CFG guiada por gargalo de informação para geração de texto para imagem em poucos passos

arXiv:2607.09133v1 Tipo de anúncio: novo Resumo: Embora os modelos generativos de texto para imagem em larga escala tenham alcançado um desempenho visual sem precedentes, sua dependência inerente de solucionadores iterativos de múltiplos passos acarreta uma latência de inferência severa. A destilação em poucos passos voltada para a trajetória de Classifier-Free Guidance (CFG) surgiu como o paradigma predominante de compressão bidimensional. No entanto, os frameworks existentes permanecem subjugados por um paradigma de injeção cega de granularidade grosseira que impõe perpetuamente um...

13.07.2026
Blog LLMs & Texto

Inicialização por Componentes Guiada pela Complexidade para o Pré-treinamento de Modelos de Linguagem

arXiv:2607.09204v1 Tipo de anúncio: novo Resumo: Modelos de linguagem pré-treinados frequentemente exibem espectros de pesos estruturados, sugerindo que o treinamento pode produzir repetidamente uma organização semelhante por camadas e por componentes. Perguntamos se esses padrões espectrais recorrentes podem ser reutilizados como um sinal de inicialização para o pré-treinamento de modelos de linguagem no estilo GPT-2. Primeiro, analisamos onze checkpoints pré-treinados no estilo GPT-2 que variam em tamanho, idioma, tokenizador e corpus de treinamento, medindo a norma de Frobenius e ...

13.07.2026
Blog Robótica & RL

PRecG: Recuperação de Precedentes Jurídicos com Redes Neurais de Grafos e Segmentação por Papéis Retóricos

arXiv:2607.09094v1 Tipo de anúncio: novo Resumo: A recuperação de precedentes jurídicos é uma tarefa fundamental na preparação de processos judiciais, no planejamento, na estratégia de litígio e na pesquisa jurídica. As abordagens atuais para a recuperação automática de precedentes mapeiam documentos jurídicos para um espaço semântico de baixa dimensionalidade e calculam a similaridade com base na proximidade de suas representações. Essas abordagens tratam os documentos jurídicos como textos monolíticos, ignorando a organização retórica das tecnicalidades jurídicas. Logo, elas deixam de considerar...

13.07.2026
Blog LLMs & Texto

BlockServe: Batching Contínuo em Granularidade de Bloco para Serviço de LLMs de Difusão com Alta Taxa de Transferência

arXiv:2607.08930v1 Tipo de Anúncio: novo Resumo: O serviço eficiente de large language models de difusão (dLLMs) é prejudicado pela heterogeneidade de convergência: ao agrupar múltiplas requisições em lote, diferentes sequências convergem a taxas distintas, fazendo com que requisições mais rápidas fiquem paradas atrás de retardatárias mais lentas e introduzindo bolhas de computação e latência de cauda. Apresentamos o BlockServe, um framework de batching contínuo que integra escalonamento em granularidade de bloco — despejando imediatamente as requisições concluídas nos limites de bloco ...

13.07.2026
Blog Robótica & RL

StereoSplat+: Renderização Gaussiana Estéreo Feed-Forward com Inferência Progressiva Assistida por Difusão

arXiv:2607.08808v1 Tipo de anúncio: novo Resumo: Avanços recentes em 3D Gaussian Splatting (3DGS) permitiram representações de cena de alta qualidade e prontas para renderização voltadas à síntese de novas visualizações. No entanto, a maioria dos pipelines de 3DGS existentes depende de observações multivisão (ou de acesso não causal a quadros futuros) para alcançar cobertura suficiente, o que muitas vezes não está disponível em cenários de robótica em dispositivo e de RA, nos quais o sensoriamento fica restrito a um único conjunto estéreo. Recuperar uma cena 3DGS de alta qualidade a partir de uma observaç...

13.07.2026
Blog Geração de Imagem

Reconstrução 4D de Cena Humana a Partir de Capturas com Baixa Sobreposição

arXiv:2607.09125v1 Tipo de anúncio: novo Resumo: A captura volumétrica existente de desempenho humano dinâmico alcança alta fidelidade com densos conjuntos de câmeras. No entanto, em cenários do mundo real, apenas um punhado de câmeras com baixa sobreposição está disponível, o que degrada a qualidade do resultado e deixa grandes áreas não observadas. Métodos recentes de reconstrução 4D têm se concentrado em configurações de baixa sobreposição, mas ainda produzem artefatos perceptíveis em regiões pouco observadas. Os modelos de difusão de vídeo surgiram como outra o...

13.07.2026
Blog Robótica & RL

FlowDAgger: Adaptação com Humano no Circuito de Políticas Generativas de Robôs no Espaço Latente

arXiv:2607.08877v1 Tipo de anúncio: novo Resumo: Políticas generativas de robôs pré-treinadas baseadas em flow matching e difusão alcançaram resultados impressionantes em uma ampla variedade de tarefas de manipulação. No entanto, as implantações no mundo real expõem rotineiramente modos de falha fora da distribuição de pré-treinamento. Fechar essas lacunas normalmente exige coleta de dados em larga escala ou aprendizado por reforço online em hardware físico, o que é impraticável para uma adaptação rápida e segura. Apresentamos o FlowDAgger, um sample- ...

13.07.2026
Blog Robótica & RL

GenVid2Robot: Da Geração de Vídeo à Manipulação Robótica via Consistência Rígido-Geométrica

arXiv:2607.09191v1 Tipo de Anúncio: novo Resumo: Vídeos gerados fornecem priors visuais de movimento úteis para a manipulação robótica, mas sua plausibilidade visual não implica em executabilidade física. Um vídeo gerado normalmente carece de geometria métrica, ancoragem de preensão, viabilidade cinemática do robô e feedback em tempo de execução, o que torna a repetição direta da trajetória pouco confiável na manipulação no mundo real. Este artigo apresenta o GenVid2Robot, um framework de consistência rígido-geométrica que converte o mo... (o movimento) de vídeo gerado

13.07.2026
Blog Geração de Imagem

MPPI adaptativo com estimativa online de covariância de perturbação: aperto de estabilidade comprovável por meio de suavização espacial

arXiv:2607.08942v1 Tipo de anúncio: cross Resumo: Estudamos o controle por integral de caminho de modelo preditivo (MPPI) para sistemas não lineares com perturbações aditivas no processo cuja covariância é desconhecida, varia espacialmente e varia lentamente no tempo. Uma covariância de perturbação incompatível produz uma penalidade persistente nos certificados de estabilidade em malha fechada, enquanto a estimativa online pode reduzir essa penalidade à medida que os dados são coletados. Propomos um estimador de covariância recursivo célula a célula com difusão espacial e provamos um ...

13.07.2026
Blog Geração de Imagem

Modelos de Geração de Vídeo são Aprendizes de Visão de Propósito Geral

arXiv:2607.09024v1 Tipo de Anúncio: novo Resumo: Impulsionado pela previsão do próximo token, o PLN deixou de usar modelos específicos para cada tarefa e passou a adotar poderosos modelos de fundação generalistas. Qual seria, então, o catalisador equivalente necessário para alcançar um modelo de propósito geral em visão computacional? Neste artigo, defendemos que a geração de texto para vídeo em larga escala serve como um forte paradigma de pré-treinamento para a visão computacional, fornecendo os priors espaço-temporais necessários, o alinhamento visão-linguagem e a escalabilidade exigidos para gen...

13.07.2026
Blog Geração de Imagem

Investigando a dinâmica de remoção de ruído da difusão para o aprendizado contrastivo de representações

arXiv:2607.09067v1 Tipo de anúncio: novo Resumo: Os modelos de difusão de texto para imagem exibem uma capacidade generativa sem precedentes e contêm ricas representações intermediárias que podem ser úteis para tarefas discriminativas de visão. Motivados por essa observação, estudamos uma questão específica: como a dinâmica de remoção de ruído de um modelo de difusão pré-treinado pode ser adaptada para dar suporte ao aprendizado discriminativo de representações, ao mesmo tempo em que preserva seu comportamento generativo sob atualizações eficientes em termos de parâmetros? Apresentamos o D$^3$CL ...

13.07.2026
420 itens no radar