// radar de ia

Áudio & Voz

Papers, modelos e datasets em alta no Hugging Face, além do blog oficial — com leitura editorial em português.

Blog Áudio & Voz

Transplante de Tokenizador: Mitigando o Colapso Autorregressivo em ASR de Bengali Eficiente para Edge

arXiv:2607.09598v1 Tipo de anúncio: novo Resumo: Modelos leves de reconhecimento de fala são fundamentais para a implantação em edge, no entanto, arquiteturas altamente otimizadas como a Moonshine frequentemente falham em línguas morfologicamente ricas e não latinas, como o bengali. Este estudo identifica que a causa raiz dessa falha é o tokenizador de nível de byte centrado no inglês do modelo, que fragmenta as palavras em bengali em cadeias de bytes de alta fertilidade e desencadeia um colapso autorregressivo catastrófico durante a inferência. Para resolver isso, um no...

13.07.2026
Blog LLMs & Texto

Além dos Deslocamentos Temporais: Adaptando o Omni-LLM como um Avaliador Sem Referência para Modelos Generativos Audiovisuais

arXiv:2607.09091v1 Tipo de Anúncio: novo Resumo: À medida que os modelos generativos audiovisuais evoluem para simuladores de mundo, a sincronização entre modalidades se destaca como um indicador crítico para avaliar a consistência da dinâmica do mundo e da causalidade no conteúdo gerado. No entanto, as métricas de avaliação existentes pressupõem correção estrutural, reduzindo a sincronização a um mero alinhamento temporal. Consequentemente, elas falham em saídas generativas, especialmente quando exibem alucinações estruturais e assimetria entre modalidades ...

13.07.2026
Blog LLMs & Texto

KV-PRM: Modelagem Eficiente de Recompensa de Processo via Transferência de KV-Cache para Escalonamento em Tempo de Teste Multiagente

arXiv:2607.09153v1 Tipo de anúncio: novo Resumo: Os Modelos de Recompensa de Processo (PRMs) têm se mostrado altamente eficazes na orientação de métodos de escalonamento em tempo de teste (TTS), que ampliam significativamente as capacidades de sistemas multiagentes baseados em LLM. No entanto, os PRMs existentes são baseados em texto: eles reprocessam todo o texto da trajetória do zero. Em rollouts multiagentes longos, o custo de pontuação, que cresce quadraticamente em relação ao comprimento da sequência L, cria um gargalo computacional severo, limitando gravemente P...

13.07.2026
Blog Áudio & Voz

Relatório Técnico do FreyaTTS

arXiv:2607.09530v1 Tipo de Anúncio: novo Resumo: Apresentamos o Freya-TTS, um modelo de conversão de texto em fala compacto, sem tokenizador e com prioridade para o turco, projetado para síntese conversacional altamente confiável e eficiente. O Freya-TTS é um Diffusion Transformer (DiT) de correspondência de fluxo condicional não autorregressivo com 183,2 milhões de parâmetros, que opera no espaço latente contínuo e congelado do AudioVAE2 (codificação em 16 kHz, decodificação em 48 kHz), permitindo que o modelo concentre sua capacidade no mapeamento de texto para latente enquanto herda alta qualid...

13.07.2026
Kyutai lança o MuScriptor: um Transformer somente-decodificador de pesos abertos para transcrição de música multi-instrumental para MIDI
Blog Áudio & Voz

Kyutai lança o MuScriptor: um Transformer somente-decodificador de pesos abertos para transcrição de música multi-instrumental para MIDI

O MuScriptor é um Transformer somente-decodificador de pesos abertos, desenvolvido pela Kyutai e pela Mirelo. Treinado com 170 mil gravações reais mais 1,45 milhão de MIDIs sintéticos, ele transcreve mixagens completas de múltiplos instrumentos em MIDI. O artigo aborda seu pipeline de três estágios, comparações de desempenho com o YourMT3+, o condicionamento por instrumento e a configuração, além de uma demonstração explicativa interativa. O post Kyutai lança o MuScriptor: um Transformer somente-decodificador de pesos abertos para transcrição de música multi-instrumental para MIDI apareceu primeiro no MarkTechPost.

10.07.2026
Blog Áudio & Voz

Uma Avaliação de Confiabilidade de Juízes de Áudio LALM para Agentes de Voz Full-Duplex

arXiv:2607.07985v1 Tipo de Anúncio: novo Resumo: Relatamos a confiabilidade empírica dos modelos Gemini como juízes de áudio que pontuam conversas de agentes full-duplex diretamente a partir da forma de onda estéreo bruta, testados em três modelos da família Gemini: 2.5 Flash, 3.5 Flash e 3.1 Pro. Nossa principal base de evidências utiliza o Gemini 2.5 Flash como o modelo de referência (ground-truth), validado contra três avaliadores humanos calibrados em 209 sessões estéreo, pontuadas em 8 dimensões de produção: 152 conversas full-duplex acros...

10.07.2026
216 itens no radar