// radar de ia

Áudio & Voz

Papers, modelos e datasets em alta no Hugging Face, além do blog oficial — com leitura editorial em português.

Blog Áudio & Voz

VSRo-200: Um Conjunto de Dados de Reconhecimento Visual de Fala em Romeno para Estudar Supervisão e Robustez Multimodal

arXiv:2607.08112v1 Tipo de Anúncio: novo Resumo: Apresentamos o VSRo-200, o primeiro conjunto de dados em larga escala para reconhecimento visual de fala (leitura labial) em romeno, composto por 200 horas de vídeos reais de podcasts. Todas as amostras são anotadas com pseudorrótulos gerados por um modelo de ASR romeno ajustado, enquanto um subconjunto de 100 horas é adicionalmente transcrito por humanos, possibilitando uma análise controlada da qualidade da supervisão sob uma estrutura unificada. Com base nesse conjunto de dados, estabelecemos um benchmark para...

10.07.2026
Blog Áudio & Voz

COALA: Modelagem de Linguagem Robusta e Aumentada por Fala Contextualizada para ASR via Regularizador Contrastivo e Estimação de Pontuação de Viés

arXiv:2607.08117v1 Tipo de anúncio: novo Resumo: O viés contextual busca integrar conhecimento externo aos sistemas de reconhecimento automático de fala (ASR) para reconhecer com precisão entidades específicas de domínio. Neste artigo, propomos o COALA (ASR Contextualizado Aproveitando a Pontuação de Viés), um framework robusto projetado para aprimorar modelos de linguagem aumentados por fala (SLMs) em cenários complexos com múltiplas entidades. Considerando as limitações inerentes da janela de contexto dos SLMs, identificar entidades-alvo relevantes a partir de...

10.07.2026
Blog Áudio & Voz

A avaliação Best-of-$N$ de TTS é distorcida pelo alinhamento de família do ASR

arXiv:2607.08256v1 Tipo de anúncio: novo Resumo: A inferência Best-of-$N$ (BoN) melhora a consistência de conteúdo em text-to-speech zero-shot ao selecionar entre $N$ candidatos com um verificador de reconhecimento automático de fala (ASR). Identificamos um fator de confusão pouco explorado na avaliação: a qualidade aparente de um verificador depende fortemente de qual família de ASR o julga. No LibriSpeech-PC test-clean~\citep{librispeechpc} com o F5-TTS~\citep{f5tts}, as classificações dos verificadores se invertem entre os avaliadores Whisper, wav2vec~2.0 e HuBERT...

10.07.2026
Blog Áudio & Voz

Adaptação do Qwen-ASR Guiada por Diarização para Fala Conversacional Multilíngue de Dois Falantes

arXiv:2607.08208v1 Tipo de anúncio: novo Resumo: Este artigo descreve nosso sistema de projeto próprio para a Tarefa 1 do Desafio MLC-SLM 2026, voltado à fala conversacional multilíngue de dois falantes. O sistema combina um front end modular de diarização de falantes com um reconhecedor Qwen3-ASR-1.7B adaptado ao desafio. O front end de diarização realiza detecção de atividade de voz, geração de subsegmentos, extração de embeddings de falante CAMPPlus, agrupamento espectral de dois falantes e segmentação de áudio baseada em RTTM. O result...

10.07.2026
NHS AI blood test could reduce invasive womb cancer checks
Blog Áudio & Voz

NHS AI blood test could reduce invasive womb cancer checks

Several NHS hospitals are preparing to use an AI-powered blood test to help assess women referred for possible womb cancer before invasive checks are carried out. According to The Guardian, around 90,000 postmenopausal women in England are referred by GPs each year for checks after experiencing heavy bleeding. About 10,000 women are diagnosed with womb […] The post NHS AI blood test could reduce invasive womb cancer checks appeared first on AI News .

09.07.2026
Blog Áudio & Voz

Ensemble Deep Learning Approaches for AI-Altered Video Detection

arXiv:2607.06872v1 Announce Type: new Abstract: The increasing accessibility of artificial intelligence has led to a rapid rise in AI-generated videos, making it more difficult to distinguish between real and manipulated content. Many existing detection methods rely on a single model and often struggle to generalize across different types of deepfakes. In this work, we developed a multimodal deepfake detection system that combines both audio and visual analysis using an ensemble of models. The s...

09.07.2026
Blog Áudio & Voz

Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts

arXiv:2607.06611v1 Announce Type: new Abstract: Automatically recognizing the sentiment, positive or negative, from speech is a challenging task, requiring both the analysis of vocal inflections and the interpretation of uttered words. Recent solutions rely on audio foundation models to solve the task, but it remains unclear if such models can take all aspects into account. To this end, we propose a multimodal solution that integrates audio and text information via cross-modal transformers, wher...

09.07.2026
Blog Áudio & Voz

Compass: Prostate Cancer Detection Needs Multi-View Context

arXiv:2607.06919v1 Announce Type: new Abstract: Artificial intelligence (AI) analysis of micro-ultrasound ($\mu$US) has shown promise for prostate cancer (PCa) detection. However, most existing AI methods focus on the analysis of single $\mu$US images in isolation. By contrast, expert $\mu$US readers typically assess a full recorded video study, which provides three-dimensional context, to improve PCa detection compared to single-frame analysis. Inspired by this clinical workflow, we propose Com...

09.07.2026
216 itens no radar