// radar de ia

Áudio & Voz

Papers, modelos e datasets em alta no Hugging Face, além do blog oficial — com leitura editorial em português.

Guia do Patter SDK para Construir um Agente Telefônico de Reservas de Restaurante com Variáveis Dinâmicas, Guardrails, Painéis de Latência e Verificações de Avaliação
Blog Áudio & Voz

Guia do Patter SDK para Construir um Agente Telefônico de Reservas de Restaurante com Variáveis Dinâmicas, Guardrails, Painéis de Latência e Verificações de Avaliação

Nós exploramos o Patter SDK construindo um fluxo de trabalho de agente de voz para um caso de uso de reservas de restaurante. Definimos variáveis dinâmicas de quem liga, registramos ferramentas chamáveis para disponibilidade, reservas, horários e transferência para atendente humano, e sobrepomos guardrails de saída em cada resposta. Simulamos o comportamento de fala-para-texto e texto-para-fala, executamos fluxos de chamada roteirizados e acompanhamos a latência e o custo modelados em um painel. Validamos o agente com uma estrutura de avaliação determinística e, em seguida, mapeamos a mesma lógica para uma implantação real usando o Twi...

16.07.2026
O primeiro produto de hardware da OpenAI é um alto-falante com IA sem tela projetado para parecer vivo
Blog Áudio & Voz

O primeiro produto de hardware da OpenAI é um alto-falante com IA sem tela projetado para parecer vivo

A OpenAI planeja entrar no mercado de hardware com um alto-falante inteligente portátil e sem tela. Equipado com câmera, sensores e partes mecânicas móveis, o dispositivo foi projetado como um companheiro de IA que parece "vivo". Mas o processo por segredos comerciais movido pela Apple, envolvendo o chefe de hardware da OpenAI, Tang Tan, pode atrasar seu lançamento previsto para 2027. O artigo O primeiro produto de hardware da OpenAI é um alto-falante com IA sem tela projetado para parecer vivo apareceu primeiro em The Decoder.

15.07.2026
Blog LLMs & Texto

Temos Uma Tradução Séria: Modelando a Intercompreensão como Inferência Probabilística

arXiv:2607.12169v1 Tipo de Anúncio: novo Resumo: A intercompreensão refere-se à inteligibilidade parcial de uma língua desconhecida (L2) por um falante de uma língua aparentada (L1). Como é possível essa compreensão interlinguística de forma zero-shot? Neste trabalho, estendemos trabalhos anteriores sobre modelos algorítmicos de inferência por canal ruidoso para modelar a intercompreensão em um arcabouço bayesiano. O modelo usa um LM em L1 apenas para pontuar hipóteses latentes sobre as traduções de enunciados observados em L2, e um propós...

15.07.2026
Blog Áudio & Voz

Aprendendo com Representações Complementares de Ultrassom para a Classificação de Doenças Hepáticas

arXiv:2607.12062v1 Tipo de anúncio: novo Resumo: Diferenciar a esteato-hepatite não alcoólica (NASH) da doença hepática gordurosa não alcoólica (NAFLD) usando ultrassom continua sendo um desafio devido a alterações sutis nos tecidos e à quantidade limitada de informação disponível na imagem convencional em modo B. Neste trabalho, investigamos se representações complementares de ultrassom derivadas de uma mesma aquisição podem melhorar a classificação entre NASH e NAFLD. Especificamente, combinamos o ultrassom convencional em modo B...

15.07.2026
Blog Visão Computacional

Aprendizado Contínuo Híbrido para Identificação de Línguas Aborígenes Australianas de Baixos Recursos

arXiv:2607.11946v1 Tipo de Anúncio: novo Resumo: A identificação de idiomas é um passo importante rumo à integração das línguas aborígenes australianas (AALs) ameaçadas de extinção às tecnologias de fala que apoiam a revitalização linguística e a inclusão digital. No entanto, a escassez extrema de dados limita o desempenho dos modelos. A transferência de aprendizado a partir de línguas de altos recursos se mostra promissora, mas frequentemente sofre de esquecimento catastrófico ao se adaptar a novas línguas. O aprendizado contínuo (CL) pode atenuar esse problema, embora ele...

15.07.2026
216 itens no radar