Qwen-Music: para gerar uma canção com voz, o modelo primeiro compõe a melodia
A Alibaba publicou o relatório técnico do Qwen-Music, um sistema de geração musical que produz canções completas — com canto — a partir de texto ou de uma melodia de referência. A peça central é um mecanismo que planeja a melodia antes de gerar a canção inteira, treinado sobre mais de 5 milhões de horas de música multilíngue.
Gerar áudio musical coerente é mais difícil do que gerar fala: uma canção precisa manter estrutura harmônica, ritmo e uma linha melódica reconhecível por vários minutos, ao mesmo tempo em que sincroniza voz cantada com instrumentação — dois fluxos de áudio que precisam concordar em afinação, tempo e emoção. É um problema em que "parece música" e "é música boa" estão longe de ser a mesma coisa.
O Qwen-Music, cujo relatório técnico foi publicado pela equipe Qwen da Alibaba, é um sistema unificado para duas tarefas: gerar uma canção completa — com canto — a partir de uma descrição em texto, e gerar um cover de uma melodia de referência com reinterpretação estilística. A peça que diferencia o sistema de gerações anteriores é como ele decide a melodia antes de "cantar" a canção inteira.
Três componentes, uma linha de produção
O sistema é dividido em três módulos que operam em sequência. O Qwen-Music-Tokenizer comprime o áudio bruto num fluxo compacto de tokens semânticos musicais, a 25 Hz e com um único codebook — uma representação discreta da música, análoga a como um tokenizador de texto quebra frases em unidades processáveis por um LLM. O Qwen-Music-LLM faz a modelagem autorregressiva sobre esses tokens, decidindo o que vem a seguir na composição. E o Qwen-Music-Render converte os tokens semânticos de volta em áudio estéreo de alta fidelidade, resolvendo a perda de qualidade que normalmente vem de trabalhar com uma representação discreta e comprimida.
O que é o Melody-CoT
A inovação central do relatório é o Melody-CoT (Melody Chain-of-Thought), um mecanismo em que o modelo primeiro gera uma linha melódica — em tokens dedicados à melodia — antes de gerar a canção completa. É o mesmo princípio por trás do chain-of-thought em LLMs de texto, que pede a um modelo para "pensar em voz alta" antes de responder: aqui, em vez de raciocínio verbal, o "pensamento" intermediário é uma melodia planejada, que serve de estrutura para a geração completa que vem depois.
Segundo a equipe, esse planejamento prévio melhora criatividade, musicalidade e coerência estrutural — a canção final segue um arco melódico definido de antemão, em vez de ser gerada nota a nota sem plano de longo prazo, o que tende a produzir composições que perdem o fio pela metade.
- Arquitetura: Tokenizer (25 Hz, codebook único) + LLM autorregressivo com Melody-CoT + Render estéreo generativo.
- Dado de treino: mais de 5 milhões de horas de música multilíngue, cobrindo centenas de idiomas.
- Treino: currículo de pré-treino graduado por qualidade, seguido de inicialização supervisionada, DPO offline e GSPO online (otimização por preferência).
- Capacidades: geração de canção completa (texto → música com canto) e cover com reinterpretação estilística a partir de melodia de referência.
- Avaliação: estado da arte em 13 de 16 métricas objetivas de musicalidade e qualidade de áudio, sobre 600 prompts em chinês e inglês; avaliadores humanos profissionais preferiram o sistema a alternativas proprietárias em testes cegos.
Por que isso não é só "mais um gerador de música"
Modelos de geração musical por texto já existem há alguns anos, mas a maioria deles gera instrumental ou trata voz cantada como um efeito colateral difícil de controlar. Um sistema que trata a melodia como uma etapa de planejamento explícita, separada da geração final, ataca diretamente o motivo pelo qual canto gerado costuma soar "quase certo, mas não exatamente": a melodia e a letra são geradas mais ou menos simultaneamente, sem uma estrutura de mais alto nível guiando a coerência ao longo da canção inteira.
O treino em 5 milhões de horas multilíngues também é um dado que merece nota: é uma escala de dado próxima da usada para treinar LLMs de texto de porte médio, aplicada a um domínio — áudio musical — historicamente mais pobre em dado de treino de qualidade do que texto ou imagem.
O limite de avaliar "qualidade musical"
Métricas objetivas de musicalidade e testes cegos com avaliadores profissionais são, hoje, o que existe de melhor para comparar sistemas de geração musical — mas ambos carregam limitação. Métricas objetivas capturam propriedades mensuráveis (afinação, estrutura, ritmo), não necessariamente o que faz uma canção boa de ouvir; e avaliação humana, mesmo profissional, é sensível a viés de familiaridade e ao próprio recorte de prompts escolhido pela equipe que publica o resultado — 600 prompts em chinês e inglês não cobrem toda a diversidade de gênero e idioma que a Qwen-Music afirma suportar.
O que fica
O Qwen-Music não resolve geração musical de forma definitiva, mas aponta uma direção clara: assim como aconteceu com texto, dar ao modelo um espaço explícito para planejar antes de gerar — em vez de produzir tudo token a token sem estrutura prévia — parece ser o próximo salto de qualidade também para áudio. A pergunta que fica em aberto é a mesma de sempre em geração criativa: o quanto dessa "musicalidade medida" se traduz em música que as pessoas realmente queiram ouvir fora de um teste cego.
Perguntas Frequentes
O que é o Melody-CoT?
É um mecanismo em que o Qwen-Music gera primeiro uma linha melódica, como um planejamento intermediário, antes de compor a canção completa — inspirado no chain-of-thought usado em LLMs de texto, em que o modelo "pensa" em etapas antes de dar a resposta final.
O Qwen-Music gera voz cantada de verdade, não só instrumental?
Sim — é uma das duas capacidades centrais do sistema: gerar uma canção completa, incluindo canto, a partir de uma descrição em texto, além de gerar covers com reinterpretação estilística a partir de uma melodia de referência.
Como o sistema evita a perda de qualidade de áudio ao usar tokens comprimidos?
Através do módulo Qwen-Music-Render, que faz a renderização estéreo generativa a partir dos tokens semânticos comprimidos, reconstruindo áudio de alta fidelidade em vez de depender diretamente da representação discreta e compacta usada durante a modelagem.