Wan-Dancer: o vídeo de dança que a difusão não conseguia manter por mais de 20 segundos
O Tongyi Lab, da Alibaba, publicou o Wan-Dancer-14B, um modelo de pesos abertos que gera vídeos de dança coerentes com mais de um minuto de duração a partir de uma foto, uma música e um estilo. O número interessante não é a dança — é o tempo: o triplo do limite prático da geração de vídeo por difusão até agora.
Modelos de geração de vídeo por difusão têm um problema conhecido e pouco discutido fora do meio técnico: eles esquecem. Gerar um quadro coerente com o anterior é relativamente fácil; manter essa coerência por um minuto inteiro — mesma pessoa, mesmo ambiente, movimento fisicamente plausível — é onde a maioria dos modelos quebra, normalmente antes dos 20 segundos.
O Wan-Dancer-14B, publicado pelo Tongyi Lab (o laboratório de IA da Alibaba) sob licença Apache 2.0, ataca esse problema com um caso de uso específico e visualmente exigente: transformar uma imagem de referência, uma faixa de música e um estilo de dança em um vídeo de corpo inteiro dançando de forma sincronizada e continuamente coerente — por mais de um minuto.
Por que dança é um teste difícil para vídeo generativo
Dança é um caso extremo de exigência para um gerador de vídeo: movimento rápido, articulações complexas, sincronização precisa com o áudio e a necessidade de manter a identidade da pessoa e a física do corpo consistentes quadro a quadro, por centenas de quadros seguidos. É o tipo de tarefa em que erros pequenos — um pé que desliza, um braço que "derrete" — ficam óbvios para qualquer espectador, mesmo sem treino técnico. Por isso serve como termômetro de quão longe a geração de vídeo coerente já chegou.
Como o modelo mantém a coerência por mais tempo
A saída do problema, segundo o Tongyi Lab, é hierárquica: o modelo primeiro planeja keyframes globais — poses-chave ao longo de toda a música, garantindo que a coreografia faça sentido do início ao fim — e só depois refina o movimento localmente entre esses pontos, quadro a quadro. É a diferença entre improvisar uma dança quadro a quadro e coreografá-la primeiro, do começo ao fim, para só então preencher os detalhes.
Duas peças técnicas sustentam isso: um mecanismo de RoPE mapeado no tempo (uma forma de embedding posicional adaptada para alinhar quadros de vídeo com o tempo real da música, mesmo em taxas de quadro variáveis) e uma função de perda baseada em optical flow — o campo de deslocamento de pixels entre quadros — que penaliza movimento fisicamente implausível durante a geração.
- Duração: vídeos coerentes de mais de 1 minuto (exemplos publicados de 2min08 a 2min41) — ante o limite prático de ~20s da maioria dos modelos de difusão.
- Resolução: 720p a 30fps.
- 5 estilos suportados: dança clássica chinesa, K-pop, street dance, dança latina e tap dance.
- Entrada: uma imagem de referência + uma faixa de música + um prompt de estilo.
- Licença: Apache 2.0, pesos e código abertos no Hugging Face.
- Instituição: Tongyi Lab, Alibaba Group.
O que muda na prática
Um minuto pode soar pouco, mas é a diferença entre um clipe de demonstração e um conteúdo publicável — a maioria dos vídeos curtos em redes sociais dura entre 15 segundos e 2 minutos. Um modelo capaz de manter coerência nessa janela inteira, com pesos abertos e sem custo de API, reduz drasticamente a barreira para produção de conteúdo audiovisual sintético em escala: estúdios pequenos, criadores individuais e ferramentas de terceiros podem rodar o modelo localmente ou hospedá-lo, sem depender de um provedor fechado que cobra por segundo gerado.
É também um lembrete de como a competição em geração de vídeo mudou de eixo. Não é mais só "a imagem parece real?" — é "o movimento se sustenta ao longo do tempo?". O Wan-Dancer não é o primeiro a tentar isso (o próprio material de divulgação do Tongyi Lab compara o modelo ao X-Dancer, um sistema anterior com o mesmo objetivo, afirmando estabilidade temporal superior), mas é o primeiro a publicar pesos abertos que sustentam a coerência por tempo tão longo nesse caso de uso específico.
O limite que continua ali
Vale o ceticismo de praxe: os exemplos publicados por qualquer laboratório são, por definição, os melhores resultados que ele conseguiu produzir — não a média do que o modelo entrega em uso real com referências de imagem imperfeitas, músicas fora do repertório de treino ou coreografias fora dos cinco estilos cobertos. Generalizar para estilos de dança não vistos no treino, ou para vídeos com múltiplas pessoas em cena, são testes que a divulgação inicial não responde.
O que fica
O Wan-Dancer-14B não resolve geração de vídeo coerente de forma geral — resolve um recorte bem definido dela, dança sincronizada com música, e resolve com folga suficiente para servir de sinal de para onde a técnica está indo. O gargalo real da geração de vídeo generativo sempre foi o tempo: quanto mais longo o clipe, mais chances de a coerência quebrar. Um modelo aberto que estica esse limite em três vezes, mesmo em um domínio específico, vale mais como indicador de tendência do que como produto pronto.
Perguntas Frequentes
O que é preciso para usar o Wan-Dancer?
Uma imagem de referência da pessoa, uma faixa de música e um prompt descrevendo o estilo de dança desejado entre os cinco suportados. O modelo está disponível com pesos abertos no Hugging Face sob licença Apache 2.0.
Por que vídeos de dança são mais difíceis de gerar do que outros vídeos?
Porque exigem sincronização precisa entre áudio e movimento, articulações complexas e preservação da identidade e da física do corpo ao longo de centenas de quadros consecutivos — qualquer falha pequena, como um pé que desliza, é imediatamente perceptível para o olho humano.
O que é o "RoPE mapeado no tempo" citado na arquitetura?
É uma adaptação do RoPE (Rotary Position Embedding, a técnica usada para informar a um modelo a posição relativa dos elementos numa sequência) para alinhar quadros de vídeo ao tempo real da faixa de música, mesmo quando a taxa de quadros varia — o que ajuda a manter a dança sincronizada com o áudio por toda a duração do clipe.