V-RAE: Rethinking Video Latent Spaces for Generation
V-RAE constructs semantically organized video latents from frozen vision representations to improve generation quality, convergence speed, and predictive modeling.
Hugging Face · Daily Papers
·Minghui Guo, Shengqiong Wu
·
·▲ 15 upvotes
Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.
Autores: Minghui Guo, Shengqiong Wu, Hao Fei
- 15 upvotes da comunidade
- Temas: V-RAE, video representation autoencoder, frozen vision foundation model, temporal pooling, video decoder, rFVD
Resumo
Resumo original (em inglês), extraído do paper:
V-RAE constructs semantically organized video latents from frozen vision representations to improve generation quality, convergence speed, and predictive modeling.