CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing

CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing

A new dataset, benchmark, and 22B model enable compositional instruction-guided video editing with multi-region attention and temporal coherence.

Hugging Face · Daily Papers ·Fuchen Long, Cong Wang · ·▲ 13 upvotes

Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.

Autores: Fuchen Long, Cong Wang, Zitao Gao, Wenhao Zhong, Yu Cheng, Xiaolu Hou

  • 13 upvotes da comunidade
  • Temas: compositional instruction-guided video editing, CoinVE-200K, CoinVE-Bench, CoinVE-Edit, region-aware attention, Wan2.1-T2V-14B

Resumo

Resumo original (em inglês), extraído do paper:

A new dataset, benchmark, and 22B model enable compositional instruction-guided video editing with multi-region attention and temporal coherence.

Onde ler

compartilhar: