FATE: Frame-Level Audio-Visual Temporal Embedding

FATE: Frame-Level Audio-Visual Temporal Embedding

FATE learns frame-level audio-visual embeddings that jointly capture semantic content and temporal alignment through cross-video and within-video contrastive training.

Hugging Face · Daily Papers ·Kaisi Guan, Bingzi Zhang · ·▲ 2 upvotes

Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.

Autores: Kaisi Guan, Bingzi Zhang, Xihua Wang, Ying Ba, Xin Cheng, Yijing Chen

  • 2 upvotes da comunidade
  • Temas: audio-visual models, frame-level embeddings, temporal alignment, cross-video contrastive learning, within-video contrastive learning, synchronization

Resumo

Resumo original (em inglês), extraído do paper:

FATE learns frame-level audio-visual embeddings that jointly capture semantic content and temporal alignment through cross-video and within-video contrastive training.

Onde ler

compartilhar: