FATE: Frame-Level Audio-Visual Temporal Embedding
FATE learns frame-level audio-visual embeddings that jointly capture semantic content and temporal alignment through cross-video and within-video contrastive training.
Hugging Face · Daily Papers
·Kaisi Guan, Bingzi Zhang
·
·▲ 2 upvotes
Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.
Autores: Kaisi Guan, Bingzi Zhang, Xihua Wang, Ying Ba, Xin Cheng, Yijing Chen
- 2 upvotes da comunidade
- Temas: audio-visual models, frame-level embeddings, temporal alignment, cross-video contrastive learning, within-video contrastive learning, synchronization
Resumo
Resumo original (em inglês), extraído do paper:
FATE learns frame-level audio-visual embeddings that jointly capture semantic content and temporal alignment through cross-video and within-video contrastive training.Onde ler
// relacionados
Leia também
Modelo
nvidia/NVIDIA-NemotronLabs-VoiceChat-11B
Blog
Detecção de Autoapresentações em Depoimentos Legislativos
Blog
"Muitos São os Meus Nomes": A Anatomia do Assistente e Suas Personas por Meio de Autoencoders Esparsos
Blog