Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
Internalized Visual Thinking trains multimodal models to predict future frame embeddings during post-training, enabling direct answer generation at inference without synthesizing i…
Hugging Face · Daily Papers
·Xiaoyu Zhu, Xinke Deng
·
·▲ 6 upvotes
Este artigo está em destaque na seleção diária de papers do Hugging Face, curada pela comunidade de pesquisa em IA.
Autores: Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar, Arnab Kumar Mondal, Zhongyu Jiang, Ian Fasel
- 6 upvotes da comunidade
- Temas: Visual CoT, Internalized Visual Thinking, next-embedding prediction, predictive world modeling, multimodal large language models, proactive video reasoning
Resumo
Resumo original (em inglês), extraído do paper:
Internalized Visual Thinking trains multimodal models to predict future frame embeddings during post-training, enabling direct answer generation at inference without synthesizing intermediate images and cutting latency over fivefold.