Avaliação de Vídeo Condicionada a Ação e Linguagem para Controle Incorporado
arXiv:2608.08273v1 Tipo de Anúncio: novo Resumo: Agentes incorporados baseados em visão que executam instruções em linguagem natural de múltiplas etapas exigem mecanismos de feedback que avaliem o progresso da tarefa ao longo de trajetórias completas. As abordagens convencionais baseadas na correspondência do quadro final ou na similaridade contínua de embeddings podem negligenciar as transições intermediárias que são necessárias para determinar se uma instrução foi concluída. Propomos o ALVA (Avaliação de Vídeo Condicionada a Ação e Linguagem), uma avaliação de trajetória...
arXiv cs.RO
·Hwanhee Kim, Jaehyun Jang, Seungmin Cha, Hyeonseo Yun, Donghoon Lee, Chang D. Yoo
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo