Otimização de Política Multirramificada para Grandes Modelos de Linguagem Multimodais
arXiv:2608.07581v1 Tipo de Anúncio: novo Resumo: Os métodos de aprendizado por reforço baseados em grupos para grandes modelos de linguagem multimodais normalmente dependem da atribuição de crédito em nível de trajetória, que aplica uma única vantagem a todos os tokens de uma resposta. No entanto, o raciocínio multimodal envolve uma incerteza perceptiva substancialmente maior do que os cenários apenas de texto, nos quais o modelo precisa reexaminar repetidamente as informações visuais para verificar interpretações intermediárias, e diferentes ancoragens visuais podem levar a dive...
arXiv cs.CV
·Shuai Lyu, Yuning Gong, Ruiling Gao, Xiaoran Shang, Zhonghong Ou, Ping Zong, Yifan Zhu, Yuan Sun, Yang Qin, Peng Hu
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo