Search-G1: Agentes de Busca Fundamentados por Meio de Recompensas Intrínsecas Baseadas em Representação
arXiv:2608.07531v1 Tipo de Anúncio: novo Resumo: Agentes de linguagem aumentados por busca devem recuperar informações externas apenas quando necessário e fundamentar suas respostas nas evidências recuperadas. As recompensas externas existentes fornecem ou uma supervisão de resultado esparsa ou um feedback mais rico proveniente de anotações de processo e de avaliadores LLM. As recompensas de resultado escalam com facilidade, mas não conseguem distinguir a recuperação fundamentada da busca redundante, ao passo que sinais mais ricos exigem anotação ou inferência custosa durante o treinamento. Recompensas internas...
arXiv cs.CL
·Cheng Ruoxi, Ma Haoxuan, Zhang Hongyi, Zhang Junming, Duan Ranjie, Xia Qiaolin, Wang Hao, Lu Yu, Shi Haibo, Ma Xingjun
·
// relacionados
Leia também
Editorial
O modelo que continua aprendendo depois de entregue: dentro do Macaron-V1
Blog
Novo Nordisk e AWS levam IA agêntica à descoberta de medicamentos
Blog
Nvidia garante o valor de seus próprios chips para destravar US$ 500 bilhões em financiamento de infraestrutura de IA
Modelo