Archer: Reuso Adaptativo de Estados Ocultos em Cache para Reversão Eficiente em Modelos de Linguagem por Difusão

arXiv:2608.08086v1 Tipo de anúncio: novo Resumo: Modelos de linguagem por difusão (DLMs) refinam iterativamente uma sequência, permitindo que previsões anteriores sejam revisadas à medida que o contexto evolui. Essa capacidade de reversão os distingue da geração autorregressiva irreversível, mas torna a inferência custosa. Cada atualização de remoção de ruído altera o contexto global, forçando o recálculo tanto dos estados do prompt quanto da resposta, mesmo que apenas os tokens de resposta sejam revisáveis. O cache de chave-valor (KV) poderia reduzir esse custo, porém co...

arXiv cs.CL ·Xuning He, Zinan Sheng, Yongding Tao, Huanyu Liu, Ge Li, Xue Jiang, Yihong Dong ·
compartilhar: