
Modelos de difusão recentes permitem gerar vídeo de alta qualidade, mas enfrentam o problema de funcionamento lento. A causa principal é o uso de grandes modelos transformadores, que se tornam lentos devido aos cálculos associados à atenção espaço-temporal.
A pesquisa mostrou que uma parte significativa das conexões entre tokens nesses modelos produz resultados insignificantes, e esses padrões frequentemente se repetem. Isso permite pular alguns cálculos de atenção sem influenciar substancialmente o resultado final.
Essa observação também se aplica às conexões entre blocos locais de tokens, o que abre a possibilidade para maior otimização e aceleração da geração de vídeo.
comentário editorial
Por que importa
Esta pesquisa pode levar a algoritmos de geração de vídeo mais eficientes, o que é importante para aplicações em tempo real. No entanto, permanecem questões sobre aplicações específicas e detalhes técnicos de implementação.