
Les récents modèles de diffusion permettent de générer des vidéos de haute qualité, mais se heurtent au problème d'une exécution lente. La cause principale réside dans l'utilisation de grands modèles de transformeurs, qui sont ralentis par les calculs liés à l'attention spatio-temporelle.
L'étude a montré qu'une part importante des connexions entre les jetons dans ces modèles produit des résultats négligeables, et que ces motifs se répètent souvent. Cela permet de sauter certains calculs d'attention sans affecter sensiblement le résultat final.
Cette observation s'applique également aux connexions entre les blocs locaux de jetons, ce qui ouvre la voie à une optimisation et une accélération supplémentaires de la génération de vidéo.
commentaire éditorial
Pourquoi c’est important
Cette étude pourrait conduire à des algorithmes de génération de vidéo plus efficaces, ce qui est important pour les applications en temps réel. Cependant, des questions subsistent concernant les applications spécifiques et les détails techniques de la mise en œuvre.