
Недавние диффузионные модели позволяют генерировать высококачественное видео, но сталкиваются с проблемой медленной работы. Основной причиной является использование крупных трансформерных моделей, которые замедляются из-за вычислений, связанных с пространственно-временным вниманием.
Исследование показало, что значительная часть соединений между токенами в этих моделях даёт незначительные результаты, и эти паттерны часто повторяются. Это позволяет пропускать некоторые вычисления внимания без существенного влияния на итоговый результат.
Это наблюдение также применимо к соединениям между локальными блоками токенов, что открывает возможность для дальнейшей оптимизации и ускорения генерации видео.
комментарий редакции
Что это значит
Это исследование может привести к более эффективным алгоритмам генерации видео, что важно для применения в реальном времени. Однако остаются вопросы о конкретных приложениях и технических деталях реализации.