
Согласно сообщению в блоге Hugging Face, бэкенд vLLM для библиотеки transformers теперь работает так же быстро или даже быстрее, чем специализированные кастомные реализации vLLM для множества архитектур больших языковых моделей. Это обновление позволяет моделям автоматически использовать существующие реализации в transformers для получения сверхбыстрого вывода.
Разработчики моделей теперь могут получать доступ к высокопроизводительному инференсу без необходимости писать отдельный код или поддерживать уникальные версии своих моделей под конкретные движки ускорения. Функциональность становится доступной бесплатно в рамках стандартного стека инструментов.
Данное изменение устраняет разрыв между удобством использования универсальной библиотеки transformers и максимальной скоростью работы специализированных движков. Авторы моделей получают выгоду от оптимизации сразу после обновления зависимостей, не требуя дополнительных усилий по интеграции.
комментарий редакции
Что это значит
Ожидается массовое обновление существующих сервисов вывода для использования нового бэкенда без изменения логики приложений. Следующим наблюдаемым сигналом станет рост количества развертываний, использующих стандартный стек transformers с высокой пропускной способностью. Основную неопределенность представляет степень совместимости со старыми или экзотическими архитектурами моделей, не входящими в число 'многих' упомянутых в анонсе.