
Selon un billet de blog de Hugging Face, le backend vLLM pour la bibliothèque transformers fonctionne désormais aussi vite, voire plus vite, que les implémentations vLLM personnalisées spécialisées pour de nombreuses architectures de grands modèles de langage. Cette mise à jour permet aux modèles d'utiliser automatiquement leurs implémentations existantes dans transformers pour obtenir une inférence ultra-rapide.
Les développeurs de modèles peuvent désormais accéder à une inférence haute performance sans avoir à écrire de code séparé ni à maintenir des versions uniques de leurs modèles pour des moteurs d'accélération spécifiques. Cette fonctionnalité est disponible gratuitement dans le cadre de la pile d'outils standard.
Ce changement comble le fossé entre la facilité d'utilisation de la bibliothèque universelle transformers et la vitesse maximale des moteurs spécialisés. Les auteurs de modèles bénéficient de l'optimisation dès la mise à jour des dépendances, sans effort d'intégration supplémentaire.
commentaire éditorial
Pourquoi c’est important
Une mise à jour massive des services d'inférence existants est attendue pour utiliser le nouveau backend sans modifier la logique des applications. Le prochain signal observable sera une augmentation du nombre de déploiements utilisant la pile standard transformers avec un débit élevé. La principale incertitude concerne le degré de compatibilité avec les architectures de modèles anciennes ou exotiques qui ne font pas partie des « nombreuses » mentionnées dans l'annonce.