
Laut einem Blogbeitrag von Hugging Face arbeitet das vLLM-Backend für die Bibliothek transformers nun genauso schnell oder sogar schneller als spezialisierte benutzerdefinierte vLLM-Implementierungen für zahlreiche Architekturen großer Sprachmodelle. Dieses Update ermöglicht es Modellen, automatisch bestehende Implementierungen in transformers zu nutzen, um extrem schnellen Inferenzbetrieb zu erzielen.
Modellentwickler können nun auf Hochleistungs-Inferenz zugreifen, ohne separaten Code schreiben oder einzigartige Versionen ihrer Modelle für spezifische Beschleunigungs-Engines warten zu müssen. Die Funktionalität wird kostenlos im Rahmen des standardmäßigen Tool-Stacks bereitgestellt.
Diese Änderung beseitigt die Kluft zwischen der Benutzerfreundlichkeit der universellen Bibliothek transformers und der maximalen Geschwindigkeit spezialisierter Engines. Modellautoren profitieren sofort nach dem Aktualisieren der Abhängigkeiten von der Optimierung, ohne zusätzlichen Integrationsaufwand.
redaktioneller Kommentar
Warum es wichtig ist
Es wird ein massives Update bestehender Inferenzdienste erwartet, um das neue Backend zu nutzen, ohne die Anwendungslogik zu ändern. Das nächste beobachtbare Signal wird ein Anstieg der Bereitstellungen sein, die den standardmäßigen Transformers-Stack mit hohem Durchsatz verwenden. Die größte Unsicherheit besteht hinsichtlich des Grades der Kompatibilität mit älteren oder exotischen Modellarchitekturen, die nicht zu den im Announcement erwähnten 'vielen' gehören.