
Según una publicación en el blog de Hugging Face, el backend vLLM para la biblioteca transformers ahora funciona tan rápido o incluso más rápido que las implementaciones personalizadas especializadas de vLLM para numerosas arquitecturas de grandes modelos de lenguaje. Esta actualización permite que los modelos utilicen automáticamente sus implementaciones existentes en transformers para lograr una inferencia ultrarrápida.
Los desarrolladores de modelos ahora pueden acceder a una inferencia de alto rendimiento sin necesidad de escribir código separado ni mantener versiones únicas de sus modelos para motores de aceleración específicos. La funcionalidad está disponible gratuitamente dentro del conjunto de herramientas estándar.
Este cambio elimina la brecha entre la facilidad de uso de la biblioteca universal transformers y la máxima velocidad de los motores especializados. Los autores de los modelos se benefician de la optimización inmediatamente después de actualizar las dependencias, sin requerir esfuerzos adicionales de integración.
comentario editorial
Por qué importa
Se espera una actualización masiva de los servicios de inferencia existentes para utilizar el nuevo backend sin cambiar la lógica de las aplicaciones. La siguiente señal observable será el aumento en el número de despliegues que utilizan el stack estándar de transformers con alto throughput. La principal incertidumbre radica en el grado de compatibilidad con arquitecturas de modelos antiguas o exóticas que no están entre las 'muchas' mencionadas en el anuncio.