
De acordo com uma publicação no blog da Hugging Face, o backend vLLM para a biblioteca transformers agora opera tão rápido ou até mais rápido do que as implementações personalizadas especializadas do vLLM para diversas arquiteturas de grandes modelos de linguagem. Esta atualização permite que os modelos utilizem automaticamente as suas implementações existentes no transformers para obter inferência ultrarrápida.
Os desenvolvedores de modelos agora podem acessar inferência de alto desempenho sem a necessidade de escrever código separado ou manter versões únicas dos seus modelos para motores de aceleração específicos. A funcionalidade torna-se disponível gratuitamente como parte do conjunto padrão de ferramentas.
Esta mudança elimina a lacuna entre a facilidade de uso da biblioteca universal transformers e a velocidade máxima de operação de motores especializados. Os autores de modelos beneficiam da otimização imediatamente após a atualização das dependências, sem exigir esforços adicionais de integração.
comentário editorial
Por que importa
Espera-se uma atualização em massa dos serviços de inferência existentes para utilizar o novo backend sem alterar a lógica das aplicações. O próximo sinal observável será o aumento no número de implantações que utilizam a pilha padrão transformers com alta taxa de transferência. A principal incerteza reside no grau de compatibilidade com arquiteturas de modelos antigas ou exóticas que não estão entre as 'muitas' mencionadas no anúncio.