
Hugging Face のブログ投稿によると、transformers ライブラリ用の vLLM バックエンドは、現在、多数の大規模言語モデル(LLM)アーキテクチャ向けに専門化されたカスタム vLLM 実装と同等か、場合によってはそれ以上に高速に動作します。この更新により、モデルは既存の transformers 実装を自動的に利用して超高速な推論を行うことが可能になります。
モデル開発者は、特定の加速エンジン用に個別のコードを作成したり、モデルの固有バージョンを維持したりすることなく、高性能な推論にアクセスできるようになりました。この機能は、標準的なツールスタックの一部として無料で提供されます。
この変更により、汎用ライブラリである transformers の使いやすさと、専用エンジンの最大速度との間のギャップが解消されました。モデルの作者は、統合のための追加 effort を必要とせず、依存関係を更新するだけで最適化の恩恵を即座に受けることができます。
編集部コメント
なぜ重要か
既存の推論サービスは、アプリケーションのロジックを変更することなく、新しいバックエンドを利用するために大規模な更新が行われると予想されます。次に観測される兆候は、高スループットを備えた標準的な transformers スタックを使用したデプロイ数の増加となるでしょう。主な不確実性は、アナウンスで言及された「多数」に含まれていない、古いまたはエキゾチックなモデルアーキテクチャとの互換性の程度にあります。