vLLM は、大規模言語モデルおよび関連するマルチモーダルモデルの推論と提供のためのオープンソースのソフトウェア フレームワークです。元々はカリフォルニア大学バークレー校のSky Computing Labで開発されたこのプロジェクトは、トランスフォーマーキー バリュー キャッシュのメモリ管理方法であるPagedAttentionを中心としており、連続バッチ処理、分散推論、量子化、OpenAI互換APIなどの機能をサポートしています。[ 2 ] [ 3 ] [ 4 ]
vLLMは、2023年にカリフォルニア大学バークレー校のスカイコンピューティングラボに所属する研究者によって発表されました。[ 3 ] [ 2 ]そのコアとなるアイデアは、2023年の論文「Efficient Memory Management for Large Language Model Serving with PagedAttention」[ 5 ]で説明されており、この論文では、大規模言語モデル向けの高スループットかつメモリ効率の良いサービスエンジンとしてシステムが紹介されています。[ 3 ]
プロジェクトのメンテナーによると、vLLM の「v」は元々仮想メモリにちなんで「仮想」を意味していたとのことです。[ 6 ]
PyTorchのプロジェクトページには、カリフォルニア大学バークレー校が2024 年 7 月にvLLM をLinux Foundationに提供したと記載されています。 [ 7 ] [ 4 ] 2025 年、PyTorch Foundation は vLLM が Foundation がホストするプロジェクトになったと発表しました。
2026年1月、TechCrunchは、vLLMの開発者たちがプロジェクトを商業化するためにスタートアップInferactを立ち上げ、1億5000万ドルのシード資金を調達したと報じた。[ 8 ]
2023年の論文によると、vLLMは、トランスフォーマー推論中に使用されるキーバリューキャッシュのメモリの無駄を削減することで、大規模言語モデルサービングの効率を向上させるように設計されました。 [ 3 ]この論文では、オペレーティングシステムの仮想メモリとページング技術に触発されたアルゴリズムであるPagedAttentionを紹介し、vLLMはブロックレベルのメモリ管理とリクエストスケジューリングを使用して、同様のレイテンシを維持しながらスループットを向上させると説明しました。[ 3 ]
プロジェクトのドキュメントとリポジトリには、連続バッチ処理、チャンクプリフィル、投機的デコード、プレフィックスキャッシング、量子化、および複数の形式の分散推論のサポートが記載されています。[ 2 ] [ 4 ] PyTorchは、vLLM を、 NVIDIAおよびAMD GPU、Google TPU、AWS Trainium、Intelプロセッサなど、さまざまなハードウェア バックエンドをサポートする、高スループットでメモリ効率の良い推論およびサービス エンジンとして説明しています。[ 7 ] [ 4 ]