| 開発者 | バレンシア工科大学 |
|---|---|
| 安定リリース | 20.07 / 2020年7月26日 |
| オペレーティング·システム | リナックス |
| タイプ | GPGPU |
| Webサイト | 翻訳元 |
rCUDAはRemote CUDAの略で、リモートGPU仮想化用のミドルウェアソフトウェア フレームワークの一種です。CUDAアプリケーション プログラミング インターフェイス ( API ) と完全に互換性があり、1 つ以上のCUDA対応 GPU を単一のアプリケーションに割り当てることができます。各 GPU はクラスターの一部にすることも、仮想マシン内で実行することもできます。このアプローチは、十分に活用されていない GPU クラスターのパフォーマンスを向上させることを目的としています。GPU 仮想化により、クラスターに必要な GPU の数が減り、結果として構成コストが削減され、エネルギー、取得、保守が削減されます。
推奨される分散アクセラレーション アーキテクチャは、GPU がクラスター ノードのごく一部に接続された高性能コンピューティングクラスターです。ローカルGPUのないノードがGPU リソースを必要とするアプリケーションを実行する場合、カーネルのリモート実行は、ローカルシステム メモリとリモート GPU メモリ間のデータおよびコード転送によってサポートされます。rCUDA は、このクライアント サーバーアーキテクチャに対応するように設計されています。一方の端では、クライアントが高レベル CUDA ランタイム API へのラッパーのライブラリを使用し、もう一方の端では、TCP ポートで要求を受信するネットワーク リスニング サービスがあります。異なる GPU アクセラレーション アプリケーションを実行する複数のノードは、クラスターにインストールされているアクセラレータのセット全体を同時に利用できます。クライアントは、要求をサーバーの 1 つに転送します。サーバーはそのコンピューターにインストールされている GPU にアクセスし、その中で要求を実行します。GPU の時間多重化、つまり共有は、リモート GPU 実行要求ごとに異なるサーバー プロセスを生成することによって実現されます。[1] [2] [3] [4] [5] [6]
rCUDA v20.07
rCUDA ミドルウェアを使用すると、CUDA 互換デバイスをリモートで同時に使用できるようになります。
rCUDA は、クライアントとサーバー間の通信に InfiniBand ネットワークまたはソケット API を使用します。rCUDA は、次の 3 つの異なる環境で役立ちます。
- クラスター。高性能クラスターにインストールされる GPU の数を減らします。これにより、エネルギーが節約されるだけでなく、取得コスト、メンテナンス、スペース、冷却などのその他の関連するコストも節約できます。
- 学術界。コモディティ ネットワークで、多数の学生に少数の高性能 GPU への同時アクセスを提供します。
- 仮想マシン。物理マシン上の CUDA 機能へのアクセスを有効にします。
rCUDA の現在のバージョン (v20.07) は、グラフィックス相互運用性を除いて、CUDA バージョン 9.0 をサポートしています。rCUDA v20.07 は、クライアント側とサーバー側の両方で Linux OS (64 ビット アーキテクチャ用) を対象としています。
CUDA アプリケーションを rCUDA で実行するためにソース コードを変更する必要はありません。
参考文献
- ^ J. Prades、F. Silla (2019 年 12 月)。「GPU ジョブの移行: rCUDA のケース」。並列および分散システムに関するトランザクション、第 30 巻、第 12 号。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要ですCS1 メンテナンス: 場所 (リンク) - ^ J. Prades、C. Reaño、F. Silla (2019 年 3 月)。「rCUDA を使用して Xen 仮想マシンに CUDA アクセラレーションを提供する効果について」。Cluster Computing、vol.22、no. 1。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要ですCS1 メンテナンス: 場所 (リンク) - ^ F. Silla、S. Iserte、C. Reaño、J. Prades (2017 年 7 月)。「リモート GPU 仮想化メカニズムの利点について: rCUDA のケース」。同時実行性と計算: 実践と経験、第 29 巻、第 13 号。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要ですCS1 メンテナンス: 場所 (リンク) - ^ J. Prades、B. Varghese、C. Reaño、F. Silla (2017 年 10 月)。「金融リスク アプリケーションのパフォーマンスを最適化するマルチテナント仮想 GPU」。Journal of Parallel and Distributed Computing、vol. 108。arXiv : 1606.04473。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要ですCS1 メンテナンス: 場所 (リンク) - ^ F. Pérez、C. Reaño、F. Silla (2016 年 6 月 6 ~ 9 日)。「rCUDA を使用した InfiniBand クラスターの KVM 仮想マシンへの CUDA アクセラレーションの提供」。第 16 回 IFIP 国際分散アプリケーションおよび相互運用システム会議 (DAIS 2016)、ギリシャ、クレタ島、イラクリオン。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要ですCS1 メンテナンス: 場所 (リンク) - ^ S. Iserte、J. Prades、C. Reaño、F. Silla (2016 年 5 月 16 ~ 19 日)。「リモート GPU 仮想化と Slurm の組み合わせによるデータ センターのパフォーマンス向上」。第 16 回 IEEE/ACM 国際クラスター、クラウド、グリッド コンピューティング シンポジウム (CCGRID 2016)、コロンビア、カルタヘナ。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要ですCS1 メンテナンス: 場所 (リンク)
外部リンク
- Nvidia CUDA 公式サイト
