NVLinkは、 Nvidiaが開発した有線シリアルマルチレーン近距離通信リンクです。PCI Expressとは異なり、1つのデバイスは複数のNVLinkで構成でき、デバイスは中央ハブ/スイッチの代わりにメッシュネットワークを使用して通信できます。このプロトコルは2014年3月に初めて発表され、独自の高速シグナリングインターコネクト(NVHS)を使用しています。[ 1 ]
GPUの数が少ない場合、単一デバイスのNVLinkレーンで全対全メッシュ接続に十分です。GPUの数を増やすために、NVLinkは2018年以降パケット交換アーキテクチャを採用しており、中央スイッチで最大32個の2レーンポートを処理できます。NVLink 4.0用のNVSwitchは、「SHARP」アクセラレータのおかげで、通信の必要性を減らすために、独自の簡単な計算(加算、ブロードキャストなど)を実行できます。[ 2 ]
原理
NVLinkは、プロセッサシステム内でCPUとGPU間、およびGPU同士でデータと制御コードを転送するためにNvidiaによって開発されました。NVLinkは、差動ペアごとに20、25、50 Gbit/s(v1.0/v2.0/v3.0+)のデータレートを持つポイントツーポイント 接続を規定しています。NVLink 1.0および2.0では、8つの差動ペアが「サブリンク」を形成し、各方向に1つずつ、合計2つの「サブリンク」が「リンク」を形成します。NVLink 3.0以降では、4つの差動ペアのみが「サブリンク」を形成します。NVLink 2.0以降では、サブリンクの合計データレートは25 GB/s、リンクの合計データレートは50 GB/sです。各V100 GPUは最大6つのリンクをサポートします。したがって、各GPUは双方向の合計帯域幅で 最大300 GB/sをサポートできます。 [ 3 ] [ 4 ]これまでに発表された NVLink 製品は、高性能アプリケーション分野に焦点を当てています。2020 年 5 月 14 日に発表された NVLink 3.0 は、差動ペアあたりのデータレートを 25 Gbit/s から 50 Gbit/s に増加させ、NVLink あたりのペア数を 8 から 4 に減らしています。Ampere ベースの A100 GPU には 12 本のリンクがあり、合計帯域幅は 600 GB/s になります。[ 5 ] 2022 年 3 月に発表された Hopper GPUマイクロアーキテクチャには18本の NVLink 4.0 リンクがあり、合計帯域幅は 900 GB/s になります。[ 6 ]したがって、NVLink 2.0、3.0、および 4.0 はすべて双方向リンクあたり 50 GB/s のデータレートを持ち、それぞれ 6、12、および 18 本のリンクがあります。
以下の表は、標準仕様に基づいた基本的な指標の比較を示しています。
以下の表は、NVLinkをオプションの一つとして提供する実際の半導体における、関連するバスパラメータの比較を示しています。
- ↑ PCIe: 5インチ基板用を含む
- 1 2 3データレート列は理論上の最大値です。
- 1 2 3 4 5はサンプル値です。PCIe レーンの使用に関しては、他の分数も使用可能です。
- 1 2 3 4 5 1 つの PCIe レーンは、差動ペアを介してデータを転送します。
- 1 2 3 4 5 6 7サンプル値。NVLink サブリンクのバンドルが可能である必要があります。
実際のパフォーマンスは、さまざまなデータ伝送オーバーヘッドコストと使用率を適用することで決定できます。これらは、次のようなさまざまな情報源から得られます。
これらの物理的な制限により、データレートは通常、転送レートの 90 ~ 95 パーセントに低下します。NVLinkのベンチマークでは、IBM POWER8 CPU のセットで駆動されるシステム内の P100 GPU への 40 Gbit/s (2 サブレーン アップリンク) NVLink 接続で、約 35.3 Gbit/s (ホストからデバイス)の転送レートが達成可能であることが示されています。[ 28 ]
プラグインボードと併用してください
NVLink グループに接続するための追加コネクタを備えた、さまざまなバージョンのプラグイン ボード (この機能を備えたハイエンド ゲームおよびプロフェッショナル グラフィックス GPU ボードはまだ少数しか存在しない) には、わずかに異なる比較的コンパクトな PCB ベースの相互接続プラグが同数存在します。通常、物理的および論理的な設計により、同じタイプのボードのみが接続できます。一部の構成では、フル データ レートを実現するために、2 つの同一のプラグを使用する必要があります。現在、一般的なプラグは U 字型で、形状の両端のストロークに、見る人から遠ざかる方向に細かいグリッド エッジ コネクタがあります。プラグの幅によって、プラグイン カードがホスト コンピュータ システムのメイン ボードからどれだけ離れて配置される必要があるかが決まります。カードの配置距離は、通常、対応するプラグによって決まります (既知のプラグの幅は 3 ~ 5 スロットで、ボードの種類にも依存します)。[ 29 ] [ 30 ]相互接続は、その構造設計と外観から、2004 年以降、スケーラブル リンク インターフェイス(SLI) と呼ばれることが多いが、最新の NVLink ベースの設計は、以前の設計と比較して、基本レベルで異なる機能を持つ、技術的にかなり異なる性質のものである。報告されている実際のデバイスは次のとおりです。[ 31 ]
- Quadro GP100(2枚のカードで最大2つのブリッジを使用。[ 32 ]この構成では、最大160 GB/sのNVLink接続が2つまたは4つ実現される[ 33 ] - これは20 GT/sのNVLink 1.0に似ている可能性がある)
- Quadro GV100(カード2枚で最大2つのブリッジが必要となり、最大200 GB/sを実現[ 29 ] - これは25 GT/sと4つのリンクを備えたNVLink 2.0に似ている可能性がある)
- TU104ベースのGeForce RTX 2080(シングルブリッジ「GeForce RTX NVLink-Bridge」[ 34 ]搭載)
- TU102ベースのGeForce RTX 2080 Ti(シングルブリッジ「GeForce RTX NVLink-Bridge」[ 30 ]搭載)
- GeForce RTX 3090(GA102ベース、独自の「GeForce RTX NVLink-Bridge(30シリーズ製品用)」搭載)[ 35 ]
- Quadro RTX 5000 [ 36 ]は TU104 [ 37 ]をベースにしています(シングルブリッジ「NVLink」で最大 50 GB/s [ 38 ] - これは 25 GT/s と 1 リンクの NVLink 2.0 に似ている可能性があります)。
- Quadro RTX 6000 [ 36 ]は TU102 [ 37 ]をベースにしています(シングルブリッジ「NVLink HB」で最大 100 GB/s [ 38 ] - これは 25 GT/s と 2 つのリンクを備えた NVLink 2.0 に似ている可能性があります)。
- Quadro RTX 8000 [ 36 ]は TU102 [ 39 ]をベースにしています(シングルブリッジ「NVLink HB」で最大 100 GB/s [ 38 ] - これは 25 GT/s と 2 つのリンクを備えた NVLink 2.0 に似ている可能性があります)。
サービスソフトウェアとプログラミング
Tesla、Quadro、Grid 製品ラインでは、NVML-API (Nvidia Management Library API) により、コンポーネントの評価やバージョン、ステータス/エラーの照会、パフォーマンスの監視など、Windows および Linux システム上の NVLink インターコネクトのいくつかの側面をプログラムで制御するための一連の機能が提供されます。[ 40 ]さらに、NCCL ライブラリ (Nvidia Collective Communications Library) の提供により、パブリック スペースの開発者は、たとえば、NVLink 上で人工知能や同様の計算負荷の高いトピックの強力な実装を実現できるようになります。[ 41 ] Nvidia コントロール パネルの「3D 設定」 »「SLI、Surround、PhysX の設定」ページとCUDAサンプル アプリケーション「simpleP2P」は、これらの API を使用して、NVLink 機能に関するサービスを実現しています。Linux プラットフォームでは、サブ コマンド「nvidia-smi nvlink」を持つコマンドライン アプリケーションが、同様の高度な情報と制御を提供します。[ 31 ]
歴史
2016年4月5日、Nvidiaは、例えばNvidia Tesla P100製品で使用されているPascalマイクロアーキテクチャベースのGP100 GPUにNVLinkを実装すると発表した。 [ 42 ] DGX-1高性能コンピュータベースの導入により、1つのラックシステムに最大8つのP100モジュールを搭載し、最大2つのホストCPUに接続することが可能になった。キャリアボード(…)は、NVLink接続をルーティングするための専用ボードを可能にする。各P100には800ピンが必要で、そのうち400ピンはPCIeと電源用、さらに400ピンはNVLink用であり、NVLinkだけで合計1600近くのボードトレースが必要となる(…)。[ 43 ]各CPUはPCIeを介して4つのP100ユニットに直接接続されており、各P100は同じCPUグループ内の他の3つのP100にそれぞれ1つのNVLinkを持ち、さらに別のCPUグループの1つのP100にもう1つのNVLinkを持っています。各NVLink(リンクインターフェイス)は双方向20 GB/秒アップ、20 GB/秒ダウンを提供し、GP100 GPUごとに4つのリンクがあり、合計帯域幅は アップ80 GB/秒、ダウン80 GB/秒です。[ 44 ] NVLinkはルーティングをサポートしているため、DGX-1設計では、各P100に対して、他の7つのP100のうち合計4つに直接アクセスでき、残りの3つには1ホップのみでアクセスできます。 Nvidiaのブログベースの出版物の説明によると、2014年からNVLinkは個々のリンクを束ねてポイントツーポイントのパフォーマンスを向上させることができるため、たとえば2つのP100と2つのユニット間で確立されたすべてのリンクを備えた設計では、 それらの間で80 GB/sのNVLink帯域幅をフルに利用できるようになります。[ 45 ]
GTC2017において、NvidiaはVolta世代のGPUを発表し、 この設計では単一チップで合計300GB/sのI/Oデータレートを可能にするNVLinkの改訂版2.0の統合を示唆しました。さらに、V100タイプのGPUモジュールを搭載し、ネットワーク接続(グループ間接続を備えた4つのV100モジュールの2つのグループ)または完全に相互接続された4つのV100モジュールの1つのグループのいずれかでNVLink 2.0を実現する高性能コンピュータ、DGX-1およびDGX-Stationの2017年第3四半期納入の予約注文オプションを発表しました。
2017年から2018年にかけて、IBMとNvidiaは、 IBMのPOWER9ファミリーCPUとNvidiaのVoltaアーキテクチャを組み合わせたスーパーコンピュータであるSummitとSierraを米国エネルギー省に納入しました[ 46 ]。これらのスーパーコンピュータは、CPU-GPU間およびGPU-GPU間の相互接続にNVLink 2.0を、システム間の相互接続にInfiniBand EDRを使用しています[ 47 ] 。
2020年、Nvidiaは2021年1月1日以降、 RTX 2000シリーズ以前の製品に新しいSLIドライバープロファイルを追加しないことを発表しました。[ 48 ]
2022年、Ada LovelaceアーキテクチャからNVLinkコネクタが削除され、NvidiaのCEOであるJensen Huangは、削除によって解放されたI/OはAI処理機能に使用され、PCIe Gen 5.0規格への移行が意図されていると明言した。[ 49 ] [ 50 ] [ 51 ]一部のユーザーは、特定のボードに削除されたNVLinkコネクタの痕跡があると報告した。[ 52 ] [ 53 ] [ 54 ] NVLinkテクノロジーは、データセンターおよびエンタープライズユーザー向けに引き続き利用可能である。[ 55 ]
参考文献
- ↑ Nvidia NVLINK 2.0が来年IBMサーバーに搭載へ(Jon Worrel著、fudzilla.com、2016年8月24日)
- ↑ Kennedy, Patrick (2022年8月23日). "NVIDIA NVLink4 NVSwitch at Hot Chips 34" . ServeTheHome .
- ↑ 「NVIDIA DGX-1 with Tesla V100 System Architecture」(PDF)
- ↑ 「NVLinkとは?」。Nvidia。2014年11月14日。
- ↑ Ryan Smith (2020年5月14日). "NVIDIA Ampereが解き放たれる:NVIDIAが新しいGPUアーキテクチャ、A100 GPU、およびアクセラレータを発表" . AnandTech. 2020年5月14日のオリジナルからアーカイブ。
- ↑ Jacobs, Blair (2022-03-23). "Nvidiaが次世代Hopper GPUアーキテクチャを発表" . Club386 . 2022-05-04に閲覧.
- 1 2 "PCIe - PCI Express (1.1 / 2.0 / 3.0 / 4.0 / 5.0)" . www.elektronik-kompendium.de .
- ↑アルコーン、ポール(2019年1月17日)。「PCIe 5.0は実用化の準備が整った」。トムズハードウェア。
- ↑ 「PCIe 6.0仕様ウェビナーQ&A:FLITモード、PAM4、および前方誤り訂正(FEC)の詳細解説 PCI-SIG」。pcisig.com。PCI -SIG 。 2024年11月28日取得。
さまざまなFLITサイズを検討した結果、236バイトのTLPペイロードと92%のTLP効率を備えた256バイトに決定しました
。 - ↑ 「NVLinkネットワークスイッチ - 高通信帯域幅SuperPOD向けNVIDIAスイッチチップ」(PDF)。HotChips 34。 2022年8月23日。
- ↑ 「NVIDIA Blackwellアーキテクチャ技術概要」 NVIDIA。p . 8。2024年11月28日取得。
第5世代NVLinkは、NVIDIA Hopperの第4世代NVLinkの2倍のパフォーマンスを実現します。Blackwell GPUの新しいNVLinkも、Hopper GPUと同様に、各方向に2つの高速差動ペアを使用して1つのリンクを形成しますが、NVIDIA Blackwellは、リンクあたりの実効帯域幅を各方向で50 GB/秒に2倍にします。
- ↑オンライン、ハイス。「NVIDIA Tesla P100 [ SXM2 ]、16GB HBM2 (NVTP100-SXM) | heise online Preisvergleich / Deutschland」。ゲイツハルス.de。
- ↑オンライン、ヘイセ(2023年8月14日)。「PNY Tesla P100 [ PCIe ]、16GB HBM2 (TCSP100M-16GB-PB/NVTP100-16) ab € 4990,00 (2020) | heise online Preisvergleich / Deutschland」。ゲイツハルス.de。
- ↑ NVLinkがGPUアクセラレーションを次のレベルへ引き上げる(Timothy Prickett Morgan著、nextplatform.com、2016年5月4日掲載)
- ↑ 「NVIDIA Tesla V100 SXM2 16 GB の仕様」。TechPowerUp。2023年8月14日。
- ↑オンライン、ヘイセ(2023年8月14日)。「PNY Quadro GV100、32GB HBM2、4x DP (VCQGV100-PB) ab € 10199,00 (2020) | heise online Preisvergleich / Deutschland」。ゲイツハルス.de。
- 1 2 Morgan, Timothy Prickett (2020年5月14日). 「Nvidiaが「Ampere」GPUでAIコンピューティングを統合」 . The Next Platform .
- 1 2 「データシート」(PDF) . www.nvidia.com . 2020年9月15日取得.
- 1 2 「NVIDIA ampere GA102 GPUアーキテクチャ ホワイトペーパー」(PDF) . nvidia.com . 2023年5月2日取得.
- 1 2 「Tensor Core GPU」(PDF)。nvidia.com 。 2023年5月2日取得。
- ↑クリス・ウィリアムズ(2016年6月20日)「NvidiaのTesla P100スーパーコンピュータの力強い動作のためにPCIeバスに全員乗車」theregister.co.uk
- ↑オンライン、ヘイセ (2017 年 6 月 22 日)。「Nvidia Tesla V100: Volta-Grafikchip と 16 GByte の PCIe-Steckkarte の詳細」。ハイセオンライン。
- ↑ 2017 年 5 月 10 日、Andreas Schilling による「GTC17: NVIDIA präsentiert die nächste GPU-Architektur Volta - Tesla V100 mit 5.120 Shadereinheiten und 16 GB HBM2」のGV100 ブロック図
- 1 2 Angelini, Chris (2018 年 9 月 14 日). "Nvidia の Turing アーキテクチャを探求: GeForce RTX 2080 の内部" . Tom's Hardware . p. 7 . 2019 年2 月 28 日取得.
TU102 と TU104 は、SLI サポート用の Multiple Input/Output (MIO) インターフェイスではなく NVLink インターコネクトを採用した Nvidia 初のデスクトップ GPU です。前者は 2 つの x8 リンクを利用可能にし、後者は 1 つに制限されています。各リンクは最大 50
GB/s の双方向帯域幅を実現します。したがって、GeForce RTX 2080 Ti はカード間で最大 100 GB/s を実現でき、RTX 2080 はその半分を実現できます。
- ↑アンドレアス・シリング(2020年6月22日)。「A100 PCIe: NVIDIA GA100-GPU コア PCI-Express-Variante」。ハードウェアラックス。2023 年5 月 2 日に取得。
- ↑ 「NVLINKとNVSWITCH」。www.nvidia.com。2021年2月7日取得。
- 1 2 3 4 「デスクの横に大容量メモリNvidia GH200:想像以上に身近に」 2024年2月23日。
- ↑エリオット・エシェルマン(2017年1月26日)。「OpenPOWERサーバー上のNVIDIA Tesla P100 GPUにおけるNVLinkとPCI-Eの比較」。microway.com 。
- 1 2 「NVIDIA Quadro NVLink Grafikprozessor-Zusammenschaltung in Hochgeschwindigkeit」。エヌビディア。
- 1 2 「新しいグラフィック: NVIDIA GeForce RTX 2080 Ti-グラフィックカルテ」。エヌビディア。
- 1 2 「Windows 10 の NVIDIA GeForce RTX 2080 および 2080 Ti 上の NVLink」。ピュージェット システム。 2018 年 10 月 5 日。
- ↑
- ↑アンドレアス・シリング(2017年2月5日)。「NVIDIA präsentiert Quadro GP100 mit GP100-GPU および 16 GB HBM2」。ハードウェアラックス。
- ↑ "NVIDIA GeForce RTX 2080 Founders Edition グラフィックカード" . NVIDIA .
- ↑ 「NVIDIA 、RTX 3090向けにNVLinkサポートを予約」。TechPowerUp 。
- 1 2 3 「プロフェッショナルデザインワークステーション向けNVIDIA Quadroグラフィックスカード」NVIDIA .
- 1 2 「NVIDIA Quadro RTX 6000 および RTX 5000 は予約注文の準備ができています」。 2018年10月1日。
- 1 2 3 "NVLink | pny.com" . www.pny.com .
- ↑ 「NVIDIA Quadro RTX 8000のスペック」。TechPowerUp。2023年8月14日。
- ↑ 「 NvLinkメソッド」 .docs.nvidia.com .
- ↑ 「NVIDIA Collective Communications Library (NCCL)」。NVIDIA Developer。2017年5月10日。
- ↑ 「Pascalの内部:NVIDIAの最新コンピューティングプラットフォーム」。2016年4月5日。
- ↑ Anandtech.com
- ↑ NVIDIAがDGX-1 HPCサーバーを発表:8テスラ、3U、2016年第2四半期発売予定(anandtech.com、2016年4月)
- ↑ NVLinkがマルチGPUコンピューティングをより高速かつ容易にする方法(マーク・ハリス著、2014年11月14日)
- ↑ 「ホワイトペーパー:SummitとSierraスーパーコンピュータ」(PDF)。2014年11月1日。
- ↑ 「Nvidia Volta、IBM POWER9が米国政府の新型スーパーコンピューター向け契約を獲得」。AnandTech 。 2014年11月17日。 2014年11月18日のオリジナルからアーカイブ済み。
- ↑ 「RIP:NvidiaがSLIの棺桶に最後の釘を打ち込み、2020年以降は新しいプロファイルは提供されない」。PC World。2020年9月18日。
- ↑ 「NVIDIAがAda LovelaceのNVLinkサポートを終了、SLIは静かに終焉を迎える」。TweakTown 。2022年9月25日。 2026年3月4日閲覧。
- ↑ Chuong Nguyen (2022-09-21) による公開。「Nvidia、RTX 4090 の NVLink を廃止」。Windows Central。2026-03-04に閲覧。
- ↑ 「ジェンセン氏が確認:Ada LovelaceにおけるNVLinkのサポートは終了」 2022年9月21日。
- ↑ "RTX 5090 Nvlink" . Level1Techs Forums . 2025-02-18 . 2026-03-04に取得.
- ↑公開、Anton Shilov (2022-10-13)。「GigabyteのRTX 4090にはNVLinkの痕跡がある」。Tom 's Hardware。2026-03-04に閲覧。
- ↑ Wilson, Jason R. (2022-10-14). "Gigabyte GeForce RTX 4090 PCBにNVIDIA NVLINKトレースが欠落していることが判明" . Wccftech . 2026-03-04に閲覧.
- ↑ 「高度なマルチGPU通信のためのNVLinkとNVSwitch」。NVIDIA 。2026年3月4日取得。
- ↑スミス、ライアン (2025 年 5 月 18 日)。「NVIDIA Computex 2025 基調講演ライブ中継」。Serve the Home。2026年1 月 16 日取得。
- ↑スミス、ライアン (2026 年 1 月 15 日)。「SiFive が将来のデータセンター向け RISC-V CPU 設計に NVLink Fusion を採用」。Serve the Home。2026年1 月 16 日取得。
- ↑ロビンソン、クリフ(2025年11月17日)。「ArmがNVIDIA NVLink Fusionエコシステムに参加」。Serve the Home 。2026年1月16日取得。
- ↑ Robinson, Cliff (2025年12月2日). "NVIDIA NVLink Fusionが将来のAWS Trainium4展開に採用される" . Serve the Home . 2026年1月16日取得.