詳細
Nvidia Tesla P100カードに使用されているGP100 GPUのダイショット
GeForce GTX 1080 Tiカード内部に搭載されているGP102 GPUのダイショット
GTX 1060カード内部に搭載されているGP106 GPUのダイショット2014 年 3 月、Nvidia はMaxwellの後継としてPascal マイクロアーキテクチャを発表した。これは 2016 年 5 月 6 日に発表され、同年 5 月 27 日にリリースされた。Tesla P100 (GP100 チップ) は、GTX GPU (GP104 チップ) とは異なるバージョンの Pascal アーキテクチャを採用している。GP104のシェーダーユニットはMaxwellに似た設計になっている。[ 7 ]
GP100アーキテクチャのアーキテクチャ上の改良点には、以下のものが含まれます。[ 8 ] [ 9 ] [ 10 ]
- Pascalでは、SM(ストリーミングマルチプロセッサ)は、GP100かGP104かによって64~128個のCUDAコアで構成されます。MaxwellはSMあたり128個のCUDAコア、Keplerは192個、Fermiは32個、Teslaは8個でした。GP100 SMは2つの処理ブロックに分割され、それぞれに32個の単精度CUDAコア、命令バッファ、ワープスケジューラ、2つのテクスチャマッピングユニット、および2つのディスパッチユニットがあります。
- CUDAコンピューティング機能6.0。
- 高帯域幅メモリ2 — 一部のカードは、 合計バス幅4096ビット、メモリ帯域幅720GB /sの4つのスタックに16GiBのHBM2を搭載しています。
- 統合メモリとは、CPUとGPUが「ページ移行エンジン」と呼ばれる技術を利用して、メインシステムメモリとグラフィックカード上のメモリの両方にアクセスできるメモリアーキテクチャのことです。
- NVLink — CPUとGPU間、および複数のGPU間の高帯域幅バス。PCI Expressを使用した場合よりもはるかに高速な転送速度を実現し、80~200 GB/sの速度を提供すると推定されています。[ 11 ] [ 12 ]
- 16ビット(FP16)浮動小数点演算(通称「半精度」)は、32ビット浮動小数点演算(「単精度」)の2倍の速度で実行でき[ 13 ]、64ビット浮動小数点演算(通称「倍精度」)は、32ビット浮動小数点演算の半分の速度で実行できます[ 14 ] 。
- レジスタ数の増加 ― Maxwellと比較して、CUDAコアあたりのレジスタ数が2倍。
- より多くの共有メモリ。
- 動的負荷分散スケジューリングシステム。[ 15 ]これにより、スケジューラは複数のタスクに割り当てられたGPUの量を動的に調整し、安全に分散できる作業がなくなるまでGPUが常に作業で飽和状態になるようにします。[ 15 ]そのため、NvidiaはPascalのドライバで非同期演算を安全に有効化しました。[ 15 ]
- 命令レベルおよびスレッドレベルのプリエンプション。[ 16 ]
GP104アーキテクチャのアーキテクチャ上の改良点には、以下のものが含まれます。[ 7 ]
- CUDA コンピューティング機能 6.1。
- GDDR5X — 10Gbit/sのデータレートをサポートする新しいメモリ規格、更新されたメモリコントローラ。[ 17 ]
- 同時マルチプロジェクション - 上流のシェーダーステージからSMPエンジンに入力される単一のジオメトリストリームの複数のプロジェクションを生成します。[ 18 ]
- DisplayPort 1.4、HDMI 2.0b。
- 第4世代デルタカラー圧縮。
- 強化されたSLIインターフェース — 以前のバージョンと比較して帯域幅が向上したSLIインターフェース。
- PureVideoの機能セットHは、HEVC Main10(10ビット)、Main12(12ビット)、およびVP9のハードウェアビデオデコードに対応しています。
- 4K DRM保護コンテンツの再生とストリーミングのためのHDCP 2.2サポート(Maxwell GM200とGM204はHDCP 2.2をサポートしていませんが、GM206はHDCP 2.2をサポートしています)。[ 19 ]
- NVENC HEVC Main10 10ビットハードウェアエンコーディング。
- GPU Boost 3.0。
- 命令レベルのプリエンプション。[ 16 ]グラフィックス タスクでは、ドライバはプリエンプションをピクセル レベルに制限します。これは、ピクセル タスクは通常すぐに終了し、ピクセル レベルのプリエンプションを実行するオーバーヘッド コストが命令レベルのプリエンプション (コストが高い) よりも低いためです。[ 16 ]コンピュート タスクは、スレッド レベルまたは命令レベルのプリエンプションを取得します。[ 16 ]コンピュート タスクは、完了までに時間がかかる場合があり、コンピュート タスクがいつ終了するか保証がないため、ドライバはこれらのタスクに対してコストの高い命令レベルのプリエンプションを有効にします。[ 16 ]
概要
グラフィックスプロセッサクラスタ
チップはグラフィックスプロセッサクラスタ(GPC)に分割されます。GP104チップの場合、1つのGPCは5つのSMで構成されます。
ストリーミングマルチプロセッサ「Pascal」
「ストリーミングマルチプロセッサ」は、AMDのコンピュートユニットに相当します。SMは、GP104チップでは128個の単精度ALU(「CUDAコア」)、GP100チップでは64個の単精度ALUで構成されています。すべてのCUバージョンは64個のシェーダープロセッサ(つまり、それぞれ16レーン幅の4つのSIMDベクトルユニット)で構成されていますが、NvidiaはCUDAコアの数を非常に多様化して実験しました。
- Teslaでは、1つのSMが8つの単精度(FP32)シェーダープロセッサを統合しています。
- Fermiでは、1つのSMが32個の単精度(FP32)シェーダープロセッサを統合しています。
- Keplerアーキテクチャでは、1つのSMが192個の単精度(FP32)シェーダープロセッサと64個の倍精度(FP64)ユニット(GK110 GPUの場合)を組み合わせて構成されています。
- Maxwellでは、1つのSMが128個の単精度(FP32)シェーダープロセッサを統合しています。
- Pascalの場合、状況によります。
- GP100では、1つのSMに64個の単精度(FP32)シェーダープロセッサと32個の倍精度(FP64)シェーダープロセッサが組み合わされており、単精度と倍精度のスループット比は2:1となっています。GP100は、2要素ベクトルで1つの単精度または2つの半精度数値を処理できる、より柔軟なFP32コアを使用しています。[ 20 ]これは、機械学習タスクをより適切に処理することを目的としています。
- GP104では、1つのSMに128個の単精度ALU、4個の倍精度ALU(32:1の比率)、および2つの半精度浮動小数点数のベクトルを含む1つの半精度ALUが組み合わされています。このベクトルは両方の浮動小数点数に対して同じ命令を実行でき、両方の要素に同じ命令が使用される場合は64:1の比率となります。
チップス
GTX 1080 TiのPCBとダイ- GP100: NvidiaのTesla P100 GPUアクセラレータは、FP64倍精度演算やFP16を使用するディープラーニングトレーニングなどのGPGPUアプリケーションを対象としています。HBM2メモリを使用しています。[ 22 ] Quadro GP100もGP100 GPUを使用しています。
- GP102: このGPUは、Titan Xp [ 23 ] 、 Titan X Pascal [ 24 ]、GeForce GTX 1080 Tiで使用されています。また、Quadro P6000 [ 25 ]およびTesla P40 [ 26 ]でも使用されています。
- GP104: この GPU は、GeForce GTX 1070、GTX 1070 Ti、GTX 1080、および一部の GTX 1060 6 GB で使用されています。GTX 1070 は 15/20、GTX 1070 Ti は 19/20 の SM が有効になっています。どちらも GDDR5 メモリを使用しています。GTX 1080 は完全にロック解除されたチップで、GDDR5X メモリを使用しています。一部の GTX 1060 6 GB は 10/20 SM が有効で GDDR5X メモリを使用している GP104 を使用しています。[ 27 ]また、Quadro P5000、Quadro P4000、Quadro P3200 (モバイル アプリケーション)、および Tesla P4 でも使用されています。
- GP106: このGPUは、GDDR5 [ 28 ]メモリを搭載したGeForce GTX 1060で使用されています。[ 29 ] [ 30 ]また、Quadro P2000でも使用されています。
- GP107:このGPUは、GeForce GTX 1050および1050 Tiに使用されています。また、Quadro P1000、Quadro P600、Quadro P620、Quadro P400にも使用されています。
- GP108:このGPUはGeForce GT 1010およびGeForce GT 1030で使用されています。
Pascal GPUの理論上の単精度演算能力(GFLOPS)は、2 × 1サイクルあたりのCUDAコアあたりのFMA命令あたりの演算回数 × CUDAコア数 × コアクロック速度(GHz)として計算されます。
Pascal GPUの理論上の倍精度演算能力は、Nvidia GP100の単精度演算能力の1/2であり、Nvidia GP102、GP104、GP106、GP107、GP108の1/32である。
Pascal GPU の理論上の半精度処理能力は、GP100 では単精度性能の 2 倍[ 14 ]、GP104、GP106、GP107、GP108 では 1/64 です。[ 20 ]
参考文献
- ↑ https://developer.nvidia.com/vulkan-driver
- ↑カンプマン、ジェフリー(2025年7月31日)。「Nvidia、MaxwellおよびPascal GPU向けGame Readyドライバーのサポート終了を確認 ― 対象製品には2025年10月まで最適化されたドライバーが提供される」。Tom 's Hardware 。2025年8月21日取得。
- ↑ 「NVIDIAの次世代7nm GPUはTSMCで製造される」。Wccftech。2018年6月24日。 2019年7月6日閲覧。
- ↑ 「サムスン、NVIDIAの「Pascal」を14nmに光学的に微細化へ」 。 2016年8月13日取得。
- ↑ 「リアルタイムレイトレーシングエコシステムの加速:GeForce RTXおよびGeForce GTX向けDXR」NVIDIA。
- ↑ 「Nvidia GTX GPUにレイトレーシングが登場:有効化する方法はこちら」 2019年4月11日。
- 1 2 "NVIDIA GeForce GTX 1080" (PDF) . International.download.nvidia.com . 2016年9月15日取得.
- ↑ Gupta, Sumit (2014年3月21日). "NVIDIAがGPUロードマップを更新、Pascalを発表" . Blogs.nvidia.com . 2014年3月25日取得.
- ↑ 「Parallel Forall」。NVIDIA開発者ゾーン。Devblogs.nvidia.com。2014年3月26日のオリジナルからアーカイブ済み。 2014年3月25日取得。
- ↑ 「NVIDIA Tesla P100」(PDF)。International.download.nvidia.com 。 2016年9月15日取得。
- ↑ 「Pascalの内部:NVIDIAの最新コンピューティングプラットフォーム」 2016年4月5日。
- ↑ Denis Foley (2014年3月25日) 「NVLink、Pascal、スタックメモリ:ビッグデータへの欲求を満たす」nvidia.com。2014年7月7日取得。
- ↑ 「NVIDIAの次世代Pascal GPUアーキテクチャにより、ディープラーニングアプリの処理速度が10倍向上」。NVIDIA公式ブログ。2015年3月23日取得。
- 1 2スミス、ライアン(2015年4月5日)。「NVIDIA、Tesla P100アクセラレータを発表 - HPC向けPascal GP100のパワー」。AnandTech。2016年4月6日のオリジナルからアーカイブ。2016年5月27日取得。
これらのSMはそれぞれ32個のFP64 CUDAコアも搭載しており、FP64のレートは1/2になります。また、Pascalアーキテクチャの新機能として、適切な条件下では1つのFP32 CUDAコア内に2つのFP16演算を詰め込むことができます。
- 1 2 3 Smith, Ryan (2016年7月20日). "NVIDIA GeForce GTX 1080 & GTX 1070 Founders Editions レビュー: FinFET世代の幕開け" . AnandTech . p. 9. 2016年7月23日のオリジナルからアーカイブ済み。 2016年7月21日取得。
- 1 2 3 4 5スミス、ライアン (2016 年 7 月 20 日)。「NVIDIA GeForce GTX 1080 および GTX 1070 Founders Editions レビュー: FinFET 世代の幕開け」。AnandTech。p . 10。2016年 7 月 24 日のオリジナルからアーカイブ。2016年7 月 21 日取得。
- ↑ 「GTX 1080 グラフィック カード」 . GeForce . 2016年9月15日取得。
- ↑ Carbotte, Kevin (2016年5月17日). "Nvidia GeForce GTX 1080 同時マルチプロジェクションと非同期演算" . Tomshardware.com . 2016年9月15日取得。
- ↑ 「Nvidia Pascal HDCP 2.2」。Nvidiaハードウェア ページ。2016年5 月 8 日取得。
- 1 2スミス、ライアン (2016 年 7 月 20 日)。「NVIDIA GeForce GTX 1080 および GTX 1070 Founders Editions レビュー: FinFET 世代の幕開け」。AnandTech。p . 5。2016年7 月 23 日のオリジナルからアーカイブ。2016年7 月 21 日取得。
- ↑スミス、ライアン (2016 年 7 月 20 日)。「NVIDIA GeForce GTX 1080 および GTX 1070 Founders Editions レビュー: FinFET 世代の幕開け」。AnandTech。p . 4。2016年7 月 23 日のオリジナルからアーカイブ。2016年7 月 21 日取得。
- ↑ハリス、マーク(2016年4月5日)。「Pascalの内部:NVIDIAの最新コンピューティングプラットフォーム」。Parallel Forall。Nvidia。2016年6月3日取得。
- ↑ 「NVIDIA TITAN Xp グラフィックス カード( Pascal アーキテクチャ搭載)」NVIDIA。
- ↑ 「NVIDIA TITAN X グラフィックス カード (Pascal 搭載)」 . GeForce . 2016 年9 月 15 日取得。
- ↑ 「Pascalアーキテクチャに基づいた新しいQuadroグラフィックス」 NVIDIA 。 2016年9月15日取得。
- ↑ 「GPUによるデータセンターワークロードの高速化」 NVIDIA 。 2016年9月15日取得。
- ↑ Zhiye Liu (2018年10月22日) 「Nvidia GeForce GTX 1060が5回目のリニューアルでGDDR5Xを搭載」Tom's Hardware。2024年2月2日閲覧。
- ↑ 「NVIDIA GeForce 10 シリーズ グラフィックス カード」NVIDIA。
- ↑ 「NVIDIA GeForce GTX 1060は7月7日に発売予定」。VideoCardz.com 。2016年6月29日。 2016年9月15日閲覧。
- ↑ 「GTX 1060 グラフィック カード」 . GeForce . 2016年9月15日取得。
- ↑スミス、ライアン (2012 年 11 月 12 日)。「NVIDIA が Tesla K20 と K20X を発表: GK110 がついに登場」。AnandTech。p . 3。2012年11 月 14 日のオリジナルからアーカイブ。2016年7 月 24 日取得。
- 1 2 3 4 5 6 Nvidia (2015 年 9 月 1 日). "CUDA C プログラミング ガイド" . 2016 年7 月 24 日取得.
- 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 Triolet, Damien (2016 年 5 月 24 日). "Nvidia GeForce GTX 1080、最初の 16nm GPU をテスト!" . Hardware.fr (フランス語). p. 2 . 2016 年7 月 24日取得。
- 1 2スミス、ライアン (2015 年 1 月 26 日)。「GeForce GTX 970: 仕様の修正とメモリ割り当ての調査」。AnandTech。p . 1。2015年1 月 28 日のオリジナルからアーカイブ。2016年7 月 24 日取得。
- ↑ 「NVIDIA Turingの発売日」。Techradar 。2021年2月2日。
- ↑ "NVIDIA Tesla P100 " 。Nvidia 。
- ↑「NVIDIA Tesla P100 SXM2」。TechPowerUp 。
- ↑ "NVIDIA Tesla P100 PCIe 16 GB" . TechPowerUp .
- ↑ Garreffa, Anthony (2017年9月17日). "NVIDIA Tesla V100テスト済み:ほぼ信じられないほどのGPUパワー" . TweakTown.com . 2025年12月30日取得。
- ↑スミス、ライアン(2020年5月14日)。「NVIDIA Ampereの真価が明らかに:NVIDIAが新しいGPUアーキテクチャ、A100 GPU、およびアクセラレータを発表」。AnandTech。 2024年7月29日にオリジナルからアーカイブ済み。
- ↑スミス、ライアン (2022年3月22日)。「NVIDIA Hopper GPUアーキテクチャとH100アクセラレータが発表:よりスマートに、よりハードに働く」。AnandTech 。 2023年9月23日のオリジナルからアーカイブ済み。
- ↑ 「B100 vs B200: AIワークロードに最適なNVIDIA Blackwell GPUはどれ? | ブログ — Northflank」。Northflank — 当社のクラウドまたはお客様のクラウドで、あらゆるプロジェクトを数秒でデプロイ。2026年6月15日取得。
- ↑ 「BlackwellとHopperの比較|B200とB100対H200とH100|Exxactブログ」。www.exxactcorp.com。2026年6月15日取得。
- ↑ Mitrasish; 共同創業者、CTO; Spheron。「NVIDIA Rubin R100 GPUチップの仕様:アーキテクチャ、VRAM、クラウド可用性(2026年)|Spheronブログ」。Spheron。2026年6月13日取得。