Maxwellは、 NVIDIAがKeplerマイクロアーキテクチャの後継として開発したGPUマイクロアーキテクチャのコードネームです。Maxwellアーキテクチャは、 GeForce 700シリーズの後期モデルで導入され、 GeForce 800Mシリーズ、GeForce 900シリーズ、Quadro Mxxxシリーズ、および一部のJetson製品にも使用されています。
Maxwellベースの最初の製品は、GeForce GTX 745 (OEM)、GeForce GTX 750、およびGeForce GTX 750 Tiでした。いずれも2014年2月18日に発売され、チップコード番号はGM107でした。それ以前のGeForce 700シリーズGPUは、コード番号GK1xxのKeplerチップを使用していました。第1世代Maxwell GPU(コード番号GM10x)は、GeForce 800MシリーズおよびQuadro Kxxxシリーズでも使用されています。 Maxwellベースの第2世代製品は、2014年9月18日にGeForce GTX 970とGeForce GTX 980で発表され、続いて2015年1月22日にGeForce GTX 960、2015年3月17日にGeForce GTX Titan X、2015年6月1日にGeForce GTX 980 Tiが発売されました。Maxwell 2.0の最終かつ最低スペックのカードは、2015年8月20日に発売されたGTX950です。これらのGPUのチップコード番号はGM20xです。

Maxwellは、電力効率を向上させた改良型ストリーミングマルチプロセッサ(SM)設計、[ 2 ]第6世代および第7世代PureVideo HD、CUDA Compute Capability 5.2を導入しました。
この建築物は、古典電磁気学の発見者であるジェームズ・クラーク・マクスウェルにちなんで名付けられた。
Maxwellアーキテクチャは、システムオンチップ(SOC)、モバイルアプリケーションプロセッサであるTegra X1に採用されています。
第1世代のMaxwell GPU(GM107/GM108)は、GeForce GTX 745、GTX 750/750 Ti、GTX 850M/860M(GM107)、GeForce 830M/840M(GM108)としてリリースされました。これらの新しいチップは、NvidiaがGPUの電力効率の向上に重点を置いたため、消費者向けの追加機能はほとんど導入されませんでした。L2キャッシュは Keplerの256 KiBから Maxwellの2 MiBに増加し、より多くのメモリ帯域幅の必要性が軽減されました。それに伴い、メモリバスはKepler(GK106)の192ビットから128ビットに縮小され、ダイ面積、コスト、消費電力が削減されました。[ 3 ]
Kepler のストリーミング マルチプロセッサ設計「SMX」も再設計され、分割されて Maxwell では「SMM」と改名されました。ワープ スケジューラの構造は Kepler から引き継がれ、テクスチャ ユニットと FP64 CUDA コアは引き続き共有されていますが、ほとんどの実行ユニットのレイアウトは分割され、SMM 内の各ワープ スケジューラは 32 個の FP32 CUDA コア、8 個のロード/ストア ユニット、および 8 個の特殊機能ユニットの 1 セットを制御するようになりました。これは、各 SMX が共有実行ユニット プールにスケジュールする 4 つのスケジューラを持っていた Kepler とは対照的です。[ 4 ]後者では、すべての実行ユニットを共有できるようにするために、不要な電力を使用する SMX 全体のクロス バーが必要でした。[ 4 ]逆に、Maxwell のよりモジュール化された設計では、よりきめ細かく効率的なリソースの割り当てが可能になり、ワークロードが共有リソースに最適でない場合は電力を節約できます。 Nvidiaは、128個の CUDAコアを持つSMMは、192個のCUDAコアを持つSMXの90%のパフォーマンスを持ち 、効率は2倍に向上すると主張している。 [ 3 ]また、グラフィックス処理クラスタ(GPC)は、Keplerでは最大4つのSMXユニット、第1世代Maxwellでは最大5つのSMMユニットを含む。[ 3 ]
GM107は、GK110/GK208 GPUのCUDA Compute Capability 3.5、GK10x GPUの3.0に対し、CUDA Compute Capability 5.0をサポートしています。GK110/GK208 GPUの2つの機能であるDynamic ParallelismとHyperQも、Maxwell製品ライン全体でサポートされています。Maxwellはまた、32ビット整数用のネイティブ共有メモリアトミック操作と、他のアトミック関数を実装するために使用できるネイティブ共有メモリ32ビットおよび64ビット比較交換(CAS)を提供します。
NvidiaのビデオエンコーダーNVENCは、KeplerベースのGPUよりも1.5~2倍高速にアップグレードされ、再生速度の6~8倍でビデオをエンコードできるようになりました。[ 3 ] Nvidiaはまた、ビデオデコーダーキャッシュとメモリ効率の向上により、PureVideo Feature Set Eのビデオデコードのパフォーマンスが8~10倍向上したと主張しています。ただし、第1世代Maxwell GPUでは、 H.265は完全なハードウェアデコードではサポートされておらず、ハードウェアデコードとソフトウェアデコード(CPUデコード)の組み合わせに依存しています。[ 3 ]ビデオをデコードする際には、Maxwell GPUで新しい低電力状態「GC5」を使用して電力を節約します。[ 3 ]
Maxwell GPUはタイルベースのレンダリングを使用していると考えられていたが[ 5 ]、実際にはタイルキャッシュを使用している[ 6 ] 。
初代Maxwell以降、 NVIDIA製GPUはUEFIグラフィックス出力プロトコルを完全にサポートしています。

第 2 世代 Maxwell GPU では、Dynamic Super Resolution [ 7 ]、第 3 世代 Delta Color Compression [ 8 ] 、 Multi-Pixel Programming Sampling [ 9 ] 、 Nvidia VXGI (Real-Time-Voxel- Global Illumination ) [ 10 ]、 VR Direct [ 10 ] [ 11 ] [ 12 ] 、 Multi-Projection Acceleration [ 8 ]、Multi-Frame Sampled Anti-Aliasing (MFAA) [ 13 ] (ただし、Coverage-Sampling Anti-Aliasing (CSAA) のサポートは削除されました) [ 14 ]、および Feature Level 12_1 の Direct3D12 API など、いくつかの新しいテクノロジーが導入されました。HDMI 2.0のサポートも追加されました。[ 15 ] [ 16 ]
ROPとメモリコントローラの比率は8:1から16:1に変更されました。[ 17 ]しかし、GTX 970では、有効なSMMが十分にないため、ROPの一部がアイドル状態になり、最大フィルレートが低下します。[ 18 ]
テッセレーションを担当するポリモーフエンジンは、第2世代Maxwell GPUでバージョン3.0にアップグレードされ、ユニット/クロックあたりのテッセレーション性能が向上しました。
第2世代のMaxwellは、GPCあたり最大4つのSMMユニットを備えているのに対し、GPCあたり5つのSMMユニットを備えている。[ 17 ]
GM204はCUDA Compute Capability 5.2をサポートしています(GM107/GM108 GPUでは5.0、GK110/GK208 GPUでは3.5、GK10x GPUでは3.0と比較)。[ 8 ] [ 17 ] [ 19 ]
GM20x GPU は、HEVC エンコードをサポートするアップグレードされた NVENC を搭載しており、1440p/60FPS および 4K/60FPS の H.264 エンコード解像度のサポートが追加されています (Maxwell の第 1 世代 GM10x GPU の NVENC は H.264 1080p/60FPS エンコードのみをサポートしていました)。[ 12 ]
消費者の苦情を受けて、[ 20 ] Nvidia は、メモリコントローラ全体を無効にすることなく、それぞれ 256KB の L2 キャッシュと 8 つの ROP を含む個々のユニットを無効にできることを明らかにしました。[ 21 ]これは、メモリバスを高速セグメントと低速セグメントに分割し、読み取り時に同時にアクセスできないという代償を伴います。これは、両方の GDDR5 コントローラを管理する L2/ROP ユニットが、GDDR5 コントローラ間で読み取り戻りチャネルと書き込みデータバスを共有しているためです。これにより、両方の GDDR5 コントローラからの同時読み取り、または両方の GDDR5 コントローラへの同時書き込みが不可能になります。[ 21 ]これは GeForce GTX 970 で使用されており、そのため、224 ビットバス上の高速セグメントに 3.5 GB、32 ビットバス上の低速セグメントに 512 MB があると説明できます。[ 21 ]このようなGPUのピーク速度は依然として達成可能ですが、ピーク速度の数値は、一方のセグメントが読み取り操作を実行している間に他方のセグメントが書き込み操作を実行している場合にのみ達成可能です。[ 21 ]
Maxwell GPUの理論上の単精度演算能力(FLOPS)は、2(1サイクルあたりのCUDAコアあたりのFMA命令あたりの演算回数)×CUDAコア数×コアクロック速度(Hz)として計算されます。
Maxwell GPU の理論上の倍精度処理能力は、単精度性能の 1/32 です (これは前世代のKeplerと比較して非常に低いことが指摘されています)。[ 22 ]
Maxwellの後継はPascalというコードネームで呼ばれている。[ 23 ] Pascalアーキテクチャは、より高い帯域幅の統合メモリとNVLinkを特徴としている。[ 23 ]
{{cite web}}: CS1 maint: タイトルとしてアーカイブされたコピー (リンク)ネイティブFP64レートはわずか1/32という貧弱な値。