
グラフィックス処理ユニット(GPU)は、デジタル画像処理とコンピュータグラフィックスの高速化のために設計された特殊な電子回路であり、専用グラフィックスカードの構成要素として、あるいはマザーボード、携帯電話、パーソナルコンピュータ、ワークステーション、ゲーム機などに組み込まれています。GPUは、グラフィックス処理でも広く利用されている線形代数演算の高速化により、人工知能(AI)処理やモデル学習にもますます活用されています。
この用語には明確な定義はなく、あらゆるビデオ表示システムを指す場合もありますが、現代では、GPUは3D画像の回転や拡大縮小といった様々なグラフィックス処理に必要な計算を内部で実行できる機能、そして多くの場合、シェーダーと呼ばれるカスタムプログラムを実行できる機能を備えています。これは、内部計算機能を持たず、基本的なメモリ移動操作しか行わなかった初期のグラフィックスコントローラであるビデオディスプレイコントローラや、ブリッターとは対照的です。現代のGPUは1990年代に登場し、 CPUの助けを借りずに線やテキストを描画する機能を追加し、後に3D機能も追加しました。
グラフィックス機能は一般的に独立しており、そのためこれらのタスクは別々の計算エンジンで実装できます。最新のGPUは数百、あるいは数千もの計算ユニットを備えています。このため、並列構造のおかげで並列処理が容易な非グラフィックス計算に役立っています。GPUは膨大な数の計算を高速に実行できるため、人工知能(AI)をはじめとする様々な分野で採用されています。AIでは、データ集約型で計算負荷の高いタスクの処理に優れています。その他の非グラフィックス用途としては、ニューラルネットワークのトレーニングや暗号通貨マイニングなどがあります。
多くの企業が様々なブランド名でGPUを製造してきた。2009年には、Intel、Nvidia、AMD / ATIが市場シェアリーダーであり、それぞれ49.4%、27.8%、20.6%の市場シェアを占めている。また、Matrox [ 1 ]は当初カスタムソリューションを製造していたが、現在はワークステーション向けにIntelとAMDのGPUをカスタマイズしている。Jingjia Microなどの中国企業も国内市場向けにGPUを製造しているが、世界的な販売実績では市場リーダーに後れを取っている。[ 2 ]
GPU の構造には、半導体デバイス製造におけるコネクタ経路のサイズ、クロック信号の周波数、各種オンチップメモリキャッシュの数とサイズなど、リアルタイムレンダリング用カードのパフォーマンスに影響を与えるいくつかの要因があります。パフォーマンスは、NVIDIA GPU のストリーミングマルチプロセッサ (SM) の数、AMD GPU のコンピュートユニット (CU) の数、または Intel Xe ベース GPU の Xe コアの数によっても影響を受けます。これらは、GPU チップ内のオンシリコンプロセッサコアユニットの数を表し、コア計算を実行します。通常、GPU 上の他の SM/CU と並列に動作します。GPU のパフォーマンスは通常、1 秒あたりの浮動小数点演算 ( FLOPS ) で測定されます。最新の GPU は通常、テラフロップス (TFLOPS) で測定されるパフォーマンスを提供します。これは推定パフォーマンス測定値であり、他の要因が実際のパフォーマンスに影響を与える可能性があるため、事実として扱うべきではありません。[ 3 ]
最新のGPUには、レイトレーシング、ビデオエンコーディング、AIアクセラレーション専用のハードウェアブロックも搭載されている。
パーソナルコンピュータには、主に2種類のGPUがあります。専用グラフィックス(ディスクリートグラフィックスとも呼ばれる)と統合グラフィックス(共有グラフィックスソリューション、統合グラフィックスプロセッサ(IGP)、または統合メモリアーキテクチャ(UMA)とも呼ばれる)です。[ 4 ]
専用グラフィックス処理ユニット(GPU)は、コンピュータのメインシステムメモリに頼るのではなく、GPU専用のオンボードRAMを使用します。このRAMは通常、 GDDR SDRAMなど、グラフィックスカードの想定されるシリアルワークロードに合わせて特別に選択されます。これによりパフォーマンスが大幅に向上しますが、専用メモリが不足すると「チョーク」が発生し、パフォーマンスが低下するという欠点があります。
Scalable Link Interface (SLI)、NVLink、CrossFireなどのテクノロジーにより、複数のGPUが1つの画面に同時に画像を描画できるようになり、グラフィックスに利用できる処理能力が向上します。しかし、これらのテクノロジーはますます一般的ではなくなってきています。ほとんどのゲームは、ほとんどのユーザーがそれらを購入する余裕がないため、複数のGPUを完全には使用していません。[ 5 ] [ 6 ] [ 7 ]複数のGPUは、スーパーコンピュータ( Summitなど)、ワークステーションでビデオの高速化(複数のビデオを一度に処理)[ 8 ] [ 4 ] [ 9 ]および3Dレンダリング[ 10 ] 、視覚効果(VFX)[ 11 ] 、汎用グラフィックス処理ユニット(GPGPU)ワークロードおよびシミュレーション[ 12 ]、NvidiaのDGXワークステーションおよびサーバーのラインナップの場合のように、トレーニングを高速化するためのAIで依然として使用されています。
統合グラフィックス処理ユニット(IGPU) は、統合グラフィックス、共有グラフィックス ソリューション、統合グラフィックス プロセッサ(IGP)、または統合メモリ アーキテクチャ(UMA) とも呼ばれ、専用のグラフィックス メモリではなく、コンピュータのシステム RAM の一部を使用します。IGP は、マザーボードのノースブリッジチップ セットの一部として統合することも、[ 13 ]アクセラレーテッド プロセッシング ユニット(AMD APU) やIntel HD Graphicsのように、CPU と同じダイ (集積回路)上に統合することもできます。IGPU と APU は、専用のグラフィックス処理よりも実装コストは低いですが、性能は劣る傾向があります。統合グラフィックス処理は、3D ゲームやグラフィック負荷の高いプログラムには不向きと考えられていましたが、Adobe Flash のような負荷の低いプログラムは実行できました。このような IGP の例としては、2004 年頃の SiS と VIA の製品が挙げられます。[ 14 ]しかし、AMD アクセラレーテッド プロセッシング ユニットやIntel Graphics Technologyなどの最新の統合グラフィックス プロセッサは、 AAA ゲームでも低設定で処理できます。
GPU 演算はメモリ集約型であるため、統合処理は、専用ビデオ メモリが最小限またはまったくないため、比較的低速なシステム RAM を CPU と競合する可能性があります。IGPU は、現在の最大帯域幅が毎秒 128 ギガバイトまでのシステム メモリを使用しますが、ディスクリート グラフィックス カードは、ビデオランダム アクセス メモリ(VRAM) と GPU コアの間で毎秒 1000 ギガバイトを超える帯域幅を持つ場合があります[ 15 ] 。このメモリ バス帯域幅は IGPU のパフォーマンスを制限する可能性がありますが、マルチ チャネル メモリはこの欠点を軽減できます。[ 16 ]
統合グラフィックスを搭載した最新のAMDプロセッサ[ 17 ] 、統合グラフィックスを搭載した最新のIntelプロセッサ[ 18 ]、Appleプロセッサ、最新のコンソールなど、「統合メモリアーキテクチャ」(UMA)を搭載したシステムでは、CPUコアとGPUブロックは同じRAMプールとメモリアドレス空間を共有します。
汎用グラフィックス処理ユニット (GPGPU) を、計算カーネルを実行するストリームプロセッサまたはベクトルプロセッサの改良版として使用することは一般的です。これにより、最新のグラフィックスアクセラレータのシェーダーパイプラインの膨大な計算能力が汎用コンピューティング能力に変換されます。大規模なベクトル演算を必要とする特定のアプリケーションでは、従来の CPU よりも数桁高いパフォーマンスが得られます。ディスクリート GPU 設計の大手 2 社であるAMDとNvidia は、さまざまなアプリケーションでこのアプローチを追求しています。Nvidiaと AMD は、スタンフォード大学と協力して、タンパク質折り畳み計算のためのFolding@home分散コンピューティングプロジェクトの GPU ベースのクライアントを作成しました。特定の状況では、GPU は、このようなアプリケーションで従来使用されていた CPU よりも 40 倍高速に計算します。[ 19 ] [ 20 ]
GPUベースの高性能コンピュータは、大規模モデリングにおいて重要な役割を果たしている。世界で最も強力なスーパーコンピュータ10台のうち3台は、GPUアクセラレーションを活用している。[ 21 ]
2005年以降、一般的に進化計算、特に遺伝的プログラミングにおける適応度評価の高速化にGPUが提供するパフォーマンスを利用することに関心が寄せられています。ほとんどのアプローチでは、線形プログラムまたはツリープログラムをホストPC上でコンパイルし、実行可能ファイルをGPUに転送して実行します。通常、パフォーマンス上の利点は、GPUの単一命令複数データ(SIMD)アーキテクチャを使用して、単一のアクティブなプログラムを多数の例題に対して並列に同時に実行することによってのみ得られます。[ 22 ]プログラムをコンパイルせずに、代わりにGPUに転送してそこで解釈することで、大幅な高速化も実現できます。[ 23 ]
GPU はノートブックの外部バスに接続できます。この目的で使用されるバスはPCI Expressのみです。ポートは、たとえばExpressCardまたはmPCIeポート (PCIe ×1、それぞれ最大 5 または 2.5 ギガビット/秒)、Thunderbolt 1、2、または 3 ポート (PCIe ×4、それぞれ最大 10、20、または 40 ギガビット/秒)、Thunderbolt 互換の USB4 ポート、またはOCuLinkポートです。これらのポートは、特定のノートブック システムでのみ利用可能です。[ 24 ]強力な GPU は数百ワットを消費する可能性があるため、eGPU エンクロージャには独自の電源 (PSU) が含まれています。 [ 25 ]

専用の3Dグラフィックスハードウェアは、アナログマトリックスプロセッサを搭載した1967年のAdage AGT-30のようなグラフィック端末にまで遡ります。1969年には、 Evans & Sutherland (E&S) が、マトリックス乗算機能を備えた初の完全デジタルシステムであるLine Drawing System-1 (LDS-1)を発表しました。同じく1969年には、低価格のグラフィック端末IMLAC PDS-1も登場しました。これは後に、Maze Warなどの初期の3Dゲーム機として利用されました。
1970年代には、「GPU」という用語は元々グラフィックスプロセッサユニットの略で、CPUとは独立して動作し、グラフィックスの操作と出力を担当するプログラム可能な処理ユニットを指していました。[ 1 ] [ 2 ]
プロフェッショナル向けハードウェアでは、1972年にイリノイ大学アーバナ・シャンペーン校でPLATO IVシステムが稼働を開始しました。1973年から1978年頃にかけて、ネットワーク接続されたマルチプレイヤーワイヤーフレーム3Dゲームがいくつか実装され、このシステムのユーザーによって普及しました。また、1972年には、E&S Continuous Tone 1 (CT1)「ワトキンスボックス」システム(E&S LDS-2とシェーディングピクチャーシステムで構成)がケース・ウェスタン・リザーブ大学に納入されました。これは、初のリアルタイムGouraudシェーディングを提供しました。1975年には、Evans & Sutherland Computer Corporationとユタ大学のコンピュータグラフィックス部門の共同作業により、カラーとスムーズシェーディングが可能な初のMOSFETビデオフレームバッファが開発されました。1977年には、E&S Continuous Tone 3 (CT3)システムが、コンピュータシミュレーションを使用したパイロット訓練のためにルフトハンザ航空に納入されました。これは、リアルタイムテクスチャマッピングが可能な初のグラフィックスシステムでした。Ikonasは70年代後半に8ビットおよび24ビットグラフィックスと3Dアクセラレーションを備えたグラフィックスシステムを製造した。[ 26 ]
アーケードシステムの基板は、 1970年代から専用の2Dグラフィックス回路を使用してきました。初期のビデオゲームハードウェアでは、フレームバッファ用のRAMが高価だったため、ビデオチップはディスプレイがモニターにスキャンされる際にデータを合成していました。[ 27 ]
特殊なバレルシフタ回路により、CPU は、 Gun Fight (1975)、Sea Wolf (1976)、Space Invaders (1978)など、MidwayやTaitoの1970 年代のさまざまなアーケード ビデオゲームのフレーム バッファグラフィックスをアニメーション化しました。 [ 28 ] 1979 年のナムコギャラクシアンアーケード システムでは、RGB カラー、マルチカラー スプライト、タイル マップの背景をサポートする特殊なグラフィックス ハードウェアが使用されました。[ 29 ]ギャラクシアン ハードウェアは、ナムコ、セントゥリ、グレムリン、アイレム、コナミ、ミッドウェイ、ニチブツ、セガ、タイトーなどのゲーム会社によって、アーケード ビデオゲームの黄金時代に広く使用されました。[ 30 ]

1977 年のAtari 2600 は、テレビインターフェースアダプタと呼ばれるビデオシフターを使用していた。[ 31 ] Atari 8 ビットコンピュータ(1979 年) には、ビデオプロセッサであるANTIC が搭載されており、「ディスプレイ リスト」を記述する命令を解釈していた。ディスプレイ リストとは、スキャンラインが特定のビットマップモードまたは文字モードにどのようにマッピングされるか、およびメモリがどこに格納されるかを示すものであった (そのため、連続したフレーム バッファは必要なかった)。[ 32 ]ディスプレイ リスト命令のビットを設定することで、スキャンライン上で6502マシン コードサブルーチンをトリガーすることができた。 [ 33 ] ANTIC は、CPU とは独立してスムーズな垂直および水平スクロールもサポートしていた。 [ 34 ]

1980年代には、プロフェッショナル向け3Dグラフィックスハードウェアにおいて大きな進歩が見られました。おそらく最も影響力があったのは、 1981年にスタンフォード大学のジム・クラークとマーク・ハンナによって設計されたVLSIベクトルプロセッサASICであるジオメトリエンジンが開発されたことでしょう。このプロセッサは、グラフィックスやAI向けに販売されている現代のテンソルコアやその他の同様のプロセッサの先駆けです。ジオメトリエンジンは、シリコングラフィックスのワークステーションで長年使用されました。シリコングラフィックスの最初の製品は、1983年11月に出荷されたIRIS 1000で、ジオメトリエンジンをベースにしたハードウェアアクセラレーションによる3Dグラフィックスを搭載した端末でした。 [ 26 ]ジオメトリエンジンは、毎秒約600万回の演算が可能でした。[ 35 ]

1981年のNEC μPD7220は、パーソナルコンピュータのグラフィックスディスプレイプロセッサを単一の大規模集積回路(LSI)チップとして実装した最初の製品でした。これにより、 Number Nine Visual Technologyなどの低コストで高性能なビデオグラフィックスカードの設計が可能になりました。1980年代半ばまで、最もよく知られたGPUとなりました。[ 36 ]これは、PC向けの初の完全統合型VLSI(超大規模集積回路)金属酸化膜半導体(NMOS)グラフィックスディスプレイプロセッサであり、最大1024×1024の解像度をサポートし、PCグラフィックス市場の基礎を築きました。多くのグラフィックスカードで使用され、 Intelの最初のグラフィックス処理ユニットであるIntel 82720などのクローンにもライセンス供与されました。[ 37 ] 1982 年にリリースされたWilliams Electronics のアーケードゲームRobotron: 2084、Joust、Sinistar、Bubbles には、16 色のビットマップで動作するためのカスタムブリッターチップが含まれています。 [ 38 ] [ 39 ]
1984年、日立はパーソナルコンピュータ向け初の主要CMOSグラフィックスプロセッサであるARTC HD63484を発売した。ARTCはモノクロモードで最大4K解像度を表示できた。1980年代後半には、多くのグラフィックスカードや端末で使用された。[ 40 ]

1985年、Amigaはビットマップ操作、線描画、領域塗りつぶし用のブリッターを含む、Agnusと呼ばれるカスタムグラフィックチップを搭載して発売されました。また、独自のシンプルな命令セットを持つコプロセッサも搭載されており、ビデオビームと同期してグラフィックハードウェアレジスタを操作したり(例えば、スキャンラインごとのパレット切り替え、スプライトの多重化、ハードウェアウィンドウ処理など)、ブリッターを駆動したりすることができました。
また、1985年には、後にNvidiaの共同創設者となるカーティス・プリエムが設計したプロフェッショナル・グラフィックス・コントローラがIBMからリリースされました。これは、 640×480ピクセル、 256色グラフィックスを備えた基本的な3Dカードで、メインシステムとは独立してグラフィックスを描画するために専用CPUを使用していました。これは、多くのメーカー(Matroxを含む)のカードのベースとして使用され、そのアナログRGB信号はVGAビデオ規格に直接つながりました。[ 26 ]プリエムは、80年代後半に影響力のあるSun Microsystems GX(cgsixとしても知られる)アクセラレーテッド2Dグラフィックスカードの開発に携わりました。[ 41 ]
1986年、テキサス・インスツルメンツは、初の完全プログラマブルなグラフィックスプロセッサであるTMS34010をリリースした。 [ 42 ]このチップは汎用コードを実行できるだけでなく、グラフィックス指向の命令セットも備えていた。1990年から1992年にかけて、このチップはテキサス・インスツルメンツ・グラフィックス・アーキテクチャ(「TIGA」)Windowsアクセラレータカードの基盤となった。

1987年にIBM 8514グラフィックスシステムがリリースされました。これは、電子ハードウェアに固定機能2Dプリミティブを実装したIBM PC互換機向けの最初のビデオカードの1つでした。 1987年にリリースされたシャープのX68000は、65,536色のカラーパレットとスプライト、スクロール、複数のプレイフィールドのハードウェアサポートを備えたカスタムグラフィックスチップセット[ 43 ]を使用しました。 [ 44 ]これは、カプコンのCPシステムアーケードボードの開発マシンとして使用されました。1989年にリリースされた富士通のFMタウンズコンピュータは、16,777,216色のカラーパレットをサポートしていました。[ 45 ]
参考までに、IBMは1987年に最大解像度640×480ピクセルのビデオグラフィックスアレイ(VGA)ディスプレイシステムも発表しました。8514/Aとは異なり、VGAにはハードウェアアクセラレーション機能はありませんでした。1988年11月、 NECホームエレクトロニクスは、VGAの後継となるスーパーVGA(SVGA)コンピュータディスプレイ規格の開発と普及のために、ビデオエレクトロニクス標準協会(VESA)を設立したと発表しました。スーパーVGAは、最大800×600ピクセルのグラフィックスディスプレイ解像度を実現し、56%向上しました。[ 46 ]
1988年、SGIは10-12ジオメトリエンジンを搭載したIRISワークステーショングラフィックスを販売し、同じくジオメトリエンジンをベースにしたIBM MicroChannelバス( RS/6000 )用のIrisVisionアドインボードも発表した。 [ 26 ]
1988年には、ナムコシステム21 [ 47 ]とタイトーエアシステム[ 48 ]で、アーケードゲーム機に初めて専用のポリゴン3Dグラフィックボードが導入されました。

1990年代には、Sun Microsystems、SGIなどによるプロフェッショナルワークステーションの3Dグラフィックスハードウェアの著しい進歩が再び見られました。 1992年にSGIがOpenGLを導入したことで、標準的なハードウェア非依存の3Dプログラミングインターフェースへの道が開かれました。[ 49 ] [ 50 ]しかし、90年代半ばから後半にかけて、プロフェッショナルハードウェアは、特にテクスチャマッピングに関して、同等またはそれ以上の性能をより低コストでエンドユーザーにとって馴染みのあるプラットフォームで提供する消費者向け製品に徐々に取って代わられつつありました。[ 50 ] [ 51 ]
1991年、S3 GraphicsはS3 86C911を発表しました。設計者たちは、このチップが約束する性能向上を示すために、ポルシェ911にちなんでこの名前を付けました。 [ 52 ] 86C911は様々な模倣品を生み出し、1995年までに主要なPCグラフィックスチップメーカーはすべて、自社のチップに2Dアクセラレーションのサポートを追加しました。[ 53 ]固定機能のWindowsアクセラレータは、Windowsのパフォーマンスにおいて高価な汎用グラフィックスコプロセッサを凌駕し、そのようなコプロセッサはPC市場から姿を消しました。
1990年代前半から中頃にかけて、リアルタイム3Dグラフィックスはアーケードゲーム、コンピュータゲーム、コンソールゲームでますます一般的になり、ハードウェアアクセラレーションによる3Dグラフィックスに対する一般の需要が高まりました。量産型3Dグラフィックスハードウェアの初期の例としては、セガモデル1、ナムコシステム22、セガモデル2などのアーケードシステムボードや、セガサターン、プレイステーション、ニンテンドー64などの第5世代ビデオゲームコンソールが挙げられます。1993年のセガモデル2やSGI Onyxベースのナムコマジックエッジホーネットシミュレータなどのアーケードシステムは、コンシューマー向けグラフィックスカードに搭載される何年も前にハードウェアT&L(変換、クリッピング、ライティング)が可能でした。[ 54 ] [ 55 ] 1994年、ソニーはプレイステーションコンソールの東芝設計のソニーGPUを指してGPU(グラフィックス処理ユニットの意味で)という用語を使用しました。[ 3 ]
もう 1 つの初期の例はSuper FXチップで、これは一部のSNESゲーム、特にDoomやStar Foxで使用されたRISCベースのカートリッジ グラフィックス チップです。一部のシステムではDSP を使用して変換を高速化しました。セガモデル 2 アーケード システムの開発に携わった富士通は、 1995 年に家庭用コンピュータで使用するために T&L を単一の LSI ソリューションに統合する作業を開始しました。[ 57 ] 1997年に、パーソナル コンピュータ向けの最初の 3D ジオメトリ プロセッサである富士通 Pinolite が発表されました。[ 58 ]家庭用ビデオゲーム コンソールで最初のハードウェア T&L GPU は、1996 年にリリースされたNintendo 64のReality Coprocessorでした。 [ 59 ] 1997 年に、三菱電機はワークステーションおよびWindows NTデスクトップ向けの変換およびライティングが可能な GPU である3Dpro/2MPをリリースしました。[ 60 ] ATiは1997年に発売したFireGL 4000グラフィックカードにこれを使用した。 [ 61 ]
「GPU」という用語は、 1994年に発売されたPlayStationビデオゲーム機に搭載された32ビットのソニーGPU (東芝が設計)を指してソニーが作ったものです。 [ 62 ]
2002 年 10 月、世界初のDirect3D 9.0 アクセラレータであるATI Radeon 9700 (R300 とも呼ばれる)の登場により、ピクセル シェーダーと頂点シェーダーはループと長時間の浮動小数点演算を実装できるようになり、CPU と同等の柔軟性を持ちながら、画像配列操作では桁違いに高速化しました。ピクセル シェーディングは、オブジェクトに光沢、鈍さ、粗さ、あるいは丸みや押し出し感を与えるテクスチャを追加するバンプ マッピングによく使用されます。[ 63 ]
Nvidia GeForce 8 シリーズと新しい汎用ストリーム処理ユニットの導入により、GPU はより汎用的なコンピューティング デバイスになりました。並列GPU は CPU に対して計算能力で進歩しており、GPU コンピューティングまたはGPGPU (汎用GPU コンピューティング) と呼ばれる研究分野は、機械学習[ 64 ] 、石油探査、科学画像処理、線形代数[ 65 ]、統計 [ 66 ]、3D再構成、株式オプション価格設定など、さまざまな分野で応用されています。GPGPU は現在コンピュート シェーダー ( CUDA、OpenCL、DirectComputeなど) と呼ばれるものの前身であり、アルゴリズムに渡されるデータをテクスチャ マップとして扱い、適切なピクセル シェーダーで三角形または四角形を描画してアルゴリズムを実行することで、ハードウェアをある程度悪用していました。スキャンコンバータなどのユニットが不要な場所で関与するため、これにはいくつかのオーバーヘッドが伴います(ピクセル シェーダーを呼び出す場合を除いて、三角形の操作は問題になりません)。
2007 年に初めて導入された Nvidia の CUDA プラットフォーム[ 67 ]は、GPU コンピューティングで最初に広く採用されたプログラミング モデルでした。OpenCL はKhronos Groupによって定義されたオープン スタンダードで、移植性を重視して GPU と CPU の両方のコードの開発を可能にします。[ 68 ] OpenCL ソリューションは Intel、AMD、Nvidia、および ARM によってサポートされており、 Evans Dataによる 2011 年のレポートによると、OpenCL は HPC ツールで 2 番目に人気がありました。[ 69 ]
2010 年、Nvidia はAudiと提携し、 Tegra GPUを使用して車のナビゲーションおよびエンターテイメントシステムの機能を強化し、車のダッシュボードに電力を供給しました。[ 70 ]車における GPU 技術の進歩は、自動運転技術の進歩に貢献しました。[ 71 ] AMD のRadeon HD 6000 シリーズカードは 2010 年にリリースされ、2011 年に AMD はモバイル デバイス向けの 6000M シリーズ ディスクリート GPU をリリースしました。[ 72 ] Nvidia のKeplerシリーズのグラフィックス カードは 2012 年にリリースされ、Nvidia 600 シリーズおよび 700 シリーズ カードで使用されました。この GPU マイクロ アーキテクチャの機能には、ビデオ カードのクロック速度を電力消費に応じて増減させる技術である GPU ブーストが含まれていました。[ 73 ] Kepler では、NVENCビデオ エンコーディング アクセラレーション技術も導入されました。
PS4とXbox Oneは2013年に発売され、どちらもAMDのRadeon HD 7850と7790をベースにしたGPUを使用していた。[ 74 ] NvidiaのKeplerシリーズのGPUに続いて、同じプロセスで製造されたMaxwellシリーズが登場した。Nvidiaの28nmチップは、台湾のTSMCが28nmプロセスを使用して製造した。過去の40nmテクノロジーと比較すると、この製造プロセスでは消費電力を抑えながらパフォーマンスが20%向上した。[ 75 ] [ 76 ]仮想現実ヘッドセットは高いシステム要件があり、メーカーは発売当時、GTX 970とR9 290X以上を推奨していた。[ 77 ] [ 78 ] Pascalマイクロアーキテクチャをベースにしたカードは2016年に発売された。GeForce 10シリーズのカードはこの世代のグラフィックカードである。これらは、従来のマイクロアーキテクチャを改良した16nm製造プロセスを使用して製造されています。[ 79 ]
2018年、NvidiaはRTX 20シリーズGPUを発売し、 GPUにレイトレーシングコアを追加することで、一般市場のハードウェアでリアルタイムレイトレーシングのパフォーマンスを実現しました。[ 80 ] AMDのPolaris 11およびPolaris 10 GPUは14nmプロセスで製造されています。これらのリリースにより、AMDビデオカードのワットあたりのパフォーマンスが大幅に向上しました。[ 81 ] AMDはまた、ハイエンド市場向けにVega GPUシリーズをリリースし、NvidiaのハイエンドPascalカードの競合製品として、Titan Vと同様にHBM2を搭載しています。
2019年、AMDはGraphics Core Next (GCN)マイクロアーキテクチャ/命令セットの後継を発表しました。RDNAと呼ばれるこのアーキテクチャを搭載した最初の製品は、Radeon RX 5000シリーズのビデオカードでした。[ 82 ]同社は、RDNAマイクロアーキテクチャの後継は段階的(「リフレッシュ」)になると発表しました。AMDは、ハードウェアアクセラレーションによるレイトレーシングをサポートするRDNA 2グラフィックスカードであるRadeon RX 6000シリーズを発表しました。 [ 83 ] 2020年後半に発売されたこの製品シリーズは、RX 6800、RX 6800 XT、およびRX 6900 XTで構成されていました。[ 84 ] [ 85 ] Navi 22をベースとしたRX 6700 XTは、2021年初頭に発売されました。[ 86 ]
PlayStation 5とXbox Series XおよびSeries Sは2020年に発売されました。どちらもRDNA 2マイクロアーキテクチャに基づくGPUを使用しており、各システムの実装において段階的な改良と異なるGPU構成が採用されています。[ 87 ] [ 88 ] [ 89 ]
2020年代には、人工知能の大規模言語モデルに必要な膨大なデータセットでのニューラルネットワークのトレーニングなど、並列処理が容易な問題を含む計算にGPUがますます使用されるようになりました。ディープラーニング専用の最新のGPUの特殊な処理コアは、4×4行列の乗算と除算を使用して、 FLOPSパフォーマンスを大幅に向上させます。2017年にリリースされたNvidiaのVoltaマイクロアーキテクチャなどの初期の実装[ 90 ]では、一部のアプリケーションで最大128 TFLOPSの結果が出ました。[ 91 ]
それ以来、AI アクセラレーション コアは、2018 年にNvidia のTuringマイクロアーキテクチャ[ 80 ]でTensor コアとして初めて採用された、コンシューマーおよびワークステーションのマイクロアーキテクチャで広く採用されている機能です。当初はゲームのパフォーマンスを向上させ、画質を改善するためにディープラーニング スーパーサンプリング(DLSS) に使用されていましたが、その後、Nvidia のBroadcastソフトウェアで音声フィルタリングやビデオノイズ除去などの AI を利用した多くの効果を提供するため、またBlenderなどの他のソフトウェアでビューポートの DLSS に使用されるようになりました。
AMDは当初、 RDNA 3アーキテクチャで同等の「Matrix」コアをコンシューマー向けに実装しましたが、RDNA 4のMatrixコアは、機械学習アップスケーリングやフレーム生成などのFSR Redstone機能セット全体を実行するために必要なFP8アクセラレーションを初めて導入しました。しかし、LinuxとWindowsの両方でコミュニティが作成したハックにより、RDNA 2、3、および競合GPUでFSR 4 INT8として知られるFSR 4の弱いバージョンを実行できるようになりました。 2024年に発売されたPlayStation 5 Proは、フレームレートと画質を向上させるために、PlayStation Spectral Super Resolution用のRDNA 4をベースに、INT8アクセラレーションのみに焦点を当てたカスタマイズされた機械学習コアを搭載しています。
Intelは、 Alchemistマイクロアーキテクチャを皮切りに、すべてのArc GPUに同等の「XMX」コアを実装しました。これは、XeSS(Xeスーパーサンプリング)、XeFG(Xeフレーム生成)などに使用されます。
レイトレーシングは2020年代に非常に普及し、DOOM: The Dark Agesなどのゲームでは、起動するためにハードウェアのレイトレーシング対応GPUが必要となるものもある。[ 92 ]パフォーマンスの低下や全体的なアクセシビリティの低下につながるものの、id Softwareは、ゲーム全体がレイトレーシングを中心に構築されているため、数時間の開発時間を節約し、ゲームのサイズを100ギガバイト以上縮小できたと主張している。
2013年には世界中で4億3830万個のGPUが出荷され、2014年の予測は4億1420万個でした。しかし、2022年第3四半期までに、PC用GPUの出荷数は約7550万個となり、前年比19%減少しました。[ 93 ][ 94 ]
{{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク){{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク){{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク){{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク)おそらく最もよく知られているのはNEC 7220でしょう。