建築 Nvidia はFermi マイクロアーキテクチャを、 G80 以降使用されているTesla マイクロアーキテクチャ に続く、GPU ラインの次の大きなステップであると説明しました。最初の Fermi アーキテクチャ製品である GF100 は、大規模です。512 個のストリームプロセッサ (32 個のグループが 16 個)、30 億個のトランジスタ、TSMC が40 nm プロセスで製造。これは、 OpenGL 4.0 とDirect3D 11 をサポートする Nvidia 初のチップです。完全に有効化された GF100 GPU を搭載した製品は販売されませんでした。GTX 480 では、1 つのストリーミング マルチプロセッサが無効化されていました。GTX 470 では、2 つのストリーミング マルチプロセッサと 1 つのメモリコントローラが無効化されていました。GTX 465 では、5 つのストリーミング マルチプロセッサと 2 つのメモリコントローラが無効化されていました。コンシューマー GeForce カードには、有効化された GDDR5 メモリコントローラのそれぞれに 256MB が接続され、合計で 1.5、1.25、または 1.0GB になります。 Tesla C2050は6つのコントローラそれぞれに512MBのメモリを搭載し、Tesla C2070はコントローラごとに1024MBのメモリを搭載していた。どちらのTeslaカードも、14個のアクティブなストリームプロセッサグループを備えていた。
高性能なTesla ブランドのチップは、オプションでECC メモリを搭載し、コアごとに1サイクルあたり1回の倍精度浮動小数点演算を実行できます。一方、コンシューマー向けGeForceカードは、ドライバによって4サイクルあたり1回の倍精度浮動小数点演算に制限されています。これらの機能に加え、Visual Studio とC++ のサポートにより、Nvidiaはプロフェッショナル市場や商用市場、そして高性能コンピューティング での利用をターゲットにしました。
フェルミは、イタリアの物理学者エンリコ・フェルミ にちなんで名付けられました。
現在の制約とトレードオフ 実際には、ALU あたりのオンボード SRAM の量は、L2 キャッシュが 240 ALU あたり 256kB から512 ALU あたり 768kB に増加したにもかかわらず、以前の G200 世代と比較して比例的に減少しています。これは、Fermi では 32 ALU あたりレジスタが 32768 個 (8 ALU あたり 16384 個)、32 ALU あたり共有メモリが 48kB (8 ALU あたり 16kB)、32 ALU あたりキャッシュが 16kB ( 8 ALU あたり定数キャッシュ8kB + 24 ALU あたり テクスチャキャッシュ 24kB) しかないためです。レジスタ数などのパラメータは、リファレンス マニュアルの CUDA 計算能力比較表に記載されています。[ 3 ]
歴史 2009 年 9 月 30 日、Nvidia はアーキテクチャを説明するホワイト ペーパーを公開しました。[ 4 ] このチップは、1 サイクルあたり 1 つの単精度演算または 2 サイクルごとに 1 つの倍精度演算が可能な 32 個の CUDA コアを備えた 16 個の「ストリーミング マルチプロセッサ」、ホストのメモリをチップのアドレス空間にマッピングできる 40 ビットの仮想アドレス空間、つまりポインタの種類が 1 つだけになり C++ のサポートが大幅に容易になる、そして 384 ビット幅のGDDR5 メモリ インターフェイスを備えています。G80およびGT200と同様に、スレッドは「 ワープ 」でスケジュールされ、各ワープは 1 つのシェーダー コアで実行される 32 個のスレッドのセットです。 GT200では各シェーダークラスタに16KBの「共有メモリ」が関連付けられており、キャッシュが必要な場合はテクスチャリングユニットを介してデータを読み取る必要がありましたが、GF100では各クラスタに64KBのメモリが関連付けられており、これは48KBのキャッシュと16KBの共有メモリとして、または16KBのキャッシュと48KBの共有メモリとして、さらに16個のクラスタすべてで共有される768KBのL2キャッシュと組み合わせて使用できます。
このホワイトペーパーでは、このチップはグラフィックスプロセッサというよりも、数万ものスレッドを含むワークロードに対応する汎用プロセッサとして説明されている。これはTera MTA アーキテクチャを彷彿とさせるが、Tera MTAが持つ非常に効率的なランダムメモリアクセス機能は備えていない。
GeForce GTX 480 ダイ裏面 (GF100) 多くのユーザーが、GeForce 400 シリーズの Fermi GPU は、競合のAMD のRadeon HD 5000 シリーズ と比較して、高温と消費電力が高く、それに伴うパフォーマンスの向上も乏しいと報告したため、AMD はこの問題を揶揄するプロモーション ビデオ「誤解」[ 5 ] を作成して公開した。ビデオでは、警察部隊が、栽培施設 を示唆する大きな熱プロファイルを持つ家への襲撃を 開始する様子が映し出されている。しかし、家に入ると、高温の原因は Fermi GPU であることが明らかになる。[ 6 ] [ 7 ] Fermi GPU をフルロードすると卵が焼ける というジョークが一般的になった。 [ 8 ]
製品 1 SPs - シェーダープロセッサ - 統合シェーダー :テクスチャマッピングユニット :レンダリング出力ユニット 2 GF100アーキテクチャのGPUの各ストリーミングマルチプロセッサ(SM)には、32個のSPと4個のSFUが含まれています。GF104/106/108アーキテクチャのGPUの各ストリーミングマルチプロセッサ(SM)には、48個のSPと8個のSFUが含まれています。各SPは、1サイクルあたり2回の単精度融合乗算加算(FMA )演算を実行できます。各SFUは、1サイクルあたり4回のSF演算を実行できます。1回のFMA演算は、2回の浮動小数点演算に相当します。したがって、シェーダー数[ n ]とシェーダー周波数[ f 、GHz]を用いた理論上の単精度ピーク性能は、次のように推定できます。FLOPS sp ≈ f × n × 2(FMA)。総処理能力: GF100 FLOPSの場合sp ≈ f × m × (32 SPs × 2(FMA) + 4 × 4 SFUs)、GF104/106/108 FLOPSの場合sp ≈ f × m × (48 SPs × 2(FMA) + 4 × 8 SFUs)、または GF100 FLOPSの場合sp ≈ f × n × 2.5、GF104/106/108 FLOPSの場合sp ≈ f × n × 8 / 3。[ 9 ] SP - シェーダープロセッサ(統合シェーダー、CUDA コア)、SFU - 特殊機能ユニット、SM - ストリーミングマルチプロセッサ。
3 GF100 の各 SM には、テクスチャ アドレス ユニットごとに 4 つのテクスチャ フィルタリング ユニットが含まれています。完全な GF100 ダイには、64 個のテクスチャ アドレス ユニットと 256 個のテクスチャ フィルタリング ユニットが含まれています[ 10 ] GF104/106/108 アーキテクチャの各 SM には、テクスチャ アドレス ユニットごとに 8 つのテクスチャ フィルタリング ユニットが含まれています。完全な GF104 ダイには、64 個のテクスチャ アドレス ユニットと 512 個のテクスチャ フィルタリング ユニットが含まれており、完全な GF106 ダイには、32 個のテクスチャ アドレス ユニットと 256 個のテクスチャ フィルタリング ユニットが含まれており、完全な GF108 ダイには、16 個のテクスチャ アドレス ユニットと 128 個のテクスチャ フィルタリング ユニットが含まれています。[ 11 ] すべての製品は40nm 製造プロセスで製造されています。すべての製品は、機能レベル11_0のDirect3D 12.0、OpenGL 4.6、およびOpenCL 1.1をサポートしています。唯一の例外は、OEM専用カードであるGeForce 405です。これはGT218(Tesla )コアに基づいており、機能レベル10_1のDirectX 11.1、OpenGL 3.3のみをサポートし、OpenCLはサポートしていません。また、GeForce 400シリーズの中でFermiマイクロアーキテクチャに基づかない唯一のカードです。仕様上、GeForce 405は、同じくOEM専用カードであるGeForce 310 と同一であり、GeForce 310自体はGeForce 210 に基づいています。特に記載がない限り、すべての製品はフルハイト、フルレングスのカードに単一のDB15 VGAコネクタを備えています。
2010年11月8日、NvidiaはGTX 580 (480の後継機種)とともにGF110チップをリリースしました。これは、消費電力が大幅に削減された再設計されたGF100チップです。これにより、Nvidiaは16個のSM(16個のコアすべて)を有効にすることができました。これは、以前のGF100搭載の「Nvidia GeForce GTX 580」では不可能でした。 GF100アーキテクチャのさまざまな機能は、より高価なQuadroおよびTeslaシリーズのカードでのみ利用可能でした。[ 12 ] GeForceコンシューマー製品の場合、倍精度性能は「完全な」Fermiアーキテクチャの4分の1です。エラーチェックおよび訂正メモリ(ECC)もコンシューマーカードでは動作しません。[ 13 ] GF100カードはCompute Capability 2.0を提供し、GF104/106/108カードはCompute Capability 2.1を提供します。
チップセット一覧表 1 2 統合シェーダー :テクスチャマッピングユニット :レンダリング出力ユニット 1 2 GF100 の各 SM は、テクスチャ アドレス ユニットごとに 4 つのテクスチャ フィルタリング ユニットを備えています。完全な GF100 ダイには、64 個のテクスチャ アドレス ユニットと 256 個のテクスチャ フィルタリング ユニットが含まれています。 [ 10 ] GF104/106/108 アーキテクチャの各 SM は、テクスチャ アドレス ユニットごとに 8 つのテクスチャ フィルタリング ユニットを備えていますが、アドレッシング ユニットとフィルタリング ユニットの両方が 2 倍になっています。完全な GF104 ダイには、SM 数が半分になっているにもかかわらず、64 個のテクスチャ アドレス ユニットと 512 個のテクスチャ フィルタリング ユニットが含まれています。完全な GF106 ダイには、32 個のテクスチャ アドレス ユニットと 256 個のテクスチャ フィルタリング ユニットが含まれています。完全な GF108 ダイには、16 個のテクスチャ アドレス ユニットと 128 個のテクスチャ フィルタリング ユニットが含まれています。 [ 14 ] 1 2 処理能力を計算するには、 Fermi (マイクロアーキテクチャ)#パフォーマンスを 参照してください。 1 2 3 4 5 GTX 460 の TDP は AMD の HD5000 シリーズと同等ですが、GF100 ベースのカード (GTX 480/470/465) は定格がはるかに低いにもかかわらず、消費電力が大幅に増加します。たとえば、TDP が 250W の GTX 480 は、TDP が 297W の HD 5970 よりも多くの電力を消費します。 [ 15 ] 1 2 400 シリーズは、GeForce 9 から 700 シリーズまでの非 OEM ファミリーの中で、公式のデュアル GPU システムを搭載していない唯一のシリーズです。しかし、2011 年 3 月 18 日、 EVGA は 、デュアル 460 を搭載した初のシングル PCB カードを発表しました。このカードは、3600 MHz で 2048 MB のメモリと 1400 MHz で 672 個のシェーダー プロセッサを搭載し 、希望小売価格は 429 ドルでした。 ↑ GeForce 405 カードは、GeForce 310 のリブランド版であり、GeForce 310 自体も GeForce 210 のリブランド版です。
サポート Nvidiaは、リリース390ドライバー以降、32ビットオペレーティングシステム用の32ビットドライバーをリリースしないことを発表した。[ 18 ]
Nvidiaは2018年4月に、Fermiがレガシードライバのサポート対象となり、2019年1月までサポートされると発表した。[ 19 ]
注記 David Kanter (2009年9月30日) 「Fermiの内部:NvidiaのHPC推進」 realworldtech.com 。 2010年 12月16日 取得 。
参考文献 ↑ Killian, Zak (2017年7月3日) 「NvidiaがついにFermi GPU所有者にDirectX 12を楽しませてくれる」 Tech Report 。 2017年 7月4日 取得 。 ↑ 「公式発表:NVIDIA、GT300は2009年第4四半期に予定通り発売、歩留まりも良好と発表 - Bright Side Of News*」 Brightsideofnews.com。2009年9月25日。 2010年 9月20日 閲覧 。 ↑ 「CUDA 3.1 公式リファレンスマニュアル (PDF)付録 G.1、147-148 ページ」 の計算能力比較表。 付録Aの97ページには、旧型のNVIDIA GPUが一覧表示されており、G200シリーズはすべて演算能力1.3であるのに対し、Fermiベースのカードは演算能力2.xであることが示されています(14ページ、セクション2.5)。 ↑ NVIDIA Fermiコンピューティングアーキテクチャホワイトペーパーnvidia.com ↑ Ghostarchive にアーカイブされています そしてウェイバックマシン 「誤解 - AMD提供 」 。YouTube 。 ↑ 「AMDが『誤解』動画でNVIDIAのFermi GPUの発熱を揶揄」 2010年8月9日。 ↑ 「NVIDIA Fermi GF100 GPU - 性能不足、発売時期 の 遅さ、発熱、価格の高さ」 。ZDNet 。 ↑ 「GeForce GTX 480:卵を焼けるほど熱いのか?」 。 2019年9月20日に オリジナルからアーカイブ 。 2019年 9月20日 に取得。 ↑ siliconmadness.com (2010). "NvidiaがTesla 20シリーズを発表" . 2010年5月21日の オリジナル からアーカイブ済み。 1 2 「GF100 のまとめ - Nvidia の GeForce GTX 480 と GTX 470: 6 か月遅れ、待った甲斐はあったのか?」 . Anandtech.com . 2011 年 8 月 5 日の オリジナルからアーカイブ済み。2015 年 12 月 11 日 取得 。 ↑ スミス、ライアン。 「NVIDIAのGeForce GTX 460:200ドルの王者」 。www.anandtech.com 。 2010年7月14日の オリジナル からアーカイブ。 2024年 5月16日 取得 。 ↑ 「NVIDIA公式フォーラム」 . NVIDIA . 2024年 5月16日 取得 。 ↑ 「NVIDIA Tesla C2xxx ウェブページ 」 なお、説明から推測されるように、テスラでは、ECCは既存のオンボードメモリの1/8を使用してオン/オフを切り替えることができます。これは、1/8の追加メモリチップを必要とする標準のECCメモリモジュールとは異なります(つまり、8ごとに1つの追加チップをプリント基板に取り付ける必要があります)。↑ "GF104: Nvidiaがスーパースカラーに参入 - NvidiaのGeForce GTX 460: 200ドルの王者" . Anandtech.com . 2015年12月22日の オリジナル からアーカイブ済み。 2015年 12月11日 取得 。 ↑ 「GeForce GTX 480 と 470: Fermi と GF100 から実際のカードへ!」 Tomshardware.com 2010 年 3 月 27 日 2015 年 12 月 11 日 閲覧 . ↑ 「クロノスグループ」 。 2022 年 5 月 31 日。 ↑ 「Nvidia Fermi Compute Architecture Whitepaper」 (PDF) 。 2009年11月22日にオリジナルから アーカイブ (PDF) 。 2010年 4月17日 に取得。 (855KB) 、22ページ中11ページ目↑ 「32ビットおよび64ビットオペレーティングシステムのサポートプラン | NVIDIA 」 ↑ 「FermiシリーズGeForce GPUのサポートプラン | NVIDIA 」
外部リンク 次世代のNvidia GeForce フェルミアーキテクチャ GTX 400の概要 GeForce GTX 480 GeForce GTX 470 GeForce GTX 465 GeForce GTX 460 GeForce GTS 450 GeForce GT 440 GeForce GT 430 GeForce GTX 485M GeForce GTX 480M GeForce GTX 470M GeForce GTX 460M GeForce GT 445M GeForce GT 435M GeForce GT 425M GeForce GT 420M GeForce GT 415M GeForce 410M GeForce 405 Nvidia Nsight techPowerUp! GPUデータベース