
Larrabeeは、Intelが現在の統合グラフィックアクセラレータ製品ラインとは別に開発していたがキャンセルされたGPGPUチップのコード名である。ワシントン州のララビー山またはララビー州立公園にちなんで名付けられた。 [1] [2]このチップは、消費者向け3Dグラフィックカードのコアとして2010年にリリースされる予定だったが、遅延と初期のパフォーマンス数値が期待外れだったため、計画はキャンセルされた。[3] [4] Larrabee研究プロジェクトから直接GPU小売製品を生産するプロジェクトは2010年5月に終了し[5] 、その技術はXeon Phiに引き継がれた。 2010年に発表されたIntel MICマルチプロセッサアーキテクチャは、Larrabeeプロジェクトから多くの設計要素を継承しているが、グラフィックス処理ユニットとしては機能せず、高性能コンピューティング用のコプロセッサとして意図されている。
ほぼ10年後の2018年6月12日、Intel専用GPUのアイデアは、2020年までにディスクリートGPUを作成するというIntelの希望により再び復活しました。[6]このプロジェクトは最終的にIntel XeシリーズとIntel Arcシリーズとなり、それぞれ2020年9月と2022年3月にリリースされましたが、どちらもLarrabeeプロジェクトの作業とは無関係でした。
プロジェクトのステータス
2009年12月4日、Intelは第1世代のLarrabeeを消費者向けGPU製品としてはリリースしないことを公式に発表した。[7]代わりに、グラフィックスと高性能コンピューティングの開発プラットフォームとしてリリースされる予定だった。戦略的リセットの公式な理由は、ハードウェアとソフトウェアの開発の遅れだった。[8] 2010年5月25日、Technology@Intelブログは、LarrabeeはGPUとしてリリースされず、代わりにNvidia Teslaと競合する高性能コンピューティング製品としてリリースされることを発表した。[9]
Larrabee研究プロジェクトから直接GPUの小売製品を生産するプロジェクトは、2010年5月に終了しました。[5] 2010年に発表されたIntel MICマルチプロセッサアーキテクチャは、Larrabeeプロジェクトから多くの設計要素を継承していますが、グラフィックス処理ユニットとしては機能しません。この製品は、高性能コンピューティング用のコプロセッサとして意図されています。プロトタイプカードはKnights Ferryと名付けられ、22nmプロセスで構築されたKnights Cornerという量産カードは2012年以降に生産される予定でした。[要出典]
競合製品との比較

Larrabee は、マルチコア CPUとGPUのハイブリッドと見なすことができ、両方に類似点があります。コヒーレントなキャッシュ 階層とx86 アーキテクチャ互換性は CPU に似ており、ワイドSIMDベクター ユニットとテクスチャ サンプリング ハードウェアは GPU に似ています。
GPUとして、Larrabeeはゲーム用の従来のラスタライズされた3Dグラフィックス(Direct3DとOpenGL )をサポートしていたでしょう。しかし、CPUとGPUの機能を融合させたことで、汎用GPU(GPGPU)やストリーム処理タスクにも適していたはずです。例えば、レイトレーシングや物理処理を[10]ゲーム用にリアルタイムで実行したり、スーパーコンピュータのコンポーネントとして科学研究用にオフラインで実行したりできたかもしれません。[11]
Larrabeeの初期の発表は、GPUの競合他社から批判を浴びた。NVISION 08で、Nvidiaの従業員は、Larrabeeに関するIntelのSIGGRAPH論文を「宣伝文句」と呼び、Larrabeeアーキテクチャは「 2006年のGPUのようだ」と推測した業界アナリスト(Peter Glaskowsky)の言葉を引用した。[12] 2009年6月までに、Intelは、LarrabeeのプロトタイプがNvidia GeForce GTX 285と同等であると主張した。[13] IntelのCTOであるJustin Rattnerは、2009年11月17日のSupercomputing 2009カンファレンスで基調講演を行った。講演中、彼はオーバークロックされたLarrabeeプロセッサが1テラフロップスを超える性能を発揮するデモを行った。彼は、これが1テラフロップスを超えるシングルチップシステムの初の公開デモであると主張した。彼は、これは初期のシリコンであり、アーキテクチャの最終的なパフォーマンスについては疑問が残ると指摘した。これは、競合するグラフィックボードの 5 分の 1 に過ぎなかったため、Larrabee は 2009 年 12 月 4 日に「スタンドアロンのディスクリート グラフィック製品として」キャンセルされた。[3]
現代のGPUとの違い
Larrabee は、 GeForce 200 シリーズやRadeon 4000 シリーズなどの古いディスクリート GPU とは主に次の 3 つの点で異なることを目的としていました。
- これは、Larrabee固有の拡張機能を備えたx86命令セットを使用するというものでした。 [14]
- すべてのコアにわたってキャッシュの一貫性を実現することになっていた。 [14]
- 特殊なグラフィックスハードウェアはほとんど含まれず、代わりにタイルベースのレンダリングアプローチを使用して、Zバッファリング、クリッピング、ブレンディングなどのタスクをソフトウェアで実行することになっていた。[14]
これにより、Larrabeeは現在のGPUよりも柔軟性が高まり、ゲームや他の3Dアプリケーション間での外観の差別化が可能になると期待されていました。IntelのSIGGRAPH 2008の論文では、現在のGPUでは実現が難しいレンダリング機能がいくつか挙げられていました。レンダリングターゲットの読み取り、順序に依存しない透明性、不規則なシャドウマッピング、リアルタイムレイトレーシングです。[14]
ATI のRadeon HD 5xxxや Nvidia のGeForce 400 シリーズなどの最近の GPU は、 DirectX11 DirectCompute と OpenCL、および Nvidia 独自のCUDAテクノロジを介して、ますます幅広い汎用コンピューティング機能を備えており、Larrabee の多くの機能を実現しています。
CPUとの違い
Larrabee の x86 プロセッサ コアは、 Core 2 DuoやCore i7などの現在の Intel CPU のコアとはいくつかの点で異なります。
- そのx86コアは、はるかに単純なP54C Pentium設計に基づいており、これは現在でも組み込みアプリケーションでの使用のために維持されています。[15] P54C派生のコアはスーパースカラーですが、アウトオブオーダー実行は含まれていません。ただし、 x86-64サポートなどの最新機能で更新されています。 [14] Atomで使用されているBonnellマイクロアーキテクチャ に似ています。インオーダー実行は個々のコアのパフォーマンスが低下することを意味しますが、コアが小さいため、1つのチップに収まるコア数が増え、全体的なスループットが向上します。実行もより決定論的であるため、命令とタスクのスケジュールをコンパイラで行うことができます。
- 各コアには 512 ビットのベクター処理ユニットが搭載されており、一度に 16 個の単精度浮動小数点数を処理できます。これは、ほとんどの x86 プロセッサのSSEユニットに似ていますが、その 4 倍の大きさで、スキャッター/ギャザー命令やマスク レジスタなどの追加機能により、ベクター ユニットの使用が簡単かつ効率的になります。Larrabee は、これらのベクター ユニットから、その数値処理能力のほとんどを引き出すことになりました。[14]
- これには、1つの主要な固定機能グラフィックスハードウェア機能、テクスチャサンプリングユニットが含まれていました。これらは、三線フィルタリングと異方性フィルタリング、およびテクスチャ解凍を実行します。[14]
- コア間およびメモリとの通信用に1024ビット(片道512ビット)のリングバスを備えていた。[14]このバスは2つのモードで構成でき、16コア以上、または16コア未満のLarrabee製品をサポートできる。[16]
- これには、データを一度だけ読み書きするストリーミング操作中のキャッシュスラッシングを減らすための明示的なキャッシュ制御命令が含まれています。 [14] L2またはL1キャッシュへの明示的なプリフェッチもサポートされています。
- 各コアは4ウェイインターリーブマルチスレッドをサポートし、各プロセッサレジスタの4つのコピーを備えていました。[14]
理論上、Larrabee の x86 プロセッサ コアは、既存の PC ソフトウェア、さらにはオペレーティング システムを実行できたはずです。プロセッサの別のバージョンは、QuickPath を使用してマザーボードの CPU ソケットに装着される可能性がありますが、[17] Intel はこれについて一切の計画を発表していません。Larrabee のネイティブ C/C++ コンパイラには自動ベクトル化が含まれており、多くのアプリケーションは再コンパイル後に正しく実行できましたが、最大の効率を得るには、C++ ベクトル組み込み関数またはインライン Larrabee アセンブリ コードを使用したコード最適化が必要でした。[14]ただし、すべての GPGPU と同様に、すべてのソフトウェアがベクトル処理ユニットの利用から恩恵を受けるわけではありません。ある技術ジャーナリズム サイトは、Larrabee のグラフィックス機能はHaswell マイクロアーキテクチャに基づく CPU に統合される予定だったと主張しています。[18]
Cellブロードバンドエンジンとの比較
多数の小さく単純なコアを使用するというLarrabeeの哲学は、Cellプロセッサの背後にあるアイデアと似ていました。コア間の通信に高帯域幅のリングバスを使用するなど、いくつかの共通点があります。[14]しかし、実装には多くの重要な違いがあり、Larrabeeのプログラミングをより簡単にすることが期待されていました。
- Cell プロセッサには、多数の小さなプロセッサを制御する 1 つのメイン プロセッサが含まれています。また、メイン プロセッサはオペレーティング システムを実行できます。対照的に、Larrabee のコアはすべて同じであり、Larrabee では OS を実行できないと想定されていました。
- セル内の各コンピュータコア(SPE)にはローカルストアがあり、DRAMへのすべてのアクセスには明示的な( DMA )操作が使用されます。DRAMへの通常の読み取りと書き込みは許可されていません。Larrabeeでは、すべてのオンチップおよびオフチップメモリは自動的に管理されるコヒーレントキャッシュ階層の下にあるため、そのコアは標準コピー( MOV )命令を通じて均一なメモリ空間を事実上共有します。Larrabeeコアにはそれぞれ256KBのローカルL2キャッシュがあり、別のL2セグメントにヒットするアクセスはアクセスに時間がかかります。[14]
- 前述のキャッシュ コヒーレンスにより、Larrabee で実行される各プログラムは、従来の汎用 CPU と同様に、実質的に大きな線形メモリを持ちます。一方、Cell のアプリケーションは、各 SPE に関連付けられたローカル ストアの限られたメモリ フットプリントを考慮してプログラムする必要があります(詳細については、この記事を参照してください)。ただし、理論的には帯域幅が高くなります。ただし、ローカル L2 はアクセスが高速であるため、Cell スタイルのプログラミング方法を使用することで利点が得られます。[引用が必要]
- Cellはオンチップのローカルメモリとのデータ転送にDMAを使用するため、ローカルメモリに格納されたオーバーレイを明示的に維持してメモリをコアに近づけ、アクセスレイテンシを削減できますが、メインメモリとの一貫性を維持するために追加の労力が必要です。一方、Larrabeeは、キャッシュ操作用の特別な命令(特にキャッシュエビクションヒントとプリフェッチ命令)を備えたコヒーレントキャッシュを使用しており、キャッシュの一貫性を維持するための追加のトラフィックとオーバーヘッドを犠牲にして、ミスとエビクションのペナルティを軽減し、キャッシュの汚染(レンダリングパイプラインやその他のストリームのような計算など)を軽減しました。[14]
- Cell 内の各計算コアは、一度に 1 つのスレッドのみを順番に実行します。Larrabee 内のコアは最大 4 つのスレッドを実行しましたが、一度に実行できるのは 1 つだけでした。Larrabee のハイパースレッディングは、順番に実行することに伴う遅延を隠すのに役立ちました。[引用が必要]
Intel GMAとの比較
インテルは2004年にインテルGMAブランドでマザーボードにGPUのラインを統合し始めた。マザーボードに統合されているため(Sandy Bridgeでリリースされたような新しいバージョンはCPUと同じダイに組み込まれている)、これらのチップは個別には販売されなかった。インテルGMAチップは低コストで消費電力が低いため、小型のラップトップやそれほど要求の厳しくないタスクには適しているが、ハイエンドのゲーム用コンピュータ市場、HPC市場、または人気のビデオゲームコンソールでの地位をめぐって当時のNvidiaやAMD/ATIのGPUと競争するには3Dグラフィックス処理能力が不足している。対照的に、Larrabeeはマザーボードとは別のディスクリートGPUとして販売され、次世代のビデオゲームコンソールで検討されるのに十分な性能を発揮すると期待されていた。[19] [20]
Larrabeeに取り組んでいたチームは、Intel GMAチームとは別のチームだった。ハードウェアは、 Nehalemを設計したチームとは別に、 Intelのオレゴン州ヒルズボロの拠点で新たに結成されたチームによって設計された。ソフトウェアとドライバーは、新たに結成されたチームによって書かれた。特に3Dスタックは、 RAD Game Toolsの開発者(Michael Abrashを含む)によって書かれた。[21]
インテルビジュアルコンピューティング研究所は、Larrabeeベースの製品に適用できる基礎技術と応用技術を研究しました。[22]
予測パフォーマンスデータ

インテルのSIGGRAPH 2008 論文では、 Larrabee の予測パフォーマンスのサイクル精度シミュレーション(メモリ、キャッシュ、テクスチャ ユニットの制限を含む) について説明しています。[14]グラフは、いくつかの人気ゲームで 1600×1200 の解像度で 60 フレーム/秒を維持するために必要な 1 GHz Larrabee コアの数を示しています。アンチエイリアシングなしのGears of Warには約 25 コア、4× アンチエイリアシングのFEARには 25 コア、 4× アンチエイリアシングのHalf-Life 2: Episode Twoには 10 コアが必要です。インテルは、Larrabee は 1 GHz よりも高速に動作する可能性が高いと主張しているため、これらの数字は実際のコアではなく、仮想的なタイムスライスを表しています。別のグラフでは、これらのゲームのパフォーマンスは、最大 32 コアまでのコア数に対してほぼ直線的に増加することが示されています。 48コアでは、線形関係が継続した場合に予想されるパフォーマンスの90%に低下します。[23]
2007年6月のPC Watchの記事では、最初のLarrabeeチップは32個のx86プロセッサコアを搭載し、2009年後半に45ナノメートルプロセスで製造されると示唆されていました。歩留まりの問題でいくつかの欠陥コアを持つチップは、 24コアバージョンとして販売されます。2010年後半には、Larrabeeは32ナノメートル製造プロセスに縮小され、48コアバージョンが可能になりました。[24]
最後のパフォーマンスは、次のように計算できます (理論上はこれが最大のパフォーマンスです)。32 コア × 16 単精度浮動小数点 SIMD/コア × 2 FLOP (融合積和演算) × 2 GHz = 理論上 2 TFLOPS。
公共のデモ
2009年9月22日、サンフランシスコで開催されたインテル開発者フォーラムで、 Larrabeeのレイトレーシング機能の公開デモンストレーションが行われた。Enemy Territory: Quake Warsの実験版であるQuake Wars: Ray Tracedがリアルタイムで披露された。このシーンには、船や数台の飛行車両など、周囲の物体を正確に映し出すレイトレーシングされた水面が含まれていた。[25] [26] [27]
2 回目のデモは、2009 年 11 月 17 日にポートランドで開催された SC09 カンファレンスで、Intel CTO のJustin Rattner氏による基調講演中に行われました。Larrabee カードは、SGEMM 4Kx4K 計算で 1006 GFLops を達成できました。
Larrabeeカードのエンジニアリングサンプルは、Linus Sebastianによって入手され、 2018年5月14日に公開されたビデオでレビューされました。しかし、彼はカードからビデオ出力を出すことができず、マザーボードにはPOSTコードD6が表示されました。[28] 2022年には、YouTuberのRoman “der8auer” Hartungによって別のカードがデモされました。これは動作し、表示信号を出力していましたが、ドライバーがないため3Dアクセラレーションができませんでした。[29]
参照
- ゼオンファイ
- インテル740
- インテル GMA
- 86 の
- 64ビット
- P5 (マイクロアーキテクチャ)
- ボンネル(マイクロアーキテクチャ)
- Intel CPU マイクロアーキテクチャの一覧
- インテルMIC
- エヌビディア テスラ
- AMD アクセラレーテッド プロセッシング ユニット
- AVX-512
参考文献
- ^ Forsyth, Tom (2019年11月). 「SMACNIからAVX512への命令セットのライフサイクル」(PDF) 。 2024年7月4日閲覧。
- ^ Forsyth, Tom (2020年12月22日). “Tom Forsyth on Naming of Larrabee Instruction Set”. Twitter.com . 2020年12月22日時点のオリジナルよりアーカイブ。2020年12月22日閲覧。
- ^ ab Crothers, Brooke (2009 年 12 月 4日)。「Intel: 初期の Larrabee グラフィック チップはキャンセルされました」。CNET。CBS Interactive。
- ^ Charlie Demerjian (2009年12月4日). 「Intel が消費者向け Larrabee を廃止、将来の派生製品に注力 - SemiAccurate」. SemiAccurate.com . 2017年4月9日閲覧。
- ^ ab Smith, Ryan (2010 年 5 月 25 日)。「Intel が Larrabee GPU を廃止、ディスクリート グラフィックス製品は市場に投入せず」。AnandTech。
- ^ ライアン・スミス(2018年6月13日)。「Intel初の(最新)ディスクリートGPUが2020年に登場」。Anandtech 。 2018年11月4日閲覧。
- ^ Stokes, Jon (2009 年 12 月 5 日)。「Intel の Larrabee GPU は凍結、2010 年にさらなるニュースが発表予定」。Ars Technica。Condé Nast。
- ^ ライアン・スミス。「Intel が Larrabee 小売製品をキャンセル、Larrabee プロジェクトは存続」。AnandTech.com。2017年4月 9 日閲覧。
- ^ 「Blogs@Intel - Intel Blogs」。Intel.com 。 2017年4月9日閲覧。
- ^ Stokes, Jon (2007 年 9 月 17 日)。「Intel が今後の GPU 製品向けにゲーミング物理エンジンを採用」。Ars Technica。2007年 9 月 17 日閲覧。
- ^ Stokes, Jon (2007 年 4 月 27 日)。「Intel の Larrabee に関する混乱を解消する」。Ars Technica。2007年6 月 1 日閲覧。
- ^ 「Larrabee のパフォーマンス - サウンドバイトを超えて」CNet.com 。2017年4 月 9 日閲覧。
- ^ 「Intelの『Larrabee』はGeForce GTX 285と同等」。TomsHardware.com。2009年6月2日。 2017年4月9日閲覧。
- ^ abcdefghijklmno Seiler, L.; Cavin, D.; Espasa, E.; Grochowski, T.; Juan, M.; Hanrahan, P.; Carmean, S.; Sprangle, A.; Forsyth, J.; Abrash, R.; Dubey, R.; Junkins, E.; Lake, T.; Sugerman, P. (2008 年 8 月)。「Larrabee: ビジュアル コンピューティング向けのマルチコア x86 アーキテクチャ」(PDF)。ACM Transactions on Graphics。ACM SIGGRAPH 2008 の議事録。27 ( 3): 18:11。doi : 10.1145 /1360612.1360617。ISSN 0730-0301 。S2CID 52799248。 2021年3月7日時点の オリジナル(PDF)からアーカイブ。2008年8月6日閲覧。
- ^ 「Intel の Larrabee GPU はペンタゴンの秘密技術をベースにしているようだ [更新]」Ars Technica 2008 年 7 月 9 日2008 年 8 月 6 日閲覧。
- ^ Glaskowsky, Peter. 「Intel の Larrabee - 見た目以上のもの、そして目立たないもの」CNET 。2008 年 8 月 20 日閲覧。
- ^ Stokes, Jon (2007 年 6 月 5 日)。「Intel の Larrabee に関する混乱の解消、パート II」。Ars Technica。2008年 1 月 16 日閲覧。
- ^ 「Intel、CPUにLarrabeeグラフィックスを採用へ - SemiAccurate」SemiAccurate.com 2009年8月19日2017年4月9日閲覧。
- ^ Chris Leyton (2008 年 8 月 13 日)。「Intel の Larrabee は次世代コンソール向けに準備中か?」。2008 年 8 月 17 日時点のオリジナルよりアーカイブ。2008 年8 月 24 日閲覧。
- ^ Charlie Demerjian (2009年2月5日). 「Intel Will Design PlayStation 4 GPU」. 2009年5月11日時点のオリジナルよりアーカイブ。2009年8月28日閲覧。
{{cite web}}: CS1 メンテナンス: 不適切 URL (リンク) - ^ Wilson、Anand Lal Shimpi、Derek。「Intel の Larrabee アーキテクチャの公開: 計算された最初の動き」。AnandTech.com。2017年4月 9 日閲覧。
- ^ Ng, Jansen (2009 年 5 月 13 日)。「Intel Visual Computing Institute が開設、"Larrabee" 開発を促進」。DailyTech。2009年 5 月 16 日時点のオリジナルよりアーカイブ。2009 年5 月 13 日閲覧。
- ^ Steve Seguin (2008 年 8 月 20 日)。「Intel の「Larrabee」が AMD と Nvidia を揺るがす」。Tom's Hardware。2008年8 月 24 日閲覧。
- ^ 「Intel、32コアCPU「Larrabee」を訴求」. pc.watch.impress.co.jp . 2008年8月6日閲覧。翻訳
- ^ Geeks3D (2008-06-12)、レイトレーシングQuake Wars、2021-09-17にオリジナルからアーカイブ、2022-03-07に取得
{{citation}}: CS1 maint: 数値名: 著者リスト (リンク) - ^ 「Light It Up! Quake Wars* がレイトレーシングに対応」(PDF) 。 2010年2月15日時点のオリジナルよりアーカイブ(PDF) 。 2022年3月7日閲覧。
- ^ 「Quake Wars: Ray Traced」 2008年8月18日。2011年7月19日時点のオリジナルよりアーカイブ。
- ^ Linus Tech Tips (2018-05-14)、インテルのプロトタイプグラフィックカードを入手しました!!、2021-12-21にオリジナルからアーカイブ、2019-05-10に取得
- ^ der8auer EN (2022-12-24)、HW-Legends #13: Intel がこのプロジェクトをキャンセル - 私のコレクションの中で最も高価なカード (Larrabee)、2023-07-23 のオリジナルからアーカイブ、2023-07-23取得
{{citation}}: CS1 maint: 数値名: 著者リスト (リンク)
外部リンク
- IDF '09 で最初の Larrabee カードの 1 つで実行されているレイトレーサーのビデオ
- LRBni、物理シミュレーションなどに関するLarrabeeを使用したホワイトペーパー
- Larrabee でのラスタライズ
- ララビー新指示書 (LRBni) の初見
- Larrabee の新命令の C++ 実装
- Larrabee でのゲーム物理パフォーマンス
- ララビーに関するインテルのファクトシート
- インテルの SIGGRAPH 2008 における Larrabee に関する論文
- Techgage.com - Larrabee が通常の GPU とどう違うのかを解説し、ブロック図も紹介
- インテルの Larrabee アーキテクチャの公開: 計算された最初の動き
