| デザイナー | クレイ |
|---|---|
| ビット | 64ビット |
| 紹介された | 2005 |
| バージョン | テラMTA第3世代 |
| エンディアン | ビッグエンディアン |
| 前任者 | クレイMTA-2 |
| 後継 | クレイXMT2 |
| レジスター | |
| ストリームあたり 32 個の汎用 (CPU あたり 4096 個) ストリームあたり 8 個のターゲット (CPU あたり 1024 個) | |
Cray XMT(Cray eXtreme MultiThreading、[1]コードネームEldorado [2])は、Crayによるスケーラブルな マルチスレッド共有メモリ スーパーコンピュータアーキテクチャであり、第3世代のTera MTAアーキテクチャに基づいており、大規模なグラフ問題(セマンティックデータベース、ビッグデータ、パターンマッチングなど)を対象としています。[3] [4] [5] 2005年に発表され、以前の失敗に終わったCray MTA-2に取って代わりました。Cray XT3ブレード内でThreadstorm3 CPUを使用します。コモディティ部品と他の商用システムの既存のサブシステムを利用するように設計されており、Cray MTA-2の完全カスタム製造とサポートの高コストの欠点を軽減しました。[2] Cray MTA-2に比べて様々な点で大幅な改善が図られ、最も顕著なのはピーク性能がほぼ3倍になったこと、最大CPU数が8,192に、最大メモリが128 TBに大幅に増加したこと、データTLBが最大512 TBになったことです。[2] [3]
Cray XMTは、 DDR1 ECCモジュール上でスクランブルされた[3] コンテンツアドレス可能メモリ[6]モデルを使用して、システムの共有グローバルアドレス空間全体にわたってメモリアクセスを暗黙的に負荷分散します。[5] 64ビットメモリワードごとに4つの追加の拡張メモリセマンティクスビット(フル/空、転送、および2つのトラップビット)を使用すると、すべてのメモリで軽量できめ細かい同期が可能になります。[7]ハードウェア割り込みはなく、ハードウェアスレッドはOSではなく命令によって割り当てられます。[5] [7]
フロントエンド(ログイン、I/O、その他のサービスノード、AMD Opteronプロセッサを利用し、SLES Linuxを実行)とバックエンド(Threadstorm3プロセッサを利用し、シンプルなBSD UnixベースのマイクロカーネルであるMTK [3]を実行した計算ノード)は、 RPCスタイルの双方向クライアント/サーバーインターフェイスであるLUC(Lightweight User Communication)インターフェイスを介して通信します。[1] [5]
スレッドストーム3
| 一般情報 | |
|---|---|
| 発売 | 2005 |
| 製造中止 | 2011 |
| デザイン: | クレイ |
| パフォーマンス | |
| 最大CPU クロックレート | 500MHz |
| HyperTransportの速度 | 300GT/秒まで |
| アーキテクチャと分類 | |
| 命令セット | MTA ISA |
| 物理的仕様 | |
| コア |
|
| ソケット | |
| 歴史 | |
| 前任者 | クレイ MTA-2 CPU |
| 後継 | スレッドストーム4 |
Threadstorm3 (「MTプロセッサ」 [2]およびXMT2より前のThreadstorm [8]と呼ばれていた) は、64ビットのシングルコアVLIW バレルプロセッサ( AMD Opteronプロセッサで使用される940ピンソケット940と互換性がある) であり、128のハードウェアストリームを持ち、それぞれにソフトウェアスレッドをマッピングでき (実質的にCPUあたり128のハードウェアスレッドを作成)、500MHzで動作し、MTA命令セットまたはそのスーパーセットを使用します。[7] [9] [注 1] 128KBの4ウェイ連想データバッファを備えています。各Threadstorm3には、128の個別のレジスタセットとプログラムカウンタ (ストリームごとに1つ) があり、各サイクルで完全にコンテキストスイッチされます。 [5]推定ピーク性能は1.5GFLOPSです。 3 つの機能ユニット (メモリ、積和演算ユニット、制御) があり、同じ MTA 命令から演算を受け取り、同じサイクル内で動作します。[7]各ストリームには、32 個の汎用レジスタ、8 個のターゲット レジスタ、およびプログラム カウンターを含むステータス ワードがあります。[6]スレッド間でのジョブ割り当ての高レベル制御は不可能です。[5] [注 2] MTA のパイプラインの長さは 21 であるため、各ストリームは 21 サイクルより前に命令を再実行するように選択されます。[11]プロセッサ パッケージの TDP は 30 W です。[ 12 ]
各サイクルでスレッドレベルのコンテキストスイッチが行われるため、Threadstorm CPU のパフォーマンスはメモリアクセス時間によって制限されません。単純化されたモデルでは、各クロックサイクルでスレッドの 1 つからの命令が実行され、次の実行ラウンドの準備ができるまでに要求されたデータが到着していることを前提として、別のメモリ要求がキューに入れられます。[13]これは、メモリアクセスで停止する多くの従来のアーキテクチャとは対照的です。このアーキテクチャは、後続のメモリアクセスを簡単に予測できないデータウォーキング方式に優れており、従来のキャッシュモデルには適していません。[1] Threadstorm の主任設計者はBurton J. Smithです。[1]
クレイXMT2
| デザイナー | クレイ |
|---|---|
| ビット | 64ビット |
| 紹介された | 2011 |
| バージョン | 第4世代のTera MTA |
| エンディアン | ビッグエンディアン |
| 前任者 | クレイXMT |
| レジスター | |
| ストリームあたり 32 個の汎用 (CPU あたり 4096 個) ストリームあたり 8 ターゲット (CPU あたり 1024) | |
Cray XMT2 [3](「次世代XMT」[8]または単にXMT [6]とも呼ばれる)は、 Crayによるスケーラブルなマルチスレッド共有 メモリスーパーコンピュータで、第4世代のTera MTAアーキテクチャに基づいています。[5] 2011年に発表され、メモリホットスポットの問題があったCray XMTの後継機です。[8] Cray XT5ブレード内でThreadstorm4 CPUを使用し、ノードあたりのメモリモジュールを2倍にし、DDR2を使用することで、メモリ容量を8倍の512 TBに、メモリ帯域幅を3倍(200 MHzではなく300 MHz)に増加しました。[6] [8] Threadstorm間のNode Pair Link接続と、メモリのみのノードを導入し、Threadstorm4パッケージではCPUとHyperTransport 1.xコンポーネントが無効になっています。[ 5] XMT2では、XMT の 4 ビットの代わりに、 2 つの追加 EMS ビット (完全/空および拡張) が使用されます。
スレッドストーム4
| 一般情報 | |
|---|---|
| 発売 | 2011 |
| 製造中止 | 2015年ですか? |
| デザイン: | クレイ |
| パフォーマンス | |
| 最大CPU クロックレート | 500MHz |
| HyperTransportの速度 | 400GT/秒まで |
| アーキテクチャと分類 | |
| 命令セット | MTA ISA |
| 物理的仕様 | |
| コア |
|
| ソケット | |
| 歴史 | |
| 前任者 | スレッドストーム3 |
Threadstorm4 (別名「Threadstorm IV」[1]および「Threadstorm 4.0」[nb 3] ) は、64 ビットのシングルコアVLIW バレル プロセッサ( AMD Opteronプロセッサで使用される1207 ピンソケット Fと互換性あり) で、128 のハードウェア ストリームを備え、前身の Threadstorm3 と非常によく似ています。改良された DDR2 対応メモリ コントローラと、ストリームごとに 8 つのトラップレジスタが追加されています。Cray は、既存の Cray XT5 インフラストラクチャ[nb 4]の再利用と、DDR3 よりも短いバースト長を理由に、意図的に DDR3 コントローラを採用しませんでした。 [nb 5]バースト長が長いことは DDR3 の高速化によって補うことができますが、より多くの電力が必要になるため、Cray のエンジニアはそれを避けたいと考えていました。[8]
蠍座
XMT の発売後、Cray は Threadstorm3 のマルチコア版の可能性を研究し、Scorpioと名付けました。多くのハードウェア ストリームを実行パイプラインに多重化することや、64 ビットのメモリ ワードごとに追加の状態ビットを実装することなど、Threadstorm3 の機能のほとんどが保持されました。Cray は後に Scorpio を放棄し、プロジェクトではチップは製造されませんでした。[3]
未来
Threadstorm4の開発とMTAアーキテクチャ全体の開発は、XMT2の後にひっそりと終了しました。これはおそらくIntelのXeon [14]やおそらくXeon Phiなどのコモディティプロセッサとの競争によるものと思われますが、CrayはXMTもXMT2も公式には廃止していません。2020年現在、CrayはXMTとXMT2に関するすべての顧客向けドキュメントをオンラインカタログから削除しています。
ユーザー
Cray XMT2は、いくつかの連邦研究所や学術施設、およびいくつかの商用HPCクライアントに購入されました。例:CSCS(2TBのグローバルメモリと64個のThreadstorm4 CPU)、[15] Noblis CAHPC。[16] XMTおよびXMT2ベースのシステムのほとんどは、2020年までに廃止されました。
注記
- ^ Tera MTA ISA はクローズドソースであり、ワークショップのプレゼンテーションで以前の MTA システムとの下位互換性を主張しているため、Threadstorm CPU で使用される ISA は MTA ISA のサブセットにはなり得ません。
- ^ ただし、命令レベルでそれが可能かどうかは不明です。
- ^ 物理パッケージについて。
- ^ DDR3 ベースのCray XT6 は、XMT2 の 2 年前の 2009 年に発売されました。
- ^ Cray XMT は主に単一の 8 バイト ワードのランダム アクセスで動作し、128 ビットのメモリ チャネルを備えているため、DDR2 バースト長が 4 の場合、通常のオーバーヘッドは 56 バイトです。バースト長が 8 の DDR3 では、通常のオーバーヘッドは 120 バイトに増加します。
参考文献
- ^ abcde 「なぜuRiKAはグラフ指向クエリでこんなに高速なのか?」YarcDataブログ2012年11月14日。2015年2月14日時点のオリジナルよりアーカイブ。
- ^ abcd Feo, John; Harper, David; Kahan, Simon; Konecny, Petr (2005). 「Eldorado」。第 2 回コンピューティング フロンティア カンファレンスの議事録 - CF '05。イタリア、イスキア: ACM プレス。p. 28。doi : 10.1145 / 1062261.1062268。ISBN 978-1-59593-019-4。
- ^ abcdef パドヴァ、デイビッド編。 (2011年)。並列コンピューティングの百科事典。マサチューセッツ州ボストン: Springer US。 pp. 453–457、2033。土井:10.1007/978-0-387-09766-4。ISBN 978-0-387-09765-7。
- ^ Mizell, David; Maschhoff, Kristyn (2009). 「大規模 Cray XMT システムの初期の経験」2009 IEEE 国際並列分散処理シンポジウムpp. 1–9. doi :10.1109/IPDPS.2009.5161108. ISBN 978-1-4244-3751-1.S2CID 1964042 。
- ^ abcdefgh Maltby, James (2012)。Cray XMT マルチスレッド プログラミング モデル。「大規模データ分析のための次世代 Cray XMT (uRiKA) の使用」スイス国立スーパーコンピューティング センター。
- ^ abcd Cray XMT™ システム概要 (S-2466-201) (PDF) 。Cray。 2011年。 2012年12月3日時点のオリジナルよりアーカイブ(PDF) 。2020年5月12日閲覧。
- ^ abcd Konecny, Petr (2011). Cray XMT の紹介(PDF) . Cray.
- ^ abcde Kopser A、Vollrath D (2011 年 5 月)。次世代 Cray XMT の概要(PDF)。第 53 回 Cray ユーザー グループ ミーティング、CUG 2011。アラスカ州フェアバンクス。2015年2 月 14 日閲覧。
- ^ Cray XMT のプログラミング(PDF) . Cray. 2012. p. 14.
- ^ Carter, Larry & Feo, John & Snavely, Allan. (2002). Tera MTA のパフォーマンスとプログラミング体験。
- ^ Snavely, A.; Carter, L.; Boisseau, J.; Majumdar, A.; Kang Su Gatlin; Mitchell, N.; Feo, J.; Koblenz, B. (1998). 「Tera MTA でのマルチプロセッサ パフォーマンス」。IEEE /ACM SC98 会議の議事録。オーランド、フロリダ州、米国: IEEE。p. 4。doi : 10.1109/SC.1998.10049。ISBN 978-0-8186-8707-5. S2CID 8258396。
- ^ Cray XMT パンフレット(PDF) . Cray . 2005年. 2016年12月24日時点のオリジナル(PDF)からアーカイブ。
- ^ Nieplocha J、Marquez A、Petrini F、Chavarria-Miranda D (2007)。「ハイスループット科学のための非従来型アーキテクチャ」(PDF) 。SciDAC Review (5、2007年秋)。Pacific Northwest National Laboratory : 46–50。 2015年2月14日時点のオリジナル(PDF)からアーカイブ。 2015年2月14日閲覧。
- ^ 「Cray CTO が将来の相互接続について語る」。The Next Platform。2016年 1 月 8 日。2016年5 月 2 日閲覧。Steve
Scott: Xeon なら問題なく実現できます。ThreadStorm プロセッサを新たに開発する予定はありません。ただし、ThreadStorm の伝統から生まれたソフトウェア テクノロジは必要です。
- ^ 「CSCS Matterhorn」。スイス国立スーパーコンピューティングセンター。
- ^ Sorin, Nita (2011 年 12 月 16 日)。「Cray が独自の 128 スレッド CPU を搭載した XMT スーパーコンピュータを提供」。Softpedia ニュース。
