人工知能(AI) プログラムをより高速かつ低エネルギーで実行するために、 Lisp マシン、ニューロモルフィック エンジニアリング、イベント カメラ、物理ニューラル ネットワークなどの特殊なコンピュータ ハードウェアがよく使用されます。2017 年以降、いくつかのコンシューマー グレードのCPUおよびSoC にはオンダイNPUが搭載されています。2023 年現在、AI ハードウェア市場はGPUが支配的です。[ 1 ]

2020年代現在、AI 計算はグラフィックス処理ユニット (GPU) と、Google の Tensor Processing Units (TPU)、AMD の Instinct MI300 シリーズ、およびコンシューマー ハードウェアに搭載されているさまざまなオン デバイス ニューラル処理ユニット (NPU) などの新しいドメイン固有のアクセラレータによって支配されています。[ 2 ] [ 3 ]
本稿では、AIハードウェアとは、機械学習のトレーニングや推論などの人工知能ワークロードを高速化するために特別に設計または最適化されたコンピューティングコンポーネントおよびシステムを指します。これには、AIに使用される汎用アクセラレータ(GPUなど)とドメイン固有のアクセラレータ(TPU、NPU、その他のAI ASICなど)が含まれます。[ 4 ]
イベントベースカメラはニューロモルフィックコンピューティングの文脈で議論されることがあるが、AI コンピューティングデバイスではなく入力センサーである。逆に、メモリスなどのコンポーネントは、単独で考えると、特殊な AI ハードウェアではなく、基本的な回路要素である。[ 5 ] [ 6 ]

Lispマシンは、プログラミング言語Lispで書かれた人工知能プログラムをより高速に実行するために、1970年代後半から1980年代前半にかけて開発されました。[ 7 ]
AIで使用されるデータフローアーキテクチャプロセッサは、ポリモーフィックデータフロー[ 8 ]、 Kinara(旧Deep Vision)の畳み込みエンジン[ 9 ] 、 Hailoの構造駆動型データフロー[ 10 ] 、 Cerebrasのデータフロースケジューリング[ 11 ]など、さまざまな実装でさまざまな目的に使用されます。

2010 年代以降、コンピュータ ハードウェアの進歩により、非線形隠れユニットの多数の層と非常に大きな出力層を含む深層ニューラル ネットワークをトレーニングするためのより効率的な方法が開発されました。[ 12 ] 2019 年までに、多くの場合 AI 専用の機能強化が施されたグラフィックス処理ユニット(GPU) が、大規模な商用クラウド AI をトレーニングするための主要な手段として中央処理装置(CPU) に取って代わりました。 [ 13 ] OpenAI は、Alex Net (2012 年) から Alpha Zero (2017 年) までの最大の深層学習プロジェクトで使用されたハードウェア コンピューティングを推定し、必要なコンピューティング量が 30 万倍に増加し、倍増する傾向が 3.4 か月であることを発見しました。[ 14 ] [ 15 ]
2010年代以降、グラフィックス処理ユニット(GPU)は、その高度に並列化されたアーキテクチャと高いメモリ帯域幅により、深層学習モデルのトレーニングと展開に広く使用されてきました。最新のデータセンターGPUには、ニューラルネットワークの演算を高速化する専用のテンソルまたは行列演算ユニットが含まれています。[ 16 ]
2022年、NVIDIAはHopper世代のH100 GPUを発表し、大規模モデルトレーニング向けにFP8精度サポートと高速インターコネクトを追加しました。[ 17 ] AMDや他のベンダーも、AIや高性能コンピューティングワークロードを対象としたGPUやアクセラレータを開発しています。[ 18 ]
汎用GPU以外にも、いくつかの企業がAIワークロードに特化した特定用途向け集積回路(ASIC)やニューラルプロセッシングユニット(NPU)を開発している。Googleは2016年に深層学習推論用のTensor Processing Unit(TPU)を発表し、後の世代では高密度シストリックアレイ設計と光インターコネクトにより大規模なトレーニングをサポートしている。[ 19 ] 他のベンダーも、AppleのNeural Engineや様々なオンデバイスNPUなど、モバイルやエッジコンピューティング環境でのエネルギー効率の高い推論を重視した同様のデバイスをリリースしている。[ 20 ]
AIアクセラレータは、トレーニングや推論の大量のデータを処理するために、高速メモリとチップ間リンクに依存しています。2022年にHBM3として標準化された高帯域幅メモリ(HBM)スタックは、最新のGPUやASICでテラバイト/秒のスループットを提供します。[ 21 ] これらのアクセラレータは、NVIDIAのNVLinkやNVSwitchなどの専用ファブリック、またはTPUシステムで使用される光インターコネクトを介して接続され、数千個のチップにわたってパフォーマンスを拡張します。[ 22 ]
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)