Tensor Processing Unit ( TPU ) は、Googleがニューラルネットワーク機械学習用に開発したニューラル処理ユニット(NPU)アプリケーション固有集積回路(ASIC)です。[ 2 ] Tensorflow、Jax、およびPyTorchは、TPU でサポートされているフレームワークです。[ 3 ] Google は 2015 年に社内で TPU の使用を開始し、2018 年にクラウドインフラストラクチャの一部として、またチップの小型版を販売することによって、サードパーティが使用できるようにしました。現在、Google Cloud は主に TPU システムの販売から製品収益を上げています。
グラフィックス処理ユニットと比較して、TPUは、ラスタライズやテクスチャマッピング用のハードウェアなしで、ジュールあたりの入出力操作が多く、低精度演算(例えば8ビット精度程度)を大量に行うように設計されています[ 4 ]。[ 5 ] Norman Jouppi氏によると、 TPU ASICはヒートシンクアセンブリに取り付けられ、データセンターラック内のハードドライブスロットに収まります[ 6 ]。
異なる種類のプロセッサは、異なる種類の機械学習モデルに適しています。TPUは畳み込みニューラルネットワーク(CNN)に適しており、GPUは一部の全結合ニューラルネットワークに利点があり、CPUはリカレントニューラルネットワーク( RNN )に利点がある場合があります。[ 7 ]
2013年、Googleはデータセンター向けカスタムシリコン開発能力を確立するためにアミール・サレックを採用した。 [ 8 ] GoogleテクニカルインフラストラクチャおよびGoogleクラウドのカスタムシリコンの創設者兼責任者として、サレックはオリジナルのTPU(Google初の量産チップ)、TPUv2(業界初の量産ディープラーニングトレーニングチップ)、TPUv3、TPUv4、Edge-TPU、およびVCU、IPU、OpenTitanなどの追加のシリコン製品の開発を主導した。[ 9 ] [ 10 ] オリジナルのTPUエンジニアの1人であり、後にGroqの創設者となったジョナサン・ロス[ 1 ]によると、Googleの3つの別々のグループがAIアクセラレータを開発しており、最終的に選ばれたのはシストリックアレイであるTPU [ 11 ]の設計だった。
Norman P. Jouppi は、Google の Tensor Processing Unit 開発の技術リーダーおよび主任アーキテクトを務め、最初の TPU の設計、検証、および本番環境への展開をわずか 15 か月で迅速に主導しました。[ 12 ] Jouppi は、第 44 回国際コンピュータ アーキテクチャ シンポジウム (ISCA 2017) で発表された、2017 年の画期的な論文「データセンター内における Tensor Processing Unit のパフォーマンス分析」の筆頭著者として、TPU が当時の CPU や GPU よりも 15 ~ 30 倍高いパフォーマンスと 30 ~ 80 倍高いワットあたりのパフォーマンスを達成し、Google の本番サービス全体で大規模なニューラル ネットワーク推論のための基盤プラットフォームとして TPU を確立したことを実証しました。[ 13 ] [ 14 ]
テンソル処理ユニットは、2016 年 5 月にGoogle I/Oカンファレンスで発表され、同社は TPU が1 年以上前からデータ センター内で使用されていると述べた。 [ 6 ] [ 5 ] 2017 年の Google の論文では、その作成について説明しており、1990 年代に構築された同様のアーキテクチャの以前のシストリック行列乗算器を引用している。[ 15 ]このチップは、ニューラル ネットワークなどの機械学習アプリケーションで使用される記号数学ライブラリである Google のTensorFlowフレームワーク向けに特別に設計された。[ 16 ]しかし、2017 年の時点では、Google は他のタイプの機械学習にはまだCPUとGPUを使用していた。[ 6 ]他のベンダーからも、組み込み市場やロボット市場を対象とした他のAI アクセラレータ設計が登場している。
GoogleのTPUは独自仕様です。一部のモデルは市販されており、2018年2月12日、ニューヨーク・タイムズは、Googleが「クラウドコンピューティングサービスを通じて他社がこれらのチップへのアクセスを購入できるようにする」と報じました。[ 17 ] Googleは、人間対機械の囲碁ゲームであるAlphaGo対イ・セドルシリーズ[ 5 ]や、ゲームルールのみからチェス、将棋、囲碁のプレイングプログラムを生成し、それらのゲームでトップのプログラムを打ち負かしたAlphaZeroシステム[ 18 ]でTPUが使用されたと述べています。Googleはまた、 Googleストリートビューのテキスト処理にTPUを使用しており、5日以内にストリートビューデータベース内のすべてのテキストを見つけることができました。Googleフォトでは、1つのTPUが1日に1億枚以上の写真を処理できます。[ 6 ]また、Googleが検索結果を提供するために使用するRankBrainでも使用されています。[ 19 ]
Google は、Google Cloud Platformの一部としてCloud TPUサービス[ 20 ]およびノートブックベースのサービスKaggleとColaboratory [ 21 ] [ 22 ]を通じて、サードパーティに TPU へのアクセスを提供しています。
Broadcom はTPU の共同開発者であり、Google のアーキテクチャと仕様を製造可能なシリコンに変換しています。SerDes 高速インターフェースなどの独自のテクノロジーを提供し、 ASIC 設計を監督し、台湾積体電路製造 ( TSMC ) などのサードパーティのファウンドリを通じてチップの製造とパッケージングを管理しており、プログラム開始以来のすべての世代をカバーしています。[ 23 ] [ 24 ] [ 25 ]
2025年9月、GoogleはCrusoeやCoreWeaveを含む複数の「ネオクラウド」と、データセンターへのTPU導入について協議している。[ 26 ] [ 27 ] 2025年11月、MetaはGoogleとAIデータセンターへのTPU導入について協議している。
第1世代のTPUは、PCIe 3.0バスを介してホストプロセッサからCISC命令で駆動される8ビット行列乗算エンジンです。28nmプロセスで製造され、ダイサイズは≤331mm2です。クロック速度は700MHzで、熱設計電力は28~40Wです。28MiBのオンチップメモリと、 256×256のシストリックアレイの8ビット乗算器の結果を取得する4MiBの32ビットアキュムレータを備えています。[ 15 ] TPUパッケージ内には、8GiBのデュアルチャネル2133MHz DDR3 SDRAMがあり、34GB/sの帯域幅を提供します。 [ 30 ]命令は、ホストとの間でデータを転送したり、行列乗算や畳み込みを実行したり、活性化関数を適用したりします。[ 15 ]
第2世代TPUは2017年5月に発表されました。[ 40 ] Googleは、第1世代TPUの設計はメモリ帯域幅に制限されていたが、第2世代の設計では16GBの高帯域幅メモリを使用することで帯域幅を600GB/秒に、性能を45テラFLOPSに向上させたと述べ て います。[ 30 ] TPUは、180 テラFLOPSの性能を持つ4チップモジュールに配置されます。[ 40 ]次に、これらのモジュール64個が、11.5ペタFLOPSの性能を持つ256チップポッドに組み立てられます 。[ 40 ]特筆すべきは、第1世代TPUは整数に限定されていたのに対し、第2世代TPUは浮動小数点でも計算でき、Google Brainが考案したbfloat16形式が導入されたことです。これにより、第2世代TPUは機械学習モデルのトレーニングと推論の両方に役立ちます。 Googleは、これらの第2世代TPUがTensorFlowアプリケーションで使用するためにGoogle Compute Engineで利用可能になると述べている。[ 41 ]
第3世代TPUは2018年5月8日に発表されました。[ 42 ] Googleは、プロセッサ自体が第2世代TPUの2倍の性能を持ち、前世代の4倍のチップを搭載したポッドに展開されると発表しました。[ 43 ] [ 44 ]これにより、第2世代TPUの展開と比較して、ポッドあたりのパフォーマンスが8倍向上します(ポッドあたり最大1,024個のチップ)。

2021 年 5 月 18 日、Google の CEO サンダー ピチャイは、Google I/O の仮想カンファレンスでの基調講演で TPU v4 テンソル処理ユニットについて語った。TPU v4 は、TPU v3 チップと比較して 2 倍以上のパフォーマンス向上を実現した。ピチャイは、「 1 つの v4 ポッドには 4,096 個の v4 チップが含まれており、各ポッドは、他のどのネットワーク技術と比較しても、チップあたりの相互接続帯域幅が 10 倍になっている」と述べた。[ 45 ] 2023 年 4 月に Google が発表した論文では、機械学習ベンチマークにおいてTPU v4 はNvidia A100より 5〜87% 高速であると主張している。[ 46 ]
また、液体冷却を必要としない「推論」バージョンであるv4i [ 47 ]も存在する[ 48 ]。
2021年、GoogleはTPU v5の物理レイアウトが深層強化学習の新しい応用によって設計されていることを明らかにした。[ 49 ] GoogleはTPU v5がTPU v4のほぼ2倍の速さであると主張しており、[ 50 ]それとTPU v4のA100に対する相対的なパフォーマンスに基づいて、TPU v5はH100と同等かそれ以上の速さであると推測する人もいる。[ 51 ]
v4iがv4の軽量版であるのと同様に、第5世代にはv5eと呼ばれる「コスト効率の良い」 [ 52 ]バージョンがあります。 [ 33 ] 2023年12月、GoogleはNvidia H100に対抗できるとされるTPU v5pを発表しました。[ 53 ]
2024 年 5 月のGoogle I/Oカンファレンスで、Google は Trillium を発表し、2024 年 10 月にプレビュー版が利用可能になりました。[ 54 ] Google は、より大きな行列乗算ユニットとクロック速度の向上により、TPU v5e と比較して 4.7 倍のパフォーマンス向上を実現したと主張しています。 [ 55 ]高帯域幅メモリ (HBM) の容量と帯域幅も 2 倍になりました。ポッドには最大 256 個の Trillium ユニットを搭載できます。[ 56 ]
2025年4月、Google Cloud Nextカンファレンスで、GoogleはTPU v7を発表しました。Ironwoodと呼ばれるこの新しいチップ[ 57 ]は、256チップのクラスタと9,216チップのクラスタの2つの構成で提供されます。Ironwoodのピーク演算性能は4,614 TFLOP/sです。[ 58 ]
2026年4月22日、Googleは、 TPU 8tとTPU 8iという2つの専用チップで構成される第8世代のTensor Processing Unitを発表しました。[ 38 ]これは、GoogleがTPUアーキテクチャをトレーニングと推論に最適化された別々の設計に分割した初めての事例です。両方のチップは、Google独自のArmベースのAxion CPU上で動作し、第4世代の液体冷却を利用しています。[ 59 ]
TPU 8t(「トレーニング」)は、最先端モデルの大規模な事前トレーニングと埋め込み負荷の高いワークロード向けに最適化されています。ピーク性能は12.6 FP4 PFLOPsで、帯域幅6,528 GB/sの216 GBのHBM3eメモリを搭載しています。Virgo Networkファブリックを使用することで、「スーパーポッド」あたり最大9,600チップまで拡張でき、121 FP4 ExaFLOPsの演算性能を実現します。[ 38 ]
TPU 8i(「推論」)は、高速サービス、AIエージェント、およびロングコンテキスト推論向けに設計されています。ピーク性能は10.1 FP4 PFLOPsで、帯域幅8,601 GB/sの288 GBのHBM3eメモリを搭載しています。オンチップSRAMは384 MBで、前世代の3倍に増加しています。TPU 8iは、「Boardfly」ネットワークトポロジーと、同期遅延を5分の1に削減するCollectives Acceleration Engine(CAE)を導入しています。[ 38 ]
2018 年 7 月、Google は Edge TPU を発表しました。Edge TPU は、エッジ コンピューティング向けの機械学習 (ML) モデルを実行するために設計された Google 専用の ASIC チップです。つまり、Google データセンターでホストされている TPU (クラウド TPU [ 60 ]とも呼ばれる) と比較して、はるかに小型で消費電力もはるかに少なくなっています。2019 年 1 月、Google はCoralブランドの製品ラインで Edge TPU を開発者向けに提供開始しました。Edge TPU は、2 W の電力で毎秒 4 兆回の演算が可能です。[ 61 ]
製品ラインナップには、シングルボードコンピュータ(SBC)、システムオンモジュール(SoM)、USBアクセサリ、ミニPCI-eカード、M.2カードが含まれます。SBC Coral Dev BoardとCoral SoMはどちらも、 Debianの派生版であるMendel Linux OSを実行します。[ 62 ] [ 63 ] USB、PCI-e、M.2製品は、既存のコンピュータシステムへのアドオンとして機能し、x86-64およびARM64ホスト( Raspberry Piを含む)上のDebianベースのLinuxシステムをサポートします。
Edge TPU 上でモデルを実行するために使用される機械学習ランタイムはTensorFlow Liteに基づいています。[ 64 ] Edge TPU は順方向パス演算のみを高速化できるため、主に推論の実行に役立ちます (ただし、Edge TPU 上で軽量な転移学習を実行することは可能です[ 65 ] )。また、Edge TPU は 8 ビット演算のみをサポートしているため、ネットワークを Edge TPU と互換性を持たせるには、TensorFlow の量子化対応トレーニング手法を使用してトレーニングするか、2019 年後半以降はトレーニング後の量子化を使用することもできます。
2019年11月12日、ASUSはEdge TPUを搭載したシングルボードコンピュータ(SBC) 2機種を発表しました。ASUS Tinker Edge TとTinker Edge RボードはIoTとエッジAI向けに設計されています。これらのSBCはAndroidとDebianオペレーティングシステムを公式にサポートしています。[ 66 ] [ 67 ] ASUSはEdge TPUを搭載したASUS PN60Tと呼ばれるミニPCも発表しています。[ 68 ]
2020年1月2日、GoogleはCoralアクセラレータモジュールとCoral Dev Board Miniを発表し、同月後半に開催されるCES 2020でデモを行う予定である。Coralアクセラレータモジュールは、Edge TPU、PCIe、USBインターフェースを備えたマルチチップモジュールで、統合が容易である。Coral Dev Board Miniは、 CoralアクセラレータモジュールとMediaTek 8167s SoCを搭載した小型のシングルボードコンピュータ(SBC )である。[ 69 ] [ 70 ]
2019年10月15日、GoogleはPixel 4スマートフォンを発表しました。このスマートフォンには、 Pixel Neural Coreと呼ばれるEdge TPUが搭載されています。Googleはこれを「Pixel 4の主要なカメラ機能の要件を満たすようにカスタマイズしたもの」と説明し、レイテンシと消費電力を最小限に抑えるために精度を多少犠牲にしたニューラルネットワーク検索を使用していると述べています。[ 71 ]
GoogleはPixel Neural Coreに続き、Edge TPUをGoogle Tensorと呼ばれるカスタムシステムオンチップに統合し、2021年にPixel 6シリーズのスマートフォンとともにリリースしました。[ 72 ] Google Tensor SoCは、機械学習に特化したベンチマークで「競合製品に対して非常に大きなパフォーマンス上の優位性」を示しました。瞬間的な消費電力も比較的高かったものの、パフォーマンスの向上により、ピークパフォーマンスを必要とする期間が短くなったため、エネルギー消費量が少なくなりました。[ 73 ]
2019年、MITの客員教授であるジョセフ・ベイツが2009年に設立したSingular Computing社[ 74 ]は、TPUチップの特許侵害を主張してGoogleを提訴した[ 75 ] 。 2020年までに、Googleは裁判所が検討するクレームの数を2つに減らすことに成功した。それは、2012年に提出されたUS 8407273のクレーム53と、2013年に提出されたUS 9218156のクレーム7であり、どちらも浮動小数点数のダイナミックレンジが10 −6から10 6であることを主張しているが、標準のfloat16は指数に5ビットしかないため、(非正規数に頼らずに)これを実現することはできない。2023年の裁判所提出書類で、Singular Computing社は、Googleがbfloat16を使用していることを特に指摘し、それがfloat16のダイナミックレンジを超えていると述べた。[ 76 ] Singular Computing は、非標準浮動小数点形式は2009 年の時点で自明ではなかったと主張しているが、Google は、指数ビット数を構成可能なVFLOAT [ 77 ]形式は2002 年の先行技術として存在していたと反論している。 [ 78 ] 2024 年 1 月までに、Singular Computing によるその後の訴訟により、係争中の特許の数は 8 件にまで増加した。その月の後半の裁判の終盤、Google は非公開の条件で和解に合意した。[ 79 ] [ 80 ]