人工ニューラル ネットワーク(ANN)の研究において、ニューラル タンジェント カーネル( NTK ) は、勾配降下法によるトレーニング中のディープ ニューラル ネットワークの進化を記述するカーネルです。これにより、カーネル法の理論的ツールを使用して ANN を研究できます。
一般に、カーネルは2 つの入力の半正定値 対称関数であり、2 つの入力間の類似性の概念を表します。NTK は、特定のニューラル ネットワークから派生した特定のカーネルです。一般に、ニューラル ネットワーク パラメーターがトレーニング中に変化すると、NTK も変化します。ただし、レイヤー幅が広いという制限では、NTK は一定になり、幅広いニューラル ネットワークのトレーニングとカーネル法の二重性が明らかになります。つまり、無限幅の制限での勾配降下法は、NTK を使用したカーネル勾配降下法と完全に同等です。結果として、ニューラル ネットワークの最小二乗損失を最小化するために勾配降下法を使用すると、NTK を使用したリッジレス カーネル回帰と同じ平均推定値が得られます。この二重性により、幅広いニューラル ネットワークの トレーニング ダイナミクス、一般化、および予測を記述する単純な閉形式方程式が可能になります。
NTKは2018年にアーサー・ジャコ、フランク・ガブリエル、クレメント・ホングラーによって導入され[1] 、彼らはこれを完全接続ニューラルネットワークの収束性と一般化特性の研究に使用しました。その後の研究[2] [3]では、NTKの結果が他のニューラルネットワークアーキテクチャに拡張されました。実際、NTKの背後にある現象はニューラルネットワークに特有のものではなく、通常は適切なスケーリングによって一般的な非線形モデルで観察できます[4]。
主な結果(非公式)
入力 のパラメータを持つ特定のニューラルネットワークによって計算されるスカラー関数を と表すとします。ニューラル接線カーネルは[1]のように定義されます。これは、マップされた入力間のドット積として表されるため(ニューラルネットワーク関数の勾配が特徴マップとして機能します)、NTK が対称かつ半正定値 であることが保証されます。したがって、NTK は有効なカーネル関数です。
任意の平均ゼロ分布に従ってiidパラメータが選択された完全に接続されたニューラル ネットワークを考えてみましょう。 のこのランダムな初期化により、初期化時とトレーニング (指定されたデータセットの勾配降下法) 全体にわたって統計を分析する分布が誘導されます。 この分布は、 の初期分布から何度も抽出し、各抽出を同じトレーニング手順に従ってトレーニングすることで構築されるニューラル ネットワーク アンサンブルによって視覚化できます。

各層のニューロンの数は層の幅と呼ばれます。すべての隠れ層の幅を無限大にし、ニューラル ネットワークを勾配降下法(学習率は適度に小さい) でトレーニングする場合を考えてみましょう。この無限幅の制限では、いくつかの優れた特性が生まれます。
- 初期化時(トレーニング前)には、ニューラルネットワークアンサンブルはゼロ平均のガウス過程(GP)です。[5]これは、関数の分布が平均と共分散を持つ最大エントロピー分布であることを意味します。ここで、GP共分散はネットワークアーキテクチャから計算できます。言い換えると、初期化時のニューラルネットワーク関数の分布には、その第1モーメントと第2モーメント(平均と共分散)以外の構造はありません。これは中心極限定理に従います。
- NTKは決定論的です。[1] [6]言い換えれば、NTKはランダムパラメータの初期化とは無関係です。
- NTKはトレーニング中に変化しない。[1] [6]
- 各パラメータは、トレーニングを通じてほとんど変化しません。Leeら[6]が指摘しているように、「個々のパラメータはごくわずかな量しか変化しませんが、それらが集合的に作用して、トレーニングに必要なネットワークの最終出力に有限の変化をもたらします。」
- トレーニング中、ニューラルネットワークは線形化されます。つまり、そのパラメータ依存性は、1次テイラー展開によって捉えることができます。ここで、は初期パラメータです。[6]これは、トレーニング中に各パラメータがほとんど変化しないという事実から生じます。(ニューラルネットワークは、入力に対して非線形のままです。)
- トレーニングダイナミクスは、 NTKをカーネルとして使用するカーネル勾配降下法と同等です。 [1]損失関数が平均二乗誤差の場合、 上の最終的な分布は依然としてガウス過程ですが、平均と共分散が新しくなります。[1] [6]特に、平均は、NTKをカーネルとして使用し、ゼロリッジ正則化 を使用したカーネル回帰によって生成された同じ推定値に収束し、共分散はNTKと初期GP共分散で表現できます。アンサンブル分散はトレーニングポイントで消失することが示されます(言い換えると、ニューラルネットワークは初期化に関係なく、常にトレーニングデータを補間します)。
物理学の観点から見ると、NTKは、ニューラルネットワークが極小ステップ(連続体極限)で勾配降下法によって訓練されたときに観測可能な量の時間発展を生成するため、ハミルトニアンの一種として理解することができる。[7]
アプリケーション
リッジレスカーネル回帰とカーネル勾配降下法
カーネル法は、入力ポイント間の一対一の関係のみを使用する機械学習アルゴリズムです。カーネル法は、入力の具体的な値には依存しません。入力と他の入力(トレーニング セットなど)との関係のみに依存します。これらの一対一の関係は、カーネル関数 によって完全に表現されます。カーネル関数 は、2つの入力の対称な半正定値関数で、2 つの入力間の類似性の概念を表します。完全に同等の条件は、マップされた入力 のドット積としてカーネル関数を記述できるような特徴マップが存在することです。カーネル法の特性は、カーネル関数の選択によって異なります。( はよりも高い次元を持つ場合があることに注意してください。)関連する例として、線形回帰を考えてみましょう。これは、から生成されたサンプルを推定するタスクです。ここで、各サンプルは、何らかの入力データ分布に従って描画されます。この設定では、は真の関数 を定義する重みベクトルです。トレーニング サンプルを使用して、を近似するモデルを開発したいと考えています。これを実現するには、モデルとトレーニング サンプル間の平均二乗誤差を最小化します。二乗誤差を最小化する明示的な解が存在します。 、ここで は列がトレーニング入力である行列、 はトレーニング出力のベクトルです。次に、モデルは新しい入力について予測を行うことができます。
しかし、この結果は次のように書き直すことができます。[8]この双対解は、入力間の内積のみで表現されることに注意してください。これが、入力間の内積を直接取る代わりに、最初に選択した特徴マップに従って入力を変換し、次に変換された入力間の内積を評価する設定に線形回帰を拡張する動機となります。上で説明したように、すべてのカーネル関数は特徴マップされた入力の内積であるため、これはカーネル関数 によって表現できます。これにより、リッジレスカーネル回帰推定量が生成されます。カーネル行列が特異の場合、ムーア・ペンローズ擬似逆行列を使用します。回帰方程式は、リッジ正則化項 がないため、「リッジレス」と呼ばれます。
この観点から見ると、線形回帰は、恒等特徴マップを持つカーネル回帰の特殊なケースです。同様に、カーネル回帰は、特徴空間(つまり、選択されたカーネルによって定義される特徴マップの範囲)における単なる線形回帰です。カーネル回帰は通常、入力空間における非線形回帰であり、これがアルゴリズムの主な強みであることに注意してください。
勾配降下法などの反復最適化アルゴリズムを使用して線形回帰を実行できるのと同様に、カーネル勾配降下法を使用してカーネル回帰を実行できます。これは、特徴空間で勾配降下法を実行することと同じです。重みベクトルがゼロに近い値に初期化されると、最小二乗勾配降下法は最小ノルム解に収束することが知られています。つまり、最終的な重みベクトルは、すべての補間解の中で最小のユークリッドノルムを持ちます。同様に、カーネル勾配降下法は、 RKHS ノルムに関して最小ノルム解をもたらします。これは、勾配降下法の暗黙的な正規化の例です。
NTKは、無限幅ANNによる推論とカーネル法による推論の間に厳密な関係を与えます。損失関数が最小二乗損失である場合、ANNによる推論は、NTKに関してリッジレスカーネル回帰と期待値で等しくなります。これは、NTKパラメータ化における大規模ANNのパフォーマンスは、適切に選択されたカーネルのカーネル法によって再現できることを示唆しています。[1] [2]
過剰パラメータ化、補間、一般化
過剰パラメータ化モデルでは、調整可能なパラメータの数がトレーニングサンプルの数を超えます。この場合、モデルはトレーニングデータを記憶(完全に適合)できます。したがって、過剰パラメータ化モデルはトレーニングデータを補間し、実質的にトレーニングエラーをゼロにします。[9]

カーネル回帰は、カーネル関数が選択されると調整する明示的なパラメータがないため、通常は非パラメトリック学習アルゴリズムと見なされます。別の見方としては、カーネル回帰は単に特徴空間における線形回帰であり、パラメータの「有効」数は特徴空間の次元であるということです。したがって、高次元の特徴マップを持つカーネルを研究することで、強く過剰パラメータ化されたモデルについての洞察を得ることができます。
一例として、一般化の問題について考えてみましょう。古典的な統計によると、記憶によりモデルはトレーニング データ内のノイズの多い信号を適合させ、未知のデータに対するパフォーマンスが損なわれるはずです。これを緩和するために、機械学習アルゴリズムはノイズ適合の傾向を緩和するための正則化を導入することがよくあります。驚くべきことに、最近のニューラル ネットワーク (強く過剰パラメータ化される傾向がある) は、明示的な正則化がなくても、うまく一般化しているようです。[9] [10]過剰パラメータ化されたニューラル ネットワークの一般化特性を調べるには、リッジレス カーネル回帰で無限幅の双対性を利用することができます。最近の研究[11] [12] [13]では、高次元カーネル回帰の予想される一般化誤差を記述する方程式が導出されています。これらの結果は、最小二乗に収束するようにトレーニングされた十分に広いニューラル ネットワークの一般化をすぐに説明します。
地球規模の最小値への収束
大域的最小値を持つ凸損失関数の場合、NTKがトレーニング中に正定値のままであれば、ANNの損失はとしてその最小値に収束します。この正定値性は多くのケースで示されており、広幅ANNがトレーニング中に大域的最小値に収束するという最初の証明をもたらしました。[1] [14] [15] [16] [17] [18]
拡張機能と制限
NTKは、さまざまなANNアーキテクチャ、[2]、特に畳み込みニューラルネットワーク(CNN)、[19] 再帰型ニューラルネットワーク(RNN)、およびトランスフォーマーについて研究することができます。[20]このような設定では、大きな幅の制限は、層の数を固定したままパラメータの数を増やすことに相当します。CNNの場合、これはチャネルの数を増やすことを意味します。
カーネル領域における広いニューラルネットワークの個々のパラメータは、トレーニング中にほとんど変化しません。しかし、これは無限幅のニューラルネットワークが特徴学習を示せないことを意味します。これは現実的なディープニューラルネットワークの重要な特性であると広く考えられています。これは無限幅のニューラルネットワークの一般的な特徴ではなく、主に幅を無限の限界まで引き上げるスケーリングの特定の選択によるものです。実際、いくつかの研究[21] [22] [23] [24]では、カーネル回帰との二重性がなく、トレーニング中に特徴学習が発生するニューラルネットワークの代替無限幅スケーリング限界が見つかっています。他の研究[25]では、有限幅の効果を説明するために「ニューラル接線階層」を導入しており、これが特徴学習を促進する可能性があります。
Neural Tangentsは、さまざまな一般的なANNアーキテクチャに対応する無限幅NTKとニューラルネットワークガウス過程(NNGP)の計算と推論に使用される無料のオープンソース Pythonライブラリです。 [26]さらに、 scikit-ntkと呼ばれるガウス過程用の無限幅NTKのscikit-learn互換実装が存在します。[27]
詳細
勾配降下法による経験的損失を最小限に抑えるために ANN のパラメータを最適化する場合、NTK はトレーニング全体を通じて ANN 出力関数のダイナミクスを制御します。
ケース1: スカラー出力
スカラー出力を持つ ANN は、パラメータのベクトルによってパラメータ化された関数のファミリで構成されます。
NTK は、 によって定義されるカーネルです。カーネル法の言語では、NTKは特徴マップに関連付けられたカーネルです。このカーネルが ANN のトレーニング ダイナミクスをどのように駆動するかを確認するには、スカラー ラベルと損失関数を含むデータセットを検討します。関数 で定義される関連する経験的損失は、次のように与えられます。ANNが連続時間勾配降下法によってデータセットに適合するように (つまり を最小化するように) トレーニングされると、パラメータは常微分方程式によって進化します。
トレーニング中、ANN 出力関数は NTK に基づいて与えられた進化微分方程式に従います。
この方程式は、トレーニング中に NTK が関数の空間で のダイナミクスをどのように駆動するかを示しています。
ケース2: ベクトル出力
ベクトル出力のサイズが の ANN は、パラメータのベクトルによってパラメータ化された関数のファミリで構成されます。
この場合、NTKは行列値カーネルで、値は行列の空間内にあり、 によって定義されます。経験的リスク最小化はスカラーの場合と同様に進行しますが、損失関数がベクトル入力 を取る点が異なります。連続時間勾配降下法によるのトレーニングにより、NTK によって駆動される関数空間で次の進化が得られます。これは、ケース 1 に示した方程式をスカラー出力に対して一般化したものです。
解釈
各データポイントは、トレーニング全体を通じて、各入力に対する出力の進化に影響を与えます。より具体的には、例に関して、NTK値は、勾配降下ステップを通じてANN出力の進化に対する損失勾配の影響を決定します。スカラーの場合、これは次のようになります。
ワイドフルコネクテッドANNは決定論的なNTKを持ち、トレーニングを通じて一定に保たれる。
幅 の全結合層を持つ ANN を考えます。ここで は、非線形性の点ごとの適用によるアフィン変換の合成であり、 はマップ をパラメータ化します。パラメータは、独立した同一分布の方法でランダムに初期化されます。
幅が大きくなるにつれて、NTK のスケールは の正確なパラメータ化とパラメータの初期化の影響を受けます。これが、いわゆる NTK パラメータ化の動機となります。このパラメータ化により、パラメータが標準正規変数として初期化された場合、NTK に有限の非自明な制限があることが保証されます。幅の広い制限では、NTK は決定論的 (非ランダム) 制限 に収束し、これは時間的に一定のままになります。
NTKは によって明示的に与えられ、 は再帰方程式の集合によって決定されます。
ここで、はガウス期待値で定義されたカーネルを表します。
この式ではカーネルはANNのいわゆる活性化カーネルである。[28] [29] [5]
ワイドフルコネクテッドネットワークは、トレーニングを通じてパラメータが線形である。
NTK は、関数空間における勾配降下法によるニューラル ネットワークの進化を記述します。この観点と対比されるのが、パラメータ空間におけるニューラル ネットワークの進化の理解です。NTK は、パラメータに対する ANN の出力の勾配で定義されるからです。無限幅の限界では、これら 2 つの観点の関係が特に興味深いものになります。大きな幅でのトレーニング中、NTK が一定のままであることは、ANN が初期化時のパラメータの周りの 1 次テイラー展開によってトレーニング中ずっと適切に記述されることと同義です。[6]
参照
参考文献
- ^ abcdefgh Jacot, Arthur; Gabriel, Franck; Hongler, Clement (2018), Bengio, S.; Wallach, H.; Larochelle, H.; Grauman, K. (eds.)、「Neural Tangent Kernel: Convergence and Generalization in Neural Networks」(PDF)、Advances in Neural Information Processing Systems 31、Curran Associates, Inc.、pp. 8571–8580、arXiv : 1806.07572 、2019-11-27取得
- ^ abc Arora, Sanjeev; Du, Simon S.; Hu, Wei; Li, Zhiyuan; Salakhutdinov, Ruslan; Wang, Ruosong (2019-11-04). 「無限に広いニューラルネットによる正確な計算について」. arXiv : 1904.11955 [cs.LG].
- ^ Yang, Greg (2020-11-29). 「テンソルプログラム II: あらゆるアーキテクチャ向けのニューラル接線カーネル」. arXiv : 2006.14548 [stat.ML].
- ^ Chizat, Lénaïc; Oyallon, Edouard; Bach, Francis (2019-12-08)、「微分可能プログラミングにおける遅延トレーニングについて」、第33回国際神経情報処理システム会議の議事録、レッドフック、ニューヨーク州、米国: Curran Associates Inc.、pp. 2937–2947、arXiv:1812.07956、2023-05-11取得
- ^ ab Lee, Jaehoon; Bahri, Yasaman; Novak, Roman; Schoenholz, Samuel S.; Pennington, Jeffrey; Sohl-Dickstein, Jascha (2018-02-15). 「ガウス過程としてのディープニューラルネットワーク」
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要です - ^ abcdef Lee, Jaehoon; Xiao, Lechao; Schoenholz, Samuel S.; Bahri, Yasaman; Novak, Roman; Sohl-Dickstein, Jascha; Pennington, Jeffrey (2020). 「任意の深さのワイドニューラルネットワークは勾配降下法の下で線形モデルとして進化する」. Journal of Statistical Mechanics: Theory and Experiment . 2020 (12): 124002. arXiv : 1902.06720 . Bibcode :2020JSMTE2020l4002L. doi :10.1088/1742-5468/abc62b. S2CID 62841516.
- ^ Roberts, Daniel A.; Yaida, Sho (2022). 「∞. トレーニングの終わり」。ディープラーニング理論の原理:ニューラルネットワークを理解するための効果的な理論的アプローチ。ボリス・ハニン。ケンブリッジ、ニューヨーク、ポートメルボルン、VIC、ニューデリー、シンガポール:ケンブリッジ大学出版局。p. 360。ISBN 978-1-316-51933-2。
{{cite book}}: CS1 maint: date and year (link) - ^ Shawe-Taylor, John; Cristianini, Nello (2004-06-28). パターン分析のためのカーネル法. Cambridge University Press. doi :10.1017/cbo9780511809682. ISBN 978-0-521-81397-6。
- ^ abc Belkin, Mikhail (2021-05-29). 「恐れずにフィット:補間のプリズムを通して見るディープラーニングの注目すべき数学的現象」. arXiv : 2105.14368 [stat.ML].
- ^ Novak, Roman; Bahri, Yasaman; Abolafia, Daniel A.; Pennington, Jeffrey; Sohl-Dickstein, Jascha (2018-02-15). 「ニューラルネットワークにおける感度と一般化:実証的研究」. arXiv : 1802.08760 [stat.ML].
- ^ Jacot, Arthur; Şimşek, Berfin; Spadaro, Francesco; Hongler, Clément; Gabriel, Franck (2020-06-17). 「カーネルアライメントリスク推定器:トレーニングデータからのリスク予測」。arXiv :2006.09796 [ stat.ML ]。
- ^ Canatar, Abdulkadir; Bordelon, Blake; Pehlevan, Cengiz (2021-05-18). 「スペクトルバイアスとタスクモデルのアラインメントがカーネル回帰と無限幅ニューラルネットワークの一般化を説明する」. Nature Communications . 12 (1): 2914. arXiv : 2006.13198 . Bibcode :2021NatCo..12.2914C. doi :10.1038/s41467-021-23103-1. ISSN 2041-1723. PMC 8131612. PMID 34006842 .
- ^ Simon, James B.; Dickens, Madeline; Karkada, Dhruva; DeWeese, Michael R. (2022-10-12). 「固有学習フレームワーク: カーネル回帰とワイドニューラルネットワークに関する保存則の観点」. arXiv : 2110.03922 [cs.LG].
- ^ アレン・ジュー、ゼユアン;李元志。宋・趙(2018)。 「過剰パラメータ化による深層学習の収束理論」。arXiv : 1811.03962 [cs.LG]。
- ^ Du, Simon S; Zhai, Xiyu; Poczos, Barnabas; Aarti, Singh (2019). 「勾配降下法は、過剰パラメータ化されたニューラルネットワークを証明可能に最適化する」. arXiv : 1810.02054 [cs.LG].
- ^ Zou, Difan; Cao, Yuan; Zhou, Dongruo; Gu, Quanquan (2020). 「勾配降下法は過剰パラメータ化されたディープReLUネットワークを最適化する」.機械学習. 109 (3): 467–492. doi : 10.1007/s10994-019-05839-6 . S2CID 53752874.
- ^ Allen-Zhu, Zeyuan; Li, Yuanzhi; Song, Zhao (2019-05-27). 「リカレントニューラルネットワークのトレーニングの収束率について」. arXiv : 1810.12065 [cs.LG].
- ^ Du, Simon; Lee, Jason; Li, Haochuan; Wang, Liwei; Zhai, Xiyu (2019-05-24). 「勾配降下法によるディープニューラルネットワークのグローバル最小値の検出」. pp. 1675–1685. arXiv : 1811.03804 [cs.LG].
- ^ Yang, Greg (2019-02-13). 「重み共有によるワイドニューラルネットワークのスケーリング限界: ガウス過程挙動、勾配独立性、ニューラル接線カーネル導出」. arXiv : 1902.04760 [cs.NE].
- ^ フロン、ジリ;バーリ、ヤサマン。ソール=ディックスシュタイン、ヤッシャ。ノバク、ローマン (2020-06-18)。 「無限の注意: ディープ アテンション ネットワークのための NNGP と NTK」。arXiv : 2006.10540 [stat.ML]。
- ^ Mei, Song; Montanari, Andrea; Nguyen, Phan - Minh (2018-08-14). 「2層ニューラルネットワークのランドスケープの平均視野ビュー」。米国 科学アカデミー紀要。115 ( 33 ): E7665–E7671。arXiv : 1804.06561。Bibcode : 2018PNAS..115E7665M。doi : 10.1073 / pnas.1806579115。ISSN 0027-8424。PMC 6099898。PMID 30054315。
- ^ Chizat, Lénaïc; Bach, Francis (2018-12-03). 「最適トランスポートを使用した過剰パラメータ化モデルの勾配降下法のグローバル収束について」。第32回国際神経情報処理システム会議の議事録。NIPS'18。レッドフック、ニューヨーク州、米国:Curran Associates Inc.:3040–3050。arXiv:1805.09545 。
- ^ Nguyen, Phan-Minh; Pham, Huy Tuan (2020-01-30). 「多層ニューラルネットワークの平均場限界のための厳密なフレームワーク」. arXiv : 2001.11443 [cs.LG].
- ^ Yang, Greg; Hu, Edward J. (2022-07-15). 「無限幅ニューラルネットワークにおける特徴学習」. arXiv : 2011.14522 [cs.LG].
- ^ Huang, Jiaoyang; Yau, Horng-Tzer (2019-09-17). 「ディープニューラルネットワークとニューラル接線階層のダイナミクス」. arXiv : 1909.08156 [cs.LG].
- ^ Novak, Roman; Xiao, Lechao; Hron, Jiri; Lee, Jaehoon; Alemi, Alexander A.; Sohl-Dickstein, Jascha; Schoenholz, Samuel S. (2019-12-05)、「Neural Tangents: Python での高速で簡単な無限ニューラル ネットワーク」、International Conference on Learning Representations (ICLR)、vol. 2020、arXiv : 1912.02803、Bibcode :2019arXiv191202803N
- ^ Lencevicius, Ronaldas Paulius (2022). 「ラプラスカーネルとニューラルタンジェントカーネルの実証分析」. arXiv : 2208.03761 [stat.ML].
- ^ Cho, Youngmin; Saul, Lawrence K. (2009), Bengio, Y.; Schuurmans, D.; Lafferty, JD; Williams, CKI (eds.)、「Kernel Methods for Deep Learning」(PDF)、Advances in Neural Information Processing Systems 22、Curran Associates, Inc.、pp. 342–350 、 2019-11-27取得
- ^ Daniely, Amit; Frostig, Roy; Singer, Yoram (2016), Lee, DD; Sugiyama, M.; Luxburg, UV; Guyon, I. (eds.)、「ニューラルネットワークのより深い理解に向けて:初期化の力と表現力に関する二重の視点」(PDF)、Advances in Neural Information Processing Systems 29、Curran Associates、Inc.、pp. 2253–2261、arXiv:1602.05897、Bibcode:2016arXiv160205897D 、 2019-11-27取得
外部リンク
- Ananthaswamy, Anil (2021-10-11). 「古いモデルへの新たなリンクがディープラーニングの謎を解く可能性」Quanta Magazine。
