エネルギーベースモデル( EBM ) (カノニカルアンサンブル学習またはカノニカルアンサンブルによる学習– CELおよびLCEとも呼ばれる) は、統計物理学のカノニカルアンサンブル定式化をデータ学習に応用したものです。このアプローチは、生成型人工知能で顕著に見られます。
EBM は、特にグラフィカルモデルやその他の構造化モデルのトレーニングにおいて、このような学習に対する多くの確率的および非確率的アプローチに統一されたフレームワークを提供します。[引用が必要]
EBM はターゲットデータセットの特性を学習し、類似しているがより大きなデータセットを生成します。EBM はデータセットの 潜在変数を検出し、同様の分布を持つ新しいデータセットを生成します。
エネルギーベースの生成ニューラルネットワーク [1] [2] は、エネルギー関数が最新のディープニューラルネットワークによってパラメータ化されたエネルギーベースのモデルの形でデータの明示的な確率分布を学習することを目的とした生成モデルの一種です。
ボルツマンマシンは、エネルギーの特定のパラメータ化を備えたエネルギーベースのモデルの特殊な形式です。[3]
説明
与えられた入力 に対して、モデルはボルツマン分布が確率(密度)であり、通常は となるようなエネルギーを記述します。
正規化定数:
(パーティション関数とも呼ばれる) は、すべての可能な入力のすべてのボルツマン因子に依存するため、標準的な最尤推定法を使用するだけでは、トレーニング中に簡単に計算したり、確実に推定したりすることはできません。
しかし、トレーニング中に尤度を最大化するために、単一のトレーニング例の対数尤度の勾配は連鎖律を使用して与えられます。
上記の式の勾配の期待値は、マルコフ連鎖モンテカルロ(MCMC)を使用して分布からサンプルを抽出することによって近似的に推定することができます。[4]
2003年のヒントンによるボルツマンマシンなどの初期のエネルギーベースのモデルでは、ブロックギブスサンプリングによってこの期待値を推定していました。新しいアプローチでは、より効率的な確率的勾配ランジュバンダイナミクス(LD)を利用して、以下を使用してサンプルを抽出します。[5]
、
ここで、過去の値の再生バッファは、最適化モジュールを初期化するために LD で使用されます。
ニューラルネットワークのパラメータは、MCMCベースの最大尤度推定を介して生成的にトレーニングされます。[6] 学習プロセスは「合成による分析」スキームに従います。各学習反復内で、アルゴリズムは勾配ベースのMCMC法(ランジュバンダイナミクスやハイブリッドモンテカルロなど)を使用して現在のモデルから合成例をサンプリングし、トレーニング例と合成例の差に基づいてパラメータを更新します(式を参照)。このプロセスは、モード探索とモードシフトの交互プロセスとして解釈でき、敵対的解釈もあります。[7] [8]
本質的に、モデルは低いエネルギーを正しい値に関連付け、高いエネルギーを誤った値に関連付ける関数を学習します。
トレーニング後、収束したエネルギーモデルが与えられたら、メトロポリス・ヘイスティングスアルゴリズムを使用して新しいサンプルを抽出できます。受け入れ確率は次のように与えられます。
歴史
「エネルギーベースモデル」という用語は、2003年のJMLR論文[9]で初めて造られ、著者らはEBMを使用して独立成分分析を過剰完備設定に一般化することを定義しました。EBMに関するその他の初期の研究では、エネルギーを潜在変数と観測可能変数の組み合わせとして表現するモデルが提案されました。
特徴
EBM は次のような有用な特性を示します:
- シンプルさと安定性 - EBM は設計とトレーニングが必要な唯一のオブジェクトです。バランスを確保するために個別のネットワークをトレーニングする必要はありません。
- 適応計算時間 - EBMは、シャープで多様なサンプル、または(より速く)粗く多様性の少ないサンプルを生成することができます。無限の時間が与えられた場合、この手順は真のサンプルを生成します。[7]
- 柔軟性 -変分オートエンコーダ(VAE) とフローベースのモデルでは、ジェネレーターは連続空間から異なるデータ モードを含む (場合によっては) 不連続空間へのマップを学習します。EBM は、分離した領域 (複数のモード) に低いエネルギーを割り当てることを学習できます。
- 適応型生成 - EBMジェネレータは確率分布によって暗黙的に定義され、分布が変化すると自動的に適応します(トレーニングなし)。これにより、EBMはジェネレータのトレーニングが実用的ではない領域に対処できるようになり、モードの崩壊を最小限に抑え、分布外のサンプルからのスプリアスモードを回避できます。[4]
- 構成性 - 個々のモデルは正規化されていない確率分布であり、専門家の積やその他の階層的手法を通じてモデルを組み合わせることができます。
実験結果
CIFAR-10やImageNet 32x32などの画像データセットでは、EBMモデルは比較的高速に高品質の画像を生成しました。EBMモデルは、ある種類の画像から学習した特徴を組み合わせて、他の種類の画像を生成することをサポートしていました。分布外データセットを使用して一般化することができ、フローベースモデルや自己回帰モデルよりも優れていました。EBMは敵対的摂動に対して比較的耐性があり、分類のトレーニングでそれらに対して明示的にトレーニングされたモデルよりも優れた動作を示しました。[4]
アプリケーション
対象アプリケーションには、自然言語処理、ロボット工学、コンピュータービジョンなどがあります。
最初のエネルギーベースの生成ニューラルネットワークは、2016年に画像パターン用に提案された生成ConvNetであり、ニューラルネットワークは畳み込みニューラルネットワークです。[10] [11]モデルは、ビデオ、[7] [2]および3Dボクセルの分布を学習するために、さまざまなドメインに一般化されています。[12]これらは、そのバリアントでより効果的になっています。[13] [14] [15] [16] [17] [18]これらは、データ生成(例:画像合成、ビデオ合成、 [7] 3D形状合成、[4]など)、データ回復(例:欠落したピクセルまたは画像フレームを含むビデオの回復、[7] 3D超解像、[4]など)、データ再構成(例:画像再構成および線形補間[14])に有用であることが証明されています。
代替案
EBM は、変分オートエンコーダ(VAE)、生成的敵対的ネットワーク(GAN)、正規化フローなどの技術と競合します。
拡張機能
共同エネルギーベースモデル

2020年にGrathwohlらによって提案されたジョイントエネルギーベースモデル(JEM)では、ソフトマックス出力を持つ任意の分類器をエネルギーベースモデルとして解釈できます。重要な観察点は、このような分類器が条件付き確率を予測するようにトレーニングされていることです。 ここで、はクラスyに対応するロジットのy番目のインデックスです。ロジットに変更を加えずに、ロジットを再解釈してジョイント確率密度を記述することが提案されました。
未知の分配関数とエネルギーを持つ。周辺化により、正規化されていない密度が得られる。
したがって、
任意の分類器を使用してエネルギー関数を定義できるようになります。
参照
文学
- エネルギーベースモデルにおける暗黙的生成と一般化 Yilun Du、Igor Mordatch https://arxiv.org/abs/1903.08689
- あなたの分類器は実はエネルギーベースのモデルであり、そのように扱うべきです、Will Grathwohl、Kuan-Chieh Wang、Jörn-Henrik Jacobsen、David Duvenaud、Mohammad Norouzi、Kevin Swersky https://arxiv.org/abs/1912.03263
参考文献
- ^ 謝建文;ルー、ヤン。ジュー、ソンチュン。ウー、インニアン(2016)。 「生成的 ConvNet の理論」。ICML。arXiv : 1602.03264。Bibcode :2016arXiv160203264X。
- ^ ab Xie, Jianwen; Zhu, Song-Chun; Wu, Ying Nian (2019). 「動的パターンのためのエネルギーベースの空間的・時間的生成ConvNetの学習」. IEEE Transactions on Pattern Analysis and Machine Intelligence . 43 (2): 516–531. arXiv : 1909.11975 . Bibcode :2019arXiv190911975X. doi :10.1109/tpami.2019.2934852. ISSN 0162-8828. PMID 31425020. S2CID 201098397.
- ^ AI のためのディープ アーキテクチャの学習、Yoshua Bengio、54 ページ、https://books.google.com/books?id=cq5ewg7FniMC&pg=PA54
- ^ abcde Du, Yilun; Mordatch, Igor (2019-03-20). 「エネルギーベースモデルにおける暗黙的生成と一般化」. arXiv : 1903.08689 [cs.LG].
- ^ Grathwohl, Will、et al. 「あなたの分類器は実はエネルギーベースのモデルなので、そのように扱うべきです。」arXiv プレプリント arXiv:1912.03263 (2019)。
- ^ Barbu, Adrian; Zhu, Song-Chun (2020).モンテカルロ法. Springer.
- ^ abcde Xie, Jianwen; Zhu, Song-Chun; Wu, Ying Nian (2017 年 7 月)。「空間的時間的生成 ConvNet による動的パターンの合成」。2017 IEEEコンピューター ビジョンおよびパターン認識会議 (CVPR)。IEEE。pp. 1061–1069。arXiv : 1606.00972。doi : 10.1109 / cvpr.2017.119。ISBN 978-1-5386-0457-1. S2CID 763074。
- ^ Wu, Ying Nian; Xie, Jianwen; Lu, Yang; Zhu, Song-Chun (2018). 「FRAMEモデルのスパースおよびディープ一般化」. Annals of Mathematical Sciences and Applications . 3 (1): 211–254. doi :10.4310/amsa.2018.v3.n1.a7. ISSN 2380-288X.
- ^ Teh, Yee Whye; Welling, Max; Osindero, Simon; Hinton, Geoffrey E. (2003 年 12 月)。「スパース過剰完全表現のエネルギーベース モデル」。JMLR . 4 (12 月): 1235–1260。
- ^ Lecun, Y.; Bottou, L.; Bengio, Y.; Haffner, P. (1998). 「文書認識への勾配ベース学習の適用」. Proceedings of the IEEE . 86 (11): 2278–2324. doi :10.1109/5.726791. ISSN 0018-9219. S2CID 14542261.
- ^ Krizhevsky, Alex; Sutskever, Ilya; Hinton, Geoffrey (2012). 「深層畳み込みニューラルネットワークによる ImageNet 分類」(PDF) . NIPS .
- ^ Xie, Jianwen; Zheng, Zilong; Gao, Ruiqi; Wang, Wenguan; Zhu, Song-Chun; Wu, Ying Nian (2018 年 6 月)。「3D 形状合成および分析のための学習記述子ネットワーク」。2018 IEEE/ CVFコンピューター ビジョンおよびパターン認識会議。IEEE。pp . 8629–8638。arXiv : 1804.00586。Bibcode : 2018arXiv180400586X。doi : 10.1109 / cvpr.2018.00900。ISBN 978-1-5386-6420-9. S2CID 4564025。
- ^ Gao, Ruiqi; Lu, Yang; Zhou, Junpei; Zhu, Song-Chun; Wu, Ying Nian (2018 年 6 月)。「マルチグリッド モデリングとサンプリングによる生成的 ConvNet の学習」。2018 IEEE / CVF コンピューター ビジョンおよびパターン認識会議。IEEE。pp. 9155–9164。arXiv : 1709.08868。doi : 10.1109 / cvpr.2018.00954。ISBN 978-1-5386-6420-9. S2CID 4566195。
- ^ ab Nijkamp, Zhu, Song-Chun Wu, Ying Nian, Erik; Hill, Mitch; Zhu, Song-Chun; Wu, Ying Nian (2019).エネルギーベースモデルに向けた非収束非持続短期MCMCの学習について。NeurIPS。OCLC 1106340764 。
{{cite book}}: CS1 maint: location missing publisher (link) CS1 maint: multiple names: authors list (link) - ^ Cai, Xu; Wu, Yang; Li, Guanbin; Chen, Ziliang ; Lin, Liang ( 2019-07-17 ) . 「FRAME再考:粒子進化 に基づく解釈の視点」。AAAI人工知能会議議事録。33 :3256–3263。arXiv :1812.01186。doi:10.1609/aaai.v33i01.33013256。ISSN 2374-3468。
- ^ Xie, Jianwen; Lu, Yang; Gao, Ruiqi; Zhu, Song-Chun; Wu, Ying Nian (2020-01-01). 「記述子ネットワークとジェネレーターネットワークの協調トレーニング」. IEEE Transactions on Pattern Analysis and Machine Intelligence . 42 (1): 27–45. arXiv : 1609.09408 . doi :10.1109/tpami.2018.2879081. ISSN 0162-8828. PMID 30387724. S2CID 7759006.
- ^ Xie, Jianwen; Lu, Yang; Gao, Ruiqi; Gao, Song-Chun (2018). 「MCMC 指導によるエネルギーベースモデルと潜在変数モデルの協調学習」。第32回 AAAI 人工知能会議。32。doi : 10.1609 / aaai.v32i1.11834。S2CID 9212174 。
- ^ Han, Tian; Nijkamp, Erik; Fang, Xiaolin; Hill, Mitch; Zhu, Song-Chun; Wu, Ying Nian (2019 年 6 月)。「ジェネレーター モデル、エネルギーベース モデル、推論モデルの共同トレーニングのための発散三角形」。2019 IEEE/CVF コンピューター ビジョンおよびパターン認識会議 (CVPR) 。IEEE。pp . 8662–8671。doi :10.1109/cvpr.2019.00887。ISBN 978-1-7281-3293-8. S2CID 57189202。
外部リンク
- 「CIAR NCAPサマースクール」www.cs.toronto.edu . 2019年12月27日閲覧。
- Dayan, Peter; Hinton, Geoffrey; Neal, Radford; Zemel, Richard S. (1999)、「Helmholtz Machine」、Unsupervised Learning、The MIT Press、doi :10.7551/mitpress/7011.003.0017、ISBN 978-0-262-28803-3
- Hinton, Geoffrey E. (2002 年 8 月)。「対照的発散を最小化することでエキスパートの成果物をトレーニングする」。 ニューラルコンピューティング。14 ( 8): 1771–1800。doi : 10.1162 /089976602760128018。ISSN 0899-7667。PMID 12180402。S2CID 207596505 。
- Salakhutdinov, Ruslan; Hinton, Geoffrey (2009-04-15). 「ディープ ボルツマン マシン」。人工知能と統計: 448–455。
