
ボルツマンマシン(外部場付きシェリントン・カークパトリックモデルまたは確率的イジングモデルとも呼ばれる)は、ルートヴィヒ・ボルツマンにちなんで名付けられた、外部場を持つスピングラスモデル、すなわちシェリントン・カークパトリックモデル[ 1 ]であり、確率的イジングモデルである。これは認知科学の文脈で応用される統計物理学の手法である[ 2 ]。また、マルコフ確率場にも分類される[ 3 ]。
ボルツマンマシンは、その学習アルゴリズムの局所性とヘッブ的性質(ヘッブの法則によって学習される)と、その並列性とダイナミクスが単純な物理プロセスに似ていることから、理論的に興味深い。制約のない接続性を持つボルツマンマシンは、機械学習や推論の実際的な問題に役立つことが証明されていないが、接続性が適切に制約されていれば、学習は実際的な問題に役立つほど効率的になる可能性がある。[ 4 ]
これらは、統計力学におけるボルツマン分布にちなんで名付けられており、その分布はサンプリング関数に使用されています。これらは、認知科学コミュニティ、特に機械学習において、ジェフリー・ヒントン、テリー・セジノウスキー、ヤン・ルカンによって広く普及・促進されました。 [ 2 ]これは、スピングラスのハミルトニアンをエネルギーとして学習タスクを定義する出発点として使用するため、 「エネルギーベースモデル」(EBM)の一部としてです。[ 5 ]

ボルツマンマシンは、シェリントン・カークパトリックモデルと同様に、ネットワーク全体に定義された総「エネルギー」(ハミルトニアン)を持つユニットのネットワークです。そのユニットはバイナリ結果を生成します。ボルツマンマシンの重みは確率的です。グローバルエネルギーボルツマンマシンにおける形式は、ホップフィールドネットワークおよびイジングモデルにおける形式と同一である。
どこ:
多くの場合、重さ対称行列として表される対角線上にゼロが並ぶ。
単一ユニットから生じるグローバルエネルギーの差0(オフ)対1(オン)に等しい、と表記される重みの対称行列を仮定すると、次の式で与えられる。
これは、2つの状態のエネルギーの差として表すことができる。
各状態のエネルギーをボルツマン因子(ボルツマン分布 の性質で、ある状態のエネルギーはその状態の負の対数確率に比例する)に従って相対確率に置き換えると、次の式が得られます。
どこはボルツマン定数であり、温度という人工的な概念に吸収される。ユニットがオンまたはオフになる確率の合計は簡略化を可能にする:
したがって、第 1 単位は次のように与えられる。
スカラーこれはシステムの温度と呼ばれます。この関係は、ボルツマンマシンの変形における確率表現に見られるロジスティック関数の源となっています。
ネットワークは、ユニットを繰り返し選択してその状態をリセットすることで動作します。ある温度で十分に長時間動作させた後、ネットワークのグローバル状態の確率は、ボルツマン分布に従って、そのグローバル状態のエネルギーのみに依存し、プロセスが開始された初期状態には依存しなくなります。これは、グローバル状態の対数確率がそのエネルギーに対して線形になることを意味します。この関係は、マシンが「熱平衡状態」にあるとき、つまりグローバル状態の確率分布が収束したときに成り立ちます。高温からネットワークを実行すると、温度は徐々に低下し、より低い温度で熱平衡状態に達します。その後、エネルギーレベルがグローバル最小値の周りで変動する分布に収束する可能性があります。このプロセスはシミュレーテッドアニーリングと呼ばれます。
ネットワークがこれらの状態に対する外部分布に従ってグローバル状態に収束するように訓練するには、確率が最も高いグローバル状態が最も低いエネルギーを持つように重みを設定する必要があります。これは訓練によって行われます。
ボルツマンマシンのユニットは、「可視」ユニット V と「隠れ」ユニット H に分けられます。可視ユニットは、「環境」から情報を受け取るユニットです。つまり、トレーニングセットは、セット V 上のバイナリベクトルのセットです。トレーニングセット上の分布は次のように表されます。。
ボルツマンマシンが熱平衡に達すると、グローバル状態に関する分布は収束する。隠れユニットに関して周辺化した後、この分布を次のように表す。。
私たちの目標は「実際の」分布を近似することです使用機械によって生成された。2 つの分布の類似性は、カルバック・ライブラー情報量によって測定される。:
ここで、和はすべての可能な状態にわたるものである。。は重みの関数であり、重みは状態のエネルギーを決定し、エネルギーはボルツマン分布が約束した通り。勾配降下アルゴリズム与えられた重量を変更する、偏微分を差し引くことによって重量に関して。
ボルツマンマシンのトレーニングには、2 つの交互のフェーズが含まれます。1 つは「正」フェーズで、可視ユニットの状態はトレーニングセットからサンプリングされた特定のバイナリ状態ベクトルにクランプされます() もう 1 つは「負の」フェーズで、ネットワークは自由に動作することが許されます。つまり、入力ノードの状態のみが外部データによって決定され、出力ノードは自由に動くことができます。与えられた重みに対する勾配は、は、次の式で与えられます。[ 2 ]
どこ:
この結果は、熱平衡状態では確率が世界のどの国家においてもネットワークが自由走行している場合、ボルツマン分布によって与えられます。
この学習ルールは、重みを変更するために必要な情報が「局所的」情報のみであるため、生物学的に妥当である。つまり、接続(生物学的にはシナプス)は、接続先の2つのニューロン以外の情報を必要としない。これは、バックプロパゲーションなど、他の多くのニューラルネットワーク学習アルゴリズムにおける接続に必要な情報よりも、生物学的に現実的である。
ボルツマンマシンの学習では、機械学習で広く用いられているEMアルゴリズムは使用されません。KLダイバージェンスを最小化することは、データの対数尤度を最大化することと同等です。したがって、学習手順では、観測データの対数尤度に対して勾配上昇法を実行します。これは、EMアルゴリズムとは対照的です。EMアルゴリズムでは、Mステップ中にデータ全体の尤度の期待値を最大化する前に、隠れノードの事後分布を計算する必要があります。
バイアスの学習方法は似ていますが、単一ノードの活動のみを使用します。
理論的には、ボルツマンマシンは非常に汎用的な計算手段である。例えば、写真で学習させた場合、このマシンは理論的に写真の分布をモデル化し、そのモデルを用いて、例えば、部分的な写真を完成させることができる。
残念ながら、ボルツマンマシンには深刻な実用上の問題があります。それは、マシンがごくわずかなサイズを超えると、正しく学習できなくなるように見えることです。これは、特に以下の重要な効果によるものです。

一般的なボルツマンマシンでは学習は非現実的ですが、隠れユニットと可視ユニット間の層内接続を禁止する制限付きボルツマンマシン(RBM)では、非常に効率的に学習できます。つまり、可視ユニット間および隠れユニット間の接続はありません。1つのRBMを学習した後、その隠れユニットの活動を、より上位のRBMを学習するためのデータとして扱うことができます。このRBMを積み重ねる方法により、多くの層の隠れユニットを効率的に学習することが可能になり、最も一般的な深層学習戦略の1つとなっています。新しい層が追加されるたびに、生成モデルは改善されます。
制限付きボルツマンマシンの拡張により、バイナリデータではなく実数値データを使用できるようになりました。[ 6 ]
RBMの実用的な応用例の一つは音声認識である。[ 7 ]
ディープボルツマンマシン(DBM)は、複数の隠れた確率変数層を持つバイナリペアワイズマルコフ確率場(無向確率的グラフィカルモデル)の一種です。これは、対称的に結合された確率的バイナリユニットのネットワークです。これは、一連の可視ユニットから構成されます。そして隠れたユニットの層同じ層のユニットをリンクする接続はありません(RBMと同様)。DBM の場合、ベクトルνに割り当てられる確率は
どこは隠れユニットの集合であり、は、可視層と隠蔽層、および隠蔽層同士の相互作用を表すモデルパラメータです。[ 8 ] DBNでは、上位2層のみが制限付きボルツマンマシン(無向グラフィカルモデル)を形成し、下位層は有向生成モデルを形成します。DBMでは、すべての層が対称で無向です。
DBNと同様に、DBMは、限られたラベル付きデータを使用して、大量のラベルなし感覚入力データを使用して構築された表現を微調整することで、物体認識や音声認識などのタスクにおける入力の複雑で抽象的な内部表現を学習できます。ただし、DBNや深層畳み込みニューラルネットワークとは異なり、推論とトレーニングの手順をボトムアップとトップダウンの両方向で実行するため、DBMは入力構造の表現をより良く明らかにすることができます。[ 9 ] [ 10 ] [ 11 ]
しかし、DBM の処理速度が遅いため、その性能と機能が制限されます。DBM では厳密な最尤学習が不可能であるため、近似的な最尤学習しかできません。別の選択肢として、平均場推論を使用してデータ依存の期待値を推定し、マルコフ連鎖モンテカルロ(MCMC) を使用して期待される十分統計量を近似する方法があります。[ 8 ]この近似推論は、各テスト入力に対して実行する必要がありますが、DBM の単一のボトムアップパスよりも 25 ~ 50 倍遅くなります。このため、大規模なデータセットでは共同最適化が非現実的になり、特徴表現などのタスクに DBM を使用することが制限されます。
Gaussian RBMのように実数値入力による深層学習の必要性から、連続数値入力をバイナリ潜在変数でモデル化する spike-and-slab RBM ( ss RBM ) が開発されました。[ 12 ]基本的なRBMとそのバリアントと同様に、spike-and-slab RBM は二部グラフですが、G RBMと同様に、可視ユニット (入力) は実数値です。違いは隠れ層にあり、各隠れユニットはバイナリの spike 変数と実数値の slab 変数を持ちます。spike はゼロでの離散確率質量であり、slab は連続領域上の密度です。 [ 13 ]これらの混合が事前分布を形成します。[ 14 ]
ss RBMの拡張版であるμ-ss RBMは、エネルギー関数に付加的な項を用いることで、より高度なモデリング機能を提供します。これらの項の一つにより、観測値が与えられた場合にスラブ変数を周辺化することで、スパイク変数の条件付き分布をモデルが形成できるようになります。
より一般的な数学的枠組みでは、ボルツマン分布はギブス測度としても知られています。統計学や機械学習においては、対数線形モデルと呼ばれます。深層学習においては、ボルツマン分布はボルツマンマシンなどの確率的ニューラルネットワークの標本分布に用いられます。
ボルツマンマシンは、デイビッド・シェリントンとスコット・カークパトリックによるシェリントン・カークパトリック・スピングラスモデルに基づいている。[ 15 ]ジョン・ホップフィールドによる先駆的な論文(1982年)では、統計力学の手法、主に最近開発された(1970年代)スピングラス理論を応用して、連想記憶(後に「ホップフィールドネットワーク」と呼ばれる)を研究した。[ 16 ]
認知科学におけるこのようなエネルギーベースのモデルの応用に関する最初の貢献は、ジェフリー・ヒントンとテリー・セジノウスキーの論文に現れた。[ 17 ] [ 18 ] [ 19 ] 1995年のインタビューで、ヒントンは、1983年の2月か3月にホップフィールドネットワークにおけるシミュレーテッドアニーリングについて講演する予定だったので、講演のために学習アルゴリズムを設計する必要があり、その結果ボルツマン機械学習アルゴリズムが生まれたと述べている。[ 20 ]
アニーリングギブスサンプリングを用いたイジングモデルを適用するというアイデアは、ダグラス・ホフスタッターのCopycatプロジェクト(1984年)で使用された。[ 21 ] [ 22 ]
ボルツマンマシンの定式化において統計力学との明確な類推が示されたことで、物理学から借用した用語(例えば「エネルギー」)が用いられるようになり、それがこの分野の標準となった。この用語が広く採用された背景には、統計力学から様々な概念や手法が取り入れられるようになったという事実があるかもしれない。推論にシミュレーテッドアニーリングを用いるという様々な提案は、明らかに独立して行われたものであった。
同様の考え方(エネルギー関数の符号が反転している)は、ポール・スモレンスキーの「ハーモニー理論」にも見られる。[ 23 ]イジングモデルはマルコフランダムフィールドに一般化することができ、言語学、ロボット工学、コンピュータビジョン、人工知能で広く応用されている。
2024年、ホップフィールドとヒントンは、ボルツマンマシンなどの機械学習への基礎的な貢献によりノーベル物理学賞を受賞しました。 [ 24 ]