不確実な量の事前確率分布(単に事前確率、事前分布、または事前と呼ばれることが多い)とは、証拠を考慮する前の、その量の想定される確率分布のことです。例えば、事前分布は、将来の選挙で特定の政治家に投票する有権者の相対的な割合を表す確率分布である可能性があります。この未知の量は、観測可能な変数ではなく、モデルのパラメータまたは潜在変数である場合があります。
ベイズ統計学において、ベイズの定理は、新しい情報に基づいて事前分布を更新し、事後確率分布(新しいデータが与えられた場合の不確実な量の条件付き分布)を得る方法を規定しています。従来、事前分布の選択は、与えられた尤度関数の共役族に限定されることが多かったため、同じ族の扱いやすい事後分布が得られました。しかし、マルコフ連鎖モンテカルロ法が広く普及したことで、この点は以前ほど問題ではなくなりました。
事前分布を構築する方法は数多くあります。[ 1 ]場合によっては、過去の実験などの過去の情報から事前分布を決定することができます。また、経験豊富な専門家の純粋に主観的な評価から事前分布を引き出すこともできます。 [ 2 ] [ 3 ] [ 4 ]情報が利用できない場合は、無関心の原理によって正当化される無情報事前分布を採用することができます。[ 5 ] [ 6 ]現代のアプリケーションでは、事前分布は正則化や特徴選択などの機械的特性に基づいて選択されることもよくあります。[ 7 ] [ 8 ] [ 9 ]
モデルパラメータの事前分布は、多くの場合、モデルパラメータ自体に依存します。これらのハイパーパラメータに関する不確実性は、ハイパー事前確率分布として表現できます。たとえば、ベルヌーイ分布のパラメータpの分布をモデル化するためにベータ分布を使用する場合、次のようになります。
原則として、事前分布は多くの条件付き分布レベルに分解することができ、これは階層的事前分布と呼ばれる。[ 10 ]
情報量の多い事前分布は、変数に関する具体的で明確な情報を表します。例えば、明日の正午の気温の事前分布が挙げられます。妥当なアプローチとしては、期待値が今日の正午の気温に等しく、分散が日々の気温の変動に等しい正規分布、あるいはその日の気温の分布を事前分布として用いることが考えられます。
この例は、多くの事前分布に共通する特性を持っています。すなわち、ある問題(今日の気温)の事後分布が、別の問題(明日の気温)の事前分布となるということです。既に考慮されている既存の証拠は事前分布の一部であり、証拠が増えるにつれて、事後分布は、元の仮定が証拠が示唆する可能性を認めている限り、元の仮定よりも証拠によって大きく左右されるようになります。「事前分布」と「事後分布」という用語は、一般的に特定のデータまたは観測値に関連して用いられます。
強い事前分布とは、新たな情報を考慮に入れた後、現在の仮定、理論、概念、またはアイデアの基礎となる、先行する仮定、理論、概念、またはアイデアのことです。強い事前分布は、分析対象データに含まれる情報よりも、事前分布に含まれる情報が圧倒的に多い、情報量の多い事前分布の一種です。ベイズ分析では、事前分布に含まれる情報とデータから抽出された情報を組み合わせて事後分布を生成します。強い事前分布の場合、事後分布は事前分布とほとんど変わりません。
弱情報事前分布は、変数に関する部分的な情報を表現し、結果を過度に制約したり極端な推定値を防いだりすることなく、既存の知識と一致する解へと分析を導きます。例えば、明日の正午のセントルイスの気温の事前分布を設定する場合、平均50度華氏、標準偏差40度の正規分布を使用すると、気温は(10度、90度)の範囲に非常に緩やかに制約され、-30度以下または130度を超える可能性はごくわずかになります。弱情報事前分布の目的は、正則化、つまり推論を妥当な範囲に収めることです。
情報量の少ない、平坦な、または拡散的な事前分布は、変数に関する漠然とした、または一般的な情報を表します。[ 5 ] 「情報量の少ない事前分布」という用語は、やや誤称です。そのような事前分布は、あまり情報量の少ない事前分布、または客観的な事前分布、つまり主観的に引き出されたものではない事前分布とも呼ばれます。
無情報事前分布は、「変数が正である」または「変数が何らかの閾値より小さい」といった「客観的な」情報を表現できます。無情報事前分布を決定するための最も単純で古い規則は、すべての可能性に等しい確率を割り当てる無差別原理です。パラメータ推定問題では、通常、無情報事前分布を使用しても、従来の統計分析とそれほど大きな違いはありません。これは、尤度関数が無情報事前分布よりも多くの情報を提供することが多いためです。
事前確率、つまり、ある意味で不確実性の状態の性質によって論理的に要求される確率分布を見つけようとする試みがいくつか行われてきました。これらは哲学的な論争の対象となっており、ベイズ主義者は大きく2つの学派に分かれています。1つは、そのような事前確率が多くの有用な状況に存在すると考える「客観的ベイズ主義者」、もう1つは、実際には事前確率は通常、厳密に正当化できない主観的な意見の判断を表すと考える「主観的ベイズ主義者」です(Williamson 2010)。客観的ベイズ主義に対する最も強力な議論は、おそらくエドウィン・T・ジェインズによって、主に対称性の結果と最大エントロピーの原理に基づいて提示されました。
ジェーンズ(2003)による事前分布の例として、ボールが3つのカップA、B、Cのいずれかの下に隠されていることはわかっているが、その位置に関する他の情報は一切ない状況を考えてみましょう。この場合、p ( A ) = p ( B ) = p ( C ) = 1/3 という一様事前分布が、直感的に唯一妥当な選択肢のように思えます。より厳密に言えば、カップのラベル(「A」、「B」、「C」)を入れ替えても問題は変わらないことがわかります。したがって、ラベルの順列によってボールがどのカップの下にあるかという予測が変わるような事前分布を選ぶのは不自然です。この不変性を保つのは一様事前分布だけです。この不変性の原理を受け入れるならば、一様事前分布がこの知識状態を表す論理的に正しい事前分布であることがわかります。この事前確率は、特定の知識状態を表す正しい選択という意味では「客観的」ですが、観察者に依存しない世界の特徴という意味では客観的ではありません。実際には、ボールは特定のカップの下に存在し、この状況で確率について語ることは、システムに関する限られた知識を持つ観察者が存在する場合にのみ意味があります。[ 11 ]
より議論の余地のある例として、ジェインズは、パラメータの変更に対する事前分布の不変性に基づく議論を発表し、確率に関する完全な不確実性を表す事前分布は、ハルデーン事前分布p − 1 (1 − p ) − 1であるべきだと示唆した。[ 12 ] ジェインズが挙げている例は、実験室で化学物質を見つけ、それが繰り返し実験で水に溶けるかどうかを問うというものである。ハルデーン事前分布[ 13 ]は、圧倒的に最も大きな重みを そしてこれは、サンプルが毎回溶解するか、まったく溶解しないかのどちらかであり、その確率は等しいことを示しています。ただし、ある実験で化学物質のサンプルが溶解し、別の実験で溶解しないことが観察された場合、この事前分布は区間 [0, 1] の一様分布に更新されます。これは、上記の事前分布を使用して、溶解の観測が 1 つと溶解しない観測が 1 つからなるデータセットに ベイズの定理を適用することによって得られます。ハルデーン事前分布は不適切な事前分布です (つまり、質量が無限大です)。ハロルド・ジェフリーズは、ベルヌーイ確率変数に対するジェフリーズ事前分布p − 1/2 (1 − p ) − 1/2のように、無情報事前分布を設計するための体系的な方法を考案しました。
パラメータ空間X が、ベイズ的知識の状態を不変に保つ自然な群構造を持つ場合、ハール測度に比例する事前分布を構築できます。 [ 12 ]これは、上記の例の 3 つのカップに対する一様事前分布を正当化するために使用された不変性原理の一般化と見なすことができます。たとえば、物理学では、座標系の原点の選択に関係なく、実験が同じ結果をもたらすことが期待できます。これは、X上の並進群の群構造を誘導し、それが定数の不適切な事前分布として事前確率を決定します。同様に、いくつかの測定値は、任意の尺度の選択に対して自然に不変です (たとえば、センチメートルまたはインチのどちらを使用しても、物理的な結果は等しくなります)。このような場合、尺度群が自然な群構造であり、X上の対応する事前分布は 1/ xに比例します。左不変ハール測度を使用するか右不変ハール測度を使用するかが重要な場合があります。たとえば、アフィン群上の左不変ハール測度と右不変ハール測度は等しくありません。 Berger(1985、p.413 )は、右不変Haar測度が正しい選択であると主張している。
エドウィン・T・ジェインズが提唱したもう一つのアイデアは、最大エントロピー原理(MAXENT)を用いることです。その動機は、確率分布のシャノンエントロピーが、その分布に含まれる情報量を測定するという点にあります。エントロピーが大きいほど、分布から得られる情報は少なくなります。したがって、X上の適切な確率分布の集合に対してエントロピーを最大化することで、集合を定義する制約と矛盾しない情報量が最も少ないという意味で、情報量が最も少ない分布を見つけることができます。例えば、離散空間における最大エントロピー事前分布は、確率が 1 に正規化されているという条件の下では、各状態に等しい確率を割り当てる事前分布です。また、連続の場合、密度が平均ゼロ、分散が 1 に正規化されているという条件の下では、最大エントロピー事前分布は標準正規分布です。最小交差エントロピー原理は、最大エントロピーの意味で適切な制約を用いて任意の事前分布を「更新」する場合に、MAXENT を一般化したものです。
関連するアイデアである参照事前分布は、 José-Miguel Bernardoによって導入されました。ここでは、事後分布と事前分布の期待されるカルバック・ライブラー情報量を最大化するという考え方が用いられます。これは、事前密度がp ( x ) の場合にXに関する期待される事後情報を最大化します。したがって、ある意味で、p ( x ) は X に関する「最も情報量の少ない」事前分布と言えます。参照事前分布は漸近極限で定義されます。つまり、データ点の数が無限大に近づくにつれて得られる事前分布の極限を考えます。この場合、事前分布と事後分布の間の KL 情報量は次のように与えられます。
ここ、あるパラメータの十分統計量である内側の積分は、事後分布間のKLダイバージェンスである。そして以前分布、そして結果はすべての値に対する加重平均です。対数を2つの部分に分け、2番目の部分の積分の順序を逆にして、依存しない収量
2番目の部分の内側の積分は、結合密度のこれは周辺分布ですということで、
ここで、確率分布の場合、確率質量関数または密度関数の対数の負の期待値であるエントロピーの概念を使用します。 これを最後の式に代入すると、
言い換えれば、KLは負の期待値である。エントロピーの条件付き限界(つまり無条件)エントロピー標本サイズが無限大に近づく極限の場合、ベルンシュタイン・フォン・ミーゼスの定理によれば、分布は特定の観測値に基づいては、真の値におけるフィッシャー情報の逆数に等しい分散を持つ正規分布です。正規密度関数のエントロピーは、どこは分布の分散です。したがって、この場合どこは任意に大きなサンプルサイズ(フィッシャー情報が比例する)であり、は「真の」値です。これはこれは積分の外に出すことができ、この積分は確率空間上の積分なので、1に等しくなります。したがって、KLの漸近形は次のように書くことができます。 どこは(漸近的に大きい)サンプルサイズに比例します。 の値はわかりません。実際、この考え方は、パラメータの「真の」値を事前分布と事後分布に置き換えるベイズ推論の哲学に反しています。そのため、それを置き換えることでそして、正規エントロピーの期待値を取ると、それは、そして、これにより、対数を組み合わせることができ、
これは準KLダイバージェンスです(「準」とは、フィッシャー情報の平方根が不適切な分布の核となる可能性があるという意味です)。マイナス符号のため、最初に求めたKLダイバージェンスを最大化するには、これを最小化する必要があります。最後の式の最小値は、対数引数内の2つの分布(不適切な分布であるか否かを問わず)が発散しないときに発生します。これは、事前分布が尤度関数のフィッシャー情報の平方根に比例する場合に発生します。したがって、単一パラメータの場合、ジェフリーズの事前分布は、ジェフリーズとは全く異なる理論的根拠に基づいているにもかかわらず、参照事前分布とジェフリーズ事前分布は同一になります。
参照事前分布は、多変量問題においてしばしば選択される客観的な事前分布である。なぜなら、他のルール(例えば、ジェフリーズのルール)では、問題のある挙動を示す事前分布が得られる可能性があるからである。
客観的な事前分布は、情報理論や符号化理論(例えば、最小記述長を参照)や頻度統計学(いわゆる確率マッチング事前分布)などの他の原理から導出することもできます。[ 14 ]このような方法は、ソロモノフの帰納的推論理論で使用されています。客観的な事前分布の構築は、最近バイオインフォマティクス、特にサンプルサイズが限られており、膨大な量の事前知識が利用可能な癌システム生物学における推論に導入されました。これらの方法では、KLダイバージェンスや二値教師あり学習問題[ 15 ]および混合モデル問題[ 16 ]の対数尤度関数などの情報理論に基づく基準が使用されます。
情報のない事前分布に関連する哲学的問題は、適切な尺度、つまり測定尺度の選択に関連しています。たとえば、未知のランナーの走行速度の事前分布を求めたいとします。その速度の事前分布として正規分布を指定することもできますが、代わりに、100メートルを走破するのにかかる時間の正規分布を事前分布として指定することもできます。この時間は、最初の事前分布の逆数に比例します。これらは非常に異なる事前分布ですが、どちらが好ましいかは明らかではありません。ジェインズの変換群法は、いくつかの状況でこの疑問に答えることができます。[ 17 ]
同様に、0 から 1 の間の未知の割合を推定するように求められた場合、すべての割合が等しく起こりうると言い、一様事前分布を使用するかもしれません。あるいは、割合のすべての桁が等しく起こりうると言い、対数事前分布は、比率の対数に対する一様事前分布です。ジェフリーズ事前分布は、どの尺度を使用しても同じ信念を表す事前分布を計算することで、この問題を解決しようとします。未知の比率pp − 1/2(1−p) − 1/2であり、ジェインズの推奨とは異なります。
アルゴリズム的確率の概念に基づく事前確率は、非常に一般的な状況における帰納的推論の基礎として用いられる。
情報のない事前分布に関連する実際的な問題には、事後分布が適切であるという要件が含まれます。連続的で境界のない変数に対する通常の情報のない事前分布は不適切です。事後分布が適切であれば、これは問題になりません。もう 1 つの重要な問題は、情報のない事前分布を日常的に、つまり多くの異なるデータセットで使用する場合、それが良好な頻度論的特性を持つ必要があるということです。通常、ベイズ主義者はこのような問題に関心を持ちませんが、この状況では重要になる可能性があります。たとえば、事後分布に基づく決定ルールは、採用された損失関数の下で許容可能である必要があります。許容性を確認するのは多くの場合困難ですが、いくつかの結果は知られています (たとえば、Berger と Strawderman 1996)。この問題は、階層ベイズ モデルで特に深刻です。通常の事前分布 (たとえば、Jeffreys の事前分布) は、階層の上位レベルで使用されると、非常に不許容な決定ルールを与える可能性があります。
イベント相互に排他的かつ網羅的である。ベイズの定理が次のように書かれている場合 そうなると、すべての事前確率P ( A i ) とP ( A j ) に所定の定数を掛けても、同じ結果が得られることは明らかです。連続確率変数についても同様です。分母の総和が収束する場合、事前値が収束しなくても事後確率は依然として 1 に合計 (または積分) されるため、事前値は正しい比率で指定するだけでよい場合があります。この考え方をさらに進めると、多くの場合、事後確率の妥当な答えを得るために、事前値の合計または積分が有限である必要さえありません。このような場合、事前値は不適切な事前値と呼ばれます。ただし、事前値が不適切な場合、事後分布は適切な分布である必要はありません。[ 18 ]これは、事象BがすべてのA jと独立している場合から明らかです。
統計学者は、不適切な事前分布を無情報事前分布として使用することがあります。[ 19 ] 例えば、確率変数の平均と分散の事前分布が必要な場合、p ( m , v ) ~ 1/ v ( v > 0 の場合) と仮定することがあります。これは、平均の値はどの値でも「等しく起こりやすい」こと、そして正の分散の値は値に反比例して「起こりにくい」ことを示唆します。多くの著者 (Lindley、1973年; De Groot、1937年; Kass と Wasserman、1996年) は、これらの事前分布は確率密度ではないため、過剰に解釈する危険性について警告しています。これらの事前分布が持つ唯一の関連性は、対応する事後分布にあり、事後分布がすべての観測値に対して適切に定義されている場合に限ります。( Haldane 事前分布は典型的な反例です。)
対照的に、尤度関数は積分する必要がなく、一様に1となる尤度関数はデータの不在に対応します(データがない場合、すべてのモデルが等しく尤度が高い)。ベイズの定理は事前確率に尤度を乗じますが、空の積は定数尤度1に相当します。ただし、事前確率分布から始めなければ、事後確率分布は得られず、したがって積分したり、期待値や損失を計算したりすることはできません。詳細は「尤度関数 § 非積分性」を参照してください。
不適切な事前分布の例としては、以下のようなものがあります。
これらの関数は一様分布として解釈され、データがない場合の尤度関数としても解釈できますが、適切な事前分布ではありません。
ベイズ統計学では事前確率は不確実なパラメータに関する初期信念を表すために使われるが、統計力学では事前確率はシステムの初期状態を記述するために使われる。[ 20 ]古典的なバージョンは、基本事象の数(例えば、サイコロを投げる回数)と全事象の数の比として定義され、これらは純粋に演繹的に、つまり実験なしで考慮される。サイコロの場合、投げずにテーブル上でサイコロを見ると、各基本事象は同じ確率を持つと演繹的に推論される。したがって、(完全な)サイコロを仮想的に投げた場合、または単に面の数を数えることによって各結果の確率は 1/6 である。サイコロの各面は等しい確率で現れる。確率は各基本事象に対して定義された尺度である。サイコロを 20 回投げて、上面に 6 が何回出るか (20 回中) 尋ねると、結果は異なる。この場合、時間が関係してくるため、時間やサイコロを投げる回数によって確率が変わってきます。一方、事前確率は時間とは無関係です。テーブルの上のサイコロを触らずに好きなだけ眺めていても、上面に6が出る確率は1/6だと推測できます。
統計力学、例えば有限体積に閉じ込められた気体の統計力学空間座標も両方ともそして運動量座標個々の気体要素(原子または分子)の数は、これらの座標によって張られる位相空間内で有限である。サイコロの場合と同様に、事前確率は(連続体の場合)位相空間の体積要素に比例する。で割った、そして は、その中の定常波(すなわち状態)の数であり、変数の範囲 そして変数の範囲(ここでは簡略化のため一次元で考える)。一次元(長さ)この数値または統計的重みまたは事前重みは通常の3次元(体積)では対応する数値は次のように計算できます。[ 21 ]この量が量子力学(すなわち波動力学)における状態の数を表すことを理解するために、量子力学ではすべての粒子がシュレーディンガー方程式の解である物質波に関連付けられていることを思い出してください。自由粒子(エネルギー)の場合)体積の箱の中の気体のようなものこのような物質波は明示的に どこは整数です。 値、したがって領域内の状態すると、上記の式であることがわかります。これらの点が覆う領域を考慮すると、さらに、不確定性関係を考慮すると、1次元空間では これらの状態は区別できません(つまり、これらの状態にはラベルが付きません)。重要な結果として、リウヴィルの定理として知られる結果、すなわち、この位相空間体積要素の時間独立性、したがって事前確率の時間独立性があります。この量の時間依存性は、システムのダイナミクスに関する既知の情報を意味し、したがって事前確率ではありません。[ 22 ]したがって、領域 :={\frac {\Delta q\Delta p}{\int \Delta q\Delta p}},\;\;\;\int \Delta q\Delta p=\mathrm {const.} ,} は 時間に関して微分した場合の値です(ハミルトンの方程式の助けを借りて)ゼロになる:時刻における体積は時刻ゼロの時と同じである。これは情報保存の法則とも呼ばれる。
完全な量子論においても、同様の保存則が存在する。この場合、位相空間領域は、射影演算子を用いて表現された状態空間の部分空間に置き換えられる。位相空間における確率の代わりに、確率密度が得られる。 :={\frac {P}{{\text{Tr}}(P)}},\;\;\;N={\text{Tr}}(P)=\mathrm {const.} ,} ただしは部分空間の次元です。この場合の保存則は、S行列のユニタリ性によって表されます。いずれの場合も、考察は閉じた孤立系を前提としています。この閉じた孤立系は、(1)固定エネルギーを持つ系です。(2)固定数の粒子(c) 平衡状態。このシステムの膨大な数の複製を考えると、マイクロカノニカルアンサンブルと呼ばれるものが得られます。量子統計学では、このシステムに対して「孤立系の先験確率が等しいという基本公準」を仮定します。これは、平衡状態にある孤立系は、アクセス可能な各状態を同じ確率で占有することを意味します。したがって、この基本公準により、先験確率をシステムの縮退度、つまり同じエネルギーを持つ異なる状態の数と等しくすることができます。
以下の例は、(a)古典的および(b)量子的文脈における事前確率(または事前重み付け)を示しています。
統計力学では、いわゆる分布関数を導出することが一般的である。さまざまな統計について。フェルミ・ディラック統計とボーズ・アインシュタイン統計の場合、これらの関数はそれぞれ次のようになる。 これらの関数は、(1)動的平衡状態にあるシステム(すなわち、定常的で均一な条件下)と、(2)粒子の総数(そして膨大な数)に対して導出される。(この条件は定数を決定します)(3)総エネルギーつまり、それぞれのエネルギーを持つ粒子導出における重要な側面は、量子統計における粒子と状態の不可分性、すなわち粒子と状態にラベルがないことを考慮に入れることである。電子のようなフェルミオンの場合、パウリの排他原理(状態ごとに粒子は1つだけ、または全く許容されない)に従うため、 したがっては、エネルギー で電子が実際に占有している状態の割合の尺度です。温度一方、事前確率はこれは、利用可能な波動力学的状態の数の尺度である。したがって 以来は均一な条件下(体積要素から流出する粒子と同じ数の粒子が絶えず流入するため、要素内の状況は静的に見える)では一定であり、すなわち時間に依存しない。、 そして時間にも依存しない前述のように、 この方程式を偏微分で表すと、ボルツマン輸送方程式が得られる。上記では電場やその他の場については何も言及していない。したがって、そのような場が存在しない場合は、上記のフェルミ・ディラック分布となる。しかし、そのような場が存在する場合は、次の追加の依存性が生じる。。