確率分布フィッティング、または単に分布フィッティングとは、変動する現象の繰り返し測定に関する一連のデータに確率分布を当てはめることである。分布フィッティングの目的は、ある一定の時間間隔における現象の大きさの発生確率、すなわち発生頻度を予測することである。
確率分布には多くの種類があり(確率分布一覧を参照)、現象や分布の特性に応じて、観測されたデータの頻度によりよく適合する分布もあれば、そうでない分布もあります。適合度の高い分布は、良好な予測につながると考えられます。したがって、分布フィッティングにおいては、データによく適合する分布を選択する必要があります。

適切な分布の選択は、データセットが中心傾向に関して対称性を持つかどうかによって決まります。
対称分布
データが平均値を中心に左右対称に分布し、平均値から離れた値の出現頻度が減少する場合、例えば正規分布、ロジスティック分布、またはスチューデントのt分布を選択することができます。最初の2つは非常によく似ていますが、自由度が1である最後のt分布は「裾が重い」、つまり平均値から離れた値が比較的頻繁に出現します(つまり、尖度が高くなります)。コーシー分布も対称です。
右に歪んだ分布

大きな値が小さな値よりも平均値から離れる傾向がある場合、右に歪んだ分布(つまり、正の歪度)となり、例えば、対数正規分布(つまり、データの対数値が正規分布に従う)、対数ロジスティック分布(つまり、データの対数値がロジスティック分布に従う)、ガンベル分布、指数分布、パレート分布、ワイブル分布、バー分布、またはフレシェ分布を選択できます。最後の4つの分布は左側に境界があります。
左に歪んだ分布
小さい値が大きい値よりも平均値から離れる傾向がある場合、左に歪んだ分布(つまり負の歪度)があり、たとえば、二乗正規分布(つまり、データ値の二乗に正規分布を適用したもの)、[ 1 ]反転(ミラー)ガンベル分布、[ 1 ]ダグム分布(ミラーバー分布)、または左に境界のあるゴンペルツ分布を選択できます。
分布フィッティングには以下の手法が存在する:[ 2 ]

対称分布(正規分布やロジスティック分布など)を、正に歪んだ分布(つまり、右に歪んでおり、平均値が最頻値より大きく、右側の裾が左側の裾より長い分布)に従うデータに適合させるために、データを対数変換するのが一般的です(対数正規分布および対数ロジスティック分布を参照) 。同様の効果は、データの平方根を取ることによっても得られます。
負に歪んだ分布(つまり、左に歪んでいて、平均値が最頻値 より小さく、右側の裾が左側の裾よりも短い)に従うデータに対称分布を当てはめるには、データの二乗値を使用して当てはめを行うことができます。
より一般的には、任意の歪度分布に従うデータに対称分布を当てはめるために、データをp乗することができます。ここで、歪度が正の場合はp < 1、歪度が負の場合はp > 1となります。pの最適値は数値的手法によって求められます。数値的手法は、 pの値の範囲を仮定し、仮定したすべてのpの値に対して分布フィッティング手順を繰り返し適用し、最後に、計算された確率と測定された頻度の偏差の二乗和(カイ二乗)が最小となるpの値を選択することから構成されます。
この一般化により、確率分布の柔軟性が向上し、分布フィッティングにおける適用範囲が拡大する。[ 6 ]
一般化の汎用性により、例えば、ほぼ正規分布に従うデータセットを多数の異なる確率分布に適合させることが可能になり[ 7 ] 、負に歪んだ分布は、二乗正規分布や鏡像ガンベル分布に適合させることができる[ 8 ] 。

歪んだ分布は、累積分布関数(F)の数式において、Fをその補関数F'=1-Fに置き換えることで反転(または鏡像化)することができ、鏡像となる補分布関数(生存関数とも呼ばれる)が得られます。このようにして、右に歪んだ分布は左に歪んだ分布に、左に歪んだ分布は右に歪んだ分布に変換されます。
歪度反転の手法を用いることで、分布フィッティングに利用できる確率分布の数が増え、分布フィッティングの機会が拡大する。
指数分布のような一部の確率分布は、負のデータ値 ( X )をサポートしていません。しかし、負のデータが存在する場合でも、 X をY = X - Xmに置き換えることで、これらの分布を使用できます。ここで、XmはXの最小値です。この置き換えは、 Xm が負であるため、確率分布を正の方向、つまり右方向にシフトすることを意味します。Y の分布フィッティングが完了したら、対応するXの値はX = Y + Xmから求められます。これは、分布を負の方向、つまり左方向にバックシフトすることを意味します。 分布シフトの手法により、適切な確率分布を見つける可能性が高まります。

2つの異なる確率分布を使用するオプションがあり、1つはデータ範囲の下限用、もう1つは上限用で、例えばラプラス分布などです。範囲はブレークポイントで区切られています。このような複合(不連続)確率分布の使用は、研究対象の現象のデータが2つの異なる条件下で取得された場合に適切です。[ 6 ]

適合確率分布に基づく発生予測には不確実性が伴い、それは以下の条件から生じる。

最初のケースと2番目のケースにおける不確実性の推定値は、例えば超過確率Pe(すなわち、事象Xが基準値Xrよりも大きい確率)と非超過確率Pn(すなわち、事象Xが基準値Xr以下である確率、これは累積確率とも呼ばれる)を用いて 、二項確率分布によって得ることができる。この場合、超過するか非超過するかの2つの可能性しかない。この双対性こそが、二項分布が適用可能な理由である。
二項分布を用いると、予測区間を求めることができる。このような区間は、失敗のリスク、すなわち予測された事象が信頼区間外にとどまる確率も推定する。信頼度またはリスク分析には、水文学で行われているように、再現期間T=1/Peを含めることができる。
ベイズアプローチはモデルの適合に使用できます事前分布を持つパラメータについてサンプルがある場合基礎となる分布から独立に抽出されたデータから、いわゆる事後分布を導出することができる。この事後分布は、新しいサンプルの確率質量関数を更新するために使用できます。観察結果を考慮するとすると、
新たに得られた確率質量関数の分散も決定できる。ベイズ確率質量関数の分散は次のように定義できる。
分散のこの式は、(独立に抽出されたサンプルを仮定すると)大幅に簡略化できます。「自己確率質量関数」を次のように定義します。
分散については[ 12 ]が得られる。
分散の式には、サンプルを含む追加の適合が含まれます興味深い。


様々な分布の適合度をランク付けすることで、どの分布が適切で、どの分布が適切でないかを把握することができる。