ピアソンシステムの図。タイプI、III、VI、V、IVの分布をβ1 ( 歪度の二乗)とβ2 ( 従来の尖度)の観点から示している。 ピアソン分布は、 連続 確率分布 の一種である。これは1895年にカール・ピアソン によって初めて発表され、その後、1901年と1916年に生物統計学 に関する一連の論文の中で彼によって拡張された。
歴史 ピアソンシステムは、もともと明らかに歪んだ 観測値をモデル化するために考案されました。当時、理論モデルを観測データの最初の2つのキュムラント またはモーメントに適合させる方法はよく知られていました。任意の 確率分布は、 位置尺度族 を形成するように簡単に拡張できます。病的な ケースを除けば、位置尺度族は、観測された平均 (第1キュムラント)と分散(第2キュムラント)に任意の精度で適合させることができます。しかし、 歪度 (標準化された第3キュムラント)と尖度 (標準化された第4キュムラント)を同様に自由に調整できる確率分布を構築する方法は知られていませんでした。この必要性は、歪度を示す観測データに既知の理論モデルを適合させようとしたときに明らかになりました。ピアソンの例には、通常非対称である生存データが含まれます。
ピアソンは、最初の論文(1895年、360ページ)で、正規分布 (当初はタイプVとして知られていた) に加えて、4種類の分布(IからIVまで番号付け)を特定しました。この分類は、分布が有界区間、半直線、または実数直線全体で サポートさ れているかどうか、また、潜在的に歪んでいるか、必然的に対称であるかによって決まります。2番目の論文(ピアソン1901)では、2つの欠落を修正しました。タイプV分布(当初は単なる正規分布 でしたが、現在は逆ガンマ分布 )を再定義し、タイプVI分布を導入しました。最初の2つの論文を合わせると、ピアソンシステムの5つの主要なタイプ(I、III、IV、V、およびVI)を網羅しています。3番目の論文で、ピアソン(1916)は、さらに特殊なケースとサブタイプ(VIIからXII)を導入しました。
Rhind (1909、pp. 430–432) は、ピアソンシステムのパラメータ空間を視覚化する簡単な方法を考案し、これは後にピアソン (1916、図版 1 および pp. 430ff.、448ff.) によって採用されました。ピアソン型は、一般に β 1 と β 2と呼ばれる 2 つの量によって特徴付けられます。1 つ目は 歪度 の二乗です。β 1 = γ 1 2 ここで γ 1 は歪度、または 3 番目の標準化モーメント です。 2つ目は、伝統的な尖度 、つまり第4標準化モーメントです。β 2 = γ 2 + 3。(現代の処理では、尖度 γ 2 をモーメントではなくキュムラントで定義するため、正規分布の場合は γ 2 = 0、β 2 = 3 となります。ここでは、歴史的な先例に従って β 2を使用します。)図は、特定の具体的な分布(点 (β 1 、β 2 )で識別される)がどのピアソン型に属するかを示しています。
統計学者にとって今日馴染み深い、歪んだ分布や非メソキュルティック 分布の多くは、1890年代初頭にはまだ知られていなかった。現在ベータ分布として知られているものは 、トーマス・ベイズが1763年の 逆確率 に関する著作の中で、ベルヌーイ分布 のパラメータの事後分布 として使用していた。ベータ分布はピアソンのシステムに含まれることで注目を集め、1940年代まではピアソンI型分布として知られていた。[ 1 ] (ピアソンのタイプ II 分布はタイプ I の特殊なケースですが、通常はもはや特別視されません。)ガンマ分布は ピアソンの研究 (Pearson 1893、p. 331; Pearson 1895、pp. 357、360、373–376) に由来し、1930 年代と 1940 年代に現在の名称を得る前はピアソンのタイプ III 分布として知られていました。[ 2 ] ピアソンの 1895 年の論文では、スチューデントの t 分布 を特殊なケースとして含むタイプ IV 分布が導入され、ウィリアム シーリー ゴセットがその後使用する数年前に先行していました。彼の 1901 年の論文では、 逆ガンマ分布 (タイプ V) とベータプライム分布 (タイプ VI)が導入されました。
意味 ピアソン密度 pは、 微分方程式 の有効な解として定義される(ピアソン1902、p.277参照 )。
p ′ ( x ) p ( x ) + A ( x ) B ( x ) = 0 ( 1 ) {\displaystyle {\frac {p'(x)}{p(x)}}+{\frac {A(x)}{B(x)}}=0\qquad (1)} どこ:
A ( x ) = a1 + a2x は 次数 が 最大で 1 の多項式 ですB ( x ) = b 0 + b 1 x + b 2 x 2 ( B ≠ 0) は次数が最大 2 の非ゼロ多項式です。 ( a 2 , b 2 ) ≠ (0, 0) : ( a 2 , b 2 ) = (0, 0) だが( a 1 , b 1 ) ≠ (0, 0) の場合、A とB に任意の有限u ≠ b 0 ⁄ b 1 でx + u を掛けます。( a 2 , b 2 ) = (0, 0) かつ( a 1 , b 1 ) = (0, 0) ( したがってA = 0 )の場合、A とB に、 u ≠ v を満たす任意の有限のu とvを用いた ( x + u )( x + v ) を掛けます。p の定義域 Iは、 B の無限大および/または実数零点 によって境界付けられているが、それらのいずれも含まない開区間 ( x min , x max ) である。すなわち 、 B に実数ゼロがない場合、私 = R {\displaystyle I=\mathbb {R} } 、B に実数ゼロx 0 が 1 つある場合、I = (−∞, x 0 ) またはI = ( x 0 , +∞) 、B に 2 つの実数零点x − < x + がある場合、I = (−∞, x − ) またはI = ( x − , x + ) またはI = ( x + , +∞) となります 。そのため、例えば半正規分布 や切断正規分布は、式 (1) を満たしているにもかかわらず、ピアソン分布ではありません(定義域が上記の基準に合致しないため)。
次元解析 によると、係数a k とb k の 次元は [AX − k ] であり、[A] は任意の次元、[X] はx の次元であるため、 a k のインデックスがシフトします。
分布が少なくとも4次までのモーメントを持ち、平均μ と標準偏差σ を持つ場合、次の式が成り立ちます(ピアソン1916、p.437 、およびカーバー1924、pp.103–104を参照 )。
p ′ ( x ) p ( x ) + 1 σ c 1 + c 2 x − μ σ d 0 + d 1 x − μ σ + d 2 ( x − μ σ ) 2 = 0 ${\displaystyle {\frac {p'(x)}{p(x)}}+{\frac {1}{\sigma }}{\frac {c_{1}+c_{2}{\frac {x-\mu }{\sigma }}}{d_{0}+d_{1}{\frac {x-\mu }{\sigma }}+d_{2}\left({\frac {x-\mu }{\sigma }}\right)^{2}}}=0}$ と
{ c 2 = 2 ( 5 β 2 − 6 β 1 − 9 ) d 0 = 4 β 2 − 3 β 1 c 1 = d 1 = γ 1 ( β 2 + 3 ) d 2 = 2 β 2 − 3 β 1 − 6 {\displaystyle {\begin{cases}{\begin{aligned}c_{2}&=2(5\beta _{2}-6\beta _{1}-9)\\d_{0}&=4\beta _{2}-3\beta _{1}\\c_{1}=d_{1}&=\gamma _{1}(\beta _{2}+3)\\d_{2}&=2\beta _{2}-3\beta _{1}-6\end{aligned}}\end{cases}}} 非ゼロの比例定数を除いて定義される。さらに、係数a k とb k の自然次元は [X 8− k ] となる。
証拠 以下の証明は、Carver 1924、pp. 103–104 に概略が示されている証明の拡張である。特に、[ q ( x ) D ( x ) x r ] J = 0 という事実は、何の根拠もなく仮定されていた。
[...] 周波数関数にt n を掛けると、分布の限界でゼロになる場合 [...]
X を 、式(1)を満たす密度 p を持つ分布とし、平均μ 、標準偏差σ 、歪度γ 1 、有限の尖度β 2 、およびB の零点に関する前述の条件に従う領域I = ( x min 、 x max ) を持つものとする。すなわち、x min (またはx max ) が有限であれば、B ( x min ) = 0 (またはB ( x max ) = 0 ) となる。Z = X − μ / σ を その標準化 とすると、密度q ( x ) = σ p ( σx + μ ) 、領域J = ( x min − μ / σ , x max − μ / σ ) を持ち、その生のモーメントはX の標準化されたモーメント と同じ数値 (ただし次元は 同じではない)を持ちます。∫ J x r q ( x ) dx = α r 、ここでα 0 = 1 、α 1 = 0 、α 2 = 1 、α 3 = γ 1 、およびα 4 = β 2 です。
Z の密度は以下を満たす。
q ′ ( x ) q ( x ) = σ 2 p ′ ( σ x + μ ) σ p ( σ x + μ ) = − σ A ( σ x + μ ) B ( σ x + μ ) {\displaystyle {\frac {q'(x)}{q(x)}}={\frac {\sigma ^{2}p'(\sigma x+\mu )}{\sigma p(\sigma x+\mu )}}=-\sigma {\frac {A(\sigma x+\mu )}{B(\sigma x+\mu )}}} これは式(1) と同じ線形÷二次構造を持つ。したがって、次のように設定できる。
q ′ ( x ) q ( x ) + C ( x ) D ( x ) = 0 ( 1 ′ ) {\displaystyle {\frac {q'(x)}{q(x)}}+{\frac {C(x)}{D(x)}}=0\qquad (1')} C ( x ) = c 1 + c 2 x およびD ( x ) = d 0 + d 1 x + d 2 x 2 である。D ( x )は B ( σx + μ ) に比例するため、領域Jの有限境界 は D の零点である。
逆に、p ( x ) = σ −1 q ( x − μ / σ ) として、次のようになります。
p ′ ( x ) p ( x ) = σ − 2 q ′ ( x − μ σ ) σ − 1 q ( x − μ σ ) = − 1 σ C ( x − μ σ ) D ( x − μ σ ) 、 {\displaystyle {\frac {p'(x)}{p(x)}}={\frac {\sigma ^{-2}q'\left({\frac {x-\mu }{\sigma }}\right)}{\sigma ^{-1}q\left({\frac {x-\mu }{\sigma }}\right)}}=-{\frac {1}{\sigma }}{\frac {C\left({\frac {x-\mu }{\sigma }}\right)}{D\left({\frac {x-\mu }{\sigma }}\right)}},} したがって
p ′ ( x ) p ( x ) + 1 σ c 1 + c 2 x − μ σ d 0 + d 1 x − μ σ + d 2 ( x − μ σ ) 2 = 0 {\displaystyle {\frac {p'(x)}{p(x)}}+{\frac {1}{\sigma }}{\frac {c_{1}+c_{2}{\frac {x-\mu }{\sigma }}}{d_{0}+d_{1}{\frac {x-\mu }{\sigma }}+d_{2}\left({\frac {x-\mu }{\sigma }}\right)^{2}}}=0} 係数c k およびd k は決定する必要がある。
自然数r ∈ ⟦0, 3⟧が与えられた場合、式(1') の各項にq ( x ) D ( x ) x r を掛けると、次の式が得られます。
q ′ ( x ) D ( x ) x r + q ( x ) ( c 1 x r + c 2 x r + 1 ) = 0. {\displaystyle q'(x)D(x)x^{r}+q(x)(c_{1}x^{r}+c_{2}x^{r+1})=0.} 方程式の2つの項をJ について積分し、最初の加数 を部分積分すると 、次の式が得られる。
0 = ∫ J 0 d x = [ q ( x ) D ( x ) x r ] J − ∫ J q ( x ) [ D ( x ) x r ] ′ d x + ∫ J q ( x ) ( c 1 x r + c 2 x r + 1 ) d x = [ q ( x ) D ( x ) x r ] J + ∫ J q ( x ) [ c 1 x r + c 2 x r + 1 − r d 0 x r − 1 − ( r + 1 ) d 1 x r − ( r + 2 ) d 2 x r + 1 ] d x = [ q ( x ) D ( x ) x r ] J + c 1 α r + c 2 α r + 1 − r d 0 α r − 1 − ( r + 1 ) d 1 α r − ( r + 2 ) d 2 α r + 1 。 {\displaystyle {\begin{aligned}0&=\int _{J}0\,dx\\&={\Big [}q(x)D(x)x^{r}{\Big ]}_{J}-\int _{J}q(x)[D(x)x^{r}]'\,dx+\int _{J}q(x)(c_{1}x^{r}+c_{2}x^{r+1})\,dx\\&={\Big [}q(x)D(x)x^{r}{\Big ]}_{J}+\int _{J}q(x)[c_{1}x^{r}+c_{2}x^{r+1}-rd_{0}x^{r-1}-(r+1)d_{1}x^{r}-(r+2)d_{2}x^{r+1}]\,dx\\&={\Big [}q(x)D(x)x^{r}{\Big ]}_{J}+c_{1}\alpha _{r}+c_{2}\alpha _{r+1}-rd_{0}\alpha _{r-1}-(r+1)d_{1}\alpha _{r}-(r+2)d_{2}\alpha _{r+1}.\end{aligned}}} tを領域 J の境界(有限または無限)とする。
t が有限の場合: ∫ J q ( x ) dx = 1 の収束は、 x → t のときq ( x ) = o (( x − t ) −1 ) となることを意味し、したがってlim x → t q ( x ) ( x − t ) = 0 となります 。tは二次多項式 D の零点であるため、 D ( x ) / x − t はt で有限値をとる線形多項式です。t r は有限です。したがって、lim x → t q ( x ) D ( x ) x r = 0 ; t が無限大の場合: X の尖度、したがってZ の尖度の存在は、 x → t のとき、少なくともη ≤ 4に対して x η q ( x ) = o ( x −1 ) が成り立つことを意味し、したがって少なくともn ≤ 5に対して lim x → t q ( x ) x n = 0 と なります。D ( x ) xr は 次数が最大でr +2≤5 の多項式である。したがって、lim x → t q ( x ) D ( x ) x r = 0 。 したがって、常に[ q ( x ) D ( x ) x r ] J = 0 と なります。
rが ⟦0, 3⟧ のすべての値をとると、次の4 つの線形方程式系が 得られます。
{ 0 = c 1 α 0 + c 2 α 1 − 0 d 0 α − 1 − 1 d 1 α 0 − 2 d 2 α 1 = c 1 − d 1 0 = c 1 α 1 + c 2 α 2 − 1 d 0 α 0 − 2 d 1 α 1 − 3 d 2 α 2 = c 2 − d 0 − 3 d 2 0 = c 1 α 2 + c 2 α 3 − 2 d 0 α 1 − 3 d 1 α 2 − 4 d 2 α 3 = c 1 + γ 1 c 2 − 3 d 1 − 4 γ 1 d 2 0 = c 1 α 3 + c 2 α 4 − 3 d 0 α 2 − 4 d 1 α 3 − 5 d 2 α 4 = γ 1 c 1 + β 2 c 2 − 3 d 0 − 4 γ 1 d 1 − 5 β 2 d 2 。 {\displaystyle {\begin{cases}{\begin{alignedat}{3}0&=c_{1}\alpha _{0}+c_{2}\alpha _{1}-0d_{0}\alpha _{-1}-1d_{1}\alpha _{0}-2d_{2}\alpha _{1}&&=c_{1}-d_{1}\\0&=c_{1}\alpha _{1}+c_{2}\alpha _{2}-1d_{0}\alpha _{0}-2d_{1}\alpha _{1}-3d_{2}\alpha _{2}&&=c_{2}-d_{0}-3d_{2}\\0&=c_{1}\alpha _{2}+c_{2}\alpha _{3}-2d_{0}\alpha _{1}-3d_{1}\alpha _{2}-4d_{2}\alpha _{3}&&=c_{1}+\gamma _{1}c_{2}-3d_{1}-4\gamma _{1}d_{2}\\0&=c_{1}\alpha _{3}+c_{2}\alpha _{4}-3d_{0}\alpha _{2}-4d_{1}\alpha _{3}-5d_{2}\alpha _{4}&&=\gamma _{1}c_{1}+\beta _{2}c_{2}-3d_{0}-4\gamma _{1}d_{1}-5\beta _{2}d_{2}.\end{alignedat}}\end{cases}}} したがって、 c 1 = d 1 およびc 2 = d 0 + 3 d 2 となり、
{ 0 = d 1 + γ 1 ( d 0 + 3 d 2 ) − 3 d 1 − 4 γ 1 d 2 = γ 1 d 0 − 2 d 1 − γ 1 d 2 0 = γ 1 d 1 + β 2 ( d 0 + 3 d 2 ) − 3 d 0 − 4 γ 1 d 1 − 5 β 2 d 2 = ( β 2 − 3 ) d 0 − 3 γ 1 d 1 − 2 β 2 d 2 。 {\displaystyle {\begin{cases}{\begin{alignedat}{3}0&=d_{1}+\gamma _{1}(d_{0}+3d_{2})-3d_{1}-4\gamma _{1}d_{2}&&=\gamma _{1}d_{0}-2d_{1}-\gamma _{1}d_{2}\\0&=\gamma _{1}d_{1}+\beta _{2}(d_{0}+3d_{2})-3d_{0}-4\gamma _{1}d_{1}-5\beta _{2}d_{2}&&=(\beta _{2}-3)d_{0}-3\gamma _{1}d_{1}-2\beta _{2}d_{2}.\end{alignedat}}\end{cases}}} するとd 1 = γ 1 ( d 0 − d 2 ) ⁄ 2 となり、
0 = 2 β 2 d 0 − 6 d 0 − 3 γ 1 2 ( d 0 − d 2 ) − 4 β 2 d 2 = ( 2 β 2 − 6 − 3 γ 1 2 ) d 0 + ( 3 γ 1 2 − 4 β 2 ) d 2 = ( 2 β 2 − 3 β 1 − 6 ) d 0 − ( 4 β 2 − 3 β 1 ) d 2 。 {\displaystyle {\begin{aligned}0&=2\beta _{2}d_{0}-6d_{0}-3\gamma _{1}^{2}(d_{0}-d_{2})-4\beta _{2}d_{2}\\&=(2\beta _{2}-6-3\gamma _{1}^{2})d_{0}+(3\gamma _{1}^{2}-4\beta _{2})d_{2}\\&=(2\beta _{2}-3\beta _{1}-6)d_{0}-(4\beta _{2}-3\beta _{1})d_{2}.\end{aligned}}} 係数c k とd k は 、式(1') を変更せずにすべてゼロ以外の定数で乗算できるため、自由に設定できます。
{ d 0 = 4 β 2 − 3 β 1 d 2 = 2 β 2 − 3 β 1 − 6 {\displaystyle {\begin{cases}{\begin{aligned}d_{0}&=4\beta _{2}-3\beta _{1}\\d_{2}&=2\beta _{2}-3\beta _{1}-6\end{aligned}}\end{cases}}} その結果
{ c 2 = d 0 + 3 d 2 = 2 ( 5 β 2 − 6 β 1 − 9 ) c 1 = d 1 = γ 1 ( d 0 − d 2 ) / 2 = γ 1 ( β 2 + 3 ) 。 {\displaystyle {\begin{cases}{\begin{alignedat}{3}c_{2}&=d_{0}+3d_{2}&&=2(5\beta _{2}-6\beta _{1}-9)\\c_{1}=d_{1}&=\gamma _{1}(d_{0}-d_{2})/2&&=\gamma _{1}(\beta _{2}+3).\end{alignedat}}\end{cases}}} γ 1 = α 3 = μ 3 σ −3 およびβ 2 = α 4 = μ 4 σ −4 を拡張し、μ 2 = σ 2 を使用すると、次のようになります。
{ c 2 = 2 ( 5 μ 4 σ − 4 − 6 μ 3 2 σ − 6 − 9 ) = 2 σ − 6 ( 5 μ 4 μ 2 − 6 μ 3 2 − 9 μ 2 3 ) d 0 = 4 μ 4 σ − 4 − 3 μ 3 2 σ − 6 = σ − 6 ( μ 4 μ 2 − 3 μ 3 2 ) c 1 = d 1 = μ 3 σ − 3 ( μ 4 σ − 4 + 3 ) = σ − 7 μ 3 ( μ 4 + 3 μ 2 2 ) d 2 = 2 μ 4 σ − 4 − 3 μ 3 2 σ − 6 − 6 = σ − 6 ( 2 μ 4 μ 2 − 3 μ 3 2 − 6 μ 2 3 ) {\displaystyle {\begin{cases}{\begin{alignedat}{3}c_{2}&=2(5\mu _{4}\sigma ^{-4}-6\mu _{3}^{2}\sigma ^{-6}-9)&&=2\sigma ^{-6}(5\mu _{4}\mu _{2}-6\mu _{3}^{2}-9\mu _{2}^{3})\\d_{0}&=4\mu _{4}\sigma ^{-4}-3\mu _{3}^{2}\sigma ^{-6}&&=\sigma ^{-6}(\mu _{4}\mu _{2}-3\mu _{3}^{2})\\c_{1}=d_{1}&=\mu _{3}\sigma ^{-3}(\mu _{4}\sigma ^{-4}+3)&&=\sigma ^{-7}\mu _{3}(\mu _{4}+3\mu _{2}^{2})\\d_{2}&=2\mu _{4}\sigma ^{-4}-3\mu _{3}^{2}\sigma ^{-6}-6&&=\sigma ^{-6}(2\mu _{4}\mu _{2}-3\mu _{3}^{2}-6\mu _{2}^{3})\end{alignedat}}\end{cases}}} そしてこうして
1 1 + 1 2 x b 0 + b 1 x + b 2 x 2 = 1 σ c 1 + c 2 x − μ σ d 0 + d 1 x − μ σ + d 2 ( x − μ σ ) 2 = σ − 7 μ 3 ( μ 4 + 3 μ 2 2 ) + 2 σ − 7 ( 5 μ 4 μ 2 − 6 μ 3 2 − 9 μ 2 3 ) ( x − μ ) σ − 5 ( μ 4 μ 2 − 3 μ 3 2 ) + σ − 7 μ 3 ( μ 4 + 3 μ 2 2 ) ( x − μ ) + σ − 7 ( 2 μ 4 μ 2 − 3 μ 3 2 − 6 μ 2 3 ) ( x − μ ) 2 = μ 3 ( μ 4 + 3 μ 2 2 ) + 2 ( 5 μ 4 μ 2 − 6 μ 3 2 − 9 μ 2 3 ) ( x − μ ) μ 2 ( μ 4 μ 2 − 3 μ 3 2 ) + μ 3 ( μ 4 + 3 μ 2 2 ) ( x − μ ) + ( 2 μ 4 μ 2 − 3 μ 3 2 − 6 μ 2 3 ) ( x − μ ) 2 。 {\displaystyle {\begin{aligned}{\frac {a_{1}+a_{2}x}{b_{0}+b_{1}x+b_{2}x^{2}}}&={\frac {1}{\sigma }}{\frac {c_{1}+c_{2}{\frac {x-\mu }{\sigma }}}{d_{0}+d_{1}{\frac {x-\mu }{\sigma }}+d_{2}\left({\frac {x-\mu }{\sigma }}\right)^{2}}}\\&={\frac {\sigma ^{-7}\mu _{3}(\mu _{4}+3\mu _{2}^{2})+2\sigma ^{-7}(5\mu _{4}\mu _{2}-6\mu _{3}^{2}-9\mu _{2}^{3})(x-\mu )}{\sigma ^{-5}(\mu _{4}\mu _{2}-3\mu _{3}^{2})+\sigma ^{-7}\mu _{3}(\mu _{4}+3\mu _{2}^{2})(x-\mu )+\sigma ^{-7}(2\mu _{4}\mu _{2}-3\mu _{3}^{2}-6\mu _{2}^{3})(x-\mu )^{2}}}\\&={\frac {\mu _{3}(\mu _{4}+3\mu _{2}^{2})+2(5\mu _{4}\mu _{2}-6\mu _{3}^{2}-9\mu _{2}^{3})(x-\mu )}{\mu _{2}(\mu _{4}\mu _{2}-3\mu _{3}^{2})+\mu _{3}(\mu _{4}+3\mu _{2}^{2})(x-\mu )+(2\mu _{4}\mu _{2}-3\mu _{3}^{2}-6\mu _{2}^{3})(x-\mu )^{2}}}.\end{aligned}}} μ k の 次元は [X k ] であり ( μ の 次元は [X] である)なので、分母に現れるσ sを取り除くと、次元が [X 8− k ] の係数a k とb k が得られることがわかります。
ξ 4 = β 2 + 3 およびξ 6 = 3 β 2 − 3 β 1 − 3 と設定することにより、加算定数を含まない式が得られます。
{ c 2 = 2 ( 2 ξ 6 − ξ 4 ) d 0 = ξ 6 + ξ 4 c 1 = d 1 = γ 1 ξ 4 d 2 = ξ 6 − ξ 4 。 {\displaystyle {\begin{cases}{\begin{aligned}c_{2}&=2(2\xi _{6}-\xi _{4})\\d_{0}&=\xi _{6}+\xi _{4}\\c_{1}=d_{1}&=\gamma _{1}\xi _{4}\\d_{2}&=\xi _{6}-\xi _{4}.\end{aligned}}\end{cases}}} Ordによれば、[ 3 ] ピアソンは、まず正規分布 の密度関数の対数の導関数の公式(線形関数を与える)に基づいて、次に超幾何分布 の確率質量関数の値の漸化式 ( 線形を2乗で割った構造を与える)に基づいて、式(1)の基礎となる形式を考案した。
式(1) において、パラメータa1 とa2 は 、 a2 ≠0 の 場合に定常点 を決定し、したがって、ある条件下では分布の最頻値を決定する。
p ′ ( − 1 1 1 2 ) = 0 {\displaystyle p'\left(-{\frac {a_{1}}{a_{2}}}\right)=0} これは微分方程式から直接導かれる。
変数係数を持つ1階線形微分方程式 に直面しているため、その解は単純明快です。
p ( x ) ∝ exp ( − ∫ 1 2 x + 1 1 b 2 x 2 + b 1 x + b 0 d x ) 。 {\displaystyle p(x)\propto \exp \left(-\int {\frac {a_{2}x+a_{1}}{b_{2}x^{2}+b_{1}x+b_{0}}}\,dx\right).} この解における積分は、被積分関数の特定の特殊な場合を考慮すると、かなり簡略化される。ピアソン(1895年、367ページ)は、二次関数の 判別式 の符号(したがって実根 の数)によって決まる2つの主要な場合を区別した。
B ( x ) = b 2 x 2 + b 1 x + b 0 。 ( 2 ) {\displaystyle B(x)=b_{2}x^{2}+b_{1}x+b_{0}.\qquad (2)}
特定の種類の分布
ケース1、負の判別式
ピアソンIV型分布 二次関数の判別式(2)が負の場合(b 1 2 − 4 b 2 b 0 < 0 {\displaystyle b_{1}^{2}-4b_{2}b_{0}<0} )、それは本当の根源を持たない。次に定義する
y = x + b 1 2 b 2 、 α = 4 b 2 b 0 − b 1 2 2 b 2 。 {\displaystyle {\begin{aligned}y&=x+{\frac {b_{1}}{2b_{2}}},\\[5pt]\alpha &={\frac {\sqrt {4b_{2}b_{0}-b_{1}^{2}}}{2b_{2}}}.\end{aligned}}} α は明確に定義された実数であり、仮定によりα ≠0で あることに注意する。4 b 2 b 0 − b 1 2 > 0 {\displaystyle 4b_{2}b_{0}-b_{1}^{2}>0} したがってb 2 ≠ 0 で ある。これらの置換を適用すると、二次関数 (2) は次のように変換される。
B ( x ) = b 2 ( y 2 + α 2 ) 。 {\displaystyle B(x)=b_{2}(y^{2}+\alpha ^{2}).} この定式化から実根が存在しないことは明らかである。なぜなら、α 2 は必ず正だからである。
ここで、微分方程式(1)の解をy の関数として表します。
p ( y ) ∝ exp ( − 1 b 2 ∫ y − b 1 2 b 2 + 1 y 2 + α 2 d y ) 。 {\displaystyle p(y)\propto \exp \left(-{\frac {1}{b_{2}}}\int {\frac {y-{\frac {b_{1}}{2b_{2}}}+a}{y^{2}+\alpha ^{2}}}\,dy\right).} ピアソン(1895年、362ページ )はこれを「三角関数の場合」と呼んだ。なぜなら、積分は
∫ y − 2 b 2 1 − b 1 2 b 2 y 2 + α 2 d y = 1 2 ln ( y 2 + α 2 ) − 2 b 2 1 − b 1 2 b 2 α アークタン ( y α ) + C 0 {\displaystyle \int {\frac {y-{\frac {2b_{2}a-b_{1}}{2b_{2}}}}{y^{2}+\alpha ^{2}}}\,dy={\frac {1}{2}}\ln(y^{2}+\alpha ^{2})-{\frac {2b_{2}a-b_{1}}{2b_{2}\alpha }}\arctan \left({\frac {y}{\alpha }}\right)+C_{0}} 逆 三角関数 arctan関数が関係します。
p ( y ) ∝ exp [ − 1 2 b 2 ln ( 1 + y 2 α 2 ) − ln α b 2 + 2 b 2 1 − b 1 2 b 2 2 α アークタン ( y α ) + C 1 ] 。 {\displaystyle p(y)\propto \exp \left[-{\frac {1}{2b_{2}}}\ln \left(1+{\frac {y^{2}}{\alpha ^{2}}}\right)-{\frac {\ln \alpha }{b_{2}}}+{\frac {2b_{2}a-b_{1}}{2b_{2}^{2}\alpha }}\arctan \left({\frac {y}{\alpha }}\right)+C_{1}\right].} 最後に
m = 1 2 b 2 、 ν = − 2 b 2 1 − b 1 2 b 2 2 α 。 {\displaystyle {\begin{aligned}m&={\frac {1}{2b_{2}}},\\[5pt]\nu &=-{\frac {2b_{2}a-b_{1}}{2b_{2}^{2}\alpha }}.\end{aligned}}} これらの置換を適用すると、次のパラメトリック関数が得られます。
p ( y ) ∝ [ 1 + y 2 α 2 ] − m exp [ − ν アークタン ( y α ) ] 。 {\displaystyle p(y)\propto \left[1+{\frac {y^{2}}{\alpha ^{2}}}\right]^{-m}\exp \left[-\nu \arctan \left({\frac {y}{\alpha }}\right)\right].} この正規化されていない密度は、実数 全体にわたってサポートを 持ちます。これは、スケールパラメータ α > 0 と形状パラメータ m > 1/2 およびνに依存します。微分方程式 (1) の解を x ではなくy の関数として求めることを選択したため、1 つのパラメータが失われました。そこで、4 番目のパラメータ、すなわち位置パラメータ λを再導入します。このようにして 、ピアソン型 IV 分布 の密度を導出しました。
p ( x ) = | Γ ( m + ν 2 私 ) Γ ( m ) | 2 α B ( m − 1 2 、 1 2 ) [ 1 + ( x − λ α ) 2 ] − m exp [ − ν アークタン ( x − λ α ) ] 。 {\displaystyle p(x)={\frac {\left|{\frac {\operatorname {\Gamma } \left(m+{\frac {\nu }{2}}i\right)}{\Gamma (m)}}\right|^{2}}{\alpha \operatorname {\mathrm {B} } \left(m-{\frac {1}{2}},{\frac {1}{2}}\right)}}\left[1+\left({\frac {x-\lambda }{\alpha }}\right)^{2}\right]^{-m}\exp \left[-\nu \arctan \left({\frac {x-\lambda }{\alpha }}\right)\right].} 正規化定数には 複素 ガンマ関数 (Γ) とベータ関数 (B)が含まれます 。ここで位置パラメータ λ は、一般的な定式化で導入された元の位置パラメータとは異なり、次の関係式で表されます。
λ = λ o r 私 g 私 n 1 l + α ν 2 ( m − 1 ) 。 {\displaystyle \lambda =\lambda _{original}+{\frac {\alpha \nu }{2(m-1)}}.}
ピアソンVII型分布 λ = 0、σ = 1、γ 2 = ∞ (赤)、γ 2 = 4 (青)、γ 2 = 0 (黒)の場合のピアソン VII 型密度のプロットピアソンIV型分布の形状パラメータνは、その 歪度 を制御します。νの値をゼロに固定すると、対称な3パラメータ族が得られます。この特殊なケースは、ピアソンVII型分布 として知られています(ピアソン1916、p.450参照 )。その密度は
p ( x ) = 1 α B ( m − 1 2 、 1 2 ) [ 1 + ( x − λ α ) 2 ] − m 、 {\displaystyle p(x)={\frac {1}{\alpha \operatorname {\mathrm {B} } \left(m-{\frac {1}{2}},{\frac {1}{2}}\right)}}\left[1+\left({\frac {x-\lambda }{\alpha }}\right)^{2}\right]^{-m},} ここで、Bはベータ関数 である。
タイプVII分布の別のパラメータ化(および若干の特殊化)は、
α = σ 2 m − 3 、 {\displaystyle \alpha =\sigma {\sqrt {2m-3}},} これはm > 3/2 を必要とします。これにより一般性がわずかに失われますが、分布の分散が存在し、σ 2 に等しいことが保証されます。これで、パラメータm は 分布の尖度 のみを制御します。λと σ を一定に保ちながらm が 無限大に近づくと、正規分布が 特殊なケースとして現れます。
リム m → ∞ 1 σ 2 m − 3 B ( m − 1 2 、 1 2 ) [ 1 + ( x − λ σ 2 m − 3 ) 2 ] − m = 1 σ 2 Γ ( 1 2 ) ⋅ リム m → ∞ Γ ( m ) Γ ( m − 1 2 ) m − 3 2 ⋅ リム m → ∞ [ 1 + ( x − λ σ ) 2 2 m − 3 ] − m = 1 σ 2 π ⋅ 1 ⋅ exp [ − 1 2 ( x − λ σ ) 2 ] 。 {\displaystyle {\begin{aligned}&\lim _{m\to \infty }{\frac {1}{\sigma {\sqrt {2m-3}}\,\operatorname {\mathrm {B} } \left(m-{\frac {1}{2}},{\frac {1}{2}}\right)}}\left[1+\left({\frac {x-\lambda }{\sigma {\sqrt {2m-3}}}}\right)^{2}\right]^{-m}\\[5pt]={}&{\frac {1}{\sigma {\sqrt {2}}\,\operatorname {\Gamma } \left({\frac {1}{2}}\right)}}\cdot \lim _{m\to \infty }{\frac {\Gamma (m)}{\operatorname {\Gamma } \left(m-{\frac {1}{2}}\right){\sqrt {m-{\frac {3}{2}}}}}}\cdot \lim _{m\to \infty }\left[1+{\frac {\left({\frac {x-\lambda }{\sigma }}\right)^{2}}{2m-3}}\right]^{-m}\\[5pt]={}&{\frac {1}{\sigma {\sqrt {2\pi }}}}\cdot 1\cdot \exp \left[-{\frac {1}{2}}\left({\frac {x-\lambda }{\sigma }}\right)^{2}\right].\end{aligned}}} これは、平均λ 、標準偏差σ の正規分布の密度です。
m > 5/2 を要求し、
m = 5 2 + 3 γ 2 。 {\displaystyle m={\frac {5}{2}}+{\frac {3}{\gamma _{2}}}.} これは別の特殊化であり、分布の最初の 4 つのモーメントが存在することを保証します。より具体的には、(λ、σ、γ 2 ) でパラメータ化されたピアソン VII 型分布は、平均がλ 、標準偏差 がσ 、歪度 がゼロ、正の過剰尖度 が γ 2 となります。
スチューデントのt 分布ピアソンVII型分布は、元のパラメータ化に以下の置換を適用することにより、パラメータν > 0、μ、σ 2 を持つ非標準化スチューデントt 分布と等価になります。
λ = μ 、 α = ν σ 2 、 m = ν + 1 2 、 {\displaystyle {\begin{aligned}\lambda &=\mu ,\\[5pt]\alpha &={\sqrt {\nu \sigma ^{2}}},\\[5pt]m&={\frac {\nu +1}{2}},\end{aligned}}} 制約条件m > 1/2 が満たされていることに注意してください。
結果として得られる密度は
p ( x ∣ μ 、 σ 2 、 ν ) = 1 ν σ 2 B ( ν 2 、 1 2 ) ( 1 + 1 ν ( x − μ ) 2 σ 2 ) − ν + 1 2 、 {\displaystyle p(x\mid \mu ,\sigma ^{2},\nu )={\frac {1}{{\sqrt {\nu \sigma ^{2}}}\,\operatorname {\mathrm {B} } \left({\frac {\nu }{2}},{\frac {1}{2}}\right)}}\left(1+{\frac {1}{\nu }}{\frac {(x-\mu )^{2}}{\sigma ^{2}}}\right)^{-{\frac {\nu +1}{2}}},} これは、スチューデントのt 分布の密度として容易に認識できる。
これは、ピアソンVII型分布が標準スチューデントのt 分布 と標準コーシー分布の 両方を包含することを意味する。特に、標準スチューデントのt分布は、 μ = 0かつσ 2 = 1の場合に、以下の置換と同等のサブケースとして現れる。
λ = 0 、 α = ν 、 m = ν + 1 2 、 {\displaystyle {\begin{aligned}\lambda &=0,\\[5pt]\alpha &={\sqrt {\nu }},\\[5pt]m&={\frac {\nu +1}{2}},\end{aligned}}} この制限付き1パラメータ族の密度は、標準的なスチューデントのt 分布です。
p ( x ) = 1 ν B ( ν 2 、 1 2 ) ( 1 + x 2 ν ) − ν + 1 2 、 {\displaystyle p(x)={\frac {1}{{\sqrt {\nu }}\,\operatorname {\mathrm {B} } \left({\frac {\nu }{2}},{\frac {1}{2}}\right)}}\left(1+{\frac {x^{2}}{\nu }}\right)^{-{\frac {\nu +1}{2}}},}
ケース2、非負判別式二次関数(2)の判別式が非負である場合(b 1 2 − 4 b 2 b 0 ≥ 0 {\displaystyle b_{1}^{2}-4b_{2}b_{0}\geq 0} ) 実根a 1 とa 2 (必ずしも異なるとは限らない) を持つ。
1 1 = − b 1 − b 1 2 − 4 b 2 b 0 2 b 2 、 1 2 = − b 1 + b 1 2 − 4 b 2 b 0 2 b 2 。 {\displaystyle {\begin{aligned}a_{1}&={\frac {-b_{1}-{\sqrt {b_{1}^{2}-4b_{2}b_{0}}}}{2b_{2}}},\\[5pt]a_{2}&={\frac {-b_{1}+{\sqrt {b_{1}^{2}-4b_{2}b_{0}}}}{2b_{2}}}.\end{aligned}}} 実根が存在する場合、二次関数(2)は次のように書ける。
B ( x ) = b 2 ( x − 1 1 ) ( x − 1 2 ) 、 {\displaystyle B(x)=b_{2}(x-a_{1})(x-a_{2}),} したがって、微分方程式の解は次のようになる。
p ( x ) ∝ exp ( − 1 b 2 ∫ x − 1 ( x − 1 1 ) ( x − 1 2 ) d x ) 。 {\displaystyle p(x)\propto \exp \left(-{\frac {1}{b_{2}}}\int {\frac {x-a}{(x-a_{1})(x-a_{2})}}\,dx\right).} ピアソン(1895年、362ページ )はこれを「対数ケース」と呼んだ。なぜなら、積分は
∫ x − 1 ( x − 1 1 ) ( x − 1 2 ) d x = ( 1 1 − 1 ) ln ( x − 1 1 ) − ( 1 2 − 1 ) ln ( x − 1 2 ) 1 1 − 1 2 + C {\displaystyle \int {\frac {x-a}{(x-a_{1})(x-a_{2})}}\,dx={\frac {(a_{1}-a)\ln(x-a_{1})-(a_{2}-a)\ln(x-a_{2})}{a_{1}-a_{2}}}+C} これは、前のケースとは異なり、arctan関数ではなく、対数 関数のみを使用します。
置換を用いて
ν = 1 b 2 ( 1 1 − 1 2 ) 、 {\displaystyle \nu ={\frac {1}{b_{2}(a_{1}-a_{2})}},} 微分方程式(1)の解として、以下のものが得られる。
p ( x ) ∝ ( x − 1 1 ) − ν ( 1 1 − 1 ) ( x − 1 2 ) ν ( 1 2 − 1 ) 。 {\displaystyle p(x)\propto (x-a_{1})^{-\nu (a_{1}-a)}(x-a_{2})^{\nu (a_{2}-a)}.} この密度は、隠された比例定数を除いてのみ知られているため、その定数を変更して密度を次のように表すことができます。
p ( x ) ∝ ( 1 − x 1 1 ) − ν ( 1 1 − 1 ) ( 1 − x 1 2 ) ν ( 1 2 − 1 ) 。 {\displaystyle p(x)\propto \left(1-{\frac {x}{a_{1}}}\right)^{-\nu (a_{1}-a)}\left(1-{\frac {x}{a_{2}}}\right)^{\nu (a_{2}-a)}.}
ピアソンII型分布 ピアソンII型分布は 、対称分布に限定されたピアソンI型分布族の特殊なケースです。I型セクションの式を使用すると、m 1 = m 2 = m {\displaystyle m_{1}=m_{2}=m} そして− 1 1 = 1 2 = 1 {\displaystyle -a_{1}=a_{2}=a} 区間(−a, a)では、次のように記述できます。
p ( x ) ∝ ( 1 − x 2 1 2 ) m 。 {\displaystyle p(x)\propto \left(1-{\frac {x^{2}}{a^{2}}}\right)^{m}.} または
x = − 1 + 2 y 1 、 {\displaystyle x=-a+2ya,} y {\displaystyle y} は区間(0, 1)上のベータ分布 に従って分布します。
p ( y ) ∝ ( 1 − 4 ( y − 1 2 ) 2 ) m ∝ y m ( 1 − y ) m 。 {\displaystyle p(y)\propto \left(1-4\left(y-{\frac {1}{2}}\right)^{2}\right)^{m}\propto y^{m}(1-y)^{m}.} 適切な比例定数を用いると、PDFは次のようになる。
p ( y ) = y m ( 1 − y ) m Γ ( 2 m + 2 ) Γ ( m + 1 ) 2 。 {\displaystyle p(y)=y^{m}(1-y)^{m}{\frac {\Gamma (2m+2)}{\Gamma (m+1)^{2}}}.}
ピアソンIII型分布 定義する
λ = μ 1 + b 0 b 1 − ( m + 1 ) b 1 、 {\displaystyle \lambda =\mu _{1}+{\frac {b_{0}}{b_{1}}}-(m+1)b_{1},} b 0 + b 1 ( x − λ ) {\displaystyle b_{0}+b_{1}(x-\lambda )} はガンマ ( m + 1 、 b 1 2 ) {\displaystyle \operatorname {Gamma} (m+1,b_{1}^{2})} ピアソンIII型分布はガンマ分布 またはカイ二乗分布 です。
ピアソンV型分布 新しいパラメータを定義する:
C 1 = b 1 2 b 2 、 λ = μ 1 − 1 − C 1 1 − 2 b 2 、 {\displaystyle {\begin{aligned}C_{1}&={\frac {b_{1}}{2b_{2}}},\\\lambda &=\mu _{1}-{\frac {a-C_{1}}{1-2b_{2}}},\end{aligned}}} x − λ {\displaystyle x-\lambda } に続く逆ガンマ ( 1 b 2 − 1 、 1 − C 1 b 2 ) {\displaystyle \operatorname {InverseGamma} ({\frac {1}{b_{2}}}-1,{\frac {a-C_{1}}{b_{2}}})} ピアソンV型分布は逆ガンマ分布 です。
ピアソン第VI型分布 定義する
λ = μ 1 + ( 1 2 − 1 1 ) m 2 + 1 m 2 + m 1 + 2 − 1 2 、 {\displaystyle \lambda =\mu _{1}+(a_{2}-a_{1}){\frac {m_{2}+1}{m_{2}+m_{1}+2}}-a_{2},} x − λ − 1 2 1 2 − 1 1 {\displaystyle {\frac {x-\lambda -a_{2}}{a_{2}-a_{1}}}} に続くβ ′ ( m 2 + 1 、 − m 2 − m 1 − 1 ) {\displaystyle \beta ^{\prime }(m_{2}+1,-m_{2}-m_{1}-1)} ピアソンVI型分布はベータプライム分布 または F 分布 です。
アプリケーション これらのモデルは、市場トレーダーにとって直感的に理解しやすい方法でパラメータ化できるため、金融市場で広く利用されています。金利や株式などの変動性の確率的性質を捉えるモデルは現在数多く存在し、この分布群は特に重要なものの一つとなる可能性があります。
米国では、対数ガンマ分布 (歴史的には対数ピアソンIIIと呼ばれていた)が洪水頻度分析のデフォルトの分布である。[ 4 ]
近年、ピアソン分布に代わる、より柔軟でデータへの適合が容易な分布が開発されている。メタログ分布を 参照のこと。
注記 ↑ ミラー、ジェフ他 (2006-07-09)。「ベータ分布」。数学用語の最も古い既知の使用例 。2006-12-09 に取得 。 ↑ ミラー、ジェフ他 (2006-12-07)。 「ガンマ分布」 。 数学用語の最も古い既知の使用例 。2006-12-09 に 取得 。 ↑ Ord JK (1972) p. 2 ↑ 「洪水流量頻度を決定するためのガイドライン」 (PDF) 。USGS Water 。1982年3月。 2019年6月14日 取得 。
情報源
一次資料 ピアソン、カール (1893)。 「進化の数学的 理論への貢献[ 要旨] 」。王立 協会 紀要 。54 (326–330 ):329–333。doi :10.1098/ rspl.1893.0079。JSTOR 115538。 Pearson, Karl (1895). 「進化の数学的理論への貢献、II:均質な物質における歪んだ変動」 . Philosophical Transactions of the Royal Society . 186 : 343– 414. Bibcode : 1895RSPTA.186..343P . doi : 10.1098/rsta.1895.0010 . JSTOR 90649 . Pearson, Karl (1901). 「進化論への数学的貢献、X:歪度変動に関する覚書の補遺」 . Philosophical Transactions of the Royal Society A. 197 ( 287–299 ) : 443–459 . Bibcode : 1901RSPTA.197..443P . doi : 10.1098/rsta.1901.0023 . JSTOR 90841 . Pearson, Karl (1902). 「判断の誤りの数学的理論について、特に個人方程式に関して」 . Philosophical Transactions of the Royal Society A. 198 ( 300–311 ) : 235–299 . doi : 10.1098/rsta.1902.0005 .ピアソン、カール (1905)。進化論への数学的貢献、XIV:歪相関と非線形回帰の一般理論について (論文)。ドレーパーズ・カンパニー研究論文集 – 生体計測シリーズ。第 II巻。Pearson, Karl (1916). 「進化論への数学的貢献、XIX:歪度変動に関する覚書への第2補遺」 . Philosophical Transactions of the Royal Society A. 216 ( 538–548 ) : 429–457 . Bibcode : 1916RSPTA.216..429P . doi : 10.1098/rsta.1916.0009 . JSTOR 91092 . Rhind, A. (1909年7月~10月) 「歪度数分布の主定数の推定誤差の計算を容易にするための表」Biometrika . 7 (1/2): 127– 147. doi : 10.1093/biomet/7.1-2.127 . JSTOR 2345367 .
参考文献 エルダートン卿、WP、ジョンソン、NL (1969)周波数曲線のシステム 。ケンブリッジ大学出版局。 Ord JK (1972)頻度分布の族 。グリフィン、ロンドン。