観測値に基づいて統計モデルのパラメータを推定する方法
統計学 において 、 最大尤度推定法 ( MLE )は、観測データが与えられた場合に、仮定の確率分布のパラメータを推定する方法である。これは、 仮定の統計モデルの下で 観測 データ が 最も 確か らしい ものとなるように尤度関数を最大化することによって達成される。尤度関数を最大化するパラメータ 空間 の 点 は 、 最大 尤 度 推定 値と呼ばれる。 [1]最大尤度の論理は直感的かつ柔軟であるため、この方法は 統計的推論 の主要な手段となっている 。 [2] [3] [4]
尤度関数が 微分可能な 場合は、最大値を見つけるための 微分検定 を適用できます。場合によっては、尤度関数の一次条件を解析的に解くことができます。たとえば、 線形回帰モデルの 通常の最小二乗 推定量は、ランダム誤差が同じ分散を持つ 正規 分布に従うと仮定した場合に尤度を最大化します 。 [5]
ベイズ推論 の観点から見ると 、MLE は一般に、 関心領域内で均一な事前分布を持つ最大事後確率 (MAP) 推定と同等です。頻度主義推論では 、 MLE は 極値 推定 量 の 特殊なケースであり 、目的関数は尤度です。
原則
我々は、一連の観測値を、一連のパラメータ で表される 未知の 結合確率分布 からのランダム サンプル としてモデル化する。最尤推定の目的は、観測データが最高の結合確率を持つパラメータを決定することである。我々は、結合分布を支配するパラメータをベクトルとして書き、この分布が パラメータ空間 と 呼ばれる パラメトリック族、つまり ユークリッド空間 の有限次元部分 集合内に入るようにする 。観測データサンプル における結合密度を評価すると 、実数値関数が得られる。
θ
=
[
θ
1
、
θ
2
、
…
、
θ
け
]
T
{\displaystyle \;\theta =\left[\theta _{1},\,\theta _{2},\,\ldots ,\,\theta _{k}\right]^{\mathsf {T}}\;}
{
ふ
(
⋅
;
θ
)
∣
θ
∈
Θ
}
、
{\displaystyle \;\{f(\cdot \,;\theta )\mid \theta \in \Theta \}\;,}
Θ
{\displaystyle \,\Theta \,}
ええ
=
(
ええ
1
、
ええ
2
、
…
、
ええ
ん
)
{\displaystyle \;\mathbf {y} =(y_{1},y_{2},\ldots ,y_{n})\;}
ら
ん
(
θ
)
=
ら
ん
(
θ
;
ええ
)
=
ふ
ん
(
ええ
;
θ
)
、
{\displaystyle {\mathcal {L}}_{n}(\theta )={\mathcal {L}}_{n}(\theta ;\mathbf {y} )=f_{n}(\mathbf {y } ;\シータ )\;,}
これは尤度関数 と呼ばれます 。 独立かつ同一に分布するランダム変数 の場合、は単変量 密度関数 の積になります 。
ふ
ん
(
ええ
;
θ
)
{\displaystyle f_{n}(\mathbf {y} ;\theta )}
ふ
ん
(
ええ
;
θ
)
=
∏
け
=
1
ん
ふ
け
あなた
ん
私
ヴ
1つの
r
(
ええ
け
;
θ
)
。
{\displaystyle f_{n}(\mathbf {y} ;\theta )=\prod _{k=1}^{n}\,f_{k}^{\mathsf {univar}}(y_{k}; \θ )~.}
最大尤度推定の目的は、パラメータ空間上の尤度関数を最大化するモデルパラメータの値を見つけることである [6]。 つまり
、
θ
^
=
1つの
r
グ
メートル
1つの
x
θ
∈
Θ
ら
ん
(
θ
;
ええ
)
。
{\displaystyle {\hat {\theta }}={\underset {\theta \in \Theta }{\operatorname {arg\;max} }}\,{\mathcal {L}}_{n}(\theta \,;\mathbf {y} )~.}
直感的には、これは観測されたデータが最も確からしいものになるパラメータ値を選択する。 尤度関数を最大化する特定の値は、 最大尤度推定値と呼ばれる。さらに、 このように定義された関数が 測定可能であれば 、最大尤度 推定量と呼ばれる。これは通常、 標本空間 上で定義される関数 、すなわち与えられた標本をその引数として取る関数である。 尤度関数が存在するための 十分条件だが必須条件ではない条件は、尤度関数が コンパクトな パラメータ 空間上で 連続して いることである。 [7] オープン の場合、 尤度関数は最大値に達することなく増加する可能性がある。
θ
^
=
θ
^
ん
(
ええ
)
∈
Θ
{\displaystyle ~{\hat {\theta }}={\hat {\theta }}_{n}(\mathbf {y} )\in \Theta ~}
ら
ん
{\displaystyle \,{\mathcal {L}}_{n}\,}
θ
^
ん
:
R
ん
→
Θ
{\displaystyle \;{\hat {\theta }}_{n}:\mathbb {R} ^{n}\to \Theta \;}
Θ
{\displaystyle \,\Theta \,}
Θ
{\displaystyle \,\Theta \,}
実際には、対数尤度 と呼ばれる尤度関数の 自然対数 を使用すると便利な場合がよくあります 。
ℓ
(
θ
;
ええ
)
=
行
ら
ん
(
θ
;
ええ
)
。
{\displaystyle \ell (\theta \,;\mathbf {y} )=\ln {\mathcal {L}}_{n}(\theta \,;\mathbf {y} )~.}
対数は 単調関数 なので、の最大値は の最大値と 同じ値で発生します。 [8] が 微分可能 で、 最大値(または最小値)が発生するための
十分な条件 は
ℓ
(
θ
;
ええ
)
{\displaystyle \;\ell (\theta \,;\mathbf {y} )\;}
θ
{\displaystyle \theta}
ら
ん
。
{\displaystyle \,{\mathcal {L}}_{n}~.}
ℓ
(
θ
;
ええ
)
{\displaystyle \ell (\theta \,;\mathbf {y} )}
Θ
、
{\displaystyle \,\Theta \,,}
∂
ℓ
∂
θ
1
=
0
、
∂
ℓ
∂
θ
2
=
0
、
…
、
∂
ℓ
∂
θ
け
=
0
、
{\displaystyle {\frac {\partial \ell }{\partial \theta _{1}}}=0,\quad {\frac {\partial \ell }{\partial \theta _{2}}}=0,\quad \ldots ,\quad {\frac {\partial \ell }{\partial \theta _{k}}}=0~,}
尤度方程式として知られる。いくつかのモデルでは、これらの方程式は明示的に解くことができるが 、一般に最大化問題に対する閉形式の解は知られていないか利用可能でなく、MLEは 数値最適化 によってのみ見つけることができる。もう1つの問題は、有限サンプルでは尤度方程式に複数の 根 が存在する可能性があることである。 [9] 尤度方程式の特定された根が 実際に(局所的)最大値であるかどうかは、2次偏微分および交差偏微分行列、いわゆる ヘッセ行列が
θ
^
、
{\displaystyle \,{\widehat {\theta \,}}\,,}
θ
^
{\displaystyle \,{\widehat {\theta \,}}\,}
H
(
θ
^
)
=
[
∂
2
ℓ
∂
θ
1
2
|
θ
=
θ
^
∂
2
ℓ
∂
θ
1
∂
θ
2
|
θ
=
θ
^
…
∂
2
ℓ
∂
θ
1
∂
θ
け
|
θ
=
θ
^
∂
2
ℓ
∂
θ
2
∂
θ
1
|
θ
=
θ
^
∂
2
ℓ
∂
θ
2
2
|
θ
=
θ
^
…
∂
2
ℓ
∂
θ
2
∂
θ
け
|
θ
=
θ
^
⋮
⋮
⋱
⋮
∂
2
ℓ
∂
θ
け
∂
θ
1
|
θ
=
θ
^
∂
2
ℓ
∂
θ
け
∂
θ
2
|
θ
=
θ
^
…
∂
2
ℓ
∂
θ
け
2
|
θ
=
θ
^
]
、
{\displaystyle \mathbf {H} \left({\widehat {\theta \,}}\right)={\begin{bmatrix}\left.{\frac {\partial ^{2}\ell }{\partial \theta _{1}^{2}}}\right|_{\theta ={\widehat {\theta \,}}}&\left.{\frac {\partial ^{2}\ell }{\partial \theta _{1}\,\partial \theta _{2}}}\right|_{\theta ={\widehat {\theta \,}}}&\dots &\left.{\frac {\partial ^{2}\ell }{\partial \theta _{1}\,\partial \theta _{k}}}\right|_{\theta ={\widehat {\theta \,}}}\\\left.{\frac {\partial ^{2}\ell }{\partial \theta _{2}\,\partial \theta _{1}}}\right|_{\theta ={\widehat {\theta \,}}}&\left.{\frac {\partial ^{2}\ell }{\partial \theta _{2}^{2}}}\right|_{\theta ={\widehat {\theta \,}}}&\dots &\left.{\frac {\partial ^{2}\ell }{\partial \theta _{2}\,\partial \theta _{k}}}\right|_{\theta ={\widehat {\theta \,}}}\\\vdots &\vdots &\ddots &\vdots \\\left.{\frac {\partial ^{2}\ell }{\partial \theta _{k}\,\partial \theta _{1}}}\right|_{\theta ={\widehat {\theta \,}}}&\left.{\frac {\partial ^{2}\ell }{\partial \theta _{k}\,\partial \theta _{2}}}\right|_{\theta ={\widehat {\theta \,}}}&\dots &\left.{\frac {\partial ^{2}\ell }{\partial \theta _{k}^{2}}}\right|_{\theta ={\widehat {\theta \,}}}\end{bmatrix}}~,}
はにおいて 負の半定値 であり 、これは局所的に 凹であること を示す。便利なことに、最も一般的な 確率分布 、特に 指数分布族は 対数的に凹である 。 [ 10] [11]
θ
^
{\displaystyle {\widehat {\theta \,}}}
制限されたパラメータ空間
尤度関数の領域、つまり パラメータ空間は、一般的には ユークリッド空間 の有限次元部分集合である が、推定プロセスには追加の 制約 を組み込む必要がある場合がある。パラメータ空間は次のように表される。
Θ
=
{
θ
:
θ
∈
R
け
、
h
(
θ
)
=
0
}
、
{\displaystyle \Theta =\left\{\theta :\theta \in \mathbb {R} ^{k},\;h(\theta )=0\right\}~,}
ここで、は ベクトル値関数 であり 、に マッピングされます。 に属する 真のパラメータを推定することは 、実際には、 制約条件の下で尤度関数の最大値を見つけることを意味します。
h
(
θ
)
=
[
h
1
(
θ
)
、
h
2
(
θ
)
、
…
、
h
r
(
θ
)
]
{\displaystyle \;h(\theta )=\left[h_{1}(\theta ),h_{2}(\theta ),\ldots ,h_{r}(\theta )\right]\;}
R
k
{\displaystyle \,\mathbb {R} ^{k}\,}
R
r
.
{\displaystyle \;\mathbb {R} ^{r}~.}
θ
{\displaystyle \theta }
Θ
{\displaystyle \Theta }
h
(
θ
)
=
0
.
{\displaystyle ~h(\theta )=0~.}
理論的には、この制約付き最適化 問題に対する最も自然なアプローチ は置換法である。つまり、制約を から への 1 対 1 関数 となる ような方法で 集合に「埋める」ことであり 、尤度関数を次のように再パラメータ化する。 [12] 最大尤度推定量の同値性のため、MLE の特性は制約付き推定値にも適用される。 [13]たとえば、 多変量正規分布では、 共分散行列は 正 定値 でなければならない。この制約は、 を に置き換えることによって課すことができる。ここ で、 は実数 上三角行列 であり、 は その 転置 である。 [14]
h
1
,
h
2
,
…
,
h
r
{\displaystyle \;h_{1},h_{2},\ldots ,h_{r}\;}
h
1
,
h
2
,
…
,
h
r
,
h
r
+
1
,
…
,
h
k
{\displaystyle \;h_{1},h_{2},\ldots ,h_{r},h_{r+1},\ldots ,h_{k}\;}
h
∗
=
[
h
1
,
h
2
,
…
,
h
k
]
{\displaystyle \;h^{\ast }=\left[h_{1},h_{2},\ldots ,h_{k}\right]\;}
R
k
{\displaystyle \mathbb {R} ^{k}}
ϕ
i
=
h
i
(
θ
1
,
θ
2
,
…
,
θ
k
)
.
{\displaystyle \;\phi _{i}=h_{i}(\theta _{1},\theta _{2},\ldots ,\theta _{k})~.}
Σ
{\displaystyle \,\Sigma \,}
Σ
=
Γ
T
Γ
,
{\displaystyle \;\Sigma =\Gamma ^{\mathsf {T}}\Gamma \;,}
Γ
{\displaystyle \Gamma }
Γ
T
{\displaystyle \Gamma ^{\mathsf {T}}}
実際には、ラグランジュ法を用いて制約が課されるのが一般的であり、上記で定義した制約を前提として、 制約尤度方程式が導かれる。
∂
ℓ
∂
θ
−
∂
h
(
θ
)
T
∂
θ
λ
=
0
{\displaystyle {\frac {\partial \ell }{\partial \theta }}-{\frac {\partial h(\theta )^{\mathsf {T}}}{\partial \theta }}\lambda =0}
そして
h
(
θ
)
=
0
,
{\displaystyle h(\theta )=0\;,}
ここで、は ラグランジュ乗数 の列ベクトルであり 、は 偏導関数の k × r ヤコビ行列 です。 [12] 当然、制約が最大値で拘束されていない場合、ラグランジュ乗数はゼロになります。 [15]これにより、 ラグランジュ乗数テスト と呼ばれる制約の「妥当性」の統計的テストが可能になります 。
λ
=
[
λ
1
,
λ
2
,
…
,
λ
r
]
T
{\displaystyle ~\lambda =\left[\lambda _{1},\lambda _{2},\ldots ,\lambda _{r}\right]^{\mathsf {T}}~}
∂
h
(
θ
)
T
∂
θ
{\displaystyle \;{\frac {\partial h(\theta )^{\mathsf {T}}}{\partial \theta }}\;}
ノンパラメトリック最大尤度推定
経験的尤度 を使用して、ノンパラメトリック最大尤度推定を実行できます 。
プロパティ
最尤推定量は、 θ の関数として目的関数を最大化することによって得られる 極値 推定 量 である。データが 独立かつ同一に分布している 場合、
ℓ
^
(
θ
;
x
)
{\displaystyle {\widehat {\ell \,}}(\theta \,;x)}
ℓ
^
(
θ
;
x
)
=
∑
i
=
1
n
ln
f
(
x
i
∣
θ
)
,
{\displaystyle {\widehat {\ell \,}}(\theta \,;x)=\sum _{i=1}^{n}\ln f(x_{i}\mid \theta ),}
これは期待対数尤度のサンプル類似物であり 、この期待値は真の密度に関して取られます。
ℓ
(
θ
)
=
E
[
ln
f
(
x
i
∣
θ
)
]
{\displaystyle \ell (\theta )=\operatorname {\mathbb {E} } [\,\ln f(x_{i}\mid \theta )\,]}
最大尤度推定量は有限サンプルに対して最適な特性を持たない。つまり、有限サンプルで評価した場合、他の推定量の方が真のパラメータ値の周囲に集中する可能性がある。 [16] しかし、他の推定方法と同様に、最大尤度推定量にはいくつかの魅力的な 制限特性 がある。サンプルサイズが無限大に増加すると、最大尤度推定量のシーケンスには次の特性がある。
一貫性 : MLE のシーケンスは、推定される値に確率的に収束します。
同値性 : が の最大尤度推定量であり 、 が の全単射変換である場合 、 の最大尤度推定量 は です 。同値性プロパティは非全単射変換に一般化できますが、その場合は一般に真の尤度ではない誘導尤度関数の最大値に適用されます。
θ
^
{\displaystyle {\hat {\theta }}}
θ
{\displaystyle \theta }
g
(
θ
)
{\displaystyle g(\theta )}
θ
{\displaystyle \theta }
α
=
g
(
θ
)
{\displaystyle \alpha =g(\theta )}
α
^
=
g
(
θ
^
)
{\displaystyle {\hat {\alpha }}=g({\hat {\theta }})}
効率性 、つまりサンプル サイズが無限大に近づくと Cramér–Rao 下限 が達成されます。これは、一貫した推定量で MLE (またはこの上限に達する他の推定量) よりも漸近平均 二乗誤差が低いものはないことを意味し、MLE が 漸近正規性 を持つことも意味します 。
バイアス補正後の二次効率。
一貫性
以下に概説する条件下では、最尤推定量は 矛盾がありません 。矛盾がないとは、データが によって生成され、観測値が十分に大きい n 個ある場合、任意の精度で θ 0 の値を見つけることができることを意味します。数学的に言えば、これは n が 無限大に近づくにつれて推定量が 確率的に 真の値
に収束すること を意味します。
f
(
⋅
;
θ
0
)
{\displaystyle f(\cdot \,;\theta _{0})}
θ
^
{\displaystyle {\widehat {\theta \,}}}
θ
^
m
l
e
→
p
θ
0
.
{\displaystyle {\widehat {\theta \,}}_{\mathrm {mle} }\ {\xrightarrow {\text{p}}}\ \theta _{0}.}
わずかに強い条件下では、推定量は ほぼ確実に (または 強く )収束します。
θ
^
m
l
e
→
a.s.
θ
0
.
{\displaystyle {\widehat {\theta \,}}_{\mathrm {mle} }\ {\xrightarrow {\text{a.s.}}}\ \theta _{0}.}
実際のアプリケーションでは、データが によって生成されることはありません 。むしろ、 は、 データによって生成されるプロセスの、多くの場合は理想化された形式のモデルです。統計学では、 すべてのモデルは間違っている というのが一般的な格言です。したがって、実際のアプリケーションでは真の一貫性は発生しません。それでも、一貫性は推定器が持つべき望ましい特性であると考えられることがよくあります。
f
(
⋅
;
θ
0
)
{\displaystyle f(\cdot \,;\theta _{0})}
f
(
⋅
;
θ
0
)
{\displaystyle f(\cdot \,;\theta _{0})}
一貫性を確立するには、以下の条件を満たせば十分である。 [17]
優位条件は、 iid 観測
の場合に使用できます 。非 iid の場合、確率の一様収束は、シーケンスが 確率的に等連続である ことを示すことによって確認できます 。ML 推定量が ほぼ確実に θ 0 に収束することを証明したい場合は 、より強力な一様収束の条件をほぼ確実に課す必要があります。
ℓ
^
(
θ
∣
x
)
{\displaystyle {\widehat {\ell \,}}(\theta \mid x)}
θ
^
{\displaystyle {\widehat {\theta \,}}}
sup
θ
∈
Θ
‖
ℓ
^
(
θ
∣
x
)
−
ℓ
(
θ
)
‖
→
a.s.
0.
{\displaystyle \sup _{\theta \in \Theta }\left\|\;{\widehat {\ell \,}}(\theta \mid x)-\ell (\theta )\;\right\|\ \xrightarrow {\text{a.s.}} \ 0.}
さらに、(上記の仮定どおり)データが によって生成された場合、特定の条件下では、最大尤度推定量が 分布において 正規分布に収束する ことも示されます。具体的には、 [18]
f
(
⋅
;
θ
0
)
{\displaystyle f(\cdot \,;\theta _{0})}
n
(
θ
^
m
l
e
−
θ
0
)
→
d
N
(
0
,
I
−
1
)
{\displaystyle {\sqrt {n}}\left({\widehat {\theta \,}}_{\mathrm {mle} }-\theta _{0}\right)\ \xrightarrow {d} \ {\mathcal {N}}\left(0,\,I^{-1}\right)}
ここで、 Iは フィッシャー情報行列 です 。
機能的不変性
最尤推定量は、観測データに可能な限り最大の確率(連続の場合は確率密度)を与えるパラメータ値を選択する。パラメータが複数の要素で構成されている場合、それらの個別の最尤推定量を、完全なパラメータのMLEの対応する要素として定義する。これと一致して、が の MLEであり 、が の任意の変換である場合 、 のMLEは 定義により [19]となる。
θ
^
{\displaystyle {\widehat {\theta \,}}}
θ
{\displaystyle \theta }
g
(
θ
)
{\displaystyle g(\theta )}
θ
{\displaystyle \theta }
α
=
g
(
θ
)
{\displaystyle \alpha =g(\theta )}
α
^
=
g
(
θ
^
)
.
{\displaystyle {\widehat {\alpha }}=g(\,{\widehat {\theta \,}}\,).\,}
いわゆる プロファイル尤度 を最大化します。
L
¯
(
α
)
=
sup
θ
:
α
=
g
(
θ
)
L
(
θ
)
.
{\displaystyle {\bar {L}}(\alpha )=\sup _{\theta :\alpha =g(\theta )}L(\theta ).\,}
MLEは、データの特定の変換に関しても同変です。 が 1対1で、推定するパラメータに依存しない場合、密度関数は次式を満たします。
y
=
g
(
x
)
{\displaystyle y=g(x)}
g
{\displaystyle g}
f
Y
(
y
)
=
f
X
(
g
−
1
(
y
)
)
|
(
g
−
1
(
y
)
)
′
|
{\displaystyle f_{Y}(y)=f_{X}(g^{-1}(y))\,|(g^{-1}(y))^{\prime }|}
したがって、および の尤度関数は 、モデルパラメータに依存しない係数によってのみ異なります。
X
{\displaystyle X}
Y
{\displaystyle Y}
たとえば、対数正規分布の MLE パラメータは、データの対数にフィットした正規分布のパラメータと同じです。実際、対数正規分布の場合 、 であれば、 対数正規分布 に従います 。Y の密度は、 に対して 、 標準 正規分布 およびに従います 。
X
∼
N
(
0
,
1
)
{\displaystyle X\sim {\mathcal {N}}(0,1)}
Y
=
g
(
X
)
=
e
X
{\displaystyle Y=g(X)=e^{X}}
f
X
{\displaystyle f_{X}}
g
−
1
(
y
)
=
log
(
y
)
{\displaystyle g^{-1}(y)=\log(y)}
|
(
g
−
1
(
y
)
)
′
|
=
1
y
{\displaystyle |(g^{-1}(y))^{\prime }|={\frac {1}{y}}}
y
>
0
{\displaystyle y>0}
効率
上で仮定したように、データが特定の条件下で生成された場合、最大尤度推定量は 分布的に正規分布に収束する ことも示せます 。これは √n に 整合し、漸近的に効率的であり、つまり クラメール・ラオ境界 に到達します。具体的には、 [18]
f
(
⋅
;
θ
0
)
,
{\displaystyle ~f(\cdot \,;\theta _{0})~,}
n
(
θ
^
mle
−
θ
0
)
→
d
N
(
0
,
I
−
1
)
,
{\displaystyle {\sqrt {n\,}}\,\left({\widehat {\theta \,}}_{\text{mle}}-\theta _{0}\right)\ \ \xrightarrow {d} \ \ {\mathcal {N}}\left(0,\ {\mathcal {I}}^{-1}\right)~,}
フィッシャー情報行列は 次のように なります 。
I
{\displaystyle ~{\mathcal {I}}~}
I
j
k
=
E
[
−
∂
2
ln
f
θ
0
(
X
t
)
∂
θ
j
∂
θ
k
]
.
{\displaystyle {\mathcal {I}}_{jk}=\operatorname {\mathbb {E} } \,{\biggl [}\;-{\frac {\partial ^{2}\ln f_{\theta _{0}}(X_{t})}{\partial \theta _{j}\,\partial \theta _{k}}}\;{\biggr ]}~.}
特に、最大尤度推定量の バイアス は次数までゼロに等しいことを意味する 。 1 / √n .
バイアス補正後の二次効率
しかし、この推定量の分布の展開 における高次の項を考慮すると、 θ mleは 1 ⁄ n のオーダーのバイアスを持つこと がわかります。このバイアスは(成分ごとに) [20] に等しいです。
b
h
≡
E
[
(
θ
^
m
l
e
−
θ
0
)
h
]
=
1
n
∑
i
,
j
,
k
=
1
m
I
h
i
I
j
k
(
1
2
K
i
j
k
+
J
j
,
i
k
)
{\displaystyle b_{h}\;\equiv \;\operatorname {\mathbb {E} } {\biggl [}\;\left({\widehat {\theta }}_{\mathrm {mle} }-\theta _{0}\right)_{h}\;{\biggr ]}\;=\;{\frac {1}{\,n\,}}\,\sum _{i,j,k=1}^{m}\;{\mathcal {I}}^{hi}\;{\mathcal {I}}^{jk}\left({\frac {1}{\,2\,}}\,K_{ijk}\;+\;J_{j,ik}\right)}
ここで (上付き文字)は 逆 フィッシャー情報行列の( j,k )番目の成分を表し 、
I
j
k
{\displaystyle {\mathcal {I}}^{jk}}
I
−
1
{\displaystyle {\mathcal {I}}^{-1}}
1
2
K
i
j
k
+
J
j
,
i
k
=
E
[
1
2
∂
3
ln
f
θ
0
(
X
t
)
∂
θ
i
∂
θ
j
∂
θ
k
+
∂
ln
f
θ
0
(
X
t
)
∂
θ
j
∂
2
ln
f
θ
0
(
X
t
)
∂
θ
i
∂
θ
k
]
.
{\displaystyle {\frac {1}{\,2\,}}\,K_{ijk}\;+\;J_{j,ik}\;=\;\operatorname {\mathbb {E} } \,{\biggl [}\;{\frac {1}{2}}{\frac {\partial ^{3}\ln f_{\theta _{0}}(X_{t})}{\partial \theta _{i}\;\partial \theta _{j}\;\partial \theta _{k}}}+{\frac {\;\partial \ln f_{\theta _{0}}(X_{t})\;}{\partial \theta _{j}}}\,{\frac {\;\partial ^{2}\ln f_{\theta _{0}}(X_{t})\;}{\partial \theta _{i}\,\partial \theta _{k}}}\;{\biggr ]}~.}
これらの式を使用すると、最大尤度推定量の 2 次バイアスを推定し、 それを減算してそのバイアスを
修正することができます。
θ
^
mle
∗
=
θ
^
mle
−
b
^
.
{\displaystyle {\widehat {\theta \,}}_{\text{mle}}^{*}={\widehat {\theta \,}}_{\text{mle}}-{\widehat {b\,}}~.}
この推定量は、順序の条件まで偏りがない 。 1 / ん 、 バイアス補正最大尤度推定量 と呼ばれます。
このバイアス補正推定量は 2次効率 が高い(少なくとも曲線指数族内では)。つまり、2次バイアス補正推定量の中で、次数 の項までの平均二乗誤差が最小であることを意味する 。 1 / 2 位 。このプロセスを継続して、3次のバイアス補正項などを導出することは可能です。しかし、最大尤度推定量は 3次効率的では ありません。 [21]
ベイズ推論との関係
最大尤度推定量は、 パラメータ に 一様 事前分布が 与えられた場合の最も 確率の高い ベイズ推定量 と一致します。実際、 最大事後推定値は、 ベイズの定理によって与えられる、データが与えられた場合に
θ の確率を最大化する パラメータ θです。
P
(
θ
∣
x
1
,
x
2
,
…
,
x
n
)
=
f
(
x
1
,
x
2
,
…
,
x
n
∣
θ
)
P
(
θ
)
P
(
x
1
,
x
2
,
…
,
x
n
)
{\displaystyle \operatorname {\mathbb {P} } (\theta \mid x_{1},x_{2},\ldots ,x_{n})={\frac {f(x_{1},x_{2},\ldots ,x_{n}\mid \theta )\operatorname {\mathbb {P} } (\theta )}{\operatorname {\mathbb {P} } (x_{1},x_{2},\ldots ,x_{n})}}}
ここで、 は パラメータ θ の事前分布であり、 は すべてのパラメータにわたって平均されたデータの確率です。分母は θ に依存しないため、ベイズ推定量は θ について最大化することで得られます 。さらに事前分布 が一様分布であると仮定すると、ベイズ推定量は尤度関数 を最大化することで得られます 。したがって、ベイズ推定量は一様事前分布の最大尤度推定量と一致します 。
P
(
θ
)
{\displaystyle \operatorname {\mathbb {P} } (\theta )}
P
(
x
1
,
x
2
,
…
,
x
n
)
{\displaystyle \operatorname {\mathbb {P} } (x_{1},x_{2},\ldots ,x_{n})}
f
(
x
1
,
x
2
,
…
,
x
n
∣
θ
)
P
(
θ
)
{\displaystyle f(x_{1},x_{2},\ldots ,x_{n}\mid \theta )\operatorname {\mathbb {P} } (\theta )}
P
(
θ
)
{\displaystyle \operatorname {\mathbb {P} } (\theta )}
f
(
x
1
,
x
2
,
…
,
x
n
∣
θ
)
{\displaystyle f(x_{1},x_{2},\ldots ,x_{n}\mid \theta )}
P
(
θ
)
{\displaystyle \operatorname {\mathbb {P} } (\theta )}
ベイズ決定理論における最大尤度推定の応用
機械学習 の多くの実用的なアプリケーションでは 、最大尤度推定がパラメータ推定のモデルとして使用されます。
ベイズ決定理論は、総期待リスクを最小化する分類器を設計することに関するもので、特に、異なる決定に関連するコスト(損失関数)が等しい場合、分類器は分布全体にわたって誤差を最小化します。 [22]
したがって、ベイズ決定則は次のように述べられる。
「 そう でなければ決定する 」
w
1
{\displaystyle \;w_{1}\;}
P
(
w
1
|
x
)
>
P
(
w
2
|
x
)
;
{\displaystyle ~\operatorname {\mathbb {P} } (w_{1}|x)\;>\;\operatorname {\mathbb {P} } (w_{2}|x)~;~}
w
2
{\displaystyle \;w_{2}\;}
ここで、 異なるクラスの予測値である。誤差を最小化する観点からは、次のようにも言える。
w
1
,
w
2
{\displaystyle \;w_{1}\,,w_{2}\;}
w
=
a
r
g
m
a
x
w
∫
−
∞
∞
P
(
error
∣
x
)
P
(
x
)
d
x
{\displaystyle w={\underset {w}{\operatorname {arg\;max} }}\;\int _{-\infty }^{\infty }\operatorname {\mathbb {P} } ({\text{ error}}\mid x)\operatorname {\mathbb {P} } (x)\,\operatorname {d} x~}
どこ
P
(
error
∣
x
)
=
P
(
w
1
∣
x
)
{\displaystyle \operatorname {\mathbb {P} } ({\text{ error}}\mid x)=\operatorname {\mathbb {P} } (w_{1}\mid x)~}
もし私たちが決めれば 、 もし私たちが決めれば
w
2
{\displaystyle \;w_{2}\;}
P
(
error
∣
x
)
=
P
(
w
2
∣
x
)
{\displaystyle \;\operatorname {\mathbb {P} } ({\text{ error}}\mid x)=\operatorname {\mathbb {P} } (w_{2}\mid x)\;}
w
1
.
{\displaystyle \;w_{1}\;.}
ベイズの定理を 適用することで
P
(
w
i
∣
x
)
=
P
(
x
∣
w
i
)
P
(
w
i
)
P
(
x
)
{\displaystyle \operatorname {\mathbb {P} } (w_{i}\mid x)={\frac {\operatorname {\mathbb {P} } (x\mid w_{i})\operatorname {\mathbb {P} } (w_{i})}{\operatorname {\mathbb {P} } (x)}}}
、
さらに、すべてのエラーに対して同じ損失となるゼロまたは1の損失関数を想定すると、ベイズ決定規則は次のように再定式化できます。
h
Bayes
=
a
r
g
m
a
x
w
[
P
(
x
∣
w
)
P
(
w
)
]
,
{\displaystyle h_{\text{Bayes}}={\underset {w}{\operatorname {arg\;max} }}\,{\bigl [}\,\operatorname {\mathbb {P} } (x\mid w)\,\operatorname {\mathbb {P} } (w)\,{\bigr ]}\;,}
ここで は 予測値であり、 は 事前確率 です 。
h
Bayes
{\displaystyle h_{\text{Bayes}}}
P
(
w
)
{\displaystyle \;\operatorname {\mathbb {P} } (w)\;}
カルバック・ライブラー距離と交差エントロピーの最小化との関係
尤度を最大化する を 見つけることは、 カルバック・ライブラー・ダイバージェンス の観点から 、データが生成された実際の確率分布( によって生成された )からの距離が最小となる 確率分布( )を定義する を見つけることと漸近的に同等です。 [23] 理想的な世界では、P と Q は同じです(そして唯一不明なのは P を定義する です)が、たとえそうでなく、使用するモデルが誤って指定されていたとしても、MLE は実際の分布 に「最も近い」分布( に依存するモデル Q の制限内で )を提供します 。 [24]
θ
^
{\displaystyle {\hat {\theta }}}
θ
^
{\displaystyle {\hat {\theta }}}
Q
θ
^
{\displaystyle Q_{\hat {\theta }}}
P
θ
0
{\displaystyle P_{\theta _{0}}}
θ
{\displaystyle \theta }
θ
^
{\displaystyle {\hat {\theta }}}
P
θ
0
{\displaystyle P_{\theta _{0}}}
例
1 からn までの番号が付けられた n 枚の チケットが箱に入れられ、そのうち 1 枚がランダムに選択される 場合を考えます( 一様分布を 参照 )。したがって、サンプル サイズは 1 です 。n が不明の場合、 n の最大尤度推定量は、 抽選されたチケットの 番号 mです。(尤度は、 n < m の場合は 0 、 n ≥ m の場合は 1 ⁄ n で、これは n = m のときに最大になります 。n の最大尤度推定値は、可能な値 の範囲の「中央」のどこか (バイアスが少なくなる) ではなく、可能な値 { m 、 m + 1、...} の下限で発生することに注意してください。) 抽選されたチケットの 番号 mの 期待値、つまり の期待値は、( n + 1)/2です。結果として、サンプル サイズが 1 の場合、 n の最大尤度推定量は n を( n − 1)/2だけ 系統的に過小評価します 。
n
^
{\displaystyle {\widehat {n}}}
n
^
{\displaystyle {\widehat {n}}}
離散分布、有限パラメータ空間
不公平なコイン がどの程度偏っているかを判断したいとします。コインを投げて「 表 」 が出る確率を p とします。すると、目標は p を 決定することになります。
コインを 80 回投げると仮定します。つまり、サンプルは x 1 = H、 x 2 = T、...、 x 80 = T のようになり、 表 が出た 回数 「H」がカウントされます。
裏 が出る確率は 1 − p です(したがって、ここで p は上記の θ です )。結果が表が 49 回、 裏が 31 回で、コインが 3 枚のコインが入った箱から出されたとします。1 枚は確率 p = 1 ⁄ 3 で表が出、1 枚は確率p = 1 ⁄ 2 で表が出、もう 1 枚は確率 p = 2 ⁄ 3 で表 が出ます。コインのラベルは剥がされているため、どれだったかは不明です。最大尤度推定を使用すると、観測されたデータから、尤度が最大となるコインを見つけることができます。 サンプル サイズが 80、成功回数が 49 で p (「成功の確率」) が異なる 二項分布 の 確率質量関数を 使用すると、尤度関数 (以下で定義) は次の 3 つの値のいずれかになります。
P
[
H
=
49
∣
p
=
1
3
]
=
(
80
49
)
(
1
3
)
49
(
1
−
1
3
)
31
≈
0.000
,
P
[
H
=
49
∣
p
=
1
2
]
=
(
80
49
)
(
1
2
)
49
(
1
−
1
2
)
31
≈
0.012
,
P
[
H
=
49
∣
p
=
2
3
]
=
(
80
49
)
(
2
3
)
49
(
1
−
2
3
)
31
≈
0.054
.
{\displaystyle {\begin{aligned}\operatorname {\mathbb {P} } {\bigl [}\;\mathrm {H} =49\mid p={\tfrac {1}{3}}\;{\bigr ]}&={\binom {80}{49}}({\tfrac {1}{3}})^{49}(1-{\tfrac {1}{3}})^{31}\approx 0.000,\\[6pt]\operatorname {\mathbb {P} } {\bigl [}\;\mathrm {H} =49\mid p={\tfrac {1}{2}}\;{\bigr ]}&={\binom {80}{49}}({\tfrac {1}{2}})^{49}(1-{\tfrac {1}{2}})^{31}\approx 0.012,\\[6pt]\operatorname {\mathbb {P} } {\bigl [}\;\mathrm {H} =49\mid p={\tfrac {2}{3}}\;{\bigr ]}&={\binom {80}{49}}({\tfrac {2}{3}})^{49}(1-{\tfrac {2}{3}})^{31}\approx 0.054~.\end{aligned}}}
尤度は p = 2 ⁄ 3 のときに最大化されるため、これが p の 最大尤度推定値 となります。
離散分布、連続パラメータ空間
ここで、コインが1枚しかないが、その pは 0 ≤ p ≤ 1の任意の値を取ることができると仮定します 。 最大化される尤度関数は
L
(
p
)
=
f
D
(
H
=
49
∣
p
)
=
(
80
49
)
p
49
(
1
−
p
)
31
,
{\displaystyle L(p)=f_{D}(\mathrm {H} =49\mid p)={\binom {80}{49}}p^{49}(1-p)^{31}~,}
そして最大化は 0 ≤ p ≤ 1のすべての可能な値にわたって行われます。
二項過程の比率値の尤度関数( n = 10)
この関数を最大化する 1 つの方法は、 p について 微分し 、ゼロに設定することです 。
0
=
∂
∂
p
(
(
80
49
)
p
49
(
1
−
p
)
31
)
,
0
=
49
p
48
(
1
−
p
)
31
−
31
p
49
(
1
−
p
)
30
=
p
48
(
1
−
p
)
30
[
49
(
1
−
p
)
−
31
p
]
=
p
48
(
1
−
p
)
30
[
49
−
80
p
]
.
{\displaystyle {\begin{aligned}0&={\frac {\partial }{\partial p}}\left({\binom {80}{49}}p^{49}(1-p)^{31}\right)~,\\[8pt]0&=49p^{48}(1-p)^{31}-31p^{49}(1-p)^{30}\\[8pt]&=p^{48}(1-p)^{30}\left[49(1-p)-31p\right]\\[8pt]&=p^{48}(1-p)^{30}\left[49-80p\right]~.\end{aligned}}}
これは 3 つの項の積です。最初の項は p = 0 のとき 0 です。2 番目の項は p = 1 のとき 0 です。3 番目の項は p = 49 ⁄ 80 の とき 0 です。尤度を最大化する解は明らかに p = 49 ⁄ 80 です( p = 0 および p = 1 のとき尤度は 0 になるため)。したがって、 p の 最大尤度推定量は 49 ⁄ 80 です 。
この結果は、ベルヌーイ試行 の「成功」の観測数を表すために 49 の代わりに s などの文字を 、ベルヌーイ試行の数を表すために 80 の代わりに n などの文字を代入することで簡単に一般化できます。まったく同じ計算で s ⁄ n が得られ、これはs 回 の「成功」をもたらす n 回 のベルヌーイ試行の任意のシーケンスの最大尤度推定値です 。
連続分布、連続パラメータ空間
確率密度関数を 持つ 正規分布 の場合
N
(
μ
,
σ
2
)
{\displaystyle {\mathcal {N}}(\mu ,\sigma ^{2})}
f
(
x
∣
μ
,
σ
2
)
=
1
2
π
σ
2
exp
(
−
(
x
−
μ
)
2
2
σ
2
)
,
{\displaystyle f(x\mid \mu ,\sigma ^{2})={\frac {1}{{\sqrt {2\pi \sigma ^{2}}}\ }}\exp \left(-{\frac {(x-\mu )^{2}}{2\sigma ^{2}}}\right),}
n 個の独立した同一分布の 正規確率変数のサンプルに対する 対応する 確率密度関数 (尤度)は、
f
(
x
1
,
…
,
x
n
∣
μ
,
σ
2
)
=
∏
i
=
1
n
f
(
x
i
∣
μ
,
σ
2
)
=
(
1
2
π
σ
2
)
n
/
2
exp
(
−
∑
i
=
1
n
(
x
i
−
μ
)
2
2
σ
2
)
.
{\displaystyle f(x_{1},\ldots ,x_{n}\mid \mu ,\sigma ^{2})=\prod _{i=1}^{n}f(x_{i}\mid \mu ,\sigma ^{2})=\left({\frac {1}{2\pi \sigma ^{2}}}\right)^{n/2}\exp \left(-{\frac {\sum _{i=1}^{n}(x_{i}-\mu )^{2}}{2\sigma ^{2}}}\right).}
この分布族には θ = ( μ , σ ) という 2 つのパラメータがあります。したがって、両方のパラメータに対して同時に、または可能であれば個別に尤度を最大化します 。
L
(
μ
,
σ
2
)
=
f
(
x
1
,
…
,
x
n
∣
μ
,
σ
2
)
{\displaystyle {\mathcal {L}}(\mu ,\sigma ^{2})=f(x_{1},\ldots ,x_{n}\mid \mu ,\sigma ^{2})}
対数 関数自体は尤度の 範囲 にわたって 連続 的に増加する 関数であるため 、尤度を最大化する値はその対数も最大化します (対数尤度自体は必ずしも厳密に増加するわけではありません)。対数尤度は次のように表すことができます。
log
(
L
(
μ
,
σ
2
)
)
=
−
n
2
log
(
2
π
σ
2
)
−
1
2
σ
2
∑
i
=
1
n
(
x
i
−
μ
)
2
{\displaystyle \log {\Bigl (}{\mathcal {L}}(\mu ,\sigma ^{2}){\Bigr )}=-{\frac {\,n\,}{2}}\log(2\pi \sigma ^{2})-{\frac {1}{2\sigma ^{2}}}\sum _{i=1}^{n}(\,x_{i}-\mu \,)^{2}}
(注: 対数尤度は 情報エントロピー および フィッシャー情報 と密接に関連しています。)
この対数尤度の導関数を次のように計算します。
0
=
∂
∂
μ
log
(
L
(
μ
,
σ
2
)
)
=
0
−
−
2
n
(
x
¯
−
μ
)
2
σ
2
.
{\displaystyle {\begin{aligned}0&={\frac {\partial }{\partial \mu }}\log {\Bigl (}{\mathcal {L}}(\mu ,\sigma ^{2}){\Bigr )}=0-{\frac {\;-2n({\bar {x}}-\mu )\;}{2\sigma ^{2}}}.\end{aligned}}}
ここで 標本平均は である 。これは次のように解ける。
x
¯
{\displaystyle {\bar {x}}}
μ
^
=
x
¯
=
∑
i
=
1
n
x
i
n
.
{\displaystyle {\widehat {\mu }}={\bar {x}}=\sum _{i=1}^{n}{\frac {\,x_{i}\,}{n}}.}
これは確かに関数の最大値です。なぜなら、これは μ の唯一の転換点であり、2次導関数は厳密にゼロより小さいからです。その 期待値は 、与えられた分布のパラメータ μ に等しいです。
E
[
μ
^
]
=
μ
,
{\displaystyle \operatorname {\mathbb {E} } {\bigl [}\;{\widehat {\mu }}\;{\bigr ]}=\mu ,\,}
これは、最大尤度推定量 が偏りがないことを意味します。
μ
^
{\displaystyle {\widehat {\mu }}}
同様に、対数尤度を σ について微分すると、ゼロになります。
0
=
∂
∂
σ
log
(
L
(
μ
,
σ
2
)
)
=
−
n
σ
+
1
σ
3
∑
i
=
1
n
(
x
i
−
μ
)
2
.
{\displaystyle {\begin{aligned}0&={\frac {\partial }{\partial \sigma }}\log {\Bigl (}{\mathcal {L}}(\mu ,\sigma ^{2}){\Bigr )}=-{\frac {\,n\,}{\sigma }}+{\frac {1}{\sigma ^{3}}}\sum _{i=1}^{n}(\,x_{i}-\mu \,)^{2}.\end{aligned}}}
これは次のように解決される。
σ
^
2
=
1
n
∑
i
=
1
n
(
x
i
−
μ
)
2
.
{\displaystyle {\widehat {\sigma }}^{2}={\frac {1}{n}}\sum _{i=1}^{n}(x_{i}-\mu )^{2}.}
得られた
推定値を挿入する
μ
=
μ
^
{\displaystyle \mu ={\widehat {\mu }}}
σ
^
2
=
1
n
∑
i
=
1
n
(
x
i
−
x
¯
)
2
=
1
n
∑
i
=
1
n
x
i
2
−
1
n
2
∑
i
=
1
n
∑
j
=
1
n
x
i
x
j
.
{\displaystyle {\widehat {\sigma }}^{2}={\frac {1}{n}}\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}={\frac {1}{n}}\sum _{i=1}^{n}x_{i}^{2}-{\frac {1}{n^{2}}}\sum _{i=1}^{n}\sum _{j=1}^{n}x_{i}x_{j}.}
期待値を計算するには、式を平均ゼロのランダム変数(統計的誤差 ) で書き直すと便利です 。これらの変数で推定値を表すと、
δ
i
≡
μ
−
x
i
{\displaystyle \delta _{i}\equiv \mu -x_{i}}
σ
^
2
=
1
n
∑
i
=
1
n
(
μ
−
δ
i
)
2
−
1
n
2
∑
i
=
1
n
∑
j
=
1
n
(
μ
−
δ
i
)
(
μ
−
δ
j
)
.
{\displaystyle {\widehat {\sigma }}^{2}={\frac {1}{n}}\sum _{i=1}^{n}(\mu -\delta _{i})^{2}-{\frac {1}{n^{2}}}\sum _{i=1}^{n}\sum _{j=1}^{n}(\mu -\delta _{i})(\mu -\delta _{j}).}
上記の式を簡略化し、および という事実を利用すると 、次の式が得られます。
E
[
δ
i
]
=
0
{\displaystyle \operatorname {\mathbb {E} } {\bigl [}\;\delta _{i}\;{\bigr ]}=0}
E
[
δ
i
2
]
=
σ
2
{\displaystyle \operatorname {E} {\bigl [}\;\delta _{i}^{2}\;{\bigr ]}=\sigma ^{2}}
E
[
σ
^
2
]
=
n
−
1
n
σ
2
.
{\displaystyle \operatorname {\mathbb {E} } {\bigl [}\;{\widehat {\sigma }}^{2}\;{\bigr ]}={\frac {\,n-1\,}{n}}\sigma ^{2}.}
これは、推定量が に対して偏っていることを意味します。 が に対して偏っている ことも示されますが 、 と は両方 とも 一貫しています。
σ
^
2
{\displaystyle {\widehat {\sigma }}^{2}}
σ
2
{\displaystyle \sigma ^{2}}
σ
^
{\displaystyle {\widehat {\sigma }}}
σ
{\displaystyle \sigma }
σ
^
2
{\displaystyle {\widehat {\sigma }}^{2}}
σ
^
{\displaystyle {\widehat {\sigma }}}
正式には、 最大
尤度推定量 は
θ
=
(
μ
,
σ
2
)
{\displaystyle \theta =(\mu ,\sigma ^{2})}
θ
^
=
(
μ
^
,
σ
^
2
)
.
{\displaystyle {\widehat {\theta \,}}=\left({\widehat {\mu }},{\widehat {\sigma }}^{2}\right).}
この場合、MLE は個別に取得できます。ただし、通常はそうはならず、MLE は同時に取得する必要があります。
正規対数尤度が最大になると、次のような非常に単純な形になります。
log
(
L
(
μ
^
,
σ
^
)
)
=
−
n
2
(
log
(
2
π
σ
^
2
)
+
1
)
{\displaystyle \log {\Bigl (}{\mathcal {L}}({\widehat {\mu }},{\widehat {\sigma }}){\Bigr )}={\frac {\,-n\;\;}{2}}{\bigl (}\,\log(2\pi {\widehat {\sigma }}^{2})+1\,{\bigr )}}
この最大対数尤度は、より一般的な 最小二乗法 、さらには 非線形最小二乗法でも同じであることが示されます。これは、尤度に基づく近似 信頼区間 と 信頼領域を 決定する際によく使用され 、一般的に、上で説明した漸近正規性を使用するものよりも正確です。
非独立変数
変数が相関している、つまり独立していない場合があります。2つのランダム変数は 、 それらの結合確率密度関数が個々の確率密度関数の積である場合にのみ独立です。つまり、
y
1
{\displaystyle y_{1}}
y
2
{\displaystyle y_{2}}
f
(
y
1
,
y
2
)
=
f
(
y
1
)
f
(
y
2
)
{\displaystyle f(y_{1},y_{2})=f(y_{1})f(y_{2})\,}
ランダム変数から n 次のガウスベクトルを構築するとします 。 ここで、各変数の平均は で与えられます。さらに、 共分散 行列は で表されます。これらの n 個の ランダム変数の結合確率密度関数は 、次式で与えられる 多変量正規分布 に従います。
(
y
1
,
…
,
y
n
)
{\displaystyle (y_{1},\ldots ,y_{n})}
(
μ
1
,
…
,
μ
n
)
{\displaystyle (\mu _{1},\ldots ,\mu _{n})}
Σ
{\displaystyle {\mathit {\Sigma }}}
f
(
y
1
,
…
,
y
n
)
=
1
(
2
π
)
n
/
2
det
(
Σ
)
exp
(
−
1
2
[
y
1
−
μ
1
,
…
,
y
n
−
μ
n
]
Σ
−
1
[
y
1
−
μ
1
,
…
,
y
n
−
μ
n
]
T
)
{\displaystyle f(y_{1},\ldots ,y_{n})={\frac {1}{(2\pi )^{n/2}{\sqrt {\det({\mathit {\Sigma }})}}}}\exp \left(-{\frac {1}{2}}\left[y_{1}-\mu _{1},\ldots ,y_{n}-\mu _{n}\right]{\mathit {\Sigma }}^{-1}\left[y_{1}-\mu _{1},\ldots ,y_{n}-\mu _{n}\right]^{\mathrm {T} }\right)}
二変量 の場合 、結合確率密度関数は次のように表されます。
f
(
y
1
,
y
2
)
=
1
2
π
σ
1
σ
2
1
−
ρ
2
exp
[
−
1
2
(
1
−
ρ
2
)
(
(
y
1
−
μ
1
)
2
σ
1
2
−
2
ρ
(
y
1
−
μ
1
)
(
y
2
−
μ
2
)
σ
1
σ
2
+
(
y
2
−
μ
2
)
2
σ
2
2
)
]
{\displaystyle f(y_{1},y_{2})={\frac {1}{2\pi \sigma _{1}\sigma _{2}{\sqrt {1-\rho ^{2}}}}}\exp \left[-{\frac {1}{2(1-\rho ^{2})}}\left({\frac {(y_{1}-\mu _{1})^{2}}{\sigma _{1}^{2}}}-{\frac {2\rho (y_{1}-\mu _{1})(y_{2}-\mu _{2})}{\sigma _{1}\sigma _{2}}}+{\frac {(y_{2}-\mu _{2})^{2}}{\sigma _{2}^{2}}}\right)\right]}
この場合や、結合密度関数が存在するその他の場合では、尤度関数は、この密度を使用して、上記の「原則 」
のセクションで定義されます。
例
X
1
,
X
2
,
…
,
X
m
{\displaystyle X_{1},\ X_{2},\ldots ,\ X_{m}}
は 1 から m までのセル/ボックス内のカウントです。各ボックスには異なる確率があり (ボックスが大きいか小さいかを考えてください)、落ちるボールの数は に固定されます 。 各ボックスの確率は で 、制約条件はです。これ は が独立していない場合であり 、ベクトルの結合確率 は多項式と呼ばれ、次の形式になります。
n
{\displaystyle n}
x
1
+
x
2
+
⋯
+
x
m
=
n
{\displaystyle x_{1}+x_{2}+\cdots +x_{m}=n}
p
i
{\displaystyle p_{i}}
p
1
+
p
2
+
⋯
+
p
m
=
1
{\displaystyle p_{1}+p_{2}+\cdots +p_{m}=1}
X
i
{\displaystyle X_{i}}
x
1
,
x
2
,
…
,
x
m
{\displaystyle x_{1},\ x_{2},\ldots ,x_{m}}
f
(
x
1
,
x
2
,
…
,
x
m
∣
p
1
,
p
2
,
…
,
p
m
)
=
n
!
∏
x
i
!
∏
p
i
x
i
=
(
n
x
1
,
x
2
,
…
,
x
m
)
p
1
x
1
p
2
x
2
⋯
p
m
x
m
{\displaystyle f(x_{1},x_{2},\ldots ,x_{m}\mid p_{1},p_{2},\ldots ,p_{m})={\frac {n!}{\prod x_{i}!}}\prod p_{i}^{x_{i}}={\binom {n}{x_{1},x_{2},\ldots ,x_{m}}}p_{1}^{x_{1}}p_{2}^{x_{2}}\cdots p_{m}^{x_{m}}}
各ボックスを他のすべてのボックスに対して個別に見ると二項式となり、これはその拡張です。
この対数尤度は次のようになります。
ℓ
(
p
1
,
p
2
,
…
,
p
m
)
=
log
n
!
−
∑
i
=
1
m
log
x
i
!
+
∑
i
=
1
m
x
i
log
p
i
{\displaystyle \ell (p_{1},p_{2},\ldots ,p_{m})=\log n!-\sum _{i=1}^{m}\log x_{i}!+\sum _{i=1}^{m}x_{i}\log p_{i}}
制約を考慮してラグランジュ乗数を使用する必要があります。
L
(
p
1
,
p
2
,
…
,
p
m
,
λ
)
=
ℓ
(
p
1
,
p
2
,
…
,
p
m
)
+
λ
(
1
−
∑
i
=
1
m
p
i
)
{\displaystyle L(p_{1},p_{2},\ldots ,p_{m},\lambda )=\ell (p_{1},p_{2},\ldots ,p_{m})+\lambda \left(1-\sum _{i=1}^{m}p_{i}\right)}
すべての導関数を0とすると、最も自然な推定値が導かれる。
p
^
i
=
x
i
n
{\displaystyle {\hat {p}}_{i}={\frac {x_{i}}{n}}}
制約の有無にかかわらず対数尤度を最大化することは、閉じた形式では解決できない問題になる可能性があり、その場合は反復手順を使用する必要があります。
反復手順
特別な場合を除いて、尤度方程式
∂
ℓ
(
θ
;
y
)
∂
θ
=
0
{\displaystyle {\frac {\partial \ell (\theta ;\mathbf {y} )}{\partial \theta }}=0}
は推定量 に対して明示的に解くことはできません。代わりに、 反復的に 解く必要があります。つまり、 ( と仮定して) 初期推定値から始めて 、収束するシーケンス を取得しようとします 。この種の 最適化問題 には多くの手法がありますが、 [26] [27] 最も一般的に使用されるのは、次の形式の更新式に基づくアルゴリズムです。
θ
^
=
θ
^
(
y
)
{\displaystyle {\widehat {\theta }}={\widehat {\theta }}(\mathbf {y} )}
θ
{\displaystyle \theta }
θ
^
1
{\displaystyle {\widehat {\theta }}_{1}}
{
θ
^
r
}
{\displaystyle \left\{{\widehat {\theta }}_{r}\right\}}
θ
^
r
+
1
=
θ
^
r
+
η
r
d
r
(
θ
^
)
{\displaystyle {\widehat {\theta }}_{r+1}={\widehat {\theta }}_{r}+\eta _{r}\mathbf {d} _{r}\left({\widehat {\theta }}\right)}
ここでベクトルは r 番目の「ステップ」 の 下降方向を 示し、スカラーは 「ステップ長」 [28] [29]を表し、 学習率 [30] としても知られています 。
d
r
(
θ
^
)
{\displaystyle \mathbf {d} _{r}\left({\widehat {\theta }}\right)}
η
r
{\displaystyle \eta _{r}}
(注: ここでは最大化問題なので、勾配の前の符号は反転しています)
η
r
∈
R
+
{\displaystyle \eta _{r}\in \mathbb {R} ^{+}}
収束するには十分小さく、
d
r
(
θ
^
)
=
∇
ℓ
(
θ
^
r
;
y
)
{\displaystyle \mathbf {d} _{r}\left({\widehat {\theta }}\right)=\nabla \ell \left({\widehat {\theta }}_{r};\mathbf {y} \right)}
勾配降下法では、r 回目の反復で勾配を計算する必要がありますが、2 次導関数の逆数、つまりヘッセ行列を計算する必要はありません。そのため、ニュートン・ラプソン法よりも計算が高速です。
η
r
=
1
{\displaystyle \eta _{r}=1}
そして
d
r
(
θ
^
)
=
−
H
r
−
1
(
θ
^
)
s
r
(
θ
^
)
{\displaystyle \mathbf {d} _{r}\left({\widehat {\theta }}\right)=-\mathbf {H} _{r}^{-1}\left({\widehat {\theta }}\right)\mathbf {s} _{r}\left({\widehat {\theta }}\right)}
ここで、 は スコア 、は 対数尤度関数の ヘッセ行列 の 逆行列 であり、どちらも r 番目の反復を評価した。 [31] [32] しかし、ヘッセ行列の計算は 計算コストが高い ため、多くの代替法が提案されている。一般的な ベルント・ホール・ホール・ハウスマンアルゴリズムは、 期待される勾配の
外積 でヘッセ行列を近似し、
s
r
(
θ
^
)
{\displaystyle \mathbf {s} _{r}({\widehat {\theta }})}
H
r
−
1
(
θ
^
)
{\displaystyle \mathbf {H} _{r}^{-1}\left({\widehat {\theta }}\right)}
d
r
(
θ
^
)
=
−
[
1
n
∑
t
=
1
n
∂
ℓ
(
θ
;
y
)
∂
θ
(
∂
ℓ
(
θ
;
y
)
∂
θ
)
T
]
−
1
s
r
(
θ
^
)
{\displaystyle \mathbf {d} _{r}\left({\widehat {\theta }}\right)=-\left[{\frac {1}{n}}\sum _{t=1}^{n}{\frac {\partial \ell (\theta ;\mathbf {y} )}{\partial \theta }}\left({\frac {\partial \ell (\theta ;\mathbf {y} )}{\partial \theta }}\right)^{\mathsf {T}}\right]^{-1}\mathbf {s} _{r}\left({\widehat {\theta }}\right)}
他の準ニュートン法では、より複雑なセカント更新を使用してヘッセ行列の近似値を求めます。
DFP 式は、対称で正定値であり、2 次導関数の現在の近似値に最も近い解を見つけます。
H
k
+
1
=
(
I
−
γ
k
y
k
s
k
T
)
H
k
(
I
−
γ
k
s
k
y
k
T
)
+
γ
k
y
k
y
k
T
,
{\displaystyle \mathbf {H} _{k+1}=\left(I-\gamma _{k}y_{k}s_{k}^{\mathsf {T}}\right)\mathbf {H} _{k}\left(I-\gamma _{k}s_{k}y_{k}^{\mathsf {T}}\right)+\gamma _{k}y_{k}y_{k}^{\mathsf {T}},}
どこ
y
k
=
∇
ℓ
(
x
k
+
s
k
)
−
∇
ℓ
(
x
k
)
,
{\displaystyle y_{k}=\nabla \ell (x_{k}+s_{k})-\nabla \ell (x_{k}),}
γ
k
=
1
y
k
T
s
k
,
{\displaystyle \gamma _{k}={\frac {1}{y_{k}^{T}s_{k}}},}
s
k
=
x
k
+
1
−
x
k
.
{\displaystyle s_{k}=x_{k+1}-x_{k}.}
BFGS は対称かつ正定値の解も提供します。
B
k
+
1
=
B
k
+
y
k
y
k
T
y
k
T
s
k
−
B
k
s
k
s
k
T
B
k
T
s
k
T
B
k
s
k
,
{\displaystyle B_{k+1}=B_{k}+{\frac {y_{k}y_{k}^{\mathsf {T}}}{y_{k}^{\mathsf {T}}s_{k}}}-{\frac {B_{k}s_{k}s_{k}^{\mathsf {T}}B_{k}^{\mathsf {T}}}{s_{k}^{\mathsf {T}}B_{k}s_{k}}}\ ,}
どこ
y
k
=
∇
ℓ
(
x
k
+
s
k
)
−
∇
ℓ
(
x
k
)
,
{\displaystyle y_{k}=\nabla \ell (x_{k}+s_{k})-\nabla \ell (x_{k}),}
s
k
=
x
k
+
1
−
x
k
.
{\displaystyle s_{k}=x_{k+1}-x_{k}.}
BFGS法は、関数が最適値付近で2次 テイラー展開を 持たない限り、収束することが保証されません。しかし、BFGSは、非滑らかな最適化インスタンスでも許容できるパフォーマンスを発揮します。
もう一つの一般的な方法は、ヘッセ行列を フィッシャー情報行列 に置き換えて、フィッシャースコアリングアルゴリズムを得るというものです。この手順は、 一般化線形モデル などの多くの方法の推定において標準的です 。
I
(
θ
)
=
E
[
H
r
(
θ
^
)
]
{\displaystyle {\mathcal {I}}(\theta )=\operatorname {\mathbb {E} } \left[\mathbf {H} _{r}\left({\widehat {\theta }}\right)\right]}
準ニュートン法は一般的ではあるが、 必ずしも局所的または大域的最大値ではなく、 局所的最小値または 鞍点である 定常点に収束する可能性がある [33] 。したがって、解で評価されたヘッセ行列が 負定値かつ 条件付きであることを検証することにより、尤度方程式の得られた解の妥当性を評価することが重要である [ 34 ] 。
歴史
ロナルド・フィッシャー 、1913年
最大尤度法の初期の使用者には、 カール・フリードリヒ・ガウス 、 ピエール=シモン・ラプラス 、 ソルヴァルド・N・ティーレ 、 フランシス・イシドロ・エッジワース などがいます。 [35] [ 36]しかし、1912年から1922年の間にこの方法の現代版を独力で考案したのは ロナルド・フィッシャー でした 。 [37] [38]
最大尤度推定は、 1938年に サミュエル・S・ウィルクス が発表した証明(現在では ウィルクスの定理と呼ばれている)で、ついに ヒューリスティックな 正当性を超越した。 [39] この定理は、複数の独立した観測からの推定値の尤度値の対数の誤差が漸近的に χ 2 分布する ことを示しており、これにより、パラメータの推定値の周りの 信頼領域 を簡単に決定できる。ウィルクスの証明の唯一の難しい部分は、 フィッシャー情報 行列の期待値に依存しており、これはフィッシャーによって証明された定理によって提供される。 [40] ウィルクスは生涯を通じて定理の一般性を改良し続け、1962年に最も一般的な証明を発表した。 [41]
最大尤度推定法の開発に関するレビューは多くの著者によって提供されている。 [42] [43] [44] [45] [46] [47] [48] [49]
参照
数学ポータル
その他の推定方法
参考文献
^ Rossi, Richard J. (2018). 数理統計学:尤度に基づく推論入門 . ニューヨーク:John Wiley & Sons. p. 227. ISBN 978-1-118-77104-4 。
^ Hendry, David F. ; Nielsen, Bent (2007). 計量経済モデリング: 尤度アプローチ . プリンストン: プリンストン大学出版局. ISBN 978-0-691-13128-3 。
^
^ ウォード、マイケル・ドン 、アルキスト、ジョン・S(2018)。 社会科学のための最大尤度:分析戦略 。ニューヨーク:ケンブリッジ大学出版局 。ISBN 978-1-107-18582-1 。
^ Press, WH; Flannery, BP; Teukolsky, SA; Vetterling, WT (1992)。「最大尤度推定器としての最小二乗法」。FORTRAN の数値レシピ: 科学計算の技術 (第 2 版)。ケンブリッジ: ケンブリッジ大学出版局。651 ~ 655 ページ 。ISBN 0-521-43064-X 。
^ Myung, IJ (2003). 「最大尤度推定に関するチュートリアル」. 数学心理学ジャーナル . 47 (1): 90–100. doi :10.1016/S0022-2496(02)00028-7.
^ Gourieroux, Christian; Monfort, Alain (1995). 統計と計量経済学モデル . ケンブリッジ大学出版局. p. 161. ISBN 0-521-40551-3 。
^ ケイン、エドワード J. (1968)。 経済統計と計量経済学 。ニューヨーク、NY:ハーパー&ロウ。p.179。
^ Small, Christoper G.; Wang, Jinfang (2003). 「根を使った作業」 非線形方程式の数値的推定法 オックスフォード大学出版局 pp. 74–124. ISBN 0-19-850688-0 。
^ Kass, Robert E.; Vos, Paul W. (1997). 漸近的推論の幾何学的基礎. ニューヨーク、NY: John Wiley & Sons. p. 14. ISBN
0-471-82668-5 。
^ Papadopoulos、Alecos (2013 年 9 月 25 日)。「MLE (最大尤度推定) を使用する場合、結合 pdf の前に必ず log() を置くのはなぜですか?」。 Stack Exchange 。
^ ab Silvey, SD (1975). 統計的推論. ロンドン、イギリス: Chapman and Hall. p. 79. ISBN 0-412-13820-4 。
^ Olive, David (2004). 「MLE は尤度を最大化するか?」 ( PDF) 南イリノイ大学 。
^ Schwallie, Daniel P. (1985). 「正定値最大尤度共分散推定量」. Economics Letters . 17 (1–2): 115–117. doi :10.1016/0165-1765(85)90139-9.
^ マグナス、ヤン・R. (2017). 計量経済学の理論入門 . アムステルダム: VU大学出版局. pp. 64–65. ISBN 978-90-8659-766-6 。
^ ファンツァグル(1994年、206ページ)
^ Newey, Whitney K.、 McFadden, Daniel (1994)の定理 2.5 による 。「第 36 章: 大規模サンプル推定と仮説検定」。Engle, Robert、McFadden, Dan (編)。 計量経済学ハンドブック、第 4 巻 。Elsevier Science。pp. 2111–2245。ISBN 978-0-444-88766-5 。
^ ab Newey, Whitney K.; McFadden, Daniel (1994)の定理 3.3 による 。「第 36 章: 大規模サンプル推定と仮説検定」。Engle, Robert; McFadden, Dan (編)。 計量経済学ハンドブック、第 4 巻 。Elsevier Science。pp. 2111–2245。ISBN 978-0-444-88766-5 。
^ ザックス、シェレミヤフ(1971年)。 統計的推論の理論 。ニューヨーク:ジョン・ワイリー・アンド・サンズ 。p.223。ISBN 0-471-98103-6 。
^ Cox, David R. ; Snell, E. Joyce (1968) の公式 20 を参照。「残差の一般的な定義」。Journal of the Royal Statistical Society、シリーズ B。30 ( 2
) : 248–275。JSTOR 2984505 。
^ 加納 豊 (1996). 「3次効率は4次効率を意味する」. 日本統計学会誌 . 26 : 101–117. doi : 10.14490/jjss1995.26.101 .
^ Christensen, Henrikt I. 「パターン認識」 (PDF) (講義)。ベイズ決定理論 - CS 7616。ジョージア工科大学。
^ cmplx96 (https://stats.stackexchange.com/users/177679/cmplx96)、Kullback–Leibler ダイバージェンス、URL (バージョン: 2017-11-18): https://stats.stackexchange.com/q/314472 (YouTube ビデオの 13 分から 25 分をご覧ください)
^ 統計的推論入門 | スタンフォード (講義 16 — モデル誤指定時の MLE)
^ Sycorax says Reinstate Monica (https://stats.stackexchange.com/users/22311/sycorax-says-reinstate-monica)、尤度の最大化とクロスエントロピーの最小化の関係、URL (バージョン: 2019-11-06): https://stats.stackexchange.com/q/364237
^ フレッチャー、R. (1987)。 最適化の実践的方法 (第2版)。ニューヨーク、NY:ジョン・ワイリー・アンド・サンズ 。ISBN
0-471-91547-5 。
^ Nocedal, Jorge ; Wright, Stephen J. (2006). 数値最適化 (第2版). ニューヨーク、NY: Springer. ISBN
0-387-30303-0 。
^ ダガンゾ、カルロス(1979年)。 多項式プロビット:理論と需要予測への応用 。ニューヨーク:アカデミック・プレス 。pp.61-78。ISBN 0-12-201150-3 。
^ ウィリアム・グールド、ジェフリー・ピットブラッド、ブライアン・ポイ(2010年)。Stata による 最大尤度推定 (第4版)。カレッジステーション:Stata Press。pp.13–20。ISBN 978-1-59718-078-8 。
^ マーフィー、ケビン・P. (2012)。機械学習:確率論的視点。ケンブリッジ:MITプレス。p. 247。ISBN 978-0-262-01802-9 。
^ 雨宮武 (1985). 上級計量経済学. ケンブリッジ: ハーバード大学出版局. pp. 137–138. ISBN 0-674-00560-0 。
^ サーガン、デニス (1988)。「数値最適化の方法」。 上級計量経済理論に関する講義ノート 。オックスフォード: バジル ブラックウェル。pp. 161–169。ISBN 0-631-14956-2 。
^ Avriel, Mordecai (1976)の定理 10.1 を参照
。非線形計画法: 分析と方法。Englewood Cliffs、NJ: Prentice-Hall。pp. 293–294。ISBN 978-0-486-43227-4 。
^ ギル、フィリップ E.、マレー、ウォルター、 ライト、マーガレット H. (1981)。 実践的最適化 。ロンドン、イギリス: アカデミック プレス。pp. 312–313。ISBN
0-12-283950-1 。
^ エッジ ワース、フランシス・Y. (1908 年9月) 。 「頻度定数の推定誤差について」。 王立統計学会誌 。71 (3):499–512。doi :10.2307/2339293。JSTOR 2339293。
^ エッジワース、フランシス・Y. (1908 年 12 月)。「頻度定数の推定誤差について」。 王立統計学会誌 。71 (4):651–678。doi :10.2307/2339378。JSTOR 2339378。
^ プファングル、ヨハン (1994)。 パラメトリック統計理論 。 ウォルター・デ・グルイテル 。 207~208ページ。 土井 :10.1515/9783110889765。 ISBN
978-3-11-013863-4 . MR 1291393。
^ Hald, Anders (1999). 「逆確率と最小二乗法との関係における最大尤度の歴史について」. 統計科学 . 14 (2): 214–222. ISSN 0883-4237.
^ Wilks, SS (1938). 「複合仮説をテストするための尤度比の大規模サンプル分布」 Annals of Mathematical Statistics 9 : 60–62. doi : 10.1214 /aoms/1177732360 .
^ Owen, Art B. (2001). Empirical Likelihood . ロンドン、イギリス; ボカラトン、フロリダ: Chapman & Hall; CRC Press. ISBN
978-1-58488-071-4 。
^ ウィルクス、サミュエル S. (1962)。 数理統計学 。ニューヨーク、NY:ジョン・ワイリー・アンド・サンズ 。ISBN
978-0-471-94650-2 。
^ サベージ、レナード J. ( 1976)。「 RA フィッシャーの再読について」。 統計年報 。4 (3): 441–500。doi : 10.1214 /aos/1176343456。JSTOR 2958221 。
^ Pratt, John W. (1976). 「FY EdgeworthとRA Fisherによる最大尤度推定の効率性について」. The Annals of Statistics . 4 (3): 501–514. doi : 10.1214/aos/1176343457 . JSTOR 2958222.
^ スティグラー 、スティーブン・M. ( 1978)。「フランシス・イシドロ・エッジワース、統計学者」。 王立 統計学会誌、シリーズA。141 ( 3): 287–322。doi :10.2307/2344804。JSTOR 2344804。
^ スティグラー、スティーブン・M(1986年)。統計の歴史:1900年以前の不確実性の測定。ハーバード大学出版局 。ISBN
978-0-674-40340-6 。
^ スティグラー、スティーブン・M(1999)。 表の統計:統計概念と方法の歴史 。ハーバード大学出版局 。ISBN
978-0-674-83601-3 。
^ Hald, Anders (1998). 1750年から1930年までの数理統計学の歴史 。ニューヨーク、NY: Wiley。ISBN 978-0-471-17912-2 。
^ Hald, Anders (1999). 「逆確率と最小二乗法との関係における最大尤度の歴史について」. 統計科学 . 14 (2): 214–222. doi : 10.1214/ss/1009212248 . JSTOR 2676741.
^ Aldrich, John (1997). 「RA Fisherと最大尤度法の考案 1912–1922」. 統計科学 . 12 (3): 162–176. doi : 10.1214/ss/1030037906 . MR 1617519.
さらに読む
Cramer, JS (1986)。最尤法の計量経済学的応用。ニューヨーク、NY:ケンブリッジ大学出版局 。ISBN 0-521-25317-9 。
エリアソン、スコット R. (1993)。 最大尤度推定: 論理と実践 。ニューベリーパーク: セージ 。ISBN 0-8039-4107-2 。
キング、ゲイリー (1989)。 『統一的政治方法論:統計的推論の類似性理論 』ケンブリッジ大学出版局 。ISBN 0-521-36697-6 。
Le Cam, Lucien (1990). 「最大尤度: 入門」 ISI Review . 58 (2): 153–171. doi :10.2307/1403464. JSTOR 1403464.
マグナス、ヤン・R. (2017)。「最大尤度」。 計量経済学の理論入門 。アムステルダム、オランダ:VU大学出版局。pp. 53–68。ISBN 978-90-8659-766-6 。
ミラー、ラッセル B. (2011)。 最大尤度推定と推論 。ホーボーケン、ニュージャージー州: Wiley。ISBN 978-0-470-09482-2 。
ピクルス、アンドリュー(1986)。 尤度分析入門 。ノーリッチ:WHハッチンズ&サンズ 。ISBN 0-86094-190-6 。
セヴェリーニ、トーマス A. (2000)。 統計における尤度法 。ニューヨーク、NY: オックスフォード大学出版局 。ISBN 0-19-850650-3 。
Ward, Michael D. ; Ahlquist, John S. (2018). 社会科学のための最大尤度: 分析戦略 . ケンブリッジ大学出版局. ISBN 978-1-316-63682-4 。
外部リンク
Tilevik, Andreas (2022). 線形回帰における最大尤度と最小二乗法 (ビデオ)
「最大尤度法」、 数学百科事典 、 EMS Press 、2001 [1994]
パーセル、S.「最大尤度推定」。
Sargent, Thomas ; Stachurski, John. 「最大尤度推定」。Python による 定量経済学 。
オット、トゥーメット。ヘニングセン、アルネ (2019-05-19)。 「maxLik: R の最尤推定用パッケージ」。
レッサー、ローレンス M. (2007)。「『MLE』の歌詞」。テキサス大学 理学部数学科学科。 テキサス州エルパソ。 2021年3月6日 閲覧 。