統計学において、最尤推定法(MLE )は、観測データに基づいて仮定された確率分布のパラメータを推定する方法です。これは、仮定された統計モデルの下で観測データが最も起こりやすいように尤度関数を最大化することによって達成されます。尤度関数を最大化するパラメータ空間の点を最尤推定値と呼びます。[ 1 ]最尤法の論理は直感的かつ柔軟であるため、この方法は統計的推論の主要な手段となっています。[ 2 ] [ 3 ] [ 4 ]
尤度関数が微分可能であれば、最大値を求めるための導関数テストを適用できます。場合によっては、尤度関数の一次条件を解析的に解くことができます。例えば、線形回帰モデルの通常の最小二乗推定量は、ランダム誤差が同じ分散の正規分布に従うと仮定した場合に尤度を最大化します。 [ 5 ]
ベイズ推論の観点から見ると、最尤推定量(MLE)は一般的に、対象領域で一様分布の事前分布を用いた最大事後確率推定(MAP推定)と同等である。頻度論的推論においては、MLEは極値推定量の特殊なケースであり、目的関数は尤度である。
観測値の集合を、一連のパラメータで表される未知の同時確率分布からのランダムサンプルとしてモデル化します。最尤推定の目標は、観測データが最高の同時確率を持つパラメータを決定することです。同時分布を支配するパラメータをベクトルとして記述します。この分布がパラメトリック族に属するようにどこはパラメータ空間と呼ばれ、ユークリッド空間の有限次元部分集合です。観測データサンプルにおける同時密度の評価実数値関数を与える、 ;\mathbf {y} )=f_{n}(\mathbf {y} ;\theta )\;,} これは尤度関数 と呼ばれます。独立した確率変数の場合、 ;\theta )} は 単変量密度関数の積になります。 ;\theta )=\prod _{k=1}^{n}\,f_{k}^{\mathsf {univar}}(y_{k};\theta )~.}
最尤推定の目標は、パラメータ空間上で尤度関数を最大化するモデルパラメータの値を見つけることである[ 6 ]。すなわち、
直感的に言えば、これは観測データが最も起こりやすいパラメータ値を選択する。具体的な値は尤度関数を最大化するこれは最尤推定値と呼ばれます。さらに、関数が定義された関数が測定可能である場合、それは最尤推定量と呼ばれます。一般に、これは標本空間上で定義された関数であり、与えられた標本を引数として取ります。その存在のための十分条件ではあるが、必要条件ではない条件は、尤度関数がパラメータ空間上で連続であることです。それはコンパクトである。[ 7 ]開放型の場合尤度関数は、最大値に達することなく増加する可能性がある。
実際には、尤度関数の自然対数、すなわち対数尤度を用いる方が便利な場合が多い。 対数は単調関数であるため、同じ値で発生します最大[ 8 ]もし微分可能最大値(または最小値)が発生するための 必要条件は以下のとおりです。 尤度方程式として知られています。一部のモデルでは、これらの方程式は明示的に解くことができます。しかし一般に、最大化問題の閉形式解は知られておらず、また利用もできないため、最尤推定値は数値最適化によってのみ求めることができる。別の問題は、有限サンプルでは尤度方程式に複数の根が存在する可能性があることである。 [ 9 ]特定された根が尤度方程式の(局所)最大値は、2階偏微分と交差偏微分の行列、いわゆるヘッセ行列が
負半正定値これは局所的な凹性を示している。都合の良いことに、最も一般的な確率分布、特に指数族は対数的に凹である。[ 10 ] [ 11 ]
尤度関数の定義域であるパラメータ空間は、一般にユークリッド空間の有限次元部分集合ですが、推定プロセスに追加の制約を組み込む必要がある場合もあります。パラメータ空間は次のように表すことができます。 :\theta \in \mathbb {R} ^{k},\;h(\theta )=0\right\}~,}
どこはベクトル値関数マッピングですの中へ真のパラメータを推定するに属する実際には、制約条件の下で尤度関数の最大値を求めることを意味する。
理論的には、この制約付き最適化問題に対する最も自然なアプローチは、代入法、つまり制約を「埋める」方法である。セットへそのような方法では からの一対一関数です自身に、そして尤度関数を再パラメータ化して、[ 12 ]最尤推定量の等変性により、最尤推定量の性質は制限付き推定値にも適用されます。 [ 13 ]例えば、多変量正規分布共分散行列は正定値でなければならない。この制約は、置き換えることによって課すことができる。どこは実数の上三角行列であり、は転置である。[ 14 ]
実際には、制約は通常ラグランジュ法を用いて課され、上記のように定義された制約条件が与えられると、制約付き尤度方程式が得られる。そして
どこはラグランジュ乗数の列ベクトルであり、は偏微分のk × rヤコビ行列です。 [ 12 ]当然、制約が最大で拘束的でない場合、ラグランジュ乗数はゼロになるはずです。[ 15 ]これにより、ラグランジュ乗数テストとして知られる、制約の「妥当性」の統計的テストが可能になります。
ノンパラメトリック最尤推定は、経験尤度を用いて実行できます。
サポート法は、データセットから推論を行うために使用される手法です。AWF Edwards [ 16 ]によると、サポート法は、特定のパラメータ値に対するデータセットによって誘導される相対的なサポート、つまり対数尤度の観点から、未知のパラメータについて推論を行うことを目的としています。この手法は、事前情報が利用可能かどうかに関わらず使用できます。最尤法はサポート法の一部ですが、サポート法は、そのサポートによって定義される信頼領域も提供することに注意してください。
最尤推定量は、θの関数として目的関数を最大化することによって得られる極値推定量である。データが独立かつ同一の分布に従う場合、次のようになります 。 これは期待対数尤度のサンプル類似物であるここで、この期待値は真の密度に関して取られる。
最尤推定量は有限サンプルに対して最適な特性を持たない。つまり、(有限サンプルで評価した場合)他の推定量の方が真のパラメータ値の周りに集中する可能性がある。[ 17 ]しかし、他の推定方法と同様に、最尤推定には魅力的な極限特性がいくつかある。サンプルサイズが無限大に近づくにつれて、最尤推定量の系列は次のような特性を持つ。
以下に概説する条件の下では、最尤推定量は一致性を持つ。一致性とは、データが次のように生成された場合、観測値nが十分に大きい場合、 θ 0の値を任意の精度で求めることができます。数学的に言えば、n が無限大に近づくにつれて推定値は確率的に真の値に収束する:
やや厳しい条件下では、推定量はほぼ確実に(または強く)収束する。
実際のアプリケーションでは、データは決して。 それよりも、これは、データによって生成されるプロセスを、多くの場合理想化された形でモデル化したものです。統計学では、「すべてのモデルは間違っている」という格言がよく知られています。したがって、実際の応用においては真の整合性は実現しません。しかしながら、整合性は推定量が持つべき望ましい特性であるとよく考えられています。
一貫性を確立するためには、以下の条件が十分である。[ 18 ]

識別条件は、対数尤度が唯一のグローバル最大値を持つことを規定する。コンパクト性とは、尤度が他の点で最大値に任意に近づくことができないことを意味する(例えば、右の図に示されているように)。
コンパクト性は十分条件であって、必要条件ではありません。コンパクト性は、次のような他の条件で置き換えることができます。
優位条件は、 iid観測の場合に適用できます。非 iid の場合、確率の一様収束は、数列が次のようになることを示すことで確認できます。確率的に等連続である。
ML推定器がθ 0 にほぼ確実に収束する場合、より強い一様収束の条件をほぼ確実に課す必要がある。
さらに、(上記のように仮定したように)データが生成された場合そして、特定の条件下では、最尤推定量が分布において正規分布に収束することも示せる。具体的には、 [ 19 ] ここで、Iはフィッシャー情報行列です。
最尤推定量は、観測データに可能な限り最大の確率(連続データの場合は確率密度)を与えるパラメータ値を選択します。パラメータが複数の成分から構成されている場合、完全なパラメータの最尤推定量の対応する成分として、それぞれの成分の最尤推定量を定義します。これと整合して、は、、そしてもしは、すると、MLE は定義により[ 20 ]
これは、いわゆるプロファイル尤度を最大化するものです。
:\alpha =g(\theta )}L(\theta ).\,}
MLEは、データの特定の変換に関しても同変です。どこが1対1であり、推定されるパラメータに依存しない場合、密度関数は以下を満たす。
したがって、尤度関数は次のようになります。そして両者の違いは、モデルパラメータに依存しない要因のみによる。
例えば、対数正規分布の最尤推定パラメータは、データの対数に適合させた正規分布のパラメータと同じです。実際、対数正規分布の場合、、 それからY は対数正規分布に従います。Y の密度は以下に従います。標準ノーマルと、のために。
上記のように仮定すると、データが生成された場合そして、特定の条件下では、最尤推定量が分布収束して正規分布になることも示せる。これは√n一致 性があり、漸近的に効率的である。つまり、クラメール・ラオ限界に達する。具体的には、[ 19 ]
どこフィッシャー情報行列は次のとおりです。
特に、これは最尤推定量のバイアスが1 / √ nの オーダーまでゼロに等しいことを意味します。
しかし、この推定量の分布の展開における高次の項を考慮すると、 θ mle には1 ⁄ nのオーダーのバイアスがあることがわかります。このバイアスは (成分ごとに) [ 21 ]に等しくなります。
どこ(上付き文字付き)は、逆フィッシャー情報行列の( j,k)番目の成分を表す。、 そして
これらの式を用いることで、最尤推定量の2次バイアスを推定し、そのバイアスを差し引くことで 補正することが可能です。この推定量は1 / nの 項まで不偏であり、バイアス補正最大尤度推定量と呼ばれます。
このバイアス補正推定量は、(少なくとも曲線指数族内では)2次効率であり、 1/n²の項までのすべての2次バイアス補正推定量の中で最小の平均二乗誤差を持つことを意味します。このプロセスを継続して、3次バイアス補正項などを導出することも可能です。ただし、最尤推定量は3次効率ではありません。 [ 22 ]
パラメータに関する一様事前分布が与えられた場合、最尤推定量は最も確率の高いベイズ推定量と一致する。実際、最大事後推定値は、ベイズの定理によって与えられる、データが与えられた場合のθの確率を最大化するパラメータθである。
どこはパラメータθの事前分布であり、は、すべてのパラメータについて平均化されたデータの確率です。分母はθに依存しないため、ベイズ推定量は、を最大化することによって得られます。θに関して。さらに、事前のが一様分布である場合、ベイズ推定量は尤度関数を最大化することによって得られる。したがって、ベイズ推定量は一様事前分布に対する最尤推定量と一致する。。
機械学習における多くの実用的な応用例では、パラメータ推定のモデルとして最尤推定法が用いられる。
ベイズ決定理論は、総期待リスクを最小化する分類器の設計に関するものであり、特に、異なる決定に関連するコスト(損失関数)が等しい場合、分類器は分布全体にわたって誤差を最小化します。[ 23 ]
したがって、ベイズ決定ルールは次のように表される。
どここれらは異なるクラスの予測です。誤差を最小化するという観点からは、次のように述べることもできます。 どこ もし私たちが決めたらそしてもし私たちが決めたら
ベイズの定理を適用することで さらに、すべてのエラーに対して同じ損失となるゼロまたはイチの損失関数を仮定すると、ベイズ決定ルールは次のように再定式化できます。 どこ予測とは事前確率です。
発見尤度を最大化するものは、漸近的に次のことと同等である。確率分布を定義する()カルバック・ライブラー情報量の観点から、我々のデータが生成された実際の確率分布(すなわち、によって生成された)との距離が最小となる分布。[ 24 ]理想的な世界では、PとQは同じであり、(そして唯一未知のものはP を定義するモデルであるが、そうでない場合や、使用するモデルが誤って指定されている場合でも、MLE は「最も近い」分布 (モデル Q が依存する制約内) を与える。実際の分布へ[ 25 ]
パラメータの最尤推定値を確率密度関数、累積分布関数、または分位関数の式に代入することで、サンプル外イベントの確率または分位値の予測を生成できます。この確率予測方法は、統計学の教科書[ 27 ] [ 28 ] [ 29 ]やアクチュアリーの教科書[ 30 ]で推奨されており、科学文献でも広く使用されています。しかし、最尤予測では、最尤パラメータ推定値の不確実性が予測に反映されません[ 31 ] [ 32 ] 。その結果、予測された確率は適切に較正されておらず、サンプル外イベントの頻度と一致するとは期待できません。特に、裾超過確率と裾超過分位値は通常過小評価され、場合によっては大幅に過小評価されます。過小評価は、訓練データが少ない場合、推定されるパラメータが多い場合、および裾の遠い場合に最も大きくなります。この予測バイアスが問題となる場合、事前分布をバイアスを軽減または排除するように選択すれば、ベイズ予測が解決策となる可能性がある。[ 33 ] [ 34 ] [ 35 ]
1からnまでの番号が振られたn枚のチケットが箱に入れられ、そこから1枚がランダムに選ばれる場合を考えます(一様分布を参照)。したがって、サンプルサイズは1です。nが不明な場合、最尤推定量はnの期待値は、引かれたチケットの番号mです。( n < mの場合は尤度は 0 、n ≥ mの場合は1 / nであり、 n = mのときに最大になります。n の最尤推定値は、可能な値の範囲の「中間」ではなく、可能な値 { m , m + 1, ...} の下限で発生することに注意してください。これにより、バイアスが少なくなります。)引かれたチケットの番号mの期待値、したがって期待値は、 、は ( n + 1)/2 です。その結果、サンプルサイズが 1 の場合、nの最尤推定量は、 n を( n − 1)/2 だけ系統的に過小評価することになります 。
不公平なコインがどれほど偏っているかを判断したいとしましょう。表が出る確率を p とします。すると、目標はpを決定することになります。
コインを80回投げたとします。つまり、サンプルはx 1 = H、x 2 = T、...、x 80 = T のようになり、表 「H」が出た回数が観測されます。
裏が出る確率は1 − pです(ここでpは上記のθです)。結果が表 49回、裏31 回だったとします。コインは 3 枚のコインが入った箱から取り出されたとします。1 枚は表が出る確率がp = 1 / 3、1枚は表が出る確率がp = 1/2 、もう1枚は表が出る確率がp = 2/3です。コインにはラベルが付いていないため、どれが表だったかはわかりません。最尤推定法を用いると、観測されたデータに基づいて、最も尤度の高いコインを見つけることができます。サンプルサイズが 80、成功回数が 49 で、p (「成功の確率」) の値が異なる二項分布の確率質量関数を用いると、尤度関数 (以下で定義) は 3 つの値のいずれかをとります。
p = 2/3のときに尤度が最大化されるため、これがpの最尤推定値となります。
ここで、コインは1枚しかなく、そのpの値は0 ≤ p ≤ 1の任意の値を取り得ると仮定します。最大化すべき尤度関数は次のようになります。
そして最大化は、0 ≤ p ≤ 1 のすべての可能な値に対して行われます。

この関数を最大化する一つの方法は、pに関して微分してゼロに設定することです。
これは3つの項の積です。第1項はp = 0のときに0になります。第2項はp = 1のときに0になります。第3項はp = 49/80のときに0になります。尤度を最大化する解は明らかにp = 49/80です (p = 0と p = 1では尤度が0になるため)。したがって、pの最尤推定値は49/80です。
この結果は、ベルヌーイ試行の「成功」回数を表す文字として49の代わりにsを、ベルヌーイ試行の回数を表す文字として80の代わりにnを代入することで容易に一般化できます。全く同じ計算により、 s回の「成功」をもたらすn回のベルヌーイ試行の任意のシーケンスに対する最尤推定値であるs / nが得られます。
n個の独立同分布正規乱数(尤度)の標本に対応する確率密度関数は
この分布族には 2 つのパラメータがあります: θ = ( μ , σ ) ;したがって、尤度を最大化します。両方のパラメータを同時に、または可能であれば個別に検討する。
対数関数自体は尤度の範囲において連続的に厳密に増加する関数であるため、尤度を最大化する値は対数も最大化します(対数尤度自体は必ずしも厳密に増加するとは限りません)。対数尤度は次のように表すことができます。
(注:対数尤度は情報エントロピーおよびフィッシャー情報量と密接に関連しています。)
次に、この対数尤度の導関数を以下のように計算します。
どこは標本平均です。これは次のように解決されます。
これは確かに関数の最大値です。なぜなら、これはμの唯一の変曲点であり、2階微分が厳密にゼロより小さいからです。その期待値は、与えられた分布のパラメータμに等しくなります。
つまり、最尤推定量は公平である。
同様に、対数尤度をσに関して微分し、ゼロに等しいとおく。
これは、
見積もりを挿入する我々は得る
期待値を計算するには、式を平均ゼロの確率変数(統計誤差) で書き換えるのが便利です。これらの変数で推定値を表現すると、
上記の式を簡略化するために、そしてこれによって、
これは推定器が偏っているまた、以下のことも示せる。偏っているしかし両方ともそして一貫性がある。
正式には、最大尤度推定量はは
この場合、最尤推定値は個別に求めることができる。しかし、一般的にはそうではなく、最尤推定値は同時に求める必要がある。
通常の対数尤度は、最大値において特に単純な形をとる。
この最大対数尤度は、より一般的な最小二乗法、さらには非線形最小二乗法においても同じであることが示されています。これは、尤度に基づく近似信頼区間や信頼領域を決定する際によく用いられ、これらは一般的に、上述の漸近正規性を用いるものよりも精度が高いです。
変数間に相関関係がある場合、あるいはより一般的には独立していない場合がある。2つの確率変数そしてそれらの結合確率密度関数が個々の確率密度関数の積である場合に限り、それらは独立である。
ランダム変数からn次のガウスベクトルを構築すると仮定する、各変数の平均値は次式で与えられる。さらに、共分散行列を次のように表す。これらのn 個の確率変数の同時確率密度関数は、次式で与えられる多変量正規分布に従います。
二変量の場合、同時確率密度関数は次のように表されます。
この場合や、結合密度関数が存在するその他の場合において、尤度関数は上記の「原理」の項で定義したように、この密度関数を用いて定義されます。
はセル/ボックス1からmまでのカウントです。各ボックスには異なる確率があり(ボックスが大きいか小さいかを考えてください)、落下するボールの数を固定します。:各ボックスの確率はただし、制約条件があります。これは、sは独立ではないので、ベクトルの同時確率はこれは多項式と呼ばれ、次の形式をとります。
各ボックスを他のすべてのボックスと個別に比較すると二項分布となり、これはその拡張である。
この事象の対数尤度は次のとおりです。
制約条件を考慮に入れ、ラグランジュ乗数を用いる必要がある。
すべての導関数を0と仮定すると、最も自然な推定値が得られる。
制約の有無にかかわらず、対数尤度を最大化する問題は、閉形式では解けない問題となる場合があり、その場合は反復手順を用いる必要がある。
特殊な場合を除き、尤度方程式は ;\mathbf {y} )}{\partial \theta }}=0}
推定量に対して明示的に解くことはできない代わりに、それらは反復的に解く必要があります。初期推定値から始めて、(言う収束する数列を得ようとするこの種の最適化問題には多くの手法が存在するが、[ 36 ] [ 37 ]最も一般的に使用されているのは、次の形式の更新式に基づくアルゴリズムである 。
ベクトルはr番目の「ステップ」の下降方向を示し、スカラー「ステップ長」[ 38 ] [ 39 ] 、学習率[ 40 ]としても知られるものを捉えます。
(注:ここでは最大化問題なので、勾配の前の符号が反転しています)
それは収束するには十分小さく、
勾配降下法では、 r回目の反復における勾配を計算する必要があるが、2階微分の逆行列、すなわちヘッセ行列を計算する必要はない。そのため、ニュートン・ラフソン法よりも計算速度が速い。
そして
どこスコアとは、 r番目の反復で評価された対数尤度関数のヘッセ行列の逆行列です。 [ 41 ] [ 42 ]しかし、ヘッセ行列の計算は計算コストが高いため、多くの代替案が提案されています。一般的なBerndt–Hall–Hall–Hausman アルゴリズムは、期待勾配の外積でヘッセ行列を近似し、
;\mathbf {y} )}{\partial \theta }}\left({\frac {\partial \ell (\theta ;\mathbf {y} )}{\partial \theta }}\right)^{\mathsf {T}}\right]^{-1}\mathbf {s} _{r}\left({\widehat {\theta }}\right)}
他の準ニュートン法では、より精緻な割線更新を用いてヘッセ行列の近似値を得る。
DFP式は、対称性、正定値性を持ち、かつ現在の2階導関数の近似値に最も近い解を求めます。
どこ
BFGS法では、対称かつ正定値な解も得られる。
どこ
BFGS法は、最適値付近で関数が二次テイラー展開を持つ場合を除き、収束が保証されません。しかし、BFGS法は、平滑でない最適化問題に対しても許容できる性能を発揮できます。
もう1つの一般的な方法は、ヘッセ行列をフィッシャー情報行列に置き換えることです。これにより、フィッシャースコアリングアルゴリズムが得られます。この手順は、一般化線形モデルなど、多くの推定方法において標準的なものです。
準ニュートン法は広く用いられているものの、局所的または大域的な最大値ではなく、局所的最小値や鞍点に収束する可能性がある[ 43 ] 。そのため、得られた尤度方程式の解の妥当性を評価するには、解で評価したヘッセ行列が負定値かつ条件が良好であることを検証することが重要である[ 44 ]。
最尤法の初期の使用者には、カール・フリードリヒ・ガウス、ピエール=シモン・ラプラス、トールヴァルド・N・ティーレ、フランシス・イシドロ・エッジワースなどがいる。[ 45 ] [ 46 ]しかし、1912年から1922年の間に、ロナルド・フィッシャーが単独でこの方法の現代版を作り出した。[ 47 ] [ 48 ]
最尤推定は、1938年にサミュエル・S・ウィルクスによって発表された証明によって、ついに経験的な正当化を超越し、現在ではウィルクスの定理と呼ばれている。 [ 49 ]この定理は、複数の独立した観測からの推定値の尤度値の対数の誤差が漸近的にχ²分布に従うことを示しており、これにより、パラメータの任意の推定値の周囲の信頼領域を簡単に決定できる。ウィルクスの証明で唯一難しい部分は、フィッシャーによって証明された定理によって提供されるフィッシャー情報行列の期待値に依存する。[ 50 ]ウィルクスは生涯を通じて定理の一般性を改善し続け、最も一般的な証明は1962年に発表された。[ 51 ]
最尤推定法の発展に関するレビューは、多くの著者によって提供されている。[ 52 ] [ 53 ] [ 54 ] [ 55 ] [ 56 ] [ 57 ] [ 58 ] [ 59 ]
{{cite book}}ISBN /日付の不一致(ヘルプ)