推定理論は、ランダムな要素を含む測定された経験的データに基づいてパラメータの値を推定する統計学の一分野です。パラメータは、その値が測定データの分布に影響を与えるような方法で、基礎となる物理的設定を記述します。推定器は、測定値を使用して未知のパラメータを近似しようとします。推定理論では、一般的に次の 2 つのアプローチが考慮されます。[ 1 ]
例えば、ある特定の候補者に投票する有権者の割合を推定したい場合、その割合が求められるパラメータとなります。推定は、少数の有権者を無作為に抽出したサンプルに基づいて行われます。あるいは、年齢などの人口統計学的特徴に基づいて、有権者が特定の候補者に投票する確率を推定したい場合もあります。
例えば、レーダーでは、送信パルスの受信エコーの往復伝搬時間を解析することで、物体(航空機、船舶など)までの距離を測定することが目的です。反射パルスは必然的に電気ノイズに埋もれるため、その測定値はランダムに分布し、伝搬時間を推定する必要があります。
特定のモデルの場合、推定器を実装するにはいくつかの統計的「要素」が必要です。最初の要素は統計的サンプルです。これは、サイズNのランダムベクトル(RV)から抽出されたデータポイントのセットです。これをベクトルに格納します。 第二に、 M個のパラメータ が存在する。 その値は推定される必要がある。第三に、データを生成した基礎となる分布の連続確率密度関数(pdf)またはその離散版である確率質量関数(pmf)を、パラメータの値に基づいて条件付きで記述する必要がある。 パラメータ自体が確率分布を持つ場合もある(例えば、ベイズ統計学)。その場合、ベイズ確率を定義する必要がある。 モデルが構築された後、目標はパラメータを推定することであり、推定値は一般的に次のように表されます。ここで、「ハット」は推定値を示します。
一般的な推定方法の一つに、最小平均二乗誤差(MMSE)推定法があり、これは推定されたパラメータと実際のパラメータ値との間の誤差を利用する。 最適性の基礎として、この誤差項を二乗し、その二乗値の期待値を最小化することでMMSE推定量を求める。
一般的に用いられる推定方法(推定手法)およびそれに関連するトピックには、以下のようなものがあります。
受信した離散信号を考えてみましょう。、 の 未知の定数からなる独立したサンプル加法性白色ガウス雑音(AWGN)平均値がゼロで分散が既知(つまり、) 分散が既知であるため、未知のパラメータは 1 つだけです。。
信号のモデルは次のようになります。
パラメータの推定値として考えられる(多数あるうちの)2つは:
これらの推定量の平均値はこれは、各推定量の 期待値を取ることによって示すことができる。 そして
この時点では、これら2つの推定量は同じように機能しているように見える。しかし、分散を比較すると、両者の違いが明らかになる。 そして
標本平均は、N > 1 の場合、分散が小さくなるため、より良い推定値であるように思われる。
最尤推定法を用いた例を続けると、1サンプルのノイズの確率密度関数(pdf)は次のようになります。は そしてその確率はになる(と考えることができる) 独立性 により、になる 確率密度関数の 自然対数 を取る そして最尤推定量は
対数尤度関数の 1階微分をとる そしてそれをゼロに設定する
これにより、最尤推定量が得られます。 これは単に標本平均です。この例から、標本平均が以下の最尤推定量であることがわかりました。AWGNによって劣化された、固定された未知のパラメータのサンプル。
標本平均推定量のクラメール・ラオ下限(CRLB)を求めるには、まずフィッシャー情報数を 求める必要がある。 そして上からコピーする
2階微分をとる そして、負の期待値を求めるのは、それが確定的な定数となるため、自明である。
最後に、フィッシャー情報を 結果として
これを(以前に決定した)標本平均の分散と比較すると、すべての値に対して標本平均がクラメール・ラオ下限に等しいことがわかる。そして言い換えれば、標本平均は(必然的に一意な)効率的な推定量であり、したがって最小分散不偏推定量(MVUE)であると同時に、最尤推定量でもある。
推定の最も単純で非自明な例の一つは、一様分布の最大値の推定です。これは、実践的な授業演習として、また推定理論の基本原理を説明するために用いられます。さらに、単一標本に基づく推定の場合、最尤推定量と尤度関数の使用における哲学的問題や誤解の可能性を示すものとなります。
離散的な一様分布が与えられた場合最大値が未知の場合、最大値の UMVU推定量は次のように与えられる。 ここで、mは標本最大値、kは標本サイズであり、非復元抽出である。[ 2 ] [ 3 ]この問題は、第二次世界大戦中のドイツ戦車の生産量の推定に最大推定法を適用したことから、一般的にドイツ戦車問題として知られている。
この式は直感的に次のように理解できる。
ギャップは、標本最大値が母集団最大値の推定値として負のバイアスを持つことを補償するために追加される。[注1 ]
これは[ 2 ]の分散を持つ。 つまり、標準偏差は約サンプル間のギャップの(母集団)平均サイズ。比較上記。これは最大間隔推定の非常に単純なケースと見なすことができます。
標本最大値は母集団最大値の最尤推定量であるが、前述のように偏りがある。
推定理論の利用を必要とする分野は数多くあります。これらの分野には以下のようなものがあります。
測定データにはノイズや不確実性が含まれる可能性が高く、統計的確率を用いて、データから可能な限り多くの情報を抽出するための最適な解決策が求められる。