平均二乗誤差を最小化する推定法
統計学と信号処理
において、最小平均二乗誤差( MMSE ) 推定量は、従属変数の近似値の平均二乗誤差(MSE)を最小化する推定法であり、平均二乗誤差は推定量の品質を測る一般的な尺度です。ベイズの設定では、MMSE という用語は、より具体的には、2 次損失関数を使用した推定を指します。このような場合、MMSE 推定量は、推定するパラメーターの事後平均によって与えられます。事後平均は計算が面倒なので、MMSE 推定量の形式は通常、特定の関数クラス内に制限されます。線形 MMSE 推定量は使いやすく、計算しやすく、用途が広いため、よく選ばれています。ウィーナー・コルモゴロフ フィルターやカルマン フィルターなど、多くの一般的な推定量がこの推定法から生まれました。
モチベーション
MMSE という用語は、より具体的には、二次コスト関数を使用したベイズ設定での推定を指します。ベイズ推定アプローチの基本的な考え方は、推定するパラメータについて何らかの事前情報を持っていることが多い実際の状況に由来しています。たとえば、パラメータが想定できる範囲に関する事前情報がある場合や、新しい観測が利用可能になったときに変更したいパラメータの古い推定値がある場合、または音声などの実際のランダム信号の統計値がある場合があります。これは、パラメータについて事前に何もわかっていないと想定され、そのような状況を考慮しない最小分散不偏推定量(MVUE) などの非ベイズアプローチとは対照的です。ベイズアプローチでは、そのような事前情報はパラメータの事前確率密度関数によって取得され、ベイズの定理に直接基づいて、より多くの観測が利用可能になるにつれて、より適切な事後推定を行うことができます。したがって、関心のあるパラメータが決定論的だが未知の定数であると想定される非ベイジアン アプローチとは異なり、ベイジアン推定器は、それ自体がランダム変数であるパラメータを推定しようとします。さらに、ベイジアン推定は、観測のシーケンスが必ずしも独立していない状況にも対処できます。したがって、ベイジアン推定は、MVUE のもう 1 つの代替手段を提供します。これは、MVUE が存在しないか見つからない場合に役立ちます。
意味
を隠れたランダムベクトル変数とし、を既知のランダムベクトル変数(測定値または観測値)とします。両者は必ずしも同じ次元である必要はありません。の推定量は測定値の任意の関数です。推定誤差ベクトルは で与えられ、その平均二乗誤差(MSE)は誤差共分散行列のトレースで与えられます。






ここで期待値 は を条件として引き継がれます。 がスカラー変数の場合、MSE式は に簡略化されます。MSEは他の方法でも同等に定義できることに留意してください。






MMSE 推定量は、最小の MSE を達成する推定量として定義されます。

プロパティ
- 平均と分散が有限である場合、MMSE推定量は一意に定義され[1]、次のように表される。

- 言い換えれば、MMSE推定量は、測定の既知の観測値が与えられた場合の条件付き期待値です。また、は事後平均であるため、誤差共分散行列は事後共分散行列に等しくなります。




。
- MMSE 推定値は偏りがありません (上記の規則性の仮定の下で)。


- ここで、は のフィッシャー情報です。したがって、MMSE 推定量は漸近的に効率的です。


- 直交性原理:がスカラーのとき、特定の形式に制約された推定量は最適推定量である。つまり、




- すべては測定値の閉じた線形部分空間内にあります。ランダムベクトルの場合、ランダムベクトルの推定のMSEは座標のMSEの合計であるため、ランダムベクトルのMMSE推定値を見つけることは、Xの座標のMMSE推定値を個別に見つけることに分解されます。



- 全てのiとjについて。より簡潔に言えば、最小推定誤差と推定量との間の相互相関はゼロであるべきであり、



- と が共にガウス分布である場合、MMSE 推定量は線形です。つまり、行列と定数に対して という形式になります。これは、ベイズの定理を使用して直接示すことができます。結果として、MMSE 推定量を見つけるには、線形 MMSE 推定量を見つければ十分です。





線形MMSE推定器
多くの場合、MMSE 推定量の解析的表現を決定することはできません。MMSE 推定量を取得するための 2 つの基本的な数値的アプローチは、条件付き期待値を見つけるか、MSE の最小値を見つけるかのいずれかに依存します。条件付き期待値の直接的な数値評価は、通常モンテ カルロ法によって行われる多次元積分を必要とすることが多いため、計算コストが高くなります。別の計算的アプローチは、確率的勾配降下法などの手法を使用して MSE の最小値を直接求めることですが、この方法でも期待値の評価が必要です。これらの数値的方法は実り多いものですが、ある程度の妥協をいとわないのであれば、MMSE 推定量の閉じた形式の表現は可能です。

1 つの可能性は、完全な最適性要件を放棄し、線形推定量のクラスなどの特定のクラスの推定量内で MSE を最小化する手法を求めることです。したがって、与えられたの条件付き期待値は の単純な線形関数であり、は、測定値がランダム ベクトル、は行列、 はベクトルであると仮定します。これは、 の 1 次テイラー近似として考えることができます。線形 MMSE 推定量は、そのような形式のすべての推定量の中で最小の MSE を達成する推定量です。つまり、次の最適化問題を解決します。









このような線形 MMSE 推定量の利点の 1 つは、 の事後確率密度関数を明示的に計算する必要がないことです。このような線形推定量は、およびの最初の 2 つのモーメントのみに依存します。したがって、 と が一緒にガウス分布であると仮定すると便利ですが、想定される分布の 1 次モーメントと 2 次モーメントが明確に定義されている限り、この仮定を行う必要はありません。線形推定量の形式は、想定される基礎分布のタイプに依存しません。





最適の式は次のように与えられます。




ここで、はと の間の相互共分散行列であり、は の自己共分散行列です。







したがって、線形MMSE推定量、その平均、自己共分散の式は次のように表される。



ここで、は と の間の相互共分散行列です。



最後に、このような推定量によって達成可能な誤差共分散と最小平均二乗誤差は


単変量の場合
とが両方ともスカラーである特別な場合、上記の関係は次のように単純化される。




ここで、は との間のピアソンの相関係数です。



上記の2つの式により、相関係数を線形回帰の正規化された傾きとして解釈することができます。

または2つの分散の比の平方根として
。
のとき、および が成り立ちます。この場合、 の不確実性を低減できる測定から得られる新しい情報はありません。一方、 のとき、およびが成り立ちます。ここで、は の直線の方程式で与えられるように、
によって完全に決定されます。








計算
ガウス消去法のような標準的な方法を使用して、 の行列方程式を解くことができます。より数値的に安定した方法は、 QR 分解法です。行列 は対称正定値行列なので、コレスキー分解を使用すると 2 倍の速さで解くことができますが、大規模なスパース システムでは共役勾配法の方が効果的です。レビンソン再帰法は、がテプリッツ行列でもある場合に高速な方法です。が広義の定常過程である場合に、これが発生する可能性があります。このような定常ケースでは、これらの推定量はウィーナー–コルモゴロフ フィルタとも呼ばれます。





線形観測プロセスのための線形MMSE推定器
観測の基礎となるプロセスを線形プロセスとしてさらにモデル化してみましょう。ここで、は既知の行列であり、は平均と相互共分散を持つランダムノイズベクトルです。ここで必要な平均と共分散行列は次のようになります。








したがって、線形MMSE推定行列の式はさらに次のように修正される。


の式にすべてを当てはめると、次のようになります。


最後に、誤差共分散は

上で扱った推定問題と、最小二乗法やガウス・マルコフ推定の問題との重要な違いは、観測値の数m(つまり、 の次元)が、未知数の数n(つまり、 の次元)以上である必要がないことです。線形観測プロセスの推定値は、 m行m列の行列が存在する限り存在します。これは、たとえば が正定値である場合、任意のmに当てはまります。物理的にこの特性が生じる理由は、がランダム変数になったため、測定を行わなくても意味のある推定値(つまり、その平均)を形成できるためです。新しい測定を行うたびに、元の推定値を修正できる追加情報が提供されるだけです。この推定値のもう 1 つの特徴は、m < nの場合、測定誤差が不要であることです。したがって、が正定値である限り、推定値が存在するため、 となる場合があります。最後に、この手法は、ノイズが相関している場合も処理できます。







行列の恒等式を使うと別の表現形式が得られる。

これは、後から を掛け、前から を掛けることで得られる。



そして

はとして書けるようになったので、 の簡略化された表現が得られる。





この形式では、上記の式はリッジ回帰、加重最小二乗法、ガウス・マルコフ推定値と簡単に比較できます。特に、 のとき、 に関する事前情報の無限分散に対応し、 を重み行列とする加重線形最小二乗推定値と同じ結果になります。さらに、 の成分が相関がなく、 となる等分散である場合 ( が単位行列である場合)、 は通常の最小二乗推定値と同じになります。 として事前情報が利用可能で、 が相関がなく等分散である場合、 となり、これはリッジ回帰解と同じになります。











逐次線形MMSE推定
多くのリアルタイム アプリケーションでは、観測データは単一のバッチでは利用できません。代わりに、観測はシーケンスで行われます。考えられる 1 つの方法は、追加データが利用可能になると、シーケンシャル観測を使用して古い推定値を更新し、より正確な推定値を得ることです。バッチ推定とシーケンシャル推定の重要な違いの 1 つは、シーケンシャル推定では追加のマルコフ仮定が必要になることです。
ベイズ理論の枠組みでは、このような再帰推定はベイズの定理を使って簡単に行える。観測値 が与えられると、ベイズの定理は の事後密度を次のように
与える。



は事後密度、は尤度関数、はk番目の時間ステップの事前密度です。ここでは、以前の観測値から条件付き独立であると
仮定しています。






これがマルコフ仮定です。
k番目の観測値に基づくMMSE 推定値は、事後密度の平均になります。状態が時間とともにどのように変化するかに関する動的情報が不足しているため、事前分布についてさらに定常性の仮定を行います。




したがって、 k番目の時間ステップの事前密度は、( k -1) 番目の時間ステップの事後密度です。この構造により、推定に対する再帰的なアプローチを定式化できます。
線形 MMSE 推定量のコンテキストでは、推定値の式は以前と同じ形式になります。ただし、 と の平均行列と共分散行列は、それぞれ事前密度と尤度の行列に置き換える必要があります。





事前密度の場合、その平均は前回のMMSE推定値によって与えられ、

、
そしてその共分散行列は前の誤差共分散行列によって与えられる。

MMSE推定値の特性と定常性仮定に従って。
同様に、線形観測プロセスの場合、尤度の平均は次のように与えられ、共分散行列は前と同じである。


。
によって与えられる の予測値とその観測値との差は予測誤差 となり、これはイノベーションまたは残差とも呼ばれます。線形 MMSE を予測誤差で表すとより便利です。
予測誤差の平均と共分散はそれぞれ とです。



![{\displaystyle \mathrm {E} [{\チルダ {y}}_{k}]=0}](https://wikimedia.org/api/rest_v1/media/math/render/svg/b7333e06de208be900c7d618273db57bf678fb1f)

したがって、推定値の更新式では、とをそれぞれ とに置き換える必要があります。また、とをとに置き換える必要があります。最後に、を に
置き換えます。









したがって、新しい観測が到着すると、新しい推定値が得られます。


そして新しい誤差共分散は

線形代数の観点から、逐次推定では、空間を生成する測定に基づく推定値がある場合、別の一連の測定を受け取った後、最初の測定の結果から予測できる部分をこれらの測定から減算する必要があります。言い換えると、更新は、古いデータに直交する新しいデータの部分に基づいて行う必要があります。


より多くの観測が可能になるにつれて、上記の2つの式を繰り返し使用することで、再帰推定技術が生まれます。これらの式は、より簡潔に次のように記述できます。



この行列はカルマンゲイン係数と呼ばれることが多い。上記のアルゴリズムの別の定式化は次のようになる。




より多くのデータが利用可能になるにつれて、これら 3 つのステップを繰り返すことで、反復推定アルゴリズムが実現します。この考え方を非定常ケースに一般化すると、カルマン フィルタが生まれます。上記の 3 つの更新ステップは、実際にカルマン フィルタの更新ステップを形成します。
特殊なケース: スカラー観測
重要な特殊なケースとして、各k番目の時点で基礎となる線形観測プロセスが となるスカラーを生成するときに、使いやすい再帰式を導出できます。ここで、 は時間とともに値が変化する可能性のあるn行 1 列の既知の列ベクトル、は推定されるn行 1 列のランダムな列ベクトル、 は分散 のスカラー ノイズ項です。 ( k +1) 番目の観測の後、上記の再帰方程式を直接使用すると、推定値の式は次のようになります。







ここで、は新しいスカラー観測値であり、ゲイン係数はn行1列のベクトルで、次のように表される。



これはn行n列の誤差共分散行列で、次のように表される。


ここでは、行列の反転は必要ありません。また、ゲイン係数 は、ノイズ分散で測定された新しいデータ サンプルの信頼度と、以前のデータの信頼度に依存します。 と の初期値は、の事前確率密度関数の平均と共分散として取られます。




代替アプローチ:この重要な特殊なケースは、最小平均二乗フィルタや再帰最小二乗フィルタなど、他の多くの反復法(または適応フィルタ)も生み出しました。これらは、確率的勾配降下法を使用して元のMSE最適化問題を直接解決します。ただし、推定誤差を直接観察できないため、これらの方法では平均二乗予測誤差を最小化しようとします。たとえば、スカラー観測の場合、勾配は次のようになります。したがって、最小平均二乗フィルタの更新方程式は次のように表されます。




ここで、 はスカラーステップサイズであり、期待値は瞬間値 によって近似されます。 ご覧のとおり、これらの方法では共分散行列が不要になります。


多くの実際のアプリケーションでは、観測ノイズは相関がありません。つまり、は対角行列です。このような場合、 の成分をベクトル測定ではなく独立したスカラー測定として考えると有利です。これにより、測定ベクトルをスカラー測定として処理することで計算時間を短縮できます。スカラー更新式を使用すると、共分散更新方程式の実装で行列反転が回避され、丸め誤差に対する数値の堅牢性が向上します。更新は次のように反復的に実装できます。







ここで、初期値としておよび を使用します。中間変数は対角行列の - 番目の対角要素です。一方、は行列の - 番目の行です。最終値はおよびです。













例
例1
例として 線形予測問題を取り上げます。観測されたスカラーランダム変数とを、別の将来のスカラーランダム変数を推定するために使用します。ランダム変数が平均がゼロで共分散行列が次式で与えられる実数ガウスランダム変数である
場合、



![{\displaystyle z=[z_{1},z_{2},z_{3},z_{4}]^{T}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/45cb1f9123fdf786074088616e42dfbcc1359d07)
![{\displaystyle \operatorname {cov} (Z)=\operatorname {E} [zz^{T}]=\left[{\begin{array}{cccc}1&2&3&4\\2&5&8&9\\3&8&6&10\\4&9&10&15\end{array}}\right],}](https://wikimedia.org/api/rest_v1/media/math/render/svg/90889a9de7192d317decb8381ca25cda49892b5c)
次に、最適な線形推定値が得られるような係数を見つけることが私たちの仕事です。


前の節で述べた用語を用いると、この問題では観測ベクトル、行ベクトルとしての推定量行列、スカラー量としての推定変数が用いられる。自己相関行列は次のように定義される。
![{\displaystyle y=[z_{1},z_{2},z_{3}]^{T}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/7fdeb8eb600c7a066561d28e2b3f32fb5b1572b9)
![{\displaystyle W=[w_{1},w_{2},w_{3}]}](https://wikimedia.org/api/rest_v1/media/math/render/svg/dd8e9343b228a9044dbb8208e9ceeb31270b04c1)


![{\displaystyle C_{Y}=\left[{\begin{array}{ccc}E[z_{1},z_{1}]&E[z_{2},z_{1}]&E[z_{3},z_{1}]\\E[z_{1},z_{2}]&E[z_{2},z_{2}]&E[z_{3},z_{2}]\\E[z_{1},z_{3}]&E[z_{2},z_{3}]&E[z_{3},z_{3}]\end{array}}\right]=\left[{\begin{array}{ccc}1&2&3\\2&5&8\\3&8&6\end{array}}\right].}](https://wikimedia.org/api/rest_v1/media/math/render/svg/50c0831c4af6cc131c13cd4da73e21ee08aac40c)
相互相関行列は次のように定義される。

![{\displaystyle C_{YX}=\left[{\begin{array}{c}E[z_{4},z_{1}]\\E[z_{4},z_{2}]\\E[z_{4},z_{3}]\end{array}}\right]=\left[{\begin{array}{c}4\\9\\10\end{array}}\right].}](https://wikimedia.org/api/rest_v1/media/math/render/svg/e0b4e00619f85de1c0967817d68b6b154557af03)
この方程式を逆数と乗算
で解くと、

![{\displaystyle C_{Y}^{-1}C_{YX}=\left[{\begin{array}{ccc}4.85&-1.71&-0.142\\-1.71&0.428&0.2857\\-0.142&0.2857&-0.1429\end{array}}\right]\left[{\begin{array}{c}4\\9\\10\end{array}}\right]=\left[{\begin{array}{c}2.57\\-0.142\\0.5714\end{array}}\right]=W^{T}.}](https://wikimedia.org/api/rest_v1/media/math/render/svg/8f29d9505d5f630feae8a4566c23bae8dd82fd5d)
したがって、
の最適係数としておよびが得られます。次に、最小平均二乗誤差を計算すると が得られます。[2]の値を計算するためにの明示的な逆行列を取得する必要はないことに注意してください。この行列方程式は、ガウスの消去法などのよく知られた方法で解くことができます。より短い非数値的な例は、直交性原理に示されています。



![{\displaystyle \left\Vert e\right\Vert _{\min }^{2}=\operatorname {E} [z_{4}z_{4}]-WC_{YX}=15-WC_{YX}=.2857}](https://wikimedia.org/api/rest_v1/media/math/render/svg/44558ab7a0b5ead1b9571853096d800773b38877)


例2
白色ガウス雑音によって乱された、固定だが未知のスカラーパラメータの観測値を取ることによって形成されるベクトルについて考えてみましょう。このプロセスを線形方程式 で記述できます。ここで です。文脈によっては、がスカラーを表すかベクトルを表すかは明らかです。の値が収まる範囲が であることがわかっているとします。 の不確実性は、区間 上の事前一様分布によってモデル化できるため、分散は になります。雑音ベクトルを として正規分布するとします。ここでは単位行列です。また、と は独立であり です。次の式から簡単にわかります。




![{\displaystyle 1=[1,1,\ldots ,1]^{T}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/43fec89f837a5e8d53869fb49ec95a9e56a788f0)

![{\displaystyle [-x_{0},x_{0}]}](https://wikimedia.org/api/rest_v1/media/math/render/svg/e79873ca5ddfd5d6b0168f6373b33c8bc3756c69)


![{\displaystyle [-x_{0},x_{0}]}](https://wikimedia.org/api/rest_v1/media/math/render/svg/e79873ca5ddfd5d6b0168f6373b33c8bc3756c69)









したがって、線形MMSE推定量は次のように与えられる。

の別の形式を使うことで式を簡略化することができます。


どこに私たちは![{\displaystyle y=[y_{1},y_{2},\ldots ,y_{N}]^{T}}](https://wikimedia.org/api/rest_v1/media/math/render/svg/8317c7045e5b1318cec0c4ee89727a02cdeecafc)
同様に、推定値の分散は

したがって、この線形推定量のMMSEは

が非常に大きい場合、一様事前分布を持つスカラーのMMSE推定量は、観測されたすべてのデータの算術平均によって近似できることが分かります。


一方、分散はデータの影響を受けず、推定値の LMMSE はゼロに近づきます。

ただし、推定量は線形に制約されているため、最適ではありません。ランダム変数もガウス分布であれば、推定量は最適になります。これらの分布の平均と分散が同じである限り、
推定量の形式は の事前分布に関係なく変更されないことに注意してください。

例3
上記の例のバリエーションを考えてみましょう。2 人の候補者が選挙に立候補しています。選挙日に一方の候補者が得る得票率を とします。したがって、もう一方の候補者が得る得票率は になります。を 上の一様事前分布を持つランダム変数として取り、その平均は、分散は とします。選挙の数週間前に、2 つの異なる世論調査会社によって 2 つの独立した世論調査が実施されました。最初の世論調査では、候補者が得票率の一部を獲得する可能性が高いことが明らかになりました。有限のサンプリングと採用された特定の世論調査方法により、いくらかの誤差は常に存在するため、最初の世論調査会社は、平均および分散がゼロの誤差がある推定値を宣言します。同様に、2 番目の世論調査会社は、平均および分散がゼロの誤差がある推定値を と宣言します。誤差の平均と分散を除き、誤差分布は指定されていないことに注意してください。特定の候補者の投票予測を取得するには、2 つの世論調査をどのように組み合わせればよいでしょうか。
![{\displaystyle x\in [0,1].}](https://wikimedia.org/api/rest_v1/media/math/render/svg/1c44eb6b4643a03d3c166df0e61c4925b6d4d4f0)


![{\displaystyle [0,1]}](https://wikimedia.org/api/rest_v1/media/math/render/svg/738f7d23bb2d9642bab520020873cccbef49768d)








前の例と同様に、

ここで、 は両方とも です。したがって、LMMSE推定値は と の線形結合として次のように
得られます。



ここで重みは次のように与えられる。

ここで、分母の項は定数なので、選挙結果を予測するために、誤差の少ない世論調査に高い重みが与えられる。最後に、の分散は次のように与えられる。


より小さくなる。したがって、LMMSEは次のように与えられる。



一般に、世論調査会社がある場合、i番目の世論調査会社の重みは次のように与えられ、LMMSEは次のように与えられる。


例4
ミュージシャンが楽器を演奏していて、その音が 2 つのマイクで受信され、それぞれが 2 つの異なる場所に設置されているとします。各マイクの距離による音の減衰を および とし、これらは既知の定数であると仮定します。同様に、各マイクのノイズを およびとし、それぞれ平均がゼロで分散が および であるとします。ミュージシャンが発する音を と表し、これは平均がゼロで分散が であるランダム変数であるとします。これら 2 つのマイクで録音された音楽は、互いに同期した後、どのように組み合わせればよいでしょうか。








各マイクで受信した音は次のようにモデル化できる。

ここでは、両方の音を次のように組み合わせることができます。


ここで、i番目の重みは次のように与えられる。

参照
注記
- ^ 「平均二乗誤差(MSE)」www.probabilitycourse.com 。 2017年5月9日閲覧。
- ^ ムーンとスターリング。
さらに読む
- Johnson, D. 「最小平均二乗誤差推定器」。Connexions。2008 年 7 月 25 日のオリジナルを Minimum Mean Squared Error Estimators からアーカイブ。2013年1 月 8 日に取得。
- ジェインズ、ET(2003)。確率論:科学の論理。ケンブリッジ大学出版局。ISBN 978-0521592710。
- Bibby, J.; Toutenburg, H. (1977).線形モデルにおける予測と改善された推定. Wiley. ISBN 9780471016564。
- Lehmann, EL; Casella, G. (1998)。「第 4 章」。点推定の理論(第 2 版) 。Springer。ISBN 0-387-98502-6。
- Kay, SM (1993).統計信号処理の基礎: 推定理論. Prentice Hall. pp. 344–350. ISBN 0-13-042268-1。
- Luenberger, DG (1969)。「第 4 章、最小二乗推定」。ベクトル空間法による最適化(第 1 版)。Wiley。ISBN 978-0471181170。
- ムーン、TK; スターリング、WC (2000)。信号処理のための数学的手法とアルゴリズム(第 1 版)。プレンティス ホール。ISBN 978-0201361865。
- Van Trees, HL (1968)。検出、推定、変調理論、パート I。ニューヨーク: Wiley。ISBN 0-471-09517-6。
- Haykin, SO (2013).適応フィルタ理論(第 5 版). Prentice Hall. ISBN 978-0132671453。