
最小二乗スペクトル解析(LSSA )は、最小二乗法を用いてデータに正弦波を当てはめることで周波数スペクトルを推定する手法の一種です。[ 1 ] [ 2 ]科学分野で最も広く用いられているスペクトル解析手法であるフーリエ解析とは異なり、LSSAではデータが等間隔である必要はありません。さらに、フーリエ解析は一般的に長い記録や欠落した記録の長周期ノイズを増幅しますが、LSSAはそのような問題を軽減します。[ 3 ]
最初の厳密な最小二乗LSSA法は1969年[ 4 ]と1971年[ 5 ]に開発され、その発明者であるペトル・ヴァニチェクと誤差最小化のための最小二乗法の発明者であるカール・フリードリヒ・ガウスにちなんで、ヴァニチェク法またはガウス・ヴァニチェク法として知られています。 [ 6 ] [ 7 ]
広く知られているLSSAの変種は、Lomb法[ 3 ]またはLomb–Scargle周期図[ 2 ] [ 8 ]であり、これは1970年代と1980年代に最初にNicholas R. Lomb [ 9 ]によって、後にJeffrey D. Scargle [ 10 ]によって導入されたVaníček法の古い計算簡略化に基づいています。その後、他のLSSA変種が開発されました。
フーリエ解析、周期図、正弦波の最小二乗フィッティングの密接な関係は、長い間知られていました。[ 11 ] しかし、ほとんどの開発は、等間隔のサンプルの完全なデータセットに限定されていました。1963年、アムステルダムのMathematisch CentrumのFreek JM Barningは、同様の手法で不等間隔のデータを扱いました。 [ 12 ]これには、今日ではLomb法と呼ばれるものに相当する周期図解析と、そのような周期図から決定された正弦波の選択された周波数の最小二乗フィッティングの両方が含まれており、今日ではポストバックフィッティングによるマッチング追跡[ 13 ]または直交マッチング追跡[ 14 ]として知られる手順で結び付けられています。
ニューブランズウィック大学のカナダ人地球物理学者で測地学者のペトル・ヴァニチェクは、 1969年に等間隔および不等間隔のデータに対するマッチング追跡法も提案し、これを「逐次スペクトル分析」、結果を「最小二乗周期図」と呼んだ。[ 4 ]彼はこの方法を一般化し、単純な平均を超えるあらゆる系統的成分、例えば「未知の大きさの予測線形(二次、指数関数など)長期トレンド」を考慮に入れ、1971年にさまざまなサンプルに適用した。[ 5 ]
ヴァニチェクの厳密な最小二乗法は、1976年にシドニー大学のニコラス・R・ロンブによって簡略化され、周期図解析との密接な関連性が指摘された。[ 9 ]その後、 NASAエイムズ研究センターのジェフリー・D・スカーグルによって、 不等間隔データの周期図の定義が修正され、解析された。[ 10 ]スカーグルは、わずかな変更を加えるだけで、個々の正弦波周波数に適合するためのロンブの最小二乗式と同一になることを示した。
スカーグルは、自身の論文は「新しい検出技術を導入するものではなく、観測時間が不均等に間隔されている場合に、最も一般的に使用されている技術である周期図による検出の信頼性と効率を研究するものである」と述べ、さらに周期図分析と比較した正弦波の最小二乗フィッティングに関して、自身の論文は「(提案された修正により)これら2つの方法が完全に同等であることを、おそらく初めて確立した」と指摘している。[ 10 ]
プレス[ 3 ]は、この展開を次のように要約している。
不均一にサンプリングされたデータに対する全く異なるスペクトル解析手法が、これらの困難を軽減し、他にも非常に望ましい特性をいくつか備えており、バーニングとヴァニチェクによる以前の研究を部分的に基に、ロンブによって開発され、さらにスカーグルによって詳細に改良された。
1989年、オンタリオ州キングストンのクイーンズ大学のマイケル・J・コーレンバーグは、スペクトルやその他の問題のほぼ最適な分解をより迅速に見つけるための「高速直交探索」法を開発しました[ 15 ]。これは後に直交マッチング追跡として知られるようになった手法と似ています。

Vaníček法では、離散データセットは、標準的な線形回帰または最小二乗法を用いて、段階的に決定される周波数の正弦波の重み付き和によって近似されます。[ 16 ] 周波数は、Barningの方法に似た方法で選択されますが、最小二乗法によるフィッティング後の残差を最小にする周波数を選択することによって、各連続する新しい周波数の選択を最適化する点でさらに進んでいます(これは、現在、事前バックフィッティングを伴うマッチング追跡法として知られているフィッティング手法に相当します[ 13 ])。正弦波の数は、データサンプルの数以下でなければなりません(同じ周波数の正弦波と余弦波を別々の正弦波としてカウントします)。DFTと最小二乗法を用いた三角関数の近似との関係は、(Strutz, 2017) [ 17 ]で詳しく説明されています。
データベクトルΦは、正弦波基底関数の重み付き和として表され、各関数をサンプル時間で評価することにより、重みベクトルxを用いて行列Aに表形式で格納されます。
ここで、重みベクトルxは、 Φ を近似する際の二乗誤差の合計を最小化するように選択されます。xの解は、標準的な線形回帰を使用して閉形式で表されます。[ 18 ]
ここで、行列 A は、サンプル時間で評価したときに互いに独立している (必ずしも直交している必要はない) 任意の関数セットに基づいて構成できます。スペクトル分析に使用される関数は、通常、関心のある周波数範囲に均等に分布した正弦関数と余弦関数です。狭すぎる周波数範囲で周波数を多く選択しすぎると、関数の独立性が不十分になり、行列の条件が悪くなり、結果として得られるスペクトルは意味をなさなくなります。[ 18 ]
Aの基底関数が直交している場合 (つまり、相関がなく、列のペアごとのドット積がゼロである場合)、行列A T Aは対角行列になります。列のパワーがすべて同じ (要素の二乗の和) 場合、その行列は単位行列に定数を掛けたものになるため、逆行列は自明です。後者は、サンプル時間が等間隔で、正弦波が、サンプルごとに周波数間隔 0 から半サイクル (サンプルごとに 1/N サイクル間隔で、0 と最大周波数での正弦位相がまったくゼロであるため省略) でペアごとに等間隔の正弦波と余弦波として選択されている場合です。このケースは、測定値と係数の観点から少し書き換えられた離散フーリエ変換として知られています。 [ 18 ]

1976年にVaníček法の計算負荷を軽減しようとして[ 9 ](もはや問題ではない)、Lombは、同じ周波数の正弦波と余弦波の基底間のペアワイズ相関を除いて、上記の簡略化を一般的に使用することを提案した。これは、少なくとも間隔が狭くない場合、正弦波のペア間の相関は小さいことが多いためである。この定式化は基本的に従来の周期図の定式化であるが、不均等間隔のサンプルで使用できるように調整されている。ベクトルxは基底スペクトルのかなり良い推定値であるが、相関を無視しているため、A xは信号の良い近似ではなくなり、この方法はもはや最小二乗法ではなくなるが、文献では引き続きそのように呼ばれている。
スカーグルは、データと正弦波および余弦波の内積を直接計算するのではなく、標準的な周期図の公式を修正して時間遅延を求めました。まず、この一対の正弦波がサンプリング時刻において互いに直交するようにする。また、これら2つの基底関数の潜在的に不均等なパワーを調整して、周波数におけるパワーのより良い推定値を得た。[ 3 ] [ 10 ]この手順により、彼の修正された周期図法はロンブの方法と完全に等価になった。時間遅延定義により等しい
次に周波数における周期図推定値は以下のとおりです。
スカーグルが報告しているように、これは均等サンプリングの場合の周期図と同じ統計分布を持つ。[ 10 ]
個々の周波数においてこの方法は、その周波数の正弦波に最小二乗法で近似した場合と同じパワーを与える。[ 19 ]
実際には、特にノイズの性質が不明な場合、特定のロンブピークが有意であるかどうかを判断することは常に困難であり、たとえば、ノイズのある周期信号のロンブ周期図分析における誤警報スペクトルピークは、乱流データのノイズに起因する可能性があります。[ 20 ]フーリエ法は、パッチアップされたデータやその他の方法で編集されたデータを分析する場合にも、偽のスペクトルピークを報告する可能性があります。[ 7 ]
標準のロンブ・スカーグル周期図は、平均値がゼロのモデルに対してのみ有効です。通常、これは周期図を計算する前にデータの平均を減算することで近似されます。しかし、モデル(適合された正弦波)の平均がゼロでない場合、これは不正確な仮定です。一般化されたロンブ・スカーグル周期図はこの仮定を取り除き、平均値を明示的に求めます。この場合、適合される関数は[ 21 ]です。
一般化されたロンブ・スカーグル周期図は、文献では浮動平均周期図とも呼ばれている。[ 22 ]
オンタリオ州キングストンのクイーンズ大学のマイケル・コーレンバーグは、スペクトル解析の正弦波成分など、過剰に完全なセットから疎なコンポーネントのセットを選択する方法を開発しました。これは高速直交探索 (FOS) と呼ばれています。数学的には、FOS は、疎行列の逆行列として実装された平均二乗誤差削減 (MSER) プロセスでわずかに修正されたコレスキー分解を使用します。[ 15 ] [ 23 ]他の LSSA 法と同様に、FOS は離散フーリエ解析の大きな欠点を回避するため、埋め込まれた周期性を正確に識別でき、不等間隔のデータで優れた性能を発揮します。高速直交探索法は、非線形システム同定 などの他の問題にも適用されました。
Palmer は、任意の数の高調波に対して最適な関数を見つける方法を開発し、非正弦波高調波関数を見つける自由度を高めました。[ 24 ]これは、標準誤差が不均一な任意間隔のデータに対する重み付き最小二乗分析のための 高速 ( FFTベース) 手法です。この手法を実装するソース コードが利用可能です。 [ 25 ] データは、多くの場合、均一間隔の離散時間でサンプリングされないため、この手法では、サンプリング時間で時系列配列を疎に埋めることでデータを「グリッド化」します。すべての中間グリッド ポイントは、統計的重みがゼロとなり、サンプル間の時間に無限の誤差棒を持つことに相当します。

LSSAの最も有用な機能は、不完全な記録でもスペクトル分析を可能にすることであり、データの操作や、本来存在しないデータを捏造する必要がない点にある。
LSSAスペクトルの振幅は、周波数または周期が時系列の分散に寄与する度合いを表します。[ 4 ]一般的に、このように定義されたスペクトル振幅により、出力の明確な有意水準管理が可能になります。[ 26 ] あるいは、Vaníčekスペクトルのスペクトル振幅はdBで表すこともできます。[ 27 ] Vaníčekスペクトルのスペクトル振幅はβ分布に従うことに注意してください。[ 28 ]
Vaníček の LSSA の逆変換は可能であり、順変換を行列として記述すると最も簡単にわかります。行列の逆行列 (行列が特異でない場合) または擬似逆行列は逆変換になります。選択された正弦波がサンプル点で互いに独立しており、その数がデータ点の数と等しい場合、逆変換は元のデータと完全に一致します。[ 18 ] 周期図法については、このような逆手順は知られていません。
LSSAは1ページ未満のMATLABコードで実装できます。[ 29 ]要するに:[ 16 ]
「最小二乗スペクトルを計算するには、m個のスペクトル値を計算する必要があります。これは、最小二乗近似をm回実行し、毎回異なる周波数における[スペクトルパワー]を取得することを意味します。」
すなわち、所望の周波数セット内の各周波数について、データサンプルに対応する時刻で正弦関数と余弦関数を評価し、データベクトルと正弦波ベクトルの内積を計算して適切に正規化します。Lomb/Scargle周期図として知られる方法に従って、内積の前に正弦成分と余弦成分を直交化するために、各周波数に対して時間シフトを計算します。[ 18 ]最後に、これら2つの振幅成分からパワーを計算します。この同じプロセスは、データが時間的に均等に間隔を空けており、選択された周波数が有限データレコード上の整数サイクル数に対応する場合に、離散フーリエ変換を実行します。
この方法は、各正弦波成分をデータ点と直交していなくても、独立して、つまり文脈から切り離して扱います。これはVaníčekのオリジナルの方法です。さらに、行列方程式を解き、指定された正弦波周波数間でデータの分散全体を分割することにより、完全な同時または文脈内最小二乗フィッティングを実行できます。[ 18 ]このような行列最小二乗解は、バックスラッシュ演算子としてMATLABでネイティブに利用できます。[ 30 ]
さらに、同時法または文脈内法は、独立法または文脈外法(Lombによる周期図法も含む)とは対照的に、データサンプルの数よりも多くの成分(正弦と余弦)を適合させることはできないため、次のようになります。[ 18 ]
「選択された周波数によっては、フーリエ成分(三角関数)の一部が互いにほぼ線形依存となり、Nが悪条件またはほぼ特異行列となる場合、深刻な影響が生じる可能性があります。このような悪条件を回避するには、推定する周波数のセットを変更する(例えば、等間隔の周波数を選択する)か、Nの相関(すなわち、非対角ブロック)を無視して、個々の周波数に対して逆最小二乗変換を個別に推定する必要があります。」
一方、ロンブの周期図法では、標準的な周期図と同様に、周波数成分の数や密度を任意に高くすることができます。つまり、周波数領域を任意の係数でオーバーサンプリングすることができます。[ 3 ]しかし、前述のように、ロンブの単純化と最小二乗基準からの逸脱により、彼の手法は重大なエラーの原因となり、偽のスペクトルピークが生じる可能性もあることに留意する必要があります。[ 20 ]
フーリエ解析では、フーリエ変換や離散フーリエ変換のように、データに適合する正弦波はすべて互いに直交しているため、単純なコンテキスト外ドット積ベースの基底関数への射影と、コンテキスト内の同時最小二乗適合との間に区別はありません。つまり、異なる周波数の直交正弦波間の分散を最小二乗で分割するために行列の反転は必要ありません。[ 31 ]過去には、等間隔のサンプルを含む完全なデータレコードが利用可能な場合、フーリエは処理効率の高い高速フーリエ変換実装のおかげで多くの人にとって好ましい方法であり、ギャップのあるレコードの分析にもフーリエファミリーの手法が使用されていましたが、そのためには、フーリエベースのアルゴリズムを実行できるようにするためだけに、存在しないデータを操作したり、作成したりする必要がありました。