
数学において、時系列とは、時系列順にインデックス付け、リスト化、またはグラフ化されたデータポイントのシーケンスのことです。最も一般的には、時系列は連続する等間隔の時点で記録された観測値で構成されます。したがって、時系列は離散時間データの一種です。時系列は、秒、日、年、あるいは数世紀にわたって収集された測定値を表すことができます。一般的な例としては、潮位、太陽黒点数、日々の気温、ダウ・ジョーンズ工業平均株価などの株価指数の終値などが挙げられます。
時系列データは、ランチャート(時間軸を示す折れ線グラフの一種)を用いて視覚化されることが多く、これにより、傾向、季節変動、不規則な変動といったパターンを特定しやすくなります。時系列データは、統計学、アクチュアリー科学、信号処理、パターン認識、計量経済学、数理ファイナンス、天気予報、地震予知、脳波検査、制御工学、天文学、通信工学など、時間的測定を伴う応用科学や工学の多くの分野で広く利用されています。
時系列分析とは、時系列データから意味のある統計量やその他の特性を抽出するために、時系列データを分析する手法のことです。時系列予測とは、過去に観測された値に基づいて将来の値を予測するためにモデルを使用することです。一般的に、時系列データは確率過程としてモデル化されます。回帰分析は、1つまたは複数の異なる時系列間の関係を検証するためによく用いられますが、この種の分析は通常「時系列分析」とは呼ばれません。時系列分析とは、特に単一の時系列内の異なる時点間の関係を指すからです。
時系列データには自然な時間的順序があります。このため、時系列分析は、観測値に自然な順序がない横断的研究(例えば、個人のデータが任意の順序で入力される可能性がある場合、人々の賃金をそれぞれの教育レベルを参照して説明するなど)とは異なります。また、時系列分析は、観測値が通常地理的な場所に関連している空間データ分析(例えば、住宅価格を住宅の固有の特性だけでなく場所によっても考慮するなど)とも異なります。時系列の確率モデルは一般的に、時間的に近い観測値は、時間的に離れた観測値よりも密接に関連しているという事実を反映します。さらに、時系列モデルは、多くの場合、時間の自然な一方向の順序を利用し、特定の期間の値は、将来の値ではなく、過去の値から何らかの形で派生したものとして表現されます(時間の可逆性を参照)。
時系列分析は、実数値の連続データ、離散数値データ、または離散記号データ(英語の文字や単語などの文字のシーケンス[ 1 ] )に適用できます。
時系列解析の手法は、周波数領域手法と時間領域手法の2種類に分けられます。前者はスペクトル解析やウェーブレット解析など、後者は自己相関解析や相互相関解析などです。時間領域では、スケーリングされた相関を用いることで、フィルタのように相関分析を行うことができ、周波数領域での処理の必要性を軽減できます。
さらに、時系列分析手法は、パラメトリック法とノンパラメトリック法に分類できます。パラメトリック法では、基礎となる定常確率過程が、少数のパラメータ(例えば、自己回帰モデルや移動平均モデル)を用いて記述できる特定の構造を持つと仮定します。これらの手法では、確率過程を記述するモデルのパラメータを推定することが課題となります。一方、ノンパラメトリック法では、過程が特定の構造を持つと仮定することなく、過程の共分散またはスペクトルを明示的に推定します。
時系列分析の手法は、線形と非線形、単変量と多変量に分類することもできます。
時系列データはパネルデータの一種です。パネルデータは一般的な分類で、多次元データセットですが、時系列データセットは一次元パネルです(横断的データセットも同様です)。データセットは、パネルデータと時系列データの両方の特徴を示す場合があります。それを判断する一つの方法は、あるデータレコードを他のレコードと区別する要素は何かを問うことです。答えが時間データフィールドであれば、それは時系列データセットの候補です。一意のレコードを特定するために、時間データフィールドと時間とは無関係な追加の識別子(例:学生ID、銘柄コード、国コード)が必要な場合は、それはパネルデータの候補です。区別が時間とは無関係な識別子にある場合は、そのデータセットは横断的データセットの候補です。
時系列データには、さまざまな目的に適した、いくつかの種類の動機付けとデータ分析手法が存在する。
統計学、計量経済学、定量金融、地震学、気象学、地球物理学の分野では、時系列分析の主な目的は予測です。信号処理、制御工学、通信工学の分野では、信号検出に使用されます。その他の応用分野としては、データマイニング、パターン認識、機械学習があり、時系列分析はクラスタリング[ 2 ] [ 3 ] [ 4 ]、分類[ 5 ]、コンテンツによるクエリ[ 6 ] 、異常検出、予測[ 7 ]などに使用できます。

規則的な時系列を調べる簡単な方法は、折れ線グラフを使って手動で調べることです。このデータグラフは、米国の結核による死亡者数[ 8 ]と、年ごとの変化率、前年比の変化率を示しています。総死亡者数は1980年代半ばまで毎年減少していましたが、その後は時折増加し、多くの場合、絶対値ではなく比例的にかなり大きくなりました。
企業データアナリストを対象とした調査では、探索的時系列分析における2つの課題が明らかになった。それは、興味深いパターンの形状を発見することと、これらのパターンの説明を見つけることである。[ 9 ]時系列データをヒートマップ行列として表現する視覚ツールは、これらの課題を克服するのに役立つ。
この手法は、フーリエ変換を用いた周波数領域における信号の調和解析とフィルタリング、およびスペクトル密度推定に基づいている。その開発は、第二次世界大戦中に数学者のノルベルト・ウィーナー、電気技師のルドルフ・E・カルマン、デニス・ガボールらによって、ノイズから信号をフィルタリングし、特定の時点での信号値を予測するために大きく加速された。
同様の効果は、カルマンフィルターのように時間領域でも実現できます。その他の手法については、「フィルタリングと平滑化」を参照してください。
その他の関連技術には以下が含まれます。
曲線フィッティング[ 12 ] [ 13 ]は、制約条件[ 15 ] [ 16 ]の対象となる場合もあり、一連のデータポイントに最もよく適合する曲線、または数学関数を構築するプロセスです[ 14 ] 。曲線フィッティングには、データに正確に適合する必要がある場合の補間[17][18]、またはデータに近似的に適合する「滑らかな」関数を構築する平滑化[19][20]のいずれかが含まれます。関連するトピックとして回帰分析[ 21 ] [ 22 ]があり、ランダム誤差を伴う観測データに適合した曲線にどの程度の不確実性があるかなど、統計的推論の問題に重点を置いています。適合した曲線は、データの視覚化[ 23 ] [ 24 ] 、データがない場合の関数の値の推定[ 25 ]、および2つ以上の変数間の関係の要約の補助として使用できます。[ 26 ]外挿とは、観測データの範囲を超えて適合曲線を使用することを指し、 [ 27 ]観測データを反映するのと同様に、曲線の構築に使用された方法を反映している可能性があるため、ある程度の不確実性を伴う[ 28 ] 。

一般的に規模が拡大すると予想されるプロセスについては、グラフ中の曲線(およびその他多くの曲線)の1つを、そのパラメータを推定することによって近似することができる。
経済時系列の構築には、過去と現在の日付の値(「ベンチマーク」)間の補間によって、特定の日付のいくつかの要素を推定することが含まれます。補間とは、既知の2つの量(履歴データ)間の未知の量を推定すること、または利用可能な情報から欠落した情報について結論を導き出すこと(「行間を読む」)です。[ 29 ]補間は、欠落したデータ周辺のデータが利用可能で、その傾向、季節性、および長期サイクルがわかっている場合に有用です。これは多くの場合、関連するすべての日付について既知の関連系列を使用することによって行われます。[ 30 ]あるいは、多項式補間またはスプライン補間が使用され、区分的多項式関数が滑らかに繋がるように時間間隔で適合されます。補間と密接に関連する別の問題は、複雑な関数を単純な関数で近似すること(回帰とも呼ばれる)です。回帰と補間の主な違いは、多項式回帰ではデータセット全体をモデル化する単一の多項式が得られることです。しかし、スプライン補間では、データセットをモデル化するために、多数の多項式から構成される区分的に連続な関数が得られます。
外挿とは、ある変数と別の変数との関係に基づいて、元の観測範囲を超えた範囲の変数の値を推定するプロセスです。これは、既知の観測値間の推定値を算出する内挿と似ていますが、外挿はより大きな不確実性を伴い、無意味な結果を生み出すリスクが高くなります。
一般的に、関数近似問題では、タスク固有の方法で目標関数によく一致する(「近似する」)関数を、明確に定義されたクラスの中から選択することが求められます。関数近似問題には、大きく分けて 2 つのクラスがあります。まず、既知の目標関数の場合、近似理論 は、特定の既知の関数(例えば、特殊関数)を、望ましい特性(計算コストが低い、連続性、積分値と極限値など)を持つ特定の関数クラス(例えば、多項式や有理関数)でどのように近似できるかを調査する数値解析の分野です。
第二に、目的関数gは未知である可能性があります。明示的な式の代わりに、( x , g ( x )) の形式の点の集合 (時系列) のみが提供されます。gの定義域と値域の構造に応じて、g を近似するためのいくつかの手法が適用可能です。たとえば、g が実数に対する演算である場合、補間、外挿、回帰分析、曲線フィッティングの手法を使用できます。g の値域 (範囲またはターゲット集合) が有限集合である場合、代わりに分類問題を扱います。オンライン時系列近似[ 31 ]に関連する問題は、データを 1 回のパスで要約し、最悪ケースのエラーの境界でさまざまな時系列クエリをサポートできる近似表現を構築することです。
ある程度、統計的学習理論では、さまざまな問題(回帰、分類、適合度近似)が統一的に扱われており、教師あり学習問題として捉えられている。
統計学において、予測は統計的推論の一部です。このような推論の特定の手法の一つは予測推論として知られていますが、予測は統計的推論の様々な手法のいずれにおいても行うことができます。実際、統計学の説明の一つとして、母集団の標本に関する知識を母集団全体、そして他の関連する母集団に伝達する手段を提供するというものがあります。これは必ずしも時間経過に伴う予測と同じではありません。情報が時間を超えて、多くの場合特定の時点に伝達される場合、そのプロセスは予測として知られています。
時系列パターンを特定のカテゴリに割り当てる。例えば、手話の一連の手の動きに基づいて単語を識別する。
時系列データをセグメントのシーケンスに分割します。時系列データは、それぞれ固有の特性を持つ個々のセグメントのシーケンスとして表現できる場合がよくあります。たとえば、電話会議の音声信号は、各参加者が話していた時間に対応する部分に分割できます。時系列データの分割では、時系列データ内のセグメント境界点を特定し、各セグメントに関連付けられた動的特性を特徴付けることが目的です。この問題は、変化点検出を用いるか、マルコフジャンプ線形システムのようなより高度なシステムとして時系列データをモデル化することで解決できます。
時系列データはクラスタリングされる可能性があるが、サブシーケンスクラスタリングを検討する際には特別な注意が必要である。[ 33 ] [ 34 ] 時系列クラスタリングは以下のように分割できる。
サブシーケンス時系列クラスタリングでは、スライディングウィンドウを使用したチャンキングによる特徴抽出によって不安定な(ランダムな)クラスタが生成された。 [ 36 ]クラスタ中心(クラスタ内の時系列の平均 - これも時系列)は、任意にシフトした正弦波パターンに従うことがわかった(データセットに関係なく、ランダムウォークの実現でも同様)。これは、クラスタ中心が常に代表的でない正弦波であるため、見つかったクラスタ中心はデータセットを記述するものではないことを意味する。
時系列データのモデルはさまざまな形式を持ち、さまざまな確率過程を表すことができます。プロセスのレベルの変動をモデル化する場合、実用上重要な3つの大きなクラスは、自己回帰(AR)モデル、積分(I)モデル、および移動平均(MA)モデルです。これら3つのクラスは、以前のデータポイントに線形に依存します。 [ 37 ]これらのアイデアの組み合わせにより、自己回帰移動平均(ARMA)モデルと自己回帰積分移動平均(ARIMA)モデルが生成されます。自己回帰分数積分移動平均(ARFIMA)モデルは、前述の3つを一般化したものです。もう1つの重要な一般化は、時間変動自己回帰(TVAR)モデルです。このモデルでは、AR係数が時間とともに変化することが許容され、モデルが進化または非定常的なダイナミクスを捉えることができます。ベクトル値データを扱うためのこれらのクラスの拡張は、多変量時系列モデルという見出しの下で利用可能であり、場合によっては、ベクトル自己回帰を表す VAR のように、上記の頭字語に「ベクトル」を表す「V」が最初に付加されます。これらのモデルの追加の拡張セットは、観測された時系列が何らかの「強制」時系列(観測された時系列に因果的影響を与えない場合もある)によって駆動される場合に使用できます。多変量の場合との違いは、強制時系列が決定論的であるか、実験者の制御下にある可能性がある点です。これらのモデルの場合、頭字語には「外生的」を表す「X」が最後に付加されます。
時変自己回帰(TVAR)モデルは、時系列の変動がトレンドや季節パターンといった古典的な変動形式に限らず、複雑な形で時間とともに変化する非定常時系列の分析に特に有効です。固定パラメータを持つ古典的なARモデルとは異なり、TVARモデルでは自己回帰係数を時間の関数として変化させることができ、通常はユーザーが形式と複雑さを決定する基底関数展開によって表現されます。これにより、時変挙動を非常に柔軟にモデル化することが可能になり、データが示す特定の非定常パターンを捉えることができます。この柔軟性により、TVARモデルは、システムの挙動における構造変化、体制転換、または緩やかな変化をモデル化するのに最適です。 TVAR 時系列モデルは、信号処理[ 38 ] [ 39 ]経済学[ 40 ]金融[ 41 ]信頼性および状態監視[ 42 ] [ 43 ] [ 44 ]電気通信[ 45 ] [ 46 ]神経科学[ 47 ]気候科学[ 48 ]および水文学[ 49 ]などの分野で広く応用されており、これらの分野では、時系列は従来の線形モデルでは適切に表現できない動態を示すことがよくあります。TVAR モデルの推定には、通常、カーネル平滑化 [ 50 ] 再帰的最小二乗法 [ 51 ]またはカルマンフィルタリング[ 52 ]などの手法が含まれます。
時系列のレベルが過去のデータポイントに非線形に依存することは、カオス的な時系列を生成する可能性があるため、興味深い。しかし、より重要なことに、経験的調査では、非線形自己回帰外生モデルのように、線形モデルからの予測よりも非線形モデルからの予測を使用する利点を示すことができる。非線形時系列分析に関するその他の参考文献: (Kantz and Schreiber) [ 53 ]および (Abarbanel) [ 54 ] 。
非線形時系列モデルには、時間の経過に伴う分散の変化(異分散性)を表すモデルがあります。これらのモデルは自己回帰条件付き異分散性(ARCH)を表し、その種類は多岐にわたります(GARCH 、TARCH、EGARCH、FIGARCH、CGARCHなど)。ここでは、変動性の変化は、観測された系列の直近の過去の値に関連付けられるか、または予測されます。これは、変動性が二重確率モデルのように、別の時間変動プロセスによって引き起こされるものとしてモデル化される可能性のある、局所的に変動する変動性の他の表現とは対照的です。
最近の「モデルフリー」解析(パラメトリックな数式で時間の経過に伴うプロセスの変化をモデル化することに依存しない解析を指す用語)に関する研究では、ウェーブレット変換に基づく手法(例えば、局所的に定常なウェーブレットやウェーブレット分解ニューラルネットワーク)が好まれている。[ 55 ]マルチスケール(マルチレゾリューションと呼ばれることが多い)手法は、与えられた時系列を分解し、複数のスケールでの時間依存性を明らかにしようとする。変動性の進化をモデル化するためのマルコフスイッチングマルチフラクタル(MSMF)手法も参照のこと。
隠れマルコフモデル(HMM)は、モデル化対象のシステムが観測不能な(隠れた)状態を持つマルコフ過程であると仮定する統計的マルコフモデルです。HMMは、最も単純な動的ベイジアンネットワークと考えることができます。HMMモデルは、音声認識において、時系列の音声単語をテキストに変換するために広く使用されています。
これらのモデルの多くは、Pythonパッケージsktimeにまとめられています。
時系列分析にはさまざまな表記法が用いられています。自然数でインデックス付けされた時系列Xを指定する一般的な表記法は、次のように記述されます。
もう1つの一般的な表記法は
ここで、Tはインデックス集合である。
この理論の多くは、以下の2つの条件に基づいて構築されている。
エルゴード性は定常性を意味しますが、その逆は必ずしも当てはまりません。定常性は通常、厳密な定常性と広義の定常性(または二次定常性)に分類されます。モデルとアプリケーションはどちらの条件の下でも開発できますが、後者の場合のモデルは部分的にしか規定されていないとみなされる可能性があります。
さらに、時系列分析は、時系列が季節的に定常である場合にも非定常である場合にも適用できます。周波数成分の振幅が時間とともに変化する状況は、時系列または信号の時間周波数表現を利用する時間周波数分析で処理できます。[ 56 ]
時系列データを調査するためのツールには、以下のようなものがあります。
時系列分類や回帰分析に使用できる時系列指標または特徴量:[ 60 ]
時系列データは、オーバーラップチャートとセパレートチャートの2種類のチャートで視覚化できます。オーバーラップチャートはすべての時系列データを同じレイアウトで表示しますが、セパレートチャートは異なるレイアウトで表示します(ただし、比較のために整列されています)[ 64 ]。
ジェボンズは時系列を研究した最初の人物である。[ 65 ]彼の著書では、1825年から1860年までの週ごとの金融時系列を多数調査した。これには、倒産、通貨流通、割引率の時系列が含まれる。
観測データに対して良好から中程度の適合が得られれば、関数は満たされる。