時系列セグメンテーションは、入力時系列を一連の離散セグメントに分割して、そのソースの根本的な特性を明らかにする時系列分析の手法です。時系列セグメンテーションの典型的な応用は、話者ダイアリゼーションです。これは、音声信号を誰がいつ話しているかに応じて複数の部分に分割するものです。変化点検出に基づくアルゴリズムには、スライディングウィンドウ、ボトムアップ、トップダウン法などがあります。[1]隠れマルコフモデルに基づく確率的手法も、この問題の解決に有効であることが証明されています。[2]
セグメンテーション問題の概要
時系列は、有限の長さの離散的なセグメントのシーケンスとして表現できることがよくあります。たとえば、株式市場の軌跡は、重要な世界的イベントの間にある領域に分割できます。手書き認識アプリケーションへの入力は、それが構成されていると考えられるさまざまな単語や文字に分割できます。または、会議の音声録音は、誰がいつ話したかに従って分割できます。最後の 2 つのケースでは、個々のセグメントのラベル割り当てが繰り返される可能性があるという事実 (たとえば、会議中に 1 人の人物が複数の別々の機会に話す場合) を利用して、セグメントをその特徴的な特性(各話者の声のスペクトル内容など) に従ってクラスタ化しようとします。この問題には、2 つの一般的なアプローチがあります。1 つ目は、時系列の変化点を探すことです。たとえば、信号の平均値に大きなジャンプがある場合は、セグメント境界を割り当てることができます。 2番目のアプローチは、時系列の各セグメントが異なるパラメータを持つシステムによって生成されていると仮定し、最も可能性の高いセグメントの位置とそれを説明するシステムパラメータを推測することです。[3]最初のアプローチは短い時間枠内の変化のみを探す傾向がありますが、2番目のアプローチでは通常、特定のポイントに割り当てるラベルを決定する際に時系列全体を考慮します。
セグメンテーションアルゴリズム
隠れマルコフモデル
隠れマルコフモデルでは、時系列はシステムが一連の離散的な隠れ状態の間を遷移するにつれて生成されたものと想定されます。各時刻 において、現在の隠れ状態によってインデックス付けされた観測(または放出)分布、すなわち からサンプルが抽出されます。セグメンテーション問題の目標は、各時刻における隠れ状態と、各隠れ状態に関連付けられた放出分布を記述するパラメータを推測することです。隠れ状態シーケンスと放出分布パラメータは、 HMM に適用される期待最大化の変形であるBaum-Welch アルゴリズム を使用して学習できます。通常、セグメンテーション問題では、状態間の自己遷移確率は高いと想定され、システムは各状態に無視できない時間留まります。より堅牢なパラメータ学習法では、階層的ディリクレ過程の事前分布を HMM 遷移行列に配置する必要があります。 [4]
参照
参考文献
- ^ Keogh、Eamonn、他「時系列のセグメント化:調査と斬新なアプローチ」時系列データベースのデータマイニング57(2004):1-22。
- ^ Fox, Emily B.他「状態持続性を備えたシステムのための HDP-HMM」機械学習に関する第 25 回国際会議の議事録。ACM、2008 年。
- ^ Li, Yang; Zhao, Kaiguang; Hu, Tongxi; Zhang, Xuesong. 「BEAST: 変化点検出と時系列分解のためのベイジアンアンサンブルアルゴリズム」。GitHub。
- ^ Teh, Yee Whye、他「階層的ディリクレ過程」アメリカ統計学会誌 101.476 (2006)。
さらに読む
- Silva, Ricardo Petri; Zarpelão, Bruno Bogaz; Cano, Alberto; Junior, Sylvio Barbon (2021 年 11 月 4 日)。「定常性分析に基づく時系列セグメンテーションによる新規サンプル予測の改善」。センサー。21 ( 21 ) : 7333。Bibcode : 2021Senso..21.7333S。doi : 10.3390 / s21217333。PMC 8587387。PMID 34770639。
