シーケンシャルパターンマイニングは、値がシーケンスで提供されるデータ例間の統計的に関連するパターンを見つけることに関係するデータマイニングのトピックです。 [ 1 ] [ 2 ]値は通常離散的であると想定されるため、時系列マイニングと密接に関連していますが、通常は別のアクティビティと見なされます。シーケンシャルパターンマイニングは、構造化データマイニングの特殊なケースです。
この分野では、いくつかの重要な従来型の計算問題が扱われています。これらには、シーケンス情報のための効率的なデータベースとインデックスの構築、頻繁に出現するパターンの抽出、類似性に基づいてシーケンスを比較すること、および欠落したシーケンスメンバーの復元が含まれます。一般に、シーケンスマイニングの問題は、通常、文字列処理アルゴリズムに基づく文字列マイニング と、通常、関連付けルール学習に基づくアイテムセットマイニングに分類できます。ローカルプロセスモデル[ 3 ]は、シーケンスパターンマイニングを、シーケンス順序構造に加えて、(排他的)選択、ループ、および並行構造を含むことができる、より複雑なパターンに拡張します。
文字列マイニングでは、通常、シーケンスに現れる項目のアルファベットは限定されていますが、シーケンス自体は非常に長くなる可能性があります。アルファベットの例としては、自然言語テキストで使用されるASCII文字セット、DNA配列のヌクレオチド塩基「A」、「G」、「C」、「T」、またはタンパク質配列のアミノ酸などが挙げられます。生物学の応用では、文字列内のアルファベットの配置の分析を使用して、遺伝子配列やタンパク質配列を調べてその特性を決定できます。DNAやタンパク質の文字の配列を知ることは、それ自体が最終目標ではありません。むしろ、主なタスクは、構造と生物学的機能の観点から配列を理解することです。これは通常、まず各配列内の個々の領域または構造単位を特定し、次に各構造単位に機能を割り当てることによって達成されます。多くの場合、これには、与えられた配列を以前に研究された配列と比較する必要があります。文字列に挿入、欠失、突然変異が発生すると、文字列間の比較は複雑になります。
バイオインフォマティクスの配列比較のための主要アルゴリズムの調査と分類は、Abouelhoda & Ghanem (2010) によって提示されており、これには以下が含まれます: [ 4 ]
シーケンスマイニングの問題の中には、頻繁に出現するアイテムセットとその出現順序を発見するのに適したものがあります。たとえば、「顧客が車を購入した場合、1週間以内に保険を購入する可能性が高い」という形式のルールを探したり、株価の文脈で「ノキアとエリクソンが上昇した場合、2日以内にモトローラとサムスンが上昇する可能性が高い」というルールを探したりする場合などです。従来、アイテムセットマイニングは、大規模な取引で頻繁に共起するアイテム間の規則性を発見するためにマーケティングアプリケーションで使用されてきました。たとえば、スーパーマーケットでの顧客の買い物かごの取引を分析することで、「顧客がタマネギとジャガイモを一緒に購入した場合、同じ取引でハンバーガー用の肉も購入する可能性が高い」というルールを作成できます。
アイテムセットマイニングの主要アルゴリズムの調査と分類は、Han ら (2007) によって提示されている。[ 5 ]
シーケンスデータベースにおける頻出アイテムセットマイニングに適用される2つの一般的な手法は、影響力のあるAprioriアルゴリズムと、より新しいFP-growth手法である。
多様な製品とユーザーの購買行動がある中で、製品を陳列する棚は小売環境において最も重要なリソースの1つです。小売業者は、棚スペースの割り当てと製品の陳列を適切に管理することで、利益を増やすだけでなくコストを削減することもできます。この問題を解決するために、GeorgeとBinu(2013)は、PrefixSpanアルゴリズムを使用してユーザーの購買パターンをマイニングし、マイニングされた購買パターンの順序に基づいて製品を棚に配置するアプローチを提案しました。[ 6 ]
一般的に使用されるアルゴリズムには以下が含まれます。