粒状コンピューティングは、情報処理における新たなコンピューティングパラダイムであり、情報抽象化や情報・データからの知識抽出の過程で生じる「情報粒」と呼ばれる複雑な情報エンティティの処理を扱います。一般的に、情報粒とは、通常は数値レベルで発生し、類似性、機能的または物理的な近接性、区別不可能性、一貫性などによってまとめられたエンティティの集合体です。
現状では、粒状コンピューティングは、体系的な手法や原理というよりも、理論的な観点としての側面が強い。理論的な観点としては、様々な解像度やスケールでデータに存在する知識を認識し、活用するデータへのアプローチを提唱する。この意味で、粒状コンピューティングは、知識や情報を抽出・表現する際の解像度において、柔軟性と適応性を提供するあらゆる手法を包含する。


前述のとおり、粒度コンピューティングはアルゴリズムやプロセスではなく、「粒度コンピューティング」と呼ばれる特定の手法は存在しません。むしろ、データの粒度レベルによって異なる興味深い規則性が現れることを認識するデータ解析のアプローチです。これは、解像度の異なる衛星画像で異なる特徴が際立つのと同様です。例えば、低解像度の衛星画像では、サイクロンなどの大規模な気象現象を表す興味深い雲のパターンが見られるかもしれませんが、高解像度の画像では、こうした大規模な大気現象は見逃され、代わりにマンハッタンの街路のような興味深いパターンといった、より小規模な現象が目に留まります。これは一般的にすべてのデータに当てはまります。解像度や粒度が異なると、異なる特徴や関係性が浮かび上がってきます。粒度コンピューティングの目的は、この事実を利用して、より効果的な機械学習システムや推論システムを設計することです。
データマイニングや機械学習では、いくつかの種類の粒度がよく用いられます。以下では、それらについて概説します。
粒度化の一種として、変数の量子化があります。データマイニングや機械学習アプリケーションでは、意味のある規則性を抽出するために変数の解像度を下げる必要があることが非常に一般的です。その例として、「外気温」( temp)という変数が挙げられます。特定のアプリケーションでは、この変数は(センシング装置に応じて)小数点以下数桁の精度で記録される可能性があります。しかし、「外気温」と、例えば「ヘルスクラブの会員数」(club)との間の関係を抽出する目的では、「外気温」をより少ない数の区間に量子化する方が一般的に有利です。
変数をこのように細分化するのに、相互に関連するいくつかの理由があります。

例えば、単純な学習器やパターン認識システムは、次のような条件付き確率閾値を満たす規則性を抽出しようとするかもしれない。特別な場合この認識システムは基本的に次の形式の論理的含意を検出しますまたは、言葉で言うと、「もしそれからシステムがそのような影響(または一般的には、閾値を超える条件付き確率)を認識する能力は、システムが変数を分析する解像度に部分的に依存します。
この最後の点の例として、右図に示す特徴空間を考えてみましょう。各変数は、2つの異なる解像度で考えることができます。変数高解像度(四元)で見れば、4つの値をとる。または、より低い(バイナリ)解像度では、2つの値をとります 同様に、変数高解像度(四元)または低解像度(二元)で見ることができ、その値はまたはそれぞれ。高解像度では、その形式の検出可能な影響はありません。なぜなら、すべての複数のものに関連付けられていますそして、すべてのしかし、低い(二値)変数解像度では、2つの双方向的な意味合いが検出可能になる。 そしてなぜなら、発生するのは、そして発生するのは、したがって、このような意味合いをスキャンするパターン認識システムは、二値変数解像度ではそれらを検出できるが、より高い四値変数解像度では検出できないだろう。
すべての変数に対して考えられるすべての離散化解像度を網羅的にテストして、どの解像度の組み合わせが興味深い、あるいは重要な結果をもたらすかを確認することは現実的ではありません。そのため、特徴空間を前処理(多くの場合、何らかのエントロピー分析によって)し、離散化プロセスをどのように進めるべきかについて何らかの指針を与える必要があります。さらに、各変数を単純に個別に分析して離散化するだけでは、一般的に良い結果は得られません。なぜなら、そうすることで、発見しようとしていた相互作用そのものが失われてしまう可能性があるからです。
一般的に変数離散化の問題、特に多変数離散化の問題を扱った論文の例は次のとおりです。Chiu 、Wong & Cheung (1991)、Bay (2001)、 Liu et al. (2002)、Wang & Liu (1998)、Zighed、Rabaséda & Rakotomalala (1998)、Catlett (1991)、Dougherty、Kohavi & Sahami (1995)、Monti & Cooper (1999)、Fayyad & Irani (1993)、Chiu、Cheung & Wong (1990)、Nguyen & Nguyen (1998)、Grzymala-Busse & Stefanowski (2001)、Ting (1994)、Ludl & Widmer (2000)、Pfahringer (1995)、An & Cercone (1999)、 Chiu & Cheung (1989)、Chmielewski &グジマラ・ブッセ (1996)、リー& Shin (1994)、Liu & Wellman (2002)、Liu & Wellman (2004)。
可変粒度化とは、次元数、冗長性、およびストレージ要件の削減を目的とした様々な手法を指す用語です。ここでは、そのいくつかの概念を簡単に説明し、関連文献への参照を示します。
主成分分析、多次元尺度構成法、因子分析、構造方程式モデリングなどの古典的な手法とその関連手法の多くは、「変数変換」という範疇に属します。また、次元削減、射影追跡、独立成分分析などのより現代的な研究分野もこの範疇に含まれます。これらの手法の一般的な目標は、元の変数の線形または非線形変換である新しい変数を用いてデータを表現することです。この新しい変数からは重要な統計的関係が浮かび上がります。結果として得られる変数セットは、元の変数セットよりもほぼ常に小さくなるため、これらの手法は特徴空間に粒度を与えるものと大まかに言えます。これらの次元削減手法はすべて、Duda、Hart & Stork (2001)、Witten & Frank (2005)、Hastie、Tibshirani & Friedman (2001)などの標準的なテキストで解説されています。
変数粒度化手法の別のクラスは、上記の手法を支える線形システム理論よりも、データクラスタリング手法から派生している。関連する変数を「クラスタリング」することは、関連するデータをクラスタリングすることとまったく同じように考えられることは、かなり早い段階で指摘された。データクラスタリングでは、類似したエンティティのグループを特定し(ドメインに適した「類似度尺度」を使用 — Martino、Giuliani & Rizzi (2018))、その後、ある意味でそれらのエンティティを何らかのプロトタイプに置き換える。プロトタイプは、特定されたクラスタ内のデータの単純平均、またはその他の代表尺度である可能性がある。しかし、重要な考え方は、後続の操作において、データクラスタの単一のプロトタイプ(おそらくプロトタイプから例がどのように導出されるかを記述する統計モデルとともに)を使用して、はるかに大きな例のセットを代用できる可能性があるということである。これらのプロトタイプは一般的に、エンティティに関する関心のある情報のほとんどを捉えるものである。

同様に、多数の変数を、変数間の最も顕著な関係を捉える少数のプロトタイプ変数に集約できるかどうかを問うのは妥当である。線形相関に基づく変数クラスタリング手法が提案されているが(Duda、Hart & Stork 2001、Rencher 2002 )、より強力な変数クラスタリング手法は、変数間の相互情報量に基づいている。渡辺は(渡辺 1960、渡辺 1969)、任意の変数セットに対して、一連の変数凝集を表す多項式(すなわちn分)ツリーを構築できることを示した。このツリーでは、完全な変数セット間の最終的な「総」相関は、各凝集サブセットによって示される「部分」相関の合計である(図を参照)。渡辺は、観察者は、まるで自然な分割や隠れた亀裂を探しているかのように、各部分間の相互依存性を最小限に抑えるようにシステムを分割しようとするかもしれないと示唆している。
このようなツリーを構築するための実際的なアプローチの1つは、ペアワイズ相互情報量が最も高い2つの変数(原子変数または以前に集約された変数)を順次集約対象として選択することです(Kraskov et al. 2003 ) 。各集約の産物は、2つの集約変数の局所的な同時分布を反映する新しい(構築された)変数であり、したがってそれらの同時エントロピーに等しいエントロピーを持ちます。 (手続き上の観点から言えば、この集約ステップでは、属性値テーブルの 2 つの列(集約する 2 つの変数を表す)を、置き換えられた列の値のすべての固有の組み合わせに対して固有の値を持つ単一の列に置き換えます(Kraskov et al. 2003 )。このような操作によって情報が失われることはありません。ただし、変数間の関係を調べるためにデータを探索する場合、このような方法で冗長な変数をマージすることは一般的に望ましくありません。なぜなら、そのような状況では、変数間の冗長性または依存関係がまさに関心の対象となる可能性が高く、冗長な変数がマージされると、それらの相互関係を研究できなくなるからです。)
データベースシステムにおいて、集計(例えば、OLAP集計やビジネスインテリジェンスシステムを参照)は、元のデータテーブル(情報システムと呼ばれることが多い)を、行と列の意味が異なるテーブルに変換します。このテーブルでは、行は元のタプルのグループ(粒)に対応し、列は各グループ内の元の値に関する集計情報を表します。このような集計は通常、SQLとその拡張機能に基づいています。結果として得られる粒は、通常、事前に選択された元の列に対して同じ値(または範囲)を持つ元のタプルのグループに対応します。
グループの定義に、例えば行の物理的な隣接性に基づくアプローチもあります。例えば、Infobrightは、データがラフ行に分割されるデータベースエンジンを実装しました。ラフ行は、物理的に連続した(またはほぼ連続した)64K行で構成されます。ラフ行には、データ列の値に関するコンパクトな情報が自動的にラベル付けされ、多くの場合、複数列および複数テーブルの関係が含まれます。その結果、オブジェクトがラフ行に対応し、属性がラフ情報のさまざまな側面に対応する、より詳細な情報レイヤーが実現しました。このような新しいフレームワーク内では、データベース操作を効率的にサポートでき、元のデータピースへのアクセスも引き続き可能です(Slezak et al. 2013 )。
粒度コンピューティングのイデオロギーの起源は、ラフ集合とファジィ集合の文献に見出すことができる。ラフ集合研究の重要な洞察の一つは(決してラフ集合研究に特有のものではないが)、一般的に、異なる特徴量または変数のセットを選択すると、異なる概念粒度が得られるということである。ここで、初等ラフ集合理論と同様に、「概念」とは、観察者にとって区別できない、あるいは識別できない実体の集合(すなわち、単純概念)、またはそのような単純概念から構成される実体の集合(すなわち、複雑概念)を意味する。言い換えれば、データセット(値属性システム)を異なる変数セットに投影することで、データ内の同値類「概念」の代替セットを認識し、これらの異なる概念セットは一般的に、異なる関係性や規則性の抽出に役立つ。
例を用いて説明しましょう。以下の属性値システムを考えてみてください。
属性の完全なセット考慮すると、次の 7 つの同値類または原始的(単純)概念が存在することがわかります。
したがって、最初の同値類内の 2 つのオブジェクトは、利用可能な属性に基づいて互いに区別することはできず、第 2 等価クラス内の 3 つのオブジェクトは、利用可能な属性に基づいて互いに区別することはできません。残りの 5 つのオブジェクトはそれぞれ他のすべてのオブジェクトと区別できます。次に、属性値システムを属性に投影することを想像してみましょう。これは、例えば、この単一の属性しか検出できない観察者からの視点を表す。すると、以下のような、より粗い同値類構造が得られる。
これはある意味では以前と同じ構造ですが、解像度が低くなっています(粒度が大きくなっています)。値の粒度化(離散化/量子化)の場合と同様に、ある粒度レベルでは存在する関係(依存関係)が、別の粒度レベルでは存在しない可能性があります。その例として、概念の粒度化が属性依存性(相互情報量のより単純な類似物)と呼ばれる尺度に与える影響を考えてみましょう。
この依存関係の概念を確立するために(ラフ集合も参照)、それぞれが特定の概念の粒度を表し、は、属性セットQによって誘導される概念構造からの同値類です。たとえば、属性セットQが属性で構成されている場合単独で、上記のように、概念構造構成する
属性セットQが別の属性セットPに依存していること、は
つまり、各同値類についてでPの属性によってその「下近似値」(ラフ集合を参照)のサイズを合計します。より簡単に言うと、この近似値は、属性セットPにおいて、ターゲットセットに属すると確実に識別できるオブジェクトの数である。すべての同値類に追加されました上記の分子は、属性セットPに基づいて、属性Qによって誘導される分類に従って正に分類できるオブジェクトの総数を表します。したがって、依存度は、そのような分類可能なオブジェクトの割合(全体の中で)を表し、ある意味で2つの概念構造の「同期」を捉えています。そして依存関係「情報システム内のそのようなオブジェクトのうち、 Pの属性の値を知るだけでQの属性の値を決定するのに十分であるものの割合として解釈できる」(Ziarko & Shan 1995)。
定義を済ませたところで、概念の粒度(つまり属性の選択)の選択が、属性間の依存関係の検出に影響を与えるという単純な観察結果を得ることができます。上記の属性値テーブルをもう一度考えてみましょう。
属性セットの依存関係を考慮する 属性セット つまり、オブジェクトのうち、どの割合がクラスに正しく分類できるかを知りたいのです。知識に基づいて同値類そして以下に示します。
概念構造に基づいて明確に分類できる対象に基づくセット内のものそして、これらが 6 つあるので、QのPへの依存性は、これはそれ自体興味深い依存関係と見なせるかもしれないが、特定のデータマイニングアプリケーションにおいては、より強い依存関係のみが望ましい場合もあるだろう。
次に、より小さな属性セットの依存性について検討する。 属性セットについて 移動にクラス構造の粗大化を引き起こす後ほど説明します。私たちは、オブジェクトのうち、(より大きな) クラスに正しく分類できる割合を改めて知りたいと考えています。知識に基づいて新しい同値類そして以下に示します。
明らかに、以前よりも粒度が粗くなっている。概念構造に従って明確に分類できるオブジェクトはに基づく完全な宇宙を構成するしたがって、QのPへの依存性、つまり、カテゴリセットに基づくメンバーシップの知識 カテゴリーメンバーシップを決定するのに十分です完全に確信を持って; この場合、次のように言えるでしょう。このように、概念構造を粗くすることで、より強い(決定論的な)依存関係を見つけることができました。しかし、誘導されたクラスはこの決定論的依存関係を得るために必要な解像度の低下から生じるものは、現在ではそれ自体が大きく、数が少ない。その結果、我々が発見した依存関係は強いものの、以前に高解像度の視点の下で発見された弱い依存関係よりも価値が低い可能性がある。
一般的に、どの誘導概念構造が最も強い依存関係を生み出すかを確認するために、すべての属性セットをテストすることは不可能であり、したがって、この探索はある程度の知性をもって行われる必要がある。この問題、および粒度化の賢明な使用に関連するその他の問題について論じた論文は、以下の#Referencesに記載されているYY YaoとLotfi Zadehによるものである。
概念の粒度化に関する別の視点は、カテゴリのパラメトリックモデルに関する研究から得られる。例えば、混合モデル学習では、データセットは異なるガウス分布(またはその他の分布)の混合として説明される。つまり、大量のデータが少数の分布に「置き換えられる」。これらの分布の数とそのサイズの選択は、やはり概念の粒度化の問題と見なすことができる。一般に、分布またはパラメータの数が多いほどデータへの適合性は向上するが、意味のあるパターンを抽出するためには、分布の数を制限する必要があり、それによって概念の解像度を意図的に 粗くする必要がある。適切な概念の解像度を見つけることは難しい問題であり、多くの手法(例えば、AIC、BIC、MDLなど)が提案されており、これらはしばしば「モデル正則化」という枠組みで検討される。
粒状コンピューティングは、問題解決の過程で情報粒度を活用する理論、方法論、技術、ツールの枠組みとして捉えることができる。この意味で、粒状コンピューティングは、これまで様々な分野で個別に研究されてきたトピックを包括する包括的な用語として用いられる。粒状コンピューティングという統一的な枠組みに照らしてこれらの既存の研究をすべて検討し、共通点を抽出することで、問題解決のための一般理論を構築できる可能性がある。
より哲学的な観点から言えば、粒度コンピューティングとは、現実世界を様々な粒度(すなわち抽象度)で認識し、特定の関心事に役立つものだけを抽象化して考慮し、異なる粒度間を切り替えるという人間の思考方法を指す。異なる粒度レベルに焦点を当てることで、異なるレベルの知識を得ることができ、また、固有の知識構造に対する理解を深めることができる。したがって、粒度コンピューティングは人間の問題解決に不可欠であり、インテリジェントシステムの設計と実装に非常に大きな影響を与える。
{{citation}}: CS1 maint: 場所の発行元が見つかりません (リンク)。{{citation}}: CS1 maint: 場所の発行元が見つかりません (リンク)。{{citation}}: CS1 maint: 場所の発行元が見つかりません (リンク)。{{citation}}: CS1 maint: 場所の発行元が見つかりません (リンク)。{{citation}}: CS1 maint: 場所の発行元が見つかりません (リンク)。{{citation}}: CS1 maint: 場所の発行元が見つかりません (リンク)。