カテゴリ ユーティリティは、Gluck & Corter (1985) および Corter & Gluck (1992) で定義された「カテゴリの良さ」の尺度です。これは、同じカテゴリの 2 つのオブジェクトが共通の属性値を持つ確率と、異なるカテゴリのオブジェクトが異なる属性値を持つ確率の両方を最大化しようとします。これは、「手がかりの妥当性」(Reed 1972、Rosch & Mervis 1975) や「コロケーション インデックス」(Jones 1983) などの、より限定されたカテゴリの良さの尺度に取って代わることを意図していました。これは、カテゴリ構造 (つまり、インスタンスのクラス ラベル) に関する知識を持つ観察者が、カテゴリ構造に関する知識を持たない観察者よりも予測上の優位性を獲得する、規範的な情報理論的尺度を提供します。この意味で、カテゴリ ユーティリティ尺度の動機は、決定木学習で使用される情報ゲインメトリックに似ています。特定の表現では、これは、以下で説明するように、相互情報量と形式的に同等でもあります。確率論的表現におけるカテゴリ効用と機械学習への応用に関するレビューは、Witten & Frank (2005、pp. 260–262) に掲載されています。
カテゴリー効用の確率論的定義
Fisher (1987) と Witten & Frank (2005) によるカテゴリ効用の 確率理論的定義は次のとおりです。
ここで、 はサイズ次元の特徴の集合であり、 はカテゴリの集合です。 項 は、特徴 が値 をとる限界確率を示し、 項 は、問題の対象がカテゴリ に属する場合に、特徴 が値 をとるカテゴリ条件付き確率を示します。
カテゴリーの効用を表すこの式の動機と発展、および大まかなオーバーフィッティング制御としての被乗数の役割については、上記の資料で説明されています。大まかに言えば (Fisher 1987)、この用語は、カテゴリー ラベルの知識と確率マッチング戦略を使用して観察者が正しく推測できる属性値の期待値の数であり、一方、は、カテゴリー ラベルの知識がなくても同じ戦略を使用して観察者が正しく推測できる属性値の期待値の数です。したがって、これらの違いは、カテゴリー構造の知識を持つことで観察者に生じる相対的な利点を反映しています。
カテゴリー効用の情報理論的定義
サイズバイナリ特徴セットとバイナリカテゴリを持つエンティティの集合に対するカテゴリユーティリティの情報理論的定義は、Gluck & Corter (1985) で次のように与えられています。
ここで、はエンティティが正のカテゴリに属する事前確率(特徴情報がない場合)であり、はエンティティがカテゴリ に属する場合に特徴を持つエンティティの条件付き確率であり、は同様にエンティティがカテゴリ に属する場合に特徴を持つエンティティの条件付き確率であり、 はエンティティが特徴を持つ事前確率(カテゴリ情報がない場合)です。
上記の式の背後にある直感は次のとおりです。項 は、記述するオブジェクトがカテゴリ に属することがわかっている場合に、特徴情報を最適にエンコード (または送信) するコスト (ビット単位) を表します。同様に、項 は、 記述するオブジェクトがカテゴリ に属することがわかっている場合に、特徴情報を最適にエンコード (または送信) するコスト (ビット単位) を表します。したがって、括弧内のこれら 2 つの項の合計は、これら 2 つのコストの加重平均です。最後の項 は、カテゴリ情報が利用できない場合に、特徴情報を最適にエンコード (または送信) するコスト (ビット単位) を表します。上記の定式化では、カテゴリ ユーティリティの値は負ではありません。
カテゴリー効用と相互情報量
Gluck & Corter (1985) および Corter & Gluck (1992) は、カテゴリ効用は相互情報量 と同等であると述べています。この同等性の性質を簡単に示します。それぞれが同じ特徴を持つエンティティのセット、つまり特徴セット があり、各特徴変数の濃度が であると仮定します。つまり、各特徴は、任意の異なる値 (順序付けられている必要はなく、すべての変数は名義変数にすることができます) を採用する能力を持ちます。特殊なケースでは、これらの特徴はバイナリと見なされますが、より一般的には、任意の に対して、特徴は単にm 進です。このデモンストレーションの目的上、一般性を失うことなく、特徴セット は、濃度 を持ち、直積 の各特徴の組み合わせに対応する一意の値を採用する単一の集約変数に置き換えることができます。(相互情報量は順序性に影響されないため、順序性は重要ではありません。) 以下では、 や などの用語は、単に が特定の値 を採用する確率を指します。 (集計機能変数を使用すると、複数の合計が置き換えられ、後続のプレゼンテーションが簡素化されます。)
このデモンストレーションでは、カーディナリティ を持つ単一のカテゴリ変数 も想定します。これは、交差しないカテゴリがある分類システムと同等です。 の特殊なケースでは、上で説明した 2 つのカテゴリのケースがあります。離散変数の相互情報量の定義から、集約特徴変数とカテゴリ変数間の相互情報量は次のように与えられます。
ここで、は特徴変数が値 を採用する事前確率、はカテゴリ変数が値 を採用する周辺確率、 は変数とが同時にそれぞれの値を採用する結合確率です。条件付き確率の観点から、これは次のように書き直すことができます(または定義できます)。
上記のカテゴリ効用の元の定義を次のように書き直すと、
この方程式は、明らかに、特徴セットとカテゴリ変数間の相互情報量を表す(青の) 方程式と同じ形式です。違いは、カテゴリ効用方程式の合計が独立した2 値変数にわたっているのに対し、相互情報量の合計は1値変数の値にわたっている点です。2 つの尺度が実際に同等になるのは、特徴、 が独立している場合のみです(また、 に対応する合計の項も追加されていると仮定します)。
カテゴリ効用の順序性に対する鈍感性
相互情報量と同様に、カテゴリ ユーティリティは、特徴変数またはカテゴリ変数値の順序付けには影響されません。つまり、カテゴリ ユーティリティに関する限り、カテゴリ セットは{small,medium,large,jumbo}カテゴリ セットと質的に違いはありません。これは{desk,fish,tree,mop}、カテゴリ ユーティリティの定式化ではクラス変数の順序付けが考慮されていないためです。同様に、値を採用する特徴変数は、{1,2,3,4,5}値を採用する特徴変数と質的に違いはありません。カテゴリ ユーティリティまたは相互情報量に関する{fred,joe,bob,sue,elaine}限り、すべてのカテゴリ変数と特徴変数は名目変数です。このため、カテゴリ ユーティリティは、このような順序付け効果に基づく可能性のある「カテゴリの良さ」のゲシュタルト側面を反映しません。順序付けに対するこの鈍感さを調整する 1 つの方法は、相互情報量に関する記事で説明されている重み付けスキームです。
カテゴリー「善」: モデルと哲学
このセクションでは、カテゴリ ユーティリティなどの「カテゴリの良し悪し」の正式な測定基準の起源と必要性についての背景と、この特定の測定基準の開発につながった歴史の一部について説明します。
良いカテゴリーとはどのようなものでしょうか?
少なくともアリストテレスの時代以来、哲学では概念と普遍性の性質に非常に強い関心が寄せられてきました。「馬」のような概念とはどのような実体なのでしょうか。このような抽象概念は、世界の特定の個体を指すものではありませんが、それを使わずに世界を理解することはほとんど考えられません。では、「馬」という概念は、心の外で独立した存在なのでしょうか。もしそうなら、この独立した存在の所在はどこにあるのでしょうか。所在の問題は、プラトンとアリストテレスの古典派が意見を異にした重要な問題でした。しかし、普遍性は確かに心から独立した存在であるという点では両者とも一致していました。したがって、世界にどのような概念と普遍性が存在するかという 問題には、常に事実がありました。
しかし、中世後期(おそらくオッカムから始まったが、ポルピュリオスもかなり以前に現状に対するある種の不快感を示す発言をしている)には、この問題に関する確信が失われ始め、いわゆる名目論者や経験主義者の間では、概念と普遍性を厳密に精神的な実体または言語の慣習と見なすことが受け入れられるようになった。概念は純粋に表象的な構成物であるというこの概念の見方に基づいて、「なぜ私たちはある概念セットを他の概念セットよりも多く持っているのか?」という新しい疑問が浮上する。ある概念セットが「良い」のに、別の概念セットが「悪い」のはなぜか?これは、現代の哲学者、そしてその後の機械学習理論家や認知科学者が何十年もの間取り組んできた疑問である。
コンセプトはどのような目的を果たすのでしょうか?
このような疑問に答える 1 つの方法は、認知における概念の「役割」または「目的」を調査することです。したがって、ミル (1843、p. 425) およびその他多くの人々による「そもそも概念は何の役に立つのか」という問いに対する答えは、分類 (概念) が帰納の前兆であるというものです。宇宙に特定の分類を課すことで、生物は物理的に同一ではない物体や状況を同一の方法で扱う能力を獲得し、それによってかなりの予測力を獲得します (Smith & Medin 1981; Harnad 2005)。JSミルは次のように述べています (Mill 1843、pp. 466–468)。
分類の一般的な問題は、物事をそのようなグループで考え、それらのグループをそのような順序で考えることで、その法則の記憶と確認に最も役立つようにすることです... [そして]そのような分類の用途の 1 つは、その分類が基づいている特性に注意を向けることによって、そして分類が適切であれば、それらの特性が他の多くの特性の特徴となることで、他の特性の発見を容易にすることです。
この基礎から、ミルは次のような結論に達します。これは、カテゴリーの有用性の概念を含む、カテゴリーの良さに関するその後の多くの考えを予見するものです。
科学的分類の目的は、対象をグループにまとめ、そのグループに関して、同じものを分類できる他のグループに関してよりも多くの一般的な命題を、そしてそれらの命題がより重要なものにしたときに、最もよく達成される。したがって、対象を分類する特性は、可能であれば、他の多くの特性の原因となる特性、または少なくとも、それらの特性の確かな特徴となる特性であるべきである。
これを、Corter & Gluck (1992) が提唱した「カテゴリー効用仮説」と比較することができます。「カテゴリーは、そのカテゴリーのインスタンスの特徴を正確に予測する能力を向上させることが期待できる程度に有用である」。ここでミルは、オブジェクトの特徴 (プロパティ) がオブジェクトのクラスについて最大限の情報を提供し、同時にオブジェクト クラスがオブジェクトの特徴について最大限の情報を提供するカテゴリー構造が最善であると示唆しているようです。言い換えると、有用な分類体系とは、カテゴリーの知識を使用してオブジェクトのプロパティを正確に推測でき、プロパティの知識を使用してオブジェクトのクラスを正確に推測できる体系です。この考え方は、アリストテレスの定義述語に対する反対述語の基準や、形式的概念分析で説明されている概念の概念と比較することもできます。
形式化の試み
この「カテゴリーの良し悪し」という概念を正式に捉えることを目的として、さまざまな尺度が提案されてきましたが、その中で最もよく知られているのはおそらく「手がかり妥当性」でしょう。カテゴリーに関する特徴の手がかり妥当性は、特徴を与えられたカテゴリーの条件付き確率 (Reed 1972;Rosch & Mervis 1975;Rosch 1978)、またはカテゴリーのベース レートからの条件付き確率の偏差 (Edgell 1993;Kruschke & Johansen 1999) として定義されます。明らかに、これらの尺度は、特徴からカテゴリーへの推論 (つまり、手がかり妥当性)のみを定量化しますが、カテゴリーから特徴への推論 (つまり、カテゴリー妥当性) は定量化しません。また、手がかり妥当性はもともと、人間の認知における基本カテゴリー(人間の学習者が明らかに好む特定の一般性レベルのカテゴリー)の実証可能な出現を説明することを目的としていましたが、この点に関して手がかり妥当性におけるいくつかの大きな欠陥がすぐに明らかになりました(Jones 1983、Murphy 1982、Corter & Gluck 1992 など)。
両方の問題に対処するために、特徴妥当性とカテゴリ妥当性の両方を同時に最大化する試みが Jones (1983) によって行われ、"コロケーション インデックス" を の積として定義しましたが、この構築はかなり場当たり的なものでした (Corter & Gluck 1992 を参照)。カテゴリ ユーティリティは、クラス構造の完全な推論力をより厳密に定量化しようとする手がかり妥当性のより洗練された改良として導入されました。上記のように、ある見方では、カテゴリ ユーティリティは、特徴変数とカテゴリ変数間の相互情報量に相当します。全体的なカテゴリ ユーティリティが最も大きいカテゴリは、規範的な意味で "最良" であるだけでなく、人間の学習者が好んで使用するカテゴリ、たとえば "基本" カテゴリであることが示唆されています (Corter & Gluck 1992)。カテゴリーの良さを測る他の関連尺度としては、「凝集性」(Hanson & Bauer 1989;Gennari, Langley & Fisher 1989)と「顕著性」(Gennari 1989)がある。
アプリケーション
- カテゴリ ユーティリティは、COBWEB (Fisher 1987) と呼ばれる一般的な概念クラスタリングアルゴリズムでカテゴリ評価尺度として使用されます。
参照
参考文献
- Corter, James E.; Gluck, Mark A. (1992)、「基本カテゴリの説明: 特徴の予測可能性と情報」(PDF)、Psychological Bulletin、111 (2): 291–303、doi :10.1037/0033-2909.111.2.291、2011-08-10にオリジナル(PDF)からアーカイブ
- Edgell, Stephen E. (1993)、「構成情報と次元情報の使用」、N. John Castellan (編)、『個人とグループの意思決定: 現在の問題』、ニュージャージー州ヒルズデール: Lawrence Erlbaum、pp. 43–64
- フィッシャー、ダグラス H. (1987)、「増分概念クラスタリングによる知識獲得」、機械学習、2 (2): 139–172、doi : 10.1007/BF00114265
- Gennari, John H. (1989)、「焦点を絞った概念形成」、Alberto Maria Segre (編)、第 6 回国際機械学習ワークショップ議事録、ニューヨーク州イサカ: Morgan Kaufmann、pp. 379–382
- ジェンナリ、ジョン H.; ラングレー、パット; フィッシャー、ダグ (1989)、「増分概念形成モデル」、人工知能、40 (1–3): 11–61、doi :10.1016/0004-3702(89)90046-5
- グルック、マーク A.、コルター、ジェームズ E. (1985)、「情報、不確実性、およびカテゴリーの有用性」、認知科学協会第 7 回年次会議プログラム、pp. 283–287
- ハンソン、スティーブン・ホセ、バウアー、マルコム(1989)、「概念的クラスタリング、分類、および多形性」、機械学習、3(4):343–372、doi:10.1007 / BF00116838
- Harnad, Stevan (2005)、「認識することは分類することである: 認知は分類である」、Henri Cohen および Claire Lefebvre (編)、認知科学における分類ハンドブック、アムステルダム: Elsevier、pp. 19–43
- ジョーンズ、グレゴリー V. (1983)、「基本カテゴリーの識別」、心理学速報、94 (3): 423–428、doi :10.1037/0033-2909.94.3.423
- Kruschke, John K. ; Johansen, Mark K. (1999)、「確率的カテゴリー学習のモデル」、Journal of Experimental Psychology: Learning, Memory, and Cognition、25 (5): 1083–1119、doi :10.1037/0278-7393.25.5.1083、PMID 10505339
- ミル、ジョン・スチュアート(1843)、「推論的および帰納的論理体系:証拠の原理と科学的調査の方法の連結された見解であること」、ロンドン:ロングマンズ、グリーン&カンパニー。。
- マーフィー、グレゴリー L. (1982)、「手がかりの妥当性と分類レベル」、心理学速報、91 (1): 174–177、doi :10.1037/0033-2909.91.1.174
- リード、スティーブン・K.(1972)、「パターン認識と分類」、認知心理学、3(3):382–407、doi:10.1016/0010-0285(72)90014-x
- ロッシュ、エレノア (1978)、「分類の原理」、エレノア・ロッシュ & バーバラ・B・ロイド (編)、『認知と分類』、ヒルズデール、ニュージャージー州: ローレンス・エルバウム、pp. 27–48
- ロッシュ、エレノア、マーヴィス、キャロリン B. (1975)、「家族の類似性:カテゴリーの内部構造の研究」、認知心理学、7 (4): 573–605、doi :10.1016/0010-0285(75)90024-9、S2CID 17258322
- スミス、エドワード E.; メディン、ダグラス L. (1981)、「カテゴリーと概念」、ケンブリッジ、マサチューセッツ州:ハーバード大学出版局
- ウィッテン、イアン H.、フランク、アイベ (2005)、『データマイニング: 実用的な機械学習ツールとテクニック』、アムステルダム: モーガン カウフマン
