決定木学習において、情報ゲイン比は情報ゲインと固有情報の比率である。これはロス・クインラン[1]によって提案され、属性を選択する際に枝の数とサイズを考慮することで、多値属性への偏りを減らすことを目的としている。[2]
情報ゲインは相互情報量としても知られています。[3]
情報ゲイン計算
情報ゲインとは、属性を持つセットを分割し、最高の値を生成する最適な候補を見つけること によって生成されるエントロピーの削減です。
ここで、はランダム変数であり、 は属性の値が与えられた場合のエントロピーです。
属性値ごとに結果属性に対して一意の分類を行うことができる場合、情報ゲインは属性の合計エントロピーに等しくなります。この場合、合計エントロピーから減算される相対エントロピーは 0 です。
分割情報計算
テストの分割情報値は次のように定義されます。
ここで、は可能な値を持つ離散ランダム変数であり、 発生回数をイベントの合計数で割った値です。ここで、はイベントのセットです。
分割情報値は、ノードからブランチを分割する潜在的な価値を表す正の数値です。これは、ランダム変数が持つ固有の値であり、情報ゲイン比率の計算でバイアスを除去するために使用されます。
情報利得率の計算
情報ゲイン比は、情報ゲインと分割情報値の比率です。
例
フォーダム大学が発表した気象データ[4]を使用して、以下の表を作成しました。
上記の表を使用すると、各変数 (見通し、温度、湿度、風) のエントロピー、情報ゲイン、分割情報、情報ゲイン比を見つけることができます。これらの計算は、以下の表に示されています。
上記の表を使用すると、Outlook の情報ゲイン率が最も高いことがわかります。次に、Outlook 変数のサブグループ (晴れ、曇り、雨) の統計を見つける必要があります。この例では、晴れのブランチのみを構築します (下の表を参照)。
他の変数(温度、湿度、風)に関する次の統計を調べて、見通し変数の晴れの要素にどれが最も大きな影響を与えるかを確認できます。
湿度は情報ゲイン率が最も高いことがわかりました。前と同じ手順を繰り返して、湿度変数 (高および正常) のイベントの統計を見つけます。
再生値はすべて「いいえ」または「はい」のいずれかであるため、情報ゲイン比率の値は 1 になります。また、Wind が最後の変数として残っている状態で変数チェーンの最後まで到達したので、決定木のルートからリーフ ノードの分岐ライン全体を構築できます。

このリーフ ノードに到達したら、決定木でまだ分割されていない残りの要素に対して同じ手順を実行します。このデータ セットは比較的小さいですが、より大きなセットを使用すると、情報ゲイン比を決定木の分割係数として使用する利点がより明らかになります。
利点
情報ゲイン比は、多数の異なる値を持つ属性を考慮し ないように決定木にバイアスをかけます。
たとえば、企業の顧客を説明するデータの決定木を構築しているとします。情報ゲイン比は、どの属性が最も関連しているかを判断するために使用されます。これらは、ツリーのルートの近くでテストされます。入力属性の 1 つは、顧客の電話番号です。この属性は、各顧客を一意に識別するため、情報ゲインが高くなります。異なる値が多いため、ルートの近くでテストされることは選択されません。
デメリット
情報ゲイン比率は情報ゲインの主要な問題を解決しますが、別の問題も生じます。異なる値の数が多い属性の量を検討している場合、これらの属性の値は、異なる値の数が少ない属性の値より高くなることはありません。
情報ゲインとの違い
- 情報ゲインの欠点は、高い個別値を持つ属性と低い個別値を持つ属性の間に数値的な差を提供しないことによって生じます。
- 例: 企業の顧客を説明するデータの決定木を構築しているとします。情報ゲインは、どの属性が最も関連しているかを判断するためによく使用されるため、ツリーのルートの近くでテストできます。入力属性の 1 つに、顧客のクレジットカード番号があります。この属性は、各顧客を一意に識別するため、情報ゲインは高くなりますが、決定木には含めません。顧客のクレジットカード番号に基づいて顧客をどのように扱うかを決定することは、これまでに見たことのない顧客に一般化される可能性は低いからです。
- 情報ゲイン比の強みは、異なる値の数が少ない属性に偏っていることです。
- 以下は、特定のシナリオにおける情報ゲインと情報ゲイン比の違いを説明する表です。
参照
参考文献
- ^ Quinlan, JR (1986). 「決定木の誘導」.機械学習. 1 : 81–106. doi : 10.1007/BF00116251 .
- ^ http://www.ke.tu-darmstadt.de/lehre/archiv/ws0809/mldm/dt.pdf 2014-12-28 にWayback Machineにアーカイブ [ URL のみの PDF ]
- ^ 「情報ゲイン、相互情報量および関連する尺度」。
- ^ https://storm.cis.fordham.edu/~gweiss/data-mining/weka-data/weather.nominal.arff
