アルゴリズム C4.5は、 ID3 と同様に、情報エントロピー の概念を用いて、トレーニングデータのセットから決定木を構築します。トレーニングデータは、S = s 1 、 s 2 、 。 。 。 {\displaystyle S={s_{1},s_{2},...}} 既に分類されたサンプルの各サンプル。s 私 s_i p次元ベクトルで構成される( x 1 、 私 、 x 2 、 私 、 。 。 。 、 x p 、 私 ) {\displaystyle (x_{1,i},x_{2,i},...,x_{p,i})} 、x j {\displaystyle x_{j}} サンプルの属性値または特徴 、およびクラスを表します。s 私 s_i 落ちる。
ツリーの各ノードにおいて、C4.5は、サンプルセットを一方のクラスまたは他方のクラスが豊富なサブセットに最も効果的に分割するデータの属性を選択します。分割基準は正規化情報利得 (エントロピーの差)です。正規化情報利得が最も高い属性が選択され、決定が下されます。その後、C4.5アルゴリズムは分割された サブリストに対して再帰的に処理を行います 。
このアルゴリズムにはいくつかの基本ケース があります。
リスト内のすべてのサンプルが同じクラスに属している場合、そのクラスを選択するように指示する決定木の葉ノードが作成されます。 これらの機能はいずれも情報利得をもたらしません。この場合、C4.5はクラスの期待値を用いて、ツリーの上位に決定ノードを作成します。 これまで見たことのないクラスのインスタンスが検出されました。C4.5は、期待値を使用して、ツリーの上位に決定ノードを作成します。
擬似コード 擬似コード では、決定木を構築するための一般的なアルゴリズムは次のとおりです。[ 4 ]
上記の基本ケースを確認してください。 各属性aについて、 a で分割することによる正規化された情報利得比を求めます。 a_bestを 、正規化された情報利得が最も高い属性とする。a_best で分割する決定ノード を作成します。a_best で分割して得られたサブリストを再帰的に処理し、それらのノードをノード の子として追加します。
ID3アルゴリズムの改善点 C4.5ではID3に多くの改良が加えられました。その一部は以下のとおりです。
連続属性と離散属性の両方の処理: 連続属性を処理するために、C4.5 はしきい値を作成し、属性値がしきい値を超えるものとしきい値以下のものにリストを分割します。[ 5 ] 欠損属性値を含むトレーニングデータの処理:C4.5では、属性値を欠損値としてマークすることができます。欠損属性値は、ゲインとエントロピーの計算には使用されません。 コストの異なる属性の取り扱い。 作成後のツリーの剪定: C4.5 は、ツリーが作成された後、ツリーを遡って確認し、役に立たない枝を葉ノードに置き換えることで削除を試みます。
C5.0/See5アルゴリズムの改良クインランはその後、C5.0とSee5(Unix/Linux用C5.0、Windows用See5)を作成し、商用販売した。C5.0はC4.5に比べて多くの改良が施されている。その一部は以下の通りである。[ 6 ] [ 7 ]
速度 - C5.0はC4.5よりも大幅に高速です(数桁速い)。 メモリ使用量 - C5.0はC4.5よりもメモリ効率が良い より小さな決定木 - C5.0は、C4.5と同等の結果を得ながら、決定木のサイズは大幅に小さくなっています。 ブースティング のサポート- ブースティングはツリーを改善し、精度を高めます。重み付け - C5.0では、さまざまなケースや誤分類の種類に重み付けを行うことができます。 属性の選別 - C5.0のオプションで、不要な属性を自動的に削除します。 C5.0のシングルスレッド版Linux用ソースコードは 、GNU一般公衆利用許諾契約書 (GPL)に基づいて入手可能です。
参考文献 ↑ Quinlan, JR C4.5:機械学習のためのプログラム 。Morgan Kaufmann Publishers、1993年。 ↑ Ian H. Witten; Eibe Frank; Mark A. Hall (2011). "データマイニング:実践的な機械学習ツールとテクニック、第3版" . Morgan Kaufmann、サンフランシスコ。p. 191。2020年11月27日にオリジナルからアーカイブ済み。2017年7月4日 に取得。 ↑ Umd.edu - データマイニングにおけるトップ10アルゴリズム ↑ SB Kotsiantis、「教師あり機械学習:分類手法のレビュー」、 Informatica 31(2007) 249-268、2007年 ↑ JR Quinlan. C4.5における連続属性の利用の改善。人工知能研究ジャーナル、4:77-90、1996年。 ↑ See5/C5.0はC4.5より優れていますか? ↑ M. Kuhn および K. Johnson、『応用予測モデリング』、Springer、2013年
外部リンク オリジナルの実装はロス・クインランのホームページに掲載されています: http://www.rulequest.com/Personal/ See5とC5.0