アイソレーションフォレストは、バイナリツリーを使用したデータ異常検出アルゴリズムです。2008年にFei Tony Liuによって開発されました。[1] 線形時間計算量と低メモリ使用量を備えており、大容量データに適しています。[2] [3]これは、異常は少なく他のデータと異なるため、少数のパーティションを使用して分離できるという仮定に基づいています。決定木アルゴリズムと同様に、密度推定は実行しません。決定木アルゴリズムとは異なり、異常スコアを出力するためにパス長のみを使用し、クラス分布やターゲット値のリーフノード統計は使用しません。
分離フォレストは、データ空間を分割し、属性と分割ポイントをランダムに選択するため高速です。異常スコアはパスの長さと反比例します。異常は数が少なく、異なるため、分離するために必要な分割数が少なくなるためです。
歴史
アイソレーションフォレスト(iForest)アルゴリズムは、2008年にFei Tony Liu、Kai Ming Ting、 Zhi-Hua Zhouによって最初に提案されました。 [2] 2012年に同じ著者は、iForestが線形時間計算量、小さなメモリ要件を持ち、高次元データに適用可能であることを示しました。[3] 2010年に、クラスター化された軸平行の異常に対処するために、アルゴリズムの拡張であるSCiforestが公開されました。[4]
隔離木

分離フォレスト アルゴリズムの前提は、異常なデータ ポイントをサンプルの残りの部分から分離するのが簡単であるということです。データ ポイントを分離するために、アルゴリズムは、属性をランダムに選択し、その属性に許可されている最小値と最大値の間の分割値をランダムに選択することで、サンプルにパーティションを再帰的に生成します。

正規分布したポイントの 2D データセットにおけるランダム パーティションの例を、最初の図に非異常ポイント、2 番目の図に異常である可能性が高いポイントで示します。図から、異常は通常のポイントと比較して、分離するために必要なランダム パーティションの数が少なくなることが分かります。
再帰的分割は、分離ツリーと呼ばれるツリー構造で表すことができます。一方、ポイントを分離するために必要なパーティションの数は、ルートから始まって終了ノードに到達するまでのツリー内のパスの長さとして解釈できます。たとえば、最初の図のポイントのパスの長さは、2 番目の図のポイント のパスの長さよりも長くなります。
を d 次元の点の集合とし、を とする。分離ツリー (iTree) は、次の特性を持つデータ構造として定義されます。
- ツリー内の各ノードは、子を持たない外部ノード、または1つの「テスト」とちょうど2つの子ノード(および )を持つ内部ノードのいずれかです。
- ノードでのテストは、属性と分割値で構成され、テストによってデータ ポイントのまたはへのトラバースが決定されます。
iTreeを構築するために、アルゴリズムは属性と分割値をランダムに選択して再帰的に分割し、
- ノードにインスタンスが1つしかない、または
- ノード上のすべてのデータは同じ値を持ちます。
iTree が完全に成長すると、各ポイントは外部ノードの 1 つで分離されます。直感的に、異常なポイントはツリー内のパス長が短いポイント (分離しやすいため) です。ポイントのパス長は、ルート ノードから外部ノードに到達するまでに通過する エッジの数として定義されます。
iTreeの確率的説明はiForestのオリジナルの論文に記載されている。[2]
異常検出
アイソレーションフォレストによる異常検出は次のように行われる。[4]
- トレーニングデータセットを使用していくつかのiTreesを構築する
- テスト セット内の各データ ポイントについて:
- すべてのiTreesに渡して、各ツリーのパスの長さを数えます。
- インスタンスに「異常スコア」を割り当てる
- スコアがドメインに応じて事前に定義されたしきい値より大きい場合は、ポイントを「異常」としてラベル付けします。
異常スコア
データポイントの異常スコアを計算するアルゴリズムは、iTreesの構造がバイナリ検索木(BST)の構造と同等であるという観察に基づいています。iTreeの外部ノードへの終了は、BSTでの失敗した検索に対応します。[4]したがって、外部ノード終了の平均の推定は、BSTでの失敗した検索の推定と同じであり、つまり[5]です。
ここで、 はテストセットのサイズ、はサンプルセットのサイズ、は調和数で、 によって推定できます。ここで、はオイラー・マスケロニ定数です。
上記は与えられた平均値なので、これを正規化して、与えられたインスタンス x の異常スコアの推定値を得る ことができます。
ここで、 はiTrees のコレクションからのの平均値です。任意のデータ ポイントについて:
- に近い場合は異常である可能性が高い
- より小さい場合は正常である可能性が高い
- サンプル内のすべての点が 付近のスコアである場合、それらはすべて正規分布している可能性が高い。
クレジットカード詐欺検出(異常)のための隔離フォレストの応用
アイソレーションフォレストアルゴリズムは、ヨーロッパのカード保有者による不均衡なデータセットで、顕著な違いを示すまれなパターンを識別することで不正行為と正当な行為を区別できるなど、データセット内の異常を発見する上でその有効性を示しています。[6]
データセットと前処理
この研究プロジェクトのデータセットには、合計284,807件の取引が記録されていますが、そのうち不正と特定されたのは492件(0.172%)のみです。正当な取引と不正な取引の不均衡により、不正の検出は非常に困難になります。そのため、従来の精度測定だけに頼るのではなく、精度再現曲線下面積(AUPRC)などの専門的な指標が正確な評価に不可欠です。[6]
データセットは、PCA 変換された特徴 (V1 から V28) と、時間 (最初のトランザクションからの経過時間) および金額 (トランザクション値) で構成されています。データセットは次の手順で処理しました。
スケーリング :StandardScalerを利用してTimeとAmount機能の入力範囲を標準化します。[7]
補完:データセット内の欠損データは、SimpleImputerを使用して対応する列の平均を使用して補完されました。[7]
特徴選択 : 予測と分析タスクにおけるモデルの有効性と精度を高めるために、尖度値を持つ特徴を選択してさらに調査しました。これらの特定の特徴は、モデリング目的で使用されるデータセット内の不規則性や異常を示す可能性のある最も重要な外れ値を持つ傾向があるためです。特にトレーニング目的で、10の特徴の選択がモデルの機能を改良し、全体的なパフォーマンスを向上させるための主要コンポーネントとして特定され、優先順位が付けられました。[8]
モデルのトレーニングとハイパーパラメータの調整
アイソレーションフォレストモデルは、データ分析タスクにおける一般的な行動パターンを認識することに焦点を当てたトランザクション(クラス=0)に特化してトレーニングされました。このアルゴリズムは、ランダムに分割されたツリーのコレクション内でインスタンスを分離するために必要な距離を測定することでインスタンスを分離します。[6]
ハイパーパラメータの調整:
以下のハイパーパラメータでグリッド検索を実行した。
汚染:データセット内の異常の予想される割合。0.01、0.02、0.05の値でテストされました[8]
最大特徴量:各ツリーでサンプリングする特徴量数。値5、8、10でテストされます。[8]
最適な構成は次のとおりでした:
- 汚染度: 0.01
- 最大機能数: 10
結果と評価
モデルは、正確性、精度、再現率、および精度再現率曲線下面積 (AUPRC) を使用して、別のテスト セットで評価されました。主な結果は次のとおりです。
- 精度: 0.99
- 精度: 0.06
- 再現率: 0.38
- AUPRC : 0.22
精度は一見すると印象的ですが、主にデータセット内の通常の取引の普及を示しています。精度と再現率は、大きな不均衡が存在するため、詐欺を検出する際の課題を強調しています。精度と再現率の両方を評価する際に、AUPRCは精度と再現率のバランスを考慮した評価を提供します。[6]
結果の視覚化
1. 検出された異常の散布図

主な詳細
- 赤い点: モデルによって異常としてフラグ付けされた不正なトランザクションを表します。これらのポイントは、通常のトランザクションの密集したクラスターから大きく逸脱しており、外れ値を効果的に分離するアルゴリズムの能力を示しています。
- 青い点: プロットの中央に密集したクラスターを形成する通常のトランザクションを表します。これらは、モデルによって異常ではないと識別されたトランザクションです。
- 解釈可能性: 尖度の高い 2 つの特徴を使用すると、モデルの意思決定プロセスを視覚的に理解しやすくなります。このような高次元データ (28 個の PCA 変換された特徴) では、最も極端な外れ値を持つ 2 次元に縮小すると、結果の解釈可能な表現が得られます。
観察: プロットは、多くの不正なトランザクション (赤い点) が、正常なトランザクション (青い点) の中心クラスターの端または遠くに位置していることを示しています。ただし、いくつかの赤い点は青いクラスターと重なっており、モデルにとって潜在的な誤検知または困難なケースを示しています。
2. 適合率-再現率曲線

主な詳細:
- X 軸 (再現率) : モデルによって正しく識別された真の不正取引 (陽性) の割合を表します。再現率が高いほど、見逃された不正が少なくなることを示します。
- Y 軸 (精度) : 不正とフラグが付けられたトランザクションのうち、実際に不正であったトランザクションの割合を表します。精度が高いほど、誤検知が少なくなります。
- AUPRC 値: 適合率-再現率曲線下面積 (AUPRC) は、モデルのパフォーマンスを定量化します。このデータセットの場合、AUPRC は 0.22 であり、非常に不均衡なデータセットで不正を検出するのがいかに難しいかを反映しています。
観察:
- リコール値が高い場合、精度は急激に低下します。これは、モデルが異常の特定に積極的になるにつれて、より多くの通常の取引を不正行為としてフラグ付けし、誤検知率が高くなることを示しています。
- 逆に、精度の値が高いと再現率は低下し、モデルがより保守的になり、多くの不正な取引を見逃すことになります。
隔離林の強み
- スケーラビリティ:線形時間計算量がO(n*logn)であるため、Isolation Forestは大規模なデータセットに効率的です。[6]
- 教師なしの性質:このモデルはラベル付きデータに依存しないため、さまざまな分野での異常検出に適しています。[8]
- 特徴に依存しない:アルゴリズムは特徴分布についての仮定をすることなく、さまざまなデータセットに適応します。[7]
課題
- 不均衡なデータ:精度が低いということは、多くの通常の取引が誤って詐欺としてフラグ付けされ、誤検知につながることを示しています。[7]
- ハイパーパラメータに対する感度:汚染率と特徴サンプリングはモデルのパフォーマンスに大きな影響を与えるため、広範囲にわたる調整が必要になります。[8]
- 解釈可能性:効果的ではあるが、ドメイン固有の知識がなければアルゴリズムの出力を解釈するのは難しい場合がある。[6]
今後の方向性
- モデルの組み合わせ:教師あり学習とアイソレーションフォレストを統合したハイブリッドアプローチは、既知の詐欺事件のラベル付きデータを活用してパフォーマンスを向上させる可能性があります。[7]
- 能動学習:誤分類されたトランザクションを使用してモデルを反復的に改良するフィードバックループを組み込むことで、再現率と精度が向上する可能性があります。[8]
- 特徴エンジニアリング:加盟店の所在地や取引の種類などの取引メタデータを追加すると、異常検出がさらに容易になります。[6]
結論
アイソレーションフォレストアルゴリズムは、異常検出のための堅牢なソリューションを提供します。特に、異常がまれで識別が難しい不正検出などの分野では効果的です。ただし、ハイパーパラメータに依存し、不均衡なデータに敏感であるため、最適な結果を得るには慎重な調整と補完的な手法が必要です。[6] [8]
プロパティ
- サブサンプリング: iForestは正常なインスタンスを分離する必要がないため、トレーニングセットの大部分を無視することができます。そのため、他のほとんどの手法では大きなサンプルサイズが有利ですが、iForestはサンプルサイズを小さく保つと非常にうまく機能します。[2] [3]
- スワンピング: 正常インスタンスが異常に近すぎる場合、異常を分離するために必要なパーティションの数が増加します。これはスワンピングと呼ばれる現象で、iForest が異常と正常ポイントを区別することがより困難になります。スワンピングの主な原因は、データが多すぎることです。そのため、考えられる解決策はサブサンプリングです。iForest はサブサンプリングで優れたパフォーマンスを発揮するため、サンプル内のポイント数を減らすこともスワンピングの影響を減らす良い方法です。[2]
- マスキング:異常が多数ある場合、それらのいくつかは密集した大きなクラスターに集まり、個々の異常を分離して識別することが困難になります。この現象は「マスキング」と呼ばれ、スワンピングと同様に、サンプルが大きい場合に発生しやすく、サブサンプリングによって軽減できます。[2]
- 高次元データ: 標準的な距離ベースの方法の主な制限は、高次元データを扱う際の非効率性です。[9]主な理由は、高次元空間ではすべての点が等しく疎であるため、距離ベースの分離測定を使用しても効果がないということです。残念ながら、高次元データは iForest の検出パフォーマンスにも影響しますが、Kurtosisなどの特徴選択を使用してサンプルの次元を減らすことで、パフォーマンスを大幅に向上させることができます。[2] [4]
- 正常インスタンスのみ:iForestは、トレーニングセットに異常なポイントが含まれていない場合でも優れたパフォーマンスを発揮します。[4]これは、iForestが長いツリーパスが正常なデータポイントに対応するようにデータ分布を記述するためです。したがって、異常の存在は検出パフォーマンスとは無関係です。
パラメータ選択
アイソレーションフォレストアルゴリズムのパフォーマンスは、そのパラメータの選択に大きく依存します。これらのパラメータを適切に調整することで、異常を正確に識別するアルゴリズムの能力が大幅に向上します。各パラメータの役割と影響を理解することは、モデルのパフォーマンスを最適化するために重要です。[10]

アイソレーションフォレストアルゴリズムには、その動作と有効性に影響を与えるいくつかの重要なパラメータが含まれています。これらのパラメータは、ツリー構築プロセスのさまざまな側面、サブサンプルのサイズ、異常を識別するためのしきい値を制御します。[10]適切なパラメータを選択することが、アイソレーションフォレストアルゴリズムのパフォーマンスの鍵となります。各パラメータは、異常検出に異なる影響を与えます。重要なパラメータは次のとおりです。
ツリーの数:このパラメータは、アイソレーションフォレスト内のツリーの数を決定します。ツリーの数が多いほど異常検出の精度は向上しますが、計算コストが増加します。最適な数は、リソースの可用性とパフォーマンスのニーズのバランスをとります。たとえば、データセットが小さい場合は、計算を節約するためにツリーの数が少なくて済むかもしれませんが、データセットが大きい場合は、より多くの複雑さを捉えるためにツリーを追加した方がよいでしょう。[2]
サブサンプルサイズ:サブサンプルサイズは、各ツリーの構築に使用されるデータポイントの数を決定します。サブサンプルサイズが小さいほど計算の複雑さは軽減されますが、データの変動性は少なくなります。たとえば、サブサンプルサイズは256が一般的に使用されますが、最適な値はデータセットの特性によって異なります。[2]
汚染係数:このパラメータはデータセット内の外れ値の割合を推定します。汚染値が高いほど、より多くのデータポイントが異常としてフラグ付けされ、誤検知につながる可能性があります。バイアスや誤分類を回避するには、ドメイン知識やクロスバリデーションに基づいてこのパラメータを慎重に調整することが重要です。[3]
最大特徴数:このパラメータは、ツリーの各分割で考慮するランダム特徴の数を指定します。特徴の数を制限するとランダム性が増し、モデルがより堅牢になります。ただし、高次元データセットでは、最も有益な特徴のみを選択すると、過剰適合が防止され、一般化が向上します。[2] [3]
ツリーの深さ:ツリーの深さはツリーの最大分割数を決定します。ツリーが深いほどデータの複雑さをより適切に捉えることができますが、特に小さなデータセットでは過剰適合のリスクがあります。一方、浅いツリーは計算効率を向上させます。[3]
以下の表は、データセットの特性に基づいたパラメータ選択戦略をまとめたものです。
適切なパラメータ調整の利点:
精度の向上:パラメータを微調整すると、アルゴリズムが正常なデータと異常をより適切に区別できるようになり、誤検知と誤検知が減ります。[10]
計算効率:ツリーの数やサブサンプルのサイズなどのパラメータに適切な値を選択すると、精度を犠牲にすることなくアルゴリズムの効率が向上します。[10]
一般化:ツリーの深さを制限し、ブートストラップサンプリングを使用すると、モデルが新しいデータに対してより適切に一般化され、過剰適合が減ります。[10]
サイフォレスト
SCiForest (分割選択基準付き分離フォレスト) は、元の分離フォレスト アルゴリズムの拡張版で、特にクラスター化された異常をターゲットにするために設計されています。分割選択基準を導入し、元の属性と軸が平行でないランダムな超平面を使用します。SCiForest は、すべてのノードで最適な超平面を必要としません。代わりに、複数のランダムな超平面を生成し、十分な試行を通じて、十分な超平面を選択します。このアプローチにより、アンサンブル学習者の総合的なパワーにより、結果として得られるモデルが非常に効果的になります。[4]
SCiForest実装の手順
SciForest の実装には 4 つの主要なステップが含まれ、各ステップは、標準の Isolation Forest 方式よりも効果的にクラスター化された異常を分離することで異常検出を改善するように調整されています。
1. サブスペースの選択
SciForestはKMeansや階層的クラスタリングなどの技術を使用して、特徴をクラスターに整理し、意味のあるサブセットを識別します。ランダムなサブスペースをサンプリングすることで、SciForestは意味のある特徴グループを強調し、ノイズを減らして焦点を改善します。これにより、無関係な次元やノイズの多い次元の影響が軽減されます。[4]
2. 分離ツリーの構築
選択された各サブスペース内で、分離ツリーが構築されます。これらのツリーは、ランダムな再帰分割によってポイントを分離します。
- 特徴はサブスペースからランダムに選択されます。
- データを分割するために、機能の範囲内のランダムな分割値が選択されます。
異常点は、まばらであったり、はっきり区別されていたりするため、通常の点に比べてより早く(経路長が短く)分離されます。[2]
3. 異常スコアリング
各データ ポイントについて、すべてのサブスペースにわたるすべてのツリーの分離深度 ( ) が計算されます。データ ポイントの異常スコアは次のように定義されます。
どこ:
- : - 番目のツリー内のデータ ポイントのパスの長さ。
- : 分離ツリーの合計数。
平均経路長()が短い点は異常である可能性が高い。[3]
4. 閾値設定
最終的な異常スコアは、データポイントを分類するために事前に定義されたしきい値と比較されます。 の場合、ポイントは異常として分類され、それ以外の場合は正常です。異常スコアしきい値θは、特定のアプリケーションに合わせて調整でき、識別された異常の割合を制御できます。[6]
これらのステップを組み合わせることで、SciForest は異常検出の効率を維持しながら、さまざまなデータ分布に適応できるようになります。
SCiForest実装フローチャート
このフローチャートは、高次元データセットの入力から異常の検出まで、SCiForest 実装のプロセスを段階的に視覚的に表しています。各ステップは主要な機能とともに強調表示されており、方法論の概要を明確に示しています。
拡張隔離林
拡張分離フォレスト (拡張 IF または EIF) は、元の分離フォレスト アルゴリズムの別の拡張です。拡張 IF は、SCiForest と同様に、さまざまな平面で回転したツリーを使用し、ランダムな傾きや切片などのランダムな値を選択してデータを分割します。
標準的なアイソレーションフォレストでは、1) ランダムな特徴または座標、2) データ内の利用可能な値の範囲からの特徴のランダムな値、という 2 つの情報が必要です。Extended IF も 2 つの情報のみを必要とします。今回は、1) ブランチカットのランダムな傾き、2) トレーニングデータの利用可能な値の範囲から選択されたブランチカットのランダムな切片です。これにより、Extended IF は回転木を使用するよりもシンプルになります。[15]

この図は、正弦波形状のデータセットに対する通常の分離フォレストと拡張分離フォレストのスコアマップを比較したものです。この画像から、データの形状と比較して、拡張分離フォレストがスコアをより正確に評価する点で改善されたことがはっきりとわかります。通常の分離フォレストは、データの正弦波形状を捉えることができず、異常スコアを適切に評価できません。通常の分離フォレストは、異常スコアを長方形に整形し、正弦波データポイントの近くの領域は異常ではないと単純に想定します。これに比べて、EIF は異常スコアをより詳細に評価する点でより正確であり、その前身とは異なり、EIF はデータの正弦波形状に近いが依然として異常である異常を検出できます。オリジナルの EIF 出版物には、単一のブロブ形状のデータセットと 2 つのブロブ形状のデータセットとの比較も含まれており、回転ツリーを使用して EIF の結果と分離フォレストを比較しています。[15]
拡張隔離林の改善
拡張分離フォレストは、従来の分離フォレスト アルゴリズムのいくつかの制限に対処し、特に高次元データの処理と異常検出の精度の向上を実現することで、そのアルゴリズムを強化します。EIF の主な改善点は次のとおりです。
拡張分割メカニズム:ランダムな軸に沿った分割を使用する従来の分離フォレストとは異なり、EIF はデータの分割にハイパープレーンを使用します。このアプローチにより、データ空間をより柔軟かつ正確に分割できるため、高次元データセットで特に役立ちます。
異常スコアリングの改善: EIF は、分割に使用されるハイパープレーンからのデータ ポイントの距離を考慮して、異常スコアリング プロセスを改良します。これにより、よりきめ細かく正確な異常スコアが得られ、正常ポイントと異常ポイントをより適切に区別できるようになります。
高次元データの処理:超平面の使用は、高次元空間でのEIFのパフォーマンスも向上させます。従来の分離フォレストは、このようなシナリオでは次元の呪いに悩まされる可能性がありますが、EIFはデータ空間内により意味のある情報豊富なパーティションを作成することでこの問題を軽減します。[16]
オープンソース実装
Fei Tony Liu によるオリジナルの実装は、 Rの Isolation Forest です。
その他の実装(アルファベット順):
- ELKI には Java 実装が含まれています。
- アイソレーションフォレスト - Open Neural Network Exchange (ONNX)エクスポートを備えた分散型Spark/Scala実装で、クロスプラットフォーム推論が容易になります。[17]
- H2O-3 による Isolation Forest - Python 実装。
- Rでのパッケージ solitude の実装。
- scikit-learnの例を含む Python 実装。
- Spark iForest - Scala/Python での分散Apache Spark実装。
- PyOD IForest - 人気の Python Outlier Detection (PyOD) ライブラリの別の Python 実装。
分離フォレスト アルゴリズム実装の他のバリエーション:
- 拡張分離フォレスト – 拡張分離フォレストの実装。[15]
- H2O-3 による Extended Isolation Forest - Extended Isolation Forest の実装。
- (Python、R、C / C ++) Isolation Forestとそのバリエーション - Isolation Forestとそのバリエーションの実装。[18]
Scikit-learn を使用した Python 実装
分離フォレスト アルゴリズムは、scikit-learn ライブラリで利用できるバージョンを通じて、データ サイエンティストによって一般的に使用されています。以下のスニペットは、コメントによる直接的な説明とともに、分離フォレストの簡単な実装を示しています。
pandasを pdとして インポートする
sklearn.ensemble からIsolationForestをインポートします
# 「data.csv」は、行としてサンプル、列として特徴、およびサンプルのバイナリ分類を含む「Class」というラベルの列を含むファイルであるとします。
df = pd.read_csv ( "data.csv" )を実行します。
X = df . drop ( columns = [ "クラス" ])
y = df [ "クラス" ]
# 分類に基づいて外れ値となるサンプルの数を決定する
outlier_fraction = len ( df [ df [ "Class" ] == 1 ]) / float ( len ( df [ df [ "Class" ] == 0 ]))
# モデルを作成して適合し、パラメータを最適化できます
モデル = IsolationForest ( n_estimators = 100 、 汚染= outlier_fraction 、 random_state = 42 )
モデル.フィット( df )
このスニペットでは、アルゴリズムの標準実装のシンプルさがわかります。ユーザーが調整する必要がある唯一の要件データは、外れ値の割合です。ユーザーは、外れ値として分類するサンプルの割合を決定します。これは通常、指定された分類に従って、陽性サンプルと陰性サンプルの中からグループを選択することにより実行できます。その他の手順のほとんどは、 scikit-learn で利用できる決定木ベースの手法の標準的なものであり、ユーザーは、ターゲット変数を特徴から分割し、指定された数の推定値 (またはツリー) でモデルを定義した後、モデルを適合させるだけです。
このスニペットはGeeksforGeeksによって調査された実装の短縮版であり、さらに調査するためにアクセスできます。[19]
参照
参考文献
- ^ Liu, Fei Tony (2014 年 7 月 7 日)。「Sourceforge での最初の Isolation Forest 実装」。
- ^ abcdefghijk Liu, Fei Tony; Ting, Kai Ming; Zhou, Zhi-Hua (2008 年 12 月)。 「 Isolation Forest」。2008年第 8 回 IEEE 国際データマイニング会議。pp. 413– 422。doi :10.1109 / ICDM.2008.17。ISBN 978-0-7695-3502-9. S2CID 6505449。
- ^ abcdefg Liu, Fei Tony; Ting, Kai Ming; Zhou, Zhi-Hua (2008 年 12 月)。「分離ベースの異常検出」。ACM Transactions on Knowledge Discovery from Data 6 : 3:1–3:39。doi : 10.1145 /2133360.2133363。S2CID 207193045 。
- ^ abcdefg Liu, Fei Tony; Ting, Kai Ming; Zhou, Zhi-Hua (2010 年 9 月)。「SCiForest を使用したクラスター化された異常の検出について」。機械学習とデータベースの知識発見に関するヨーロッパ合同会議 - ECML PKDD 2010: 機械学習とデータベースの知識発見。コンピュータ サイエンスの講義ノート。第 6322 巻。pp. 274– 290。doi : 10.1007 /978-3-642-15883-4_18。ISBN 978-3-642-15882-7。
- ^ Shaffer, Clifford A. (2011). Java におけるデータ構造とアルゴリズム分析(第 3 版 Dover 版). ミネオラ、ニューヨーク: Dover Publications. ISBN 9780486485812. OCLC 721884651.
- ^ abcdefghi Dal Pozzolo, Andrea; Caelen, Olivier; Johnson, Reid A; Bontempi, Gianluca (2015). 「Unbalanced Classification のためのアンダーサンプリングによる確率の調整」2015 IEEE 計算知能シンポジウムシリーズpp. 159– 166. doi :10.1109/SSCI.2015.33. ISBN 978-1-4799-7560-0。
{{cite book}}:|journal=無視されました (ヘルプ) - ^ abcdefg 「クレジットカード詐欺検出データセット」。2024年12月4日閲覧。
- ^ abcdefg Dal Pozzolo, Andrea; Caelen, Olivier; Le Borgne, Yann-Ael; Waterschoot, Serge; Bontempi, Gianluca. 「実務家の観点から見たクレジットカード詐欺検出の教訓」. Expert Systems with Applications . 41 (10): 4915– 4928. doi :10.1016/j.eswa.2014.03.026.
- ^ Dilini Talagala, Priyanga; Hyndman, Rob J.; Smith-Miles, Kate (2019年8月12日). 「高次元データにおける異常検出」. arXiv : 1908.04000 [stat.ML].
- ^ abcde 「ハイパーパラメータチューニング分離フォレスト | Restackio」。www.restack.io 。 2024年12月5日閲覧。
- ^ “アンドレア・ダル・ポッツォーロ”. dalpozz.github.io 。2024 年 12 月 6 日に取得。
- ^ abcde Michael Heigl; Ashutosh Anand Kumar; Andreas Urmann; Dalibor Fiala; Martin Schramm; Robert Hable (2021). 「ストリーミングデータによる外れ値検出のための分離フォレストアルゴリズムの改善について」. Electronics . 10 (13): 1534. doi : 10.3390/electronics10131534 .
- ^ abcde Yassine Chabchoub; MU Togbe; Aboubacar Boly; Rachid Chiky (2022). 「隔離林の詳細な研究と改善」. IEEE Access . 10 : 10219–10237 . Bibcode :2022IEEEA..1010219C. doi :10.1109/ACCESS.2022.3144425.
- ^ abcdefghij 「異常検出のための分離フォレストの調整 | Restackio」。www.restack.io 。 2024年12月5日閲覧。
- ^ abcd Hariri, Sahand; Kind, Matias Carrasco; Brunner, Robert J. (2021年4月). 「Extended Isolation Forest」. IEEE Transactions on Knowledge and Data Engineering . 33 (4): 1479– 1489. arXiv : 1811.02141 . doi :10.1109/TKDE.2019.2947676. ISSN 1558-2191. S2CID 53236735.
- ^ Hariri, Sahand; Kind, Matias Carrasco; Brunner, Robert J. (2021-04-01). 「Extended Isolation Forest」. IEEE Transactions on Knowledge and Data Engineering . 33 (4): 1479– 1489. arXiv : 1811.02141 . doi :10.1109/TKDE.2019.2947676. ISSN 1041-4347.
- ^ Verbus, James (2019 年 8 月 13 日)。「分離フォレストを使用して LinkedIn での不正使用を検出および防止する」。LinkedInエンジニアリング ブログ。2023年 7 月 2 日閲覧。
- ^ Cortes, David (2019). 「分離フォレストを使用した距離近似」. arXiv : 1910.12362 [stat.ML].
- ^ GeeksforGeeks、「Isolation Forest とは何か?」、2024 年 11 月 19 日にアクセス。
