ブートストラップ集約(バギング、ブートストラップとも呼ばれる)は、機械学習(ML)のアンサンブルメタアルゴリズムであり、ML分類および回帰アルゴリズムの安定性と精度を向上させるために設計されています。また、分散と過学習も軽減します。通常は決定木法に適用されますが、あらゆる種類の手法で使用できます。バギングは、アンサンブル平均化アプローチの特殊なケースです。
標準的なトレーニングセットが与えられた場合サイズの袋詰めによって新しいトレーニングセットそれぞれのサイズはからサンプリングすることによって均一かつ復元抽出。復元抽出では、各サンプルで一部の観測値が繰り返される可能性がある。。 もし大きなセットは、(1 - 1/ e ) (~63.2%) の割合のユニークなサンプルを持つと予想されます。残りは重複です。[ 1 ]この種のサンプルはブートストラップサンプルとして知られています。置換サンプリングでは、サンプリング時に以前に選択されたサンプルに依存しないため、各ブートストラップがピアから独立していることが保証されます。次に、上記のブートストラップサンプルを使用してモデルを適合させ、出力を平均化(回帰の場合)または投票(分類の場合)によって組み合わせます。

バギングは「不安定な手順の改善」につながり、[ 2 ]例えば、人工ニューラルネットワーク、分類木と回帰木、線形回帰における部分集合選択などが含まれます。[ 3 ]バギングは、プリイメージ学習を改善することが示されています。[ 4 ] [ 5 ]一方、k近傍法などの安定した手法のパフォーマンスをわずかに低下させる可能性があります。[ 2 ]
ブートストラップ集計には、3種類のデータセットがあります。オリジナルデータセット、ブートストラップデータセット、アウトオブバッグデータセットです。以下の各セクションでは、オリジナルデータセットを除く各データセットの作成方法について説明します。オリジナルデータセットとは、与えられた情報そのものです。
ブートストラップデータセットは、元のデータセットからオブジェクトをランダムに選択して作成されます。また、元のデータセットと同じサイズである必要があります。ただし、ブートストラップデータセットには重複するオブジェクトを含めることができるという点が異なります。以下に、その仕組みを示す簡単な例と図を示します。
![]()
元のデータセットは12人のグループだとします。彼らの名前は、エミリー、ジェシー、ジョージ、コンスタンティン、レクシー、セオドア、ジョン、ジェームズ、レイチェル、アンソニー、エリー、ジャマルです。
ランダムに名前のグループを選び、ブートストラップデータセットにJames、Ellie、Constantine、Lexi、John、Constantine、Theodore、Constantine、Anthony、Lexi、Constantine、Theodoreという名前が含まれているとします。この場合、ブートストラップサンプルにはConstantineが4つ、LexiとTheodoreがそれぞれ2つずつ重複して含まれていました。
アウトオブバッグデータセットは、ブートストラップデータセットに含まれなかった残りの人々を表します。これは、元のデータセットとブートストラップデータセットの差を取ることで計算できます。この場合、選択されなかった残りのサンプルは、エミリー、ジェシー、ジョージ、レイチェル、ジャマルです。両方のデータセットは集合であるため、差を取る際には、ブートストラップデータセット内の重複した名前は無視されることに注意してください。以下の図は、計算方法を示しています。
![]()
ブートストラップデータセットとアウトオブバッグデータセットの作成は、ランダムフォレストなどのアンサンブル学習アルゴリズムの精度をテストするために使用されるため、非常に重要です。たとえば、ブートストラップ/アウトオブバッグデータセットを使用して50個の決定木を生成するモデルは、10個の決定木を生成するモデルよりも精度が高くなります。このアルゴリズムは複数の決定木、つまり複数のデータセットを生成するため、ブートストラップデータセットからオブジェクトが漏れる可能性は低くなります。次のいくつかのセクションでは、ランダムフォレストアルゴリズムの動作についてさらに詳しく説明します。
アルゴリズムの次のステップでは、ブートストラップされたデータセットから決定木を生成します。これを実現するために、プロセスでは各遺伝子/特徴を調べ、その特徴の有無が陽性または陰性の結果をもたらすサンプルの数を決定します。次に、この情報を使用して混同行列を計算します。混同行列には、分類器として使用した場合の特徴の真陽性、偽陽性、真陰性、および偽陰性がリストされます。これらの特徴は、混同行列に基づいてさまざまな分類指標に従ってランク付けされます。一般的な指標には、正答率の推定値(真陽性から偽陽性を差し引いて計算)、良さの尺度、および情報利得などがあります。これらの特徴は、サンプルを2つのセットに分割するために使用されます。つまり、最上位の特徴を持つサンプルと、持たないサンプルです。
下の図は、深さ2の決定木を使用してデータを分類する例を示しています。例えば、特徴1は示すが特徴2は示さないデータポイントには「いいえ」が与えられます。特徴1は示さないが特徴3を示すデータポイントには「はい」が与えられます。

このプロセスは、目的の深さに達するまで、ツリーの各レベルで再帰的に繰り返されます。ツリーの最下層では、最終特徴量に対して陽性反応を示したサンプルは一般的に陽性と分類され、その特徴量を持たないサンプルは陰性と分類されます。これらのツリーは、新しいデータを分類するための予測器として使用されます。
アルゴリズムの次の部分では、ブートストラップされたツリー間にさらに別の変動要素を導入します。各ツリーはブートストラップされたサンプルセットのみを調べるだけでなく、分類器としてランク付けする際には、少数の一定数の固有の特徴のみが考慮されます。つまり、各ツリーは少数の定数の特徴と、元のデータセット以下の可変数のサンプルに関するデータしか知りません。その結果、ツリーはより多様な知識から導き出された、より幅広い回答を返す可能性が高くなります。これにより、ランダム性のない単一の決定木よりも多くの利点を持つランダムフォレストが生成されます。ランダムフォレストでは、各ツリーは特徴に基づいてサンプルを陽性と分類するかどうかを「投票」します。サンプルは多数決に基づいて分類されます。下の図にその例を示します。ランダムフォレストの4つのツリーが、変異A、B、F、Gを持つ患者が癌であるかどうかを投票します。4つのツリーのうち3つが「はい」と投票したため、患者は癌陽性と分類されます。

ランダムフォレストは、その特性から最も正確なデータマイニングアルゴリズムの1つと考えられており、データに過学習する可能性が低く、大規模なデータセットでも高速かつ効率的に実行されます。 [ 6 ]ランダムフォレストは、データセット内の統計変数間の観測された関連性を引き出そうとする回帰とは異なり、主に分類に役立ちます。このため、ランダムフォレストは、過去のデータに基づいて将来の結果を予測できることが重要な銀行、医療、株式市場、電子商取引などの分野で特に役立ちます。 [ 7 ]上記の例で示されているように、遺伝的要因に基づいて癌を予測するための有用なツールとして、ランダムフォレストの応用例の1つがあります。
ランダムフォレストを設計する際には、考慮すべき重要な要素がいくつかあります。ランダムフォレストのツリーが深すぎると、特異性が高すぎるために過学習が発生する可能性があります。フォレストが大きすぎると、実行時間が増加するため、アルゴリズムの効率が低下する可能性があります。ランダムフォレストは、変動性の低い疎なデータが与えられた場合、一般的にうまく機能しません。[ 7 ]しかし、ランダムフォレストは、解釈がはるかに容易で、一般的にトレーニングに必要なデータが少ないため、ニューラルネットワークなどの類似のデータ分類アルゴリズムよりも多くの利点があります。ランダムフォレストの不可欠なコンポーネントとして、ブートストラップ集約は分類アルゴリズムにとって非常に重要であり、以下で説明するように、新しいデータを分析する際に精度を高めることができる重要な変動要素を提供します。
上記の手法ではランダムフォレストとバギング(ブートストラップとも呼ばれる)を利用していますが、実行時間と投票時間、予測精度、および全体的なパフォーマンスを向上させるために使用できる特定の手法があります。効率的なランダムフォレストを作成するための重要な手順は次のとおりです。

分類には、トレーニングセットを使用します。誘導剤ブートストラップサンプルの数入力として。分類器を生成する出力として[ 12 ]
i = 1 から m まで { D' = Dからのブートストラップサンプル(復元抽出によるサンプル) Ci = I(D') } C*(x) = argmax #{i:Ci(x)=y} (最も頻繁に予測されるラベルはy) y∈Y 袋詰めの基本原理を説明するために、以下にオゾンと温度の関係についての分析を示します(データはRousseeuwと Leroy (1986) によるもので、分析はRで行いました)。
散布図に基づくと、このデータセットでは温度とオゾンの関係は非線形であるように見えます。この関係を数学的に記述するために、LOESS平滑化器(帯域幅0.5)を使用します。データセット全体に対して単一の平滑化器を作成する代わりに、100個のブートストラップサンプルを抽出しました。各サンプルは元のデータのランダムなサブセットで構成され、マスターセットの分布と変動の類似性を維持します。各ブートストラップサンプルに対して、LOESS平滑化器を適合させました。次に、これらの100個の平滑化器から、データの範囲全体にわたって予測を行いました。黒線はこれらの初期予測を表しています。線は予測に一致がなく、データポイントに過剰適合する傾向があります。これは、線の流れが不安定であることから明らかです。

元のデータセットのサブセットに対応する100個の平滑化関数の平均を取ることで、1つのバギング予測器(赤線)が得られます。赤線の流れは安定しており、どのデータポイントにも過度に適合しません。
利点:
デメリット:
ブートストラップ集約の概念は、ブラッドリー・エフロンによって開発されたブートストラップの概念に由来します。[ 15 ]ブートストラップ集約は、レオ・ブレイマン によって提案され、彼はまた「バギング」(ブートストラップ集約)という略語も考案しました。ブレイマンは、ランダムに生成されたトレーニングセットの分類を組み合わせることによって分類を改善するために、1994 年にバギングの概念を開発しました。彼は、「学習セットを摂動することで構築された予測器に大きな変化が生じる可能性がある場合、バギングによって精度を向上させることができる」と主張しました。[ 3 ]
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ) CS1 メンテナンス: 複数の名前: 著者リスト (リンク)が必要です