統計学において、ランダムフォレストのジャックナイフ分散推定は、ブートストラップ効果を排除するために、ランダムフォレストモデルの分散を推定する方法である。
袋詰め学習者の標本分散は次のとおりです。
ブートストラップ効果を排除するために、ジャックナイフ推定を検討することができます。ジャックナイフ分散推定量は次のように定義されます。[ 1 ]
一部の分類問題において、ランダムフォレストを用いてモデルを適合させる場合、ジャックナイフ推定分散は次のように定義されます。
ここ、はトレーニング後の決定木を表します。サンプルなしの結果を示します観察。
Eメールのスパム問題は一般的な分類問題であり、この問題では、スパムメールと非スパムメールを分類するために57の特徴が使用されます。IJ-U分散式を適用して、m=15、19、57のモデルの精度を評価します。結果は論文(ランダムフォレストの信頼区間: ジャックナイフと無限小ジャックナイフ)で示されており、m=57のランダムフォレストは非常に不安定であるのに対し、m=5のランダムフォレストによる予測は非常に安定しているように見えます。この結果は、エラー率による評価に対応しており、m=5のモデルの精度は高く、m=57のモデルの精度は低いことがわかります。
ここでは、精度はエラー率によって測定され、エラー率は次のように定義されます。
ここでNはサンプル数、Mはクラス数です。は、次の場合に 1 となる指示関数です。観測値はクラス j に属し、他のクラスに属する場合は 0 となります。ここでは確率は考慮されていません。精度を測定するためのエラー率に似た別の方法があります。
ここで、Nはサンプル数、Mはクラス数です。は、次の場合に 1 となる指示関数です。観測値はクラス j に属し、他のクラスに属する場合は 0 となります。予測される確率は授業中の観察この方法はKaggleで使用されています[ 2 ] 。 これら2つの方法は非常によく似ています。
モンテカルロMSEを使用して推定する場合そして特にnが大きい場合、モンテカルロバイアスの問題を考慮する必要がある。バイアスは大きくなる。
この影響を排除するために、バイアス補正された修正が提案されている。