勾配ブースティングは 、関数空間でのブースティング に基づく機械学習 手法であり、従来のブースティングのように残差 ではなく擬似残差をターゲットとします。これは、弱い予測モデルの アンサンブル の形で予測モデルを提供します。弱い予測モデルとは、データについてほとんど仮定を置かないモデルであり、通常は単純な決定木 です。[ 1 ] [ 2 ] 決定木が弱い学習器である場合、結果として得られるアルゴリズムは勾配ブースティング木と呼ばれ、通常はランダム フォレストよりも優れた性能を発揮します。[ 1 ] 他のブースティング 手法と同様に、勾配ブースティング木モデルは段階的に構築されますが、任意の微分可能な 損失関数 の最適化を可能にすることで、他の手法を一般化しています。
歴史 勾配ブースティングのアイデアは、ブースティングを適切なコスト関数上の最適化アルゴリズムとして解釈できるというレオ・ブレイマンの観察から生まれた。 [ 3 ] その後、ジェローム・H・フリードマン [ 4 ] [ 2 ] によって明示的な回帰勾配ブースティングアルゴリズムが開発された(1999年と2001年)。これは、リュー・メイソン、ジョナサン・バクスター、ピーター・バートレット、マーカス・フリーアンによるより一般的な関数勾配ブースティングの観点と同時期であった。[ 5 ] [ 6 ] 後者の2つの論文は、ブースティングアルゴリズムを反復関数勾配降下 アルゴリズム として捉える見方を導入した。つまり、負の勾配方向を指す関数(弱い仮説)を反復的に選択することによって、関数空間上でコスト関数を最適化するアルゴリズムである。この関数勾配ブースティングの見方は、回帰や分類にとどまらず、機械学習や統計学の多くの分野でブースティングアルゴリズムの開発につながった。
アルゴリズム 多くの教師あり学習 問題では、出力変数y と入力変数のベクトルx が、何らかの確率分布で互いに関連しています。目標は、ある関数を見つけることです。F ^ ( x ) \displaystyle {\hat {F}}(x)} これは、入力変数の値から出力変数を最もよく近似するものです。これは、損失関数を導入することによって形式化されます。 L ( y 、 F ( x ) ) {\displaystyle L(y,F(x))} そして期待値を最小化する:
F ^ = アルグミン F E x 、 y [ L ( y 、 F ( x ) ) ] 。 {\displaystyle {\hat {F}}=\operatorname {argmin} \limits _{F}\mathbb {E} _{x,y}[L(y,F(x))].} 勾配ブースティング法は、y が実数値であることを前提としています。近似値を求めます。F ^ ( x ) \displaystyle {\hat {F}}(x)} M 個の関数の加重和の形でh m ( x ) {\displaystyle h_{m}(x)} ある階級からH \displaystyle {\mathcal {H}}} 基本学習器(または弱 学習器)と呼ばれるもの:
F ^ ( x ) = ∑ m = 1 M γ m h m ( x ) + const 、 {\displaystyle {\hat {F}}(x)=\sum _{m=1}^{M}\gamma _{m}h_{m}(x)+{\mbox{const}},} どこγ m \displaystyle \gamma _{m}} ステージでの体重はm {\displaystyle m} 通常、トレーニングセットが提供されます。{ ( x 1 、 y 1 ) 、 … 、 ( x n 、 y n ) } {\displaystyle \{(x_{1},y_{1}),\dots ,(x_{n},y_{n})\}} 既知のxの値とそれに対応する y の値。経験的リスク最小化 原理に従って、この方法は近似値を見つけようとします。F ^ ( x ) \displaystyle {\hat {F}}(x)} これは、訓練セットにおける損失関数の平均値を最小化する、すなわち経験的リスクを最小化する。これは、定数関数からなるモデルから始めることによって行われる。F 0 ( x ) {\displaystyle F_{0}(x)} そして、それを貪欲な 方法で段階的に拡張します。
F 0 ( x ) = 引数 ミニ h 0 ∈ H ∑ 私 = 1 n L ( y 私 、 h 0 ( x 私 ) ) 、 {\displaystyle F_{0}(x)={\underset {h_{0}\in {\mathcal {H}}}{\arg \min }}\sum _{i=1}^{n}{L(y_{i},h_{0}(x_{i}))},} F m ( x ) = F m − 1 ( x ) + ( 1 r g m 私 n h m ∈ H [ ∑ 私 = 1 n L ( y 私 、 F m − 1 ( x 私 ) + h m ( x 私 ) ) ] ) ( x ) 、 {\displaystyle F_{m}(x)=F_{m-1}(x)+\left({\underset {h_{m}\in {\mathcal {H}}}{\operatorname {arg\,min} }}\left[\sum _{i=1}^{n}L(y_{i},F_{m-1}(x_{i})+h_{m}(x_{i}))\right]\right)(x),} のためにm ≥ 1 {\displaystyle m\geq 1} 、 どこh m ∈ H {\displaystyle h_{m}\in {\mathcal {H}}} これは基本学習関数です。
残念ながら、最適な機能を選択するh m {\displaystyle h_{m}} 任意の損失関数Lに対して各ステップで を実行することは、一般に計算上実行不可能な最適化問題です。したがって、我々のアプローチは問題の簡略化されたバージョンに限定します。この最小化問題に 最急降下 法(関数勾配降下法)を適用するというアイデアです。基本的なアイデアは、 を反復して損失関数の局所最小値を見つけることです。F m − 1 ( x ) {\displaystyle F_{m-1}(x)} 実際、損失関数の局所最大降下方向は負の勾配である。[ 8 ] したがって、少量の移動γ {\displaystyle \gamma } 線形近似が有効なままとなるように:
F m ( x ) = F m − 1 ( x ) − γ ∑ 私 = 1 n ∇ F m − 1 L ( y 私 、 F m − 1 ( x 私 ) ) {\displaystyle F_{m}(x)=F_{m-1}(x)-\gamma \sum _{i=1}^{n}\nabla _{F_{m-1}}L(y_{i},F_{m-1}(x_{i}))} どこγ > 0 {\displaystyle \gamma >0} 小規模向けγ {\displaystyle \gamma } これは、L ( y 私 、 F m ( x 私 ) ) ≤ L ( y 私 、 F m − 1 ( x 私 ) ) {\displaystyle L(y_{i},F_{m}(x_{i}))\leq L(y_{i},F_{m-1}(x_{i}))} 。
さらに、最適化することができますγ {\displaystyle \gamma } 見つけることでγ {\displaystyle \gamma } 損失関数が最小値をとる値:
γ m = アルグミン γ ∑ 私 = 1 n L ( y 私 、 F m ( x 私 ) ) = 引数 ミニ γ ∑ 私 = 1 n L ( y 私 、 F m − 1 ( x 私 ) − γ ∇ F m − 1 L ( y 私 、 F m − 1 ( x 私 ) ) ) 。 {\displaystyle \gamma _{m}={\underset {\gamma }{\operatorname {argmin} }}\sum _{i=1}^{n}L(y_{i},F_{m}(x_{i}))={\underset {\gamma }{\arg \min }}{\sum _{i=1}^{n}L\left(y_{i},F_{m-1}(x_{i})-\gamma \nabla _{F_{m-1}}L(y_{i},F_{m-1}(x_{i}))\right)}.} 連続的な場合、つまり、H {\displaystyle {\mathcal {H}}} は、上の任意の微分可能な関数の集合である。R {\displaystyle \mathbb {R} } 我々は以下の式に従ってモデルを更新する。
F m ( x ) = F m − 1 ( x ) − γ m ∑ 私 = 1 n ∇ F m − 1 L ( y 私 、 F m − 1 ( x 私 ) ) {\displaystyle F_{m}(x)=F_{m-1}(x)-\gamma _{m}\sum _{i=1}^{n}{\nabla _{F_{m-1}}L(y_{i},F_{m-1}(x_{i}))}} どこγ m {\displaystyle \gamma _{m}} ステップ長は次のように定義されます。 γ m = 引数 ミニ γ ∑ 私 = 1 n L ( y 私 、 F m − 1 ( x 私 ) − γ ∇ F m − 1 L ( y 私 、 F m − 1 ( x 私 ) ) ) 。 {\displaystyle \gamma _{m}={\underset {\gamma }{\arg \min }}\sum _{i=1}^{n}L\left(y_{i},F_{m-1}(x_{i})-\gamma \nabla _{F_{m-1}}L(y_{i},F_{m-1}(x_{i}))\right).} しかし離散的な場合、つまりセットがH {\displaystyle {\mathcal {H}}} が有限である場合、 L の勾配に最も近い 候補関数h を 選択し、その係数γ を上記の方程式に対する線探索 によって計算します。このアプローチはヒューリスティックであるため、与えられた問題の正確な解ではなく、近似解が得られることに注意してください。擬似コードでは、一般的な勾配ブースティング法は次のようになります。[ 4 ] [ 1 ]
入力: トレーニングセット{ ( x 私 、 y 私 ) } 私 = 1 n 、 {\displaystyle \{(x_{i},y_{i})\}_{i=1}^{n},} 微分可能な損失関数L ( y 、 F ( x ) ) 、 {\displaystyle L(y,F(x)),} 反復回数M 。
アルゴリズム:
モデルを定数値で初期化します。 F 0 ( x ) = 引数 ミニ γ ∑ 私 = 1 n L ( y 私 、 γ ) 。 {\displaystyle F_{0}(x)={\underset {\gamma }{\arg \min }}\sum _{i=1}^{n}L(y_{i},\gamma ).} m = 1 からM まで: いわゆる擬似残差 を計算する: r 私 m = − [ ∂ L ( y 私 、 F ( x 私 ) ) ∂ F ( x 私 ) ] F ( x ) = F m − 1 ( x ) のために 私 = 1 、 … 、 n 。 {\displaystyle r_{im}=-\left[{\frac {\partial L(y_{i},F(x_{i}))}{\partial F(x_{i})}}\right]_{F(x)=F_{m-1}(x)}\quad {\text{for }}i=1,\ldots ,n.} スケーリングに対して閉じたベース学習器(または弱学習器、例えばツリー)を適合させるh m ( x ) {\displaystyle h_{m}(x)} 擬似残差に、つまりトレーニングセットを使用してトレーニングします。{ ( x 私 、 r 私 m ) } 私 = 1 n {\displaystyle \{(x_{i},r_{im})\}_{i=1}^{n}} 。 乗数を計算するγ m {\displaystyle \gamma _{m}} 以下の一次元最適化問題を解くことによって: γ m = アルグミン γ ∑ 私 = 1 n L ( y 私 、 F m − 1 ( x 私 ) + γ h m ( x 私 ) ) 。 {\displaystyle \gamma _{m}={\underset {\gamma }{\operatorname {argmin} }}\sum _{i=1}^{n}L\left(y_{i},F_{m-1}(x_{i})+\gamma h_{m}(x_{i})\right).} モデルを更新する: F m ( x ) = F m − 1 ( x ) + γ m h m ( x ) 。 {\displaystyle F_{m}(x)=F_{m-1}(x)+\gamma _{m}h_{m}(x).} 出力F M ( x ) 。 {\displaystyle F_{M}(x).}
勾配木ブースティング 勾配ブースティングは通常、基本学習器として固定サイズの決定木 (特にCART )とともに使用されます。この特殊なケースにおいて、フリードマンは各基本学習器の適合度を向上させる勾配ブースティング手法の改良を提案しています。
m 番目のステップでの一般的な勾配ブースティングは決定木に適合するだろうh m ( x ) {\displaystyle h_{m}(x)} 擬似残差へ。J m {\displaystyle J_{m}} 葉の数とする。木は入力空間を分割する。J m {\displaystyle J_{m}} 分離した領域R 1 m 、 … 、 R J m m {\displaystyle R_{1m},\ldots ,R_{J_{m}m}} そして各領域で一定の値を予測します。指示記号 表記を使用すると、h m ( x ) {\displaystyle h_{m}(x)} 入力x は、次の和として表すことができます。
h m ( x ) = ∑ j = 1 J m b j m 1 R j m ( x ) 、 {\displaystyle h_{m}(x)=\sum _{j=1}^{J_{m}}b_{jm}\mathbf {1} _{R_{jm}}(x),} どこb j m {\displaystyle b_{jm}} 領域内で予測される値ですR j m {\displaystyle R_{jm}} [ 9 ]
次に係数b j m {\displaystyle b_{jm}} ある値を掛け合わせるγ m {\displaystyle \gamma _{m}} 損失関数を最小化するように線探索を用いて選択し、モデルを以下のように更新します。
F m ( x ) = F m − 1 ( x ) + γ m h m ( x ) 、 γ m = 1 r g m 私 n γ ∑ 私 = 1 n L ( y 私 、 F m − 1 ( x 私 ) + γ h m ( x 私 ) ) 。 {\displaystyle F_{m}(x)=F_{m-1}(x)+\gamma _{m}h_{m}(x),\quad \gamma _{m}={\underset {\gamma }{\operatorname {arg\,min} }}\sum _{i=1}^{n}L(y_{i},F_{m-1}(x_{i})+\gamma h_{m}(x_{i})).} フリードマンはこのアルゴリズムを修正し、別の最適値を選択するようにすることを提案している。γ j m {\displaystyle \gamma _{jm}} ツリーの各領域に対して、単一のγ m {\displaystyle \gamma _{m}} ツリー全体に対して。彼はこの改良アルゴリズムを「TreeBoost」と呼んでいる。係数b j m {\displaystyle b_{jm}} ツリーフィッティング手順からの要素は単純に破棄することができ、モデル更新ルールは次のようになります。
F m ( x ) = F m − 1 ( x ) + ∑ j = 1 J m γ j m 1 R j m ( x ) 、 γ j m = 1 r g m 私 n γ ∑ x 私 ∈ R j m L ( y 私 、 F m − 1 ( x 私 ) + γ ) 。 {\displaystyle F_{m}(x)=F_{m-1}(x)+\sum _{j=1}^{J_{m}}\gamma _{jm}\mathbf {1} _{R_{jm}}(x),\quad \gamma _{jm}={\underset {\gamma }{\operatorname {arg\,min} }}\sum _{x_{i}\in R_{jm}}L(y_{i},F_{m-1}(x_{i})+\gamma ).} 損失が発生した場合L ( ⋅ 、 ⋅ ) {\displaystyle L(\cdot ,\cdot )} 平均二乗誤差(MSE)は係数ですγ j m {\displaystyle \gamma _{jm}} ツリーフィッティング手順の係数と一致するb j m {\displaystyle b_{jm}} 。
正則化 訓練データセットに過度に適合させると、モデルの汎化能力、つまり未知のデータに対する性能が低下する可能性があります。いわゆる正則化 手法のいくつかは、適合手順に制約を設けることで、この過学習の 影響を軽減します。
自然な正則化パラメータの一つとして、勾配ブースティングの反復回数M (すなわち、ベースモデルの数)が挙げられます。Mを増やすと訓練データセットにおける誤差は減少しますが、過学習のリスクが高まります 。M の最適な値は、多くの場合、別の検証データセットにおける予測誤差を監視することによって決定されます。
ツリーブースティングにおけるもう一つの正則化パラメータは、ツリーの深さです。この値が大きいほど、モデルが訓練データに過学習する可能性が高くなります。
収縮 勾配ブースティングの重要な要素の一つは、修正された更新ルールを用いる収縮による正則化である。
F m ( x ) = F m − 1 ( x ) + ν ⋅ γ m h m ( x ) 、 0 < ν ≤ 1 、 {\displaystyle F_{m}(x)=F_{m-1}(x)+\nu \cdot \gamma _{m}h_{m}(x),\quad 0<\nu \leq 1,} パラメータ ν {\displaystyle \nu } これは「学習率」と呼ばれます。
経験的に、小さな学習率 (例えば、ν < 0.1 {\displaystyle \nu <0.1} ) は、縮小することなく勾配ブースティングよりもモデルの汎化能力を劇的に向上させます (ν = 1 {\displaystyle \nu =1} ) [ 1 ] ただし、学習率が低いほど、トレーニング中とクエリ中の両方で 計算時間が 増加するという代償が伴います。つまり、学習率が低いほど、より多くの反復が必要になります。
確率的勾配ブースティング 勾配ブースティングが導入されて間もなく、フリードマンはブレイマン のブートストラップ集約 (「バギング」)法に触発され、アルゴリズムに若干の修正を提案した。[ 2 ] 具体的には、アルゴリズムの各反復において、ベース学習器を、復元抽出なしでランダムに抽出されたトレーニングセットのサブサンプルに適合させるべきであると提案した。[ 10 ] フリードマンはこの修正により勾配ブースティングの精度が大幅に向上することを確認した。
サブサンプルサイズは一定の割合ですf {\displaystyle f} トレーニングセットのサイズ。f = 1 {\displaystyle f=1} アルゴリズムは決定論的であり、上記のものと同一です。f {\displaystyle f} アルゴリズムにランダム性を導入し、過学習を 防ぐのに役立ち、一種の正則化 として機能します。また、回帰木を各反復でより小さなデータセットに適合させる必要があるため、アルゴリズムは高速化されます。フリードマン[ 2 ] は、0.5 ≤ f ≤ 0.8 {\displaystyle 0.5\leq f\leq 0.8} 小規模および中規模のトレーニングセットでは良好な結果が得られます。したがって、f {\displaystyle f} 通常は0.5に設定されており、これはトレーニングセットの半分が各ベース学習器の構築に使用されることを意味します。[ 11 ]
また、バギングと同様に、サブサンプリングでは、次のベース学習器の構築に使用されなかった観測値に対する予測を評価することにより、予測性能の向上に関するアウトオブバッグ誤差 を定義することができます。アウトオブバッグ推定は、独立した検証データセットの必要性を回避するのに役立ちますが、実際の性能向上と最適な反復回数を過小評価することがよくあります。[ 12 ] [ 13 ]
葉における観測数 勾配ツリーブースティングの実装では、ツリーの終端ノードにおける観測値の最小数を制限することで正則化を行うことがよくあります。これは、ツリー構築プロセスにおいて、この最小数よりも少ない訓練セットインスタンスを含むノードにつながる分割を無視することで実現されます。
この制限を設けることで、葉における予測値のばらつきを減らすことができる。
複雑性ペナルティ 勾配ブースティングモデルに対するもう1つの有用な正則化手法は、その複雑さにペナルティを課すことです。[ 14 ] 勾配ブースティングツリーの場合、モデルの複雑さは、ツリー内の葉の比例数として定義できます 。損失とモデルの複雑さの同時最適化は、閾値で損失を減らすことができない枝を削除する後剪定アルゴリズムに対応します。
他の種類の正則化としては、ℓ 2 {\displaystyle \ell _{2}} 葉の値に対するペナルティは、過学習を 回避するためにも使用できます。[ 15 ]
使用法 勾配ブースティングは、ランキング学習 の分野で使用できます。商用ウェブ検索エンジンのYahoo [ 16 ] とYandex [ 17 ] は 、機械学習ランキングエンジンで勾配ブースティングのバリアントを使用しています。勾配ブースティングは、高エネルギー物理学のデータ分析でも利用されています。大型ハドロン衝突型加速器 (LHC) では、勾配ブースティング深層ニューラルネットワーク (DNN) のバリアントが、ヒッグス粒子の発見に使用されたデータセットの非機械学習分析方法の結果を再現することに成功しました。 [ 18 ]勾配 ブースティング決定木は、地球および地質学の研究にも適用されています。たとえば、砂岩貯留層の品質評価などです。[ 19 ]
名前 この手法はさまざまな名前で呼ばれています。フリードマンは回帰手法を「勾配ブースティングマシン」(GBM)として紹介しました。[ 4 ] メイソン、バクスターらは、アルゴリズムの一般化された抽象クラスを「関数型勾配ブースティング」と表現しました。[ 5 ] [ 6 ] フリードマンらは、勾配ブースティングモデルの進歩を多重加法回帰木(MART)と表現しました。[ 20 ] エリスらは、そのアプローチを「ブースト回帰木」(BRT)と表現しました。[ 21 ]
R の人気のあるオープンソース実装では「Generalized Boosting Model」と呼ばれていますが[ 12 ] 、この研究を拡張したパッケージでは BRT を使用しています[ 22 ] 。また、別の名前としては、ツリーベースの手法の使用を先駆的に行った研究者の 1 人である Salford System の Dan Steinberg による初期の商用実装にちなんで TreeNet があります[ 23 ] 。
機能重要度ランキング 勾配ブースティングは特徴の重要度ランキングに使用できます。これは通常、基本学習器の重要度関数を集約することに基づいています。[ 24 ] 例えば、エントロピーベースの決定木 を使用して勾配ブースティングツリーアルゴリズムが開発されている場合、アンサンブルアルゴリズムは、すべての基本学習器で平均化されるという注意点付きで、エントロピーに基づいて特徴の重要度をランク付けします。[ 24 ] [ 1 ]
デメリット ブースティングは、決定木や線形回帰などの基本学習器の精度を向上させることができますが、理解しやすさと解釈しやすさを 犠牲にします。[ 24 ] [ 25 ] 例えば、決定木が決定を下すまでの経路をたどることは簡単で自明ですが、数百または数千の木の経路をたどることははるかに困難です。パフォーマンスと解釈しやすさの両方を実現するために、一部のモデル圧縮技術では、XGBoost を同じ決定関数を近似する単一の「生まれ変わった」決定木に変換することができます。[ 26 ] さらに、計算負荷が高いため、その実装はより困難になる可能性があります。
参考文献 1 2 3 4 5 6 Hastie, T.; Tibshirani, R.; Friedman, JH (2009). "10. ブースティングと加算ツリー" .統計的学習の要素 (第 2 版). ニューヨーク: Springer. pp. 337–384 . ISBN 978-0-387-84857-0 2009年11月10日にオリジナルからアーカイブされました。 1 2 3 4 Friedman, JH (1999 年 3 月)。 「確率的勾配ブースティング」 (PDF) 。2014 年 8 月 1 日に オリジナル (PDF)からアーカイブ済み。2013 年 11 月 13 日 に取得 。 ↑ Breiman, L. (1997年6月). 「Arcing The Edge」 (PDF) . 技術報告書486 . カリフォルニア大学バークレー校統計学部。 1 2 3 Friedman, JH (1999 年 2 月)。 「貪欲関数近似: 勾配ブースティングマシン」 (PDF) 。2019年 11 月 1 日に オリジナル (PDF) からアーカイブ済み。2018 年 8 月 27 日 に取得 。 1 2 Mason, L.; Baxter, J.; Bartlett, PL; Frean, Marcus (1999). "Boosting Algorithms as Gradient Descent" (PDF) . In SA Solla and TK Leen and K. Müller (ed.). Advances in Neural Information Processing Systems 12 . MIT Press. pp. 512–518 . 1 2 Mason, L.; Baxter, J.; Bartlett, PL; Frean, Marcus (1999 年 5 月)。 「関数空間における勾配降下法としてのブースティングアルゴリズム」 (PDF) 。2018 年 12 月 22 日に オリジナル (PDF) からアーカイブされました 。 ↑ Cheng Li. 「勾配ブースティング入門」 (PDF ) ↑ ランバース、ジム (2011–2012)。 「最も急な降下法」 (PDF) 。 ↑ 注:通常のCARTツリーの場合、ツリーは最小二乗損失を使用して適合されるため、係数はb j m {\displaystyle b_{jm}} その地域にとってR j m {\displaystyle R_{jm}} は、出力変数の値に等しく、すべてのトレーニングインスタンスで平均化されます。R j m {\displaystyle R_{jm}} 。 ↑ これは、トレーニングセットと同じサイズのサンプルを使用するため、復元抽出を行うバギングとは異なることに注意してください。 ↑ Arrabi, Nooshin; Torabi, Mohhamadreza; Fassihi, Afshin; Ghasemi, Fahimeh. "ツリーベース学習モデリングと分子ドッキングシミュレーションによる潜在的な血管内皮増殖因子受容体阻害剤の同定". Chemometrics . 1 (1): 1. doi : 10.1002/cem.3545 . 1 2 Ridgeway, Greg (2007). Generalized Boosted Models: A guide to the gbm package. ↑ より良い予測のための勾配ブースティングアルゴリズムを学ぶ(R言語のコード付き) ↑ 陳天奇著『ブーステッドツリー入門』 ↑ Arrabi, Nooshin; Torabi, Mohhamadreza; Fassihi, Afshin; Ghasemi, Fahimeh. "ツリーベース学習モデリングと分子ドッキングシミュレーションによる潜在的な血管内皮増殖因子受容体阻害剤の同定". Chemometrics . 1 (1): 1. doi : 10.1002/cem.3545 . ↑ Cossock, David および Zhang, Tong (2008). Statistical Analysis of Bayes Optimal Subset Ranking ( Wayback Machine に 2010-08-07 に アーカイブ)、14 ページ。 ↑ Yandexの企業ブログ記事、新しいランキングモデル「Snezhinsk」について( 2012年3月1日にWayback Machine に アーカイブ済み、ロシア語) ↑ Lalchand, Vidhi (2020). "ブーストされた決定木からより多くの情報を抽出する:高エネルギー物理学のケーススタディ". arXiv : 2001.06033 [ stat.ML ]. ↑ マー、ロンフェイ。シャオ、ハンミン。タオ、ジンウェイ。鄭、泰儀。張海琴(2022年1月1日)。 「勾配ブースティング決定木アルゴリズムを使用した、タイトな砂岩貯留層における貯留層品質評価のためのインテリジェントなアプローチ」 。 地球科学を開きます 。 14 (1): 629–645 。 Bibcode : 2022OGeo...14..354M 。 土井 : 10.1515/geo-2022-0354 。 ISSN 2391-5447 。 ↑ Friedman, Jerome (2003). "多重加法回帰木とその疫学への応用". Statistics in Medicine . 22 (9): 1365– 1381. doi : 10.1002/sim.1501 . PMID 12704603 . S2CID 41965832 . ↑ Elith, Jane (2008). "ブースト回帰ツリーの実践ガイド" . Journal of Animal Ecology . 77 (4): 802– 813. Bibcode : 2008JAnEc..77..802E . doi : 10.1111/j.1365-2656.2008.01390.x . PMID 18397250 . ↑ Elith, Jane. "Boosted Regression Trees for ecological modeling" (PDF) . CRAN . 2020年7月25日に オリジナル (PDF)からアーカイブ済み。 2018年 8月31日 に取得 。 ↑ 「独占インタビュー:サルフォード・システムズ社長、データマイニングのパイオニア、ダン・スタインバーグ氏 」 。KDnuggets 。 1 2 3 Piryonesi, S. Madeh; El-Diraby, Tamer E. (2020-03-01). "資産管理におけるデータ分析: 舗装状態指数の費用対効果の高い予測" . Journal of Infrastructure Systems . 26 (1): 04019036. doi : 10.1061/(ASCE)IS.1943-555X.0000512 . ISSN 1943-555X . S2CID 213782055 . ↑ Wu, Xindong; Kumar, Vipin; Ross Quinlan, J.; Ghosh, Joydeep; Yang, Qiang; Motoda, Hiroshi; McLachlan, Geoffrey J.; Ng, Angus; Liu, Bing; Yu, Philip S.; Zhou, Zhi-Hua (2008-01-01). "データマイニングにおけるトップ10アルゴリズム". Knowledge and Information Systems . 14 (1): 1– 37. doi : 10.1007/s10115-007-0114-2 . hdl : 10983/15329 . ISSN 0219-3116 . S2CID 2367747 . ↑ Sagi, Omer; Rokach, Lior (2021). "解釈可能な決定木による XGBoost の近似". Information Sciences . 572 (2021): 522– 542. doi : 10.1016/j.ins.2021.05.055 .
さらに読む ベームケ、ブラッドリー; グリーンウェル、ブランドン(2019)。「勾配ブースティング」。『Rによる実践的機械学習』 。チャップマン&ホール。pp. 221–245。ISBN 978-1-138-49568-5 。
外部リンク 勾配ブースティングを説明する方法 勾配ブースティング回帰木 ライトGBM