区分回帰(区分的回帰または折れ線回帰とも呼ばれる)は、独立変数を区間に分割し、各区間に個別の線分を当てはめる回帰分析の手法です。区分回帰分析は、さまざまな独立変数を分割することで、多変量データに対しても実行できます。区分回帰は、異なるグループにクラスター化された独立変数が、これらの領域内の変数間で異なる関係を示す場合に有効です。セグメント間の境界はブレークポイントです。
区分線形回帰とは、区間内の関係が線形回帰によって得られる区分回帰のことです。
区分線形回帰、2つのセグメント
第1脚水平
1つ目の枝は上向きに傾斜している
1本目の枝が下向きに傾斜しているブレークポイントで区切られた 2 つのセグメントを持つセグメント線形回帰は、変動する影響因子 ( x ) の応答関数 (Yr) の急激な変化を定量化するのに役立ちます。ブレークポイントは、望ましい効果または望ましくない効果が発生する臨界値、安全値、または閾値として解釈できます。ブレークポイントは意思決定において重要となる場合があります[ 1 ]
これらの図は、得られる結果と回帰分析の種類の一部を示しています。
セグメント回帰分析は、( y, x ) データセットの存在に基づいています。ここで、yは従属変数、x は独立変数です。
各セグメントに個別に最小二乗法を適用すると、従属変数の観測値(y )と計算値(Yr)の差の二乗和(SSD)を最小化しながら、2つの回帰直線がデータセットにできるだけ近づくように調整され、次の2つの式が得られます。
- Yr = A 1 . x + K 1 ( x < BP (ブレークポイント)の場合)
- Yr = A 2 . x + K 2 ( x > BP (ブレークポイント))
どこ:
- Yr は、特定のxの値に対するyの期待値 (予測値) です。
- A1とA2は回帰係数(線分の傾きを示す)です。
- K 1とK 2は回帰定数( y軸における切片を示す)です。
データには多くの種類や傾向が見られる可能性があります。[ 2 ]図を参照してください。
この方法では、2つの相関係数(R)も得られます。
x < BP (ブレークポイント)の場合
そして
x > BP (ブレークポイント)の場合
どこ:
セグメントあたりの最小SSD
そして
- Y a1とY a2は、それぞれの区間におけるyの平均値である。
最も適切な傾向を決定する際には、その傾向が信頼できる(有意である)ことを確認するために、統計的検定を実施する必要があります。
有意なブレークポイントが検出されない場合は、ブレークポイントを考慮しない回帰分析に頼らざるを得ない。
例
区分線形回帰、タイプ3b右側の青い図は、マスタードの収量(Yr = Ym、t/ha)と土壌塩分濃度(x = Ss、土壌溶液の電気伝導率EC、dS/mで表される)の関係を示しており、次のことがわかります。[ 3 ]
BP = 4.93、A 1 = 0、K 1 = 1.74、A 2 = − 0.129、K 2 = 2.38、R 1 2 = 0.0035 (有意差なし)、R 2 2 = 0.395 (有意差あり) および:
- Ss < 4.93 (ブレークポイント) の場合、Ym = 1.74 t/ha
- Ym = − 0.129 Ss + 2.38 t/ha (Ss > 4.93 (ブレークポイント))
これは、土壌塩分濃度が4.93 dS/m未満であれば安全であり、4.93 dS/mを超えると、土壌塩分濃度が1単位増加するごとに収量が0.129 t/ha減少することを示している。
図には、以下に詳述するように、信頼区間と不確実性も示されています。
試験手順
時系列データの例、タイプ5
ANOVA表の例:この場合、ブレークポイントの導入は非常に有意である。傾向の種類を判断するために、以下の統計的検定が使用されます。
- ブレークポイント(BP)の有意性を評価するため、BPを 回帰係数A1とA2 、yデータの平均Y1とY2 、およびxデータの平均X1とX2 (BPの左右)の関数として表し、加算と乗算における誤差伝播の法則を用いてBPの標準誤差(SE)を計算し、スチューデントのt検定を適用した。
- A1とA2の有意性(スチューデントのt分布を適用)およびA1とA2の標準誤差SE
- A1とA2の差の有意性を、その差の標準誤差を用いてスチューデントのt分布を適用して評価する。
- Y1とY2の差の有意性を、その差の標準誤差を用いてスチューデントのt分布を適用して評価する。
- ブレークポイントの存在を検定するためのより正式な統計的手法は、セグメント化された線の推定を必要としない擬似スコア検定によるものである。[ 4 ]
さらに、全データの相関係数(Ra)、決定係数または説明係数、回帰関数の信頼区間、およびANOVA分析が使用される。[ 5 ]
有意性検定によって設定された条件下で最大化されるべき、全データに対する決定係数(Cd)は、次式から求められます。

ここで、Yrは前述の回帰方程式に基づくyの期待値(予測値)であり、Yaはすべてのy値の平均である。
Cd係数は0(全く説明なし)から1(完全な説明、完全一致)までの範囲をとります。純粋な非区分線形回帰では、CdとRa 2 の値は等しくなります。区分回帰では、区分を正当化するために、CdはRa 2よりも有意に大きくなければなりません。
ブレークポイントの最適値は、 Cd係数が最大となるように見つけることができる。
効果なしの範囲
X=0からX=7.85までの範囲では影響がないことを示す図。区分回帰は、説明変数 (X) が従属変数 (Y) に影響を与えない範囲を検出するためによく使用されます。この範囲を超えると、正または負の明確な応答があります。影響のない範囲は、X ドメインの最初の部分にある場合もあれば、逆に最後の部分にある場合もあります。「影響なし」分析の場合、区分回帰分析の最小二乗法[ 6 ]を適用することは、最も適切な手法ではない可能性があります。なぜなら、目的は、YX 関係がゼロの傾きを持つと考えられる最長の区間を見つけることであり、この範囲を超えると傾きがゼロと有意に異なるものの、この傾きの最適な値に関する知識は重要ではないからです。影響のない範囲を見つける方法は、範囲全体にわたる漸進的偏回帰[ 7 ]であり、回帰係数がゼロと有意に異なるまで、小さなステップで範囲を拡張します。
次の図では、変曲点はX=7.9で見出されますが、同じデータ(上の青い図のマスタード収量を参照)に対して、最小二乗法では変曲点はX=4.9でしか得られません。後者の値は低いものの、変曲点以降のデータへの適合度はより良好です。したがって、どちらの方法を用いるべきかは、分析の目的に応じて判断する必要があります。
ソフトウェア実装
- Pythonには、 piecewise-regressionパッケージがあります。
- R言語には、 segmentedパッケージがあります。
参考文献
- ↑頻度分析と回帰分析。HPRitzema (編、1994)『排水の原理と応用』第6章、出版物16、175-224ページ、国際土地改良研究所(ILRI)、オランダ、ワーヘニンゲン。ISBN 90-70754-33-9ウェブページから無料でダウンロードできます。20番の下、またはPDFとして直接 :
- ↑農地の排水調査:データ分析。オランダ、ワーヘニンゲンにある国際土地改良研究所(ILRI)のプロジェクト「リキッドゴールド」の一部。PDFとしてダウンロード :
- ↑ RJOosterbaan、DPSharma、KNSingh、KVGKRao、1990、「作物生産と土壌塩分:区分線形回帰によるインドの現場データの評価」。『乾燥および半乾燥地域における塩分制御のための土地排水に関するシンポジウム議事録』、1990年2月25日~3月2日、エジプト、カイロ、第3巻、セッションV、373~383ページ。
- ↑ Muggeo, VMR (2016). "対立仮説の下でのみ存在する不要パラメータを用いた検定: セグメント化モデリングへの応用を伴うスコアベースのアプローチ" (PDF) . Journal of Statistical Computation and Simulation . 86 (15): 3059– 3067. doi : 10.1080/00949655.2016.1149855 . S2CID 124914264 .
- ↑分散分析とF検定を用いた、ブレークポイント付き区分線形回帰の統計的有意性。ダウンロードはこちら13番の下、またはPDFとして直接 :
- ↑区分回帰分析、国際土地改良研究所(ILRI)、オランダ、ワーヘニンゲン。ウェブページから無料でダウンロードできます。
- ↑偏回帰分析、国際土地改良研究所(ILRI)、オランダ、ワーヘニンゲン。ウェブページから無料でダウンロードできます。