セグメント回帰は、区分回帰または折れ線回帰とも呼ばれ、独立変数を区間に分割し、各区間に個別の線分を当てはめる回帰分析の手法です。セグメント回帰分析は、さまざまな独立変数を分割することで、多変量データに対して実行することもできます。セグメント回帰は、異なるグループにクラスター化された独立変数が、これらの領域内の変数間で異なる関係を示す場合に役立ちます。セグメント間の境界は、ブレークポイントです。
セグメント化線形回帰は、区間内の関係が線形回帰によって得られるセグメント化された回帰です。
セグメント線形回帰、2つのセグメント



ブレークポイントで区切られた2つのセグメントを持つセグメント線形回帰は、変化する影響因子( x )の応答関数(Yr)の急激な変化を定量化するのに役立ちます。ブレークポイントは、それを超えるか下回ると(望ましくない)効果が発生する臨界値、安全値、または閾値として解釈できます。ブレークポイントは意思決定において重要になることがあります[1]
図は、得られる結果と回帰タイプの一部を示しています。
セグメント回帰分析は、( y、x ) データセットの存在に基づいています。ここで、yは従属変数であり、x は独立変数です。
各セグメントに個別に適用される最小二乗法では、従属変数の観測値 ( y ) と計算値 (Yr)の差の二乗和(SSD)を最小化しながら、2 つの回帰直線がデータ セットに可能な限り適合するように作成され、次の 2 つの式が得られます。
- Yr = A 1 . x + K 1 ( x < BP (ブレークポイント))
- Yr = A 2 . x + K 2 ( x > BP の場合)(ブレークポイント)
どこ:
- Yr は、 xの特定の値に対するyの期待値(予測値)です。
- A 1と A 2 は回帰係数(線分の傾きを示す)です。
- K 1と K 2 は回帰定数( y軸の切片を示す)です。
データには多くの種類や傾向が見られる可能性があります。 [2]図を参照してください。
この方法では、次の 2 つの相関係数(R) も得られます。
- x < BP (ブレークポイント)
そして
- x > BP (ブレークポイント)
どこ:
- セグメントあたりの最小SSD
そして
- Y a1とY a2 は、それぞれのセグメントにおけるyの平均値です。
最も適切な傾向を決定するには、その傾向が信頼できる(有意である)ことを確認するために 統計テストを実行する必要があります。
重要なブレークポイントを検出できない場合は、ブレークポイントなしの回帰にフォールバックする必要があります。
例

右の青い図はマスタードの収穫量(Yr = Ym、t/ha)と土壌塩分濃度(x = Ss、土壌溶液ECの電気伝導率dS/mで表す)の関係を示しており、次のことがわかります。[3]
BP = 4.93、A 1 = 0、K 1 = 1.74、A 2 = −0.129、K 2 = 2.38、R 1 2 = 0.0035(有意でない)、R 2 2 = 0.395(有意)、および:
- Ym = 1.74 t/ha、Ss < 4.93(ブレークポイント)
- Ym = −0.129 Ss + 2.38 t/ha(Ss > 4.93の場合)(ブレークポイント)
土壌塩分濃度が 4.93 dS/m 未満であれば安全であり、土壌塩分濃度が 4.93 dS/m を超えると、土壌塩分濃度の単位増加あたり 0.129 t/ha の収穫量が減少することを示しています。
この図には、以下に詳述する信頼区間と不確実性も示されています。
テスト手順


トレンドの種類を判断するために、 次の統計テストが使用されます。
- ブレークポイント(BP)の有意性は、BPを 回帰係数A 1およびA 2 、 yデータの平均Y 1およびY 2 、 xデータの平均X 1およびX 2 (BPの左側と右側)の関数として表し、加算と乗算の誤差の伝播の法則を使用してBPの標準誤差(SE)を計算し、スチューデントのt検定を適用することによって算出されます。
- スチューデントのt分布を適用したA 1とA 2の有意性とA 1とA 2の標準誤差SE
- 差の SE を使用してスチューデントの t 分布を適用し、 A 1と A 2の差の重要性を計算します。
- 差の標準誤差を使用してスチューデントのt分布を適用するY 1とY 2の差の有意性。
- ブレークポイントの存在をテストするためのより正式な統計的アプローチは、セグメント化された線の推定を必要としない疑似スコアテストによるものである。[4]
さらに、全データの相関係数(Ra)、決定係数または説明係数、回帰関数の信頼区間、および分散分析が使用されます。[5]
有意性検定によって設定された条件下で最大化されるすべてのデータの決定係数 (Cd) は、次のように求められます。
ここで、Yr は前述の回帰方程式に従って期待される (予測される) yの値であり、Ya はすべてのy値の平均です。
Cd 係数の範囲は、0 (まったく説明なし) から 1 (完全な説明、完全一致) までです。
純粋でセグメント化されていない線形回帰では、Cd と Ra 2の値は等しくなります。セグメント化された回帰では、セグメント化を正当化するために
、Cd が Ra 2よりも大幅に大きくなければなりません。
ブレークポイントの最適値は、 Cd係数が最大になるように見つけることができます。
効果なしの範囲

セグメント回帰は、説明変数 (X) が従属変数 (Y) に影響を与えない範囲を検出するためによく使用されますが、その範囲を超えると、正または負の明確な応答があります。効果がない範囲は、X ドメインの最初の部分で見つかる場合もあれば、逆に最後の部分で見つかる場合もあります。「効果なし」分析の場合、セグメント回帰分析に最小二乗法を適用することは、最適な手法ではない可能性があります。これは、YX 関係が 0 の傾きを持つと考えられる最長の範囲を見つけることが目的であり、範囲を超えると傾きが 0 と大幅に異なるものの、この傾きの最適な値に関する知識は重要ではないためです。効果がない範囲を見つける方法は、範囲全体で漸進的偏回帰[7]を行い、回帰係数が 0 と大幅に異なるまで範囲を少しずつ拡張します。
次の図では、ブレーク ポイントは X=7.9 にありますが、同じデータ (マスタード収量については上記の青い図を参照) の場合、最小二乗法では X=4.9 でのみブレーク ポイントが生成されます。後者の値は低くなりますが、ブレーク ポイントを超えるデータの適合性は向上します。したがって、どの方法を採用する必要があるかは、分析の目的によって異なります。
参照
- チャウテスト
- 単純回帰
- 線形回帰
- 通常の最小二乗法
- 多変量適応回帰スプライン
- ローカル回帰
- 回帰不連続設計
- ステップワイズ回帰
- セグメント回帰のためのSegReg(ソフトウェア)
参考文献
- ^ 頻度分析と回帰分析。第6章:HPRitzema(編、1994年)「排水原理と応用」、Publ. 16、pp. 175-224、国際土地再生・改善研究所(ILRI)、ワーゲニンゲン、オランダ。ISBN 90-70754-33-9 。ウェブページ[1]の20番から無料でダウンロードできます。またはPDFとして直接ダウンロードすることもできます : [2]
- ^ 農家の畑の排水研究:データ分析。オランダ、ワーゲニンゲンの国際土地改良研究所(ILRI)のプロジェクト「液体の金」の一部。PDFとしてダウンロード:[3]
- ^ RJOosterbaan、DPSharma、KNSingh、KVGKRao、1990、「作物生産と土壌塩分:セグメント線形回帰によるインドの現場データの評価」。乾燥地域および半乾燥地域の塩分制御のための土地排水に関するシンポジウム議事録、1990 年 2 月 25 日から 3 月 2 日、エジプト、カイロ、第 3 巻、セッション V、p. 373 - 383。
- ^ Muggeo, VMR (2016). 「代替案の下でのみ 存在する迷惑パラメータによるテスト: セグメント化モデリングへの応用を伴うスコアベースのアプローチ」(PDF)。Journal of Statistical Computation and Simulation。86 (15): 3059–3067. doi :10.1080/00949655.2016.1149855. S2CID 124914264。
- ^ 分散分析とF検定を用いたブレークポイント付きセグメント線形回帰の統計的有意性。[4]の13番からダウンロードするか、直接PDFとしてダウンロードしてください:[5]
- ^ セグメント回帰分析、国際土地改良研究所(ILRI)、ワーゲニンゲン、オランダ。ウェブページから無料でダウンロードできます[6]
- ^ 部分回帰分析、国際土地改良研究所(ILRI)、ワーゲニンゲン、オランダ。ウェブページから無料でダウンロードできます[7]
