
統計学において、多項式回帰は、独立変数xと従属変数yの関係をxに関する多項式としてモデル化する回帰分析の一種です。多項式回帰は、 xの値とそれに対応するyの条件付き平均(E( y | x )の間の非線形関係に適合します。多項式回帰はデータに非線形モデルを適合させますが、統計的推定問題としては線形です。つまり、回帰関数 E( y | x ) は、データから推定される未知のパラメータに関して線形です。したがって、多項式回帰は重回帰分析の特殊なケースです。
「ベースライン」変数の多項式展開から得られる説明変数(独立変数)は、高次項として知られています。このような変数は分類設定でも使用されます。[ 1 ]
多項式回帰モデルは通常、最小二乗法を用いて適合されます。最小二乗法は、ガウス・マルコフの定理の条件下で、係数の不偏推定量の分散を最小化します。最小二乗法は、1805年にルジャンドル、1809年にガウスによって発表されました。多項式回帰のための最初の実験計画は、 1815年のゲルゴンヌの論文に登場しました。[ 2 ] [ 3 ] 20世紀には、多項式回帰は回帰分析の発展において重要な役割を果たし、計画と推論の問題に重点が置かれました。[ 4 ] 最近では、多項式モデルの使用は他の方法によって補完され、非多項式モデルは一部の問題クラスで利点があります。
回帰分析の目的は、従属変数yの期待値を独立変数 (または独立変数のベクトル) xの値でモデル化することです。単純線形回帰では、モデルは
ここで、εはスカラー変数xに条件付けられた平均ゼロの観測不能なランダム誤差です。このモデルでは、 xの値が1単位増加するごとに、yの条件付き期待値はβ1単位増加します。
多くの状況において、このような線形関係は成り立たない可能性があります。例えば、化学合成の収率を合成が行われる温度でモデル化する場合、温度が1単位上昇するごとに収率が向上する量が異なる場合があるかもしれません。あるいは、収率が温度の上昇とともに減少する(ただし、ある一定の温度範囲に限る)場合と、別の温度範囲で温度の上昇とともに増加する場合があるかもしれません。この場合、次のような二次モデルを提案することができます。
このモデルでは、温度がx 単位からx + 1 単位に上昇すると 、期待収量は次のように変化します。(これは回帰式のxに関する導関数を求めることで確認できます。)xの微小変化に対するyへの影響は、xに関する全導関数によって与えられます。収量の変化がxに依存するという事実が、推定対象となるパラメータに関してモデルが線形であるにもかかわらず、xとyの関係を非線形にする原因となっている。
一般的に、 yの期待値はn次多項式としてモデル化でき、一般的な多項式回帰モデルが得られます。
都合の良いことに、これらのモデルはすべて推定の観点からは線形です。なぜなら、回帰関数は未知のパラメータβ 0、β 1、 ...に関して線形だからです。 したがって、最小二乗分析の場合、多項式回帰の計算および推論上の問題は、重回帰の手法を用いて完全に解決できます。これは、 x、x 2、... を重回帰モデルにおける別々の独立変数として扱うことによって行われます。
多項式回帰モデル
設計行列を用いて行列形式で表現できる応答ベクトルパラメータベクトル、そしてベクトルランダムエラーのi行目そしてには、 i番目のデータサンプルのx値とy値が含まれます。すると、モデルは線形方程式系として記述できます。
純粋な行列表記を用いると、次のように書かれる。
推定された多項式回帰係数のベクトル(最小二乗推定法を使用)は
行列が可逆であるために必要なm < nを仮定すると、はヴァンデルモンド行列であり、すべての値はそれぞれ異なります。これが唯一の最小二乗解です。言い換えれば、距離の最小値を実現します。サンプル間でそして、対応する多項式の値、つまり、最小限の
上記の行列方程式は、多項式回帰の挙動をよく説明しています。しかし、xy点ペアのセットに対して多項式回帰を物理的に実装するには、より詳細な説明が役立ちます。以下の多項式係数の行列方程式は、導出なしで回帰理論から展開されており、簡単に実装できます。[ 5 ] [ 6 ] [ 7 ]
上記の連立一次方程式を解いた後、回帰多項式は次のように構築できます。
多項式回帰は厳密には重回帰分析の特殊なケースですが、適合させた多項式回帰モデルの解釈には、やや異なる視点が必要です。多項式回帰モデルでは、基となる単項式同士の相関が高い場合があるため、個々の係数を解釈するのはしばしば困難です。例えば、 x が区間 (0, 1) で一様分布している場合、 xとx 2 の相関は約 0.97 になります。直交多項式を用いることで相関を低減することはできますが、一般的には適合させた回帰関数全体を考慮した方がより有益です。そして、点ごとの信頼区間や同時信頼区間を用いることで、回帰関数の推定値の不確実性を把握することができます。
多項式回帰は、基底関数を使用して2つの量の間の関数関係をモデル化する回帰分析の一例です。より具体的には、多項式基底を用いた線形回帰において例えば多項式基底の欠点は、基底関数が「非局所的」であること、つまり、特定の値x = x 0におけるyの適合値が、 x がx 0から遠く離れているデータ値に強く依存することです。[ 8 ]現代の統計学では、多項式基底関数は、スプライン、放射基底関数、ウェーブレットなどの新しい基底関数とともに使用されます。これらの基底関数のファミリーは、多くの種類のデータに対してより簡潔な適合を提供します。
多項式回帰の目的は、独立変数と従属変数の間の非線形関係(厳密には、独立変数と従属変数の条件付き平均の間の関係)をモデル化することです。これは、非線形回帰関係を捉えることを目的とするノンパラメトリック回帰の目的と似ています。したがって、平滑化などのノンパラメトリック回帰アプローチは、多項式回帰の有用な代替手段となり得ます。これらの方法の中には、古典的な多項式回帰の局所化された形式を利用するものがあります。[ 9 ] 従来の多項式回帰の利点は、多重回帰の推論フレームワークを使用できることです(これは、スプラインなどの他の基底関数ファミリーを使用する場合にも当てはまります)。
最後の選択肢は、多項式カーネルを用いたサポートベクター回帰などのカーネル化モデルを使用することです。