統計学と機械学習において、線型予測関数は、係数と説明変数(独立変数)のセットの線型関数(線型結合)であり、その値は従属変数の結果を予測するために使用されます。[1] この種の関数は通常、線型回帰で使用され、係数は回帰係数と呼ばれます。ただし、さまざまな種類の線型分類器(ロジスティック回帰、[2]パーセプトロン、[3]サポートベクターマシン、[4]および線型判別分析[5]など)や、主成分分析[6]や因子分析などのさまざまなモデルでも使用されます。これらのモデルの多くでは、係数は「重み」と呼ばれます。
意味
データポイントi(p個の説明変数からなる)に対する線形予測関数の基本形は、 i = 1, ..., nの場合、次のようになる。
ここで、k = 1, ..., pの場合、はデータポイントiのk番目の説明変数の値であり、は特定の説明変数が結果に与える相対的な影響を示す係数(回帰係数、重みなど)です。
表記
予測関数は、次のようによりコンパクトな形式で記述するのが一般的です。
- 係数β 0、β 1、...、β p は、サイズp + 1の単一のベクトルβにグループ化されます 。
- 各データポイントiに対して、切片係数β 0に対応する固定値 1 を持つ追加の説明疑似変数x i 0が追加されます。
- 結果として得られる説明変数x i0 (= 1)、x i 1、...、x ipは、サイズp + 1の単一のベクトルx iにグループ化されます 。
ベクトル表記
これにより、線形予測関数を次のように記述できるようになります。
2 つのベクトル間のドット積の表記法を使用します。
行列表記
行列表記を使用した同等の形式は次のとおりです。
ここで、 およびは(p+1)行 1列のベクトルであると想定され、は の転置行列です(したがって は1 行(p+1)行ベクトルです)。は、 1 行(p+1)列ベクトルと(p+1)行 1 列ベクトル間の行列乗算を示し、スカラーとなる 1 行 1 列の行列を生成します。
線形回帰
線形予測関数の使用例としては、線形回帰が挙げられます。線形回帰では、各データポイントは連続的な結果y iに関連付けられ、関係は次のように表されます。
ここで、 は外乱項または誤差変数であり、従属変数と予測関数の間の線形関係にノイズを追加する 観測されないランダム変数です。
スタッキング
いくつかのモデル(特に標準線形回帰)では、各データポイントi = 1, ..., nの式が積み重ねられ、ベクトル形式で次のように記述されます。
どこ
行列X は設計行列として知られ、独立変数に関するすべての既知の情報をエンコードします。変数はランダム変数であり、標準線形回帰では標準正規分布に従って分布し、結果に対する未知の要因の影響を表します。
これにより、単純な行列演算を使用した最小二乗法を通じて最適な係数を見つけることが可能になります。特に、最小二乗法によって推定される最適な係数は次のように記述できます。
この行列は、Xのムーア・ペンローズ擬似逆行列として知られています。この式で逆行列を使用するには、 X がフルランクであること、つまり、異なる説明変数間に完全な多重共線性がない(つまり、説明変数を他の説明変数から完全に予測できない)ことが必要です。このような場合、特異値分解を使用して擬似逆行列を計算できます。
説明変数の前処理
非線形関数の固定セットを使用してデータ ポイントの値を変換する場合、これらの関数は基底関数と呼ばれます。一例は多項式回帰です。多項式回帰では、線形予測関数を使用して、既存の説明変数のさまざまな累乗に対応する複数の説明変数を追加することにより、2 セットのデータ ポイント (つまり、1 つの実数値の説明変数と関連する実数値の従属変数) 間の任意の次数の多項式関係 (指定された次数まで) を適合させます。数学的には、形式は次のようになります。
この場合、各データポイントiに対して、説明変数のセットが次のように作成されます。
そして標準線形回帰が実行される。この例の基底関数は次のようになる。
この例は、線形予測関数が実際には一見よりもはるかに強力であることを示しています。実際に必要なのは係数に対して線形であることだけです。説明変数のあらゆる種類の非線形関数をモデルに適合させることができます。
基底関数への入力が単変量または 1 次元である必要は特にありません (出力も同様ですが、その場合、K次元の出力値はK 個の個別のスカラー出力基底関数として扱われる可能性があります)。この例として、ラジアル基底関数(RBF) が挙げられます。これは、ある固定点までの距離の変換バージョンを計算します。
一例として、正規分布と同じ関数形式を持つガウスRBFがあります。
cからの距離が増加するにつれて急速に減少します。
RBF の可能な使用法の 1 つは、観測されたデータ ポイントごとに 1 つ作成することです。つまり、新しいデータ ポイントに適用された RBF の結果は、新しいポイントが RBF が適用されたポイントの近くにない限り、0 に近くなります。つまり、ラジアル ベース関数の適用により最も近いポイントが選択され、その回帰係数が支配的になります。結果は、最近接近傍補間の一種となり、最も近い観測データ ポイントの予測値を使用して予測が行われ、すべての距離が同様の場合は複数の近隣データ ポイント間で補間が行われる可能性があります。このタイプの予測のための最近接近傍法は、標準的な線形回帰で使用される予測のタイプとは正反対であると見なされることがよくあります。しかし実際には、線形予測関数の説明変数に適用できる変換は非常に強力であるため、最近接近傍法でさえ、線形回帰の一種として実装できます。
係数を線形に見える新しい係数に変換することで、係数が非線形に見える関数を当てはめることも可能です。たとえば、係数の形式の関数は、線形になる置換を適用することで適切な線形関数に変換できます。線形回帰や同様の手法を適用して、最適な係数を見つけることもできますが、誤差の推定値などは間違っています。
説明変数は、実数値、バイナリ、カテゴリなど、任意のタイプにすることができます。主な違いは、連続変数(収入、年齢、血圧など)と離散変数(性別、人種、政党など)です。2つ以上の選択肢を示す離散変数は、通常、ダミー変数(または指標変数)を使用してコード化されます。つまり、離散変数の可能な値ごとに、値 0 または 1 を取る個別の説明変数が作成されます。1 は「変数には指定された値がある」ことを意味し、0 は「変数には指定された値がない」ことを意味します。たとえば、血液型の 4 元離散変数(可能な値は「A、B、AB、O」) は、個別の 2 元ダミー変数 (「is-A、is-B、is-AB、is-O」) に変換されます。この場合、ダミー変数の 1 つだけが値 1 を持ち、残りはすべて値 0 を持ちます。これにより、離散変数の可能な値ごとに個別の回帰係数を一致させることができます。
Kカテゴリの場合、すべてのK個のダミー変数が互いに独立しているわけではないことに注意してください。たとえば、上記の血液型の例では、4 つのダミー変数のうち 3 つだけが独立しており、3 つの変数の値がわかれば、4 つ目の変数は自動的に決定されます。したがって、4 つの可能性のうち 3 つをダミー変数としてエンコードするだけで十分であり、実際、4 つの可能性すべてをエンコードすると、モデル全体が識別不能になります。これは、線形回帰で使用される単純な閉形式のソリューションなど、いくつかの方法で問題を引き起こします。解決策は、ダミー変数の 1 つを削除してこのようなケースを回避するか、正則化制約を導入することです (これにより、最適な係数を見つけるためのより強力な、通常は反復的な方法が必要になります)。[7]
参照
参考文献
- ^ Makhoul, J. (1975). 「線形予測: チュートリアルレビュー」. Proceedings of the IEEE . 63 (4): 561– 580. Bibcode :1975IEEEP..63..561M. doi :10.1109/PROC.1975.9792. ISSN 0018-9219.
- ^ David A. Freedman (2009).統計モデル: 理論と実践.ケンブリッジ大学出版局. p. 26. ISBN 9780521743853単回帰方程式では
、右側に切片と傾き係数を持つ説明変数があります。重回帰方程式では、右側に2つ以上の説明変数があり、それぞれに傾き係数があります。
- ^ ローゼンブラット、フランク (1957)、「パーセプトロン - 知覚と認識を行うオートマトン」、レポート 85-460-1、コーネル航空研究所。
- ^ Cortes, Corinna ; Vapnik, Vladimir N. (1995). 「サポートベクターネットワーク」(PDF) .機械学習. 20 (3): 273– 297. CiteSeerX 10.1.1.15.9362 . doi :10.1007/BF00994018.
- ^ McLachlan, GJ (2004).判別分析と統計パターン認識. Wiley Interscience. ISBN 978-0-471-69115-0. MR 1190469。
- ^ Jolliffe IT主成分分析、シリーズ: Springer Series in Statistics、第 2版、Springer、NY、2002、XXIX、487 ページ、28 図。ISBN 978-0-387-95442-4
- ^ ハスティー、トレバー、ティブシラニ、ロバート、フリードマン、ジェローム H. (2009)。統計学習の要素: データマイニング、推論、予測。シュプリンガー。ISBN 978-0-387-84884-6。
