最小絶対偏差( LAD ) は、最小絶対誤差( LAE )、最小絶対残差( LAR )、または最小絶対値( LAV ) とも呼ばれ、絶対偏差の合計(絶対残差の合計または絶対誤差の合計とも呼ばれる) またはそのような値のL 1ノルムを最小化することに基づく統計的最適性基準および統計的最適化手法です。最小二乗法に似ていますが、二乗値ではなく絶対値に基づいています。関数によって生成されたポイントと対応するデータ ポイント間の残差を最小化することにより、データ セットを厳密に近似する関数を見つけようとします。LAD 推定値は、誤差がラプラス分布に従う場合の最大尤度推定値としても使用されます。1757 年にRoger Joseph Boscovichによって導入されました。[1]
処方
データセットが点 ( x i , y i )で構成され、 i = 1, 2, ..., nであるとします。次のような関数fを見つけたいとします。
この目標を達成するために、関数fは、決定する必要のあるいくつかのパラメータを含む特定の形式であると仮定します。たとえば、最も単純な形式は線形で、f ( x ) = bx + cです。ここで、bとc は、値が不明であるが推定したいパラメータです。もっと単純に、f ( x ) が2 次式、つまりf ( x ) = ax 2 + bx + cであると仮定します。ここで、a、b、c はまだ不明です。(より一般的には、説明子x は1 つだけではなく、複数の説明子があり、それらはすべて関数fの引数として現れます。)
ここで、残差の絶対値の合計を最小化する未知のパラメータの推定値を求めます。
解決
最小絶対偏差回帰の考え方は最小二乗回帰と同じくらい簡単ですが、最小絶対偏差線を効率的に計算するのはそれほど簡単ではありません。最小二乗回帰とは異なり、最小絶対偏差回帰には解析的な解決方法がありません。したがって、反復的なアプローチが必要です。以下は、いくつかの最小絶対偏差の解決方法の一覧です。
- シンプレックスベースの方法(バロデール・ロバーツアルゴリズム[2]など)
- 問題は線形計画法なので、多くの線形計画法の手法(単体法やその他の手法を含む)を適用できます。
- 反復再重み付け最小二乗法[3]
- ウェソロフスキーの直接降下法[4]
- Li-Arceの最大尤度アプローチ[5]
- 再帰的次元削減アプローチ[6]
- ポイントツーポイントラインのすべての組み合わせをチェックして、エラーの合計が最小になるようにします。
単体法に基づく方法は、最小絶対偏差問題を解くための「推奨される」方法です。[7]単体法は、線形計画法の問題を解く方法です。最も人気のあるアルゴリズムは、Barrodale-Roberts 修正単体法です。IRLS、Wesolowsky 法、および Li 法のアルゴリズムは、他の方法とともに[7]の付録 A に記載されています 。任意の 2 つの (x,y) データ ポイントを通過する線のすべての組み合わせを確認することは、最小絶対偏差線を見つけるもう 1 つの方法です。少なくとも 1 つの最小絶対偏差線が少なくとも 2 つのデータ ポイントを通過することがわかっているため、この方法では、各線の SAE (データ ポイント上の最小絶対誤差) を比較して線を見つけ、SAE が最小の線を選択します。さらに、複数の線が同じ最小 SAE を持つ場合、線は複数の解の領域を概説します。この最後の方法は単純ですが、大規模なデータ セットには非効率的です。
線形計画法を用いた解法
この問題は、以下の問題仕様に基づいて任意の線形計画法を使用して解くことができます。
パラメータの値の選択に関して、y i は従属変数のi番目の観測値、x ij はj番目の独立変数のi番目の観測値( j = 1,..., k )である。この問題を人工変数u iで書き直すと、
- に関して、そして
- 対象となる
これらの制約は、最小化されるとそれぞれが等しくなるように強制する効果があり、目的関数は元の目的関数と等しくなります。この問題ステートメントのこのバージョンには絶対値演算子が含まれていないため、任意の線形計画パッケージで解決できる形式になっています。
プロパティ
最小絶対偏差線には、他にも固有の特性があります。( x , y )データのセットの場合、最小絶対偏差線は、複数の解がない限り、常に少なくとも2つのデータポイントを通過します。複数の解が存在する場合、有効な最小絶対偏差解の領域は、それぞれが少なくとも2つのデータポイントを通過する少なくとも2つの線で囲まれます。より一般的には、k個の 回帰変数(定数を含む)がある場合、少なくとも1つの最適な回帰面がk個のデータポイントを通過します。 [8] : p.936
このデータ ポイントへのラインの「ラッチ」は、「不安定性」特性を理解するのに役立ちます。ラインが常に少なくとも 2 つのポイントにラッチされる場合、データ ポイントが変更されると、ラインは異なるポイント セット間を移動します。また、「ラッチ」は「堅牢性」特性を理解するのにも役立ちます。外れ値が存在し、最小絶対偏差ラインが 2 つのデータ ポイントにラッチする必要がある場合、ほとんどの場合、その 2 つのポイントのいずれかでは絶対偏差の合計が最小化されないため、外れ値はその 2 つのポイントのいずれかではない可能性が高くなります。
複数の解が存在する既知のケースの 1 つは、下の図 A に示すように、水平線を中心に対称な点の集合です。

図 A に示されているケースで複数の解が存在する理由を理解するには、緑色の領域にあるピンクの線について考えてみましょう。その絶対誤差の合計は、ある値 S です。線を緑色の領域内に維持したまま、わずかに上向きに傾けた場合、誤差の合計は依然として S です。各点から線までの距離は線の片側で増加し、線の反対側の各点までの距離はまったく同じ量だけ減少するため、誤差の合計は変化しません。したがって、絶対誤差の合計は同じままです。また、線を無限に小さな増分で傾けることができるため、複数の解が存在する場合、解は無限に存在することも示しています。
利点と欠点
以下は最小絶対偏差法のいくつかの性質と最小二乗法(非特異問題の場合)の性質を対比した表である。[9] [10]
*データ ポイントの数が特徴の数以上である場合。
最小絶対偏差法は、最小二乗法に比べて堅牢であるため、多くの分野で応用されています。最小絶対偏差法は、データ内の外れ値に耐性があるという点で堅牢です。LAD は、残差を二乗することで大きな残差、つまり予測値が実際の観測値から大きく離れている外れ値に重みを与える通常の最小二乗法 (OLS) とは対照的に、すべての観測値を等しく重視します。これは、外れ値を他の観測値よりも重視する必要がない研究で役立つ場合があります。外れ値に大きな重みを与えることが重要である場合は、最小二乗法の方が適しています。
バリエーション、拡張、特殊化
残差の絶対値の合計において、絶対値関数を傾斜した絶対値関数に一般化すると、左の半直線上の傾きは、右の半直線上の傾きは となり、 となるため、分位回帰が得られます。 の場合は、最小絶対偏差による標準回帰となり、中央値回帰とも呼ばれます。
最小絶対偏差問題は、複数の説明子、制約、正則化を含むように拡張することができ、例えば、線形制約を持つ線形モデルが挙げられる。[11]
- 最小化する
- たとえば、
ここで、は推定される係数の列ベクトル、bは推定される切片、xiはさまざまな説明変数のi番目の観測値の列ベクトル、 y iは従属変数のi番目の観測値、kは既知の定数です。
LASSO(最小絶対収縮選択演算子)による正規化もLADと組み合わせることができる。 [12]
参照
参考文献
- ^ 「最小絶対偏差回帰」。統計の簡潔な百科事典。シュプリンガー。2008年。pp. 299–302。doi : 10.1007/ 978-0-387-32833-1_225。ISBN 9780387328331。
- ^ Barrodale, I.; Roberts, FDK (1973). 「離散 L 1線形近似の改良アルゴリズム」. SIAM Journal on Numerical Analysis . 10 (5): 839–848. Bibcode :1973SJNA...10..839B. doi :10.1137/0710069. hdl : 1828/11491 . JSTOR 2156318.
- ^ Schlossmacher, EJ (1973 年12月)。「絶対偏差曲線フィッティングの反復手法」。アメリカ統計学会誌。68 (344): 857–859。doi :10.2307/2284512。JSTOR 2284512。
- ^ Wesolowsky, GO (1981). 「最小絶対値回帰問題のための新しい降下アルゴリズム」. Communications in Statistics – Simulation and Computation . B10 (5): 479–491. doi :10.1080/03610918108812224.
- ^ Li, Yinbo; Arce, Gonzalo R. (2004). 「最小絶対偏差回帰に対する最大尤度アプローチ」EURASIP Journal on Applied Signal Processing . 2004 (12): 1762–1769. Bibcode :2004EJASP2004...61L. doi : 10.1155/S1110865704401139 .
- ^ クルジッチ、アナ・ソビッチ;セルシッチ、ダミール (2018)。 「次元の再帰的削減を使用した L1 最小化」。信号処理。151:119-129。Bibcode :2018SigPr.151..119S。土井:10.1016/j.sigpro.2018.05.002。
- ^ ab William A. Pfeil、 「統計的教育補助」、理学士論文、ウースター工科大学、2006年
- ^ Branham, RL, Jr.、「最小二乗法の代替法」、天文学ジャーナル87、1982年6月、928-937。[1] SAO / NASA天体物理学データシステム(ADS)
- ^ これらの違いを示すアプレットのセットについては、次のサイトを参照してください: http://www.math.wpi.edu/Course_Materials/SAS/lablets/7.3/73_choices.html
- ^ LAD と OLS の議論については、次の学術論文とレポートを参照してください: http://www.econ.uiuc.edu/~roger/research/rq/QRJEP.pdf および https://www.leeds.ac.uk/educol/documents/00003759.htm
- ^ Shi, Mingren; Mark A., Lukas (2002 年 3 月). 「縮退と線形制約による L1 推定アルゴリズム」.計算統計とデータ分析. 39 (1): 35–55. doi :10.1016/S0167-9473(01)00049-4.
- ^ Wang, Li; Gordon, Michael D.; Zhu , Ji (2006 年 12 月)。「正規化された最小絶対偏差回帰とパラメータ調整のための効率的なアルゴリズム」。第 6 回国際データマイニング会議の議事録。pp. 690–700。doi :10.1109/ICDM.2006.134。
さらに読む
- Peter Bloomfield 、William Steiger (1980)。「最小絶対偏差曲線フィッティング」。SIAM Journal on Scientific Computing。1 ( 2): 290–301。doi :10.1137 / 0901019。
- Subhash C. Narula および John F. Wellington ( 1982)。「絶対誤差の最小合計回帰: 最新の調査」。国際統計レビュー。50 (3): 317–326。doi :10.2307/1402501。JSTOR 1402501。
- Robert F. Phillips (2002年7 月)。「EM アルゴリズムによる最小絶対偏差推定」。統計とコンピューティング。12 (3): 281–285。doi : 10.1023 /A:1020759012226。
- Enno Siemsen & Kenneth A. Bollen (2007). 「構造方程式モデリングにおける最小絶対偏差推定」。社会学的方法と研究。36 (2): 227–265。doi : 10.1177 /0049124107301946。
