統計学において、変数誤差モデルまたは測定誤差モデルは、独立変数の測定誤差を考慮した回帰モデルです。対照的に、標準的な回帰モデルでは、回帰変数が正確に測定されている、または誤差なく観測されていると想定されます。そのため、これらのモデルは従属変数、つまり応答の誤差のみを考慮します。[引用が必要]

一部の回帰変数が誤差を伴って測定された場合、標準仮定に基づく推定は矛盾した推定につながり、非常に大きなサンプルであってもパラメータ推定が真の値に近づかないことを意味します。単純な線形回帰の場合、その影響は係数の過小評価であり、減衰バイアスとして知られています。非線形モデルでは、バイアスの方向はより複雑になる可能性があります。[1] [2] [3]
動機付けの例
次のような単純な線形回帰モデルを考える。
ここで、 は真の、しかし観測されていない回帰変数を表します。代わりに、この値は誤差を伴って観測されます。
ここで、測定誤差は真の値とは無関係であると仮定する。
実用的な応用としては、フックの法則の標準的な学校理科実験があり、バネに加えられた重量とバネの伸び量の関係を推定する。′s を ′s に単純に回帰する
と(単回帰直線を参照)、傾き係数の推定値は次のようになる。
これはサンプルサイズが無制限に増加すると収束します。
これは、 を使用して推定されたの「真の」効果とは対照的です。
分散は非負であるため、極限では推定値は より小さくなり、統計学者はこの効果を減衰または回帰希釈と呼んでいます。[4]したがって、「単純な」最小二乗推定量は の矛盾した推定量 です。しかし、 は、観測された が与えられた場合の の最良の線形予測子に必要なパラメータの矛盾のない推定量です。アプリケーションによっては、推定値と予測値の誤差の分散が同一であると仮定する「真の」回帰係数 の推定値ではなく、これが必要な場合があります。これは、直前に引用した結果と、単純な線形回帰で′s と実際に観測された ′s を関連付ける回帰係数が次のように与えられる という事実から直接導かれます。
ノイズの影響を受ける 観測値に基づいての予測子を構築するには、ではなくこの係数が必要になります。
ほぼすべての既存のデータセットには、性質や大きさの異なるエラーが含まれているため、減衰バイアスが非常に頻繁に発生すると言えます(ただし、多変量回帰ではバイアスの方向はあいまいです[5])。ジェリー・ハウスマンはこれを計量経済学の鉄則と見ています。「推定値の大きさは通常、予想よりも小さくなります。」[6]
仕様
通常、測定誤差モデルは潜在変数アプローチを使用して記述されます。 が応答変数であり、 が回帰変数の観測値である場合、モデルの「真の」関数関係に従う潜在変数とが存在すると仮定され、観測量はそれらのノイズの多い観測値になります。
ここで、はモデルのパラメータであり、はエラーがないと想定される回帰変数です (たとえば、線形回帰に切片が含まれる場合、定数に対応する回帰変数には「測定エラー」がまったくありません)。仕様に応じて、これらのエラーのない回帰変数は個別に扱われる場合と扱われない場合があります。後者の場合、 の分散行列の対応するエントリがゼロであると単純に想定されます。
変数、、はすべて観測されます。つまり、統計学者は、上記のデータ生成プロセスに従う統計単位のデータ セットを所有していることになります。ただし、潜在変数、、、は観測されません。
この仕様は、既存の変数エラー モデルをすべて網羅しているわけではありません。たとえば、一部の関数は非パラメトリックまたはセミパラメトリックです。他のアプローチでは、との関係を関数ではなく分布としてモデル化します。つまり、 の条件付きで が特定の (通常はパラメトリックな) 分布に従うと想定します。
用語と前提
- 観測された変数は、マニフェスト変数、インジケーター変数、またはプロキシ変数と呼ばれることもあります。
- 観測されない変数は潜在変数または真の変数と呼ばれることがあります。これは未知の定数(この場合、モデルは機能モデルと呼ばれます)またはランダム変数(対応する構造モデルと呼ばれます)としてみなすことができます。[7]
- 測定誤差と潜在変数の関係は、さまざまな方法でモデル化できます。
- 古典的なエラー:エラーは潜在変数に依存しません。これは最も一般的な仮定であり、エラーは測定デバイスによって導入され、その大きさは測定される値に依存しないことを意味します。
- 平均独立性:潜在回帰変数のあらゆる値に対して誤差の平均はゼロです。これは、測定誤差に異分散性やその他の影響が存在することを許容するため、 [8]従来の仮定よりも制限の少ない仮定です。
- バークソンの誤差:誤差は観測された回帰変数xとは無関係です。 [9]この仮定の適用範囲は非常に限られています。一例としては、丸め誤差が挙げられます。たとえば、ある人の年齢*が連続ランダム変数であるに対し、観測された年齢が次に小さい整数に切り捨てられる場合、切り捨て誤差は観測された年齢とほぼ無関係です。もう 1 つの可能性は、固定設計実験の場合です。たとえば、科学者が特定のあらかじめ決められた瞬間、たとえば に、実際の測定は の別の値で発生する可能性があり(たとえば、科学者の有限の反応時間のため)、そのような測定誤差は一般に回帰変数の「観測された」値とは無関係になります。
- 誤分類エラー:ダミー回帰変数に使用される特殊なケース。 が特定のイベントまたは状態 (人が男性/女性、何らかの医療処置が行われた/行われなかったなど) の指標である場合、そのような回帰変数の測定エラーは、統計テストのタイプ I およびタイプ II エラーと同様に、誤った分類に対応します。 この場合、エラーは3 つの値のみを取る可能性があり、 を条件とするその分布は、、および の2 つのパラメーターでモデル化されます。 識別に必要な条件は 、つまり誤分類が「頻繁に」発生しないことです。 (この考え方は、3 つ以上の可能な値を持つ離散変数に一般化できます。)
線形モデル
線形変数誤差モデルが最初に研究されたが、これはおそらく線形モデルが広く使用されており、非線形モデルよりも簡単だからだろう。標準的な最小二乗回帰(OLS)とは異なり、変数誤差回帰(EiV)を単純なケースから多変数のケースに拡張することは、すべての変数を同じように扱う、つまり同等の信頼性を仮定しない限り、簡単ではない。[10]
単純な線形モデル
単純な線形変数エラー モデルは、「動機」セクションですでに紹介されています。
ここで、すべての変数はスカラーです。ここで、αとβ は関心のあるパラメータですが、σ εとσ η (誤差項の標準偏差) は迷惑パラメータです。「真の」回帰変数x*は、測定誤差η (従来の仮定) とは無関係なランダム変数 (構造モデル) として扱われます。
このモデルは、 (1)潜在変数x*が正規分布していない場合、(2) x*は正規分布しているが、εtもηtも正規分布で割り切れない場合の2つのケースで識別可能です。 [11]つまり、潜在変数がガウス分布でなければ、パラメータα、βは追加情報なしでデータセットから一貫して推定できます。
この識別可能性の結果が確立される前に、統計学者はすべての変数が正規であると仮定して最大尤度法を適用しようとし、モデルが識別されていないと結論付けました。提案された解決策は、モデルのパラメータのいくつかは既知であるか、外部ソースから推定できると仮定することでした。そのような推定方法には[12]が含まれます。
- デミング回帰— 比率δ = σ² ε / σ² ηが既知であると仮定します。これは、たとえば、yとxの誤差が両方とも測定によって発生し、測定装置または手順の精度がわかっている場合に適しています。δ = 1 の場合は、直交回帰とも呼ばれます。
- 信頼性比 がわかっている回帰λ = σ² ∗ / ( σ² η + σ² ∗ )、ここでσ² ∗ は潜在回帰変数の分散です。このアプローチは、たとえば同じユニットの繰り返し測定が利用できる場合や、独立した研究から信頼性比がわかっている場合などに適用できます。この場合、傾きの一貫した推定値は、最小二乗推定値をλで割った値に等しくなります。
- σ² ηがわかっている場合の回帰は、xの誤差の原因がわかっていて、その分散を計算できる場合に発生します。これには、丸め誤差や測定装置によって導入される誤差が含まれます。σ² η がわかっている場合は、信頼性比をλ = ( σ² x − σ² η ) / σ² xとして計算し、問題を前のケースに縮小できます。
モデルのパラメータの一部を知らないことを前提としない推定方法には、
- モーメント法 -観測変数の3次(またはそれ以上)の結合キュムラントに基づくGMM推定量。傾き係数は[13]から推定できる。
ここで、( n 1 , n 2 )は、( x , y )の結合キュムラントK ( n 1 +1, n 2 )がゼロにならないような値である。潜在回帰変数x*の3次中心モーメントがゼロでない場合、式は次のように簡約される。
- 道具変数—道具と呼ばれる特定の追加データ変数z が利用可能であることを必要とする回帰。これらの変数は従属(結果)変数の方程式の誤差と無相関(有効)でなければならず、また真の回帰変数x*と相関(関連)している必要がある。このような変数が見つかった場合、推定量は次の形式になる。
- 幾何平均関数関係。これは、両方の変数が同じ信頼性を持つものとして扱います。結果として得られる傾きは、通常の最小二乗傾きと逆最小二乗傾きの幾何平均、つまり図の2本の赤い線です。[14]
多変量線形モデル
多変数モデルは単純な線形モデルとまったく同じですが、今回はβ、η t、x t、x* tがk× 1 ベクトルである点が異なります。
( ε t、η t ) が共に正規分布している場合、パラメータβ は、特異でない k×kブロック行列 [ a A ] が存在する場合にのみ識別されません。ここで、 aは、 a′x*がA′x* とは独立に正規分布する ようなk× 1 ベクトルです。 ε t、η t1、...、η tkが相互に独立している 場合、上記の条件に加えて、誤差の一部が 2 つの独立変数のうちの 1 つが正規分布している合計として表される場合にのみ、パラメータ β は識別されません。[15]
多変量線形モデルの推定方法には次のようなものがある。
- 総最小二乗法は、デミング回帰を多変数設定に拡張したものです。ベクトル ( ε、η ) のすべてのk +1 成分が等分散で独立している場合、これはベクトルxに対してyの直交回帰を実行することと同等です。つまり、点 ( y t、x t ) と「最適適合」のk次元超平面との間の二乗距離の合計を最小化する回帰です。
- モーメント法推定量[16]は、モーメント条件E[ zt · ( yt − α − β'xt )]=0に基づいて構築することができる。ここで、(5k + 3 )次元ベクトルztは次のように定義される
。
ここで、は行列のアダマール積を表し、変数xt、ytは予備的に平均が除去されている。この方法の著者は、フラーの修正IV推定量を使用することを提案している。[17]
この方法は、必要に応じて3次以上のモーメントを使用するように拡張でき、誤差なく測定された変数に対応することもできる。[18]
- 道具変数アプローチでは、測定が誤っている回帰変数x tの道具変数となる追加のデータ変数z tを見つける必要がある。この方法は実装の観点からは最も単純だが、欠点は追加データの収集が必要であり、コストがかかったり不可能になったりする可能性がある。道具変数が見つかると、推定量は標準形式になる。
- 公平なフィッティングアプローチは、信頼性が等しいと仮定してすべての変数を同じように扱い、結果の方程式を再配置できるため、説明変数と応答変数を区別する必要はありません。これは最も単純な測定誤差モデルであり、上記の2つの変数の幾何平均機能関係を一般化したものです。計算する必要があるのは共分散のみなので、基本的なスプレッドシート関数を使用して推定できます。 [19]
非線形モデル
一般的な非線形測定誤差モデルは次のような形をとる。
ここで関数g はパラメトリックまたはノンパラメトリックのいずれかになります。関数gがパラメトリックの場合は、 g ( x *, β )と表記されます。
一般的なベクトル値回帰変数x*の場合、モデル識別可能性の条件は不明である。しかし、スカラーx*の場合、関数gが「対数指数」形式でない限り、モデルは識別される[20]
潜在回帰変数x*の密度は
ここで、定数A、B、C、D、E、F はa、b、c、dに依存する場合があります。
この楽観的な結果にもかかわらず、今のところ、外部情報なしで非線形変数誤差モデルを推定する方法は存在しません。ただし、操作変数または繰り返し観測のいずれかの追加データを使用する手法はいくつかあります。
操作変数法
- パラメトリックモデルに対するニューイのシミュレーテッドモーメント法[21]では、観測された予測変数 z tの追加セットが必要となり、真の回帰変数は次のように表される。
ここで、π 0とσ 0 は(未知の)定数行列であり、ζ t ⊥ z tです。係数π 0は、 xのzに対する標準的な最小二乗回帰を使用して推定できます。 ζ tの分布は未知ですが、柔軟なパラメトリック ファミリ、つまりエッジワース級数に属するものとしてモデル化できます。
ここでϕは標準正規分布です。
シミュレーションされたモーメントは、重要度サンプリングアルゴリズムを使用して計算できます。まず、標準正規分布からいくつかのランダム変数{ v ts ~ ϕ , s = 1,…, S , t = 1,…, T }を生成し、次にt番目の観測値 におけるモーメントを次のように計算します。
ここでθ = ( β , σ , γ )、Aは単に操作変数zの関数であり、Hはモーメントの2成分ベクトルである。
繰り返しの観察
このアプローチでは、回帰変数x*の 2 つ (またはそれ以上) の繰り返し観測が利用できます。両方の観測には独自の測定誤差が含まれますが、それらの誤差は独立している必要があります。
ここでx* ⊥ η 1 ⊥ η 2である。変数η 1、η 2 は同一に分布している必要はない(ただし、同一であれば推定値の効率がわずかに向上する)。これら2つの観測値のみで、コトラルスキーのデコンボリューション法を使用してx*の密度関数を一貫して推定することができる。[22]
- パラメトリックモデルに対するLiの条件付き密度法。[23]回帰式は観測変数を用いて次のように表される。
ここで、条件付き密度関数ƒ x*|xがわかれば積分を計算することができる。この関数がわかったり推定できたりすれば、問題は標準的な非線形回帰となり、たとえばNLLS法を使って推定できる。
簡単のため、η 1、η 2が同一分布であると仮定すると、この条件付き密度は次のように計算できる。ここで、表記法を少し誤用すると、x j はベクトルのj番目の成分を表します。この式のすべての密度は、経験的特性関数
の逆関数を使用して推定できます。特に、これらの特性関数を反転するには、数値安定性を確保するために必要なトリミングパラメータC を使用して逆フーリエ変換を適用する必要があります。例:
- シェンナッハのパラメトリック線形変数非線形モデルに対する推定量。[24]これは次の形式のモデルである。
ここでw tは誤差なしで測定された変数を表す。ここでの回帰変数x*はスカラーである(この方法はベクトルx*の場合にも拡張できる)。測定誤差がなければ、これは推定量を持つ 標準的な線形モデル
になるだろう。どこ
この式のすべての期待値は、同じ逆畳み込みトリックを使用して推定できることがわかります。特に、一般的な観測量w t(1、w 1 t、…、w ℓ t、またはy t)と何らかの関数h (任意のg jまたはg i g jを表す)の場合、次の式が得られます。
ここでφ h はh ( x* )のフーリエ変換であるが、特性関数の場合と同じ規則を用いる。
- 、
そして
- ノンパラメトリックモデルに対するシェンナッハ推定量。[25]ノンパラメトリックモデルに対する
標準的なナダラヤ・ワトソン推定量は、
参考文献
- ^ Griliches, Zvi; Ringstad, Vidar (1970). 「非線形コンテキストにおける変数内誤差バイアス」Econometrica . 38 (2): 368–370. doi :10.2307/1913020. JSTOR 1913020.
- ^ Chesher, Andrew (1991). 「測定誤差の影響」. Biometrika . 78 (3): 451–462. doi :10.1093/biomet/78.3.451. JSTOR 2337015.
- ^ Carroll, Raymond J.; Ruppert, David; Stefanski, Leonard A.; Crainiceanu, Ciprian (2006). 非線形モデルにおける測定誤差: 現代の視点 (第 2 版). ISBN 978-1-58488-633-4。
- ^ Greene, William H. (2003). 計量経済分析(第5版). ニュージャージー州: Prentice Hall. 第5.6.1章. ISBN 978-0-13-066189-0。
- ^ Wansbeek, T.; Meijer, E. (2000). 「測定誤差と潜在変数」。Baltagi, BH (編)。理論計量経済学入門。ブラックウェル。pp. 162–179。doi :10.1111/ b.9781405106764.2003.00013.x。ISBN 9781405106764。
- ^ハウスマン、ジェリー A. ( 2001 )。「計量分析における誤った変数の測定:右派からの問題と左派からの問題」。経済展望ジャーナル。15 (4): 57–67 [p. 58]。doi : 10.1257 / jep.15.4.57。JSTOR 2696516 。
- ^ フラー、ウェイン A. (1987)。測定誤差モデル。ジョン ワイリー アンド サンズ。p. 2。ISBN 978-0-471-86187-4。
- ^ 林文夫 (2000). 計量経済学. プリンストン大学出版局. pp. 7–8. ISBN 978-1400823833。
- ^ Koul, Hira; Song, Weixing (2008). 「Berkson測定誤差による回帰モデル検査」.統計計画と推論ジャーナル. 138 (6): 1615–1628. doi :10.1016/j.jspi.2007.05.048.
- ^ Tofallis, C. (2023). 方程式をデータに公平に適合させる。数学、11(18)、3957。https://ssrn.com/abstract=4556739 https://doi.org/10.3390/math11183957
- ^ Reiersøl, Olav (1950). 「誤差の影響を受ける変数間の線形関係の識別可能性」. Econometrica . 18 (4): 375–389 [p. 383]. doi :10.2307/1907835. JSTOR 1907835.やや制限的な結果は、Geary, RC (1942) によって以前に確立されました。「ランダム変数間の固有の関係」。Proceedings of the Royal Irish Academy。47 : 63–76。JSTOR 20488436。彼は、( ε, η ) が共に正規分布であるという追加の仮定の下では、 x * が正規分布である場合にのみモデルが識別されないことを示した。
- ^ Fuller, Wayne A. (1987). 「単一の説明変数」.測定誤差モデル. John Wiley & Sons. pp. 1–99. ISBN 978-0-471-86187-4。
- ^ Pal, Manoranjan (1980). 「変数に誤差がある場合の回帰係数の一貫したモーメント推定量」Journal of Econometrics . 14 (3): 349–364 (pp. 360–361). doi :10.1016/0304-4076(80)90032-9.
- ^ Xu, Shaoji (2014-10-02). 「幾何平均回帰の特性」.アメリカ統計学者. 68 (4): 277–281. doi :10.1080/00031305.2014.962763. ISSN 0003-1305.
- ^ Ben-Moshe, Dan (2020). 「すべての変数に誤差がある線形回帰の識別」.計量経済理論. 37 (4): 1–31. arXiv : 1404.1473 . doi :10.1017/S0266466620000250. S2CID 225653359.
- ^ Dagenais, Marcel G.; Dagenais, Denyse L. (1997). 「変数に誤差がある線形回帰モデルの高次モーメント推定量」Journal of Econometrics . 76 (1–2): 193–221. CiteSeerX 10.1.1.669.8286 . doi :10.1016/0304-4076(95)01789-5. 以前の論文では、Pal(1980)は、ベクトル( ε、η )のすべての成分が独立しており対称的に分布しているという、より単純なケースを検討しました。
- ^ フラー、ウェイン A. (1987)。測定誤差モデル。ジョン ワイリー アンド サンズ。p. 184。ISBN 978-0-471-86187-4。
- ^ Erickson, Timothy; Whited, Toni M. (2002). 「高次モーメントを用いた変数エラーモデルの2段階GMM推定」.計量経済理論. 18 (3): 776–799. doi :10.1017/s0266466602183101. JSTOR 3533649. S2CID 14729228.
- ^ Tofallis, C. (2023). 方程式をデータに公平に適合させる。数学、11(18)、3957。https://ssrn.com/abstract=4556739 https://doi.org/10.3390/math11183957
- ^ Schennach, S. ; Hu, Y.; Lewbel, A. (2007). 「サイド情報なしの古典的な変数エラーモデルのノンパラメトリック識別」。ワーキングペーパー。
- ^ Newey, Whitney K. (2001). 「非線形変数誤差モデルの柔軟なシミュレートモーメント推定」.経済統計レビュー. 83 (4): 616–627. doi :10.1162/003465301753237704. hdl : 1721.1/63613 . JSTOR 3211757. S2CID 57566922.
- ^ Li, Tong; Vuong, Quang (1998). 「複数の指標を用いた測定誤差モデルのノンパラメトリック推定」. Journal of Multivariate Analysis . 65 (2): 139–165. doi : 10.1006/jmva.1998.1741 .
- ^ Li, Tong (2002). 「非線形変数誤差モデルの堅牢かつ一貫した推定」Journal of Econometrics . 110 (1): 1–26. doi :10.1016/S0304-4076(02)00120-3.
- ^ Schennach, Susanne M. (2004). 「測定誤差を伴う非線形モデルの推定」. Econometrica . 72 (1): 33–75. doi :10.1111/j.1468-0262.2004.00477.x. JSTOR 3598849.
- ^ Schennach, Susanne M. (2004). 「測定誤差がある場合のノンパラメトリック回帰」.計量経済理論. 20 (6): 1046–1093. doi :10.1017/S0266466604206028. S2CID 123036368.
さらに読む
- ドハティ、クリストファー (2011)。「確率的回帰変数と測定誤差」。計量経済学入門(第 4 版)。オックスフォード大学出版局。300 ~ 330 ページ。ISBN 978-0-19-956708-9。
- Kmenta, Jan (1986) 「不十分なデータによる推定」計量経済学の要素(第 2 版) ニューヨーク: Macmillan。pp. 346–391。ISBN 978-0-02-365070-3。
- Schennach, Susanne (2013)。「非線形モデルにおける測定誤差 - レビュー」。Acemoglu, Daron、Arellano, Manuel、Dekel, Eddie (編)。経済学と計量経済学の進歩。ケンブリッジ大学出版局。pp. 296–337。doi : 10.1017/CBO9781139060035.009。hdl :10419/ 79526。ISBN 9781107017214。
外部リンク
- 両変数に誤差がある線形回帰の歴史的概要、JW Gillard 2006
- Mark Thomaによる計量経済学の講義(トピック:確率的回帰変数と測定誤差)のYouTubeでの講義。
