統計学において、モデルの仕様は統計モデル構築プロセスの一部です。仕様とは、モデルに適した関数形式を選択し、どの変数を含めるかを選択することです。例えば、個人の所得が与えられた場合、長年の教育と併せて実務経験関数関係を指定するかもしれない以下のとおりです。[ 1 ]
どこは、独立同分布のガウス変数から構成されると想定される、説明のつかない誤差項です。
統計学者のサー・デイビッド・コックスは、「主題の問題から統計モデルへの変換がどのように行われるかは、分析において最も重要な部分であることが多い」と述べている。[ 2 ]
仕様誤差は、関数形式や独立変数の選択が、真のデータ生成過程の関連側面を適切に表現していない場合に発生します。特に、バイアス(推定パラメータと真の基礎値との差の期待値)は、独立変数が基礎過程に内在する誤差と相関している場合に発生します。仕様誤差にはいくつかの異なる原因が考えられます。以下にその一部を示します。
さらに、測定誤差は独立変数に影響を与える可能性があります。これは仕様上の誤差ではありませんが、統計的な偏りを生じさせる可能性があります。
すべてのモデルには何らかの仕様エラーがあることに注意してください。実際、統計学には「すべてのモデルは間違っている」 という格言があります。バーナムとアンダーソンの言葉を借りれば、
「モデリングは科学であると同時に芸術でもあり、統計的推論の基礎となる良い近似モデルを見つけることを目指している。」[ 4 ]
Ramsey RESET検定は、回帰分析における仕様エラーの検定に役立ちます。
上記の例で、個人の所得と学歴および職務経験を関連付けた場合、モデルの仮定が正しいとすれば、パラメータの最小二乗推定値はそして効率的かつ偏りのない方法となる。したがって、仕様診断では通常、残差の1次から4次モーメントのテストが行われる。[ 5 ]
モデルを構築するには、データを生成するプロセスを表す一連の関係性を見つける必要があります。そのためには、上述したような誤った仕様の原因をすべて回避しなければなりません。
一つのアプローチは、データ生成過程の理論的理解に基づいた一般形式のモデルから始めることです。次に、そのモデルをデータに適合させ、統計モデル検証と呼ばれる作業において、様々な誤指定の原因を検証します。そして、理論的理解に基づいてモデルを修正することで、理論的妥当性を維持しつつ誤指定の原因を取り除くことができます。しかし、データに適合する理論的に許容可能な仕様を見つけることが不可能であることが判明した場合、その理論モデルは却下され、別のモデルに置き換えられる必要があるかもしれません。
ここでカール・ポパーの次の言葉が適切である。「ある理論が唯一可能な理論であるように思えるときはいつでも、それはあなたがその理論も、それが解決しようとした問題も理解していないという兆候だと考えなさい。」[ 6 ]
モデル構築のもう一つのアプローチは、複数の異なるモデルを候補として指定し、それらの候補モデルを相互に比較することです。比較の目的は、どの候補モデルが統計的推論に最も適しているかを判断することです。モデルを比較するための一般的な基準には、R²、ベイズ因子、尤度比検定とその一般化相対尤度などがあります。このトピックの詳細については、「統計モデルの選択」を参照してください。