
回帰分析では、ダミー変数(指標変数または単にダミーとも呼ばれる)は、結果を変化させる可能性のある何らかのカテゴリ効果の有無を示すために、バイナリ値(0または1)を取る変数です。 [ 1 ]機械学習 では、これはワンホットエンコーディングとして知られています。
ダミー変数は、教育レベルや職業など、2つ以上のレベルを持つカテゴリ変数を表すために回帰分析でよく使用されます。この場合、変数の各レベルを表すために複数のダミー変数が作成され、各観測値に対して1つのダミー変数のみが値1をとります。ダミー変数は、カテゴリ変数が数値ではないため分析に含めるのが難しい場合があるため、分析に利用できるという点で有用です。
ダミー変数は二値変数に適用されます。例えば、性別は、女性を0、男性を1として表すことでダミー変数として符号化できます。
モデルに変数を追加する場合と同様に、ダミー変数を追加すると、サンプル内モデルの適合度(決定係数)は向上しますが、自由度が減少し、モデルの一般性(サンプル外モデルの適合度)が失われます。ダミー変数が多すぎると、一般的な結論が得られないモデルになってしまいます。
ダミー変数は様々な場面で役立ちます。例えば、計量経済学の時系列分析では、戦争や大規模なストライキの発生を示すためにダミー変数が使用されることがあります。したがって、ダミー変数はブール値、つまり数値0または1で表される真偽値と考えることができます(コンピュータプログラミングでよく行われるように)。
ダミー変数は、より複雑なケースにも拡張できます。たとえば、季節効果は、各季節のダミー変数を作成することで捉えることができます。D1=1は観測が夏の場合に1、それ以外の場合は0。D2=1は秋の場合に限り1、それ以外の場合は0。D3=1は冬の場合に限り1、それ以外の場合は0。D4=1は春の場合に限り1、それ以外の場合は0。パネルデータでは、固定効果推定量ダミーは、クロスセクションデータ(企業や国など)の各単位、またはプールされた時系列の期間ごとに作成されます。
このような回帰分析では、定数項またはダミー変数のいずれかを削除して、それを他のカテゴリを評価する基準カテゴリにする必要があります。これは、すべてのカテゴリのダミー変数を含めると、すべての観測値の合計が 1 になり、係数が定数項である 1 のベクトル変数と同一であるため、完全に相関してしまうためです。1 のベクトル変数も存在すると、完全な多重共線性[ 2 ]が発生し、推定アルゴリズムでの行列の反転が不可能になります。これはダミー変数の罠と呼ばれます。