統計学において、識別可能性とは、正確な推論を可能にするためにモデルが満たさなければならない性質です。モデルは、そこから無限個の観測データを得た後に、そのモデルの基礎となるパラメータの真の値を理論的に学習できる場合に識別可能であると言えます。数学的には、これはパラメータの異なる値が観測可能な変数の異なる確率分布を生成することと同等です。通常、モデルは特定の技術的な制約の下でのみ識別可能であり、その場合、これらの要件の集合は識別条件と呼ばれます。
識別できないモデルは、識別不可能または識別不能であると言われます。つまり、2つ以上のパラメータ化が観測的に等価です。場合によっては、モデルが識別不可能であっても、モデルパラメータの特定の部分集合の真の値を学習できることがあります。この場合、モデルは部分的に識別可能であると言います。また、パラメータ空間の特定の有限領域まで真のパラメータの位置を学習できる場合もあり、その場合はモデルは識別可能であると言えます。
モデルの特性を厳密に理論的に探求することとは別に、識別可能性は、識別可能性分析を使用して実験データセットでモデルをテストする場合に、より広い範囲で言及することができます。[ 1 ]
させてパラメータ空間を持つ統計モデルである私たちはこう言いますマッピングが識別可能であれば1対1 です: [ 2 ]
この定義は、 θの異なる値は異なる確率分布に対応する必要があることを意味します。θ 1 ≠ θ 2 の場合、P θ 1 ≠ P θ 2 も成り立ちます。[ 3 ]分布が確率密度関数( pdf )で定義されている場合、2 つの pdf は、非ゼロ測度の集合で異なる場合にのみ異なるとみなされます (たとえば、2 つの関数 ƒ 1 ( x ) = 1 0 ≤ x < 1と ƒ 2 ( x ) = 1 0 ≤ x ≤ 1は、測度がゼロの集合である単一の点x = 1でのみ異なるため、異なる pdf とはみなされません)。
モデルの識別可能性(マップの可逆性という意味で)これは、モデルを無限に長く観測できる場合、モデルの真のパラメータを学習できることと同等です。実際、{ X t } ⊆ S がモデルからの観測のシーケンスである場合、大数の強法則により、
任意の可測集合A ⊆ Sに対して(ここで1 {...}は指示関数です)。したがって、無限個の観測値があれば、モデル内の真の確率分布P 0を見つけることができ、上記の識別可能性条件はマップが 可逆であれば、与えられた分布P 0を生成したパラメータの真の値も見つけることができる。
それから
この式は、すべての係数がゼロに等しい場合にのみ、ほぼすべてのxに対してゼロに等しくなります。これは、| σ 1 | = | σ 2 | およびμ 1 = μ 2の場合にのみ可能です。スケール パラメータσはゼロより大きい値に制限されているため、モデルは識別可能であると結論付けられます。ƒ θ 1 = ƒ θ 2 ⇔ θ 1 = θ 2。
させて標準線形回帰モデルとする:
(ここで ′ は行列の転置を表す)。すると、パラメータβは、行列がこれは可逆である。したがって、これはモデルにおける識別条件である。
ここで、( ε、η、x* ) は期待値がゼロで分散が未知の、共変的に正規分布に従う独立な確率変数であり、変数 ( x、y ) のみが観測されます。この場合、このモデルは識別できません。 [ 4 ]積 βσ² ∗のみが識別可能です (ここで σ² ∗は潜在回帰変数x*の分散です)。これも集合識別可能なモデルの例です。βの正確な値は学習できませんが、β yxはyをxに対してOLS回帰したときの係数、β xyは x をyに対してOLS 回帰したときの係数である区間 ( β yx、 1÷ β xy ) のどこかに存在することは保証できます。[ 5 ]
正規性の仮定を放棄し、x* が正規分布に従わないことを要求し、独立条件ε ⊥ η ⊥ x*だけを残すと、モデルは識別可能になる。[ 4 ]