
NM法、またはNaszodi–Mendonca法は、統計学、計量経済学、経済学、社会学、人口統計学において反事実分割表を作成するために適用できる操作です。この方法は行列を求めます。()行列に「最も近い」((シードテーブルと呼ばれる)順位は同じだが、ターゲットマトリックスの行と列の合計と同じという意味で行合計と列合計は行列は既知である。それ自体は知られていないかもしれない。
行列の解はNM法は一意であり、関数である。、 どこサイズが 1 の行ベクトルです、 その間サイズが 1 の列ベクトルです。
NM法はNaszodiとMendonca(2023)[ 1 ]によって開発され、行列を解くためにNaszodiとMendonca(2019) [ 2 ]によって初めて適用されました。問題では、行列は、行列の行合計と列合計によって特徴付けられる母集団からのサンプルではありません。しかし、それは別の集団を表している。
彼らの研究は、教育における同質性の強さの世代間変化を定量化し、それによって1980年から2010年までの米国における異なる教育グループ間の社会的不平等の歴史的変化を測定することを目的としていた。不平等の傾向はU字型であることが判明し、適切な社会経済政策によって不平等を軽減できるという見解を裏付けるものとなった。
同じサイズの2つの行列間の近さは、いくつかの方法で定義できます。ユークリッド距離とカルバック・ライブラー情報量は、よく知られた例です。
NM法は、James Coleman (1958) の式(15)で定義されたColeman指数をわずかに修正したLiu–Lu指数[3]に基づく定義と一致している。[ 4 ]この定義によれば、行列は行列に「最も近い」それらのLiu–Lu値が同じである場合。言い換えれば、順序Liu–Lu指数によって同じ順位付けされている場合。
もしは2×2行列で、スカラー値のLiu–Lu指数は次のように定義される。
、 どこ ; ; ; ; 。
ジェームズ・コールマン(1958)[ 4 ]に従って、この指数は「実際の値マイナス期待値÷最大値マイナス最小値」と解釈される。実際の値はシードマトリックスのエントリ;は、対応する行合計と列合計がはあらかじめ決められているが、内部はランダムである。また、行変数と列変数の関連付けが最小値である場合、は非負です。最後に、の最大値は(指定された行の合計に対して列合計。
行列の場合サイズ n×m (、Liu–Lu指数はNaszodiとMendonca(2023)[ 1 ]によって行列値指数に一般化された。一般化の前提条件は、行列の行変数と列変数が順序付けする必要がある。一般化された行列値のLiu–Lu指数を等しくすると、行列のそれと合わせてこれは、順序付けられた行変数と順序付けられた列変数を二値化することと同等である。で行と列の変数の順序性を利用する方法。次に、二分化によって得られた 2×2 行列の元のスカラー値の Liu–Lu インデックスを等しくします。つまり、任意のペアに対して、(、 そして制限課せられる場所はマトリックス最初のブロックのサイズは、そしてその2番目のブロックのサイズは同様に、は転置行列によって与えられる最初のブロックのサイズは、そしてその2番目のブロックのサイズは。
マトリックス満たすべきなのはしかし、行合計と列合計に対する制約も存在します。そして。
と仮定するとすべてのペアについて(どこ、 そして)の解決策は一意であり、決定論的であり、閉じた形式の式で与えられる。[ 1 ]
行列の場合そしてサイズの、解決策は
。
他の3つの細胞これらは行合計と列合計によって一意に決定されます。これが、2×2シードテーブルに対するNM法の仕組みです。
のために、 そしてサイズが の行列(、) 解は、順序付き行変数と順序付き列変数を、解く前に考えられるすべての意味のある方法で二値化することによって得られます。2×2形式の問題の数。各問題は、ペア(そして) と、および目標とする行合計と列合計:、 そしてそれぞれ。各問題は、次の式を用いて個別に解くものとする。解の集合が決定する行列のエントリ数残りの要素は、対象となる行合計と列合計によって一意に決定されます。
次に、行列の場合にNM法がどのように機能するかを見てみましょう。は、条件を満たしていません。
もしすべてのペアについて解決策もまた、一意で決定論的であり、閉形式の式で与えられる。ただし、対応する行列ランキングの概念は、上記で説明したものとは若干異なる。LiuとLu(2006)[ 3 ]は、それを次のように定義している。、 どこ;最小の整数は、。
最後に、NM法も、定義されるのはペアであって、、一方別のペアでは。
次の行列を考えてみましょう行合計と列合計、およびターゲット、つまり行列の行合計と列合計が補完されます。:
NM法の最初のステップとして、行列を掛け合わせる、 そして各ペアの行列(、 そしてこれにより、目標とする行合計と列合計を持つ、サイズ2×2の9つの行列が生成されます。
次のステップは、一般化行列値Liu–Lu指数を計算することです。、 (どこ9つの行列それぞれに、元のスカラー値Liu–Lu指数の式を適用することによって、次の式が得られます。
どうやらマトリックスはは正である。したがって、NM法が定義される。2 ×2形式の9つの問題をそれぞれ解くと、次の9つのエントリが得られる。行列。その他の 7 つのエントリは、目標行合計と列合計によって一意に決定されます。は:
次の行列を考えてみましょう行合計と列合計、および目標値も併せて表示されます。つまり、行列の行合計と列合計:
NM法の最初のステップとして、行列を掛け合わせる、 そして各ペアの行列(、 そしてこれにより、目標とする行合計と列合計を持つ、サイズ2×2の4つの行列が生成されます。
次のステップは、一般化行列値Liu–Lu指数を計算することです。、 (どこ4つの行列それぞれに元のスカラー値Liu–Lu指数の式を適用することによって、次の式が得られます。
どうやらマトリックスはは正である。したがって、NM法が定義される。2 ×2形式の4つの問題をそれぞれ解くと、次の4つのエントリが得られる。行列。その他の5つの要素は、目標とする行合計と列合計によって一意に決定されます。解決策は:
NM法はExcel [ 5 ] 、 Visual Basic [ 5 ]、R [ 5 ] 、 Stata [ 6 ]にも実装されています。
NM法は、同類交配、社会移動の一種としての世代間移動[ 7 ] 、居住分離、採用、人材管理など、さまざまな現象の研究に適用できます。
これらのアプリケーションすべてにおいて、行列、、 そしてNM法は適用範囲が広いものの、次に示す例はすべて教育レベルに沿った同類交配に関するものです。これらの応用例では、2つの前提条件(順序付けられた特性変数と、すべての教育グループにおける正の同類交配)が満たされているかどうかは議論されていません。
と仮定するマトリックスジンバブエにおける夫と妻の共同教育分布を特徴づける一方、行列はイエメンでも同様のことが見られる。マトリックスNM法を用いて構築されるこのモデルは、夫と妻の教育分布がイエメンと同じであり、同類婚への全体的な願望(経済学では集計結婚選好、社会学では結婚マッチングの社会的規範/社会的障壁とも呼ばれる)が変化しない場合、ジンバブエにおける夫婦の共同教育分布がどうなるかを示している。
では2番目の応用例、行列そして同じ国を異なる2年間で特徴づける。マトリックスこれは、2040年のアメリカの新婚夫婦の共同教育分布であり、夫はZ世代で、観察時点で若年成人である。マトリックス2024年に観察されたジェネレーションYについても同様です。将来的には、新婚のアメリカの若いカップルが、Z世代の男性とそのパートナーと同じように結婚し、Y世代の男性とそのパートナーと同じ教育レベルであった場合、彼らの教育分布がどうなるかを研究することができるだろう。
では3つ目の応用例、行列そしてこのアプリケーションでは、行列が2つの異なる年で同じ国を再び特徴付けます。これは、2011年のポルトガルの若いカップル(男性パートナーの年齢が30歳から34歳)の共同教育分布です。同じだが、1981年に観測された。行列を構築することを目指すかもしれない。ポルトガルの若いカップルが2011年の同世代の人々と同じように結婚していた場合、彼らの教育分布はどうなっていたかを研究するため、また、男女別の教育分布は1981年と同じであったと仮定した。
最初の2つのアプリケーションでは、行列これは反事実的な同時分布を表します。特定の他の条件が同じ場合の効果を定量化するために使用できます。より正確には、ジンバブエとイエメン、または反事実的分解を用いてZ世代とY世代における結婚選択の直接観察不可能な程度の差を基数尺度で定量化するために使用できます。分解には、反事実表を使用します。これは、各推進力(つまり、人口レベルでの機会を決定するさまざまな教育レベルの潜在的なパートナーの構造的利用可能性、および集計されたマッチングの好み、欲求、規範、障壁などの観察不可能な非構造的要因)とそれらの相互作用(つまり、構造的利用可能性の変化による集計された好み/欲求/規範/障壁の変化の影響)が、観察可能な基数尺度統計(たとえば、教育的に同質なカップルの割合)にどれだけ寄与しているかを計算するために使用されます。
3番目の応用例は、NaszodiとMendonca(2023)[ 1 ]によって、意味のない反事実の例として使用されました。ポルトガルでは、調査対象となった30年間で教育水準が劇的に変化したため、この反事実を得ることは不可能です。驚くべきことに、最近まで同類交配に関する文献で一般的に使用されていたある手法は、3番目の例の不可能な反事実に対する解決策を幻覚のように作り出すのに対し、NM法はそれを構築することを拒否します。
まず、NM法は適用範囲の限界に達すると意味のある解を得られなくなります。[ 1 ]例えば、3番目の応用例では、NM法は行列に負の要素をシグナルとして示します。反事実が不可能であることを示す(AlternativeMethod_US_1980s_2010s_age3035_main.xls シート PT_A1981_P2011_Not_meaningful を参照)。[ 5 ]この点において、NM法は、予測確率が単位区間外にあるという同じことを示す線形確率モデルと類似している。。
第二に、NM法は行変数と列変数の隣接カテゴリのマージと可換である。[ 1 ]、 どこはサイズの行結合行列です; そして、 どこは、サイズの列結合行列です。。
反復比例フィッティング手順 (IPF) も関数です: [ 8 ] [ 9 ] [ 10 ] [ 11 ]これは適合行列を求める操作です。()行列が満たす条件と同様の条件を満たすNM法で構築。例:行列行列に最も近いただし、対象マトリックスの行と列の合計値を使用する場合。
しかし、IPFとNM法には違いがあります。IPFは、同じサイズの行列の近さを交差エントロピーまたはカルバック・ライブラー情報量によって定義します。[ 12 ]したがって、2×2行列間の距離のIPF互換概念は、そしてそれらの交差積比[ 11 ] (オッズ比とも呼ばれる)が同じであれば、はゼロになる。[ 13 ] NM法の行列の順位が等しい条件を思い出してください。そしては。
以下の数値例は、IPFとNM法が同一ではないことを明確に示している。行列を考えてみましょう。その目標と共に:
NM法では以下の行列が得られる。:
行列の解はIPFで得られる値は次のとおりです。
IPFは、行列が結合母集団分布の最尤推定量[ 10 ]に相当する。(結合母集団分布の推定値)は行列から計算されます母集団から抽出されたランダムサンプルにおける観測された同時分布は、行列の行合計と列合計によって特徴付けられる。IPF によって解決される問題とは対照的に、行列NM法が解決するために開発された問題では、この母集団からサンプリングされていません。実際、NM問題では、行列はそして2つの異なる集団を特徴付ける(ジンバブエとイエメンへの適用のように同時に観察される場合と、 Z世代とY世代の集団への適用のように2つの異なる時点で観察される場合)。この違いにより、経験的応用においてNM法とIPFの選択が容易になる。[ 13 ]
IPFの発明者であるデミングとステファン(1940)[ 14 ]は、行列が古典的な最尤推定問題に彼らの方法を適用した例を示した。行列の行合計と列合計によって特徴付けられる母集団からサンプリングされた。彼らは、一般的にIPFは反事実予測には適していないという事実を認識しており、彼らのアルゴリズムは「それ自体では予測には役立たない」と明示的に警告していた(StephanとDeming 1940 p. 444を参照)。[ 14 ] [ 13 ]
さらに、IPFとNM法が解を生成する領域は異なります。まず、NM法とは異なり、IPFはすべてのシードテーブルに対して解を提供するわけではありません。エントリがゼロの場合(Csiszár(1975)[ 15 ]は、エントリがゼロの一般テーブルでIPFを適用するための必要十分条件を発見した)。 第二に、NM法の前提条件(いずれかまたは) は IPF の適用可能性の前提条件ではありません。第三に、NMとは異なり、IPFは行列のペアに対して意味のある解を提供する。そしてポルトガルに関する3番目の数値例の行列のペアなど、不可能な反事実を定義する(Naszodi 2025 [ 16 ])。
最後に、NMとは異なり、IPFは行変数と列変数の隣接するカテゴリをマージする操作とは可換ではありません。これは、Naszodi(2023)の数値例で示されています(10ページ参照)。[ 17 ] このため、IPFで得られる変換されたテーブルは、特性カテゴリの数の選択に敏感になる可能性があります。
Kenneth Macdonald (2023) [ 18 ]は、Naszodi (2023) [ 19 ] の結論、 すなわち IPF は標本補正タスクには適しているが、反事実の生成には適していないという結論に納得している。Naszodi と同様に、Macdonald もまた、IPF の行と列の比例変換が、社会移動を研究できる分割表内の関連性の構造を保持しているかどうか疑問を呈している。
最小ユークリッド距離アプローチ(MEDA)(FernándezとRogerson、2001に倣ってAbbottら、2019によって定義)もまた関数である:[ 20 ] [ 21 ]。
まず、MEDAは行列にスカラー値を割り当てます。: これは、2 つの極端なケース (ランダムマッチングと完全な同類マッチング) の凸結合を構築するために使用される重みです。ユークリッド距離を最小化することによって例えば、このスカラーはAbbott et al.(2019) から引用した数値例では 、[ 20 ] 第二に、任意の反事実周辺分布のペアに対して、) MEDA は、2 つの極端なケース (ランダムなマッチングと完全な同類マッチング) と、周辺ペア ()).
NMとMEDAの違い:NMは一般化された行列値のLiu–Lu指数を維持することで同類性を変化させない一方、固定すると、MEDA はスカラーを保持することで同じことを行います修正済み。、 そしてサイズが の行列2つの方法では、同じ変換済みテーブルが生成されます。分割表の順位付けは、スカラー値のLiu–Lu指数と同じである。[ 22 ] ただし、2×2より大きい行列の場合、一般化Liu–Lu指数は行列値であるため、スカラー値とは異なります。したがって、NM変換された表はMEDA変換された表とも異なります。
例えば、Abbott et al.(2019)から引用した数値例では、MEDAによって構築された反事実表は 行列は:
行列の違い行列無視できない。例えば、MEDAが作成した反事実マトリックスでは、同類婚カップルの割合は2パーセントポイント低い。観測された行列よりも一方、NMが構築した反事実マトリックスでは、その値は3.4パーセントポイント小さくなっている。相対的に。
アボットの例は架空のものではなく、アメリカの夫婦の教育分布に関する実証的なデータに基づいているため、2パーセントポイントと3.4パーセントポイントの差は、MEDAがNMと比較して世代間の不平等の変化を著しく小さく定量化していると解釈できる。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)