

構造方程式モデリング(SEM)は、科学者が観察研究と実験研究の両方で使用する多様な手法です。SEMは主に社会科学や行動科学の分野で使用されていますが、疫学[ 2 ]、ビジネス[ 3 ]、その他の分野でも使用されています。標準的な定義では、SEMは「想定される基礎概念モデルまたは理論モデルによって定義される少数の「構造的」パラメータの観点から、観測データの平均、分散、共分散に関する仮説を表現しようとする手法のクラス」です。[ 4 ]
SEMは、ある現象のさまざまな側面が互いにどのように因果的に結びついていると考えられるかを表すモデルです。構造方程式モデルには、潜在変数(存在すると考えられるが直接観測できない変数)間の想定される因果関係が含まれることがよくあります。追加の因果関係は、これらの潜在変数をデータセットに値が現れている観測変数にリンクします。因果関係は方程式を使用して表されますが、想定される構造は、図1および図2のように矢印を含む図を使用して表すこともできます。因果構造は、観測変数の値の間に特定のパターンが現れるはずであることを示唆しています。これにより、観測変数の値間のつながりを使用して想定される効果の大きさを推定し、観測データが仮説上の因果構造の要件と一致するかどうかをテストすることが可能になります。[ 5 ]
構造方程式モデルとは何か、そうでないものとは何かの境界は必ずしも明確ではありませんが、SE モデルには、一連の潜在変数 (態度、知能、精神疾患など、存在すると考えられるが直接観察できない変数) 間の想定される因果関係と、想定される潜在変数を観察可能で、その値がデータセットで利用可能な変数にリンクする因果関係が含まれることがよくあります。潜在的な因果関係のスタイルのバリエーション、潜在変数を測定する観測変数のバリエーション、統計的推定戦略のバリエーションにより、確認的因子分析(CFA)、確認的複合分析、パス分析、マルチグループモデリング、縦断的モデリング、部分最小二乗パスモデリング、潜在成長モデリング、階層的またはマルチレベルモデリングを含む SEM ツールキットが生まれます。[ 6 ] [ 7 ] [ 8 ] [ 9 ] [ 10 ]
SEM 研究者は、コンピュータ プログラムを使用して、モデル化された構造的接続に対応する係数の強さと符号を推定します。たとえば、図 1 の矢印に接続された数値などです。図 1 のような想定されたモデルは、観測されたデータ測定を制御する現実世界の力に対応しない可能性があるため、プログラムはモデル テストと診断の手がかりも提供し、どの指標またはどのモデル コンポーネントがモデルと観測データの間に矛盾を引き起こす可能性があるかを示唆します。SEM 方法に対する批判には、利用可能なモデル テストの無視、モデルの仕様の問題、外部妥当性を考慮せずにモデルを受け入れる傾向、潜在的な哲学的バイアスなどがあります。[ 11 ]
SEMの大きな利点は、これらの測定とテストがすべて1つの統計的推定手順で同時に行われ、すべてのモデル係数が観測変数からのすべての情報を使用して計算されることです。これは、研究者がモデルの各部分を個別に計算する場合よりも推定値が正確であることを意味します。[ 12 ]
構造方程式モデリング(SEM)は、Sewall Wrightが、観測変数間の直接的および間接的な影響を生み出す物理的および生理学的メカニズムの確固たる理解に基づいて、一連の回帰スタイルの方程式に明確な因果的解釈を提供したときに、相関および回帰から区別されるようになりました。[ 13 ] [ 14 ] [ 15 ]これらの方程式は通常の回帰方程式のように推定されましたが、測定された変数の実質的なコンテキストにより、単なる予測ではなく、明確な因果的理解が可能になりました。Otis D. Duncanは1975年の著書で社会科学にSEMを導入し、[ 16 ] SEMは、コンピューティング能力の向上により実用的なモデル推定が可能になった1970年代後半から1980年代にかけて開花しました。 1987年、レスリー・A・ヘイドゥク[ 7 ]は潜在変数を用いた構造方程式モデリングに関する最初の書籍形式の入門書を提供し、その後すぐにケネス・ボーレンの人気テキスト(1989)が出版された[ 17 ] 。
心理学、社会学、経済学では、異なるが数学的に関連したモデリング手法が開発されました。初期のカウルズ委員会の同時方程式推定に関する研究は、輸送経済学と最適ルーティングのクープマンとフッド(1953)のアルゴリズムを中心としており、コンピュータが登場する以前は反復解探索手法が限られていたため、最尤推定と閉形式の代数計算が用いられました。これらの発展の流れのうち2つ(心理学の因子分析と、ダンカンを経由した社会学のパス分析)が収束し、現在のSEMの中核が生まれました。カール・ヨレスコグが教育テストサービスで開発したいくつかのプログラムの1つであるLISREL [ 18 ] [ 19 ] [ 20 ]は、潜在変数(心理学者が因子分析の潜在因子として知っていたもの)をパス分析スタイルの方程式(社会学者がシーウォール・ライトとオーティス・ダンカンから受け継いだもの)に組み込みました。モデルの因子構造部分は測定誤差を組み込んでおり、それによって、想定される様々な潜在変数を結びつける効果の推定において、必ずしも誤差のない推定とは限らないものの、測定誤差の調整が可能になった。
因子分析とパス分析の伝統の歴史的な収束の痕跡は、モデルの測定部分と構造部分の区別、およびモデル検定、測定が構造推定に先行すべきか同時であるべきかについての継続的な意見の相違として残っている。[ 21 ] [ 22 ]因子分析をデータ削減手法とみなすことは検定を軽視することになり、これは仮定された因果関係の検定を重視するパス分析とは対照的である。パス分析では、検定結果がモデルの誤指定を示す可能性がある。因子分析とパス分析の伝統間の摩擦は、文献の中で引き続き表面化している。
ライトのパス分析は、ハーマン・ウォルド、ウォルドの教え子カール・ヨレスコグ、ヨレスコグの教え子クラエス・フォーネルに影響を与えたが、SEMは米国の計量経済学者の間で大きな支持を得ることはなかった。これはおそらく、モデリングの目的と典型的なデータ構造の根本的な違いによるものと考えられる。SEMの経済学部門が長期間分離していたため、手続きと用語に違いが生じたが、深い数学的および統計的なつながりは残っている。[ 23 ] [ 24 ]アプローチの分野間の違いは、SEMNETの内生性に関する議論や、有向非巡回グラフ(DAG)による因果関係に関する議論に見られる。[ 5 ]さまざまなSEMアプローチを比較対照する議論が利用可能であり、データ構造の分野間の違いと経済モデルを動機づける懸念が強調されている。[ 25 ] [ 26 ]
ジュデア・パール[ 5 ]はSEMを線形モデルからノンパラメトリックモデルに拡張し、方程式の因果的および反事実的解釈を提案した。ノンパラメトリックSEMは、効果の線形性や誤差項の分布に関する仮定に一切拘束されることなく、総効果、直接効果、間接効果を推定することを可能にする。[ 26 ]
SEM分析は、複雑な概念を分解し、因果関係を理解するのに役立つ分析手法であるため、社会科学で広く用いられていますが、モデルの複雑さにより、従来の制御変数の有無、サンプルサイズ、関心のある変数に応じて結果に大きなばらつきが生じる可能性があります。[ 27 ]実験計画法を用いることで、こうした疑問の一部に対処できるかもしれません。[ 28 ]
今日、構造方程式モデリング(SEM)は機械学習および(解釈可能な)ニューラルネットワークの基礎の一部を成している。古典統計学における探索的因子分析と確認的因子分析は、教師なし機械学習と教師あり機械学習に相当する。
以下の考慮事項は、多くの構造方程式モデルの構築と評価に当てはまります。
モデルの構築または仕様策定には、以下の点に注意する必要があります。
構造方程式モデルは、因果的に均質な事例、すなわち、同じ因果構造に絡み合っているものの、原因に対する価値観が異なり、したがって結果変数に対する価値観も異なる事例において作用する現実世界の力を反映しようとする。因果的均質性は、事例の選択、あるいは多群モデルにおける事例の分離によって促進される。モデルの仕様は、研究者が以下を指定するまで完了しない。
モデルの潜在レベルは、内生変数と外生変数で構成されます。内生潜在変数は、少なくとも1つの他のモデル化変数から影響を受けると想定される真のスコア変数です。各内生変数は、回帰式における従属変数としてモデル化されます。外生潜在変数は、1つ以上の内生変数の原因となると想定される背景変数であり、回帰式における予測変数と同様にモデル化されます。外生変数間の因果関係は明示的にモデル化されませんが、通常は外生変数が互いに自由に相関しているとモデル化することで考慮されます。モデルには、介在変数(一部の変数から影響を受けるだけでなく、他の変数にも影響を与える変数)が含まれる場合があります。回帰と同様に、各内生変数には、利用できない、通常は未知の原因の影響を包含する残差変数または誤差変数が割り当てられます。外生的か内生的かを問わず、各潜在変数は、その変数に関する事例の真のスコアを含んでいると考えられ、これらの真のスコアは、観察/報告された指標変数の 1 つ以上に有効な/真の変動を因果的に寄与する。[ 29 ]
LISREL プログラムは、さまざまなモデル コンポーネントを追跡するために、一連の行列の要素にギリシャ語の名前を割り当てました。これらの名前は比較的標準的な表記法になりましたが、さまざまな統計的考慮事項に対応するために表記法は拡張および変更されています。[ 20 ] [ 7 ] [ 17 ] [ 30 ] 図を使用したり、ユーザーが選択した変数名を許可する方程式を使用したりしてモデル仕様を「簡略化」するテキストやプログラムは、バックグラウンドでユーザーのモデルを何らかの標準的な行列代数形式に再変換します。「簡略化」は、ユーザーが気にする必要がないとされるモデル機能に関するデフォルトのプログラムの「仮定」を暗黙的に導入することによって達成されます。残念ながら、これらのデフォルトの仮定は、モデルの構造と基となる行列内に認識されない問題が潜んでいるモデル コンポーネントを容易に隠蔽します。
SEM(構造方程式モデリング)では、モデルは大きく2つの構成要素に分けられます。1つは、内生変数と外生変数の間の潜在的な因果関係を示す構造モデル、もう1つは、潜在変数と指標の間の因果関係を示す測定モデルです。例えば、探索的因子分析モデルや確認的因子分析モデルは、因果的な測定関係に焦点を当てていますが、パスモデルはSEMの潜在的な構造的関係により密接に対応しています。
モデル作成者は、モデル内の各係数を、推定可能な値として指定するか、ある値に固定するかを指定します。自由係数は、研究者が検証したい想定効果、外生変数間の背景相関、または内生潜在変数にさらなる変動をもたらす残差変数または誤差変数の分散などです。固定係数は、図2の1.0のように潜在変数の尺度を提供する値、または0.0のように、学業成績から図1の4つの尺度のいずれにも直接的な影響がない(矢印がない)という主張など、因果関係の断絶を主張する値です。SEMプログラムは自由係数の推定と検定を提供しますが、固定係数はモデル全体の構造を検証する上で重要な役割を果たします。係数間のさまざまな制約も使用できます。[ 30 ] [ 7 ] [ 17 ]モデルの仕様は、文献から知られていること、モデル化された指標変数に関する研究者の経験、および特定のモデル構造を使用して調査される特徴に依存します。
モデルで推定できる係数の数には制限があります。推定係数の数よりもデータポイントが少ない場合、結果として得られるモデルは「識別不能」と言われ、係数の推定値は得られません。相互作用効果やその他の因果ループも推定を妨げる可能性があります。[ 31 ] [ 32 ] [ 30 ]
0.0、1.0、またはその他の値に固定されたモデル係数は、既に指定値があるため推定する必要はありません。自由モデル係数の推定値は、自由モデル係数が推定値を取る場合のデータの特性と比較して、データへの適合を最大化するか、データとの差を最小化することによって得られます。特定の係数値のセットに対してデータがどのように見えるべきかというモデルの意味は、次の要素に依存します。a) モデル内の係数の位置 (たとえば、どの変数が接続されているか、または接続されていないか)、b) 変数間の接続の性質 (共分散または効果。効果は線形であると仮定されることが多い)、c) 誤差または残差変数の性質 (多くの場合、多くの変数から独立しているか、または因果的に接続されていないと仮定される)、および d) 変数に適した測定尺度 (間隔尺度測定が仮定されることが多い)。
2 つの潜在変数を結びつける効果が強いということは、それらの潜在変数の指標間の相関がより強いことを意味します。したがって、潜在変数の効果の妥当な推定値は、対応する潜在変数の指標間の相関に最もよく一致する値、つまりデータとの一致を最大化する推定値、またはデータとの差異を最小化する推定値になります。最尤推定では、すべての自由モデル係数の数値は、サンプルデータ(データが変数の共分散/相関であるか、指標変数のケースの実際の値であるかに関わらず)を観測する可能性が最大になるまで個別に調整されます(初期開始値から段階的に増加または減少)。通常の最小二乗推定値は、データと、モデルが正しく指定されている場合(つまり、モデルの推定されたすべての特徴が現実世界の特徴に対応している場合)のデータとの間の二乗差を最小化する係数値です。
推定値を得るために最大化または最小化する適切な統計的特徴は、変数の測定レベル(一般的に、名義尺度や順序尺度よりも間隔尺度の方が推定が容易)と、特定の変数がモデル内のどこに現れるか(例えば、内生二値変数は外生二値変数よりも推定が困難になる)によって決まります。ほとんどのSEMプログラムでは、モデルの係数の推定値を得るために何を最大化または最小化するかについて、いくつかのオプションが用意されています。選択肢には、最尤推定(MLE)、完全情報最尤推定(FIML)、最小二乗法(OLS)、加重最小二乗法(WLS)、対角加重最小二乗法(DWLS)、および2段階最小二乗法が含まれることがよくあります。[ 30 ]
よくある問題の一つは、係数の推定値がモデルとデータによって十分に制約されていないために、識別不能になる可能性があることです。モデルとデータが一緒に係数の値を十分に制約または制限しない限り、唯一の最良推定値は存在しません。たとえば、2 つの変数間の単一のデータ相関の大きさは、それらの変数間のモデル化された効果の相互ペアの推定値を提供するには不十分です。相関は、相互効果の 1 つがもう 1 つの効果よりも強いか、もう 1 つの効果が 1 つの効果よりも強いか、または効果が等しい大きさであることによって説明できます。識別不能な効果推定値は、追加のモデルおよび/またはデータ制約を導入することによって識別可能になります。たとえば、相互効果は、一方の効果推定値をもう 1 つの効果推定値の 2 倍、3 倍、または同等に制約することによって識別可能になります[ 32 ]。ただし、結果として得られる推定値は、追加のモデル制約が世界の構造に対応している場合にのみ信頼できます。相互に因果関係にある変数のペアのうち一方のみを直接引き起こす第三の変数に関するデータも、識別に役立つことがあります。[ 31 ]第三の変数が相互に因果関係にある変数の一方を直接引き起こさないように制約すると、その第三の変数は、直接引き起こす変数と、間接的にしか影響を与えない「もう一方の」端の変数よりも強く相関している必要があるため、そうでなければ相互効果の推定を悩ませる対称性が崩れます。[ 31 ] これは、モデルの因果関係の仕様が適切であることを再び前提としていることに注意してください。つまり、第三の変数から相互効果のこの端の変数への直接的な効果が実際にあり、相互に結びついた変数のペアの「もう一方の端」の変数への直接的な効果がないということです。ヌル/ゼロ効果の理論的要求は、推定に役立つ制約を提供しますが、理論は、どの効果が存在しないとされているかを明確に報告しないことがよくあります。
モデル評価は、理論、データ、モデル、および推定戦略に依存します。したがって、モデル評価では以下を考慮します。
理論を検証または「調査」すると主張する研究では、偶然を超えたモデルとデータの不整合に注意を払う必要があります。推定では、モデルの自由係数を調整して、データに可能な限り最適な適合を提供します。SEMプログラムの出力には、推定されたモデル効果が実際に観測変数の値を制御する場合に観測されるであろう観測変数間の関係を報告するマトリックスが含まれます。モデルの「適合」は、モデルが示唆する関係(多くの場合、共分散)と、対応する変数間の観測された関係との一致または不一致を報告します。データとモデルの示唆との間に大きな有意差がある場合は、問題があることを示しています。χ²(カイ二乗)検定に伴う確率は、推定されたモデルが実際の基礎となる母集団の力であると仮定した場合に、データがランダムなサンプリング変動によって生じる可能性がある確率です。χ²の確率が小さい場合は、モデル化された構造が実際の母集団の因果関係の力であると仮定した場合に、現在のデータが生じる可能性は低いことを示しており、残りの差異はランダムなサンプリング変動に起因すると考えられます。
最適な係数推定値を選択したにもかかわらずモデルがデータと矛盾する場合、誠実な研究対応ではこの証拠(多くの場合、有意なモデル χ² 検定)を報告し、注意を払います。 [ 33 ]偶然を 超えたモデルとデータの矛盾は、矛盾の原因が問題のあるデータ、不適切な統計的推定、または誤ったモデル仕様のいずれであるかに関わらず、係数推定値とモデル構造を判断するモデルの能力の両方に課題を突きつけます。データと矛盾する(「失敗した」)モデルの係数推定値は、利用可能なデータと矛盾するモデルを信じる人にとって世界がどのように見えるかの報告として解釈可能です。データと矛盾するモデルの推定値は、統計的に奇妙になったり、理論に従って符号が間違っていたりして、必ずしも「明らかに間違っている」とは限りません。推定値は理論の要件に非常に近い場合もありますが、残りのデータの矛盾により、推定値と理論の一致は助けになりません。失敗したモデルは解釈可能ですが、利用可能な証拠と矛盾する解釈としてのみです。
複製では、データに不適切に適合する誤ったモデルを検出することは困難です。複製データが元のデータのランダムな変動範囲内にある場合、元のデータに不適切な適合をもたらしたのと同じ誤った係数配置が、複製データにも不適切に適合する可能性が高いからです。複製は、(異なる研究グループによって行われた)データミスなどの問題を検出するのに役立ちますが、探索的モデル修正後の誤った仕様の検出には特に弱いです。例えば、前半データの探索的因子分析(EFA)に続いて、後半データのランダムなデータに確認的因子分析を適用する場合などです。
修正指数とは、現在固定されている特定のモデル係数を推定対象から外した場合に、モデルのデータへの適合度がどの程度「改善」するか(ただし、モデルの構造がどの程度改善するかは必ずしも保証されない)を推定する指標です。データと矛盾するモデルに直面した研究者は、修正指数が適合度の大幅な改善をもたらす可能性が高いと報告する係数を容易に解放することができます。しかし、これは同時に、因果関係が誤っていて不適合なモデルから、因果関係は誤っているが適合するモデルへと移行する重大なリスクをもたらします。なぜなら、データへの適合度が向上したとしても、解放された係数が実質的に妥当であるか、あるいは現実世界と整合しているかの保証にはならないからです。元のモデルには、誤った方向の効果や、利用できない変数に関する誤った仮定など、因果関係の誤った指定が含まれている可能性があり、このような問題は現在のモデルに係数を追加しても修正できません。したがって、係数を追加することで適合度が向上したとしても、このようなモデルは依然として誤った指定のままです。適合しているものの現実と矛盾するモデルは、特定のモデル(例えば、望ましい数の因子を持つ因子モデル)に固執する研究者が、修正指標によって「示唆された」測定誤差共分散を挿入することで、当初は適合しなかったモデルを適合させた場合に特に発生しやすい。マッカラム(1986)は、「好ましい条件下であっても、仕様探索者から生じるモデルは慎重に検討する必要がある」ことを示した。[ 34 ]モデルの誤指定は、修正指標によって示唆された係数を挿入することで修正できる場合もあるが、類似しているが重要な点で異なる潜在変数のいくつかの指標を用いることで、より多くの修正の可能性が生まれる。[ 35 ]
失敗したモデルを「十分近い」と「受け入れる」ことも、妥当な代替案ではありません。注意すべき例として、Browne、MacCallum、Kim、Anderson、およびGlaserは、χ 2検定がモデルの誤指定を検出するのにかなりの力を持つ可能性がある(ただし、常に持つわけではない)理由の背後にある数学について論じました。[ 36 ] χ 2検定に伴う確率は、現在のモデルが最適な推定値とともに実際の基礎となる母集団の力を構成する場合、データがランダムなサンプリング変動によって生じる可能性がある確率です。小さなχ 2確率は、現在のモデル構造が実際の母集団の因果関係の力を構成する場合、現在のデータが生じる可能性は低いことを示しており、残りの差異はランダムなサンプリング変動に起因すると考えられます。Browne、McCallum、Kim、Andersen、およびGlaserは、 χ 2によるとモデルがデータと著しく矛盾しているにもかかわらず、許容できると考える因子モデルを提示しました。適合度が高ければ十分であるという彼らの主張の誤りは、Hayduk、Pazkerka-Robinson、Cummings、Levers、Beres [ 37 ]によって 実証された。彼らは、Browne らが見落としていた実験的特徴を組み込むことで、Browne らのデータに適合するモデルを示した。問題は、指標の計算やχ 2検定の過敏性にあるのではなく、Browne、MacCallum、および他の著者が、適合度の低さがモデルの仕様における問題の性質、位置、または深刻さに対応するとは限らないことを忘れ、無視し、または見落としていたことにある。[ 38 ]
多くの研究者は、χ 2 はサンプルサイズ (N) の増加とともに増加する (したがって χ 2 の確率は減少する) と主張して、モデルをテストするのではなく適合度指標に切り替えることを正当化しようとしました。この根拠に基づいてχ 2 を軽視することには 2 つの誤りがあります。まず、適切なモデルの場合、 χ 2 はN の増加とともに増加しません[ 33 ]。したがって、χ 2 がN とともに増加する場合、それ自体が検出可能な問題があることを示しています。次に、検出可能な誤指定のモデルの場合、χ 2 がN とともに増加すると、モデルの誤指定を検出する統計的検出力 (つまり、第 II 種の過誤を検出する検出力) が増加するという朗報が得られます。重要な誤指定の中には、χ 2では検出できないものもあります[ 38 ]。したがって、ランダムな変動によって合理的に生成される可能性のある範囲を超える適合不良は、報告および検討に値します[ 39 ] [ 33 ] 。調整される可能性のあるχ 2モデル検定 [ 40 ] は、利用可能な構造方程式モデル検定の中で最も強力です。
多数の適合度指標は、モデルがデータにどれだけ適合しているかを定量化しますが、すべての適合度指標は、適合度の悪さの大きさや量が、データの不整合を引き起こす問題の深刻さや性質と信頼できる形で整合していないという論理的な難点を抱えています。[ 38 ] 因果構造が異なり、データに同じように適合するモデルは、等価モデルと呼ばれてきました。[ 30 ]このようなモデルは、因果的に等価ではないものの、データ適合度は等価であるため、いわゆる等価モデルの少なくとも1つは、世界の構造と矛盾している必要があります。XとYの間に完全な1.0の相関があり、これをXがYの原因であるとモデル化すると、完全な適合と残差誤差はゼロになります。しかし、Yが実際にXの原因である場合、またはXとYの両方が共通の原因Zに反応している場合、または世界にはこれらの影響の混合(たとえば、共通の原因とYがXに与える影響など)または他の因果構造が含まれている可能性があるため、モデルは世界と一致しない可能性があります。完璧な適合は、モデルの構造が世界の構造に対応していることを必ずしも示すものではなく、ひいては、完璧な適合に近づくことが必ずしも世界の構造に近づくことに対応するとは限らないことを意味します。そうなる場合もあれば、そうでない場合もあります。そのため、研究者が、完璧なモデル適合であっても、モデルが因果関係を正しく規定していると主張するのは誤りです。中程度の複雑さのモデルであっても、完全に同等に適合するモデルは稀です。どのような指標であれ、データにほぼ適合するモデルは、必然的に、潜在的に重要でありながら未知のモデルの誤指定をもたらします。これらのモデルは、より大きな研究上の障害となります。
この論理的な弱点により、構造方程式モデルがデータと著しく矛盾する場合、すべての適合度指標は「役に立たない」ものとなるが、[ 39 ]いくつかの要因が適合度指標の使用を広め続けている。たとえば、ダグ・ソルボムは、最初の構造方程式モデリングプログラムの開発者であるカール・ヨレスコグに「なぜLISRELプログラムにGFIを追加したのですか?」と尋ねたところ、ヨレスコグは「ユーザーが、常にそのような大きなカイ二乗値を生成するならLISRELの使用をやめると脅してきた。だから、人々を満足させる何かを発明しなければならなかった。GFIはその目的を果たしている」と答えたと報告している。[ 41 ]モデルとデータの不一致を示すχ²の証拠は、統計的に確固としていたため、覆したり破棄したりすることはできなかったが、少なくとも人々は「厄介な」証拠から注意をそらす方法を得ることができた。追加の指標を開発したり、指標の挙動に関する調査を報告したり、モデルとデータの不整合の証拠をMDI(注意をそらす指標の山)の下に意図的に隠蔽したモデルを発表したりすることで、キャリア上の利益を依然として得ることができます。研究者が検出された誤った仕様を修正しようとするのではなく、因果的に間違ったモデルを「受け入れる」べき一般的な正当性はないようです。また、文献の一部では、「モデルを受け入れる」(指標値を「満たす」ことを根拠とする)ことが、帰無仮説の「受け入れ」に適用される批判の強化版に苦しんでいることに気づいていないようです。入門統計学の教科書では、通常、第II種過誤の可能性を認めるために、「受け入れる」という用語を「帰無仮説を棄却できなかった」に置き換えることを推奨しています。第III種過誤は、現在のデータでモデルを棄却するのに十分であるにもかかわらず、モデル仮説を「受け入れる」ことから生じます。
研究者が世界の構造を探求することに真剣に取り組んでいるかどうかは、根本的な問題である。モデルとデータの不整合のテスト証拠を、許容可能な適合性を示す指標の主張の背後に隠すことで、学問分野全体にわたるコストが発生し、学問分野の本質を構造的に改善した理解を得るために学問分野が行うことができたはずのことから注意が逸れてしまう。学問分野は、モデルの誤指定の証拠を指標に基づいて置き換えることで、実際にコストを支払うことになる。モデルの誤指定を修正する必要性についての意見の相違によって生じる摩擦は、非因子構造モデルの使用の増加、および類似しているが重要な点で異なる潜在変数の、より少なく、より正確な指標の使用の増加に伴って増加する可能性が高い。[ 35 ]
適合度指標を使用する際に考慮すべき事項には、以下の項目の確認が含まれます。
よく使われる適合度統計には以下のようなものがある。
次の表は、RMSEA(近似二乗平均平方根誤差)、SRMR(標準化二乗平均平方根残差)、CFI(確認適合度指標)、TLI(タッカー・ルイス指標)など、一般的な指標のこれらの特徴やその他の特徴を文書化した参考文献を示しています。AIC(赤池情報量規準)などの追加の指標は、ほとんどのSEM入門書で見つけることができます。[ 30 ]各適合度指標について、モデルとデータの間の十分な適合度を表すものについての決定は、研究者のモデリングの目的(おそらく他の誰かのモデルに異議を唱えること、または測定を改善すること)、モデルが「テスト済み」であると主張できるかどうか、および指標によって文書化された適合度の悪さの証拠を研究者が「無視」しても問題ないかどうかを反映しています。[ 33 ]
研究者たちは、安定した係数推定値と妥当な検定力を得るためにはサンプルサイズが十分大きい必要があるという点では一致しているが、具体的な必要サンプルサイズ、あるいは適切なサンプルサイズをどのように決定するかについて、一般的な合意はない。推奨事項は、推定する係数の数、モデル化変数の数、および特定のモデル係数を扱うモンテカルロシミュレーションに基づいている。[ 30 ] 指標の数と潜在変数の比率に基づくサンプルサイズの推奨事項は因子指向であり、固定された非ゼロの測定誤差分散を持つ単一の指標を使用するモデルには適用されない。[ 35 ] 全体として、統計的に推定が困難な係数のない中規模モデルの場合、必要なサンプルサイズ(N)は、すべての指標を使用する回帰に必要なNとほぼ同等であるように思われる。
サンプルサイズが大きいほど、因果的に均質でないケースが含まれる可能性が高くなります。したがって、望ましい係数を統計的に有意と報告できる可能性を高めるためにNを増やすと、モデルの誤指定のリスクと誤指定を検出する力の両方が同時に増加します。モデリングから学びたい(モデルの調整や置き換えが必要であることを学ぶ可能性も含む)研究者は、資金と、母集団に基づく因果的異質性/均質性の可能性に関する評価によって許容される限り、できるだけ大きなサンプルサイズを目指します。利用可能なNが膨大な場合、ケースのサブセットをモデリングすることで、そうでなければ因果的均質性を阻害する可能性のある変数を制御できます。モデルの欠陥を報告しなければならないかもしれないことを恐れる研究者は、関心のある構造係数を検出するのに十分な検出力を得るためにNを大きくしたい一方で、モデルとデータの不整合を示す可能性のある検出力を避けたいと、葛藤しています。モデル構造やデータ特性に大きなばらつきがあることから、適切なサンプルサイズを見つけるには、類似のデータを用いて推定された同規模・同程度の複雑さのモデルについて、他の研究者が得た経験(良い経験も悪い経験も)を参考にすることが有効かもしれない。
SEモデルの因果的解釈は最も明確で理解しやすいものですが、モデルの構造が世界の因果構造と一致しない場合、これらの解釈は誤りとなります。したがって、解釈はモデルの推定係数だけでなく、モデル全体の状態と構造を考慮に入れるべきです。モデルがデータに適合するかどうか、そしてどのようにデータに適合するようになったかは、解釈において最も重要です。探索によって、あるいは連続的な修正指標に従って得られたデータ適合性は、モデルが間違っていることを保証するものではありませんが、これらのアプローチはデータの特徴を誤ってモデル化する可能性が高く、深刻な疑念を生じさせます。例えば、必要な因子の数を調べるために探索を行うと、特に測定誤差共分散を含めることで因子モデルが適合するように「説得」された場合、データが因子構造ではないことが判明する可能性が高くなります。「修正指標が示唆する」効果や誤差共分散を不当に含めるたびに、想定されたモデルに反論するデータの能力は徐々に低下していきます。初期/基本モデルに複数の誤った仕様が含まれている場合、適切なモデルを復元することは非常に困難になります。[ 49 ]
直接効果の推定値は、回帰方程式の係数の解釈と並行して解釈されますが、因果関係が考慮されます。因果変数の値が1単位増加するごとに、他のすべての作用/モデル化された因果メカニズムを制御または調整した場合、従属変数の値の推定値の大きさが変化するとみなされます。間接効果も同様に解釈され、特定の間接効果の大きさは、その間接効果を構成する一連の直接効果の積に等しくなります。関係する単位は、観測変数の値の実際の尺度と、潜在変数に割り当てられた尺度値です。特定の指標に対する潜在変数の指定/固定された1.0の効果は、その指標の尺度を潜在変数の尺度と整合させます。モデルの残りの部分が一定または不変であるという仮定は、現実世界では実際の単位増加によって同時に引き起こされる可能性のある間接効果を割り引く必要がある場合があります。また、単位増加自体が現実世界で可能なことと矛盾する可能性があり、原因変数の値を変更する既知の方法がない場合もあります。モデルが測定誤差を調整する場合、その調整により、潜在レベルの効果を真のスコアの変動を参照していると解釈できます。[ 29 ]
SEMの解釈は、潜在変数を因果係数のネットワークで結ぶ場合、回帰分析の解釈とは大きく異なります。これは、回帰分析には間接効果の推定値が含まれていないためです。SEMの解釈は、背景変数から媒介変数を経て下流の従属変数に影響を及ぼす間接効果のパターンの結果を伝える必要があります。SEMの解釈は、複数の現実世界の因果経路がどのように協調して、あるいは独立して、あるいは互いに打ち消し合うのかを理解することを促します。直接効果は間接効果によって打ち消されたり(あるいは強化されたり)、共通原因の影響によって相関関係が打ち消されたり(あるいは強化されたり)する可能性があります。[ 16 ]特定の推定値の意味と解釈は、完全なモデルの中で文脈化されるべきです。
SEモデルの解釈では、特定のモデル因果セグメントを、その分散と共分散の意味合いに結びつける必要があります。単一の直接効果は、独立変数の分散が従属変数の値に特定の量の変動をもたらすことを示していますが、単一の効果係数には、その効果がどのように発生するかという構造化されたストーリーに統合できるサブコンポーネントが含まれていないため、何が正確にこれを引き起こすのかという因果関係の詳細は特定されません。原因と結果の間に介在する変数を組み込んだ、より詳細なSEモデルが必要となり、個々の効果がどのように機能するかについてのストーリーを構成する特徴を提供できるようになります。そのようなモデルが登場するまでは、推定された各直接効果には未知の要素が残り、それによって理論の本質が呼び起こされます。より詳細なモデルであっても、推定された各係数には同様の本質的な未知性が伴うため、SEモデルから根本的な謎の感覚が完全に消えることはありません。
たとえモデル化された各効果が、関係する変数の識別と効果の推定値以外には不明であっても、複数のモデル化された効果を結びつける構造は、観測された変数を調整するために物事がどのように機能するかを表現する機会を提供し、それによって有用な解釈の可能性をもたらします。たとえば、共通の原因は、影響を受ける 2 つの変数間の共分散または相関に寄与します。なぜなら、原因の値が上昇すれば、それぞれの原因の根底にある完全なストーリーがわからなくても、両方の効果の値も上昇するはずだからです (正の効果を仮定して)。[ 16 ] (相関とは、分散が 1.0 になるように標準化された 2 つの変数間の共分散です)。別の解釈への貢献は、2 つの原因変数が従属変数の分散をどのように説明できるか、また、そのような 2 つの原因間の共分散が従属変数の説明された分散をどのように増加または減少させるかを表現することによってなされる可能性があります。つまり、解釈には、効果と共分散のパターンが従属変数の分散の減少にどのように寄与するかを説明することが含まれる場合があります。[ 50 ]因果関係を理解することは暗黙のうちに「制御」を理解することにつながり、一部の変数は制御すべきだが他の変数は制御すべきでない理由を説明できる可能性がある。[ 5 ] [ 51 ]モデルが複雑になるにつれて、これらの基本的な要素は直感に反する方法で組み合わされる可能性があり、例えば、2 つの変数が直接的なゼロでない因果効果でつながっているにもかかわらず、相関がない (共分散がゼロ) 理由を説明できる。[ 16 ] [ 17 ] [ 7 ] [ 32 ]
効果推定値の統計的有意性の欠如は、推定値がヌル/ゼロ効果の周りのランダムサンプリング変動として容易に発生する可能性があることを示しているため、推定値を実際の効果として解釈することは曖昧になります。回帰と同様に、モデル化された原因の変動によって説明される各従属変数の分散の割合は R 2 によって提供されますが、従属変数が相互効果またはループ効果に関与している場合、または従属変数の誤差変数が予測変数の誤差変数と相関している場合は、ブロック誤差 R 2 を使用する必要があります。[ 52 ]
モデル評価の項で述べた注意点を改めて強調しておきます。モデルがデータと整合しているか否かにかかわらず、解釈は可能であるべきです。推定値は、モデルを信じる人が世界をどのように認識するかを示しています。たとえその信念が、モデル自体が誤っているために根拠のないものであったとしてもです。解釈においては、モデル係数が「パラメータ」に対応するとは限らないことを認識する必要があります。なぜなら、モデルの係数には、現実世界の構造的特徴が必ずしも対応しているとは限らないからです。
少数の明確な因果関係のある場所/変数で、元のモデルに出入りする新しい潜在変数を追加すると、係数の解釈を損なう可能性のあるモデルの誤指定を検出するのに役立ちます。新しい潜在変数の指標とすべての元の指標との相関は、元のモデルの構造をテストするのに役立ちます。なぜなら、少数の新しい焦点化された効果係数は、新しい指標を元の指標と調整するために、モデルの元の直接効果と間接効果と連携して機能する必要があるからです。元のモデルの構造に問題があった場合、疎な新しい因果関係は、新しい指標を元の指標と調整するのに不十分であり、それによってモデルとデータの不整合を通じて元のモデルの係数の不適切さを知らせます。[ 32 ]ゼロ/ゼロ効果係数と固定の非ゼロ値に割り当てられた係数に基づく相関制約は、モデルテストと係数推定の両方に貢献するため、推定値とその解釈を支える足場として認識されるべきです。[ 32 ]
相互作用、非線形性、複数のグループ、複数のレベル、カテゴリ変数を含むモデルでは、解釈が次第に複雑になります。[ 30 ] 因果ループ、相互効果、または相関残差に影響を与える効果も、若干の解釈の修正が必要です。[ 7 ] [ 32 ]
適合しないモデルと適合するモデルの両方を注意深く解釈することで、研究の進歩につながる可能性があります。信頼できるモデルであるためには、学術的に有益な因果構造を調査し、理解可能な推定値で適用可能なデータに適合し、無意味な係数を含まない必要があります。[ 53 ]信頼できる適合モデルは、適合しないモデルや不適切に無理やり適合させたモデルよりもまれですが、適切に適合するモデルは可能です。[ 37 ] [ 54 ] [ 55 ] [ 56 ]
PLS モデルの概念化の方法が複数あるため[ 57 ]、 PLS モデルの解釈が複雑になります。上記のコメントの多くは、PLS モデラーが、モデル化された指標が、既存のが利用できない潜在変数と一致するように組み合わされることを保証することで、現実主義的な視点を採用する場合に当てはまります。R 2やサンプル外予測力に主に焦点を当てた非因果的 PLS モデルは、モデルの係数が現実世界に対応するものがあるかどうかの懸念を減らすことで、解釈基準を変えます。Rigdon、Sarstedt、Ringle [ 57 ]が議論した 5 つの PLS モデリングの視点を区別する基本的な特徴は、PLS モデラーの目的の違い、および解釈を必要とするモデルの特徴の対応する違いを示しています。
実験や時系列調査が行われた場合でも、因果関係を主張する際には注意が必要です。因果モデルという用語は、「因果関係の仮定を伝えるモデル」を意味するものと理解されるべきであり、必ずしも検証済みの因果関係の結論を生み出すモデルを意味するものではありません。そうなる場合もあれば、そうでない場合もあります。複数の時点でデータを収集し、実験的または準実験的なデザインを使用することで、特定の競合する仮説を排除することができますが、ランダム化実験であっても、因果関係の主張に対する脅威を完全に排除することはできません。いかなる研究デザインも、因果構造を完全に保証することはできません。[ 5 ]
構造方程式モデリングには論争がつきまとう。因子分析の伝統を受け継ぐ研究者は、複数の指標のセットを、パス構造モデルで後で使用するために、より少なく、より扱いやすい尺度または因子スコアに削減することを一般的に試みる。これは段階的なプロセスであり、最初の測定ステップで、パス構造モデルで後で使用する尺度または因子スコアが得られる。この段階的なアプローチは当然のように思えるが、実際には深刻な根本的な欠陥を抱えている。段階への分割は、尺度または因子スコアが指標を適切に表しているか、および/または潜在レベルの効果を適切に報告しているかを徹底的に検証することを妨げている。測定レベルと潜在レベルの構造の両方を同時に組み込んだ構造方程式モデルは、潜在因子が指標を適切に調整しているかどうかを確認するだけでなく、同じ潜在因子が、各潜在因子の指標を、その潜在因子の理論上の原因および/または結果の指標と適切に調整しているかどうかも同時に確認する。[ 32 ]潜在因子がこれらの両方の調整スタイルを実行できない場合、その潜在因子の妥当性が疑問視され、その潜在因子を測定するとされる尺度または因子スコアが疑問視される。意見の相違は、想定される潜在因子の妥当性に異議を唱える証拠に対する尊重または軽視をめぐって渦巻いていた。くすぶり、時には沸騰する議論の結果、ジャーナル Structural Equation Modeling の特集号が Hayduk と Glaser による対象論文[ 21 ]に焦点を当て 、それに続くいくつかのコメントと反論[ 22 ]が続き、これらはすべて George Marcoulides の努力により無料で公開された。
これらの議論は、構造方程式モデルがデータとの整合性を検証すべきかどうかについての意見の相違を煽り、モデル検証が次の議論の焦点となった。パスモデリングの歴史を持つ研究者は慎重なモデル検証を擁護する傾向があり、因子モデリングの歴史を持つ研究者は適合度検証ではなく適合度指標を擁護する傾向があった。これらの議論は、ポール・バレットによる『パーソナリティと個人差』誌の論文[ 39 ]につながり 、彼は「実際、私は今、モデルの『受容性』または『不適合度』を示すものとして、そのような指標が論文に一切登場することを禁止することを推奨する」と述べた[ 39 ](821ページ)。バレットの論文には、両方の視点からのコメントも添えられていた[ 53 ] [ 58 ] 。
モデルテストに関する論争は、重大なモデルとデータの不整合を明確に報告することが義務付けられるようになったことで減少しました。科学者は、証拠が報告する内容が気に入らないという理由だけで、証拠を無視したり、報告しなかったりすることはできません。[ 33 ]モデルの誤指定を示す証拠に注意を払う必要性は、誤差変数/残差変数の独立性の欠如により推定を妨げるモデル誤指定のスタイルである「内生性」に対処するという最近の懸念の根拠となっています。一般的に、因子モデルを含む構造方程式モデルの因果的性質に関する論争も減少しています。因子分析の重鎮であるスタン・ムライクは、因子モデルの因果的根拠を認めています。[ 59 ] SEMの文脈における因果関係に関する神話についてのボーレンとパールのコメント[ 26 ]は、SEMの文脈における因果的思考の中心性を強化しました。
競合モデルに焦点を当てた、より簡潔な論争があります。競合モデルを比較することは非常に役立ちますが、2 つのモデルを作成して適合度の高いモデルを保持するだけでは解決できない根本的な問題があります。たとえば、Levy と Hancock (2007) [ 60 ]のようなプレゼンテーションの統計的な洗練さにより、研究者が 1 つのひどいモデルと 1 つの極めて悪いモデルから始めて、何らかの指標が極めて悪いモデルよりも適合度が高いと報告したために、構造的にひどいモデルを保持してしまう可能性があることを見落としやすくなります。Kline (2016) [ 30 ]のような、それ以外は優れた SEM のテキストでさえ、モデル テストのプレゼンテーションが依然として驚くほど弱いのは残念です。[ 61 ] 全体として、構造方程式モデリングによって貢献できることは、たとえ失敗したモデルがたまたま利用可能な最良のモデルであったとしても、慎重かつ詳細なモデル評価に依存します。
これまでの論争の周辺に触れた新たな論争が、火種を待っている。 複数の指標を持つ因子モデルや理論に埋め込まれた因子構造は失敗する傾向があり、弱い指標を削除するとモデルとデータの不整合が減少する傾向がある。指標の数を減らすと、構造方程式モデルで潜在変数を支持するために必要な最小限の指標の数について懸念や論争が生じる。因子の伝統に縛られた研究者は、潜在変数ごとに指標の数を3つに減らすよう説得されるかもしれないが、3つ、あるいは2つの指標でも、提案された根本的な因子の共通原因と矛盾する可能性がある。HaydukとLittvay(2012)[ 35 ]は、モデル化された各潜在変数に単一の指標のみを使用する場合、測定誤差についてどのように考え、擁護し、調整するかについて議論した。単一の指標はSEモデルで長い間効果的に使用されてきたが[ 54 ]、論争は因子分析の観点からのみ測定を検討した査読者のすぐそばに残っている。
こうした論争は減少傾向にあるものの、SEMの文献にはその痕跡が散見され、次のような質問をすれば容易に意見の相違が生じる。データと著しく矛盾するモデルをどう扱うべきか?あるいは、モデルの単純さは、データの矛盾の証拠に対する尊重を凌駕するのか?あるいは、いくつかのモデルについて、データへの適合度が近い、あるいはそれほど近くない指標に、どの程度の重みを与えるべきか?あるいは、データと矛盾する簡潔なモデルに対して、特に寛容になり、「報いる」べきなのか?あるいは、RMSEAが各モデルの自由度における実際の不適合を無視することを容認していることを考えると、RMSEAがゼロでない帰無仮説でモデルをテストする人々は、不十分なモデルテストを行っていることになるのではないか?こうした疑問に説得力をもって答えるには、統計学的な洗練度の大きなばらつきが必要となるが、回答はおそらく、研究者が証拠を報告し尊重する必要があるかどうかという非技術的な問題に集中するだろう。
Structural equation modeling can be defined as a class of methodologies that seeks to represent hypotheses about the means, variances, and covariances of observed data in terms of a smaller number of 'structural' parameters defined by a hypothesized underlying conceptual or theoretical model.
{{cite book}}: CS1メンテナンス: 場所の発行元が見つかりません (リンク)