
多変量統計学において、探索的因子分析(EFA)は、比較的多数の変数の根底にある構造を明らかにするために使用される統計的手法です。EFAは因子分析の手法の一つであり、その包括的な目標は、測定変数間の根底にある関係を特定することです。[ 1 ]研究者は、尺度(尺度は、特定の研究テーマを測定するために使用される質問の集合)を開発する際にEFAをよく使用し、一連の測定変数の根底にある潜在的構成概念を特定します。 [ 2 ]研究者が測定変数の因子やパターンについて事前の仮説を持たない場合にEFAを使用する必要があります。 [ 3 ]測定変数は、観察および測定可能な人々の属性のいずれかです。測定変数の例としては、人間の身長、体重、脈拍数などが挙げられます。通常、研究者は多数の測定変数を持ち、それらは少数の「観察されていない」因子に関連していると想定されます。研究者は、分析に含める測定変数の数を慎重に検討する必要があります。[ 2 ] EFAの手順は、分析において各因子が複数の測定変数によって表される場合に、より正確になります。
EFAは共通因子モデルに基づいています。[ 1 ]このモデルでは、観測変数は共通因子、固有因子、および測定誤差の関数として表現されます。各固有因子は1つの観測変数にのみ影響を与え、観測変数間の相関関係は説明しません。共通因子は複数の観測変数に影響を与え、「因子負荷量」は共通因子が観測変数に与える影響の尺度です。[ 1 ] EFA手順では、共通因子とそれに関連する観測変数を特定することに重点を置きます。
EFAは、あらゆる指標/測定変数があらゆる因子と関連付けられる可能性があると仮定します。尺度を開発する際、研究者は確認的因子分析に進む前にまずEFAを使用する必要があります。[ 4 ] EFAは、一連の測定変数の根底にある因子/構成概念を決定するために不可欠です。一方、確認的因子分析では、観測された変数とそれらの根底にある潜在因子/構成概念との間に関係が存在するという仮説を研究者が検証できます。[ 5 ] EFAには決まった方法がないため、研究者は分析の実施方法について多くの重要な決定を下す必要があります。
適合手順は、モデルの因子負荷量と固有分散を推定するために使用されます(因子負荷量は、項目と因子の間の回帰係数であり、共通因子が測定変数に与える影響を測定します)。選択できる因子分析適合方法はいくつかありますが、それらの長所と短所に関する情報はほとんどなく、一貫して使用される正確な名前さえ持っていないものも多くあります。主軸因子法(PAF)と最尤法(ML)は、一般的に推奨される2つの抽出方法です。一般的に、データが正規分布しているか、正規性の仮定が破られているかに応じて、MLまたはPAFが最良の結果をもたらします。[ 2 ]
最尤法には、モデルの適合度を示すさまざまな指標を計算できる、因子負荷量の統計的有意性を検定できる、因子間の相関を計算し、これらのパラメータの信頼区間を計算できるなど、多くの利点があります。[ 6 ]データが正規分布している場合は、ML が最適な選択肢です。なぜなら、「モデルの適合度を示すさまざまな指標を計算でき、因子負荷量と因子間の相関の統計的有意性検定と信頼区間の計算が可能」だからです。[ 2 ]
「主軸因子分析」と呼ばれるのは、最初の因子が可能な限り多くの共通分散を説明し、次に2番目の因子が次に多くの分散を説明する、というように続くからです。PAFは記述的な手法なので、対象がサンプルのみであり、結果をサンプル外に一般化する予定がない場合に最適です。PAFの欠点は、最尤法(ML)に比べて適合度指標の範囲が限られていること、および信頼区間や有意性検定を計算できないことです。
モデルに含める因子の数を選択する際、研究者は簡潔性(比較的因子が少ないモデル)と妥当性(測定変数間の相関関係を適切に説明するのに十分な因子があること)のバランスを取るように努めなければならない。[ 7 ]
過剰要因化とは、モデルにあまりにも多くの要因が含まれることであり、研究者が理論的価値の低い構成概念を提唱してしまう可能性がある。
因子不足は、モデルに含まれる因子が少なすぎる場合に発生します。モデルに含まれる因子が十分でない場合、大きな誤差が生じる可能性が高くなります。モデルに含まれていない因子に負荷がかかる測定変数は、含まれている因子に誤って負荷がかかる可能性があり、真の因子負荷量を変化させてしまいます。その結果、2つの因子が1つの因子に結合されるような回転解が生じ、真の因子構造が不明瞭になる可能性があります。
EFAにおいて保持すべき最適な因子数を決定するために設計された手順は数多く存在する。概して言えば、既存の手順のほとんどは、(1)共分散行列の固有値のパターンを調べるか、(2)モデル選択問題として扱うことによって、適切な因子数を決定するアプローチをとっている。[ 8 ]既存のアプローチには、Kaiser (1960) の固有値1より大きいルール (または K1 ルール)、[ 9 ] Cattell (1966) のスクリー プロット、[ 10 ] Revelle と Rocklin (1979) の非常に単純な構造基準、[ 11 ]モデル比較手法、[ 12 ] Raiche、Roipel、および Blais (2006) の加速係数と最適座標、[ 13 ] Velicer (1976) の最小平均部分、[ 14 ] Horn (1965) の並列解析、および Ruscio と Roche (2012) の比較データが含まれます。[ 15 ]これらの手法の堅牢性を評価する最近のシミュレーション研究では、後者の 5 つの手法が実務者がデータを慎重にモデル化するのに役立つことが示唆されています。[ 15 ]これらの 5 つの最新技術は、IBM SPSS Statistics ソフトウェア (SPSS) と R (R Development Core Team、2011) を統合して使用することで簡単に利用できるようになりました。連続データ、順序データ、および異種 (連続データと順序データ) に対してこれらの手順を実行する方法については、Courtney (2013) [ 16 ]を参照してください。
RevelleとRocklin(1979)の非常に単純な構造基準、モデル比較手法、およびVelicer(1976)の最小平均部分を除いて、他のすべての手順は固有値の分析に依存しています。因子の固有値は、その因子によって説明される変数の分散の量を表します。固有値が低いほど、その因子が変数の分散を説明するのに寄与する割合は小さくなります。[ 1 ]
上記9つの手順それぞれについて、以下に簡単な説明を記載します。
アメリカの心理学者ヘンリー・フェリックス・カイザーにちなんで名付けられたカイザー基準は、相関行列の固有値を計算し、これらの固有値のうち 1 より大きいものがいくつあるかを数えることによって因子の数を決定します。[ 9 ]この数がモデルに含める因子の数です。この手順の欠点は、非常に恣意的であることです (たとえば、固有値 1.01 は含まれますが、固有値 0.99 は含まれません)。この手順は、因子の過剰選択や、場合によっては因子の不足につながることが多く、より現代的な方法と比較して最適ではないと広く考えられています。[ 2 ] K1 基準の問題点の深刻さを軽減するために、研究者が各固有値の信頼区間を計算し、信頼区間全体が 1.0 より大きい因子のみを保持する K1 基準の変形が作成されました。[ 17 ] [ 18 ]

相関行列の固有値を計算し、値を大きい順から小さい順にプロットします。グラフを調べて、固有値の大きさの最後の大きな低下を特定します。最後の低下の前にプロットされた点の数が、モデルに含める因子の数です。[ 10 ]この方法は主観的であるため(つまり、大きな低下を構成するものについての明確な客観的定義がないため)、批判されています。[ 19 ]この手順は主観的であるため、Courtney (2013) はこれを推奨していません。[ 16 ]
RevelleとRocklin(1979)のVSS基準は、各項目の最も高い負荷量のみを保持し、他のすべての負荷量をゼロに設定した簡略化されたパターン行列によって元の相関行列がどの程度再現されるかを評価することで、この傾向を操作化します。再現の程度を評価するためのVSS基準は0から1の間の値を取り、因子解の適合度を測る尺度です。VSS基準は、1つの因子(k = 1)からユーザーが指定した理論上の最大因子数までの因子解から収集されます。その後、最も高いVSS基準を提供する因子解によって、行列内の解釈可能な因子の最適な数が決定されます。項目が複数の因子と共変動するデータセット(つまり、より因子的に複雑なデータ)に対応するために、最も高い2つの負荷量を保持し、残りをゼロに設定した簡略化されたパターン行列を使用して基準を実行することもできます(最大VSS複雑度2)。コートニーは、VSS基準の性能に関する堅牢なシミュレーション研究が不足しているため、VSSを推奨していません。[ 16 ]
複雑さの異なる複数のモデルの中から、最適なモデルを選択します。研究者は適合度指標を用いて、因子数がゼロのモデルから始め、因子数を徐々に増やしながらモデルを構築していきます。最終的な目標は、より単純なモデル(因子数が少ないモデル)よりもデータの説明力が大幅に高く、かつより複雑なモデル(因子数が多いモデル)と同等の説明力を持つモデルを選択することです。
モデルの適合性を評価するために使用できるさまざまな方法があります: [ 2 ]
キャッテル (1966) のスクリー テストの主観的な弱点を克服しようとして、[ 10 ] [ 28 ]は 2 つの非グラフ的解法を提示した。最初の方法は最適座標 (OC) と呼ばれ、固有値とその前の座標に関連付けられた勾配を測定することによってスクリーの位置を決定しようとする。2 番目の方法は加速係数 (AF) と呼ばれ、曲線の傾きが最も急激に変化する座標を決定するための数値解法に関するものである。これらの方法は両方とも、シミュレーションで K1 法を上回った。[ 15 ] Ruscio と Roche の研究 (2012) [ 15 ]では、 OC 法は 74.03% の確率で正しく、PA 法 (76.42%) に匹敵した。AF 法は 45.91% の確率で正しく、過小評価する傾向があった。ピアソン相関係数を用いて生成されたOC法とAF法は、RuscioとRoche(2012)のシミュレーション研究で検討された。結果は、2~7の順序尺度応答カテゴリ(C = 2-7)および準連続(C = 10または20)データ状況において、両方の手法が非常に良好に機能することを示唆した。シミュレーションにおけるこれらの手順の精度を考慮すると、EFAで保持する因子の数を決定するために強く推奨される。これは、Courtneyが推奨する5つの現代的な手順の1つである。[ 16 ]
Velicer (1976) の MAP テスト[ 14 ]は、「完全な主成分分析に続いて、一連の偏相関行列の検討を行う」ものです (p. 397)。ステップ「0」の二乗相関 (図 4 を参照) は、偏りのない相関行列の非対角相関の二乗平均値です。ステップ 1 では、最初の主成分とその関連項目が偏り除去されます。その後、ステップ 1 の次の相関行列の非対角相関の二乗平均値が計算されます。ステップ 2 では、最初の 2 つの主成分が偏り除去され、結果として得られる非対角相関の二乗平均値が再び計算されます。計算は k マイナス 1 ステップ (k は行列内の変数の総数を表す) で実行されます。最後に、すべてのステップの二乗相関の平均値と、最も低い二乗相関の平均値となったステップ番号によって、保持する成分または因子の数が決まります (Velicer、1976)。この方法では、相関行列の分散が残差分散や誤差分散ではなく系統的分散を表している限り、成分が維持されます。 方法論的には主成分分析に似ていますが、MAP 手法は、複数のシミュレーション研究で保持する因子の数を決定する際に非常に優れたパフォーマンスを発揮することが示されています。[ 15 ] [ 29 ]ただし、ごく少数のケースでは、MAP は未知の理由でデータセットの因子の数を大幅に過大評価する可能性があります。[ 30 ]この手順は、SPSS のユーザー インターフェースを通じて利用できます。ガイダンスについては、Courtney (2013) [ 16 ]を参照してください。これは、彼が推奨する 5 つの最新の手順の 1 つです。
PA テストを実行するには、ユーザーは相関行列の固有値を計算し、値を大きい順にプロットし、次にランダムな固有値のセットをプロットします。交点より前の固有値の数は、モデルに含める因子の数を示します。[ 21 ] [ 31 ] [ 32 ] この手順はやや恣意的になる可能性があります (つまり、カットオフをちょうど満たす因子は含まれ、わずかに下回る因子は含まれません)。[ 2 ]さらに、この方法はサンプル サイズに非常に敏感で、PA はサンプル サイズが大きいデータセットでより多くの因子を示唆します。[ 33 ]欠点があるにもかかわらず、この手順はシミュレーション研究で非常にうまく機能し、Courtney が推奨する手順の 1 つです。[ 16 ] PA は、R や SPSS などの一般的に使用されている統計プログラムに実装されています。
2012年、RuscioとRoche [ 15 ]は、PA法を改良する試みとして比較データ(CD)手順を導入しました。著者らは、「サンプリング誤差のみを考慮するランダムなデータセットを生成するのではなく、既知の因子構造を持つ複数のデータセットを分析し、実際のデータの固有値のプロファイルを最もよく再現するものを決定する」と述べています(p. 258)。この手順の強みは、サンプリング誤差だけでなく、項目の因子構造と多変量分布も組み込むことができる点です。RuscioとRoche(2012)のシミュレーション研究[ 15 ]では、CD手順が保持すべき因子の正しい数を決定することを目的とした他の多くの方法よりも優れていることが分かりました。この研究では、ピアソン相関を利用したCD手法が、正しい因子の数を87.14%の確率で正確に予測しました。ただし、このシミュレーション研究では5つ以上の因子は扱われていません。したがって、5つ以上の因子を超える因子構造を推定するためのCD手順の適用可能性はまだ検証されていません。コートニーはこの手順を推奨リストに含めており、SPSSのユーザーインターフェース内から簡単に実行できる方法を示すガイドラインを提供している。[ 16 ]
2023年、ゴレツコとルシオはCDアプローチの拡張として比較データフォレストを提案した。[ 34 ]
ヘンソンとロバーツ(2006)による60の学術論文のレビューでは、PAやヴェリサー(1976)の最小平均部分(MAP)手順など、収束を見つけるために複数の最新技術を使用したものはなかったことがわかった。ルシオとロッシュ(2012)のシミュレーション研究は、収束を求めることの経験的利点を示した。CD手順とPA手順が一致した場合、推定された因子数の精度は92.2%の確率で正しかった。ルシオとロッシュ(2012)は、さらなるテストが一致した場合、推定の精度をさらに高めることができることを示した。[ 16 ]
心理測定学の分野における最近のシミュレーション研究では、並列分析、最小平均部分検定、比較データ手法は、さまざまなデータ状況に応じて改善できることが示唆されています。たとえば、シミュレーション研究では、順序データの場合、最小平均部分検定の性能は、ピアソン相関ではなくポリコリック相関を利用することで改善できます。Courtney (2013) [ 16 ]は、これら 3 つの手順をそれぞれ SPSS インターフェース内で最適化して同時に実行する方法を詳しく説明しています。
因子回転は、EFAでよく用いられる手順であり、因子行列の解釈を助けるために使われます。[ 35 ] [ 36 ] [ 37 ] 2つ以上の因子を持つ任意の解に対して、データを同様にうまく説明する因子の向きは無限に存在します。唯一の解がないため、研究者は無限の可能性の中から1つの解を選択する必要があります。因子回転の目標は、多次元空間で因子を回転させて、最も単純な構造を持つ解に到達することです。ここで、単純な構造とは、 m個の列を持つ因子行列を指し、次のようになります。 [ 35 ]
因子回転には、直交回転と斜交回転という2つの主要な種類があります。
直交回転では、因子が互いに直交し、したがって無相関になるように制約されます。直交回転の利点は、その単純さと概念的な明快さですが、いくつかの欠点もあります。社会科学では、構成概念が相関していることを期待する理論的根拠がしばしばあるため、直交回転はこれを許容しないため、あまり現実的ではない可能性があります。また、直交回転は因子が無相関であることを要求するため、単純な構造の解を生成する可能性が低くなります。[ 2 ]
バリマックス回転は、因子軸を直交回転させて、因子行列内のすべての変数(行)に対する因子(列)の二乗負荷量の分散を最大化するもので、抽出された因子によって元の変数を区別する効果があります。各因子は、特定の変数に対して大きな負荷量または小さな負荷量を持つ傾向があります。バリマックス解は、各変数を単一の因子でできるだけ簡単に識別できる結果をもたらします。これは最も一般的な直交回転オプションです。[ 2 ]
Quartimax回転は、各因子ではなく各変数の二乗負荷量を最大化する直交回転です。これにより、各変数を説明するために必要な因子の数が最小化されます。このタイプの回転では、多くの場合、ほとんどの変数が高または中程度の負荷量を持つ一般的な因子が生成されます。[ 38 ]
エクイマックス回転は、バリマックス基準とクォーティマックス基準の中間的な妥協点である。
斜交回転では、因子間の相関関係を考慮できます。斜交回転の利点は、因子間に相関関係があると予想される場合に、より単純な構造を持つ解が得られること、および因子間の相関関係の推定値が得られることです。[ 2 ]因子間に相関関係がない場合、これらの回転は直交回転と同様の解を生成する可能性があります。
斜回転法にはいくつかの一般的な方法があります。直接オブリミン回転は標準的な斜回転法です。プロマックス回転は、オブリミン回転よりも計算が容易なため、古い文献でよく見られます。その他の斜回転法には、直接クォータミン回転とハリス・カイザー直交回転があります。[ 2 ]
一般的な因子分析ソフトウェアは、回転なし解を生成することができます。これは、主軸因子分析を行い、それ以上の回転を行わない結果を指します。いわゆる回転なし解は、実際には最初の因子の分散を最大化する直交回転です。回転なし解は、ほとんどの変数に負荷量を持つ一般因子を与える傾向があります。これは、スクリープロット上で1つまたは少数の支配的な固有値によって示されるように、多くの変数が互いに相関している場合に役立ちます。
文化の違いに関する研究のメタ分析により、回転していない解の有用性が強調されました。これにより、文化の違いに関する多くの発表された研究が同様の因子分析結果を示しているものの、回転の仕方が異なっていることが明らかになりました。因子回転は、異なる研究の結果間の類似性や強力な一般因子の存在を不明瞭にしていましたが、回転していない解ははるかに類似していました。[ 39 ] [ 40 ]
因子負荷量は、測定変数に対する因子の強さと方向を示す数値です。因子負荷量は、因子が測定変数にどの程度強く影響するかを示します。モデル内の因子にラベルを付けるには、研究者は因子パターンを調べて、どの項目がどの因子に高い負荷を持っているかを確認し、それらの項目に共通するものを決定する必要があります。[ 2 ]項目に共通するものが、因子の意味を示します。解釈は、分析プロセスの重要だが難しい部分として長い間指摘されてきました。[ 41 ]
しかし、探索的因子分析は変数間の潜在的な構造を明らかにする強力なツールである一方で、適切な理論化なしにそれに依存することは避ける必要がある。アームストロング[ 42 ]の批判は、理論的枠組みなしにEFAを実施すると、誤解を招く解釈につながる可能性があることを強調している。たとえば、金属のさまざまな物理的特性の分析を含む架空のケーススタディでは、EFAの結果は真の潜在的な因子を特定できず、代わりに観測された変数間の関係の単純さを覆い隠す「過剰因子化」モデルを生成した。同様に、不適切に設計された調査項目は、偽の因子構造につながる可能性がある。[ 43 ]
{{cite web}}: CS1 maint: タイトルとしてアーカイブされたコピー (リンク){{cite web}}: CS1 maint: タイトルとしてアーカイブされたコピー (リンク)