統計学において、確認的因子分析(CFA )は因子分析の特殊な形式であり、社会科学研究で最も一般的に使用されています。[ 1 ]これは、構成概念の測定値が、その構成概念(または因子)の性質に関する研究者の理解と一致しているかどうかを検証するために使用されます。したがって、確認的因子分析の目的は、データが仮説的な測定モデルに適合するかどうかを検証することです。この仮説的なモデルは、理論および/または以前の分析研究に基づいています。[ 2 ] CFAは、 Jöreskog(1969)によって最初に開発され[ 3 ] 、Campbell & Fiske(1959)で説明されているMTMMマトリックスなどの構成概念妥当性を分析する古い方法に基づいて構築され、それらに取って代わりました。[ 4 ]
確認的因子分析では、研究者はまず、使用する尺度の根底にあると考えられる因子(例えば、「うつ病」がベックうつ病尺度とハミルトンうつ病評価尺度の根底にある因子であるなど)に関する仮説を立て、これらの事前仮説に基づいてモデルに制約を課すことがあります。これらの制約を課すことで、研究者はモデルが自身の理論と整合するように強制します。例えば、尺度の共分散を説明する因子が2つあり、これらの因子は互いに無関係であると仮定した場合、研究者は因子Aと因子Bの相関をゼロに制約するモデルを作成できます。その後、モデル適合度指標を取得して、提案されたモデルがモデル内のすべての項目または尺度間の共分散をどの程度適切に捉えているかを評価できます。研究者がモデルに課した制約がサンプルデータと整合しない場合、モデル適合度の統計的検定の結果は適合度が低いことを示し、モデルは棄却されます。適合度が低い場合、一部の項目が複数の因子を測定していることが原因である可能性があります。また、ある因子内の項目の中には、他の項目よりも互いに関連性が高いものがある可能性もある。
一部のアプリケーションでは、「ゼロ負荷」(特定の因子に負荷しないと想定される指標)の要件が厳しすぎると考えられてきました。新たに開発された分析手法である「探索的構造方程式モデリング」は、観測された指標と想定される主要な潜在因子との関係についての仮説を指定すると同時に、他の潜在因子との負荷の推定も可能にします。[ 5 ]
確認的因子分析では、研究者は通常、観測可能な確率変数のp x 1 ベクトルに対する応答が、1 つ以上の観測不可能な変数に値を割り当てるためにどの程度使用できるかを研究することに関心を持っています。この調査は、主に、観測されない潜在変数の側面を捉えるために使用される各項目の負荷量を推定および評価することによって行われます。つまり、y[i]は、観測されない潜在変数によって予測される観測応答のベクトルです。これは次のように定義されます。
、
どこは観測された確率変数のp x 1 ベクトルであり、は観測されない潜在変数であり、はp x k行列であり、 k は潜在変数の数に等しい。[ 6 ]なぜなら、不完全な尺度であるこのモデルには誤差も含まれており、最尤法(ML)の場合の推定値は、適合関数を繰り返し最小化することによって生成されます。
どこは、提案された因子分析モデルによって示される分散共分散行列であり、は観測された分散共分散行列です。[ 6 ]つまり、モデルによって示される分散共分散行列と観測された分散共分散行列の差を最小にする自由モデルパラメータの値が求められます。
CFAモデルを推定するために数多くのアルゴリズムが使用されてきましたが、最尤法(ML)が依然として主要な推定手順となっています。[ 7 ]とはいえ、CFAモデルは、有効なML推定の通常の理論要件から逸脱するデータ条件に適用されることがよくあります。たとえば、社会科学者は、非正規データと離散順序カテゴリを使用して尺度化された指標でCFAモデルを推定することがよくあります。[ 8 ]そのため、応用研究者が遭遇する多様なデータ条件に対応する代替アルゴリズムが開発されてきました。代替推定量は、(1)ロバスト推定量と(2)限定情報推定量の2つの一般的なタイプに分類されます。[ 9 ]
正規理論の仮定から逸脱したデータでMLを適用すると、CFAモデルは偏ったパラメータ推定値と誤解を招く結論を生成する可能性があります。[ 10 ]ロバスト推定は通常、正規理論モデルのχ2と標準誤差を調整することで問題を修正しようとします。[ 9 ] 例えば、SatorraとBentler(1994)は、通常の方法でML推定を使用し、その後、モデルのχ2を多変量尖度の尺度で割ることを推奨しました。[ 11 ]ロバストML推定量のもう1つの利点は、一般的なSEMソフトウェア(例:LAVAAN)で利用できることです。[ 12 ]
残念ながら、頑健な ML 推定量は一般的なデータ条件下では維持できなくなる可能性があります。特に、指標が少数の応答カテゴリ (たとえば、反対、中立、賛成) を使用してスケーリングされている場合、頑健な ML 推定量は性能が低下する傾向があります。[ 10 ]顕在指標が順序形式をとる場合、重み付き最小二乗法(WLS)などの限定情報推定量はより良い選択肢となる可能性があります。 [ 13 ]概して、限定情報推定量は、CFA モデルに適合するためにポリコリック相関を使用することで、順序指標に対応します。 [ 14 ]ポリコリック相関は、カテゴリ化された形式のみが観測される場合に、2 つの潜在変数間の共分散を捉えます。これは主に閾値パラメータの推定によって達成されます。[ 15 ]
探索的因子分析(EFA)と確認的因子分析(CFA)はどちらも、測定変数の共通分散を理解するために用いられ、その分散は因子または潜在構成概念に起因すると考えられる。しかし、このような類似性にもかかわらず、EFAとCFAは概念的にも統計的にも異なる分析手法である。
EFA の目標は、データに基づいて因子を特定し、説明される分散の量を最大化することです。[ 16 ]研究者は、いくつの因子が出現するか、またこれらの因子がどのような項目や変数で構成されるかについて、特定の仮説を持つ必要はありません。これらの仮説が存在する場合、それらは統計分析に組み込まれず、結果に影響を与えません。対照的に、CFA は事前の仮説を評価し、主に理論によって推進されます。CFA 分析では、研究者は、因子の数、これらの因子が相関しているかどうか、どの項目/尺度がどの因子に負荷し、どの因子を反映するかを事前に仮説する必要があります。[ 17 ]そのため、すべての負荷が自由に変化できる探索的因子分析とは対照的に、CFA では特定の負荷をゼロに明示的に制約することができます。
尺度開発の初期段階では、CFA よりも EFA の方が適切だと考えられることが多い。なぜなら、CFA では項目が仮説に基づかない因子にどの程度負荷しているかが分からないからである。[ 18 ] EFA を最初に使うべきもう一つの強力な理由は、尺度開発の初期段階で因子の数を誤って指定しても、確認的因子分析では通常検出されないからである。尺度開発の後期段階では、確認的手法によって競合する因子構造を明確に対比することで、より多くの情報が得られる可能性がある。[ 18 ]
EFAは、CFAの方がより適切な統計的手法であるにもかかわらず、研究で報告されることがある。[ 19 ] CFAは探索的に使用すると制約が多く不適切になる可能性があると主張されている。[ 20 ]しかし、CFAが「確認的」分析のみであるという考えは、CFAで使用される修正指標が本質的にある程度探索的であるため、誤解を招く可能性がある。修正指標は、特定の係数が制約されなくなった場合にモデル適合度がどれだけ改善されるかを示す。[ 21 ]同様に、EFAとCFAは相互に排他的な分析である必要はなく、EFAは適合度の低いCFAモデルに対する妥当なフォローアップであると主張されている。[ 22 ]
構造方程式モデリングソフトウェアは、通常、確認的因子分析を実行するために使用されます。LISREL [ 23 ]、EQS [ 24 ]、AMOS [ 25 ] 、 Mplus [ 26 ]、Jamovi [ 27 ]、および R の LAVAAN パッケージ[ 28 ]は、よく使用されるソフトウェア プログラムです。Python パッケージsemopy 2 [ 29 ]もあります。CFAは、構造方程式モデルで提案された測定モデルを評価する最初のステップとしてもよく使用されます。構造方程式モデリングにおけるモデル適合とモデル修正の評価に関する解釈ルールの多くは、 CFA にも同様に適用されます。CFA は、潜在因子間に方向性のある矢印がないという点で、構造方程式モデリングと区別されます。言い換えれば、CFA では因子が互いに直接原因となることは想定されていませんが、SEM では特定の因子と変数が因果関係にあると指定されることがよくあります。 SEMの文脈では、CFAはしばしば「測定モデル」と呼ばれ、潜在変数間の関係(方向矢印で示される)は「構造モデル」と呼ばれます。
CFAでは、モデルがデータにどれだけ適合しているかを判断するために、いくつかの統計的検定が使用されます。[ 16 ]モデルとデータの間の適合が良いということは、モデルが「正しい」という意味でも、共分散の大部分を説明しているという意味でもないことに注意してください。「モデルの適合が良い」とは、モデルが妥当であることを示すだけです。[ 30 ]確認的因子分析の結果を報告する際には、次のことを報告することが推奨されます。a) 提案されたモデル、b) 行われた修正、c) 各潜在変数を識別する尺度、d) 潜在変数間の相関、e) 制約が使用されているかどうかなど、その他の関連情報。[ 31 ]報告するモデル適合統計を選択することに関しては、最も適合度が高いと推定される統計を単純に報告するべきではありません。様々な意見が存在するものの、Kline (2010) は、カイ二乗検定、近似二乗平均平方根誤差 (RMSEA)、比較適合度指標(CFI)、標準化二乗平均平方根残差 (SRMR) を報告することを推奨している。[ 1 ]
絶対適合度指標は、事前モデルがデータにどれだけ適合しているか、またはデータをどれだけ再現しているかを決定します。[ 32 ]絶対適合度指標には、カイ二乗検定、RMSEA、GFI、AGFI、RMR、SRMRなどが含まれますが、これらに限定されません。[ 33 ]
カイ二乗検定は、観測された共分散行列と期待される共分散行列の差を示します。ゼロに近い値ほど適合度が高いことを示します。つまり、期待される共分散行列と観測された共分散行列の差が小さいほど適合度が高いということです。 [ 21 ]カイ二乗統計は、ネストされたモデルのデータへの適合度を直接比較するためにも使用できます。ただし、モデル適合度のカイ二乗検定の難点は、サンプルサイズが小さい場合は不適切なモデルを棄却できず、サンプルサイズが大きい場合は適切なモデルを棄却できない可能性があることです。[ 21 ]そのため、他の適合度尺度が開発されています。
近似の二乗平均平方根誤差(RMSEA)は、最適に選択されたパラメータ推定値を持つ仮説モデルと母集団共分散行列との間の不一致を分析することで、サンプルサイズの問題を回避します。[ 33 ] RMSEAは0から1の範囲で、値が小さいほどモデルの適合性が高いことを示します。0.06以下の値は、許容できるモデルの適合性を示します。[ 34 ] [ 35 ]
二乗平均平方根残差 (RMR) と標準化二乗平均平方根残差 (SRMR) は、標本共分散行列とモデル共分散行列の差の平方根です。[ 33 ]ただし、RMR は、その範囲がモデル内の指標のスケールに基づいているため、解釈がやや難しい場合があります (スケールが異なる複数の指標がある場合、これは厄介になります。たとえば、2 つの質問票があり、一方は 0 ~ 10 スケール、もう一方は 1 ~ 3 スケールです)。[ 1 ]標準化二乗平均平方根残差は、この解釈の難しさを解消し、0 ~ 1 の範囲をとり、0.08 以下の値は許容可能なモデルを示します。[ 34 ]
適合度指標(GFI)は、仮説モデルと観測された共分散行列との適合度を測る指標です。調整済み適合度指標(AGFI)は、各潜在変数の指標数によって影響を受けるGFIを補正します。GFIとAGFIは0から1の範囲で、0.9を超える値は一般的に許容できるモデル適合度を示します。[ 36 ]
Relative fit indices (also called “incremental fit indices”[37] and “comparative fit indices”[38]) compare the chi-square for the hypothesized model to one from a “null”, or “baseline” model.[32] This null model almost always contains a model in which all of the variables are uncorrelated, and as a result, has a very large chi-square (indicating poor fit).[33] Relative fit indices include the normed fit index and comparative fit index.
The normed fit index (NFI) analyzes the discrepancy between the chi-squared value of the hypothesized model and the chi-squared value of the null model.[39] However, NFI tends to be negatively biased.[38] The non-normed fit index (NNFI; also known as the Tucker–Lewis index, as it was built on an index formed by Tucker and Lewis, in 1973[40]) resolves some of the issues of negative bias, though NNFI values may sometimes fall beyond the 0 to 1 range.[38] Values for both the NFI and NNFI should range between 0 and 1, with a cutoff of .95 or greater indicating a good model fit.[41]
The comparative fit index (CFI) analyzes the model fit by examining the discrepancy between the data and the hypothesized model, while adjusting for the issues of sample size inherent in the chi-squared test of model fit,[21] and the normed fit index.[38] CFI values range from 0 to 1, with larger values indicating better fit. Previously, a CFI value of .90 or larger was considered to indicate acceptable model fit.[41] However, a 1999 study indicated that a value greater than .90 is needed to ensure that misspecified models are not deemed acceptable.[41] Thus, a CFI value of .95 or higher is presently accepted as an indicator of good fit.
モデルのパラメータを推定するには、モデルが適切に識別されている必要があります。つまり、推定される(未知の)パラメータの数(q)は、測定変数間の固有の分散と共分散の数以下でなければなりません。p ( p + 1)/2。この式は「tルール」として知られています。パラメータ推定の根拠となる情報が少なすぎる場合、モデルは識別不足であると言われ、モデルパラメータを適切に推定することはできません。[ 42 ]