統計学において、混合データの因子分析(FAMD、フランス語原文:AFDMまたはAnalyse Factorielle de Données Mixtes)は、個人のグループが量的変数と質的変数の両方で記述されるデータ表に特化した因子分析法です。これは、ジャン=ポール・ベンゼクリによって設立されたフランスの学派であるAnalyse des données(データ分析)によって開発された探索的分析法に属します。
「混合」という用語は、量的変数と質的変数の両方を使用することを指します。大まかに言えば、FAMDは量的変数に対しては主成分分析(PCA)として、質的変数に対しては多重対応分析(MCA)として機能すると言えます。
データに両方のタイプの変数が含まれている場合でも、有効な変数が均質であれば、PCAまたはMCAを使用できます。
実際、MCAでは、変数と個体に関する因子との相関係数を用いて、補助的な量的変数を簡単に組み込むことができます(個体に関する因子とは、因子軸上の個体の座標をまとめたベクトルです)。得られる表現は、(PCAと同様に)相関円です。
同様に、PCA に補助的なカテゴリ変数を含めることも容易です。[ 1 ]この場合、各カテゴリは、そのカテゴリを持つ個体の重心 (MCA として) で表されます。
アクティブ変数が混在する場合、通常は量的変数に対して離散化処理を行います(例えば、調査では年齢を年齢階級に変換するのが一般的です)。このようにして得られたデータは、MCA(多重対応分析)によって処理できます。
このやり方には限界がある。
データには以下が含まれます量的変数そして質的変数。
これは量的変数です。以下に留意してください。
PCAでは関数を探す(各個人に値を割り当てます(初期変数と主成分の場合)すべてと最も相関が高い変数とは、次のような意味を持つ。
Qの MCA では、関数を探索しますすべてに関連するもの変数とは、次のような意味を持つ。
FAMDでは関数を探すすべてに関係する変数とは、次のような意味を持つ。
この基準では、両方のタイプの変数が同じ役割を果たします。この基準における各変数の寄与度は1以下に制限されます。
個人の表現は、要因から直接行われる。。
量的変数の表現は、PCA(相関円)と同様に構築される。
質的変数のカテゴリの表現はMCAと同様で 、カテゴリはそれに属する個体の重心に位置します。MCAで慣例となっているように軸に依存する係数を除いた重心ではなく、正確な重心を用いることに注意してください(MCAではこの係数は固有値の平方根の逆数に等しくなりますが、FAMDでは不適切です)。
変数の表現は関係スクエアと呼ばれます。質的変数の座標軸に沿っては変数間の相関比の二乗に等しいそして順位の要素(表記)量的変数の座標軸に沿っては、変数間の相関係数の二乗に等しい。そして順位の要素 (表記))
初期変数間の関係指標は、行の交点に、いわゆる関係行列にまとめられます。およびコラム:
ごく小規模なデータセット(表1)は、FAMDの動作と出力を示しています。6人の被験者は、3つの量的変数と3つの質的変数によって記述されています。データは、Rパッケージ関数FAMD FactoMineRを使用して分析されました。
関係行列では、係数は(量的変数)(質的変数)または(各型につき1つの変数)
この行列は、2種類の変数間の関係が複雑に絡み合っている様子を示している。
個体の表現(図1)は、3つの個体グループを明確に示している。第1軸は個体1と個体2を他のすべての個体と対立させ、第2軸は個体3と個体4を個体5と個体6と対立させている。
変数の表現(関係の四角形、図 2)は、第 1 軸()は変数と密接に関連しています、そして相関円(図3)は、相関の符号を示します。、そしてカテゴリーの表現(図4)は、関係の性質を明確にする。そして最後に、第1軸によって個体化された個体1と2は、高い値によって特徴付けられます。そしてカテゴリー別の同じように。
この例は、FAMDが量的変数と質的変数を同時に分析する方法を示しています。つまり、この例では、2種類の変数に基づいた第1次元を示しています。
FAMDの原著は、ブリジット・エスコフィエ[ 2 ]とジルベール・サポルタ[ 3 ]によるものです。この研究は2002年にジェローム・パジェス[ 4 ]によって再開されました。FAMDのより完全な英語での解説は、ジェローム・パジェスの著書に収録されています[ 5 ] 。
このメソッドは、RパッケージFactoMineRに実装されています。また、Pythonライブラリprinceにも実装されています。