混合モデル、混合効果モデル、または混合誤差成分モデルは、固定効果とランダム効果の両方を含む統計モデルです。[ 1 ] [ 2 ] これらのモデルは、物理学、生物学、社会科学のさまざまな分野で役立ちます。特に、同じ統計単位で繰り返し測定が行われる場合(縦断研究も参照)、または関連する統計単位のクラスターで測定が行われる場合に便利です。[ 2 ]混合モデルは、独立観測の仮定に依存しないため、従来の分散分析回帰モデルよりも好まれることがよくあります。さらに、欠損値や繰り返し測定の不均一な間隔を扱う柔軟性があります。 [ 3 ]混合モデル分析では、バイアスのある推定構造を回避して、より幅広い相関と分散共分散で測定値を明示的にモデル化できます。
このページでは、一般化線形混合モデルや非線形混合効果モデルではなく、主に線形混合効果モデルについて説明します。[ 4 ]
線形混合モデル(LMM)は、固定効果とランダム効果を組み込むことで、独立していないデータ構造を正確に表現する統計モデルです。LMMは分散分析(ANOVA)の代替手法です。ANOVAでは、各グループ内の観測値が統計的に独立していることを前提としていることが多いのですが、この前提は、多階層構造、縦断的データ、相関データセットなど、独立していないデータでは成り立たない場合があります。
非独立セットとは、結果間の変動がグループ内またはグループ間の相関によるものであるセットのことです。混合モデルは、観測値がネストされた関連性によって影響を受けるネスト構造/階層的データ構造を適切に考慮します。たとえば、複数の学校を含む教育方法を研究する場合、考慮すべき変数のレベルが複数あります。個人レベル/下位レベルは、学校内の個々の生徒または教師で構成されます。この生徒/教師から得られた観測値は、学校内にネストされています。たとえば、生徒Aは学校A内の単位です。次の上位レベルは学校です。上位レベルでは、学校には複数の個々の生徒と教師が含まれます。学校レベルは、生徒と教師から得られた観測値に影響を与えます。たとえば、学校Aと学校Bは上位レベルであり、それぞれに生徒Aと生徒Bのセットがあります。これは階層的データスキームを表しています。階層的データをモデル化する解決策は、線形混合モデルを使用することです。

LMM を使用すると、データ構造に組み込まれた非独立性の標準誤差の補正を取り入れながら、レベル間およびレベル内の重要な効果を理解できます。[ 4 ] [ 5 ]社会心理学、心理言語学、認知心理学 (および神経科学) などの実験分野では、研究に複数のグループ化変数が含まれることが多く、ランダム効果を考慮しないと、タイプ I エラー率が大きくなり、結論が信頼できないものになる可能性があります。[ 6 ] [ 7 ]例えば、参加者のサンプルと刺激のサンプル (画像、シナリオなど) の両方を含む実験のデータを分析する場合、これらのグループ化変数のいずれかの変動を無視すると (刺激で平均化するなど)、誤った結論につながる可能性があります。このような場合、研究者は代わりに LMM を使用して参加者と刺激の両方をランダム効果として扱うことができ、そうすることで、複数のグループ化変数にわたるデータの変動を正しく考慮することができます。同様に、比較縦断調査のデータを分析する場合、国や国年などの関連するすべてのレベルでランダム効果を含めないと、結果が著しく歪む可能性があります。[ 8 ]
固定効果は、主要な関心レベルで一貫している傾向/トレンドを包含します。これらの効果は、ランダムではなく、研究対象の母集団に対して一定であると想定されるため、固定効果とみなされます。[ 5 ]例えば、教育を研究する場合、固定効果は、すべての学校で一貫している学校レベルの全体的な効果を表すことができます。
データセットの階層構造は通常明らかですが、すべての被験者の平均応答に影響を与える特定の固定効果を指定する必要があります。一部の固定効果係数は対応するランダム効果なしで十分ですが、他の固定係数は個々の単位がランダムな平均のみを表します。これらは、ランダム切片と傾きを組み込むことによって決定できます。[ 9 ] [ 10 ] [ 11 ]
ほとんどの場合、関連する複数のモデルが検討され、普遍的なモデルを最もよく表すモデルが採用される。
混合モデルの重要な構成要素は、ランダム効果を固定効果に組み込むことです。固定効果は、多くの場合、基礎となるモデルを表すように適合されます。線形混合モデルでは、母集団の真の回帰は線形βです。固定データは最高レベルで適合されます。ランダム効果は、データ階層のさまざまなレベルで統計的変動を導入します。これらは、データ内の特定のグループに影響を与える測定されていない分散源を考慮に入れます。たとえば、同じクラスの生徒1と生徒2の違い、または同じ学校のクラス1とクラス2の違いなどです。[ 9 ] [ 10 ] [ 11 ]

ロナルド・フィッシャーは、親族間の形質値の相関を研究するためにランダム効果モデルを導入しました。 [ 12 ] 1950年代には、チャールズ・ロイ・ヘンダーソンが固定効果の最良線形不偏推定値とランダム効果の最良線形不偏予測値 を提供しました。[ 13 ] [ 14 ] [ 15 ] [ 16 ] その後、混合モデルは、最尤推定値の計算、非線形混合効果モデル、混合効果モデルにおける欠損データ、混合効果モデルのベイズ推定に関する研究を含め、統計研究の主要な分野となりました。混合モデルは、関心のある各単位について複数の相関測定が行われる多くの分野で適用されています。遺伝学からマーケティングまで、人間と動物を対象とする研究で広く使用されており、野球[ 17 ]や産業統計[ 18 ]でも使用されています。 混合線形モデル関連により、偽陽性関連の防止が改善されました。集団は深く相互接続されており、混合モデルを使用せずに集団動態の関連構造をモデル化することは非常に困難です。しかし、線形混合モデルが唯一の解決策ではないかもしれない。LMMには一定の残差分散の仮定があるが、深く関連する連続特性と二値特性を考慮すると、この仮定が破られることがある。[ 19 ]
行列表記では、線形混合モデルは次のように表すことができます。
どこ
例えば、各観測値がk 個のカテゴリのうち 0 個以上に属する可能性がある場合、観測値ごとに 1 行を持つZはk列を持つように選択でき、 Zの行列要素の値が1の場合は観測値がカテゴリに属することがわかっていることを示し、値が0の場合は観測値がカテゴリに属さないことがわかっていることを示します。この場合、カテゴリに対するuの推定値はカテゴリ固有の切片となります。Z に追加の列があり、その非ゼロの値が観測値の独立変数の値である場合、対応するuの推定値はその独立変数に対するカテゴリ固有の傾きとなります。カテゴリの切片と傾きの事前分布は、共分散行列Gによって記述されます。
結合密度そして次のように書くことができます。正規分布を仮定すると、、そして結合密度を最大化するそしては、線形混合モデルに対するヘンダーソンの「混合モデル方程式」(MME) を示しています。[ 13 ] [ 15 ] [ 20 ]
例えば、X′はXの行列転置であり、R −1はRの行列逆行列である。
上記のより簡潔な表現は次のとおりである。
または、
ここでG −1は
MMEの解決策、そしては、最良の線形不偏推定値および予測値です。そしてそれぞれ、。これは、結果の条件付き分散が単位行列にスケーリングできない場合のガウス・マルコフの定理の結果です。条件付き分散が既知の場合、逆分散加重最小二乗推定値は最良の線形不偏推定値になります。しかし、条件付き分散が既知であることはまれです。したがって、MMEを解く際には、分散と加重パラメータ推定値を同時に推定することが望ましいです。
混合モデルにおいてアナリストが直面する選択肢の一つは、どのランダム効果(すなわち、グループ化変数、ランダム切片、ランダム傾き)を含めるかである。検証的仮説検定の文脈における重要な推奨事項の一つは[ 21 ]、第一種過誤率を制御する手段として、実験計画によって正当化されるすべての可能なランダム効果を含む「最大」のランダム効果構造を採用することである。
このような混合モデルを適合させるために使用される方法の 1 つは、期待値最大化アルゴリズム(EM) であり、分散成分は結合尤度における観測されない不要パラメータとして扱われます。 [ 22 ]現在、この方法はPython (statsmodels パッケージ) などの統計ソフトウェアに実装されており、 Rの nlme パッケージの lme()では初期ステップとしてのみ実装されています。混合モデル方程式の解は、誤差の分布が正規分布である場合に最尤推定値となります。 [ 23 ] [ 24 ]

混合モデルを適合させる他の方法はいくつかあり、最初に混合効果モデル(MEM)を使用し、次にニュートン・ラフソン法(Rパッケージnlme [ 25 ]のlme()、SAS MIXED、およびSPSS MIXEDで使用)、ペナルティ付き最小二乗法を使用して、(低次元の)分散共分散パラメータのみに依存するプロファイルされた対数尤度を取得する方法などがあります。つまり、その共分散行列そして、縮小された目的関数の現代的な直接最適化(Rの lme4 [ 26 ]パッケージの lmer() やJuliaパッケージの MixedModels.jl で使用)と尤度の直接最適化(例えばRの glmmTMB で使用)が行われます。注目すべきは、ヘンダーソンが提案した標準形は理論的には有用ですが、多くの一般的なソフトウェア パッケージは、疎行列法を活用するために数値計算に異なる定式化を使用していることです(例えば lme4 や MixedModels.jl など)。
ベイズ法の文脈では、brms パッケージは、Stan を使用して R で混合モデルを適合させるためのユーザーフレンドリーなインターフェースを提供し、事前分布の組み込みと事後分布の推定を可能にします。[ 27 ] [ 28 ] Python では、Bambi は PyMC を使用して混合効果モデルを適合させるための同様に効率的なアプローチを提供します。[ 29 ]
{{cite book}}: CS1メンテナンス: パブリッシャーの場所 (リンク){{cite book}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite book}}: CS1 maint: 複数の名前: 著者リスト (リンク) CS1 maint: 出版社の場所 (リンク)