
統計学において、要因実験(完全要因実験とも呼ばれる)は、複数の要因が応答変数と呼ばれる特定の結果にどのように影響するかを調査するものです。各要因は異なる値(水準)でテストされ、実験ではすべての要因にわたるこれらの水準のあらゆる組み合わせが網羅されます。この包括的なアプローチにより、研究者は各要因が個別に応答にどのように影響するかだけでなく、要因同士がどのように相互作用し、影響し合うかも把握することができます。
要因実験では、各要因に2つの水準のみを用いることで、実験を簡略化できる場合が多い。例えば、2×2要因計画では、2つの要因があり、それぞれに2つの水準が設定されるため、4つの組み合わせをテストすることになる。個々の要因にも影響がある場合でも、これらの要因間の相互作用が最も重要な発見となることが多い。
組み合わせの数が多すぎて完全要因計画が複雑になりすぎる場合、研究者は部分要因計画を用いることができる。この方法は、実験をより扱いやすくするために、いくつかの組み合わせ(通常は少なくとも半分)を戦略的に省略する。
これらの因子レベルの組み合わせは、実験のラン、グラフの頂点としての組み合わせを表すポイント、行と列の交点として生じるセルなどと呼ばれることがあります。
要因計画法は、19世紀にロザムステッド実験ステーションのジョン・ベネット・ローズとジョセフ・ヘンリー・ギルバートによって使用されました。[ 1 ]
ロナルド・フィッシャーは1926年に、「複雑な」設計(要因計画など)は一度に1つの要因を研究するよりも効率的であると主張した。[ 2 ]フィッシャーは次のように書いている。
野外実験に関して最も頻繁に繰り返される格言は、「自然には一度に少数の質問、理想的には1つの質問しかしてはならない」というものだ。しかし、筆者はこの見解は全く間違っていると確信している。自然は、論理的で綿密に練られた質問票に最もよく答えてくれるだろう。実際、もし私たちが自然に1つの質問をしたとしても、自然は他の話題が議論されるまで答えることを拒否することが多いのだ。
要因計画法を用いることで、複数の要因の影響、さらにはそれらの相互作用さえも、いずれか一つの影響を単独で同じ精度で判定するために必要な試行回数と同じ回数で判定することが可能になる。
フランク・イェーツは、特にイェーツ分析による設計分析において、重要な貢献をした。
「階乗」という用語は、フィッシャーが著書『実験計画法』で使用した1935年以前には印刷物で使われていなかった可能性がある。[ 3 ]
多くの人は単一の要因または変数の影響のみを調べます。このような一度に1つの要因(OFAT)実験と比較して、要因実験にはいくつかの利点があります[ 4 ] [ 5 ]。
完全要因計画の主な欠点は、考慮する要因または入力の数に応じて指数関数的に増加するサンプルサイズの要件です。[ 6 ]計算効率が向上した代替戦略には、部分要因計画、ラテン超立方体サンプリング、準ランダムサンプリング技術などがあります。
統計学者のジョージ・ボックスは著書『ほぼあらゆるものを改善する:アイデアとエッセイ』の中で、要因実験の利点について多くの例を挙げています。その一つがこれです。[ 7 ]ベアリングメーカーのSKFのエンジニアたちは、より安価な「ケージ」設計に変更するとベアリングの寿命に影響するかどうかを知りたいと考えていました。エンジニアたちは、統計学者のクリスター・ヘルストランドに実験設計の協力を求めました。[ 8 ]

ボックス氏は以下のように報告している。 「結果は加速寿命試験によって評価されました。…実際の生産ラインで行う必要があったため、試験費用は高額でした。実験者は標準ケージで4回、改良ケージで4回試験を行う予定でした。クリスターは、他に試験したい要因があるかどうか尋ねました。彼らはあると答えましたが、追加の試験を行うと予算を超えてしまうとのことでした。クリスターは、試験回数を増やすことなく、またケージ効果の推定精度を低下させることなく、2つの追加要因を「無料で」試験する方法を示しました。この2×2×2要因計画と呼ばれる構成では、3つの要因それぞれを2つのレベルで実行し、8つの組み合わせすべてを網羅します。さまざまな組み合わせは、立方体の頂点として分かりやすく示すことができます…」「それぞれの場合において、標準条件はマイナス記号で、改良条件はプラス記号で示されています。変更された要因は、熱処理、外輪接触、およびケージ設計です。数値はベアリングの相対的な寿命を示しています。[立方体プロット]を見ると、選択がケージ設計の違いは大きな影響を与えませんでした。…しかし、ケージ設計の数値のペアを平均すると、他の2つの要因がどのような影響を与えたかを示す[下の表]が得られます。…その結果、この特定の用途においては、外輪接触と内輪熱処理という2つの要因を同時に高めることで、ベアリングの寿命を5倍に延ばすことができるという驚くべき発見に至りました。
「このようなベアリングが何十年も前から製造されてきたことを考えると、これほど重要な改良点が発見されるまでにこれほど長い時間がかかったのは、最初は驚きである。考えられる説明としては、最近までほとんどのエンジニアが一度に一つの要素しか実験に用いていなかったため、相互作用効果を見落としていたことが挙げられる。」
最も単純な要因実験では、2つの要因それぞれに2つの水準が設定されます。例えば、あるエンジニアが、2種類のモーターAとBをそれぞれ2つの異なる回転速度(2000回転/分または3000回転/分)で運転した場合の総消費電力を調べたいとします。この場合、要因実験は4つの実験ユニットで構成されます。すなわち、モーターAを2000回転/分で運転した場合、モーターBを2000回転/分で運転した場合、モーターAを3000回転/分で運転した場合、そしてモーターBを3000回転/分で運転した場合です。各要因から選択された1つの水準の組み合わせは、それぞれ1回ずつ存在します。
この実験は、2 2 (または 2×2) 要因実験の一例です。これは、2 つの要因 (べき乗または上付き文字) それぞれに対して 2 つの水準 (ベース) を考慮するため、つまり、#水準#要因となり、2 2 = 4 つの要因点が得られるため、このように呼ばれています。

実験計画には、多くの独立変数が含まれる場合があります。さらに別の例として、3つの入力変数の影響を、立方体の角として示される8つの実験条件で評価することができます。
これは、目的や利用可能なリソースに応じて、反復実験の有無にかかわらず実施できます。これにより、3つの独立変数が従属変数に及ぼす影響と、それらの相互作用の可能性が明らかになります。
要因実験は、要因の数と各要因の水準の数の 2 つの要素で表されます。たとえば、2×3 要因実験には 2 つの要因があり、最初の要因は 2 つの水準、2 番目の要因は 3 つの水準です。このような実験には 2×3=6 通りの処理の組み合わせまたはセルがあります。同様に、2×2×3 実験には 3 つの要因があり、2 つの要因は 2 つの水準、1 つの要因は 3 水準で、合計 12 通りの処理の組み合わせがあります。すべての要因がs水準を持つ場合 (いわゆる固定水準または対称設計)、実験は通常s kと表記され、kは要因の数です。したがって、2 5実験には 5 つの要因があり、それぞれが 2 水準です。固定水準ではない実験は、混合水準または非対称であると言われます。
各要因のレベルを示すにはさまざまな慣習があります。要因にすでに自然単位がある場合は、それが使用されます。たとえば、エビ養殖実験[ 9 ]では、温度が25 ℃と35 ℃、密度が80匹または160匹/40リットル、塩分濃度が10%、25%、40%の要因があるかもしれません。ただし、多くの場合、要因のレベルは単なるカテゴリであり、レベルのコーディングはやや恣意的です。たとえば、6レベルの要因のレベルは、単に1、2、...、6と表記されるかもしれません。
処理の組み合わせは、順序対、より一般的には順序タプルで表されます。養殖実験では、順序トリプル(25、80、10)は、各因子の最低レベルを持つ処理の組み合わせを表します。一般的な2×3実験では、順序対(2、1)は、因子Aがレベル2、因子Bがレベル1のセルを示します。括弧は、添付の表に示すように省略されることがよくあります。
2k実験における因子レベルを表すために、文献には3つの特定のシステムが登場する。
これらの値が治療の「低」と「高」の設定を表す場合、0と1を使用する場合でも、-1と1を使用する場合でも、1が「高」を表すのは自然です。これは、2×2実験の付随する表に示されています。因子レベルが単なるカテゴリである場合、対応関係は異なる可能性があります。たとえば、0と1を使用する場合は「コントロール」を0として、1と-1を使用する場合は1としてコード化することで、「コントロール」と「実験」条件を表すのは自然です。[注1 ]後者の例を以下に示します。この例は、+1と-1のコード化の別の使用法を示しています。
その他の固定レベル(s k)実験では、因子レベルを表すために0、1、...、s −1の値がよく使用されます。これらは、 sが素数の場合のsを法とする 整数の値です。[注2 ]
特定の治療の組み合わせに対する期待される反応はセル平均と呼ばれ、[ 12 ]通常はギリシャ文字μで表されます。(セルという用語は、データ表での使用法から借用されています。)この表記法は、2×3実験についてここで示されています。
セル平均値のコントラストとは、係数の合計が0になるセル平均値の線形結合のことです。コントラストはそれ自体が興味深いものであり、主効果や交互作用を定義するための構成要素となります。
ここで示されている 2 × 3 実験では、式
これは、治療組み合わせ11と12の平均応答を比較する対比です。(ここでの係数は1と-1です。)
これは因子Aの主効果に属すると言われており、因子の「1」レベルに対する反応と対比される。「2」レベルのものと比較します。セルの真の値が平均である場合、Aの主効果は存在しないと言われます。この式を0に等しくします。真のセル平均は原理的に観測できないため、この式が0に等しいかどうかを評価するために統計的仮説検定が使用されます。
要因実験における交互作用とは、要因間の加法性の欠如であり、対比によっても表現されます。2 × 3 実験では、対比は
そして
A × B の相互作用に属します。これらの式が 0 に等しい場合、相互作用は存在しません(加法性があります)。 [ 13 ] [ 14 ]加法性は、以下の 分析セクションで示されているように、因子間の一種の並行性として見なすことができます。主効果と同様に、仮説検定を実行することによって加法性の仮定を評価します。
これらの対比の係数が重要な情報を含んでいるため、それらは列ベクトルとして表示されることが多い。上記の例では、そのような表は次のようになるかもしれない。[ 15 ]
このような表の列はコントラストベクトルと呼ばれ、その成分の合計は0になります。各効果は、列内の成分のパターンと列の数の両方によって決定されます。
これらの列の構成要素のパターンは、ボーズによって与えられた一般的な定義を反映しています。[ 16 ]
2つ以上の要因の相互作用についても同様の定義が成り立ちます。例えば、2×3の例では、A列のパターンは、各セルの最初の要素で示される要因Aのレベルのパターンに従います。同様に、 B列のパターンは要因Bのレベルのパターンに従います(Bでソートすると、これがより分かりやすくなります)。
各効果を指定するために必要な列の数は、その効果の自由度であり、 [注4 ]分散分析において不可欠な量です。式は次のとおりです。[ 18 ] [ 19 ]
2つ以上の要因の場合も、このパターンに従います。上記の2×3の例では、2つの主効果と交互作用の自由度(それぞれの列数)は、それぞれ1、2、2です。
以下の例の表では、「セル」列のエントリは処理の組み合わせを表しています。各組み合わせの最初の要素は因子Aのレベル、2番目は因子Bのレベル、3番目(2×2×2の例では)は因子Cのレベルです。他の各列のエントリの合計は0になるため、各列は対比ベクトルとなります。
3×3実験:ここでは、因子Aと因子Bの主効果それぞれに3-1=2の自由度、因子A×Bの交互作用に(3-1)(3-1)=4の自由度があると想定されます。これは、付随する表における各効果の列数に反映されています。
Aの 2 つの対比ベクトルは、因子Aのレベルのみに依存します。これは、各A列のエントリのパターンが「cell」の最初のコンポーネントのパターンと同じであることに注目することで確認できます。(必要であれば、 Aで表をソートするとこれがわかります。)したがって、これら 2 つのベクトルはAの主効果に属します。同様に、 Bの 2 つの対比ベクトルは、因子Bのレベル、つまり「cell」の 2 番目のコンポーネントのみに依存するため、 Bの主効果に属します。
最後の4つの列ベクトルはA×B相互作用に属します。なぜなら、それらの要素は両方の因子の値に依存し、また4つの列すべてがAとBの列と直交しているからです。後者は内積を取ることで確認できます。
2×2×2の実験:これは、主効果と交互作用それぞれに1つの自由度を持ちます。例えば、2因子交互作用の場合、(2-1)(2-1) = 1の自由度となります。したがって、7つの効果それぞれを指定するには、1つの列だけで済みます。
A、B、Cの列はそれぞれ対応する主効果を表しており、各列のエントリは対応する因子のレベルのみに依存します。たとえば、B列のエントリは「cell」の中央のコンポーネントと同じパターンに従います。これは、 Bでソートすることで確認できます。
AB、AC、BCの列は、対応する 2 因子相互作用を表します。たとえば、(i) BC列のエントリは、セルの2 番目と 3 番目の ( BとC ) 成分に依存し、最初の ( A ) 成分とは独立しています。これは、 BCでソートすることで確認できます。 (ii) BC列は、 B 列とC列に対して直交しています。これは、ドット積を計算することで確認できます。
最後に、ABC列は3つの因子の相互作用を表します。その値は3つの因子すべてのレベルに依存し、他の6つの対比ベクトルとは直交しています。
列A、B、Cを組み合わせて行ごとに読み取ると、この実験における処理の組み合わせ(セル)について、前述の別の表記法が得られます。セル000は+++、001は++−などに対応します。
A列からABC列では、1を任意の定数に置き換えることができます。なぜなら、結果として得られる列は依然としてコントラストベクトルとなるからです。例えば、2×2×2実験[注5 ]では、各主効果または交互作用を定義するために1/4という数値を使用するのが一般的です。例えば、コントラストが
は因子Aの「主な」効果であり、推定可能な数値である。[ 20 ]
2つ以上の因子の場合、2k - 1因子実験を複製し、最初の複製を新しい因子の第1(または低)レベルに、2番目の複製を第2(または高)レベルに割り当てることで、2k因子実験を再帰的に設計できます。このフレームワークは、例えば、3つのレベルの因子に対して3つの複製を設計するなど、一般化できます。
要因実験では、実験誤差を推定する方法が2つあります。実験を繰り返すか、効果の疎性原理 を利用するかのいずれかです。繰り返しは小規模な実験でよく行われ、実験誤差を評価する非常に信頼性の高い方法です。要因の数が多い場合(通常は5つ以上の要因ですが、これは用途によって異なります)、実験計画の繰り返しは操作的に困難になることがあります。このような場合、実験計画を1回だけ繰り返し、ある次数(例えば3つ以上の要因間)を超える要因間の相互作用は無視できると仮定するのが一般的です。この仮定の下では、このような高次の相互作用の推定値は厳密にゼロの推定値となり、したがって実際には実験誤差の推定値となります。
要因が多い場合、繰り返し実験を行わなくても、多くの実験回数が必要になります。例えば、10個の要因をそれぞれ2つの水準で実験すると、2¹⁰ = 1024通りの組み合わせが生じます。しかし、コストが高かったり、リソースが不足したりして、このような実験は非現実的になる場合があります。このような場合は、一部実施要因計画法を用いることができます。
他の統計実験と同様に、要因実験における実験実行は、バイアスが実験結果に及ぼす影響を軽減するためにランダム化されるべきである。しかし実際には、これは大きな運用上の課題となる可能性がある。
要因実験は、各要因の水準が2つ以上ある場合に使用できます。ただし、3水準(またはそれ以上)の要因計画に必要な実験回数は、2水準の要因計画の場合よりもかなり多くなります。したがって、研究者が2つ以上の水準を考慮したい場合、要因計画はあまり魅力的な選択肢とは言えません。
要因実験は、 ANOVAまたは回帰分析を使用して分析できます。[ 21 ] 2水準実験で要因「A」の主効果を計算するには、Aが低水準(または第1水準)にあるすべての実験実行の平均応答から、Aが高水準(または第2水準)にあるすべての実験実行の平均応答を差し引きます。
要因実験に役立つその他の探索的分析ツールとしては、主効果プロット、交互作用プロット、パレートプロット、推定効果の正規確率プロットなどがある。
因子が連続変数である場合、2水準要因計画では効果が線形であると仮定します。因子に二次効果が予想される場合は、中心複合計画などのより複雑な実験を用いる必要があります。二次効果を持つ可能性のある因子の最適化は、応答曲面法の主な目的です。
モンゴメリー[ 4 ]は、要因実験の分析の例として以下を挙げている。
ある技術者は、化学物質を製造するプロセスのろ過速度(出力)を向上させ、プロセスで使用されるホルムアルデヒドの量を削減したいと考えています。これまでのホルムアルデヒド削減の試みでは、ろ過速度が低下していました。現在のろ過速度は毎時75ガロンです。温度(A)、圧力(B)、ホルムアルデヒド濃度(C)、攪拌速度(D)の4つの要素が考慮されます。これら4つの要素はそれぞれ2つのレベルでテストされます。
以降、マイナス(−)とプラス(+)の記号は、それぞれその要因が低レベルで実行されているか高レベルで実行されているかを示します。

A:C相互作用プロットにおける平行でない線は、因子Aの効果が因子Cのレベルに依存することを示しています。A:D相互作用についても同様の結果が得られます。グラフは、因子Bが濾過速度にほとんど影響を与えないことを示しています。4つの因子すべてとそれらの間の考えられるすべての相互作用項を含む分散分析(ANOVA)により、以下の表に示す係数推定値が得られます。

観測値が16個、係数(切片、主効果、交互作用)が16個あるため、このモデルではp値を計算できません。係数の値とグラフから、重要な因子はA、C、D、および交互作用項A:CとA:Dであることが示唆されます。
A、C、D の係数は ANOVA で全て正の値であるため、3 つの変数全てを高い値に設定してプロセスを実行することが推奨されます。しかし、各変数の主効果は、他の変数のレベルの平均値です。上記の A:C 相互作用プロットは、因子 A の効果は因子 C のレベルに依存し、その逆もまた同様であることを示しています。因子 C が + レベルの場合、因子 A (温度) はろ過速度にほとんど影響を与えません。しかし、因子 C (ホルムアルデヒド) が − レベルの場合、因子 A はろ過速度に大きな影響を与えます。A を + レベル、C を − レベルの組み合わせで、ろ過速度が最大になります。この観察結果は、一度に 1 つの因子のみを分析すると、重要な相互作用を見逃す可能性があることを示しています。因子 A と C の両方を同時に変化させることによってのみ、エンジニアは因子 A の効果が因子 C のレベルに依存することを発見できます。

最適なろ過率は、AとDが高レベルでCが低レベルの場合に得られます。この結果は、ホルムアルデヒド(因子C)の削減という目的も満たしています。Bは重要ではないと思われるため、モデルから除外できます。因子A、C、D、および交互作用項A:CとA:Dを使用してANOVAを実行すると、次の表に示す結果が得られ、すべての項が有意です(p値<0.05)。
要因ランダム化比較試験の報告ガイドラインは、要因試験論文の報告に関する CONSORT 2010 拡張版や、要因試験プロトコルの報告に関する SPIRIT 2013 拡張版など、利用可能です。[ 22 ] [ 23 ] CONSORT および SPIRIT 拡張版の説明と解説論文では、適切な報告と実施に関する詳細な説明と例が提供されています。[ 24 ]