外的妥当性とは、科学的研究の結論をその研究の文脈外に適用できるかどうかの妥当性です。[ 1 ]言い換えれば、研究結果が他の状況、人々、刺激、時間に一般化または転用できる程度です。[ 2 ] [ 3 ]一般化可能性とは、事前に定義されたサンプルをより広い母集団に適用できるかどうかを指し、転用可能性とは、あるサンプルを別の対象母集団に適用できるかどうかを指します。[ 2 ]対照的に、内的妥当性とは、特定の研究の文脈内で導き出された結論の妥当性です。
外的妥当性の数学的分析は、異質な集団間での一般化が可能かどうかを判断し、有効な一般化を生み出す統計的および計算的方法を考案することに関係する。[ 4 ]
外的妥当性を確立する際、研究者は研究の「範囲」を特定する傾向がある。これは、研究の理論や議論の適用可能性や限界を指す。[ 2 ]これは、研究のサンプルと、そのサンプルが代表するより広い母集団を定義することを伴う。[ 2 ]
「外的妥当性への脅威とは、特定の研究結果から一般化を行う際に、どのように誤りが生じる可能性があるかを説明するものです。」[ 5 ]ほとんどの場合、ある要因(つまり独立変数)の効果が他の要因に依存する場合、一般化可能性は制限されます。したがって、外的妥当性へのすべての脅威は、統計的相互作用として説明できます。[ 6 ]いくつかの例を挙げると次のようになります。
研究の外的妥当性は、その内的妥当性によって制限されることに注意が必要である。ある研究内で行われた因果推論が妥当でない場合、その推論を他の状況に一般化することも妥当ではない。
クックとキャンベル[ 7 ]は、ある集団への一般化と、ある背景要因の異なるレベルによって定義されるサブ集団全体への一般化との間の重要な区別をしました。リンチは、歴史のスナップショットとして以外では意味のある集団に一般化することはほとんど不可能であるが、ある原因が従属変数に及ぼす影響が、ある背景要因が異なるサブ集団全体にわたってどの程度一般化されるかをテストすることは可能であると主張しています。そのためには、調査中の治療効果が1つ以上の背景要因との相互作用によって調整されるかどうかをテストする必要があります。[ 6 ] [ 8 ]
妥当性に対する脅威を列挙することは、研究者が不当な一般化を避けるのに役立つかもしれないが、それらの脅威の多くは体系的に無力化または中和することができ、それによって妥当な一般化が可能になる。具体的には、ある集団からの実験結果を「再処理」または「再較正」することで、集団間の違いを回避し、実験が実施できない別の集団で妥当な一般化を生み出すことができる。PearlとBareinboim [ 4 ]は、一般化の問題を2つのカテゴリに分類した。(1)妥当な再較正に適した問題、(2)理論的に外部妥当性が不可能な問題。グラフベースの因果推論計算[ 9 ]を用いて、問題インスタンスが妥当な一般化を可能にするための必要十分条件を導き出し、必要な再較正が存在する場合には、それを自動的に生成するアルゴリズムを考案した。[ 10 ]これにより、外的妥当性の問題はグラフ理論の演習に還元され、一部の哲学者はこの問題が解決されたと結論付けています。[ 11 ]
外的妥当性の問題における重要な変種の一つに、選択バイアス(サンプリングバイアスとも呼ばれる)があります。これは、対象集団を代表しないサンプルで研究を実施した場合に生じるバイアスです。例えば、大学生を対象に臨床試験を実施した場合、研究者は、年齢、教育、収入などの属性が典型的な学生とは大きく異なる全集団に結果が一般化できるかどうかを知りたいと思うかもしれません。BareinboimとPearlのグラフベースの手法は、サンプル選択バイアスを回避できる条件を特定し、これらの条件が満たされると、全集団における平均因果効果の不偏推定量を構築します。不適切なサンプリングによる研究からの一般化と、異なる集団間での一般化の主な違いは、集団間の差異は通常、年齢や民族などの既存の要因によって引き起こされるのに対し、選択バイアスは多くの場合、治療後の状況、例えば、研究から脱落した患者や、怪我の重症度によって選択された患者によって引き起こされるという点にあります。選択が治療後の要因によって左右される場合、バイアスのない推定を保証するために非従来型の再較正方法が必要であり、これらの方法は問題のグラフから容易に得られる。[ 12 ] [ 13 ]
年齢が治療効果が個人によって異なる主な要因であると判断される場合、サンプルされた学生と一般集団との年齢差は、その集団における平均治療効果の推定値に偏りをもたらします。ただし、このような偏りは、簡単な再重み付け手順で修正できます。学生サブ集団における年齢固有の効果を取り、一般集団の年齢分布を使用してその平均を計算します。これにより、集団における平均治療効果の偏りのない推定値が得られます。一方、研究サンプルを一般集団から区別する関連要因自体が治療の影響を受ける場合は、別の再重み付けスキームを適用する必要があります。この要因をZと呼び、実験サンプルにおけるYに対するXのz固有の効果を再び平均しますが、今度はXのZに対する「因果効果」で重み付けします。言い換えれば、新しい重みは、治療X=xが全集団に投与された場合にレベルZ=zに達したユニットの割合です。この介入確率は、多くの場合、Do 計算を使用して記述されます[ 14 ]は、一般集団における観察研究から推定できる場合もある。
この種の典型的な例は、 Zが治療と結果の間の媒介変数である場合に発生します。たとえば、治療はコレステロール低下薬、Zはコレステロール値、Yは平均余命です。ここでは、Zは治療の影響を受けると同時に、結果Yを決定する主要な要因でもあります。実験研究のために選択された被験者は、一般集団の典型的な値よりもコレステロール値が高い傾向があると仮定します。全集団における薬剤の生存に対する平均効果を推定するために、まず実験研究におけるz固有の治療効果を計算し、次にそれを平均化します。重み付け関数として。得られた推定値は、ZとYが交絡している場合、つまり、ZとYの両方に影響を与える測定されていない共通因子が存在する場合でも、バイアスフリーになります。[ 15 ]
この重み付けスキームやその他の重み付けスキームの妥当性を保証する正確な条件は、Bareinboim and Pearl, 2016 [ 15 ]および Bareinboim et al., 2014 [ 13 ]で定式化されています。
多くの研究や研究デザインでは、内的妥当性と外的妥当性の間にトレードオフが存在する可能性があります。 [ 16 ] [ 17 ] [ 18 ]内的妥当性を高めようとすると、研究結果の一般化可能性が制限される可能性があり、その逆もまた然りです。このような状況から、多くの研究者が「生態学的妥当性」のある実験を提唱しています。これは、実験手順が「現実世界」の状況に似ているべきだという意味です。彼らは、人工的に制御され制限された環境に焦点を当てた多くの実験室ベースの研究における生態学的妥当性の欠如を批判しています。一部の研究者は、生態学的妥当性のある研究デザインに基づく因果推論は、人工的に作られた実験室環境で得られたものよりも高い一般化可能性を可能にするという意味で、外的妥当性と生態学的妥当性は密接に関連していると考えています。しかし、これは、ある集団への一般化(生態学的妥当性に関する懸念と密接に関連)と、何らかの背景要因で異なるサブ集団への一般化との区別に再び関係します。生態学的妥当性の高い研究環境で得られた知見の中には、一般化が困難なものもあれば、高度に統制された環境で得られた知見の中には、ほぼ普遍的な外的妥当性を主張するものもある。したがって、外的妥当性と生態学的妥当性は独立したものであり、ある研究は外的妥当性を備えていても生態学的妥当性を備えていない場合もあれば、その逆もあり得る。
質的研究パラダイムでは、外的妥当性は転用可能性の概念に置き換えられます。転用可能性とは、研究結果が類似のパラメータ、集団、特性を持つ状況に適用できる能力のことです。[ 19 ]
研究者の間では、実験は本質的に外的妥当性が低いという主張がよく聞かれる。実験的手法を用いる際に多くの欠点が生じる可能性があると主張する研究者もいる。被験者を無作為に条件に割り当て、外的要因の影響を排除することで状況を十分に制御できるようになった結果、実験環境はやや人工的になり、現実生活からかけ離れてしまう可能性がある。
問題となる一般化可能性には2種類ある。
しかし、これらの考察はいずれも、クックとキャンベルの、ある特定の対象集団への一般化という概念に関するものであり、おそらくより中心的な課題である、研究対象となった特定の状況とは異なる下位集団や、研究対象となった回答者とは何らかの意味のある点で異なる人々に対する実験結果の一般化可能性を評価することとは関係がない。[ 7 ]
実験の批判者たちは、外的妥当性はフィールド設定(または少なくとも現実的な実験室設定)の使用と回答者の真の確率標本の使用によって改善できると示唆している。しかし、状況的または個人的背景要因が異なるサブグループ間での一般化可能性を理解することが目的であれば、これらの対策は一般的に考えられているほど外的妥当性を高める効果はない。研究者が認識していない背景要因と治療の相互作用が存在する場合(その可能性が高いと思われる)、これらの研究手法は外的妥当性の著しい欠如を覆い隠してしまう可能性がある。産業・組織心理学について書いているディップボイとフラナガンは、あるフィールド設定とある実験室設定からの知見が、別のフィールド設定に一般化される可能性は同程度低いという証拠があると指摘している。[ 20 ]したがって、フィールド研究は本質的に外的妥当性が高いわけではなく、実験室研究は本質的に外的妥当性が低いわけでもない。どちらの場合も、研究対象とした特定の治療効果が、その研究で一定に保たれている背景要因の変化によって変化するかどうかによる。研究が、治療と相互作用しない何らかの背景要因のレベルで「非現実的」である場合、外的妥当性には影響しません。実験が何らかの背景要因を非現実的なレベルで一定に保ち、その背景要因を変化させた場合に治療×背景要因の強い相互作用が明らかになる場合にのみ、外的妥当性が脅かされます。[ 6 ]
大学で行われる心理学実験の研究は、人工的な状況で行われているため、現実生活に一般化できないと批判されることが多い。[ 21 ] [ 22 ] この問題を解決するために、社会心理学者は、研究をできるだけ現実的にすることで、結果の一般化可能性を高めようとしている。前述のように、これは特定の集団に一般化できることを期待してのことである。現実性そのものは、設定が何らかの形でより現実的になった場合、または研究参加者が異なる現実的な設定に置かれた場合に結果が変わるかどうかについての発言には役立たない。1つの設定しかテストされない場合、設定間の一般化可能性についての発言は不可能である。[ 6 ] [ 8 ]
しかし、多くの著者は外的妥当性と現実性を混同している。実験が現実的である方法は一つではない。
これは、実験が現実の状況にどれだけ似ているかという程度を、実験の日常的リアリズムと呼ぶ。[ 21 ]
研究の心理的リアリズムが高いことを確認することの方が重要である。つまり、実験で引き起こされる心理的プロセスが、日常生活で起こる心理的プロセスとどれだけ似ているかということである。[ 23 ]
人々が現実の出来事に没頭すると、心理的リアリズムは高まります。これを実現するために、研究者は参加者にカバーストーリー、つまり研究の目的についての偽りの説明を伝えることがあります。しかし、実験者が参加者に実験の目的を伝えると、そのような手順は心理的リアリズムが低くなります。日常生活では、緊急事態がいつ発生するかは誰にもわかりませんし、人々はそれに対する対応を計画する時間もありません。つまり、引き起こされる心理的プロセスは実際の緊急事態のそれとは大きく異なり、研究の心理的リアリズムが低下します。[ 3 ]
人は、実際にその行動を起こすまで、なぜそうするのか、あるいは何をするのかを必ずしも理解しているわけではありません。そのため、実験状況を参加者に説明し、普段通りに反応するように求めても、実際に同じ状況に置かれた人々の行動とは一致しない反応しか得られない可能性があります。架空の状況で人々がどう行動するかという予測に頼ることはできません。現実世界で起こるのと同じ心理的プロセスを引き起こす状況を構築して初めて、人々が実際にどう行動するかを知ることができるのです。
社会心理学者は、人々が一般的に社会的影響にどれほど影響を受けやすいかを研究する。いくつかの実験では、社会的影響の興味深く意外な例が記録されている。それは、他人がそこにいるという事実を知るだけで、人々が助け合う可能性が低くなるというものだ。
実験結果が特定の集団の行動を代表していることを確実にする唯一の方法は、参加者がその集団から無作為に選ばれていることを確認することです。社会心理学の実験では、無作為抽出は非現実的で費用がかかるため、調査のように無作為にサンプルを選択することはできません。政治世論調査の一環として、無作為抽出された人々に電話でいくつかの質問に答えてもらうよう説得するだけでも大変で、そのような世論調査の実施には数千ドルかかることがあります。さらに、たとえ何らかの方法で真に無作為なサンプルを募集できたとしても、実験的処置の効果には観察されない異質性が存在する可能性があります。処置は一部のサブグループにはプラスの効果をもたらすかもしれませんが、他のサブグループにはマイナスの効果をもたらす可能性があります。処置の平均値で示される効果は、どのサブグループにも一般化できない可能性があります。[ 6 ] [ 24 ]
多くの研究者は、人々が社会的影響を受けやすくなる基本的な心理的プロセスを研究することでこの問題に取り組んでおり、これらのプロセスは非常に基本的であるため普遍的に共有されていると仮定している。社会心理学のプロセスの中には、文化によって異なるものもあり、そのような場合は、多様な人々のサンプルを研究する必要がある。[ 25 ]
実験の外的妥当性を究極的に検証するのは、再現実験、つまり研究を再度実施することです。通常は、異なる被験者集団や異なる環境で実施されます。研究者は、同じ結果が得られるかどうかを確認するために、しばしば異なる方法を用います。
一つの問題について多くの研究が行われると、結果はばらつきが生じる可能性があります。傍観者の数が援助行動に影響を与えるという結果が出た研究もあれば、そうでない研究もあるかもしれません。こうしたばらつきを理解するために、メタ分析と呼ばれる統計的手法があります。メタ分析は、2つ以上の研究の結果を平均化して、独立変数の効果が信頼できるかどうかを判断します。メタ分析は基本的に、多くの研究結果における発見が偶然によるものか、独立変数によるものかの確率を示します。独立変数が20の研究のうち1つでのみ効果を示した場合、メタ分析ではその1つの研究は例外であり、平均的には独立変数は従属変数に影響を与えていないと判断されます。独立変数がほとんどの研究で効果を示している場合、メタ分析では平均的には従属変数に影響を与えていると判断される可能性が高くなります。
実験室に限定されない信頼できる現象が存在する可能性がある。たとえば、傍観者の数を増やすと、子供、大学生、将来の大臣など、さまざまなタイプの人々による援助行動が抑制されることがわかっている。[ 25 ]イスラエルで[ 26 ]米国の小さな町や大都市で[ 27 ]心理学実験室、街路、地下鉄などさまざまな環境で[ 28 ]発作、火災の可能性、喧嘩、事故などのさまざまな種類の緊急事態[29]、パンクなどのそれほど深刻ではない出来事[30]でも同様のことが確認されている。これらの再現実験の多くは、人々が実験が行われていることを知り得ないような現実の環境で行われている。
心理学の実験を行う際、内的妥当性と外的妥当性の間には常にトレードオフが存在すると考える人もいる。
研究者の中には、外的妥当性を高める良い方法として、フィールド実験を行うことを挙げている人もいます。フィールド実験では、人々の行動を実験室の外、つまり自然な環境で調査します。フィールド実験は、実際の生活環境で行われる点を除けば、実験室実験と設計は同じです。フィールド実験の参加者は、自分が経験する出来事が実際には実験であることに気づいていません。このような実験は、典型的な大学生のサンプルよりも多様な実際の人々を対象に現実世界で行われるため、外的妥当性が高いと主張する人もいます。しかし、現実世界の環境は大きく異なるため、ある現実世界の環境での発見が別の現実世界の環境に一般化できるかどうかはわかりません。[ 20 ]
単一の実験では、内的妥当性も外的妥当性も捉えることはできません。社会心理学者はまず内的妥当性を重視し、被験者を異なる条件にランダムに割り当て、すべての外的変数を統制する実験室実験を行います。他の社会心理学者は統制よりも外的妥当性を重視し、フィールド調査で研究の大部分を行い、両方を行う者も多くいます。両方のタイプの研究を合わせると、完璧な実験の要件を満たします。研究者は、再現実験によって、与えられた研究課題を最大限の内的妥当性と外的妥当性で研究することができます。[ 31 ]