
実験とは、仮説を支持または反証するため、あるいはこれまで試されたことのない事柄の有効性や可能性を判断するために行われる手順のことです。実験は、特定の要因を操作したときにどのような結果が生じるかを示すことで、因果関係についての洞察を与えます。実験は目的や規模において大きく異なりますが、常に再現可能な手順と結果の論理的な分析に基づいています。また、自然実験研究も存在します。
子どもは、物がどのように地面に落ちるかを理解するために基本的な実験を行うかもしれませんが、科学者のチームは、現象の理解を深めるために何年もかけて体系的な調査を行うかもしれません。実験やその他の種類の実践的な活動は、理科の授業での生徒の学習にとって非常に重要です。実験は、テストの点数を上げ、特に時間をかけて行うと、生徒が学習している教材にもっと積極的に興味を持つようにするのに役立ちます。[ 1 ]実験は、個人的で非公式な自然な比較(たとえば、さまざまなチョコレートを試食してお気に入りを見つける)から、高度に制御された(たとえば、素粒子に関する情報を発見しようとする多くの科学者が監督する複雑な装置を必要とするテスト)まで多岐にわたります。実験の使用法は、自然科学と人文科学の間で大きく異なります。
実験には通常、単一の独立変数以外の変数の影響を最小限に抑えるように設計された対照群が含まれます。これにより、多くの場合、対照群の測定値と他の測定値との比較を通じて、結果の信頼性が向上します。科学的対照は科学的方法の一部です。理想的には、実験におけるすべての変数が制御され(対照測定によって考慮され)、制御されていない変数はありません。このような実験において、すべての対照が期待どおりに機能すれば、実験が意図どおりに機能し、結果がテストされた変数の影響によるものであると結論付けることができます。
科学的方法において、実験は競合するモデルや仮説を検証する経験的手順である。[ 2 ] [ 3 ]研究者はまた、既存の理論や新しい仮説を検証し、それらを支持または反証するために実験を使用する。[ 3 ] [ 4 ]
実験は通常、特定のプロセスや現象がどのように機能するかについての仮説、つまり期待を検証するものです。しかし、実験は、実験結果が何を示すかについての具体的な期待を持たずに、「もし~だったらどうなるか」という問いに答えること、あるいは以前の結果を確認することを目的とする場合もあります。実験が慎重に実施されれば、結果は通常、仮説を支持するか反証するかのどちらかになります。科学哲学の中には、実験は仮説を「証明」することはできず、支持を加えることしかできないとするものもあります。一方、反例を提供する実験は理論や仮説を反証する可能性がありますが、理論は単純さを犠牲にして適切な場当たり的な修正を加えることで常に救済できるとされています。
実験では、実験の正確性や再現性、あるいは結果の解釈能力を損なう可能性のある交絡因子を制御する必要がある。交絡因子は、一般的に科学的制御、あるいは無作為化実験においては無作為割り付けによって排除される。
工学および物理科学において、実験は科学的方法の主要な構成要素です。実験は、特定の条件下で物理プロセスがどのように機能するかについての理論や仮説を検証するために用いられます(例えば、特定の工学プロセスで目的の化学物質を生成できるかどうかなど)。これらの分野における実験は、通常、同一の手順を繰り返し行うことで、毎回同一の結果が得られることを期待します。無作為割り当ては一般的ではありません。
医学や社会科学では、実験研究の普及率は分野によって大きく異なります。しかし、実験が行われる場合、通常は臨床試験の形式をとります。臨床試験では、実験単位(通常は個々の人間)が治療条件または対照条件にランダムに割り当てられ、1つ以上の結果が評価されます。[ 5 ]物理科学の規範とは対照的に、通常は平均治療効果(治療群と対照群の結果の差)または実験によって得られた別の検定統計量に焦点が当てられます。 [ 6 ]単一の研究では通常、実験の繰り返しは行われませんが、個別の研究はシステマティックレビューとメタ分析によって統合される場合があります。
科学の各分野において、実験手法には様々な違いがある。例えば、農業研究ではランダム化実験(例えば、異なる肥料の比較有効性を検証するため)が頻繁に用いられる一方、実験経済学では、被験者を無作為に処置群と対照群に割り当てることなく、理論化された人間の行動を実験的に検証することが多い。
ダニエル書1章12-16節の記述は、古代文学における統制された比較試験の最も初期の記述の一つであると、複数の学者が指摘している。この物語では、ダニエルとその仲間たちは、他の若者たちが王の食事を続ける一方で、野菜と水だけを摂取する10日間の試練を要求する。2つの食事法の結果が比較され、執事は観察可能な結果に基づいて行動するように指示される。[ 7 ] [ 8 ]
科学史家は、この箇所を経験的推論の初期の文学的例として時折引用している。デイビッド・C・リンドバーグは、ヘブライ語聖書には「経験的テストに似た手順」が含まれていると指摘し、ダニエル書1章を、競合する条件を評価するために意図的に実験が行われた例の一つとして挙げている。[ 9 ]ジェームズ・C・ヴァンダーカムも同様に、このエピソードは、管理された状況下で2つの食事を比較する「初歩的な実験計画」を示していると述べている。[ 10 ]この見解は普遍的ではないが、一部の評論家はこのエピソードを、記録に残る最も初期の実験テストの一つと呼んでいる。[ 11 ]
現代的な意味での実験への最初の体系的なアプローチの1つは、アラブの数学者であり学者であるイブン・アル=ハイサムの著作に見られる。彼は、プトレマイオスの著作における光学と数学の問題に遡り、光学の分野で実験を行った。その際、自己批判、実験の目に見える結果への依存、以前の結果に対する批判といった要素によって実験を制御した。彼は、結果を得るために帰納的実験法を用いた最初の学者の1人であった。[ 12 ]彼の著書『光学の書』では、実験的な意味での知識と研究への根本的に新しいアプローチについて述べている。
すなわち、私たちはその原理と前提に関する探求を再開し、まず存在する事物の調査と可視対象の状態の調査から始めるべきである。個々の事物の性質を区別し、視覚が生じる際に目に関係するものと、感覚の様式において均一で不変であり、明白で疑いの余地のないものを帰納的に収集すべきである。その後、前提を批判し、結論に関して慎重さを払いながら、探求と推論を段階的かつ秩序正しく進めるべきである。私たちが検証と検討の対象とするすべての事柄において目指すのは、偏見にとらわれず、正義を貫き、判断と批判を行うすべての事柄において、真実を求め、意見に左右されないようにすることである。このようにして、私たちは最終的に心を満足させる真実にたどり着き、徐々に慎重に、そして確信が現れる終着点に到達することができる。また、批判と慎重さを通して、意見の相違を解消し、疑わしい事柄を解決する真実を掴むことができるのである。とはいえ、私たちは人間の本性にある人間の濁りから完全に自由ではありませんが、人間として持っている力で最善を尽くさなければなりません。私たちはあらゆることにおいて神から支えを得ています。[ 13 ]
彼の説明によれば、人間の本質に起因する結果の主観性や影響を受けやすさを考慮した、厳密に管理された実験実施が必要である。さらに、先行研究者の結果や成果に対する批判的な視点も必要である。
したがって、科学者の著作を研究する者の義務は、真理の探求を目的とするならば、読んだものすべてを敵視し、その内容の核心と周辺にまで精神を集中させ、あらゆる角度から攻撃することである。また、批判的な検討を行う際には、偏見や寛容に陥らないよう、自らをも疑うべきである。[ 14 ]
したがって、客観的な実験を行うためには、以前の結果と実験結果を比較することが必要であり、目に見える結果がより重要となる。最終的に、これは実験研究者が、特に結果が実験的なものではなく論理的・精神的な推論によるものである場合は、従来の意見や結果を捨てるだけの勇気を持つ必要があることを意味するかもしれない。この批判的検討の過程において、研究者自身も「偏見」や「寛容さ」を通して主観的な意見に傾きがちであることを忘れてはならず、したがって、仮説構築の自身の方法について批判的にならなければならない。
17 世紀に活躍したイギリスの哲学者で科学者のフランシス・ベーコン(1561–1626) は、イギリスのルネサンス期に実験科学の有力な支持者となった。彼は、イブン・アル=ハイサムと同様に演繹によって科学的疑問に答える方法に反対し、それを次のように表現した。「まず自分の意志に従って疑問を決定した後、人は経験に頼り、それを自分の思い通りに曲げ、まるで捕虜を行列に引き回すように経験を引き回す。」[ 15 ]ベーコンは、再現可能な観察、つまり実験に基づく方法を求めていた。特筆すべきは、彼が今日私たちが理解している科学的方法を初めて体系化したことである。
単純な経験が残る。それをそのまま受け入れるならば、それは偶然と呼ばれ、それを求めるならば、それは実験と呼ばれる。真の経験的方法は、まずろうそく(仮説)に火を灯し、次にそのろうそくによって道筋を示す(実験を整理し、限定する)。それは、適切に整理され、消化された経験から始まり、混乱したり、不規則であったりせず、そこから公理(理論)を演繹し、確立された公理から再び新しい実験を行うからである。[ 16 ]: 101
その後の数世紀にわたり、さまざまな分野で科学的方法を適用した人々は重要な進歩と発見を成し遂げました。たとえば、ガリレオ・ガリレイ(1564~1642)は時間を正確に測定し、落下する物体の速度について正確な測定と結論を出すための実験を行いました。フランスの化学者アントワーヌ・ラヴォアジエ(1743~1794)は、実験を用いて燃焼や生化学などの新しい分野を記述し、質量(物質)保存の法則を発展させました。 [ 17 ]ルイ・パスツール(1822~1895)は科学的方法を用いて、当時主流だった自然発生説を否定し、病原菌説を発展させました。[ 18 ]潜在的に交絡する変数を制御することが重要であるため、可能な限り適切に設計された実験室実験の使用が推奨されます。
20世紀初頭には、ロナルド・フィッシャー(1890~1962)、イェジー・ネイマン(1894~1981)、オスカー・ケンプソーン(1919~2000)、ガートルード・メアリー・コックス(1900~1978)、ウィリアム・ジェメル・コックラン(1909~1980)などの統計学者の貢献により、実験の設計と分析においてかなりの進歩が見られました。[ 19 ]
実験は、さまざまな研究分野における専門的な規範や基準に応じて、いくつかの側面に基づいて分類される可能性がある。
一部の分野(例えば、心理学や政治学)では、「真の実験」とは、2種類の変数がある社会調査の方法である。独立変数は実験者によって操作され、従属変数は測定される。真の実験の重要な特徴は、実験者のバイアスを中和するために被験者をランダムに割り当て、実験を多数回繰り返すことで、すべての交絡因子を制御することを保証することである。[ 20 ]
分野によって、実験は異なるものの相互に排他的ではない目的を達成するために実施されることがある。[ 21 ]理論の検証、現象の探索と記録、理論の開発、政策立案者への助言などである。これらの目的は妥当性に関する懸念とも異なる形で関連している。
対照実験では、実験サンプルから得られた結果を対照サンプルと比較することがよくあります。対照サンプルは、効果がテストされる側面(独立変数)を除いて、実験サンプルと実質的に同一です。良い例としては、薬物試験が挙げられます。薬物を投与されるサンプルまたはグループは実験グループ(治療グループ)であり、プラセボまたは通常の治療を受けるサンプルまたはグループは対照グループです。多くの実験室実験では、実施するテストに対して複数の反復サンプルを用意し、陽性対照と陰性対照の両方を用意することが推奨されます。反復サンプルの結果は平均化できる場合が多く、反復サンプルの1つが他のサンプルの結果と明らかに矛盾している場合は、実験エラーの結果として破棄することができます(テスト手順の何らかのステップがそのサンプルで誤って省略された可能性があります)。多くの場合、テストは2回または3回繰り返されます。陽性対照は、実際の実験テストと同様の手順ですが、過去の経験から陽性の結果が得られることがわかっています。陰性対照は、陰性の結果が得られることがわかっています。陽性対照は、実際の実験サンプルが陽性結果を示さなくても、実験の基本条件が陽性結果を生成できることを確認するものです。陰性対照は、テストで測定可能な陽性結果が得られなかった場合に得られる基準値を示します。多くの場合、陰性対照の値は、テストサンプルの結果から差し引く「バックグラウンド」値として扱われます。場合によっては、陽性対照が標準曲線の象限を取ることもあります。
教育実験室でよく用いられる例として、制御されたタンパク質定量法があります。学生には、タンパク質の量が不明な液体サンプルが与えられることがあります。学生の課題は、制御された実験を正しく実施し、その液体サンプル(通常は「未知サンプル」と呼ばれます)中のタンパク質濃度を測定することです。教育実験室には、タンパク質濃度が既知のタンパク質標準溶液が用意されています。学生は、タンパク質標準溶液を様々な濃度に希釈した陽性対照サンプルをいくつか作成できます。陰性対照サンプルには、タンパク質定量法に必要な試薬はすべて含まれていますが、タンパク質は含まれていません。この例では、すべてのサンプルを2回ずつ測定します。この定量法は比色定量法であり、分光光度計を用いて、タンパク質分子と添加した色素分子の相互作用によって形成される着色複合体を検出することで、サンプル中のタンパク質量を測定します。図では、希釈した試験サンプルの結果を標準曲線(図中の青線)の結果と比較することで、未知サンプル中のタンパク質量を推定できます。
実験におけるすべての条件を正確に制御することが難しい場合、制御実験を実施することができます。この場合、実験は確率的に同等な2つ以上のサンプルグループを作成することから始まります。これは、グループ間で特性の測定値が類似し、同じ処理を与えられた場合にグループが同じように反応することを意味します。この同等性は、個体間のばらつきの量と各グループの個体数を考慮した統計的手法によって決定されます。微生物学や化学などの分野では、個体間のばらつきが非常に少なく、グループのサイズが容易に数百万に達するため、これらの統計的手法はしばしば省略され、溶液を等分するだけで同一のサンプルグループが得られるとみなされます。
同等のグループが形成されたら、実験者は、分離したい変数を除いて、グループを同一に扱うように努めます。人体実験では、プラセボ効果などの外部変数に対する特別な対策が必要です。このような実験は一般的に二重盲検法で行われ、すべてのデータが収集されるまで、被験者も研究者も、どの被験者が対照群でどの被験者が実験群であるかを知りません。これにより、被験者に生じる効果は治療そのものによるものであり、治療を受けているという事実に対する反応ではないことが保証されます。
人間を対象とした実験では、研究者は被験者(人)に刺激を与え、被験者はその刺激に反応する。実験の目的は、テスト方法を用いて刺激に対する反応を測定することである。
実験計画法では、2つ以上の「処理」を適用して、処理に対する平均応答の差を推定します。たとえば、パンを焼く実験では、水と小麦粉の比率などの量的変数と、酵母の株などの質的変数に関連する応答の差を推定できます。実験は、2つ以上の競合する説明、つまり仮説の間で人々が決定を下すのに役立つ科学的方法のステップです。これらの仮説は、現象を説明したり、行動の結果を予測したりする理由を示唆します。たとえば、「このボールを放すと、床に落ちる」という仮説が考えられます。この示唆は、ボールを放す実験を行い、結果を観察することによってテストできます。正式には、仮説は反対の仮説または帰無仮説(「このボールを放すと、床に落ちない」)と比較されます。帰無仮説は、調査されている推論によって現象の説明や予測力がないということです。仮説が定義されたら、実験を行い、その結果を分析することで、仮説の妥当性を確認、反証、または明確にすることができる。
また、近隣の未処理区画への波及効果を推定するための実験を設計することもできる。
「実験」という用語は通常、制御された実験を意味しますが、制御された実験は、非常に困難、不可能、非倫理的、または違法な場合があります。この場合、研究者は自然実験または準実験に頼ります。[ 22 ]自然実験は、制御された実験のように1つまたは少数の変数を操作するのではなく、研究対象のシステムの変数の観察のみに依存します。可能な限り、すべての変数の寄与を決定でき、特定の変数の変動の影響がほぼ一定に保たれ、他の変数の影響を識別できるような方法で、システムのデータを収集しようとします。これがどの程度可能であるかは、観測されたデータの説明変数間の相関関係に依存します。これらの変数の相関が低い場合、自然実験は制御された実験の検出力に近づくことができます。しかし、通常はこれらの変数間に何らかの相関関係があり、制御された実験を行った場合に結論付けられることと比較して、自然実験の信頼性が低下します。また、自然実験は通常、制御されていない環境で行われるため、検出されない要因からの変数は測定も一定に保たれることもなく、研究対象の変数間に見かけ上の相関関係が生じる可能性がある。
経済学、人文地理学、考古学、社会学、文化人類学、地質学、古生物学、生態学、気象学、天文学など、多くの科学分野における研究は、準実験に依拠している。例えば、天文学において、「星は水素の雲が収縮したものである」という仮説を検証する場合、巨大な水素の雲から始めて、それが星を形成するまで数十億年待つという実験を行うことは明らかに不可能である。しかし、様々な収縮状態にある様々な水素の雲や、この仮説の他の意味合い(例えば、星の光から発せられる様々なスペクトル放射の存在)を観測することで、仮説を裏付けるために必要なデータを収集することができる。この種の実験の初期の例としては、17世紀に光が瞬時に場所から場所へ移動するのではなく、測定可能な速度を持つことを初めて検証したことが挙げられる。木星の衛星の出現は、木星が地球から遠いときの方が、木星が地球に近いときよりもわずかに遅れて観測されました。そして、この現象は、衛星の出現時間の差が測定可能な速度と一致することを示すために使用されました。[ 23 ]
フィールド実験は、人工的で高度に管理された実験室環境で仮説を検証することで科学的統制を強化する実験室実験と区別するために、そのように名付けられています。社会科学、特に教育や健康介入の経済分析でよく用いられるフィールド実験は、人工的な実験室環境ではなく、自然な環境で結果を観察できるという利点があります。このため、フィールド実験は実験室実験よりも外的妥当性が高いと見なされることがあります。しかし、自然実験と同様に、フィールド実験も汚染の可能性に悩まされます。実験室では、実験条件をより正確かつ確実に制御できます。しかし、一部の現象(例えば、選挙における投票率)は、実験室では容易に研究できません。

観察研究は、物理的または社会的システムを実験室環境に適合させること、交絡因子を完全に制御すること、または無作為割り付けを適用することが非現実的、非倫理的、費用がかかりすぎる(またはその他の理由で非効率的)な場合に用いられます。また、交絡因子が限定的であるか、または十分に既知であるため、それらを考慮してデータを分析できる場合にも用いられます(ただし、社会現象を調査する場合、このようなケースはまれです)。観察科学が有効であるためには、実験者は交絡因子を把握し、考慮に入れる必要があります。このような状況において、観察研究は、無作為化実験や新たなデータ収集によって検証可能な仮説を提示することが多いため、価値があります。
しかし、根本的に、観察研究は実験ではありません。定義上、観察研究にはベーコンの実験に必要な操作がありません。さらに、観察研究(例えば、生物学的システムや社会的システム)には、定量化や制御が難しい変数が含まれることがよくあります。観察研究は、ランダム化実験の統計的特性がないため、限界があります。ランダム化実験では、実験プロトコルで指定されたランダム化の方法が統計分析を導き、統計分析も通常、実験プロトコルで指定されます。[ 24 ]客観的なランダム化を反映する統計モデルがない場合、統計分析は主観的なモデルに依存します。[ 24 ]主観的なモデルからの推論は、理論的にも実際的にも信頼できません。[ 25 ]実際、注意深く実施された観察研究が一貫して誤った結果、つまり観察研究の結果が矛盾しており、実験の結果とも異なるケースがいくつかあります。たとえば、大腸がんの疫学研究では一貫してブロッコリーの摂取との有益な相関関係が示されていますが、実験では有益性は見出されていません。[ 26 ]
ヒトを対象とした観察研究における特有の問題は、治療(または曝露)間の公平な比較が非常に困難であることです。なぜなら、このような研究は選択バイアスを受けやすく、異なる治療(曝露)を受けたグループは、共変量(年齢、身長、体重、投薬、運動、栄養状態、民族、家族の病歴など)によって大きく異なる可能性があるからです。一方、ランダム化は、各共変量について、各グループの平均が同じであると期待されることを意味します。ランダム化試験では、もちろん平均からの多少のばらつきは予想されますが、ランダム化によって、中心極限定理とマルコフの不等式により、実験グループの平均値が近いことが保証されます。ランダム化が不十分であったり、サンプルサイズが小さかったりすると、治療グループ(または曝露グループ)間の共変量の系統的なばらつきにより、治療(曝露)の効果を、測定されていない他の共変量の効果から分離することが困難になります。このようなデータを分析するために使用される数理モデルは、(測定されている場合)それぞれの異なる共変量を考慮する必要があり、共変量がランダム化されておらず、かつモデルに含まれていない場合、結果は意味をなさない。
実験の有用性を大幅に低下させるような状況を避けるため、米国食品医薬品局の承認を得るための臨床試験を実施する医師は、特定可能な共変量を定量化してランダム化します。研究者は、傾向スコアマッチングなどのマッチング方法を用いて観察研究のバイアスを減らそうとしますが、これには大規模な被験者集団と共変量に関する広範な情報が必要です。しかし、傾向スコアマッチングはバイアスを減らすのではなく増やす可能性があるため、もはや手法としては推奨されていません。[ 27 ]結果も可能な限り定量化され(骨密度、血液中の特定の細胞または物質の量、身体の強さまたは持久力など)、被験者または専門の観察者の意見に基づくものではありません。このようにして、観察研究のデザインは結果をより客観的にし、したがってより説得力のあるものにすることができます。
独立変数の分布を研究者が制御下に置くことで、実験、特に人間を対象とする実験では、利益と害のバランス、介入(例えば、病気の治療)の公平な分配、インフォームド・コンセントなどの倫理的考慮事項が生じる可能性がある。例えば、心理学や医療では、患者に標準以下の治療を提供することは非倫理的である。したがって、倫理審査委員会は、新しい治療法が現在の最良の診療と同等の利益をもたらすと信じられない限り、臨床試験やその他の実験を中止することになっている。[ 28 ]また、ヒ素摂取が人間の健康に及ぼす影響など、標準以下の治療や有害な治療の影響に関するランダム化実験を行うことは、一般的に非倫理的(そして多くの場合違法)である。このような曝露の影響を理解するために、科学者は観察研究を用いてこれらの要因の影響を理解することがある。
実験研究が直接的に人間を対象としない場合でも、倫理的な懸念が生じる可能性がある。例えば、マンハッタン計画で行われた核爆弾実験は、実験自体に人間が直接関与していなかったにもかかわらず、核反応を利用して人間に危害を加えることを示唆していた。