影響評価は、プロジェクト、プログラム、ポリシーなどの特定の介入に起因する変化を評価します。意図されたものだけでなく、理想的には意図されていないものも評価します。[1]目標が達成されたかどうかを調査する成果モニタリングとは対照的に、影響評価は、介入が行われなかった場合、参加者の幸福などの成果がどのように変化したかという質問に答えるように構成されています。これには、反事実分析、つまり「実際に起こったことと介入がなかった場合に起こったであろうこととの比較」が含まれます。[2]影響評価は、因果関係の質問に答えようとします。言い換えると、プログラムに直接起因する成果の変化を探します。[3]
影響評価は、何が効果的で、何が効果的でないか、どこで、なぜ、そしていくらかという、証拠に基づく政策立案のための重要な質問に答えるのに役立ちます。近年、先進国と発展途上国の両方において、政策立案において影響評価への注目が高まっています。[4]評価ツールと評価アプローチの重要な要素であり、生活水準の向上における援助の提供と公共支出の有効性を改善するための世界的な取り組みに不可欠です。もともと影響評価は、発展途上国における社会セクタープログラム、特に条件付き現金給付の評価に重点を置いていましたが、現在では農業、エネルギー、輸送などの他の分野でもますます適用されています。
反事実的評価設計
反事実分析により、評価者は介入と結果の因果関係を特定できます。「反事実」は介入が行われなかった場合に受益者に何が起こったかを測定し、反事実の結果と介入下で観察された結果を比較することで影響を推定します。影響評価における主な課題は、反事実を直接観察することができず、比較グループを参照して近似する必要があることです。反事実分析に適した比較グループを決定するための、前向き (事前) または後向き (事後) 評価設計のいずれかを使用する、さまざまなアプローチが認められています。前向き評価は介入の設計フェーズで開始され、介入の受益者 (「治療グループ」) と非受益者 (「比較グループ」) からベースライン データとエンドライン データを収集します。個人またはコミュニティを治療グループと比較グループに選択する必要がある場合があります。遡及的評価は通常、実施段階の後に実施され、既存の調査データを活用する場合があります。ただし、最良の評価では、介入グループと比較グループの比較可能性を確保するために、可能な限りベースラインに近いデータを収集します。
厳密な影響評価では、内部妥当性(研究設計)と外部妥当性(一般化可能性)に関連する5つの重要な原則、すなわち交絡因子、選択バイアス、波及効果、汚染、影響の異質性に対処する必要があります。[5]
- 交絡は、通常、社会経済的地位に関連する特定の要因が介入への曝露と相関し、曝露とは関係なく、関心のある結果と因果関係がある場合に発生します。したがって、交絡因子は、介入と結果の間に観察される(おそらく偽の)関係に対する別の説明となります。
- 選択バイアスは交絡の特殊なケースであり、介入参加者が受益者集団からランダムに選ばれず、選択を決定する基準が結果と相関している場合に発生します。介入へのアクセスまたは介入への参加に関連し、関心のある結果と因果関係にある観察されない要因が考慮されていない場合、介入と結果の間に偽の関係が生じる可能性があります。自己選択は、たとえば、より有能または組織化された個人またはコミュニティが、関心のあるより良い結果を得る可能性が高いため、介入に参加する可能性も高い場合に発生します。内生的プログラム選択は、介入から利益を得る可能性が高いと思われる個人またはコミュニティが参加するように選択される場合に発生します。交絡因子を無視すると、欠落変数バイアスの問題につながる可能性があります。選択バイアスの特殊なケースでは、選択変数の内生性により同時性バイアスが発生する可能性があります。
- スピルオーバー(実験評価の場合は伝染と呼ばれる)は、比較(コントロール)グループのメンバーが介入の影響を受ける場合に発生します。
- 汚染は、治療グループおよび/または比較グループのメンバーが、関心のある結果にも影響を与える別の介入にアクセスできる場合に発生します。
- 影響の異質性とは、受益者の種類と状況によって生じる影響の違いを指します。質の高い影響評価では、さまざまなグループ (たとえば、恵まれない人々) が介入からどの程度恩恵を受けるか、また状況が影響に及ぼす潜在的な影響を評価します。結果がどの程度一般化できるかによって、他の状況での介入に教訓を適用できるかどうかが決まります。
影響評価設計は、反事実を生成するために使用される方法の種類によって識別され、実験的、準実験的、非実験的設計の3つのカテゴリに大まかに分類できます。これらは、実現可能性、コスト、介入の設計中または実施後の段階の関与、および選択バイアスの程度が異なります。White (2006) [6]と Ravallion (2008) [7] は、代替の影響評価アプローチについて説明しています。
実験的アプローチ
実験的評価では、治療群と比較群がランダムに選択され、介入からも、また関心のある結果に影響を与える可能性のある介入からも分離されます。これらの評価設計は、ランダム化比較試験(RCT) と呼ばれます。実験的評価では、比較群は対照群と呼ばれます。介入による伝染なしに十分に大きなサンプルに対してランダム化が実施されると、治療群と対照群の平均的違いは、対照群が介入を受けないことだけです。評価のサンプルがランダムに選択されるランダムサンプル調査を、治療のランダム割り当てを必要とする実験的評価設計と混同しないでください。
実験的アプローチは、評価の「ゴールドスタンダード」としてしばしば取り上げられる。これは、介入と結果の因果関係を証明する際に選択バイアスを決定的に説明できる唯一の評価設計である。ランダム化と介入からの分離は、社会政策の分野では実行可能ではない可能性があり、倫理的に擁護するのが難しいかもしれないが、[8] [9]自然実験を使用する機会はあるかもしれない。BambergerとWhite(2007)[10]は、開発介入にRCTを適用することの限界のいくつかを強調している。Scriven(2008)[11]は、社会介入は完全に盲検化することができないためにバイアスが導入されるという方法論的批判を行っており、Deaton(2009)[12]は、実際のRCTの分析では、回避しようとしている回帰ベースのアプローチに頼っているため、同じ潜在的なバイアスの影響を受けると指摘している。その他の問題としては、介入の状況が多様で変化していること、ロジスティックスと実務上の課題、サービス提供のモニタリングの難しさ、比較グループによる介入へのアクセス、選択基準や介入の経時的変化などが挙げられる。そのため、RCTは開発資金の5%にしか適用できないと推定されている。[10]
ランダム化比較試験(RCT)
RCT は、新しい介入の有効性を測定するために使用される研究です。それ自体では因果関係を証明することはまずありませんが、ランダム化によってバイアスが軽減され、因果関係を調べるツールが提供されます。[13] RCT はランダム割り当てに依存しているため、プロジェクトの自然な割り当てがランダムベースになることはまれであるため、評価はほとんどの場合事前に設計する必要があります。 [14] RCT を設計する際には、次の 5 つの重要な質問をする必要があります。テストされる治療法は何か、治療群はいくつあるか、割り当ての単位は何か、必要なサンプルの規模はどれくらいか、テストはどのようにランダム化されるか。[14] 適切に実施された RCT は、特定の集団または割り当て単位内での平均治療効果に関する信頼できる推定値をもたらします。[15] RCT の欠点は「輸送問題」であり、ある集団内で有効なものが必ずしも別の集団内で有効であるとは限らないため、平均治療効果は異なる割り当て単位間では適用できないことを意味します。[15]
自然実験
自然実験が使用されるのは、これらの方法が、制御されていないフィールドと制御された実験室でのデータ収集アプローチに内在する緊張を和らげるためである。[16]自然実験は、研究者と被験者の制御外のイベントを活用して、内部妥当性に対するいくつかの脅威に対処し、交絡因子の可能性を最小限に抑える一方で、より自然な治療効果の範囲や有機的に形成されたコンテキストの存在など、フィールドデータの特徴のいくつかを犠牲にしている。 [16]自然実験の主な問題は、再現性の問題である。実験室での作業は、適切に記述され、繰り返されると、同様の結果を生み出すことができるはずである。自然実験の独自性のため、複製は、同様のイベントからの代替データの分析に限定されることが多い。[16]
非実験的アプローチ
準実験デザイン
準実験的アプローチは、観測可能なものの選択から生じるバイアス、およびパネル データが利用可能な場合は時間不変の観測不可能なものを除去することができます。準実験的方法には、マッチング、差分、操作変数、パイプライン アプローチなどがあり、通常は多変量回帰分析によって実行されます。
選択特性がわかっていて観察されている場合、それを制御して偏りを取り除くことができます。マッチングでは、観察された選択特性に基づいてプログラム参加者と非参加者を比較します。傾向スコア マッチング(PSM) では、統計モデルを使用して、観察可能な特性のセットに基づいて参加の確率を計算し、同様の確率スコアを持つ参加者と非参加者をマッチングします。回帰不連続設計では、誰が介入を受けるか受けないかの決定ルールを利用して、このカットオフの両側にいる人々の結果を比較します。
介入グループと比較グループのベースラインとエンドラインで収集されたデータを使用する差異の差異または二重差異は、選択を決定する観察不可能な要因が時間の経過に伴って固定されている(時間不変)という仮定の下で選択バイアスを説明するために使用できます。
手段変数推定では、選択とは相関しているが結果とは相関していない要因(「手段」)を使用して参加をモデル化することで選択バイアスを考慮し、外生的として扱うことができるプログラム参加の側面を分離します。
パイプライン アプローチ (ステップ ウェッジ デザイン) では、後の段階でプロジェクトに参加するよう既に選択されている受益者を比較グループとして使用します。この仮定では、将来介入を受けるよう選択されている受益者は治療グループと類似しており、したがって、関心のある結果変数の点で比較可能であるとされています。ただし、実際には、治療グループと比較グループが比較可能であることは保証されず、比較可能性を確認するために何らかのマッチング方法を適用する必要があります。
非実験的デザイン
非実験的影響評価は、介入にアクセスできない比較グループを含まないことから、このように呼ばれています。非実験的評価で使用される方法は、介入の実施前と実施後の介入グループを比較することです。介入中断時系列(ITS) 評価では、介入前後の治療対象者に関する複数のデータ ポイントが必要ですが、前後 (または事前テスト事後テスト) デザインでは、前後の 1 つのデータ ポイントのみが必要です。事後テスト分析には、介入グループからの介入後のデータのみが含まれます。非実験的デザインは、介入と結果の因果関係を説得力を持って示すために、結果に対する可能性のある代替説明は無関係であることを評価で実証する必要があるため、最も弱い評価デザインです。ただし、たとえば、アメニティへのアクセスを改善する介入による時間の節約を計算する場合など、このデザインが関連するアプリケーションはまだあります。さらに、普遍的に実施されるプログラムや、孤立した比較グループが存在しない可能性が高い国家政策改革など、非実験的設計が唯一実行可能な影響評価設計である場合もあります。
プログラム効果の推定におけるバイアス
ランダム化フィールド実験は、プログラムの影響を評価するための最も強力な研究設計です。この特定の研究設計は、プログラムの実際の効果を公正かつ正確に推定できるため、実行可能な場合は一般的に選択される設計であると言われています (Rossi、Lipsey、Freeman、2004)。
そうは言っても、ランダム化フィールド実験は必ずしも実行可能とは限らず、このような状況では、評価者が利用できる代替の研究デザインがあります。しかし主な問題は、評価者がどのデザインを選択するかに関係なく、共通の問題に陥りやすいことです。つまり、デザインがどれだけよく考え抜かれ、適切に実装されているかに関係なく、各デザインはプログラム効果の偏った推定値を生み出す傾向があります。これらのバイアスは、プログラム効果を誇張したり、小さくしたりする役割を果たします。それだけでなく、バイアスがとる方向は通常、事前に知ることができません (Rossi et al.、2004)。これらのバイアスは利害関係者の利益に影響します。さらに、バイアスが効果のないプログラムや有害なプログラムを効果的であるように見せることに寄与する場合、プログラム参加者が不利益を被る可能性があります。また、バイアスによって、効果的なプログラムが効果がない、または有害であるようにさえ見える可能性もあります。これにより、プログラムの成果が小さく、あるいは重要でないと思われ、その結果、プログラム担当者やスポンサーがプログラムへの資金提供を削減または中止せざるを得なくなる可能性があります (Rossi et al.、2004)。
不適切な設計によって偏りが生じた場合、最も懸念されるのは、プログラムの資金提供に大きく責任を持つ利害関係者であると言っても過言ではありません。評価の結果は、最終決定権が資金提供者とスポンサーにあるため、利害関係者がプログラムへの資金提供を継続するかどうかを決定するのに役立ちます。最も懸念されるのは利害関係者だけではありません。プログラムに参加する人々やプログラムがプラスの影響を与えることを意図している人々も、選択された設計とその選択された設計によってもたらされる結果の影響を受けます。したがって、評価者の懸念は、プログラム効果の推定における偏りの量を最小限に抑えることです (Rossi 他、2004)。
バイアスは通常、次の 2 つの状況で明らかになります。プログラムへの参加による結果の測定値、またはプログラムへの参加がない場合の結果の推定値が、対応する「真の」値よりも高いか低い場合です (p267)。残念ながら、影響評価を危うくする可能性のあるバイアスの形態はすべて明らかというわけではありません (Rossi 他、2004)。
影響評価設計の最も一般的な形式は、プログラムを受ける介入グループと受けない対照グループの 2 つの個人または他のユニットのグループを比較することです。プログラム効果の推定は、適切な結果測定におけるグループ間の差異に基づきます (Rossi 他、2004)。個人をプログラム グループと対照グループにランダムに割り当てることで、継続的な同等性を想定できます。ランダム化によって形成されていないグループ比較は、非同等比較設計と呼ばれます (Rossi 他、2004)。
選択バイアス
同等性の仮定がない場合、グループ間の結果の差は、プログラム効果の推定において何らかのバイアスを生み出す。これは選択バイアスとして知られている(Rossi et al., 2004)。これは、非同等グループ比較設計を使用したあらゆる影響評価においてプログラム効果推定の妥当性に脅威をもたらし、グループへの割り当てが純粋な偶然によって決定されるのではなく、影響の原因となるプロセスが完全にはわかっていない状況で、どの個人がどのグループに入るかを選択する場合に現れる(Rossi et al., 2004)。これは、参加者の自己選択による場合もあれば、プログラムの配置(配置バイアス)による場合もある。[17]
選択バイアスは、すでに形成された介入グループとコントロール グループのメンバーの結果データが失われる自然または意図的なプロセスを通じて発生する可能性があります。これは脱落と呼ばれ、2 つの方法で発生します (Rossi 他、2004 年)。つまり、ターゲットが介入から脱落するか、コントロール グループに到達できないか、ターゲットが結果測定に協力することを拒否します。明確な偶然のプロセス以外の何かの結果として脱落が発生した場合、差異脱落が想定されます (Rossi 他、2004 年)。つまり、「結果データが欠落している介入グループの個人は、結果データが欠落しているコントロール グループの個人と同じ結果関連特性を持っているとは想定されない」ということです (Rossi 他、2004 年、p271)。ただし、ランダム割り当て設計は、脱落によって引き起こされる選択バイアスから逃れられません (Rossi 他、2004 年)。
その他の偏見
影響評価の結果に偏りが生じる原因となる要因は他にもあります。これらは通常、介入中に発生するプログラムを受ける以外のイベントや経験に関係しています。これらの偏りには、世俗的な傾向、干渉イベント、成熟度などが含まれます (Rossi 他、2004)。
世俗的な傾向か世俗的な流れか
世俗的傾向とは、コミュニティ、地域、または国における比較的長期的な傾向と定義できます。これらは世俗的ドリフトとも呼ばれ、介入の明らかな効果を高めたり隠したりする変化を生み出す可能性があります (Rossi 他、2004)。たとえば、コミュニティの出生率が低下している場合、その下降傾向から生じるバイアスのために、出生率を下げるプログラムが効果的であるように見えることがあります (Rossi 他、2004、p273)。
妨害イベント
妨害イベントは世俗的な傾向に似ています。この場合、プログラム効果の推定に偏りをもたらす可能性のある変化を生み出す可能性のあるのは短期的なイベントです。たとえば、停電によって通信が妨害されたり、食品サプリメントの配達が妨げられたりすると、栄養プログラムに支障をきたす可能性があります (Rossi 他、2004、p273)。
成熟
影響評価では、自然な成熟と発達のプロセスがプログラムとは無関係にかなりの変化を生み出す可能性があるという事実を考慮する必要があります。プログラム効果の推定にこれらの変化を含めると、バイアス推定値が発生します。このバイアスの例として、成人の予防的健康習慣を改善するプログラムは、一般的に年齢とともに健康が低下するため、効果がないように見える場合があります (Rossi 他、2004、p273)。
「ランダム割り当てと結果測定の間、プログラム グループとコントロール グループの比較可能な状況を注意深く維持することで、グループに対する他の異なる経験やイベントの影響による偏りを防ぐことができます。これらの条件のいずれかが設計に含まれていない場合、プログラム効果の推定に偏りが生じる可能性があります」(Rossi 他、2004、p274)。
推定方法
推定方法は、概ね評価設計に従う。設計が異なれば、対照事実からの幸福の変化を測定するための推定方法も異なる。実験的評価および準実験的評価では、介入の推定影響は、治療群(介入を受ける人々)と対照群または比較群(介入を受けない人々)の平均結果の差として計算される。この方法は、ランダム化比較試験(RCT)とも呼ばれる。雑誌D+C Development and Cooperationで、アメリカ評価協会の元代表ジム・ラフ氏へのインタビューによると、この方法は複雑で多層的な問題には適さない。単一差推定量は、最終段階で平均結果を比較し、治療群と対照群がベースラインで同じ結果値を持つ場合に有効である。差の差(または二重差)推定量は、治療群と比較群の経時的な結果の変化の差を計算するため、両方のグループのベースラインで収集されたデータと、介入の実施後(数年後になる場合もある)の最終段階で収集された2回目のデータを利用する。[18]
受益者の参加(「コンプライアンス」または「アドヒアランス」とも呼ばれる)に関係なく、治療グループの平均成果を比較グループの結果と比較する必要がある影響評価は、治療意図(ITT)分析と呼ばれます。治療グループで介入に従順またはアドヒアランスした受益者の成果を対照グループの結果と比較する影響評価は、治療対治療(TOT)分析と呼ばれます。したがって、ITTは影響の下限推定値を提供しますが、自発的プログラムの分析では、TOTよりも政策的関連性が高いと言えます。[19]
討論
影響評価の重要性については合意が得られており、対事実的評価方法の使用についてもコンセンサスが形成されつつあるが、近年では影響評価の定義と適切な評価方法の使用についても広範な議論がなされている(概要については White 2009 [20]を参照)。
定義
国際影響評価イニシアチブ(3ie)は、厳密な影響評価を次のように定義しています。「調査対象の評価問題と特定の状況に対して、利用可能な最良の方法論、実行可能かつ適切な方法論を使用して、特定のプログラムに起因する特定の人々のグループの成果の純変化を測定する分析」[21]
世界銀行のDIMEイニシアチブによると、「影響評価は、プログラムの結果を、プログラムがなければ受益者に何が起こったかを示す反事実と比較する。他の評価形式とは異なり、実験的および準実験的設計に従うことで、観察された結果の変化を評価対象のプログラムに帰属させることができる」[22] 。
同様に、米国環境保護庁によると、影響評価とは、プログラムの成果をプログラムがない場合に起こったであろう結果の推定と比較することによって、プログラムの純粋な効果を評価する評価形式です。[23]
世界銀行の独立評価グループ(IEG)によると、影響評価とは、プログラムやプロジェクトなどの特定の開発活動によって個々の世帯、機関、環境にもたらされるプラスまたはマイナスの影響、意図的か否かを問わず、体系的に特定することです。[24]
影響評価は過去数十年にわたって様々な定義がなされてきました。[6]影響評価の他の解釈としては以下のようなものがあります。
- プロジェクトの成果だけでなく、介入が最終的な福祉成果に与える影響に注目する評価、または実施に焦点を当てたプロセス評価。
- 影響が現れるまでの時間を確保するために、介入が完了してからしばらく経ってから(5年から10年後)評価を実施する。
- 特定のセクターまたは地理的領域内のすべての介入を考慮した評価。
他の著者は「影響評価」と「影響評価」を区別している。「影響評価」は経験的手法を使用して介入の効果とその統計的有意性を推定するのに対し、「影響評価」には構造シミュレーションや統計的有意性をテストできない他のアプローチを含む、より広範な方法が含まれる。[17]
評価で使われる「影響」の一般的な定義は、一般的に、介入が生活の質の成果に及ぼす長期的な影響の総体を指します。たとえば、経済協力開発機構の開発援助委員会 (OECD-DAC) は、影響を「開発介入によって直接的または間接的に、意図的または意図的でない形で生み出される、プラスとマイナス、一次的および二次的な長期的影響」と定義しています。[25]多くの国際機関もこの影響の定義を採用しています。たとえば、ユニセフは、影響を「意図的であるかどうかにかかわらず、技術的、経済的、社会文化的、制度的、環境的、またはその他のプログラムの長期的な結果。意図された影響は、プログラムの目標に対応している必要があります。」と定義しています。 [26]同様に、Evaluationwiki.org は、影響評価を、政策、指導、またはサービスの直接的な結果を超えて、長期的および意図されていないプログラムの影響を特定する評価と定義しています。[27]
技術的には、ここで定義された「影響」を、反事実的分析を参照せずに評価することができます。しかし、既存の文献の多く(例:NONIEの影響評価ガイドライン[28])は、OECD-DACの影響の定義を採用しながらも、介入の影響を帰属させるために使用される手法は、必然的に反事実的分析に基づくものであると述べています。
「影響」評価という用語に欠けているのは、「影響」が長期的に現れる方法です。たとえば、ほとんどのモニタリングと評価の「論理フレームワーク」計画には、入力、出力、結果、そして...影響があります。最初の 3 つはプロジェクト期間中に現れますが、影響が発生するにははるかに長い時間がかかります。たとえば、5 年間の農業プロジェクトでは、種子が入力、種子の使用を訓練された農民が出力、種子が適切に植えられたことによる作物の収穫量の変化が結果、家族が時間の経過とともにより持続可能な食糧確保を行えることが影響です。このようなプロジェクト後の影響評価は非常にまれです。これらは事後評価とも呼ばれ、持続的影響評価という造語も使われています。何十万もの文書がそれらを要求していますが、資金面での柔軟性、または関心を持って、プロジェクトが終了し、リソースが撤回された後、私たちの介入がどれだけ持続的で耐久性があったかを確認するために戻ってくることはめったにありません。設計、実装、M&E、および国のオーナーシップを促進する方法について学ぶべき教訓は数多くあります。
方法論的議論
学界では、影響評価の適切な方法論をめぐって、実験的方法論の支持者と、より一般的な方法論の支持者の間で激しい議論が交わされている。ウィリアム・イースタリーはこれを「開発経済学の内戦」と呼んでいる。実験設計の支持者(「ランダミスタ」と呼ばれることもある)[8]は、ランダム化が観察不可能な選択バイアスを考慮に入れる唯一の手段であり、脆弱な実験的証拠の基盤を構築することが優先課題として開発されるべきであると主張している。[29]これとは対照的に、ランダム化割り当てが開発介入に適切であることはめったになく、適切であったとしても、実験は特定の介入を特定の状況に適用した結果に関する情報しか提供せず、外部との関連性についてはほとんど提供しないと主張する者もいる。[30]評価機関などからは、一部のドナーや学者が影響評価に好まれる方法を過度に強調し、 [31]実際にこれが学習と説明責任を妨げる可能性があるという批判がある。 [32]さらに、影響評価における定性的な手法の適切な役割についても議論がありました。[33] [34]
理論に基づく影響評価
有効性に関する知識は不可欠であるが、有効性の理由と結果が再現される可能性のある状況を理解することも重要である。治療群と比較群の間の結果の平均差のみを報告する「ブラックボックス」の影響評価アプローチとは対照的に、理論に基づく影響評価では、入力から結果と影響までの因果関係の連鎖をマッピングし、根本的な仮定をテストする必要がある。[35] [28]公共政策の領域における介入のほとんどは、強制的な(法的に義務付けられた)性質ではなく、自発的なものである。さらに、介入は受動的ではなく能動的であることが多く、受益者の参加が少ないのではなく多く、したがって有効性の前提条件として行動の変化が必要である。したがって、人々が行動を好意的に変えるよう動機付けられる程度に応じて、公共政策は成功する。理論に基づくアプローチにより、政策立案者はプログラム参加の異なるレベル(「コンプライアンス」または「遵守」と呼ばれる)の理由と、行動の変化を決定するプロセスを理解することができる。理論に基づくアプローチでは、定量的データ収集と定性データ収集の両方が使用されます。後者は、遵守の理由を理解し、介入を他の環境で再現できるかどうか、また再現するにはどうすればよいかを判断するのに特に役立ちます。定性データ収集の方法には、フォーカス グループ、詳細なインタビュー、参加型農村評価 (PRA)、現地訪問、人類学および政治文献の閲覧などがあります。
ホワイト(2009b)[35]は、影響評価の政策的妥当性を向上させる手段として、影響評価への理論に基づくアプローチをより広く適用することを提唱し、理論に基づくアプローチの6つの主要原則を概説している。
- 介入がどのようにして意図した成果につながると予想されるかを説明する因果関係の連鎖(プログラム理論)をマッピングし、因果関係の根底にある仮定をテストするためのデータを収集します。
- 介入の社会的、政治的、経済的状況を含む文脈を理解する。
- 異質性を予測してサブグループを識別し、分析で使用する分解レベルを考慮してサンプル サイズを調整します。
- 信頼できる反事実的仮定を用いた影響の厳密な評価(上記で説明したとおり)。
- 因果関係の連鎖におけるリンクの厳密な事実分析。
- 混合方法(定量的方法と定性的方法の組み合わせ)を使用します。
例
1980年代から開発途上国における栄養や水・衛生への介入を評価するために実験的影響評価手法が使用されてきたが、大規模開発プログラムへの実験的手法の最初で最もよく知られている適用は、メキシコの条件付き現金給付(CCT)プログラムProgresa(現在はOportunidadesと呼ばれている)の評価であり、就学率、予防接種率、児童労働など、さまざまな開発成果が調査された。[36] [37] CCTプログラムはそれ以来、ラテンアメリカやその他の国々の多くの政府によって実施されており、2009年2月に世界銀行が発表した報告書では、20カ国におけるCCTの影響が調査されている。[38]
最近では、インパクト評価は社会部門と生産部門にわたるさまざまな介入に適用されている。3ieは、低所得国と中所得国で実施された研究を網羅したインパクト評価のオンラインデータベースを立ち上げた。インパクト評価を公表している他の組織には、Innovations for Poverty Action、世界銀行のDIME Initiative、NONIEなどがある。世界銀行のIEGは、過去20年間にさまざまな部門で実施された開発プログラムのインパクト評価10件の経験を体系的に評価し、要約している。[39]
開発介入の影響評価を推進する組織
2006年、評価ギャップ作業部会[40]は、開発介入に関する証拠に大きなギャップがあり、特に低・中所得国における厳格な影響評価に資金を提供し、推進することでそのギャップを埋めるための独立機関を設立すべきだと主張した。この報告書を受けて、国際影響評価イニシアチブ(3ie)が設立された。3ieは、何が、いつ、なぜ、どの程度効果があるのかの証拠を提供、要約することで、低・中所得国の貧困層の生活改善を目指している。3ieは助成金プログラムを運営し、低・中所得国における影響調査や、新たな証拠が現れたときに更新される既存の証拠の総合的なレビューに資金を提供し、品質保証サービスを通じて質の高い影響評価をサポートしている。
影響の評価に特化したもう一つの取り組みは、持続可能性評価委員会 (COSA) です。COSA は非営利のグローバル機関コンソーシアムで、国際持続可能開発研究所(IISD) の持続可能な商品イニシアチブ、国連貿易開発会議(UNCTAD)、および国連国際貿易センター(ITC) と提携して維持されています。COSA は、農業慣行、特に特定の持続可能性プログラム (オーガニック、フェアトレードなど) の実施に関連する農業慣行の明確な社会的、環境的、経済的影響を分析するための独立した測定ツールを開発および適用しています。この取り組みの焦点は、農家、政策立案者、業界がさまざまな作物や農業セクターでの持続可能性を理解し、改善するために使用できるグローバルな指標と測定ツールを確立することです。COSA は、特定の持続可能性イニシアチブに参加することで生じる相対的なコストとメリットを正確に計算できるようにすることで、これを促進することを目指しています。
貧困対策イノベーション、世界銀行の戦略的影響評価基金 (SIEF)、世界銀行の開発影響評価 (DIME) イニシアティブ、CGIAR の組織学習と変革 (ILAC) イニシアティブ、影響評価ネットワーク ネットワーク (NONIE) など、影響評価を世界的に推進するために設立された組織は数多くあります。
影響の証拠の体系的レビュー
さまざまな組織が、システマティック レビューの作成を調整するために取り組んでいます。システマティック レビューは、特定のトピックに関する既存の証拠の範囲を評価し、その情報をアクセス可能な形式で提示することで、研究と政策の溝を埋めることを目指しています。厳密な影響評価と同様に、システマティック レビューは、研究の対象範囲、検索、および統合方法に関する基準を事前に規定する研究プロトコルから作成されます。システマティック レビューには、次の 5 つの主要なステップが含まれます。対象とする介入、対象集団、結果、研究デザインの決定、発表済みおよび未発表の文献を特定するための検索、研究プロトコルに規定されている研究対象範囲基準 (介入、対象集団、結果、研究デザインに関連) の適用、研究からの情報のコード化、フォレスト プロットを使用した介入の有効性に関する定量的推定値の提示、および介入が適切に均質であると判断された場合は、メタ分析を使用したプールされた要約推定値の計算。最後に、システマティック レビューは、新しい証拠が出現するたびに定期的に更新する必要があります。システマティック レビューでは、介入の有効性に対する障壁や促進要因などに関する質的情報の統合も行われる場合があります。
参照
参考文献
- ^ 世界銀行貧困グループの影響評価、2008年1月6日にアクセス
- ^ 「White, H. (2006) Impact Evaluation: The Experience of the Independent Evaluation Group of the World Bank、World Bank、ワシントン DC、p. 3」(PDF) 。 2018年2月19日時点のオリジナル(PDF)からアーカイブ。 2010年1月7日閲覧。
- ^ 「Gertler、Martinez、Premand、Rawlings、Vermeersch (2011) Impact Evaluation in Practice、ワシントン DC:世界銀行」。2011 年 7 月 17 日時点のオリジナルよりアーカイブ。2010年 12 月 15 日閲覧。
- ^ 「ログイン」(PDF) 。 2017年1月16日閲覧。
- ^ 「ログイン」(PDF) 。 2017年1月16日閲覧。
- ^ ab 「White, H. (2006) Impact Evaluation: The Experience of the Independent Evaluation Group of the World Bank、World Bank、ワシントン DC」(PDF) 。 2018年2月19日時点のオリジナル(PDF)からアーカイブ。 2010年1月7日閲覧。
- ^ ラヴァリオン、M. (2008) 貧困対策プログラムの評価
- ^ ab Martin, Ravallion (2009年1月1日). 「ランダミスタはルールを作るべきか?」. 6 (2): 1–5 . 2017年1月16日閲覧– RePEc - IDEAS経由。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要です - ^ 「ランダミスタは、RCT 手法の支持者を表すために批評家が使用する俗語です。これは、実験経済学者とその成功、特にランダム化の最も成功した専門家の 1 人であるエスター・デュフロを軽々しく退けることを意図した、性別を区別した軽蔑的な用語であることはほぼ間違いありません。」 Webber, S., & Prouse, C. (2018). The New Gold Standard: The Rise of Randomized Control Trials and Experimental Development. Economic Geography, 94(2), 166–187 を参照。
- ^ ab Bamberger, M. および White, H. (2007) 開発途上国における強力な評価デザインの活用: 経験と課題、Journal of MultiDisciplinary Evaluation、第 4 巻、第 8 号、58-73
- ^ Scriven (2008) RCT 方法論の総括的評価: 因果関係研究への代替アプローチ、Journal of MultiDisciplinary Evaluation、第 5 巻、第 9 号、11-24 ページ
- ^ ディートン、アンガス(2009年1月1日)。「開発の手段:熱帯地方におけるランダム化、そして経済開発へのつかみどころのない鍵の探求」SSRN 1335715。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要です - ^ Hariton, Eduardo; Locascio, Joseph J. (2018年12月). 「ランダム化比較試験—有効性研究のゴールドスタンダード」. BJOG: 国際産科婦人科ジャーナル. 125 (13): 1716. doi :10.1111/1471-0528.15199. ISSN 1470-0328. PMC 6235704 . PMID 29916205.
- ^ ab White, Howard (2013年3月8日). 「開発介入を評価するためのランダム化比較試験の利用入門」. Journal of Development Effectiveness . 5 :30–49. doi : 10.1080/19439342.2013.764652 . S2CID 51812043.
- ^ ab Deaton, Angus; Cartwright, Nancy (2016-11-09). 「ランダム化比較試験の限界」VoxEU.org . 2020年10月26日閲覧。
- ^ abc Roe, Brian E.; Just, David R. (2009年12月). 「経済研究における内部妥当性と外部妥当性: 実験、フィールド実験、自然実験、フィールドデータ間のトレードオフ」. American Journal of Agricultural Economics . 91 (5): 1266–1271. doi :10.1111/j.1467-8276.2009.01295.x. hdl : 10.1111/j.1467-8276.2009.01295.x . ISSN 0002-9092.
- ^ ab White, Howard; Raitzer, David (2017). 開発介入の影響評価: 実践ガイド(PDF)マニラ: アジア開発銀行。ISBN 978-92-9261-059-3。
- ^ Rugh, Jim (2012年6月22日). 「釘を探すハンマー」D+C Development and Cooperation . 2012 (7): 300.
- ^ Bloom, H. (2006) 社会調査のためのランダム化実験のコア分析。MDRC 研究方法論ワーキングペーパー。MDRC、ニューヨーク
- ^ 「White, H. (2009) 影響評価における現在の議論に関する考察、ワーキングペーパー1、国際影響評価イニシアチブ、ニューデリー」。2013年1月8日時点のオリジナルよりアーカイブ。2012年10月29日閲覧。
- ^ 「ログイン」(PDF) 。 2017年1月16日閲覧。
- ^ 世界銀行(nd)開発影響評価(DIME)イニシアチブ、プロジェクト文書、世界銀行、ワシントン DC
- ^ 米国環境保護庁プログラム評価用語集、2008年1月6日にアクセス
- ^ 世界銀行独立評価グループ、2008年1月6日にアクセス
- ^ OECD-DAC (2002) 評価と成果に基づく管理における主要用語集 提案された統一用語集、OECD、パリ
- ^ UNICEF (2004) UNICEF評価報告書基準、評価オフィス、UNICEF NYHQ、ニューヨーク
- ^ 「評価の定義: 評価とは何か? - EvaluationWiki」 。 2017年1月16日閲覧。
- ^ ab 「ページが見つかりません」 。 2017年1月16日閲覧。
{{cite web}}:引用は一般的なタイトルを使用します (ヘルプ) - ^ 「Banerjee, AV (2007) 『Making Aid Work』 Cambridge, Boston Review Book, MIT Press, MA」(PDF) 。 2017年1月16日閲覧。[永久リンク切れ ]
- ^ Bamberger, M. および White, H. (2007) 発展途上国における強力な評価デザインの活用: 経験と課題、Journal of MultiDisciplinary Evaluation、第 4 巻、第 8 号、58-73
- ^ http://www.europeanevaluation.org/download/?noGzip=1&id=1969403 [ permanent dead link ]影響評価における方法論的に多様なアプローチの重要性に関するEES声明
- ^ http://www.odi.org.uk/resources/odi-publications/opinions/127-impact-evaluation.pdf 「ゴールドスタンダード」は評価の万能薬ではない
- ^ 「援助の有効性:影響評価における質的研究の役割」2014年6月27日。
- ^ Prowse, Martin; Camfield, Laura (2013). 「開発援助の質の向上」. Progress in Development Studies . 13 : 51–61. doi :10.1177/146499341201300104. S2CID 44482662.
- ^ ab 「White, H. (2009b) 理論に基づく影響評価: 原則と実践、ワーキングペーパー3、国際影響評価イニシアチブ、ニューデリー」。2012年11月6日時点のオリジナルよりアーカイブ。 2012年10月29日閲覧。
- ^ Gertler, P. (2000) 最終報告書: PROGRESA の健康への影響。国際食糧政策研究所、ワシントン DC
- ^ 「無題の文書」(PDF)2017年1月16日閲覧。
- ^ Fiszbein, A. および Schady, N. (2009) 条件付き現金給付: 現在および将来の貧困の削減: 世界銀行政策研究報告書、世界銀行、ワシントン DC
- ^ インパクト評価:世界銀行独立評価グループの経験、2006年
- ^ 「私たちはいつ学ぶのか?影響評価を通じて生活を改善する」 。 2017年1月16日閲覧。
情報源と外部リンク
- Gertler、Martinez、Premand、Rawlings、Vermeersch (2011) 『インパクト評価の実践』、ワシントン DC: 世界銀行
- 世界銀行貧困グループ 世界銀行貧困グループ
- 世界銀行独立評価グループまたはWikipediaの独立評価グループ
- ベイカー、ジュディ。2000年。開発プロジェクトの貧困への影響の評価:実務者向けハンドブック。開発の方向性、世界銀行、ワシントンDC
- インパクト評価のための国際イニシアチブ
- 貧困撲滅のためのイノベーション
- 持続可能性評価委員会 (COSA)
- 国際持続可能開発研究所(IISD)
- 国連国際貿易センター(ITC)
