統計学および心理測定学 において、信頼性とは、測定誤差のない尺度である。[ 1 ]古典的テスト理論において、信頼性とは、観測されたテストスコアの変動のうち、「真の」スコア変動によるものの割合である。信頼性の高い尺度は、一貫した条件下で類似した測定値を生み出す傾向がある。
これは、一連のテストスコアの特性であり、測定プロセスから生じるランダム誤差がスコアにどれだけ含まれているかに関係します。信頼性の高いスコアは、正確で再現性があり、テストの機会ごとに一貫性があります。つまり、テストプロセスを同じ受験者グループで繰り返した場合、基本的に同じ結果が得られます。スコアの誤差の量を示すために、通常、0.00(誤差が大きい)から1.00(誤差がない)までの値をとるさまざまな種類の信頼性係数が使用されます。[ 2 ]
信頼性推定には、いくつかの一般的な分類があります。
信頼性は妥当性を意味するものではない。つまり、一貫して何かを測定している信頼性の高い尺度が、必ずしも測定すべきものを測定しているとは限らない。例えば、特定の能力を測定する信頼性の高いテストは数多く存在するが、それらすべてが、例えば仕事のパフォーマンスを予測するのに妥当であるとは限らない。
信頼性は妥当性を意味するものではないが、信頼性はテストの全体的な妥当性に限界を設ける。完全に信頼性のないテストは、人の属性を測定する手段としても、基準のスコアを予測する手段としても、完全に妥当であることはできない。信頼性の高いテストは有用な妥当な情報を提供する可能性があるが、信頼性のないテストは妥当であるはずがない。[ 7 ]
例えば、ある計量器が常に物体の重量を実際の重量より500グラム多く計測した場合、その計量器は非常に信頼性が高いと言えますが、有効な計量器とは言えません(計測値が実際の重量ではないため)。計量器が有効であるためには、物体の実際の重量を正確に計測する必要があります。この例は、完全に信頼できる測定値が必ずしも有効であるとは限らない一方、有効な測定値は必ず信頼性も備えている必要があることを示しています。
実際には、テストの測定方法は決して完全に一貫しているわけではありません。テストの信頼性に関する理論は、一貫性の欠如が測定の正確さに及ぼす影響を推定するために開発されました。テストの信頼性に関するほぼすべての理論の基本的な出発点は、テストのスコアが2種類の要因の影響を反映しているという考え方です。[ 7 ]
これらの要因には以下が含まれます。[ 7 ]
信頼性を推定する目的は、テストスコアの変動のうち、測定誤差によるものと真のスコア(真の値)の変動によるものの割合を決定することです。[ 7 ]
真のスコアとは、測定対象の概念の再現可能な特徴のことである。それは、誤差がない場合、異なる測定機会においても繰り返し得られる観測スコアの部分である。
測定誤差は、ランダム誤差 と系統誤差の両方から構成されます。これは、テストで得られたスコアと対応する真のスコアとの間のずれを表します。
この概念的な分解は、通常、次の単純な方程式で表されます。
ここで、Xは観測されたテストスコア、Tは真のスコア、Eは測定誤差である。
信頼性理論の目的は、測定における誤差を推定し、誤差を最小限に抑えるための検査方法の改善策を提案することである。
信頼性理論の中心的な仮定は、測定誤差は本質的にランダムであるということである。これは、誤差がランダムなプロセスから生じるという意味ではない。個々の人にとって、測定誤差は完全にランダムな事象ではない。しかし、多数の個人にわたって、測定誤差の原因は非常に多様であるため、測定誤差はランダム変数として作用すると考えられる。[ 7 ]
誤差が確率変数の本質的な特性を持つ場合、誤差は正負どちらになる確率も等しく、真の得点や他のテストの誤差とは相関がないと考えるのが妥当である。
以下のことが想定される:[ 8 ]
信頼性理論によれば、得られたスコアの分散は、真のスコアの分散と測定誤差の分散の合計に等しい。[ 7 ]
この方程式は、テストの点数が2つの要因によって変動することを示唆している。
信頼性係数これは、真の得点と誤答得点がテストの得点に及ぼす相対的な影響度を示す指標です。一般的に、信頼性係数は、真の得点の分散とテストの得点の全分散の比として定義されます。あるいは、誤答得点の変動と観測得点の変動の比を1から引いた値と同等です。
残念ながら、真の得点を直接観察したり計算したりする方法はありません。そのため、テストの信頼性を推定するために様々な方法が用いられます。
信頼性を推定する方法の例としては、再テスト信頼性、内的整合性信頼性、並行テスト信頼性などが挙げられる。それぞれの方法は、テストにおける誤差の原因を突き止めるという問題に対して、多少異なるアプローチをとる。
古典的なテスト理論家にとって、測定精度は測定尺度全体で均一ではないことはよく知られていた。[ 9 ] テストは、中程度の特性レベルを持つ受験者をより良く区別する傾向があるが、高得点と低得点の受験者の間では区別が悪くなる傾向がある。 項目反応理論は、信頼性の概念を単一の指標から情報関数と呼ばれる関数に拡張する。IRT情報関数は、任意のテストスコアにおける条件付き観測スコア標準誤差の逆数である。
信頼性を推定する目的は、テストスコアのばらつきのうち、測定誤差によるものと真のスコアのばらつきによるものの割合を判断することである。
テストの信頼性を推定するための実用的な方法を提供する4つの実践的な戦略が開発されました。[ 7 ]
再テスト信頼性法は、テストの実施回数ごとにテストスコアの一貫性がどの程度あるかを直接評価する手法です。これには以下の要素が含まれます。
最初のテストのスコアと再テストのスコアの相関関係は、ピアソン積率相関係数を使用してテストの信頼性を推定するために使用されます。項目-合計相関も参照してください。
この方法の鍵は、内容、回答プロセス、統計的特性において同等の代替テスト形式を開発することです。例えば、いくつかの一般知能テストには代替形式が存在し、これらのテストは一般的に同等であると見なされています。[ 7 ]
並行テストモデルでは、テストの2つの形式を開発することが可能です。つまり、形式Aにおける個人の真の得点は、形式Bにおける個人の真の得点と同一になります。両方の形式のテストを複数の人に実施した場合、形式Aと形式Bの得点の差は、測定誤差のみに起因する可能性があります。[ 7 ]これは以下を含みます。
2つの代替形式の得点間の相関関係は、テストの信頼性を推定するために使用される。
この方法は、再テスト信頼性法に内在する多くの問題に対する部分的な解決策を提供する。例えば、2つのテスト形式が異なるため、持ち越し効果の問題は少なくなる。反応性効果も部分的に制御されるが、最初のテストを受けることで2回目のテストに対する反応が変わる可能性がある。しかし、同じテストを2回実施する場合ほど、テストの異なる形式では効果が強くないと考えるのは妥当である。[ 7 ]
しかし、この手法には欠点もある。
この方法は、小節の2つの部分を代替形式として扱います。これは、並行形式法が抱える問題、すなわち代替形式の作成の難しさに対するシンプルな解決策を提供します。[ 7 ]この方法には以下が含まれます。
これら2つの分割された部分間の相関関係は、テストの信頼性を推定するために使用されます。この分割された部分の信頼性推定値は、スピアマン・ブラウンの予測式を使用して、テスト全体の長さにまで拡張されます。
信頼性を推定するためにテストを分割する方法はいくつかあります。たとえば、40項目の語彙テストを2つのサブテストに分割できます。最初のサブテストは項目1から20までで構成され、2番目のサブテストは項目21から40までで構成されます。ただし、項目の難易度と疲労の増加により、前半の回答は後半の回答と系統的に異なる可能性があります。[ 7 ]
テストを分割する場合、内容と回答者の想定される状態の両方において、2つの半分が可能な限り類似している必要があります。最も簡単な方法は、奇数番号の項目をテストの半分に、偶数番号の項目をもう一方の半分に分割する奇数偶数分割を採用することです。この配置により、各半分に元のテストの最初、中間、最後の項目が同数含まれることが保証されます。[ 7 ]
内的整合性は、テスト内の項目間の結果の一貫性を評価します。最も一般的な内的整合性の尺度はクロンバックのアルファであり、これは通常、可能なすべての分割半係数の平均として解釈されます。[ 10 ]クロンバックのアルファは、内的整合性を推定する以前の形式であるクーダー・リチャードソン式20 の一般化です。[ 10 ]最も一般的に使用されているにもかかわらず、クロンバックのアルファに関していくつかの誤解があります。[ 11 ] [ 12 ]
これらの信頼性指標は、さまざまな誤差要因に対する感度が異なるため、必ずしも等しいとは限りません。また、信頼性は指標そのものではなく、指標のスコアの特性であるため、標本依存的であると言えます。ある標本から得られた信頼性推定値は、別の標本から得られた信頼性推定値と(標本抽出のばらつきによる影響を超えて)異なる可能性があります。これは、2番目の標本が異なる母集団から抽出された場合、その母集団における真のばらつきが異なるためです。(これはあらゆる種類の指標に当てはまります。例えば、物差しは家屋の寸法を測るには適していても、昆虫の体長を測るには信頼性が低い場合があります。)
信頼性は、表現の明確化(筆記評価の場合)、尺度の延長[ 10 ]、その他の非公式な手段によって向上させることができます。しかし、項目分析と呼ばれる正式な心理測定分析は、信頼性を高める最も効果的な方法と考えられています。この分析は、項目の難易度と項目の弁別指数を計算することで構成され、後者の指数は、項目とテスト全体の項目スコアの合計との相関関係を計算することによって算出されます。難しすぎる項目、簡単すぎる項目、および/または弁別力がゼロに近い、または負の値の項目をより良い項目に置き換えると、尺度の信頼性が向上します。
このセクションでは、尺度得点の信頼性に関する推奨事項、信頼性と妥当性の関係、および尺度得点の信頼性を高めるための戦略について説明します。
信頼性の最小値として広く引用されている基準は0.70であり、この基準の主要な出典としてNunnally(1978)の教科書[ 13 ]がよく挙げられます。しかし、Nunnallyは実際にはかなり異なることを述べていました。彼は基礎研究の初期段階(信頼性が0.70以上で十分だと考えていた)と、候補者について重要な決定が下される状況(「信頼性0.90が最低限であり、信頼性0.95が望ましい基準とみなされるべきである(p.246)」)を区別しました。
ナンナリーの推薦重要な意思決定において、偽陰性エラーによる損失が候補者に不均衡に及ぶという懸念が、この提言の根拠となっている。応募者が十分にいる場合、組織は別の候補者を採用するか、別の学生を入学させるだけで済むが、候補者は機会を失うことになる。したがって、ナンナリーの提言は、評価を通じた倫理的な意思決定のための提言と捉えることができるだろう。
しかし、彼は高い信頼性を達成することに伴う「コスト」については明確には言及しなかった。例えば、50項目のテストの信頼性がすると、信頼性に必要な試験の長さは約238項目(追加項目は既存の項目と同等でなければならない)である。ナンナリー氏は、組織が238項目の試験にどのように資金を提供するのか、また受験者が238項目の試験を受けることについてどう感じるのかについては言及しなかった。疲労の影響が受験者のスコアに悪影響を与える可能性があるかどうか、また試験実施期間が極端に長いことが一部の受験者に不利になる可能性があるかどうかについても議論しなかった。
信頼性が高いことは、心理測定学者が残りの項目の内容を無視して係数アルファなどの推定値を最大化するために項目を削除すると、内容妥当性と矛盾する可能性がある。本質的に同じ質問を異なる方法で繰り返し測定することは、内容妥当性を損なう一方で信頼性を高めるためだけに用いられることが多い。[ 14 ] [ 15 ]
他の条件が同じ場合、項目数が増えるにつれて信頼性は向上する。しかし、項目数の増加は測定効率を低下させる。
信頼性を向上させるために、以下の方法を検討することができる。
データ収集前:
データ収集後:
{{cite book}}: CS1 maint: 複数の名前: 著者リスト (リンク)