心理測定学において、項目反応理論(IRT、潜在特性理論、強力真スコア理論、現代精神テスト理論とも呼ばれる)は、能力、態度、その他の変数を測定するテスト、質問票、および同様のツールの設計、分析、および採点のためのパラダイムです。これは、テスト項目における個人の成績と、その項目が測定するように設計された能力の全体的な尺度における受験者の成績レベルとの関係に基づくテスト理論です。項目と受験者の両方の特性を表すために、いくつかの異なる統計モデルが使用されます。[ 1 ]尺度の作成と質問票の回答の評価のためのより単純な代替手段とは異なり、各項目が等しく難しいとは仮定しません。この点が、たとえばリッカート尺度とは異なります。リッカート尺度では、「すべての項目は互いに複製であると仮定される、つまり項目は並行ツールとみなされる」のです。[ 2 ]対照的に、項目反応理論は、各項目の難易度(項目特性曲線、またはICC)を、項目の尺度化に組み込む情報として扱います。
IRTは、テストデータに数学モデルを適用することに基づいています。古典的テスト理論と比較して、より複雑なテスト状況を扱うことができるため、[ 3 ] IRTは、大学院入学共通試験(GRE)や大学院経営入学試験(GMAT)など、いくつかの重要な評価で好ましい方法となっています。
項目反応理論という名称は、古典的テスト理論がテスト全体に焦点を当てているのに対し、この理論が項目に焦点を当てていることに由来します。したがって、IRTは、特定の能力を持つ各受験者がテスト内の各項目にどのように反応するかをモデル化します。項目という用語は一般的で、あらゆる種類の情報項目を網羅しています。項目は、正解と不正解がある多肢選択式の問題である場合もあれば、回答者が同意の度合い(評価またはリッカート尺度)を示すことができる質問票の記述、患者の症状の有無を採点する項目、複雑なシステムにおける診断情報なども含まれます。
IRTは、項目に対する正解/キー入力の確率が、個人パラメータと項目パラメータの数学的関数であるという考えに基づいています。(「個人パラメータと項目パラメータの数学的関数」という表現は、行動は環境における個人の関数であると主張するLewinの式、B = f(P, E)に類似しています。)個人パラメータは、(通常)単一の潜在特性または次元として解釈されます。例としては、一般知能や態度の強さなどがあります。項目の特徴付けに用いられるパラメータには、難易度(難易度範囲における位置を表す「位置」として知られています)、個人の成功率が能力に応じてどれだけ急激に変化するかを表す弁別力(傾きまたは相関)、および推測によって最も能力の低い人でも得点する(低い)漸近線を特徴付ける擬似推測パラメータ(たとえば、4つの選択肢がある多肢選択式項目で純粋な偶然による得点は25%)などがあります。
項目反応関数の概念は 1950 年以前から存在していました。IRT の理論としての先駆的な研究は 1950 年代と 1960 年代に行われました。先駆者 3 人は、Educational Testing Service の心理測定学者Frederic M. Lord [ 4 ]、デンマークの数学者Georg Rasch、オーストリアの社会学者Paul Lazarsfeldで、それぞれ独立して並行研究を進めていました。IRT の進歩をさらに進めた主要人物には、Benjamin Drake WrightとDavid Andrichがいます。IRT が広く使われるようになったのは 1970 年代後半から 1980 年代にかけてで、その頃、実務家は IRT の「有用性」と「利点」を知らされ、パーソナル コンピュータによって多くの研究者が IRT に必要な計算能力を利用できるようになったのです。1990 年代には、 Margaret Wu がPISAとTIMSS のデータを分析する 2 つの項目反応ソフトウェア プログラムを開発しました。 ACER ConQuest(1998年)とRパッケージTAM(2010年)。
IRTの目的は、とりわけ、評価がどれだけうまく機能するか、また評価における個々の項目がどれだけうまく機能するかを評価するための枠組みを提供することです。IRTの最も一般的な応用例は教育分野であり、心理測定学者は試験の開発と設計、試験用項目バンクの維持、試験の連続バージョンにおける項目の難易度の等化(例えば、時間の経過に伴う結果の比較を可能にするため)にIRTを使用します。[ 5 ]
IRTモデルは、潜在特性モデルと呼ばれることが多い。潜在という用語は、個々の項目の回答が、直接観察されるものではなく、顕在的な回答から推論されなければならない、仮説上の特性、構成概念、または属性の観察可能な現れであると強調するために用いられる。潜在特性モデルは社会学の分野で開発されたが、IRTモデルと実質的に同一である。
IRTは一般的に、古典的テスト理論(CTT)よりも優れているとされています。CTTで実行可能なタスクにおいては、IRTは一般的に柔軟性が高く、より高度な情報を提供します。コンピュータ適応型テストなど、IRTによって可能になるアプリケーションもあり、古典的テスト理論だけでは適切に実行できません。IRTがCTTよりも優れているもう一つの利点は、IRTが提供するより高度な情報によって、研究者が評価の信頼性を向上させることができる点です。
IRTには3つの前提がある。
この特性は、尺度上で測定可能であるとさらに想定されています(テストが存在すること自体がこれを前提としています)。通常、平均が 0.0、標準偏差が 1.0 の標準尺度に設定されます。一次元性は均質性と解釈されるべきであり、これは特定の目的や用途に関連して定義または経験的に実証されるべき性質ですが、測定可能な量ではありません。「局所的独立性」とは、(a)ある項目が使用される可能性が他の項目の使用とは関連していないこと、および(b)項目への回答が各受験者の独立した決定であること、つまり不正行為やペアワーク、グループワークがないことを意味します。次元性のトピックは因子分析で調査されることが多い一方、IRF は IRT の基本的な構成要素であり、多くの研究や文献の中心となっています。
IRF(問題応答関数)は、特定の能力レベルを持つ人が正解する確率を示します。能力が低い人は正解する可能性が低く、能力が高い人は正解する可能性が非常に高くなります。例えば、数学の能力が高い生徒は、数学の問題を正解する可能性が高くなります。確率の正確な値は、能力に加えて、IRFの項目パラメータのセットによって決まります。

例えば、3パラメータロジスティックモデル(3PL )では、通常は多肢選択式の質問である二値項目iに対する正解の確率は次のようになります。
どここれは、項目パラメータを推定する目的で、個人の能力が正規分布からのサンプルとしてモデル化されていることを示しています。項目パラメータが推定された後、報告目的で個々の個人の能力が推定されます。、、 そしてこれらは項目パラメータです。項目パラメータによってIRFの形状が決まります。図1は理想的な3PL ICCを示しています。
項目パラメータは、標準ロジスティック関数の形状を変更するものとして解釈できます。 簡単に言うと、パラメータは次のように解釈されます(読みやすさのために添え字は省略しています)。bが最も基本的なパラメータなので、最初に記載されています。
もしするとこれらは次のように簡略化されます。そしてつまり、bは50%の成功レベル(難易度)に等しく、a(4で割った値)は最大傾斜(識別力)であり、これは50%の成功レベルで発生します。さらに、正解のロジット(対数オッズ)は(仮定すると)特に、能力θが難易度bに等しい場合、正解の確率は1:1(つまりlogit 0)であり、能力が難易度より上(または下)であればあるほど、正解の可能性が高く(または低く)なり、識別aによって、能力に応じて確率がどれだけ急速に増加または減少するかが決まります。
言い換えれば、標準ロジスティック関数は漸近最小値が 0 である ()は、0 を中心としています(、)であり、最大傾斜を持つ。のパラメータは水平スケールを伸縮します。パラメータは水平スケールをシフトし、パラメータは垂直スケールを圧縮しますにこれについては以下で詳しく説明します。
パラメータこれは項目の位置を表し、達成度テストの場合は項目の難易度と呼ばれます。IRF の傾きが最大となる場所、そして値が最小値とそして最大値は1です。例題は中程度の難易度です。=0.0 は分布の中心付近に位置します。このモデルでは、項目の難易度と個人の特性が同じ連続体上にスケーリングされていることに注意してください。したがって、項目に関連するタスクをうまくこなすことが特定の能力レベルを反映しているという意味で、項目の難易度が個人 A の特性レベルとほぼ同じである、あるいは個人の特性レベルが項目 Y の難易度とほぼ同じである、と言うことは妥当です。
アイテムパラメータこれは項目の識別力、つまり潜在連続体上の異なる領域にいる人々を項目がどの程度識別できるかを表します。このパラメータは、IRFの傾きが最大となる点を特徴づけます。例の項目は=1.0となり、これはかなり良好な判別能力を示しています。能力の低い人は、能力の高い人に比べて正解する可能性がはるかに低いことが分かります。この判別パラメータは、標準的な加重線形回帰(最小二乗法、OLS)における各項目または指標の重み係数に相当し、したがって、潜在的な概念を教師なしで測定するための指標の加重インデックスを作成するために使用できます。
複数選択項目などの項目については、パラメータは、推測が正解の確率に与える影響を考慮するために用いられます。これは、能力が非常に低い人が偶然にこの項目を正解する確率を示し、数学的には下漸近線として表されます。4つの選択肢がある多肢選択式項目は、例の項目のようなIRFを持つ可能性があります。能力が非常に低い受験者が正解を推測する確率は1/4なので、はおよそ 0.25 になります。このアプローチでは、すべての選択肢が等しく妥当であると仮定しています。なぜなら、1 つの選択肢が意味をなさない場合、最も能力の低い人でもそれを捨てることができるからです。そのため、IRT パラメータ推定法では、これを考慮に入れて、を推定します。観測データに基づく。[ 6 ]
大まかに言えば、IRTモデルは一次元モデルと多次元モデルの2種類に分類できます。一次元モデルでは、単一の特性(能力)次元が必要です。多次元IRTモデルは、複数の特性から生じると仮定される応答データをモデル化する。しかし、複雑さが大幅に増すため、IRTの研究および応用の大部分は一次元モデルを利用している。
IRT モデルは、採点される回答の数に基づいて分類することもできます。典型的な多肢選択式項目は二分法です。選択肢が 4 つまたは 5 つある場合でも、正解/不正解 (正しい/間違っている) としてのみ採点されます。別のクラスのモデルは、各回答が異なるスコア値を持つ多項式の結果に適用されます。 [ 7 ] [ 8 ]この一般的な例としては、リッカート型の項目、たとえば「1 から 5 の尺度で評価してください」などがあります。別の例としては、部分点採点があり、多項式ラッシュ モデルなどのモデルが適用できます。
二分IRTモデルは、使用するパラメータの数によって説明されます。[ 9 ] 3PLは、3つの項目パラメータを使用するため、そのように名付けられています。 2パラメータモデル(2PL)は、データには推測がなく、アイテムは位置に関して変化する可能性があると仮定します()と差別() 1パラメータモデル (1PL) は、推測が能力の一部であり、モデルに適合するすべての項目が同等の弁別力を持つと仮定し、項目は単一のパラメータ (この結果、1パラメータモデルは特定の客観性という性質を持ちます。つまり、項目の難易度の順位は能力に関係なくすべての回答者で同じであり、個人の能力の順位は難易度に関係なく項目で同じです。したがって、1パラメータモデルはサンプルに依存しない性質を持ちますが、これは2パラメータモデルや3パラメータモデルでは成り立ちません。さらに、理論的には4パラメータモデル(4PL)があり、その上限漸近線はで表されます。どこ3PLでは、ただし、これはめったに使用されません。項目パラメータのアルファベット順は、その実用的または心理測定上の重要性とは一致しないことに注意してください。位置/難易度()パラメータは、3つのモデルすべてに含まれているため、明らかに最も重要です。1PLはのみを使用します。2PLはそして3PLは、4PLは、。
2PLは3PLモデルと同等で、また、空欄補充問題(「121の平方根は何ですか?」)のように正解を推測することが極めて困難な項目や、性格、態度、興味に関する項目(例:「私はブロードウェイミュージカルが好きです。賛成/反対」)のように推測という概念が適用されない項目をテストするのに適しています。
1PLは、推測が存在しない(または無関係である)だけでなく、すべての項目が識別力の点で同等であると仮定します。これは、すべての項目に同一の負荷量を持つ共通因子分析に類似しています。個々の項目または個人には二次因子が存在する可能性がありますが、これらは相互に独立しており、全体として直交していると仮定されます。
別の定式化では、正規確率分布に基づいてIRFを構築します。これらは、正規オジーブモデルと呼ばれることもあります。例えば、 2パラメータ正規オジーブIRFの式は次のとおりです。
ここで、Φは標準正規分布の累積分布関数(CDF)である。
正規オジーブモデルは、測定誤差が正規分布するという仮定に基づいており、その点において理論的に魅力的である。は、再び難易度パラメータです。識別パラメータは、これは項目iの測定誤差の標準偏差であり、1/ に匹敵する。。
項目間の四分相関行列を因子分析することで、正規オジーブ潜在特性モデルを推定することができる。[ 10 ] これは、汎用統計ソフトウェアを使用して単純なIRTモデルを推定することが技術的に可能であることを意味する。
能力パラメータを再スケーリングすることで、2PLロジスティックモデルを累積正規オージブに非常に近いものにすることが可能です。[ 11 ] 通常、2PLロジスティックと正規オージブのIRFは、関数の範囲全体で確率が0.01以下しか違いません。ただし、結果に大きな影響を与える傾向のある分布の裾の部分では、その差が最も大きくなります。
潜在特性/IRTモデルは、当初は正規オジーブを使用して開発されましたが、当時のコンピュータ(1960年代)では計算負荷が高すぎると考えられていました。より単純な代替案としてロジスティックモデルが提案され、それ以来広く使用されています。しかし、最近では、正規CDFの標準的な多項式近似を使用すると、正規オジーブモデルはロジスティックモデルよりも計算負荷が高くないことが実証されています。[ 12 ] [ 13 ]
ラッシュモデルは、しばしば1PL IRTモデルとみなされます。しかし、ラッシュモデリングの支持者は、データと理論の関係を概念化するためのまったく異なるアプローチとして捉えることを好みます。[ 14 ] 他の統計モデリングアプローチと同様に、IRTはモデルと観測データとの適合性の重要性を強調しますが、[ 15 ]ラッシュモデルは基本的な測定の要件の重要性を強調し、適切なデータとモデルの適合は、テストや研究機器が特性を測定していると主張される前に満たすべき重要ではあるが二次的な要件です。[ 16 ] 操作的には、これは、IRTアプローチがデータで観察されたパターンを反映するための追加のモデルパラメータを含み(たとえば、項目が潜在特性との相関で変化するようにする)、ラッシュアプローチでは、潜在特性の存在に関する主張は、(a)データがラッシュモデルに適合し、(b)テスト項目と受験者がモデルに適合する場合にのみ有効とみなされることを意味します。したがって、ラッシュモデルでは、不適合な回答は不適合の理由を診断する必要があり、潜在特性に対応していない理由を実質的に説明できる場合はデータセットから除外される可能性があります。 [ 17 ]このように、ラッシュアプローチは、観測されたデータをモデル化しようとする探索的アプローチとは対照的に、確認的アプローチであると言えます。
推測または擬似偶然パラメータの有無は、重要かつ時には議論の的となる区別である。IRTアプローチには、多肢選択式試験での推測を考慮するための左漸近線パラメータが含まれるが、Raschモデルには含まれない。これは、推測によってデータにランダムに分布したノイズが加わると想定されているためである。ノイズはランダムに分布しているため、十分な項目がテストされれば、生の得点による潜在特性に沿った人の順位は変化せず、単に線形再スケーリングを受けると想定される。対照的に、3パラメータIRTは、特定の客観性を犠牲にして、データに適合するモデルを選択することによってデータとモデルの適合を達成する[ 18 ]。
実際には、ラッシュモデルはIRTアプローチと比較して少なくとも2つの主要な利点があります。1つ目の利点は、ラッシュモデル特有の要件[ 19 ]が最優先されることです。これらの要件が満たされると、基本的な個人フリー測定(個人と項目を同じ不変尺度にマッピングできる)が実現します[ 20 ] 。ラッシュアプローチのもう1つの利点は、十分な統計量が存在するため、ラッシュモデルではパラメータの推定がより容易になることです。このアプリケーションでは、これは生の正答数スコアとラッシュモデルとの1対1のマッピングを意味します。推定値。[ 21 ]
数学モデルを用いる場合、どのような場合でも、データとモデルの適合性を評価することが重要です。例えば、多肢選択式テストにおける紛らわしい選択肢など、項目の質の低さが原因であることが判明した場合、その項目は当該テスト形式から削除され、書き直されるか、今後のテスト形式で置き換えられる可能性があります。しかし、不適合な項目が多数発生し、その原因が明らかでない場合は、テストの構成概念妥当性を再検討する必要があり、テスト仕様を書き直す必要が生じるかもしれません。このように、不適合はテスト開発者にとって非常に貴重な診断ツールとなり、テスト仕様の根拠となる仮説をデータに基づいて実証的に検証することを可能にします。
適合度を評価する方法はいくつかあり、カイ二乗統計量やその標準化版などが挙げられます。2パラメータおよび3パラメータのIRTモデルは項目弁別力を調整し、データとモデルの適合度を向上させるため、適合度統計量は、理想化されたモデルが事前に指定されている1パラメータモデルに見られるような確認診断的価値を持ちません。
データは、モデルへの不適合を理由に削除されるべきではなく、不適合の原因が構成概念に関連する理由であると診断された場合に削除されるべきである。例えば、英語を母語としない人が英語で書かれた科学テストを受けた場合などである。このような受験者は、テストの次元によっては、同じ集団に属していないと主張できる。また、1パラメータIRT尺度はサンプルに依存しないと主張されているが、母集団に依存しないわけではないため、このような不適合は構成概念に関連するものであり、テストやモデルを無効にするものではない。このようなアプローチは、測定器の妥当性検証において不可欠なツールである。2パラメータおよび3パラメータモデルでは、心理測定モデルがデータに適合するように調整されるため、各実施のスコアが他の実施にも一般化できるという仮説を確認するために、テストの今後の実施が最初の妥当性検証で使用されたのと同じモデルに適合しているかどうかをチェックする必要がある。データとモデルの適合を達成するために、実施ごとに異なるモデルが指定されている場合、異なる潜在特性が測定されていることになり、テストスコアは実施間で比較可能であるとは主張できない。
項目反応理論の主要な貢献の一つは、信頼性の概念を拡張したことである。従来、信頼性とは測定の精度(つまり、測定に誤差がない度合い)を指す。従来、信頼性は、真のスコアと観測されたスコアの分散の比率など、さまざまな方法で定義された単一の指標を使用して測定されてきた。この指標は、たとえば2つのテストを比較するために、テストの平均信頼性を特徴付けるのに役立つ。しかし、IRTは、精度がテストスコアの全範囲にわたって均一ではないことを明確にする。たとえば、テストの範囲の端にあるスコアは、範囲の中央に近いスコアよりも一般的に誤差が多くなる。
項目反応理論は、信頼性に代わるものとして項目情報とテスト情報の概念を提唱しています。情報もまた、モデルパラメータの関数です。たとえば、フィッシャー情報理論によれば、二値応答データに対する 1PL の場合に提供される項目情報は、単に正解の確率に不正解の確率を掛けたもの、つまり、
推定の標準誤差(SE)は、特定の形質レベルでのテスト情報の逆数であり、
つまり、情報量が多いほど測定誤差は少なくなるということだ。
2パラメータモデルや3パラメータモデルなどの他のモデルでは、判別パラメータが関数において重要な役割を果たします。2パラメータモデルの項目情報関数は次のようになります。
3パラメータモデルの項目情報関数は[ 22 ]である。
一般的に、項目情報関数はベル型になる傾向があります。識別力の高い項目は、情報関数が縦長で幅が狭く、情報量に大きく貢献しますが、その範囲は狭いです。識別力の低い項目は、情報量は少ないものの、情報量の範囲は広くなります。
項目情報量のグラフを用いることで、各項目がどれだけの情報量を提供し、尺度得点範囲のどの部分に貢献しているかを把握できます。項目情報関数は局所独立性を持つため、加法性があります。したがって、テスト情報関数は、試験に含まれる各項目の情報関数の合計となります。この性質を大規模な項目バンクに適用することで、テスト情報関数を調整し、測定誤差を非常に正確に制御することが可能です。
テストスコアの精度を特徴づけることは、心理測定理論における中心的な課題であり、IRTとCTTの主な違いでもある。IRTの研究結果は、CTTにおける信頼性の概念が単純化されていることを示している。信頼性の代わりに、IRTはテスト情報関数を提供し、これはθのさまざまな値における精度の度合いを示す。
これらの結果により、心理測定学者は、慎重に選択された項目を含めることで、さまざまな能力範囲における信頼性のレベルを(潜在的に)慎重に調整することが可能になります。例えば、試験が合格か不合格かの二択しかなく、合格基準点が一つしかなく、実際の合格点が重要でない資格認定試験のような状況では、合格基準点付近の情報量が多い項目のみを選択することで、非常に効率的な試験を開発できます。これらの項目は一般的に、難易度が合格基準点とほぼ同じ項目に対応します。
人パラメータこれは、テストによって測定される人間の能力または属性である、個人の潜在特性の大きさを表します。 [ 23 ] これは、認知能力、身体能力、スキル、知識、態度、性格特性などである可能性があります。
IRTを用いたテストにおける個人パラメータの推定値(「スコア」)は、正答数や正答率といった従来のスコアとは全く異なる方法で計算され、解釈されます。個人の合計正答数は実際のスコアではなく、IRFに基づいており、モデルに項目弁別パラメータが含まれる場合は加重スコアとなります。これは実際には、各項目の項目反応関数を乗算して尤度関数を得ることで得られ、その最高点が最大尤度推定値となります。この最高点は通常、IRTソフトウェアでニュートン・ラフソン法を用いて推定されます。[ 24 ] IRTによる採点ははるかに洗練されていますが、ほとんどのテストでは、シータ推定値と従来のスコアとの相関は非常に高く、多くの場合0.95以上です。IRT スコアと従来のスコアのグラフは、IRT推定値が範囲の中央よりも境界付近で個人をより分離することを示唆するオジーブ形状を示します。
CTTとIRTの重要な違いは、測定誤差の扱い方であり、これは測定の標準誤差によって示されます。すべてのテスト、質問票、およびインベントリーは不正確なツールです。私たちは人の真のスコアを知ることは決してできず、観測されたスコアという推定値しか得られません。観測されたスコアが真のスコアよりも高くなったり低くなったりする可能性のあるランダム誤差がいくらか存在します。CTTは誤差の量が各被験者で同じであると仮定しますが、IRTは誤差が変動することを許容します。[ 25 ]
また、IRTは人間の発達や向上を否定したり、特性レベルが固定されていると仮定したりするものではありません。人はスキルや知識、あるいはいわゆる「テストを受けるスキル」を習得することで、真のスコアが高くなる可能性があります。実際、IRT研究の一部は特性レベルの変化の測定に焦点を当てています。[ 26 ]
古典的テスト理論(CTT)と項目反応理論(IRT)は、ほぼ同じ問題を扱っているものの、理論体系が異なり、手法も異なります。この2つのパラダイムは概ね一貫性があり補完的ですが、いくつかの相違点があります。
CTTとIRTの具体的な類似点についても言及しておくと、概念間の対応関係を理解するのに役立つ。まず、Lord [ 27 ]は、正規分布に従う場合、2PLモデルにおける判別は、点双列相関係数の単調関数に近似的である。具体的には:
どこは項目iの点双列相関係数です。したがって、仮定が成り立つ場合、弁別力が高いほど、一般的に点双列相関係数も高くなります。
もう一つの類似点は、IRTでは各推定値の標準誤差と情報関数が提供される一方で、テスト全体に対する指標、すなわちクロンバックのアルファに直接類似した分離指数も得られることです。そのためには、CTTにおける観測スコアの真のスコアと誤差への分解と同様に、IRT推定値を真の位置と誤差に分解することから始める必要があります。
どこが本当の場所であり、これは推定値との誤差の関連性です。は標準偏差の推定値です特定の加重スコアを持つ人物の場合、分離指数は次のように得られます。
ここで、個人推定値の平均二乗標準誤差は誤差の分散の推定値を与える。個人間で。標準誤差は通常、推定プロセスの副産物として生成されます。分離指数は通常、クロンバックのアルファと非常に近い値になります。[ 28 ]
IRTは、比較的新しい理論体系であり、CTTに内在する仮説をより明確にするため、強力真得点理論または現代精神検査理論と呼ばれることもある。
項目反応理論のさまざまなバリエーションの実装は、 Rプログラミング言語[ 29 ] [ 30 ] [ 31 ]やPython [ 32 ]など、多くの異なる統計プログラムや言語で利用可能です。
項目反応理論を扱った書籍や、IRT(項目反応理論)またはIRTに類似したモデルを扱った書籍は数多く出版されています。以下は、より詳細な解説を提供している書籍に焦点を当てた、一部のリストです。