ゲオルク・ラッシュにちなんで名付けられたラッシュモデルは、回答者の能力、態度、性格特性と項目の難易度とのトレードオフの関数として、読解力評価の質問への回答やアンケートの回答などのカテゴリデータを分析するための心理測定モデルです。[ 1 ] [ 2 ]例えば、アンケートの回答から学生の読解力や死刑に対する個人の態度の極端さを推定するために使用できます。心理測定学や教育研究に加えて、ラッシュモデルとその拡張は、医療専門職[ 3 ]、農業[ 4 ]、市場調査[ 5 ] [ 6 ]などの他の分野でも使用されています。
ラッシュモデルの根底にある数学理論は、項目反応理論の特殊なケースです。しかし、モデルパラメータの解釈とその哲学的意味合いには重要な違いがあり[ 7 ] 、それがラッシュモデルの支持者と項目反応モデリングの伝統を分けています。この違いの中心的な側面は、ゲオルク・ラッシュによればラッシュモデルの定義特性である特定の客観性[ 8 ]の役割、つまり測定の成功に必要な条件に関係しています。
ラッシュモデルでは、特定の回答(正解/不正解など)の確率は、個人パラメータと項目パラメータの関数としてモデル化されます。具体的には、オリジナルのラッシュモデルでは、正解の確率は、個人パラメータと項目パラメータの差のロジスティック関数としてモデル化されます。このモデルの数式は、この記事の後半で説明します。ほとんどの場合、モデルのパラメータは、回答者の習熟度と項目の難易度を、連続的な潜在変数上の位置として特徴付けます。たとえば、教育テストでは、項目パラメータは項目の難易度を表し、個人パラメータは評価される人の能力または達成度を表します。項目の難易度に対する個人の能力が高いほど、その項目で正解する確率が高くなります。潜在特性上の個人の位置が項目の難易度と等しい場合、ラッシュモデルでは、定義上、正解する確率は0.5となります。
ラッシュモデルは、ある意味ではモデルと言えます。それは、データから測定値を得るためにデータが示すべき構造を表すものであり、つまり、測定の成功基準を提供するものです。データを超えて、ラッシュ方程式は、現実世界で得られると予想される関係性をモデル化します。例えば、教育は、教科書やテストに出てくるものだけでなく、子どもたちが人生で直面するあらゆる課題に対応できるよう準備することを目的としています。ラッシュモデルは、同じものを測定する異なるテスト間で測定値が同じ(不変)であることを要求することで、カリキュラムやテストで提示される特定の課題が、その領域におけるあらゆる可能な課題の無限の母集団を首尾一貫して表しているという仮説を検証することを可能にします。したがって、ラッシュモデルは、たとえ実際に観察されることがなくても、有用な組織原理として機能する発見的フィクションを提供する、理想または基準という意味でのモデルと言えます。
ラッシュモデルを支える視点またはパラダイムは、統計モデリングを支える視点とは異なります。モデルは、多くの場合、データセットを記述する目的で使用されます。パラメータは、データにどれだけ適合するかに基づいて修正され、受け入れられるか拒否されます。対照的に、ラッシュモデルが使用される場合、目的はモデルに適合するデータを取得することです。[ 9 ] [ 10 ] [ 11 ]この視点の根拠は、ラッシュモデルが、物理科学で一般的に理解されている意味での測定を得るために満たさなければならない要件を体現しているということです。
この考え方を理解する上で役立つ類推として、秤で測定される物体を考えてみましょう。ある測定で物体Aの重量が物体Bの重量よりもかなり大きいと測定され、その直後に物体Bの重量が物体Aの重量よりもかなり大きいと測定されたとします。測定に求められる特性の一つは、他の要因に関係なく、物体間の比較結果が同じ、つまり不変であることです。この重要な要件は、ラッシュモデルの形式的な構造の中に具体化されています。したがって、ラッシュモデルはデータに合わせて変更されるべきではありません。むしろ、この要件を満たすように評価方法を変更する必要があります。これは、秤が物体を別々に測定した際に異なる比較結果を示す場合に、秤を修正する必要があるのと同様です。
このモデルを用いて分析されるデータは、通常、正誤問題形式の教育テストなど、従来のテスト項目に対する回答です。しかし、このモデルは汎用的なものであり、定量的な属性や特性を測定する目的で離散データが取得されるあらゆる場面に適用できます。
受験者全員が単一のテストのすべての項目に挑戦できる場合、テストの各合計スコアは能力の推定値に対応し、合計スコアが大きいほど能力の推定値も大きくなります。合計スコアと能力の推定値の間には線形関係はありません。むしろ、図 1 に示すように、関係は非線形です。合計スコアは縦軸に、対応する個人の位置推定値は横軸に示されています。図 1 に示すテスト特性曲線 (TCC) の基となる特定のテストでは、合計スコアが約 13 から 31 の範囲全体にわたって、関係はほぼ線形です。TCC の形状は、この例のように、一般的にややシグモイドです。ただし、合計スコアと個人の位置推定値の間の正確な関係は、テストの項目の分布によって異なります。TCC は、図 1 および図 2 の 0 の両側の範囲のように、項目が多い連続体の範囲でより急勾配になります。
ラッシュモデルを適用する際、項目の位置は、以下に説明するような方法に基づいて、まず最初にスケーリングされることがよくあります。このスケーリングのプロセスは、項目較正と呼ばれることがよくあります。教育テストでは、正答率が低いほど項目の難易度が高くなり、したがって項目のスケール位置も高くなります。項目の位置がスケーリングされると、そのスケール上で人物の位置が測定されます。その結果、図2に示すように、人物と項目の位置が単一のスケール上で推定されます。
正誤などの二値データの場合、定義上、尺度上の項目の位置は、質問に対する正解の確率が 0.5 となる人の位置に対応します。一般に、その人の位置よりも難易度の低い質問に正解する確率は 0.5 より大きく、その人の位置よりも難易度の高い質問に正解する確率は 0.5 より小さくなります。項目特性曲線 (ICC) または項目反応関数 (IRF) は、人の能力の関数として正解の確率を示します。単一の ICC が示され、この記事の図 4 に関連してより詳細に説明されています (項目反応関数も参照)。図 3 の左端の ICC は最も簡単な項目であり、同じ図の右端の ICC は最も難しい項目です。
回答者の回答を項目難易度の低い順から高い順に並べると、最も可能性の高いパターンはガットマンパターンまたはベクトル、すなわち{1,1,...,1,0,0,0,...,0}となります。しかし、ラッシュモデルの構造からするとこのパターンが最も可能性が高いものの、モデルが要求するのは確率的なガットマン回答パターン、つまりガットマンパターンに近づく傾向のあるパターンのみです。回答が厳密にパターンに適合することは稀です。なぜなら、可能なパターンは多数存在するからです。データがラッシュモデルに適合するために、回答が厳密にパターンに適合する必要はありません。

各能力推定値には、能力推定値に関連する不確実性の度合いを定量化した測定の標準誤差が関連付けられています。項目推定値にも標準誤差があります。一般的に、項目推定値の標準誤差は、個人推定値の標準誤差よりもかなり小さくなります。これは、通常、個人よりも項目に対する回答データが多いためです。つまり、特定の項目を試した人の数は、特定の個人が試した項目の数よりも通常多くなります。個人推定値の標準誤差は、ICCの傾きが急なほど小さくなります。これは一般的に、テストのスコアの中間範囲に相当します。したがって、傾きが急であればあるほど、直線上の任意の2点間の差が大きくなるため、この範囲では精度が高くなります。
統計的検定とグラフ的検定は、データとモデルの一致性を評価するために使用されます。一部の検定は全体的なものですが、他の検定は特定の項目または個人に焦点を当てています。適合度検定の中には、不適切な項目の問題点を除外または修正することで、テストの信頼性を高めるために使用できる項目に関する情報を提供するものがあります。ラッシュ測定では、信頼性指標の代わりに個人分離指標が使用されます。ただし、個人分離指標は信頼性指標に類似しています。分離指標は、測定誤差を含む分離に対する比率として、真の分離を要約したものです。前述のように、測定誤差のレベルはテストの範囲全体で均一ではなく、一般的に極端なスコア(低値と高値)で大きくなります。
このモデル群は、物理学における測定の中核的な要件、すなわち不変比較の要件との一致に基づいてモデルの認識論的根拠を提唱したデンマークの数学者および統計学者であるゲオルク・ラッシュにちなんで名付けられました。[ 1 ]これは、次のセクションで詳しく説明するように、このモデル群の決定的な特徴です。二値データに対するラッシュモデルは、 LLサーストンによって定式化され広く使用されたモデルである比較判断の法則(LCJ) [ 12 ] [ 13 ]と概念的に密接な関係があり、したがってサーストン尺度とも密接な関係があります。[ 14 ]
ラッシュは、最もよく知られている測定モデルを導入する以前に、ポアソン分布を測定モデルとして読解データに適用し、関連する経験的文脈では、特定の個人が犯すエラーの数は、テキストの難易度と個人の読解能力の比率によって決まるという仮説を立てました。ラッシュはこのモデルを乗法ポアソンモデルと呼びました。二値データ(つまり、回答が2つのカテゴリに分類できる場合)に対するラッシュのモデルは、彼の最も広く知られ、使用されているモデルであり、ここでの主な焦点となっています。このモデルは、単純なロジスティック関数の形をしています。
上記の簡単な概要は、ラッシュの社会測定に関する視点の、いくつかの特徴的で相互に関連する要素を強調したものであり、それらは以下のとおりである。
このように、トーマス・クーンが1961年の論文「現代物理科学における測定の機能」で述べた見解と一致して、測定は理論に基づいていると同時に、より広範な理論的枠組みに関連する仮説と矛盾する定量的異常を検出するための手段であると考えられていた。[ 15 ]この見解は、テストの点数などのデータが測定の理論的基礎を必要とせずに直接測定として扱われる社会科学で一般的に主流となっている見解とは対照的である。このような対照は存在するものの、ラッシュの見解は、間隔尺度測定を必要とする統計分析やモデリングの使用を実際には補完するものである。なぜなら、ラッシュモデルを適用する目的は、そのような測定を得ることにあるからである。ラッシュモデルの応用は、さまざまな資料で説明されている。[ 16 ]
二値データに対するラッシュモデルは、項目パラメータが1つある項目反応理論(IRT)モデルとみなされることが多い。しかし、特定のIRTモデルというよりは、このモデルの支持者[ 17 ]: 265は、他のIRTモデルとは異なる特性を持つモデルだと考えている。具体的には、ラッシュモデルを定義する特性は、不変比較の原理を形式的または数学的に具現化したものである。ラッシュは不変比較の原理を次のように要約した。
ラッシュモデルはこの原理を体現しています。なぜなら、その形式的な構造により、個人パラメータと項目パラメータを代数的に分離できるからです。つまり、項目パラメータの統計的推定の過程で個人パラメータを消去できるということです。この結果は、条件付き最尤推定法を用いることで実現されます。この方法では、応答空間は個人の合計スコアに基づいて分割されます。その結果、項目または個人の生スコアは、項目または個人パラメータの十分統計量となります。つまり、個人の合計スコアには、指定されたコンテキスト内で個人について利用可能なすべての情報が含まれており、項目の合計スコアには、関連する潜在特性に関して項目に関するすべての情報が含まれています。ラッシュモデルでは、応答データに特定の構造、すなわち確率的ガットマン構造が必要です。
より分かりやすい言い方をすれば、ラッシュモデルは、評価の合計スコアから連続体上の個人の位置を求めるための基礎と正当性を提供するものです。合計スコアを直接測定値として扱うことは珍しくありませんが、実際には、それらは測定値ではなく、個々の観測値のカウントです。各観測値は、個人と対象物との比較によって得られる観察可能な結果を表します。このような結果は、天秤がどちらかの方向に傾く様子を観察することと直接的に類似しています。この観察結果は、どちらかの物体の質量が大きいことを示唆しますが、このような観測値のカウントを直接測定値として扱うことはできません。
ラッシュは、物理学における測定の特徴として、不変比較の原理を挙げ、例えば、各計測器が固体に機械的な力を及ぼして加速度を生み出す双方向の実験的な参照系を例に挙げた。ラッシュ[ 1 ]: 112-3はこの文脈で次のように述べている。「一般に、任意の2つの物体について、一方の計測器によって生み出された加速度の比が一定の値である場合、他のどの計測器についても同じ比が見つかるだろう」。ニュートンの第二法則によれば、このような比は物体の質量の比に反比例することが容易に示される。
させて例えば、二値確率変数である。は正解を示し、与えられた評価項目に対する誤った回答。二値データのラッシュモデルでは、結果の確率は次のように与えられます。
どこ人の能力そしてアイテムの難易度はしたがって、二分法の達成項目の場合、は、関連する人物と評価項目との相互作用における成功確率です。モデルに基づくと、ある人物が項目に正しく応答する対数オッズ、またはロジットは、次のようになることが容易に示されます。能力パラメータが異なる2人の受験者を想定します。そしてそして、困難な任意の項目これら2人の受験者のロジットの差を計算するには、この差は逆に、2 つの項目のうちの 1 つに正解した場合、同じ人物が 1 つの項目に正解する対数オッズは、項目の位置の差に等しいことが示せる。例えば、
どこは、2つの項目におけるn人の合計得点であり、どちらか一方の項目に正解したことを意味します。[ 1 ] [ 19 ] [ 20 ] したがって、条件付き対数オッズには人物パラメータは含まれません。したがって、合計スコアに基づいて条件付けすることで、これを排除することができる。つまり、生のスコアに基づいて回答を分割し、正解の対数オッズを計算することで、推定値が得られます。関与なしに得られるより一般的には、条件付き最尤推定法などの手法を適用することで、項目パラメータを反復的に推定することができます(ラッシュモデル推定を参照)。より複雑な方法ではありますが、こうした推定においても基本的な原理は同じです。

二値データに対するラッシュモデルのICCを図4に示す。灰色の線は離散的な結果の確率を表している。(つまり、質問に正しく答えること)潜在連続体上の異なる位置(つまり、能力レベル)を持つ人々について。項目の位置は、定義上、その確率がは 0.5 に等しい。図 4 では、黒丸は、結果が観測されたクラス区間内の実際のまたは観測された人の割合を表します。たとえば、教育心理学の文脈で使用される評価項目の場合、これらは項目に正しく回答した人の割合を表す可能性があります。人は潜在連続体上の位置の推定値によって順序付けられ、この基準に基づいてクラス区間に分類され、観測とモデルの一致をグラフィカルに検査します。データはモデルとよく一致しています。データのグラフィカルな検査に加えて、さまざまな適合度統計検定を使用して、必要に応じて、観測のモデルからの逸脱がランダム効果のみに起因するのか、それともモデルからの体系的な逸脱があるのかを評価します。
ラッシュモデルには複数の多項拡張があり、これらは二値モデルを一般化して、連続する整数スコアが潜在特性のレベルや大きさの増加を表すカテゴリ(能力の向上、運動機能、声明への賛同など)に適用できるようにします。これらの多項拡張は、例えば、リッカート尺度の使用、教育評価における成績評価、審査員によるパフォーマンスの採点などに適用できます。
ラッシュモデルに対する批判の一つは、モデルが過度に制限的または規範的であるという点である。なぜなら、このモデルはすべての項目が等しい弁別力を持つという前提に基づいているが、実際には項目の弁別力は異なり、したがって、どのデータセットもデータとモデルが完全に一致することはないからである。よくある誤解は、ラッシュモデルは各項目が異なる弁別力を持つことを許容しないというものだが、等しい弁別力は不変測定の前提であるため、項目の弁別力が異なることは禁止されているのではなく、測定の質が理論上の理想とは等しくないことを示しているにすぎない。物理的な測定と同様に、現実世界のデータセットが理論モデルと完全に一致することは決してないため、関連する問題は、特定のデータセットが達成不可能な完璧さの基準に完全に一致するかどうかではなく、目の前の目的に対して十分な測定の質を提供しているかどうかである。
多肢選択式問題の回答データにラッシュモデルを用いる場合の批判として、ラッシュモデルでは左漸近線が常にゼロ確率に近づくため、推測による回答が考慮されていない点が挙げられます。これは、能力の低い人は必ず問題を間違えることを意味します。しかし、能力の低い人が多肢選択式試験を受ける場合、偶然によって正解を選ぶ確率ははるかに高くなります(k個の選択肢がある問題の場合、その確率は約1/ kです)。
3パラメータ ロジスティックモデルはこれらの仮定の両方を緩和し、2 パラメータ ロジスティック モデル(2PL) は傾きの変動を許容します。[ 21 ]ただし、単純な重み付けされていない生スコアの十分性を維持するためには、均一な識別とゼロ左漸近線の指定がモデルの必須特性です。実際には、多肢選択データセットに見られるゼロでない下漸近線は、一般的に想定されているよりも測定に対する脅威が少なく、適切に開発されたテスト項目が適切に使用される場合、通常は測定に実質的な誤差をもたらしません。[ 22 ]
Verhelst & Glas (1995) は、One Parameter Logistic Model (OPLM) と呼ばれるモデルについて条件付き最尤推定 (CML) 方程式を導出しました。代数形式では 2PL モデルと同一に見えますが、OPLM は 2PL の推定された識別パラメータではなく、あらかじめ設定された識別指数を含んでいます。しかし、これらの著者が指摘しているように、推定された識別パラメータを用いた推定で直面する問題は、識別が不明であるということです。つまり、加重された生のスコアは「単なる統計量ではなく、したがって CML を推定方法として使用することは不可能」です。[ 23 ] : 217つまり、2PL の加重された「スコア」の十分性は、十分統計量が定義される方法に従って使用することはできません。OPLM のように、重みが推定されるのではなく、代入される場合、条件付き推定が可能になり、Rasch モデルのいくつかの特性が保持されます。[ 24 ] [ 23 ] OPLMでは、差別指数の値は1から15の間に制限されています。このアプローチの限界は、実際には差別指数の値を初期値として事前に設定する必要があることです。これは、差別を避けることが目的であるにもかかわらず、何らかの差別推定が関与することを意味します。
二値データに対するラッシュモデルは、本質的に単一の弁別パラメータを伴いますが、ラッシュ[ 1 ] : 121が指摘しているように、これは潜在特性の大きさが表現または推定される単位の任意の選択を構成します。しかし、ラッシュモデルは、特定の参照枠(つまり、評価条件が与えられた評価コンテキスト)内の個人と項目間の相互作用全体で弁別が均一であることを要求します。
このモデルを適用すると、基準がどの程度満たされているかについての診断情報が得られます。また、このモデルを適用すると、評価項目や質問が能力や特性を測定するのにどの程度有効かについての情報も得られます。たとえば、特定の行動をとる人の割合がわかっている場合、ラッシュモデルを使用して、行動の難易度、態度、行動の関係を導き出すことができます。[ 25 ]ラッシュモデルの著名な提唱者には、ベンジャミン・ドレイク・ライト、デビッド・アンドリッチ、アーリング・アンダーセンなどがいます。