テストの点数とは、通常は数値で表される、受験者のテストにおける成績を示す情報です。正式な定義の一つは、「測定対象となる構成概念に関連するテスト項目に対する受験者の回答に含まれる証拠の要約」です。[ 1 ]
テストの得点は、基準参照解釈または規範参照解釈、あるいはその両方で解釈されます。基準参照解釈とは、得点が他の受験者の中での受験者の順位に関して意味を持つことを意味します。基準参照解釈とは、得点が他の受験者の得点に関係なく、特定の科目に関して受験者に関する情報を提供することを意味します。[ 2 ]
テストの得点には、素点と換算点という2種類があります。素点とは、正解した問題数など、調整や変換を一切行っていない得点のことです。換算点とは、相対評価のように、素点に何らかの変換を適用した結果得られる得点のことです。
尺度得点の目的は、すべての受験者の得点を一貫した尺度で報告することです。テストに2つの形式があり、一方が他方よりも難しいとします。形式1の65%の得点は形式2の68%の得点に相当すると等価であると決定されています。両方の形式の得点を尺度に変換することで、これらの同等の得点が同じ報告得点になるようにすることができます。たとえば、100から500の尺度で両方とも350点になる場合があります。
米国でよく知られている、スコアが標準化されているテストは、ACTとSATの2つです。ACTのスコア範囲は0~36、SATは200~800(セクションごと)です。表向きには、これらの2つのスコア範囲は、ACTでは平均18と標準偏差6、SATでは500と100を表すように設定されています。上限と下限が設定された理由は、プラスマイナス3標準偏差の範囲内に人口の99%以上が含まれるためです。この範囲外のスコアは測定が難しく、実用的な価値はほとんどありません。
スケーリングはテストの心理測定特性には影響しないことに注意してください。スケーリングは評価プロセス(および等化処理がある場合は等化処理)が完了した後に行われる処理です。したがって、これは心理測定そのものの問題ではなく、解釈可能性の問題です。
テストを正誤で採点する場合、学習に関して重要な前提が置かれています。正解数、または項目得点の合計(部分点が与えられる場合)が、現在の学習状況を測る適切な指標であると想定されているのです。さらに、不正解には意味のある情報が含まれていないという二次的な前提も置かれています。
第一に、問題の根底にある内容や概念構造を深く理解していなくても、暗記によって正解を出すことが可能です。第二に、解決に複数の手順が必要な場合、正解に至るためのアプローチは複数存在することがよくあります。正解であるという事実だけでは、複数の手順のうちどれが用いられたかは分かりません。学生が解答(または計算過程)を提示すれば、この情報は元の資料から容易に入手できます。
第二に、もし間違った答えが単なる当てずっぽうであれば、それらの答えからは何の情報も得られないだろう。一方、間違った答えが期待される解釈からの逸脱を反映している場合、それらの答えはテスト全体の測定対象と何らかの関係性を示すはずである。この逸脱は、テストが書かれた言語で答えを選択または回答する生徒の心理言語学的成熟度によって左右されるはずである。
この2番目のケースでは、テスト項目への回答からこの順序を抽出することが可能です。[ 3 ]ラッシュモデルなどのこのような抽出プロセスは、専門家の間で項目開発の標準的な手法となっています。しかし、間違った回答は採点プロセス中に破棄されるため、これらの回答に含まれる可能性のある情報の分析はほとんど行われません。
第三に、トピック別のサブテストスコアが提供される場合もあるが、より一般的なのは合計スコア、あるいはその再スケーリング版を報告することである。この再スケーリングは、これらのスコアを何らかの基準と比較することを目的としている。このようにテスト結果をさらに集約することで、どの項目を間違えたかという具体的な情報がすべて体系的に削除されてしまう。
したがって、テストを正誤で採点すると、1) 生徒がどのように正解に至ったか、2) 何が生徒を不適切な解答へと導いたか、3) テストのどの部分でこの予想からの逸脱が生じたか、といった情報が失われます。
この解説では、現在の採点手順がテスト実施過程のダイナミクスを隠蔽し、評価対象となる生徒の能力を不明瞭にしていると指摘しています。現在の採点方法は、最初の採点段階でこれらのデータを過度に単純化しています。この手順上の誤りの結果、教師が生徒へのより良い指導に役立つはずの診断情報が不明瞭になっています。さらに、これらのテストを丹念に準備している人々が、本来であればこの誤りの存在に気づくはずの情報を把握することを妨げています。
この問題に対する解決策として、応答スペクトル評価(RSE)[ 4 ]が現在開発されており、これら3つの形式の情報損失すべてを回復できると同時に、現在のパフォーマンス状態を確立し、パフォーマンスの変化を追跡するための数値スケールも提供できるようです。
この RSE アプローチは、正解か不正解かを問わず、すべての回答の解釈を提供し、受験者が使用したと思われる思考プロセスを示します。[ 5 ]この章では、他の発見の中でも、復元可能な情報によって、正解のみを考慮した場合よりもテストの変動の 2 ~ 3 倍多くが説明されることが報告されています。この膨大な情報の損失は、「間違った」回答が採点プロセス中に収集される情報から削除され、正誤採点に内在する手続き上のエラーを明らかにするために利用できなくなるという事実によって説明できます。この手順は、テストデータに内在する線形依存性によって生じる制限を回避します。