テスト等化とは、従来、異なる形式の試験で比較可能なスコアを決定する統計的プロセスを指します。[ 1 ]これは、観測されたスコアを使用するか、項目反応理論 を使用して実行できます。
項目反応理論では、等化[ 2 ]とは、2つ以上の並行するテスト形式の得点を共通の得点尺度に当てはめるプロセスです。その結果、2つの異なるテスト形式の得点を直接比較したり、同じテスト形式から得られたものとして扱ったりすることができます。テストが並行していない場合、一般的なプロセスは連結と呼ばれます。これは、異なるテストの結果から生徒の能力が推定された2つの尺度の単位と原点を等しくするプロセスです。このプロセスは、華氏と摂氏を一方の尺度から他方の尺度に変換することによって等しくするプロセスに似ています。比較可能な得点の決定は、テスト結果から得られた尺度を等しくすることによって生じる等化の副産物です。
ディックとジェーンが、ある職業の資格を取得するための試験を受けるとしましょう。試験に合格すればその職業に就けるという大きなリスクがあるため、不正行為の誘惑が生じる可能性があるので、試験を監督する組織は2種類の試験用紙を作成します。ディックが用紙Aで60%、ジェーンが用紙Bで70%の点数を取ったとします。この場合、どちらが試験内容をより深く理解しているかを確実に判断できるでしょうか?用紙Aが非常に難しい問題で構成され、用紙Bが比較的簡単な問題で構成されている場合はどうでしょうか?このような問題を解決するために、点数の公平性を最大限に高めるための等化分析が行われます。
項目反応理論では、個人の「位置」(テストによって評価される何らかの特性の尺度)は間隔尺度で推定されます。つまり、位置は単位と原点との関係で推定されます。教育評価では、異なるテストの応答データから得られた尺度の原点、そして必要に応じて単位も等しくすることで共通の尺度を確立することを目的として、異なる学生グループを評価するためにテストを用いるのが一般的です。このプロセスは等化またはテスト等化と呼ばれます。
項目反応理論では、等化には水平等化と垂直等化の2種類があります。[ 3 ]垂直等化とは、学年(就学年)が異なる生徒など、能力の異なる生徒のグループに実施されるテストを等化するプロセスを指します。[ 4 ]水平等化とは、能力が類似しているグループに実施されるテストを等化することを指します。たとえば、同じ学年の生徒に2年連続で実施される2つのテストなどです。練習効果を避けるために、異なるテストが使用されます。
項目反応理論の観点から言えば、等化は、複数のテストを使用する場合に適用できる、より一般的な尺度化プロセスの特殊なケースに過ぎません。しかし実際には、尺度化は異なるテストごとに別々に実施され、その後、尺度が等化されることがよくあります。
等化の方法には、共通被験者等化と共通項目等化の2種類がよく区別されます。共通被験者等化では、共通の被験者グループに対して2つのテストを実施します。2つのテストにおけるグループの尺度位置の平均値と標準偏差は、線形変換を用いて等化されます。共通項目等化では、アンカーテストと呼ばれる共通項目のセットを2つの異なるテストに組み込みます。共通項目の平均項目位置が等化されます。
平均値の等化は、一方の形式の平均が他方の形式の平均と同等になるようにスコアの分布を調整するだけの単純な方法です。平均値の等化はその単純さゆえに魅力的ですが、柔軟性に欠け、つまり形式の標準偏差が異なる可能性を考慮に入れることができません。[ 1 ]
線形等化は、2 つの形式のスコアを調整して、平均と標準偏差が同程度になるようにします。線形等化にはいくつかの種類があり、パラメータを推定するために使用される仮定と数学が異なります。タッカーとレヴィンの観測スコア法は、2 つの形式の観測スコア間の関係を推定し、レヴィンの真のスコア法は、2 つの形式の真のスコア間の関係を推定します。[ 1 ]
等パーセンタイル等化とは、スコアがどちらの形式でも同等のパーセンタイルを持つ可能性があるという等化関係を定義するものです。この関係は非線形である場合があります。
項目反応理論とは異なり、観測スコア等化はスケーリングとはやや異なる。等化は生データから生データへの変換であり、基本となるフォームAの各生スコアに対応するフォームBの生スコアを推定する。使用されるスケーリング変換は、等化の上に、または等化と同時に適用される。