基準参照テスト( NRT ) は、測定される特性に関して、テストされた個人が事前に定義された集団内でどの位置にいるかを推定するタイプのテスト、評価、または査定です。このようなテストでスコアを割り当てることは、相対的グレーディング、曲線によるマーキング( BrE )、または曲線によるグレーディング( AmE、CanE ) (曲線グレーディング、ベルカーブ、またはグレーディング カーブの使用とも呼ばれる) と表現できます。これは、クラスの生徒に成績を割り当てる方法で、正規分布(ガウス分布とも呼ばれる)など、特定の平均と導出特性を持つ、事前に指定された成績の分布を取得または近づける方法です。[ 1 ]「曲線」という用語は、正規分布の確率密度のグラフ表現であるベルカーブを指しますが、この方法は、たとえば一様分布など、任意の望ましい成績分布を達成するために使用できます。この推定値は、母集団から抽出されたサンプルから得られたテストスコア、および場合によってはその他の関連データの分析に基づいて算出されます。つまり、このタイプのテストは、受験者が他の受験者よりも成績が良かったか悪かったかを判断するものであり、受験者が特定の目的に必要な知識を多く知っているか少なく知っているかを判断するものではありません。参照母集団が受験者と同年代の人である場合、規範的評価という用語が使用されます。
規範参照評価は、基準参照評価および自己評価と対比できます。基準参照評価では、スコアは受験者が特定の課題でうまくできたか、うまくできなかったかを示し、他の受験者との比較は示しません。自己評価システムでは、受験者は過去の成績と比較されます。これらの方法はいずれも、同じテスト用紙の採点に使用できます。[ 2 ]
ロバート・グレイザーは、もともと規範参照テストと基準参照テストという用語を考案した。[ 3 ]
多くの大学入学試験や全国的に使用されている学校テストでは、基準参照テストが用いられています。SAT 、GRE (大学院入学共通試験)、 WISC(ウェクスラー児童知能検査)などは、個々の受験者の成績を基準サンプルと比較します。基準参照テストでは、受験者は「不合格」になることはありません。各受験者には、通常パーセンタイルで表される、他の受験者と比較したスコアが与えられます。これは、合格点の範囲が広く、誰がより優れた成績を収めているかを把握することが目的の場合に役立ちます。
IQテストは、受験者の知能を順位付けすることを目的とした、基準参照型テストです。IQの中央値は100に設定されており、すべての受験者はその基準値と比較して順位付けされます。
規範的テストの代替手段として、自己評価テストや基準参照型テストが考えられる。
自己評価では、個人のパフォーマンスは過去のパフォーマンスとのみ比較されます。[ 4 ] [ 5 ]例えば、減量ダイエット中の人は、現在の体重が理想体重や他の人の体重と比べてどうなのかではなく、現在の体重が過去の体重と比べてどうなのかで評価されます。
テストは、期待される行動または望ましい行動に基づいてパフォーマンスが判断される場合、基準参照型である。設定された基準に基づいて受験者を評価するテスト(例:全員が 1 キロメートルを 5 分未満で走れるはずである)は、基準参照型テストである。基準参照型テストの目的は、個人が他のランナーより速いか遅いかを調べることではなく、テスト実施者が望むほど速く走れるかどうかを調べることである。 基準に基づく教育改革は、基準参照型テストに焦点を当てている。[ 6 ] [ 7 ]学校で行われるほとんどの日常的なテストやクイズ、およびほとんどの州の学力テストや高校の卒業試験は、基準参照型である。このモデルでは、すべての受験者が合格することも、すべての受験者が不合格になることもあり得る。
Both terms criterion-referenced and norm-referenced were originally coined by Robert Glaser.[8] Unlike a criterion-reference test, a norm-referenced test indicates whether the test-taker did better or worse than other people who took the test. For example, if the criterion is "Students should be able to correctly add two single-digit numbers," then reasonable test questions might look like "" or "" A criterion-referenced test would report the student's performance strictly according to whether the individual student correctly answered these questions. A norm-referenced test would report primarily whether this student correctly answered more questions compared to other students in the group. Even when testing similar topics, a test which is designed to accurately assess mastery may use different questions than one which is intended to show relative ranking. This is because some questions are better at reflecting actual achievement of students, and some test questions are better at differentiating between the best students and the worst students. (Many questions will do both.) A criterion-referenced test will use questions which were correctly answered by students who know the specific material. A norm-referenced test will use questions which were correctly answered by the "best" students and not correctly answered by the "worst" students (e.g. Cambridge University's pre-entry 'S' paper). Some tests can provide useful information about both actual achievement and relative ranking. The ACT provides both a ranking, and indication of what level is considered necessary to likely success in college.[9] Some argue that the term "criterion-referenced test" is a misnomer, since it can refer to the interpretation of the score as well as the test itself.[10] In the previous example, the same score on the ACT can be interpreted in a norm-referenced or criterion-referenced manner.
領域参照テストは基準参照テストに似ており、特定の学習領域を網羅する評価であり、そのスコアによってその領域をどの程度習得しているかが明らかになります。したがって、個人が領域参照テストまたは基準参照テストで項目の 90% を正解した場合、これはテストで扱われる内容に関する深い知識と理解を示す高得点となります。これらの種類のテストは、スコアがテストを受けた他の受験者と比較して受験者が項目でどれだけうまくできたかを示す規範参照テストとは対照的です。 [ 11 ] [ 12 ]
相対評価の1つの方法は、次の3つのステップで構成されます。
例えば、ある大学の特定のコースにA、B、C、D、Fの5つの成績があり、Aは上位20%の学生、Bは次の30%、Cは次の30~40%、残りの10~20%にDまたはFが割り当てられている場合、0%から10~20%のパーセンタイル区間のスコアはDまたはFの成績、11~21%から50%のスコアはCの成績、51%から80%のスコアはBの成績、81%から100%のスコアはAの成績となります。
上記の例と同様に、成績評価曲線は、教育機関が特定の成績平均点(GPA)の閾値に学生を均等に分布させることを可能にします。多くの教授は、コースの平均をCにすることを目標に曲線を設定しているため、対応する成績平均点は、北米のほとんどの大学で採用されている標準的な4.0スケールで2.0になります。[ 1 ]同様に、4.0スケールで3.0の成績平均点は、学生がクラスの上位20%以内であることを示します。成績評価曲線は、これらの数値にさらなる意味を持たせる役割を果たし、採用される具体的な分布は教育機関によって異なる場合があります。[ 13 ]
基準参照テストの主な利点は、個人のテスト成績が基準グループ内の他の人々と比較してどの程度であるかについての情報を提供できることである。
基準参照テストの重大な限界は、参照グループが現在の対象集団を代表していない可能性があることです。オレゴン研究所の国際パーソナリティ項目プールウェブサイトで指摘されているように、「既製の『基準』を使用することには非常に注意する必要があります。なぜなら、現在のサンプルが代表的サブセットであるような集団を見つけることができるとは限らないからです。ほとんどの『基準』は誤解を招くものであり、したがって使用すべきではありません。はるかに妥当なのは、自分で作成したローカル基準です。たとえば、クラスの生徒にフィードバックを与えたい場合は、各個人のスコアをクラス自体から得られた平均値と標準偏差に関連付ける必要があります。情報量を最大化するために、これらのローカル基準に基づいて各尺度の頻度分布を生徒に提供し、生徒は関連する分布上で自分のスコアを見つけて丸で囲むことができます。」[ 14 ]
基準参照は、テストの妥当性(つまり、テストが測定しようとしている構成概念を測定していること)を保証するものではありません。
基準参照型テストのもう一つの欠点は、集団全体の進歩を測定できず、個々の生徒が全体の中でどの位置にいるかしか測れない点である。そのため、例えば、すべての生徒の学力向上を目指す教育改革プログラムの成功度を測る場合のように、一定の目標値に基づいて測定する必要がある。
基準参照テストでは、従来、学年レベルはスコアの中央50パーセントによって設定されたレベルに設定されていました。 [ 15 ]対照的に、全米児童読書財団は、ほぼすべての子供が3年生までに学年レベル以上で読めるようにすることが不可欠であると考えており、これは基準参照による学年レベルの定義では達成できない目標です。[ 16 ]
規範は必ずしも基準を意味するものではありません。規範参照テストは、受験者が何を知っているべきか、何ができるべきかといった期待を押し付けるものではありません。受験者を同年代の受験者と比較することで、受験者の現在のレベルを測定します。順位付けシステムは、どの学生が平均的なレベルで成績を収めているか、どの学生が平均以上で、どの学生が平均以下であるかを示すデータのみを提供します。どの受験者が、就職や進学にふさわしいレベルで課題を正しく遂行できるかを特定するものではありません。
成績評価曲線の究極の目的は、同じコースを担当する複数の教員間の評価のばらつきの影響を最小限に抑え、あるいは排除することで、どのクラスにおいても学生が同級生と同等の評価を受けられるようにすることです。また、この方法は、特定の試験の複数のバージョンを使用することに伴う問題も回避します。複数のバージョンを使用する方法は、試験の実施日がクラスごとに異なる場合によく用いられます。実際の難易度であれ、認識上の難易度であれ、成績評価曲線は学業成績の均等な分布を保証します。
しかし、カーブ採点は学生間の競争意識を高め、授業における教員の公平性に対する学生の認識に影響を与える可能性があります。学生は一般的に、カーブ採点によって成績が下がった場合に最も不満を感じます。このような事態を防ぐため、教員は通常、カーブ採点を行う際には、平均的な学生がカーブ採点の平均値よりも低い素点を得ることが想定されるように、テスト自体が十分に難しいものとなるよう努力し、すべての学生がカーブ採点の恩恵を受けられるようにします。したがって、カーブ採点は盲目的に使用すべきではなく、基準参照採点などの代替案と比較して慎重に検討する必要があります。さらに、カーブ採点を常に誤用すると、設計の不十分なテストの成績が調整される可能性がありますが、評価は教員が設定した学習目標を正確に反映するように設計されるべきです。[ 17 ]
民主主義と同様に、相対評価は最悪のシステムかもしれないが、他のすべての代替案に比べればそうでもない。