適応型比較判定は、心理物理学から取り入れた技術で、教育評価に信頼性の高い結果を生み出すことができます。そのため、従来の試験の採点に代わるものです。このアプローチでは、審査員に生徒の作品のペアが提示され、どちらが優れているかを選択するよう求められます。反復的で適応的なアルゴリズムによって、基準を参照せずに生徒の作品のスケール分布を取得できます。
導入
伝統的な試験の採点は、学部生の数が増え、学生の適切な順位付けの重要性が高まった 1792 年にケンブリッジで始まりました。そこで 1792 年に、新しい試験監督官のウィリアム ファリッシュが採点を導入しました。これは、すべての試験官がすべての学生の回答に数値の点数を付け、全体の合計点によって学生を最終的な順位に付けるプロセスです。フランシス ゴルトン(1869) は、1863 年頃の不明の年に、上級ラングラーの得点は最高 17,000 点中 7,634 点だったのに対し、2 級ラングラーの得点は 4,123 点だったと述べています (「ウッド スプーン」の得点はわずか 237 点でした)。
1792 年以前は、ケンブリッジ大学の試験官チームが試験最終日の午後 5 時に集まり、各学生が受験した 19 の試験問題を審査し、真夜中に順位を発表していました。採点によって、数の問題が解決され、不公平な個人的偏見が防止されました。採点の導入は、採点が最も適した形式である現代の客観的なテストへの第一歩でした。しかし、信頼性と採点の自動化に重点を置いたその後のテスト技術は、教育の成果の一部の領域にとって不快なパートナーとなっています。ライティングやスピーキングなどのパフォーマンスを評価するには、より定性的で判断力のあるものが必要です。
適応型比較判断の技法は、採点に代わるものです。1792 年以前の、質に応じて論文を分類するという考え方に立ち返りますが、信頼性と公平性の保証は維持されます。これは、エッセイやより複雑なパフォーマンスを採点する方法として、これまでで最も信頼性の高い方法です[要出典]。採点よりもはるかに簡単で、試したほぼすべての試験官が好んで使用しています。適応型比較判断の真の魅力は、評価活動を再専門化し、評価と学習を再統合できる点にあります。
歴史
サーストンの比較判断の法則
「絶対的な判断というものは存在しない」
— ラミング(2004)[1]
比較判断の科学は、シカゴ大学のルイス・レオン・サーストンによって始まりました。心理物理学の先駆者である彼は、感覚やその他の心理的特性を測定する尺度を構築するいくつかの方法を提案しました。その1つが比較判断の法則であり、[2] [3] [4]、それぞれの「品質」の値が与えられた場合、ある対象が別の対象に「勝つ」可能性をモデル化する数学的方法を定義しました。完全な測定システムを構築するには、これだけで十分です。
彼のモデルのバリエーション(ペアワイズ比較と BTL モデルを参照)では、品質値の差は、オブジェクト A がオブジェクト B に勝つオッズの対数に等しいとされています。
現代のコンピュータが利用できるようになる前は、各オブジェクトの品質の「価値」を計算するために必要な数学的処理のため、この方法は少数のオブジェクトにしか使用できず、その適用範囲も限られていました。サーストンにとって、オブジェクトは一般的に、強度などの感覚、犯罪の深刻さなどの態度、または意見表明でした。社会調査員は引き続きこの方法を使用し、市場調査員の場合、オブジェクトはホテルの部屋のレイアウトの違いや提案された新しいビスケットのバリエーションなどでした。
1970 年代と 1980 年代に、比較判断は、新しい潜在特性理論または項目反応理論の理論的基礎または先駆けとして、教育評価においてほぼ初めて登場しました (Andrich、1978)。これらのモデルは現在、特に項目バンキングおよび適応型テスト システムで標準となっています。
教育における再導入
比較判断を教育に使用した最初の論文は、ポリットとマレー (1994) で、基本的にはケンブリッジの CPE 試験のスピーキング パートで評価される英語能力スケールの性質に関する研究論文でした。対象は受験者で、テスト セッションの 2 分間のビデオ録画で表現され、審査員は評価の訓練を受けていない言語学の大学院生でした。審査員はビデオ スニペットのペアを比較し、どちらの学生が優れていると思うかを報告し、その後、臨床面接を受けて決定の理由を聞き出しました。
ポリットはその後、異なる委員会のAレベルの基準を比較する方法として、比較判定法を英国の資格認定機関に導入した。比較判定法は、異なる委員会の公式基準に対して筆記試験の筆記試験の直接判定を必要とする既存の方法に代わるものである。この最初の2、3年間、ポリットは、この目的のために書いたプログラムを使用して、すべての委員会のすべての分析を実行した。この方法はすぐに、英国で試験の比較可能性を調査するために使用される唯一の実験的方法となった。1996年から2006年までのこの目的の適用については、Bramley (2007) に詳しく記載されている。[5]
2004 年、ポリットは国際教育評価協会の会議で「試験の採点をやめよう」と題する論文を発表し、2009 年の同じ会議では「採点主義の廃止」と題する論文も発表しました。各論文の目的は、評価コミュニティに、ある種の評価では採点の代わりに比較判定法を使用することで大きな利点があることを納得させることでした。2010 年には、ヨーロッパ教育評価協会で「ライティングを信頼性と妥当性をもって評価する方法」と題する論文を発表し、小学生の母国語である英語のライティング能力を評価する際に比較判定法が達成した極めて高い信頼性の証拠を示しました。
適応的比較判断
比較判定は、適応型ウェブベースの評価システムとして実装されると、採点の有効な代替手段になります。この場合、「スコア」(各オブジェクトのモデルパラメータ)は、各「ラウンド」の判定の後に再推定されます。このラウンドでは、平均して各オブジェクトがもう 1 回判定されます。次のラウンドでは、各スクリプトは、現在の推定スコアが類似している別のスクリプトとのみ比較されるため、各判定に含まれる統計情報の量が増えます。その結果、推定手順は、ランダムペアリングや、従来の比較判定アプリケーションで使用されるような他の事前に決定されたペアリングシステムよりも効率的です。(Pollitt、2012)。[6]コンピュータ適応型テストと同様に、この適応性により推定手順の効率が最大化され、スコアの分離が拡大し、標準誤差が減少します。最も明らかな利点は、採点による評価と比較して、妥当性を損なうことなく信頼性が大幅に向上することです。
適応的比較判断が本当に信頼性を高めるかどうかは定かではない。(Bramley、Vitello、2016)。[7]
現在の比較判断プロジェクト
RM比較
RM Compareは、適応型比較判断システムの元祖です。[8]このシステムは、もともとDigital Assess社(旧TAG Developments社)によってCompareAssessとして開発され、適応型比較判断の大規模な展開を実行するように設計されており、世界中でさまざまな状況で使用されてきました。
比較判断
No More Marking は、オンラインの比較判断アプリケーションと、役立つ情報のリポジトリを作成しました。
逃げる
比較判断法を学生の直接評価に初めて応用したのは、ロンドン大学ゴールドスミス・カレッジのリチャード・キンベル教授が主導したe-scapeというプロジェクトでした(Kimbell & Pollitt、2008年)。 [9]開発作業は、デザイン&テクノロジーコースの複数の認定機関と共同で実施されました。キンベルのチームは、学生が監督下で3時間のセッションを2回行い 、子供用の錠剤ディスペンサーなどの物体のプロトタイプを開発するという、洗練された本格的なプロジェクトを開発しました。
ウェブベースの判定システムは、現在 Digital Assess の一部である TAG Developments の Karim Derrick 氏と Declan Lynch 氏によって設計され、現在は Manage として知られるオリジナルの MAPS (ソフトウェア) 評価ポートフォリオ システムに基づいています。Goldsmiths、TAG Developments、および Pollitt は 3 回の試験を実施し、サンプル サイズを 20 名から 249 名に増やし、判定システムと評価システムの両方を開発しました。地理と科学、およびデザインとテクノロジーのオリジナルを含む 3 つのパイロット プログラムがあります。
小学校の作文
2009 年後半、TAG Developments と Pollitt は、ライティング評価システムの新バージョンを試用しました。全国規模の評価をシミュレートした状況で、合計 1000 の小学校の作文が 54 人の審査員チームによって評価されました。各作文を 16 回審査した後のスコアの信頼性は 0.96 で、同様のライティング評価に関する他のどの研究よりもかなり高いものでした。システムをさらに開発すると、各作文を約 9 回審査した後で 0.93 の信頼性に到達できることが示されました。この場合、システムは 1 回採点するのと費用は変わりませんが、それでもはるかに信頼性が高くなります。[6]
さらなるプロジェクト
現在、イングランド、スコットランド、アイルランド、イスラエル、シンガポール、オーストラリアでいくつかのプロジェクトが進行中です。その範囲は小学校から大学までで、作文から数学まで、形成的評価と総括的評価の両方が含まれます。基本的な Web システムは現在、TAG Assessment (http://www.tagassessment.com) から商用ベースで入手でき、特定のニーズに合わせて変更することができます。
ACJ は、アイルランドのリムリック大学の Seery、Canty、Gordon、Lane によって、2009 年以来、教員養成プログラムにおける学部生の成果を評価するために使用されています。また、ACJ は、パデュー大学の Bartholomew 博士によって、中学生、高校生、大学生のデザイン ポートフォリオを評価するために使用されています。Bartholomew 博士は、オープンエンドの問題の形成的評価の指導および学習ツールとしても ACJ を使用しています。
参考文献
- ^ ラミング、ドナルド (2003)。人間の判断。ロンドン:Cengage Learning。ISBN 978-1-86152-777-6。
- ^ Thurstone, LL (1927). 「心理物理学的分析」(PDF) .アメリカ心理学会誌. 38 (3). イリノイ大学出版局: 368–389. ISSN 0002-9556. JSTOR 1415006 . 2024年12月5日閲覧。
- ^ サーストン、LL(1959)。価値の測定。シカゴ大学出版局。OCLC 9794765 。
- ^ Thurstone, LL (1927). 「社会的価値の一対比較法」.異常・社会心理学ジャーナル. 21 (4): 384–400. doi :10.1037/h0065439. ISSN 0096-851X.
- ^ Bramley, Tom (2007). 「一対比較法」試験基準の比較可能性を監視するための手法246 : 294.
- ^ ab Pollitt, Alastair (2012). 「適応型比較判断の方法」.教育における評価:原則、政策、実践. 19 (3): 281–300. doi :10.1080/0969594X.2012.665354. ISSN 0969-594X.
- ^ Bramley , Tom; Vitello, Sylvia (2019-01-02). 「適応性が適応的比較判断における信頼性係数に与える影響」。教育における評価:原則、政策、実践。26 (1): 43–58。doi :10.1080/0969594X.2017.1418734。ISSN 0969-594X 。
- ^ 「RM Compare」. RM plc . 2024-12-02 . 2024-12-05閲覧。
- ^ リチャード・キンベル、アラステア・ポリット(2008)。重要試験におけるコースワーク評価:信憑性、創造性、信頼性。第3回国際ラシェ測定会議。西オーストラリア州パース。
さらに読む
- Pollitt, A (2015) ACJ における信頼性バイアスについて: 適応的比較判断の有効なシミュレーション。ケンブリッジ試験研究: ケンブリッジ、英国 https://www.researchgate.net/publication/283318012_On_%27Reliability%27_bias_in_ACJ で入手可能
- APA、AERA、NCME (1999)教育および心理テストの標準。
- ガルトン、F(1855)遺伝的天才:その法則と結果の探求。ロンドン:マクミラン。
- Kimbell, RA, Wheeler A, Miller S, Pollitt A (2007) e-scape ポートフォリオ評価 (ポートフォリオ環境における創造的評価のための e ソリューション) フェーズ 2 レポート。TERU Goldsmiths、ロンドン大学 ISBN 978-1-904158-79-0
- Pollitt, A (2004) 「試験の採点をやめよう」 国際教育評価協会年次会議、フィラデルフィア、6 月。http://www.camexam.co.uk 出版物で入手可能。
- Pollitt, A, (2009) 「マーク主義の廃止と妥当性の回復」 国際教育評価協会年次会議、ブリスベン、9月。http://www.camexam.co.uk publications で入手可能。
- Pollitt, A, & Murray, N (1993) 評価者が本当に注目するもの. Language Testing Research Colloquium, Cambridge. Milanovic, M & Saville, N (Eds) 『Studies in Language Testing 3: Performance Testing, Cognition and Assessment』, Cambridge University Press, Cambridge に再掲載。
外部リンク
- RM比較
- ノーモアマーキング株式会社
- 逃げる
- リスクに見合う報酬
- TAG評価ACJ
