コンピュータ分類テスト( CCT ) は、その名前が示すように、受験者を分類する目的でコンピュータによって管理されるパフォーマンス評価システムを指します。最も一般的な CCT は、受験者を「合格」または「不合格」に分類する習熟度テストですが、この用語には受験者を 3 つ以上のカテゴリに分類するテストも含まれます。この用語は一般に、分類のためにコンピュータで管理されるすべてのテストを指すと考えられますが、通常は、コンピュータ適応型テスト(CAT) と同様に、対話形式で管理されるテストまたは可変長のテストを指すために使用されます。CAT と同様に、可変長の CCT は、従来の固定形式のテストで使用される項目の数のほんの一部で、テストの目的 (正確な分類) を達成できます。
CCT にはいくつかのコンポーネントが必要です。
開始点は論争の的ではありません。CCT の研究では、主に他の 3 つのコンポーネントに対するさまざまな方法の適用について調査しています。 注:終了基準と採点手順は CAT では別々ですが、分類が行われるとテストが終了するため、CCT では同じです。したがって、CAT を設計するには 5 つのコンポーネントを指定する必要があります。
CCTの入門書はThompson (2007) [1]とParshall、Spray、Kalohn、Davey (2006) [2]の著書に掲載されています。 公開されているCCT研究の参考文献は以下にあります。
仕組み
CCT は CAT と非常によく似ています。受験者に対して項目が 1 つずつ出題されます。受験者が項目に回答すると、コンピューターが採点し、受験者が分類可能かどうかを判断します。分類可能であれば、テストは終了し、受験者は分類されます。分類できない場合は、別の項目が出題されます。受験者が分類されるか、別の終了点が満たされるまで (バンク内のすべての項目が出されるか、最大テスト時間に達するまで)、このプロセスが繰り返されます。
心理測定モデル
CCT の心理測定モデルには、古典的テスト理論(CTT) と項目反応理論 (IRT) の 2 つのアプローチがあります。古典的テスト理論は、各カテゴリに属すると判断された受験者のサンプルの項目パラメータを決定することによって適用されるため、状態モデルを前提としています。たとえば、数百の「マスター」と数百の「非マスター」をサンプルとして抽出し、それぞれの難易度と識別力を判断できますが、そのためには、各グループに属する明確な人々の集合を簡単に識別できる必要があります。一方、IRT は特性モデルを前提としています。つまり、テストで測定される知識または能力は連続体です。分類グループは、マスターと非マスターを区別するためのカットスコアの使用など、連続体に沿って多かれ少なかれ任意に定義する必要がありますが、項目パラメータの仕様は特性モデルを前提としています。
それぞれに長所と短所があります。CTT は概念的に非常に単純です。さらに重要なことは、CTT では、最終的に CCT の設計に使用される項目パラメータの較正に必要なサンプルの受験者数が少なくなるため、小規模なテスト プログラムに適していることです。CTT ベースの CCT の説明については、Frick (1992) [3]を参照してください。ただし、ほとんどの CCT では IRT が使用されています。IRT はより特異性が高いですが、最も重要な理由は、CCT (および CAT) の設計には費用がかかり、そのため、大規模なリソースを持つ大規模なテスト プログラムによって行われる可能性が高いことです。このようなプログラムでは、IRT が使用される可能性があります。
出発点
CCT には、特定のアルゴリズムを有効にするために開始点が指定されている必要があります。終了基準として連続確率比検定を使用する場合、開始比率は暗黙的に 1.0 (受験者がマスターであるか非マスターであるかの確率が等しい) と想定されます。終了基準が信頼区間アプローチである場合は、シータ上の開始点を指定する必要があります。通常、これは分布の中心である 0.0 ですが、受験者分布のパラメータがわかっている場合は、特定の分布からランダムに抽出することもできます。また、前回のテスト受験時のスコア (再受験の場合) など、個々の受験者に関する以前の情報を使用することもできます。
アイテムの選択
CCTでは、従来の方法のように受験者全員に固定のテスト項目セットを配布するのとは異なり、テスト全体を通じてテスト項目が選択され配布されます。これは通常、個々の項目ごとに行われますが、テストレットと呼ばれる項目のグループごとに行うこともできます(Leucht & Nungester、1996年、[4] Vos & Glas、2000年[5])。
項目選択の方法には、カットスコアベースと推定値の 2 つのカテゴリがあります。カットスコアベースの方法 (シーケンシャル選択とも呼ばれます) は、受験者の能力に関係なく、カットスコア (カットスコアが複数ある場合はカットスコア) で項目から提供される情報を最大化します。推定値ベースの方法 (アダプティブ選択とも呼ばれます) は、カットスコアの位置に関係なく、受験者の能力の現在の推定値で情報を最大化します。どちらも効率的に機能しますが、効率は採用する終了基準に一部依存します。シーケンシャル確率比テストはカットスコア付近の確率のみを評価するため、カットスコアベースの項目選択の方が適しています。信頼区間終了基準は受験者の能力推定値を中心にしているため、推定値ベースの項目選択の方が適しています。これは、信頼区間がカットスコアより完全に上または下になるほど小さい場合にテストが分類を行うためです (以下を参照)。測定の標準誤差が小さいほど信頼区間は小さくなり、受験者のシータレベルの情報が多いほど測定の標準誤差は小さくなります。
終了基準
CCT でよく使用される終了基準は 3 つあります。 ベイジアン決定理論法は、損失/効用構造と評価の考慮事項の無限の選択肢を提示することで大きな柔軟性を提供しますが、同時により大きな恣意性ももたらします。信頼区間アプローチは、テストの各ポイントで受験者の現在のシータ推定値の周りの信頼区間を計算し、その区間が分類を定義するシータの領域内に完全に収まる場合に受験者を分類します。これはもともと適応型マスタリーテスト (Kingsbury & Weiss、1983) として知られていましたが、必ずしも適応型項目選択を必要とするわけではなく、2 つの分類マスタリーテストの状況に限定されるわけでもありません。逐次確率比テスト(Reckase、1983) は、分類問題を、受験者のシータがカットスコアより上の特定のポイントまたはカットスコアより下の特定のポイントに等しいという仮説検定 として定義します。
参考文献
- ^ Thompson, NA (2007). 可変長コンピュータ分類テストのための実践ガイド. 実践的評価研究と評価, 12(1). [1]
- ^ Parshall, CG, Spray, JA, Kalohn, JC, & Davey, T. (2006). コンピュータベーステストにおける実践的考慮事項。ニューヨーク: Springer。
- ^ Frick, T. (1992). エキスパートシステムとしてのコンピュータ化された適応型習熟度テスト。教育コンピューティング研究ジャーナル、8(2)、187-213。
- ^ Luecht, RM, & Nungester, RJ (1998). コンピュータ適応型逐次テストの実際的な例。教育測定ジャーナル、35、229-249。
- ^ Vos, HJ & Glas, CAW (2000)。テストレットベースの適応型習熟度テスト。van der Linden, WJ、および Glas, CAW (編) 『コンピュータ適応型テスト: 理論と実践』。
CCT研究の文献
- アーミテージ、P.(1950)「2つ以上の対立仮説を持つ逐次分析と判別関数分析との関係」王立統計学会誌、12、137-144。
- Braun, H.、Bejar, II、および Williamson, DM (2006)。自動採点のためのルールベースの方法: ライセンス コンテキストでのアプリケーション。Williamson, DM、Mislevy, RJ、および Bejar, II (編) コンピュータ ベース テストにおける複雑なタスクの自動採点。Mahwah、NJ: Erlbaum。
- Dodd, BG, De Ayala, RJ, & Koch, WR (1995). 多項式項目によるコンピュータ適応型テスト。応用心理測定、19、5-22。
- Eggen, TJHM (1999)「逐次確率比テストによる適応型テストにおける項目選択」応用心理測定、23、249-261。
- Eggen, TJH M, Straetmans, GJJM (2000)。受験者を3つのカテゴリーに分類するためのコンピュータ適応型テスト。教育および心理測定、60、713-734。
- Epstein, KI、Knerr, CS (1977)。シーケンシャル テスト手順のパフォーマンス テストへの応用。1977 年コンピューター適応型テスト カンファレンス (ミネソタ州ミネアポリス) で発表された論文。
- Ferguson, RL (1969)。個別に指示された指導プログラムのためのコンピュータ支援分岐テストの開発、実装、および評価。未発表の博士論文、ピッツバーグ大学。
- Frick, TW (1989)。「コンピュータベースのテストとコンピュータ誘導演習におけるベイズ適応」教育コンピューティング研究ジャーナル、5、89-114。
- Frick, TW (1990)。コンピュータベースの習熟度テストの長さを調整するための 3 つの決定モデルの比較。教育コンピューティング研究ジャーナル、6、479–513。
- Frick, TW (1992)。エキスパートシステムとしてのコンピュータ適応型習熟度テスト。教育コンピューティング研究ジャーナル、8、187-213。
- Huang, C.-Y., Kalohn, JC, Lin, C.-J., Spray, J. (2000)。コンピューター分類テストによる項目プール開発のための古典的指標からの項目パラメータの推定。(研究報告 2000–4)。アイオワ州アイオワシティ: ACT, Inc.
- Jacobs-Cassuto, MS (2005). テストレットを使用した適応型習熟度テストの比較
3 パラメータ ロジスティック モデルを使用。未発表の博士論文、ミネソタ大学、ミネソタ州ミネアポリス。
- Jiao, H., & Lau, AC (2003)。コンピュータ分類テストにおけるモデル不適合の影響。2003 年 4 月、イリノイ州シカゴで開催された National Council of Educational Measurement の年次会議で発表された論文。
- Jiao, H., Wang, S., & Lau, CA (2004)。コンピュータ分類テストにおける 3 つのカテゴリ分類決定のための SPRT の 2 つの組み合わせ手順の調査。2004 年 4 月、サンアントニオで開催されたアメリカ教育研究協会の年次総会で発表された論文。
- Kalohn, JC, & Spray, JA (1999)。コンピュータ化されたテストを使用して行われた分類決定に対するモデルの誤指定の影響。教育測定ジャーナル、36、47-59。
- Kingsbury, GG、Weiss, DJ (1979)。「習熟度決定のための適応型テスト戦略」研究報告 79-05。ミネアポリス:ミネソタ大学、心理測定法研究所。
- Kingsbury, GG、Weiss, DJ (1983)。IRT ベースの適応型習熟度テストと逐次型習熟度テスト手順の比較。DJ Weiss (編)、『テストの新たな地平: 潜在特性理論とコンピュータ適応型テスト』(pp. 237–254)。ニューヨーク: Academic Press。
- Lau, CA (1996)。多次元テストデータによる単次元コンピュータテスト習熟手順の堅牢性。未発表の博士論文、アイオワ大学、アイオワシティ IA。
- Lau, CA, & Wang, T. (1998)。コンピュータ分類テストにおける SPRT 手順による二値項目と多値項目の比較と組み合わせ。サンディエゴで開催されたアメリカ教育研究協会の年次会議で発表された論文。
- Lau, CA, & Wang, T. (1999)。多項式モデルによる実際的制約下でのコンピュータ分類テスト。カナダ、モントリオールで開催されたアメリカ教育研究協会の年次会議で発表された論文。
- Lau, CA, & Wang, T. (2000)。コンピュータ分類テストにおける混合項目タイプの新しい項目選択手順。ルイジアナ州ニューオーリンズで開催されたアメリカ教育研究協会の年次会議で発表された論文。
- Lewis, C., & Sheehan, K. (1990). ベイズ決定理論を用いたコンピュータ化された習熟度テストの設計。応用心理測定、14、367–386。
- Lin, C.-J. & Spray, JA (2000)。項目選択基準が連続確率比検定による分類テストに与える影響。(研究報告 2000–8)。アイオワシティ、アイオワ州: ACT, Inc.
- Linn, RL, Rock, DA, & Cleary, TA (1972)。二分決定のための連続テスト。教育および心理測定、32、85–95。
- Luecht, RM (1996)。「資格認定や免許取得の文脈における多次元コンピュータ適応型テスト」応用心理測定、20、389-404。
- Reckase, MD (1983)。テーラーメイドテストを使用した意思決定の手順。DJ Weiss (編)、テストの新たな地平: 潜在特性理論とコンピュータ適応型テスト (pp. 237–254)。ニューヨーク: Academic Press。
- Rudner, LM (2002)。意思決定理論適応型テスト手順の検討。2002 年 4 月 1 日から 5 日までルイジアナ州ニューオーリンズで開催されたアメリカ教育研究協会の年次総会で発表された論文。
- Sheehan, K., & Lewis, C. (1992). 非等価テストレットを用いたコンピュータ化された習熟度テスト。応用心理測定、16、65–76。
- Spray, JA (1993)。連続確率比検定を用いた複数カテゴリ分類(研究報告書 93–7)。アイオワ州アイオワシティ:ACT, Inc.
- Spray, JA, Abdel-fattah, AA, Huang, C., および Lau, CA (1997)。項目プールと潜在空間が多次元の場合のコンピュータ化されたテストの一次元近似 (研究レポート 97–5)。アイオワ州アイオワシティ: ACT, Inc.
- Spray, JA, & Reckase, MD (1987)。項目パラメータ推定誤差が逐次確率比検定を用いた意思決定に与える影響(研究報告書 87–17)。アイオワシティ、アイオワ州:ACT、Inc。
- Spray, JA, & Reckase, MD (1994)。コンピュータ適応型テストによる意思決定のためのテスト項目の選択。全米教育測定協議会年次会議 (ルイジアナ州ニューオーリンズ、1994 年 4 月 5 ~ 7 日) で発表された論文。
- Spray, JA, & Reckase, MD (1996)。コンピュータ化されたテストを使用して受験者を2つのカテゴリに分類するためのSPRTとシーケンシャルベイズ手順の比較。教育行動統計ジャーナル、21、405-414。
- Thompson, NA (2006). 項目反応理論を用いた可変長コンピュータ分類テスト。CLEAR Exam Review、17(2)。
- Vos, HJ (1998)。「コンピュータベースの指導のための最適な順次ルール」。教育コンピューティング研究ジャーナル、19、133-154。
- Vos, HJ (1999)。ベイズ決定理論の逐次的習熟度テストへの応用。教育行動統計ジャーナル、24、271-292。
- Wald, A. (1947). 逐次分析. ニューヨーク: Wiley.
- Weiss, DJ, Kingsbury, GG (1984)。「コンピュータ適応型テストの教育問題への応用」教育測定ジャーナル、21、361-375。
- Weissman, A. (2004)。複数カテゴリ分類 CAT における相互情報量項目選択。カリフォルニア州サンディエゴで開催された National Council for Measurement in Education の年次会議で発表された論文。
- ワイツマン、RA(1982a)。選択のための連続テスト。応用心理測定、6、337-351。
- ワイツマン、RA (1982b)。兵役に就く予定者の事前選抜に連続テストを使用する。DJ ワイス (編)、1982 年コンピュータ適応型テスト会議議事録。ミネソタ州ミネアポリス: ミネソタ大学、心理学部、心理測定法プログラム、1982 年。
外部リンク
- ローレンス・ラドナー著「測定決定理論」
- CAT Central デイビッド・J・ワイス著
