自動項目生成(AIG)または自動項目生成は、心理測定学とコンピュータプログラミングを結び付けるプロセスです。コンピュータアルゴリズムを使用して、心理テストの基本的な構成要素であるテスト項目を自動的に作成します。この方法は、1960年代にJohn R. Bormuth [1]によって初めて説明されましたが、最近まで開発されていませんでした。AIGは2段階のプロセスを使用します。まず、テストの専門家が項目モデルと呼ばれるテンプレートを作成します。次に、テスト項目を生成するためのコンピュータアルゴリズムが開発されます。[2]そのため、テストの専門家が個々の項目を作成する代わりに、コンピュータアルゴリズムが親項目モデルの小さなセットから項目のファミリーを生成します。[3] [4] [5]最近では、GPTファミリーなどの大規模言語モデルを含むニューラルネットワークが、項目の自動生成に効果的に使用されています。[6] [7]
コンテクスト
心理テストでは、テスト項目に対する受験者の反応から、さまざまな人間特性の客観的な測定データが提供されます。[8]心理テストや教育テストで測定される特性には、学力、学校の成績、知能、意欲などがあり、これらのテストは、個人または個人のグループに重大な影響を与える決定を下すために頻繁に使用されます。テストの妥当性などの測定品質基準を達成することは、心理学者や教育者にとって最も重要な目標の1つです。[9] AIGは、コンピューター化されたテストによって多数のテスト項目の必要性が高まっている現代の環境において、テストの品質を経済的に維持および改善するために使用できるテスト開発アプローチです。[5]
利点
AIGは標準化されたテストの作成コストを削減します。[10]アルゴリズムは、人間のテスト専門家よりも一定時間内に多くの項目を生成できるためです。並列テストフォームを迅速かつ簡単に作成できるため、さまざまな受験者に同じレベルの複雑さや難易度の異なるテスト項目のグループを提示でき、テストのセキュリティが向上します。[3]コンピューター適応型テストと組み合わせると、AIGは新しい項目を生成したり、テストの実施中に受験者の能力に基づいて次に実施する既に生成された項目を選択したりできます。AIGはまた、幅広い難易度、より少ない構成の項目を作成し、プロトタイプ項目モデルをより体系的に定義することで項目の比較可能性を高めることが期待されています。[3] [11] [12]
根号、付随語、同形
テスト開発(AIGを含む)は、認知理論に基づいている場合、充実させることができます。特定の理論から取られた認知プロセスは、その構築中に項目の特徴と一致することがよくあります。この目的は、項目の難易度(以下、β)などの特定の心理測定パラメータを事前に決定することです。項目パラメータに大きく影響し、項目に特定の認知要件を提供する構造要素をラジカル[11]とします。項目モデルの1つ以上のラジカルを操作して、異なるパラメータ(例: β )レベルを持つ親項目モデルを作成できます。その後、各親は、Irvine [11]が偶発要素と呼ぶ他の要素を操作することで、独自のファミリーを成長させることができます。偶発要素は、同じファミリー内で項目ごとにランダムに変化する表面特徴です。ラジカルの構造が同じで、偶発要素のみが異なる項目は、通常、同型[13]またはクローンと呼ばれます。[14] [15]項目のクローニングには2種類ある。一方では、項目モデルは1つ以上の空きスペースを持つ項目で構成され、各スペースを可能性のリストから選択した要素で埋めることでクローニングが行われる。他方では、項目モデルは、例えば空間能力テストのオブジェクトの角度を変えるなどの変換を導入することでクローニングされた完全な項目である可能性がある。[16]これらの項目の表面特性の変化は、被験者の反応に大きな影響を与えないはずである。これが、偶発的な要因が同型群の項目パラメータにわずかな違いしか生じないと考えられる理由である。[3]
現在の動向
多数のアイテムジェネレーターが客観的な検証テストを受けています。
MathGenは数学の達成度をテストするための問題を生成するプログラムです。2018年にJournal of Educational Measurementに発表された論文で、著者のエムブレットソンとキングストンは、生成された問題の定性的および心理測定的特性を評価するために広範な定性的レビューと実証的な試行を行い、生成された問題は成功しており、同じ問題構造から生成された問題は予測可能な心理測定特性を持っているという結論に達しました。[17] [18]
計算モデルRachman-Jun 2015 [19]の助けを借りて開発された旋律識別テストが、2017年の試験の参加者に実施されました。PM Harrisonらによって収集されたデータによると、結果は高い妥当性と信頼性を示しています。[20]
フェレイラとバックホフ・エスクデロ[21]は、彼らが開発したGenerExというプログラムを使用して、教育スキルの一般的なテストである基礎能力試験(Excoba)の2つの並行バージョンを作成しました。次に、作成されたテストの内部構造と心理測定学的同等性を研究しました。心理測定学的品質の実証結果は全体的に良好であり、テストと項目は複数の心理測定指標によって測定されるように一貫しています。
Gierlと彼の同僚[22] [23] [24] [25]は、 Item Generator(IGOR [26])と呼ばれるAIGプログラムを使用して、医学知識をテストする多肢選択式問題を作成した。IGORで生成された問題は、手動で設計された問題と比較しても、優れた心理測定特性を示した。
Arendasy、Sommer、Mayr [27]は、AIGを使用してドイツ語と英語の言語流暢性をテストするための言語項目を作成し、それぞれドイツ語と英語を話す参加者に実施しました。コンピューターで生成された項目は、許容できる心理測定特性を示しました。これら2つのグループに実施された項目セットは、言語間のパフォーマンスの比較を容易にする共通言語間アンカー項目セットに基づいていました。
Holling、Bertling、Zeuch [28]は確率論を用いて、予想される難易度を持つ数学の文章題を自動生成した。彼らはRasch [29]モデルの適合を達成し、項目の難易度は線形ロジスティック検定モデル(LLTM [30])とランダム効果LLTMによって説明できた。Holling、Blank、Kuchenbäcker、Kuhn [31] は統計的文章題を用いて同様の研究を行ったが、AIGは使用しなかった。Arendasyと彼の同僚[32] [33] は、自動生成された代数文章題に関する研究を発表し、AIGの品質管理フレームワークが項目の測定品質にどのように影響するかを検討した。
フィギュアアイテムの自動生成

アイテムメーカー(IMak)は、 Rプログラミング言語で書かれた図形類推項目をプロットするためのプログラムです。IMakで生成された23項目の心理測定特性は満足のいくものであり、ルール生成に基づく項目の難易度は線形ロジスティックテストモデル(LLTM)によって予測できました。[3]
MazeGenはRでコード化された別のプログラムで、迷路を自動生成します。18の迷路の心理測定特性は、Raschモデルの適合や迷路の難易度のLLTM予測など、最適であることがわかりました。[34]
GeomGen は図形マトリックスを生成するプログラムです。[35]図形マトリックス項目の反応除去戦略に関連する測定バイアスの原因を特定した研究では、気を散らすものの顕著性が反応除去戦略の追求に有利に働き、この知識を AIG に組み込むことでそのような項目の構成妥当性を改善できると結論付けられました。[36]同じグループは AIG を使用して、心的回転に関連する差異的項目機能(DIF) と性差を研究しました。彼らは以前の研究で性差 DIF を示した項目設計機能を操作し、性差の効果サイズの推定値は、特定の項目設計機能に関連する可能性のあるさまざまな種類の性差 DIF の存在によって損なわれることを示しました。[37] [38]
アレンダシーは、自動的に生成された視空間推論項目について、項目反応理論(IRT)を使用して特定された心理測定品質の違反の可能性についても研究した。この目的のために、彼は2つのプログラム、すなわち、すでに述べたGeomGen [35]とEndless Loop Generator(EsGen)を紹介した。彼は、IRTの原理を項目生成中に組み込むことができるため、GeomGenの方がAIGに適していると結論付けた。[39] GeomGenを使用した並行研究プロジェクトで、アレンダシーとゾマー[40]は、項目の知覚的構成の変動が、能力レベルに応じて回答者のパフォーマンスに影響を与える可能性があり、それがいくつかの心理測定品質指標に影響を及ぼしていることを発見した。これらの結果から、彼らは一般に図形マトリックス項目の一次元性仮定に疑問を投げかけた。
MatrixDeveloper [41]は、25個の4x4正方行列項目を自動的に生成するために使用されました。これらの項目は169人の被験者に実施されました。研究結果によると、これらの項目はRaschモデルによく適合しており、ルールベースの生成により項目の難易度を説明できます。[42]
最初のアイテムマトリックスジェネレーターはEmbretsonによって設計され[43] [14]、EmbretsonとReiseによって示されているように、彼女が自動的に生成したアイテムは優れた心理測定特性を示しました。[44]彼女はまた、適切なオンラインアイテム生成モデルを提案しました。
参考文献
- ^ Bormuth, J. (1969). 「達成度テスト項目の理論について」シカゴ、イリノイ州:シカゴ大学出版局。
- ^ Gierl, MJ, & Haladyna, TM (2012).自動アイテム生成の理論と実践。ニューヨーク、NY: Routledge Chapman & Hall。
- ^ abcde Blum, Diego; Holling, Heinz (2018年8月6日). 「IMakパッケージによる図形アナロジーの自動生成」. Frontiers in Psychology . 9 :1286. doi : 10.3389 /fpsyg.2018.01286 . PMC 6087760. PMID 30127757.
この資料は、クリエイティブ コモンズ アトリビューション 4.0 国際ライセンスの下で利用可能なこのソースからコピーされました。
- ^ Glas, CAW, van der Linden, WJ, & Geerlings, H. (2010). 適応型テストのための項目複製モデルのパラメータの推定。WJ van der Linden、CAW Glas (編)。適応型テストの要素(pp. 289–314)。DOI: 10.1007/978-0-387-85461-8_15。
- ^ ab Gierl, MJ, & Lai, H. (2012). 自動アイテム生成におけるアイテムモデルの役割。International Journal of Testing, 12 (3), 273–298. DOI: 10.1080/15305058.2011.635830.
- ^ von Davier, M. リカレントニューラルネットワークによる自動アイテム生成。Psychometrika 83, 847–857 (2018). https://doi.org/10.1007/s11336-018-9608-y
- ^ Yaneva, V., & von Davier, M. (編著). (2023). 教育評価における自然言語処理の進歩 (第 1 版). Routledge. https://doi.org/10.4324/9781003278658
- ^ Van der Linden, WJ, & Hambleton, RK (1997). 項目反応理論: 簡単な歴史、一般的なモデル、および拡張。RK Hambleton、WJ van der Linden (編)。現代項目反応理論ハンドブック(pp. 1–31)。ニューヨーク: Springer。
- ^ Embretson, SE (1999)。認知能力の測定における問題。SE Embretson、SL Hershberger (編)。新しい測定ルール(pp. 1–15)。Mahwah: Lawrence Erlbaum Associates。
- ^ Rudner, L. (2010). 大学院経営学入学試験のコンピュータ適応型テストの実施。WJ van der Linden、CAW Glas (編)。適応型テストの要素(pp. 151–165)。DOI: 10.1007/978-0-387-85461-8_15。
- ^ abc Irvine, S. (2002). 大量テストのための項目生成の基礎。SH Irvine、PC Kyllonen (編)。テスト開発のための項目生成(pp. 3–34)。マホワ:Lawrence Erlbaum Associates。
- ^ Lai, H., Alves, C., & Gierl, MJ (2009). 自動項目生成を使用して CAT の項目需要に対応する。DJ Weiss (編)、Proceedings of the 2009 GMAC Conference on Computerized Adaptive Testing。Web: www.psych.umn.edu/psylabs/CATCentral。
- ^ Bejar, II (2002). 生成的テスト: 構想から実装まで、テスト開発のための項目生成、SH Irvine および PC Kyllonen 編 (Mahwah, NJ: Lawrence Erlbaum Associates)、199–217 ページ。
- ^ ab Embretson, SE (1999). テスト中の項目生成:心理測定の問題とモデルPsychometrika, 64 (4), 407–433.
- ^ Arendasy, ME, Sommer, M. (2012). 自動項目生成を使用して、高リスクの教育および職業評価の項目需要の増加に対応する。学習と個人差、22、112–117。doi : 10.1016/j.lindif.2011.11.005。
- ^ Glas, CAW, van der Linden, WJ (2003). 項目クローニングによるコンピュータ適応型テスト。応用心理測定、 27、247–261。doi: 10.1177/0146621603027004001。
- ^ Embretson, SE, & Kingston, NM (2018). 自動項目生成: 数学の達成項目を開発するためのより効率的なプロセス?教育測定ジャーナル、55 (1), 112–131. DOI: 10.1111/jedm.12166
- ^ Willson, J., Morrison, K., & Embretson, SE (2014).数学の達成項目の自動項目生成器: MathGen3.0。教育科学研究所助成金 R305A100234 の技術レポート IES1005A-2014。ジョージア州アトランタ: ジョージア工科大学認知測定研究所。
- ^ Collins, T., Laney, R., Willis, A., & Garthwaite, PH (2016). 音楽スタイルの計算モデルの開発と評価。エンジニアリング設計、分析、製造のための人工知能、30、16–43。DOI : 10.1017/S0890060414000687。
- ^ Harrison, PM, Collins, T., & Müllensiefen, D. (2017). メロディック弁別テストへの最新心理測定技術の応用: 項目反応理論、コンピュータ適応型テスト、自動項目生成。Scientific reports, 7 (3618), 1–18。
- ^ フェレイラ、MF、バックホフ=エスクデロ、E. (2016)。 Validez del Generador Automático de Ítems del Examen de Competencias Básicas (Excoba)。リリーフ、22 (1)、アート。 2、1~16。 DOI: 10.7203/relieve.22.1.8048。
- ^ Gierl, MJ, Lai, H., Pugh, D., Touchie, C., Boulais, AP, & De Champlain, A. (2016). 生成された多肢選択式テスト項目の心理測定特性の評価。教育における応用測定、29 (3), 196–210。DOI: 10.1080/08957347.2016.1171768。
- ^ Lai, H., Gierl, MJ, Byrne, BE, Spielman, AI, & Waldschmidt, DM (2016). 歯科における検査項目の自動生成を促進する3つのモデリングアプリケーション。歯科教育ジャーナル、80 (3), 339–347。
- ^ Gierl, MJ, & Lai, H. (2013). 自動化プロセスで作成された医療多肢選択問題の品質評価。医学教育、 47、726–733。DOI: 10.1111/medu.12202。
- ^ Gierl, MJ, Lai, H., & Turner, SR (2012). 自動項目生成を使用した多肢選択式テスト項目の作成。医学教育、46 (8), 757–765. DOI: 10.1111/j.1365-2923.2012.04289.x.
- ^ Gierl, MJ, Zhou, J., & Alves, C. (2008). 評価エンジニアリングを促進するための項目モードタイプの分類の開発。J technol learn assess、7 (2)、1–51。
- ^ Arendasy, ME, Sommer, M., & Mayr, F. (2011). 自動項目生成を使用して、語彙流暢性テストのドイツ語版と英語版を同時に作成する。異文化心理学ジャーナル、43 (3)、464–479。DOI: 10.1177/0022022110397360。
- ^ Holling, H., Bertling, JP, & Zeuch, N. (2009). 確率単語問題の自動項目生成。教育評価研究、35 (2–3), 71–76。
- ^ Rasch, G. (1960).知能テストと達成度テストのための確率モデルシカゴ: シカゴ大学出版局.
- ^ Fischer, GH (1973). 教育研究の手段としての線形ロジスティックテストモデル。Acta Psychological, 37 , 359–374. DOI: 10.1016/0001-6918(73)90003-6.
- ^ Holling, H., Blank, H., Kuchenbäcker, K., & Kuhn, JT (2008). 統計的単語問題のルールベースの項目設計:レビューと最初の実装。心理学科学季刊誌、50 (3), 363–378。
- ^ Arendasy, ME, Sommer, M., Gittler, G., & Hergovich, A. (2006). 定量的推論項目の自動生成。パイロットスタディ。Journal of individual Differences、27 (1)、2–14。DOI: 10.1027/1614-0001.27.1.2。
- ^ Arendasy, ME, & Sommer, M. (2007). 教育評価における心理測定技術の使用: 定量的推論項目の自動生成に対するスキーマベースの同型アプローチの事例。学習と個人差、17 (4), 366–383。DOI: 10.1016/j.lindif.2007.03.005。
- ^ Loe, BS, & Rust, J. (2017). 知覚迷路テストの再考:自動生成迷路の難易度の評価。評価、1–16。DOI: 10.1177/1073191117746501。
- ^ ab アレンダシー、M. (2002)。Matrizentestaufgaben の Geom-Gen-Ein アイテムジェネレーター。ウィーン: アイゲンフェルラーグ。
- ^ Arendasy, ME, & Sommer, M. (2013). 回答除去戦略を減らすと図形マトリックスの構成妥当性が向上する。インテリジェンス、 41、234–243。DOI: 10.1016/j.intell.2013.03.006。
- ^ Arendasy, ME, & Sommer, M. (2010). 自動項目生成を用いた3次元メンタルローテーションにおける性差の効果サイズに対する異なる項目特性の寄与の評価。インテリジェンス、38 (6)、574–581。DOI:10.1016/j.intell.2010.06.004。
- ^ Arendasy, ME, Sommer, M., & Gittler, G. (2010). 自動項目生成と実験デザインの組み合わせによる、メンタルローテーションにおける性差への認知要素の寄与の調査。インテリジェンス、38 (5), 506–512. DOI:10.1016/j.intell.2010.06.006.
- ^ Arendasy, M. (2005). Rasch較正項目の自動生成:図形マトリックステストGEOMとEndless-LoopsテストEC。国際テストジャーナル、5 (3)、197–224。
- ^ Arendasy, ME, & Sommer, M. (2005). 異なるタイプの知覚操作が自動生成された図形マトリックスの次元に与える影響。インテリジェンス、33 (3), 307–324。DOI: 10.1016/j.intell.2005.02.002。
- ^ ホーファー、S. (2004)。マトリックス開発者。ドイツ、ミュンスター:心理研究所 IV。ヴェストフェリッシュ ヴィルヘルム大学。
- ^ Freund, PA, Hofer, S., & Holling, H. (2008). コンピュータ生成図形マトリックス項目の心理測定特性の説明と制御。応用心理測定、32 (3), 195–210。DOI: 10.1177/0146621607306972。
- ^ Embretson, SE (1998). 有効なテストを生成するための認知設計システムアプローチ:抽象的推論への応用。心理学的方法、3 (3), 380–396。
- ^ Embretson, SE, & Reise, SP (2000).心理学者のための項目反応理論. マホワ: Lawrence Erlbaum Associates.
