心理測定学は、測定の理論と技術を扱う心理学の研究分野です。心理測定学は一般的に、テスト、測定、評価、および関連活動に特化した心理学と教育の専門分野を網羅しています。[ 1 ]心理測定学は、直接観察できない潜在的構成概念の客観的な測定に関係しています。潜在的構成概念の例としては、知能、性格因子(例:内向性)、精神障害、学業成績などがあります。[ 2 ]観察できない潜在変数における個人のレベルは、テストや尺度の項目に対する個人の反応から観察されるものに基づいて、数学的モデルによって推測されます。[ 2 ]
心理測定学の研究者は心理測定学者と呼ばれますが、心理測定学の研究に従事する人すべてがこの肩書きを名乗るわけではありません。ほとんどの心理測定学者は、心理測定学と測定理論の高度な大学院教育を受けた心理学者です。心理学辞典によると、心理測定学者は「測定技術の理論的知識を持ち、心理テストの開発、評価、改善を行う資格のある個人」です。[ 3 ]心理測定学者は、従来の学術機関に加えて、ピアソンや教育テストサービスなどの組織や独立コンサルタントとしても働いています。心理測定学の研究者の中には、調査、尺度、自由回答式または選択式の質問票などの評価ツールの構築と妥当性検証に焦点を当てている人もいます。また、測定理論(項目反応理論、級内相関など)に関連する研究に焦点を当てている人や、学習と開発の専門家として特化している人もいます。
「サイコメトリー」という言葉は、ギリシャ語の「ψυχή」(psukhē、「精神、魂」)と「μέτρον」(metron、「測定」)に由来する。アメリカの学者ジョセフ・ローズ・ブキャナンは、心理学的基準の合理的な定量化ではなく、超常現象の研究に関連して、1842年に「サイコメトリー」という言葉を初めて造語したとされている。
合理的な心理検査は、2つの思想の流れから生まれた。1つ目は、ダーウィン、ゴルトン、キャッテルによる個人差の測定に関するもので、2つ目は、ヘルバルト、ウェーバー、フェヒナー、ヴントによる同様の構成概念の精神物理学的測定に関するものである。後者の研究者とその研究が、実験心理学と標準化された検査の発展につながった。[ 4 ]
チャールズ・ダーウィンは、心理測定学の発展に貢献した科学者フランシス・ゴルトンのインスピレーションの源泉となった。1859年、ダーウィンは著書『種の起源』を出版した。ダーウィンは、植物や動物の様々な種が時間をかけて出現する過程における自然選択の役割について論じた。この本は、ある種の個体がどのように互いに異なり、環境への適応度合いが異なる特性を持っているかを示した。適応度の高い特性を持つ個体は、生き残って子孫を残し、次の世代を生み出す可能性が高く、適応度の低い特性を持つ個体は、その可能性が低い。これらの考えは、ゴルトンが人間を研究し、人間同士の違いや、それらの違いをどのように測定するかに関心を持つきっかけとなった。
ゴルトンは『遺伝的天才』という本を執筆し、1869年に初版が出版されました。この本では、人々が持つさまざまな特性と、それらの特性によって一部の人が他の人よりも「適している」理由について説明しています。今日では、感覚機能や運動機能(反応時間、視力、体力)などのこれらの違いは、科学的心理学の重要な領域となっています。心理測定学の初期の理論的および応用的な研究の多くは、知能を測定しようとして行われました。しばしば「心理測定学の父」と呼ばれるゴルトンは、精神テストを考案し、人体測定法の中に含めました。心理測定学の分野の先駆者であるジェームズ・マッキーン・キャッテルは、ゴルトンの研究をさらに発展させました。キャッテルは「精神テスト」という用語を作り出し、最終的に現代のテストの開発につながる研究と知識に貢献しました。[ 4 ]
心理測定学の起源は、関連分野である精神物理学ともつながりがある。ダーウィン、ゴルトン、キャッテルが発見をしていたのとほぼ同時期に、ヘルバルトも科学的方法によって「人間の意識の謎を解き明かす」ことに興味を持っていた。[ 4 ]ヘルバルトは心の数学モデルを作成したが、それはその後何年にもわたって教育実践に影響を与えた。
EH ウェーバーはヘルバルトの研究を発展させ、感覚系を活性化するには最小限の刺激が必要であると述べ、心理的閾値の存在を証明しようと試みた。ウェーバーの後、G.T. フェヒナーはヘルバルトとウェーバーから得た知識を発展させ、感覚の強さは刺激強度の対数に比例するという法則を考案した。ウェーバーとフェヒナーの弟子であるヴィルヘルム・ヴントは、心理学の創始者として知られている。ヴントの影響が、他の人々が心理検査を開発する道を開いたのである。[ 4 ]
1936年、心理測定学会の共同創設者であり初代会長でもある心理測定学者LLサーストンは、比較判断の法則と呼ばれる測定への理論的アプローチを開発し応用した。このアプローチは、エルンスト・ハインリヒ・ウェーバーとグスタフ・フェヒナーの精神物理学理論と密接な関係がある。さらに、スピアマンとサーストンはともに、心理測定学で広く開発され使用されている統計的手法である因子分析の理論と応用に重要な貢献をした。 [ 5 ] 1950年代後半、レオポルド・ゾンディは、過去数十年間の心理学に対する統計的思考の影響について、歴史的かつ認識論的な評価を行った。「過去数十年間、特に心理学的な思考はほぼ完全に抑圧され、排除され、統計的思考に取って代わられた。まさにここに、今日のテスト学とテストマニアという癌が見られる。」[ 6 ]
近年では、心理測定理論は、性格、態度、信念、学業成績の測定に応用されている。これらの潜在的な構成概念は真に測定することは不可能であり、この分野の研究や科学の多くは、これらの構成概念を可能な限り真の値に近づけて測定しようとする試みとして発展してきた。
心理測定学に多大な貢献をした人物には、ポール・ホルスト、カール・ピアソン、ヘンリー・F・カイザー、カール・ブリガム、LL・サーストン、EL・ソーンダイク、ゲオルク・ラッシュ、ユージン・ギャランター、ジョンソン・オコナー、フレデリック・M・ロード、レディヤード・R・タッカー、ルイス・ガットマン、ジェーン・レーヴィンガーなどがいる。
社会科学における測定の定義には長い歴史がある。スタンリー・スミス・スティーブンスが提唱した現在広く用いられている定義は、測定とは「何らかの規則に従って対象や事象に数値を割り当てること」である。この定義は、スティーブンスが4つの測定レベルを提案した1946年のサイエンス誌の記事で紹介された。[ 7 ]この定義は広く採用されているものの、物理科学で採用されているより古典的な測定の定義とは重要な点で異なっている。すなわち、科学的測定とは「定量的属性のある大きさと同一属性の単位との比率の推定または発見」を伴うものである(358ページ)[ 8 ]。
実際、スティーブンスの測定の定義は、物理学者A・ファーガソンが委員長を務めた英国のファーガソン委員会の提言を受けて提示されたものでした。この委員会は、感覚事象を定量的に推定する可能性を調査するために、1932年に英国科学振興協会によって任命されました。委員長や他の委員は物理学者でしたが、委員会には数名の心理学者も含まれていました。委員会の報告書は、測定の定義の重要性を強調しました。スティーブンスは、この分野に大きな影響を与えた新しい定義を提案することで対応しましたが、これは報告書に対する唯一の対応ではありませんでした。もう一つ、著しく異なる対応は、次の記述に反映されているように、古典的な定義を受け入れることでした。
これらの異なる反応は、測定に対する代替的なアプローチに反映されている。たとえば、共分散行列に基づく方法は、評価から得られる生のスコアなどの数値が測定値であるという前提で一般的に用いられる。このようなアプローチは、数値が何らかの規則に従って割り当てられることだけを要求するスティーブンスの測定の定義を暗黙のうちに含んでいる。したがって、主な研究課題は、一般的に、スコア間の関連性、およびそのような関連性の根底にあると考えられる要因の発見であると考えられている。[ 10 ]
一方、ラッシュモデルなどの測定モデルを用いる場合、数値は規則に基づいて割り当てられるわけではありません。むしろ、リースの上記の発言にあるように、測定のための具体的な基準が定められ、その基準を満たすデータが得られるような手順や操作を構築することが目標となります。測定値はモデルに基づいて推定され、関連する基準が満たされているかどうかを確認するためにテストが実施されます。
最初の心理測定機器は知能を測定するために設計された。[ 11 ]知能を測定する初期のアプローチの1つは、アルフレッド・ビネとテオドール・シモンによってフランスで開発されたテストである。このテストはビネ・シモンテストとして知られていた。フランスのテストはスタンフォード大学のルイス・ターマンによって米国での使用に合わせて改良され、スタンフォード・ビネIQテストと名付けられた。
心理測定学におけるもう一つの主要な焦点は、性格検査である。性格の概念化と測定にはさまざまな理論的アプローチがあるが、広く合意された理論はない。よく知られている検査には、ミネソタ多面人格目録、五因子モデル(または「ビッグ5」)、性格嗜好目録、マイヤーズ・ブリッグス・タイプ指標などのツールがある。態度も心理測定学的アプローチを用いて広く研究されている。[ 12 ]代替方法としては、展開測定モデルの適用があり、最も一般的なのは双曲線余弦モデル(Andrich & Luo、1993)である。[ 13 ]
心理測定学者は、さまざまな測定理論を開発してきました。これには、古典的テスト理論(CTT) と項目反応理論(IRT) が含まれます。[ 14 ] [ 15 ]数学的には IRT と似ているように見えますが、その起源と特徴の点ではかなり異なるアプローチとして、測定のためのRasch モデルがあります。Rasch モデル、およびそれが属するより広いクラスのモデルの開発は、物理科学における測定の要件に基づいて明確に構築されました。[ 16 ]
心理測定学者は、相関と共分散の大きな行列を扱うための方法も開発してきました。この一般的な伝統の手法には、データの根底にある次元を決定する方法である因子分析[ 17 ]が含まれます。因子分析の利用者が直面する主な課題の1つは、潜在因子の数を決定するための適切な手順に関する合意がないことです[ 18 ]。通常の手順は、元の球が縮小するため、固有値が1を下回ったときに因子分析を停止することです。明確な区切り点がないことは、他の多変量解析手法にも関係しています[ 19 ] 。
多次元尺度構成法[ 20 ]は、多数の潜在次元を持つデータの単純な表現を見つけるための手法です。クラスター分析は、互いに類似したオブジェクトを見つけるためのアプローチです。因子分析、多次元尺度構成法、およびクラスター分析はすべて、大量のデータからより単純な構造を抽出するために使用される多変量記述法です。
最近では、構造方程式モデリング[ 21 ]とパス解析は、大規模な共分散行列を扱うためのより洗練されたアプローチです。これらの方法により、統計的に洗練されたモデルをデータに適合させ、それが適切かどうかをテストすることができます。詳細なレベルでは、心理測定研究は関心のある各項目の多次元性の程度と性質に関心があるため、二因子分析[ 22 ] [ 23 ] [ 24 ]として知られる比較的新しい手順が役立つことがあります。二因子分析は、「理想的には、一般因子と追加の体系的分散の1つのソースという2つのソースの観点から、項目の体系的分散」を分解することができます。[ 25 ]
古典的テスト理論における重要な概念は、信頼性と妥当性である。信頼性の高い尺度は、時間、個人、状況を問わず、構成概念を一貫して測定できる尺度である。妥当な尺度は、測定しようとしているものを実際に測定できる尺度である。信頼性は妥当性にとって必要条件ではあるが、十分条件ではない。
信頼性と妥当性はどちらも統計的に評価できます。同じテストを繰り返し測定した場合の一貫性はピアソン相関係数で評価でき、これは再テスト信頼性と呼ばれることが多いです。[ 26 ]同様に、同じ測定の異なるバージョンの等価性はピアソン相関係数で指標化でき、等価形式信頼性または同様の用語で呼ばれます。[ 26 ]
単一のテスト形式の均質性を扱う内部一貫性は、テストの 2 つの半分のパフォーマンスを相関させることによって評価できます。これは分割半分信頼性と呼ばれます。この 2 つの半分のテストのピアソン積率相関係数の値は、スピアマン-ブラウン予測式を使用して、2 つの完全なテスト間の相関に対応するように調整されます。 [ 26 ]おそらく最も一般的に使用される信頼性の指標は、すべての可能な分割半分係数の平均に相当するクロンバックの αです。他のアプローチには、特定のターゲットの測定値の分散とすべてのターゲットの分散の比率であるクラス内相関があります。
妥当性にはさまざまな形態があります。基準関連妥当性とは、テストや尺度が「測定機器自体とは外部にある」行動のサンプル、つまり基準をどの程度予測できるかを指します。[ 27 ]この外部の行動サンプルには、別のテスト、高校のSATが大学での成績を予測するために使用される場合の大学の成績平均点、さらには過去に発生した行動(現在の心理症状のテストが過去の被害の発生を予測する場合など)(これは事後予測を正確に表します)など、多くのものが含まれます。基準尺度が検証対象の尺度と同時に収集される場合、目標は同時妥当性を確立することです。基準が後から収集される場合、目標は予測妥当性を確立することです。尺度は、理論で要求されるように他の構成概念の尺度と関連している場合、構成概念妥当性を持ちます。内容妥当性とは、テストの項目が測定対象の領域を適切にカバーしていることを示すものです。人事選考の例では、テストの内容は、職務分析から得られた知識、スキル、能力、またはその他の特性に関する定義済みの記述または一連の記述に基づいています。
項目反応理論は、潜在特性とテスト項目への反応との関係をモデル化します。IRTには、他の利点に加えて、特定の潜在特性における受験者の位置の推定値と、その位置の測定の標準誤差を得るための基礎を提供します。例えば、大学生の歴史の知識は、大学のテストの点数から推測でき、それを、より簡単なテストから推測される高校生の知識と確実に比較することができます。古典的テスト理論から得られるスコアにはこのような特性はなく、実際の能力(他の受験者との相対的な能力ではなく)の評価は、母集団から無作為に選ばれた「基準グループ」のスコアと比較することによって行う必要があります。実際、古典的テスト理論から得られるすべての尺度は、テスト対象のサンプルに依存しますが、原則として、項目反応理論から得られる尺度は依存しません。
妥当性と信頼性に関する考慮事項は、一般的に、あらゆるテストの質を決定する上で不可欠な要素と見なされています。しかし、専門家団体や実務家団体は、特定の状況下で基準を策定し、テスト全体の質を評価する際に、これらの懸念をより広い文脈の中に位置づけることがよくあります。多くの応用研究の場面で懸念されるのは、特定の心理検査の指標が意味のあるものなのか、それとも恣意的なものなのかということです。[ 28 ]
2014年、米国教育研究協会(AERA)、米国心理学会(APA)、および全米教育測定協議会(NCME)は、テストの開発、評価、および使用に関する基準を記述した「教育および心理テストの基準」の改訂版[ 29 ]を公表しました。この基準は、妥当性、信頼性/測定誤差、テストの公平性など、テストにおける重要なトピックを網羅しています。また、テストの設計と開発、スコア、尺度、規範、スコアのリンク、カットオフスコア、テストの実施、採点、報告、スコアの解釈、テストの文書化、テスト受験者とテスト利用者の権利と責任など、テストの運用に関連する基準も定めています。最後に、この基準は、心理テストと評価、職場テストと資格認定、教育テストと評価、プログラム評価と公共政策におけるテストなど、テストの応用に関連するトピックを網羅しています。
評価の分野、特に教育評価の分野では、教育評価基準合同委員会[ 30 ]が評価基準を3つ発表している。人事評価基準[ 31 ]は1988年に、プログラム評価基準(第2版)[ 32 ]は1994年に、学生評価基準[ 33 ]は2003年に発表された。
各出版物では、さまざまな教育現場で使用するための一連の基準が提示され、詳細に説明されています。これらの基準は、特定された評価形式の設計、実施、評価、および改善のためのガイドラインを提供します。[ 34 ]各基準は、適切で、有用で、実行可能で、正確な教育評価を促進するために、4 つの基本的なカテゴリのいずれかに分類されています。これらの基準のセットでは、妥当性と信頼性に関する考慮事項は、正確性のトピックで扱われています。たとえば、学生の正確性基準は、学生の評価が学生の学習とパフォーマンスに関する健全で正確かつ信頼できる情報を提供することを保証するのに役立ちます。
心理測定学は相関と統計的推論によって測定される潜在的な心理プロセスに基づいているため、心理的特性が科学的に正確に測定できる範囲については、長い間論争が続いています。[ 35 ]物理科学の実践者を含む批判者は、知能、性格、情緒安定性、心理的適応などの構成概念は、直接観察可能な物理的特性ではなく、抽象的な人間の経験であると主張しています。その結果、心理測定は、物理科学の意味での正確な測定ではなく、統計モデル、確率論、サンプリング仮定、相関、解釈の枠組みに大きく依存しています。したがって、心理学における統計的結論は絶対的なものではなく確率的であり、テストスコアは理論、方法論、文化、環境、文脈によって形成された推定解釈を表しています。[ 36 ]批判者はさらに、心理測定学の歴史的基盤が中立性と客観性の主張を複雑にしていると主張しています。フランシス・ゴルトン、チャールズ・スピアマン、ルイス・ターマンといった影響力のある知能理論家は優生学の提唱者であり、彼らの前提は知能と人間の差異に関する初期の理論を大きく形作った。[ 37 ] [ 38 ]そのため、批評家たちは、知能検査は、その歴史的発展に内在する人種的および社会的前提から完全に切り離すことはできないと主張している。IQ検査は心理学や教育で広く使われ続けているが、批評家たちは、知能が文化的に中立で客観的な生物学的特性として測定できるという前提にますます疑問を呈している。デビッド・ウェクスラーは知能を「目的を持って行動し、合理的に考え、環境に効果的に対処する個人の総合的または全体的な能力」と定義したが、批評家たちは、異なる文化、社会経済的状況、教育制度、社会環境によって、推論、適応、コミュニケーション、問題解決の異なる形式が評価される可能性があると指摘している。
教育心理測定基準では、「妥当性とは、テストの提案された使用に伴うテストスコアの解釈を証拠と理論がどの程度支持しているかを指す」と規定されている。[ 39 ]簡単に言えば、テストは、設計された方法で解釈および使用されない限り、妥当ではない。[ 40 ]信頼性と妥当性が許容範囲内のテストであっても、測定対象と測定結果の解釈方法に関する理論的仮定に依存している。批評家は、主に西洋および白人多数派の学術的伝統の中で開発された心理測定テストは、支配的な文化的経験に基づいて「正常」の基準を構築し、それらの規範からの逸脱を欠陥または異常と位置づけてきたと主張する。心理学は、こうした測定法に内在する仮定を十分に批判することなく、こうした測定法に依存し続けることで、意図せず知能、達成、行動、および精神衛生に関する人種的な解釈を正当化してしまう可能性がある。こうした仮定は、教育における不平等な配置、偏った臨床的解釈、差別的な職業選考、および医療における格差につながる可能性がある。リー・クロンバックは『アメリカン・サイコロジスト』 (1957年)で、「相関心理学は実験心理学と全く同じくらい古いが、成熟が遅かった。しかし、独特の種類の質問をし、質問が適切に設定され、データが適切に解釈されているかどうかを検証する技術的な方法を持っているため、学問分野として同等の資格がある」と述べている。さらに彼は、「相関法は、人間が制御することを学んでいない、あるいは制御することを決して望めないものを研究することができる…学問分野の真の連合が必要である。独立したままでは、特定の重要な問題に関して間違った答えしか出せないか、全く答えが出ない可能性がある」と主張した。[ 41 ]
性格特性を測定するために使用されるツールの主なカテゴリは、客観的テストと投影法です。例としては、ビッグファイブインベントリー(BFI)、ミネソタ多面人格目録(MMPI-2)、ロールシャッハインクブロットテスト、神経症的性格質問票KON-2006 [ 42 ]、アイゼンク性格質問票などがあります。一部の心理測定尺度は許容できる信頼性と妥当性を示していますが、他の尺度は依然として議論の的となっています。たとえば、マイヤーズ・ブリッグス・タイプ指標(MBTI)は、妥当性に疑問があるとして批判されています。心理測定専門家のロバート・ホーガンは、「ほとんどの性格心理学者は、MBTIを精巧な中国のフォーチュンクッキーに過ぎないと考えている」と書いています。[ 43 ]
心理測定学は、人間の能力、態度、特性、および教育の進化を扱います。特に、非人間動物の行動、精神過程、および能力の研究は、通常、比較心理学によって扱われるか、非人間動物とその他の動物との連続体として進化心理学によって扱われます。しかしながら、人間に対して取られたアプローチと(非人間)動物に対して取られたアプローチの間には、より緩やかな移行を提唱する人もいます。[ 44 ] [ 45 ] [ 46 ] [ 47 ]
機械の能力、特性、学習進化の評価は、人工知能の分野では特定のアプローチが用いられているものの、人間や非人間動物の場合とはほとんど関係がない。普遍的心理測定学という名称で、より統合的なアプローチも提案されている。[ 48 ] [ 49 ]
特定の特殊な精神的精神、究極の十年間、最高の医療と完全な安全性、安全な医療を提供します。テストログとテストマニアの癌を正確に把握します。
{{cite book}}: CS1メンテナンス: 場所の発行元が見つかりません (リンク){{cite book}}: CS1メンテナンス: 場所の発行元が見つかりません (リンク)