
標準化テストとは、一貫した、または標準的な方法で実施および採点されるテストのことです。標準化テストは、質問と解釈が一貫しており、あらかじめ定められた標準的な方法で実施および採点されるように設計されています。[ 1 ]
標準化テストは、すべての受験者に対して統一された方法で実施され、採点されます。すべての受験者に同じテストが同じ方法で実施され、全員に対して同じ方法で採点されるテストはすべて、標準化テストです。標準化テストは、高リスクのテスト、時間制限のあるテスト、多肢選択式テスト、学力テスト、または多数の受験者を対象としたテストである必要はありません。標準化テストは、筆記、口頭、実技など、さまざまな形式をとることができます。標準化テストでは、運転、創造性、運動能力、性格、職業倫理、学力など、多くの項目を評価することができます。
標準化テストの反対は非標準化テストであり、これは受験者ごとに大きく異なるテストを実施したり、同じテストを大きく異なる条件下で実施したり、異なる方法で評価したりするものである。
学校で生徒が受ける日常的な小テストや試験のほとんどは、標準化テストの定義に当てはまります。クラスの全員が同じ時間に同じ状況下で同じテストを受け、すべてのテストは教師によって同じ方法で採点されます。しかし、標準化テストという用語は、特定の職業に就くための免許取得を希望するすべての成人や、特定の年齢のすべての生徒が受けるテストなど、より大規模なグループに対して実施されるテストを指す場合によく使われます。ほとんどの標準化テストは、総括的評価(学習単元の最後に参加者の学習状況を測定する評価)です。
全員が同じテストを受け、同じ採点システムが適用されるため、標準化テストは非標準化テストよりも公平であると認識されることが多い。このようなテストは、一部の受験者が簡単なテストを受け、他の受験者がより難しいテストを受けるシステムよりも客観的であると考えられることが多い。標準化テストは、全員が同じテストを受け、同じ方法で採点されるため、すべての受験者間で結果を確実に比較できるように設計されている。[ 2 ]

標準化テストの定義は、時間の経過とともに多少変化してきました。[ 3 ] 1960年、標準化テストは、テストの実施時期、場所、実施者、採点者に関係なく、テストを受けるすべての人に対して条件と内容が等しいものと定義されました。標準化テストは、一貫した統一された採点方法を採用しています。[ 4 ]これは、テストの問題に同じように答えたすべての受験者が、その問題に対して同じ点数を得ることを意味します。この標準化の目的は、点数が測定対象の能力やスキルを確実に示し、他の変数を示さないことを保証することです。[ 3 ]
21 世紀初頭までに、条件の厳密な同一性から、試験条件の公平性の平等へと焦点が移りました。 [ 5 ]例えば、手首を骨折した受験者は、怪我のために書くのが遅くなる可能性があり、時間制限のある試験で、その人に解答を書く時間を数分多く与える方が、より公平で、受験者の実際の知識をより確実に理解できるでしょう。永続的または一時的な障害に関して公平性を向上させる方法で試験条件を変更するが、評価の要点を損なわないことを、調整と呼びます。しかし、調整が試験の目的を損なう場合、その配慮は内容の変更となり、標準化された試験ではなくなります。
標準化されたテストの最も古い証拠は、漢王朝時代の中国に見られ、[ 6 ]科挙では音楽、弓術、乗馬、算術、書道、公私両方の儀式や祭礼に関する知識を含む六芸が問われた。これらの試験は国家官僚機構の職員を選抜するために用いられた。
その後、軍事戦略、民法、歳入・税制、農業、地理に関する分野が試験に追加されました。この形式で、試験は千年以上にわたって制度化されました。
今日でも、標準化されたテストは広く利用されており、最も有名なのは大学入試制度である。
標準化テストは、19世紀初頭に中国の官吏試験をモデルとしてヨーロッパに導入されました[ 7 ] 。これは、イギリスの植民地行政官の提唱によるもので、その中でも最も「粘り強い」提唱者は、中国の広州駐在イギリス領事トーマス・テイラー・メドウズでした[ 7 ]。メドウズは、標準化テストが帝国全体で直ちに実施されなければ、大英帝国が崩壊すると警告しました[ 7 ] 。
標準化テストが採用される以前は、西洋の教育法には伝統的に標準化テストは含まれていませんでした。古代ギリシャから受け継がれた懐疑的で自由な議論の伝統に基づき、西洋の学界は学生が書いたエッセイを用いた非標準化評価を好んでいました。そのため、ヨーロッパで初めて標準化テストが実施されたのは、ヨーロッパ本土ではなく、イギリス領インドでした。[ 8 ] 19世紀初頭、中国での標準化テストの使用に触発され、イギリスの企業経営者は採用や昇進の際に標準化テストを使用し、プロセスを公平に保ち、腐敗やえこひいきを排除しました。[ 8 ]この標準化テストの慣行は、後に19世紀後半にイギリス本土で採用されました。その後の議会での議論では、「中国の官僚制度」に何度も言及されました。[ 7 ]
標準化テストはイギリスからイギリス連邦全体だけでなく、ヨーロッパ、そしてアメリカへと広まった。[ 7 ]その普及は産業革命によって促進された。義務教育法の結果として学校に通う生徒数が増加したことで、大量生産や客観的な評価が難しい自由記述式の評価の使用が減少した。

第二次世界大戦中、イギリス陸軍では将校訓練やその他の任務に就く候補者を選抜するために、陸軍省選抜委員会などの標準化されたテストが開発されました。 [ 9 ]これらのテストでは、兵士の精神的能力、機械的技能、他者と協力する能力、その他の資質が評価されました。以前の方法は偏りがあり、将校訓練に不適切な兵士を選抜してしまうという問題がありました。[ 9 ]
標準化テストは19世紀からアメリカの教育の一部であったが、アメリカの学校における標準化テストへの広範な依存は、主に20世紀の現象である。
19世紀半ばの移民は、アメリカ合衆国における標準化テストの普及に貢献した。[ 10 ]標準化テストは、人々が初めてアメリカに入国した際に、社会的役割をテストし、社会的権力と地位を見つけるために使用された。[ 11 ]
大学入学試験委員会は、1901年に大学入学のための標準化された試験の提供を開始し、9つの科目を網羅しました。この試験は、米国北東部のエリート大学への入学を標準化するという考えに基づいて実施されました。当初、この試験は、学校間のカリキュラムを統一するために、一流の寄宿学校にも適用されることを意図していました。 [ 12 ]当初、標準化された試験はエッセイで構成されており、広く実施されることを意図したものではありませんでした。[ 12 ]
第一次世界大戦中、陸軍のアルファテストとベータテストは、新兵の知能レベルを評価して適切な任務に配置するために開発されました。[ 13 ] 現代の標準化されたIQテストであるスタンフォード・ビネー知能テストの最初の版は1916年に登場しました。その後、カレッジボードは1926年にSAT(Scholar Aptitude Test)を設計しました。最初のSATテストは陸軍のIQテストに基づいており、受験者の知能、問題解決能力、批判的思考を判断することを目的としていました。[ 14 ] 1959年、エベレット・リンドクイストはACT(American College Testing)を初めて提供しました。 [ 15 ] 2020年現在、ACTは英語、数学、読解、科学をテストする多肢選択式の4つの主要セクションと、オプションのライティングセクションで構成されています。[ 16 ]
1970年代には、各州が公立学校制度を通じて多数の子供やティーンエイジャーを対象にテストを開始しました。1980年代には、アメリカの学校は全国規模で評価を行うようになりました。[ 17 ] 2012年には、45州が大規模な年間学力テストに生徒一人当たり平均27ドル、総額6億6900万ドルを支払いました。[ 18 ]しかし、生徒をテストに備えさせるための教師への報酬やテスト実施に費やす授業時間など、間接的なコストはテスト自体の直接的なコストを大幅に上回ります。[ 18 ]
連邦政府が高度に分散化された(地方管理の)公教育システム全体で意味のある比較を行う必要性から、大規模な標準テストの使用が促進された。1965年の初等中等教育法は、公立学校での標準テストを義務付けた。 2001年のノー・チャイルド・レフト・ビハインド法は、公立学校への資金提供の一部を標準テストの結果にさらに結びつけた。これらの連邦法の下では、学校のカリキュラムは依然として各州によって設定されていたが、連邦政府は、学校と教師が州が選択した教材を標準テストでどれだけうまく教えているかを州に評価することを義務付けた。[ 19 ]大規模な標準テストの結果は、学校への資金やその他のリソースの配分、および成績の悪い学校の閉鎖に使用された。2015年末に、全生徒成功法(Every Student Succeeds Act)がNCLBに取って代わりました。 [ 20 ]その時点で、これらの大規模な標準テストは、すべての生徒が同じテストを受け、同じ方法で採点されるからという理由ではなく、学校制度や教師にとって非常に重要なテストになったため、米国で物議を醸すようになっていました。 [ 21 ]
近年、多くの米国の大学やカレッジは、出願者に対する標準テストのスコアの要件を廃止した。[ 22 ]
オーストラリア全国学力評価プログラム(NAPLAN)は、オーストラリアカリキュラム・評価・報告機関によって2008年に開始された標準化テストである。同機関は「すべてのオーストラリアの生徒の21世紀の学習を支援する国家カリキュラム、国家評価プログラム、国家データ収集・報告プログラムの開発を担当する独立機関」である。[ 23 ]
このテストは、オーストラリアの学校に通う小学3年生、5年生、中学1年生、中学3年生の全生徒を対象に、全国統一テストを用いて評価を行うものです。テストで出題される科目は、読解、作文、言語規則(綴り、文法、句読点)、算数です。
このプログラムでは、保護者がお子様の学校生活における進捗状況を把握できるよう、生徒レベルのレポートを提供します。また、教師が生徒一人ひとりの学習機会を向上させるための支援も行います。生徒および学校レベルのデータは、必要な学校に特定の支援やリソースを重点的に提供するために、該当する教育機関にも提供されます。教師と学校は、この情報を他の情報と併せて活用し、生徒の学習状況を把握し、支援が必要な分野を特定します。
生徒の学力テストという概念自体は新しいものではないが、現在のオーストラリアのアプローチは、米国と英国の現在の教育政策構造にその起源を持つと言えるだろう。オーストラリアのNAPLANと英国および米国の戦略には、いくつかの重要な違いがある。オーストラリア国内で成績不振と判断された学校は、現在の連邦政府の方針に基づき、財政支援を受けることになる。
1968年、高等教育を規制するためにコロンビア教育評価研究所(ICFES)が設立された。それまで実施されていた、教育機関および大学プログラムの運営認可と法的承認のための公的評価システムが導入された。
コロンビアには、国内の教育水準を評価するための標準化されたテストがいくつかあります。これらのテストはICFESによって実施されます。
小学3年生、5年生、中学3年生は「Saber 3°5°9°」という試験を受けます。この試験は現在、管理されたサンプルと全数調査のサンプルにおいて、コンピュータ上で実施されています。
高校卒業時に、生徒は「セイバー11」という試験を受け、それに基づいて国内の様々な大学に入学することができます。自宅学習をしている生徒も、この試験を受けて高校を卒業し、学位証明書と卒業証書を取得できます。
大学を卒業する学生は、「セイバープロ」試験を受けなければならない。
カナダでは、教育、ひいては標準テストは各州の管轄下に置かれている。各州は独自の州全体の標準テスト制度を設けており、サスカチュワン州では生徒に標準テストが義務付けられていないのに対し、ニューファンドランド・ラブラドール州では高校の最終成績の40%を占める試験となっている。[ 24 ]
一般的に、主要な学力テストは、人間が採点するセクションとコンピューターが採点するセクションの両方を含んでいる。
標準化テストは、多肢選択問題、正誤問題、記述式問題、実体評価、またはほぼあらゆる形式の評価で構成できます。多肢選択問題と正誤問題は、コンピュータで読み取れる専用の解答用紙を使用したり、コンピュータ適応型テストを利用したりすることで、安価かつ迅速に、そして確実に実施・採点できるため、数千人が受験するテストでよく選ばれます。一部の標準化テストには、短答式問題や記述式問題が含まれており、独立した評価者がルーブリック(ルールまたはガイドライン)とベンチマークペーパー(各スコアに対応する解答例)を使用して、解答に与えるべき成績を決定します。

すべての標準化テストが質問に答える形式であるとは限りません。運動能力の本格的な評価としては、一定時間走ったり、一定の距離をドリブルしたりすることが挙げられます。医療従事者は、医療処置を行うことができることを証明するテストに合格する必要があります。運転免許証の申請者は、自動車を運転できることを示す標準化テストに合格する必要があります。カナダ標準化体力テストは、受験者の身体的な適性を判断するために医学研究で使用されています。 [ 25 ] [ 26 ]
20世紀後半以降、大規模な標準化テストは、コンピュータによる多肢選択式テストの採点が容易かつ低コストになったことによって、その様相を大きく左右されてきた。現在、国内外のほとんどの評価は、人間による完全な評価は行われていない。
人間は、コンピュータでは簡単に採点できない項目(エッセイなど)を採点することに慣れています。例えば、大学院入学共通試験(GRE)はコンピュータ適応型評価であり、ライティング部分を除いて人間による採点は必要ありません。[ 27 ]
人間の採点は比較的高価で、しばしばばらつきが生じるため、可能な限りコンピュータによる採点が好まれます。たとえば、一部の批評家は、低賃金の従業員はテストの採点が下手になると言っています。[ 28 ]採点者間の一致率は、テストや採点セッションによって60~85パーセントまで変動します。学校での大規模なテストでは、テスト実施者の中には、各答案を2人以上の採点者に読んでもらうために費用を支払う人もいます。採点結果が一致しない場合は、答案は別の採点者に渡されます。[ 28 ]
多肢選択式テストを電子的に採点するよりも難しいプロセスではあるが、エッセイもコンピュータで採点することができる。その他の場合、エッセイやその他の自由記述式の回答は、訓練を受けた採点者によって、あらかじめ定められた評価基準に従って採点される。例えば、ピアソンでは、エッセイの採点者は全員4年制大学の学位を取得しており、その大多数は現役または元教師である。[ 29 ]
ルーブリックを用いる目的は、受験者の成績評価における公平性を高めることです。標準化されたテストでは、測定誤差(テストの採点における一貫した誤差や偏りのパターン)は容易に特定できます。しかし、採点者の個人的な好みによってスコアが左右される場合、受験者の成績は誰が採点するかによって決まります。
標準化されたテストは、評価における採点者の偏見も排除します。研究によると、教師はテスト受験者の評価において一種の自己成就予言を作り出し、成功すると予想される生徒には高い点数を与え、失敗すると予想される生徒には低い点数を与えます。[ 30 ]標準化されていない評価では、採点者はより多くの裁量権を持つため、無意識の偏見によって不公平な結果を生み出す可能性が高くなります。
テストスコアの解釈には、基準参照スコアの解釈と基準参照スコアの解釈の2種類があります。 [ 4 ]
これらのシステムはいずれも標準化テストに使用できます。標準化テストにおいて重要なのは、すべての生徒がほぼ平等な状況下で同等の問題を問われ、同じ基準に基づいて採点されるかどうかです。

規範評価では、各受験者を他の受験者と比較します。規範参照テスト(NRT)は、あらかじめ定義された集団における被験者の位置を推定するタイプのテスト、評価、または査定です。この推定値は、集団から抽出されたサンプルからのテストスコアやその他の関連データの分析から導き出されます。このタイプのテストでは、受験者がこのテストを受けた他の人よりも成績が良かったか悪かったかが分かります。IQテストは、規範参照型の標準化テストです。
他者との比較が可能なため、基準参照型の標準化テストは、高等教育機関の入学選考において有用です。高等教育機関では、全国または世界中の学生を比較しようとします。標準化によってすべての学生が平等にテストされることが保証され、基準参照によって成績の良し悪しが明らかになります。このような国際的なベンチマークテストの例としては、国際数学・理科教育動向調査(TIMSS)や国際読解力調査(PIRLS)などがあります。

基準参照テスト(CRT)とは、テストの得点を用いて、受験者が与えられた課題をどれだけうまくこなせたかを示すテスト形式であり、他の受験者との比較で評価するものではありません。学校の教師が作成するテストやクイズのほとんどは、基準参照テストです。この場合、目的は単に受験者が質問に正しく答えられるかどうかを確認することです。テスト作成者は通常、各受験者の結果を他の受験者と比較しようとはしません。
妥当性と信頼性に関する考慮事項は、一般的に、あらゆる標準化テストの質を判断する上で不可欠な要素とみなされています。しかし、専門家団体や実務家団体は、基準を策定したり、特定の状況下における標準化テスト全体の質について総合的な判断を下したりする際に、これらの懸念事項をより広い文脈の中に位置づけることがよくあります。
心理測定学の分野では、教育および心理検査の基準[ 32 ]が妥当性と信頼性、測定誤差、および障害のある個人への配慮に関連する問題について基準を設けています。3番目で最後の主要なトピックは、テストの適用、資格認定、プログラム評価および公共政策におけるテストに関連する基準を扱っています。
評価の分野、特に教育評価の分野では、教育評価基準合同委員会[ 33 ]が評価基準を3つ発表している。人事評価基準[ 34 ]は1988年に、プログラム評価基準(第2版)[ 35 ]は1994年に、学生評価基準[ 36 ]は2003年に発表された。
各出版物には、さまざまな教育現場で使用できる一連の基準が示されています。これらの基準は、特定された評価形式の設計、実施、評価、および改善のためのガイドラインを提供します。各基準は、適切で、有用で、実現可能で、正確な教育評価を促進するために、4 つの基本的なカテゴリのいずれかに分類されています。これらの基準セットでは、妥当性と信頼性に関する考慮事項は、正確性のトピックで扱われています。テストは、学習とパフォーマンスに関する健全で正確かつ信頼できる情報を提供することを目的としていますが、ほとんどの学力テスト(標準化されているか否かを問わず)は、達成度に関する狭い情報しか提供しません。学力に焦点を当てた狭い視点に頼ると、達成度は個人の成功の可能性を十分に表すことができません(たとえば、対人スキルやソフトスキルをテストしないなど)。[ 37 ]

大規模な標準化テストの主な利点の 1 つは、結果を経験的に文書化できることです。したがって、テストのスコアは、一般化可能で再現可能な結果だけでなく、相対的な妥当性と信頼性があることが示されます。 [ 38 ]これは、個々の教師によって割り当てられる学校の成績証明書の成績とは対照的です。個別に割り当てられた成績を見ると、学校間の教育文化の違い、特定の教師の課題の難易度、指導スタイルの違い、成績インフレの圧力、および成績評価に影響を与えるその他の手法やバイアスを考慮することが難しい場合があります。
もう一つの利点は集計です。適切に設計された標準化テストは、個人の知識や技能の習熟度を評価するものであり、ある程度の集計を行うことで有用な情報が得られます。つまり、個々の評価は実用上十分な精度ではないかもしれませんが、クラス、学校、企業の支店、その他のグループの平均スコアは、サンプルサイズを増やすことで誤差が減少するため、有用な情報を提供できる可能性があります。
ほとんどのテストは複数のカテゴリーに分類できます。たとえば、テストは標準化されていると同時に重要なテストであったり、標準化されていると同時に多肢選択式テストであったりします。「標準化テスト」(受験者全員がほぼ同じ条件下で同じテストを受け、同じ方法で採点される)に対する批判は、標準化とは無関係な懸念に集中していることが多く、標準化されていないテストにも同様に当てはまります。たとえば、批判者は「標準化テストはすべて時間制限のあるテストだ」と不満を述べるかもしれません(これは、学校が実施する多くの年次標準化テストには当てはまりますが、すべてではありません)。しかし、批判の焦点は時間制限であり、全員が同じテストを受け、解答が同じ方法で採点されることではありません。
高リスクテストとは、良い成績を収めた場合に望ましい報酬が得られるテストのことです。[ 4 ]世界中の大学入学試験 で使用される多くのテストを含む一部の標準化テストは、高リスクテストです。通常の教室での小テストなど、ほとんどの標準化テストは低リスクテストです。[ 4 ]
意思決定において高リスクの標準化テストに過度に依存することは、しばしば議論の的となる。高リスクテストに関する一般的な懸念は、単一のイベント(例えば、単一のオーディションでのパフォーマンス)でのパフォーマンスを測定することであり、批評家はより包括的な評価が適切であると考えている。批評家は、教室での成績や教師による短い個別評価(散文で記述)など、累積的または数値化されない指標を重視することをしばしば提案する。支持者は、テストの点数は明確で客観的な基準を提供し、成績インフレに対する貴重なチェックとして機能すると主張する。[ 39 ]

基準参照テストとは、受験者によって順位が異なったり、順位が下がったりするように設計・採点されたテストのことです。[ 4 ]この順位付けは相対的な順位に関する情報を提供し、誰が最も優秀かを判断する場合(例えば、一流大学の入学選考など)に役立ちます。[ 4 ]
基準参照テストは、受験者が必要な教材を習得したかどうかを知ることが目的の場合に、より一般的で実用的です。[ 4 ]例えば、縦列駐車 ができるかどうかを知ることが目的の場合、標準化された運転テストでは、受験者に車を駐車させ、正しく安全に駐車できたかどうかに基づいてパフォーマンスを測定します。
しかし、一部の批評家は、生徒に同じテストを合理的に類似した条件下で実施し、回答を同じように採点することに反対するのではなく、学校で通常テストされる教材の種類に反対しているため、標準化テストに反対している。運転免許試験の例を挙げると、批評家は、運転免許取得者が縦列駐車ができるかどうかを知る必要はないと言うかもしれない。教育現場では、批評家は非学術的スキルやソフトスキルをテストすることを望むかもしれない。トーランス創造的思考テストのような非学術的属性の標準化テストは存在するが、学校では「主体性、創造性、想像力…好奇心…善意、倫理的考察、その他多くの価値ある気質や属性」を測定するための標準化テストを実施することはほとんどない。[ 40 ] [ 41 ]その代わりに、学校で実施されるテストは、道徳や人格形成よりも、読解力や算数 などの個人を特定できる学術的スキルに重点を置いている傾向がある。

テストを受けるときに不安になる人もいます。学生の10~40%がテスト不安を経験します。 [ 42 ]テスト不安は、標準化されたテストと標準化されていないテストの両方に当てはまります。
試験不安は、他者から評価されていると感じるあらゆる状況で発生する可能性があり、特に好意的な評価を得られる可能性が低いと考える場合に顕著です。[ 43 ] この現象は、重要度の低い試験よりも重要度の高い試験でより多く見られます。重要度の高い試験(標準化されているか否かを問わず)は、試験不安を引き起こす可能性があります。貧困の中で暮らす子どもは、裕福な家庭の子どもよりも試験不安の影響を受けやすい傾向があります。[ 44 ]
一部の生徒は、自分は「テストが苦手」だと言います。つまり、テスト中に緊張して集中力が散漫になってしまうということです。例えば、標準的な運転免許試験では、受験生は試験への緊張からミスをしてしまうことがあります。そのため、試験自体は標準化されており公平な結果が得られるはずなのに、受験生は緊張の少ない受験生に比べて不利な立場にあると主張します。

多肢選択式テストでは、受験者はあらかじめ決められた選択肢の中から正解を選び、それに対応する問題に回答します。これは、選択肢が限定されたタイプの問題です。受験者は選択肢の中から正解を選びます。
標準化テストに対する多くの批判者は、多肢選択式テストに反対している。この形式は、費用を抑えた大規模なテストによく用いられるが、受験者が段落を書けるかどうかを測るなど、一部の目的には適していない。しかし、標準化テストは、すべての受験者が合理的に類似した条件下で同じテストを受け、同じ方法で評価される限り、自由記述式問題を含むあらゆるテスト形式を用いることができる。
テスト対策指導とは、テストで測定される内容のみに焦点を当てるように、意図的に指導範囲を狭めるプロセスです。たとえば、教師が次の歴史のテストに音楽史や美術史に関する質問が含まれていないことを知っている場合、教師は教科書の音楽と美術に関する内容を飛ばすことで「テスト対策指導」を行うことができます。批評家はまた、標準化テストは創造性やテストに含まれない科目の詳細な学習を犠牲にして「テスト対策指導」を助長すると非難しています。批評家は、テスト対策指導は高次の学習を阻害し、教師が教えることを許される内容を変え、生徒が長年にわたって学ぶ他の情報の量を大幅に制限すると述べています。[ 45 ]標準化テストの内容によってカリキュラムや指導が決定されないようにテストを使用することは可能ですが、多くの場合、テストされない内容は教えられず、科目のテスト方法がその科目の教え方のモデルになることがよくあります。
教育省が地域の生徒向けに作成したテストなど、外部から課せられたテストは、教師にカリキュラムの形式を狭め、テストに合わせた指導をするよう促します。 [ 46 ]
成果主義に基づく給与とは、生徒がテストで良い成績を収めれば教師の給与は増え、成績が悪ければ減るという考え方である。[ 45 ] 教師や学校がテストでの成績向上によって報われると、教師は豊かで幅広いカリキュラムを提供する代わりに「テスト対策」をするように促される。2007年にオー・ウェインが行った定性調査では、標準化テストがカリキュラムを狭め、生徒中心の学習ではなく教師中心の指導を促すことが示された。[ 47 ]ニュージャージー州知事クリス・クリスティは、教師に「テスト対策」をさせるだけでなく、給与や雇用の安定性を犠牲にして生徒に良い成績を取らせるよう圧力をかけるニュージャージー州の教育改革を提案した。この改革では、生徒の標準化テストでの成績と教育的成果に応じて報酬が決まる成果主義に基づく給与が求められた。[ 48 ]
批評家たちは、これらのテストの過剰使用や誤用はカリキュラムを狭めることで教育と学習に悪影響を及ぼすと主張している。FairTestという団体によると、標準テストが説明責任の主要な要素となると、学校はテストを使ってカリキュラムを狭く定義し、指導に集中してしまう。説明責任は大きなプレッシャーを生み出し、これが標準テストの誤用や誤った解釈につながる可能性がある。[ 49 ]
{{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク)95.)受験者1
96.)受験者2