教育評価または教育査定[ 1 ]は、知識、技能、態度、適性、信念に関する実証データを体系的に記録し、プログラムを改善し、学生の学習を向上させるプロセスです。[ 2 ]評価データは、学習成果の達成度を評価するために学生の作品を直接調査することによって取得することも、学習について推論できるデータに基づいて取得することもできます。[ 3 ]評価はテストとほぼ同義で使われることが多いですが、テストに限定されるものではありません。[ 4 ]評価は、個々の学習者、学習コミュニティ(クラス、ワークショップ、またはその他の組織化された学習者グループ)、コース、学術プログラム、機関、または教育システム全体(粒度とも呼ばれる)に焦点を当てることができます。「評価」という言葉は、第二次世界大戦後に教育の文脈で使用されるようになりました。[ 5 ]
評価は継続的なプロセスとして、測定可能な学生の学習成果を確立し、これらの成果を達成するための十分な学習機会を提供し、学生の学習が期待にどれだけ合致しているかを判断するために証拠を収集、分析、解釈する体系的な方法を実施し、収集した情報を使用して学生の学習の改善に関するフィードバックを提供します。[ 6 ]評価は教育プロセスの重要な側面であり、学生の達成レベルを決定します。 [ 7 ]
教育における評価実践の最終的な目的は、実践者や研究者の理論的枠組み、すなわち人間の心の性質、知識の起源、学習過程に関する彼らの前提や信念に依存する。
評価という用語は一般的に、教師が生徒の学習を支援し、生徒の進捗状況を把握するために用いるすべての活動を指します。[ 8 ] [ 9 ]評価は便宜上、以下の分類を用いて分けることができます。
評価は、評価方法のさまざまな目的に対応するために、初期評価、形成的評価、総括的評価の3つのカテゴリーに分けられることが多い。
(1)配置評価 – 配置評価は、以前の達成度や知識レベル、または個人の特性に基づいて、指導シーケンスの最も適切なポイント、独自の指導戦略、または適切な教師に配置するために使用されることがあります[ 10 ]。配置評価は、大学や高等教育機関が大学入学準備度を評価し、学生を最初のクラスに配置するために使用するテストである配置テストを通じて実施されます。配置評価は、事前評価、初期評価、または閾値知識テスト(TKT)とも呼ばれ、指導や介入の前に実施され、個々の学生の成長を測定できるベースラインを確立します。このタイプの評価は、学生の科目のスキルレベルを判断するために使用され、教師が教材をより効果的に説明するのにも役立ちます。これらの評価は一般的に採点されません。[ 11 ]
(2)形成的評価– これは一般的にコースやプロジェクト全体を通して実施されます。「教育的評価」とも呼ばれ、学習を支援するために使用されます。教育現場では、形成的評価は教師(または仲間)または学習者(自己評価[ 12 ] [ 13 ]など)によって実施され、学生の作業に対するフィードバックを提供し、必ずしも成績評価のために使用されるとは限りません。形成的評価は、診断テスト、標準化テスト、クイズ、口頭質問、または下書きの形式をとることができます。形成的評価は指導と同時に実施され、その結果は評価に反映される場合があります。形成的評価の目的は、総括的評価を実施する前に学生が指導内容を理解しているかどうかを判断することです。[ 11 ]
(3)総括的評価– これは通常、コースやプロジェクトの最後に実施されます。教育現場では、総括的評価は通常、学生にコースの成績を割り当てるために使用され、評価的な性質を持ちます。総括的評価は、学生が何を学んだかを要約し、主題をよく理解しているかどうかを判断するために使用されます。このタイプの評価は通常、採点され(例:合格/不合格、0~100)、テスト、試験、またはプロジェクトの形式をとることができます。総括的評価は基本的に、学生が授業に合格したか不合格だったかを判断するために使用されます。総括的評価に対する批判は、それが還元主義的であり、学習者は知識をどれだけ習得したかを、それが役立つには遅すぎるタイミングで知ることになるという点です。[ 11 ]
(4)診断評価 – 最後に、診断評価では学習プロセス中に発生したすべての困難に焦点を当てます。
ジェイ・マクタイグとケン・オコナーは、効果的な学習のための7つの実践を提案した。[ 11 ]そのうちの1つは、テストの前に評価基準を示すことであり、もう1つは、指示を与える前に生徒のスキルレベルを知るための事前評価の重要性である。多くのフィードバックと励ましを与えることも、もう1つの実践である。
教育研究者のロバート・ステーク[ 14 ]は、形成的評価と総括的評価の違いを次のような例えで説明しています。
料理人がスープを味見するのは形成的な段階であり、客がスープを味見するのは総括的な段階である。[ 15 ]
総括的評価と形成的評価は、学習の文脈ではそれぞれ学習の評価と学習のための評価と呼ばれることが多い。学習の評価は一般的に総括的であり、学習成果を測定し、それを生徒、保護者、管理者に報告することを目的としている。学習の評価は主に授業、コース、学期、または学年度の終わりに行われるが、学習のための評価は一般的に形成的であり、教師が個々の学習者とクラスに対する指導方法と次のステップを検討するために使用される。[ 16 ]
形成的評価の一般的な形態の一つに、診断的評価があります。診断的評価は、生徒の現在の知識とスキルを測定し、適切な学習プログラムを特定するものです。自己評価は、生徒自身が評価を行う診断的評価の一形態です。
将来を見据えた評価では、評価対象者に架空の将来の状況における自分自身について考えてもらうよう求める。[ 17 ]
パフォーマンス評価は、達成度に焦点を当てるという点で総括的評価と似ています。これは、基準に基づく教育改革や成果に基づく教育運動とよく結びついています。理想的には、従来の多肢選択式テストとは大きく異なりますが、最も一般的には基準に基づく評価と関連付けられています。基準に基づく評価では、標準の質問に対する自由形式の回答が、基準に基づく尺度で人間の採点者によって採点され、パフォーマンス基準を満たしているか、下回っているか、上回っているかで評価され、曲線で順位付けされることはありません。明確に定義されたタスクが特定され、生徒は、多くの場合、知識とスキルの現実世界での応用を伴う環境で、何かを創造、制作、または実行するように求められます。熟練度は、拡張された回答を提供することによって示されます。パフォーマンス形式は、さらに製品とパフォーマンスに分類されます。パフォーマンスは、絵画、ポートフォリオ、論文、展示会などの製品になる場合もあれば、スピーチ、運動技能、音楽リサイタル、朗読などのパフォーマンスで構成される場合もあります。
評価(総括的評価または形成的評価)は、多くの場合、客観的評価と主観的評価に分類されます。客観的評価は、正解が1つしかない質問形式です。主観的評価は、正解が複数ある(または正解の表現方法が複数ある)質問形式です。客観的質問と主観的質問には、さまざまな種類があります。客観的質問の種類には、正誤問題、多肢選択問題、複数回答問題、マッチング問題などがあり、主観的質問には、記述式問題やエッセイ問題などがあります。客観的評価は、ますます普及しているコンピュータ化されたオンライン評価形式に適しています。
客観的評価と主観的評価の区別は、実際には「客観的」評価など存在しないため、有用でも正確でもないと主張する人もいる。実際、すべての評価は、関連する主題や内容に関する決定に組み込まれた固有のバイアス、および文化的(階級、民族、性別)バイアスによって作成されている。[ 18 ]
テスト結果は、確立された基準、他の生徒の成績、または過去の成績と比較することができる。
(5)基準参照評価は、その名の通り、基準参照テストを用いて、受験者が定義された(客観的な)基準に基づいて評価される際に行われます。基準参照評価は、必ずしもそうとは限りませんが、多くの場合、人の能力(つまり、何かができるかどうか)を判断するために使用されます。基準参照評価の最もよく知られた例は運転免許試験で、教習生は「他の道路利用者を危険にさらさない」などの明確な基準に基づいて評価されます。
(6)基準参照評価(俗に「相対評価」と呼ばれる)は、通常、基準参照テストを使用し、定義された基準に基づいて測定されるものではありません。このタイプの評価は、受験する学生集団に相対的なものです。これは実質的に学生を比較する方法です。IQテストは、基準参照評価の最もよく知られた例です。多くの入学試験(名門校や大学への入学試験)は基準参照型であり、一定割合の学生が合格できます(この文脈での「合格」とは、明確な能力レベルではなく、学校や大学に受け入れられることを意味します)。これは、基準参照評価が(基準が変更されない限り)そうではないのに対し、基準集団の質に応じて基準が年ごとに変動する可能性があることを意味します。[ 19 ]
(7)自己評価とは、同じ領域内での時間の経過に伴う自己比較、または同じ生徒内の他の領域との比較のことである。
評価は、正式なものと非公式なものに分けられます。正式な評価は通常、テスト、クイズ、レポートなどの文書で行われます。正式な評価では、生徒のパフォーマンスに基づいて数値スコアまたは成績が付けられますが、非公式な評価は生徒の最終成績には影響しません。非公式な評価は通常、よりカジュアルな方法で行われ、観察、インベントリー、チェックリスト、評価尺度、ルーブリック、パフォーマンスおよびポートフォリオ評価、参加、ピア評価および自己評価、ディスカッションなどが含まれます。[ 20 ]
内部評価は学校(つまり教師)によって設定・採点され、生徒は評価結果とフィードバックを受け取ります。外部評価は運営機関によって設定され、公平な担当者によって採点されます。外部評価の中には、採点におけるフィードバックが非常に限定的なものもあります。しかし、オーストラリアのNAPLANのようなテストでは、生徒が取り組んだ基準について詳細なフィードバックが提供されるため、教師は生徒の学習成果を評価・比較し、今後の計画を立てることができます。
一般的に、質の高い評価とは、信頼性と妥当性が高いものです。その他の一般的な原則としては、実用性、真正性、ウォッシュバックなどがあります。[ 21 ] [ 22 ]
信頼性とは、評価の一貫性に関わるものです。信頼性の高い評価とは、同じ(または類似の)学生集団に対して常に同じ結果が得られる評価のことです。信頼性には、曖昧な質問、問題用紙の選択肢が多すぎる、採点指示が不明瞭、採点者の訓練不足など、さまざまな要因が影響します。従来、評価の信頼性は、以下の要素に基づいて評価されてきました。
測定値xの信頼性は、定量的に次のように定義することもできます。 どこは、観測された(テスト)スコア x の信頼性です。 そしてこれらはそれぞれ、「真の」(つまり、候補者の生来の能力)と測定されたテストスコアのばらつきである。0(全く信頼できない)から1(完全に信頼できる)までの範囲をとります。
信頼性には、生徒に関連するもの(個人的な問題、病気、疲労など)、評価者に関連するもの(偏見や主観性など)、テスト実施に関連するもの(テスト実施の条件など)、そしてテストに関連するもの(基本的にテストの性質に関連するもの)の4種類があります。[ 24 ] [ 21 ] [ 25 ]
妥当な評価とは、測定しようとしているものを正確に測定することです。例えば、筆記試験だけで運転技能を評価するのは妥当ではありません。運転技能をより妥当に評価するには、運転知識に関する筆記試験など、運転者が何を知っているかを判断するのに役立つ試験と、実際の運転技能評価など、運転者が何ができるかを判断するのに役立つ試験を組み合わせるのが適切です。教師は、一部の試験が、その試験の根拠となるカリキュラムを適切に評価していないとよく不満を述べますが、これは事実上、試験の妥当性を問うていることになります。
評価の妥当性は、一般的に以下のカテゴリーの証拠を検証することによって判断されます。
その他には、次のものがあります。[ 21 ] [ 24 ]
優れた評価は、特定の状況と目的に対して、妥当性と信頼性の両方を備え、上記で述べた他の品質特性も備えています。実際には、評価が完全に妥当であったり、完全に信頼できることはめったにありません。目盛りが間違っている定規は、常に同じ(間違った)測定値を示します。これは非常に信頼性が高いですが、妥当性は高くありません。時計や腕時計を見ずにランダムな人に時間を答えてもらうことは、妥当性はあるが信頼性が低い評価の例として挙げられることがあります。回答は個人によって異なりますが、平均的な回答は実際の時間に近いでしょう。医学研究、教育テスト、心理学など、多くの分野では、信頼性と妥当性の間にトレードオフが生じることがよくあります。高い妥当性を目指して作成された歴史のテストには、多くの記述式問題や穴埋め問題が含まれます。これは科目の習熟度を測る良い指標となりますが、完全に正確に採点することは困難です。高い信頼性を目指して設計された歴史のテストは、すべて多肢選択式です。これは歴史的知識を測定するのにそれほど適していませんが、非常に高い精度で採点できます。ここから一般化することができます。測定しようとしているものの推定値が信頼できるほど、実際にその達成度を測定しているという確信は薄れる。
「主題妥当性」と「予測妥当性」を区別することは重要である。前者は教育分野で広く用いられており、異なる問題を用いた同様のテストで生徒が獲得するであろう点数を予測する。後者は職場などで広く用いられており、パフォーマンスを予測する。したがって、運転規則に関する知識を測る主題妥当性テストは適切である一方、予測妥当性テストは、潜在的な運転者がそれらの規則を遵守できるかどうかを評価するものである。
この原則は、評価ツールの作成と実施における時間とコストの制約を指します。 [ 21 ]つまり、テストは経済的に提供できるものでなければなりません。テストの形式は理解しやすいものでなければなりません。さらに、テストの解答は適切な時間枠内に収まるものでなければなりません。一般的に実施は簡単です。評価手順は具体的で時間効率の良いものでなければなりません。[ 25 ]
評価ツールは、文脈に沿っていて、自然な言語と意味のある関連性のある興味深いトピックを含み、現実世界の経験を再現している場合に、真正であると言える。[ 21 ]
この原則は、教室での教育と学習に対する評価の結果に関するものです。[ 21 ]ウォッシュバックには、肯定的と否定的があります。肯定的ウォッシュバックとは、テストの望ましい効果を指し、否定的ウォッシュバックとは、テストの否定的な結果を指します。肯定的ウォッシュバックを実現するには、指導計画を使用できます。[ 27 ]
評価の分野、特に北米の教育評価の分野では、教育評価基準合同委員会が評価基準を3つ発表している。人事評価基準は1988年に発表され[ 28 ] 、プログラム評価基準(第2版)は1994年に発表され[ 29 ]、学生評価基準は2003年に発表された[ 30 ]。
各出版物では、さまざまな教育現場で使用できる一連の基準が提示され、詳細に解説されています。これらの基準は、特定された評価方法の設計、実施、評価、および改善のためのガイドラインを提供します。各基準は、適切で、有用で、実現可能で、正確な教育評価を促進するために、4つの基本的なカテゴリーのいずれかに分類されています。これらの基準セットでは、妥当性と信頼性に関する考慮事項は、正確性のトピックで扱われています。たとえば、学生の正確性に関する基準は、学生の評価が学生の学習と成績に関する健全で正確かつ信頼できる情報を提供することを保証するのに役立ちます。
英国では、成人教育、継続教育、職場ベースの教育および訓練のあらゆる場面で、教育評価における優れた実践を学び、発展させることを支援するために、トレーニング、評価、品質保証(TAQA)の資格が取得できます。[ 31 ]
成績インフレ(成績評価の甘さとも呼ばれる)とは、同じ質の作業に対して時間の経過とともに一般的に高い成績が与えられることであり、成績の価値を低下させる。 [ 32 ]しかし、平均成績が高いこと自体は成績インフレの証明にはならない。これが成績インフレであるためには、作業の質が高い成績に値しないことを証明する必要がある。[ 32 ]
成績インフレのため、標準化されたテストは、標準化されていない試験のスコアよりも妥当性が高い可能性がある。[ 33 ]最近の卒業率の上昇は、部分的に成績インフレに起因する可能性がある。[ 34 ]
以下の表は、教育におけるほぼすべての理論的・研究的活動、および指導実践(もちろん、その一つが評価の実践である)を支える主要な理論的枠組みをまとめたものである。これらの異なる枠組みは、学者たちの間で興味深い議論を巻き起こしてきた。
公立学校制度全体で評価方法をどのように最適に適用するかについての懸念は、主に高リスクの標準化テストの使用に集中しており、これらのテストは生徒の進歩、教師の質、学校、学区、または州全体の教育的成功を測るためによく用いられる。
ほとんどの研究者や実践者にとって、問題はテストを実施すべきかどうかではなく、テストは有用な方法で実施されれば、生徒の進捗状況やカリキュラムの実施状況に関する情報を提供し、学習者の形成的な目的にも役立つという点で意見が一致している。[ 35 ]したがって、本当の問題は、現在実施されているテスト方法が、教育者や生徒にこれらのサービスを提供できるかどうかである。
ブッシュ大統領は2002年1月8日に「落ちこぼれ防止法(NCLB)」に署名した。NCLB法は1965年の初等中等教育法(ESEA)を再承認するものであった。ジョンソン大統領は貧困撲滅戦争を支援するためにESEAに署名し、小中学校への資金提供を支援した。ジョンソン大統領の目標は、教育への平等なアクセスを強調し、高い基準と説明責任を確立することであった。NCLB法は、各州に基礎学力に関する評価を開発することを義務付けた。連邦政府の学校資金を受け取るには、各州は特定の学年のすべての生徒にこれらの評価を実施しなければならなかった。
米国では、ノー・チャイルド・レフト・ビハインド法により、全国的に標準化テストが義務付けられています。これらのテストは州のカリキュラムに準拠しており、教師、生徒、学区、州の責任がテスト結果に結び付けられています。NCLBの支持者は、教育の成功を測る具体的な方法を提供し、教師や学校に不合格点に対する責任を負わせ、階級や民族間の学力格差を解消すると主張しています。[ 36 ]
標準化テストの反対者はこれらの主張に異議を唱え、テスト結果に対する教育者の責任を問うことは「テストのための教育」につながると主張している。さらに、標準化テストに重点を置くことで、教師は生徒にテストの成績を高めるための狭い範囲のスキルを身につけさせ、実際には教科内容や知識領域内の重要な原則に対するより深い理解を育むことができないと主張する人も多い。[ 37 ]
米国で大きな論争を巻き起こしているこの評価方法は、高校卒業試験を利用して、4年間高校に通ったにもかかわらず、試験で必要な内容を習得したことを証明できない生徒に卒業証書を授与しないというものです。反対派は、4年間学校に通った生徒が、単に試験に繰り返し不合格になったり、必要な内容を知らなかったりするだけで、高校の卒業証書を授与されないのはおかしいと主張しています。[ 38 ] [ 39 ] [ 40 ]
高難易度のテストは、生徒や教師の病気やテスト不安の原因となり、教師がカリキュラムをテストされると思われる範囲に狭めてしまう原因となっていると非難されている。子供たちがテストに慣れるようにするための取り組みとして、ワシントン州スポケーンの新聞は、恐怖を糧とする怪物の絵を掲載した。[ 41 ]掲載された画像は、州の評価についてどう思うかを絵に描くように求められた生徒の反応だとされている。
ワシントン州立大学のドン・オーリッチなどの他の批評家は、生徒の年齢の標準的な認知レベルをはるかに超えたテスト項目の使用に疑問を呈している。[ 42 ]
ポートフォリオ評価と比較すると、単純な多肢選択式テストははるかに安価で、採点者間の意見の相違も少なく、学年末までに返却できるほど迅速に採点できます。標準化テスト(すべての生徒が同じ条件下で同じテストを受けるテスト)では、これらの理由から多肢選択式の問題がよく使用されます。Orlich は、非常に多くの生徒のシステムと個人の両方の質を測定するために、安価な多肢選択式の「マークシート式テスト」ではなく、高価で総合的に評価されるテストを使用することを批判しています。[ 42 ]高リスクテストの他の著名な批判者には、FairtestやAlfie Kohnなどがいます。
教育上の意思決定においてIQテストの使用が禁止されている州もあり、生徒を「最高」から「最低」まで順位付けする基準参照型テストは、少数派に対する偏見があるとして批判されている。ほとんどの教育関係者は、重要な意思決定を行う際には、基準参照型テスト(生徒の得点は、隣の生徒の成績が良かったか悪かったかに関わらず、質問に正しく答えたかどうかのみに基づいて決定される)を支持している。
ソーシャルメディアやWeb 2.0の技術とマインドセットの出現により、学習はますます協調的になり、知識は学習コミュニティの多くのメンバー間でますます分散されるようになっていることは広く指摘されている。しかし、従来の評価方法は主に個人に焦点を当てており、文脈における知識の構築と学習を考慮に入れていない。評価分野の研究者は、より参加型の文化の出現から生じる文化的変化を考慮するにつれて、学習者への評価の適用に関する新しい方法を見つける必要があるだろう。[ 43 ]
大規模学習評価(LSLA)は、特定の年に限られた数の領域にわたって学習者グループの学習達成度を概観するシステムレベルの評価です。これらはしばしば国内または国際比較の評価として分類され、教師の資格、学校環境の質、保護者の支援と指導、学校内外での社会的および感情的な健康など、学習レベルと学習の決定要因に関連する問題に注目します。[ 44 ]
サドベリー・モデルの民主的教育学校は、評価、査定、成績証明書、推薦状などを発行せず、提供もしません。彼らは、生徒を格付けすることはなく、学校は裁判官ではないと主張しています。生徒同士を比較したり、何らかの基準と比較したりすることは、生徒のプライバシーと自己決定権の侵害であると彼らは考えています。生徒は、自発的な学習者としての進歩をどのように測定するかを、自己評価のプロセスとして自ら決定します。これこそが真の生涯学習であり、21世紀にふさわしい教育評価であると彼らは主張しています。[ 45 ]
サドベリーの学校側によると、この方針は生徒たちが学校を出て社会生活を送る上で悪影響を与えるものではないという。しかし、学校側は、この方針によって社会生活への移行がより困難になることは認めているものの、こうした困難は生徒たちが自らの道を切り開き、自らの基準を設定し、自らの目標を達成していくための学びの一部であると述べている。
成績評価や評定を行わない方針は、学生間の競争や大人の承認を求める争いのない雰囲気を作り出し、学生の間で前向きで協力的な環境を促進するのに役立つ。[ 46 ]
サドベリー教育の最終段階は、学生が希望すれば卒業論文です。各学生は、成人として、そして社会に出る準備をどのようにしてきたかについて論文を書きます。この論文は審査のために議会に提出されます。論文プロセスの最終段階は、学生による口頭弁論であり、その間、学生は議会の全メンバーからの質問、異議、コメントを受け付けます。最後に、議会は秘密投票で卒業証書を授与するかどうかを決定します。[ 47 ]
教育評価の利用における大きな懸念事項は、英語学習者(ELL)を評価する際の評価の全体的な妥当性、正確性、公平性です。米国における評価の大部分は、英語圏の文化に基づいた規範基準を採用しており、ELL集団を適切に反映していません。したがって、多くの場合、ELL生徒の規範スコアを結論付けることは不正確かつ不適切です。研究によると、ほとんどの学校は、多様な文化的背景を持つ生徒に対応するために評価を適切に修正していません。このため、ELL生徒が特別支援教育に過剰に紹介され、特別支援教育プログラムにおけるELL生徒の割合が不均衡になっています。特別支援教育への不適切な配置を支援的で有益だと考える人もいるかもしれませんが、研究によると、不適切な配置を受けた生徒は実際には進歩が後退していることが示されています。
ELL生徒の母語で評価を実施するには翻訳者が必要となる場合が多いが、評価項目の翻訳にはいくつかの問題がある。1つの問題は、翻訳によって正解または期待される回答が示唆され、評価項目の難易度が変わってしまうことである。[ 48 ]さらに、評価項目の翻訳によって、項目の本来の意味が歪められることもある。[ 48 ]最後に、多くの翻訳者は、評価の場面でELL生徒と協力するための資格や適切な訓練を受けていない。これらの要因すべてが評価の妥当性と公平性を損ない、結果の信頼性を低下させる。非言語評価はELL生徒に対する差別が少ないが、それでも項目に文化的な偏りが見られるものもある。[ 48 ]
ELL生徒を特別支援教育の対象とする場合、評価チームは偏りのない結論を確実にするために、収集したすべての情報を統合して解釈する必要があります。[ 48 ]決定は、教師や保護者へのインタビュー、教室での観察など、多次元的なデータソースに基づいて行う必要があります。[ 48 ]決定は、生徒固有の文化的、言語的、経験的背景を考慮に入れるべきであり、評価結果のみに基づいて行うべきではありません。
評価は、才能教育プログラムの場合のように、従来から過小評価されてきたグループの生徒が特定のプログラムや機会へのアクセスに必要なテストから除外される場合、不平等と関連付けられる可能性があります。この不平等に対処する方法の1つは、教師や保護者の推薦に基づいて一部の生徒のみをテストするのではなく、すべての生徒をテストする(才能の有無をテストする)普遍的スクリーニングです。普遍的スクリーニングの結果、識別基準を一切変更することなく、従来から過小評価されてきたグループ(黒人、ヒスパニック、貧困層、女性、英語学習者など)が才能教育プログラムに選ばれる割合が大幅に増加します。[ 49 ]
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)試験に不合格になった受験生からよく聞かれる不満の一つは、学校で試験範囲の内容を教えてもらえなかったというものだ。この場合、問題は試験ではなく不十分な教育にある。試験のせいで失敗したとするのは、排ガス検査に不合格になったことをガソリンスタンドのせいにするようなもので、教育という「乗り物」の根本的な問題を無視している。
責任はスタンフォード 9 やカリフォルニア州の高校卒業試験のような「高リスクのテスト」にある。同委員会は、こうしたテストに頼ることは「これらのテストで最高のパフォーマンスを発揮するための学力ツールが提供されていない生徒を不当に罰する」と不満を漏らしている。
カリフォルニア州の裁判官が、同州の高校卒業試験を無効にしようとしている。なぜか?それは、試験が効果を発揮しているからだ。試験は生徒たちに、もっと学ぶ必要があることを示している。私たちはそれを有益な情報と呼ぶ。卒業要件としての試験の使用を阻止するために訴訟を起こしている原告たちにとっては、それは別の問題だ。不平等な扱いの証拠…卒業試験は、不合格になった生徒の多くが資格のある教師に恵まれなかったため、不公平だと判断された。確かにそうかもしれないが、必要な知識がない生徒に卒業証書を与えることは、彼らに無価値な紙切れを残すことになり、不公平さをさらに悪化させるだけだ。
{{cite web}}: CS1 maint: タイトルとしてアーカイブされたコピー (リンク)