

全米教育進歩評価(NAEP )は、米国の生徒がさまざまな科目で何を知っていて何ができるかを評価する、最大規模の継続的かつ全国的に代表性のある評価です。NAEPは、米国教育省の教育科学研究所(IES)内の国立教育統計センター(NCES)が管理する、議会の命令によるプロジェクトです。NAEPの最初の全国的な実施は1969年に行われました。[ 1 ]全米評価管理委員会(NAGB)は、NAEPの方針を設定し、枠組みとテスト仕様の開発を担当する独立した超党派の委員会です。米国教育長官によって任命される全米評価管理委員会のメンバーには、知事、州議会議員、地方および州の学校関係者、教育者、企業代表、および一般市民が含まれます。議会は1988年に26人のメンバーからなる管理委員会を設立しました。
NAEPの結果は、さまざまな科目における生徒の達成度に関するグループレベルのデータを提供するように設計されており、「国の成績表」として発表されます。[ 2 ]個々の生徒、教室、または学校に関する結果はありません。NAEPは、性別、社会経済的地位、人種/民族などのさまざまな人口統計グループの結果を示します。評価は、数学、読解、科学、および作文で最も頻繁に行われます。芸術、公民、経済、地理、技術および工学リテラシー(TEL)、米国史などの他の科目は定期的に評価されます。
NAEPは、様々な教科における生徒の学力評価に加え、生徒、教師、学校管理者へのアンケート調査も実施し、背景情報の提供に役立てています。参加者の人種や民族、学校への出席状況、学業に対する期待などに関する質問は、政策立案者、研究者、そして一般の人々が評価結果をより深く理解するのに役立ちます。
教師、校長、保護者、政策立案者、研究者は皆、NAEPの結果を利用して全国の生徒の進捗状況を評価し、米国の教育を改善する方法を開発しています。NAEPは1969年から生徒の成績に関するデータを提供しています。[ 3 ] [ 4 ]
NAEPは、米国の学校や生徒の地理的、人種的、民族的、社会経済的多様性を代表する評価を可能にするサンプリング手順を使用しています。障害のある生徒や英語学習者に関するデータも提供されています。NAEP評価は、障害のある生徒への配慮を除き、参加生徒に対して同じテスト冊子と手順を使用して実施されるため、NAEPの結果は、評価に参加する州や都市部の学区の比較に使用されます。[ 5 ] [ 6 ]
NAEPのウェブサイトは2つあります。NCES NAEPウェブサイトとThe Nation's Report Cardウェブサイトです。前者はNAEPプログラム全体を詳細に解説しているのに対し、後者は主に個々のデータ発表に焦点を当てています。
NAEPは1964年、カーネギー財団からの助成金を受けて教育進歩評価調査委員会(ESCAPE)を設立したことから始まった。最初の全国規模の評価は1969年に実施された。各州による自主的な評価は1990年に試験的に開始され、1996年にはNAEPの恒久的な要素として2年ごとに実施されるようになった。2002年には、一部の都市部学区が試験的に州レベルの評価に参加し、現在も試験的都市部学区評価(TUDA)として継続されている。
NAEPプログラムの成功には、研究者、州の教育関係者、請負業者、政策立案者、学生、教師など、多くの人々が関わってきました。[ 7 ]
NAEP評価には、主要NAEPと長期トレンドNAEPの2種類があります。この区分により、以下の2つの目的を達成することが可能になります。
NAEPの主な評価は、全国の小学4年生、中学2年生、高校3年生を対象に、さまざまな科目で実施されます。評価が最も頻繁に行われるのは、数学、読解、理科、作文です。その他、芸術、公民、経済、地理、技術・工学リテラシー(TEL)、米国史などの科目も定期的に評価されます。
これらの評価は、NAGBによって開発された教科領域の枠組みに従い、評価方法論の最新の進歩を利用しています。[ 8 ] 主要なNAEPでは、結果は全国レベルで報告され、場合によっては州レベルや地区レベルでも報告されます。

全米教育進歩評価(NAEP)は、生徒の学業成績および教育成績に関連する要因に関する統計情報を、全国レベルおよび特定の人口統計グループ(人種/民族、性別など)別に報告するものです。公立学校と私立学校の両方の生徒が対象となり、科目によっては4年生、8年生、12年生の成績が報告されます。
州ごとのNAEP(全米教育進歩評価)の結果は、小学4年生と中学2年生の一部の科目で公開されています。これにより、参加州は数学、読解、理科、作文における自州の学習進捗状況を時系列で把握することができます。そして、自州の生徒の知識や技能を、他の州や全国平均と比較することが可能になります。
各州で実施される評価は、全国で実施される評価と全く同じです。従来、州のNAEPは4年生と8年生のみで評価されていました。しかし、2009年のパイロットプログラム[ 10 ] により、11州(アーカンソー州、コネチカット州、フロリダ州、アイダホ州、イリノイ州、アイオワ州、マサチューセッツ州、ニューハンプシャー州、ニュージャージー州、サウスダコタ州、ウェストバージニア州)が12年生レベルでスコアを受け取ることが可能になりました。
1988年まで、NAEPは国全体の学力達成度と人口内の人口統計学的グループごとの学力達成度のみを報告していた。1988年、議会は自主的な州別試験評価を認可する法律を可決した。州NAEPへの参加に同意した各州または管轄区域から、生徒の代表サンプルが個別に選ばれた。州別試験評価は1990年、1992年、1994年に実施された。1996年の評価から、認可法は州レベルの評価を「試験」とはみなさなくなった。
2001年、初等中等教育法(通称「落ちこぼれゼロ法」)の再承認に伴い、州レベルのNAEPに大きな変更が加えられました。この法律により、タイトルIの資金援助を受けている州は、2年ごとに4年生と8年生を対象とした数学と読解力の州レベルNAEP評価に参加することが義務付けられました。州レベルNAEPで評価されるその他の科目(理科と作文)への参加は、引き続き任意となっています。
他のNAEP評価と同様に、州のNAEP評価では、評価対象となった生徒や学校の個別のスコアは提供されません。
試験的都市地区評価(TUDA)は、NAEPを用いて公立学校の生徒の学力レベルを地区レベルで報告することの実現可能性を判断するために開発されたプロジェクトです。議会の承認に基づき、NAEPは選定された都市地区の生徒サンプルに対し、数学、読解、科学、および作文の評価を実施しました。
TUDAは2002年に6つの都市地区で開始され、その後2017年の評価サイクルに向けて27地区に拡大した。
長期傾向評価であるNAEPは、9歳、13歳、17歳の生徒を対象に、全国規模で定期的に実施されます。この長期傾向評価では、生徒の数学と読解力の成績を測定し、現在の生徒の成績を1970年代初頭以降の生徒の成績と比較することができます。
長期トレンドとメインNAEPはどちらも数学と読解力を評価するが、両者にはいくつかの違いがある。特に、評価内容、評価の実施頻度、結果の報告方法が異なる。これらの違いなどから、長期トレンドとメインNAEPの結果を直接比較することはできない。[ 11 ]
NAEPは1970年代から実施されているが、2021年に米国教育省当局はCOVID-19パンデミックのため、数学と読解力の評価を延期することを決定した。延期の理由には、遠隔学習オプションの違いによる生徒サンプルの偏りや結果の偏りの可能性、および試験監督者と生徒の安全上の懸念などが含まれる。[ 12 ]
NAGBはNAEP評価の実施スケジュールを定めています。 1968年以降のすべてのNAEP評価、および2017年までに予定されている評価については、評価スケジュール全体を参照してください。
NAEPの主要な学力調査は、通常、毎年1月末から3月初めにかけての約6週間にわたって実施されます。長期的な傾向調査は、通常、4年ごとに10月から5月にかけて、年齢層別に実施されます。これらの調査はすべて、NAEPと契約している全国各地の調査員によって実施されます。
NAEPは各州との連携のもとで実施されます。NAEPプログラムは、各州に常勤のNSC(全米学校能力評価センター)を配置するための資金を提供しており、NSCはNAEP、州の教育機関、そして参加校との連絡役を務めます。
NSCはNAEPプログラムに多くの重要なサービスを提供しており、以下の責任を負っています。
NAEPの評価のほとんどは紙と鉛筆を用いた形式で実施されていますが、NAEPは変化する教育環境に対応するため、デジタルベースの評価への移行を進めています。NAEPは最新のテクノロジーを活用して生徒に評価を提供しており、テクノロジーの進化に伴い、DBA(デジタルベース評価)の実施方法も変化していくでしょう。目標は、今世紀末までにすべてのNAEP評価をペーパーレス化することです。2011年のライティング評価は、初めて完全にコンピュータベースで実施されました。
2009年には、従来の紙と鉛筆を用いた理科の評価の一環として、情報通信技術(ICT)を用いた試験が実施されました。コンピュータによる実施により、他の方法では評価できない科学的知識、プロセス、スキルを測定することが可能になりました。試験課題には、通常であれば長時間を要する現象の観察、非常に大規模な現象や肉眼では見えない現象のモデル化、広範な資料の調査などが含まれていました。
2011年に実施されたこの多段階テストに関する特別研究では、NAEP(全米教育進歩評価)における適応型テストの原理の活用について調査した。対象となった生徒には、能力レベルに合わせて調整されるオンライン数学評価テストが実施された。研究で使用された問題はすべて、既存のNAEP問題である。
TEL評価フレームワークでは、技術・工学リテラシーを、技術を使用、理解、評価する能力、およびソリューションを開発し目標を達成するために必要な技術原理と戦略を理解する能力と定義しています。評価の3つの領域は以下のとおりです。
全国の8年生(中学2年生)が2014年の冬にこの評価テストを受験した。テスト結果は2016年5月に発表された。
2011年、NAEPは、生徒のコンピュータを使った作文能力を測定するため、8年生と12年生の作文評価を紙と鉛筆からコンピュータベースの方式に移行しました。この評価では、最新のデジタル技術の多くの機能を活用し、課題は短いビデオや音声などのマルチメディア形式で提供されます。さらに、できるだけ多くの生徒が参加できるように、コンピュータベースの作文評価システムには、テキスト読み上げ、フォントサイズの調整、電子スペルチェックなどのユニバーサルデザイン機能が組み込まれています。2012年、NAEPは4年生を対象にコンピュータベースの評価を試験的に実施しました。
NAEPは、評価に加えて、関連する多数の特別調査を調整しており、それらの調査には、特別なデータ収集プロセス、NAEPの結果の二次分析、および技術的手順の評価が含まれることが多い。
学力格差は、ある生徒グループが別の生徒グループを平均スコアで統計的に有意な差(誤差範囲よりも大きい)で上回った場合に発生します。NAEPは、黒人と白人、ヒスパニックと白人の学力格差を強調する多数のレポートとデータ概要を発表しました。これらの格差のパターンと時間の経過に伴う変化を明らかにするために、数学および/または読解における各グループのNAEPスコアを使用しました。[ 13 ]学校構成と黒人と白人の学力格差 などの研究レポートには、データの解釈に関する注意書きと警告も含まれています。[ 14 ]
HSTSは、全米の高校で実施されているカリキュラムと、成績証明書の収集を通して高校生の履修パターンを調査することで、12年生のNAEP(全米教育進歩評価)の成績と高校での学業成績との関係を探究しています。近年の研究では、STEM教育と、それがNAEPの数学および科学の評価における生徒の成績にどのように関連しているかに重点が置かれています。
国際数学・理科教育動向調査(TIMSS)は、国際教育達成度評価協会(IEA)が実施する国際的な評価で、数学と理科における生徒の学習状況を測定するものです。NCESは、各州および一部の学区が自州の生徒の成績を国際的な基準と比較できるように、NAEP-TIMSS連携調査を開始しました。この連携調査は、2011年に8年生を対象に数学と理科で実施されました。NCESは、NAEPのデータを用いて、両科目における州および学区レベルのTIMSSスコアを「予測」します。
NIESは、米国におけるアメリカ先住民/アラスカ先住民の生徒の教育状況を明らかにするために設計された2部構成の研究です。研究の第1部は、4年生と8年生の数学と読解力に関する評価結果で構成されています。第2部では、アメリカ先住民/アラスカ先住民の生徒、教師、学校管理者に対して実施されたアンケート調査の結果が示されています。このアンケート調査は、生徒の学校内外における文化的経験に焦点を当てています。
1965 年初等中等教育法 (ESEA) の 2001 年の再承認により、各州は独自の評価方法を開発し、生徒の学力測定のための独自の習熟度基準を設定しています。各州は独自の評価プログラムを管理しており、独自の基準を開発しているため、州全体の生徒の評価方法には州間で大きなばらつきが生じています。このばらつきは、米国全体の生徒の学力レベルを理解する上で課題となっています。2003 年以降、NCES は NAEP の習熟度基準と各州の習熟度基準を比較する研究を支援してきました。州の評価は NAEP スコアによって定義された共通の尺度に当てはめられ、これにより、州の習熟度基準を NAEP だけでなく、州同士でも比較することができます。NCES は、2003 年、2005 年、2007 年、2009 年、そして最近では 2013 年に、数学と読解の州データを使用した「州の習熟度基準のマッピング」レポートを公表しています。[ 15 ]
NCESは長年にわたり、NAEPプログラムのさまざまな側面に関連する数多くの研究を実施してきました。近年実施された研究の一部を以下に示します。
NAEP が統計的仮説検定を多用していることから、結果の解釈に関して批判を受けている。例えば、全米学力調査報告書では、各学年 10 万人の理科のテスト結果に基づき、「2005 年の 3 学年すべてで男子が女子を上回った」と報告されている。[ 16 ]ハイドとリンはこの主張を批判し、平均差は 300 点中 4 点に過ぎず、効果量が小さく分布が大きく重なっていることを示唆していると主張した。彼らは、「NAEP や他の調査における成績の小さな差が広く報道され、微妙で根強い偏見が強化されている」と主張している。[ 17 ]
NAEPがどの解答を正解または不正解とするかの選択も批判されており、これは他の国でも起こっている問題である。[ 18 ]例えば、歴史の問題では、1954年のブラウン対教育委員会判決について尋ねており、人種差別撤廃を命じた1955年の判決ではなく、問題を特定した1954年の判決に明示的に言及していた。NAEPは生徒に「この1954年の判決が是正しようとした状況を説明する」ように求めた。人種差別撤廃に言及せずに人種隔離に言及した生徒を不正解とした。実際には、この問題は既存の状況についてのみ尋ねており、解決策については尋ねておらず、いずれにせよ1954年の判決は人種差別撤廃を命じていなかった。[ 19 ] [ 20 ]国は「全速力で」という言葉を聞くために1955年のブラウンII判決まで待たなければならなかった。別の歴史の問題では、米国が朝鮮戦争で中国や北朝鮮だけでなくロシアとも戦ったことを知っていた生徒を不正解とした。数学や作文に関する他の公開された問題も同様の批判を受けている。数学の解答では、負の平方根、ローンの利息、データの範囲を超えてグラフを外挿する際の誤りを理解している生徒にペナルティが課せられてきた。 [ 21 ] [ 22 ]
NAEPが批判的思考を測定するという主張も批判されている。UCLAの研究者たちは、生徒が批判的思考をしなくても正しい答えを選択できることを発見した。[ 23 ]
NAEPは、統計的手法で各テストを採点し、「基礎」と「習熟」の基準のカットオフを設定し、各レベルの生徒がテストで達成した内容の例を示します。テストと基準の設計プロセスは、ウェスタンミシガン大学(1991年)、全米教育アカデミー(1993年)、政府会計検査院(1993年)、全米科学アカデミー(1999年)[ 24 ] [ 25 ] 、アメリカン・インスティテュート・フォー・リサーチとRTIインターナショナル(2007年)[ 26 ] 、ブルッキングス研究所(2007年[ 27 ]と2016年[ 26 ])、Buros Center for Testing(2009年)[ 24 ] 、および全米科学・工学・医学アカデミー(2016年) [ 26 ]によって批判されています。
NAEPの結果の解釈は困難でした。NAEPの4年生に実施される読解テストの「熟達」というカテゴリーは、テストで良い成績を収め、7年生レベルに達している生徒を反映しています。[ 26 ] NAEPの8年生に実施される数学テストの「熟達」というカテゴリーは、テストで良い成績を収め、12年生レベルに達している生徒を反映しています。[ 27 ]この基準で熟達し、12年生レベルに達する8年生が少ないという事実は、8年生レベルに達する8年生さえ少ないと主張するために誤って解釈されてきました。[ 28 ] NAEPは、「この用語の一般的な用法を考慮すると、ある科目に習熟している可能性のある生徒でも、NAEP達成レベルのパフォーマンス要件を満たさない可能性がある」と述べている。 [ 26 ]『A Nation at Risk 』の主著者であるジェームズ・ハーベイは、「この言葉は政策立案者と一般市民を混乱させるために意図的に選ばれたと結論づけざるを得ない」と述べている。[ 26 ]
{{cite news}}: CS1 maint: 複数の名前: 著者リスト (リンク)