ライティング評価とは、ライティング課題を通して書き手のパフォーマンスや潜在能力を評価するための理論と実践を含む研究分野を指します。ライティング評価は、作文研究の学術研究と教育評価における測定理論の組み合わせと考えることができます。[ 1 ]ライティング評価は、学生のライティングと学習を評価するために使用される技術と実践を指す場合もあります。[ 2 ]ライティング評価の重要な結果の一つは、評価の種類と方法がライティング指導に影響を与え、その指導の性質と質に影響を与える可能性があるということです。[ 3 ]
作文評価は20世紀最初の20年間、教室での実践として始まったが、この時期には高リスクの標準化テストも登場した。 [ 4 ] 1930年代には、カレッジボードは直接作文評価から間接評価に移行した。これは、間接評価の方が費用対効果が高く、信頼性が高いと考えられたためである。[ 4 ] 1950年代以降、多様な背景を持つ学生が大学に通うようになったため、管理者は標準化テストを利用して、これらの学生をどこに配置すべきか、何を教えるべきか、どのように教えるべきか、そして必要なことを学んだかどうかをどのように測定すべきかを決定するようになった。[ 5 ]この時期に発展した大規模な州全体の作文評価は、直接作文評価と多肢選択式問題を組み合わせたもので、この方法は今日でもSATやGREなどの米国の大規模テストプログラム全体で主流となっている。[ 4 ]これらの評価は通常、教室外の州レベルおよび全国レベルで行われる。しかし、標準化テストのスコアに基づいてコースに振り分けられる学生が増えるにつれ、ライティング教師は、学生がテストされている内容(文法、用法、語彙)と、教師が実際に教えている内容(ライティングプロセスと推敲)との間に矛盾があることに気づき始めました。[ 5 ]教育を測定する学者や専門家は、評価するためのさまざまな基準を重視していましたが、ライティング研究の学者は、ライティング評価の焦点が学生の学習にあることを望んでいました。[ 6 ]このような隔たりがあったため、教育者は、地域、プログラム、教室レベルで設計および実施されるライティング評価を推進し始めました。[ 5 ] [ 7 ]ライティング教師が地域レベルの評価を設計し始めると、評価方法が多様化し、時間制限付きエッセイテスト、地域で設計されたルーブリック、ポートフォリオが生まれました。教室レベルやプログラムレベルに加えて、ライティング評価はライティングセンターの評価や同様の学術支援センターにも大きな影響を与えています。[ 8 ]
作文評価は様々な場面で用いられるため、理論や実践における大きな変化を促した特定の概念や状況を検証することで、作文評価の歴史を辿ることができる。作文評価の起源については、研究者の間でも意見が一致しているわけではない。
作文評価の歴史は、作文評価に使用される方法の 3 つの大きな変化から成り立っていると説明されています。 [ 5 ]作文評価の最初の波 (1950 ~ 1970 年) は、間接的な評価尺度を用いた客観的なテストを求めました。2 番目の波 (1970 ~ 1986 年) は、生徒の実際の作文が評価され始めた総合的に採点されるテストに焦点を当てました。そして、3 番目の波 (1986 年以降) は、生徒の作品の集合 (つまりポートフォリオ評価) とプログラム評価の評価へと移行しました。
1961年にディーデリッヒ、フレンチ、カールトンによって出版された『作文能力判断の要因』は、現代の作文評価の誕生を告げるものとして特徴づけられている。 [ 9 ]ディーデリッヒらは、その著書の大部分を、過去10年間に教育テストサービス(ETS)を通じて行われた研究に基づいている。この本は作文評価の標準化を試みたものであり、作文評価の研究の基礎を築いた。[ 10 ]
妥当性と信頼性の概念は、ライティング評価における優先順位の変化を理解するためのヒューリスティックの一種として提案されており[ 11 ]、ライティング評価におけるベストプラクティスとして理解されているものを解釈するためにも用いられている[ 12 ] 。
ライティング評価の第一波では、信頼性が重視されました。[ 13 ]信頼性は、テストの一貫性に関する疑問に直面するものです。この波では、最小限のコストと労力で最高の予測可能性でライティングを評価することが中心的な関心事でした。David Slomp のような学者の中には、信頼性の定義や、評価者間の信頼性がライティングの評価方法にどのように影響するかについて懸念を抱いていた人もいます。彼は、学習者のライティングを適切に判断するには、学習者に基づいた十分なコンテキストがしばしば不足していると主張しました。[ 6 ]
その後、妥当性の原則を考慮する動きを示す第二波へと移行しました。妥当性とは、与えられた目的に対するテストの適切性と有効性に関する疑問に直面することです。この波の手法は、テストの構成概念妥当性、つまりテストから引き出された内容が、テストが測定しようとしているものを適切に測定しているかどうかに関心を寄せていました。教師たちは、ライティングを測定するために引き出された内容と、教師が生徒に書かせている内容との間に不一致があることに気づき始めました。ライティング研究者のエドワード・M・ホワイトが提唱した総合的採点法は、この波で登場しました。これは、生徒のライティング能力を測定するために、生徒のライティングを引き出す評価方法の一つです。[ 14 ]
作文評価の第三の波は、評価方法の妥当性に対する継続的な関心とともに現れました。この波では、ポートフォリオ評価が学習と教育にどのように貢献するかを含めた、妥当性の定義の拡大が検討され始めました。この波では、ポートフォリオ評価は、推敲、下書き、プロセスなど、作文・ライティング研究における理論と実践を重視するようになりました。
間接的なライティング評価は、通常、文法、語法、語彙に関する多肢選択式テストで構成されます。[ 5 ]例としては、 ACT、SAT、GREなどの高難易度の標準化テストがあり、これらは大学が入学目的でよく使用します。Compassなどの他の間接的な評価は、学生を補習ライティングコースまたは一般ライティングコースに配置するために使用されます。Writeplacer ESL(Accuplacerの一部)や時間制限付きエッセイテストなどの直接的なライティング評価は、少なくとも1つの学生のライティングサンプルを必要とし、実際のライティングサンプルを評価するため、多くのライティング評価研究者によって間接テストよりも妥当性が高いとみなされています。[ 5 ]一般的に、1学期に書かれた複数の学生のライティングで構成されるポートフォリオ評価は、1980年代後半から1990年代初頭にかけて時間制限付きエッセイに取って代わり始めました。ポートフォリオ評価は、教室の実際の状況で作成された複数の学生のライティングサンプルに焦点を当てているため、時間制限付きエッセイテストよりもさらに妥当性が高いとみなされています。ポートフォリオによって、評価者は学生の複数の作文サンプルや、1つのエッセイの複数の草稿を調べることができます。[ 5 ]
作文評価の方法は、状況や評価の種類によって異なります。以下は、よく実施される作文評価の例の一部です。
ポートフォリオ評価は、通常、コースの終了時または数年間にわたって学生が何を学んだかを評価するために使用されます。コースポートフォリオは、学生の複数のライティングサンプルと、学生がコースでのライティングと作業について説明する反省の手紙またはエッセイで構成されます。[ 5 ] [ 15 ] [ 16 ] [ 17 ]「ショーケースポートフォリオ」には学生のライティングの最終ドラフトが含まれ、「プロセスポートフォリオ」には各ライティングの複数のドラフトが含まれます。[ 18 ]印刷ポートフォリオと電子ポートフォリオの両方がショーケースポートフォリオまたはプロセスポートフォリオのいずれかになりますが、電子ポートフォリオには通常、反省のエッセイまたは手紙から学生の作品のサンプル、場合によっては外部ソースへのハイパーリンクが含まれます。 [ 16 ] [ 18 ]
時間制限付きエッセイテストは、多肢選択式の間接的な作文評価に代わるものとして開発されました。時間制限付きエッセイテストは、学生のスキルレベルに適した作文コースに振り分けるためによく用いられます。これらのテストは通常、監督官付きで行われます。つまり、特定の場所で試験が実施され、学生は決められた時間内に課題に対する解答を記述する必要があります。SATとGREには、いずれも時間制限付きエッセイセクションが含まれています。
ルーブリックは、さまざまなライティングの文脈で使用できるライティング評価ツールです。ルーブリックは、評価者がライターに点数や評価をつけるための基準または説明のセットで構成されています。ルーブリックの起源は、20 世紀初頭の教育におけるライティングの標準化と尺度化の初期の試みに遡ることができます。アーネスト C ノイズは、1912 年 11 月に、より科学に基づいた評価方法への移行を主張しました。教育で使用された初期の尺度の 1 つは、マイロ B. ヒレガスがA Scale for the Measurement of Quality in English Composition by Young Peopleで開発しました。この尺度は、一般的にヒレガス尺度と呼ばれています。ヒレガス尺度と教育で使用された他の尺度は、管理者が学校の進捗状況を比較するために使用されました。[ 19 ]
1961年、教育テストサービス(ETS)のディーデリッヒ、フレンチ、カールトンは、一連の評価者のコメントを分類し、5つの要素からなるルーブリックにまとめた「ライティング能力の判断における要素」を発表しました。[ 20 ]
ルーブリックが教室で使われるようになると、教師たちは、生徒が評価方法に関与できるように、生徒と評価基準について話し合うことを提唱し始めた。クリス・ギャラガーやエリック・ターリー[ 21 ] 、ボブ・ブロード[ 22 ] 、井上麻生[ 23 ]などの学者(他にも多数)は、ルーブリックの効果的な使用は、地域的、文脈的、かつ話し合いによる基準から生まれると主張している。
批判点:
ルーブリックの導入は学者たちの間で議論を巻き起こした。一部の教育者は、ルーブリックは誤った客観的主張に基づいているため主観に基づいていると主張している。[ 24 ]エリック・ターリーとクリス・ギャラガーは、国家が課すルーブリックは改善ではなく説明責任のためのツールであると主張した。多くの場合、ルーブリックは教室外で生徒自身と関係のない著者によって作成され、その後他の教育者によって解釈および適応される。[ 25 ]ターリーとギャラガーは、「遠隔減衰の法則によれば、教育ツールは、教室から遠ざかるほど、または教室に伝わるほど、指導上の有用性が低下し、教育の健全性を損なう可能性が高くなる」と指摘している。[ 25 ]彼らはさらに、ルーブリックは、積極的な反応の代わりとなるものではなく、執筆者が一連の合意価値を測定するためのツールとして解釈されるべきであると述べている。
Stellmack らによる研究では、合意された基準に基づくルーブリックの認識と適用について評価しました。その結果、異なる評価者が同じドラフトを評価した場合、以前にフィードバックを与えた評価者の方が改善点に気づきやすいことがわかりました。研究者らは、信頼性の高いルーブリックを使用すれば、「レビュー・修正・再提出」の手順でより良い結果が得られると結論付けました。[ 26 ]
反ルーブリック:ルーブリックは文章の質を測定するだけでなく、学部や特定の機関の修辞的価値観に関する個人の信念も反映します。しかし、ルーブリックには、指導者がこれらの価値観からどのように逸脱するかについての詳細が欠けています。ボブ・ブロードは、ルーブリックの代替案の一例として[ 27 ]「動的基準マッピング」を挙げています。
単一の評価基準は、エルボーが価値の社会的構築そのものに触れているように、さらなる疑問を提起する。彼は、合意の要件を取り除いた共同プロセスを提案し、クラスが「潜在的な合意、つまり思考における強制されない合意を見ることができ、同時に意見の相違点を明確にするのに役立つ」と述べている。 [ 28 ]彼は、採点が多次元的な視点を取り、「優れた文章」の可能性が開かれることを提案している。そうすることで、単一の次元のルーブリックが多次元的なパフォーマンスを評価しようとしていると指摘している。[ 28 ]
契約採点とは、学生と教師の間で合意された労働契約に基づいて、学生の成績が、認識されている作業の質ではなく、完了した課題の量に基づいて決定される評価方法です。労働ベースの契約採点は、採点を教師の認識から切り離し、学生が望む成績を達成する方法について明確な期待を与えることで、学生の主体性を高め、不安を大幅に軽減する可能性があることを支持する研究があります。[ 29 ] [ 30 ]一方、労働ベースの契約採点システムはそれほど中立的ではないかもしれないと示唆する研究者もいます。神経発達障害のある学生は、考慮されていない異なる経験を持っている可能性があり、それを考慮に入れないシステムによって引き続き阻害される可能性があると主張しています。[ 31 ]
2010年代から2020年代初頭にかけて、契約採点方式は、浅尾B.井上などの学者によって、人種的不平等を軽減する可能性のある代替的なライティング評価方法として提唱されてきた。[ 32 ]
多肢選択式テストには、用法、文法、語彙に関する質問が含まれています。アーサー・アップルビーは、多肢選択式テストは、先に述べた語彙など、ライティングの特定の側面をテストする有効かつ信頼できる方法であると付け加えています。これらの特定のタイプのテストは、単独で使用するのではなく、他の筆記評価と併用して使用する必要があります。[ 33 ] SAT、ACT、GREなどの標準化テストは、通常、大学または大学院の入学に使用されます。CompassやAccuplacerなどの他のテストは、通常、学生を補習ライティングコースまたは一般ライティングコースに配置するために使用されます。
自動エッセイ採点(AES) は、人間以外のコンピュータ支援評価手法を使用して、ライティング課題を評価、採点、またはグレード付けすることです。初期の頃、人々は構文をコンピュータがライティングを判断する方法として使用していました。[ 34 ]これは、コンピュータがエッセイを評価する簡単な方法であることが証明されました。コンピュータによる自動エッセイ採点により、エッセイの評価とグレード付けの時間とコストが効率化されました。[ 33 ] [ 34 ]
一部のソフトウェアプログラムは、新しいエッセイを比較するための対照として、同じ課題に対して以前に提出されたエッセイを使用します。インテリジェントエッセイアセッサーなどの他のプログラムは、エッセイ内の情報がどれほど正確で事実に基づいているかを判断します。その目的は、構文やトーンなどの文章の複雑さではなく、知識を採点してテストすることでした。[ 34 ]
Google DocsやMicrosoft Wordのようなライティングプロセッサは、エッセイの自動採点に使用され、ライティングプロセスを簡略化することができます。文法やスペルを修正するためのさまざまなツールがあり、従来の鉛筆と紙に比べて編集が簡単に行えます。しかし、インターネットへのアクセスレベルにはばらつきがあります。コンピュータの使用に精通している学生もいれば、タイピングに問題を抱えている学生もいるため、すべての学生がコンピュータベースのライティング評価を同じように完了できるわけではありません。[ 33 ]
コンピュータによる採点は、文章の複雑さやニュアンスを理解できないという批判がある。多くの場合、エッセイを小さな部分に分解し、エッセイ全体ではなく数学的に採点する。その結果、物語のようなエッセイは、書かれた選択の背後にある選択や個性を考慮できないため、はるかに低い点数になる。[ 34 ]
作文評価の研究者の中には、人種が作文評価の成績に与える影響に研究の焦点を当てている者もいる。人種と作文評価に関する研究は、人種のカテゴリーや人種に対する認識が作文評価の結果をどのように形成し続けているかを研究しようとしている。しかし、作文評価の研究者の中には、21世紀の人種差別はもはや明示的ではないと認識している者もいるが、[ 35 ]作文評価の実践における「静かな」人種差別を主張しており、作文評価における人種的不平等は通常、人種とは関係のない理由で正当化されている。 [ 36 ]一部の研究者は、現在の成績評価システムと教育システムは白人中心主義に深く根付いていると主張している。[ 37 ] [ 38 ]これらの研究者は、人種と作文評価の交差を評価の実践の最前線に持ち込む、作文評価の新たな発展を提唱している。研究者は、これらの新しい作文評価が学習者と試験官の状況と文脈を考慮することを提唱している。[ 38 ]
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)