Loading article…
ROUGE(Recall-Oriented Understudy for Gisting Evaluation)[1]は、自然言語処理における自動要約および機械翻訳ソフトウェアを評価するために使用される一連の指標およびソフトウェアパッケージです。指標は、自動的に生成された要約または翻訳を、参照または参照セット(人間が生成した)の要約または翻訳と比較します。ROUGE指標の範囲は0〜1で、スコアが高いほど、自動的に生成された要約と参照の類似性が高いことを示します。
メトリクス
評価指標としては以下の 5 つが利用可能です。
- ROUGE-N:システム要約と参照要約間の
nグラム[2]の重複。
- ROUGE-1 は、システム要約と参照要約間のユニグラム (各単語)の重複を指します。
- ROUGE-2 は、システムと参照要約間のバイグラムの重複を指します。
- ROUGE-L: 最長共通部分列(LCS)[3]に基づく統計。最長共通部分列問題は、文レベルの構造類似性を自然に考慮し、シーケンスnグラム内で共起する最長部分列を自動的に識別します。
- ROUGE-W: 連続する LCS を優先する加重 LCS ベースの統計。
- ROUGE-S: スキップ・ビグラム[3]に基づく共起統計。スキップ・ビグラムは文の順序に従った任意の単語のペアである。
- ROUGE-SU: スキップビグラムとユニグラムベースの共起統計。
参照
参考文献
- ^ Lin, Chin-Yew. 2004. ROUGE: 要約の自動評価パッケージ。テキスト要約ブランチアウトに関するワークショップ (WAS 2004) の議事録、スペイン、バルセロナ、2004 年 7 月 25 日 - 26 日。
- ^ Lin、Chin-Yew、EH Hovy 2003。N グラム共起統計を使用した要約の自動評価。2003 Language Technology Conference (HLT-NAACL 2003) の議事録、カナダ、エドモントン、2003 年 5 月 27 日 - 6 月 1 日。
- ^ ab Lin、Chin-Yew、Franz Josef Och。2004年。最長共通部分列とスキップ・ビグラム統計を使用した機械翻訳品質の自動評価。第42回計算言語学会年次会議(ACL 2004)の議事録、スペイン、バルセロナ、2004年7月21日~26日。
外部リンク
- ROUGE 使い方チュートリアル
- ROUGEのJava実装
