自動要約とは、データセットをコンピュータ処理によって短縮し、元のコンテンツの中で最も重要または関連性の高い情報を表すサブセット(要約)を作成するプロセスです。この目的を達成するために、人工知能(AI)アルゴリズムが一般的に開発・利用されており、様々な種類のデータに合わせて特化されています。
テキスト要約は通常、自然言語処理手法によって実装され、特定の文書内で最も情報量の多い文を特定するように設計されています。[ 1 ]一方、視覚コンテンツはコンピュータビジョンアルゴリズムを使用して要約できます。画像要約は継続的な研究の対象であり、既存のアプローチは通常、特定の画像コレクションから最も代表的な画像を表示したり、コレクション全体から最も重要なコンテンツのみを含むビデオを生成したりします。[ 2 ] [ 3 ] [ 4 ]ビデオ要約アルゴリズムは、通常、時間順に、元のビデオコンテンツから最も重要なフレーム(キーフレーム)および/または最も重要なビデオセグメント(キーショット)を識別して抽出します。[ 5 ] [ 6 ] [ 7 ] [ 8 ]ビデオ要約は、元のビデオフレームの慎重に選択されたサブセットを保持するだけであり、したがって、元のビデオコンテンツに基づいて新しいビデオフレームが合成されるビデオ概要アルゴリズムの出力と同一ではありません。
2022年にGoogleドキュメントは自動要約機能をリリースした。[ 9 ]
自動要約には、抽出と抽象化という2つの一般的なアプローチがあります。
ここでは、元のデータからコンテンツが抽出されますが、抽出されたコンテンツは一切変更されません。抽出されたコンテンツの例としては、テキスト文書に「タグ付け」またはインデックス付けするために使用できるキーワード、要約を構成するキーワード(見出しを含む)、および前述のように代表的な画像やビデオセグメントなどがあります。テキストの場合、抽出はスキミングのプロセスに類似しており、要約(利用可能な場合)、見出しと小見出し、図、セクションの最初と最後の段落、および必要に応じて段落の最初と最後の文を読んでから、文書全体を詳細に読むかどうかを選択します。[ 10 ]臨床的関連性の観点からテキストの重要なシーケンス(患者/問題、介入、結果を含む)を含む抽出の他の例もあります。[ 11 ]
抽象的要約手法は、元のテキストには存在しなかった新しいテキストを生成します。[ 12 ]これは主にテキストに適用されてきました。抽象的手法は、元のコンテンツの内部意味表現(言語モデルと呼ばれることが多い)を構築し、この表現を使用して、人間が表現するであろうものにより近い要約を作成します。抽象化は、ソース文書のセクションを言い換えることで抽出されたコンテンツを変換し、抽出よりもテキストをより強く凝縮することができます。ただし、このような変換は、自然言語処理と、元の文書が特定の知識分野に関連する場合、元のテキストのドメインに対する深い理解の両方を必要とするため、抽出よりも計算的にずっと困難です。「言い換え」は画像やビデオに適用するのがさらに難しいため、ほとんどの要約システムは抽出型です。
要約の質を高めるためのアプローチは、ソフトウェアと人間の努力を組み合わせることに依存しています。機械支援型人間要約では、抽出技術によって要約に含める候補となる箇所が抽出され(そこに人間がテキストを追加または削除します)、人間支援型機械要約では、人間がソフトウェアの出力を後処理します。これは、Google翻訳による自動翻訳の出力を編集するのと同様の方法です。
要約プログラムが何に焦点を当てるかによって、抽出型要約タスクは大きく2種類に分けられます。1つ目は汎用要約で、これはコレクション(文書、画像セット、動画、ニュース記事など)の一般的な要約または概要を取得することに重点を置いています。2つ目は クエリ関連要約(クエリベース要約とも呼ばれる)で、クエリに特有のオブジェクトを要約します。要約システムは、ユーザーのニーズに応じて、クエリ関連テキスト要約と汎用的な機械生成要約の両方を作成できます。
要約問題の一例として、文書要約が挙げられます。これは、与えられた文書から自動的に要約を作成しようとするものです。単一のソース文書から要約を生成することに関心がある場合もあれば、複数のソース文書(例えば、同じトピックに関する複数の記事)を使用する場合もあります。この問題は、複数文書要約と呼ばれます。関連する応用例として、ニュース記事の要約があります。特定のトピックに関するニュース記事を(ウェブから)自動的に収集し、最新ニュースを簡潔に要約として表現するシステムを想像してみてください。
画像コレクションの要約は、自動要約のもう1つの応用例です。これは、より大きな画像セットから代表的な画像セットを選択することです。[ 13 ]この文脈での要約は、画像コレクション探索システムで結果の最も代表的な画像を表示するのに役立ちます。ビデオ要約は関連分野であり、システムが長いビデオの予告編を自動的に作成します。これは、退屈な動作や繰り返しの動作をスキップしたい場合、消費者ビデオや個人ビデオにも応用できます。同様に、監視ビデオでは、キャプチャされた退屈で冗長なフレームをすべて無視して、重要で疑わしい動作を抽出したい場合があります。
要約アルゴリズムは、非常に大まかに言うと、オブジェクト(文の集合や画像の集合など)のサブセットを見つけ、そのサブセットが全体の情報をカバーするようにすることを目的としています。これはコアセットとも呼ばれます。これらのアルゴリズムは、要約の多様性、網羅性、情報量、代表性といった概念をモデル化します。クエリベースの要約手法では、さらに要約とクエリの関連性もモデル化します。要約問題を自然にモデル化する手法やアルゴリズムには、TextRank、PageRank、劣モジュラ集合関数、行列式点過程、最大周辺関連性(MMR)などがあります。
タスクは次のとおりです。ジャーナル記事などのテキストが与えられ、そのテキストで議論されている主要なトピックを捉えるキーワードまたはキーフレーズのリストを作成する必要があります。[ 14 ]研究論文の場合、多くの著者が手動でキーワードを割り当てていますが、ほとんどのテキストには既存のキーフレーズがありません。たとえば、ニュース記事にはキーフレーズが付けられていることはまれですが、以下で説明するいくつかのアプリケーションでは、それを自動的に行うことができると便利です。ニュース記事の例テキストを考えてみましょう。
キーワード抽出器は、「陸軍工兵隊」、「ブッシュ大統領」、「ニューオーリンズ」、「欠陥のある洪水制御ポンプ」などをキーワードとして選択するかもしれません。これらはテキストから直接抽出されます。一方、抽象キーワードシステムは、何らかの方法で内容を内面化し、テキストには現れないものの、人間が作り出すであろう表現により近いキーワード、例えば「政治的怠慢」や「洪水に対する不十分な保護」などを生成します。抽象化にはテキストの深い理解が必要となるため、コンピュータシステムにとっては困難です。キーワードには多くの用途があります。短い要約を提供することで文書の閲覧を容易にしたり、情報検索を改善したり(文書にキーワードが割り当てられている場合、ユーザーはキーワードで検索することで全文検索よりも信頼性の高い結果を得ることができます)、大規模なテキストコーパスの索引エントリの生成に利用したりできます。
キーワード抽出は、文献やキーワードの定義によって大きく異なるため、非常に関連性の高いテーマと言える。
Turneyの研究[ 15 ]を皮切りに、多くの研究者がキーワード抽出を教師あり機械学習問題として捉えてきました。文書が与えられたら、テキスト中に含まれる各単語、2文字、3文字の例を作成します(ただし、後述するように他のテキスト単位も可能です)。次に、各例を記述するさまざまな特徴を計算します(たとえば、フレーズが大文字で始まっているかどうかなど)。トレーニング文書のセットに対して既知のキーワードが利用可能であると仮定します。既知のキーワードを使用して、例に正または負のラベルを割り当てることができます。次に、特徴の関数として正例と負例を区別できる分類器を学習します。分類器の中には、テスト例に対してバイナリ分類を行うものもあれば、キーワードである確率を割り当てるものもあります。たとえば、上記のテキストでは、最初の文字が大文字のフレーズはキーワードである可能性が高いというルールを学習することができます。学習器をトレーニングした後、次のようにしてテスト文書のキーワードを選択できます。テスト文書にも同じ例生成戦略を適用し、各例を学習器に通します。学習済みモデルから返される二値分類の決定または確率を調べることで、キーワードを特定できます。確率が与えられている場合は、閾値を使用してキーワードを選択します。キーワード抽出器は、一般的に精度と再現率を使用して評価されます。精度は、提案されたキーワードのうち実際に正しいものがいくつあるかを示します。再現率は、システムが提案した真のキーワードのうち正しいものがいくつあるかを示します。これら2つの指標は、2つの調和平均であるFスコア(F = 2 PR /( P + R ))で組み合わせることができます。提案されたキーワードと既知のキーワードとの一致は、ステミングまたはその他のテキスト正規化を適用した後に確認できます。
教師ありキーワード抽出システムを設計するには、いくつかの選択肢を決定する必要があります(これらの選択肢の一部は教師なしシステムにも適用されます)。最初の選択肢は、例をどのように生成するかです。Turney らは、句読点を挟まずストップワードを除去した後、考えられるすべての単語、2 文字、3 文字を使用しました。Hulth は、品詞タグの特定のパターンに一致するトークンのシーケンスを例として選択することで、ある程度の改善が得られることを示しました。理想的には、例を生成するメカニズムは、既知のラベル付きキーワードすべてを候補として生成しますが、実際にはそうでない場合がよくあります。たとえば、単語、2 文字、3 文字のみを使用する場合、4 つの単語を含む既知のキーワードを抽出することは決してできません。したがって、再現率が低下する可能性があります。ただし、例を生成しすぎると、精度が低下する可能性もあります。
また、例を記述し、学習アルゴリズムがキーワードと非キーワードを区別できるほど十分な情報を提供する特徴量を作成する必要もあります。通常、特徴量には、さまざまな用語の出現頻度(現在のテキストまたはより大きなコーパスでフレーズが何回出現するか)、例の長さ、最初の出現位置、さまざまなブール構文特徴(すべて大文字を含むなど)などが含まれます。ターニーの論文では、このような特徴量が約12個使用されました。ハルスは、ターニーの先駆的な論文から派生したKEA(キーワード抽出アルゴリズム)の研究で最も成功した、より少ない数の特徴量を使用しています。
最終的に、システムはテスト文書のキーワードリストを返す必要があるため、その数を制限する方法が必要です。アンサンブル法(つまり、複数の分類器からの投票を使用する方法)は、数値スコアを生成し、それを閾値処理することで、ユーザーが指定した数のキーワードを提供できます。これは、TurneyがC4.5決定木で使用した手法です。Hulthは単一のバイナリ分類器を使用したため、学習アルゴリズムが適切な数を暗黙的に決定します。
事例と特徴量が作成されたら、キーワードを予測する方法を学習する必要があります。決定木、ナイーブベイズ、ルール誘導など、事実上あらゆる教師あり学習アルゴリズムを使用できます。TurneyのGenExアルゴリズムの場合、遺伝的アルゴリズムを使用して、ドメイン固有のキーワード抽出アルゴリズムのパラメータを学習します。抽出器は、一連のヒューリスティックに従ってキーワードを識別します。遺伝的アルゴリズムは、既知のキーワードを含むトレーニング文書でのパフォーマンスに基づいて、これらのヒューリスティックのパラメータを最適化します。
もう一つのキーワード抽出アルゴリズムは TextRank です。教師あり学習法には、キーワードの特徴を表す解釈可能なルールを生成できるなど、いくつかの優れた特性がありますが、大量の学習データも必要です。キーワードが既知の文書が多数必要になります。さらに、特定のドメインで学習すると、抽出プロセスがそのドメインに合わせてカスタマイズされる傾向があるため、結果として得られる分類器は必ずしも移植可能ではありません。これは Turney の結果の一部で示されています。教師なしキーワード抽出では、学習データの必要性がなくなります。これは、問題を別の角度からアプローチします。キーワードを特徴付ける明示的な特徴を学習しようとするのではなく、TextRank アルゴリズム[ 16 ]は、 PageRank が重要な Web ページを選択するのと同じように、テキスト自体の構造を利用して、テキストの「中心」となるキーワードを決定します。これは、ソーシャル ネットワークからの「プレステージ」または「推薦」の概念に基づいていることを思い出してください。このように、TextRankは過去の学習データに一切依存せず、任意のテキストに対して実行でき、テキスト本来の特性に基づいて出力を生成することができます。そのため、このアルゴリズムは新しい分野や言語にも容易に適用可能です。
TextRankは、 NLP向けの汎用グラフベースランキングアルゴリズムです。基本的には、特定のNLPタスク用に特別に設計されたグラフ上でPageRankを実行します。キーワード抽出の場合、テキストユニットの集合を頂点としてグラフを構築します。エッジは、テキストユニットの頂点間の意味的または語彙的な類似性に基づいて決定されます。PageRankとは異なり、エッジは通常無向であり、類似性の度合いを反映するように重み付けできます。グラフが構築されると、ランダムサーフィンモデルのように減衰係数と組み合わせて確率行列を形成し、固有値1に対応する固有ベクトル(つまり、グラフ上のランダムウォークの定常分布)を見つけることで、頂点のランキングを取得します。
頂点は、ランク付けしたいものに対応する必要があります。理論的には、教師あり学習法に似た方法で、各単語、2単語、3単語などに頂点を作成することもできます。しかし、グラフを小さく保つために、著者らは最初のステップで個々の単語をランク付けし、次に、ランクの高い隣接する単語をマージして複数語のフレーズを形成する2番目のステップを含めることにしました。これにより、任意の長さのキーワードフレーズを生成できるという良い副次効果が得られます。たとえば、単語をランク付けして、「advanced」、「natural」、「language」、「processing」がすべて高いランクを獲得した場合、元のテキストを見て、これらの単語が連続して出現していることを確認し、4つすべてを組み合わせて最終的なキーワードフレーズを作成します。グラフに配置された単語は品詞でフィルタリングできることに注意してください。著者らは、形容詞と名詞を含めるのが最適であることがわかりました。したがって、このステップでは、ある程度の言語学的知識が役立ちます。
TextRankのこの応用では、単語の共起に基づいてエッジが作成されます。元のテキストで、単語がN個のウィンドウ内に出現する場合、2つの頂点はエッジで接続されます。Nは通常2~10程度です。したがって、NLPに関するテキストでは、「natural」と「language」がリンクされる可能性があります。「Natural」と「processing」も、どちらも同じN個の単語の文字列内に出現するため、リンクされます。これらのエッジは、「テキストの結束性」という概念と、互いに近くに出現する単語は意味のある形で関連しており、読者に「推奨」される可能性が高いという考えに基づいています。
この方法は個々の頂点を単純にランク付けするため、閾値を設定してキーワードの数を制限する必要があります。そこで、グラフ内の頂点の総数に対するユーザー指定の割合をTとして設定する手法を採用しました。次に、定常確率に基づいて上位T個の頂点/単語を選択します。その後、後処理ステップを適用して、これらのT個の単語の隣接するインスタンスをマージします。結果として、T個より多い、または少ない最終的なキーワードが生成されますが、その数は元のテキストの長さにほぼ比例するはずです。
PageRankを共起グラフに適用すると、なぜ有用なキーワードが生成されるのかは、最初は明らかではありません。一つの考え方として、次のように考えることができます。テキスト全体に複数回出現する単語は、多くの異なる共起する隣接語を持つ可能性があります。たとえば、機械学習に関するテキストでは、「learning」という単語が、「machine」、「supervised」、「un-supervised」、「semi-supervised」と4つの異なる文で共起する可能性があります。したがって、「learning」の頂点は、これらの他の修飾語に接続する中心的な「ハブ」となります。グラフにPageRank/TextRankを実行すると、「learning」は高いランク付けがされる可能性が高いです。同様に、テキストに「supervised classification」というフレーズが含まれている場合、「supervised」と「classification」の間にエッジが存在します。「classification」が他の複数の場所に出現し、多くの隣接語を持つ場合、その重要性が「supervised」の重要性に寄与します。上位にランクインした場合、「learning」や恐らく「classification」とともに、上位のT語句の一つとして選ばれます。最終的な後処理ステップでは、「supervised learning」と「supervised classification」というキーワードが得られます。
要するに、共起グラフには、頻繁に異なる文脈で出現する用語が密に連結した領域が含まれます。このグラフ上でのランダムウォークでは、クラスターの中心にある用語に大きな確率を割り当てる定常分布が得られます。これは、密に連結したWebページがPageRankで上位にランク付けされるのと似ています。このアプローチは、後述する文書要約にも使用されています。
キーワード抽出と同様に、文書要約もテキストの本質を特定することを目的としています。唯一の違いは、単語やフレーズではなく、より大きなテキスト単位、つまり文全体を扱う点です。
教師ありテキスト要約は、教師ありキーワード抽出と非常によく似ています。基本的に、文書のコレクションと、それらに対する人間が作成した要約があれば、要約に含めるのに適した文の特徴を学習できます。特徴には、文書内での位置(つまり、最初の数文が重要である可能性が高い)、文の単語数などが含まれます。教師あり抽出型要約の主な難点は、既知の要約を文を抽出して手動で作成し、元のトレーニング文書の文を「要約に含まれる」または「要約に含まれない」とラベル付けする必要があることです。これは通常、人々が要約を作成する方法ではないため、ジャーナルの要約や既存の要約を使用するだけでは不十分な場合が多いです。これらの要約の文は、元のテキストの文と必ずしも一致するとは限らないため、トレーニングの例にラベルを割り当てるのは困難です。ただし、ROUGE-1評価では単語のみを考慮するため、これらの自然な要約は評価目的で使用できます。
DUC 2001および2002の評価ワークショップにおいて、TNOはニュース分野における複数文書要約のための文抽出システムを開発しました。このシステムは、ナイーブベイズ分類器と顕著性モデリングのための統計的言語モデルを用いたハイブリッドシステムに基づいています。システムは良好な結果を示しましたが、研究者らは、特徴依存性に対して頑健であることが知られている最大エントロピー(ME)分類器の会議要約タスクにおける有効性を検証したいと考えました。最大エントロピーは、放送ニュース分野の要約にも成功裏に適用されています。
有望なアプローチは、適応型文書/テキスト要約です。[ 17 ]これは、まずテキストのジャンルを認識し、次にそのジャンルに最適化された要約アルゴリズムを適用するものです。このようなソフトウェアは既に開発されています。[ 18 ]
教師なし要約手法は、教師なしキーワード抽出と本質的に非常に似ており、高価な学習データの問題も回避できます。教師なし要約手法の中には、「セントロイド」文、つまり文書内のすべての文の平均単語ベクトルを見つけることに基づくものがあります。そして、各文をこのセントロイド文との類似性に基づいてランク付けします。
文の重要性を推定するより原理的な方法は、ランダムウォークと固有ベクトル中心性を使用することです。LexRank [ 19 ]は、基本的に TextRank と同一のアルゴリズムであり、どちらもこのアプローチを使用して文書の要約を行います。この 2 つの方法は、異なるグループによって同時期に開発され、LexRank は要約に特化していましたが、キーワード抽出やその他の NLP ランキング タスクにも同様に使用できます。
LexRankとTextRankの両方において、文書内の各文を頂点としてグラフが構築される。
文間のエッジは、何らかの意味的類似性または内容の重複に基づいています。LexRankはTF-IDFベクトルのコサイン類似度を使用しますが、TextRankは2つの文に共通する単語数(文の長さで正規化)に基づく非常に類似した尺度を使用します。LexRankの論文では、コサイン値に閾値を適用した後、重み付けされていないエッジを使用する方法を検討しましたが、類似度スコアと同じ重みを持つエッジを使用する実験も行いました。TextRankは、重みとして連続的な類似度スコアを使用します。
どちらのアルゴリズムでも、結果として得られるグラフにPageRankを適用することで文の順位付けが行われます。要約は、上位にランク付けされた文を組み合わせることで作成され、要約のサイズを制限するために閾値または長さのカットオフが使用されます。
ここで注目すべきは、TextRankはここで説明したとおりに要約に適用されたのに対し、LexRankはより大規模な要約システム(MEAD)の一部として使用された点である。MEADは、LexRankスコア(定常確率)と文の位置や長さなどの他の特徴量を、ユーザー指定または自動調整された重みを用いた線形結合で組み合わせる。この場合、いくつかの学習用文書が必要になる可能性があるが、TextRankの結果から、追加の特徴量は必ずしも必要ではないことがわかる。
TextRankとは異なり、LexRankは複数文書の要約に適用されている。
複数文書要約は、同じトピックについて書かれた複数のテキストから情報を抽出することを目的とした自動処理です。結果として得られる要約レポートにより、専門の情報消費者などの個々のユーザーは、多数の文書に含まれる情報を迅速に把握することができます。このように、複数文書要約システムは、情報過多への対処という次の段階を担うニュースアグリゲーターを補完します。複数文書要約は、質問への回答として行うこともできます。[ 20 ] [ 11 ]
複数文書の要約は、簡潔かつ包括的な情報レポートを作成します。さまざまな意見をまとめて概要化することで、あらゆるトピックを単一の文書内で複数の視点から記述できます。簡潔な要約の目的は、最も関連性の高い情報源文書を示すことで情報検索を簡素化し、時間を短縮することですが、包括的な複数文書の要約は、必要な情報自体を含んでいるべきであり、そのため、元のファイルにアクセスする必要性は、精査が必要な場合に限られます。自動要約は、複数の情報源から抽出された情報をアルゴリズムによって提示し、編集上の手直しや主観的な人間の介入を一切行わないため、完全に偏りのない情報を提供します。
複数文書抽出型要約では、冗長性の問題に直面します。理想的には、「中心的」(つまり、主要なアイデアを含む)かつ「多様」(つまり、互いに異なる)な文を抽出したいと考えます。たとえば、ある出来事に関するニュース記事のセットでは、各記事に多くの類似した文が含まれている可能性があります。この問題に対処するため、LexRank は、文をランク順に追加し、既に要約に含まれている文と類似しすぎている文を破棄するヒューリスティックな後処理ステップを適用します。この方法は、クロスセンテンス情報包含 (CSIS) と呼ばれます。これらの方法は、文が読者に対して他の類似した文を「推奨」するという考えに基づいています。したがって、ある文が他の多くの文と非常に似ている場合、それは非常に重要な文である可能性が高いです。その重要性は、それを「推奨」する文の重要性にも由来します。したがって、高いランクを獲得して要約に掲載されるには、文は多くの文と類似している必要があり、それらの文もまた多くの他の文と類似している必要があります。これは直感的に理解しやすく、アルゴリズムを任意の新しいテキストに適用できる。この手法はドメインに依存せず、移植性も高い。ニュース分野における重要な文を示す特徴は、生物医学分野における特徴とは大きく異なる可能性がある。しかし、教師なし学習に基づく「推薦」アプローチは、あらゆるドメインに適用可能である。
関連する手法として、最大周辺関連性 (MMR) [ 21 ]があります。これは、吸収マルコフ連鎖ランダムウォーク (特定の状態がウォークを終了するランダムウォーク)に基づく統一された数学的フレームワークで「中心性」と「多様性」の両方を扱う Page/Lex/TextRank のような汎用グラフベースのランキングアルゴリズムを使用します。このアルゴリズムは GRASSHOPPER と呼ばれています。 [ 22 ]ランキングプロセス中に多様性を明示的に促進することに加えて、GRASSHOPPER は事前ランキング (要約の場合は文の位置に基づく) を取り入れています。
複数文書要約の最先端結果は、劣モジュラ関数の混合を使用して得られています。これらの方法は、文書要約コーパスである DUC 04 - 07 で最先端の結果を達成しました。[ 23 ] DUC-04 では、行列式点プロセス (劣モジュラ関数の特殊なケース) を使用して同様の結果が得られました。[ 24 ]
冗長性を回避する新しい多言語・複数文書要約手法は、各文書の各文の意味を表す表意文字を生成し、表意文字の形状と位置を比較することで類似性を評価します。単語頻度、学習、前処理は使用しません。ユーザーが指定する2つのパラメータ、等価性(2つの文が等価とみなされる条件)と関連性(必要な要約の長さ)を使用します。
劣モジュラ集合関数の概念は、近年、さまざまな要約問題に対する強力なモデリングツールとして注目されています。劣モジュラ関数は、カバレッジ、情報、表現、多様性といった概念を自然にモデル化します。さらに、いくつかの重要な組み合わせ最適化問題は、劣モジュラ最適化の特殊なケースとして現れます。例えば、集合被覆問題は、集合被覆関数が劣モジュラ関数であるため、劣モジュラ最適化の特殊なケースです。集合被覆関数は、与えられた概念の集合を網羅するオブジェクトの部分集合を見つけようとします。例えば、文書要約では、要約が文書内のすべての重要かつ関連性の高い概念を網羅することが望まれます。これは集合被覆の一例です。同様に、施設配置問題も劣モジュラ関数の特殊なケースです。施設配置関数もまた、カバレッジと多様性を自然にモデル化します。劣モジュラ最適化問題の別の例としては、多様性をモデル化するために決定点過程を使用することが挙げられます。同様に、最大周辺関連性法も劣モジュラ最適化の一例と見なすことができます。カバレッジ、多様性、情報を促進するこれらの重要なモデルはすべて劣モジュラ関数です。さらに、劣モジュラ関数は効率的に組み合わせることができ、結果として得られる関数も依然として劣モジュラ関数です。したがって、多様性をモデル化する劣モジュラ関数と、カバレッジをモデル化する別の劣モジュラ関数を組み合わせ、人間の監視を用いて、問題に適した劣モジュラ関数のモデルを学習することができます。
劣モジュラ関数は要約に適した問題であると同時に、最適化のための非常に効率的なアルゴリズムも許容します。たとえば、単純な貪欲アルゴリズムは定数係数を保証します。[ 25 ]さらに、貪欲アルゴリズムは実装が非常に簡単で、大規模なデータセットにも拡張できるため、要約問題にとって非常に重要です。
劣モジュラ関数は、ほぼすべての要約問題において最先端の性能を達成しています。例えば、LinとBilmesによる2012年の研究[ 26 ]では、文書要約システムDUC-04、DUC-05、DUC-06、DUC-07において、劣モジュラ関数が現在までに最良の結果を達成していることが示されています。同様に、LinとBilmesによる2011年の研究[ 27 ]では、自動要約のための既存のシステムの多くが劣モジュラ関数のインスタンスであることが示されています。これは、劣モジュラ関数が要約問題に適したモデルであることを確立する画期的な成果でした。
劣モジュラ関数は、他の要約タスクにも使用されています。Tschiatschek ら (2014 年) は[ 28 ]で、劣モジュラ関数の混合が画像コレクションの要約で最先端の結果を達成することを示しています。同様に、Bairi ら (2015 年) [ 29 ]は、複数ドキュメントのトピック階層を要約するための劣モジュラ関数の有用性を示しています。劣モジュラ関数は、機械学習データセットの要約にも成功裏に使用されています。[ 30 ]
自動要約の具体的な応用例としては、以下のようなものがある。
自動生成された要約の情報量を評価する最も一般的な方法は、人間が作成したモデル要約と比較することである。
評価は内在的または外在的であり[ 37 ]、テキスト間またはテキスト内である[ 38 ]。
内在的評価は要約そのものを直接評価するのに対し、外在的評価は要約システムが他のタスクの遂行にどのような影響を与えるかを評価する。内在的評価は主に要約の一貫性と情報量について評価してきた。一方、外在的評価は、要約が関連性評価や読解力などのタスクに与える影響を検証してきた。
テキスト内評価は特定の要約システムの出力を評価するのに対し、テキスト間評価は複数の要約システムの出力の比較分析に焦点を当てる。
人間は「良い」要約とは何かについて大きな個人差があるため、自動評価プロセスを構築するのは特に困難です。手動評価も可能ですが、要約だけでなく原文も読む必要があるため、時間と労力がかかります。その他にも、一貫性や網羅性といった課題があります。
要約を評価する最も一般的な方法は、ROUGE (Recall-Oriented Understudy for Gisting Evaluation:要旨評価のための想起指向型アンダースタディ)です。これは、 NIST(米国国立標準技術研究所)の文書理解会議における要約システムや翻訳システムで非常によく用いられています。ROUGEは、参照資料と呼ばれる人間が作成した要約の内容を、自動生成された要約がどの程度網羅しているかを、再現率に基づいて評価する指標です。自動生成された要約と、以前に人間が作成した要約との間で、 nグラムの重複を計算します。重要なトピックをすべて要約に含めるよう促すため、再現率に基づいて評価されます。再現率は、ユニグラム、バイグラム、トライグラム、または4グラムのマッチングに基づいて計算できます。例えば、ROUGE-1は、参照資料の要約に含まれるすべてのユニグラムのうち、参照資料の要約と自動生成された要約の両方に現れるユニグラムの割合です。参照資料の要約が複数ある場合は、それらのスコアを平均します。重複率が高いほど、2つの要約間で共通する概念が多いことを示します。
ROUGEは、結果が首尾一貫しているか、つまり文が論理的につながっているかどうかを判断することはできません。高次のnグラムROUGE指標は、ある程度役立ちます。
もう1つの未解決の問題は、照応解決です。同様に、画像要約については、Tschiatschekらは、画像要約アルゴリズムの性能を評価するVisual-ROUGEスコアを開発しました。[ 39 ]
ドメイン非依存の要約手法は、一般的な特徴のセットを適用して、情報量の多いテキストセグメントを識別します。最近の研究では、医学知識や医学テキストを要約するためのオントロジーなど、テキストのドメインに固有の知識を使用したドメイン固有の要約に焦点が当てられています。[ 40 ]
これまでの評価システムの主な欠点は、自動生成された要約とモデルを比較するために、参照要約(手法によっては複数)が必要となる点です。これは困難で費用のかかる作業です。テキストのコーパスとその対応する要約を作成するには、多大な労力が必要です。さらに、一部の手法では要約の手動アノテーションが必要となります(例:ピラミッド法のSCU)。加えて、これらの手法はすべて、異なる類似度指標に基づいて定量的な評価を行っています。
この分野での最初の出版物は1957年に遡り[ 41 ](ハンス・ペーター・ルーン)で、統計的手法から始まりました。2015年に研究が大幅に増加しました。 2016年までに用語頻度-逆文書頻度が使用されるようになりました。パターンベースの要約は、2016年までに発見された複数文書要約の最も強力なオプションでした。翌年には、潜在意味解析(LSA)と非負行列因子分解(NMF)の組み合わせによって追い抜かれました。これらは他のアプローチに取って代わることはなく、しばしばそれらと組み合わせて使用されますが、2019年までに機械学習手法は、成熟に近づいていると考えられる単一文書の抽出要約を支配しました。2020年までに、この分野は依然として非常に活発であり、研究は抽象的要約とリアルタイム要約へと移行しています。[ 42 ]
近年、従来型のRNN(LSTM )に代わるトランスフォーマーモデルの台頭により、テキストシーケンスを異なるタイプのテキストシーケンスにマッピングする柔軟性がもたらされ、自動要約に非常に適している。これには、T5 [ 43 ]やPegasus [ 44 ]などのモデルが含まれる。
{{cite book}}: CS1メンテナンス: 場所の発行元が見つかりません (リンク){{cite web}}: CS1 maint: タイトルとしてアーカイブされたコピー (リンク) CS1 maint: bot: 元の URL の状態が不明です (リンク){{cite book}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite book}}: CS1 maint: 複数の名前: 著者リスト (リンク)、グラスホッパーアルゴリズム{{cite book}}: CS1 maint: 複数の名前: 著者リスト (リンク)、STEM 研究と教育のための概念構造。