計算言語学におけるパラフレーズまたは言い換えは、言い換えを検出および生成する自然言語処理タスクです。言い換えの用途は、情報検索、質問応答、テキスト要約、盗作検出など多岐にわたります。[1]言い換えは、機械翻訳の評価にも役立ちます。[2]また、意味解析[3]や既存のコーパスを拡張するための新しいサンプルの生成[4]にも役立ちます。[5]
パラフレーズ生成
多重配列アライメント
BarzilayとLee [5]は、単一言語のパラレルコーパス、つまり同じ日の同じ出来事を扱ったニュース記事を使用してパラフレーズを生成する方法を提案した。トレーニングは、マルチシーケンスアライメントを使用して、注釈のないコーパスから文レベルのパラフレーズを生成することで構成される。これは、
- 個々のコーパスで繰り返し発生するパターンを見つける。例えば、「X(負傷者)Y人、Z重傷」など。ここで、X、Y、Zは変数である。
- 言い換えを表すパターン間のペアリングを見つける、つまり「XはY人を負傷させ、Zは重傷」と「YはXによって負傷し、そのうちZは重傷」
これは、まずn-gramオーバーラップを使用して類似の文をクラスタリングすることで実現されます。マルチシーケンス アライメントを使用して、クラスター内で繰り返しパターンが検出されます。次に、各クラスター内の変動性の高い領域、つまりクラスターの文の 50% 以上で共有されている単語間の領域を検出することで、引数の単語の位置が決定されます。次に、異なるコーパス間で類似の変数単語を比較することで、パターン間のペアリングが検出されます。最後に、ソース文に一致するクラスターを選択し、ソース文の引数をクラスター内の任意の数のパターンに置き換えることで、新しい言い換えを生成できます。
フレーズベースの機械翻訳
パラフレーズは、バナードとカリソン・バーチが提案したフレーズベースの翻訳を使用して生成することもできます。 [6]主な概念は、ピボット言語のフレーズを揃えて、元の言語で潜在的なパラフレーズを生成することです。たとえば、英語の文のフレーズ「under control」は、ドイツ語のフレーズ「unter kontrolle」と揃えられます。次に、フレーズ「unter kontrolle」は別のドイツ語の文に見つかり、揃えられた英語のフレーズは「under control」のパラフレーズである「in check」になります。
確率分布は としてモデル化できます。確率フレーズは の言い換えであり、これは全体にわたって合計したもの、つまりピボット言語での潜在的なフレーズ翻訳に相当します。さらに、文は、言い換えにコンテキストを追加するために事前として追加されます。したがって、最適な言い換えは、次のようにモデル化できます。
および は、単に頻度を取ることによって近似することができます。 を事前分布として追加することは、を に置き換えたときにが形成される確率を計算することによってモデル化されます。
長期短期記憶
長短期記憶(LSTM)モデルを使用して言い換えを生成することに成功している。[7]つまり、このモデルはエンコーダーとデコーダーのコンポーネントで構成され、どちらもスタックされた残差LSTMのバリエーションを使用して実装されています。まず、エンコーディングLSTMは、文中のすべての単語のワンホットエンコーディングを入力として受け取り、入力文を表すことができる最終的な隠しベクトルを生成します。デコーディングLSTMは、隠しベクトルを入力として受け取り、文末トークンで終了する新しい文を生成します。エンコーダーとデコーダーは、フレーズを受け取り、単純な確率的勾配降下法を使用して困惑を最小限に抑えることで、対応する言い換えのワンホット分布を再現するようにトレーニングされます。新しい言い換えは、新しいフレーズをエンコーダーに入力し、出力をデコーダーに渡すことによって生成されます。
トランスフォーマー
Transformerモデルの導入により、ニューラルネットワークパラメータをスケーリングし、フィードフォワード層を通じてトレーニングを大幅に並列化することで、言い換え生成アプローチのテキスト生成能力が向上しました。[8]これらのモデルはテキスト生成が非常に流暢であるため、人間の専門家は例が人間が作成したものか機械が作成したものかを識別することができません。[9] Transformerベースの言い換え生成は、自動エンコード、自己回帰、またはシーケンスツーシーケンス法に依存しています。自動エンコーダモデルは語彙のワンホット分布を使用して単語の置換候補を予測し、自己回帰モデルとseq2seqモデルは一度に1単語を予測するソースに基づいて新しいテキストを生成します。[10] [11]意味の保持や語彙の多様性など、事前に定義された品質の次元に従って言い換えを制御可能にするためのより高度な取り組みも存在します。[12]多くのTransformerベースの言い換え生成方法は、大量のトレーニングデータを活用して方法を拡張するために、教師なし学習に依存しています。[13] [14]
言い換え認識
再帰オートエンコーダ
言い換え認識は、Socherら[1]によって再帰オートエンコーダーを使用して試みられました。主な概念は、オートエンコーダーを再帰的に使用して、文とその構成要素のベクトル表現を生成することです。言い換えのベクトル表現は同様のベクトル表現を持つ必要があり、処理されてから、分類のためにニューラルネットワークに入力として送られます。
単語を含む文が与えられると、オートエンコーダは 2次元の単語埋め込みを入力として受け取り、 次元のベクトルを出力として生成するように設計されています。同じオートエンコーダが のすべての単語のペアに適用され、ベクトルが生成されます。次に、オートエンコーダは、単一のベクトルが生成されるまで、新しいベクトルを入力として再帰的に適用されます。入力が奇数の場合、最初のベクトルはそのまま次の再帰レベルに転送されます。オートエンコーダは、初期の単語埋め込みを含む完全な再帰ツリー内のすべてのベクトルを再現するようにトレーニングされます。
長さがそれぞれ 4 と 3 の2 つの文とが与えられると、オートエンコーダーは、初期の単語埋め込みを含む 7 と 5 のベクトル表現を生成します。次に、とのベクトルのすべての組み合わせ間でユークリッド距離が測定され、類似性マトリックス が生成されます。次に、は動的 min-プーリング層にかけられて、固定サイズのマトリックスが生成されます。はすべての潜在的な文間でサイズが均一ではないため、ほぼ均等なセクションに分割されます。次に、出力は平均 0、標準偏差 1 になるように正規化され、ソフトマックス出力を持つ完全接続層に送られます。動的プーリングからソフトマックスへのモデルは、既知の言い換えのペアを使用してトレーニングされます。
スキップ思考ベクトル
スキップ・ソート・ベクトルは、スキップ・グラム・モデルと同様に、文の意味のベクトル表現を作成する試みである。[15]スキップ・ソート・ベクトルは、エンコーダーと2つのデコーダーという3つの主要コンポーネントで構成されるスキップ・ソート・モデルを使用して生成されます。文書のコーパスが与えられると、スキップ・ソート・モデルは文を入力として受け取り、それをスキップ・ソート・ベクトルにエンコードするようにトレーニングされます。スキップ・ソート・ベクトルは、両方のデコーダーの入力として使用されます。1つは前の文を完全に再現しようとし、もう1つは次の文を完全に再現しようとします。エンコーダーとデコーダーは、再帰ニューラルネットワーク(RNN)またはLSTMを使用して実装できます。
言い換えは互いに同じ意味を持つため、同様のスキップ思考ベクトルを持つはずです。したがって、2 つのスキップ思考ベクトルの絶対差と成分ごとの積を入力として、単純なロジスティック回帰をトレーニングして、良好なパフォーマンスを得ることができます。
トランスフォーマー
Transformerモデルが言い換え生成に影響を与えたのと同様に、言い換えの識別への応用も大きな成功を収めました。BERTなどのモデルは、バイナリ分類レイヤーに適応でき、識別タスクでエンドツーエンドでトレーニングできます。[16] [17] Transformerは、ロジスティック回帰などの従来の機械学習手法と比較して、ドメインや言い換え手法間の転送で優れた結果を達成します。Transformerアーキテクチャに基づく他の成功した方法には、敵対的学習とメタ学習の使用が含まれます。[18] [19]
評価
言い換えを評価するには、複数の方法を使用できます。言い換え認識は分類問題として提起できるため、精度、f1スコア、ROC曲線などのほとんどの標準的な評価指標は比較的うまく機能します。ただし、特定のフレーズに対する言い換えの完全なリストを作成するのが難しく、優れた言い換えはコンテキストに依存するため、f1スコアの計算は困難です。これらの問題に対処するために設計された指標がParaMetricです。[20] ParaMetricは、自動言い換えシステムの精度と再現率を計算することを目的とし、言い換えの自動アライメントを類似フレーズの手動アライメントと比較します。ParaMetricはフレーズアライメントの品質を評価するだけなので、フレーズアライメントを生成プロセスの一部として使用していると仮定すると、言い換え生成システムの評価に使用できます。ParaMetricの顕著な欠点は、評価を生成する前に最初に作成しなければならない、大量かつ網羅的な手動アライメントのセットです。
言い換え生成の評価は、機械翻訳の評価と同様の困難を伴う。言い換えの質は、文脈、要約として使用されているかどうか、どのように生成されたかなど、さまざまな要因に依存する。さらに、良い言い換えは通常、元のフレーズとは語彙的に異なっている。言い換え生成を評価するために使用される最も簡単な方法は、人間の審査員を使用することである。残念ながら、人間の審査員による評価は時間がかかる傾向がある。評価への自動化アプローチは、本質的に言い換え認識と同じくらい難しい問題であるため、困難であることが判明している。もともと機械翻訳の評価に使用されていたバイリンガル評価アンダースタディ(BLEU)は、言い換え生成モデルの評価にも効果的に使用されてきた。しかし、言い換えには、語彙的に異なるが同等に有効な複数のソリューションが存在することが多く、BLEUやその他の同様の評価基準に悪影響を及ぼしている。[21]
言い換え生成を評価するために特別に設計された指標には、前述の ParaMetric に加えて、n グラム変更における言い換え (PINC) [21]と言い換え評価指標 (PEM) [22]があります。PINC は BLEU とともに使用して、BLEU の不十分さを補うために設計されています。BLEU は語彙の相違を測定するのが難しいため、PINC はソース文と候補となる言い換え間の n グラムの重複の欠如を測定します。これは本質的には文間のJaccard 距離であり、意味の同等性を維持するためにソース文に現れる n グラムを除外します。一方、PEM は、ピボット言語のN グラムの重複を使用して計算された単一の値ヒューリスティックを返すことで、言い換えの「適切性、流暢性、語彙の相違」を評価しようとします。ただし、PEM の大きな欠点は、大規模なドメイン内並列コーパスと人間の審査員を使用してトレーニングする必要があることです。[21]言い換え生成システムを評価することは、言い換え認識を訓練することと同等である。
Quoraの質問ペアデータセットには、数十万の重複した質問が含まれており、言い換え検出器の評価によく使われるデータセットとなっています。[23]一貫して信頼性の高い言い換え検出はすべてTransformerアーキテクチャを使用しており、質問ペアで微調整する前に、より一般的なデータで大量の事前トレーニングを行っています。
参照
参考文献
- ^ ab Socher, Richard; Huang, Eric; Pennington, Jeffrey; Ng, Andrew; Manning, Christopher (2011)、「Advances in Neural Information Processing Systems 24」、Dynamic Pooling and Unfolding Recursive Autoencoders for Paraphrase Detection、2018-01-06 にオリジナルからアーカイブ、 2017-12-29取得
- ^ Callison-Burch, Chris (2008 年 10 月 25 ~ 27 日)。パラレルコーパスから抽出された言い換えに対する統語的制約。EMNLP '08 Proceedings of the Conference on Empirical Methods in Natural Language Processing。ホノルル、ハワイ。pp. 196 ~ 205。
- ^ Berant, Jonathan、および Percy Liang。「言い換えによる意味解析」。計算言語学会第 52 回年次会議議事録 (第 1 巻: 長文論文)。第 1 巻。2014 年。
- ^ Wahle, Jan Philip; Ruas, Terry; Kirstein, Frederic; Gipp, Bela (2022). 「大規模言語モデルが機械言い換え盗用をどのように変革しているか」。2022年自然言語処理における経験的手法に関する会議の議事録。オンラインおよびアラブ首長国連邦アブダビ。pp. 952–963。arXiv :2210.03568。doi:10.18653 /v1/2022.emnlp-main.62。
{{cite book}}: CS1 メンテナンス: 場所が見つかりません 発行者 (リンク) - ^ ab Barzilay, Regina; Lee, Lillian (2003 年 5 月~6 月)。言い換えの学習: 複数シーケンスアライメントを使用した教師なしアプローチ。HLT-NAACL 2003 の議事録。
- ^ Bannard, Colin; Callison-Burch, Chris (2005). パラフレーズバイリンガルパラレルコーパス。ACL第43回年次会議議事録。ミシガン州アナーバー。pp. 597–604。
- ^ プラカシュ、アーディティヤ;ハサン、サディッド A.リー、キャシー。ダトラ、ヴィヴェク。カディール、アシュクル。リュー、ジョーイ。 Farri、Oladimeji (2016)、ステーク残差 LSTM ネットワークによるニューラル パラフレーズ生成、arXiv : 1610.03098、Bibcode :2016arXiv161003098P
- ^ Zhou, Jianing; Bhat, Suma (2021). 「パラフレーズ生成:最新技術の調査」。 2021年自然言語処理における経験的手法に関する会議の議事録。オンラインおよびプンタカナ、ドミニカ共和国:計算言語学協会。pp. 5075–5086。doi : 10.18653/ v1 /2021.emnlp-main.414。S2CID 243865349 。
- ^ Dou, Yao; Forbes, Maxwell; Koncel-Kedziorski, Rik; Smith, Noah; Choi, Yejin (2022). 「GPT-3テキストは人間のテキストと区別がつかないのか? Scarecrow:機械テキストを精査するためのフレームワーク」。計算言語学協会第60回年次会議の議事録(第1巻:長編論文)。 ダブリン、アイルランド: 計算言語学協会:7250–7274。arXiv:2107.01294。doi:10.18653/v1/2022.acl-long.501。S2CID 247315430。
- ^ Liu, Xianggen; Mou, Lili; Meng, Fandong; Zhou, Hao; Zhou, Jie; Song, Sen (2020). 「シミュレーテッドアニーリングによる教師なしパラフレーズ」。計算言語学会第58回年次会議の議事録。オンライン: 計算言語学会: 302–312。arXiv : 1909.03588。doi : 10.18653 / v1 /2020.acl-main.28。S2CID 202537332 。
- ^ Wahle, Jan Philip; Ruas, Terry; Meuschke, Norman; Gipp, Bela (2021). 「ニューラル言語モデルは優れた剽窃者か?ニューラルパラフレーズ検出のベンチマーク」。2021 ACM/IEEE Joint Conference on Digital Libraries (JCDL)。米国イリノイ州シャンペーン:IEEE。pp. 226–229。arXiv : 2103.12450。doi :10.1109 / JCDL52503.2021.00065。ISBN 978-1-6654-1770-9. S2CID 232320374。
- ^ Bandel, Elron; Aharonov, Ranit; Shmueli-Scheuer, Michal; Shnayderman, Ilya; Slonim, Noam; Ein-Dor, Liat (2022). 「品質管理された言い換え生成」。計算言語学協会第60回年次会議議事録(第1巻:長文論文)。ダブリン、アイルランド:計算言語学協会:596–609。arXiv :2203.10940。doi:10.18653 / v1/2022.acl-long.45。
- ^ Lee, John Sie Yuen; Lim, Ho Hung; Carol Webster, Carol (2022). 「複合名詞化の教師なし言い換え可能性予測」。2022年北米支部計算言語学会会議議事録: 人間言語技術。シアトル、米国: 計算言語学会。pp. 3254–3263。doi : 10.18653/ v1 /2022.naacl-main.237。S2CID 250390695 。
- ^ Niu, Tong; Yavuz, Semih; Zhou, Yingbo; Keskar, Nitish Shirish; Wang, Huan; Xiong, Caiming (2021). 「事前学習済み言語モデルによる教師なしパラフレーズ」。2021年自然言語処理における経験的手法に関する会議の議事録。オンラインおよびプンタカナ、ドミニカ共和国:計算言語学協会。pp. 5136–5150。doi : 10.18653/ v1 /2021.emnlp- main.417。S2CID 237497412 。
- ^ キロス、ライアン;朱裕坤。サラフトディノフ、ルスラン。リチャード・ゼメル。トラルバ、アントニオ。ウルタスン、ラケル。フィドラー、サンジャ (2015)、スキップ思考ベクトル、arXiv : 1506.06726、Bibcode :2015arXiv150606726K
- ^ デブリン、ジェイコブ; チャン、ミンウェイ; リー、ケントン; トゥタノバ、クリスティーナ (2019)。「2019年北部カンファレンス議事録」。2019年北部カンファレンス議事録。ミネソタ州ミネアポリス:計算言語学協会:4171–4186。doi :10.18653/v1/N19-1423。S2CID 52967399。
- ^ ヴァーレ、ヤン・フィリップ; ルアス、テリー; フォルティネク、トマーシュ; ミューシュケ、ノーマン; ギップ、ベラ(2022)、スミッツ、マルテ(編)、「機械による言い換え盗用の識別」、より良い世界のための情報:グローバルな未来の形成、vol。13192、チャム:シュプリンガーインターナショナルパブリッシング、pp。393〜413、arXiv:2103.11909、doi:10.1007 / 978-3-030-96957-8_34、ISBN 978-3-030-96956-1, S2CID 232307572 , 2022-10-06取得
- ^ Nighojkar, Animesh; Licato, John (2021). 「敵対的言い換えタスクによる言い換え検出の改善」。第59回計算言語学協会年次会議および第11回自然言語処理国際合同会議の議事録(第1巻:長文論文)。オンライン:計算言語学協会。pp. 7106–7116。doi : 10.18653/ v1 /2021.acl-long.552。S2CID 235436269 。
- ^ Dopierre, Thomas; Gravier, Christophe; Logerais, Wilfried (2021). 「ProtAugment: 教師なしの多様な言い換えによる意図検出メタ学習」。第59回計算言語学協会年次会議および第11回自然言語処理国際合同会議の議事録(第1巻:長文論文)。オンライン:計算言語学協会。pp. 2454–2466。doi : 10.18653/ v1 /2021.acl-long.191。S2CID 236460333 。
- ^ Callison-Burch, Chris; Cohn, Trevor; Lapata, Mirella (2008). ParaMetric : 言い換えの自動評価メトリック。第22回国際計算言語学会議の議事録。マンチェスター。pp. 97–104。doi : 10.3115 /1599081.1599094。S2CID 837398 。
- ^ abc Chen, David; Dolan, William (2008). パラフレーズ評価のための高度並列データの収集。計算言語学会第49回年次会議議事録: 人間言語技術。オレゴン州ポートランド。pp. 190–200。
- ^ Liu, Chang; Dahlmeier, Daniel; Ng, Hwee Tou (2010)。PEM: 並列テキストを利用した言い換え評価メトリック。2010 年自然言語処理における実証的手法に関する会議の議事録。MIT、マサチューセッツ州。pp. 923–932。
- ^ 「Quora の質問ペアにおける言い換え識別」。コード付き論文。
外部リンク
- Microsoft Research パラフレーズ コーパス - ニュース記事から抽出された 5,800 組の文章で構成されるデータセット。文章のペアが意味的に同等であるかどうかが注釈として付けられています。
- パラフレーズデータベース (PPDB) - 16 の異なる言語で何百万ものパラフレーズを含む検索可能なデータベース
