自然言語処理 において、文埋め込み (または文書埋め込み)とは、意味のある意味情報を符号化した数値ベクトルとして自然言語テキストを表現することである [ 1 ] [ 2 ] [ 3 ] [ 4 ] [ 5 ] [ 6 ] [ 7 ] 。この名称は、当初は文よりも長いテキストのシーケンスを埋め込むというアプローチの限界に由来するが、これはもはや限界ではない。
最先端の埋め込みは、専用の文変換モデルの学習された隠れ層表現に基づいています。BERTは 、モデルに入力される各文の先頭に専用の [CLS] トークンを付加するアプローチを先駆的に採用しました。このトークンの最終的な隠れ状態ベクトルは文に関する情報をエンコードし、文分類タスクで使用するために微調整できます。しかし実際には、[CLS] トークンを使用した BERT の文埋め込みは、非文脈的単語埋め込みを単純に平均化するよりもパフォーマンスが劣ることがよくあります[ 8 ] 。SBERTは 後に、SNLI データセットでシャムニューラルネットワーク アーキテクチャを使用して BERT の [CLS] トークン埋め込みを微調整することで、優れた文埋め込みパフォーマンスを達成しました[ 8 ] 。
他のアプローチは、文に適用される分布意味論 の考え方を大まかに基にしている。Skip -Thoughtは、隣接する文の予測タスクのためにエンコーダー・デコーダー構造を学習するが、 InferSent やSBERTなどのアプローチよりも性能が劣ることが示されている。
別の方向性としては、Word2vec が返す単語埋め込みなどを集約して文埋め込み を作成する方法があります。最も単純なアプローチは、単語ベクトルの平均を計算することで、これは連続単語バッグ (CBOW) として知られています。[ 9 ] しかし、単語ベクトルの量子化に基づくより高度なソリューションも提案されています。そのようなアプローチの 1 つは、局所的に集約された単語埋め込みのベクトル (VLAWE) であり、[ 10 ] 下流のテキスト分類タスクでパフォーマンスの向上を示しました。
アプリケーション 近年、文埋め込みは、意味検索のためのベクトルインデックスの使用を通じて、自然言語クエリ可能な知識ベースへの応用により、ますます注目を集めています。たとえば、 LangChain は 、文書のインデックス作成のために文トランスフォーマーを使用しています。具体的には、文書のチャンクの埋め込みを生成し、(文書チャンク、埋め込み)タプルを保存することでインデックスが作成されます。次に、自然言語のクエリが与えられると、クエリの埋め込みを生成できます。その後、クエリ埋め込みと文書チャンク埋め込みの間でトップ k 類似度検索アルゴリズムを使用して、質問応答 タスクのコンテキスト情報として最も関連性の高い文書チャンクを取得します。このアプローチは、正式には検索拡張生成 としても知られています。[ 11 ]
BERTScoreほど普及しているわけではありませんが、文埋め込みは文類似性の評価によく用いられ、大規模言語モデル の生成パラメータを最適化するタスクでよく利用されています。この最適化は、候補文と参照文を比較することによって行われることがよくあります。候補文と参照文の文埋め込みのコサイン類似度を評価関数として使用することで、グリッドサーチアルゴリズムを利用してハイパーパラメータの最適化を 自動化できます。
外部リンク InferSentの文埋め込みとトレーニングコード ユニバーサルセンテンスエンコーダー 大規模マルチタスク学習による汎用分散文表現の学習
参考文献 ↑ バーカン、オーレン。ラジン、ノーム。マルキエル、イツィク。カッツ、オリ。カシウラル、アヴィ。ケーニヒシュタイン、ノーム (2019)。 「抽出された文の埋め込みによるスケーラブルな注意深い文ペアのモデリング」。arXiv : 1908.05161 [ cs.LG ]。 ↑ ユニバーサル単語埋め込みと文埋め込みの最新ベスト ↑ サー、ダニエル。ヤン、インフェイ。コン・シェンイー。フア、ナン。リムティアコ、ニコール。ジョン、ロムニ通り。コンスタント、ノア。グアハルド=セスペデス、マリオ。ユアン、スティーブ。タール、クリス。ソン、ユンシュアン。ストロープ、ブライアン。レイ・カーツワイル (2018)。 「ユニバーサルセンテンスエンコーダー」。 arXiv : 1803.11175 [ cs.CL ]。 ↑ ウー、レデル。フィッシュ、アダム。チョプラ、スミット。アダムズ、キース。ボルデス、アントワーヌ。ウェストン、ジェイソン (2017)。 「StarSpace: あらゆるものを埋め込みます!」。 arXiv : 1709.03856 [ cs.CL ]。 ↑ Sanjeev Arora、Yingyu Liang、Tengyu Ma。「文埋め込みのためのシンプルだが打ち破るのが難しいベースライン」、2016年; openreview:SyK00v5xx。 ↑ トリファン、ミルチャ。イヨネスク、ボグダン。ガデア、クリスティアン。ダン・イオネスク (2015)。 「意味解析のためのグラフデジタル信号処理手法」。 2015 年の応用計算知能と情報学に関する IEEE 10 回ジュビリー国際シンポジウム 。 pp. 187–192 。 土井 : 10.1109/SACI.2015.7208196 。 ISBN 978-1-4799-9911-8 . S2CID 17099431 . ↑ Basile, Pierpaolo; Caputo, Annalina; Semeraro, Giovanni (2012). "分布空間における単語の構成的意味論に関する研究". 2012 IEEE Sixth International Conference on Semantic Computing . pp. 154–161 . doi : 10.1109/ICSC.2012.55 . ISBN 978-1-4673-4433-3 . S2CID 552921 . 1 2 Reimers, Nils; Gurevych, Iryna (2019). "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks". arXiv : 1908.10084 [ cs.CL ]. ↑ Mikolov, Tomas; Chen, Kai; Corrado, Greg; Dean, Jeffrey (2013-09-06). "ベクトル空間における単語表現の効率的な推定". arXiv : 1301.3781 [ cs.CL ]. ↑ Ionescu, Radu Tudor; Butnaru, Andrei (2019). "Vector of Locally-Aggregated Word Embeddings (" . Proceedings of the 2019 Conference of the North . Minneapolis, Minnesota: Association for Computational Linguistics. pp. 363– 369. doi : 10.18653/v1/N19-1033 . S2CID 85500146 . ↑ Lewis, Patrick; Perez, Ethan; Piktus, Aleksandra; Petroni, Fabio; Karpukhin, Vladimir; Goyal, Naman; Küttler, Heinrich; Lewis, Mike; Yih, Wen-tau; Rocktäschel, Tim; Riedel, Sebastian; Kiela, Douwe (2020). "Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks". arXiv : 2005.11401 [ cs.CL ]. ↑ マルコ・マレッリ、ステファノ・メニーニ、マルコ・バローニ、ルイーザ・ベンティヴォーリ、ラファエラ・ベルナルディ、ロベルト・ザンパレッリ。 「構成分布意味論的モデルの評価のための病気の治療法。」 LREC、216 ~ 223 ページ。 2014年。 ↑ Cer, Daniel; Diab, Mona; Agirre, Eneko; Lopez-Gazpio, Iñigo; Specia, Lucia (2017 年 8 月). Bethard, Steven; Carpuat, Marine; Apidianaki, Marianna; Mohammad, Saif M.; Cer, Daniel; Jurgens, David (編). "SemEval-2017 タスク 1: 意味的テキスト類似性 多言語およびクロスリンガルに焦点を当てた評価" . 第 11 回国際意味評価ワークショップ (SemEval-2017) 議事録 . カナダ、バンクーバー: 計算言語学会: 1– 14. arXiv : 1708.00055 . doi : 10.18653/v1/S17-2001 . ↑ Thakur, Nandan; Reimers, Nils; Rücklé, Andreas; Srivastava, Abhishek; Gurevych, Iryna (2021-08-29). "BEIR: 情報検索モデルのゼロショット評価のための異種ベンチマーク" . ↑ Muennighoff, Niklas; Tazi, Nouamane; Magne, Loic; Reimers, Nils (2023 年 5 月). Vlachos, Andreas; Augenstein, Isabelle (編). "MTEB: Massive Text Embedding Benchmark" . Proceedings of the 17th Conference of the European Chapter of the Association for Computational Linguistics . Dubrovnik, Croatia: Association for Computational Linguistics: 2014– 2037. doi : 10.18653/v1/2023.eacl-main.148 . ↑ エネヴォルセン、ケネス。チョン、アイザック。ケルブア、イメネ。カルドス、マートン。マーサー、アシュウィン。タップ、デイビッド。ガラ、ジェイ。シブリニ、ウィサム。クルシェミンスキー、ドミニク (2025-02-19)。 「MMTEB: 大規模な多言語テキスト埋め込みベンチマーク」 。 arXiv.org 。 2026 年 6 月 8 日 に取得 。