潜在意味解析 ( LSA ) は、 自然言語処理 、特に分布意味論 における手法であり、文書と用語に関連する概念のセットを生成することによって、一連の文書とそれらに含まれる用語間の関係を分析します。LSA は、意味が近い単語は類似したテキストに現れるという仮定 (分布仮説 ) に基づいています。大きなテキストから、文書ごとの単語数を含む行列 (行は固有の単語を表し、列は各文書を表す) が作成され、特異値分解 (SVD) と呼ばれる数学的手法を使用して、列間の類似性構造を維持しながら行数を削減します。次に、任意の 2 つの列間のコサイン類似度 によって文書が比較されます。1 に近い値は非常に類似した文書を表し、0 に近い値は非常に類似していない文書を表します。[ 1 ]
潜在意味構造を用いた情報検索技術は、1988年にスコット・ディアウェスター、スーザン・デュマイス、ジョージ・ファーナス、リチャード・ハーシュマン、トーマス・ランダウアー、カレン・ロックバウム、リン・ストリーターによって特許取得され ました [ 2 ] 。 情報 検索へ の 応用という 文脈で は、潜在 意味インデックス (LSI )と呼ばれることもあります[ 3 ] 。
概要 文書-単語マトリックスにおけるトピック検出プロセスのアニメーション。各列は文書に対応し、各行は単語に対応します。セルには文書内の単語の重み(tf-idf など)が格納され、暗いセルは重みが高いことを示します。LSAは、類似した単語を含む文書と、類似した文書セットに出現する単語の両方をグループ化します。結果として得られるパターンは、潜在的成分を検出するために使用されます。[ 4 ]
発生マトリックス LSAは、文書中の用語の出現頻度を表す文書-用語行列 を使用できます。これは、行が用語に対応し、列が文書に対応する 疎行列 です。行列の要素の重み付けの典型的な例は、tf-idf (用語頻度-逆文書頻度)です。行列の要素の重みは、各文書における用語の出現回数に比例し、出現頻度の低い用語は相対的な重要性を反映するために重みが高くなります。
この行列は標準的な意味モデルにも共通して用いられますが、行列の数学的性質が常に利用されるとは限らないため、必ずしも明示的に行列として表現されるとは限りません。
階級降格 出現行列の構築後、LSAは用語文書行列 の低ランク近似 [ 5 ] を見つけます。これらの近似にはさまざまな理由が考えられます。
元の用語-文書行列は計算リソースに対して大きすぎると想定されるため、この場合、近似された低ランク行列は近似値 (「最小限かつ必要な悪」)として解釈される。 元の用語-文書行列にはノイズが含まれ ていると想定されます。例えば、用語の事例的な出現は除去する必要があります。この観点から、近似行列はノイズが除去された行列 (元の行列よりも優れた行列)と解釈されます。 元の用語-文書マトリックスは、「真の」用語-文書マトリックスに比べて過度に疎であると想定されます。つまり、元のマトリックスには各文書 に実際に含まれている単語しかリストされていませんが、実際には各文書 に関連する すべての単語に関心があるかもしれません。同義語の 存在により、通常ははるかに大きな単語のセットになります。 ランクを下げることの結果として、いくつかの次元が結合され、複数の項に依存するようになる。
{(車), (トラック), (花)} → {(1.3452 * 車 + 0.2828 * トラック), (花)} これにより、同義語の識別に関する問題が軽減されます。ランクを下げることで、類似の意味を持つ用語に関連付けられた次元が統合されることが期待されるためです。また、多義語 の問題も部分的に軽減されます。多義語の構成要素のうち、「正しい」方向を指すものは、類似の意味を持つ単語の構成要素に追加されるためです。逆に、他の方向を指す構成要素は、単純に相殺されるか、最悪の場合でも、意図した意味に対応する方向の構成要素よりも小さくなる傾向があります。
導出 させてX {\displaystyle X} 要素が( 私 、 j ) {\displaystyle (i,j)} 用語の発生について説明します私 {\displaystyle i} 文書内j {\displaystyle j} (これは例えば、周波数などである。)X {\displaystyle X} 表示は次のようになります。
d j ↓ t 私 T → [ x 1 、 1 … x 1 、 j … x 1 、 n ⋮ ⋱ ⋮ ⋱ ⋮ x 私 、 1 … x 私 、 j … x 私 、 n ⋮ ⋱ ⋮ ⋱ ⋮ x m 、 1 … x m 、 j … x m 、 n ] {\displaystyle {\begin{matrix}&{\textbf {d}}_{j}\\&\downarrow \\{\textbf {t}}_{i}^{T}\rightarrow &{\begin{bmatrix}x_{1,1}&\dots &x_{1,j}&\dots &x_{1,n}\\\vdots &\ddots &\vdots &\ddots &\vdots \\x_{i,1}&\dots &x_{i,j}&\dots &x_{i,n}\\\vdots &\ddots &\vdots &\ddots &\vdots \\x_{m,1}&\dots &x_{m,j}&\dots &x_{m,n}\\\end{bmatrix}}\end{matrix}}} この行列の各行は、用語に対応するベクトルとなり、各文書との関連性を示します。
t 私 T = [ x 私 、 1 … x 私 、 j … x 私 、 n ] {\displaystyle {\textbf {t}}_{i}^{T}={\begin{bmatrix}x_{i,1}&\dots &x_{i,j}&\dots &x_{i,n}\end{bmatrix}}} 同様に、この行列の各列は文書に対応するベクトルとなり、各用語との関係を示します。
d j = [ x 1 、 j ⋮ x 私 、 j ⋮ x m 、 j ] {\displaystyle {\textbf {d}}_{j}={\begin{bmatrix}x_{1,j}\\\vdots \\x_{i,j}\\\vdots \\x_{m,j}\\\end{bmatrix}}} 今度はドット積 t 私 T t p {\displaystyle {\textbf {t}}_{i}^{T}{\textbf {t}}_{p}} 2 つの用語ベクトル間の行列積 は、文書セット全体における用語間の相関関係を示します。 X X T {\displaystyle XX^{T}} これらすべてのドット積を含みます。要素( 私 、 p ) {\displaystyle (i,p)} (要素と等しい)( p 、 私 ) {\displaystyle (p,i)} ) にはドット積が含まれていますt 私 T t p {\displaystyle {\textbf {t}}_{i}^{T}{\textbf {t}}_{p}} (= t p T t 私 {\displaystyle ={\textbf {t}}_{p}^{T}{\textbf {t}}_{i}} )同様に、行列X T X {\displaystyle X^{T}X} すべての文書ベクトル間の内積を含み、用語間の相関関係を示します。d j T d q = d q T d j {\displaystyle {\textbf {d}}_{j}^{T}{\textbf {d}}_{q}={\textbf {d}}_{q}^{T}{\textbf {d}}_{j}} 。
さて、線形代数の理論から、分解が存在する。X {\displaystyle X} そのためU {\displaystyle U} そしてV {\displaystyle V} は直交行列 であり、Σ {\displaystyle \Sigma } これは対角行列 です。これは特異値分解 (SVD)と呼ばれます。
X = U Σ V T {\displaystyle {\begin{matrix}X=U\Sigma V^{T}\end{matrix}}} 用語と文書の相関関係を示す行列積は次のようになります。
X X T = ( U Σ V T ) ( U Σ V T ) T = ( U Σ V T ) ( V T T Σ T U T ) = U Σ V T V Σ T U T = U Σ Σ T U T X T X = ( U Σ V T ) T ( U Σ V T ) = ( V T T Σ T U T ) ( U Σ V T ) = V Σ T U T U Σ V T = V Σ T Σ V T {\displaystyle {\begin{matrix}XX^{T}&=&(U\Sigma V^{T})(U\Sigma V^{T})^{T}=(U\Sigma V^{T})(V^{T^{T}}\Sigma ^{T}U^{T})=U\Sigma V^{T}V\Sigma ^{T}U^{T}=U\Sigma \Sigma ^{T}U^{T}\\X^{T}X&=&(U\Sigma V^{T})^{T}(U\Sigma V^{T})=(V^{T^{T}}\Sigma ^{T}U^{T})(U\Sigma V^{T})=V\Sigma ^{T}U^{T}U\Sigma V^{T}=V\Sigma ^{T}\Sigma V^{T}\end{matrix}}} 以来Σ Σ T {\displaystyle \Sigma \Sigma ^{T}} そしてΣ T Σ {\displaystyle \Sigma ^{T}\Sigma } 斜めになっているのを見ると、U {\displaystyle U} の固有ベクトル を含まなければならないX X T {\displaystyle XX^{T}} 、 その間V {\displaystyle V} は、X T X {\displaystyle X^{T}X} 両方の積は、次の非ゼロ要素によって与えられる同じ非ゼロ固有値を持つ。Σ Σ T {\displaystyle \Sigma \Sigma ^{T}} または同様に、ゼロ以外のエントリによってΣ T Σ {\displaystyle \Sigma ^{T}\Sigma } 分解結果は以下のようになります。
X U Σ V T ( d j ) ( d ^ j ) ↓ ↓ ( t 私 T ) → [ x 1 、 1 … x 1 、 j … x 1 、 n ⋮ ⋱ ⋮ ⋱ ⋮ x 私 、 1 … x 私 、 j … x 私 、 n ⋮ ⋱ ⋮ ⋱ ⋮ x m 、 1 … x m 、 j … x m 、 n ] = ( t ^ 私 T ) → [ [ u 1 ] … [ u l ] ] ⋅ [ σ 1 … 0 ⋮ ⋱ ⋮ 0 … σ l ] ⋅ [ [ v 1 ] ⋮ [ v l ] ] {\displaystyle {\begin{matrix}&X&&&U&&\Sigma &&V^{T}\\&({\textbf {d}}_{j})&&&&&&&({\hat {\textbf {d}}}_{j})\\&\downarrow &&&&&&&\downarrow \\({\textbf {t}}_{i}^{T})\rightarrow &{\begin{bmatrix}x_{1,1}&\dots &x_{1,j}&\dots &x_{1,n}\\\vdots &\ddots &\vdots &\ddots &\vdots \\x_{i,1}&\dots &x_{i,j}&\dots &x_{i,n}\\\vdots &\ddots &\vdots &\ddots &\vdots \\x_{m,1}&\dots &x_{m,j}&\dots &x_{m,n}\\\end{bmatrix}}&=&({\hat {\textbf {t}}}_{i}^{T})\rightarrow &{\begin{bmatrix}{\begin{bmatrix}\,\\\,\\{\textbf {u}}_{1}\\\,\\\,\end{bmatrix}}\dots {\begin{bmatrix}\,\\\,\\{\textbf {u}}_{l}\\\,\\\,\end{bmatrix}}\end{bmatrix}}&\cdot &{\begin{bmatrix}\sigma _{1}&\dots &0\\\vdots &\ddots &\vdots \\0&\dots &\sigma _{l}\\\end{bmatrix}}&\cdot &{\begin{bmatrix}{\begin{bmatrix}&&{\textbf {v}}_{1}&&\end{bmatrix}}\\\vdots \\{\begin{bmatrix}&&{\textbf {v}}_{l}&&\end{bmatrix}}\end{bmatrix}}\end{matrix}}} 値σ 1 、 … 、 σ l {\displaystyle \sigma _{1},\dots ,\sigma _{l}} これらは特異値と呼ばれ、u 1 、 … 、 u l {\displaystyle u_{1},\dots ,u_{l}} そしてv 1 、 … 、 v l {\displaystyle v_{1},\dots ,v_{l}} 左特異ベクトルと右特異ベクトル。U {\displaystyle U} それはt 私 {\displaystyle {\textbf {t}}_{i}} は私 'th {\displaystyle i{\textrm {'th}}} 行。この行ベクトルを と呼ぶことにします。t ^ 私 T {\displaystyle {\hat {\textrm {t}}}_{i}^{T}} 同様に、V T {\displaystyle V^{T}} それはd j {\displaystyle {\textbf {d}}_{j}} はj 'th {\displaystyle j{\textrm {'th}}} カラム、d ^ j {\displaystyle {\hat {\textrm {d}}}_{j}} これらは固有ベクトルではありませんが、 すべての 固有ベクトルに依存します。
選択すると、k {\displaystyle k} 最大の特異値と、それに対応する特異ベクトルU {\displaystyle U} そしてV {\displaystyle V} ランクを獲得k {\displaystyle k} 近似値X {\displaystyle X} 最小誤差(フロベニウスノルム )で。この近似は最小限の誤差を持ちます。しかし、より重要なのは、用語ベクトルと文書ベクトルを「意味空間」として扱うことができるようになったことです。行「用語」ベクトルt ^ 私 T {\displaystyle {\hat {\textbf {t}}}_{i}^{T}} そして、k {\displaystyle k} それを低次元空間にマッピングするエントリ。これらの新しい次元は、理解可能な概念とは一切関係ありません。これらは高次元空間の低次元近似です。同様に、「ドキュメント」ベクトルも同様です。d ^ j {\displaystyle {\hat {\textbf {d}}}_{j}} これは、この低次元空間における近似値です。この近似値を次のように記述します。
X k = U k Σ k V k T {\displaystyle X_{k}=U_{k}\Sigma _{k}V_{k}^{T}} これで以下の操作が可能になります。
関連文書を見るj {\displaystyle j} そしてq {\displaystyle q} ベクトルを比較することで、低次元空間にあることがわかります。Σ k ⋅ d ^ j {\displaystyle \Sigma _{k}\cdot {\hat {\textbf {d}}}_{j}} そしてΣ k ⋅ d ^ q {\displaystyle \Sigma _{k}\cdot {\hat {\textbf {d}}}_{q}} (通常はコサイン類似度 による)。 用語の比較私 {\displaystyle i} そしてp {\displaystyle p} ベクトルを比較することによってΣ k ⋅ t ^ 私 {\displaystyle \Sigma _{k}\cdot {\hat {\textbf {t}}}_{i}} そしてΣ k ⋅ t ^ p {\displaystyle \Sigma _{k}\cdot {\hat {\textbf {t}}}_{p}} 。 ご了承くださいt ^ {\displaystyle {\hat {\textbf {t}}}} これは列ベクトルになりました。 文書や用語ベクトル表現は、コサイン類似度などの類似度尺度を用いて、k-meansなどの従来型のクラスタリングアルゴリズムでクラスタリングすることができる。 クエリが与えられたら、それをミニドキュメントとみなし、低次元空間にあるドキュメントと比較します。 後者を実行するには、まずクエリを低次元空間に変換する必要があります。その際、ドキュメントに適用するのと同じ変換を使用する必要があることは直感的に理解できます。
d ^ j = Σ k − 1 U k T d j {\displaystyle {\hat {\textbf {d}}}_{j}=\Sigma _{k}^{-1}U_{k}^{T}{\textbf {d}}_{j}} ここで、対角行列の逆行列はΣ k {\displaystyle \Sigma _{k}} 行列内の各非ゼロ値を反転させることで求めることができる。
これは、クエリベクトルがある場合q {\displaystyle q} 翻訳はあなたが行う必要がありますq ^ = Σ k − 1 U k T q {\displaystyle {\hat {\textbf {q}}}=\Sigma _{k}^{-1}U_{k}^{T}{\textbf {q}}} 低次元空間の文書ベクトルと比較する前に、以下の手順を実行してください。擬似用語ベクトルについても同様の手順を実行できます。
t 私 T = t ^ 私 T Σ k V k T {\displaystyle {\textbf {t}}_{i}^{T}={\hat {\textbf {t}}}_{i}^{T}\Sigma _{k}V_{k}^{T}} t ^ 私 T = t 私 T V k − T Σ k − 1 = t 私 T V k Σ k − 1 {\displaystyle {\hat {\textbf {t}}}_{i}^{T}={\textbf {t}}_{i}^{T}V_{k}^{-T}\Sigma _{k}^{-1}={\textbf {t}}_{i}^{T}V_{k}\Sigma _{k}^{-1}} t ^ 私 = Σ k − 1 V k T t 私 {\displaystyle {\hat {\textbf {t}}}_{i}=\Sigma _{k}^{-1}V_{k}^{T}{\textbf {t}}_{i}}
アプリケーション 新しい低次元空間は、一般的に以下の目的で使用できます。
低次元空間で文書を比較する(データクラスタリング 、文書分類 )。 翻訳された文書の基本セットを分析した後、言語を超えて類似の文書を見つける(異言語情報検索 )。 用語間の関係(同義語 と多義語 )を見つける。 用語のクエリが与えられたら、それを低次元空間に変換し、一致する文書を見つける(情報検索 )。 多肢選択式問題(MCQ) の解答モデルのように、意味論的な方法(つまり知識コーパスの文脈において)で、少数の用語グループ間の最も類似した類似性を見つけます。[ 6 ] 機械学習/テキストマイニングシステムの特徴空間を拡張する[ 7 ] テキストコーパス内の単語の関連性を分析する[ 8 ] 同義語と多義語は、自然言語処理 における根本的な問題である。
同義語とは、異なる単語が同じ概念を表す現象のことです。そのため、検索エンジンでクエリを実行しても、クエリに含まれる単語が含まれていない関連文書は取得できない場合があります。例えば、「doctors」で検索しても、「physicians 」という単語を含む文書は返されない可能性があります。これらの単語は同じ意味を持つにもかかわらずです。 多義性とは、同じ単語が複数の意味を持つ現象のことです。そのため、検索によって、目的の単語が誤った意味で含まれている無関係な文書が取得される可能性があります。例えば、「木」という単語を探している植物学者とコンピュータ科学者では、おそらく異なる文書セットを必要とするでしょう。
人間の記憶への応用 潜在意味解析の使用は、人間の記憶の研究、特に自由想起 と記憶検索の分野で広く行われてきました。[ 10 ] [ 11 ] ランダムな普通名詞の学習リストを使用した自由想起課題において、2 つの単語の意味的類似性 (LSA で測定) と単語が連続して想起される確率の間には正の相関があります。また、このような状況では、類似した単語間の応答間隔は、類似していない単語間の応答間隔よりもはるかに速いことも指摘されています。これらの発見は意味的近接効果 と呼ばれています。[ 12 ]
参加者が学習した項目を思い出す際に間違いを犯した場合、これらの間違いは、目的の項目と意味的に関連が深く、以前に学習したリストに含まれていた項目である傾向がありました。これらの以前のリストの侵入と呼ばれるものは、現在のリストの項目と想起をめぐって競合しているようです。[ 13 ]
単語連想空間 (WAS)と呼ばれる別のモデルも記憶研究で使用されており、一連の実験から自由連想データを収集し、72,000を超える異なる単語ペアの単語関連性の尺度が含まれています。[ 14 ]
制限事項 LSAの欠点には以下のようなものがある。
結果として得られる寸法は解釈が難しい場合がある。例えば、 {(車), (トラック), (花)} ↦ {(1.3452 * 車 + 0.2828 * トラック), (花)} (1.3452 * 車 + 0.2828 * トラック) の要素は「車両」と解釈される可能性があります。ただし、 {(車), (ボトル), (花)} ↦ {(1.3452 * 車 + 0.2828 *ボトル ), (花)} 発生します。これは、数学的には正当化できるものの、自然言語ではすぐには明らかな意味を持たない結果につながります。ただし、(1.3452 * 車 + 0.2828 * ボトル)の要素は、ボトルと車の両方に透明な部分と不透明な部分があり、人工物であり、表面にロゴや単語が含まれている可能性が高いため正当化できます。したがって、多くの点で、これら 2 つの概念は「意味を共有」しています。つまり、問題となっている言語内では、割り当て可能な単語がすぐに見つからない場合があり、説明可能性は、単純な単語/クラス/概念の割り当てタスクではなく、分析タスクになります。 LSA は、単語が空間内の単一の点として表現されるため、単語の各出現が同じ意味を持つものとして扱われるため、多義性 (つまり、単語の複数の意味) を部分的にしか捉えることができません。たとえば、「The Chair of the Board」を含む文書と、「the chair maker」を含む別の文書における「chair」の出現は同じものとみなされます。この動作により、ベクトル表現はコーパス内の単語のすべての異なる意味の平均となり、比較が難しくなる場合があります。 [ 20 ] ただし、単語がコーパス全体で支配的な意味 を持つ (つまり、すべての意味が等しく起こりやすいわけではない) ため、この影響はしばしば軽減されます。 単語のバッグモデル (BOW)の限界。BOWでは、テキストは順序付けされていない単語の集合として表現されます。単語のバッグモデル (BOW)の限界に対処するために、マルチグラム 辞書を使用して、用語間の直接的および間接的な関連、ならびに高次の 共起 を見つけることができます。[ 21 ] LSAの確率モデル は観測データと一致しません。LSAは単語と文書がガウス 分布(エルゴード仮説 )を形成すると仮定していますが、ポアソン分布が観測されています。そのため、 多項 モデルに基づく確率的潜在意味解析 という新しい代替手法があり、これは標準的なLSAよりも優れた結果をもたらすと報告されています。[ 22 ]
代替方法
セマンティックハッシュ セマンティックハッシュ[ 23 ] では、意味的に類似した文書が近くのアドレスに配置されるように、ニューラルネットワーク を使用して文書をメモリ アドレスにマッピングします。ディープ ニューラル ネットワークは、 基本的に、多数の文書から得られた単語数ベクトルのグラフィカル モデル を構築します。クエリ ドキュメントに類似した文書は、クエリ ドキュメントのアドレスからわずか数ビットだけ異なるすべてのアドレスにアクセスするだけで見つけることができます。ハッシュ コーディングの効率を近似マッチングに拡張するこの方法は、局所性敏感ハッシュ と密接に関連しています。
潜在意味インデックス 潜在意味インデックス ( LSI ) は、 特異値分解 (SVD)と呼ばれる数学的手法を使用して、非構造化テキストの集合に含まれる用語 と概念 間の関係のパターンを識別するインデックス作成および検索方法です。LSI は、同じ文脈で使用される単語は似た意味を持つ傾向があるという原則に基づいています。LSI の重要な特徴は、類似した文脈 で出現する用語間の関連性を確立することによって、テキストの本体 の概念的内容を抽出できることです。[ 24 ]
LSIは、1970年代初頭にジャン=ポール・ベンゼクリ [ 25 ] によって開発された多変量統計手法である対応分析を、文書中の単語数から構築された 分割表 に適用したものでもある。
テキストの集合に潜在する 意味的に 関連する用語を相関させる能力があることから「潜在意味インデックス」と呼ばれ、1980年代後半に ベルコア で初めてテキストに適用されました。潜在意味解析(LSA)とも呼ばれるこの手法は、テキスト本文中の単語の使用における潜在的な意味構造を明らかにし、概念検索と呼ばれるユーザーのクエリに応じてテキストの意味を抽出するためにどのように使用できるかを示します。LSIが適用された一連の文書に対するクエリ、つまり概念検索は、結果が検索条件と特定の単語を共有していなくても、検索条件と概念的に意味が類似した結果を返します。
LSIの利点 LSIは、ブールキーワードクエリ やベクトル空間モデルの最も厄介な制約の1つである再現率を高めることで、同義語の問題を克服するのに役立ちます。 [ 20 ] 同義語は、文書の作成者と情報検索 システムの利用者が使用する語彙の不一致の原因となることがよくあります。[ 26 ] その結果、ブールクエリやキーワードクエリは、無関係な結果を返したり、関連する情報を見逃したりすることがよくあります。
LSI は、文書の自動分類を 実行するためにも使用されます。実際、いくつかの実験では、LSI と人間がテキストを処理および分類する方法の間には多くの相関関係があることが実証されています。[ 27 ] 文書分類とは、カテゴリの概念的内容との類似性に基づいて、文書を 1 つ以上の事前定義されたカテゴリに割り当てることです。[ 28 ] LSI は、例と なる文書を使用して、各カテゴリの概念的基盤を確立します。分類処理中、分類対象の文書に含まれる概念が例となる項目に含まれる概念と比較され、文書に含まれる概念と例となる文書に含まれる概念との類似性に基づいて、文書にカテゴリ (または複数のカテゴリ) が割り当てられます。
LSIを使用すれば、文書の概念的内容に基づいた動的なクラスタリングも実現できます。クラスタリングとは、各クラスタの概念的基盤を確立するためのサンプル文書を使用せずに、文書同士の概念的な類似性に基づいて文書をグループ化する方法です。これは、未知の非構造化テキストの集合を扱う場合に非常に役立ちます。
LSIは厳密に数学的なアプローチを採用しているため、本質的に言語に依存しません。これにより、LSIは辞書やシソーラスなどの補助構造を使用することなく、あらゆる言語で書かれた情報の意味内容を抽出できます。LSIは、言語横断的な概念検索 や事例に基づく分類も実行できます。例えば、英語などの1つの言語でクエリを実行すると、それが全く異なる言語や複数の言語で構成されていても、概念的に類似した結果が返されます。[ 29 ] [ 30 ]
LSIは単語のみを扱うことに限定されません。任意の文字列も処理できます。テキストとして表現できるオブジェクトはすべて、LSIベクトル空間で表現できます。たとえば、MEDLINE抄録を用いたテストでは、LSIがMEDLINE引用文献のタイトルと抄録に含まれる生物学的情報の概念モデルに基づいて遺伝子を効果的に分類できることが示されています。[ 31 ]
LSIは新しい用語や変化する用語に自動的に適応し、ノイズ(スペルミス、タイプミス、判読不能な文字など)に対する耐性が非常に高いことが示されています。[ 32 ] これは、光学文字認識(OCR)や音声テキスト変換から得られたテキストを使用するアプリケーションにとって特に重要です。LSIはまた、疎なデータ、曖昧なデータ、矛盾したデータにも効果的に対処します。
LSIを効果的に活用するために、テキストは必ずしも文形式である必要はありません。リスト、自由形式のメモ、電子メール、Webコンテンツなど、様々な形式で利用できます。テキストの集合に複数の用語が含まれていれば、LSIを用いて、テキストに含まれる重要な用語と概念間の関係におけるパターンを特定することができます。
LSIは、多くの概念マッチング問題に対する有用な解決策であることが証明されています。[ 33 ] [ 34 ] この手法は、因果関係、目標指向、分類情報などの重要な関係情報を捉えることが示されています。[ 35 ]
LSIのタイムライン 1960年代半ば – 因子分析手法が初めて記述され、検証される(H. BorkoとM. Bernick)。1988年 – LSI技術に関する画期的な論文が発表される[ 24 ] 1989年 – 特許取得[ 24 ] 1992年 – 論文を査読者に割り当てるためにLSIが初めて使用された[ 36 ] 1994年 – LSIの多言語応用に関する特許が取得される(Landauerら)。1995年 – エッセイの採点にLSIが初めて使用される(Foltzら、Landauerら)。1999年 – 情報機関向けに非構造化テキスト分析のためのLSI技術が初めて実装される(SAIC )。2002年 – LSIベースの製品を情報機関向け政府機関に提供開始(SAIC)
LSIの数学 LSIは、一般的な線形代数手法を用いて、テキスト群における概念間の相関関係を学習します。一般的に、このプロセスは、重み付けされた用語-文書行列を作成し、その行列に対して特異値分解 を行い、最後にその行列を用いてテキストに含まれる概念を特定するという手順で構成されます。
ランク削減特異値分解 テキストに含まれる用語と概念間の関係のパターンを決定するために、行列に対してランク削減された特異値分解が実行されます。SVDはLSIの基礎を形成します。 [ 39 ] 単一の用語頻度行列を近似することにより、用語および文書ベクトル空間を計算します。A {\displaystyle A} 、他の3つの行列(m × r の用語概念ベクトル行列)に分割する。T {\displaystyle T} r × r の 特異値行列S {\displaystyle S} 、n × r の概念文書ベクトル行列、D {\displaystyle D} これらは以下の関係を満たす。
A ≈ T S D T {\displaystyle A\approx TSD^{T}}
T T T = 私 r D T D = 私 r {\displaystyle T^{T}T=I_{r}\quad D^{T}D=I_{r}}
S 1 、 1 ≥ S 2 、 2 ≥ … ≥ S r 、 r > 0 S 私 、 j = 0 どこ 私 ≠ j {\displaystyle S_{1,1}\geq S_{2,2}\geq \ldots \geq S_{r,r}>0\quad S_{i,j}=0\;{\text{where}}\;i\neq j}
この式において、A はテキストの集合における語句頻度を表す、m × nの重み付き行列であり、 m は固有の語句の数、n は文書の数です。Tは、 A のランク(固有の次元の尺度≤ min( m,n ))である、 m × r の語句ベクトルの計算行列です。Sは、特異値が減少する r × r の 対角行列であり、Dは 、 n × r の文書ベクトルの計算行列です。
SVDは、特異値行列Sの対角成分のうち最大の k « r 個のみを残すことでランクを削減するために切り捨てられます 。ここでk は通常100から300次元程度です。これにより、用語ベクトル行列と文書ベクトル行列のサイズはそれぞれm × k とn × k に効果的に縮小されます。SVD演算とこの縮小により、テキスト中の最も重要な意味情報を保持しつつ、元の空間A のノイズやその他の望ましくないアーティファクトを低減する効果があります。この縮小された行列セットは、次のような修正された式で表されることがよくあります。
A ≈ A k = T k S k D k T 効率的なLSIアルゴリズムは、完全なSVDを計算してから切り捨てるのではなく、最初のk個の特異値と用語ベクトルおよび文書ベクトルのみを計算します。
このランク削減は、行列Aに対して 主成分分析 (PCA)を実行するのと本質的に同じですが、PCAでは平均値が差し引かれる点が異なります。PCAは行列A の疎性を失わせるため、大規模な語彙集には適用できない場合があります。
LSIベクトル空間のクエリと拡張 計算された行列T k とD k は、用語ベクトル空間と文書ベクトル空間を定義し、計算された特異値S k とともに、文書コレクションから得られた概念情報を具現化します。これらの空間における用語または文書の類似性は、それらが空間内でどれだけ近いかという要素であり、通常は対応するベクトル間の角度の関数として計算されます。
既存の LSI インデックスの文書空間内で、クエリと新規文書のテキストを表すベクトルを特定するために、同じ手順が使用されます。A = TSD T 式を同等のD = A T TS −1 式に単純に変換することで、クエリまたは新規文書の新しいベクトルd を、 A の新しい列を計算し、その新しい列にTS −1 を乗算することによって作成できます。A の新しい列は、 元々導出されたグローバル用語重みを使用して計算され、クエリまたは新規文書の用語に同じローカル重み関数が適用されます。
この方法でベクトルを計算する際の欠点は、新しい検索対象文書を追加する際に、元のインデックスのSVD段階では知られていなかった用語が無視されることです。これらの用語は、元のテキストコレクションから得られたグローバルな重みや学習された相関関係には影響を与えません。しかし、新しいテキストに対して計算されたベクトルは、他のすべての文書ベクトルとの類似性比較において依然として非常に重要です。
LSI インデックスの文書ベクトル空間をこのように新しい文書で拡張するプロセスは、フォールディング イン と呼ばれます。フォールディング イン プロセスでは新しいテキストの新しい意味内容は考慮されませんが、このようにして多数の文書を追加しても、それらに含まれる用語と概念が、追加先の LSI インデックス内で適切に表現されている限り、クエリに対して良好な結果が得られます。新しい文書セットの用語と概念を LSI インデックスに含める必要がある場合は、用語文書行列と SVD を再計算するか、増分更新方法 ( [ 16 ] で説明されているような方法) が必要です。
LSIのその他の用途 テキストを意味論的に扱う能力は、現代の情報検索システムにとって不可欠であると広く認識されている。その結果、拡張性や性能に関する以前の課題が克服されたことで、近年、LSI(言語構造情報)の利用は著しく拡大している。
LSIは、さまざまな情報検索およびテキスト処理アプリケーションで使用されていますが、主な用途は概念検索と自動文書分類です。[ 40 ] LSIのその他の使用例を以下に示します。
LSIは、企業が訴訟に備えるために電子文書開示(eDiscovery)にますます利用されるようになっている。eDiscoveryでは、概念に基づいて大量の非構造化テキストをクラスタリング、分類、検索する機能が不可欠である。LSIを使用した概念ベースの検索は、2003年にはすでに主要なプロバイダーによってeDiscoveryプロセスに適用されている。[ 57 ]
LSIに対する課題 LSI の初期の課題は、スケーラビリティとパフォーマンスに集中していました。LSI は、他の情報検索技術と比較して、比較的高い計算性能とメモリを必要とします。[ 58 ] しかし、最新の高速プロセッサの実装と安価なメモリの入手可能性により、これらの考慮事項はほぼ克服されました。行列と SVD 計算によって完全に処理された 3000 万を超えるドキュメントを含む実際のアプリケーションは、一部の LSI アプリケーションで一般的です。完全にスケーラブルな (ドキュメント数無制限、オンライン トレーニング) LSI の実装は、オープンソースのgensim ソフトウェア パッケージに含まれています。[ 59 ]
LSI のもう 1 つの課題は、SVD を実行するために使用する最適な次元数を決定するのが難しいとされていることである。一般的に、次元数が少ないほどテキストのコレクションに含まれる概念をより広範囲に比較できるが、次元数が多いほど概念をより具体的 (またはより関連性の高い) に比較できる。実際に使用できる次元数は、コレクション内の文書数によって制限される。研究によると、中規模の文書コレクション (数十万の文書) では約 300 次元が通常最良の結果をもたらし、大規模な文書コレクション (数百万の文書) ではおそらく 400 次元が最良の結果をもたらすことが示されている。[ 60 ] しかし、最近の研究では、文書コレクションのサイズと性質に応じて 50 ~ 1000 次元が適切であることが示されている。[ 61 ] PCA や因子分析 と同様に、保持された分散の割合をチェックして最適な次元数を決定する方法は、LSI には適していない。同義語テストまたは欠落語の予測を使用することは、適切な次元数を見つける 2 つの可能な方法である。[ 62 ] LSIトピックを教師あり学習手法の特徴量として使用する場合、予測誤差測定を使用して理想的な次元数を求めることができます。
参考文献 ↑ Susan T. Dumais (2005). "潜在意味解析". Annual Review of Information Science and Technology . 38 : 188–230 . doi : 10.1002/aris.1440380105 . ↑ 「米国特許第4,839,853号」 。 2017年12月2日に オリジナル からアーカイブされました。 (現在は期限切れ)↑ 「潜在意味インデックスのホームページ」 。 ↑ "image" . topicmodels.west.uni-koblenz.de . 2023年3月17日に オリジナル からアーカイブされました。 ↑ Markovsky I. (2012) Low-Rank Approximation: Algorithms, Implementation, Applications, Springer, 2012, ISBN 978-1-4471-2226-5 ↑ Alain Lifchitz; Sandra Jhean-Larose; Guy Denhière (2009). "調整されたパラメータがLSA多肢選択式質問応答モデルに与える影響" (PDF) . Behavior Research Methods . 41 (4): 1201– 1209. arXiv : 0811.0146 . doi : 10.3758/BRM.41.4.1201 . PMID 19897829 . S2CID 480826 . 1 2 Ramiro H. Gálvez; Agustín Gravano (2017). "自動株価予測システムにおけるオンライン掲示板マイニングの有用性の評価". Journal of Computational Science . 19 : 1877– 7503. doi : 10.1016/j.jocs.2017.01.001 . hdl : 11336/60065 . 1 2 Altszyler, E.; Ribeiro, S.; Sigman, M.; Fernández Slezak, D. (2017). "夢の意味の解釈:小規模テキストコーパスにおける潜在意味解析を用いた曖昧性の解消". Consciousness and Cognition . 56 : 178–187 . arXiv : 1610.01520 . doi : 10.1016/j.concog.2017.09.004 . PMID 28943127. S2CID 195347873 . ↑ Gerry J. Elman (2007 年 10 月)「自動特許審査支援 - 提案」 バイオテクノロジー法レポート 26 ( 5): 435–436 . doi : 10.1089/blr.2007.9896 . ↑ Landauer, Thomas K. (1997). "プラトンの問題の解決策". Psychological Review . 104 (2): 211– 240. doi : 10.1037/0033-295X.104.2.211 . ↑ Foltz, Peter W. (1998). 「潜在意味解析によるテキストの一貫性の測定」。Discourse Processes . 25 ( 2–3 ): 285–307 . doi : 10.1080/01638539809545029 . ↑ Marc W. Howard; Michael J. Kahana (1999). "自由想起における文脈的変動性と系列位置効果" . Journal of Experimental Psychology: Learning, Memory, and Cognition . 25 (4): 923– 941. doi : 10.1037/0278-7393.25.4.923 . ↑ Franklin M. Zaromb; et al. (2006). Temporal Associations and Prior-List Intrusions in Free Recall (PDF) . Interspeech'2005. ↑ ネルソン、ダグラス。 「南フロリダ大学の単語連想、韻、単語断片の規範」 。 2011年 5月8日 取得 。 ↑ Geneviève Gorrell; Brandyn Webb (2005). "潜在意味解析のための一般化ヘッブアルゴリズム" (PDF) . Interspeech'2005 . 2008年12月21日に オリジナル (PDF) からアーカイブ済み。 1 2 Matthew Brand (2006). "高速低ランク修正による薄型特異値分解" . 線形代数とその応用 . 415 : 20– 30. doi : 10.1016/j.laa.2005.07.021 . ↑ 「MATLAB」 。 2014年2月28日に オリジナル からアーカイブされました。 ↑ Python ↑ Ding, Yaguang; Zhu, Guofeng; Cui, Chenyang; Zhou, Jian; Tao, Liang (2011). "Map-ReduceとPARPACKに基づく特異値分解の並列実装". 2011年国際コンピュータサイエンス・ネットワーク技術会議議事録 . pp. 739–741 . doi : 10.1109/ICCSNT.2011.6182070 . ISBN 978-1-4577-1587-7 . S2CID 15281129 . 1 2 Deerwester, Scott; Dumais, Susan T.; Furnas, George W.; Landauer, Thomas K.; Harshman, Richard (1990). "潜在意味解析によるインデックス作成". Journal of the American Society for Information Science . 41 (6): 391– 407. CiteSeerX 10.1.1.108.8490 . doi : 10.1002/(SICI)1097-4571(199009)41:6 < 391::AID-ASI1 > 3.0.CO ; 2-9 . ↑ Abedi, Vida; Yeasin, Mohammed; Zand, Ramin (2014年11月27日). 「意味的に関連する関連性のネットワークを用いた知識ギャップを埋めるための実証的研究」 . Journal of Translational Medicine . 12 (1): 324. doi : 10.1186/s12967-014-0324-9 . PMC 4252998 . PMID 25428570 . ↑ Thomas Hofmann (1999). "確率的潜在意味解析". 人工知能における不確実性 . pp. 289–296 . arXiv : 1301.6705 . ↑ Salakhutdinov, Ruslan、および Geoffrey Hinton。「意味的ハッシュ化」。RBM 500.3 (2007): 500。 1 2 3 Deerwester, S., et al、「潜在意味インデックスによる情報検索の改善」、米国情報科学会第51回年次会議議事録25、1988年、36-40頁。 ↑ ベンゼクリ、J.-P. (1973年)。 ドネの分析。第二巻。通信の分析 。フランス、パリ:デュノー。 ↑ Furnas, GW; Landauer, TK; Gomez, LM; Dumais, ST (1987). "人間とシステム間のコミュニケーションにおける語彙の問題". Communications of the ACM . 30 (11): 964–971 . CiteSeerX 10.1.1.118.4768 . doi : 10.1145/32206.32212 . S2CID 3002280 . ↑ Landauer, T., et al., Learning Human-like Knowledge by Singular Value Decomposition: A Progress Report , MI Jordan, MJ Kearns & SA Solla (Eds.), Advances in Neural Information Processing Systems 10, Cambridge: MIT Press, 1998, pp. 45–51. ↑ Dumais, S.; Platt, J.; Heckerman, D.; Sahami, M. (1998). "テキスト分類のための帰納的学習アルゴリズムと表現" (PDF) . 第7回国際情報知識管理会議 - CIKM '98 議事録 . pp. 148 . CiteSeerX 10.1.1.80.8909 . doi : 10.1145/288627.288651 . ISBN 978-1581130614 . S2CID 617436 . ↑ Dumais, Susan T. (1997). "潜在意味インデックスを用いた自動的な異言語情報検索". AAAI Spring Symposium on Cross-Language Text and Speech Retrieval . pp. 18–24 . ↑ Vulić, Ivan (2013). "文書アラインメントされた比較可能なコーパスで訓練された潜在トピックモデルに基づくクロス言語情報検索モデル". Information Retrieval . 16 (3): 331–368 . doi : 10.1007/s10791-012-9200-5 . ↑ Homayouni, R.; Heinrich, K.; Wei, L.; Berry, MW (2004). "MEDLINE抄録の潜在意味インデックスによる遺伝子クラスタリング" . Bioinformatics . 21 (1): 104– 115. doi : 10.1093/bioinformatics/bth464 . PMID 15308538 . ↑ Price, RJ; Zukas, AE (2005). 「ノイズ の 多いテキスト処理 へ の潜在意味インデックスの応用」。 インテリジェンスとセキュリティ情報学 。Lecture Notes in Computer Science。Vol. 3495。p. 602。doi : 10.1007/11427995_68。ISBN 978-3-540-25999-2 。↑ Ding, C.、「潜在意味インデックスのための類似性に基づく確率モデル」、第22回国際ACM SIGIR情報検索研究開発会議議事録、1999年、59-65ページ。 ↑ Bartell, B.、Cottrell, G.、Belew, R.、「潜在意味インデックスは多次元尺度構成法の最適な特殊ケースである」 、ACM SIGIR 情報検索研究開発会議議事録、1992 年、pp. 161–167。 ↑ Graesser, A.; Karnavat, A. (2000). "潜在意味解析は因果的、目標指向的、分類学的構造を捉える". Proceedings of CogSci 2000 : 184– 189. CiteSeerX 10.1.1.23.5444 . ↑ Dumais, S.; Nielsen, J. (1992). 「投稿された原稿の査読者 への割り当ての自動化」。 第 15回ACM SIGIR国際会議 「 情報検索における研究開発 - SIGIR '92」議事録 。pp . 233–244。CiteSeerX 10.1.1.16.9793。doi : 10.1145 /133160.133205。ISBN 978-0897915236 . S2CID 15038631 . ↑ Berry, MW、および Browne, M.、「検索エンジンの理解:数理モデリングとテキスト検索」、産業応用数学会、フィラデルフィア、(2005)。 ↑ Landauer, T., et al., Handbook of Latent Semantic Analysis, Lawrence Erlbaum Associates, 2007. ↑ Berry, Michael W., Dumais, Susan T., O'Brien, Gavin W., Using Linear Algebra for Intelligent Information Retrieval , December 1994, SIAM Review 37:4 (1995), pp. 573–595. ↑ Dumais, S.、「潜在意味解析」、ARIST Review of Information Science and Technology、第38巻、2004年、第4章。 ↑ 電子情報開示における検索および情報取得方法の使用に関するベストプラクティス解説、セドナ会議、2007年、189~223ページ。 ↑ Foltz, PW および Dumais, STパーソナライズされた情報配信: 情報フィルタリング方法の分析、Communications of the ACM、1992、34(12)、51-60。 ↑ Gong, Y.、Liu, X.、「汎用テキスト要約の作成」、第6回国際文書解析認識会議議事録、2001年、pp. 903–907。 ↑ Bradford, R.、「大規模テキストデータベースにおける新規情報の効率的な発見」、IEEE国際インテリジェンスおよびセキュリティ情報学会議議事録、ジョージア州アトランタ、LNCS Vol. 3495、Springer、2005年、pp. 374–380。 ↑ Bradford, RB (2006). 「テロリストネットワークのグラフ生成における潜在意味インデックスの応用」. Intelligence and Security Informatics . Lecture Notes in Computer Science. Vol. 3975. pp. 674–675 . doi : 10.1007/11760146_84 . ISBN 978-3-540-34478-0 。↑ Yarowsky, D.、および Florian, R.、「会議議長の負担を軽減する:デジタル論文ルーティングアシスタントに向けて」、1999 年 SIGDAT 合同会議「自然言語処理と超大規模コーパスにおける経験的手法」議事録、1999 年、pp. 220–230。 ↑ Caron, J.、「オンライン顧客サポートへのLSAの適用:試行研究」、未発表修士論文、2000年5月。 ↑ Soboroff, I., et al、「 Nグラムと潜在意味インデックスを使用した文書著者の可視化」、情報可視化と操作における新しいパラダイムに関するワークショップ、1997年、43-48ページ。 ↑ Monay, F.、および Gatica-Perez, D.、「潜在空間モデルを用いた画像自動注釈について」、第 11 回 ACM 国際マルチメディア会議議事録、カリフォルニア州バークレー、2003 年、pp. 275–278。 ↑ Maletic, J.; Marcus, A. (2000年11月13日~15日)「潜在意味解析を用いてソースコードの類似性を特定し、プログラム理解を支援する」 第 12 回IEEE人工知能ツール国際会議議事録、ICTAI 2000 、 pp . 46–53。CiteSeerX 10.1.1.36.6652。doi : 10.1109 / TAI.2000.889845。ISBN 978-0-7695-0909-9 . S2CID 10354564 . ↑ Gee, K.、「潜在意味インデックスを用いたスパムのフィルタリング」、2003 ACM Symposium on Applied Computing 論文集、メルボルン、フロリダ、pp. 460–464。 ↑ Landauer, T., Laham, D., and Derr, M., From Paragraph to Graph: Latent Semantic Analysis for Information Visualization , Proceedings of the National Academy of Sciences, 101, 2004, pp. 5214–5219. ↑ Foltz, Peter W.、Laham, Darrell、Landauer, Thomas K.、「自動エッセイ採点:教育技術への応用」、EdMedia 会議録、1999 年。 ↑ ランダウアー、トーマス K. (2003). 「インテリジェント エッセイ アセッサーによるエッセイの自動採点と注釈」. 自動エッセイ採点:学際的視点 . ローレンス アールバウム アソシエイツ. pp. 87–112 . ISBN 978-0805839739 。↑ ハースト、マーティ A. (2000). 「自動エッセイ採点に関する議論」. IEEE Intelligent Systems . 15 (5): 22–37 . doi : 10.1109/5254.889104 . 「自然言語からの文書作成」 。 2026年5月22日 取得 。 ↑ Gordon, M.、および Dumais, S.、「文献に基づく発見のための潜在意味インデックスの使用」、Journal of the American Society for Information Science、49(8)、1998、pp. 674–685。 ↑ 検索にはもっと良い方法があるはずだ、2008年、ホワイトペーパー、Fios, Inc. ↑ Karypis, G., Han, E., 「文書分類と検索への応用を伴う高速教師あり次元削減アルゴリズム」、第9回ACM情報知識管理会議CIKM-00論文集。 ↑ Radim Řehůřek (2011). "潜在意味解析のための部分空間追跡". Advances in Information Retrieval . Lecture Notes in Computer Science. Vol. 6611. pp. 289–300 . doi : 10.1007/978-3-642-20161-5_29 . ISBN 978-3-642-20160-8 。↑ Bradford, R.、「大規模潜在意味インデックスアプリケーションに必要な次元に関する実証的研究」、第17回ACM情報知識管理会議議事録、米国カリフォルニア州ナパバレー、2008年、pp. 153–162。 ↑ Landauer, Thomas K.、および Dumais, Susan T.、「潜在意味解析」、Scholarpedia、3(11):4356、2008年。 ↑ Landauer, TK、Foltz, PW、Laham, D. (1998).潜在意味解析入門. Discourse Processes, 25, 259-284
さらに読む Landauer, Thomas ; Foltz, Peter W.; Laham, Darrell (1998). "潜在意味解析入門" (PDF) . Discourse Processes . 25 ( 2– 3): 259– 284. CiteSeerX 10.1.1.125.109 . doi : 10.1080/01638539809545028 . S2CID 16625196 . Deerwester, Scott ; Dumais, Susan T. ; Furnas, George W. ; Landauer, Thomas K. ; Harshman, Richard (1990). "Indexing by Latent Semantic Analysis" (PDF) . Journal of the American Society for Information Science . 41 (6): 391– 407. CiteSeerX 10.1.1.33.2447 . doi : 10.1002/(SICI)1097-4571(199009)41:6 < 391::AID-ASI1 > 3.0.CO ; 2-9 . 2012年7月17日にオリジナル(PDF) からアーカイブされました。 そのモデルが初めて紹介された元の記事。ベリー、マイケル ;デュメ、スーザン T.;オブライエン、ギャビン W. (1995)。「インテリジェント情報検索のための線形代数の使用」。 (PDF) 2018年11月23日にWayback Machine に アーカイブされました。LSAを文書検索に適用した例。Chicco, D; Masseroli, M (2015). "遺伝子およびタンパク質の注釈予測と類似性検索のためのソフトウェアスイート". IEEE /ACM Transactions on Computational Biology and Bioinformatics . 12 (4): 837–843 . doi : 10.1109/TCBB.2014.2382127 . hdl : 11311/959408 . PMID 26357324. S2CID 14714823 . 「潜在意味解析」 . InfoVis. 2020年2月18日にオリジナルからアーカイブ済み。2005年7月1日 に取得。 Fridolin Wild (2005年11月23日). 「R 用のオープンソース LSA パッケージ」 . CRAN . 2006年 11月20日 取得 。 Thomas Landauer ; Susan T. Dumais (1997). "プラトンの問題への解決策: 知識の獲得、帰納、および表象に関する潜在意味解析理論" . Psychological Review . 104 (2): 211– 240. doi : 10.1037/0033-295X.104.2.211 . 2007年7月 2日取得 .
外部リンク
LSAに関する記事 潜在意味解析(Latent Semantic Analysis)は、LSAの創始者の一人であるトム・ランダウアーが執筆した、LSAに関するScholarpediaの記事です。
講演とデモンストレーション LSAの概要、トーマス・ホフマン 教授による講演( 2017年12月22日にWayback Machine に アーカイブ済み) 。LSA、情報検索におけるその応用、および確率的潜在意味解析 との関連性について説明しています。 Windows 用の C# による完全な LSA サンプル コードです。このデモ コードには、テキスト ファイルの列挙、ストップ ワードのフィルタリング、ステミング、文書-単語行列の作成、および SVD が含まれています。
実装 LSAは、情報検索 、自然言語処理 (NLP)、認知科学 、計算言語学 といった分野横断的な応用が可能であるため、様々な種類のアプリケーションをサポートするために実装されてきた。
Sense Clustersは、LSAを情報検索向けにPerlで実装したものです。 S-Spaceパッケージは、計算言語学および認知科学に特化したLSAのJava実装です。 Semantic Vectorsは、Luceneの 用語-文書マトリックスにランダム射影、LSA、および反射型ランダムインデックスを適用します。 Infomapプロジェクトは、LSAをC言語で実装した自然言語処理指向のプロジェクトです(現在はsemanticvectorsプロジェクトに置き換えられています)。 Text to Matrix Generatorは、テキストコレクションから用語-文書行列を生成するMATLABツールボックスで、LSAをサポートしています。 Gensimには 、RAMよりも大きな行列に対するLSAのPython実装が含まれています。