機械学習において、埋め込みは、複雑な高次元データを数値ベクトルの低次元ベクトル空間にマッピングする表現学習手法である。[ 1 ]
また、意味のあるパターンや関係が保持された結果として得られる表現も示します。この手法は、単語、画像、ユーザーインタラクションなどのデータからこれらのベクトルを学習するもので、ワンホットエンコーディングなどの手動で設計された方法とは異なります。[ 2 ]このプロセスは複雑さを軽減し、ドメインの事前知識を必要とせずに重要な特徴を捉えます。
自然言語処理では、単語や概念は特徴ベクトルとして表現され、類似の概念は近くのベクトルにマッピングされます。結果として得られる埋め込みは、テキスト用の単語埋め込み( Word2Vecなど)、視覚データ用の画像埋め込み、知識グラフ用の知識グラフ埋め込みなど、種類によって異なり、それぞれがNLP、コンピュータビジョン、推薦システムなどのタスクに合わせて調整されています。[ 3 ]この二重の役割により、特徴抽出を自動化し、さまざまなアプリケーション間で潜在的な類似性を明らかにすることで、モデルの効率と精度が向上します。
2 つの埋め込み間の距離を測定するには、類似度尺度を使用して、埋め込みによって表現される概念の全体的な類似性を求めることができます。ベクトルの大きさが 1 に正規化されている場合、類似度尺度は、[ 4 ]
コサイン類似度は類似度を決定する際にベクトルの大きさを考慮しないため、非常に頻繁に出現するトレーニングデータに対するバイアスが少なくなります。ドット積は本質的に大きさを考慮するため、より頻繁に出現するデータを高く評価する傾向があります。[ 4 ]一般的に、高次元ベクトル空間では、ベクトルは距離が収束する傾向があるため、大きな埋め込みベクトルではユークリッド距離の信頼性が低下します。[ 5 ]