

t分布確率的近傍埋め込み(t-SNE)は、各データポイントに2次元または3次元マップ内の位置を与えることで高次元データを可視化する統計的手法です。これは、 Geoffrey HintonとSam Roweisによって最初に開発された確率的近傍埋め込み[ 1 ]に基づいており、 Laurens van der MaatenとHintonがt分布の変種を提案しました[ 2 ]。これは、高次元データを2次元または3次元の低次元空間に埋め込んで可視化するための非線形次元削減手法です。具体的には、類似したオブジェクトは近くの点でモデル化され、類似していないオブジェクトは高い確率で遠くの点でモデル化されるように、各高次元オブジェクトを2次元または3次元の点でモデル化します。
t-SNE アルゴリズムは主に 2 つの段階から構成されます。まず、t-SNE は、類似したオブジェクトには高い確率が、類似していない点には低い確率が割り当てられるように、高次元オブジェクトのペアに対する確率分布を構築します。次に、t-SNE は、低次元マップ上の点に対する同様の確率分布を定義し、マップ上の点の位置に関して、2 つの分布間のKullback–Leibler ダイバージェンス(KL ダイバージェンス) を最小化します。元のアルゴリズムは類似度メトリックのベースとしてオブジェクト間のユークリッド距離を使用しますが、これは必要に応じて変更できます。リーマンの変種はUMAPです。
t-SNE は、ゲノミクス、コンピュータ セキュリティ研究[ 3 ] 、自然言語処理、音楽分析[ 4 ] 、がん研究[ 5 ] 、バイオインフォマティクス[ 6 ] 、地質学的ドメイン解釈[ 7 ] [ 8 ] [ 9 ]、および生体医療信号処理[ 10 ]など、幅広いアプリケーションで可視化に使用されています。
データセットの場合要素、t-SNEは時間と空間。[ 11 ]
与えられたセット高次元オブジェクトt-SNEはまず確率を計算します物体の類似性に比例するそして、 次のように。
のために、 定義する
そして設定する上記の分母は、すべての人々のために。
ファン・デル・マーテンとヒントンが説明したように、「データポイントの類似性データポイントへは条件付き確率です。、 それ選ぶ近傍がガウス分布を中心として確率密度に比例して選ばれた場合、その近傍として[ 2 ]
定義
これは次のような動機によるものです。 そして N個のサンプルから1/Nと推定されるため、条件付き確率は次のように表すことができます。 そして 。 以来そうすれば、前の式を取得できます。
また、次の点にも注意してください。 そして。
ガウスカーネルの帯域幅は、二分法を用いて条件付き分布のエントロピーが事前に定義されたエントロピーと等しくなるように設定されます。結果として、帯域幅はデータの密度に合わせて調整されます。データ空間のより密度の高い部分で使用されます。エントロピーはこの分布のパープレキシティとともに増加します。この関係は次のように見なされる
どこシャノンエントロピーは
パープレキシティはt-SNEの手動で選択されたパラメータであり、著者らが述べているように、「パープレキシティは有効な近傍の数の滑らかな尺度として解釈できます。SNEのパフォーマンスはパープレキシティの変化に対してかなり頑健であり、典型的な値は5から50の間です。」[ 2 ]
ガウスカーネルはユークリッド距離を使用するため次元の呪いの影響を受け、高次元データでは距離が識別能力を失うため、類似しすぎる(漸近的に定数に収束する)ため、これを緩和するために、各点の固有次元に基づいてべき変換で距離を調整することが提案されている。 [ 12 ]
t-SNEは、次元マップ(とそして通常は2つまたは3つに選ばれる)類似性を反映している 可能な限り。この目的のために、類似性を測定します。地図上の2点間そして非常に似たアプローチを使用しています。具体的には、、 定義するとして
そして設定するここでは、低次元点間の類似性を測定するために、裾の重いスチューデントt分布(自由度1、コーシー分布と同じ)を使用し、マップ上で遠く離れた類似性のないオブジェクトをモデル化できるようにします。
ポイントの位置マップ内の値は、分布の(非対称)カルバック・ライブラー情報量を最小化することによって決定されます。分布からつまり:
点に関するカルバック・ライブラー情報量の最小化勾配降下法を用いて最適化が行われます。この最適化の結果得られるマップは、高次元の入力間の類似性を反映しています。
t-SNE プロットはしばしばクラスターを表示しているように見えるが、視覚的なクラスターは選択されたパラメータ化 (特にパープレキシティ) に大きく影響される可能性があるため、t-SNE のパラメータをよく理解する必要がある。このような「クラスター」は、明確なクラスタリングのない構造化データにも現れることが示されており、[ 13 ]誤った発見である可能性がある。同様に、t-SNE によって生成されるクラスターのサイズは情報がなく、クラスター間の距離も同様である。[ 14 ]したがって、パラメータを選択して結果を検証するには、インタラクティブな探索が必要になる場合がある。[ 15 ] [ 16 ] t-SNE は、よく分離されたクラスターを復元できることが多く、特別なパラメータの選択により、単純な形式のスペクトルクラスタリングを近似することが示されている。[ 17 ]