次元削減とは、高次元空間のデータを低次元空間に変換することであり、低次元表現が元のデータのいくつかの意味のある特性を保持し、理想的にはその固有次元に近いものとなるようにする。高次元空間での作業は、多くの理由から望ましくない場合がある。生データは次元の呪いの結果として疎であることが多く、データの分析は通常、計算上困難である。次元削減は、信号処理、音声認識、神経情報学、バイオインフォマティクスなど、多数の観測値や多数の変数を扱う分野で一般的である。[ 1 ]
手法は一般的に線形アプローチと非線形アプローチに分けられます。[ 1 ]線形アプローチはさらに特徴選択と特徴抽出に分けられます。[ 2 ]次元削減は、ノイズ低減、データ可視化、クラスタ分析、または他の分析を容易にするための中間ステップとして使用できます。
特徴選択のプロセスは、対象となるタスクに適した入力変数(特徴量、または属性)のサブセットを見つけることを目的としています。その戦略は、フィルタ戦略(情報利得など)、ラッパー戦略(精度誘導型探索など)、および埋め込み戦略(予測誤差に基づいてモデル構築中に特徴量を追加または削除する)の3つです。
特徴射影(特徴抽出とも呼ばれる)は、データを高次元空間からより少ない次元の空間に変換します。データ変換は、主成分分析(PCA)のように線形である場合もありますが、多くの非線形次元削減手法も存在します。[ 4 ] [ 5 ]多次元データの場合、テンソル表現は、多重線形部分空間学習による次元削減に使用できます。[ 6 ]

次元削減のための主要な線形手法である主成分分析は、低次元空間におけるデータの分散が最大化されるように、データを低次元空間に線形マッピングします。実際には、データの共分散行列(場合によっては相関行列も)を作成し、この行列の固有ベクトルを計算します。最大の固有値(主成分)に対応する固有ベクトルを用いることで、元のデータの分散の大部分を再構築できます。さらに、最初の数個の固有ベクトルは、特に低次元システムにおいて、システムのエネルギーの大部分を占めることが多いため、システムの大規模な物理的挙動の観点から解釈できる場合がよくあります。ただし、すべてのシステムがこのような挙動を示すわけではないため、これはケースバイケースで検証する必要があります。元の空間(点の数と同じ次元)は、(データ損失はあるものの、最も重要な分散は保持されることを期待して)少数の固有ベクトルによって張られる空間に縮小された。
NMFは非負行列を2つの非負行列の積に分解するもので、非負信号のみが存在する分野、例えば天文学[ 7 ] [ 8 ]において有望なツールとなっている。 [ 9 ] [ 10 ] NMFはLee & Seungによる乗法更新ルール[ 7 ]以来よく知られており、不確実性の包含[ 9 ] 、欠損データと並列計算の考慮[ 11 ] 、 NMFの安定性と線形性につながる逐次構築[ 11 ] [10]、デジタル画像処理における欠損データの処理を含むその他の更新[ 12 ]など、継続的に開発されてきた。
構築中の安定したコンポーネントベースと線形モデリングプロセスにより、逐次NMF [ 11 ]は、特に周星円盤の直接イメージングにおいて、系外惑星を検出する方法の 1 つとして、天文学における周星構造の直接イメージングでフラックスを保持することができます[ 10 ] 。PCA と比較すると、NMF は行列の平均を除去しないため、物理的に非負のフラックスが生じます。したがって、NMF は Ren ら[ 10 ]が実証したように、PCA よりも多くの情報を保持することができます。
主成分分析は、カーネルトリックを用いることで非線形的に適用できる。この手法は、データの分散を最大化する非線形マッピングを構築することができる。この手法はカーネルPCAと呼ばれる。
その他の著名な非線形手法には、 Isomap、局所線形埋め込み(LLE)[ 13 ] 、ヘッセ行列LLE、ラプラシアン固有マップ、接空間解析に基づく手法[ 14 ]などの多様体学習手法が含まれます。これらの手法は、高次元の入力データが周囲空間に埋め込まれた低次元多様体の近くにあると仮定し、データの局所的な特性を保持するコスト関数を使用して低次元表現を構築します。これらは、カーネルPCAのグラフベースのカーネルを定義するものと見なすことができます。[ 15 ]
近年では、固定カーネルを定義する代わりに、半正定値計画法を用いてカーネルを学習する手法が提案されている。このような手法の最も代表的な例が、最大分散展開(MVU)である。MVUの中心的な考え方は、(内積空間において)最近傍点間のすべてのペアワイズ距離を正確に保持しつつ、最近傍点ではない点間の距離を最大化することである。
近傍保存の代替アプローチとして、入力空間と出力空間の距離の差を測定するコスト関数を最小化する方法があります。このような手法の重要な例としては、PCAと同一である古典的な多次元尺度構成法、データ空間で測地距離を使用するIsomap 、データ空間で拡散距離を使用する拡散マップ、点のペア間の分布の乖離を最小化するt分布確率的近傍埋め込み(t-SNE)、および曲線成分分析などがあります。
非線形次元削減の別のアプローチは、ボトルネック隠れ層を持つ特殊なフィードフォワードニューラルネットワークであるオートエンコーダーを使用することです。 [ 16 ]ディープエンコーダーのトレーニングは通常、貪欲な層ごとの事前トレーニング(たとえば、制限付きボルツマンマシンのスタックを使用)を使用して実行され、その後、バックプロパゲーションに基づくファインチューニング段階が続きます。

線形判別分析(LDA)は、統計学、パターン認識、機械学習において、2つ以上のクラスのオブジェクトやイベントを特徴づけたり分離したりする特徴の線形結合を見つけるために使用される手法である、フィッシャーの線形判別分析の一般化である。
GDAはカーネル関数演算子を用いた非線形判別分析を扱う。GDA法は入力ベクトルを高次元特徴空間にマッピングするという点で、その基礎理論はサポートベクターマシン(SVM)に近い。 [ 17 ] [ 18 ] LDAと同様に、GDAの目的はクラス間散布とクラス内散布の比率を最大化することで、特徴をより低次元の空間に投影することである。
オートエンコーダーは、非線形次元削減関数や符号化を学習するために使用でき、さらに符号化から元の表現への逆関数も学習できる。
T分布確率的近傍埋め込み(t-SNE)は、高次元データセットの可視化に役立つ非線形次元削減手法です。密度や距離を必ずしも適切に保持するとは限らないため、クラスタリングや外れ値検出などの分析での使用は推奨されません。[ 19 ]
均一多様体近似射影(UMAP)は、非線形次元削減手法です。視覚的にはt-SNEに似ていますが、データが局所的に連結したリーマン多様体上に均一に分布しており、リーマン計量が局所的に一定であるか、または近似的に局所的に一定であるという前提に基づいています。
高次元データセットの場合、次元の呪いを軽減するために、通常はk近傍法(k -NN)アルゴリズムを適用する前に次元削減が行われます。[ 20 ]
特徴抽出と次元削減は、主成分分析(PCA)、線形判別分析(LDA)、正準相関分析(CCA)、または非負行列因子分解(NMF)技術を使用してデータを前処理し、その後、次元削減された空間の特徴ベクトルに対してk -NNによるクラスタリングを行うことで、1つのステップで組み合わせることができます。機械学習では、このプロセスは低次元埋め込みとも呼ばれます。[ 21 ]
高次元データセット(例えば、ライブビデオストリーム、DNAデータ、高次元時系列で類似性検索を実行する場合)の場合、局所性に敏感なハッシュ、ランダム射影、[ 22 ]「スケッチ」、[ 23 ]、またはVLDBカンファレンスツールボックスのその他の高次元類似性検索技術を使用した高速近似k -NN検索を実行することが、唯一実行可能なオプションとなる可能性があります。
神経科学で時折使用される次元削減手法は、最大情報次元[ 24 ]であり、元のデータに関する情報が可能な限り多く保持されるように、データセットの低次元表現を見つける。