
機械学習(ML)において、特徴学習または表現学習[2]は、システムが生データから特徴検出または分類に必要な表現を自動的に発見できるようにする一連の技術です。これは手動の特徴エンジニアリングに代わるもので、機械が特徴を学習し、それを使用して特定のタスクを実行できるようにします。
特徴学習は、分類などの ML タスクでは、数学的および計算的に処理しやすい入力がしばしば必要になるという事実に起因しています。しかし、画像、ビデオ、センサー データなどの現実世界のデータは、特定の特徴をアルゴリズムで定義する試みには対応していません。代替案としては、明示的なアルゴリズムに頼らずに、検査を通じてそのような特徴や表現を発見することが挙げられます。
特徴学習は、教師あり学習、教師なし学習、自己教師学習のいずれかになります。
- 教師あり特徴学習では、ラベル付き入力データを使用して特徴を学習します。ラベル付きデータには入力とラベルのペアが含まれており、入力がモデルに与えられ、モデルは出力として真実のラベルを生成する必要があります。[3]これを活用して、モデルで特徴表現を生成することができ、高いラベル予測精度が得られます。例としては、教師ありニューラルネットワーク、多層パーセプトロン、辞書学習などがあります。
- 教師なし特徴学習では、データセット内の点間の関係性を分析することで、ラベルのない入力データを使用して特徴を学習します。[4]例としては、辞書学習、独立成分分析、行列分解、[5]およびさまざまな形式のクラスタリング などがあります。[6] [7] [8]
- 自己教師あり特徴学習では、教師なし学習と同様にラベルなしデータを使用して特徴が学習されますが、入力ラベルのペアは各データポイントから構築され、勾配降下法などの教師あり手法を通じてデータの構造を学習できます。[9]古典的な例としては、単語埋め込みやオートエンコーダーなどがあります。[10] [11]自己教師あり学習は、畳み込みニューラルネットワークやトランスフォーマーなどのディープニューラルネットワークアーキテクチャの使用を通じて、多くのモダリティに適用されてきました。[9]
監督付き
教師あり特徴学習は、ラベル付きデータから特徴を学習することです。データ ラベルにより、システムはラベルを生成できなかった度合いを表すエラー項を計算できます。このエラー項は、学習プロセスを修正するためのフィードバックとして使用できます (エラーを削減/最小化)。アプローチには次のものがあります。
教師あり辞書学習
辞書学習では、入力データから代表的な要素のセット (辞書) を作成し、各データ ポイントを代表的な要素の加重合計として表すことができます。辞書の要素と重みは、平均表現エラー (入力データ全体) を最小化し、重みのL1正規化を行ってスパース性 (つまり、各データ ポイントの表現にはゼロ以外の重みがいくつかある) を実現することで見つけることができます。
教師あり辞書学習は、入力データの構造とラベルの両方を利用して辞書要素を最適化します。たとえば、この[12]教師あり辞書学習手法は、入力データに基づいて辞書要素、データポイントを表す重み、および分類器のパラメータを共同で最適化することにより、分類問題に辞書学習を適用します。特に、最小化問題が定式化され、目的関数は分類誤差、表現誤差、各データポイントの表現重みのL1正則化(データのスパース表現を可能にするため)、および分類器のパラメータの L2正則化で構成されます。
ニューラルネットワーク
ニューラル ネットワークは、相互接続されたノードの複数の層からなる「ネットワーク」を使用する学習アルゴリズムのファミリーです。動物の神経系にヒントを得たもので、ノードはニューロン、エッジはシナプスとして見なされます。各エッジには重みが関連付けられており、ネットワークはネットワークの入力層から出力層に入力データを渡すための計算ルールを定義します。ニューラル ネットワークに関連付けられたネットワーク関数は、重みによってパラメータ化される入力層と出力層の関係を特徴付けます。適切に定義されたネットワーク関数を使用すると、ネットワーク関数 (重み) のコスト関数を最小化することで、さまざまな学習タスクを実行できます。
多層ニューラル ネットワークは、隠れ層で入力の表現を学習し、その後出力層で分類や回帰に使用するため、特徴学習に使用できます。このタイプの最も一般的なネットワーク アーキテクチャは、シャム ネットワークです。
監督なし
教師なし特徴学習は、ラベルなしデータから特徴を学習することです。教師なし特徴学習の目標は、多くの場合、高次元の入力データの背後にある構造を捉える低次元の特徴を発見することです。特徴学習が教師なしで実行されると、ラベルなしデータセットから学習した特徴を使用して、ラベル付きデータを使用した教師あり設定でのパフォーマンスを向上させる、一種の半教師あり学習が可能になります。 [13] [14]以下ではいくつかのアプローチを紹介します。
け- クラスタリングを意味する
K平均法クラスタリングは、ベクトル量子化のアプローチです。特に、 n個のベクトルのセットが与えられた場合、 k平均法クラスタリングは、各ベクトルが最も近い平均値を持つクラスターに属するように、それらを k 個のクラスター (つまり、サブセット) にグループ化します。この問題は計算上NP 困難ですが、最適ではない貪欲アルゴリズムが開発されています。
K平均法クラスタリングは、ラベル付けされていない入力セットをk個のクラスターにグループ化し、これらのクラスターの重心を使用して特徴を生成するために使用できます。これらの特徴はいくつかの方法で生成できます。最も単純な方法は、各サンプルにk個のバイナリ特徴を追加することです。ここで、各特徴jは、 k平均法によって学習されたj番目の重心が検討中のサンプルに最も近い場合に限り、値1を持ちます。[ 6 ]また、クラスターまでの距離を特徴として使用することもできます。その場合は、それらをラジアル基底関数( RBFネットワークのトレーニングに使用されている手法[15])で変換した後で使用します。CoatesとNgは、k平均法の特定のバリアントがスパースコーディングアルゴリズムと同様に動作することを指摘しています。 [16]
教師なし特徴学習法の比較評価において、Coates、Lee、Ngは、適切な変換を伴うk平均法クラスタリングが、画像分類タスクにおいて、最近発明されたオートエンコーダやRBMよりも優れていることを発見しました。 [6] k平均法は、 NLPの領域、特に名前付きエンティティ認識の分野でもパフォーマンスを向上させます。[17]そこでは、ブラウンクラスタリングや分散単語表現(ニューラル単語埋め込みとも呼ばれる)と競合します。 [14]
主成分分析
主成分分析(PCA) は、次元削減によく使用されます。ラベルなしのn 個の入力データ ベクトルのセットが与えられると、PCA は、データ マトリックスのp 個の最大特異値に対応するp個の右特異ベクトル(これは入力データの次元よりはるかに小さい)を生成します。ここで、データ マトリックスのk番目の行は、入力のサンプル平均によってシフトされたk番目の入力データ ベクトルです (つまり、データ ベクトルからサンプル平均を減算します)。同様に、これらの特異ベクトルは、入力ベクトルのサンプル共分散マトリックスのp 個の最大固有値に対応する固有ベクトルです。これらのp 個の特異ベクトルは、入力データから学習された特徴ベクトルであり、データが最も大きく変化する方向を表します。
PCA は、 p 個の特異ベクトルがデータ マトリックスの線形関数であるため、線形特徴学習アプローチです。特異ベクトルは、p回の反復を伴う単純なアルゴリズムによって生成できます。i 番目の反復では、データ マトリックスの(i-1)番目の固有ベクトルへの投影が減算され、i番目の特異ベクトルが残差データ マトリックスの最大特異値に対応する右特異ベクトルとして検出されます。
PCA にはいくつかの制限があります。まず、分散の大きい方向が最も重要であると想定しますが、必ずしもそうとは限りません。PCA は元のデータの直交変換のみに依存し、データの 1 次モーメントと 2 次モーメントのみを利用するため、データ分布の特性を十分に表すことができない可能性があります。さらに、PCA は入力データ ベクトルが相関している場合にのみ次元を効果的に削減できます (その結果、支配的な固有値が少数になります)。
局所線形埋め込み
局所線形埋め込み(LLE)は、(ラベルなしの)高次元入力から低次元の近傍保存表現を生成する非線形学習アプローチです。このアプローチは、RoweisとSaul(2000)によって提案されました。[18] [19] LLEの一般的な考え方は、元のデータセット内の近傍のいくつかの幾何学的特性を維持しながら、低次元のポイントを使用して元の高次元データを再構築することです。
LLE は 2 つの主要なステップから構成されます。最初のステップは「近傍保存」です。各入力データ ポイントXi は、 K 個の最近傍データ ポイントの加重合計として再構築され、各ポイントに関連付けられた加重の合計が 1 になるという制約の下で、平均二乗再構築誤差 (つまり、入力ポイントとその再構築の差) を最小化することで最適な加重が求められます。2 番目のステップは「次元削減」です。最初のステップで最適化された加重を使用して、表現誤差を最小化する低次元空間のベクトルを探します。最初のステップでは、加重は固定データで最適化され、最小二乗問題として解くことができます。2 番目のステップでは、低次元ポイントは固定加重で最適化され、スパース固有値分解によって解くことができます。
最初のステップで得られた再構成重みは、入力データの近傍の「固有の幾何学的特性」を捉えます。[19]元のデータは滑らかな低次元多様体上にあると想定されており、元のデータの重みによって捉えられた「固有の幾何学的特性」もその多様体上にあると予想されます。これが、LLEの2番目のステップで同じ重みが使用される理由です。PCAと比較すると、LLEは基礎となるデータ構造を活用する点でより強力です。
独立成分分析
独立成分分析(ICA)は、独立した非ガウス成分の加重和を使用してデータ表現を形成する手法です。[20]すべての成分がガウス分布に従う場合、重みを一意に決定できないため、非ガウスの仮定が課されます。
教師なし辞書学習
教師なし辞書学習ではデータラベルを利用せず、データの根底にある構造を利用して辞書要素を最適化します。教師なし辞書学習の例としてスパースコーディングが挙げられます。これはラベルなし入力データからデータ表現のための基底関数(辞書要素)を学習することを目的としています。スパースコーディングは、辞書要素の数が入力データの次元よりも大きい過剰辞書の学習に適用できます。[21] Aharonらは、スパース表現を可能にする要素の辞書を学習するためのアルゴリズムK-SVDを提案しました。[22]
多層/深層アーキテクチャ
生物神経系の階層的構造は、学習ノードを複数層に積み重ねることによって特徴学習を行うディープラーニング構造に影響を与えている。 [23]これらの構造は、多くの場合、分散表現の仮定に基づいて設計される。つまり、観測データは、複数のレベルでの多くの異なる要因の相互作用によって生成される。ディープラーニング構造では、各中間層の出力は、元の入力データの表現とみなすことができる。各層は、前の下位層によって生成された表現を入力として使用し、新しい表現を出力として生成し、それを上位層に送る。最下層の入力は生データであり、最終最上位層の出力は、最終的な低次元の特徴または表現である。
制限付きボルツマンマシン
制限付きボルツマンマシン(RBM) は、多層学習アーキテクチャの構成要素としてよく使用されます。[6] [24] RBM は、バイナリ隠し変数のグループ、可視変数のグループ、および隠しノードと可視ノードを接続するエッジで構成される無向二部グラフで表すことができます。これは、ノード内接続がないという制約を持つ、より一般的なボルツマンマシンの特殊なケースです。RBM の各エッジには重みが関連付けられています。重みと接続によってエネルギー関数が定義され、これに基づいて可視ノードと隠しノードの結合分布を考案できます。RBM のトポロジーに基づいて、隠し (可視) 変数は独立しており、可視 (隠し) 変数を条件としています。[説明が必要]このような条件付き独立性により、計算が容易になります。
RBMは、教師なし特徴学習のための単層アーキテクチャとして考えることができます。特に、可視変数は入力データに対応し、隠れ変数は特徴検出器に対応します。重みは、ヒントンのコントラストダイバージェンス(CD)アルゴリズムを使用して、可視変数の確率を最大化することでトレーニングできます。[24]
一般的に、最大化問題を解くことでRBMを訓練すると、非スパースな表現になる傾向があります。スパースな表現を可能にするために、スパースRBM [25]が提案されました。そのアイデアは、データ尤度の目的関数に正規化項を追加し、期待される隠れ変数が小さな定数から逸脱した場合にペナルティを課すというものです。RBMは、興味深い特徴が別々の隠れユニットにマッピングされる、データの分離表現を得るためにも使用されています。[26]
オートエンコーダ
エンコーダとデコーダで構成されるオートエンコーダは、ディープラーニングアーキテクチャのパラダイムです。HintonとSalakhutdinov [24]は、エンコーダが生データ(画像など)を入力として使用し、特徴または表現を出力として生成し、デコーダがエンコーダから抽出した特徴を入力として使用し、元の入力生データを出力として再構成する例を示しています。エンコーダとデコーダは、RBMの複数の層を積み重ねて構築されます。アーキテクチャに含まれるパラメータは、もともと貪欲な層ごとの方法でトレーニングされていました。つまり、特徴検出器の1つの層が学習された後、それらは対応するRBMをトレーニングするための可視変数として供給されます。現在のアプローチでは、通常、確率的勾配降下法を使用してエンドツーエンドのトレーニングが適用されます。トレーニングは、いくつかの停止基準が満たされるまで繰り返すことができます。
自己監督
自己教師あり表現学習は、情報信号として明示的なラベルに頼るのではなく、ラベルなしデータの構造をトレーニングすることで特徴を学習する。このアプローチにより、ディープニューラルネットワークアーキテクチャと大規模なラベルなしデータセットを組み合わせて使用することで、ディープな特徴表現を生成できるようになった。[9]トレーニングタスクは、通常、対照的、生成的、またはその両方のクラスに分類される。[27]対照的表現学習では、正のサンプルと呼ばれる関連するデータペアの表現を整列させるようにトレーニングし、負のサンプルと呼ばれる関係のないペアは対照的にする。通常、負のサンプルの大部分は、すべての入力が同じ表現にマッピングされる壊滅的な崩壊を防ぐために必要である。[9]生成的表現学習では、制限された入力に一致するか、より低次元の表現から完全な入力を再構築するために、正しいデータを生成するようにモデルに指示する。[27]
特定のデータ タイプ (テキスト、画像、音声、ビデオなど) の自己教師あり表現学習の一般的な設定は、一般的なコンテキストのラベルなしデータの大規模なデータセットを使用してモデルを事前トレーニングすることです。[11]コンテキストに応じて、この結果は、新しいデータを分割できる一般的なデータ セグメント (単語など) の表現のセット、または各新しいデータ ポイント (画像など) を低次元の特徴のセットに変換できるニューラル ネットワークのいずれかになります。[9]どちらの場合も、出力表現は、ラベル付きデータが限られている可能性のあるさまざまな問題設定で初期化として使用できます。モデルを特定のタスクに特化することは、通常、ラベルを信号としてモデル/表現を微調整するか、表現を固定してそれらを入力として受け取る追加のモデルをトレーニングすることによって、教師あり学習で行われます。[11]
様々なモダリティの表現学習に使用するために多くの自己教師あり学習スキームが開発されており、多くの場合、他のデータタイプに転送される前に、まずテキストや画像への適用が成功していることが示されています。[9]
文章
Word2vec は、大規模なテキスト コーパスのスライディング ウィンドウ内の各単語とその隣接単語に対する自己監督を通じて単語を表現することを学習する単語埋め込み手法です。 [28]このモデルには、単語ベクトル表現を生成するための 2 つのトレーニング スキームがあり、1 つは生成的、もう 1 つは対照的です。[27] 1 つ目は、各隣接単語を入力として単語を予測することです。[28] 2 つ目は、隣接単語の表現類似性とランダムな単語のペアの表現非類似性のトレーニングです。[10] word2vec の制限は、データのペアワイズ共起構造のみが使用され、順序やコンテキスト単語のセット全体は使用されないことです。最近のトランスフォーマー ベースの表現学習アプローチでは、単語予測タスクでこの問題を解決しようとしています。[9] GPT は、前の入力単語をコンテキストとして使用して次の単語予測を事前トレーニングします。[29]一方、BERT は双方向コンテキストを提供するためにランダム トークンをマスクします。[30]
他の自己教師あり学習技術は、入力データ内の文章や段落などのより大きなテキスト構造の表現を見つけることで単語埋め込みを拡張します。 [9] Doc2vecは、単語予測タスクに段落に基づいて単語が含まれる入力を追加することでword2vecの生成的トレーニングアプローチを拡張し、段落レベルのコンテキストを表現することを目的としています。[31]
画像
画像表現学習の分野では、変換、 [32]、インペインティング[33]、パッチ識別[34] 、クラスタリング[35]など、さまざまな自己教師あり学習手法が採用されてきました。
生成的アプローチの例としては、マスクされた画像を入力として、削除された画像領域を生成するためにAlexNet CNNアーキテクチャをトレーニングするコンテキストエンコーダ[33]や、画像の解像度を下げた後にピクセル予測をトレーニングすることでGPT-2言語モデルアーキテクチャを画像に適用するiGPT [36]などがあります。
他の多くの自己教師あり学習法では、シャムネットワークが使用されています。これは、さまざまな拡張を通じて画像のさまざまなビューを生成し、それらを同様の表現に整列させるものです。課題は、モデルがすべての画像を同じ表現にエンコードする、崩壊ソリューションを回避することです。[37] SimCLRは、 ResNet CNNで画像表現を生成するために負の例を使用する対照的なアプローチです。[34] Bootstrap Your Own Latent(BYOL)は、トレーニング中に変更されるモデルパラメータの低速移動平均を使用してビューの1つをエンコードすることにより、負のサンプルの必要性を排除します。[38]
グラフ
多くのグラフ表現学習技術の目標は、全体的なネットワーク トポロジに基づいて各ノードの埋め込み表現を生成することです。[39] node2vec は、グラフ内のランダム ウォークの共起を関連の尺度として使用することで、word2vecトレーニング手法をグラフ内のノードに拡張します。 [40]別のアプローチは、グラフ内の関連構造の表現間の相互情報量、つまり類似性の尺度を最大化することです。 [9]一例として、Deep Graph Infomax があります。これは、各ノードの周りの「パッチ」の表現とグラフ全体の要約表現間の相互情報量に基づく対照的自己監督を使用します。負のサンプルは、マルチグラフ トレーニング設定でグラフ表現を別のグラフの表現とペアにするか、単一グラフ トレーニングで破損したパッチ表現とペアにすることで取得されます。[41]
ビデオ
マスク予測[42]やクラスタリング[43]でも同様の結果が得られており、ビデオ表現学習アプローチは画像技術に似ていることが多いが、追加の学習構造としてビデオフレームの時間的シーケンスを利用する必要がある。例としては、ビデオクリップをマスクし、一連のクリップオプションが与えられた場合に正しいものを選択するようにトレーニングするVCPや、シャッフルされたビデオクリップセットが与えられた場合に元の順序を識別するように3D-CNNをトレーニングするXuらがある。[44]
オーディオ
自己教師あり表現技術は、多くのオーディオデータ形式、特に音声処理に適用されています。[9] Wav2vec 2.0は、時間的畳み込みを介してオーディオ波形をタイムステップに離散化し、コントラスト損失を使用してランダムタイムステップのマスク予測でトランスフォーマーをトレーニングします。 [45]これはBERT言語モデルに似ていますが、ビデオに対する多くのSSLアプローチと同様に、モデルは単語語彙全体ではなく一連のオプションの中から選択します。[30] [45]
マルチモーダル
自己教師学習は、複数のデータタイプの共同表現の開発にも使用されています。[9]アプローチでは通常、暗黙のラベルとして、モダリティ間の自然または人間由来の関連性に依存しています。たとえば、特徴的な音を持つ動物やオブジェクトのビデオクリップ、[46]または画像を説明するために書かれたキャプションです。[47] CLIP は、コントラスト損失を使用して、画像とキャプションのペアの大規模なデータセットから画像とテキストのエンコーディングを整列させるようにトレーニングすることにより、共同画像テキスト表現空間を生成します。[47] MERLOT Reserve は、3 つの共同事前トレーニングタスク (ビデオフレームと周囲のオーディオとテキストのコンテキストが与えられた場合のオーディオまたはテキストセグメントのコントラストマスク予測、およびビデオフレームと対応するキャプションのコントラストアラインメント) を通じて、トランスフォーマーベースのエンコーダーをトレーニングして、大規模なビデオデータセットからオーディオ、字幕、ビデオフレームを共同で表現します。[46]
マルチモーダル表現モデルは、通常、異なるモダリティにおける表現の直接的な対応を想定することができません。これは、正確な対応付けがノイズが多かったり、あいまいであったりすることが多いためです。たとえば、「犬」というテキストは、さまざまな犬の写真とペアになっている可能性があり、それに応じて、犬の写真はさまざまな程度の特定性でキャプションが付けられる可能性があります。この制限は、下流のタスクが最適なパフォーマンスを達成するために、モダリティ間の追加の生成マッピングネットワークを必要とする可能性があることを意味します。たとえば、テキストから画像を生成するDALLE-2などです。[48]
動的表現学習
動的表現学習法[49] [50]は、動的ネットワークなどの動的システムの潜在的な埋め込みを生成します。特定の距離関数は特定の線形変換に対して不変であるため、異なる埋め込みベクトルのセットは実際には同じ/類似の情報を表すことができます。したがって、動的システムの場合、その埋め込みの時間的な違いは、任意の変換やシステムの実際の変更による埋め込みの不整合によって説明できます。[51]したがって、一般的に言えば、動的表現学習法によって学習された時間的な埋め込みは、偽の変化がないか検査され、その後の動的分析の前に調整される必要があります。
参照
参考文献
- ^ Goodfellow, Ian (2016).ディープラーニング. Yoshua Bengio, Aaron Courville. マサチューセッツ州ケンブリッジ. pp. 524–534. ISBN 0-262-03561-8 . OCLC 955778308.
- ^ Y. Bengio; A. Courville; P. Vincent (2013). 「表現学習: レビューと新たな展望」. IEEE Transactions on Pattern Analysis and Machine Intelligence . 35 (8): 1798– 1828. arXiv : 1206.5538 . doi :10.1109/tpami.2013.50. PMID 23787338. S2CID 393948.
- ^ Stuart J. Russell、Peter Norvig (2010) Artificial Intelligence: A Modern Approach、第3版、Prentice Hall ISBN 978-0-13-604259-4。
- ^ Hinton, Geoffrey; Sejnowski, Terrence (1999).教師なし学習: ニューラルコンピューティングの基礎MIT Press. ISBN 978-0-262-58168-4 .
- ^ ネイサン・スレブロ;ジェイソンDMレニー。トミ・S・ジャーコラ (2004)。最大マージン行列因数分解。NIPS。
- ^ abcd Coates, Adam; Lee, Honglak; Ng, Andrew Y. (2011). 教師なし特徴学習における単層ネットワークの分析(PDF) . AIと統計に関する国際会議 (AISTATS). 2017-08-13のオリジナル(PDF)からアーカイブ。2014-11-24に取得。
- ^ Csurka, Gabriella; Dance, Christopher C.; Fan, Lixin; Willamowski, Jutta; Bray, Cédric (2004). バッグオブキーポイントによる視覚的分類(PDF) . ECCV Workshop on Statistical Learning in Computer Vision.
- ^ Daniel Jurafsky、James H. Martin (2009)。音声言語処理。Pearson Education International。pp. 145– 146。
- ^ abcdefghijk Ericsson, Linus; Gouk, Henry; Loy, Chen Change; Hospedales, Timothy M. (2022年5月). 「自己教師あり表現学習:概要、進歩、課題」. IEEE Signal Processing Magazine . 39 (3): 42– 62. arXiv : 2110.09327 . Bibcode :2022ISPM...39c..42E. doi :10.1109/MSP.2021.3134634. ISSN 1558-0792. S2CID 239017006.
- ^ ab Mikolov, Tomas; Sutskever, Ilya; Chen, Kai; Corrado, Greg S; Dean, Jeff (2013). 「単語と句の分散表現とその構成性」。ニューラル情報処理システムの進歩。26。Curran Associates、Inc。arXiv:1310.4546。
- ^ abc Goodfellow, Ian (2016).ディープラーニング. Yoshua Bengio, Aaron Courville. マサチューセッツ州ケンブリッジ. pp. 499–516. ISBN 0-262-03561-8 . OCLC 955778308.
- ^ Mairal, Julien; Bach, Francis; Ponce, Jean; Sapiro, Guillermo; Zisserman, Andrew (2009). 「教師あり辞書学習」。ニューラル情報処理システムの進歩。
- ^ Percy Liang (2005). 自然言語のための半教師あり学習(PDF) (M. Eng.). MIT . pp. 44– 52.
- ^ ab Joseph Turian、Lev Ratinov、Yoshua Bengio (2010)。単語表現:半教師あり学習のためのシンプルで一般的な方法(PDF) 。計算言語学協会第48回年次会議の議事録。 2014年2月26日時点のオリジナル(PDF)からアーカイブ。 2014年2月22日閲覧。
- ^ Schwenker, Friedhelm; Kestler, Hans A.; Palm, Günther (2001). 「ラジアル基底関数ネットワークの3つの学習フェーズ」.ニューラルネットワーク. 14 ( 4– 5): 439– 458. CiteSeerX 10.1.1.109.312 . doi :10.1016/s0893-6080(01)00027-2. PMID 11411631.
- ^ Coates, Adam; Ng, Andrew Y. (2012). 「k-means による特徴表現の学習」。G. Montavon、GB Orr、K.-R. Müller (編)。ニューラル ネットワーク: コツのコツ。Springer。
- ^ Dekang Lin; Xiaoyun Wu (2009). Phrase clustering for discriminative learning (PDF) . Proc. J. Conf. of the ACL and 4th Int'l J. Conf. on Natural Language Processing of the AFNLP. pp. 1030– 1038. 2016-03-03 にオリジナル(PDF)からアーカイブ。2013-07-14に閲覧。
- ^ Roweis, Sam T; Saul, Lawrence K (2000). 「局所線形埋め込みによる非線形次元削減」. Science . New Series. 290 (5500): 2323– 2326. Bibcode :2000Sci...290.2323R. doi :10.1126/science.290.5500.2323. JSTOR 3081722. PMID 11125150. S2CID 5987139.
- ^ ab Saul, Lawrence K; Roweis, Sam T (2000). 「局所線形埋め込み入門」
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要です - ^ ヒュヴァリネン、アーポ;オージャ、エルキ (2000)。 「独立成分分析: アルゴリズムとアプリケーション」。ニューラルネットワーク。13 (4): 411–430。土井:10.1016/s0893-6080(00)00026-5。PMID 10946390。S2CID 11959218 。
- ^ Lee, Honglak; Battle, Alexis; Raina, Rajat; Ng, Andrew Y (2007). 「効率的なスパースコーディングアルゴリズム」。ニューラル情報処理システムの進歩。
- ^ Aharon, Michal ; Elad, Michael; Bruckstein, Alfred (2006). 「K-SVD: スパース表現の過剰完全辞書を設計するためのアルゴリズム」. IEEE Trans. Signal Process . 54 (11): 4311– 4322. Bibcode :2006ITSP...54.4311A. doi :10.1109/TSP.2006.881199. S2CID 7477309.
- ^ Bengio, Yoshua (2009). 「AIのためのディープアーキテクチャの学習」.機械学習の基礎と動向. 2 (1): 1– 127. doi :10.1561/2200000006. S2CID 207178999.
- ^ abc Hinton, GE; Salakhutdinov, RR (2006). 「ニューラルネットワークによるデータの次元削減」(PDF) . Science . 313 (5786): 504– 507. Bibcode :2006Sci...313..504H. doi :10.1126/science.1127647. PMID 16873662. S2CID 1658773. 2015-12-23 に オリジナル(PDF)からアーカイブ。2015-08-29に取得。
- ^ Lee, Honglak; Ekanadham, Chaitanya; Andrew, Ng (2008). 「視覚領域 V2 のスパース ディープ ビリーフ ネット モデル」。ニューラル情報処理システムの進歩。
- ^ Fernandez-de-Cossio-Diaz, Jorge; Cocco, Simona; Monasson, Rémi (2023-04-05). 「敵対者なしの制限付きボルツマンマシンにおける表現の分離」. Physical Review X . 13 (2): 021003. arXiv : 2206.11600 . Bibcode :2023PhRvX..13b1003F. doi :10.1103/PhysRevX.13.021003.
- ^ abc 劉、暁;チャン、ファンジン。ホウ・ジェンユー。ミアン、リー。王、趙宇。張、静。唐潔(2021)。 「自己教師あり学習: 生成的または対照的」。知識およびデータエンジニアリングに関する IEEE トランザクション。35 (1): 857–876 . arXiv : 2006.08218。土井:10.1109/TKDE.2021.3090866。ISSN 1558-2191。S2CID 219687051。
- ^ ab Mikolov, Tomas; Chen, Kai; Corrado, Greg; Dean, Jeffrey (2013-09-06). 「ベクトル空間における単語表現の効率的な推定」. arXiv : 1301.3781 [cs.CL].
- ^ 「生成的事前トレーニングによる言語理解の向上」(PDF)。2022年10月10日閲覧。
- ^ ab Devlin, Jacob; Chang, Ming-Wei; Lee, Kenton; Toutanova, Kristina (2019年6月). 「Proceedings of the 2019 Conference of the North」。計算言語学協会の北米支部2019年会議の議事録: 人間言語技術、第1巻 (長編および短編論文) 。ミネソタ州ミネアポリス: 計算言語学協会: 4171– 4186。doi :10.18653/v1/N19-1423。S2CID 52967399 。
- ^ Le, Quoc; Mikolov, Tomas (2014-06-18). 「文章と文書の分散表現」。機械学習に関する国際会議。PMLR: 1188– 1196。arXiv : 1405.4053。
- ^ Spyros Gidaris、Praveer Singh、Nikos Komodakis。画像の回転を予測することによる教師なし表現学習。ICLR、2018年。
- ^ ab Pathak, Deepak; Krahenbuhl, Philipp ; Donahue, Jeff; Darrell, Trevor; Efros, Alexei A. (2016). 「コンテキストエンコーダー:インペインティングによる特徴学習」:2536– 2544。arXiv :1604.07379。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要です - ^ ab Chen, Ting; Kornblith, Simon; Norouzi, Mohammad; Hinton, Geoffrey (2020-11-21). 「視覚表現の対照学習のためのシンプルなフレームワーク」。国際機械学習会議。PMLR: 1597– 1607。
- ^ Mathilde, Caron; Ishan, Misra; Julien, Mairal ; Priya, Goyal; Piotr, Bojanowski; Armand, Joulin (2020). 「対照的なクラスター割り当てによる視覚特徴の教師なし学習」。ニューラル情報処理システムの進歩。33。arXiv :2006.09882。
- ^ Chen, Mark; Radford, Alec; Child, Rewon; Wu, Jeffrey; Jun, Heewoo; Luan, David; Sutskever, Ilya (2020-11-21). 「ピクセルからの生成的事前トレーニング」。機械学習に関する国際会議。PMLR: 1691– 1703。
- ^ Chen, Xinlei; He, Kaiming (2021). 「単純なシャム表現学習の探求」: 15750– 15758. arXiv : 2011.10566。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要です - ^ Jean-Bastien, Grill; Florian, Strub; Florent, Altché; Corentin, Tallec; Pierre, Richemond; Elena, Buchatskaya; Carl, Doersch; Bernardo, Avila Pires; Zhaohan, Guo; Mohammad, Gheshlaghi Azar; Bilal, Piot; koray, kavukcuoglu; Remi, Munos; Michal, Valko (2020). 「潜在変数を自分でブートストラップする - 自己教師あり学習への新しいアプローチ」。ニューラル情報処理システムの進歩。33 。
- ^ Cai, HongYun; Zheng, Vincent W.; Chang, Kevin Chen-Chuan (2018 年 9 月). 「グラフ埋め込みの包括的な調査: 問題、手法、およびアプリケーション」. IEEE Transactions on Knowledge and Data Engineering . 30 (9): 1616– 1637. arXiv : 1709.07604 . doi :10.1109/TKDE.2018.2807452. ISSN 1558-2191. S2CID 13999578.
- ^ Grover, Aditya; Leskovec, Jure (2016-08-13). 「Node2vec」。第22回ACM SIGKDD国際知識発見およびデータマイニング会議の議事録。KDD '16。Vol . 2016。ニューヨーク、ニューヨーク州、米国:Association for Computing Machinery。pp. 855– 864。doi : 10.1145 /2939672.2939754。ISBN 978-1-4503-4232-2. PMC 5108654 . PMID 27853626.
- ^ Velikovi, P.、Fedus, W.、Hamilton, WL、Li, P.、Bengio, Y.、およびHjelm, RD Deep Graph InfoMax。国際学習表現会議 (ICLR'2019)、2019年。
- ^ Luo, Dezhao; Liu, Chang; Zhou, Yu; Yang, Dongbao; Ma, Can; Ye, Qixiang; Wang, Weiping (2020-04-03). 「自己教師あり時空間学習のためのビデオクローズ手順」。AAAI人工知能会議の議事録。34 ( 7 ): 11701– 11708。arXiv :2001.00294。doi:10.1609 / aaai.v34i07.6840。ISSN 2374-3468。S2CID 209531629 。
- ^ Humam, Alwassel; Dhruv, Mahajan; Bruno, Korbar; Lorenzo, Torresani; Bernard, Ghanem; Du, Tran (2020). 「クロスモーダルオーディオビデオクラスタリングによる自己教師あり学習」。ニューラル情報処理システムの進歩。33。arXiv:1911.12667。
- ^ Xu, Dejing; Xiao, Jun; Zhao, Zhou; Shao, Jian; Xie, Di; Zhuang, Yueting (2019 年 6 月)。「ビデオ クリップ順序予測による自己教師あり時空間学習」。2019 IEEE / CVF コンピューター ビジョンおよびパターン認識会議 (CVPR)。pp. 10326– 10335。doi :10.1109/CVPR.2019.01058。ISBN 978-1-7281-3293-8. S2CID 195504152。
- ^ ab Alexei, Baevski; Yuhao, Zhou; Abdelrahman, Mohamed; Michael, Auli (2020). 「 wav2vec 2.0: 音声表現の自己教師学習のためのフレームワーク」。ニューラル情報処理システムの進歩。33。arXiv : 2006.11477。
- ^ ab Zellers, Rowan; Lu, Jiasen; Lu, Ximing; Yu, Youngjae; Zhao, Yanpeng; Salehi, Mohammadreza; Kusupati, Aditya; Hessel, Jack; Farhadi, Ali; Choi, Yejin (2022). 「MERLOT Reserve: 視覚と言語と音を通じた神経スクリプト知識」: 16375– 16387. arXiv : 2201.02639 .
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要です - ^ ab Radford, Alec; Kim, Jong Wook; Hallacy, Chris; Ramesh, Aditya; Goh, Gabriel; Agarwal, Sandhini; Sastry, Girish; Askell, Amanda; Mishkin, Pamela; Clark, Jack; Krueger, Gretchen; Sutskever, Ilya (2021-07-01). 「自然言語監督からの転送可能な視覚モデルの学習」。国際機械学習会議。PMLR: 8748– 8763。arXiv : 2103.00020。
- ^ Ramesh, Aditya; Dhariwal, Prafulla; Nichol, Alex; Chu, Casey; Chen, Mark (2022-04-12). 「CLIP Latents による階層的テキスト条件付き画像生成」. arXiv : 2204.06125 [cs.CV].
- ^ チャン、ダオクン;イン、ジエ。朱星泉。張成啓(2020年3月)。 「ネットワーク表現の学習: 調査」。ビッグデータに関するIEEEトランザクション。6 (1): 3–28 . arXiv : 1801.05852。土井:10.1109/TBDATA.2018.2850013。ISSN 2332-7790。S2CID 1479507。
- ^ Atzberger, Paul; Lopez, Ryan (2021). 「物理システムの非線形ダイナミクスを学習するための変分オートエンコーダ」. AAAI-MLPS Proceedings . arXiv : 2012.03448 .
- ^ Gürsoy, Furkan; Haddad, Mounir; Bothorel, Cécile (2023-10-07). 「埋め込みのアライメントと安定性: 測定と推論の改善」. Neurocomputing . 553 :126517 . arXiv : 2101.07251 . doi :10.1016/j.neucom.2023.126517. ISSN 0925-2312. S2CID 231632462.
