自己教師あり学習 (SSL )は、 機械学習 のパラダイムの一つで、外部から提供されるラベルに頼るのではなく、データ自体を使用して教師信号を生成することで、タスクのモデルを訓練します。ニューラルネットワーク の文脈では、自己教師あり学習は、入力データ内の固有の構造や関係性を活用して、意味のある訓練信号を生成することを目的としています。SSLタスクは、データ内の重要な特徴 や関係性を捉えることで解決できるように設計されています。入力データは通常、関連するサンプルのペアを作成するように拡張または変換され、一方のサンプルが入力として機能し、もう一方のサンプルが教師信号の生成に使用されます。この拡張には、ノイズの導入、切り抜き、回転、その他の変換が含まれる場合があります。自己教師あり学習は、人間が物体を分類する方法をより忠実に模倣しています。[ 1 ]
SSLでは、モデルは2つのステップで学習します。まず、モデルパラメータの 初期化に役立つ擬似ラベルを使用して、補助的または前置き的な分類タスクに基づいてタスクが解決されます。[ 2 ] [ 3 ] 次に、教師あり学習 または教師なし学習 を使用して実際のタスクが実行されます。[ 4 ] [ 5 ] [ 6 ]
自己教師あり学習は近年有望な結果を生み出しており、音声処理 などの分野で実用的な応用が見出され、Facebook などが音声認識 に利用している。[ 7 ]
擬似ラベル 擬似ラベルは、モデルが自身の予測に基づいてラベルなしデータに割り当てる自動生成ラベルです。これらは、正解ラベルが限られているか利用できない自己教師あり学習や半教師あり学習で広く使用されています。予測ラベルを正解ラベルの代わりとして扱うことで、学習アルゴリズムはトレーニングプロセスで大量のラベルなしデータを利用できます。[ 8 ]
擬似ラベル付けは、データの統計的特性が時間とともに変化する概念ドリフト に適応する必要があるシステムでも重要な役割を果たします。このようなシナリオでは、モデルは入力インスタンスが以前に学習した動作から逸脱していることを検出する可能性があります。システムはそのインスタンスの分類結果を生成し、この予測されたクラスは、古くなりつつあるモデルコンポーネントを更新または再トレーニングするための擬似ラベルとして使用されます。このアプローチにより、手動による注釈を必要とせずに、動的な環境で継続的な適応が可能になります。[ 9 ] [ 10 ]
多くの適応型学習 パイプラインでは、分類器が十分な確信度で予測を生成した場合に擬似ラベルが選択され、エラー伝播のリスクが低減されます。これらの擬似ラベル付きインスタンスは、特に既存のコンポーネントがドリフトや分布シフトによって「劣化」の兆候を示した場合に、新たなデータパターンに対するモデルの理解を更新または進化させるために、トレーニングに組み込まれます。この戦略により、手動によるラベル付けへの依存度を低減しつつ、長期的なモデル性能の維持に役立ちます。
種類
自己連想型自己教師あり学習 自己連想型自己教師あり学習は、ニューラルネットワークが自身の入力データを再現または再構築するように訓練される自己教師あり学習の特定のカテゴリです。[ 11 ] 言い換えれば、モデルはデータの本質的な特徴や構造を捉える表現を学習し、元の入力を再生成するように求められます。
「自己連想」という用語は、モデルが入力データを本質的にそれ自身と関連付けているという事実から来ています。これは多くの場合、表現学習に使用されるニューラルネットワークアーキテクチャの一種であるオートエンコーダー を使用して実現されます。オートエンコーダーは、入力データを低次元表現(潜在空間)にマッピングするエンコーダー ネットワークと、この表現から入力を再構築するデコーダーネットワークで構成されています。
学習プロセスでは、モデルに入力データを与え、可能な限り元のデータに忠実に再構築するように要求します。学習中に使用される損失関数は 、通常、元の入力と再構築された出力との差(例えば、平均二乗誤差)にペナルティを課します。この再構築誤差を最小化することで、オートエンコーダーは 潜在空間 におけるデータの意味のある表現を学習します。
対照的な自己教師あり学習 二値分類 タスクの場合、トレーニングデータは 正例と負例に分けられます。正例はターゲットと一致するものです。たとえば、鳥を識別する分類器をトレーニングする場合、正のトレーニングデータには鳥を含む画像が含まれます。負例は鳥を含まない画像です。[ 12 ] 対照的自己教師あり学習では、正例と負例の両方を使用します。対照的学習の損失関数は、正例ペア間の距離を最小化し、負例ペア間の距離を最大化するために使用されます。[ 12 ]
初期の例では、1 次元畳み込みニューラル ネットワーク のペアを使用して2 つの画像を処理し、それらの一致を最大化します。[ 13 ]
対照言語画像事前学習 (CLIP)は、テキストエンコーダと画像エンコーダの共同事前学習を可能にし、一致する画像とテキストのペアの画像エンコーディングベクトルとテキストエンコーディングベクトルが小さな角度(大きなコサイン類似度 )を持つようにします。
InfoNCE(ノイズコントラスト推定)[ 14 ]は、ノイズコントラスト推定(NCE) [ 15 ] に基づいて2つのモデルを同時に最適化する方法です。X = { x 1 、 … x N } {\displaystyle X=\left\{x_{1},\ldots x_{N}\right\}} のN {\displaystyle N} 1 つの陽性サンプルを含むランダムサンプルp ( x t + k ∣ c t ) {\displaystyle p\left(x_{t+k}\mid c_{t}\right)} そしてN − 1 {\displaystyle N-1} 「提案」分布からのネガティブサンプルp ( x t + k ) {\displaystyle p\left(x_{t+k}\right)} これは、以下の損失関数を最小化します。
L N = − E X [ ログ f k ( x t + k 、 c t ) ∑ x j ∈ X f k ( x j 、 c t ) ] {\displaystyle {\mathcal {L}}_{\mathrm {N} }=-\mathbb {E} _{X}\left[\log {\frac {f_{k}\left(x_{t+k},c_{t}\right)}{\sum _{x_{j}\in X}f_{k}\left(x_{j},c_{t}\right)}}\right]}
非対照的な自己教師あり学習 非対照自己教師あり学習(NCSSL)は、正例のみを使用します。直感に反して、NCSSLは損失がゼロの自明な解に到達するのではなく、有用な局所最小値に収束します。バイナリ分類の例では、各例を正として分類するように自明に学習します。効果的なNCSSLには、ターゲット側で逆伝播 しないオンライン側の追加の予測器が必要です。[ 12 ]
共同埋め込みと予測アーキテクチャ 自己教師あり学習の主要なクラスは、対照的なペアを超えて、統計的制約によって崩壊を防ぎながら、ビュー間の合意を最大化します。ディープ正準相関分析 (Deep CCA) [ 16 ]に根ざしたこのアプローチには、Barlow Twins [ 17 ] や VICReg [ 18 ] のようなジョイント埋め込みアーキテクチャ (JEA) が含まれており、負のサンプリングなしで不変表現を学習するために共分散制約を強制します。ディープ潜在変数パスモデリング (DLVPM) [ 19 ] は、これをマルチモーダルシステムに一般化し、パスモデルを使用して、さまざまなデータタイプ間で相関と直交性を強制します。
2022年、ヤン・ルカンは、 自律学習による自己改善を含め、機械における意思決定、推論、自律的な人間知能への一歩として、ジョイント埋め込み予測アーキテクチャ(JEPA)を発表しました。表現学習を基盤とするルカンは、機械に自らが存在する世界の概念を与えることで、機械が人間の知能を再現できるようにすることを目的とした「世界モデル 」の概念をJEPAに取り入れました。[ 20 ]
オートエンコーダーとは異なり、JEPAは潜在空間で完全に動作し、ピクセルレベルのノイズを回避して意味構造に焦点を当てます。JEPAは不変性を学習するだけでなく、可視コンテキストからマスクされた潜在表現を予測することによって学習します。[ 21 ] JEPAは、画像解析 [ 22 ] 、音声処理[ 23 ] 、画像やビデオの動き[ 24 ] などの領域に適用されています。
SSLは、入力から分類された出力を生成することを目標としている点で、教師あり学習手法に属します。しかし同時に、ラベル付き入出力ペアを明示的に使用する必要はありません。代わりに、相関関係、データに埋め込まれたメタデータ、または入力に存在するドメイン知識が 、データから暗黙的かつ自律的に抽出されます。データから抽出されたこれらの教師信号は、トレーニングに使用できます。[ 1 ]
SSLは、サンプルデータにラベルを必要としないという点で、教師なし学習と似ています。ただし、教師なし学習とは異なり、学習は固有のデータ構造を使用して行われるわけではありません。
半教師あり学習は 教師あり学習と教師なし学習を組み合わせたもので、学習データのごく一部にラベルを 付けるだけでよい。[ 3 ]
転移学習 では、あるタスク用に設計されたモデルが別のタスクで再利用されます。[ 25 ]
オートエンコーダーの トレーニングは、出力パターンが入力パターン自体の最適な再構成になる必要があるため、本質的に自己教師あり学習プロセスです。しかし、現在の専門用語では、「自己教師あり学習」という用語は、多くの場合、事前テキストタスクのトレーニング設定に基づくタスクを指します。これは、完全に自己完結型のオートエンコーダーのトレーニングの場合とは異なり、そのような事前テキストタスクの(人間の)設計を伴います。[ 11 ]
強化学習 では、損失の組み合わせによる自己教師あり学習により、状態に関する最も重要な情報のみが圧縮された形で保持される抽象的な表現を作成できます。[ 26 ]
参考文献 1 2 Bouchard, Louis (2020年11月25日). 「自己教師あり学習とは何か?|機械はいつか人間のように学習できるようになるのか?」 . Medium . 2021年 6月9日 取得 。 ↑ Doersch, Carl; Zisserman, Andrew (2017年10月) 「マルチタスク自己教師あり視覚学習」 2017 IEEE International Conference on Computer Vision (ICCV) IEEE. pp. 2070–2079 . arXiv : 1708.07860 . doi : 10.1109/iccv.2017.226 . ISBN 978-1-5386-1032-9 . S2CID 473729 . 1 2 Beyer, Lucas; Zhai, Xiaohua; Oliver, Avital; Kolesnikov, Alexander (2019年10月). "S4L: 自己教師あり半教師あり学習" . 2019 IEEE/CVF 国際コンピュータビジョン会議 (ICCV) . IEEE. pp. 1476–1485 . arXiv : 1905.03670 . doi : 10.1109/iccv.2019.00156 . ISBN 978-1-7281-4803-8 . S2CID 167209887 . ↑ Doersch, Carl; Gupta, Abhinav; Efros, Alexei A. (2015年12月). "コンテキスト予測による教師なし視覚表現学習" . 2015 IEEE International Conference on Computer Vision (ICCV) . IEEE. pp. 1422–1430 . arXiv : 1505.05192 . doi : 10.1109 /iccv.2015.167 . ISBN 978-1-4673-8391-2 . S2CID 9062671 . ↑ Zheng, Xin; Wang, Yong; Wang, Guoyou; Liu, Jianguo (2018 年 4 月). "自己教師あり学習による白血球画像の高速かつ堅牢なセグメンテーション" . Micron . 107 : 55–71 . doi : 10.1016 /j.micron.2018.01.010 . ISSN 0968-4328 . PMID 29425969. S2CID 3796689 . ↑ Gidaris, Spyros; Bursuc, Andrei; Komodakis, Nikos; Perez, Patrick Perez; Cord, Matthieu (2019年10月). "Boosting Few-Shot Visual Learning with Self-Supervision" . 2019 IEEE/CVF International Conference on Computer Vision (ICCV) . IEEE. pp. 8058–8067 . arXiv : 1906.05186 . doi : 10.1109/iccv.2019.00815 . ISBN 978-1-7281-4803-8 . S2CID 186206588 . 1 2 「Wav2vec: 自己監視による最先端の音声認識」 . ai.facebook.com . 2021年 6月9日 取得 . ↑ Lee, Dong-Hyun (2013). Pseudo-Label: The Simple and Efficient Semi-Supervised Learning Method for Deep Neural Networks . ICML 2013 Workshop on Challenges in Representation Learning (WREPL). ↑ Gama, João (2014). "概念ドリフト適応に関する調査" . ACM Computing Surveys . 46 (4): 1– 37. doi : 10.1145/2523813 . ↑ Xu, K.; Li, Y.; Deng, R.; Chen, K.; Xu, J. (2019). 自己進化型Androidマルウェア検出システム . IEEE European Symposium on Security and Privacy (EuroS&P). pp. 47–62 . doi : 10.1109/EuroSP.2019.00014 . 1 2 Kramer, Mark A. (1991). "自己連想ニューラルネットワークを用いた非線形主成分分析" (PDF) . AIChE Journal . 37 (2): 233– 243. Bibcode : 1991AIChE..37..233K . doi : 10.1002/aic.690370209 . 1 2 3 4 「重要な自己教師あり学習手法の解明:非対照学習」 . ai.facebook.com . 2021年 10月5日 取得 . ↑ Becker, Suzanna; Hinton, Geoffrey E. (1992年1月). 「ランダムドットステレオグラムの表面を発見する自己組織化ニューラルネットワーク」 . Nature . 355 (6356): 161–163 . Bibcode : 1992Natur.355..161B . doi : 10.1038/355161a0 . ISSN 1476-4687 . PMID 1729650 . ↑ Oord, Aaron van den; Li, Yazhe; Vinyals, Oriol (2019年1月22日). "Representation Learning with Contrastive Predictive Coding". arXiv : 1807.03748 [ cs.LG ]. ↑ Gutmann, Michael; Hyvärinen, Aapo (2010年3月31日) 「ノイズコントラスト推定:非正規化統計モデルのための新しい推定原理」 。 第13回人工知能と統計に関する国際会議議事録 。JMLRワークショップおよび会議議事録: 297–304 。 ↑ Andrew, Galen; Arora, Raman; Bilmes, Jeff; Livescu, Karen (2013年5月26日). "Deep Canonical Correlation Analysis" . Proceedings of the 30th International Conference on Machine Learning . PMLR: 1247–1255 . ↑ Zbontar, Jure; Jing, Li; Misra, Ishan; LeCun, Yann; Deny, Stephane (2021年7月1日). 「Barlow Twins: 冗長性削減による自己教師あり学習」 . 第38回国際機械学習会議議事録 . PMLR: 12310–12320 . ↑ Bardes, Adrien; Ponce, Jean; LeCun, Yann (2021年5月11日). "VICReg: 自己教師あり学習のための分散不変性共分散正則化". arXiv : 2105.04906v3 [ cs.CV ]. ↑ Ing, Alex; Andrades, Alvaro; Cosenza, Marco Raffaele; Korbel, Jan O. (2025年7月). "深層潜在変数パスモデリングを用いたマルチモーダル癌データの統合" . Nature Machine Intelligence . 7 (7): 1053– 1075. doi : 10.1038/s42256-025-01052-4 . ISSN 2522-5839 . PMC 12283373 . PMID 40709098 . ↑ LeCun, Yann (2022年6月27日). 「自律型機械知能への道」 . OpenReview . ↑ Assran, Mahmoud; Duval, Quentin; Misra, Ishan; Bojanowski, Piotr; Vincent, Pascal; Rabbat, Michael; LeCun, Yann; Ballas, Nicolas (2023年4月13日). "Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture". arXiv : 2301.08243 [ cs.CV ]. ↑ Garrido, Quentin; Assran, Mahmoud; Ballas, Nicolas; Bardes, Adrien; Najman, Laurent; LeCun, Yann (2024). "Learning and Leveraging World Models in Visual Representation Learning". arXiv : 2403.00504 [ cs.CV ]. ↑ フェイ、ジェンコン。ファン・ミンユアン;黄潤士(2023)。 「A-JEPA: ジョイント埋め込み予測アーキテクチャはリッスンできる」。 arXiv : 2311.15830 [ cs.SD ]。 ↑ Bardes, Adrien; Ponce, Jean; LeCun, Yann (2023). "MC-JEPA: 動きとコンテンツの特徴の自己教師あり学習のための共同埋め込み予測アーキテクチャ". arXiv : 2307.12698 [ cs.CV ]. ↑ Littwin, Etai; Wolf, Lior (2016年6月) 「堅牢な転移学習のためのマルチバース損失」 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) IEEE. pp. 3957–3966 . arXiv : 1511.09033 . doi : 10.1109/cvpr.2016.429 . ISBN 978-1-4673-8851-1 . S2CID 6517610 . ↑ Francois-Lavet, Vincent; Bengio, Yoshua; Precup, Doina; Pineau, Joelle (2019). "抽象表現による強化学習の組み合わせ". AAAI 人工知能会議議事録 . arXiv : 1809.04506 . ↑ 「BERTのオープンソース化:自然言語処理のための最先端の事前学習」 。Google AIブログ 。2018年11月2日。 2021年 6月9日 取得 。 ↑ Wilcox, Ethan; Qian, Peng; Futrell, Richard; Kohita, Ryosuke; Levy, Roger; Ballesteros, Miguel (2020). "構造的監視によりニューラル言語モデルにおける少数ショット学習と構文一般化が改善される" . Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP) . Stroudsburg, PA, USA: Association for Computational Linguistics. pp. 4640– 4652. arXiv : 2010.05725 . doi : 10.18653/v1/2020.emnlp-main.375 . S2CID 222291675 . ↑ グリル、ジャン・バスティアン。フロリアン・スタブ。アルチェ、フィレンツェ;タレック、コランタン。リシュモン、ピエール H.ブチャツカヤ、エレナ。カール・ドーシュ。ピレス、ベルナルド・アビラ。郭、趙漢ダニエル。アザール、モハマド・ゲシュラギ。ピオット、ビラル(2020年9月10日)。 「自分自身の潜在能力をブートストラップする: 自己教師あり学習への新しいアプローチ」。 arXiv : 2006.07733 [ cs.LG ]。 ↑ Gündüz, Hüseyin Anil; Binder, Martin; To, Xiao-Yin; Mreches, René; Bischl, Bernd; McHardy, Alice C.; Münch, Philipp C.; Rezaei, Mina (2023年9月11日). "ゲノミクスにおけるデータ効率の良いトレーニングのための自己教師あり深層学習法" . Communications Biology . 6 (1): 928. doi : 10.1038/s42003-023-05310-2 . ISSN 2399-3642 . PMC 10495322 . PMID 37696966 . ↑ Ye, He; Martinez, Matias; Luo, Xiapu; Zhang, Tao; Monperrus, Martin (2022). "SelfAPR: テスト実行診断による自己監視型プログラム修復" . 第37回IEEE/ACM国際自動ソフトウェア工学会議議事録 . pp. 1–13 . doi : 10.1145/3551349.3556926 . ISBN 978-1-4503-9475-8 2026年5月28日 に取得 。
さらに読む バレストリエロ、ランドール。イブラヒム、マーク。ソバル、ヴラド。モルコス、アリ。シェカール、シャシャンク。ゴールドスタイン、トム。ボルデス、フロリアン。バーデス、エイドリアン。ミアロン、グレゴワール。天、元東。シュワルツシルト、アヴィ。ウィルソン、アンドリュー・ゴードン。ガイピン、ジョナス。ガリード、クエンティン。フェルナンデス、ピエール(2023年4月24日)。 「自己教師あり学習のクックブック」。arXiv : 2304.12210 [ cs.LG ]。
外部リンク Doersch, Carl ; Zisserman, Andrew (2017年10月)「マルチタスク自己教師あり視覚学習」2017 IEEE International Conference on Computer Vision (ICCV) pp. 2070–2079 . arXiv : 1708.07860 . doi : 10.1109/ICCV.2017.226 . ISBN 978-1-5386-1032-9 . S2CID 473729 . カール・ドーシュ。グプタ、アビナフ。エフロス、アレクセイ A. (2015 年 12 月)。 「文脈予測による教師なし視覚表現学習」。2015 IEEE コンピューター ビジョン国際会議 (ICCV) 。ページ1422–1430。arXiv : 1505.05192 。 土井 :10.1109/ICCV.2015.167。ISBN 978-1-4673-8391-2 . S2CID 9062671 . Zheng, Xin; Wang, Yong; Wang, Guoyou; Liu, Jianguo (2018年4月1日). 「自己教師あり学習による白血球画像の高速かつ堅牢なセグメンテーション」 . Micron . 107 : 55–71 . doi : 10.1016 /j.micron.2018.01.010 . ISSN 0968-4328 . PMID 29425969. S2CID 3796689 . Yarowsky, David (1995). "教師なし単語意味曖昧性解消法が教師あり法に匹敵する" . Proceedings of the 33rd Annual Meeting of the Association for Computational Linguistics . Cambridge, MA: Association for Computational Linguistics: 189–196 . doi : 10.3115 /981658.981684 . 2022年 11月1日 取得 。