弱教師あり学習(半教師あり学習とも呼ばれる)は機械学習のパラダイムであり、大規模言語モデルの登場に伴い、学習に必要なデータ量が膨大になったことから、その重要性と注目度が高まった。弱教師あり学習の特徴は、少量の人間がラベル付けしたデータ(よりコストと時間がかかる教師あり学習パラダイムでのみ使用される)と、大量のラベルなしデータ(教師なし学習パラダイムでのみ使用される)を組み合わせることである。言い換えれば、望ましい出力値はトレーニングデータのサブセットに対してのみ提供される。残りのデータはラベルなし、または不正確にラベル付けされている。直感的には、弱教師あり学習は試験、ラベル付きデータは教師が別の問題セットを解くための補助としてクラスのために解くサンプル問題と見なすことができる。転置的学習の設定では、これらの未解決の問題は試験問題として機能する。帰納的学習の設定では、これらは試験を構成するような練習問題となる。

学習問題のためのラベル付きデータの取得には、多くの場合、熟練した人間のエージェント(例えば、音声セグメントの書き起こし)または物理的な実験(例えば、タンパク質の3D構造の決定や、特定の場所に油が存在するかどうかの判定)が必要となります。そのため、ラベル付けプロセスに伴うコストによって、大規模で完全にラベル付けされたトレーニングセットの取得が困難になる場合があります。一方、ラベルなしデータの取得は比較的安価です。このような状況では、半教師あり学習が非常に実用的な価値を持ちます。半教師あり学習は、機械学習における理論的な関心事であると同時に、人間の学習のモデルとしても注目されています。

より厳密には、半教師あり学習は、独立同分布の例対応するラベル付きそしてラベルなしの例処理されたデータに対して、半教師あり学習は、ラベルなしデータを破棄して教師あり学習を行う場合、またはラベルを破棄して教師なし学習を行う場合のいずれよりも優れた分類性能を実現するために、これらの情報を組み合わせて使用します。
半教師あり学習は、転帰的学習または帰納的学習のいずれかを指す場合がある。[ 1 ]転帰的学習の目標は、与えられたラベルなしデータに対して正しいラベルを推論することである。帰納的学習の目標は、正しいマッピングを推論することです。に。
入力空間全体にわたって分類規則を推論することによって転帰的学習を行うことは不要であり(ヴァプニックの原理によれば、賢明ではない)、しかし実際には、転帰的学習または帰納的学習のために正式に設計されたアルゴリズムがしばしば互換的に使用される。
ラベルなしデータを利用するためには、データの基となる分布との何らかの関係が存在しなければなりません。半教師あり学習アルゴリズムは、少なくとも以下の仮定のいずれかを利用します。[ 2 ]
互いに近い点ほどラベルを共有する可能性が高い。これは教師あり学習でも一般的に仮定されており、幾何学的に単純な決定境界が好まれる。半教師あり学習の場合、滑らかさの仮定により、低密度領域では決定境界が好まれるため、互いに近いがクラスが異なる点はほとんどない。[ 3 ]
データは離散的なクラスターを形成する傾向があり、同じクラスター内の点はラベルを共有する可能性が高い(ただし、ラベルを共有するデータは複数のクラスターにまたがる場合もある)。これは平滑性仮定の特殊なケースであり、クラスタリングアルゴリズムを用いた特徴学習につながる。
データは、入力空間よりもはるかに低次元の多様体上にほぼ存在します。この場合、ラベル付きデータとラベルなしデータの両方を使用して多様体を学習することで、次元の呪いを回避できます。その後、多様体上で定義された距離と密度を使用して学習を進めることができます。
多様体仮定は、直接モデル化するのが難しいものの自由度が少ないプロセスによって高次元データが生成される場合に実用的です。たとえば、人間の声は少数の声帯によって制御され、[ 4 ]さまざまな顔の表情の画像は少数の筋肉によって制御されます。このような場合、距離と滑らかさを、それぞれすべての可能な音波や画像の空間ではなく、生成問題の自然な空間で考慮する方が良いでしょう。
自己訓練(自己学習または自己ラベル付けとも呼ばれる)のヒューリスティックなアプローチは、歴史的に見て半教師あり学習の最も古いアプローチであり、[ 2 ] 1960年代から応用例が見られます。[ 5 ]
トランスダクティブ学習フレームワークは、1970年代にウラジミール・ヴァプニクによって正式に導入されました。 [ 6 ]生成モデルを使用した帰納的学習への関心も1970年代に始まりました。ガウス混合の半教師あり学習のほぼ正しい学習限界は、1995年にラツァビーとヴェンカテシュによって実証されました。[ 7 ]
統計的学習に対する生成的アプローチは、まず推定を試みる。各クラスに属するデータポイントの分布。確率特定の点ラベルがありますは、ベイズの定理により。生成モデルを用いた半教師あり学習は、教師あり学習(分類と情報)の拡張と見なすことができる。)または教師なし学習の拡張(クラスタリングとラベル付け)として。
生成モデルは、分布が何らかの特定の形式をとることを前提としている。ベクトルによってパラメータ化されるこれらの仮定が間違っている場合、ラベルなしデータは、ラベル付きデータのみから得られるものと比較して、ソリューションの精度を実際に低下させる可能性があります。[ 8 ] しかし、仮定が正しい場合は、ラベルなしデータは必然的にパフォーマンスを向上させます。[ 7 ]
ラベルなしデータは、個々のクラス分布の混合分布に従って分布します。ラベルなしデータから混合分布を学習するには、それが識別可能である必要があります。つまり、異なるパラメータが異なる合計分布を生成する必要があります。ガウス混合分布は識別可能であり、生成モデルで一般的に使用されます。
パラメータ化された同時分布は次のように記述できます。連鎖律を用いることにより、各パラメータベクトルは決定関数に関連付けられているパラメータは、ラベル付きデータとラベルなしデータの両方への適合度に基づいて選択され、重み付けされます。:
もう1つの主要な手法は、データポイントが少ない領域(ラベル付きまたはラベルなし)に境界を設定しようとするものです。最も一般的に使用されるアルゴリズムの1つは、トランスダクティブサポートベクターマシン(TSVM)です(その名前にもかかわらず、帰納的学習にも使用できます)。教師あり学習用のサポートベクターマシンは、ラベル付きデータに対して最大のマージンを持つ決定境界を求めますが、TSVMの目標は、決定境界がすべてのデータに対して最大のマージンを持つように、ラベルなしデータにラベルを付けることです。標準的なヒンジ損失に加えて、ラベル付きデータの場合、損失関数ラベルなしデータに対して導入されるTSVMは次に選択する再生核ヒルベルト空間から正規化された経験的リスクを最小化することによって:
非凸項のため、厳密解を求めることは不可能である。そのため、研究は有用な近似に焦点を当てている。[ 9 ]
低密度分離を実現する他のアプローチとしては、ガウス過程モデル、情報正則化、エントロピー最小化(TSVMはその特殊なケース)などがある。
ラプラシアン正則化は、歴史的にグラフラプラシアンを通してアプローチされてきました。半教師あり学習のためのグラフベースの手法では、データのグラフ表現を使用し、ラベル付きおよびラベルなしの各例にノードが割り当てられます。グラフは、ドメイン知識または例の類似性を使用して構築できます。一般的な2つの方法は、各データポイントをそのノードに接続することです。最も近い隣人、またはある程度の距離内の例重量エッジ間のそして次に、。
多様体正則化の枠組みでは、[ 10 ] [ 11 ]グラフは多様体の代理として機能します。標準的なティホノフ正則化問題に項が追加され、多様体(問題の固有空間)および周囲の入力空間に関して解の滑らかさが強制されます。最小化問題は次のようになります。
どこは再生核ヒルベルト空間であり、はデータが存在する多様体です。正則化パラメータそしてそれぞれ周囲空間と固有空間における滑らかさを制御します。グラフは、固有正則化項を近似するために使用されます。グラフラプラシアンの定義どこそしてベクトル、 我々は持っています
ラプラシアン正則化に対するグラフベースのアプローチは、有限差分法と関連付けられる。
ラプラシアンは、教師あり学習アルゴリズムである正則化最小二乗法とサポートベクターマシン(SVM)を、半教師あり学習バージョンのラプラシアン正則化最小二乗法とラプラシアンSVMに拡張するためにも使用できます。
半教師あり学習の手法の中には、ラベル付きデータとラベルなしデータの両方から学習することを本質的に目的としていないものがあり、代わりに教師あり学習のフレームワーク内でラベルなしデータを利用するものがあります。例えば、ラベル付きとラベルなしの例教師なし学習の最初のステップでは、データの表現、距離メトリック、またはカーネルの選択に役立つ可能性があります。次に、ラベル付きサンプルのみから教師あり学習が進められます。この流れで、教師ありデータを使用して低次元表現を学習し、学習した表現に低密度分離またはグラフベースの方法を適用する方法もあります。 [ 12 ] [ 13 ]表現を繰り返し洗練し、その表現に対して半教師あり学習を実行すると、パフォーマンスがさらに向上する可能性があります。
自己学習は、半教師あり学習のラッパー手法です。[ 14 ]まず、ラベル付きデータのみに基づいて教師あり学習アルゴリズムをトレーニングします。次に、この分類器をラベルなしデータに適用して、教師あり学習アルゴリズムへの入力として、より多くのラベル付き例を生成します。一般的に、各ステップでは、分類器が最も確信しているラベルのみが追加されます。[ 15 ]自然言語処理では、単語の意味の曖昧性解消、アクセントの復元、スペル修正などの問題に対する一般的な自己学習アルゴリズムとして、ヤロウスキーアルゴリズムがあります。[ 16 ]
共同学習は自己学習の拡張であり、複数の分類器が異なる(理想的には互いに排他的な)特徴セットで学習され、互いに対してラベル付きサンプルを生成する。[ 17 ]
形式的な半教師あり学習問題に対する人間の反応は、ラベルなしデータの影響の度合いについてさまざまな結論をもたらしました。[ 18 ]より自然な学習問題も、半教師あり学習の事例と見なすことができます。人間の概念学習の多くは、少量の直接的な指導(たとえば、幼少期に親が物体にラベルを付ける)と大量のラベルなし経験(たとえば、物体に名前を付けたり数えたりせずに、または少なくともフィードバックなしで観察すること)の組み合わせによって成り立っています。
人間の乳児は、犬や猫の画像、男性や女性の顔など、ラベル付けされていない自然なカテゴリーの構造に敏感である。[ 19 ]乳児や子供は、ラベル付けされていない例だけでなく、ラベル付けされた例が生じるサンプリング過程も考慮に入れる。 [ 20 ] [ 21 ]
弱教師あり学習は、限定的または不正確なラベル付きデータの課題に対処する、予測保守における新興の機械学習アプローチです。従来の予測保守モデルは、多くの場合、正確にラベル付けされた大量の故障データと運用データに依存していますが、これは入手がコストがかかるか非現実的な場合があります。弱教師あり学習は、ノイズのあるラベル、ヒューリスティック、ドメインエキスパートルール、部分的にラベル付けされたデータセットなど、不完全な教師ありソースを活用して予測モデルをトレーニングすることで、この問題を軽減します。データプログラミング、ラベルモデリング、半教師あり学習などの技術を組み込むことで、弱教師あり学習は、高品質のラベル付きデータへの依存度を減らしながら、機器の故障や異常を特定できる堅牢な予測保守システムの開発を可能にします。このアプローチは、機械の故障がまれで、ラベル付き故障データが少ない産業環境で特に価値があります。[ 22 ]
{{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク)