共学習は、ラベル付きデータが少なく、ラベルなしデータが大量にある場合に使用される機械学習アルゴリズムです。その用途の一つとして、検索エンジンのテキストマイニングが挙げられます。1998年にアヴリム・ブルームとトム・ミッチェルによって提唱されました。
共同学習は、データの2 つのビューを必要とする半教師あり学習手法です。各例は、インスタンスに関する補完的な情報を提供する 2 つの異なる特徴セットを使用して記述されていると想定しています。理想的には、2 つのビューは条件付きで独立しており(つまり、各インスタンスの 2 つの特徴セットは、クラスが与えられた場合に条件付きで独立しています)、各ビューは十分です (つまり、インスタンスのクラスは、各ビューのみから正確に予測できます)。共同学習では、まず、ラベル付きの例を使用して、各ビューごとに個別の分類器を学習します。次に、ラベルなしデータに対する各分類器の最も確信度の高い予測を使用して、追加のラベル付きトレーニングデータを反復的に構築します。[ 1 ]
オリジナルの共同トレーニング論文では、共同トレーニングを使用してウェブページを「学術コースのホームページ」かそうでないかに分類する実験について説明しました。分類器は、ラベル付けされたウェブページがわずか12個の例であるにもかかわらず、788のウェブページの95%を正しく分類しました。[ 2 ]この論文は1000回以上引用され、著名なコンピュータサイエンス会議である第25回国際機械学習会議(ICML 2008)で10年間最優秀論文賞を受賞しました。[ 3 ] [ 4 ]
KrogelとSchefferは2004年に、データセットが独立している場合にのみ共同学習が有効であることを示した。つまり、一方の分類器が、もう一方の分類器が以前に誤分類したデータポイントを正しくラベル付けした場合のみ有効である。分類器がラベル付けされていないすべてのデータについて一致している場合、つまり分類器が依存している場合、データのラベル付けは新しい情報を生み出しない。分類器の依存度が60%を超える実験では、結果が悪化した。[ 5 ]
共同トレーニングは、ページ上のテキストを一方のビューとして、そのページを指す他のページのハイパーリンクのアンカーテキストをもう一方のビューとして、ウェブページを分類するために使用されてきました。簡単に言えば、あるページのハイパーリンク内のテキストは、リンク先のページに関する情報を提供できます。 [ 2 ]共同トレーニングは、まだ分類またはタグ付けされていない「ラベルなし」テキストで機能することができ、これはウェブページや電子メールに表示されるテキストによく見られます。Tom Mitchell 氏によると、「ページを説明する特徴は、ページ上の単語と、そのページを指すリンクです。共同トレーニング モデルは、両方の分類器を使用して、ページが検索条件に関連するデータを含む可能性を判断します。」ウェブサイト上のテキストは、リンク分類器の関連性を判断できるため、「共同トレーニング」という用語が使われています。Mitchell 氏は、他の検索アルゴリズムの精度は 86% であるのに対し、共同トレーニングの精度は 96% であると主張しています。[ 6 ]
共同学習は、求人検索サイトのFlipDog.comや、米国労働省の継続教育および遠隔教育のディレクトリで使用されました。[ 6 ]また、統計解析や視覚的検出など、他の多くのアプリケーションでも使用されています。[ 7 ]