機械学習において、マルチインスタンス学習(MIL)は教師あり学習の一種です。学習器は、個別にラベル付けされたインスタンスのセットを受け取る代わりに、それぞれに多数のインスタンスを含むラベル付きバッグのセットを受け取ります。マルチインスタンス二値分類の単純なケースでは、バッグ内のすべてのインスタンスが負であれば、バッグは負とラベル付けされます。一方、バッグ内に少なくとも1つの正のインスタンスがあれば、バッグは正とラベル付けされます。ラベル付きバッグのコレクションから、学習器は(i)個々のインスタンスを正しくラベル付けする概念を誘導するか、(ii)概念を誘導せずにバッグにラベルを付ける方法を学習しようとします。
Babenko (2008) [ 1 ]は、MIL の簡単な例を挙げています。数人の人がいて、それぞれが数個の鍵が入ったキーホルダーを持っていると想像してください。これらの人のうち、ある部屋に入れる人もいれば、入れない人もいます。そこで、特定の鍵またはキーホルダーでその部屋に入れるかどうかを予測することが課題となります。この問題を解決するには、すべての「有効な」キーホルダーに共通する正確な鍵を見つける必要があります。この鍵を正しく識別できれば、キーホルダー全体を正しく分類することもできます。必要な鍵が含まれている場合は「有効」、含まれていない場合は「無効」と分類できます。
トレーニングデータの種類とバリエーションに応じて、機械学習は大きく分けて教師あり学習、教師なし学習、強化学習の3つのフレームワークに分類できます。マルチインスタンス学習(MIL)は教師あり学習のフレームワークに属し、すべてのトレーニングインスタンスには、離散値または実数値のラベルが付与されます。MILは、トレーニングセット内のラベルに関する知識が不完全な問題を扱います。より正確には、マルチインスタンス学習では、トレーニングセットはラベル付きの「バッグ」で構成され、各バッグはラベルなしインスタンスの集合です。バッグ内のインスタンスのうち少なくとも1つが正であれば正のラベルが付与され、すべてのインスタンスが負であれば負のラベルが付与されます。MILの目標は、新しい、未知のバッグのラベルを予測することです。
Keeler ら[ 2 ]は、1990 年代初頭の研究で、MIL の分野を最初に探求しました。マルチインスタンス学習という実際の用語は、1990 年代半ばに Dietterich らが薬剤活性予測の問題を調査していたときに導入されました。[ 3 ]彼らは、既知の分子のコレクションを分析することによって、新しい分子が何らかの薬剤を作るのに適しているかどうかを予測できる学習システムを作成しようとしました。分子は多くの代替的な低エネルギー状態を持つことができますが、そのうちの 1 つまたはいくつかだけが薬剤を作るのに適しています。問題は、科学者が分子に適しているかどうかだけを判断でき、どの低エネルギー形状がそれの原因となっているかを正確に言うことができなかったために発生しました。
この問題を解決するために提案された方法の 1 つは、教師あり学習を使用し、適格な分子のすべての低エネルギー形状を正のトレーニング インスタンスとみなし、不適格な分子のすべての低エネルギー形状を負のインスタンスとみなすことでした。Dietterich らは、この方法では、すべての低エネルギー形状が誤って正とラベル付けされるため、偽陽性ノイズが高くなり、実際には役に立たないことを示しました。[ 3 ]彼らのアプローチは、各分子をラベル付きバッグとみなし、その分子のすべての代替低エネルギー形状を個別のラベルなしでバッグ内のインスタンスとみなすことでした。これにより、マルチインスタンス学習が定式化されました。
Dietterich らが提案した複数インスタンス学習問題の解決策は、軸平行矩形 (APR) アルゴリズムです。[ 3 ]このアルゴリズムは、特徴の結合によって構築された適切な軸平行矩形を探索します。彼らは、薬剤活性予測の具体的なテスト データであり、複数インスタンス学習で最もよく使用されるベンチマークである Musk データセットでこのアルゴリズムをテストしました。[ 4 ] [ 5 ] APR アルゴリズムは最良の結果を達成しましたが、APR は Musk データを念頭に置いて設計されました。
マルチインスタンス学習の問題は、創薬に限ったものではありません。1998年、MaronとRatanは、マシンビジョンのシーン分類にマルチインスタンス学習の別の応用例を見つけ、Diverse Densityフレームワークを考案しました。[ 6 ]画像が与えられると、インスタンスは1つ以上の固定サイズのサブ画像とみなされ、インスタンスのバッグは画像全体とみなされます。画像にターゲットシーン(たとえば滝)が含まれている場合はポジティブ、そうでない場合はネガティブとラベル付けされます。マルチインスタンス学習は、ターゲットシーンを特徴付けるサブ画像のプロパティを学習するために使用できます。それ以来、これらのフレームワークは、画像コンセプト学習やテキスト分類から株式市場の予測まで、幅広いアプリケーションに適用されてきました。
画像分類を例にとると、Amores (2013)は、与えられた画像からその視覚的内容に基づいてターゲットクラスを判別したいとします。例えば、ターゲットクラスが「ビーチ」で、画像に「砂」と「水」の両方が含まれている場合を考えてみましょう。MILの用語では、画像はバッグとして記述されます。それぞれは、対応するから抽出された特徴ベクトル(インスタンスと呼ばれる)です。画像内の 番目の領域とは、画像を分割する領域(インスタンス)の総数です。バッグに「砂」領域のインスタンスと「水」領域のインスタンスの両方が含まれている場合、バッグは正(「ビーチ」)とラベル付けされます。
MILが適用される例は以下のとおりです。
多くの研究者が、サポートベクターマシンやブースティングといった古典的な分類手法を、複数インスタンス学習の文脈で機能するように適応させる研究に取り組んできた。
インスタンスの空間がすると、バッグの集合は関数の集合となる。これは、の多重部分集合の集合と同型である。各バッグにつきそして各事例、回数として見なされる発生する[ 8 ]ラベルの空間であるならば、「複数インスタンス概念」はマップであるMILの目標は、そのような概念を学習することです。記事の残りの部分では、バイナリ分類に焦点を当てます。。
Dietterich et al. (1997) や Maron & Lozano-Pérez (1997) の初期の論文[ 3 ] [ 9 ]を含む、マルチインスタンス学習に関するほとんどの研究は、バッグ内のインスタンスとバッグのクラスラベルの関係について仮定を置いています。その重要性から、この仮定はしばしば標準 MI 仮定と呼ばれます。
標準的な仮定では、各インスタンスが関連ラベルを持つこれは学習者には隠されている。は「インスタンスレベルの概念」と呼ばれます。バッグはインスタンスレベルの概念のマルチセットとして見なされ、そのインスタンスの少なくとも1つが正のラベルを持つ場合は正、すべてのインスタンスが負のラベルを持つ場合は負とラベル付けされます。形式的には、バッグになる。ラベルはすると標準的な相互情報量(MI)の仮定は非対称であり、正負のラベルが逆になると、仮定の意味が変わってしまいます。そのため、この仮定を用いる際には、どちらのラベルを正とするかを明確にする必要があります。
標準的な仮定は厳しすぎると見なされる可能性があり、そのため近年、研究者たちはその立場を緩和しようと試み、より緩やかな仮定が生まれた。[ 10 ]その理由は、標準的なMIL仮定はMuskデータセットに適しているものの、MILは他の多くの問題にも適用できるため、おそらく別の仮定の方がより適切であるという考えに基づいている。この考えに基づき、Weidmann [ 11 ]はMILのための一般化されたインスタンスベースの仮定の階層を定式化した。これは、標準的なMI仮定と3種類の一般化されたMI仮定から構成され、それぞれが前のものよりも一般的である。つまり、前者は後者の特定のパラメータの選択として得られるという意味で、標準的なMI仮定よりも一般的である。プレゼンスベース閾値ベースカウントベースの仮定が最も一般的で、標準の仮定が最も一般的ではない。(ただし、カウントベースの仮定を満たすバッグは閾値ベースの仮定を満たし、閾値ベースの仮定は存在ベースの仮定を満たし、存在ベースの仮定は標準の仮定を満たすことに注意してください。その意味で、標準の仮定が最も弱く、したがって最も一般的であり、カウントベースの仮定が最も強く、したがって最も一般的ではないと言うことも正しいです。)これらの仮定のいずれかの下でうまく機能するアルゴリズムは、より一般的でない仮定の下でも少なくとも同等にうまく機能すると期待されます。
存在に基づく仮定は、標準的な仮定の一般化であり、バッグが肯定とラベル付けされるためには、必要なインスタンスレベルの概念のセットに属するすべてのインスタンスが含まれている必要がある。形式的には、を必要なインスタンスレベルの概念の集合とし、インスタンスレベルの概念が出現した回数を表すバッグの中で発生する。 それからすべての人々のために。インスタンスレベルの概念が1つだけ含まれる場合、存在に基づく仮定は標準的な仮定に帰着する。
さらに一般化すると、閾値ベースの仮定では、各必須インスタンスレベルの概念は、バッグ内で一度出現するだけでなく、バッグが正であるとラベル付けされるために、最小(閾値)回数出現する必要がある。上記の表記では、各必須インスタンスレベルの概念に対してしきい値に関連付けられていますバッグの場合、すべての人々のために。
カウントベースの仮定は、必須概念が正にラベル付けされたバッグ内で出現できる回数の下限と上限の両方を強制する最終的な一般化です。各必須インスタンスレベルの概念しきい値が低い上限値とバッグラベルはすべての人々のために。
Scott、Zhang、およびBrown(2005)[ 12 ]は、標準モデルの別の一般化である「一般化複数インスタンス学習」(GMIL)について述べている。GMILの仮定は、必要なインスタンスのセットを指定する。バッグ少なくとも に十分近いインスタンスが含まれている場合、ポジティブとラベル付けされます。必要なインスタンスのうち[ 12 ]この条件の下でのみ、GMILの仮定は存在に基づく仮定と同等である。[ 8 ]しかし、Scottらは、吸引点の集合が存在するというさらなる一般化について述べている。そして反発点の集合バッグは、少なくとも に十分近いインスタンスが含まれている場合に限り、ポジティブとラベル付けされます。観光名所の1つであり、最大でも十分近い。反発点の。[ 12 ]この条件は、存在に基づく条件よりも厳密には一般的ですが、上記の階層には含まれません。
バッグが固定されていると想定されていた以前の想定とは対照的に、集合的な想定ではバッグは固定されていると想定される。分布としてインスタンスにわたって同様にラベルを分布とみなすインスタンスにわたって。集合的な仮定の下で動作するアルゴリズムの目標は、分布をモデル化することです。。
以来は一般的に固定されているが未知数と考えられており、アルゴリズムは代わりに経験的なバージョンの計算に焦点を当てている。、 どこバッグ内のインスタンスの数。 以来も通常は固定されているが未知であるとみなされ、ほとんどの集団仮定に基づく手法は、単一インスタンス版と同様に、この分布の学習に焦点を当てています。[ 8 ] [ 10 ]
集合的仮定ではすべてのインスタンスに等しい重要度が与えられるが、Fouldsは集合的仮定を拡張してインスタンスの重みを組み込んだ。重み付き集合的仮定は次のようになる。、 どこはインスタンスに対する重み関数であり、[ 8 ]

マルチインスタンス学習のアルゴリズムには、インスタンスベースとメタデータベース(または埋め込みベース)の2つの主要な種類があります。「インスタンスベース」という用語は、アルゴリズムがMIの仮定に基づいて代表的なインスタンスのセットを見つけ、これらの代表から将来のバッグを分類しようとすることを意味します。対照的に、メタデータベースのアルゴリズムは、インスタンスとバッグラベルの関係について仮定を置かず、代わりにバッグに関するインスタンスに依存しない情報(メタデータ)を抽出して概念を学習しようとします。[ 10 ]最新のMIアルゴリズムの概説については、FouldsとFrankを参照してください。[ 8 ]
最初に提案された MI アルゴリズムは、Dietterich らによって開発された一連の「反復識別」アルゴリズムと、Maron と Lozano-Pérez によって開発された Diverse Density であった。[ 3 ] [ 9 ]これらのアルゴリズムはどちらも標準的な仮定の下で動作した。
大まかに言うと、反復識別アルゴリズムはすべて2つのフェーズから構成されます。最初のフェーズは、各正例群から少なくとも1つのインスタンスを含み、負例群からはインスタンスを含まない軸平行矩形(APR)を成長させることです。これは、ランダムなインスタンスから始めて反復的に行われます。プラスのバッグでは、APRはあらゆるインスタンスをカバーする最小のAPRに拡張されます新しい陽性バッグこのプロセスは、APRが各ポジティブバッグから少なくとも1つのインスタンスをカバーするまで繰り返されます。次に、各インスタンスAPRに含まれる要素には「関連性」が与えられ、これはその要素を削除した場合にAPRから除外される負の点の数に対応します。次に、アルゴリズムは関連性の低い順に候補となる代表インスタンスを選択し、負の点群に含まれるインスタンスがAPRに含まれなくなるまでこの処理を繰り返します。アルゴリズムは、収束するまでこれらの成長と代表インスタンスの選択のステップを繰り返し、各反復におけるAPRのサイズは候補となる代表インスタンスのみで構成されるものとします。
第1フェーズの後、APRは代表的な属性のみを厳密に包含すると考えられています。第2フェーズでは、この厳密なAPRを次のように拡張します。各属性を中心とするガウス分布を作成し、正例が一定の確率で厳密なAPRの外側に落ちるように、より緩やかなAPRを作成します。[ 4 ]反復識別手法は標準的な仮定ではうまく機能しますが、他のMI仮定にはうまく一般化できません。[ 8 ]
最も単純な形では、多様性密度(DD)は単一の代表例を想定しています。概念として。この代表例は、正のバッグからのインスタンスに負のバッグからのインスタンスよりもはるかに近いという意味で「密」である必要があり、また、各正のバッグから少なくとも1つのインスタンスに近いという意味で「多様」である必要があります。
させてを正のラベルが付いた袋の集合とし、負のラベルが付いたバッグの集合を とすると、代表インスタンスの最良の候補は次のように与えられる。多様な密度バッグが独立して分配されるという仮定の下で、貸すバッグ i の j 番目のインスタンスを表すと、ノイズ付き OR モデルは次のようになります。
はスケールされた距離とみなされるどこはスケーリングベクトルです。このようにして、すべての正のバッグに に近いインスタンスがある場合、 それからそれぞれが高くなるしかし、もしネガティブバッグがあれば近いインスタンスがあります、低くなります。したがって、すべてのポジティブバッグに、負のバッグには、候補者のコンセプト勾配法によって取得できます。新しいバッグの分類は、近接性を評価することによって行うことができます。[ 9 ] Diverse Densityは元々1998年にMaronらによって提案されたものですが、より最近のMILアルゴリズムでは、2001年のEM-DD [ 13 ]や2004年のDD-SVM [ 14 ]、2006年のMILES [ 8 ]など、DDフレームワークが使用されています。
標準的な仮定の下で、多くの単一インスタンスアルゴリズムが複数インスタンスのコンテキストにも適用されており、
2000年以降、標準的な仮定から離れ、上記に挙げたより一般的な仮定に対処するように設計されたアルゴリズムの開発が進められた。[ 10 ]
新しい特徴空間の次元が高く、元のインスタンス空間のすべての APR を明示的に列挙するコストがかかるため、GMIL-1 は計算とメモリの両方の点で非効率的です。GMIL-2 は、効率を改善するために GMIL-1 を改良して開発されました。GMIL-2 はインスタンスを前処理して、候補となる代表インスタンスのセットを見つけます。次に、GMIL-2 は GMIL-1 と同様に各バッグをブールベクトルにマッピングしますが、候補となる代表インスタンスの一意のサブセットに対応する APR のみを考慮します。これにより、メモリと計算の要件が大幅に削減されます。[ 8 ]
メタデータベースのアルゴリズムは、各バッグをメタデータの特徴ベクトルにマッピングすることで、任意の単一インスタンスアルゴリズムを使用して実際の分類タスクを実行できる柔軟性を提供します。将来のバッグは、メタデータの特徴空間にマッピング(埋め込み)され、選択された分類器によってラベル付けされます。したがって、メタデータベースのアルゴリズムでは、どの特徴またはどのタイプの埋め込みが効果的な分類につながるかに重点が置かれています。なお、TLCやGMILなど、前述のアルゴリズムの一部はメタデータベースとみなすことができます。
彼らは、kNNの2つのバリエーション、ベイズkNNと引用kNNを、従来の最近傍問題を複数インスタンスの設定に適応させたものとして定義している。
これまで本稿では、複数インスタンス学習を二値分類器の文脈でのみ考察してきた。しかし、単一インスタンスの二値分類器の一般化は、複数インスタンスの場合にも適用できる。
MILに関する最近のレビューには以下が含まれる。