結合パターン学習器(CPL)は、カテゴリと関係の半教師あり学習を組み合わせることで、ブートストラップ学習法に伴う意味的ドリフトの問題を回避する機械学習アルゴリズムです。
少数のラベル付き例と多数のラベルなし例を使用する半教師あり学習アプローチは、内部的に一貫性はあるものの誤った抽出セットを生成するため、通常は信頼性が低い。CPL は、これらの分類器のトレーニングを結合する制約を定義するオントロジーの存在下で、さまざまなカテゴリと関係の分類器を同時に学習することでこの問題を解決する。これは、 2009 年にAndrew Carlson、Justin Betteridge、Estevam R. Hruschka Jr.、およびTom M. Mitchellによって導入された。[ 1 ] [ 2 ]
CPLは、多数の情報抽出器のトレーニングを組み合わせることで、より正確な結果を得る半教師あり学習のアプローチです。CPLの基本的な考え方は、「コーチ」のような単一タイプの抽出器を半教師ありでトレーニングするよりも、相互に関連するさまざまなエンティティと関係タイプをカバーする多数の抽出器を同時にトレーニングする方がはるかに難しいということです。CPLは、これらの異なるエンティティと関係間の関係に関する事前知識を使用することで、ラベルなしデータをトレーニング中の有用な制約として利用します。たとえば、「コーチ(x)」は「人物(x)」であり、「スポーツ(x)ではない」ことを意味します。
CPLは主に、複数の関数の学習を結合することで半教師あり学習問題を制約するという考え方に基づいています。CPLは、学習された関数を2つの方法で制約します。
オントロジー内の各述語 P には、P と相互に排他的な、同じ引数を持つ他の述語のリストがあります。A が述語 B と相互に排他的である場合、A の肯定インスタンスとパターンは、B の否定インスタンスと否定パターンになります。たとえば、インスタンス「Boston」とパターン「mayor of arg1」を持つ「city」が「scientist」と相互に排他的である場合、「Boston」と「mayor of arg1」は、それぞれ「scientist」の否定インスタンスと否定パターンになります。さらに、一部のカテゴリは、別のカテゴリのサブセットとして宣言されます。たとえば、「athlete」は「person」のサブセットです。
これは、関係とカテゴリの学習を連携させるために使用される型チェック情報です。例えば、「ceoOf」関係の引数は、「person」と「company」というカテゴリに属すると宣言されます。CPLは、2つの名詞句が正しい引数タイプに属すると分類されない限り、その名詞句のペアを関係のインスタンスとして昇格させません。
以下にCPLアルゴリズムの簡単な概要を示します。[ 2 ]
入力:オントロジーOとテキストコーパスC 出力:各述語に対する信頼できるインスタンス/パターン for i=1,2,...,∞ do foreach predicate p in O do 最近昇格したパターン/インスタンスを使用して、候補となるインスタンス/コンテキストパターンを抽出する。 結合条件に違反する候補を除外する。 候補となるインスタンス/パターンをランク付けする。 優秀な候補者を昇進させる。 終わり終わり
品詞タグが付けられた文の大規模なコーパスと、事前定義されたカテゴリ、関係、同数述語間の相互排他的関係、一部のカテゴリ間の部分集合関係、すべての述語のシードインスタンス、およびカテゴリのシードパターンを含む初期オントロジー。
CPLは、新たに昇格したパターンを使用して、テキストコーパス内でそれらのパターンと共起する名詞句を抽出することにより、新しい候補インスタンスを見つけます。CPLは、
候補となるインスタンスとパターンは、高い精度を維持し、極めて特殊なパターンを回避するためにフィルタリングされます。インスタンスは、テキストコーパス内で少なくとも2つの推奨パターンと共起し、かつ、すべての推奨パターンとの共起回数が、否定的なパターンとの共起回数の少なくとも3倍である場合にのみ、評価対象として考慮されます。
CPLは、候補となるインスタンスが共起する推奨パターンの数に基づいてランク付けを行い、より多くのパターンと共起する候補ほど上位にランク付けします。パターンは、各パターンの精度推定値に基づいてランク付けされます。
CPLは、評価スコアに基づいて候補をランク付けし、各述語につき最大100個のインスタンスと5個のパターンを昇格させます。インスタンスとパターンは、それぞれ少なくとも2つの昇格済みのパターンまたはインスタンスと共起する場合にのみ昇格されます。
Meta-Bootstrap Learner (MBL) も CPL の著者らによって提案されました。[ 2 ] Meta-Bootstrap Learner は、複数の抽出手法のトレーニングを、抽出器が一致する必要があるマルチビュー制約と結合します。これにより、既存の抽出アルゴリズムをブラックボックスとして扱いながら、結合制約を追加することが可能になります。MBL は、異なる抽出手法によって発生するエラーは独立していると仮定します。以下に、MBL の簡単な概要を示します。
入力: オントロジー O、抽出器の集合 ε 出力: 各述語に対する信頼できるインスタンス for i=1,2,...,∞ do foreach predicate p in O do foreach extractor e in ε do 最近昇格したインスタンスを使用して、p の新しい候補を e から抽出します。 終わり 相互排他制約または型チェック制約に違反する候補をフィルタリングします。 すべての抽出ツールによって抽出された候補者を昇格させる。 終わり終わり
MBLで使用される下位アルゴリズムは、それ自体でインスタンスを昇格させることはなく、各候補に関する証拠をMBLに報告し、インスタンスの昇格はMBLが担当します。
論文[ 1 ]では、CPLが既存の意味知識リポジトリであるFreebase [ 3 ]に新しい事実をもたらす可能性を示す結果が発表されている。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)