データベース処理において、スキーママッチングとマッピングという用語はしばしば同義語として使われます。この記事では、この2つを次のように区別します。スキーママッチングは、2つのオブジェクトが意味的に関連していることを識別するプロセス(この記事の範囲)であり、マッピングはオブジェクト間の変換を指します。たとえば、2つのスキーマDB1.Student(名前、SSN、レベル、専攻、成績)とDB2.Grad-Student(名前、ID、専攻、成績)では、考えられるマッチングは、DB1.Student ≈ DB2.Grad-Student、DB1.SSN = DB2.IDなどであり、考えられる変換またはマッピングは、DB1.MarksからDB2.Grades(100~90はA、90~80はBなど)です。
これら2つのアプローチを自動化することは、データ統合における基本的な課題の1つでした。一般的に、2つのスキーマ間のさまざまな対応関係を完全に自動的に判断することは不可能です。これは主に、2つのスキーマのセマンティクスが異なり、多くの場合、明示または文書化されていないためです。
中でも、マッチングとマッピングの自動化における一般的な課題は、特にリレーショナル DB スキーマに関して[ 1 ]で分類されており、 [ 2 ]では、スキーマと意味の違い/異質性を認識するリレーショナル モデルに限定されない、かなり包括的な異質性のリストが示されています。これらの異質性のほとんどは、スキーマが同じ情報を表現するために異なる表現または定義を使用しているため (スキーマの競合)、または異なる式、単位、精度によって同じデータの表現が矛盾するため (データの競合) に存在します。[ 1 ] スキーマ マッチングの研究は、2 つのスキーマ間の意味的一致を見つけるプロセスに自動化されたサポートを提供することを目指しています。このプロセスは、次のレベルの異質性により困難になります[ 3 ]
スキーマ統合タスクまたは関連するアクティビティの一般的な方法論について説明します。[ 5 ]著者によると、統合を見ることができます。
スキーマ統合のアプローチは、スキーマ情報のみを利用するものと、スキーマとインスタンスレベルの情報を利用するものに大別できます。[ 4 ] [ 5 ]
スキーマレベルのマッチャーは、インスタンスデータではなくスキーマ情報のみを考慮します。利用可能な情報には、名前、説明、データ型、関係タイプ(part-of、is-aなど)、制約、スキーマ構造など、スキーマ要素の一般的なプロパティが含まれます。要素レベル(オブジェクトの属性などの原子要素)または構造レベル(構造内で一緒に現れる要素の組み合わせを照合)で動作するこれらのプロパティは、2 つのスキーマで一致する要素を識別するために使用されます。言語ベースまたは言語的マッチャーは、名前とテキスト(つまり、単語または文)を使用して、意味的に類似したスキーマ要素を見つけます。制約ベースのマッチャーは、スキーマによく含まれる制約を利用します。このような制約は、データ型と値の範囲、一意性、オプション性、関係タイプとカーディナリティなどを定義するために使用されます。2 つの入力スキーマの制約を照合して、スキーマ要素の類似性を判断します。
インスタンスレベルのマッチャーは、インスタンスレベルのデータを使用して、スキーマ要素の内容と意味に関する重要な洞察を収集します。これらは通常、スキーマレベルのマッチングに加えて使用され、特にスキーマレベルで利用可能な情報が不十分な場合に、マッチング結果の信頼性を高めます。このレベルのマッチャーは、インスタンスの言語的および制約ベースの特徴付けを使用します。たとえば、言語的手法を使用すると、Dept、DeptName、および EmpName インスタンスを調べて、DeptName が EmpName よりも Dept のより良いマッチング候補であると結論付けることができます。郵便番号は 5 桁の長さでなければならない、または電話番号の形式などの制約により、このようなタイプのインスタンス データのマッチングが可能になります。[ 9 ]
ハイブリッドマッチングは、複数の基準または情報源に基づいてマッチング候補を決定するために、複数のマッチング手法を直接組み合わせます。 これらの手法のほとんどは、辞書、シソーラス、ユーザーが提供するマッチングまたはミスマッチ情報などの追加情報も利用します[ 10 ] 。
マッチング情報の再利用 もう一つの取り組みとして、以前のマッチング情報を将来のマッチングタスクの補助情報として再利用するというものがあります。この取り組みの動機は、構造やサブ構造が、例えばEコマース分野のスキーマなどで頻繁に繰り返されることです。しかし、以前のマッチング情報をこのように再利用するには、慎重な選択が必要です。このような再利用は、新しいスキーマの一部、あるいは特定のドメインでのみ意味を持つ可能性があります。例えば、給与計算アプリケーションでは「給与」と「収入」は同一とみなされるかもしれませんが、税務申告アプリケーションではそうではないかもしれません。このような再利用には、さらなる研究に値する未解決の課題がいくつかあります。
サンプルプロトタイプ 通常、このようなマッチング技術の実装は、ルールベースシステムまたは学習器ベースシステムに分類できます。これらの異なるアプローチの相補的な性質により、検討対象のドメインまたはアプリケーションの性質に応じて、技術の組み合わせを使用する多くのアプリケーションが生まれています。[ 4 ] [ 5 ]
マッチング プロセスの最後に識別されるオブジェクト間の関係タイプは、通常、重複、非連結、排除、等価性、包含などのセット セマンティクスを持つものです。これらの関係の論理エンコーディングが、それらの意味です。とりわけ、スキーマ統合とこのような関係の識別に記述ロジックを使用する初期の試みが提示されました。[ 11 ]現在、いくつかの最先端のマッチング ツール[ 4 ] [ 7 ]と、オントロジー アライメント評価イニシアチブでベンチマークされたツール[ 12 ]は、オブジェクト間のこのような単純なマッチング (1:1 / 1:n / n:1 要素レベルのマッチング) と複雑なマッチング (n:1 / n:m 要素または構造レベルのマッチング) を多数識別することができます。
スキーママッチングの品質は、一般的に精度と再現率によって測定されます。精度は、マッチングされたすべてのペアのうち、正しくマッチングされたペアの数を測定するのに対し、再現率は、実際にマッチングされたペアの数を測定します。
{{cite conference}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite conference}}: CS1 maint: 複数の名前: 著者リスト (リンク)