意味的異質性とは、同じドメインのデータベーススキーマやデータセットが独立した当事者によって開発され、データ値の意味や解釈に違いが生じることです。 [1]構造化データを超えて、半構造化データの柔軟性や、ドキュメントや非構造化データに適用されるさまざまなタグ付け方法により、意味的異質性の問題はさらに複雑になります。意味的異質性は、異種データセットの違いの重要な原因の1つです。
しかし、複数のデータ ソースを相互運用するには、これらの意味の違いを調整することが不可欠です。意味の異質性のさまざまなソースを分解することで、これらの違いを克服するためにデータをマッピングおよび変換する方法を理解するための基礎が得られます。
分類
データセマンティクスに適用された最初の分類体系の1つは、20年以上前にウィリアム・ケントが考案したものです。[2]ケントのアプローチは意味の違いよりも構造マッピングの問題に重点を置いており、データ辞書が解決できる可能性があると 指摘しました。
最も包括的な分類の 1 つは、Pluempitiwiriyawej と Hammer による「XML データ ソースにおけるセマンティックおよびスキーマの異質性の分類スキーム」です。[3]彼らは異質性を 3 つの大まかなクラスに分類しています。
- 構造的競合は、関連データまたは重複データを表すソースのスキーマに矛盾がある場合に発生します。構造的競合は、基礎となるスキーマを比較するときに検出できます。構造的競合のクラスには、一般化競合、集約競合、内部パスの不一致、欠落項目、要素の順序、制約と型の不一致、要素型と属性名の間の命名競合が含まれます。
- ドメイン競合は、統合されるデータ ソースのセマンティクスに矛盾がある場合に発生します。ドメイン競合は、スキーマに含まれる情報を調べ、基礎となるデータ ドメインに関する知識を使用することで検出できます。ドメイン競合のクラスには、スキーマの矛盾、スケールまたは単位、精度、およびデータ表現の競合が含まれます。
- データの競合とは、複数のソースにわたる類似または関連するデータ値間の不一致を指します。データの競合は、基礎となるソースを比較することによってのみ検出できます。データの競合のクラスには、ID 値、欠落データ、スペルミス、要素コンテンツと属性値間の命名の競合が含まれます。
さらに、セット要素 (「集団」の不一致) または属性 (「説明」の不一致) の間で不一致または競合が発生する可能性があります。
マイケル・バーグマンは、この図式を拡張して、言語の4番目の主要な明示的なカテゴリを追加し、さらに意味の異質性の種類ごとにいくつかの例を追加した結果、約40の異なる潜在的なカテゴリが生まれました[4] 。[5]この表は、ソース間の意味の異質性の可能性のある40のソースを組み合わせたものです。
意味論と統合アプローチを分類するための別のアプローチは、Shethらによって採用されています。[6]彼らの概念では、意味論を暗黙的、形式的、強力の 3 つの形式に分類しています。暗黙的意味論は、大部分に存在するか、簡単に抽出できるものです。形式言語は、比較的少ないものの、オントロジーまたはその他の記述ロジックの形で存在します。強力 (ソフト) 意味論はあいまいで、厳格なセットベースの割り当てに限定されません。Sheth らの主なポイントは、必要な意味論を適切に捉えるには、一階述語論理(FOL) または記述ロジックだけでは不十分であるということです。
関連アプリケーション
データの相互運用性以外にも、意味の異質性の調整に依存する情報技術の関連分野には、データ マッピング、意味の統合、エンタープライズ情報統合などがあります。概念的なデータから実際のデータまで、2 つのデータ ソースを統合すると、視点、語彙、測定基準、規則に違いが生じます。これらの意味の異質性に明示的に注意を払うことは、情報を統合または相互運用するための 1 つの方法です。
わずか 20 年前、情報技術システムは、さまざまな形式とシステムでデータを表現および保存していました。インターネットと Web プロトコルは、これらの相違点の原因を克服するのに大いに役立っています。意味の異質性には多数のカテゴリがありますが、これらのカテゴリはパターン化されており、予測して修正することができます。これらのパターン化されたソースは、意味の違いがまだ残っている場合に、それを克服するためにどのような作業を行う必要があるかを示します。
参照
参考文献
- ^ Alon Halevy (2005). 「なぜデータが混ざらないのか」. Queue . 3 (8).
- ^ ウィリアム・ケント(1989年2月27日~3月3日)。「一つの事実の多様な形」IEEE COMPCON会議録。サンフランシスコ。13頁。
- ^ Charnyote Pluempitiwiriyawej および Joachim Hammer (2000 年 9 月)。「XML データ ソース内の意味的および図式的異質性の分類スキーム」(PDF)。フロリダ州ゲインズビル: フロリダ大学。技術レポート TR00-004。
- ^ MK Bergman (2006 年 6 月 6 日). 「意味的異質性のソースと分類」. AI3:::Adaptive Information . 2014 年9 月 28 日閲覧。
- ^ MK Bergman (2014 年 8 月 12 日). 「Big structure and data interoperability」. AI3:::Adaptive Information . 2014 年9 月 28 日閲覧。
- ^ Amit P. Sheth、Cartic Ramakrishnan、Christopher Thomas (2005)。「セマンティック Web のセマンティクス: 暗黙的、形式的、 そして強力」。セマンティック Web と情報システムに関する国際ジャーナル。1 (1): 1–18。doi : 10.4018 /jswis.2005010101。
さらに読む
- 意味的異質性の分類
