実際のデータベースのほとんどは、その正確性が不確かなデータを含んでいます。このようなデータを扱うためには、データの整合性を定量化する必要があります。これは、確率的データベースを用いることで実現できます。
確率データベースとは、可能な世界に確率が関連付けられている不確実なデータベースのことです。確率データベース管理システムは現在、活発な研究分野となっています。「現在、商用の確率データベースシステムは存在しませんが、いくつかの研究プロトタイプが存在します...」[ 1 ]
確率データベースは、ANSI-SPARCアーキテクチャにおけるリレーショナルデータベースと同様に、論理データモデルとデータの物理的表現を区別します。確率データベースでは、このようなデータベースは、多くの場合、1つの世界(古典的なデータベース)のサイズに対して指数関数的に増加する非常に多くの可能な世界を簡潔に表現する必要があるため、これはさらに重要です。[ 2 ] [ 3 ]
確率データベースでは、各タプルに0から1までの確率が関連付けられ、0はデータが確実に間違っていることを表し、1はデータが確実に正しいことを表します。
確率的データベースは複数の状態を取り得る。例えば、データベース内にタプルが存在するかどうかが不確実な場合、データベースはそのタプルに関して2つの異なる状態を取り得る。最初の状態ではタプルが含まれ、2番目の状態では含まれない。同様に、属性がx、y、zのいずれかの値を取る場合、データベースはその属性に関して3つの異なる状態を取り得る。
これらの各状態は、可能世界と呼ばれる。
以下のデータベースを考えてみましょう。
(ここで{b3, b3′, b3′′}は、属性がb3、b3′、またはb3′′のいずれかの値を取ることができることを示します。)
すると、データベースの実際の状態には、最初のタプルが含まれている場合と含まれていない場合があります(それが正しいかどうかによります)。同様に、属性Bの値はb3、b3′、またはb3′′になる可能性があります。
したがって、データベースに対応する可能性のある世界は以下のとおりです。
確率的データベースには、基本的に2種類の不確実性が存在する可能性があります。以下に示す表をご覧ください。
データ項目に関連付けられた乱数変数に値を割り当てることで、さまざまな可能性のある世界を表現できる。
「確率的データベース」という用語が初めて公表されたのは、おそらく1987年のVLDB会議論文「確率的データベースの理論」で、CavalloとPittarelliによるものだった。[ 4 ]この11ページの論文のタイトルは、David Maierの600ページに及ぶモノグラフ「関係データベースの理論」が当時、会議参加者や会議議事録の読者の多くに知られていたため、ちょっとした冗談のつもりだった。