不確実な推論は、情報検索におけるクエリと文書の関係を正式に定義する方法として、CJ van Rijsbergen [1]によって初めて説明されました。この形式化は、不確実性の尺度を付加した 論理的推論です。
定義
ライスベルゲンは、クエリqに対するドキュメントdの不確実性の尺度は、その論理的含意の確率であると提案しています。つまり、
ユーザーのクエリは、目的のドキュメントに関する一連のアサーションとして解釈できます。特定のドキュメントが与えられた場合、クエリ アサーションが真であるかどうかを推論するのがシステムのタスクです。真である場合、ドキュメントが取得されます。多くの場合、ドキュメントの内容はクエリをアサートするのに十分ではありません。事実とルールの知識ベースが必要ですが、推論に使用することには確率が関連している可能性があるため、それらの一部は不確実である可能性があります。したがって、これを妥当な推論と呼ぶこともできます。推論の妥当性は、各クエリ アサーションの妥当性の関数です。クエリに完全に一致するドキュメントを取得するのではなく、そのクエリに関する妥当性に基づいてドキュメントをランク付けする必要があります。dとq はどちらもユーザーによって生成されるため、エラーが発生しやすく、したがって不確実です。これは、特定のクエリの妥当性に影響します。
これにより、次の 2 つのことが達成されます。
- 確率を修正するプロセスを論理から分離する
- 関連性の処理とリクエストの処理を分離する
画像や動画などのマルチメディアドキュメントは、データの種類ごとに異なる推論プロパティを持ちます。また、テキスト ドキュメントのプロパティとも異なります。妥当な推論のフレームワークにより、これらのさまざまなプロパティから生じる確率を測定し、組み合わせることができます。
不確実な推論は、真理値が既知か未知かであり、既知の場合は真か偽かとなる 自己認識論理の概念を一般化します。
例
次の形式のクエリがあるとします。
ここで、A、B、C はクエリアサーションであり、ドキュメント D については次の確率を求めます。
これを条件付き確率 に変換し、クエリアサーションが独立している場合は、個々のアサーション確率の積として含意の全体的な確率を計算できます。
さらなる作業
Croft と Krovetz [2] は、OFFICERと呼ばれるオフィス文書の情報検索システムに不確実推論を適用しました。オフィス文書では、クエリが個々の属性に焦点を合わせるため、独立性仮定が有効です。文書の内容を分析するだけでなく、作成者、サイズ、トピック、コレクションなどについてクエリすることもできます。彼らは、文書とクエリの属性を比較し、その妥当性を推論し、それを組み合わせて各文書の全体的な評価を行う方法を考案しました。そのほか、文書とクエリの内容の不確実性にも対処する必要がありました。
確率的論理ネットワークは、不確実な推論を実行するためのシステムです。明確な真偽の真理値は、確率だけでなく、確率の確実性を示す信頼度レベルにも置き換えられます。
マルコフ論理ネットワークでは不確実な推論を実行できます。不確実性は、マルコフ連鎖が有限状態マシンの不確実性を記述する方法と同様に、最大エントロピー原理を使用して計算されます。
