コンセプトマイニングは、成果物から概念を抽出する活動です。このタスクの解決策には通常、データマイニングやテキストマイニングなどの人工知能と統計の側面が含まれます。[1] [2]成果物は通常、概念ではなく、緩く構造化された単語やその他の記号のシーケンスであるため、問題は簡単ではありませんが、文書の意味、出所、類似性に関する強力な洞察を提供できます。
方法
伝統的に、単語から概念への変換はシソーラス[3]を使用して行われており、計算技術でも同様のことが行われる傾向があります。使用されるシソーラスは、タスク用に特別に作成されたもの、または通常プリンストンのWordNetに関連する既存の言語モデルのいずれかです。
単語と概念のマッピング[4]はしばしば曖昧です。通常、特定の言語の各単語は複数の概念に関連します。人間は文脈を利用して、与えられたテキストのさまざまな意味を明確にしますが、既存の機械翻訳システムでは文脈を簡単に推測することはできません。
ただし、コンセプト マイニングの目的の場合、これらの曖昧さは機械翻訳の場合ほど重要ではない傾向があります。これは、テキスト マイニングの場合と同様に、大規模なドキュメントでは曖昧さが均等化される傾向があるためです。
曖昧さを解消するために使用できる手法は多数あります。例としては、テキストの言語分析や、大規模なテキスト コーパスから推測できる単語と概念の関連頻度情報の使用などがあります。最近では、可能性のある概念とコンテキスト間の意味的類似性に基づく手法が登場し、科学界で関心を集めています。
アプリケーション
大規模コーパス内の類似文書の検出とインデックス作成
単語ドメインではなく概念ドメインで文書統計を計算することの副次的効果の 1 つは、概念が上位語と下位語に基づいて自然なツリー構造を形成することです。これらの構造を使用して、ユークリッド概念空間で任意の文書を見つけるために使用できる単純なツリー メンバーシップ統計を生成できます。文書のサイズもこの空間の別の次元として考慮すると、非常に効率的なインデックス システムを作成できます。この手法は現在、250 万の文書コーパスで同様の法的文書を見つけるために商用で使用されています。
トピック別にドキュメントをクラスタリングする
標準的な数値クラスタリング手法は、前述のように「概念空間」で使用して、推論されたトピックによってドキュメントを検索し、インデックスを作成することができます。これらは、数値的にはテキスト マイニングの類似手法よりもはるかに効率的であり、人間が生成する類似性尺度によりよく対応付けられるという点で、より直感的に動作する傾向があります。
参照
参考文献
- ^ Yuen-Hsien Tseng、Chun-Yen Chang、Shu-Nu Chang Rundgren、Carl-Johan Rundgren、「メディアにおける市民の科学的リテラシーを測定するためのニュース記事からのコンセプトマップのマイニング[リンク切れ ]」、Computers and Education、Vol. 55、No. 1、2010年8月、pp. 165-177。
- ^ Li, Keqian; Zha, Hanwen; Su, Yu; Yan, Xifeng (2018 年 11 月)。「埋め込みによるコンセプトマイニング」。2018 IEEE 国際データマイニング会議 (ICDM)。IEEE。pp. 267–276。doi :10.1109/ icdm.2018.00042。ISBN 978-1-5386-9159-5. S2CID 52841398。
- ^ Yuen-Hsien Tseng、「中国語文書の自動シソーラス生成」、アメリカ情報科学技術協会誌、第53巻第13号、2002年11月、1130-1138頁。
- ^ Yuen-Hsien Tseng、「クラスター化されたドキュメントの一般的なタイトルラベル付け」、Expert Systems With Applications、Vol. 37、No. 3、2010 年 3 月 15 日、pp. 2247-2254。
