Open Mind Common Sense(OMCS)は、マサチューセッツ工科大学(MIT)メディアラボを拠点とする人工知能プロジェクトであり、ウェブ上の何千人もの人々からの貢献に基づいて、大規模な常識知識ベースを構築・活用することを目的としています。1999年から2016年まで活動していました。
設立以来、15,000 人以上の貢献者から 100 万件を超える英語の事実を蓄積しており、他の言語の知識ベースも含まれています。OMCS のソフトウェアの大部分は、相互接続された 3 つの表現に基づいて構築されています。それは、人々が直接操作する自然言語コーパス、このコーパスから構築されたConceptNetと呼ばれる意味ネットワーク、そして次元削減を使用して新しい知識を推論できるConceptNet のマトリックスベースの表現であるAnalogySpaceです。[ 1 ] Open Mind Common Sense によって収集された知識は、MIT やその他の研究プロジェクトを可能にしてきました。
このプロジェクトは、マービン・ミンスキー、プッシュ・シン、キャサリン・ハヴァシらの発案によるものでした。開発作業は1999年9月に始まり、プロジェクトは1年後にインターネットに公開されました。ハヴァシは博士論文の中で、このプロジェクトを「当時まだ初期段階にあったインターネットの分散型人間コンピューティング能力を活用しようとする試み」と表現しています。[ 2 ]オリジナルのOMCSはウェブサイトEverything2とその前身の影響を受けており、 Googleに触発されたミニマルなインターフェースを備えています。
プッシュ・シンは2007年にMITメディアラボの教授となり、コモンセンス・コンピューティング・グループを率いる予定だったが、2006年2月28日に自殺した。[ 3 ]
このプロジェクトは現在、MITメディアラボのデジタル・インテュイション・グループがキャサリン・ハヴァシの指揮のもと運営している。
OMCSにはさまざまな種類の知識が含まれています。いくつかの記述は、自然言語の簡単なフレーズで表現された、オブジェクトやイベント間の関係を伝えています。例としては、「コートは暖かくするために使われます」、「太陽はとても暑いです」、「夕食を作るときに最後にすることは食器を洗うことです」などがあります。このデータベースには、「友達と時間を過ごすと幸せになります」、「交通事故に遭うと怒りを感じます」などの記述で、状況の感情的な内容に関する情報も含まれています。OMCSには、「人々は尊敬されたいと思っています」、「人々はおいしいコーヒーを飲みたいと思っています」など、大小さまざまな人々の欲求や目標に関する情報も含まれています。[ 1 ]
当初、これらの記述は制約のないテキスト文として Web サイトに入力することができ、後で解析する必要がありました。現在のバージョンのWeb サイトは、より構造化された空欄補充テンプレートを使用してのみ知識を収集します。OMCS は、目的のあるゲーム「Verbosity」によって収集されたデータも利用しています。[ 4 ]
OMCSデータベースは、本来の形で言えば、共通の知識を伝える短い文の集合体に過ぎません。この知識をコンピュータ上で利用するためには、より構造化された表現に変換する必要があります。
ConceptNetは、 OMCSデータベースの情報に基づいた意味ネットワークです。ConceptNetは、ノードが概念、エッジがこれらの概念に関する常識的な主張である有向グラフとして表現されます。概念は、名詞句、動詞句、形容詞句、または節である可能性のある、密接に関連する自然言語のフレーズの集合を表します。[ 5 ]
ConceptNetは、OMCSの自然言語アサーションを浅い構文解析器を使用してパターンと照合することによって作成されます。アサーションは、可能な関係の限られたセットから選択された2つの概念間の関係として表現されます。さまざまな関係は、OMCSコーパスで見られる一般的な文パターンを表しており、特に、知識収集Webサイトで使用されるすべての「空欄補充」テンプレートは、特定の関係に関連付けられています。[ 5 ]
ConceptNetを構成するデータ構造は2007年に大幅に再編成され、ConceptNet 3として公開されました。[ 5 ]現在、ソフトウェアエージェントグループは新しいバージョン4.0用のデータベースとAPIを配布しています。[ 6 ]
2010年、OMCSの共同創設者兼ディレクターであるキャサリン・ハヴァシは、ロビン・スピアー、デニス・クラーク、ジェイソン・アロンソと共に、ConceptNetを基盤としたテキスト分析ソフトウェア会社であるLuminosoを設立しました。 [ 7 ] [ 8 ] [ 9 ] [ 10 ]同社は、ConceptNetを主要な語彙リソースとして使用し、企業がアンケート、製品レビュー、ソーシャルメディアなどの膨大な量の定性データを理解し、そこから洞察を得るのを支援しています。[ 7 ] [ 11 ] [ 12 ]
ConceptNetの情報は、機械学習アルゴリズムの基礎として使用できます。AnalogySpaceと呼ばれる表現は、特異値分解を使用してConceptNetの知識のパターンを一般化して表現し、AIアプリケーションで使用できるようにします。その開発者は、テキストコーパス、ConceptNetなどの構造化知識ベース、および両者の組み合わせに基づいて機械学習を実行するためのDivisi [ 13 ]と呼ばれるPython機械学習ツールキットを配布しています。
その他にも、知識収集や参加へのインセンティブ提供における代替的なアプローチを模索した類似プロジェクトとして、 Never-Ending Language Learning、Mindpixel(現在はサービス終了)、Cyc、Learner、SenticNet、Freebase、YAGO、DBpedia、Open Mind 1001 Questionsなどがある。
Open Mind Common Senseプロジェクトは、収集した常識知識を形式的な論理構造ではなく英語の文として表現することに重点を置いている点でCycとは異なります。ConceptNetは、その作成者の1人であるHugo Liuによって、「形式的な言語的厳密さよりも非形式的な概念的つながりを重視している」ため、CycよりもWordNetに似た構造になっていると説明されています。 [ 14 ]