
自然言語理解(NLU)または自然言語解釈(NLI)[ 1 ]は、人工知能における自然言語処理のサブセットであり、機械による読解を扱います。NLUはAIハード問題と考えられてきました。[ 2 ]
自動推論[ 3 ] 、機械翻訳[ 4 ] 、質問応答[ 5 ]、ニュース収集、テキスト分類、音声認識、アーカイブ、大規模コンテンツ分析への応用により、この分野には大きな商業的関心が寄せられています。
1964 年にダニエル・ボブロウがMITでの博士論文のために書いたプログラムSTUDENT は、コンピュータによる NLU の最も初期の試みの 1 つです。[ 6 ] [ 7 ] [ 8 ] [ 9 ] [ 10 ]ジョン・マッカーシーが人工知能という用語を作り出してから 8 年後、ボブロウの博士論文 ( 「コンピュータ問題解決システムのための自然言語入力」というタイトル) は、コンピュータが単純な自然言語入力を理解して代数の文章問題を解くことができることを示しました。
1年後の1965年、MITのジョセフ・ワイゼンバウムは、あらゆるトピックについて英語で対話を行う対話型プログラムELIZAを開発した。最も人気のあるトピックは心理療法だった。ELIZAは、キーワードを単純な構文解析と定型句への置換によって動作し、ワイゼンバウムはプログラムに現実世界の知識のデータベースや豊富な語彙を与えるという問題を回避した。しかし、ELIZAはおもちゃのプロジェクトとして驚くほど人気を博し、 Ask.comなどで使用されている現在の商用システムの非常に初期の先駆けと見なすことができる。[ 11 ]
1969年、スタンフォード大学のロジャー・シャンクはNLUの概念依存理論を導入した。 [ 12 ]このモデルは、シドニー・ラムの研究に部分的に影響を受けており、ロバート・ウィレンスキー、ウェンディ・レーネルト、ジャネット・コロドナーなど、イェール大学のシャンクの学生によって広く使用された。
1970年、ウィリアム・A・ウッズは自然言語入力を表現するために拡張遷移ネットワーク(ATN)を導入した。 [ 13 ] ATNは句構造規則の代わりに、再帰的に呼び出される同等の有限状態オートマトンのセットを使用した。ATNとそのより一般的な形式である「一般化ATN」は、その後数年間使用され続けた。
1971年、テリー・ウィノグラードはMITでの博士論文のためにSHRDLUを書き終えた。SHRDLUは、子供のブロックで構成された限られた世界で簡単な英語の文を理解し、ロボットアームを操作して物を動かすことができた。SHRDLUの実証に成功したことで、この分野の研究が継続する上で大きな勢いがついた。 [ 14 ] [ 15 ]ウィノグラードは著書『言語を認知プロセスとして捉える』を出版し、この分野に大きな影響を与え続けた。[ 16 ]スタンフォード大学では、ウィノグラードは後にGoogleの共同創設者となるラリー・ペイジに助言を与えた。
1970年代と1980年代には、SRI Internationalの自然言語処理グループがこの分野の研究開発を継続しました。研究に基づいた多くの商業的取り組みが行われ、例えば1982年には、ゲイリー・ヘンドリックスが当初はパーソナルコンピュータ上のデータベースクエリ用の自然言語インターフェースを開発する会社としてシマンテック社を設立しました。しかし、マウス操作のグラフィカルユーザーインターフェースの出現により、シマンテックは方向転換しました。同時期には、他の多くの商業的取り組みも開始されました。例えば、アーティフィシャル・インテリジェンス・コーポレーションのラリー・R・ハリスや、コグニティブ・システムズ社のロジャー・シャンクとその学生たちなどです。 [ 17 ] [ 18 ] 1983年には、マイケル・ダイヤーがイェール大学でBORISシステムを開発しましたが、これはロジャー・シャンクとWGレーネルトの研究と類似点がありました。[ 19 ]
3千年紀には、IBM Watsonのような機械学習を用いたテキスト分類システムが導入された。しかし、専門家の間では、こうしたシステムがどの程度「理解」しているかについて議論が分かれている。例えば、ジョン・サールによれば、Watson は質問すら理解していなかったという。[ 20 ]
2010年代には、NLUシステムでは、大規模なテキストコレクションから学習した密なベクトルとして単語を表現し、単語間の構文的および意味的な関係を捉えることができるword2vecなどの単語埋め込みがますます使用されるようになった。 [ 21 ]その後、 BERTなどのトランスフォーマーベースのモデルでは、大規模な事前学習とそれに続くファインチューニングが使用され、質問応答や自然言語推論などのNLUタスクのパフォーマンスが向上した。[ 22 ]
認知科学者でありパトム理論の発明者であるジョン・ボールはこの評価を支持しています。自然言語処理は、サービス業や電子商取引における人間の生産性を支援するアプリケーションに進出してきましたが、これは主にアプリケーションの範囲を狭めることで可能になりました。人間の言語で何かを要求する方法は何千通りもあり、それらは依然として従来の自然言語処理では対応できません。ウィベ・ワーゲマンスによれば、「機械と意味のある会話をするには、3歳児が推測せずに行うように、文中の他の単語の意味に基づいてすべての単語を正しい意味に一致させる必要があります。」[ 23 ]
「自然言語理解」という包括的な用語は、ロボットに短いコマンドを発行するなどの比較的単純な小さなタスクから、新聞記事や詩の一節を完全に理解するなどの非常に複雑な取り組みまで、さまざまなコンピュータ アプリケーションに適用できます。多くの実際のアプリケーションは、この 2 つの極端な間に位置します。たとえば、電子メールを自動的に分析して企業の適切な部門にルーティングするためのテキスト分類では、テキストの詳細な理解は必要ありませんが[ 24 ]、固定スキーマを持つデータベース テーブルへの単純なクエリの管理よりもはるかに多くの語彙とより多様な構文を扱う必要があります。
長年にわたり、コンピュータに提示された自然言語または英語のような文を処理するさまざまな試みが、さまざまな複雑さのレベルで行われてきました。いくつかの試みは、深い理解を持つシステムには至りませんでしたが、システム全体の使いやすさを向上させました。たとえば、ウェイン・ラトリフは、スタートレックの英語を話すコンピュータを模倣するために、英語のような構文を持つVulcanプログラムを最初に開発しました。Vulcanは後にdBaseシステムとなり、その使いやすい構文は、パーソナルコンピュータデータベース業界を効果的に立ち上げました。[ 25 ] [ 26 ]しかし、使いやすいまたは英語のような構文を持つシステムは、豊富な語彙を使用し、自然言語の文の意味の内部表現(多くの場合、一階述語論理)を含むシステムとは全く異なります。
したがって、システムが目指す「理解」の広さと深さによって、システムの複雑さ(およびそれに伴う課題)と、システムが扱うことができるアプリケーションの種類が決まります。システムの「広さ」は、語彙と文法の規模によって測定されます。「深さ」は、その理解が流暢なネイティブスピーカーの理解にどれだけ近いかによって測定されます。最も狭く浅い英語のようなコマンドインタプリタは、最小限の複雑さしか必要としませんが、アプリケーションの範囲は狭いです。狭くて深いシステムは、理解のメカニズムを探求しモデル化しますが、[ 27 ]、それでもアプリケーションは限られています。ニュースリリースなどの文書の内容を単純なキーワードマッチングを超えて理解し、ユーザーにとって適切かどうかを判断しようとするシステムは、より広範で、かなりの複雑さを必要としますが、[ 28 ]、それでもまだやや浅いです。非常に広くて非常に深いシステムは、現在の最先端技術を超えています。
使用されるアプローチに関係なく、ほとんどのNLUシステムはいくつかの共通コンポーネントを共有しています。システムには、言語の語彙と、文を内部表現に分解するための構文解析器と文法規則が必要です。適切なオントロジーを備えた豊富な語彙の構築には、かなりの労力が必要です。たとえば、WordNet語彙には、多くの人年分の労力が必要でした。[ 29 ]
システムは、理解を導くために意味論の理論も必要とします。言語理解システムの解釈能力は、それが使用する意味論に依存します。競合する言語の意味論は、コンピュータによる自動意味解釈の基礎としての適合性において、特定のトレードオフを持っています。[ 30 ]これらは、素朴な意味論や確率的意味解析から、文脈から意味を導き出すための語用論の使用まで多岐にわたります。[ 31 ] [ 32 ] [ 33 ]意味解析器は、自然言語テキストを形式的な意味表現に変換します。[ 34 ]
NLUの高度なアプリケーションでは、論理推論をフレームワークに組み込むことも試みられています。これは一般的に、導出された意味を述語論理のアサーションのセットにマッピングし、論理演繹を使用して結論に到達することによって実現されます。したがって、 Lispなどの関数型言語に基づくシステムでは、論理アサーションを表現するサブシステムを含める必要がありますが、 Prolog言語を使用するような論理指向システムは、一般的に組み込みの論理表現フレームワークの拡張に依存しています。[ 35 ] [ 36 ]
NLUにおけるコンテキストの管理は、特別な課題をもたらす可能性がある。さまざまな例と反例により、コンテキストの形式的モデリングに対する複数のアプローチが生まれ、それぞれに特有の長所と短所がある。[ 37 ] [ 38 ]