自然言語処理の歴史は、 自然言語処理の進歩について説明しています。機械翻訳の歴史、音声認識の歴史、人工知能の歴史と一部重複しています。
初期の歴史
機械翻訳の歴史は、ライプニッツやデカルトなどの哲学者が言語間の単語を関連付けるコードの提案を行った 17 世紀にまで遡ります。これらの提案はすべて理論上のものであり、実際の機械の開発には至りませんでした。
「翻訳機」の最初の特許は 1930 年代半ばに申請されました。ジョルジュ・アルトルーニによる提案の 1 つは、紙テープを使用した自動二か国語辞書という単純なものでした。ロシア人のピーター・トロヤンスキーによるもう 1 つの提案は、より詳細なものでした。二か国語辞書と、エスペラント語に基づく言語間の文法的な役割を処理する方法の両方が含まれていました。
論理期間
1950 年、アラン チューリングは有名な論文「計算機と知能」を発表し、知能の基準として現在チューリング テストと呼ばれるものを提案しました。この基準は、コンピュータ プログラムが人間の審査員とリアルタイムで書面による会話を行い、審査員が会話の内容だけに基づいてプログラムと実際の人間を確実に区別できないほど十分に人間になりすます能力に依存します。
1957年、ノーム・チョムスキーの「統語構造」は、統語構造の規則に基づいたシステムである「普遍文法」によって言語学に革命をもたらしました。 [1]
1954 年のジョージタウン大学の実験では、60 以上のロシア語の文章を英語に完全に自動翻訳しました。著者らは、3 ~ 5 年以内に機械翻訳の問題は解決されると主張しました。[2] しかし、実際の進歩ははるかに遅く、10 年間の研究が期待に応えられなかったと1966 年に発表されたALPAC の報告書の後、機械翻訳への資金提供は大幅に削減されました。1980 年代後半に最初の統計的機械翻訳システムが開発されるまで、機械翻訳に関するさらなる研究はほとんど行われませんでした。
1960 年代に開発された注目すべき NLP システムには、制限された語彙を持つ制限された「ブロックの世界」で動作する自然言語システムであるSHRDLUがあります。
1969年にロジャー・シャンクは自然言語理解のための概念依存性理論を発表しました。 [3]このモデルは、シドニー・ラムの研究に部分的に影響を受けており、ロバート・ウィレンスキー、ウェンディ・レーナート、ジャネット・コロドナーなど、イェール大学のシャンクの学生によって広く使用されました。
1970 年、ウィリアム A. ウッズは、自然言語入力を表現するために拡張遷移ネットワーク(ATN) を導入しました。[4] ATN は、句構造規則の代わりに、再帰的に呼び出される同等の有限状態オートマトンのセットを使用しました。ATN と、そのより一般的な形式である「一般化 ATN」は、その後も何年も使用され続けました。1970 年代には、多くのプログラマーが「概念オントロジー」を書き始めました。これは、現実世界の情報をコンピューターが理解できるデータに構造化するものです。例としては、MARGIE (Schank、1975 年)、SAM (Cullingford、1978 年)、PAM (Wilensky、1978 年)、TaleSpin (Meehan、1976 年)、QUALM (Lehnert、1977 年)、Politics (Carbonell、1979 年)、Plot Units (Lehnert、1981 年) などがあります。この間、PARRY、Racter、Jabberwackyなど多くのチャットボットが開発されました。
統計期間
1980 年代まで、ほとんどの NLP システムは複雑な手書きのルールのセットに基づいていました。しかし、1980 年代後半から、言語処理用の機械学習アルゴリズムの導入により、NLP に革命が起こりました。これは、ムーアの法則による計算能力の着実な向上と、言語処理に対する機械学習アプローチの基礎となるようなコーパス言語学を阻害する理論的根拠となったチョムスキー派言語理論 (例:変形文法) の優位性の漸進的な低下の両方によるものでした。 [5]決定木などの最も初期に使用された機械学習アルゴリズムのいくつかは、既存の手書きルールに似たハードな if-then ルールのシステムを生成しました。しかし、研究はますます、入力データを構成する特徴に実数値の重み付けに基づいてソフトで確率的な決定を行う統計モデルに焦点を当てるようになりました。現在多くの音声認識システムが依存しているキャッシュ言語モデルは、このような統計モデルの例です。このようなモデルは、通常、未知の入力、特にエラーを含む入力(実際のデータでは非常に一般的)が与えられた場合に堅牢性が高く、複数のサブタスクを含む大規模なシステムに統合された場合に、より信頼性の高い結果を生成します。
データセット
統計的アプローチの出現は、コンピューティング能力の向上と大規模なデータセットの利用可能性の両方によって促進されました。当時、大規模な多言語コーパスが登場し始めていました。特に、カナダ議会と欧州連合によって、すべての政府手続きを対応する政府システムのすべての公用語に翻訳することを求める法律の結果として、いくつかのコーパスが作成されました。
初期の注目すべき成功の多くは、機械翻訳の分野で起こりました。1993年には、IBMのアラインメントモデルが統計的機械翻訳に使用されました。[6]以前の機械翻訳システムは、計算言語学者が手動でコード化した記号システムでしたが、これらのシステムは統計的であり、大規模なテキストコーパスから自動的に学習することができました。これらのシステムは、利用できるコーパスが小さい状況ではうまく機能しないため、データ効率の高い方法は引き続き研究開発の分野となっています。
2001年には、インターネットから収集された10億語の大規模テキストコーパス(当時は「非常に大規模」と呼ばれていた)が単語の曖昧さ回避に使用されました。[7]
大規模でラベルのないデータセットを活用するために、教師なし学習および自己教師学習用のアルゴリズムが開発されました。一般に、このタスクは教師あり学習よりもはるかに難しく、通常、与えられた量の入力データに対して生成される結果の精度は低くなります。ただし、利用可能な注釈なしのデータは膨大にあり ( World Wide Webのコンテンツ全体など)、多くの場合、劣った結果を補うことができます。
神経期

1990年、エルマンネットワークは、リカレントニューラルネットワークを使用して、トレーニングセット内の各単語を単語埋め込みと呼ばれるベクトルとしてエンコードし、語彙全体をベクトルデータベースとしてエンコードすることで、単純な多層パーセプトロンの能力を超えたシーケンス予測などのタスクを実行できるようにしました。静的埋め込みの欠点は、同音異義語の複数の意味を区別できないことでした。[8]
ソフトウェア
参考文献
- ^ 「SEM1A5 - パート 1 - NLP の簡単な歴史」。2010年 6 月 25 日閲覧。
- ^ ハッチンズ、J.(2005)
- ^ Roger Schank、1969年、「自然言語の概念的依存関係パーサー」、1969年計算言語学会議の議事録、スウェーデン、Sång-Säby、1-3ページ
- ^ ウッズ、ウィリアムA(1970)。「自然言語解析のための遷移ネットワーク文法」ACM通信13(10):591-606 [1]
- ^ チョムスキー言語学は、コーパス言語学の場合のように現実世界のデータで発生する典型的な現象を体系的に調査するのではなく、通常思考実験を使用して作成される、理論モデルの限界を強調する「コーナーケース」(数学の病的な現象に相当)の調査を奨励します。このような現実世界のデータのコーパスの作成と使用は、NLP の機械学習アルゴリズムの基本的な部分です。さらに、いわゆる「刺激の貧困」の議論などのチョムスキー言語学の理論的根拠は、機械学習で一般的に使用される一般的な学習アルゴリズムは言語処理では成功しないことを意味します。その結果、チョムスキーのパラダイムは、そのようなモデルを言語処理に適用することを妨げました。
- ^ Brown, Peter F. (1993). 「統計的機械翻訳の数学: パラメータ推定」.計算言語学(19): 263–311.
- ^ Banko, Michele; Brill, Eric (2001). 「自然言語の曖昧性解消のための非常に大規模なコーパスへのスケーリング」。計算言語学協会第39回年次会議議事録 - ACL '01 。米国ニュージャージー州モリスタウン: 計算言語学協会: 26–33。doi : 10.3115/1073012.1073017。S2CID 6645623 。
- ^ Elman, Jeffrey L. (1990年3月). 「時間の中に構造を見つける」.認知科学. 14 (2): 179–211. doi :10.1207/s15516709cog1402_1. S2CID 2763403.
- ^ マコーダック 2004、p. 286、クレヴィエ 1993、pp. 76−79、ラッセル&ノルヴィグ 2003、p. 19
- ^ マコーダック 2004、pp. 291-296、クレヴィエ 1993、pp. 134−139
- ^ ジャネット・L・コロドナー、クリストファー・K・リースベック;経験、記憶、推論; 心理学出版; 2014年再版
文献
- クレヴィエ、ダニエル(1993) 。AI: 人工知能への激動の探求。ニューヨーク、NY: BasicBooks。ISBN 0-465-02997-3。
- マコーダック、パメラ(2004)、考える機械(第2版)、マサチューセッツ州ネイティック:AKピーターズ社、ISBN 978-1-56881-205-2、OCLC 52197627。
- ラッセル、スチュアート J. ;ノーヴィグ、ピーター(2003)、人工知能: 現代的アプローチ (第 2 版)、アッパー サドル リバー、ニュージャージー: プレンティス ホール、ISBN 0-13-790395-2。
