歴史 自然言語処理は1950年代に起源を持つ。[ 2 ] 1950年にはすでにアラン・チューリングが「 計算機械と知能 」というタイトルの論文を発表しており、当時は人工知能とは別の問題として明確にはされていなかったものの、現在チューリングテスト と呼ばれる知能の基準を提案していた。提案されたテストには、自然言語の自動解釈と生成を含むタスクが含まれている。
記号的NLP(1950年代~1990年代初頭)抽象構文木に解析された文書 記号的自然言語処理の前提は、ジョン・サールの中国語の部屋 思考実験を用いて説明されることが多い。一連の規則(例えば、質問とそれに対応する回答が記載された中国語のフレーズ集)が与えられると、コンピュータはそれらの規則を目の前のデータに適用することで、自然言語理解(またはその他の自然言語処理タスク)を模倣する。
統計的自然言語処理(1990年代~現在)1980年代までは、ほとんどの自然言語処理システムは、手書きの複雑なルールセットに基づいていました。しかし、1980年代後半から、言語処理のための機械学習 アルゴリズムの導入により、自然言語処理に革命が起こりました。この変化は、計算能力の向上(ムーアの法則を参照)と、 チョムスキーの 言語理論(変形文法 など)の優位性の低下によって影響を受けました。チョムスキーの理論の理論的基盤は、機械学習による言語処理のアプローチの根底にあるようなコーパス言語学を阻害していました。 [ 9 ]
アプローチ:記号的、統計的、ニューラルネットワーク記号的アプローチ、つまり記号を操作するための一連のルールを手作業でコーディングし、辞書検索と組み合わせる方法は、歴史的に、AI全般とNLPの両方で最初に使われたアプローチでした。[ 19 ] [ 20 ] 例えば、文法を書いたり、語幹抽出 のためのヒューリスティックルールを考案したりする場合などです。
一方、統計ネットワークとニューラルネットワークの両方を含む機械学習アプローチは、記号的アプローチに比べて多くの利点がある。
統計的手法とニューラルネットワーク手法はどちらも、テキストコーパスから抽出された最も一般的なケースに重点を置く傾向があるのに対し、ルールベースのアプローチでは、稀なケースと一般的なケースの両方に対して等しくルールを提供する必要がある。 統計的手法またはニューラルネットワーク手法によって生成される言語モデルは 、ルールベースのシステムと比較して、馴染みのない入力(例えば、これまで見たことのない単語や構造を含むもの)や誤った入力(例えば、スペルミスのある単語や誤って省略された単語)に対してより頑健である。ただし、ルールベースのシステムは生成コストも高い。このような(確率的な)言語モデルは、規模が大きくなるほど精度が高くなる。これに対し、ルールベースのシステムは、ルールの量と複雑さを増やすことによってのみ精度を高めることができ、結果として扱いが困難 になるという問題が生じる。 ルールベースシステムは一般的に以下のような用途で使用されています。
機械学習手法をうまく適用するのに十分なトレーニングデータの量が不足している場合、たとえば、Apertium システムが提供するようなリソースの少ない言語の機械翻訳の場合、 NLPパイプラインの前処理、例えばトークン化 、または NLPパイプラインの出力の後処理や変換、例えば構文解析からの知識抽出などに使用されます。
統計的手法 1980年代後半から1990年代半ばにかけて、統計的手法はルールベースの手法の非効率性によって引き起こされたAIの冬の時代を終わらせた。 [ 21 ] [ 22 ]
初期の決定木は、厳密な if-thenルールを 生成するシステムであり、従来のルールベースのアプローチと非常によく似ていた。品詞タグ付けに適用される隠れマルコフモデル の導入によって初めて、従来のルールベースのアプローチの終焉が告げられた。
一般的な自然言語処理タスク 以下は、自然言語処理において最もよく研究されているタスクの一部です。これらのタスクの中には、現実世界に直接応用できるものもあれば、より大きなタスクの解決を支援するサブタスクとして用いられるものもあります。
自然言語処理のタスクは密接に関連しているものの、便宜上、いくつかのカテゴリーに分類することができる。以下に大まかな分類を示す。
形態学的分析 バスク語の語幹抽出 語幹抽出 語尾のみを除去し、単語の基本辞書形式(レマとも呼ばれる)を返すタスク。レマ化は、単語を正規化された形式に還元するもう1つの手法です。ただし、この場合、変換は実際に辞書を使用して単語を実際の形式にマッピングします。[ 29 ] 形態学的セグメンテーション 単語を個々の形態素 に分け、形態素のクラスを識別します。この作業の難易度は、対象言語の形態論 (つまり、単語の構造)の複雑さに大きく依存します。 英語は 形態論、特に屈折形態論が 比較的単純なので、この作業を完全に無視して、単語のすべての可能な形式(例:「open、opens、opened、opening」)を別々の単語としてモデル化することがしばしば可能です。しかし、トルコ語 や、高度に膠着したインドの言語である メイテイ語 のような言語では、辞書の各項目に何千もの可能な単語形式があるため、このようなアプローチは不可能です。[ 30 ] 品詞タグ付け 文が与えられたら、各単語の品詞 (POS)を判定してください。多くの単語、特に一般的な単語は、複数の品詞として機能することがあります。例えば、「book」は名詞 (「the book on the table」)にも動詞 (「to book a flight」)にもなり得ます。「set」は名詞、動詞、形容詞 のいずれにもなり得ます。「out」は少なくとも5つの異なる品詞のいずれかになり得ます。 ステミング 語幹抽出とは、屈折語(または派生語)を基本形に還元するプロセスです(例:「close」は「closed」、「closing」、「close」、「closer」などの語幹になります)。語幹抽出は語形変化と同様の結果をもたらしますが、辞書ではなく規則に基づいて行われます。
構文解析 文法帰納法 [ 31 ] 言語の構文を記述する形式文法 を生成する。 文分割 (「文境界の曖昧さ解消 」とも呼ばれる)テキストの塊が与えられたら、文の境界を見つけます。文の境界は、ピリオド やその他の句読点 で示されることが多いですが、これらの同じ文字は他の目的にも使用されます(例:略語 を示す)。 解析 与えられた文の構文解析ツリー (文法分析)を決定します。自然言語 の文法は 曖昧 で、典型的な文には複数の分析が考えられます。おそらく驚くべきことに、典型的な文には何千もの潜在的な構文解析が存在する可能性があります(そのほとんどは人間にとって全く意味不明に思えるでしょう)。構文解析には、依存関係構文解析 と構成要素構文 解析の 2 つの主要なタイプがあります。依存関係構文解析は、文中の単語間の関係(主要な目的語や述語などをマークする)に焦点を当てますが、構成要素構文解析は、確率的文脈自由文法 (PCFG)(確率的文法 も参照)を使用して構文解析ツリーを構築することに焦点を当てます。
語彙意味論(文脈における個々の単語の意味)パイプラインをリンクするエンティティ 語彙意味論 文脈における個々の単語の計算論的な意味は何ですか? 分布意味論 データから意味表現を学習するにはどうすればよいか? 固有表現認識 (NER)テキストのストリームが与えられた場合、テキスト内のどの項目が人や場所などの固有名詞に対応しているか、また、そのような名前のタイプ(人、場所、組織など)が何であるかを判断します。英語などの言語では大文字化によって 固有名詞を認識するのに役立ちますが、この情報は固有名詞 のタイプを判断するのに役立たず、いずれにしても不正確または不十分な場合が多いです。たとえば、文の最初の文字も大文字で、固有名詞は複数の単語にまたがることが多く、そのうちの一部だけが大文字になります。さらに、非西洋の文字体系を持つ他の多くの言語(中国語 やアラビア語 など)では、そもそも大文字化がなく、大文字化のある言語でも、名前を区別するために一貫して使用するとは限りません。たとえば、ドイツ語では 、名前かどうかに関わらずすべての名詞を大文字で始め、 フランス語 とスペイン語では、 形容詞 として機能する名前を大文字で始めません。このタスクはトークン分類とも呼ばれます。[ 32 ] 感情分析( マルチモーダル感情分析 も参照)感情分析とは、テキストに表現されている感情的なトーンを識別し分類することです。この手法では、テキストを分析して、表現されている感情が肯定的、否定的、または中立的であるかを判断します。感情分類モデルは通常、単語nグラム 、 TF-IDF( Term Frequency-Inverse Document Frequency )特徴、手動で生成された特徴などの入力を使用するか、テキストシーケンス内の長期的および短期的依存関係の両方を認識するように設計された深層学習 モデルを使用します。感情分析の応用は多岐にわたり、さまざまなオンラインプラットフォーム上の顧客レビューの分類などのタスクにまで及んでいます。[ 26 ] 用語抽出 用語抽出の目的は、与えられたコーパスから関連する用語を自動的に抽出することです。 単語の意味曖昧性解消 (WSD)多くの単語には複数の意味 があります。文脈に最も合う意味を選択する必要があります。この問題では、通常、辞書やWordNet などのオンラインリソースから、単語とその意味のリストが与えられます。 エンティティリンク 多くの単語(特に固有名詞)は、名前付きの実体 を指します。ここでは、文脈の中で言及されている実体(有名な人物、場所、会社など)を選択する必要があります。
関係意味論(個々の文の意味論)関係性の抽出 与えられたテキストから、固有表現間の関係(例:誰が誰と結婚しているか)を特定する。 意味解析 テキスト(通常は文)が与えられたら、その意味をグラフ(AMR構文解析 など)または論理形式(DRT構文解析 など)に従って形式的に表現します。この課題には、意味論に関するより基本的なNLPタスク(意味役割のラベリング、語義の曖昧性解消など)のいくつかの側面が含まれており、本格的な談話分析(談話分析、共参照など。下記の自然言語理解を 参照)にまで拡張できます。 意味役割のラベリング (下記の暗黙的な意味役割のラベリングも参照)与えられた単一の文から、意味述語(動詞フレーム など)を特定して曖昧さを解消し、次にフレーム要素(意味役割 )を特定して分類します。
談話(個々の文を超えた意味論)共参照解決 文またはより大きなテキストの塊が与えられた場合、どの単語(「言及」)が同じオブジェクト(「実体」)を参照しているかを判断します。照応解決は このタスクの具体的な例であり、特に代名詞とそれが参照する名詞または名前を一致させることに関係しています。 共参照解決というより一般的なタスクには、参照表現 を含むいわゆる「橋渡し関係」の特定も含まれます。たとえば、「彼は正面玄関からジョンの家に入った」のような文では、「正面玄関」は参照表現であり、特定すべき橋渡し関係は、参照されているドアがジョンの家の正面玄関であるという事実です(参照される可能性のある他の建物のドアではない)。 談話分析 この評価基準には、関連するいくつかの課題が含まれています。1つは談話解析、つまり、連続したテキストの談話 構造、すなわち文間の談話関係の性質(例えば、詳述、説明、対比など)を特定することです。もう1つの課題は、テキストの塊に含まれる発話行為 (例えば、はい/いいえの質問、内容に関する質問、陳述、断言など)を認識し、分類することです。 暗黙的な意味役割ラベリング 単一の文が与えられた場合、現在の文における意味述語(動詞フレーム など)とその明示的な意味役割を特定し、曖昧さを解消します(上記の「意味役割のラベル付け」を 参照)。次に、現在の文で明示的に実現されていない意味役割を特定し、テキスト内の他の場所で明示的に実現されている引数と指定されていない引数に分類し、前者をローカルテキストに対して解決します。これと密接に関連するタスクは、ゼロ照応解決、つまり、共参照解決をプロドロップ言語 に拡張することです。 テキストの含意を認識する 2 つのテキスト断片が与えられたとき、一方が真である場合、他方が真である、他方が否定される、または他方が真または偽のどちらでもなり得るかを判断します。[ 33 ] トピックの分割 と認識与えられたテキストの塊を、それぞれが特定のトピックに特化しているセグメントに分割し、各セグメントのトピックを特定する。 議論マイニング 議論マイニングの目標は、コンピュータプログラムの助けを借りて、自然言語テキストから議論構造を自動的に抽出および識別することです。 [ 34 ] このような議論構造には、前提、結論、議論スキーム 、および談話内の主論証と副論証、または主論証と反論証の関係が含まれます。[ 35 ] [ 36 ]
より高度な自然言語処理アプリケーション Firefoxの機械翻訳 自動要約 (テキスト要約)長文のテキストを読みやすい要約として作成する。研究論文や新聞の経済面記事など、特定の種類のテキストの要約を作成する際によく用いられる。 文法上の誤りの訂正 文法エラーの検出と訂正には、言語分析のあらゆるレベル (音韻論/正書法、形態論、統語論、意味論、語用論) にわたる幅広い問題が含まれます。文法エラーの訂正は、英語を第二言語として使用または習得する何億人もの人々に影響を与えるため、影響力があります。そのため、2011 年以降、多くの共有タスクの対象となってきました。[ 37 ] [ 38 ] [ 39 ] 正書法、形態論、統語論、および意味論の特定の側面に関しては、GPT-2 などの強力なニューラル言語モデルの開発により、これは現在 (2019 年) ほぼ解決された問題とみなすことができ、さまざまな商用アプリケーションで販売されています。 論理翻訳 自然言語のテキストを形式論理に翻訳する。 機械翻訳 (MT)ある人間の言語から別の人間の言語へテキストを自動的に翻訳する。これは最も難しい問題の一つであり、一般的に「 AI完全 」と呼ばれる問題群に属する。つまり、適切に解決するには、人間が持つあらゆる種類の知識(文法、意味論、現実世界に関する事実など)が必要となる。自然言語理解 (NLU)テキストの塊を、コンピュータ プログラムが操作しやすい一階述語論理 構造などのより形式的な表現に変換します。自然言語理解には、通常、自然言語概念の組織化された表記法の形をとる自然言語表現から導き出せる複数の可能な意味の中から、意図された意味を識別することが含まれます。言語メタモデルとオントロジーの導入と作成は効率的ですが、経験的な解決策です。意味論形式化の基礎を構築するには、閉世界仮定 (CWA) 対開世界仮定 、主観的な Yes/No 対 客観的な True/False などの暗黙の仮定と混同することなく、自然言語の意味論を明示的に形式化することが求められます。[ 40 ] 自然言語生成 (NLG): コンピュータデータベースや意味的意図からの情報を、人間が読みやすい言語に変換する。 書籍の世代 厳密にはNLPタスクではないが、自然言語生成やその他のNLPタスクの拡張として、本格的な書籍の作成がある。最初の機械生成書籍は、1984年にルールベースのシステムによって作成された(Racter、『警官のあごひげは半分構築されている 』)。[ 41 ] ニューラルネットワークによる最初の出版作品は、2018年に出版された小説として販売された『1 the Road』 で、6000万語が含まれている。これらのシステムはどちらも基本的に精巧だが意味のない(意味論のない)言語モデルで ある。最初の機械生成科学書は、2019年に出版された(Beta Writer、『Lithium-Ion Batteries 』、Springer、Cham)。[ 42 ] Racter や『1 the Road』 とは異なり、これは事実知識に基づいており、テキスト要約に基づいている。 ドキュメントAI ドキュメントAIプラットフォームはNLP技術の上に構築されており、人工知能、機械学習、NLPの経験がないユーザーでも、さまざまな種類のドキュメントから必要な特定のデータを抽出するためにコンピュータを迅速にトレーニングできます。NLPを活用したドキュメントAIにより、弁護士、ビジネスアナリスト、会計士など、技術に詳しくないチームでもドキュメントに隠された情報に迅速にアクセスできます。[ 43 ] 対話管理 人間と会話することを目的としたコンピュータシステム。 質問への回答 人間が発する質問が与えられたら、その答えを判定してください。典型的な質問には明確な正解があります(例:「カナダの首都はどこですか?」)が、自由回答形式の質問も考慮される場合があります(例:「人生の意味は何ですか?」)。 テキストから画像への変換 画像の説明が与えられたら、その説明に一致する画像を生成する。[ 44 ] テキストからシーンへの生成 シーンの説明が与えられたら、そのシーンの3Dモデル を生成する。[ 45 ] [ 46 ] テキストからビデオへ 動画の説明が与えられたら、その説明に一致する動画を生成する。[ 47 ] [ 48 ]
一般的な傾向と(考えられる)将来の方向性この分野における長年の傾向に基づいて、NLP の将来の方向性を推測することが可能です。2020 年現在、長年にわたる CoNLL Shared Tasks シリーズのトピックの中で、次の 3 つの傾向が観察できます。[ 49 ]
自然言語のますます抽象的で「認知的」な側面への関心(1999~2001年:浅層構文解析、2002~03年:固有表現認識、2006~09年/2017~18年:依存関係構文、2004~05年/2008~09年:意味役割ラベリング、2011~12年:共参照、2015~16年:談話解析、2019年:意味解析)。 多言語性、そして将来的にはマルチモダリティへの関心の高まり(英語は1999年から、スペイン語とオランダ語は2002年から、ドイツ語は2003年から、ブルガリア語、デンマーク語、日本語、ポルトガル語、スロベニア語、スウェーデン語、トルコ語は2006年から、バスク語、カタルーニャ語、中国語、ギリシャ語、ハンガリー語、イタリア語、トルコ語は2007年から、チェコ語は2009年から、アラビア語は2012年から、2017年には40以上の言語、2018年には60以上/100以上の言語に対応) 記号表現の排除(ルールベース学習から弱教師あり学習への移行、表現学習、エンドツーエンドシステム)
認知 高度な自然言語処理(NLP)アプリケーションの多くは、知的な行動や自然言語の理解を模倣する側面を含んでいます。より広義には、認知行動の高度な側面を技術的に具体化していくことは、NLPの発展の軌跡の一つと言えます(上記のCoNLL共有タスクの傾向を参照)。
認知とは 、「思考、経験、感覚を通して知識や理解を獲得する精神的な活動またはプロセス」を指します。[ 50 ] 認知科学 は、心とそのプロセスを学際的に科学的に研究する分野です。[ 51 ] 認知言語学は 、心理学と言語学の両方からの知識と研究を組み合わせた、言語学の学際的な分野です。[ 52 ] 特に記号的自然言語処理 の時代には、計算言語学の分野は認知研究と強い結びつきを維持していました。
例えば、ジョージ・レイコフは 認知科学の観点と認知言語学の知見に基づいて自然言語処理(NLP)アルゴリズムを構築するための方法論を提示しており、[ 53 ] 2つの特徴的な側面がある。
ラコフが「ある考えを別の考えで理解すること」と説明した概念メタファー の理論を適用することで、著者の意図を把握できます。[ 54 ] 例えば、英語の単語big を考えてみましょう。比較で使用した場合(「それは大きな木だ」)、著者は、その木が他の木や著者の経験に比べて物理的に大きいことを示唆しようとしています。比喩的に使用した場合(「明日は大きな日だ」)、著者は 重要性 を示唆しようとしています。「彼女は大きな人だ」などの他の用法の背後にある意図は、追加情報がなければ、人間にとっても認知的な自然言語処理アルゴリズムにとっても、やや曖昧なままです。分析対象のテキストの前後に提示された情報に基づいて、単語、句、文、またはテキストに相対的な意味の尺度を割り当てます。たとえば、確率的文脈自由文法 (PCFG) を使用します。このようなアルゴリズムの数式は、米国特許第 9269353 号に記載されています。[ 55 ] R M M ( t o k e n N ) = P M M ( t o k e n N ) × 1 2 d ( ∑ 私 = − d d ( ( P M M ( t o k e n N ) × P F ( t o k e n N − 私 、 t o k e n N 、 t o k e n N + 私 ) ) 私 ) {\displaystyle {RMM(token_{N})}={PMM(token_{N})}\times {\frac {1}{2d}}\left(\sum _{i=-d}^{d}{((PMM(token_{N})}\times {PF(token_{Ni},token_{N},token_{N+i}))_{i}}\right)} どこ RMM は意味の相対的尺度であるトークン とは、テキスト、文、句、または単語のブロックのことです。N は分析対象のトークンの数です。PMMは コーパスに基づく意味の推定値である。dは、 N 個のトークンのシーケンスにおけるトークンの非ゼロの位置である。PF は言語固有の確率関数である。認知言語学とのつながりはNLPの歴史的遺産の一部ですが、1990年代の統計的転回以降はあまり取り上げられなくなりました。それにもかかわらず、認知モデルを技術的に運用可能なフレームワークに向けて開発するアプローチは、認知文法[ 56 ] 、機能文法 [ 57 ] 、構成文法[ 58 ] 、計算心理言語学、認知神経科学(ACT-Rなど)といったさまざまなフレームワークの文脈で追求されてきましたが、主流のNLP( ACL の主要会議[ 59 ] での発表数で測ると)での採用は限られています。より最近では、認知NLPのアイデアが、「認知AI」の概念などの下で説明可能性を 実現するアプローチとして復活しています。 [ 60 ] 同様に、認知NLPの考え方は、ニューラルモデルマルチモーダル NLP(明示的に示されることはまれですが)[ 61 ] や人工知能 の発展、特に大規模言語モデル アプローチを使用するツールやテクノロジー[ 62 ] 、そしてユニバーシティ・カレッジ・ロンドンの英国神経科学者で理論家のカール・J・フリストンによる 自由エネルギー原理 に基づく汎用人工知能 の新しい方向性[ 63 ] に内在しています。
参考文献 ↑アイゼンシュタイン、ジェイコブ ( 2019年10月1日)。 自然言語処理入門 。MIT Press。p. 1。ISBN 978-0-262-04284-0 。↑ 「NLP」 。 ↑ Hutchins, J. (2005). "機械翻訳の歴史を簡潔にまとめると" (PDF) 。 2019年7月13日に オリジナル (PDF)からアーカイブ済み 。 2019年2月4日 に取得。 ↑ 「ALPAC:悪名高き報告書」、ジョン・ハッチンズ、MTニュース・インターナショナル、第14号、1996年6月、9~12ページ。 ↑ Crevier 1993 、pp. 146–148 harvnb error: no target: CITEREFCrevier1993 ( help ) 、 Buchanan 2005 、p. 56 harvnb error: no target: CITEREFBuchanan2005 ( help ) も参照: 「初期のプログラムは、メモリのサイズと速度によって必然的に範囲が制限されていた」 ↑ Koskenniemi, Kimmo (1983), Two-level morphology: A general computational model of word-form recognition and production (PDF) , Department of General Linguistics, University of Helsinki , archived from the original (PDF) on 2018-12-21 , retrieved 2020-08-20 ↑ Joshi, AK、& Weinstein, S. (1981年8月)。推論の制御:談話構造中心化のいくつかの側面の役割。IJCAI (pp. 385–387)。 ↑ Guida, G.; Mauri, G. (1986年7月). 「自然言語処理システムの評価:課題とアプローチ」. Proceedings of the IEEE . 74 (7): 1026–1035 . Bibcode : 1986IEEEP..74.1026G . doi : 10.1109/PROC.1986.13580 . ISSN 1558-2256 . S2CID 30688575 . ↑ チョムスキー言語学は、コーパス言語学のように現実世界のデータに現れる典型的な現象を体系的に調査するのではなく、思考実験を用いて作成される、理論 モデルの限界を強調する「 コーナーケース」(数学における 病理 現象に相当)の調査を奨励する。このような現実世界のデータからなるコーパス の作成と使用は、自然言語処理のための機械学習アルゴリズムの基本的な部分である。さらに、いわゆる「刺激の貧困 」論などのチョムスキー言語学の理論的基盤は、機械学習で一般的に使用されるような汎用学習アルゴリズムは言語処理では成功できないことを示唆している。その結果、チョムスキーのパラダイムは、そのようなモデルを言語処理に適用することを推奨しなかった。 ↑ Bengio, Yoshua; Ducharme, Réjean; Vincent, Pascal; Janvin, Christian (2003年3月 1日). "ニューラル確率言語モデル" . The Journal of Machine Learning Research . 3 : 1137–1155 – ACM Digital Library経由。 ↑ ミコロフ、トマーシュ。カラフィアト、マーティン。ブルゲット、ルカシュ。チェルノツキー、ヤン。クダンプール、サンジーブ(2010年9月26日)。 「リカレント ニューラル ネットワーク ベースの言語モデル」 (PDF) 。 インタースピーチ 2010 。 pp. 1045–1048 . doi : 10.21437/Interspeech.2010-343 。 S2CID 17048224 。 ↑ Goldberg, Yoav (2016). "自然言語処理のためのニューラルネットワークモデル入門" . Journal of Artificial Intelligence Research . 57 : 345– 420. arXiv : 1807.10854 . doi : 10.1613/jair.4992 . S2CID 8273530 . ↑ Goodfellow, Ian; Bengio, Yoshua; Courville, Aaron (2016). Deep Learning . MIT Press. ↑ Jozefowicz, Rafal; Vinyals, Oriol; Schuster, Mike; Shazeer, Noam; Wu, Yonghui (2016). Exploring the Limits of Language Modeling . arXiv : 1602.02410 . Bibcode : 2016arXiv160202410J . ↑ Choe, Do Kook; Charniak, Eugene. "Parsing as Language Modeling" . Emnlp 2016 . 2018-10-23 の オリジナル からアーカイブ済み. 2018-10-22 に取得 . ↑ Vinyals, Oriol; et al. (2014). "Grammar as a Foreign Language" (PDF) . Nips2015 . arXiv : 1412.7449 . Bibcode : 2014arXiv1412.7449V . ↑ Turchin, Alexander; Florez Builes, Luisa F. (2021-03-19). "Using Natural Language Processing to Measure and Improve Quality of Diabetes Care: A Systematic Review" . Journal of Diabetes Science and Technology . 15 (3): 553– 560. doi : 10.1177/19322968211000831 . ISSN 1932-2968 . PMC 8120048 . PMID 33736486 . ↑ Lee, Jennifer; Yang, Samuel; Holland-Hall, Cynthia; Sezgin, Emre; Gill, Manjot; Linwood, Simon; Huang, Yungui; Hoffman, Jeffrey (2022-06-10). "自然言語処理技術を用いた臨床記録におけるセンシティブ用語の出現頻度:観察研究" . JMIR Medical Informatics . 10 (6) e38482. doi : 10.2196/38482 . ISSN 2291-9694 . PMC 9233261 . PMID 35687381 . ↑ ウィノグラード、テリー (1971)。 自然言語理解のためのコンピュータプログラムにおけるデータ表現としての手続き (学位論文)。 ↑ Schank, Roger C.; Abelson, Robert P. (1977). Scripts, Plans, Goals, and Understanding: An Inquiry Into Human Knowledge Structures . Hillsdale: Erlbaum. ISBN 0-470-99033-3 。↑ マーク・ジョンソン。「統計革命が(計算)言語学をどのように変えるか」。EACL 2009 言語学と計算言語学の相互作用に関するワークショップ議事録。 ↑ フィリップ・レスニック。「4つの革命」。ランゲージ・ログ、2011年2月5日。 ↑ Socher, Richard. "Deep Learning For NLP-ACL 2012 Tutorial" . www.socher.org . 2021年4月14日の オリジナルからアーカイブ済み。 2020年8月17日 取得 。 これはACL 2012で行われた初期のディープラーニングチュートリアルで、参加者のほとんどが興味を示すと同時に(当時としては)懐疑的な見方も示しました。それまで、ニューラルネットワーク学習は統計的な解釈可能性の欠如を理由に基本的に拒否されていました。2015年までに、ディープラーニングは自然言語処理(NLP)の主要なフレームワークへと発展しました。[リンク切れです。http: //web.stanford.edu/class/cs224n/をお試しください]↑ セゲフ、エラド(2022)。 社会科学における意味ネットワーク分析 。ロンドン:ラウトレッジ 。ISBN 978-0-367-63652-4 2021年12月5日にオリジナルからアーカイブされました。2021年 12月5日 に取得 。↑ Yi, Chucai; Tian, Yingli (2012), "視覚障害者のための複雑な背景からのテキスト読み取り支援", Camera-Based Document Analysis and Recognition , Lecture Notes in Computer Science, vol. 7139, Springer Berlin Heidelberg, pp. 15–28 , CiteSeerX 10.1.1.668.869 , doi : 10.1007/978-3-642-29364-1_2 , ISBN 978-3-642-29363-4 1 2 「自然言語処理(NLP) - 完全ガイド」 . www.deeplearning.ai . 2023-01-11 . 2024-05-05 に取得. ↑ "GeeksforGeeks. (nd). 自然言語処理 (NLP) におけるトークン化。GeeksforGeeks" . Geeksforgeeks . 2024年6月25日。 ↑ Torabi, Mohhamadreza; Ghasemi, Fahimeh. "ブラックコホシュ由来のα-グルコシダーゼ阻害剤を予測するためのデータ拡張とBERTベースの深層学習の統合" . Scientific Reports . 1 (1): 1– 15. doi : 10.1038/s41598-025-14699-1 . PMC 12391535 . ↑ 「自然言語処理とは?機械学習におけるNLP入門」 。GyanSetu ! 。2020年12月6日。 2021年1月9日 取得 。 ↑ Kishorjit, N.; Vidya, Raj RK.; Nirmal, Y.; Sivaji, B. (2012). "Manipuri Morpheme Identification" (PDF) . Proceedings of the 3rd Workshop on South and Southeast Asian Natural Language Processing (SANLP) . COLING 2012、ムンバイ、2012年12月: 95–108 . {{cite journal}}: CS1メンテナンス: 場所 (リンク)↑ Klein, Dan; Manning, Christopher D. (2002). "構成要素-文脈モデルを用いた自然言語文法誘導" (PDF) . Advances in Neural Information Processing Systems . ↑ Kariampuzha, William; Alyea, Gioconda; Qu, Sue; Sanjak, Jaleal; Mathé, Ewy; Sid, Eric; Chatelaine, Haley; Yadaw, Arjun; Xu, Yanji; Zhu, Qian (2023). "Precision information extraction for rare disease epidemiology at scale" . Journal of Translational Medicine . 21 (1): 157. doi : 10.1186/s12967-023-04011-y . PMC 9972634 . PMID 36855134 . ↑ PASCAL テキスト含意認識チャレンジ (RTE-7) https://tac.nist.gov//2011/RTE/ ↑ Lippi, Marco; Torroni, Paolo (2016-04-20). "Argumentation Mining: State of the Art and Emerging Trends" . ACM Transactions on Internet Technology . 16 (2): 1– 25. doi : 10.1145/2850417 . hdl : 11585/523460 . ISSN 1533-5399 . S2CID 9561587 . ↑ 「議論マイニング – IJCAI2016 チュートリアル」 。www.i3s.unice.fr 。 2021年4月18日に オリジナル からアーカイブ済み 。 2021年3月9日 に取得。 ↑ 「NLPによる計算論証へのアプローチ – ACL 2016、ベルリン」 。 2021年3月9日 取得 。 ↑ 管理部。 「言語技術センター(CLT)」 。 マッコーリー大学。 2021年1月11日 取得 。 ↑ 「共有タスク:文法エラー訂正」 。www.comp.nus.edu.sg 。 2021年1月11日 取得 。 ↑ 「共有タスク:文法エラー訂正」 。www.comp.nus.edu.sg 。 2021年1月11日 取得 。 ↑ Duan, Yucong; Cruz, Christophe (2011). "Formalizing Semantic of Natural Language through Conceptualization from Existence" . International Journal of Innovation, Management and Technology . 2 (1): 37– 42. 2011年10月9日に オリジナル からアーカイブ済み。 ↑ "UBUWEB :: Racter" . www.ubu.com . 2020年8月17日 取得 . ↑ 著者 、ベータ(2019)。 リチウム イオン 電池 。doi : 10.1007/978-3-030-16800-1。ISBN 978-3-030-16799-8 . S2CID 155818532 . ↑ 「Google Cloud での文書理解 AI (Cloud Next '19) – YouTube」 。www.youtube.com。2019年 4 月 11 日。2021 年 10 月 30 日に オリジナル からアーカイブ済み。2021 年 1 月 11 日に取得 。 ↑ Robertson, Adi (2022-04-06). "OpenAIのDALL-E AI画像生成器は、画像の編集も可能になった" . The Verge . 2022-06-07 に閲覧。 ↑ 「スタンフォード自然言語処理グループ」 。nlp.stanford.edu 。 2022年6月7日 取得 。 ↑ Coyne, Bob; Sproat, Richard (2001-08-01). "WordsEye" . Proceedings of the 28th annual conference on Computer graphics and interactive techniques . SIGGRAPH '01. New York, NY, USA: Association for Computing Machinery. pp. 487–496 . doi : 10.1145/383259.383316 . ISBN 978-1-58113-374-5 . S2CID 3842372 . ↑ 「Google、テキストからビデオへの変換、言語翻訳などにおけるAIの進歩を発表」 。VentureBeat 。2022年11月2日。 2022年11月9 日 閲覧 。 ↑ Vincent, James (2022-09-29). 「Metaの新しいテキストからビデオへのAIジェネレーターは、ビデオ版DALL-Eのようなものだ」 The Verge 2022-11-09 閲覧 。 ↑ 「以前の共有タスク | CoNLL」 。www.conll.org 。 2021年1月11日 取得 。 ↑ 「認知」 。Lexico 。 オックスフォード大学出版局 および Dictionary.com 。 2020 年7月15日の オリジナルからアーカイブ。 2020年 5月6日 取得 。 ↑ 「認知科学者に聞く」 。 アメリカ教員連盟 。2014年8月8日。 認知科学は、言語学、心理学、神経科学、哲学、コンピュータ科学、人類学の研究者による学際的な分野であり、心の理解を目指しています。 ↑ ロビンソン、ピーター(2008)。 認知言語学と第二言語習得ハンドブック 。ラウトレッジ 。3-8 頁 。ISBN 978-0-805-85352-0 。↑ ラコフ、ジョージ( 1999)。 『肉体の哲学:身体化された心と西洋哲学への挑戦;付録:言語パラダイムの神経理論 』ニューヨーク、ベーシックブックス、 569-583頁 。ISBN 978-0-465-05674-3 。↑ ストラウス、クラウディア(1999)。 『文化的意味の認知理論 』ケンブリッジ大学出版局、 156-164 頁 。ISBN 978-0-521-59541-4 。↑ 米国 特許第9269353号 ↑ 「ユニバーサル概念認知アノテーション(UCCA)」 。 ユニバーサル概念認知アノテーション(UCCA) 。 2021年1月11日 取得 。 ↑ ロドリゲス、FC、マイラル・ウソン、R. (2016)。 RRG 計算文法の構築。オノマゼイン 、(34)、86–117。 ↑ 「Fluid Construction Grammar – 構築文法のための完全に機能する処理システム」 。 2021年1月11日 取得 。 ↑ 「ACLメンバーポータル|計算言語学会メンバーポータル」 。www.aclweb.org 。 2021年1月11 日 取得 。 ↑ 「チャンクとルール」 。W3C 。 2021年1月11日 取得 。 ↑ Socher, Richard; Karpathy, Andrej; Le, Quoc V.; Manning, Christopher D.; Ng, Andrew Y. (2014). "Grounded Compositional Semantics for Finding and Describing Images with Sentences" . Transactions of the Association for Computational Linguistics . 2 : 207–218 . doi : 10.1162/tacl_a_00177 . S2CID 2317858 . ↑ Dasgupta, Ishita; Lampinen, Andrew K.; Chan, Stephanie CY; Creswell, Antonia; Kumaran, Dharshan; McClelland, James L.; Hill, Felix (2022). "言語モデルは推論に人間のような内容効果を示す、Dasgupta、Lampinen 他". arXiv : 2207.07051 [ cs.CL ]. ↑ Friston, Karl J. (2022). Active Inference: The Free Energy Principle in Mind, Brain, and Behavior; Chapter 4 The Generative Models of Active Inference . The MIT Press. ISBN 978-0-262-36997-8 。
さらに読む Bates, M (1995). 「自然言語理解のモデル」 .米国科学アカデミー紀要 . 92 (22): 9977–9982 . Bibcode : 1995PNAS...92.9977B . doi : 10.1073 / pnas.92.22.9977 . PMC 40721. PMID 7479812 . Steven Bird、Ewan Klein、Edward Loper (2009)『Pythonによる自然言語処理 』 O'Reilly Media。ISBN 978-0-596-51649-9 。 Kenna Hughes-Castleberry 、「殺人ミステリーパズル:何十年も人類を悩ませてきた文学パズル『カインの顎骨』は、自然言語処理アルゴリズムの限界を露呈する」、 サイエンティフィック・アメリカン 、第329巻、第4号(2023年11月)、81~82ページ。「この殺人ミステリーコンテストは、NLP(自然言語処理 )モデルが驚異的な能力を発揮できる一方で、その能力は受け取るコンテキスト の量によって大きく制限されることを明らかにした。これは、古代言語の 分析など、これらのモデルを使って何かをしようとする研究者にとって困難を引き起こす可能性がある。場合によっては、そのような目的のための訓練データ として利用できる、はるか昔の文明 に関する歴史的記録がほとんど存在しない。」( 82ページ) ダニエル・ジュラフスキー、ジェームズ・H・マーティン(2008)。音声と言語処理 、第2版。ピアソン・プレンティス・ホール。ISBN 978-0-13-187321-6 。 Mohamed Zakaria Kurdi (2016).自然言語処理と計算言語学:音声、形態論、構文論、第1巻 。ISTE -Wiley。ISBN 978-1848218482 。 Mohamed Zakaria Kurdi (2017).自然言語処理と計算言語学:意味論、談話、応用、第2巻 。ISTE -Wiley。ISBN 978-1848219212 。 クリストファー・D・マニング、プラバーカール・ラガヴァン、ヒンリッヒ・シュッツェ(2008年)。情報検索の概要 。ケンブリッジ大学出版局。ISBN 978-0-521-86571-5 公式のHTML版とPDF版は無料で入手可能です。 クリストファー・D・マニング、ヒンリッヒ・シュッツェ(1999)。『統計的自然言語処理の基礎』 MIT出版。ISBN 978-0-262-13360-9 。 David MW Powers および Christopher CR Turk (1989).自然言語の機械学習 . Springer-Verlag. ISBN 978-0-387-19557-5 。
外部リンク ウィキメディア・コモンズにある 自然言語処理関連のメディア