言語学 において、語彙(古代ギリシア語のλέξις「単語」に由来)という用語は、ある言語におけるすべての可能な単語の完全な集合、または特定の言語的基準によってグループ化された単語の特定の部分集合を指します。たとえば、一般的な用語である英語語彙は英語のすべての単語を指しますが、[ 1 ]より具体的な用語である英語宗教語彙は、英語語彙内の特定の部分集合を指し、意味的に宗教的な領域に関連する単語のみを含みます。[ 2 ]
体系機能言語学において、語彙または語彙項目とは、特定の事物や現象の種類を呼ぶ方法のことです。体系機能言語学の観点から見ると、語彙は呼び方であるため、「ホワイトハウス」「ニューヨーク市」「心臓発作」など、複数の文法的な単語によって実現される可能性があります。さらに、語彙は呼び方であるため、「子供」「子供たち」「子供の」「子供たちの」など、異なる単語が同じ語彙項目を実現することもあります。
語彙のグループ化は次のようになる可能性がある。
心理言語学と神経言語学の主要な研究分野は、オンライン言語処理と産出において、メンタル語彙コーパスから単語がどのように検索されるかという問題に関わっています。たとえば、コホートモデルは、競合する語彙エントリのセグメントごとの活性化という観点から語彙検索を説明しようとしています。[ 3 ] [ 4 ]
近年、実際の音声や文章のサンプルを用いた言語データベースの構築により、研究者は言語の構成を新たな視点から捉えることができるようになった。とりわけ、統計的手法を用いることで、単語間の相互作用の仕組みについて確かな知見が得られる。最も興味深い発見は、言語使用(言語がどのように使われているか)と言語使用法(言語がどのように使われうるか)という二分法に関するものである。
言語使用は、単語とその関連語が最も頻繁に出現するパターンを示します。この研究の主な発見は、言語使用者が、簡単に組み合わせて文を形成できる既成の言語「語彙チャンク」に非常に大きく依存しているということです。これにより、話し手は各文を文法的に分析する必要がなくなり、状況に効果的に対処できます。典型的な例としては、「おっしゃることは分かります」や「~をお渡しいただけますか」、または「最近の研究によると…」などが挙げられます。
一方、言語使用とは、既存の表現が話し手の差し迫ったニーズを満たさない場合に生じる現象です。つまり、新しい文が形成されようとしており、その正しさを分析する必要があるということです。文法規則はネイティブスピーカーによって内面化されており、それによって新しい文の妥当性を判断できます。言語使用は、他のすべての選択肢が尽きたときの最終手段と定義できるでしょう。
言語構造を統計的に分析する際、高頻度で出現する文脈語、いわゆる文脈キーワード(KWIC)から始めるのが効果的です。数百万もの話し言葉と書き言葉のサンプルがデータベースに保存された後、これらのKWICは、共起する単語、つまり頻繁に一緒に出現する単語に基づいて分類・分析することができます。KWICを分析する際に役立つ原則には、以下のようなものがあります。
データが収集されたら、それを並べ替えて共起確率を判定することができます。一般的でよく知られた方法の一つは、コンコーダンスを用いることです。KWIC(キーワードとキーワードの一致)が中央に配置され、数十もの使用例とともに示されます。下の「可能性」の例をご覧ください。
まもなく登場する可能性が高い。ベンがもう ヒエット氏は、それは現実的な可能性として残っていると述べている。PLOの一部として、PLFは グラハム氏は付け加えた。「それも可能性の一つだ」とウィットロック氏は認めた。 激しい痛みは常に起こりうる可能性があった。世紀の初めには、 可能な限り、外部の講演者によるスピーチを含む他のあらゆる可能性 私たちができること、あらゆる可能性を活用すること、 別々に貸し出すことも可能です。別の可能性としては「建設的破壊行為」も考えられます。 人々は暴力を拒否し、暴力の可能性は可能性 フランス国民の投票により、現在、2議席を獲得する可能性を享受している。 刑事告訴の可能性を直ちに調査し、 スリランカの情報筋によると、タミル人との交渉の可能性は シェイク領においても、扇動行為を助長する可能性がある。 12の加盟国は、 マリーはすでに[f]を説得する可能性について調べていた 依存の機能ではあるが、資本主義的発展の可能性もある。 彼らはほとんど無防備だった。侵略の可能性は明らかだった。 奇妙なことに、薬物使用の可能性を心配している場合は、そう伝えてください。 最初に招集されたのは、クーデターを起こして政権を奪還する可能性について議論するためだった。 MI5の路線と、国家が中傷に利用される可能性について 移転の背景には、新たな市場の可能性があった。安価なターミナル 個別に評価される。遺伝子検査の可能性は、 特権を与えられた。もちろん、もう一つの可能性は、その小旅行が これらすべてが経済改革の可能性を損ない、 得る。(性交を試みる可能性がないと知ると、 社会主義の実現可能性について公然と懐疑的だった人物 5 市民として活動する可能性を認識できるように 毒や火、死の可能性に直面して 昨日、機関を利用して情報を収集する可能性について聞いた。 1903年に製造されたこの車は、今後交換される可能性は全くないと考えています。 遺伝的要因が作用している可能性があり、少なくとも数人がその可能性を支持している。 いずれかの国が 長い歴史があり、最近の急増の可能性もある 警察は、彼女が短時間目撃された可能性について捜査している。 感染の可能性があると考える医師 お店にいるなら、保湿剤を塗っている可能性が高い 生きていくためには、 彼は麻薬密輸の可能性についての話を終えた いわゆる古代の人々が
いったんこのような一致表が作成されると、KWICと他の単語の共起を分析できます。これはtスコアを用いて行われます。例えば、「stranger」(比較級の形容詞と名詞)という単語を取り上げると、tスコア分析によって、コーパスにおける単語の出現頻度などの情報が得られます。「no」や「to」といった単語は当然ながら非常に頻繁に出現しますが、「controversy」のような単語ははるかに頻度が低くなります。次に、その単語とKWICの出現回数(「同時出現頻度」)を計算し、その組み合わせが異常に一般的かどうか、つまり、単語の組み合わせが、その単語の出現頻度だけから予想されるよりも有意に多く出現するかどうかを判断します。そうであれば、その共起は強いとみなされ、より詳しく検討する価値があります。
この例では、「no stranger to」は非常に頻繁に使われるコロケーションです。同様に、「mysterious」「handsome」「dark」といった単語もよく使われます。これは驚くべきことではありません。しかし、より興味深いのは「no stranger to controversy」です。おそらく最も興味深い例は、慣用句である「perfect stranger」でしょう。このような単語の組み合わせは、私たちが期待するような「完璧な見知らぬ人」という意味ではないため、単独では予測できません。その異常に高い使用頻度は、この2つの単語が強く共起し、表現として非常に慣用的であることを示しています。
コーパス言語学の研究は、上記のように、言語の真の性質について多くの洞察を与えてくれます。本質的に、語彙コーパスは、言語の使用は組み立てプロセスとして捉えるのが最適であるという前提に基づいて構築されているようです。つまり、脳は既成のチャンクを連結します。直感的にこれは理にかなっています。話すたびに「車輪を再発明する」負担を軽減するための自然な近道です。さらに、よく知られた表現を使用すると、聞き手が発話を構成要素に分解する必要がないため、大量の情報を迅速に伝えることができます。『Words and Rules』の中で、スティーブン・ピンカーは、規則動詞と不規則動詞を使ってこのプロセスがどのように機能するかを示しています。規則動詞は、未知の単語に適用できる規則を提供してくれるため、私たちは規則動詞を集めます(たとえば、過去形の動詞の語尾「-ed」によって、新語「to google」を「googled」に変化させることができます)。その他のパターン、つまり不規則動詞は、記憶すべき個別の項目として別々に保存されます。[ 6 ]
語彙コーパスにおける効果的な言語記憶のもう 1 つの方法として、記憶原理としてメタファーを使用することが挙げられます。(「記憶」と「ファイル」は、人間の記憶とコンピュータの記憶が同じ語彙に関連付けられてきた良い例です。これは常にそうであったわけではありません。)ジョージ・レイコフの研究は、言語におけるメタファーの研究の基礎としてよく引用されます。[ 7 ] 1 つの例は非常に一般的です。「時は金なり」。私たちは時間とお金の両方を節約したり、使ったり、無駄にしたりできます。もう 1 つの興味深い例は、ビジネスとセックスから来ています。企業は市場に参入し、顧客を引き付け、「関係管理」について話し合います。ビジネスは戦争でもあります。広告キャンペーンを開始し、市場で足場を築き(軍事用語ではすでに上昇メタファーとなっています)、損失を被ります。一方、システムは水です。情報の洪水、人であふれかえり、交通の流れ。語彙獲得の NOA 理論は、メタファーによる分類フィルターが言語記憶を簡素化し、過負荷を回避するのに役立つと主張しています。
コンピュータ研究により、全く新しい言語を作り出す能力という意味での文法は、可能な限り回避されていることが明らかになった。アリゾナ大学でCobuild GSWEに取り組んでいるBiber氏とそのチームは、それ自体では意味を持たない単語の束が異常に高い頻度で出現していることに気づいた。しかし、1つか2つの例を見れば、その機能はすぐにわかる。つまり、形式を事前に分析することなく、文法的な接着剤として挿入できるのだ。例をざっと観察するだけでも、あらゆる言語使用においていかに一般的であるかがわかるが、私たちはその存在にほとんど気づいていない。研究によると、言語はあらゆるレジスターでこのような束で溢れている。2つの例としては、会話でよく見られる「do you want me to」や、学術的なレジスターで見られる「there was no significant」などがある。会話では、これらを組み合わせることで、「I'm not sure」+「if they're」+「they're going」のように、理解できる文を作ることができる。「I'm not sure if they're going」このような文は、文法分析を一切必要としないため、語彙項目への負担を軽減する。[ 8 ]
イギリスの言語学者マイケル・K・ハリデーは、話し言葉と書き言葉という有用な二分法を提唱しており、これは実際にはパラダイムシフトを伴うものである。言語理論では、話し言葉が書き言葉よりも優れている(前者は起源であり、自然に生じるため、書き言葉に先行する)か、書き言葉が話し言葉よりも優れている(同じ理由で、書き言葉は最も基本的な言語形態である)とされているが、ハリデーは、両者は全く異なる存在であると述べている。
彼は、話し言葉は文法的に複雑であるのに対し、書き言葉は語彙的に密であると主張している。[ 9 ]つまり、「先日話していた従兄弟、ダラスではなくヒューストンに住んでいる従兄弟が、昨日電話をかけてきて、メアリーについての全く同じ話をしてくれた…」という文は、新聞の見出しではなく、会話の中で見られる可能性が高い。一方、「首相が和解を誓う」は、典型的なニュースの見出しである。一方はよりコミュニケーション的(話し言葉)であり、もう一方はより記録ツール(書き言葉)である。
ハリデーの研究は、根本的に異なることを示唆している。言語はレジスター(言語様式)で振る舞うというのだ。LGSWE(言語使用様式研究)に取り組むビバーらは、会話、文学、ニュース、学術の4つのレジスター(これらは網羅的なものではなく、単なる例示である)を扱った。これらの4つのレジスターは、「文法」的なアプローチでは明らかにならない言語使用における明確な区別を浮き彫りにする。当然のことながら、それぞれのレジスターは異なる単語や構造の使用を好む。例えば、ニュースの見出し記事は文法的に単純だが、会話の逸話は語彙の繰り返しに満ちている。しかし、ニュースの語彙は非常に密度が高く、話し言葉の文法が信じられないほど複雑になることがあるのと同様である。
{{cite book}}: CS1 maint: 複数の名前: 著者リスト (リンク)