3つの段階 話し言葉 の生成には、概念化、定式化、発音という 3 つの主要なレベルの処理が含まれます。[ 1 ] [ 8 ] [ 9 ]
第一段階は概念化 または概念準備のプロセスであり、発話を作成する意図が望ましい概念を表現すべき特定の言葉に結びつける。ここでは、表現すべき概念を具体的に示す前言語的な意図されたメッセージが形成される。[ 10 ]
第 2 段階は、望ましいメッセージの表現に必要な言語形式を作成する定式化です。定式化には、文法符号化、形態音韻符号化、および音声符号化が含まれます。[ 10 ] 文法符号化は、適切な統語語またはレマ を選択するプロセスです。選択されたレマは、概念化されたメッセージに適した統語 フレームを活性化します。形態音韻符号化は、明示的な発話で生成される音節に単語を分解するプロセスです。音節化は、 I-com-pre-hend とI-com-pre-hen-dit のように、前後の単語に依存します。[ 10 ] 定式化段階の最後の部分は音声符号化です。これは、形態音韻プロセスで選択された音節に依存する調音動作 の活性化を伴い、発話が組み立てられ、発声器官 の動きの順序が完了するにつれて調音スコアを作成します。[ 10 ]
発話生成の第 3 段階は調音であり、これは肺、声門、喉頭、舌、唇 、顎 、その他の発声器官によって調音譜が実行され、発話が生じることである。 [ 8 ] [ 10 ]
右利きの人の場合、発話活動の大部分は左大脳半球で行われる。
障害 発話能力は、いくつかの障害によって影響を受ける可能性があります。
音声生成研究の歴史 発話エラーの例。目標は話し手が言おうとした内容、エラーは話し手が実際に言った内容です。これらの間違いは、発話の構造を理解するために研究されてきました。 1960年代後半まで、音声に関する研究は理解 に焦点を当てていました。研究者たちが音声エラー のデータを大量に収集するにつれて、音声の生成に関わる心理的プロセスを調査し、流暢な音声の可能なプロセスについて考察し始めました。[ 14 ] 音声エラー研究の知見はすぐに音声生成モデルに組み込まれました。音声エラーデータからの証拠は、音声生成に関する以下の結論を裏付けています。
これらのアイデアには以下のようなものがあります。
スピーチは事前に計画される。[ 15 ] 語彙は 意味的にも音韻的にも整理されている。[ 15 ] つまり、意味と単語の音によって整理されている。 形態的に 複雑な単語が組み立てられます。[ 15 ] 形態素を含む単語は、発話生成プロセス中に組み立てられます。形態素は 意味を含む言語の最小単位です。たとえば、過去形の単語の-ed など です。言い間違いでは、接辞 や機能語は文脈語とは異なる振る舞いをします。[ 15 ] これは、単語の使用方法に関する規則がそれらとともに保存されている可能性が高いことを意味し、一般的に、発話エラーが発生した場合、間違い語はその機能を維持し、文法的に意味を成します。言語エラーは ルールの知識を反映している。[ 15 ] 間違いがあっても、言語は意味不明ではない。言語エラーで生成される単語や文は、通常は文法的であり、話されている言語のルールに違反していない。
音声生成モデルの側面 音声生成モデルが有効であるためには、特定の要素を含まなければならない。これには、以下に列挙する音声を構成する要素が含まれる。以下でより詳細に議論する、受け入れられている音声生成モデルはすべて、明示的または暗黙的にこれらの段階を取り入れており、現在では時代遅れまたは議論の的となっているモデルは、以下の段階の1つ以上を見落としているとして批判されている。[ 16 ]
受け入れられる音声モデルの属性は次のとおりです。
a) 話し手が表現したいことを抽象的に特定する概念段階。[ 16 ]
b) 単語が配置される枠組みが選択される統語段階。この枠組みは通常、文構造 である。[ 16 ]
c) 意味に基づいて単語を検索する語彙段階。単語が選択され取得されると、音韻論 や形態論を含むその単語に関する情報が話者に利用可能になる。 [ 16 ]
d) 抽象的な情報が音声のような形式に変換される音韻段階。[ 16 ]
e)発音筋 に送られる指示が準備される音声 段階。[ 16 ]
また、モデルには、将来計画メカニズム、バッファ、および監視メカニズムが備わっている必要がある。
以下に、前述の段階を考慮または取り入れ、発話エラー研究やその他の非流暢性データ[ 17 ] 、例えば舌先現象の 研究から発見された情報を含む、影響力のある発話生成モデルをいくつか示します。
モデル
発話生成器モデル(1971年)発話生成モデルは、フロムキン(1971)によって提案されました。[ 18 ] このモデルは6つの段階から構成され、これまでの発話エラー研究の結果を説明する試みでした。発話生成モデルの段階は、特定の発話の表現における変化の可能性に基づいています。最初の段階は、人が伝えたい意味を生成する段階です。2番目の段階では、メッセージが構文構造に変換されます。ここで、メッセージにアウトラインが与えられます。[ 19 ] フロムキンが提案した3番目の段階は、意味に基づいてメッセージに異なるアクセントとイントネーションが付与される段階です。フロムキンが提案した4番目の段階は、語彙 から単語を選択する段階です。4番目の段階で単語が選択された後、メッセージは音韻的仕様を受けます。[ 20 ] 5番目の段階では、発音規則が適用され、出力される音節が生成されます。フロムキンの発話生成モデルの6番目で最後の段階は、発話に必要な運動指令の調整です。ここでは、メッセージの音声的特徴が声道の関連する筋肉に送られ、意図したメッセージが生成されます。フロムキンのモデルの独創性にもかかわらず、研究者たちはこの音声生成の解釈を批判してきました。発話生成器モデルは、音声エラー研究で発見された多くのニュアンスとデータに関係していますが、研究者たちはまだ改善の余地があると判断しました。[ 21 ] [ 22 ]
ギャレットモデル(1975年)フロムキンのモデルよりも新しい、発話生成の説明の試みは、1975年にギャレットによって発表された。[ 23 ] ギャレットもまた、発話エラーのデータを収集してこのモデルを作成した。このモデルと、その基となったフロムキンのモデルには多くの重複があるが、彼はフロムキンのモデルにいくつかの要素を追加し、他の研究者によって指摘されていたいくつかのギャップを埋めた。ギャレットとフロムキンのモデルはどちらも、概念レベル、文レベル、運動レベルの3つのレベルを区別している。これらの3つのレベルは、現代の発話生成の理解に共通している。[ 24 ]
これはデルのモデルを解釈したものです。最上部の単語は意味カテゴリーを表します。第2レベルは、その意味カテゴリーを示す単語を表します。第3レベルは音素(音節情報、すなわち語頭、母音、語末など)を表します。
デルのモデル(1994年)1994年、デルは、音声の生成方法の理解において基礎となる語彙ネットワークのモデルを提案した。[ 1 ] この語彙ネットワークのモデルは、語彙を記号的に表現し、それによって、人々がどのように発話したい単語を選択し、それらの単語がどのように音声に組織化されるかを説明しようとするものである。デルのモデルは、意味、単語、音素の3つの段階から構成されていた。モデルの最上位段階の単語は、意味カテゴリーを表す。(図では、意味カテゴリーを表す単語はwinter、footwear、feet、snowであり、それぞれbootとskateの意味カテゴリーを表している。)第2レベルは、意味カテゴリーを参照する単語を表す(図では、bootとskate)。そして、第3レベルは音素(音節情報、 音節頭 、母音、音節末など)を表す。 [ 25 ]
レベルトモデル(1999年)Levelt は Dell が提唱した語彙ネットワークをさらに改良した。Levelt は音声エラーデータを用いて Dell のモデルの 3 つのレベルを再現した。概念層は最上位かつ最も抽象的なレベルで、特定の概念に関する人の考えについての情報が含まれている。[ 26 ] 概念層には、概念同士がどのように関連しているかについての考えも含まれている。ここで単語の選択が行われ、人は表現したい単語を選択する。次の、または中間のレベルであるレマ層には、 時制 や機能など、個々の単語の統語機能に関する情報が含まれている。[ 1 ] このレベルは、構文を維持し、話者にとって意味のある文構造に単語を正しく配置する機能を持つ。[ 26 ] 最下位かつ最後のレベルは形式層であり、Dell モデルと同様に音節情報が含まれている。ここから、形式層レベルに保存された情報が運動皮質に送られ、そこで発声器官が協調して物理的に音声を生成する。
関節部 人間の発声器官は、音声を生成するために用いられる。 人間の鼻、喉、声帯の物理的構造により、多くの独特な音を生成することが可能であり、これらの領域はさらに調音部位 に細分化できます。異なる音は異なる領域で、異なる筋肉と呼吸法によって生成されます。[ 27 ] 効果的にコミュニケーションするために必要なさまざまな音を生成するためにこれらのスキルを利用できる能力は、発話に不可欠です。発話は精神運動活動です。2人の間の会話は会話 であり、カジュアル、フォーマル、事実、または取引的であり、使用される言語構造または物語のジャンルは文脈によって異なります。感情は 発話を制御する重要な要素です。感情によって言語使用の記憶を阻害する兆候には、緊張感、不安状態、吐き気などの身体的兆候が含まれます。感情がもたらす言語レベルの兆候は、話し手の躊躇、繰り返し、言い間違い、不完全、構文の融合などで観察できます。調音方法の困難は、発話の困難や 障害 につながる可能性があります。[ 28 ] 乳児は、可能な母音と子音の全スペクトルを発音できると考えられています。国際音声記号 (IPA) は、可能なすべての音声を理解し分類するためのシステムであり、音声の生成方法と生成場所に関する情報が含まれています。[ 28 ] これは、音声生成の理解に非常に役立ちます。なぜなら、音声は、話されている言語によっては誤解を招く可能性がある綴りではなく、音に基づいて書き起こすことができるからです。平均的な発話速度は、1 分あたり 120 ~ 150 語 (wpm) の範囲であり、これはオーディオブックの録音の推奨ガイドラインです。人々は特定の言語に慣れるにつれて、特定の音声を生成する能力だけでなく、これらの音声を区別する能力も失いがちです。[ 28 ]
発音 発音は、しばしば発話と関連付けられますが、人が物理的に音声を生成する方法です。流暢に話す人にとって、発音は自動で行われ、1秒間に15個の音声を生成することができます。[ 29 ]
効果的な発話には、流暢さ、複雑さ、正確さ、理解しやすさといった要素が含まれる。[ 30 ]
流暢さ: 意図したメッセージを伝える能力、または話し手が意図した方法で聞き手に影響を与える能力です。正確な言語の使用はこの能力の構成要素ですが、正確さに過度に注意を払うと、実際には流暢さの発達が阻害される可能性があります。流暢さには、一貫性のある発話や会話のまとまりを構築すること、過度の躊躇なしに応答したり話したりすること(「えー 」 「あのー」「 えー」「~ みたいな 」 「ほら」などのフィラーの使用を制限すること)が含まれます。また、簡略化やジェスチャーなどの戦略を使用してコミュニケーションを補助する能力も含まれます。流暢さには、関連情報、適切な語彙、構文 の使用が含まれます。 複雑性:メッセージが正確に伝達される発話。聞き手の反応に応じてメッセージを調整したり、会話の主導権を握ったりする能力、そして話し手の役割や関係性に応じて適切な従属節や節形式を用いる能力。これには、社会言語学的知識、つまり異文化間で効果的にコミュニケーションをとるために必要なスキル、規範、どのような状況で誰に何を言うのが適切かという知識の活用が含まれる。 正確性:これは、適切な高度な文法、主語と動詞の一致 、語順 、語形 (excited/excitingなど )の使用、そして話し言葉における適切な語彙選択を指します。また、会話中に自己修正を行い、文法的に正確な話し言葉を明確にしたり修正したりする能力も含まれます。理解可能性:これは他者に理解される能力であり、言語の音と関連しています。理解可能性に影響を与える3つの要素は、1.発音(単語の音を正しく発音すること)、2.イントネーション(単語や音節に適切な アクセント を付け、上昇音程と下降音程を用いて疑問や陳述を示し、声色を用いて感情や強調を示し、適切なリズムで話すこと)、3.明瞭な発音 (適切なペースで明瞭に話し、単語やフレーズを効果的に発音し、適切な音量で話すこと)です。
発達 乳児は音を出す前から顔の表情や動きを真似します。[ 31 ] 生後7ヶ月頃になると、乳児は口を開閉することと音を出すことを協調させようとして、コミュニケーション音の実験を始めます。
生後1年までは、乳児はまとまった言葉を発することができず、代わりに喃語を繰り返し発します。 喃語によって、乳児は意味に注意を払うことなく発音を試すことができます。この繰り返される喃語が、最初の言語生成の始まりとなります。喃語は、対象物の永続性や位置の理解と連携して、最初の 語彙 項目や単語のネットワークを支えます。 [ 7 ] 乳児の語彙の発達は、対象物が存在しないときでも存在することを理解できるようになると大幅に増加します。
意味のある発話の最初の段階は、1歳頃まで起こりません。この段階は単語段階です。[ 32 ] 全体的段階とは、乳児の発話が一度に1つの単語で構成される時期を指します(例:パパ )。
次の段階は電報段階です。この段階では、乳児は短い文(例:パパ座る 、ママ飲む )を形成できます。これは通常、1歳半から2歳半の間に起こります。この段階は、子どもの語彙 が爆発的に増加するため、特に注目に値します。この段階では、乳児は意味や概念を伝えるために、記憶されている単語の表象を特定の知覚目標語に選択して一致させる必要があります。[ 31 ] 十分な語彙があれば、乳児は音のパターンを抽出し始め、単語を音韻 セグメントに分解することを学び、学習できる単語の数をさらに増やします。[ 7 ] 乳児の言語発達のこの時点では、語彙は200語以上になり、話せるよりも理解できる単語の方が多くなります。[ 32 ]
2歳半になると、子どもの発話はますます複雑になり、特に意味構造が顕著になります。より詳細な意味ネットワークが形成さ れることで、乳児はより幅広い意味を表現できるようになり、複雑な概念体系である語彙 の発達を促します。
4歳か5歳頃になると、子供の語彙は多様化し、正しい発話に必要な適切な語彙を選択できるようになります。[ 7 ] 乳幼児に読み聞かせをすると、語彙が増えます。この年齢では、読み聞かせをしてもらい、より珍しい複雑な単語に触れた子供は、言語的に貧弱な子供よりも3200万語多くなります。[ 33 ] この年齢になると、子供は大人と同じように、完全な文で話せるようになります。
参考文献 1 2 3 4 Levelt, WJ (1999). "単語生成のモデル" (PDF) . Trends in Cognitive Sciences . 3 (6): 223– 232. doi : 10.1016/S1364-6613(99)01319-4 . PMID 10354575 . S2CID 7939521 . ↑ Garnham, A、Shillcock RC、Brown GDA、Mill AID、Culter A (1981)。 「ロンドン・ルンド自発会話コーパスにおける言い間違い」 (PDF) 。 言語学 。19 ( 7–8 ): 805–817。doi : 10.1515/ling.1981.19.7-8.805。hdl : 11858/00-001M-0000-0013-33D0-4。S2CID 144105729。 2011 年10月 8 日に オリジナル (PDF) からアーカイブ。 2009年12 月 25 日 に 取得 。 {{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク)↑ Oldfield RC、Wingfield A (1965)。「物体の命名における反応潜時」。 実験 心理 学 季刊 誌 。17 ( 4 ) : 273–281。doi : 10.1080/17470216508416445。hdl : 11858 / 00-001M-0000-002C- 17D2-8。PMID 5852918。S2CID 9567809 。 ↑ Bird, H; Franklin, S; Howard, D (2001). "動詞や機能語を含む多数の単語の習得年齢とイメージしやすさの評価" (PDF) . Behavior Research Methods, Instruments, and Computers . 33 (1): 73– 9. doi : 10.3758/BF03195349 . PMID 11296722 . ↑ Weinberg, Bernd; Westerhouse, Jan (1971). "口腔発話の研究". Journal of Speech and Hearing Research . 14 (3). American Speech Language Hearing Association: 652– 658. doi : 10.1044/jshr.1403.652 . ISSN 0022-4685 . PMID 5163900 . also published as Weinberg, B.; Westerhouse, J. (1972). "A Study of Buccal Speech". The Journal of the Acoustical Society of America . 51 (1A). Acoustical Society of America (ASA): 91. Bibcode :1972ASAJ...51Q..91W. doi :10.1121/1.1981697 . ISSN 0001-4966. ↑ McNeill D (2005). Gesture and Thought . University of Chicago Press. ISBN 978-0-226-51463-5 . 1 2 3 4 5 Harley, T.A. (2011), Psycholinguistics. (Volume 1). SAGE Publications. 1 2 Levelt, WJM (1989). Speaking: From Intention to Articulation . MIT Press. ISBN 978-0-262-62089-5 . ↑ Jescheniak, JD; Levelt, WJM (1994). "Word frequency effects in speech production: retrieval of syntactic information and of phonological form". Journal of Experimental Psychology: Learning, Memory, and Cognition . 20 (4): 824– 843. CiteSeerX 10.1.1.133.3919 . doi :10.1037/0278-7393.20.4.824. S2CID 26291682. 1 2 3 4 5 Levelt, W. (1999). "The neurocognition of language", p.87 -117. Oxford Press ↑ Indefrey, P; Levelt, WJ (2004). "The spatial and temporal signatures of word production components". Cognition . 92 (1– 2): 101– 44. doi :10.1016/j.cognition.2002.06.001. hdl :11858/00-001M-0000-0013-1C1F-E . PMID 15037128. S2CID 12662702. ↑ Booth, JR; Wood, L; Lu, D; Houk, JC; Bitan, T (2007). "The role of the basal ganglia and cerebellum in language processing". Brain Research . 1133 (1): 136– 44. doi :10.1016/j.brainres.2006.11.074. PMC 2424405 . PMID 17189619. 1 2 Ackermann, H (2008). "小脳の音声生成と音声知覚への寄与:心理言語学的および神経生物学的観点". Trends in Neurosciences . 31 (6): 265–72 . doi : 10.1016/j.tins.2008.02.011 . PMID 18471906 . S2CID 23476697 . ↑ Fromkin, Victoria; Bernstein, Nan (1998). Speech Production Processing Models . Harcourt Brace College. p. 327. ISBN 978-0155041066 。1 2 3 4 5 Fromkin, Victoria; Berstien Ratner, Nan (1998). Chapter 7 Speech Production . Harcourt Brace College. pp. 322–327 . ISBN 978-0155041066 。1 2 3 4 5 6フィールド、ジョン ( 2004)。 心理言語学 。ラウトレッジ。p. 284。ISBN 978-0415258906 。↑ Fromkin, Victoria; Berstein, Nan (1998). Speech Production Processing Models . Harcourt Brace College Publishers. p. 328. ISBN 978-0155041066 。↑フロムキン、ヴィクトリア ; バーンスタイン・ラトナー、ナン( 1998)。 第7章 発話生成 (第2 版)。フロリダ:ハーコート・ブレイス・カレッジ・パブリッシャーズ。pp. 328–337。ISBN 978-0155041066 。↑ フロムキン、ヴィクトリア(1971)。 『心理言語学における発話生成の発話生成器モデル』 (第2 版)。ハーコート・カレッジ・パブリッシャーズ。328 ページ 。ISBN 978-0155041066 。↑ Fromkin, Victoria (1998). 心理言語学における発話生成の発話生成器モデル (第2 版)。Harcourt。p. 330。 ↑ ギャレット(1975)。 心理言語学におけるギャレットモデル 。ハーコート・カレッジ。331 ページ 。ISBN 978-0155041066 。↑ バターワース (1982). 心理言語学 . ハーコート・カレッジ. p. 331. ↑ フロムキン、ヴィクトリア;バーンスタイン、ナン(1998)。 心理言語学におけるギャレットモデル 。ハーコート・カレッジ。331 ページ 。ISBN 978-0155041066 。↑ Garrett; Fromkin, VA; Ratner, NB (1998). The Garrett Model in Psycho-linguistics . Harcourt College. p. 331. ↑ Dell, GS (1997). Analysis of Sentence Production . Vol. 9. pp. 133–177 . doi : 10.1016/S0079-7421(08)60270-4 . ISBN 9780125433099 。1 2 Levelt, Willem JM (1999). "単語生成のモデル". Trends in Cognitive Sciences . 3 (6): 223– 232. doi : 10.1016/S1364-6613(99)01319-4 . PMID 10354575 . S2CID 7939521 . ↑ ケレン、ライス(2011)。 子音調音位置 。ジョン・ワイリー&サンズ社、 519~ 549頁 。ISBN 978-1-4443-3526-2 。1 2 3 ハリソン、アレン。E(2011)。 言語障害 :原因、治療、および社会的影響 。ニューヨーク:ノヴァ・サイエンス・パブリッシャーズ 。ISBN 9781608762132 。↑ フィールド、ジョン(2004)。心理言語学 : 主要概念 。ラウトレッジ。18-19 頁 。ISBN 978-0415258906 。↑レベッカ・ヒューズ、ベアトリス・シュチェペック ・ リード(2016)。 『スピーキングの指導と研究:第3版 』テイラー&フランシス。6ページ 以降。ISBN 978-1-317-43299-9 。1 2 Redford, MA (2015). 音声生成ハンドブック。チチェスター、ウェストサセックス州; マルデン、マサチューセッツ州 : John Wiley & Sons, Ltd、2015 年。 1 2 Shaffer, D., Wood, E., & Willoughby, T. (2005). 発達心理学 児童期と青年期。(第2版カナダ版). Nelson. ↑ Wolf, M. (2005). Proust and the Squid : The Story and Science of the Reading Brain , New York, NY. Harper.
さらに読む Gow DW (2012年6月) 「語彙知識の皮質組織:音声言語処理の二重語彙モデル」 Brain Lang . 121 ( 3): 273–88 . doi : 10.1016/j.bandl.2012.03.005 . PMC 3348354. PMID 22498237 . Hickok G (2012). "音声処理の皮質組織:フィードバック制御と予測符号化:デュアルストリームモデルの文脈" . J Commun Disord . 45 (6): 393– 402. doi : 10.1016/j.jcomdis.2012.06.004 . PMC 3468690 . PMID 22766458 . Hickok G、Houde J、Rong F (2011年2月) 「音声処理における感覚運動統合:計算基盤と神経組織」 Neuron 69 ( 3 ): 407–22 . doi : 10.1016/j.neuron.2011.01.019 . PMC 3057382 . PMID 21315253 . Hickok G、Poeppel D ( 2004) 。 「背側および腹側ストリーム:言語 の機能解剖学的側面 を理解するため の枠組み」。Cognition。92 ( 1–2 ) : 67–99。doi : 10.1016 / j.cognition.2003.10.011。PMID 15037127。S2CID 635860。 Poeppel D 、Emmorey K 、Hickok G、Pylkkänen L (2012 年10 月 )。「言語の新しい神経生物学に向けて」。J . Neurosci . 32 ( 41 ):14125–31。doi : 10.1523 / JNEUROSCI.3244-12.2012。PMC 3495005。PMID 23055482 。 Price CJ (2012年8月) 「聴覚音声、話し言葉、読解に関するPETおよびfMRI研究の最初の20年間のレビューと統合」 NeuroImage.62 ( 2 ) : 816–47.doi : 10.1016 / j.neuroimage.2012.04.062.PMC 3398395.PMID 22584224 . Stout D、Chaminade T(2012年1月)「 人類進化における石器、言語、脳」 Philos . Trans. R. Soc. Lond. B Biol. Sci . 367(1585 ): 75–87。doi :10.1098 / rstb.2011.0099。PMC 3223784。PMID 22106428 。 Kroeger BJ、Stille C、Blouw P、Bekolay T、Stewart TC(2020年11月)「音声生成における階層的シーケンスとフィードフォワードおよびフィードバック制御メカニズム:正常および障害のある音声をモデル化するための予備的アプローチ」Frontiers in Computational Neuroscience 14 :99 doi=10.3389/fncom.2020.573554