音声学は、主に音声の発音、音波特性、知覚を扱う言語学の一分野です。音声学の分野は、伝統的に調音音声学、音響音声学、聴覚音声学の3 つの下位分野に分けられます。発声のこれらの物理的特性の研究を専門とする言語学者は音声学者です。伝統的に、音声学の最小言語単位は音声、つまり個々の音声です。これは音韻論の最小言語単位である音素とは異なります。音素は音声の抽象的で言語固有の分類であり、意味に影響を与える最小単位として定義されます。[ 1 ]
言語の伝達様式とは、その言語の産出と知覚が行われる方法を指します。英語のように口語・聴覚様式を用いる言語は、発話は口(口)で行われ、知覚は聴覚(耳)で行われます。オーストラリア手話(Auslan)やアメリカ手話(ASL)のように手話・視覚様式を用いる言語は、手話は手(手)で行われ、知覚は視覚(目)で行われます。ASLやその他の手話には、盲ろう者が触覚手話を行うための手話方言も存在し、手話では手を使って手話が作られ、手を使って知覚されます。音声学も手話の同様の側面を扱い、触覚手話の研究も含まれます。
音声学の最初の研究は、紀元前6世紀にサンスクリット語の 文法学者によって行われたことが知られています。[ 2 ]ヒンドゥー教の学者パーニニは、これらの初期の研究者の中で最もよく知られている人物の一人です。紀元前350年頃に書かれた彼の4部構成の文法は、現代言語学に影響を与えており、現在でも「これまでに書かれたあらゆる言語の中で最も完全な生成文法」となっています。[ 3 ]彼の文法は現代言語学の基礎を形成し、有声性を含むいくつかの重要な音声原理を記述しました。この初期の記述では、共鳴は声帯が閉じているときは音色によって、声帯が開いているときは雑音によって生成されると説明されています。文法の音声原理は、理論分析の対象そのものではなく、理論分析の基礎となるものであるため、「原始的」であると考えられており、これらの原理は彼の音韻体系から推論することができます。[ 4 ]
サンスクリット語における音声学の研究はシクシャと呼ばれ、紀元前1千年紀のタイッティリーヤ・ウパニシャッドでは次のように定義されている。
オーム!シクシャについて説明します。音とアクセント、量(母音)と表現(子音)、バランス(サマン)とつながり(音)、シクシャの研究について。 || 1 |
Taittiriya Upanishad 1.2、Shikshavalli、Paul Deussen 訳[ 5 ]。
パーニニと同時代の人物以降の音声学の進歩は、ギリシャやローマの文法学者による限定的な調査を除いて、近代まで限られていた。インドの文法学者から近代音声学までの数千年の間に、パーニニの説明の原動力であった話し言葉と書き言葉の違いから焦点が移り、音声の物理的特性のみに焦点を当てるようになった。音声学への持続的な関心は西暦1800年頃に再び始まり、「音声学」という用語が現在の意味で初めて使用されたのは1841年である。[ 6 ] [ 2 ]医学の新たな発展と音声・映像記録装置の開発により、音声学の知見は新しくより詳細なデータを利用して検証できるようになった。近代音声学のこの初期の時期には、アレクサンダー・メルヴィル・ベルによる調音位置に基づく影響力のある音声アルファベットの開発が含まれる。可視音声として知られるこのアルファベットは、聴覚障害児の口頭教育のツールとして注目を集めた。[ 2 ]
音声録音機器が広く普及する以前は、音声学者は、音声学者間で転写や調査結果の一貫性を確保するために、実践音声学の伝統に大きく依存していました。この訓練には、音声の認識である聴覚訓練と、音声を生成する能力である産出訓練の両方が含まれていました。音声学者は、国際音声記号のさまざまな音を耳で認識することを学ぶことが期待されており、IPA は現在でも英語の音声パターンを正確に生成する能力について話者をテストし、認定しています (ただし、他の言語についてはこの慣行を中止しています)。[ 7 ]メルヴィル・ベルは、可視音声法の改訂として、高さと後舌性による母音の記述を開発し、9 つの基本母音を導き出しました。[ 8 ]音声学者は、実践音声学の訓練の一環として、フィールドワーク中にこれらの音声の認識と転写の基準とするために、これらの基本母音を生成することを学ぶことが期待されていました。[ 7 ]このアプローチは、1960年代にピーター・ラデフォゲッドによって批判された。彼は実験的証拠に基づいて、基本母音は発音の目標ではなく聴覚の目標であることを発見し、それらが音声学者が他の発音を判断するための発音の基準点であるという主張に異議を唱えた。[ 9 ]
言語生成は、非言語的なメッセージを音声または手話の言語信号に変換する、相互依存するいくつかのプロセスから成ります。言語学者は、言語生成のプロセスが一連の段階(逐次処理)で行われるのか、それとも生成プロセスが並行して行われるのかについて議論しています。言語的に符号化するメッセージを特定した後、話者は、語彙選択と呼ばれるプロセスで、そのメッセージを表す個々の単語(語彙項目として知られる)を選択する必要があります。単語は、言語学で意味情報と呼ばれる意味に基づいて選択されます。語彙選択は、単語の意味と文法情報の両方を含む単語の語幹を活性化します。[ 10 ] [ a ]
発話が計画された後、[ b ]音韻符号化が行われます。言語生成のこの段階では、単語の心的表象に、生成される音素のシーケンスとして音韻内容が割り当てられます。音素は、唇を閉じる、舌を特定の位置に置くなど、特定の目標を示す調音特徴に指定されます。これらの音素は、筋肉に送ることができる一連の筋肉コマンドに調整され、これらのコマンドが適切に実行されると、意図した音が生成されます。[ 12 ]したがって、メッセージから音への生成プロセスは、次のシーケンスとして要約できます。[ c ]
声道の完全または部分的な狭窄によって生じる音は子音と呼ばれます。子音は通常、口の中の声道で発音され、この狭窄の位置によって発音される音が変化します。舌の位置と発音される音には密接な関係があるため、調音位置は音声学の多くの分野において重要な概念となっています。
音は、狭窄の位置と狭窄を行う身体部位によって部分的に分類されます。たとえば、英語のfightingとthought は、構造を作る器官の違いだけで、構造を作る位置は異なる最小対語です。 fightingの「f」は、下唇を歯に押し当てて作られる唇歯音です。thoughtの「th」は、舌を歯に押し当てて作られる舌歯音です。唇による狭窄は唇音、舌による狭窄は舌音と呼ばれます。
舌による狭窄は声道のいくつかの部位で行われ、大きく分けて舌尖調音、舌背調音、舌根調音に分類されます。舌尖調音は舌の前部で、舌背調音は舌の後部で、舌根調音は咽頭で行われます。[ 13 ]これらの区分は、すべての音声を区別して記述するには十分ではありません。[ 13 ]例えば、英語では[s]と[ʃ]はどちらも舌尖調音ですが、口の異なる場所で発音されます。これを説明するには、狭窄が起こる口の領域に基づいて、より詳細な調音部位が必要です。[ 14 ]
唇を使った調音は、3つの異なる方法で行うことができます。両方の唇を使う(両唇音)、片方の唇と歯を使う(下唇が能動調音器官で上歯が受動調音器官となる)[ 15 ](唇歯音)、舌と上唇を使う(舌唇音)[ 16 ] 。使用する定義によっては、これらの調音の一部または全部が唇調音のクラスに分類される場合があります。両唇子音は両方の唇で作られます。これらの音を発音するとき、下唇が最も遠くまで動いて上唇に当たり、上唇もわずかに下がります[ 17 ]。ただし、場合によっては、開口部(唇の間の開口部)を通過する空気の力によって、唇が近づくよりも早く離れてしまうことがあります。[ 18 ]他のほとんどの調音とは異なり、両方の調音器官は軟組織でできているため、両唇破裂音は、歯や口蓋などの硬い表面が関わる調音よりも、不完全な閉鎖で生成される可能性が高くなります。両唇破裂音はまた、声道の上部の調音器官が能動的に下方に動き、上唇が能動的に下方に動くという点でも珍しいです。[ 19 ]舌唇子音は、舌の刃が上唇に近づくか接触することで作られます。両唇調音と同様に、上唇はより能動的な調音器官に向かってわずかに動きます。このグループの調音は、国際音声記号に独自の記号はなく、むしろ、歯茎カテゴリーに暗黙的に配置する発音記号と先端記号を組み合わせることによって形成されます。[ 20 ] [ 21 ]これらは、タンゴア語など、バヌアツ固有の多くの言語に存在します。
唇歯音は、下唇を上の歯に持ち上げることで作られます。唇歯音は摩擦音であることが最も多いですが、唇歯鼻音も類型的に一般的です。[ 22 ]真の唇歯破裂音が自然言語に存在するかどうかについては議論がありますが、 [ 23 ]ズールー語、[ 24 ]トンガ語、[ 25 ]およびシュビ語[ 23 ]など、唇歯破裂音を持つ言語が多数報告されています。
歯冠子音は舌の先端または舌背で作られ、舌の前部の敏捷性により、位置だけでなく舌の姿勢にも多様性があります。歯冠調音部位は、舌が接触または収縮する口の領域を表し、歯、歯槽、および後歯槽の位置が含まれます。舌の先端を使用した舌の姿勢は、舌の先端の上部を使用する場合は先端、舌背を使用する場合は舌板、舌の先端を後ろに丸めて舌の下部を使用する場合は亜先端になります。歯冠子音は、あらゆる調音方法が確認されているという点で、グループとして独特です。[ 20 ] [ 26 ]オーストラリアの言語は、この地域の言語内および言語間で多数の歯冠対立が見られることでよく知られています。[ 27 ]歯子音は、舌の先端または舌背と上の歯で作られます。舌のどの部分を使って発音するかによって、歯音は2つのグループに分けられます。歯尖子音は舌先を歯に当てて発音し、歯間子音は舌先を歯の前に突き出して舌の刃で発音します。これら両方を対照的に使う言語は知られていませんが、異音として存在する可能性はあります。歯茎子音は、歯のすぐ後ろの歯茎隆起で舌先または舌の刃を使って発音し、同様に歯尖子音または舌板子音に分類できます。[ 28 ]
言語横断的に、歯音と歯茎音は頻繁に対立し、言語横断的なパターンの多くの一般化につながっています。異なる調音位置は、それらを発音するために使用される舌の部分でも対立する傾向があります。歯音破裂音を持つほとんどの言語は舌板歯音を持ち、舌尖破裂音を持つ言語は通常舌尖破裂音を持ちます。言語では、舌板性の対立を持つ同じ位置の2つの子音を持つことはまれですが、Taa (ǃXóõ) はこのパターンの反例です。[ 29 ]言語に歯音破裂音または歯茎破裂音のどちらか一方しかない場合、歯音破裂音の場合は通常舌板破裂音であり、歯茎破裂音の場合は通常舌尖破裂音ですが、たとえばテムネ語とブルガリア語[ 30 ]はこのパターンに従いません。[ 31 ]ある言語に舌尖破裂音と舌端破裂音の両方がある場合、イソコ語のように舌端破裂音の方が破擦音化されやすいが、ダハロ語では歯茎破裂音の方が破擦音化されやすいという逆のパターンが見られる。[ 32 ]
そり舌子音には、舌の位置を重視するか、口蓋上の位置を重視するかによって、いくつかの異なる定義があります。一般的に、そり舌子音は、舌先がいくらか上方に丸まる一連の調音を表します。このように、そり舌調音は、歯茎、後歯茎、口蓋領域など、口蓋上のいくつかの異なる場所で発生する可能性があります。舌先の裏側が口蓋に接触する場合、それは亜尖部ですが、尖部後歯茎音もそり舌音として記述されます。[ 33 ]亜尖部そり舌破裂音の典型的な例は、ドラヴィダ語族によく見られ、米国南西部の先住民族の言語では、歯音と歯茎音の対立的差異は、歯茎音のわずかなそり舌化です。[ 34 ]音響的には、そり舌化は高次のフォルマントに影響を与える傾向があります。[ 34 ]
歯槽隆起のすぐ後ろで行われる調音は、後歯槽子音として知られており、さまざまな用語で呼ばれてきました。歯茎先端の後歯槽子音はしばしばそり舌音と呼ばれ、舌板調音は口蓋歯槽音と呼ばれることもあります。[ 35 ]オーストラリア英語の文献では、これらの舌板破裂音は、通常口蓋と表現される口蓋領域よりも前方で発音されるにもかかわらず、「口蓋」と表現されることがよくあります。[ 27 ]個々の解剖学的変異のため、口蓋歯槽破裂音(および一般的に歯茎音)の正確な調音は、言語共同体内で大きく異なる場合があります。[ 36 ]
背側子音は、舌先や舌翼ではなく舌本体を使って作られる子音で、通常は口蓋、軟口蓋、または口蓋垂で発音されます。口蓋子音は、口蓋の天井にある硬口蓋に舌本体を当てて作られます。これらは軟口蓋子音や口蓋垂子音とよく対立しますが、3つすべてを同時に対立させる言語はまれで、ジャカル語が3つ対立の可能性のある例です。[ 37 ]軟口蓋子音は、軟口蓋に舌本体を当てて作られます。これらは言語横断的に非常に一般的で、ほとんどすべての言語に軟口蓋破裂音があります。軟口蓋子音と母音はどちらも舌本体を使って作られるため、母音との調音結合の影響を強く受け、硬口蓋まで前方に、または口蓋垂まで後方に発音することができます。これらのバリエーションは通常、母音空間と並行して前部軟口蓋、中央軟口蓋、後部軟口蓋に分けられます。[ 38 ]口蓋子音と音声的に区別するのは難しい場合があるが、典型的な口蓋子音の領域のわずかに後ろで発音される。[ 39 ]口蓋垂子音は、舌の本体が口蓋垂に接触または接近することによって作られる。まれであり、推定で言語の 19 パーセントに存在し、アメリカ大陸とアフリカの広い地域には口蓋垂子音を持つ言語がない。口蓋垂子音を持つ言語では、破裂音が最も頻繁に、次に継続音(鼻音を含む) が続く。[ 40 ]
喉の狭窄によって作られる子音は咽頭音、喉頭の狭窄によって作られる子音は喉頭音です。喉頭は喉の奥深くにあるため舌が届かず、声帯を使って喉頭音を発音します。一方、咽頭音は口に近いため、舌の一部が届きます。
根部子音は、発音時に舌根または喉頭蓋を使用し、声道のかなり奥で発音されます。[ 41 ]咽頭子音は、舌根を咽頭の壁にほぼ触れるほど奥に引っ込めることで発音されます。発音の難しさから、摩擦音と接近音のみがこの方法で発音できます。[ 42 ] [ 43 ]喉頭蓋子音は、喉頭蓋と咽頭の後壁で発音されます。喉頭蓋破裂音はダハロ語で記録されています。[ 43 ]声門と喉頭蓋の間の空洞が小さすぎて有声化できないため、有声喉頭蓋子音は不可能と考えられています。[ 44 ]
声門子音は、喉頭の声帯を使って発音される子音です。声帯は発声の源であり、口腔鼻腔声道の下にあるため、有声声門閉鎖音など、多くの声門子音は発音できません。声門子音は、無声声門閉鎖音と2つの声門摩擦音の3つが可能であり、すべて自然言語で確認されています。[ 20 ]声帯を閉じることによって発音される声門閉鎖音は、世界の言語で非常に一般的です。[ 44 ]多くの言語では句の境界を区切るために声門閉鎖音を使用しますが、アラビア語やワトラ・マサテク語のような言語では、声門閉鎖音は対照的な音素として使用されます。さらに、この言語では、声門閉鎖音は後続の母音の喉頭化として実現されることがあります。 [ 45 ]声門閉鎖音、特に母音間の声門閉鎖音は、通常、完全な閉鎖を形成しません。真の声門閉鎖音は、通常、重子音の場合にのみ発生します。[ 46 ]

喉頭は、一般的に「声帯」として知られており、気管にある軟骨構造で、発声に関与しています。声帯は、振動するように閉じたり、振動しないように開いたりします。声帯の位置は、披裂軟骨の動きによって決まります。[ 47 ]喉頭内筋は、披裂軟骨を動かすとともに、声帯の張力を調節する役割を担っています。[ 48 ]声帯が十分に閉じていないか、張力が足りない場合、声帯は断続的に振動するか、全く振動しません。断続的に振動すると、その程度に応じて、きしむような声や息漏れのある声になります。全く振動しない場合は、無声になります。
声帯を正しく配置することに加えて、声帯を横切る空気の流れがなければ、声帯は振動しません。発声に必要な声門を挟んだ圧力差は、1~2 cm H 2 O (98.0665~196.133 パスカル) と推定されています。[ 49 ]声門上部の圧力の上昇 (声門上圧) または声門下部の圧力の低下 (声門下圧) により、圧力差は発声に必要なレベルを下回ることがあります。声門下圧は呼吸筋によって維持されます。収縮や調音がない場合、声門上圧は大気圧とほぼ等しくなります。しかし、調音、特に子音は気流の収縮を表すため、これらの収縮の後ろの腔内の圧力が上昇し、声門上圧が高くなります。[ 50 ]
語彙アクセスモデルによれば、認知の2つの異なる段階が用いられるため、この概念は語彙アクセスの2段階理論として知られている。第1段階である語彙選択は、機能レベルの表現を構築するために必要な語彙項目に関する情報を提供する。これらの項目は、特定の意味的および統語的特性に従って検索されるが、この段階では音韻形式はまだ利用できない。第2段階である語形の検索は、位置レベルの表現を構築するために必要な情報を提供する。[ 51 ]
発話時には、調音器官が空間内の特定の位置を移動して接触し、音響信号に変化が生じます。発話生成のモデルの中には、これを基本として、身体内部(内在的)または外部(外在的)の座標系で調音をモデル化するものがあります。内在的座標系では、調音器官の動きを身体内の関節の位置と角度としてモデル化します。顎の内在的座標モデルでは、並進と回転を表す2~3自由度を使用することがよくあります。これらのモデルは、顎や腕の関節とは異なり、象の鼻のような筋肉質の静水圧構造である舌をモデル化する際に問題に直面します。[ 52 ]生理学的構造が異なるため、発話や咀嚼中の顎の動きの経路は比較的直線ですが、舌の動きは曲線を描きます。[ 53 ]
直線運動は、発話が内在空間ではなく外在空間で計画されたと主張するために使用されてきたが、外在座標系には物理座標空間だけでなく音響座標空間も含まれる。[ 52 ]運動が外在空間で計画されると仮定するモデルは、観測された経路または音響信号を生成する筋肉と関節の位置を説明するという逆問題に直面する。たとえば、腕には 7 自由度と 22 個の筋肉があるため、複数の異なる関節と筋肉の構成が同じ最終位置につながる可能性がある。外在音響空間での計画モデルの場合も同様に 1 対 多のマッピング問題が適用され、物理的または音響的目標から、それを達成するために必要な筋肉の動きへの一意のマッピングは存在しない。しかし、逆問題に関する懸念は誇張されている可能性がある。なぜなら、発話は、その目的のために進化した神経構造を使用する高度に学習されたスキルだからである。[ 54 ]
平衡点モデルは、運動目標を関節に作用する筋肉ペアの位置として表現することで、逆問題の解決策を提案しています。[ d ]重要なのは、筋肉がバネとしてモデル化され、目標がモデル化されたバネ-質量系の平衡点であるということです。バネを使用することで、平衡点モデルは、運動が中断されたときの補償と応答を容易に説明できます。これらの筋肉の位置は、空間内の点、つまり筋肉のバネのような作用が収束する平衡点として表現されると仮定しているため、座標モデルとみなされます。[ 55 ] [ 56 ]
発話生成に対するジェスチャー的アプローチでは、発音は特定の座標ではなく、動きのパターンとして表現されると提案されています。最小単位はジェスチャーであり、「特定の発話関連目標(例えば、両唇閉鎖)を参照して能動的に制御される、機能的に同等の発音運動パターン」のグループを表します。[ 57 ]これらのグループは、動きを個々の筋肉の動きではなく、単一のユニットとして一緒に働くタスク依存の筋肉のグループとして捉える協調構造または「シナジー」を表します。[ 58 ] [ 59 ]これにより、発音計画の自由度が減少します。これは、抽象的な表現に特定の動きを符号化するのではなく、発話目標を達成するあらゆる動きを許容する内在座標モデルにおいて特に問題となります。発音の共起はジェスチャーモデルによってよく説明され、速い発話速度での発音は、遅い発話速度での独立したジェスチャーの複合体として説明できます。[ 60 ]

音声は、気流の変形によって音波が生じることで生成されます。この変形は調音器官によって行われ、調音の位置や方法によって音響結果が異なります。舌の位置だけでなく声道の姿勢も音に影響を与える可能性があるため、調音方法は音声を説明する上で重要です。英語の単語tackとsack はどちらも歯茎音で始まりますが、舌が歯茎隆起からどれだけ離れているかが異なります。この違いは気流に大きな影響を与え、結果として生成される音にも影響します。同様に、気流の方向と発生源も音に影響を与える可能性があります。最も一般的な気流生成メカニズムは肺気流(肺を使う)ですが、声門や舌も気流を生成するために使用できます。
音声の大きな違いの一つは、有声か無声かという点です。発声時に声帯が振動し始めると、その音は有声になります。多くの音は発声の有無にかかわらず生成できますが、身体的な制約により、一部の発音では発声が困難または不可能になる場合があります。発音が有声の場合、主な音源は声帯の周期的な振動です。無声破裂音のような発音には音源がなく、無音であることで認識されますが、摩擦音のような他の無声音は、発声の有無に関わらず独自の音源を生成します。
発声は喉頭の筋肉によって制御され、言語は二元的な有声性よりも多くの音響的詳細を利用します。発声中、声帯は一定の速度で振動します。この振動によって、基本周波数とその倍音からなる周期的な音響波形が生じます。音響波の基本周波数は喉頭の筋肉を調整することで制御でき、聞き手はこの基本周波数を音高として知覚します。言語は音高操作を用いて、声調言語では語彙情報を伝え、多くの言語では音高を用いて韻律情報や語用論的情報を表現します。
声帯が振動するためには、声帯が適切な位置にあり、声門に空気が流れている必要があります。[ 49 ]発声の種類は、完全に開いている(無声)状態から完全に閉じている(声門閉鎖音)状態までの連続的な声門の状態に基づいてモデル化されています。振動に最適な位置、そして会話で最もよく使われる発声の種類であるモード音声は、これら2つの極端な状態の中間にあります。声門がわずかに広いと、息漏れ声になり、声帯を近づけると、きしむような声になります。[ 61 ]
通常の会話で使用される通常の音声パターンは、声帯が適度な張力で閉じられたモード音声です。声帯は単一のユニットとして周期的に効率的に振動し、声門は完全に閉じられ、気息はありません。[ 62 ]声帯がさらに離れると振動しなくなり、無声音になります。声帯がしっかりと閉じられると、声門閉鎖音になります。[ 61 ]
声帯を通常の発声時よりもわずかに離して保持すると、息漏れ声(またはつぶやき声)やささやき声などの発声タイプが生成されます。声帯靭帯(声帯)にかかる張力は通常の発声時よりも小さく、空気がより自由に流れることができます。息漏れ声とささやき声は、息漏れ声のより周期的な波形からささやき声のよりノイズの多い波形へと大まかに特徴づけられる連続体上に存在します。音響的には、どちらも第1フォルマントを減衰させる傾向があり、ささやき声の方がより極端な偏差を示します。[ 63 ]
声帯をより強く閉じると、きしむような声になる。声帯にかかる張力は通常の声よりも小さいが、声帯は強く閉じられているため、声帯の靭帯だけが振動する。[ e ]パルスは非常に不規則で、ピッチと周波数振幅は低い。[ 64 ]
一部の言語では、一部の子音[ f ]の有声/無声の区別を維持しませんが、すべての言語はある程度有声/無声を使用します。たとえば、既知のすべての母音が標準的に有声である母音の音素的な有声/無声の対立を持つ言語は知られていません。[ g ]息漏れ声やきしみ声などの声門の他の位置は、ハラパ・マサテク語などの多くの言語で音素を対立させるために使用されますが、英語などの他の言語では異音として存在します。
音声セグメントが有声か無声かを判断する方法はいくつかありますが、最も簡単な方法は、発話中に喉頭を触って振動を感じるタイミングをメモすることです。より正確な測定は、スペクトログラムまたはスペクトルスライスの音響分析によって得られます。スペクトログラム分析では、有声セグメントは、有声セグメントの低周波数に、音響エネルギーの高い領域である有声バーを示します。[ 65 ]スペクトルスプライスを調べると、発音された母音のモデルがある時点の音響スペクトルで口のフィルタリングを反転させ、声門のスペクトルを生成します。次に、フィルタリングされていない声門信号の計算モデルを逆フィルタリングされた音響信号に適合させて、声門の特性を決定します。[ 66 ]超音波や内視鏡などの特殊な医療機器を使用して視覚分析も利用できます。[ 65 ] [ h ]
母音は、発音される口の部位によって大まかに分類されますが、声道の狭窄を伴わずに発音されるため、その正確な記述は舌の位置の音響的相関を測定することに依存します。母音の発音時の舌の位置によって、声道が共鳴する周波数が変化し、これらの共鳴(フォルマントと呼ばれる)が測定され、母音の特徴付けに用いられます。
母音の高さは、伝統的に発音時の舌の最高点を指します。[ 67 ]高さのパラメータは、高(狭母音)、中狭母音、中開母音、低(開母音)の 4 つの主要なレベルに分けられます。高さが中間の母音は中母音と呼ばれます。わずかに開いた狭母音とわずかに閉じた開母音は、それぞれ近狭母音と近開母音と呼ばれます。最も低い母音は、舌を下げるだけでなく、顎を下げることによっても発音されます。[ 68 ]
IPAでは母音の高さに7つのレベルがあることが示唆されているが、特定の言語で7つのレベルすべてを最小限に区別できる可能性は低い。チョムスキーとハレは3つのレベルしかないと示唆しているが[ 69 ] 、デンマーク語を説明するには4つの母音の高さのレベルが必要であり、言語によっては5つ必要になる可能性もある[ 70 ] 。
母音の後舌性は、前舌、中舌、後舌の 3 つのレベルに分けられます。言語は通常、母音の後舌性のレベルを 2 つ以上区別することはありません。3 つの後舌性の区別があると主張されている言語には、ニンボラン語とノルウェー語があります。[ 71 ]
ほとんどの言語では、母音の発音時の唇は、丸められるか丸められない(広がる)かに分類できますが、圧縮や突出などの他のタイプの唇の位置も説明されています。唇の位置は高さと後舌性と相関関係があり、前舌母音と低母音は丸められない傾向があり、後舌母音と高母音は通常丸められます。[ 72 ] IPAチャート上の対になった母音は、左に広がる母音、右に丸められた母音があります。[ 73 ]
上述の普遍的な母音の特徴に加えて、一部の言語には鼻音性、長さ、無声音やきしみ音などの異なるタイプの発声といった追加の特徴があります。特定の母音を記述するために、 R音性、舌根の前方移動、咽頭化、摩擦音、摩擦音などのより特殊な舌の動きが必要になる場合もあります。[ 74 ]
子音を完全に説明するには、調音位置を知るだけでは不十分であり、狭窄の仕方も同様に重要である。調音様式は、能動的な調音器官が声道をどのように変化させ、狭め、または閉じるかを正確に説明する。[ 75 ]
破裂音(破裂音とも呼ばれる)は、気流が完全に遮断される子音です。狭窄中は口の中に圧力が蓄積され、調音器官が離れると小さな音の爆発として解放されます。軟口蓋が持ち上げられ、空気が鼻腔を通らないようになっています。軟口蓋が下がり、空気が鼻腔を通れるようになると、鼻音破裂音になります。ただし、音声学者はほとんどの場合、鼻音破裂音を単に「鼻音」と呼びます。[ 75 ]破擦音は、同じ場所に摩擦音が続く一連の破裂音です。[ 76 ]
摩擦音は、声道の一部を部分的に、しかし完全にではない方法で塞ぐことによって気流が乱れる子音です。[ 75 ]歯擦音は、乱れた気流が歯に向かって向けられる特殊なタイプの摩擦音で、[ 77 ]高いシューという音を生じさせます。[ 78 ]
鼻音(鼻音閉鎖音とも呼ばれる)は、口腔が閉鎖され、軟口蓋が下がり、空気が鼻を通って流れる子音である。[ 79 ]
近似発音では、調音器官は接近するが、乱流気流を生じさせるほど接近することはない。[ 78 ]
側面音は、声道の中心に沿って気流が妨げられ、片側または両側で気流が自由に流れる子音です。[ 78 ]また、側面音は、舌が収縮して、舌の中心よりも側面の気流が大きくなる子音としても定義されています。[ 80 ]最初の定義では、舌の上を空気が流れることは考慮されていません。
震え音は、気流によって舌や唇が動く子音です。[ 81 ]狭窄は、気流によって軟調音器官の開閉が繰り返されるパターンを引き起こすように形成されます。[ 82 ]先端震え音は通常、2つまたは3つの振動周期から構成されます。[ 83 ]
タップとフラップは、舌を口蓋に叩きつける、通常は先端部で行われる、非常に素早い停止に似た、単発で素早い動作です。 [ 81 ]これらの用語は時々互換的に使用されますが、一部の音声学者は区別しています。[ 84 ]タップでは、舌は一回の動作で口蓋に接触しますが、フラップでは、舌は口蓋に接線方向に動き、通過する際に口蓋に当たります。
声門気流機構では、声門が閉じられ、空気の塊が閉じ込められます。これにより、声道内の残りの空気を別々に移動させることができます。閉じられた声門が上方に動くと、この空気が押し出され、放出子音になります。あるいは、声門が下がり、より多くの空気が口の中に吸い込まれると、内破子音になります。[ 85 ]
クリック音は、舌の動きによって口の中に空気が吸い込まれる閉鎖音であり、これは軟口蓋気流と呼ばれます。[ 86 ]クリック音の間、2 つの調音閉鎖の間で空気が希薄になり、前方の閉鎖が解放されると大きな「クリック」音が発生します。前方の閉鎖の解放はクリック流入と呼ばれます。軟口蓋または口蓋垂の後部閉鎖の解放はクリック流出と呼ばれます。クリック音は、コイサン語やバントゥー語など、いくつかのアフリカの言語族で使用されています。[ 87 ]
発話のほぼすべては肺によって行われ、肺音の圧力を生み出すことが音声学における肺の重要性です。言語全体で最も一般的な音の種類は肺呼気で、これは肺から空気が吐き出される音です。[ 88 ]反対の音も可能ですが、肺吸気音を音素として持つ言語は知られていません。[ 89 ]スウェーデン語など多くの言語では、遺伝的にも地理的にも多様な言語の肯定など、パラ言語的発音に肺吸気音を使用しています。 [ 90 ]呼気音と吸気音の両方は、声帯を特定の姿勢に保ち、肺を使って声帯に空気を送り込み、声帯が振動するか(有声)、振動しないか(無声)を左右します。[ 88 ]肺発音は、特定の呼吸サイクルで吐き出すことができる空気の量、つまり肺活量によって制限されます。
肺は、発声の生成と調整のために、2 種類の圧力を同時に維持するために使用されます。発声を生成するには、肺は声門上の圧力よりも 3~5 cm H 2 O 高い圧力を維持しなければなりません。しかし、アクセントなどの超分節的特徴に合わせて発話を調整するために、声門下圧に小さく素早い調整が行われます。これらの調整を行うために、多くの胸部筋が使用されます。肺と胸郭は吸気中に伸びるため、肺の弾性力だけで、肺活量の 50 パーセントを超える肺容量で発声に十分な圧力差を生み出すことができます。[ 91 ]肺活量の 50 パーセントを超えると、呼吸筋は胸郭の弾性力を「抑制」して安定した圧力差を維持するために使用されます。その容量を下回ると、呼吸筋は空気を積極的に吐き出すことによって声門下圧を上げるために使用されます。
発話中は、言語的および生物学的ニーズの両方に対応するために呼吸サイクルが調整されます。通常、安静時には呼吸サイクルの約60%を占める呼気は、発話時には呼吸サイクルの約90%に増加します。代謝ニーズは比較的安定しているため、ほとんどの場合、発話時に移動する空気の総量は、静かな潮汐呼吸とほぼ同じままです。[ 92 ]発話強度が18dB (大きな会話)増加しても、移動する空気の量への影響は比較的小さいです。子供の呼吸器系は大人ほど発達していないため、大人に比べて肺活量のより大きな割合を使用し、より深く息を吸い込む傾向があります。[ 93 ]
音声のソース・フィルタモデルは、声道姿勢と音響的結果との関連性を説明する音声生成理論です。このモデルでは、声道は音響フィルタに結合されたノイズ源としてモデル化できます。[ 94 ]多くの場合、ノイズ源は発声過程における喉頭ですが、他のノイズ源も同様にモデル化できます。声門上声道の形状がフィルタとして機能し、調音器官の異なる構成によって異なる音響パターンが生じます。これらの変化は予測可能です。声道は、直径が異なる一端が閉じた一連の管としてモデル化でき、音響共鳴の式を使用することで、調音姿勢の音響効果を導き出すことができます。[ 95 ]逆フィルタリングのプロセスは、この原理を使用して、発声中に声帯によって生成されるソーススペクトルを分析します。予測フィルターの逆数を取ることで、声門上声道の音響効果を打ち消し、声帯によって生成される音響スペクトルを得ることができます。[ 96 ]これにより、さまざまな発声タイプの定量的研究が可能になります。
言語知覚とは、言語信号が聞き手によって解読され理解される過程である。[ i ]音声を知覚するためには、連続的な音響信号を音素、形態素、単語などの離散的な言語単位に変換する必要がある。[ 97 ]音を正しく識別し分類するために、聞き手は言語カテゴリーを確実に区別できる信号の特定の側面を優先する。[ 98 ]特定の手がかりが他の手がかりよりも優先される一方で、信号の多くの側面が知覚に寄与する可能性がある。たとえば、口語言語は音響情報を優先するが、マクガーク効果は、音響手がかりが信頼できない場合に、視覚情報が曖昧な情報を区別するために使用されることを示している。[ 99 ]
聞き手はさまざまな情報を使って音声信号をセグメント化できますが、音響信号とカテゴリ知覚の関係は完全な対応関係ではありません。調音結合、騒がしい環境、個人差などにより、カテゴリ内には音響的な変動が大きく存在します。[ 100 ]知覚的不変性の問題として知られるように、聞き手は音響的な具現化の変動にもかかわらず、カテゴリを確実に知覚することができます。[ 101 ]そのため、聞き手は新しい話者に素早く適応し、会話相手が行っている音響的な区別に合わせてカテゴリ間の境界を移動させます。[ 102 ]
聴覚、つまり音を聞くプロセスは、音声認識の最初の段階です。発声器官は空気圧に系統的な変化をもたらし、それが音波として聞き手の耳に伝わります。音波はその後、聞き手の鼓膜に当たり、鼓膜を振動させます。鼓膜の振動は、中耳の3つの小さな骨である耳小骨によって蝸牛に伝達されます。[ 103 ]蝸牛は、基底膜を含むコルチ器によって縦方向に分割された、液体で満たされた螺旋状の管です。基底膜は蝸牛を通過するにつれて厚みを増し、異なる周波数が異なる場所で共鳴します。この音調局在設計により、耳はフーリエ変換と同様の方法で音を分析することができます。[ 104 ]
基底膜の差動振動により、コルチ器内の有毛細胞が動きます。これにより有毛細胞が脱分極し、最終的に音響信号が神経信号に変換されます。 [ 105 ]有毛細胞自体は活動電位を生成しませんが、聴神経線維とのシナプスで神経伝達物質を放出し、これが活動電位を生成します。このようにして、基底膜上の振動パターンは、音に関する情報を脳幹に伝える発火の時空間パターンに変換されます。[ 106 ]
音声学は、子音と母音に加えて、音節や句などのより大きな音声単位ではなく、セグメントに局在しない音声の特性も記述します。プロソディーには、ピッチ、発話速度、持続時間、音量などの聴覚特性が含まれます。言語は、これらの特性をさまざまな程度で使用して、アクセント、ピッチアクセント、イントネーションを実現します。たとえば、英語とスペイン語のアクセントはピッチと持続時間の変化と相関していますが、ウェールズ語のアクセントは持続時間よりもピッチとより一貫して相関しており、タイ語のアクセントは持続時間のみと相関しています。[ 107 ]
運動理論などの初期の音声知覚理論は、音声知覚と音声生成が密接に関連していると主張することで、知覚不変性の問題を解決しようと試みた。最も強い形では、運動理論は、音声知覚には聞き手が音の調音表現にアクセスする必要があると主張している。 [ 108 ]音を適切に分類するために、聞き手はその音を生成する調音を逆算し、これらの動作を識別することで、意図された言語カテゴリーを取得できる。[ 109 ]マクガーク効果や神経損傷患者の症例研究などの発見は運動理論を支持しているが、さらなる実験は強い形の運動理論を支持しておらず、生成と知覚の間に非決定論的な関係があると主張する弱い形の運動理論を支持するものがある。[ 109 ] [ 110 ] [ 111 ]
音声知覚の後継理論は、音のカテゴリーに対する音響的手がかりに焦点を当てており、抽象主義理論とエピソード理論の 2 つの大きなカテゴリーに分類できます。[ 112 ]抽象主義理論では、音声知覚は、必要な構成要素に縮小された信号に基づいて理想化された語彙対象を識別し、話者の変動に対抗するために信号を正規化することを含みます。例モデルなどのエピソード理論は、音声知覚は以前に聞いたトークンの詳細な記憶 (つまり、エピソード記憶) にアクセスすることを含むと主張します。知覚的不変性の問題は、エピソード理論では馴染みの問題として説明されます。正規化は、抽象主義理論が主張するような離散的なプロセスではなく、より変動する分布にさらされることの副産物です。[ 112 ]
音響音声学は、音声の音響特性を扱います。音の感覚は、鼓膜を動かす圧力変動によって生じます。耳はこの動きを神経信号に変換し、脳がそれを音として認識します。音響波形は、これらの圧力変動を測定した記録です。[ 113 ]
調音音声学は、音声がどのように作られるかを扱う学問である。
聴覚音声学は、人間が音声をどのように知覚するかを研究する学問である。聴覚系の解剖学的特徴が音声信号を歪めるため、人間は音声を完全な音響記録として経験するわけではない。例えば、デシベル(dB)で測定される音量の聴覚印象は、音圧の差と線形的に一致するわけではない。[ 114 ]
音響分析と聞き手が聞く音との不一致は、特定の摩擦音のように高周波エネルギーを多く含む音声で特に顕著です。この不一致を解消するために、聴覚系の機能モデルが開発されました。[ 115 ]
人間の言語はさまざまな音を使用するため、それらを比較するには、言語学者は言語に依存しない方法で音を記述できなければなりません。音声はさまざまな方法で記述できます。最も一般的なのは、音声を発音するために必要な口の動きによって音声が呼ばれることです。子音と母音は、音声学者が音声の動きによって定義する2つの大まかなカテゴリです。より細かい記述子としては、調音位置などのパラメータがあります。調音位置、調音方法、有声性は子音を記述するために使用され、国際音声記号の子音表の主な区分です。母音は、高さ、後舌性、円唇性によって記述されます。手話は、位置、動き、手の形、手のひらの向き、非手動の特徴など、似ているが独特な一連のパラメータを使用して記述されます。調音記述に加えて、口語で使用される音は、その音響を使用して記述することもできます。音響特性は発音の結果であるため、どちらの記述方法も音を区別するのに十分であり、どちらの方法を選択するかは調査対象の音声的特徴によって決まる。
子音は、声道の完全または部分的な閉鎖によって発音される音声です。これらは一般的に、肺から吐き出された気流の変形によって生成されます。気流の生成と変形に使用される呼吸器官は、声道(喉頭上)、喉頭、声門下系の 3 つの領域に分けられます。気流は、呼気(声道から出る)または吸気(声道に入る)のいずれかです。肺音では、気流は声門下系で肺によって生成され、喉頭と声道を通過します。声門音は、肺からの気流を伴わずに喉頭の動きによって生成された気流を使用します。クリック音は、舌による空気の希薄化と、それに続く舌の前方閉鎖の解放によって発音されます。
母音は、声道に何の障害もなく発音される音節の音声です。[ 116 ]通常、明確な調音位置を持つ子音とは異なり、母音は基本母音と呼ばれる基準母音のセットとの関係で定義されます。母音を定義するには、舌の高さ、舌の奥、唇の丸みという 3 つの特性が必要です。安定した音質で調音される母音は単母音と呼ばれ、同じ音節内の 2 つの別々の母音の組み合わせは二重母音です。[ 117 ] IPAでは、母音は人間の口を表す台形上に表されます。垂直軸は床から天井までの口を表し、水平軸は前後方向を表します。[ 118 ]
音声転写は、言語(口語か手話かを問わず)で発生する音素を転写するためのシステムです。最も広く知られている音声転写システムである国際音声記号(IPA)は、口語音のための標準化された記号セットを提供します。[ 119 ] [ 120 ] IPAの標準化された性質により、ユーザーはさまざまな言語、方言、個人語の音素を正確かつ一貫して転写することができます。[ 119 ] [ 121 ] [ 122 ] IPAは、音声学の研究だけでなく、言語教育、プロの演技、言語病理学にも役立つツールです。[ 121 ]
手話には標準化された表記体系はありませんが、言語学者は手の形、位置、動きを記述する独自の表記体系を開発してきました。ハンブルク表記体系(HamNoSys)は、詳細レベルを様々に調整できる点でIPAに似ています。KOMVAやStokoeシステムなどの表記体系は辞書での使用を目的として設計されており、手の形を表すのに現地語のアルファベット文字を使用するのに対し、HamNoSysは手の形を直接表します。SignWritingは手話の習得しやすい表記体系を目指していますが、まだどのろう者コミュニティにも正式に採用されていません。[ 123 ]
音声言語とは異なり、手話では耳ではなく目で単語を認識します。手話は手、上半身、頭を使って表現されます。主な表現器官は手と腕です。腕の相対的な部位は、近位と遠位という用語で表されます。近位とは胴体に近い部分を指し、遠位とは胴体から遠い部分を指します。例えば、手首の動きは肘の動きに比べて遠位です。遠位の動きはエネルギー消費が少ないため、一般的に容易に表現できます。筋肉の柔軟性やタブーとみなされるなどのさまざまな要因によって、手話として認識できるものが制限されます。[ 124 ]手話のネイティブスピーカーは会話相手の手を見ません。代わりに、視線は顔に固定されます。周辺視野は視野の中心ほど焦点が合っていないため、顔の近くで表現される手話では、指の動きや位置の微妙な違いをより正確に認識できます。[ 125 ]
音声言語とは異なり、手話には2つの同一の調音器官、つまり手があります。手話話者は、コミュニケーションを妨げることなく、どちらの手を使っても構いません。普遍的な神経学的制約のため、両手手話では一般的に両手で同じ種類の調音を行います。これは対称性条件と呼ばれます。[ 124 ] 2つ目の普遍的な制約は優位性条件で、2つの手の形が関係する場合、一方の手は静止したままで、優位な動く手に比べて手の形のセットが限られるというものです。[ 126 ]さらに、非公式な会話では両手手話の一方の手が省略されることがよくあります。これは弱省略と呼ばれます。[ 124 ]音声言語の単語と同様に、調音結合によって手話の形が互いに影響し合うことがあります。例としては、隣接する手話の手の形が互いに似てくること(同化)や弱省略(省略の一例)などがあります。[ 127 ]