音声分析は、音声認識など、言語内容以外の目的で音声を研究するものである。このような研究には主に音声の医学的分析 (音声医学)が含まれるが、話者識別も含まれる。[1]さらに議論を呼んでいるのは、音声ストレス分析や階層化音声分析を使用することで話者の 誠実さや感情状態を判断できると考える人もいることである。
分析方法
音声分析を必要とする音声の問題は、ほとんどの場合、声帯またはそれを制御する喉頭筋に起因します。声帯は、振動サイクルごとに衝突力を受け、声帯間の小さな隙間から押し出される空気によって乾燥し、喉頭筋は発声または歌唱中に激しく活動し、疲労しやすいためです。しかし、声帯とその動きの動的分析は物理的に困難です。声帯の位置により、動きを直接的かつ侵襲的に測定することは事実上不可能です。X線や超音波などの侵襲性の低い画像診断法は、声帯が軟骨に囲まれていて画質が歪むため機能しません。声帯の動きは速く、基本周波数は通常 80 ~ 300 Hzであるため、通常のビデオは使用できません。ストロボスコープや高速度ビデオを利用できますが、声帯を見るには、カメラにつながる光ファイバー プローブを喉に配置する必要があり、発声が困難になります。さらに、咽頭に物体を置くと、通常は嘔吐反射が誘発され、発声が止まり喉頭が閉じます。また、ストロボ画像は、声帯の振動パターンが厳密に周期的である場合にのみ有効です。
最も重要な間接的方法は、現在、マイクロフォンまたは口腔気流記録の逆フィルタリングと電気声門記録法(EGG) です。[要出典]逆フィルタリングでは、発話音 (マイクロフォンから得られる放射音圧波形) または円周ベント (CV) マスクからの口腔気流波形が口の外で記録され、その後、数学的手法でフィルタリングされて声道の影響が除去されます。この方法は、出力を記録し、計算モデルを使用して声道の影響を逆転させることで、発声の声門入力を推定します。声帯の動きを非侵襲的に間接的に示すもう 1 つの方法は電気声門記録法で、被験者の喉の両側の声帯の高さに配置された電極が、声帯が互いに接触している部分の大きさに応じて喉の伝導性の変化を記録します。これにより、接触面積の 1 次元情報が得られます。逆フィルタリングも EGG も、声帯の動きの複雑な 3 次元パターンを完全に説明するには不十分ですが、その動きの有用な間接的な証拠を提供することはできます。
音声分析を行う別の方法は、声の特徴を見ることです。声の特徴には、発声、ピッチ、音量、速度などがあります。これらの特徴は人の声を評価するために使用でき、音声分析プロセスに役立ちます。発声は通常、長母音を含む単語、多くの音素を含む単語、または単なる典型的な会話など、人から収集されたさまざまな種類のデータを見ることによってテストされます。人のピッチは、その人にできる限り高い音と低い音、およびその間の音を発させることで評価できます。キーボードを使用してこのプロセスを支援できます。音量が重要であるのは、特定の人にとって音量が特定の音の発声方法に影響を与えるためです。一部の人々は、特定の音素を発音するために、他の人と比較して大きな声で話す必要があります。[要出典]これは、音階を歌うときに同じ音量を使用するように人に依頼することでテストできます。速度も、人がどれだけ速くまたは遅く話すかを見るため重要です。
[2]
医療での使用
声の医学的研究には、例えば、手術で声帯からポリープを取り除いた患者の声の分析などがあります。コンピューター化された方法を使用すると、このような問題を客観的に評価できます。 [3]経験豊富な音声セラピストは、かなり確実に声を評価できますが、これには広範なトレーニングが必要であり、依然として主観的です。
医療音声分析におけるもう一つの活発な研究テーマは、音声負荷評価です。長時間話す人の声帯は疲労します。つまり、話すプロセスによって声帯に負荷がかかり、組織が疲れます。プロの音声使用者(教師、営業マンなど)の場合、この疲労により発声障害や病欠が生じることがあります。音声分析は、このような問題を客観的に評価する手段として研究されてきました。[4]
声帯麻痺の研究において、音声分析は重要な要素でした。音声分析は発話から呼吸まで声帯のさまざまな機能に影響を及ぼし、甲状腺形成術(内側化甲状腺形成術)による術後声帯の改善の有効性を研究するために音声分析が使用されます。手術前には、選択された患者の声を録音して術後の使用状況と比較する従来の音声録音に加えて、電気声門造影法、写真声門造影法[5]、ビデオキモグラフィーを使用したより複雑な録音が使用されます。医療専門家は複雑な録音の結果を読んで理解することができますが、正確な結果を得るには、これらの実験には音声専門家の知識が必要です。音声の専門家は、訓練された耳を持っているため、手術の成功を確実にするために声帯の物理的検査と神経学的検査を結び付ける上で重要な役割を果たしました。音声の知覚的評価は声質に大きく依存しており、音声の専門家(言語聴覚士)が評価することが望ましい要素です。プロの音声分析者は訓練された耳を持っており、結果から誤解を招く可能性のある余分な変異をブロックすることができます。[6]
法医学での使用
音声分析は、オーディオフォレンジックと呼ばれる法医学の分野で使用されています。これらの分析は、一般的に、問題の音声の信憑性を評価し、邪魔な背景ノイズに隠れている可能性のある音声の特徴を強調し、法医学の専門家の観点から音声を解釈する目的で証拠に対して実行されます。 [7]また、場合によっては話者を識別する目的でも実行されます。[8]
専門家は分析にさまざまな技術を使用します。最低限必要な手順は、「批判的聴取、波形分析、スペクトル分析」です。[9]批判的聴取では、前景音と背景音の両方を繰り返し聴取して徹底的に分析します。[9]波形分析では、オーディオを視覚化して、検査官が不規則な点を見つけられるようにします。スペクトル分析では、オーディオの周波数を視覚化して、検査官が興味のある特徴を見つけられるようにします。[9]
音声が大きな役割を果たした事例の一つはトレイボン・マーティン事件で、警察への通報の録音を分析して、背景の叫び声がジョージ・ジマーマンのものかマーティンのものかを判断した。
法医学的音声
法医学音声の専門家は、送信および保存された音声を調べ、強化して、犯罪捜査、裁判、および連邦機関のために解読することで録音を分析します。
法廷で音声録音を利用するには、法医学音声学者が録音を認証して改ざんを検出し、音声を強化し、音声を解釈する必要があります。彼らの最初の仕事は、使用されている録音内の音声が理解可能であることを確認することです。多くの場合、サンプルの音質は風や動きなどの環境要因により低下します。また、音質の低下は録音デバイス内の技術的な問題によるものです。録音が適切な品質になるまで、話者識別に関する調査作業を行うことはできません。理解しにくさに対するさまざまな解決策は、ユーザーがノイズをフィルタリングして除去できるコンピューター プログラムを使用して行われます。コンピューター ソフトウェアは音声をスペクトルと波形に変換することもできるため、法医学音声学者にとって便利です。ただし、録音に対する作業は、元の録音のコピーを作成してから行う必要があります。
法医学音声学者の主な仕事は、話者の特定です。解釈プロセスには、タイムラインの組み立て、会話の書き起こし、音声録音内の不明または理解不能な音の特定などが含まれます。法廷では、専門家は最終的に音声証拠に関する事実を説明し、録音によって証明される内容を説明するために、関連する音響的および物理的原理の説明を提供します。報告書には、録音に理解できない部分や聞き取れない部分がある場合の詳細情報、録音で何が起こっていたかの説明、録音から何が欠けているかの説明が含まれます。
話者識別
音声分析は、話者識別において役割を果たします。これは、話者の身元が不明であり、犯罪捜査や裁判に関連して、他の多数の声や容疑者から識別する必要がある場合です。特に刑事事件における話者と声の適切な識別は、熟知度、露出、遅延、声のトーン、声の変装、アクセントなどの一連の要因に依存します。話者をよく知っていると、声を適切に識別し、区別できる可能性が高くなります。声にさらされる量も、なじみのない声であっても、声を正しく識別するのに役立ちます。より長い発話を聞いたり、より頻繁に声にさらされたりした聞き手は、おそらく 1 つの単語しか聞き取れなかった人よりも、声を認識する能力が高くなります。声を聞いた時間と話者を識別する時間の間に遅延があると、正しい話者を識別する可能性も低くなります。声のトーンは、正しい話者を識別する能力に影響します。比較時に話者のトーンと一致しない場合、分析はより困難になります。また、話者がささやいているなど、声が変装している場合も、正確に一致させて話者を特定することが困難になります。場合によっては、分析対象の話者と同じ言語を話す人は、声のアクセントや強勢により、その人を特定するのが容易になります。話者の特定は、録音の技術的な方法による歪みや、感情状態や別の動機など、話者自体の問題によってさらに複雑になり、録音された声と話者の声が一致しなくなります。法医学における話者特定の方法には、聞いた声を特定するために使用される耳の目撃者の使用、個人のスピーチの超分節に関して専門家が行う聴覚知覚アプローチ、およびコンピューターベースのアプローチがあります。
参照
参考文献
- ^ Sarangi, Susanta; Sahidullah, Md; Saha, Goutam (2020 年 9 月). 「自動話者検証のためのデータ駆動型フィルタバンクの最適化」.デジタル信号処理. 104 : 102795. arXiv : 2007.10729 . doi :10.1016/j.dsp.2020.102795. S2CID 220665533.
- ^ ハプナー、エディ、ステンプル、ジョセフ(2014)。音声療法:臨床ケーススタディ。プルラル出版。
- ^ Toran, SiKC; Lal, BK (2010). 「微小喉頭音声手術後の声帯ポリープの客観的音声分析」カトマンズ大学医学ジャーナル8 (2): 185–189. doi : 10.3126 /kumj.v8i2.3555 . ISSN 1812-2078. PMID 21209532.
- ^ Stemple, Joseph C.; Stanley, Jennifer; Lee, Linda (1995). 「長時間の発声使用後の正常な被験者の発声の客観的測定」Journal of Voice . 9 (2): 127–133. doi :10.1016/s0892-1997(05)80245-0. ISSN 0892-1997. PMID 7620534.
- ^ Gerratt, Bruce R.; Hanson, David G.; Berke, Gerald S.; Precoda, Kristin (1991-01-01). 「Photoglottography: A clinical synopsis」. Journal of Voice . 5 (2): 98–105. doi :10.1016/S0892-1997(05)80173-0 . 2020年12月16日閲覧。
- ^ Chowdhury, Kanishka; Saha, Somnath; Saha, Vedula Padmini; Pal, Sudipta; Chatterjee, Indranil (2013-03-23). 「片側声帯麻痺症例における内側化甲状腺形成術後の術前および術後の音声分析」Indian Journal of Otolaryngology and Head & Neck Surgery . 65 (4): 354–357. doi :10.1007/s12070-013-0649-3. ISSN 2231-3796. PMC 3851511 . PMID 24427598.
- ^ Maher, Robert C. (2018).法医学的音声分析の原理. 現代の音響と信号処理. チャム: Springer International Publishing. pp. 1–2. doi :10.1007/978-3-319-99453-6. ISBN 978-3-319-99452-9 .
- ^ ソラン、ローレンス・M.、ティアースマ、ピーター・M. (2004)。 『犯罪について語る』シカゴ大学出版局。doi : 10.7208/chicago/9780226767871.001.0001。ISBN 978-0-226-76793-2。
- ^ abc Maher, Robert C. (2018).法医学的オーディオ分析の原理. 現代の音響学と信号処理. 出版社: Springer International Publishing. pp. 48–49. doi :10.1007/978-3-319-99453-6. ISBN 978-3-319-99452-9 .
外部リンク
- 声の問題と発声障害のオンライン コミュニティ (VoiceMatters.net)
