Loading article…
ビゼームとは、例えば唇の動きを読み取るときなどに同じように見える複数の音声のうちの任意のものです(Fisher 1968)。
ビゼムと音素は1対1で対応していません。多くの場合、複数の音素が1つのビゼムに対応しており、これは、/k、 ɡ、 ŋ/や/t、 d、 n、 l/、/p、 b、 m/など、発音時に顔で同じに見える音素がいくつかあるためです。したがって、 pet、bell、 menなどの単語はすべて同じように見えるため、読唇術で区別することは困難です。ある説明では、ビゼムは調音場所に関する(音声)情報を提供しますが、調音方法は聴覚入力を必要とします[1]。
しかし、自然な会話では、特定のジェスチャーの視覚的な「特徴」という点でタイミングや持続時間が異なる場合があり、これは各口のパターンの画像を順番に連結(静止)するだけでは捉えることができません[2]。逆に、聴覚的に区別しにくい音でも、顔によって明確に区別できる場合があります。たとえば、英語の話し言葉では、/l/と/r/ はよく似た音に聞こえますが(特に「草」と「ガラス」のように連続している場合)、視覚情報によって区別できます。一部の言語学者は、会話はバイモーダル(聴覚と視覚)で理解するのが最もよく、これら 2 つの領域のいずれかが欠けていると理解が損なわれる可能性があると主張しています(McGurk と MacDonald 1976)。
ビゼームは、多くの場合ユーモラスです。たとえば、「elephant juice」というフレーズは、唇の動きを読み取ると「I love you」と同じになります。
ビゼームの研究の応用としては、音声処理、音声認識、コンピューターの顔のアニメーションなどがあります。
参照
参考文献
- Chen, T. および Rao RR ( 1998 年 5 月)。「マルチモーダル通信におけるオーディオビジュアル統合」。IEEE 86会議録、837–852。doi :10.1109/5.664274。
- Chen, T. (2001). 「オーディオビジュアル音声処理」IEEE 信号処理マガジン18, 9–21. doi :10.1109/79.911195
- フィッシャー、CG(1968)。「視覚的に知覚される子音間の混乱」音声聴覚研究ジャーナル、11(4):796-804。doi :10.1044 / jshr.1104.796 。
- McGurk, H. および MacDonald, J. (1976 年 12 月)。「唇を聞き、声を見る」。Nature 264、746–748。doi : 10.1038 /264746a0。
- Patrick Lucey、Terrence Martin、Sridha Sridharan (2004)。「雑音環境におけるビセムクラスに従ってグループ化された音素の混同可能性」。2004年 12 月 8 日から 10 日まで、シドニーのマッコーリー大学で開催された第 10 回オーストラリア国際音声科学技術会議で発表されました。
- ^ サマーフィールド Q. リップリーディングとオーディオビジュアル音声知覚。Philos Trans R Soc Lond B Biol Sci. 1992 年 1 月 29 日;335(1273):71-8。doi: 10.1098/rstb.1992.0009。PMID: 1348140
- ^ @article{Calvert2003ReadingSF, title={静止顔と動いている顔からの音声の読み取り: 可視音声の神経基質}, author={Gemma A. Calvert と R. Campbell}, journal={Journal of Cognitive Neuroscience}, year={2003}, volume={15}, pages={57-70}, url={https://api.semanticscholar.org/CorpusID:14153329} }
