音声処理において、メル周波数ケプストラム( MFC ) は、周波数の非線形メルスケール上のログパワースペクトルの線形コサイン変換に基づいて、音声の 短期パワースペクトルを表現します。
メル周波数ケプストラム係数( MFCC ) は、集合的に MFC を構成する係数です。[1]これらは、オーディオ クリップのケプストラム表現の一種(非線形の「スペクトルのスペクトル」) から派生します。ケプストラムとメル周波数ケプストラムの違いは、MFC では周波数帯域がメル スケール上で等間隔に配置されていることです。これは、通常のスペクトルで使用される線形間隔の周波数帯域よりも、人間の聴覚システムの反応に近似しています。この周波数ワーピングにより、たとえばオーディオ圧縮でサウンドをより適切に表現できるようになり、オーディオ信号の伝送帯域幅とストレージ要件が削減される可能性があります。
MFCCは一般的に次のように導出される:[2] [3]
- 信号(のウィンドウ化された抜粋)のフーリエ変換を実行します。
- 三角形の重なり合うウィンドウまたはコサインの重なり合うウィンドウを使用して、上で得られたスペクトルのパワーをメル スケールにマッピングします。
- 各メル周波数におけるパワーのログを取得します。
- メル対数べき乗のリストを信号であるかのように離散コサイン変換します。
- MFCC は結果として得られるスペクトルの振幅です。
このプロセスにはバリエーションがあり、例えば、スケールをマッピングするために使用されるウィンドウの形状や間隔の違い、[4]または「デルタ」や「デルタデルタ」(フレーム間の1次および2次の差)係数などのダイナミクス機能の追加などがあります。[5]
欧州電気通信標準化機構は2000年代初頭に携帯電話で使用される標準化されたMFCCアルゴリズムを定義しました。[6]
アプリケーション
MFCCは、電話で話された数字を自動的に認識できるシステムなど、 音声認識[7]システムの特徴として一般的に使用されています。
MFCCは、ジャンル分類やオーディオ類似度測定などの音楽情報検索アプリケーションでもますます利用されるようになっています。 [8]
話者認識のためのMFCC
MFCCではメル周波数帯域が均等に分布しており、人間の音声システムと非常に似ているため、MFCCは話者の特徴を効率的に把握することができます。例えば、話者の携帯電話のモデル特性を認識したり、話者の声の詳細を把握したりすることができます。[4]
このタイプのモバイルデバイス認識が可能なのは、携帯電話の電子部品の製造には許容範囲があり、異なる電子回路の実現には正確に同じ伝達関数がないためです。タスクを実行する回路が異なるメーカーのものであると、実現方法間の伝達関数の相違はより顕著になります。したがって、各携帯電話は入力音声に畳み込み歪みをもたらし、携帯電話からの録音に独自の影響を残します。したがって、元の周波数スペクトルに各電話に固有の伝達関数をさらに乗算し、その後信号処理技術を適用することで、録音された音声から特定の電話を識別できます。したがって、MFCC を使用すると、携帯電話の録音を特徴付けて、電話のブランドとモデルを識別できます。[5]
携帯電話の録音セクションを線形時不変 ( LTI ) フィルターとして考える:
インパルス応答-h(n)、入力x(n)に対するフィルタの出力として記録された音声信号y(n) 。
したがって、(畳み込み)
音声は定常信号ではないため、信号が定常であると想定される重複フレームに分割されます。したがって、録音された入力音声の短期セグメント (フレーム) は次のようになります。
- 、
ここでw(n):長さWのウィンドウ関数。
したがって、指定されたように、録音された音声の携帯電話のフットプリントは、録音された電話を識別するのに役立つ畳み込み歪みです。
携帯電話に埋め込まれた ID は、より識別しやすい形式に変換する必要があるため、短時間フーリエ変換を実行します。
入力音声を生成する連結された伝達関数と見なすことができ、録音された音声は携帯電話からの元の音声として認識できます。
したがって、声道と携帯電話レコーダーの等価伝達関数は、録音された音声の元のソースと見なされます。したがって、
ここで、Xew(f)は励起関数、はフレーム内の音声の声道伝達関数、は携帯電話を特徴付ける等価伝達関数です。
このアプローチは、デバイスの識別と話者の識別が密接に関連しているため、話者の認識に役立ちます。
フィルタバンク(メルスケールフィルタバンクを備えた適切なケプストラム)で乗算されたスペクトルのエンベロープを重視し、フィルタバンクを伝達関数 U(f) で平滑化した後、出力エネルギーのログ演算は次のようになります。
代表する
MFCC が成功したのは、この加法特性を持つ非線形変換のおかげです。
時間領域に戻すと:
ここで、cy(j)、ce(j)、cw(j)は、それぞれ携帯電話の特性を表す携帯電話レコーダーの録音された音声ケプストラムと加重等価インパルス応答であり、jはフィルタバンク内のフィルタの数です。
より正確には、デバイス固有の情報は、識別に適した加法形式に変換された録音された音声に含まれています。
cy(j)はさらに処理されて録音電話機の識別に使用されます。
よく使用されるフレームの長さ - 20 または 20 ミリ秒。
よく使用されるウィンドウ関数 - ハミング ウィンドウとハニング ウィンドウ。
したがって、メルスケールは、1000 Hz までは線形で、それを超えると対数になる、一般的に使用される周波数スケールです。
メルスケールでのフィルタの中心周波数の計算:
- 、基数は10です。
MFCC計算の基本的な手順:
- 対数フィルタ バンクの出力が生成され、20 倍されてデシベル単位のスペクトル エンベロープが得られます。
- MFCC は、スペクトル エンベロープの離散コサイン変換 (DCT) を実行することによって取得されます。
- ケプストラム係数は次のように得られます。
、、
ここで、は- 番目の MFCC 係数に対応し、はフィルタ バンク内の三角形フィルタの数、は - 番目のフィルタ係数のログ エネルギー出力、は計算する MFCC 係数の数です。
反転
MFCCは、4つのステップでオーディオに逆変換できます。(a1)逆DCTでメルログパワー[dB]スペクトログラムを取得し、(a2)パワーにマッピングしてメルパワースペクトログラムを取得し、(b1)再スケーリングして短時間フーリエ変換振幅を取得し、最後に(b2)グリフィン・リムを使用して位相再構成とオーディオ合成を行います。各ステップは、MFCC計算の1ステップに対応します。[9]
ノイズ感度
MFCC値は加法性ノイズの存在下ではそれほど堅牢ではないため、音声認識システムではノイズの影響を軽減するために値を正規化するのが一般的です。一部の研究者は、離散コサイン変換(DCT)を行う前にlog-mel振幅を適切な累乗(約2または3)に上げるなど、基本的なMFCCアルゴリズムを変更して堅牢性を向上させることを提案しています。これにより、低エネルギー成分の影響が軽減されます。[10]
歴史
MFCの開発者としては、一般的にポール・マーメルスタイン[11] [12]が知られています。マーメルスタインは、このアイデアを ブライドルとブラウン[13]に帰しています。
ブライドルとブラウンは、不均一間隔のバンドパスフィルタの出力をコサイン変換して得られる19個の重み付きスペクトル形状係数のセットを使用しました。フィルタ間隔は1kHz以上では対数になるように選択され、フィルタ帯域幅もそこで増加します。したがって、これらをメルベースのケプストラムパラメータと呼びます。[11]
初期の創始者の両方が引用されることもある。[14]
デイビスやマーメルスタイン[12]を含む多くの著者は、MFCのコサイン変換のスペクトル基底関数は、ポルスとその同僚によってずっと以前に音声表現と認識に適用された対数スペクトルの主成分と非常に似ているとコメントしている。[15] [16]
参照
参考文献
- ^ Min Xu; et al. (2004). 「HMM ベースのオーディオ キーワード生成」(PDF)。相澤清治、中村雄一、佐藤真一 (編)。マルチメディア情報処理の進歩 – PCM 2004: マルチメディアに関する第 5 回環太平洋会議。Springer。ISBN 978-3-540-23985-72007年5月10日時点のオリジナル(PDF)よりアーカイブ。
- ^ Sahidullah, Md.; Saha, Goutam (2012 年 5 月). 「話者認識のための MFCC 計算におけるブロックベース変換の設計、分析、実験的評価」.音声通信. 54 (4): 543–565. doi :10.1016/j.specom.2011.11.004. S2CID 14985832.
- ^ Abdulsatar, Assim Ara; Davydov, VV; Yushkova, VV; Glinushkin, AP; Rud, V Yu (2019-12-01). 「音声信号からの年齢と性別の認識」. Journal of Physics: Conference Series . 1410 (1): 012073. Bibcode :2019JPhCS1410a2073A. doi : 10.1088/1742-6596/1410/1/012073 . ISSN 1742-6588. S2CID 213065622.
- ^ ab Fang Zheng、Guoliang Zhang、Zhanjiang Song (2001)、「MFCC のさまざまな実装の比較」、J. Computer Science & Technology、 16(6): 582–589。
- ^ ab S. Furui (1986)、「強調スペクトルダイナミクスに基づく話者に依存しない孤立単語認識」
- ^ 欧州電気通信標準化機構 (2003)、音声処理、伝送および品質の側面 (STQ)、分散音声認識、フロントエンド特徴抽出アルゴリズム、圧縮アルゴリズム。技術標準 ES 201 108、v1.1.3。
- ^ T. Ganchev、N. Fakotakis、G. Kokkinakis (2005)、「話者検証タスクにおけるさまざまな MFCC 実装の比較評価」、Wayback Machineに 2011-07-17にアーカイブ済み、第 10 回国際音声・コンピュータ会議 (SPECOM 2005)、第 1 巻、pp. 191–194。
- ^ Meinard Müller (2007). 音楽と動きのための情報検索. Springer. p. 65. ISBN 978-3-540-74047-6。
- ^ "librosa.feature.inverse.mfcc_to_audio — librosa 0.10.0 ドキュメント". librosa.org。
- ^ V. Tyagi および C. Wellekens (2005)、「堅牢な音声認識のためのメルケプストラムのスプリアススペクトル成分に対する感度低下について」、音響、音声、および信号処理、2005 年。議事録。(ICASSP '05)。IEEE 国際会議、第 1 巻、pp. 529–532。
- ^ ab P. Mermelstein (1976)、「音声認識のための距離測定、心理的および器械的」、パターン認識と人工知能、CH Chen 編、pp. 374–388。Academic、ニューヨーク。
- ^ ab SB Davis、P. Mermelstein (1980)、「連続的に話された文における単音節単語認識のためのパラメトリック表現の比較」『IEEE Transactions on Acoustics, Speech, and Signal Processing』28(4)、pp. 357–366。
- ^ JS Bridle および MD Brown (1974)、「実験的な自動単語認識システム」、JSRU レポート No. 1003、Joint Speech Research Unit、Ruislip、イギリス。
- ^ ネルソン・モーガン、エルヴェ・ブルラール、ヒネック・ハーマンスキー (2004)。「自動音声認識: 聴覚的観点」スティーブン・グリーンバーグ、ウィリアム・A・エインズワース (編) 著『聴覚システムにおける音声処理』シュプリンガー、315 ページ。ISBN 978-0-387-00590-4。
- ^ LCW Pols (1966)、「単音節語におけるオランダ語母音のスペクトル分析と識別」、オランダ、アムステルダム自由大学博士論文
- ^ R. Plomp、LCW Pols、JP van de Geer (1967)。 「母音スペクトルの次元解析」J. アメリカ音響協会、 41(3):707–712。
外部リンク
- MFCC およびその他の音声特徴の MATLAB コード
- 自動音声認識のための MFCC に関するチュートリアル
