アルゴリズムの概要
VADアルゴリズムの典型的な設計は以下のとおりです。
- まず、スペクトル減算などによるノイズ低減段階があるかもしれない。
- 次に、入力信号の一部からいくつかの特徴量または量が計算される。
- 分類ルールを適用して、そのセクションを音声か非音声かに分類します。多くの場合、この分類ルールは、値が特定の閾値を超えた場合に検出されます。
この処理シーケンスにはフィードバックが含まれる場合があり、VADの決定結果を用いてノイズ低減段階におけるノイズ推定精度を向上させたり、閾値を適応的に変化させたりします。これらのフィードバック処理により、非定常ノイズ(つまり、ノイズが大きく変動する場合)におけるVADの性能が向上します。
最近発表された代表的なVAD手法では、音声とノイズ間の乖離距離を瞬時に測定し、フレームごとに判定ルールを策定します。VAD手法で使用される様々な測定方法には、スペクトル傾斜、相関係数、対数尤度比、ケプストラム、加重ケプストラム、および修正距離尺度などがあります。
VADアルゴリズムの選択とは無関係に、音声がノイズとして検出されるか、ノイズが音声として検出されるか(偽陽性と偽陰性の間)の妥協点を見つける必要があります。携帯電話で動作するVADは、非常に多様な種類の音響背景ノイズが存在する状況でも音声を検出できなければなりません。このような困難な検出条件下では、音声セグメントを失う可能性を低減するために、VADがフェイルセーフであり、判断に疑義がある場合に音声が検出されたことを示すことが望ましい場合が多くあります。この環境での音声検出における最大の困難は、遭遇する信号対雑音比(SNR)が非常に低いことです。音声発話の一部がノイズの下に埋もれている場合、単純なレベル検出技術を使用して音声とノイズを区別することは不可能かもしれません。
アプリケーション
デジタル移動無線、デジタル同時音声データ伝送(DSVD)、音声ストレージなど、幅広いアプリケーションにおいて、音声符号化パラメータを断続的に伝送することが望ましい。その利点としては、携帯電話端末の平均消費電力の低減、データ伝送などの同時サービスにおける平均ビットレートの向上、ストレージチップの容量増加などが挙げられる。しかし、この改善は主に、音声中の休止時間の割合と、これらの休止時間を検出するために使用されるVADの信頼性に依存する。一方では、音声活動の割合が低い方が有利である。他方では、クリッピング、すなわち数ミリ秒の音声活動時間の損失は、品質を維持するために最小限に抑える必要がある。これは、高ノイズ環境下におけるVADアルゴリズムにとって重要な課題である。
テレマーケティングでの使用
VADの議論を呼ぶ用途の一つに、テレマーケティング会社が使用する予測ダイヤラーとの連携があります。テレマーケティング会社は、エージェントの生産性を最大化するために、利用可能なエージェントの数よりも多くの番号に発信するよう予測ダイヤラーを設定します。これは、ほとんどの通話が「呼び出し音なし」または留守番電話につながることを承知の上でのことです。人が電話に出ると、通常は「もしもし」「こんばんは」などと短く話し、その後しばらく沈黙します。留守番電話のメッセージは通常、3~15秒間の連続した音声です。VADのパラメータを正しく設定することで、ダイヤラーは通話に応答したのが人間か機械かを判断し、人間であれば利用可能なエージェントに通話を転送します。留守番電話のメッセージを検出すると、ダイヤラーは通話を切断します。多くの場合、システムが通話に応答した人間を正しく検出しても、利用可能なエージェントがいない場合があり、「無音通話」となることがあります。「どなたかお名前をお知らせください。電話に出ます」といった数秒間のメッセージによる通話スクリーニングは、このような自動音声通話を妨害するのに役立ちます。
VADを評価するには、テスト録音を使用した出力を、「理想的な」VADの出力と比較します。理想的なVADは、録音に音声の有無を手動で注釈付けすることによって作成されます。VADのパフォーマンスは、一般的に次の4つのパラメータに基づいて評価されます。[ 4 ]
- FEC(フロントエンドクリッピング):ノイズから音声活動への移行時に導入されるクリッピング。
- MSC(音声途中のクリッピング):音声がノイズとして誤分類されたことによるクリッピング。
- OVER: VADフラグが音声活動からノイズに移行する際にアクティブなままであったため、ノイズが音声として解釈されました。
- NDS(音声として検出されたノイズ):無音期間内に音声として解釈されたノイズ。
上記の方法はVADの性能に関する有用な客観的情報を提供するものの、主観的な効果を近似的に測定するに過ぎません。例えば、快適ノイズ合成に選択されたモデルによっては、背景雑音の存在によって音声信号のクリッピングの影響が隠されてしまう場合があり、客観的なテストで測定されたクリッピングの一部は実際には聞こえない可能性があります。したがって、VADの主観的なテストを実施することが重要であり、その主な目的は、知覚されるクリッピングが許容範囲内であることを確認することです。VoIPアプリケーションでは、検出直前まで巻き戻し、ごくわずかに遅延したデータを送信することで、フロントエンドのクリッピングを低減できます。
この種のテストでは、一定数のリスナーが、テスト対象のVADの処理結果を含む録音を評価し、以下の特徴に基づいて複数の音声シーケンスに点数を付ける必要があります。
これらのマークは、上記に挙げた各機能の平均結果を計算するために使用され、それによってテスト対象のVADの動作に関する全体的な推定値が得られます。
結論として、VADの品質を評価する初期段階では客観的な方法が非常に有用である一方、主観的な方法の方がより重要である。主観的な方法は、数日間にわたって複数の人が参加する必要があり、コストが増加するため、一般的には提案が標準化されようとしている段階でのみ使用される。
実装
- 初期の標準的なVADの1つは、1991年に汎ヨーロッパのデジタルセルラー携帯電話サービスで使用するためにブリティッシュ・テレコムが開発したものです。これは、非音声セグメントでトレーニングされた逆フィルタリングを使用して背景ノイズを除去し、単純な電力閾値を使用して音声が存在するかどうかをより確実に判断できるようにします。[ 5 ]
- G.729規格では、 VADの以下の特徴を計算します。線スペクトル周波数、全帯域エネルギー、低帯域エネルギー(<1 kHz)、およびゼロ交差率。これらの特徴によって定義される空間で固定決定境界を使用して単純な分類を適用し、その後、平滑化と適応補正を適用して推定値を改善します。[ 6 ]
- GSM規格には、ETSIによって開発された2つのVADオプションが含まれています。[ 7 ]オプション1は、9つのバンドでSNRを計算し、これらの値にしきい値を適用します。オプション2は、チャネル電力、音声メトリック、ノイズ電力などの異なるパラメータを計算します。次に、推定SNRに応じて変化するしきい値を使用して音声メトリックにしきい値を適用します。
- Speexオーディオ圧縮ライブラリは、Improved Minima Controlled Recursive Averagingという手順を使用しており、これはスペクトルパワーの平滑化された表現を使用し、平滑化された周期図の最小値を調べます。[ 8 ]バージョン1.2以降、これは作者が「応急処置」と呼んだものに置き換えられました。[ 9 ]
- Lingua Libreは、言語ドキュメント作成のためのウィキメディアツールおよびプロジェクトであり、VADを使用して短時間で多くの発音を録音できるようにしています。
- VAD Androidライブラリ[ 10 ]は、 WebRTC GMM、Silero DNN、Yamnet DNNなどのGMMとDNNモデルの組み合わせを利用しています。このライブラリは、品質とパフォーマンスの両面で多くの実用レベルのモデルを凌駕しています。
- 最近のDNNベースのアプローチでは、深層学習の助けを借りてVADのパフォーマンスを向上させることができることが実証されています。TEN VAD [ 11 ] は、高性能、低サイズ、低遅延のDNNベースのアプローチであり、webRTC VADやSOTAのDNNベースのSilero VADなどの従来のアプローチを凌駕しています。
参考文献
- ↑マノージ・バティア。ジョナサン・デイビッドソン。サティシュ・カリディンディ。スディプト・ムケルジー;ジェームズ・ピーターズ(2006年10月20日)。「VoIP: 徹底した分析 - 音声アクティビティの検出」。シスコ。
- ↑メリーランド州サヒドラ。パティーノ、ホセ。コーネル、サミュエル。イン、ルイキン。シヴァサンカラン、スニット。ブレディン、エルベ。コルシュノフ、パベル。ブルッティ、アレッシオ。セリゼル、ロマン。ヴィンセント、エマニュエル。エヴァンス、ニコラス。マルセル、セバスチャン。スクアルティーニ、ステファノ。バラス、クロード (2019-11-06)。 「DIHARD II へのスピード提出: 貢献と得られた教訓」。arXiv : 1911.02388 [ eess.AS ]。
- ↑ラヴィ・ラマチャンドラン、リチャード・マンモーネ( 2012年12月6日)。現代音声処理法。シュプリンガー・サイエンス&ビジネス・メディア。102ページ以降。ISBN 978-1-4615-2281-2。
- ↑ Beritelli, F.; Casale, S.; Ruggeri, G.; Serrano, S. (2002 年 3 月). "G.729/AMR/ファジー音声活動検出器の性能評価と比較". IEEE Signal Processing Letters . 9 (3): 85–88 . Bibcode : 2002ISPL....9...85B . doi : 10.1109/97.995824 . S2CID 16724847 .
- ↑ Freeman, DK (1989 年 5 月) 「汎ヨーロッパデジタルセルラー移動電話サービスのための音声活動検出器」。国際音響・音声・信号処理会議(ICASSP-89)議事録。第 1 巻、 369~ 372ページ。doi : 10.1109 /ICASSP.1989.266442。
- ↑ Benyassine, A.; Shlomot, E.; Huan-yu Su; Massaloux, D.; Lamblin, C.; Petit, J.-P. (1997年9月). "ITU-T勧告G.729附属書B:V.70デジタル同時音声およびデータアプリケーション向けに最適化されたG.729で使用するための無音圧縮方式". IEEE Communications Magazine . 35 (9): 64–73 . doi : 10.1109/35.620527 .
- ↑ ETSI (1999). "GSM 06.42、デジタルセルラー通信システム(フェーズ2+);ハーフレート音声;ハーフレート音声トラフィックチャネル用音声アクティビティ検出器(VAD)"(文書)。ETSI。
- ↑ Cohen, I. (2003年9月). "不利な環境におけるノイズスペクトル推定:改良された最小値制御再帰平均法". IEEE Transactions on Speech and Audio Processing . 11 (5): 466–475 . Bibcode : 2003ITSAP..11..466C . CiteSeerX 10.1.1.620.8768 . doi : 10.1109/TSA.2003.811544 .
- ↑ 「Speex VAD アルゴリズム」。 2004 年 9 月 30 日。
- ↑ 「Android音声アクティビティ検出(VAD)ライブラリ。WebRTC VAD GMM、Silero VAD DNN、Yamnet VAD DNNモデルをサポート」。Github 。2019年11月27日取得。
- ↑ "TEN VAD : 低遅延、高性能、軽量の音声アクティビティ検出器" . Github .
- 移動局の不連続送信動作に関するDMA最小性能基準、TIA文書およびデータベースIS-727、1998年6月。
- MY Appiah、M. Sasikath、R. Makrickaite、M. Gusaite、「堅牢な音声活動検出およびノイズ低減メカニズム(PDF)」、オールボー大学電子システム研究所
- XL Liu、Y. Liang、YH Lou、H. Li、BS Shan、「隠れセミマルコフモデルに基づくノイズ耐性のある音声活動検出器」、Proc. ICPR'10、81–84。