知覚的客観的聴取品質分析(POLQA )は、デジタル音声信号を分析することによって音声品質を予測するモデルを対象とするITU-T規格の仮称でした。 [ 1 ]このモデルは、2011年にITU-T勧告P.863(知覚的客観的聴取品質評価)として標準化されました。この規格の第2版は2014年に発行され、現在有効な第3版は、知覚的客観的聴取品質予測というタイトルで2018年に採択されました。[ 2 ]
POLQAは、デジタル音声信号解析によって音声品質を予測するモデルを扱っています[ 3 ] [ 4 ]。これらの客観的な指標の予測は、主観的な聴取テストで得られた主観的な品質スコアにできるだけ近づく必要があります。通常、平均意見スコア(MOS)が予測されます。POLQAは、電話ネットワークを評価するためのテスト刺激として実際の音声を使用します。
POLQAはPESQ(ITU-T勧告P.862)の後継です。 [ 5 ] POLQAは現在のP.862モデルの弱点を回避し、より広い帯域幅の音声信号の処理に拡張されています。さらに、時間呼び出し信号や遅延変動の多い信号の処理にも改良が加えられています。P.862と同様に、POLQAは一般的な電話帯域(300~ 3400Hz)での測定をサポートしていますが、それに加えて、広帯域および超広帯域音声信号(50~14000Hz)でのHD-Voiceを評価するための第2の動作モードを備えています 。POLQAはまた、口と耳のシミュレータを備えた人工頭部で音響的に記録された音声信号の評価も対象としています。
POLQA の活動は、2006 年初頭に ITU-T で P.OLQA という作業タイトルで開始されました。2009 年半ばには、いくつかの候補モデルを評価するための競争が開始されました。2010 年 5 月、ITU-T は 3 社 (OPTICOM、SwissQual / Rohde & Schwarz、TNO (オランダ応用科学研究機構)) から候補モデルを選定しました。3 社はそれぞれのアプローチを 1 つのモデルに統合し、それが ITU-T 勧告 P.863 として採用されました。[ 2 ]
ITU-T の完全参照型の客観的音声品質測定のファミリーは、1997 年に勧告 ITU-T P.861 (PSQM) で始まり、2001 年にITU-T P.862 (PESQ) [ 5 ]に置き換えられました。P.862 はその後、勧告 ITU-T P.862.1 [ 6 ] (PESQ スコアを MOS スケールにマッピング)、ITU-T P.862.2 [ 7 ] (広帯域測定)、および ITU-T P.862.3 [ 8 ] (アプリケーション ガイド) によって補完されました。ITU-T P.863 (POLQA) [ 2 ]の初版は2011 年に発効しました。勧告 ITU-T P.863 のアプリケーション ガイドは 2019 年に承認され、ITU-T P.863.1 として発行されました。[ 9 ]
上記の完全参照方式に加えて、ITU-Tの客観的音声品質測定規格のリストには、ITU-T P.563 [ 10 ](参照なしアルゴリズム)も含まれています。
POLQAは、P.862 PESQと同様に、劣化または処理された音声信号を元の信号と比較して評価するフルリファレンス(FR)アルゴリズムです。参照信号(話者側)の各サンプルを、劣化信号(聞き手側)の対応する各サンプルと比較します。両信号間の知覚的な違いは、差分としてスコア化されます。知覚的な心理音響モデルは、MP3やAACと同様の人間の知覚モデルに基づいています。基本的に、信号はマスキング関数を適用した後、周波数領域(重要な帯域)で分析されます。2つの信号表現間のマスキングされていない違いは、歪みとしてカウントされます。最後に、音声ファイルで蓄積された歪みは、MOSテストで通常どおり1から5の品質スケールにマッピングされます。FR測定は最高の精度と再現性を提供しますが、ライブネットワークでの専用テスト(モバイルネットワークベンチマーク用のドライブテストツールなど)にのみ適用できます。
POLQAはフルリファレンスアルゴリズムであり、参照信号とテスト信号の対応する部分を時間的にアライメントした後、音声信号をサンプルごとに分析します。POLQAは、ネットワークのエンドツーエンド(E2E)品質評価、または個々のネットワークコンポーネントの特性評価に適用できます。
POLQAの結果は主に、1(悪い)から5(素晴らしい)までの尺度をカバーする平均意見スコア(MOS)をモデル化しています。
アルゴリズムへの入力は、16ビットPCMサンプルを含む2つのデータベクトルで表される2つの波形です。最初のベクトルには(歪みのない)参照信号のサンプルが含まれ、2番目のベクトルには劣化信号のサンプルが含まれます。POLQAアルゴリズムは、時間アライメントブロック、入力信号のサンプリングレートの差を補償するために使用されるサンプリングレートコンバータのサンプリングレート推定器、およびMOS計算を実行する実際のコアモデルで構成されています。最初のステップでは、2つの入力信号間の遅延が決定され、2つの信号の相対的なサンプリングレートが推定されます。サンプリングレートの推定は、時間アライメントによって計算された遅延情報に基づいています。サンプリングレートが約1%以上異なる場合、サンプリングレートが高い信号がダウンサンプリングされます。各ステップの後、結果は平均遅延信頼性指標とともに保存されます。これは、遅延推定の品質の尺度です。最終的に、最も高い全体的な信頼性をもたらしたリサンプリングステップの結果が選択されます。正しい遅延が決定され、サンプルレートの差が補正されると、信号と遅延情報がコアモデルに渡され、コアモデルは歪みの知覚可能性と不快感を計算し、MOSスケールにマッピングします。アルゴリズムのより詳細で包括的な説明は、[ 2 ]に記載されています。次のいくつかのセクションでは、POLQAの内部構造の基本の概要のみを示します。
コアモデルの主要要素は知覚モデルであり、異なる主要な歪みタイプに対応するために、異なるパラメータを使用して4回計算されます。これらの歪みタイプは、加算歪みと減算歪みに分類できます。どちらのタイプについても、非常に強い影響と弱い影響がさらに区別されます。知覚モデルへの入力は波形と遅延情報です。出力は妨害密度であり、これは信号の歪みの知覚可能性の尺度です。メインブランチの知覚モデルは、周波数歪み、ノイズ、残響歪みの指標も生成します。非常に強い歪みを検出する検出器によってトリガーされる後続のスイッチにより、4つの妨害密度の値が、加算歪みと減算歪みの2つに減らされます。これまでのところ、妨害密度は歪みの知覚可能性の指標にすぎず、認知効果はまだ考慮されていません。しかし、人間が知覚できるものの質を評価するように求められる場合、認知的な側面は重要になります。基本的に、彼らは知覚度指標である妨害密度を不快感指標に変換します。この変換は、以下の状況における妨害密度の値を補正することによって行われます。
このステップでは、スペクトルの平坦度とレベル変動に関する2つの指標も計算されます。
これまでのところ、すべての処理は、サンプリングレートに応じて約32~43msのフレーム(オーバーラップ率50%)に対して、各バークバンドごとに個別に実行されてきました。最終段階では、すべての指標を時間と周波数にわたって積分し、最終的なMOS LQO値を算出します。
知覚モデルにおける重要な概念は理想化です。この概念の根底にあるのは、POLQAが絶対カテゴリー評価(ACR)テストをシミュレートするという考え方です。しかし、ACRテストでは、被験者は音声信号を採点する際に、実際の参照信号と比較することができません。その代わりに、被験者は理想的な信号がどのような音であるかを理解しており、それを自身の基準として使用すると想定されています。したがって、被験者が絶対的に完璧ではない参照信号(例えば、音量が間違っている、音色、ノイズ、残響が多すぎるなど)を採点するように求められた場合、完璧よりも低い点数が付けられます。そのため、POLQAは理想化ステップにおいて、参照信号の小さな不完全さを補正し、劣化信号との比較において、人間が心の中で用いるのと同じ理想的な参照を導き出します。参照信号の理想化と同様に、劣化信号に存在する、ACRテストではほとんど知覚できない歪み(例えば、小さなピッチシフト、線形周波数歪みなど)も部分的に補正されます。知覚モデルは、参照信号を理想的な平均アクティブ音声レベルである約 -26dBov にスケーリングすることから始まります。劣化信号にはこのようなスケーリングは行われません。劣化信号のレベルが理想的な -26dBov から逸脱している場合は、信号の劣化としてスコアリングされると想定されます。次に、両方の信号のスペクトルは、32ms から 43ms (サンプリングレートによって異なります) の期間で 50% オーバーラップするフレームを使用した FFT を使用して計算されます。その後、劣化信号の小さなピッチシフトが除去されます (周波数デワーピング)。次に、個々のスペクトル線 (FFT ビン) をいわゆるクリティカルバンドに結合することにより、スペクトルは心理音響的に動機付けられたピッチスケールに変換されます。使用されるピッチスケールは、バンドあたり平均 0.3 Bark の解像度を持つ Bark スケールに似ています。結果はピッチパワー密度です。この段階では、周波数応答の歪み、付加ノイズ、室内残響に関する最初の 3 つの歪み指標が計算されます。次に、各バンドの励起が導出されます。これには、周波数領域と時間領域の両方におけるマスキング効果のモデリングが含まれます。結果として、各信号の各フレームについて、各周波数成分がどの程度大きく知覚されるかを概ね示す、頭部内部表現が得られます。次に、基準信号のさらなる理想化ステップとして、過剰な音色と低レベルの定常ノイズがフィルタリングによって除去されます。同時に、線形周波数歪みと定常ノイズが劣化信号から部分的に除去されます。理想化された励起を差し引くことで、最終的に歪み密度が得られ、これは歪みの可聴性を測定するために使用されます。
POLQAを使用して、声調言語と非ネイティブリスニングが音声品質測定に与える影響を調査した論文は、[ 11 ]に掲載されています。