知覚音声品質測定(PSQM )は、 ITU-T勧告P.861で定義されている計算およびモデリングアルゴリズムであり、音声帯域(300~3400Hz )の音声コーデックの音声品質を客観的に評価および定量化します。
これは、異なる音声入力レベル、話者、ビットレート、およびトランスコーディングにおけるこれらの音声コーデックの性能をランク付けするために使用できます。P.861は廃止され、改良された音声評価アルゴリズムを含むITU-T勧告P.862(PESQ)に置き換えられました。
PSQM規格を用いることで、自動化されたシミュレーションベースのテスト手法により、音声の明瞭度と伝送音声品質の両方を客観的に評価することが可能になります。このテストを容易にするために、様々なソフトウェアやハードウェア製品が開発されています。これにより、従来のように大勢の人が主観的に音声信号を評価して音声品質を査定する手法に比べて、コストと時間を大幅に節約できます。さらに、信頼性が高く再現性のある客観的な結果が得られます。これは、高いサービス品質基準を維持することが義務付けられている電話事業者にとって非常に重要です。
PSQMは、心理音響数学モデル(知覚的および認知的)アルゴリズムを使用して、送信前後の音声信号を分析し、信号品質の劣化度合いを示すPSQM値を算出します。PSQM値は0(劣化なし)から6.5(最も劣化が激しい)までの範囲をとります。この結果は、平均意見スコア(MOS)に変換できます。MOSは、受信したメディアの知覚品質を1から5までの数値スケールで表す、広く受け入れられている指標です。1は許容できないほど音質の悪い音声を示し、5は知覚できる問題のない高音質の音声を示します。
PSQMアルゴリズムは、時間周波数マッピング、周波数ワーピング、強度ワーピングなどの一連の非線形処理を通して、物理領域の信号を知覚的に意味のある心理音響領域に変換します。
符号化された音声の品質は、内部表現の差異に基づいて評価されます。この差異は、時間と周波数の関数としてノイズ妨害を計算するために使用されます。PSQMアルゴリズムは、知覚モデリングに加えて、主観的測定値と客観的測定値の間に高い相関関係を得るために、ラウドネススケーリングや非対称マスキングなどの認知モデリングも使用します。
PSQMは、当初の構想では、VoIPアプリケーションでよく見られるネットワークのサービス品質の変動、例えばパケット損失、遅延変動、順不同配信などを考慮するようには開発されていませんでした。これらの状況は、ネットワーク負荷の高いシミュレーションでは通常不適切な結果をもたらし、実際に感じられる音声品質の低下を考慮できていません。大幅なパケット損失を導入することでネットワーク障害の状態を再現しようとすると、PSQMの値が誤って過大評価されたMOS値に対応することになります。
この制約を克服するために、元のアルゴリズムを改良したPSQM+が開発されました。PSQM+は、現実的なネットワーク負荷条件下における音声コーデックの性能低下をより正確に反映する結果を生成します。
その他の問題としては、さまざまな音声コーデックを評価するために使用されるテスト信号の標準化が不十分なことが挙げられます。PSQMは、品質の客観的および主観的評価に関するITU推奨方法(ITU-T P.800/P.830/P.861)に従って使用すれば、より信頼性が高く一貫性のあるMOS値を提供します。これらのITU-T勧告には、平均レベル-20 dBで男性と女性の両方の性別の音声参照信号を使用することが含まれています。音声 または信号の種類、性別、持続時間、ゲインはすべて、しきい値レベル、発信通話数、および環境のその他の構成設定と同様に、PSQM値またはMOSスコアにわずかな影響を与える可能性があります。音声品質の測定値を比較する場合は、信号、環境、および構成をすべて考慮する必要があります。
音声コーデックは数多く存在し、幅広い用途で使用されています。システム要件に適合する適切な音声コーデックを慎重に選択する必要があります。一般的な音声コーデックとその関連するPSQM/PSQM+由来のMOS値(様々なネットワーク負荷条件下で取得)の一覧が利用可能です。