平均意見スコア(MOS )は、体験品質や電気通信工学の分野で用いられる指標であり、刺激やシステムの全体的な品質を表します。これは、「被験者がシステム品質のパフォーマンスに対する意見に割り当てた、あらかじめ定義された尺度上のすべての個々の値」の算術平均です。 [ 1 ]このような評価は通常、主観的な品質評価テストで収集されますが、アルゴリズムによって推定することもできます。
MOSは、ビデオ、オーディオ、および視聴覚品質の評価によく用いられる指標ですが、これらの形式に限定されるものではありません。ITU -Tは、勧告ITU-T P.800.1において、スコアが視聴覚、会話、リスニング、発話、またはビデオ品質テストのいずれから得られたかに応じて、MOSの参照方法をいくつか定義しています。
MOSは単一の有理数で表され、通常は1~5の範囲で、1は知覚される品質が最も低く、5は知覚される品質が最も高いことを示します。基礎となるテストで使用された評価尺度によっては、他のMOS範囲も可能です。絶対カテゴリー評価尺度は非常によく使用され、以下の表に示すように、悪いから優れているまでの評価を1~5の数値にマッピングします。
ITU-T勧告には、他の標準化された品質評価尺度も存在します( ITU-T P.800やITU-T P.910など)。例えば、1~100の範囲の連続尺度を使用することもできます。どの尺度を使用するかは、テストの目的に応じて異なります。特定の状況では、異なる尺度を使用して得られた同じ刺激の評価値の間に統計的に有意な差はありません。[ 2 ]
MOSは、主観的な品質評価テストにおいて、被験者が特定の刺激に対して行った個々の評価の算術平均として算出されます。したがって、次のようになります。
どこ特定の刺激に対する個々の評価は対象者。
MOSには特定の数学的特性とバイアスがあります。一般的に、MOSが単一のスカラー値で体験の質を定量化するのに有用かどうかについては議論が続いています。[ 3 ]
MOS がカテゴリ評価尺度を使用して取得される場合、それはリッカート尺度と同様に順序尺度に基づいています。この場合、尺度項目の順位はわかっていますが、その間隔はわかりません。したがって、中心傾向を得るために個々の評価の平均を計算することは数学的に正しくありません。代わりに中央値を使用する必要があります。[ 4 ]ただし、実際には、MOS の定義では、算術平均を計算することは許容されると考えられています。
カテゴリー評価尺度(ACRなど)では、個々の項目が被験者によって等距離であると認識されないことが示されています。たとえば、「良い」と「普通」の間の「ギャップ」は、 「良い」 と「非常に良い」の間の「ギャップ」よりも大きい場合があります。認識される距離は、尺度が翻訳される言語によっても異なる可能性があります。[ 5 ]ただし、尺度の翻訳が結果に有意な影響を与えないことを証明できなかった研究も存在します。[ 6 ]
MOS評価の取得方法には、他にもいくつかのバイアスが存在します。[ 7 ]上記の非線形的に知覚される尺度の問題に加えて、いわゆる「範囲均等化バイアス」があります。被験者は、主観的な実験の過程で、評価尺度全体にわたるスコアを与える傾向があります。このため、提示された品質の範囲が異なる場合、2つの異なる主観的テストを比較することは不可能になります。言い換えれば、MOSは決して品質の絶対的な尺度ではなく、取得されたテストに対する相対的な尺度にすぎません。
上記の理由、および主観的テストにおける知覚品質に影響を与えるその他のいくつかの状況要因のため、MOS値は、その値が収集された状況が既知であり、かつ報告されている場合にのみ報告されるべきである。したがって、異なる状況およびテスト設計から収集されたMOS値を直接比較すべきではない。勧告ITU-T P.800.2は、 MOS値の報告方法を規定している。具体的には、P.800.2は次のように述べている。
別々の実験から得られたMOS値を直接比較することは、それらの実験が比較を目的として明示的に設計されていない限り、意味がありません。また、比較が妥当であることを確認するために、データは統計的に分析されるべきです。
MOSは歴史的に、リスナーが「静かな部屋」に座って電話通話の品質を主観的に評価するという主観的な測定方法に由来しています。この種のテスト方法は、電話業界で数十年にわたり使用されており、 ITU-T勧告P.800で標準化されました。この勧告では、「話者は、容積が30~120 m³で残響時間が500 ms未満(好ましくは200~300 ms)の静かな部屋に座るべきである。室内の騒音レベルは30 dBA未満で、スペクトルに支配的なピークがあってはならない」と規定されています。他の方式に関する要件も、後のITU-T勧告で同様に規定されました。
MOS評価を取得するには、人間の評価者を雇用する必要があるため、時間と費用がかかる場合があります。コーデック開発やサービス品質監視など、品質を繰り返し自動的に評価する必要があるさまざまなユースケースでは、MOSスコアは、通常、人間のMOS評価を使用して開発およびトレーニングされた客観的な品質モデルによって予測することもできます。このようなモデルを使用する際に生じる疑問は、生成されたMOSの差がユーザーにとって認識できるかどうかです。たとえば、5段階のMOSスケールで画像を評価する場合、MOSが5の画像は、MOSが1の画像よりも明らかに品質が良いと予想されます。それとは逆に、MOSが3.8の画像が、MOSが3.6の画像よりも明らかに品質が良いかどうかは明らかではありません。デジタル写真でユーザーが認識できる最小のMOS差を決定するために実施された研究では、ユーザーの75%が高品質の画像を検出できるようにするには、約0.46のMOS差が必要であることが示されました。[ 8 ]それにもかかわらず、画像品質に対する期待、ひいてはMOSは、ユーザーの期待の変化に伴って時間とともに変化します。その結果、[ 8 ]などの分析方法を用いて決定された最小可視MOS差は、時間とともに変化する可能性があります。