主観的ビデオ品質とは、人間が体験するビデオ品質です。これは、視聴者 (「観察者」または「対象」とも呼ばれる) がビデオをどのように認識するかに関係し、特定のビデオシーケンスに対する視聴者の意見を示します。これは、体験品質の分野に関連しています。PSNR などの客観的な品質評価アルゴリズムは主観的な評価とあまり相関していないことが示されているため、主観的なビデオ品質を測定する必要があります。主観的な評価は、新しいアルゴリズムを開発するための基準として使用することもできます。
主観的なビデオ品質テストは、一定数の視聴者が特定の刺激セットを評価する心理物理学的実験です。これらのテストは、時間 (準備と実行) と人的資源の点で非常にコストがかかるため、慎重に設計する必要があります。
主観的なビデオ品質テストでは、通常、SRC(「ソース」、つまり元のビデオシーケンス)がさまざまな条件(「仮想参照回路」のHRC )で処理され、 PVS(「処理済みビデオシーケンス」)が生成されます。[1]
測定
主観的なビデオ品質を測定する基本的な考え方は、オーディオの平均オピニオン評点(MOS) 評価に似ています。ビデオ処理システムの主観的なビデオ品質を評価するには、通常、次の手順が実行されます。
- テスト用にオリジナルの、損傷のないビデオシーケンスを選択する
- 評価するシステムの設定を選択する
- SRCに設定を適用すると、テストシーケンスが生成される
- テスト方法を選択し、視聴者にシーケンスがどのように提示され、視聴者の意見がどのように収集されるかを説明します。
- 視聴者のパネルを招待する
- 特定の環境(実験室環境など)でテストを実行し、各PVSを特定の順序ですべての視聴者に提示します。
- 個々のPVS、SRC、HRCの評価結果(MOSなど)を計算する
室内の照明、ディスプレイの種類、明るさ、コントラスト、解像度、視聴距離、視聴者の年齢や教育レベルなど、視聴条件の多くのパラメータが結果に影響を与える可能性があります。したがって、得られた評価とともにこれらの情報を報告することをお勧めします。
ソースの選択
通常、システムは、代表的な数の異なるコンテンツとコンテンツ特性を使用してテストする必要があります。たとえば、アクション映画、ニュース番組、漫画など、さまざまなジャンルのコンテンツから抜粋を選択できます。ソース ビデオの長さはテストの目的によって異なりますが、通常は 10 秒以上のシーケンスが使用されます。
動きの量と空間の詳細も広範囲に及ぶ必要があります。これにより、テストにさまざまな複雑さのシーケンスが含まれるようになります。
ソースは、純粋な品質である必要があります。目に見えるコーディングアーティファクトや、元のシーケンスの品質を低下させるその他の特性 があってはなりません。
設定
HRC の設計は、調査対象のシステムによって異なります。通常、この段階で複数の独立変数が導入され、いくつかのレベルで変化します。たとえば、ビデオ コーデックの品質をテストする場合、独立変数は、ビデオ エンコード ソフトウェア、ターゲット ビットレート、および処理されたシーケンスのターゲット解像度になります。
品質範囲全体をカバーする評価が得られる設定を選択することをお勧めします。言い換えると、絶対カテゴリ評価スケールを想定すると、テストでは視聴者が悪いから優れているまで評価するシーケンスが表示されるはずです。
視聴者
視聴者数
視聴者は「観察者」または「被験者」とも呼ばれます。被験者の数が多いほど、平均評価の標準偏差が減少するなど、実験結果の信頼性が高まるため、調査には一定数の視聴者を招待する必要があります。さらに、評価中に信頼性の低い行動をした被験者を除外しなければならないリスクもあります。
主観的なビデオ品質調査に必要な被験者の最小数は厳密には定義されていません。ITU-T によると、4 から 40 までであればどの数でも構いませんが、統計上の理由から 4 が絶対最小数であり、40 人以上の被験者を招待しても付加価値はありません。一般的に、実験には少なくとも 15 人の観察者が参加する必要があります。観察者は、仕事の一環として画質評価に直接関与してはならず、経験豊富な評価者であってはいけません。[2]他の文書では、意味のある平均評価を得るには少なくとも 10 人の被験者が必要であるとも主張されています。[3]
ただし、被験者の数に関する推奨事項のほとんどは、家庭用テレビや PC ユーザーが体験するビデオ品質を測定するために設計されており、歪みの範囲と多様性は制限される傾向があります (例: エンコード アーティファクトのみ)。モバイル デバイスでキャプチャされたビデオやワイヤレス ネットワーク経由で送信されたビデオでは、障害の範囲と多様性が広いため、通常はより多くの被験者が必要になる場合があります。
BrunnströmとBarkowskyは、既存の主観的テストに基づいて、必要な被験者の最小数を推定する計算を提供しました。[4]彼らは、評価を比較する際に統計的に有意な差を保証するためには、通常推奨されるよりも多くの被験者が必要になる可能性があると主張しています。
視聴者の選択
視聴者は、ビデオコーディングや関連分野の専門家ではないという意味で非専門家である必要があります。この要件は、潜在的な主題の偏りを避けるために導入されています。[2]
通常、視聴者はスネレン視力表を使用して正常視力または矯正視力の検査を受けます。色覚異常は石原色覚表を使用して検査されることが多いです。[2]
QoEコミュニティでは、視聴者の文化的、社会的、経済的背景が、得られる主観的なビデオ品質の結果に大きな影響を与えるかどうかについて議論が続いています。4か国6つの研究所が参加した体系的な研究では、被験者の言語と文化/出身国がビデオ品質の評価に統計的に有意な影響を与えないことがわかりました。[5]
テスト環境
主観的品質テストは、どのような環境でも行うことができます。しかし、異質な状況からの影響要因の可能性があるため、通常は専用の実験室などの中立的な環境でテストを行うことをお勧めします。このような部屋は防音対策が施され、壁はニュートラルグレーに塗装され、適切に調整された光源が使用されています。いくつかの推奨事項では、これらの条件が指定されています。[6] [7]制御された環境では、得られたスコアの変動性が低くなることが示されています。[5]
クラウドソーシング
クラウドソーシングは最近、主観的なビデオ品質評価、より一般的には体験の質の文脈で使用されています。[8]ここでは、視聴者は実験室で主観的な品質テストに参加するのではなく、自宅で自分のコンピューターを使用して評価を行います。この方法では、従来の主観テストよりも低コストで多くの結果を得ることができますが、収集された回答の妥当性と信頼性を慎重に確認する必要があります。[9]
結果の分析
視聴者の意見は、通常、平均オピニオン スコア (MOS) に平均化されます。この目的のために、カテゴリ スケールのラベルを数値に変換できます。たとえば、「悪い」から「優れている」までの回答を 1 から 5 までの値にマッピングし、平均化できます。MOS 値は常に統計的信頼区間とともに報告され、観察者間の一般的な合意を評価できるようにする必要があります。
被験者のスクリーニング
多くの場合、結果を評価する前に追加の措置が講じられます。被験者のスクリーニングとは、評価が無効または信頼できないと見なされた視聴者を、それ以上の分析から除外するプロセスです。被験者はビデオを見ずに評価したり、テスト中に不正行為をしたりする可能性があるため、無効な評価を検出することは困難です。被験者の全体的な信頼性はさまざまな手順で判断できますが、その一部はITU-RおよびITU-Tの推奨事項に概説されています。[2] [7]たとえば、すべてのシーケンスで評価された個人のスコアと全体的なMOSの相関関係は、残りのテスト参加者と比較した信頼性の良い指標です。
高度なモデル
刺激を評価する際、人間はバイアスの影響を受けます。バイアスは、異なる不正確な採点行動につながり、その結果、刺激の「真の品質」を代表しないMOS値をもたらす可能性があります。近年、評価プロセスを正式に記述し、その後主観的評価のノイズを回復することを目的とした高度なモデルが提案されています。Janowskiらによると、被験者は一般的にスコアを変える意見のバイアスと、評価される被験者と刺激に依存する採点の不正確さを持つ可能性があります。[10] Liらは、被験者の不一致とコンテンツの曖昧さを区別することを提案しました。[11]
標準化されたテスト方法
適切なシーケンス、システム設定、テスト方法を選択する方法は多数あります。そのうちのいくつかは標準化されています。これらは、ITU-R BT.500 [7]や ITU-T P.910 [2]など、いくつかの ITU-R および ITU-T 勧告で詳細に説明されています。いくつかの側面で重複している部分もありますが、BT.500 勧告は放送にルーツがあり、P.910 はマルチメディア コンテンツに重点を置いています。
標準化されたテスト方法では通常、次の側面が説明されます。
- 実験セッションの継続時間
- 実験が行われる場所
- 各PVSを何回、どの順番で視聴するか
- 評価は刺激ごとに1回(例えば、提示後)行われるか、継続的に行われるか
- 評価が絶対的なものか(つまり、1つの刺激のみを参照するもの)、それとも相対的なもの(2つ以上の刺激を比較するもの)か
- どのスケールの評価を受けるか
もう一つの勧告であるITU-T P.913 [6]では、研究者に一般的な試験室とは異なる環境で主観的な品質テストを実施する自由を与えていますが、そのようなテストを再現可能にするために必要なすべての詳細を報告することを要求しています。
例
以下に、標準化されたテスト手順のいくつかの例を説明します。
単一刺激
- ACR(絶対カテゴリー評価):[2]各シーケンスはACRスケールで個別に評価されます。スケール上のラベルは「悪い」、「悪い」、「普通」、「良い」、「優れている」であり、MOSを計算する際には1、2、3、4、5の値に変換されます。
- ACR-HR (隠された参照による絶対カテゴリ評価): ACR のバリエーションで、元の障害のないソース シーケンスが障害のあるシーケンスに加えて表示されますが、被験者にはその存在が通知されません (したがって、「隠された」)。評価は、参照バージョンと障害のあるバージョン間の差分スコアとして計算されます。差分スコアは、PVS のスコアから隠された参照に与えられたスコアを差し引き、スケールのポイント数を加えたものとして定義されます。たとえば、PVS が「悪い」と評価され、対応する隠された参照が「良い」と評価された場合、評価は です。これらの評価を平均すると、結果は MOS ではなく、差分 MOS (「DMOS」) になります。
- SSCQE(単一刺激連続品質評価):[7]スライダーデバイス(フェーダーのバリエーション)を使用して、より長いシーケンスを時間の経過と共に継続的に評価し、被験者が現在の品質を評価します。サンプルは一定の間隔で採取されるため、単一の品質評価ではなく、時間の経過に伴う品質曲線が得られます。
二重刺激または多重刺激
- DSCQS(二重刺激連続品質尺度)[7] :視聴者は、障害のない参照映像と障害のある映像をランダムな順序で見る。視聴者は映像を再度視聴し、ACRカテゴリーでラベル付けされた連続尺度で両方の品質を評価することができる。
- DSIS(二重刺激障害尺度)[7]とDCR(劣化カテゴリー評価):[2]はどちらも同じ方法を指します。視聴者は障害のない参照ビデオを見て、次に同じビデオを障害ありで見て、その後、いわゆる障害尺度(「障害は知覚できない」から「障害は非常に不快」まで)を使用して2番目のビデオに投票するよう求められます。
- PC(ペア比較): [2]障害のないシーケンスと障害のあるシーケンスを比較するのではなく、異なる障害タイプ(HRC)を比較します。HRCの可能なすべての組み合わせを評価する必要があります。
方法論の選択
どの方法を選択するかは、テストの目的と、時間やその他のリソースの制約に大きく依存します。方法によっては、コンテキスト効果(刺激の順序が結果に影響を与える場合など)が少なく、望ましくないテストバイアスが生じることがあります。[12] ITU-T P.910では、特に高品質システムでは、伝送の忠実度をテストするためにDCRなどの方法を使用する必要があるとされています。ACRとACR-HRは、認定テストや、絶対的な結果が得られるためシステムの比較に適しています。PC法は識別力が高いですが、より長いテストセッションが必要です。
データベース
使用された刺激を含む主観的品質テストの結果は、データベースと呼ばれます。このような研究に基づいた主観的な画像およびビデオ品質データベースは、研究機関によって数多く公開されています。これらのデータベースは、一部は事実上の標準となっており、開発されたモデルを取得した主観データに対してトレーニングできるため、世界中のテレビ、映画、ビデオのエンジニアによって客観的な品質モデルの設計とテストにグローバルに使用されています。公開されているデータベースの概要は、ビデオ品質専門家グループによってまとめられており、ビデオ資産は消費者向けデジタルビデオライブラリで利用できます。
参考文献
- ^ ITU-Tチュートリアル:ビデオ品質の客観的知覚評価:フルリファレンステレビ、2004年。
- ^ abcdefgh ITU-T勧告P.910:マルチメディアアプリケーションの主観的ビデオ品質評価方法、2008年。
- ^ Winkler, Stefan. 「ビデオ品質実験における主観評価の特性について」。Proc . Quality of Multimedia Experience、2009年。
- ^ Brunnström, Kjell; Barkowsky, Marcus (2018-09-25). 「統計的経験品質分析:サンプルサイズの計画と統計的有意性テストについて」. Journal of Electronic Imaging . 27 (5): 053013. Bibcode :2018JEI....27e3013B. doi :10.1117/1.jei.27.5.053013. ISSN 1017-9909. S2CID 53058660.
- ^ ab Pinson, MH; Janowski, L.; Pepion, R.; Huynh-Thu, Q.; Schmidmer, C.; Corriveau, P.; Younkin, A.; Callet, P. Le; Barkowsky, M. (2012 年 10 月). 「被験者と環境が視聴覚主観テストに与える影響: 国際調査」(PDF) . IEEE Journal of Selected Topics in Signal Processing . 6 (6): 640–651. Bibcode :2012ISTSP...6..640P. doi :10.1109/jstsp.2012.2215306. ISSN 1932-4553. S2CID 10667847.
- ^ ab ITU-T P.913: インターネットビデオのビデオ品質、オーディオ品質、視聴覚品質、およびあらゆる環境におけるテレビ配信品質の主観的評価方法、2014年。
- ^ abcdef ITU-R BT.500: テレビ画像の品質の主観的評価の方法論、2012年。
- ^ Hossfeld, Tobias (2014-01-15). 「QoE クラウドテストのベストプラクティス: クラウドソーシングによる QoE 評価」. IEEE Transactions on Multimedia . 16 (2): 541–558. doi :10.1109/TMM.2013.2291663. S2CID 16862362.
- ^ Hossfeld, Tobias; Hirth, Matthias; Redi, Judith; Mazza, Filippo; Korshunov, Pavel; Naderi, Babak; Seufert, Michael; Gardlo, Bruno; Egger, Sebastian (2014 年 10 月)。「クラウドソーシングによる QoE のベスト プラクティスと推奨事項 - Qualinet タスク フォース「クラウドソーシング」から学んだ教訓」hal-01078761。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要です - ^ Janowski, Lucjan; Pinson, Margaret (2015). 「品質実験における被験者の正確性: 理論的被験者モデル」. IEEE Transactions on Multimedia . 17 (12): 2210–2224. doi : 10.1109/tmm.2015.2484963 . ISSN 1520-9210. S2CID 22343847.
- ^ Li, Zhi; Bampis, Christos G. (2017). 「ノイズの多い測定から主観的品質スコアを回復する」2017 データ圧縮会議 (DCC) . IEEE. pp. 52–61. arXiv : 1611.01715 . doi :10.1109/dcc.2017.26. ISBN 9781509067213.S2CID 14251604 。
- ^ Pinson, Margaret および Wolf, Stephen。「主観的ビデオ品質テスト方法の比較」。SPIEビデオ通信および画像処理会議、ルガーノ、スイス、2003 年 7 月。
外部リンク
- ビデオ品質専門家グループ
