動画コピー検出とは、違法にコピーされた動画を分析し、オリジナルコンテンツと比較することによって、それらを検出するプロセスです。
このプロセスの目的は、動画制作者の知的財産を保護することです。
Indyk ら[ 1 ] は、映画の長さに基づいてビデオのコピー検出理論を考案しましたが、これは変更のない映画全体にのみ有効でした。短いビデオクリップに適用した場合、Indyk らの手法ではクリップがコピーであることを検出できません。
その後、 Oostveenらは、動画の内容に基づいて動画固有の署名を作成する、指紋(ハッシュ関数)の概念を導入しました。この指紋は、動画をグリッドに分割することで決定される動画の長さと明るさに基づいています。指紋はそれぞれの動画の特定の特徴しか記述しないため、元の動画を再現するために使用することはできません。
少し前に、B.Coskunらは離散コサイン変換に基づく2つの堅牢なアルゴリズムを発表しました。
ハンパプールとバレは、動画の動き、色、空間、長さに基づいて、動画全体を包括的に記述するアルゴリズムを開発した。
画像の色レベルを調べることが考えられ、そのため、Liらは、各フレームのヒストグラムからバイナリ署名を取得してクリップの色を調べるアルゴリズムを作成した。しかし、このアルゴリズムは、ロゴがビデオに追加されている場合、一貫性のない結果を返す。これは、ロゴの色要素の挿入によって、システムを混乱させる可能性のある誤った情報が追加されるためである。

ウォーターマークは、動画に目に見えない信号を挿入することで、不正コピーの検出を容易にする技術です。この技術は写真家によって広く利用されています。視聴者が容易に確認できる場所にウォーターマークを動画に配置することで、コンテンツ制作者は画像がコピーされたかどうかを容易に検出できます。
透かしの欠点は、元の画像に透かしが入っていない場合、他の画像がコピーであるかどうかを知ることができない点です。

この手法では、動画の内容に基づいて動画固有の署名が作成されます。動画の内容の特徴を利用して動画に固有のビデオハッシュを割り当てる、さまざまな動画コピー検出アルゴリズムが存在します。このフィンガープリントは、データベース内の他のビデオハッシュと比較することができます。
この種のアルゴリズムには重大な問題があります。動画の内容のさまざまな側面が似ている場合、問題の動画がオリジナル動画のコピーなのか、単に似ているだけなのかをアルゴリズムが判断するのは困難です。このような場合(例えば、2つの異なるニュース放送)、ニュース放送では似たようなバナーが使われることが多く、プレゼンターの位置も似ていることが多いため、アルゴリズムは問題の動画がコピーであると判断する可能性があります。時間経過に伴うフレームの変化が非常に少ない動画は、ハッシュ衝突が発生しやすくなります。
以下は、動画コピー検出のために提案されているアルゴリズムと手法の一部です。
このアルゴリズムでは、グローバル強度は、ビデオ全体にわたって重み付けされたすべてのピクセルの強度の合計として定義されます。したがって、ビデオの長さとビデオ全体にわたるピクセル強度に基づいて、ビデオサンプルの識別情報を構築できます。
グローバル強度a(t)は次のように定義されます。
ここで、kは画像の重み、Iは画像、Nは画像のピクセル数である。
このアルゴリズムでは、動画はグレースケール値に基づいてN個のブロックに分割されます。そして、各ブロックの平均グレースケール値を表すベクトルを作成することができます。
これらの平均レベルを用いることで、ビデオのシグネチャである新しいベクトルS(t)を作成することが可能です。
2つの動画を比較するために、このアルゴリズムは両者の類似性を表すD(t)を定義します。
D(t)によって返される値は、問題のビデオがコピーであるかどうかを判断するのに役立ちます。
この手法はL.ChenとF.Stentifordによって提案されました。類似性の測定は、前述の2つのアルゴリズム、グローバル時間記述子とグローバル順序測定記述子を時間と空間で組み合わせることによって行われます。
2019年、FacebookはTMK+PDQFをオープンソース化しました。[ 2 ]これはFacebookで有害コンテンツを検出するために使用されているツール群の一部です。動画全体の署名を生成し、フォーマットの変更や追加された透かしにも容易に対応できますが、切り抜きやクリッピングにはあまり寛容ではありません。[ 3 ]
A. Jolyらが提唱したこのアルゴリズムは、Harrisの注目点検出器を改良したものです。この手法は、多くの動画において多数のフレームがほぼ同一であるため、すべてのフレームをテストするのではなく、動きの大きいフレームのみをテストする方が効率的であることを示唆しています。
ViCopTは、各画像から抽出した特徴点を用いて、動画全体の特徴を定義します。各画像において、アルゴリズムは2つの部分を識別・定義します。1つは背景、つまり時間的なシーケンスに沿って静止している要素の集合です。もう1つは動き、つまり動画全体を通して位置が変化する持続的な点です。
このアルゴリズムは、I. LaptevとT. Lindebergによって開発されました。空間と時間に沿った特徴点技術を用いてビデオの特徴を定義し、この特徴を格納する34次元ベクトルを作成します。
現在、動画コピー検出のためのアルゴリズムは既に存在している。2007年には、MUSCLE(Multimedia Understanding Through Semantics, Computation and Learning)と呼ばれる評価ショーケースが開催され、家庭用ビデオ録画から1分から1時間の長さのテレビ番組の断片まで、さまざまなビデオサンプルを用いて動画コピー検出アルゴリズムのテストが行われた。