ビデオコンテンツ分析、またはビデオコンテンツアナリティクス(VCA )は、ビデオ分析またはビデオアナリティクス(VA )とも呼ばれ、ビデオを自動的に分析して時間的および空間的なイベントを検出および特定する機能です。
この技術的能力は、エンターテインメント[ 1 ] 、ビデオ検索とビデオ閲覧[ 2 ]、ヘルスケア、小売、自動車、輸送、ホームオートメーション、炎と煙の検出、安全、セキュリティ[ 3 ]など、幅広い分野で使用されています。アルゴリズムは、汎用マシン上のソフトウェアとして、または専用のビデオ処理ユニットのハードウェアとして実装できます。
VCAではさまざまな機能を実装できます。ビデオモーション検出は、固定された背景シーンに対して動きを検出する、よりシンプルな形式の1つです。より高度な機能には、ビデオトラッキング[ 4 ]や自己運動推定[ 5 ]などがあります。
VCAが機械内で生成する内部表現に基づいて、ビデオ要約[ 6 ]識別、行動分析、その他の状況認識などの他の機能を構築することが可能です。
VCAは良質な入力ビデオに依存するため、ビデオノイズ除去、画像安定化、アンシャープマスキング、超解像などのビデオ強調技術と組み合わせて使用されることが多い。
いくつかの記事では、ビデオ分析アプリケーションの開発に関わるモジュールの概要が説明されています。[ 7 ] [ 8 ]これは、既知の機能のリストと簡単な説明です。
VCAは比較的新しい技術であり、2000年代半ばには多くの企業がVCA強化製品をリリースしました。[ 10 ] [ 11 ] [ 12 ]アプリケーションは多数ありますが、さまざまなVCAソリューションの実績は大きく異なります。モーション検出、人数カウント、銃検出などの機能は市販の既製品として利用可能であり、十分な実績があると考えられています(たとえば、dsprobotics Flowstoneのようなフリーウェアでも、動きと色の分析を処理できます)。COVID -19パンデミックに対応して、多くのソフトウェアメーカーは、フェイスマスク検出やソーシャルディスタンス追跡などの新しい公衆衛生分析を導入しました。[ 13 ] [ 14 ] [ 15 ]
多くの分野で、VCAはCCTVシステムに実装されており、カメラに分散配置(エッジ)されているか、専用の処理システムに集中配置されています。ビデオ分析とスマートCCTVは、セキュリティ分野におけるVCAの商用用語です。英国では、BSIAがセキュリティ分野におけるVCAの入門ガイドを作成しました。[ 16 ]ビデオ分析に加えて、それを補完するために、音声分析も使用できます。[ 17 ]
ビデオ管理ソフトウェアメーカーは、利用可能なビデオ分析モジュールの範囲を絶えず拡大しています。新しい容疑者追跡技術により、対象者のあらゆる動きを簡単に追跡することが可能になります。対象者がどこから来たのか、いつ、どこで、どのように移動したのかなどです。特定の監視システムでは、インデックス技術によって、特定の期間中または一定期間内にカメラの視野内にいた、類似した特徴を持つ人物を特定できます。通常、システムは類似した特徴を持つ多数の人物を検出し、スナップショットの形で表示します。オペレーターは、追跡する必要のある画像と対象をクリックするだけで済みます。1分程度で、特定の人物のすべての動きを追跡し、動きのステップバイステップのビデオを作成することもできます。
Kinectは、 Xbox 360ゲーム機用のアドオン周辺機器で、ユーザー入力の一部にVCAを使用しています。[ 18 ]
小売業界では、VCAは店内での買い物客の行動を追跡するために使用されています。[ 19 ]この方法で、店舗のヒートマップを取得でき、これは店舗設計やマーケティングの最適化に役立ちます。その他の用途としては、商品を見ているときの滞在時間や、持ち出し/置き忘れた商品の検出などがあります。
商用環境における VCA の品質を判断することは困難です。使用事例、実装、システム構成、コンピューティング プラットフォームなど、多くの変数に依存します。商用環境における品質を客観的に把握するための一般的な方法としては、独立したベンチマーク[ 20 ]や指定されたテスト場所などがあります。
VCAは、特にロンドンのO2アリーナやロンドン・アイなどで、群衆管理の目的で使用されてきました。
警察や法医学者は、犯罪行為を捜査する際にCCTVの映像を分析します。警察は、Kinesenseなどのソフトウェアを使用して、ビデオコンテンツ分析を行い、ビデオ内の重要な出来事を検索して容疑者を見つけます。調査によると、事件の最大75%にCCTVが関係しています。警察は、ビデオコンテンツ分析ソフトウェアを使用して、長いビデオから重要な出来事を検索します。[ 21 ] [ 22 ]
ビデオコンテンツ分析は、コンピュータビジョン、ひいては人工知能のサブセットです。主要な学術ベンチマークイニシアチブは、i-LIDS ビデオ映像の一部を使用する TRECVID [ 23 ] と PETS ベンチマークデータ [ 24 ] の 2 つです。これらは、追跡、置き忘れ荷物の検出、仮想フェンスなどの機能に焦点を当てています。UCF101 [ 25 ]などのベンチマークビデオデータセットは、畳み込みニューラルネットワークと長短期記憶を使用して、時間的および空間的な視覚的注意を組み込んだアクション認識研究を可能にします。ビデオ分析ソフトウェアは、公開用に映像をより簡単に編集し、ビデオ内のイベントや人物を特定するために、ボディカメラやダッシュボードカメラの映像と組み合わせて使用されることもあります。[ 26 ]
EUは、組み込みシステム上のビデオコンテンツ分析を警察や交通セキュリティデータベースと統合するためのFP7プロジェクトP-REACT [ 27 ]に資金を提供している。 [ 28 ]
ビデオ監視用の人工知能は、監視カメラからの音声と画像を分析して、人間、車両、物体、イベントを認識するコンピュータソフトウェアプログラムを利用します。セキュリティ請負業者のプログラムは、カメラの視野内の制限区域(フェンスで囲まれた区域、駐車場(ただし、歩道や駐車場外の公道は除く)など)を定義し、カメラ監視で保護されている物件の時間帯(営業時間終了後など)を設定するソフトウェアです。人工知能(AI)は、その時間帯にその区域への立ち入りが禁止されているという「ルール」に違反する侵入者を検出すると、アラートを送信します。