ボリューム記録またはボリュームビデオは、場所やパフォーマンスなどの3次元空間を記録する技術です。[ 1 ]このタイプのボリュームグラフィーは、2D投影として視覚化できるデータと、3DディスプレイやVRヘッドセットを使用して視覚化できるデータを取得します。消費者向けのフォーマットは数多くあり、必要なモーションキャプチャ技術は、コンピュータグラフィックス、フォトグラメトリ、およびその他の計算ベースの方法に依存しています。視聴者は通常、リアルタイムエンジンで結果を体験し、生成されたボリュームを探索するために直接入力できます。[ 2 ]

平面スクリーンの制約を受けずに才能を記録することは、SF作品で長い間描かれてきました。ホログラムや3Dの実写映像は、スター・ウォーズ、ブレードランナー、その他多くのSF作品で長年にわたり重要な役割を果たしてきました。コンピュータグラフィックス、光学、データ処理の分野における進歩に伴い、このフィクションは徐々に現実のものへと進化してきました。立体映像は、写真の視覚的な品質と空間化されたコンテンツの没入感とインタラクティブ性を組み合わせたものであり、立体映画や360°動画の次の論理的なステップであり、現代映画の誕生以来、人間のパフォーマンスを記録する上で最も重要な発展となる可能性があります。[ 2 ]
動画、写真、その他の計測方法から3Dモデルを作成することは、コンピュータグラフィックスにおいて常に重要なテーマでした。究極の目標は、現実を細部に至るまで忠実に再現しつつ、クリエイターが自身のビジョンに合った世界をこの基盤の上に構築できるようにすることです。従来、アーティストはコンピュータグラフィックスの誕生以来数十年にわたって開発されてきたモデリングとレンダリング技術を用いてこれらの世界を創造してきました。映画やビデオゲームの視覚効果は、フォトグラメトリー、スキャン装置、そしてこれらの新しい高度な手法から得られるデータを処理するための計算バックエンドの進歩への道を開きました。一般的に、これらの進歩はエンターテインメントやメディア向けのより高度なビジュアル制作の結果としてもたらされたものですが、この分野自体の目標ではありませんでした。

LIDARスキャンは、レーザーでサンプリングされた点を密集させて静止物体をスキャンし、点群を作成する測量方法を指します。これには物理的なスキャナーが必要で、膨大な量のデータが生成されます。2007 年に、バンドのレディオヘッドは「ハウス・オブ・カード」のミュージック ビデオを作成するためにこれを大々的に使用し、歌手の顔や特定の環境の点群パフォーマンスをキャプチャしました。これは、ボリューム キャプチャにこの技術を使用した最初の例の 1 つです。監督のジェームズ フロストはメディア アーティストのアーロン コブリンと協力して、このミュージック クリップで使用される 3D 点群をキャプチャしました。この作品の最終的な出力はまだレンダリングされた平面的なデータ表現でしたが、キャプチャと作者の考え方はすでに時代を先取りしていました。点群は、位置と色を持つ 3 次元空間の個別のサンプルであり、膨大な量のデータを使用して現実世界を高忠実度で表現します。しかし、このデータをリアルタイムで表示することはまだ不可能でした。

2010年、マイクロソフトはKinectを市場に投入しました。これは、赤外線スペクトルの構造化光を用いてカメラから3Dメッシュを生成する消費者向け製品でした。ユーザー入力とゲームプレイの簡素化と革新を目的としていましたが、ボリュームキャプチャコミュニティでは、3Dデータ用の汎用キャプチャデバイスとしてすぐに採用されました。既知のパターンを空間に投影し、シーン内のオブジェクトによる歪みをキャプチャすることで、キャプチャ結果をさまざまな出力に変換できます。アーティストや愛好家は、この手頃な価格のデバイスを活用してツールやプロジェクトを作成し始め、創造的なメディアとしてのボリュームキャプチャへの関心が高まりました。
マイクロソフトの研究者たちは、複数のカメラ、Kinect デバイス、および光学情報と深度情報を組み合わせた完全なボリュームキャプチャを生成するアルゴリズムを使用して、キャプチャ ステージ全体を構築しました。これが現在、Microsoft Mixed Reality Capture Studio であり、研究部門の一部として、またBlade Runner 2049 VR エクスペリエンスなどの特定の商業エクスペリエンスの一部として使用されています。現在、ワシントン州レドモンド、カリフォルニア州サンフランシスコ、およびイギリスのロンドンの 3 つのスタジオが稼働しています。これはハイエンド市場にとって非常に興味深いセットアップですが、単一の Kinect デバイスの価格が手頃になったことで、より多くの実験的なアーティストや独立系ディレクターがボリュームキャプチャの分野で活動するようになりました。[ 3 ]この活動から生まれた 2 つの成果がDepthkitとEF EVE™です。EF EVE™ は、1 台の PC で無制限の数の Azure Kinect センサーをサポートし、簡単なセットアップで完全なボリュームキャプチャを実現します。また、自動センサー キャリブレーションと VFX 機能も備えています。Depthkit は、Azure Kinect を含む 1 つの構造化光センサーでジオメトリ データをキャプチャできるソフトウェア スイートです。[ 4 ]また、接続されたウィットネス カメラから高品質のカラー ディテールを取得できます。

写真測量法は、写真参照に基づいてデータを測定するプロセスを指します。写真そのものと同じくらい古い技術ですが、長年にわたる体積キャプチャ研究の進歩により、多数の入力画像からより多くの形状とテクスチャの詳細をキャプチャすることが可能になりました。結果は通常、静的ジオメトリとフルパフォーマンスキャプチャという2つの合成ソースに分割されます。静的ジオメトリの場合、多数の重なり合うデジタル画像でキャプチャされたセットは、画像内の類似した特徴を使用して互いに位置合わせされ、三角測量と深度推定のベースとして使用されます。この情報は3Dジオメトリとして解釈され、セットのほぼ完璧なレプリカが得られます。一方、フルパフォーマンスキャプチャでは、ビデオカメラのアレイを使用してリアルタイム情報をキャプチャします。これらの同期されたカメラは、フレームごとに使用されて、高速で再生できる一連の点またはジオメトリを生成し、あらゆる環境に合成できるフルボリュームパフォーマンスキャプチャが得られます。2008年、4DViews [ 5 ]は、東京(日本)のDigiCastスタジオに最初のボリュームビデオキャプチャシステムを設置しました。 2015年後半には8iがこの分野に貢献し、最近ではIntel、Microsoft [ 6 ] 、 Samsung [ 7 ]がパフォーマンスキャプチャとフォトグラメトリ用の独自のキャプチャステージを作成することで参加しました。

ボリュームビデオが環境やパフォーマンスのキャプチャに商業的に応用可能なアプローチへと発展するにつれ、6自由度で結果の中を動き回り、真の立体視を実現するには、新しいタイプのディスプレイデバイスが必要となりました。2016年にOculus RiftやHTC Viveなどのデバイスを通じて消費者向けVRが台頭したことで、これが突然可能になりました。立体視と、頭部を回転・移動させ、狭い空間でも移動できる機能により、過去には不可能だった環境への没入感を実現できます。キャプチャの撮影特性とこの没入感、そしてそれによって生まれるインタラクティブ性が組み合わさることで、真の仮想現実という聖杯に大きく近づきました。360°ビデオコンテンツの台頭に伴い、6自由度キャプチャの需要が高まっており、特にVRはこの技術の応用を推進し、映画、ゲーム、アートをボリュームキャプチャ研究の分野と徐々に融合させています。ボリュームビデオは現在、Meta QuestやApple Vision Proデバイス上のScenezアプリケーションを介して仮想コンサートを配信するために使用されています。

ライトフィールドは、特定のサンプルポイントにおけるあらゆる方向からの入射光を記述します。これは、被写界深度などの効果を生成するためにポストプロセスで使用され、ユーザーが頭をわずかに動かすことを可能にします。Lytroは2006年以来、ライトフィールドのキャプチャを可能にするコンシューマー向けカメラを開発しています。フィールドは、カメラ内で内側から外側へ、または3Dジオメトリのレンダリングから外側から内側へキャプチャでき、操作可能な膨大な量の情報を表します。現在、データレートは依然として大きな課題ですが、この技術は光をサンプリングし、さまざまな方法で結果を表示するため、将来的に大きな可能性を秘めています。
この技術のもう一つの副産物は、シーンのかなり正確な深度マップです。つまり、各ピクセルがカメラからの距離に関する情報を持っているということです。FacebookはこのアイデアをSurround360カメラシリーズで活用し、距離マップを利用して合成される360°動画を撮影しています。この生データを抽出することは可能で、あらゆるステージを高解像度で撮影できます。ただし、データレートと深度マップの精度が大きなボトルネックとなっていますが、より高度な深度推定技術、圧縮、パラメトリックライトフィールドによって、間もなく克服されるでしょう。
現在、ボリュームビデオを生成するためのさまざまなワークフローが利用可能です。これらは相互に排他的ではなく、組み合わせて効果的に使用されます。以下に、それらの例をいくつか示します。[ 2 ]
この手法では、コンピュータゲームや視覚効果で使用されるジオメトリと同様の、より伝統的な3D三角形メッシュが生成されます。データ量は通常少なくなりますが、実世界のデータを低解像度データに量子化するため、解像度と視覚的な忠実度が制限されます。一般的に、メッシュ密度と最終的なユーザーエクスペリエンスのパフォーマンスの間でトレードオフが生じます。
フォトグラメトリは通常、スタティックメッシュのベースとして使用され、その後、ビデオグラメトリと同じ基盤技術を用いてタレントのパフォーマンスキャプチャによって補強されます。最終的な三角形セットを作成するには、徹底的なクリーンアップ作業が必要です。物理世界を超えて拡張するために、CG技術を導入してキャプチャされたデータをさらに強化し、必要に応じてアーティストがスタティックメッシュに構築や追加を行うことができます。再生は通常、リアルタイムエンジンによって処理され、実装は従来のゲームパイプラインに似ており、インタラクティブな照明変更や、スタティックメッシュとアニメーションメッシュを創造的かつアーカイブ可能な方法で合成することが可能です。
近年、注目はポイントベースのボリュームキャプチャへと移りつつある。得られるデータは、色やポイントサイズなどの属性を持つ3D空間内のポイントまたはパーティクルとして表現される。これにより、より高い情報密度と高解像度コンテンツを実現できる。しかし、必要なデータレートは膨大であり、現在のグラフィックスハードウェアはメッシュベースのレンダリングパイプラインに最適化されているため、この方式でのレンダリングには適していない。
ポイントの主な利点は、空間解像度が高くなる可能性があることです。ポイントは、事前に計算された照明を備えた三角形メッシュ上に散布することも、LIDAR スキャナから直接使用することもできます。[ 8 ]タレントのパフォーマンスは、メッシュベースのアプローチと同様にキャプチャされますが、制作時により多くの時間と計算能力を使用してデータをさらに改善できます。再生時には、「詳細レベル」を使用して再生デバイスの計算負荷を管理し、ポリゴンの数を増減できます。[ 9 ]データの大部分が事前にベイクされているため、インタラクティブな照明の変更を実現するのは困難です。これは、ポイントとともに保存される照明情報が非常に正確で高忠実度である一方で、特定の状況で簡単に変更する機能がないことを意味します。ポイント キャプチャのもう 1 つの利点は、コンピュータ グラフィックスを非常に高い品質でレンダリングし、ポイントとして保存できるため、現実の要素と想像上の要素を完璧に融合できることです。
データの取得と生成後、リアルタイムエンジン内で編集と合成が行われ、記録されたアクションをつなぎ合わせて意図したストーリーが展開されます。最終的な成果物は、取得されたデータの平面レンダリングとして、またはVRヘッドセットでインタラクティブに表示できます。
体積キャプチャにおけるポイントベースのアプローチの目標の一つは、クラウドから自宅のユーザーにポイントデータをストリーミング配信し、オンデマンドでリアルな仮想世界を作成・配信することである。一方、近年検討されているもう一つの目標は、ライブイベントのリアルタイムデータストリームである。ピクセル情報には深度データが含まれるため(つまりボクセルとなるため)、これには非常に高い帯域幅が必要となる。
体積データは、実際のアプリケーションにおいて、その取得と作成に関していくつかの課題に直面しています。以下に、この技術全般における一般的な問題点と限界をいくつか挙げます。
あらゆるメディアが独自の視覚言語、ルール、そして創造的なアプローチを生み出すという点において、ボリュメトリックビデオはまだ比較的未発達な段階にある。これは、動画に音声が加わった時と同様で、新たなデザイン哲学を生み出し、検証する必要があった。現在、映画という言語において、演出の芸術は100年以上にわたって発展してきたが、6自由度とインタラクティブで非線形な世界においては、多くの伝統的なアプローチが困難に直面している。体験がより頻繁に創造され、分析されるほど、コミュニティはこの体験の言語についてより早く結論に達することができるだろう。
撮影したデータを保存・再生するには、大量のデータを消費者にストリーミング配信する必要があります。現状では、専用アプリを開発して配信するのが最も効率的な方法です。動画専門家グループ(MPEA)は、より効率的なデータストリーミング方法を模索しており、データの圧縮技術の開発が進められています。この課題は、動画配信が主流となる前に解決しておく必要があります。
エンターテインメントでの応用以外にも、上記のような詳細なシーンの撮影に関心を持つ業界がいくつかあります。スポーツイベントは、試合の状況を詳細にリプレイすることで大きな恩恵を受けるでしょう。これはすでにアメリカンフットボールや野球、そしてイギリスのサッカーで行われています。[ 10 ]将来、360度リプレイによって視聴者は試合を複数の視点から分析できるようになります。
歴史的な出来事の場を記録し、それを生で撮影したり再現したりすることは、教育分野に大きな恩恵をもたらします。歴史上の大きな出来事を没入型の要素で描いたバーチャル講義は、未来の世代が空間を想像し、出来事について共同で学ぶのに役立ちます。これは抽象化して、人類の歴史の流れを変えた壮大な出来事だけでなく、細胞レベルのミクロなシナリオを視覚化するためにも使用できます。バーチャルフィールドトリップの主な利点は、高度な教育シナリオを民主化することです。実際に博物館に行かなくても見学に参加できるため、より幅広い層の人々が参加でき、また、現在展示されている一部だけでなく、所蔵品全体を展示することも可能になります。
不動産や観光業界では、目的地をより正確にプレビューできる可能性があり、小売業界は個々の顧客に合わせたカスタマイズが可能になるだろう。靴に関しては既に商品イメージの撮影が行われており、店舗ではマジックミラーを使ってこれらの商品を視覚化できる。ショッピングモールは、VRアーケードで顧客を引き付けたり、商品をバーチャルに展示したりすることで集客を図るため、これらの技術の導入を始めている。