
コンピュータ生成画像(CGI)は、美術、印刷媒体、シミュレーター、ビデオ、ビデオゲームなどの画像を作成または改善するためのコンピュータグラフィックスの特定の応用です。これらの画像は、静止画像(静止画)または動画(動画像)のいずれかです。CGIは、キャラクター、仮想世界、シーン、特殊効果(映画、テレビ番組、コマーシャルなど)をデザインする目的で、 2Dコンピュータグラフィックスと(より一般的には) 3Dコンピュータグラフィックスの両方を指します。アニメーションを作成または改善するためのCGIの応用は、コンピュータアニメーション(またはCGIアニメーション)と呼ばれます。
CGIと実写映像の合成を初めて用いた長編映画は『めまい』[ 1 ]で、映画のオープニングクレジットではジョン・ホイットニーによる抽象的なコンピュータグラフィックスが使用されている。映画のストーリーラインでCGIと実写映像を初めて使用した長編映画は1973年の映画『ウエストワールド』 [ 2 ]である。完全にCGIで描かれたキャラクターを初めて登場させた長編映画は1985年の映画『ヤング・シャーロック・ホームズ』で、完全にアニメーション化されたステンドグラスの騎士のキャラクターが登場する。[ 3 ] CGI を取り入れた初期の映画には、デーモン シード(1977)、スター ウォーズ(1977)、[ 2 ]トロン(1982)、スター トレック II: カーンの逆襲(1982)、[ 2 ]ゴルゴ 13: プロフェッショナル(1983)、[ 4 ]ラスト スターファイター(1984)、[ 5 ]ゴジラの逆襲(1984)、[ 6 ]アビス(1989)、ターミネーター 2: 審判の日(1991)、ジュラシック パーク(1993) などがあります。CGIを使用した最初のミュージック ビデオは、ウィル パワーズの「Adventures in Success」(1983) でした。[ 7 ] 1995 年、ピクサーのトイ ストーリーは、初のフル CGI 長編映画となり、アニメーションと映画製作の両方にとって歴史的なマイルストーンとなりました。[ 8 ] CGIが映画、バーチャルリアリティ、パーソナルコンピューティング、ゲームで普及する以前、CGIの初期の実用的な応用例の一つは、航空および軍事訓練、すなわちフライトシミュレーターでした。フライトシミュレーターで開発された視覚システムは、今日の3次元コンピュータグラフィックスおよびコンピュータ生成画像(CGI)システムの重要な前身でもありました。これは、フライトシミュレーションの目的が、飛行中の航空機の挙動を地上で再現することであったためです。この再現の多くは、現実を模倣した信憑性のある視覚合成に関係していました。[ 9 ]シンガー社(シンガーリンク)のLink Digital Image Generator(DIG)は、世界初のCGIシステムの1つと考えられていました。[ 10 ]これは、 NASAスペースシャトルやF-111で使用された、リアルタイムで3D対応の昼夜兼用システムでした。ブラックホークやB-52など。リンクのデジタルイメージジェネレーターは、パイロットの視点に現実的に対応する視覚システムを提供するアーキテクチャを備えていた。[ 11 ] DIGの基本アーキテクチャとその後の改良は、シーンマネージャ、ジオメトリプロセッサ、ビデオプロセッサ、そしてディスプレイへと続き、リアルなテクスチャ、シェーディング、半透明機能を処理し、エイリアシングのない視覚システムを最終目標としていた。[ 12 ]
仮想合成と軍事レベルの訓練要件を組み合わせる必要性と相まって、フライトシミュレーションに適用されるCGI技術は、商用コンピューティングや高予算映画で利用可能だったものよりも何年も先を行っていた。初期のCGIシステムは、平面ポリゴンで構成されるオブジェクトしか描画できなかった。1970年代と1980年代のフライトシミュレーターの視覚システムとCGIにおけるアルゴリズムと電子機器の進歩は、現代のCGIで使用されている多くの技術に影響を与え、表面にテクスチャを重ね合わせたり、画像をある詳細レベルから次の詳細レベルにスムーズに移行したりする機能を追加した。[ 13 ]
CGIの進化は1990年代にバーチャルシネマトグラフィーの出現につながり、そこではシミュレーションされたカメラの映像は物理法則に制約されない。CGIソフトウェアの普及とコンピュータの処理速度の向上により、個人アーティストや小規模企業が自宅のコンピュータからプロレベルの映画、ゲーム、美術作品を制作できるようになった。

アニメーション画像がコンピュータ生成画像の一部を構成するだけでなく、自然な風景 (フラクタル風景など) もコンピュータアルゴリズムによって生成されます。フラクタル表面を生成する簡単な方法は、三角形メッシュ法の拡張を使用することです。これは、ド・ラーム曲線の特殊なケース(例えば、中点変位)の構築に依存します。 [ 14 ]例えば、アルゴリズムは大きな三角形から開始し、それを 4 つの小さなシェルピンスキー三角形に分割して再帰的にズームインし、各点の高さを最も近い隣接点から補間することができます。[ 14 ]ブラウン表面の作成は、新しいノードが作成されるときだけでなく、メッシュの複数のレベルで追加のノイズを追加することによっても実現できます。[ 14 ]このように、比較的単純なフラクタルアルゴリズムを使用して、高さのレベルが異なる地形図を作成できます。CGI で使用される典型的なプログラミングしやすいフラクタルには、プラズマフラクタルと、より劇的な断層フラクタルがあります。[ 15 ]
高度に焦点を絞ったコンピュータ生成効果を生み出すために、多くの特定の技術が研究され開発されてきました。たとえば、石の化学的風化を表現するための特定のモデルを使用して侵食をモデル化し、特定の石ベースの表面に「古びた外観」を生成します。[ 16 ]

現代の建築家は、顧客と建設業者の両方のために、コンピュータグラフィック会社のサービスを利用して3次元モデルを作成します。これらのコンピュータ生成モデルは、従来の図面よりも正確です。建築アニメーション(インタラクティブな画像ではなく、建物のアニメーション動画を提供するもの)は、建物が環境や周囲の建物とどのような関係になるかを確認するためにも使用できます。紙と鉛筆の道具を使わずに建築空間を処理することは、現在では多くのコンピュータ支援建築設計システムで広く受け入れられている手法です。[ 17 ]
建築モデリングツールを使用すると、建築家は空間を視覚化し、インタラクティブな方法で「ウォークスルー」を実行できるため、都市レベルと建物レベルの両方で「インタラクティブな環境」を提供できます。[ 18 ]建築における具体的なアプリケーションには、建物の構造(壁や窓など)やウォークスルーの仕様だけでなく、光の効果や、日中のさまざまな時間帯に太陽光が特定のデザインにどのように影響するかも含まれます。[ 19 ] [ 20 ]
建築モデリングツールはますますインターネットベースになってきている。しかし、インターネットベースのシステムの品質は、高度な社内モデリングシステムにはまだ及ばない。[ 21 ]
アプリケーションによっては、コンピューター生成画像が歴史的建造物の「リバースエンジニアリング」に使用されます。たとえば、ドイツのゲオルゲンタール修道院のコンピューター生成による復元は、修道院の遺跡から作成されましたが、当時の建物の「外観と雰囲気」を視聴者に提供します。[ 22 ]
骨格アニメーションで使用されるコンピュータ生成モデルは、必ずしも解剖学的に正確とは限りません。しかし、科学計算・画像処理研究所(SCI)などの組織は、解剖学的に正確なコンピュータベースのモデルを開発しています。コンピュータ生成解剖モデルは、教育目的と実務目的の両方に使用できます。現在でも、フランク・H・ネッター氏による心臓画像など、アーティストが作成した多数の医療画像が医学生によって使用され続けています。しかし、オンラインで利用できる解剖モデルも数多く登場しています。
患者のX線写真1枚は、たとえデジタル化されていても、コンピュータ生成画像ではありません。しかし、CTスキャンを用いるアプリケーションでは、多数の単一スライスX線写真から3次元モデルが自動的に生成され、「コンピュータ生成画像」が作成されます。磁気共鳴画像法(MRI)を用いるアプリケーションでも、複数の「スナップショット」(この場合は磁気パルスによる)を組み合わせて、合成された内部画像が生成されます。
現代の医療応用では、「コンピュータ支援手術」において患者固有のモデルが構築されます。例えば、人工膝関節置換術では、詳細な患者固有のモデルを構築することで、手術を慎重に計画することができます。[ 23 ]これらの3次元モデルは通常、患者自身の解剖学的構造の適切な部位の複数のCTスキャンから抽出されます。このようなモデルは、心臓病の治療によく用いられる大動脈弁移植術の計画にも使用できます。冠動脈開口部の形状、直径、位置は患者によって大きく異なるため、患者の弁の解剖学的構造に酷似したモデルを(CTスキャンから)抽出することは、手術計画において非常に有益です。[ 24 ]

布製のモデルは、一般的に次の3つのグループに分類されます。
現在でも、デジタルキャラクターの服を自然な形で自動的に折り畳むことは、多くのアニメーターにとって依然として課題となっている。[ 26 ]
映画、広告、その他の公共の場での使用に加えて、コンピューターで生成された衣服の画像は、現在では一流のファッションデザイン会社によって日常的に使用されています。[ 27 ]
人間の肌の画像をレンダリングする際の課題は、3つのレベルのリアリズムに関わるものです。
細かいしわや毛穴など、目に見える最も微細な特徴は、約100μm(0.1ミリメートル)の大きさです。皮膚は、7次元の双方向テクスチャ関数(BTF)または対象物の表面上の双方向散乱分布関数(BSDF)の集合としてモデル化できます。
コンピュータ生成モデルで髪や毛皮などのテクスチャをアニメーション化する場合、まず個々の基本となる毛が作成され、その後複製されてボリュームが表現されます。[ 29 ]初期の毛は、モデルの複数の異なる部分を覆うように、長さや色が異なることがよくあります。このテクニックは、ピクサーの『モンスターズ・インク』(2001年)でキャラクターのサリーに特に使用され、約1,000本の初期毛が生成され、その後2,800回複製されました。[ 29 ]複製の数は、求められる詳細レベルに応じて、数千から数百万に及ぶことがあります。
インタラクティブな視覚化とは、動的に変化する可能性のあるデータをレンダリングし、ユーザーが複数の視点からデータを表示できるようにするものです。応用分野は、流体力学における流れのパターンの視覚化から特定のコンピュータ支援設計アプリケーションまで、大きく異なります。[ 30 ]レンダリングされたデータは、ユーザーがシステムとやり取りするにつれて変化する特定の視覚シーンに対応する場合があります。たとえば、フライトシミュレータなどのシミュレータは、世界を表現するためにCGI技術を幅広く利用しています。[ 31 ]
抽象レベルでは、インタラクティブな視覚化プロセスには、生データが管理され、レンダリングに適した形式にフィルタリングされる「データパイプライン」が含まれます。これはしばしば「視覚化データ」と呼ばれます。視覚化データは、レンダリングシステムに供給できる「視覚化表現」にマッピングされます。これは通常「レンダリング可能な表現」と呼ばれます。この表現は、表示可能な画像としてレンダリングされます。[ 31 ]ユーザーがシステムと対話するにつれて(たとえば、ジョイスティックコントロールを使用して仮想世界内での位置を変更するなど)、生データがパイプラインに供給されて新しいレンダリング画像が作成され、多くの場合、このようなアプリケーションではリアルタイムの計算効率が重要な考慮事項となります。[ 31 ] [ 32 ]
コンピューターで生成された風景画像は静止画である場合もあるが、コンピューターアニメーションは映画のような動的な画像にのみ適用される。ただし、一般的にコンピューターアニメーションという用語は、ユーザー操作を許容しない動的な画像を指し、インタラクティブなアニメーション環境には仮想世界という用語が用いられる。
コンピュータアニメーションは、基本的に3Dモデルのストップモーションアニメーションや2Dイラストのフレームごとのアニメーションといった従来のアニメーション技法をデジタル化したものです。コンピュータで生成されるアニメーションは、特殊効果用のミニチュアを製作したり、群衆シーンにエキストラを雇ったりといった、より物理的な手法よりも制御が容易であり、他の技術では実現不可能な映像制作を可能にします。また、俳優や高価なセット、小道具を使わずに、一人のグラフィックアーティストがそのようなコンテンツを制作することもできます。
動きの錯覚を生み出すために、コンピュータ画面に画像が表示され、前の画像と似ているが時間軸上でわずかに進んだ新しい画像(通常は毎秒24または30フレーム)に繰り返し置き換えられます。この技術は、テレビや映画で動きの錯覚を生み出す方法と全く同じです。

an astronaut riding a horse, by Hiroshigeテキスト・トゥ・イメージ(T2IまたはTTI)モデルとは、入力された自然言語のプロンプトを受け取り、その説明に一致する画像を生成する機械学習モデルである。
テキストから画像への変換モデルは、深層ニューラルネットワークの進歩により、AIブームが始まった2010年代半ばに徐々に開発され始めました。2022年には、OpenAIのDALL-E 2、Google BrainのImagen、Stability AIのStable Diffusion、Midjourney 、RunwayのGen-4といった最先端のテキストから画像への変換モデルの出力が、実際の写真や人間が描いた絵の品質に近づいていると見なされるようになりました。
テキストから画像へのモデルは一般的に潜在拡散モデルであり、ピクセル空間で直接拡散処理を行うのではなく、圧縮された潜在空間で拡散処理を行います。オートエンコーダー(多くの場合、変分オートエンコーダー)を使用して、ピクセル空間とこの潜在表現の間で変換を行います。これらのシステムは通常、事前学習済みの言語モデルまたは視覚言語モデルを使用して入力プロンプトをテキスト埋め込みに変換し、拡散ベースの生成画像モデルを使用してその埋め込みに基づいて画像を生成します。最も効果的なモデルは一般的に、Webからスクレイピングされた大量の画像データとテキストデータで学習されています。[ 33 ]


仮想世界は、エージェントベースのシミュレーション環境であり、ユーザーはアバターを使用して、人工的にアニメーション化されたキャラクター(ソフトウェアエージェントなど)や他の物理的なユーザーとインタラクトできます。仮想世界は、ユーザーが居住してインタラクトすることを目的としており、今日では、ユーザーが他のユーザーにグラフィカルに表示されるアバターの形をとるインタラクティブな3D仮想環境とほぼ同義語になっています。 [ 34 ]これらのアバターは通常、テキスト、2次元、または3次元のグラフィカル表現として描かれますが、他の形式も可能です[ 35 ](たとえば、聴覚[ 36 ]や触覚)。仮想世界の中には、複数のユーザーを許可するものもありますが、すべてではありません。
コンピューター生成画像は、主に2000年代初頭から法廷で使用されてきました。しかし、一部の専門家は、それが偏見を招く可能性があると主張しています。コンピューター生成画像は、裁判官や陪審員が出来事の順序、証拠、または仮説をよりよく視覚化するのを助けるために使用されます。[ 37 ]しかし、1997年の研究では、人々は直感的な物理学者としては劣っており、コンピューター生成画像に容易に影響されることが示されました。[ 38 ]したがって、陪審員やその他の法的意思決定者は、そのような証拠が単なる可能性のある出来事の順序の表現であることを認識することが重要です。
天気予報の視覚化は、テレビにおけるCGIの最初の応用例でした。天気予報グラフィックを生成するためのコンピュータシステムを最初に提供した企業の1つは、 1979年にApple IIコンピュータをベースにした「LiveLine」を発表したColorGraphics Weather Systems社でした。ColorGraphics社は後に、Dazzlerビデオグラフィックカードを搭載したCromemcoコンピュータを使用するモデルを発表しました。
天気予報では、複数のカメラやその他の画像機器からリアルタイムで撮影された映像をフルモーションビデオで表示することが一般的になっている。3Dグラフィックスシンボルと共通の仮想地理空間モデルを組み合わせ、これらのアニメーション映像は、テレビにおけるCGIの真の応用例と言える。
スポーツ中継ではCGIが一般的になっています。スポーツやエンターテイメントの会場では、観客の視聴体験を向上させるために、トラッキングカメラフィードを通して透視およびオーバーレイコンテンツが提供されています。例としては、アメリカンフットボールの試合のテレビ放送で見られる黄色の「ファーストダウン」ラインがあり、これは攻撃チームがファーストダウンを獲得するために越えなければならないラインを示しています。CGIは、フットボールやその他のスポーツイベントに関連して、競技エリアの映像に商業広告を重ねて表示するためにも使用されます。ラグビー場やクリケット場の一部にもスポンサー画像が表示されます。水泳中継では、レースの進行に合わせて現在の記録保持者の位置を示すためにレーンに線が追加されることが多く、視聴者が現在のレースを最高のパフォーマンスと比較できるようにします。その他の例としては、ホッケーパックのトラッキングやレーシングカーのパフォーマンスの注釈[ 39 ]、スヌーカーボールの軌道[ 40 ] [ 41 ]などがあります。現実世界と正しく整合したテレビのCGIは、拡張現実と呼ばれることもあります。
コンピュータ生成画像は、CGIやアニメーションに伴う欠点をより効果的に補うために、モーションキャプチャと組み合わせて使用されることが多い。コンピュータ生成画像は、そのリアルさによって実用的な用途が制限されます。非現実的、または管理が不十分なコンピュータ生成画像は、不気味の谷効果を引き起こす可能性があります。[ 42 ]この効果は、人間に不気味なほど似ているが少し違うものを人間が認識できる能力を指します。このような能力は、人間の体の複雑な解剖学的構造のために、それを完全に再現できないことが多い通常のコンピュータ生成画像の欠点です。アーティストは、モーションキャプチャを使用して、人間が動作している映像を取得し、それをコンピュータ生成画像で完全に再現して、自然に見えるようにすることができます。
多くの場合、モーションキャプチャは俳優の全身の動きを正確に模倣し、若返りによって外見をわずかに変化させるために必要です。若返りは、顔スキャン技術、モーションキャプチャ、写真参照などを使用して俳優の外見を変更するために使用される視覚効果です。これは、俳優を若く見せるためにフラッシュバックシーンやカメオ出演でよく使用されます。マーベルのX-MEN: ファイナル ディシジョンは、若返りを公に採用した最初の映画であり、俳優のパトリック・スチュワートとイアン・マッケランの若い頃のキャラクターが登場するフラッシュバックシーンで使用されました。[ 43 ]視覚効果はLola VFX社によって行われ、若い頃に撮影された俳優の写真が参照として使用され、後でCGIを使用して顔のしわを滑らかにしました。時間の経過とともに、若返り技術は進歩し、映画「Here (2024)」では、デジタルAI技術を使用して俳優を若く見せ、何百万もの顔の特徴をスキャンし、その多くを俳優の顔に組み込んで外見を変更しています。[ 44 ]
解剖学的に正確なデジタルモデルが不足していることが、コンピュータ生成画像で使用されるモーションキャプチャの必要性につながっています。コンピュータ生成画像はレンダリングされるオブジェクトの外側、つまり皮膚のみを反映するため、話すなどの細かい運動技能で使用される相互に連動する筋肉群間の極めて小さな相互作用を捉えることができません。唇の形や舌の動きで音を出すときの顔の絶え間ない動きと、話すことに伴う顔の表情は、手で再現するのが困難です。[ 45 ]モーションキャプチャは顔の筋肉の根本的な動きを捉え、音声に伴う視覚をより良く再現することができます。
{{cite book}}: CS1 maint: 複数の名前: 著者リスト (リンク)