
人工知能ビジュアルアート、またはAIアートとは、人工知能(AI)プログラムの実装によって生成または強化されたビジュアルアート作品であり、最も一般的にはテキストから画像へのモデルが使用されます。自動化されたアート制作のプロセスは古代から存在しています。人工知能の分野は1950年代に設立され、アーティストは学問分野の設立後まもなく人工知能を使用してアートを制作し始めました。これらの作品の一部は美術館で展示され、賞を受賞しています。[ 1 ] AIはその歴史を通じて、人間の心、人工存在、人間とAIのコラボレーションにおけるアートの本質に関連する多くの哲学的問題を提起してきました。
2020年代のAIブームの間、 Midjourney、DALL-E、Stable Diffusionなどのテキストから画像へのモデルが一般に広く利用可能になり、ユーザーは少ない労力で画像を素早く生成できるようになりました。[ 2 ] [ 3 ] 2020年代のAIアートに関する論評は、著作権、欺瞞、名誉毀損、および技術的失業を含むより伝統的なアーティストへの影響に関連する問題に焦点を当てることがよくあります。
2023年8月、米国最高裁判所は、AIアートは人間の著作者の要件を満たしていないため著作権の対象にならないとの判決を下した。[ 4 ] [ 5 ] 2026年3月、同裁判所は、AI生成アートが著作権の対象となるかどうかについての訴訟の審理を拒否した。[ 6 ] [ 7 ] [ 8 ]
自動化された芸術は、少なくとも古代ギリシャ文明のオートマタにまで遡り、ダイダロスやアレクサンドリアのヘロンなどの発明家が、文字を書いたり、音を生成したり、音楽を演奏したりできる機械を設計したとされています。[ 9 ] [ 10 ]創造的なオートマタは歴史を通じて繁栄しており、 1800年頃に作られた、複数の絵や詩を作成できるマイヤルデのオートマタなどが挙げられます。 [ 11 ]
また19世紀には、エイダ・ラブレスが「計算操作」が音楽や詩の生成に利用できる可能性があると記した。[ 12 ] [ 13 ] 1950年、アラン・チューリングの論文「計算機械と知能」は、機械が人間の行動を説得力をもって模倣できるかどうかに焦点を当てた。[ 14 ]その後まもなく、 1956年にダートマス大学の研究ワークショップで人工知能という学問分野が創設された。[ 15 ]
AIの創設以来、AI研究者は人間の心の性質や、人間のような知能を持つ人工生命体を作り出すことの結果に関する哲学的問題を探求してきました。これらの問題は、古代から神話、フィクション、哲学によって探求されてきました。[ 16 ]

1950年代にAIが誕生して以来、アーティストは人工知能を使って芸術作品を制作してきた。これらの作品は、アルゴリズムアート[ 17 ] 、コンピュータアート、デジタルアート、ニューメディアアート[ 18 ]などと呼ばれることもある。
初期の重要なAIアートシステムの1つは、 1960年代後半にカリフォルニア大学サンディエゴ校でハロルド・コーエンによって開発されたAARONです。 [ 19 ] AARONは、 GOFAIプログラミングの時代に、記号ルールベースのアプローチを使用して技術的な画像を生成します。コーエンは、描画行為をコード化できるようにすることを目的としてAARONを開発しました。[ 20 ] AARONは1972年にロサンゼルス郡立美術館で展示されました。[ 21 ] 1973年から1975年にかけて、コーエンはスタンフォード大学の人工知能研究所での滞在中にAARONを改良しました。[ 22 ] 2024年には、ホイットニー美術館が、コーエンの初期のロボット描画マシンの再現バージョンを含む、コーエンのキャリア全体にわたるAIアートを展示しました。[ 22 ]
カール・シムズは1980年代から人工生命で制作したアート作品を展示している。 1987年にMITメディアラボでコンピュータグラフィックスの修士号を取得し、1990年から1996年までスーパーコンピュータメーカー兼人工知能企業Thinking Machinesのアーティスト・イン・レジデンスを務めた。[ 23 ] [ 24 ] [ 25 ] 1991年と1992年には、人工進化を用いたビデオ作品でアルス・エレクトロニカ賞のゴールデン・ニカ賞を受賞した。 [ 26 ] [ 27 ] [ 28 ] 1997年には、東京のNTTインターコミュニケーションセンター向けにインタラクティブな人工進化インスタレーション「ガラパゴス」を制作した。 [ 29 ]シムズは2019年にエンジニアリング開発における卓越した功績でエミー賞を受賞した。[ 30 ]

1999年、スコット・ドレイブスと数名のエンジニアからなるチームが、フリーソフトウェアのスクリーンセーバーとしてElectric Sheepを作成し、公開しました。 [ 31 ] Electric Sheepは、フラクタルフレームをアニメーション化して進化させるボランティアコンピューティングプロジェクトで、ネットワーク接続されたコンピュータに配信され、スクリーンセーバーとして表示されます。このスクリーンセーバーは、AIを使用してユーザーから学習することで無限のアニメーションを作成しました。2001年、ドレイブスはElectric SheepでFundacion Telefónica Life 4.0賞を受賞しました。[ 32 ]
2014年、ステファニー・ディンキンスは「Conversations with Bina48」の制作を開始した。[ 33 ]このシリーズのために、ディンキンスは中年の黒人女性に似たソーシャルロボットであるBINA48との会話を録音した。 [ 34 ] [ 35 ] 2019年、ディンキンスは「有色人種の興味や文化」に基づいて進化する人工知能を制作したことで、クリエイティブ・キャピタル賞を受賞した。 [ 36 ]
2015年、ソウグウェン・チョンは、自身とロボットアームとの継続的なコラボレーションである「ミミクリー(ドローイング・オペレーションズ・ユニット:ジェネレーション1)」を開始した。 [ 37 ] 2019年、チョンはAIを用いて自身と同様の方法で描画を試みるロボットアームとの継続的なパフォーマンスにより、ルーメン賞を受賞した。[ 38 ]

2018年、ニューヨークのクリスティーズで人工知能アートのオークションが開催され、 AIアート作品「エドモンド・ド・ベラミー」が432,500米ドルで落札されました。これは、 7,000~10,000米ドルという予想価格のほぼ45倍でした。この作品は、パリを拠点とする集団Obviousによって制作されました。[ 39 ] [ 40 ] [ 41 ]
2024年に日本の映画generAIdoscopeが公開された。この映画は安達弘孝、曽根武、山口弘樹が共同監督を務めた。映画内の映像、音声、音楽はすべて人工知能で制作された。[ 42 ]
2025年に日本のテレビアニメシリーズ『ツインズ ひなひま』が放送された。このアニメは、写真の切り抜きやアニメイラストへの変換の過程でAIの支援を受けて制作・アニメーション化され、その後アートスタッフによって修正された。キャラクターやロゴなどの残りの部分のほとんどは、さまざまなソフトウェアを使用して手描きされた。[ 43 ] [ 44 ]
人間の脳を模倣しようとする多層構造を特徴とするディープラーニングは、2010年代に初めて登場し、AIアートの世界に大きな変化をもたらしました。 [ 45 ]ディープラーニングの時代には、主に次のようなタイプの生成アートのデザインがありました。自己回帰モデル、拡散モデル、GAN、正規化フロー。
2014年、モントリオール大学のイアン・グッドフェローと同僚は、画像などの入力データの統計的分布を模倣することを学習できる深層ニューラルネットワークの一種である生成敵対ネットワーク(GAN)を開発しました。GANは、「ジェネレーター」を使用して新しい画像を生成し、「ディスクリミネーター」を使用して生成された画像のうちどれが成功したとみなされるかを決定します。[ 46 ]手作業でコーディングされたルールに従う従来のアルゴリズムアートとは異なり、生成敵対ネットワークは、サンプル画像のデータセットを分析することによって特定の美的感覚を学習できます。[ 17 ]
2015年、 Googleのチームは、畳み込みニューラルネットワークを使用してアルゴリズム的パレイドリアによって画像内のパターンを見つけて強調するプログラムであるDeepDreamをリリースしました。[ 47 ] [ 48 ] [ 49 ]このプロセスは、サイケデリック体験を彷彿とさせる夢のような外観を持つ、意図的に過剰処理された画像を生成します。[ 47 ]その後、2017年に、条件付きGANは、視覚オブジェクト認識ソフトウェア研究で使用するために設計された大規模な視覚データベースであるImageNetの1000の画像クラスを生成することを学習しました。[ 50 ] [ 51 ]このアプローチは、ランダムノイズと特定のクラスラベルの両方でGANを条件付けすることにより、クラス条件付きモデルの画像合成の品質を向上させました。[ 52 ]
画像生成には自己回帰モデルが使用されており、例えばPixelRNN(2016)は、リカレントニューラルネットワークでピクセルを1つずつ自己回帰的に生成する。[ 53 ] TransformerアーキテクチャがAttention Is All You Need (2018)で提案された直後、テキスト条件付けなしで画像の自己回帰生成に使用された。[ 54 ]
2018年に開設されたウェブサイトArtbreederは、 StyleGANとBigGAN [ 55 ] [ 56 ]のモデルを使用して、ユーザーが顔、風景、絵画などの画像を生成および変更できるようにしています。[ 57 ]
2020年代には、プロンプトに基づいて画像を生成するテキストから画像への変換モデルが広く使用されるようになり、AI生成アート作品の制作における新たな転換点となった。[ 2 ]
2021年、OpenAIは、GPT-2とGPT-3で使用されている影響力のある大規模言語生成事前学習済みトランスフォーマーモデルを使用して、テキストから画像へのAIモデルDALL-E 1で作成された一連の画像を公開しました。[ 58 ]これは、基本的にGPT-3と同じアーキテクチャを持つ自己回帰生成モデルです。これに加えて、2021年後半には、EleutherAIがOpenAIのCLIPモデルに基づいたオープンソースのVQGAN-CLIP [ 59 ]を公開しました。 [ 60 ]拡散モデル、既存のデータに基づいて合成データを作成するために使用される生成モデル、[ 61 ]は、 2015 年に初めて提案されましたが、[ 62 ] 2021 年初頭になって GAN よりも優れたものになりました。[ 63 ]潜在拡散モデルは 2021 年 12 月に公開され、後にStability AI、ミュンヘン大学 CompVis グループ、および Runway のコラボレーションによって開発されたStable Diffusion (2022 年 8 月) の基礎となりました。[ 64 ]
2022年には、Midjourney [ 65 ]がリリースされ、続いて、2022年5月に発表されたGoogle BrainのImagenとParti、 MicrosoftのNUWA-Infinity [ 66 ] [ 2 ]、そして2022年8月にリリースされたソースコード公開済みのStable Diffusion [ 67 ] [ 68 ] [ 69 ]がリリースされました。DALL -E の後継であるDALL-E 2はベータテストを経てリリースされました(さらに後継のDALL-E 3は2023年にリリースされました)。Stability AIは、DreamStudio [ 70 ] と呼ばれるStable DiffusionのWebインターフェース、Krita、Photoshop、Blender、GIMP用のプラグイン[ 71 ]、そしてWebベースのオープンソースユーザーインターフェースAutomatic1111を提供しています。[ 72 ] [ 73 ] [ 74 ] Stable Diffusion の主要な事前学習済みモデルは、Hugging Face Hubで共有されています。[ 75 ]
Ideogramは2023年8月にリリースされ、このモデルは読みやすいテキストを生成する能力で知られています。[ 76 ] [ 77 ]
2024年にFluxがリリースされました。このモデルはリアルな画像を生成でき、X(旧Twitter)で使用されているチャットボットGrokと、Mistral AIのチャットボットLe Chatに統合されました。[ 3 ] [ 78 ] [ 79 ] [ 80 ] Fluxは、Stable Diffusionの研究者によって設立されたBlack Forest Labsによって開発されました。[ 81 ] Grokはその後、同年12月に独自のテキストから画像へのモデルAuroraに切り替えました。 [ 82 ]いくつかの企業は、自社製品とともに、画像編集サービスに統合されたAIモデルも開発しています。Adobeは、AIモデルFireflyをリリースし、Premiere Pro、Photoshop、Illustratorに統合しました。[ 83 ] [ 84 ] Microsoftも、 Microsoft Paint用のAI画像生成機能を公表しました。[ 85 ]これに加えて、 2020年代半ばのテキストからビデオへのモデルの例としては、 RunwayのGen-4、GoogleのVideoPoet 、 2024年12月にリリースされたOpenAIのSora 、 2025年にリリースされたLTX-2などがあります。 [ 86 ] [ 87 ] [ 88 ]
2025年には、いくつかのモデルがリリースされました。 2025年3月にリリースされたOpenAIのGPT Image 1は、新しいテキストレンダリングとマルチモーダル機能を導入し、スケッチやテキストなどの多様な入力から画像を生成することを可能にしました。[ 89 ] 2025年4月には、テキストプロンプト処理を改善したMidJourney v7が登場しました。 [ 90 ] 2025年5月には、 Black Forest LabsのFlux.1 Kontextが高忠実度画像生成のための効率的なモデルとして登場し、[ 91 ] GoogleのImagen 4はフォトリアリズムを改善してリリースされました。[ 92 ] 2025年11月には、画像参照、タイポグラフィ、プロンプト理解を改善したFlux.2が登場しました。[ 93 ]
アーティストがAIビジュアルアートを開発するために使用するアプローチは数多くあります。テキストから画像への変換を使用する場合、AIは拡散やトランスフォーマーベースのアーキテクチャなどのモデルを使用して、テキストの説明に基づいて画像を生成します。ユーザーがプロンプトを入力すると、AIは対応するビジュアルを生成します。[ 94 ] [ 95 ]画像から画像への変換を使用する場合、AIはプロンプトまたはスタイルの参照に基づいて入力画像を新しいスタイルまたは形式に変換します。たとえば、スケッチをフォトリアリスティックな画像に変換したり、芸術的なスタイルを適用したりします。[ 96 ] [ 97 ]画像からビデオへの変換を使用する場合、AIは単一の画像または一連の画像から短いビデオクリップまたはアニメーションを生成し、多くの場合、動きやトランジションを追加します。これには、静止画のアニメーション化や動的なシーンの作成が含まれます。[ 98 ] [ 99 ]テキストからビデオへの変換を使用する場合、AIはテキストプロンプトから直接ビデオを作成し、アニメーション、リアルなシーン、または抽象的なビジュアルを生成します。これはテキストから画像への変換の拡張ですが、時間的なシーケンスに焦点を当てています。[ 100 ]

拡散モデルを扱う際、アーティストは様々なツールを利用できます。ポジティブプロンプトとネガティブプロンプトの両方を定義できるだけでなく、VAE、LoRA、ハイパーネットワーク、IPアダプタ、埋め込み/テキスト反転の使用(または使用しない)を選択することもできます。アーティストは、ガイダンススケール(創造性と精度のバランスを取る)、シード(ランダム性を制御する)、アップスケーラー(画像解像度を向上させる)などの設定を調整できます。ノイズ操作によって推論前にさらに影響を与えることができ、推論後には従来型の後処理技術がよく使用されます。また、独自のモデルをトレーニングすることも可能です。
さらに、数学的パターン、筆遣いやその他の絵画的効果をシミュレートするアルゴリズム、生成敵対ネットワーク(GAN)やトランスフォーマーなどの深層学習モデルを利用した、手続き型の「ルールベース」画像生成技術が開発されています。いくつかの企業は、ユーザーが肯定的なプロンプトのみに集中でき、他のパラメータを手動で設定する必要がなくなるアプリケーションやウェブサイトをリリースしています。また、写真を有名な絵画スタイルの美学を模倣した様式化された画像に変換できるプログラムもあります。[ 101 ] [ 102 ]
シンプルな消費者向けモバイル アプリから、効果的に実行するために強力な GPU を必要とするJupyterノートブックや Web UI まで、多くのオプションがあります。 [ 103 ]追加機能には、「テキスト反転」があり、これは、少数の画像から学習したユーザー提供の概念 (オブジェクトやスタイルなど) の使用を可能にするものです。関連付けられた単語 (学習された、多くの場合抽象的な概念に割り当てられたテキスト) [ 104 ] [ 105 ]やモデルの拡張または微調整 ( DreamBoothなど) から新しいアートを生成できます。
AI は社会変革の可能性を秘めており、アマチュアによる非商業的なニッチ ジャンル (ソーラーパンクのようなサイバーパンク派生作品など) の拡大、斬新なエンターテイメント、高速プロトタイピング[ 106 ]、芸術制作へのアクセスの向上 [ 106 ]、労力、費用、時間あたりの芸術的成果の向上[ 106 ]などが含まれる可能性があります。例えば、下書き、下書き定義、画像コンポーネント (インペインティング) の生成などです。生成された画像は、スケッチ[ 107 ]、低コストの実験[ 108 ] 、インスピレーション、概念実証段階のアイデアの図解として使用されることがあります。追加の機能や改善は、画像エディタによる後続の微調整など、生成後の手動編集 (磨き上げ) にも関連する可能性があります。[ 108 ]
プロのビジュアルアーティストやデザイナーは、最終的な制作(収束的思考)よりも初期段階の概念化(発散的思考)で生成型AIをより多く使用しており、デジタルまたは一時的な出力(UI/UXデザイン、コンセプトアートなど)を生成する実践は、物理的で永続的な成果物(彫刻、建築など)を生成する実践よりも、これらをより容易に統合しています。[ 109 ]物理的な領域では、構造的完全性、材料の制約、および文化的「エスノコンピューティング」に関する懸念により、AIは生産の代替ではなく、「補完的な強化」の役割に限定されることがよくあります。[ 110 ]さらに、導入に対する態度はキャリア段階によって大きく異なり、エントリーレベルの専門家は生成型AIを市場競争力に必要なデジタルツールの実用的な拡張と見なす一方、ベテランの実務家は、身体化された専門知識と長期的なスキル開発の価値の低下について批判的な懐疑論を表明することがよくあります。[ 109 ]
テキストから画像への変換モデルのプロンプトには、画像やキーワード、芸術スタイルなどの設定可能なパラメータも含まれる場合があります。芸術スタイルは、プロンプトで「[アーティスト名]のスタイルで」などのキーフレーズを介して使用されることがよくあります[ 111 ] /または、幅広い美的/芸術スタイルの選択によって使用されます[ 112 ] [ 107 ] 。画像ジェネレータから特定の画像を生成するためのプロンプトを共有、交換、検索、フォーク/改良、または共同作業するためのプラットフォームがあります[ 113 ] [ 114 ] [ 115 ] [ 116 ] 。プロンプトは、Redditなどの画像共有ウェブサイトやAIアート専用のウェブサイトで画像とともに共有されることがよくあります。プロンプトは、画像の生成に必要な完全な入力ではありません。生成される画像を決定する追加の入力には、出力解像度、乱数シード、およびランダムサンプリングパラメータが含まれます[ 117 ] 。
AIアートを含む合成メディアは、2022年に今後数年間でビジネスに影響を与える主要なテクノロジー主導のトレンドとして説明されました。[ 106 ]ハーバード・ケネディ・スクールの研究者たちは、XプラットフォームでのAIアートの普及を研究した直後、合成メディアが政治的な誤情報の媒介となることについて懸念を表明しました。[ 118 ]シンソグラフィーは、AIを使用して写真に似た画像を生成する手法を表す提案された用語です。[ 119 ]
AIが生成する視覚芸術は、創造性、作者性、身体性、そしてイメージの地位といった問題と関連付けて議論されてきた。また、生成システムはカメラの前で対応する物理的な出来事を記録することなく画像を生成できるため、写真や映画の指標性に関する議論も再燃している。
映画監督でアーティストのヨハネス・グレンツフルトナーは、2026年のエッセイ「現実のマニフェスト:物理的痕跡後の映画」の中で、「存在論的開示」を主張し、物理的に参照されるイメージ、ハイブリッドなイメージ、完全に合成されたイメージを区別した。[ 120 ]アーティストで教育者のマット・バロウは、2026年のAIと教育学に関する講演でグレンツフルトナーの主張について論じ、それを身体性、作者性、イメージ、文書、または出来事が物理的な起源を持つかどうかを検証する能力に関する懸念と関連付けた。[ 121 ]この主張は、 paraflowsが2026年に発表したエッセイでも議論されており、グレンツフルトナーの出来事に基づくイメージ、ハイブリッドなイメージ、完全に合成されたイメージの区別は、ドキュメンタリーとフィクションの伝統的な境界の弱体化に対する美的かつ政治的な反応であると特徴づけている。[ 122 ]
オリジナルアートの制作に加えて、デジタルアートコレクションを定量的に分析するためにAIを使用した研究手法が開発されました。これは、過去数十年間のアート作品の大規模なデジタル化によって可能になりました。CETINICとSHE(2022)によると、既存のアートコレクションを分析するために人工知能を使用することで、芸術様式の発展や芸術的影響の特定に関する新しい視点が得られます。[ 123 ] [ 124 ]
デジタル化されたアートを分析する典型的なアプローチとして、精読と遠隔観察という 2 つの計算手法が用いられます。[ 125 ]精読は、1 つの作品の特定の視覚的側面に焦点を当てます。精読手法で機械が行うタスクには、計算によるアーティストの認証や、筆致やテクスチャ特性の分析などがあります。一方、遠隔観察手法では、特定の機能についてコレクション全体にわたる類似性を統計的に視覚化できます。この手法に関連する一般的なタスクには、自動分類、オブジェクト検出、マルチモーダルタスク、美術史における知識発見、計算美学などがあります。[ 124 ]合成画像は、アートの認証や偽造品の検出のための AI アルゴリズムのトレーニングにも使用できます。 [ 126 ]
研究者たちは、芸術に対する感情的な反応を予測するモデルも開発している。そのようなモデルの1つが、機械学習モデルと組み合わせた大規模データセットであるArtEmisである。ArtEmisには、6,500人以上の参加者からの感情的な注釈とテキストによる説明が含まれている。このデータセットからの視覚的な入力と付随するテキストによる説明の両方を分析することで、ArtEmisは微妙な感情の予測を生成することを可能にする。[ 127 ] [ 128 ]
AI は視覚芸術以外の芸術分野でも使用されています。生成型 AI は音楽制作に使用されているほか、ビデオゲーム制作においても画像以外の用途、特にレベルデザイン(カスタムマップなど) や新しいコンテンツ (クエストや対話など) の作成、ビデオゲーム内のインタラクティブ ストーリーの作成に使用されています。[ 129 ] [ 130 ] AI は文学分野でも使用されており、[ 131 ]作家の行き詰まりの解消、インスピレーションの獲得、または一部を書き直すのに役立っています。 [ 132 ][133][134] [ 135 ]料理分野では、プロトタイプの調理ロボットの中には動的に味見できるものもあり、調理中に料理の内容や風味を分析する際にシェフを支援できます。[ 136 ]
AIソフトウェアによって生成された作品に「芸術」というラベルを使用することは、芸術家、哲学者、学者などの間で議論を巻き起こしている。様々な観察者は、機械によって生成された画像を「芸術」と呼ぶことは、創造性、技術、意図性といった人間の芸術の伝統的な特徴を損なうと主張している。現代の真の芸術創造の定義は、人間レベルの意図、個人的な経験や感情、そして歴史的および/または芸術的な文脈の必要性を強調することが多い。[ 137 ]
米国国立医学図書館の研究によると、人間は本質的にAIによって生成されたと説明される芸術作品に対して偏見を示す。研究参加者に2つの類似した画像を見せ、そのうち1つだけがAIによって生成されたと説明された場合、被験者は人工的に生成されたと説明された画像の芸術的価値を低く評価する傾向があった。これは、画像の他の視覚的特徴に関係なく、社会的および文化的態度が画像が芸術とみなされるかどうかの決定を左右する可能性があることを示唆している。[ 138 ]
2023年にデジタルアートオブザーバー年次大会に提出されたレポートの中で、サミュエル・ルーミスは、「AIアート」という用語は、伝統的なアートに適用されるのと同じ批評基準で評価する場合、人間の指導と機械駆動の生成システムの産物としての二重性を認めていると述べている。[ 139 ]

2020年代には、深層学習に基づく生成型人工知能モデルの急速な進歩により、AI生成作品の著作権ステータス、およびそのような作品のトレーニングや使用時に著作権侵害が発生するかどうかについて疑問が生じました。これには、 Stable Diffusionなどのテキストから画像への変換モデルや、ChatGPTなどの大規模言語モデルが含まれます。最先端の大規模言語モデルは、インターネットからスクレイピングできるすべてのデータでトレーニングされ、多くの場合、著作権で保護された素材が利用されています。 [ 142 ] 2023年現在、著作権で保護されたデータを使用してAIモデルをトレーニングすることに異議を唱える米国での訴訟がいくつか係争中で、被告側はこれがフェアユースの範囲内であると主張しています。[ 143 ]
{{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク)