
生成型人工知能(GenAI)は、生成モデルを使用してテキスト、画像、ビデオ、音声、ソフトウェア コード、またはその他の形式のデータを生成する人工知能(AI)のサブ分野です。 [ 1 ]これらのモデルは、トレーニング データの根底にあるパターンと構造を学習し、それらを使用して新しいデータを生成します。[ 2 ]入力は多くの場合、自然言語プロンプトの形式をとります。[ 3 ] [ 4 ]
2020年代のAIブーム以降、生成AIツールの普及率は大幅に増加しました。このブームは、特にトランスフォーマーアーキテクチャに基づく大規模言語モデル(LLM)などの深層ニューラルネットワークの改良によって可能になりました。生成AIアプリケーションには、 ChatGPT、Claude、Microsoft Copilot、DeepSeek、Doubao、Google Gemini、Grok、Kimi、Qwenなどのチャットボット、DALL-E、Firefly、Stable Diffusion、Midjourneyなどのテキストから画像への変換モデル、 Veo、LTX、Soraなどのテキストからビデオへの変換モデルが含まれます。[ 5 ] [ 6 ] [ 7 ]
ソフトウェア開発、ヘルスケア[ 8 ]、金融[ 9 ]、エンターテイメント[ 10 ]、カスタマーサービス[ 11 ] 、セールスとマーケティング[12]、アート、ライティング[ 13 ] 、製品デザイン[ 14 ]など、さまざまな分野の企業が生成型AIを利用しています。
生成AIはサイバー犯罪や、フェイクニュースやディープフェイクを通じて人々を欺いたり操作したりするために使用されてきました。[ 15 ] [ 16 ]生成AIモデルは、著作権者の許可なく著作権で保護された作品でトレーニングされています。[ 17 ]多くの生成AIシステムは大規模なデータセンターを使用しており、その環境への影響には、電子廃棄物、冷却のための真水の消費、着実に増加していると推定される高エネルギー消費が含まれます。 [ 18 ]
アルゴリズムによって生成されるメディアの起源は、20 世紀初頭から自然言語のモデル化に使用されてきたマルコフ連鎖の開発に遡ることができます。ロシアの数学者アンドレイ・マルコフは 1906 年にこの概念を導入し、[ 19 ] [ 20 ]エフゲニー・オネーギンの母音と子音のパターンの分析も行いました。テキスト コーパスでトレーニングされたマルコフ連鎖は、確率的なテキストを生成できます。[ 21 ] [ 22 ]
1970年代初頭までに、アーティストはマルコフモデルを超えて生成技術を拡張するためにコンピュータを使用し始めました。ハロルド・コーエンは、絵画を自律的に作成するように設計された先駆的なコンピュータプログラムであるAARONによって生成された作品を開発し、展示しました。 [ 23 ]生成AIプランニングまたは生成プランニング という用語は、1980年代と1990年代に、特定の目標に到達するために一連のアクションを生成するために使用されるAIプランニングシステム、特にコンピュータ支援プロセスプランニングを指すために使用されました。 [ 24 ] [ 25 ]生成AIプランニングシステムは、状態空間探索や制約充足などの記号AI手法を使用し、1990年代初頭までに「比較的成熟した」技術でした。これらは、軍事用の危機行動計画[ 26 ] 、製造用のプロセス計画[ 24 ]、プロトタイプの自律型宇宙船などの意思決定計画を生成するために使用されました。[ 27 ]

機械学習では、データの予測や生成に識別モデルと生成モデルの両方を使用します。2000年代後半から2010年代初頭にかけて、ディープラーニングの進歩により、画像分類、音声認識、自然言語処理が大幅に改善されました。[ 28 ]この時期のニューラルネットワークは、生成モデルのトレーニングが比較的困難であったため、通常は識別モデルとしてトレーニングされていました。 [ 29 ]
2014年には、変分オートエンコーダー(VAE)や敵対的生成ネットワーク(GAN)などのモデルの導入により、画像などの複雑なデータの効果的な深層生成モデリングが可能になった。[ 30 ] [ 31 ]
2017年、Transformerアーキテクチャは、以前の長短期記憶(LSTM)ネットワークと比較して、生成モデリングのさらなる進歩を可能にした。 [ 32 ]これにより、 2018年のGPT-1を皮切りに、生成事前学習済みTransformer(GPT)モデルの開発につながった。 [ 33 ]

2020年3月、 MITの匿名の研究者が作成した無料のウェブアプリケーション「15.ai」がリリースされました。これは最小限のトレーニングデータを使用して説得力のあるキャラクターの声を生成できるもので、生成AIの最も初期の公開された使用例の1つでした。[ 34 ]このプラットフォームは、オーディオディープフェイクの最初の主流サービスとして評価されています。[ 35 ] [ 36 ]
2021年、OpenAIが開発したクローズドソースのトランスフォーマーベースの生成モデルであるDALL-Eが、テキストから画像への生成に広く注目を集めた。[ 37 ]
VQGAN+CLIPやDALL·E Mini(後にCraiyonと改名)などのオープンソースのアプローチを含む他のプロジェクトにより、同様のシステムが一般に利用しやすくなった。[ 38 ]
WomboのDreamは2021年末にリリースされ[ 39 ] 、続いて2022年にMidjourneyとStable Diffusionがリリースされた[ 40 ] [ 41 ]。
2022年11月、ChatGPTが一般公開されました。2023年までに、汎用テキストベースのタスク向けに生成AIを普及させました。[ 42 ] [ 43 ] [ 44 ]

マーケティング調査会社イプソスが2024年に実施した調査によると、アジア太平洋諸国は生成型AIに関して欧米諸国よりもかなり楽観的で、導入率も高いことが示されています。プライバシーや変化のペースについて懸念を表明しているにもかかわらず、アジア太平洋地域の回答者の68%がAIは世界にプラスの影響を与えていると信じており、これは世界平均の57%を上回っています。[ 45 ] SASとコールマン・パークス・リサーチの調査によると、2023年時点で中国の回答者の83%がこの技術を使用しており、世界平均の54%と米国の65%の両方を上回っています。国連の報告書によると、中国の企業は2014年から2023年までに38,000件以上の生成型AI特許を出願しており、これは他のどの国よりも多い数です。[ 46 ]ソーシャルメディアアプリ「 Just So Soul」による2024年の調査では、2000年以降に生まれた回答者の18%が「ほぼ毎日」生成AIを使用しており、回答者の60%以上がAI生成コンテンツ(AIGC)を好きまたは愛している一方、嫌いまたは憎んでいるのは3%未満であると報告されている。[ 47 ]
2025年半ばまでに、企業は統合、データ品質、期待された収益が得られないことに苦労し、生成型AIのパイロットプロジェクトを放棄するケースが増え、ガートナーとエコノミストのアナリストは、この時期をガートナーのハイプサイクルの「幻滅期」に入ったと特徴づけた。 [ 48 ] [ 49 ]
生成型人工知能は、コンテンツ作成や自動化のために複数の産業で応用されています。医療分野では、生成モデルは創薬や診断システムのトレーニングのための合成医療データの生成に使用されています。[ 50 ]金融分野では、レポート作成、データ生成、顧客サービスの自動化に使用されています。[ 51 ]メディアおよびエンターテイメント業界では、音楽作曲、脚本開発、画像やビデオの生成などのタスクに生成システムが使用されています。[ 52 ]研究者や政策立案者は、正確性、誤用、学術および専門的な仕事への影響について懸念を表明しています。[ 51 ]
大規模言語モデル(LLM)は、大規模コーパスからのトークン化されたテキストでトレーニングされ、自然言語処理、機械翻訳、自然言語生成が可能です。[ 53 ]
LLMは、さまざまな下流タスクの基礎モデルとして使用できます。 [ 54 ]また、ソースコードでトレーニングして、プロンプトからプログラムを生成することもできます。[ 55 ]
多くのアプリケーションでは、大規模な言語モデルと外部の知識ソースを、検索拡張生成(RAG)という手法を用いて組み合わせています。この手法では、推論時に関連文書が検索され、モデルの応答に組み込まれます。
生成AIはコンテンツ管理およびウェブサイト公開プラットフォームに統合されており、大規模な言語モデルを使用してテキストを生成し、ページ構成を支援し、自然言語プロンプトからウェブサイトの作成を自動化します。[ 56 ] WordPress.comは、生成AIをウェブサイト作成ワークフローに組み込んだアプリケーションの一例です。[ 57 ]
2016年、DeepMindのWaveNetは、深層ニューラルネットワークが生の音声波形を生成できることを実証しました。[ 58 ]これにより、以前のアプローチと比較して、よりリアルな音声合成が可能になりました。Tacotron 2などの後続のシステムは、エンドツーエンドのニューラルテキスト音声生成を実証しました。[ 59 ]
生成AIは視覚芸術の作成に使用できます。[ 60 ]このようなシステムは画像とテキストのペアでトレーニングされます。例としては、Stable Diffusion、DALL-E、Midjourneyなどがあります。[ 61 ]
生成AIは、フォトリアリスティックなビデオを生成するために使用できます。Runwayなどのシステムは、テキストからビデオを生成する機能を実証しています。[ 62 ]
生成モデルは、過去のデータから学習することで、動作計画やロボット制御に利用できます。[ 63 ]
ジェネレーティブモデルは、テキストや画像から3Dアセットを生成するなど、3Dモデリング作業の自動化を支援することができます。
ワールドモデルは、空間的特性や動的特性を含む物理環境の表現を学習するように設計されたニューラルネットワークです。[ 64 ]最近のマルチモーダルシステムは、視覚、言語、および行動を統合モデルに組み込むことで、これらの機能を拡張しています。[ 65 ]
生成型AIシステムは、数学やコンピュータ科学において、候補となるコンピュータプログラム、証明、構成、またはアルゴリズムを生成するために使用されてきた。
2023年、Google DeepMindは、数学的およびアルゴリズム的問題を解決するコンピュータプログラムを作成するための手法で あるFunSearchを発表しました。FunSearchは、キャップセット問題とビンパッキング問題で新しい数学的構成を発見するために使用されました。[ 66 ] [ 67 ] [ 68 ]
2023年、Google DeepMindはAlphaDevを発表しました。これは、これまで知られていた人間のベンチマークを上回る小さなソートアルゴリズムを発見するために使用され、 LLVM標準C++ソートライブラリに統合されました。[ 69 ] [ 70 ] 2025年、Google DeepMindは、汎用アルゴリズムの発見と最適化のためのAIシステムであるAlphaEvolveを発表しました。AlphaEvolveは、LLMを使用してコードの変更を提案し、自動評価器を使用して各候補を評価し、進化プロセスを使用してアルゴリズムを反復的に改善します。[ 71 ]
2026年、数学的発見における生成型AIの利用増加に対応して、数学者グループが人工知能と数学に関するライデン宣言を発表し、研究論文におけるAIの使用の開示、AI支援論文の査読の保証、学術界と営利企業が対等な条件で競争できるようにするための法的リソースと公的資金の提供を推奨した。[ 72 ]
2023年、Google DeepMindは、材料科学における計算スクリーニングと実験的合成のための候補無機結晶構造を提案する手法であるGNoMEを発表しました。[ 73 ]他の材料科学手法には、MatterGen [ 74 ]、CDVAE [ 75 ]、CrystalFlow [ 76 ] [ 77 ]などがあります。
生成エンジン最適化(GEO) は、生成型 AI システムによって生成される応答の可視性を向上させるために、デジタル コンテンツを構造化し、オンライン プレゼンスを管理する手法です。この手法は、大規模言語モデル(LLM) がユーザーのクエリに応答して情報を取得、要約、提示する方法に影響を与えます。[ 78 ]関連用語には、回答エンジン最適化 (AEO) [ 78 ]および人工知能最適化 (AIO) [ 79 ]があります。

生成型AIモデルは、ChatGPTなどのチャットボット製品、GitHub Copilotなどのプログラミングツール[ 80 ]、Midjourneyなどのテキストから画像への変換製品、 Runway Gen-2などのテキストからビデオへの変換製品[ 81 ]の動力源として使用されています。生成型AI機能は、 Microsoft Office(Microsoft Copilot)[ 82 ] 、 Google Photos [ 83 ]、Adobe Suite(Adobe Firefly ) [ 84 ]など、既存のさまざまな市販製品に統合されています。また、 Stable DiffusionやLLaMA [ 85 ]言語モデルなど、多くの生成型AIモデルはオープンソースソフトウェアとしても利用可能です。
数億パラメータまでの小規模な生成AIモデルは、スマートフォン、組み込みデバイス、パーソナルコンピュータで実行できます。たとえば、LLaMA-7B(70億パラメータのバージョン)はRaspberry Pi 4で実行でき[ 86 ]、Stable DiffusionのあるバージョンはiPhone 11で実行できます[ 87 ]。
数百億のパラメータを持つ大規模なモデルは、ラップトップまたはデスクトップコンピュータで実行できます。許容できる速度を実現するには、この規模のモデルでは、NVIDIAやAMDが製造するGPUチップやAppleシリコン製品に含まれるNeural Engineなどのアクセラレータが必要になる場合があります。たとえば、650億パラメータバージョンのLLaMAは、デスクトップPCで実行するように構成できます。[ 88 ]
ローカルで生成AIを実行する利点には、プライバシーと知的財産の保護、レート制限と検閲の回避が含まれます。特にサブレディットr/LocalLLaMAは、圧縮などの技術を使用してコンシューマーグレードのゲーム用グラフィックカード[ 89 ]を使用することに焦点を当てています。
GPT-4やPaLMなど、数千億ものパラメータを持つ言語モデルは、通常、GPUアレイ(NVIDIAのH100など)やAIアクセラレータチップ(GoogleのTPUなど)を搭載したデータセンターのコンピュータ上で動作します。これらの非常に大規模なモデルは、通常、インターネット経由でクラウドサービスとしてアクセスされます。
2022年、米国は中国に対する先進コンピューティングおよび半導体の新輸出規制により、生成AIに使用されるGPUおよびAIアクセラレータチップの中国への輸出に制限を課した。 [ 90 ] NVIDIA A800 [ 91 ]やBiren Technology BR104 [ 92 ]などのチップは、制裁の要件を満たすために開発された。
生成型人工知能によって生成されたテキスト( GPTZeroなど)や、そこから生成された画像、音声、動画を認識できる無料のソフトウェアが市販されている。 [ 93 ]生成型AIコンテンツを検出するための潜在的な対策としては、デジタル透かし、コンテンツ認証、情報検索、機械学習分類器モデルなどが挙げられる。[ 94 ]精度が高いと謳われているにもかかわらず、無料および有料のAIテキスト検出器は、学生がAIで生成された作品を提出したと誤って判断する誤検出を頻繁に発生させている。[ 95 ] [ 96 ]

敵対的生成ネットワーク(GAN) は、生成器と識別器という 2 つのニューラル ネットワークが競合する設定で同時にトレーニングされる生成モデリング手法です。生成器は、ランダム ノイズをトレーニング データセットに似たサンプルに変換することで合成データを生成します。識別器は、生成器によって生成された合成データと実際のデータを区別するようにトレーニングされます。2 つのモデルはミニマックスゲームを行います。生成器は識別器を「だます」ためにますますリアルなデータを生成することを目指し、識別器は実際のデータと偽のデータを区別する能力を向上させます。この継続的なトレーニング設定により、生成器は高品質でリアルな出力を生成できます。[ 97 ]

変分オートエンコーダー(VAE)は、データを確率的に符号化する深層学習モデルです。通常、画像からのノイズ除去、データ圧縮、異常なパターンの識別、顔認識などのタスクに使用されます。入力データを固定の潜在表現に圧縮する標準的なオートエンコーダーとは異なり、VAEは潜在空間を確率分布としてモデル化し、データポイント間のスムーズなサンプリングと補間を可能にします。エンコーダー(「認識モデル」)は入力データを潜在空間にマッピングし、確率分布を定義する平均と分散を生成します。デコーダー(「生成モデル」)はこの潜在分布からサンプリングし、元の入力を再構築しようとします。[ 98 ]

Transformerは、OpenAIが開発した生成事前学習済みTransformer(GPT)シリーズの基盤となり、従来のリカレントモデルや畳み込みモデルに取って代わりました。自己注意機構により、モデルは次のトークンを予測する際にシーケンス内の各トークンの相対的な重要性を判断できるため、文脈理解が向上します。リカレントニューラルネットワークとは異なり、Transformerはトークンを並列処理するため、トレーニング効率とスケーラビリティが向上します。[ 32 ]
米国では、OpenAI、Alphabet、Metaなどの企業グループが、2023年7月にバイデン政権とAI生成コンテンツに透かしを入れる自主協定を締結した。 [ 99 ] 2023年10月、大統領令14110号は国防生産法を適用し、特定の影響力の大きいAIモデルを訓練する際に、すべての米国企業に連邦政府に情報を報告することを義務付けた。[ 100 ] [ 101 ]
欧州連合(EU)では、人工知能法に、生成AIシステムのトレーニングに使用される著作権で保護された素材を開示し、AIが生成した出力にその旨を明記するという要件が含まれている。[ 102 ] [ 103 ]
中国では、中国国家インターネット情報弁公室が導入した生成AIサービス管理暫定措置により、一般公開されている生成AIが規制されている。これには、生成された画像や動画に透かしを入れること、トレーニングデータやラベルの品質に関する規制、個人データの収集に関する制限、生成AIサービスは「社会主義の核心的価値観を遵守しなければならない」というガイドラインなどが含まれる。[ 104 ] [ 105 ]
2021年、ユネスコは人工知能の倫理に関する勧告を採択した。これはAIに関する初のグローバルな標準設定文書である。人権、公平性、透明性、データガバナンス、環境の持続可能性などの問題について加盟国に指針を提供する。[ 106 ]
G7は2023年に広島AIプロセスを開始し、高度なAIシステムの開発者向けの国際的な指針と自主的な行動規範を策定した。[ 107 ] 2024年には、欧州評議会が人工知能と人権、民主主義、法の支配に関する枠組み条約を採択した。これは人工知能を規制する初の法的拘束力のある国際条約である。[ 108 ]
ChatGPTやMidjourneyなどの生成型AIシステムは、著作権で保護された作品を含む大規模な公開データセットでトレーニングされています。AI開発者は、このようなトレーニングはフェアユースによって保護されていると主張していますが、著作権者は、それが自分たちの権利を侵害していると主張しています。[ 109 ]
フェアユースのトレーニングを支持する人々は、フェアユースは変容的な利用であり、著作権で保護された作品のコピーを一般に公開することには当たらないと主張している。[ 109 ]一方、批判者たちは、 Midjourneyのような画像生成ツールは、著作権で保護された画像とほぼ同一のコピーを作成できると主張している。[ 110 ]また、生成型AIプログラムは、トレーニングに使用されたコンテンツと競合すると主張している。[ 111 ]
2024年現在、トレーニングにおける著作権で保護された素材の使用に関連する訴訟がいくつか進行中です。Getty Imagesは、 Stable Diffusionのトレーニングに自社の画像を使用したとしてStability AIを提訴しました。[ 112 ] Authors GuildとThe New York Timesは、ChatGPTのトレーニングに自社の作品を使用したとしてMicrosoftとOpenAIを提訴しました。[ 113 ] [ 114 ]
別の問題として、AIが生成した作品が著作権保護の対象となるかどうかという点がある。米国著作権局は、人間の関与なしに人工知能によって作成された作品は、人間の著作者がいないという理由で著作権の対象にならないと裁定している。[ 115 ]一部の法律専門家は、米国第9巡回控訴裁判所が非人間は芸術作品の著作権者にはなれないと判断したNaruto v. Slater (2018) が、生成型AIによって作成された作品に関する著作権訴訟の潜在的な先例となる可能性があると示唆している。 [ 116 ]しかし、同局は、これらの規則を生成型AI向けに修正する必要があるかどうかを判断するために、一般からの意見も受け付け始めている。[ 117 ]
2025年1月、米国著作権局(USCO)は、創作過程におけるAIツールの使用に関する包括的なガイダンスを発表し、「…生成AIシステムも同様にユーザーが制御を行使できるツールを提供している。[これら]は、ユーザーが個々の創作要素の選択と配置を制御できるようにする。このような変更がFeistで要求される最低限の独創性の基準に達するかどうかは、ケースバイケースの判断に委ねられる。達する場合、出力は著作権で保護されるべきである」[ 118 ]と定めた。その後、USCOは、完全にAIで生成された素材で構成された最初の視覚芸術作品「A Single Piece of American Cheese」を登録した。[ 119 ]
生成型AIの開発は、政府、企業、個人から懸念を引き起こし、抗議、法的措置、AI実験の一時停止の要求、複数の政府による行動につながっている。2023年7月の国連安全保障理事会のブリーフィングで、アントニオ・グテーレス事務総長は 、「生成型AIは、規模において善と悪の両方の大きな可能性を秘めている」と述べ、AIは「世界的な発展を加速」させ、2030年までに世界経済に10兆ドルから15兆ドル貢献する可能性があるが、悪用されると「想像を絶する規模で恐ろしいレベルの死と破壊、広範囲にわたるトラウマ、深刻な心理的ダメージを引き起こす可能性がある」と述べた。[ 120 ]さらに、生成型AIは大きなカーボンフットプリントを持っている。[ 121 ]
2026年のヒューマンファクター・イン・コンピューティング・システム会議で発表された研究では、生成AIへの過度の依存は誤情報を識別する能力を低下させる可能性があることが判明しました。[ 122 ] [ 123 ]この研究では、主に英国と米国の参加者を4週間追跡しました。[ 123 ]
生成型AIは、学術的な文章の生成や修正、出典の言い換え、言語の翻訳などに使用できます。教室環境での生成型AIの使用は、従来の学術盗用の定義に挑戦し、AIを使用する学生とそれを検出しようとする教育機関との間で「いたちごっこ」のような状況を生み出しています。[ 124 ] ChatGPTのリリース直後、多くの学区や大学がこの技術を一時的に禁止しましたが、その後、多くの教育機関は管理された統合の方針へと移行しました。[ 124 ]しかし、これらの方針の実施はしばしば明確さを欠いています。研究によると、「許容される使用」の解釈の負担はしばしば個々の学生や教師にかかり、学術的な誠実さを定義して強制することが難しい環境を作り出しています。[ 125 ]
教師にとってよく提案される用途は、採点とフィードバックの提供です。ピアソンやETSのような企業は、文法、表記法、語法、スタイルを採点するためにAIを使用していますが、主要なアイデアや全体的な構成については採点していません。[ 126 ]全米英語教師協議会は、機械採点によって学生は自分の文章が読む価値がないと感じるようになると述べています。[ 127 ] AI採点は、異なる民族的背景を持つ学生に対して不公平な結果をもたらすこともあります。[ 128 ]

AI の開発初期から、ELIZA の開発者であるジョセフ・ワイゼンバウム氏らは、コンピュータと人間の違い、定量的計算と定性的で価値に基づく判断の違いを考慮すると、コンピュータが実行できるタスクを実際にコンピュータが実行すべきかどうかについて議論を提起してきた。[ 130 ] 2023 年 4 月には、画像生成 AI により、中国のビデオゲームのイラストレーターの仕事の 70% が失われたと報告された。[ 131 ] [ 132 ] 2023 年 7 月には、生成 AI の発展が2023 年のハリウッド労働争議の一因となった。全米映画俳優組合の会長であるフラン・ドレシャー氏は、 2023 年の SAG-AFTRA ストライキ中に、「人工知能はクリエイティブな職業に存亡の危機をもたらす」と宣言した。[ 133 ]音声生成 AI は、声優業界に対する潜在的な脅威と見なされている。[ 134 ] [ 135 ]
しかし、2025年の研究では、米国の労働市場はこれまで生成型AIによる目立った混乱を経験していないと結論付けられました。[ 136 ]別の研究では、チャットボットを使用したデンマークの労働者は平均して2.8%の時間を節約し、収入や労働時間に大きな変化は見られなかったと報告されています。[ 137 ]
2023年1月、Futurismは、 CNETが少なくとも77本の記事を書くために非公開の内部AIツールを使用していたというスクープ記事を掲載した。このニュースが報じられた後、CNETは41本の記事に訂正を掲載した。 [ 138 ] 2023年4月、Die Aktuelleは、AIが生成したマイケル・シューマッハの偽インタビューを掲載した。[ 139 ] 2024年5月、Futurismは、前述の多くのメディア向けに記事を作成するために生成AIを使用していたAdVon Commerceのコンテンツ管理システムのビデオが、「150社以上の出版社向けに数万本の記事を作成した」ことを示しているようだと指摘した。[ 140 ] 2025年、アメリカン・サンライト・プロジェクトの報告書は、プラウダ・ネットワークが1日に最大1万本の記事を公開していると述べ、このコンテンツの多くは、トレーニングデータを通じてロシア語の物語を大規模な言語モデルに押し込むことを目的としていると結論付けた。[ 141 ]
2024年6月、ロイター研究所は2024年のデジタルニュースレポートを発表しました。ロイター研究所は、アメリカとヨーロッパの人々を対象とした調査で、それぞれ52%と47%が「主にAIが一部人間の監視の下で作成する」ニュースに不快感を抱いており、それぞれ23%と15%が快適だと報告しています。アメリカ人の42%とヨーロッパ人の33%は、「主に人間が一部AIの助けを借りて作成する」ニュースに快適だと回答しました。世界的な調査結果によると、人々は、政治(46%)、犯罪(43%)、地域ニュース(37%)などのニュースのトピックについて、他のニュースのトピックよりもAIが作成することに不快感を抱いていることが報告されています。[ 142 ] 2025年のピュー・リサーチ・センターの調査では、アメリカの成人の約半数が、今後20年間でAIがアメリカの人々が得るニュースに非常に(24%)またはやや(26%)否定的な影響を与えるだろうと回答しています。[ 143 ]
言語モデルは、データにそのようなパターンが広く見られる場合、特定の職業を特定の性別と関連付ける可能性がある。[ 144 ]同様に、一部の画像生成システムは、女性よりも男性をCEOとして画像を生成することが多いことが観察されている。 [ 145 ]
AIソフトウェア、特に音声認識ソフトウェアを使用する場合、発話障害の認識と理解に苦労します。たとえば、吃音のある人は、ソフトウェアのトレーニング方法が原因で、GeminiやSiriなどの音声アシスタントを起動するのに苦労します。[ 146 ]
AIシステムを使用して新規採用を行う企業は、音声認識ソフトウェアが面接プロセス中に候補者の話し方を誤って書き起こすため、アクセントや話し方のある人を除外してしまう。そのため、このような生成型AIシステムが使用される場合、障害のある人や珍しいアクセントの人は、人間の面接官にたどり着くことがほとんどない。[ 147 ]これは、多くのAIモデルが米国でトレーニングおよび作成されているため、米国人のアクセントに基づいているためである。[ 148 ]
ディープフェイク(「ディープラーニング」と「フェイク」の合成語[ 149 ])は、既存の画像や動画に写っている人物を人工ニューラルネットワークを使って別の人物に置き換えるAI生成メディアです。[ 150 ]ディープフェイクは、有名人のポルノ動画、リベンジポルノ、フェイクニュース、デマ、健康に関する偽情報、金融詐欺、秘密裏の外国による選挙干渉などに使用されていることから、広く注目と懸念を集めています。[ 151 ] [ 152 ] [ 153 ] [ 154 ] [ 155 ]
2023年7月、ファクトチェック会社のLogicallyは、人気の生成AIモデルであるMidjourney、DALL-E 2、Stable Diffusionが、指示されると、米国での選挙不正やインドのインド人民党を支持するイスラム教徒の女性などの、もっともらしい偽情報画像を生成することを発見した。[ 156 ]
ユーザーがソフトウェアを悪用して、有名人、公務員、その他の著名人の声のスタイルで物議を醸す発言を生成する事例は、音声生成AIに対する倫理的な懸念を引き起こしている。[ 157 ] [ 158 ] [ 159 ] [ 160 ] [ 161 ] [ 162 ]これに対し、ElevenLabsなどの企業は、安全対策と本人確認を通じて潜在的な悪用を軽減するよう取り組むと表明している。[ 163 ]
AIが生成した音楽には、懸念やファン層が生まれている。声のクローン作成に使われるのと同じソフトウェアが、有名ミュージシャンの声に使われ、彼らの声を模倣した曲が作られ、絶大な人気と批判の両方を集めている。[ 164 ] [ 165 ] [ 166 ]同様の技術は、流出した曲や未発表の曲の音質向上版やフルバージョンの作成にも使われている。[ 167 ]
生成AIは、情報ロンダリングにおける国家支援のプロパガンダキャンペーンでの使用が注目されている。Graphikaによる2025年のレポートによると、生成AIは、中国グローバルテレビネットワークなどの中国国営メディアの記事をさまざまなソーシャルメディアサイトを通じてロンダリングし、記事の出所を偽装するために使用されている。 [ 168 ]
ニューヨーク・タイムズは、スロップをスパムに例えて「ソーシャルメディア、アート、書籍、検索結果における粗悪または望ましくないAIコンテンツ」定義している。 [ 169 ]ジャーナリストは、ソーシャルメディアのコンテンツモデレーションに関して、低品質の生成コンテンツの規模について懸念を表明している。 [ 170 ]ソーシャルメディア企業がそのようなコンテンツを拡散するための金銭的インセンティブ、 [ 170 ] [ 171 ]誤った政治的メッセージ、 [ 171 ]科学研究論文投稿のスパム、 [ 172 ]インターネット上でより高品質または望ましいコンテンツを見つけるための時間と労力の増加、 [ 173 ]検索エンジンによる生成コンテンツのインデックス化、 [ 174 ]そしてジャーナリズム自体について。 [ 175 ]研究では、AIが自信満々に正しいように聞こえる不正確な主張、引用、要約を作成できることがわかっている。これは幻覚と呼ばれる現象である。 [ 176 ] [ 177 ] [ 178 ] [ 179 ]
Amazon Web Services AI Labs の研究者が発表した論文によると、Web ページのスナップショットであるCommon Crawlの 60 億以上の文のサンプルから、57% を超える文が機械翻訳されたことが判明しました。これらの自動翻訳の多くは、特に 3 つ以上の言語に翻訳された文において、品質が低いと見なされました。リソースの少ない言語 (例:ウォロフ語、コサ語) の多くは、リソースの多い言語 (例: 英語、フランス語) よりも多くの言語に翻訳されていました。[ 180 ] [ 181 ]
2024年9月、インターネット上のテキストに基づいて単語頻度を計算するオープンソースデータベースwordfreqの作者であるRobyn Speerは、 RedditやTwitterからデータを取得するコストが高いこと、自然言語処理コミュニティの他の方法と比較して生成AIに過度に焦点が当てられていること、そして「生成AIがデータを汚染した」ことなど、いくつかの理由でデータの更新を停止したと発表した。[ 182 ]
生成型AIツールの採用により、複数のドメインでAI生成コンテンツが爆発的に増加しました。ユニバーシティ・カレッジ・ロンドンの調査によると、2023年には6万件以上の学術論文(全出版物の1%以上)がLLMの支援を受けて執筆された可能性が高いと推定されています。[ 183 ] スタンフォード大学の人間中心型AI研究所によると、新たに発表されたコンピュータサイエンス論文の約17.5%と査読テキストの16.9%が、現在LLMによって生成されたコンテンツを取り入れています。[ 184 ]
AI 生成コンテンツが、AI モデルの追加トレーニングのためにインターネットからの新しいデータ クロールに含まれる場合、結果として得られるモデルに欠陥が生じる可能性があります。[ 185 ]別の AI モデルの出力のみを使用して AI モデルをトレーニングすると、品質の低いモデルが生成されます。各新しいモデルが前のモデルの出力でトレーニングされるこのプロセスを繰り返すと、徐々に劣化し、最終的には複数回の反復後に「モデルの崩壊」につながります。[ 186 ]
一方、合成データは、ユーザーのプライバシーを保護しながら機械学習モデルをトレーニングするために使用できます。[ 187 ]このアプローチはテキスト生成に限定されず、画像生成はコンピュータビジョンモデルのトレーニングに使用されています。[ 187 ]
AIが生成した露骨な画像や動画を許可するウェブサイトが多数作成されており、[ 188 ]これはレイプ、児童性的虐待資料、[ 189 ] [ 190 ]死体性愛、獣姦などの違法コンテンツの作成に使用されています。
生成型AIのリアルな偽コンテンツを作成する能力は、フィッシング詐欺を含む多くの種類のサイバー犯罪で悪用されてきました。[ 191 ]ディープフェイクのビデオとオーディオは、偽情報や詐欺の作成に使用されています。2020年、元Googleクリック詐欺対策責任者のShuman Ghosemajumder氏は、ディープフェイクビデオが完全にリアルになると、視聴者にとって驚くべきものではなくなり、偽情報が無批判に受け入れられる可能性があると主張しました。[ 192 ]さらに、大規模言語モデルやその他のテキスト生成AIは、eコマースWebサイトの偽レビューを作成して評価を上げるために使用されています。[ 193 ]サイバー犯罪者は、WormGPTやFraudGPTなど、詐欺に特化した大規模言語モデルを作成しました。[ 194 ]
2023年の研究では、生成AIは脱獄、逆心理攻撃、プロンプトインジェクション攻撃に対して脆弱であり、攻撃者がソーシャルエンジニアリングやフィッシング攻撃の作成など、有害な要求で支援を得ることを可能にすることが示されました。[ 195 ]さらに、他の研究者は、オープンソースモデルは低コストでセキュリティ制限を取り除くように微調整できることを実証しました。[ 196 ]
2025年、イスラエルは米国に拠点を置くクロックタワーX社と600万ドルの契約を締結し、ソーシャルメディアやウェブサイトに親イスラエル情報を拡散することでChatGPT、Gemini、Grokに影響を与えることを目指した。これは、LLMがより最新の情報を提供するために使用する検索拡張生成(RAG)技術を利用しようとする試みであった。 [ 197 ] [ 198 ] [ 199 ]
CLOUD法は、米国当局が、データが物理的に保存されている場所に関係なく、一部のAIサービスプロバイダーを含む対象となるサービスプロバイダーからデータを要求することを認めています。[ 200 ] [ 201 ]裁判所は、親会社に子会社が保有するデータの提供を命じることができ、そのような命令には、プロバイダーが影響を受けるユーザーに通知することを禁じる非開示要件が付随する場合があります。[ 202 ]この枠組みは、国際協定に基づかない限り、外国の裁判所または行政命令に応じて個人データを移転することを制限する一般データ保護規則(GDPR)第48条との間で法的緊張を生じさせると、法律解説で説明されています。[ 203 ]その結果、両方の法域で事業を行うサービスプロバイダーは、米国法とEU法の下で競合する法的義務に直面する可能性があります。[ 203 ]

AI は、トレーニングと使用の両方からのエネルギー消費の増加により、大きなカーボン フットプリントを抱えています。[ 121 ]科学者やジャーナリストは、生成モデルの開発と展開が環境に与える影響について懸念を表明しています。高 CO2排出量、[ 205 ] [ 206 ] [ 207 ]データ センターで使用される大量の淡水、[ 208 ] [ 209 ]大量の電力使用量、[ 206 ] [ 210 ] [ 211 ]電子廃棄物、[ 212 ]およびバックアップ ディーゼル発電機の排気による汚染。[ 213 ]また、これらのモデルが Google Search や Bing などの広く使用されている検索エンジンに組み込まれるにつれて、[ 210 ]チャット ボットやその他のアプリケーションがより普及するにつれて、 [ 209 ] [ 210 ]モデルの再トレーニングが必要になるにつれて、これらの影響が増加する可能性があるという懸念もあります。[ 210 ]
生成型AIの世界的なカーボンフットプリントは着実に増加していると推定されており、2035年までに年間排出量は1821万トンから2億4594万トンのCO2に達する可能性がある[ 214 ] 。 2035年の最高推定値は、米国牛肉産業の排出量への影響(2024年時点で年間2億5750万トンの排出量と推定されている)に近づいている[ 215 ] 。
提案されている緩和戦略には、モデル開発やデータ収集の前に潜在的な環境コストを考慮すること[ 205 ]、電力/エネルギー使用量を削減するためにデータセンターの効率を高めること[ 207 ] [ 210 ] [ 211 ]、より効率的な機械学習モデルを構築すること[ 206 ] [ 208 ] [ 209 ]、モデルの再トレーニングが必要な回数を最小限に抑えること[ 207 ]、これらのモデルの環境影響を監査するための政府主導の枠組みを開発すること[ 207 ] [ 208 ]、これらのモデルの透明性を規制すること[ 207 ] 、エネルギーと水の使用を規制すること[ 208 ]、研究者にモデルのカーボンフットプリントに関するデータを公開するよう奨励すること[ 207 ] [ 210 ]、機械学習と気候科学の両方を理解する主題専門家の数を増やすこと[ 207 ]などがある。
最先端のAIモデルのトレーニングには膨大な計算能力が必要です。通常、そのような投資を行うための資金力を持っているのは大手テクノロジー企業だけです。CohereやOpenAIのような小規模なスタートアップ企業は、それぞれGoogleやMicrosoftからデータセンターへのアクセス権を購入することになります。[ 216 ]
GPTZeroなどのツールは、AIによって生成されたコンテンツを検出できます。しかし、誤った検出(偽陽性)を行うこともあります。[ 217 ]デジタル透かしは、検出精度を向上させる技術です。これは、生成されたコンテンツをソースで微妙な方法で変更することで機能し、対応するソフトウェアによって検出できます。
2023年、OpenAIはChatGPT用の透かしツールを開発した。しかし、ユーザーが競合他社に乗り換えることを懸念し、公開しなかった。また、別のAIに言い換えを依頼するなどして簡単に回避できるとも主張した。[ 218 ] [ 219 ]
2025年3月、中国はオンラインサービスプロバイダーに対し、AIコンテンツにラベルを付けるよう求める要件を発令した。[ 220 ]
2025年5月、GoogleはウォーターマークツールSynthIDを導入しました。これはGemini(テキスト)、Imagen(画像)、Veo(動画)の出力にウォーターマークを付けます。これらの製品からの出力を検出するには、Googleの「SynthID検出器」ポータルを使用します。[ 221 ]
2025年、ユーザーはビデオゲーム「リトル・ドロイド」と「チェスプラス」に生成AIを使用しているとゲーム会社を誤って非難した。[ 222 ]
我々の審議器は、HSTS計画フレームワーク(Muscettola, 1994)に基づく従来の生成型AIプランナーであり、制御コンポーネントは従来の
宇宙船姿勢制御
システム(Hackney et al. 1993)である。また、世界モデリング(モード識別子)に明示的に専用のアーキテクチャコンポーネントを追加し、制御と監視を区別する。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)音声ミームは、2020年に「15.ai」がローンチされて以来、何らかの形で存在してきたが、[...]
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)テキストからビデオへの変換は生成型 AI の次のフロンティアだが、現在の出力は初歩的だ。Runway は、新しい生成型ビデオモデル Gen-2 を「今後数週間以内」にユーザーに提供すると述べている。
マイクロソフトは、人気のチャット アプリ ChatGPT などの生成型人工知能テクノロジーを、ビジネス ソフトウェア スイート Microsoft 365 に導入しています。Copilot と呼ばれる新しい AI 機能は、Word、PowerPoint、Excel など、同社の最も人気のあるビジネス アプリの一部で利用できるようになります。
フォト アプリに、AI を搭載した再設計されたメモリー機能が追加されます...生成型 AI を使用して、「砂漠の冒険」などの候補名を生成できるようになります。
Firefly の AI 機能をデザインに取り入れるため、Photoshop に生成型塗りつぶし機能を発表しました。
2を自分のマシンで実行したり、コードを変更したりする場合は、AIモデルを共有するための主要プラットフォームであるHugging Faceから直接ダウンロードできます。
8GBのRAMを搭載したPi 4を使用すると、LLaMAをベースにしたChatGPTのようなサーバーを作成できます。
Thingsは、iPhoneにStable Diffusionをもたらすアプリです。AI画像はローカルで生成されるため、インターネット接続は必要ありません。
自宅でLLaMAモデルを実行するには、推論に必要な大量のデータと計算を処理できる強力なGPUを搭載したコンピュータが必要です。
A800 は、Nvidia が販売できる処理能力を制限する米国の厳しい輸出基準に準拠しながら、A100 GPU の 70% の速度で動作します。
、作家とその創作物を保護するAI規制を明示的に要求する契約を求めて、全米脚本
家組合
( Writer's
Guild
of America)に加わった
。ハリウッドにおける生成型人工知能の将来、そしてそれが労働力の代替としてどのように利用できるかは、ストライキ中の俳優にとって重要な争点となっている。木曜日の記者会見で、全米映画俳優組合・全米テレビ・ラジオ芸術家連盟(SAG-AFTRAとしてよく知られている)の会長であるフラン・ドレシャーは、「人工知能はクリエイティブな職業にとって存亡の危機であり、すべての俳優やパフォーマーは、同意や報酬なしにアイデンティティや才能を悪用されることから身を守るための契約条項を受ける権利がある」と述べた。
インターネット上やWordfreqが使用したデータセットには常にスパムが存在していたが、「それは管理可能で、多くの場合識別可能だった。大規模な言語モデルは、実際には意図がないにもかかわらず、意図を持って本物の言語を装ったテキストを生成し、その出力は至る所に現れる」と彼女は書いている。彼女は例として、ChatGPTが「delve」という単語を人間が使わない方法で過剰に使用し、この特定の単語の頻度を狂わせていることを挙げている。