人工知能において、基盤モデル(FM)、別名ラージxモデル( LxM 、ここで「x」はテキスト、画像、音声などを表す変数)は、膨大なデータセットでトレーニングされた機械学習または深層学習モデルであり、幅広いユースケースに適用できます。[ 1 ]大規模言語モデル(LLM)などの生成AIアプリケーションは、基盤モデルの一般的な例です。[ 1 ]
基盤モデルの構築は、多くの場合、非常に多くのリソースを必要とし、最も高度なモデルでは、膨大なデータセットの取得、キュレーション、処理にかかる費用と、トレーニングに必要な計算能力を賄うために、数億ドルもの費用がかかります。[ 2 ]これらのコストは、高度なインフラストラクチャ、長時間のトレーニング、 GPUなどの高度なハードウェアの必要性から生じています。対照的に、既存の基盤モデルを特定のタスクに合わせて調整したり、直接使用したりする方が、事前トレーニング済みの機能を使用し、通常はより小規模なタスク固有のデータセットで微調整するだけで済むため、はるかにコストが低くなります。
基盤モデルの初期の例としては、OpenAI の GPTシリーズやGoogleのBERTなどの言語モデルが挙げられます。[ 3 ] [ 4 ]テキスト以外にも、基盤モデルはさまざまなモダリティで開発されています。画像にはDALL-E、Stable diffusion、Flamingo [ 5 ] 、音楽には MusicGen [ 6 ]と LLark [ 7 ]、ロボット制御には RT-2 [ 8 ]などがあります。また、天文学[ 9 ] 、放射線学[ 10 ]、眼科学[ 11 ] 、 ゲノミクス[ 12 ] 、地球科学[ 13 ] 、コーディング[ 14 ]、時系列予測[ 15 ] 、数学 [16]、化学[ 17 ]などの分野でも基盤モデルが開発されています。
スタンフォード大学人間中心人工知能研究所(HAI)の基盤モデル研究センター(CRFM)は、2021年8月に「基盤モデル」という用語を考案しました[ 18 ]。これは、「広範なデータ(一般的には大規模な自己教師あり学習を使用)でトレーニングされ、幅広い下流タスクに適応(微調整など)できるモデル」を意味します[ 19 ] 。これは、既存の用語は重複しているものの適切ではないという彼らの観察に基づいています。「『大規模言語モデル』は、焦点が言語だけではないことから狭すぎます。『自己教師ありモデル』はトレーニングの目的に特化しすぎています。『事前トレーニング済みモデル』は、注目すべきアクションがすべて『事前トレーニング』の後に起こったことを示唆しています」[ 20 ]。「基盤モデル」という用語は、「基盤モデル」[ 21 ]よりも選ばれました。「基盤」は、これらのモデルが「基盤」とは異なる方法で基本的な原理を提供することを意味します。[ 22 ]視覚言語モデル(VLM)という用語もほぼ同義語として使用されます。
政府が財団のモデルを規制するにつれて、新たな法的定義が生まれてきた。
米国の定義は、基礎モデルのサイズに言及している唯一の定義であり、その規模に関して異なっている。ベイヤーとエシューの定義では、基礎モデルは潜在的な危険性となるほどの性能レベルを達成しなければならないと規定されている。一方、EUの定義では、モデルは出力の汎用性を考慮して設計されなければならないと規定されている。いずれの定義も、基礎モデルは幅広いデータに基づいて学習され、多くの分野で応用可能である必要があるという点では一致している。
技術的には、基盤モデルは、深層ニューラルネットワーク、転移学習、自己教師あり学習といった確立された機械学習技術を用いて構築されます。基盤モデルは、特定のタスクに特化した特注モデルではなく、再利用可能なインフラストラクチャとして機能する汎用モデルであるという点で、従来の技術とは異なります。
コンピュータ並列処理の進歩(CUDA GPUなど)やニューラルネットワークアーキテクチャの新たな発展(Transformerなど)、最小限の教師あり学習によるトレーニングデータの使用増加などが、ファウンデーションモデルの台頭に貢献しました。ファウンデーションモデルは、2010年代後半にディープラーニングモデルの最新波として具体化し始めました。[ 25 ]ディープラーニングに関するこれまでの研究のほとんどと比較して、これらの言語モデルは、自己教師あり学習の目的(大規模なテキストコーパスで次の単語を予測するなど)を使用して、はるかに大規模なウェブソースデータセットでトレーニングする可能性を示しました。これらのアプローチは、word2vecやGloVeなどの以前の研究に基づいており、注釈付きデータ(クラウドソーシングによるラベルなど)を必要とする以前の教師あり学習アプローチとは異なっていました。
2022年にリリースされたStable DiffusionとChatGPT(当初はGPT-3.5モデルで動作)は、基盤モデルと生成AIが広く一般に議論されるきっかけとなった。さらに、2023年にリリースされたLLaMA、Llama 2、Mistralは、基盤モデルのリリース方法に重点を置くことに貢献し、オープンな基盤モデルは多くの支持[ 26 ]と精査[ 27 ]を集めた。
高度に発達した基盤モデルの中には、「フロンティアモデル」と呼ばれるものがあり、公共の安全に重大なリスクをもたらす可能性のある危険な能力を備えている。[ 28 ]これらの「危険な能力」は、そのようなモデルの偶発的または意図的な誤用から生じ、その強力な性質と相まって深刻な被害につながる可能性がある。基盤モデルが改良され続けるにつれて、一部のAI研究者は、次世代の基盤モデルのほぼすべてがフロンティアモデルとみなされるだろうと推測している。
危険な能力という概念は本質的に主観的なものであるため、どの基礎モデルが最先端モデルとして認められるかを厳密に定義する基準はありません。しかし、十分に危険な能力に関する一般的に受け入れられている考え方には、以下のようなものがあります。
米国の定義(NISTのAI安全研究所による)は、「最先端」のステータスを計算技術の閾値にも関連付け、客観的な法的要件を作り出した。[ 33 ]
最先端モデルは独自の機能を備えているため、その開発と展開を効果的に規制することは困難です。その創発的な性質から、開発段階と展開後の両方で、最先端モデルに新たな危険な機能が自然に現れる可能性があります。[ 28 ]さらに、最先端モデルは展開後も適応し続けるため、既に展開されたモデルから生じるすべての害を軽減することは依然として困難です。最先端モデルがたまたまオープンソースであったり、オンラインで公開されたりした場合、モデルは急速に拡散する可能性があり、説明責任の欠如を生み出すことで規制当局の活動をさらに妨げます。
これに対し、OpenAI、Anthropic、Google、Microsoftが設立したFrontier Model Forumなどのグループが、これらの高度な基礎モデルの安全基準を作成するために設立されました。[ 34 ]政府および政府間機関のグローバルネットワークが、AI安全研究所のグローバルネットワーク(AISI)[ 35 ]やG7「広島AIプロセス」(HAIP)[ 36 ]など、正式な安全基準を作成するために出現しました。
基盤モデルは幅広いユースケースに適応できるため、汎用AIの例とみなされることがあります。欧州議会は、EU AI法を設計する際に、汎用AI技術の新たな波がAIエコシステム全体を形作っていると述べています。[ 37 ]エコシステムのより完全な構造は、特定の汎用AIシステムの特性に加えて、AI政策と研究の設計に影響を与えます。[ 38 ]汎用AIシステムは、 ChatGPTやDALL-Eなどのアプリケーションやツールを通じて、人々の日常生活にもよく登場します。
欧州議会などの政府機関は、基盤モデルなどの汎用AIの規制を最優先事項として位置付けています。汎用AIシステムは、規模が大きく、透明性が低く、創発的な性質を持つことが多く、これらはすべて意図しない害をもたらす可能性があります。また、このようなシステムは下流のアプリケーションにも大きな影響を与えるため、規制の必要性がさらに高まります。主要な法規制に関して言えば、多くの関係者がEU AI法に汎用AIシステムに対する制限を盛り込むよう働きかけており、これらの制限は基盤モデルにも適用されます。
ワールドモデルは、基礎モデルと呼ばれることもあります。[ 39 ] [ 40 ]ワールドモデルは、一連のアクションを実行した後の環境の状態を予測することを目的とした環境の表現であり、[ 41 ] [ 42 ]重力などの物理的概念を暗黙的にモデル化します。[ 42 ]ワールドモデルへの入力プロンプトには、テキストや画像、[ 43 ] [ 44 ]動画や3Dシーン[ 45 ]を含めることができ、結果として得られる3D環境をエクスポートできます。[ 45 ]ワールドモデルは、具現化されたAI、マルチエージェントモデル、脳の神経科学モデルとともに、汎用人工知能を実現するための大規模言語モデルの代替手段と見なされています。[ 46 ]
世界モデルには完全に合意された定義はありませんが、2つの範囲に分けられています。1つは現在の環境を表現し理解するためのもので、もう1つはその環境の将来の状態を予測するためのものです。前者の観点からは、モデルベースの強化学習とマルコフ決定過程を使用して世界モデルが開発され、モデル予測制御またはモンテカルロ木探索を使用してポリシーが作成されます。後者では、(マルチモーダル)大規模言語モデルまたはビデオ生成モデルを使用できます。さらに、これらの環境は、現実世界で相互作用できるAIエージェントをトレーニングするための没入型シミュレーションである可能性があります。[ 47 ]
Quanta Magazine は、世界モデルを、1943 年にKenneth Craikがメンタルモデルについて発表した論文と、1960 年代のSHRDLUのブロックワールドに遡って追跡した。 [ 48 ] Business Insider は、世界モデルを、1971 年にJay Wright Forresterが発表した論文に遡って追跡した。[ 46 ]世界知識を整理する関連アイデアであるフレーム表現は、 1974 年にMarvin Minskyによって提案された。[ 47 ]
2018年、研究者のDavid HaとJürgen Schmidhuberは、強化学習の文脈で世界モデルを定義しました。それは、視覚的観察を表すための変分オートエンコーダーモデルV 、記憶を表すためのリカレントニューラルネットワークモデルM、および意思決定を行うための線形モデルCを持つエージェントです。彼らは、現実をシミュレートする環境で世界モデルに基づいて訓練されたエージェントは、現実世界の設定に適用できると示唆しました。[ 49 ]
2022年、ヤン・ルカンは、世界モデル(彼によれば、関連性があるとみなされる世界の側面に対する精神モデルとして機能するニューラルネットワーク)を、より大きな認知アーキテクチャシステム(脳のさまざまな領域に類似する他のニューラルネットワーク)の一部として捉えた。彼の見解では、このフレームワークは常識的な推論につながる可能性がある。[ 50 ] [ 51 ]ルカンは、世界モデルが完全に機能するようになるのは2020年代後半[ 52 ]から2030年代半ば[ 53 ]になると推定している。
ワールドモデルは、テキスト、画像、音声、ビデオなど、さまざまなデータモダリティでトレーニングされ、ビデオ生成に適用されています。[ 54 ]ワールドモデル用のオープンソースデータセットの1つには、複数のモダリティ(テキスト、画像、音声、ビデオ、点群)にわたる10億のデータポイントが含まれており、100万の手動アノテーションが含まれています。[ 42 ]
TechCrunch はSora を世界モデルの例として挙げたが、 [ 54 ] 2025 年 1 月にはNvidia が独自の世界モデルをリリースした。[ 55 ] [ 40 ] South China Morning PostはManycore Tech が世界モデルの構築を目指す企業のもう 1 つの例であり、その取り組みを空間知能の例として挙げた。[ 56 ] 2025 年 5 月には、モハメド・ビン・ザイード人工知能大学がAI エージェントをテストするためのシミュレーション構築用の世界モデルをリリースした。[ 57 ]
Google DeepMind は、ビデオ データでトレーニングされた2 次元空間と3 次元空間の 2 つのワールド モデルもそれぞれ公開しており、Google は後者が AI エージェントのトレーニング 環境になり得ると主張している。 [ 58 ] [ 59 ] Meta は2025 年 6 月にワールド モデルを公開した。 [ 60 ] Tencent は2025 年 7 月にオープンソースのワールド モデルを公開した。[ 61 ] Niantic, Inc. のスピンオフであるNiantic Spatial は、 Pokémon GOからの匿名化されたプレイヤー スキャンを使用してワールド モデルを開発している。[ 62 ] [ 63 ] 2025 年現在、ワールド モデルの構築を計画している他の企業には、ByteDance [ 61 ]とxAI [ 64 ]がある。
フェイフェイ・リーは、世界モデルはロボット工学やクリエイティブ作品に応用できると考えている。これらのモデルの複雑さゆえに、彼女はデータ取得、データエンジニアリング、データ処理、データ合成においてより複雑な戦略を提唱している。[ 65 ]彼女は世界モデル構築のスタートアップを共同設立し、2024年時点で、3次元空間と時間の理解の組み込み、拡張現実のサポート、ロボット工学のサポートという3つのフェーズでそれを計画していた。[ 66 ]彼女のスタートアップであるワールドラボは、2025年11月に商用世界モデルであるマーブルをリリースした。[ 67 ]
ワールドモデルは、インタラクティブメディア(ビデオゲームや映画など[ 68 ])や環境シミュレーション[69]での使用を目的としています。ワールドモデルの提案されているユースケースには、行動計画や結果予測[ 67 ]などがあります。その他のアプリケーションには、社会システムをシミュレートするソーシャルシミュラクラ[ 47 ]などがあります。Wiredはワールドモデルをメタバースと比較し[ 66 ]、Business Insiderは軍事用途の可能性を指摘しました[ 65 ]。
2025年には、世界モデルがドローン戦争、ロボット工学、自動運転車に適用されています。ウォール・ストリート・ジャーナルは、世界モデルが人工知能モデルの空間推論を改善し、ブルーカラーとホワイトカラーの両方の仕事を自動化できる可能性があると推測しました。 [ 70 ] 2025年10月現在、テキストからビデオへのモデル(特にVeo 3)の空間推論能力に関する研究では、さまざまな結果が出ています。[ 71 ] 眼科では、基礎モデルが体積光コヒーレンストモグラフィーを含む網膜イメージングに適用されています。[ 72 ]
TechCrunchは、世界モデルは大規模な言語モデルよりも多くのデータを使用する可能性があり、はるかに多くの計算能力(トレーニングと推論に数千個のGPUを使用することを含む)が必要になると指摘した。 [ 51 ] [ 54 ]また、幻覚、カバレッジバイアス、アルゴリズムバイアスのリスクも。 [ 54 ]同様に、フィナンシャル・タイムズは、世界をシミュレートするためのデータを収集し、そのデータを使用するモデルをトレーニングすることの難しさと費用を指摘した。 [ 64 ]
クリエイティブな専門家たちは、世界モデルが自分たちの業界の雇用を混乱させる可能性があると懸念を表明している。[ 69 ]
その他の懸念事項としては、データプライバシー[ 47 ]、有害な状況のシミュレーション[ 47 ] 、誤情報と偽情報[ 47 ] 、創発的行動[ 73 ]、著作権[ 68 ]などが挙げられる。
基盤モデルが効果的に汎化するために、トレーニングデータの豊富な表現を獲得する必要があります。そのため、基盤モデルの構築においては、大規模データを効率的に処理する表現力豊かなモデルアーキテクチャが好まれることが多いです。[ 19 ]現在、Transformerアーキテクチャは、さまざまなモダリティにわたる基盤モデルの構築において事実上の選択肢となっています。[ 74 ]
基礎モデルは、損失関数を最適化することによって構築されます。損失関数とは、トレーニングデータに対するモデルの予測に基づいてモデルパラメータがどのように更新されるかを決定する数学関数です。[ 75 ]言語モデルは、多くの場合、次のトークンの予測目標でトレーニングされます。これは、モデルがシーケンス内の次のトークンをどの程度予測できるかを示します。画像モデルは、一般的に、対照学習または拡散トレーニング目標でトレーニングされます。対照学習の場合、画像はランダムに拡張され、その結果得られるモデルの表現の類似性に基づいて評価されます。拡散モデルの場合、画像はノイズが加えられ、モデルは目標を介して徐々にノイズを除去することを学習します。マルチモーダルトレーニング目標も存在し、トレーニング中に画像とテキストを分離するものもあれば、同時に調べるものもあります。[ 76 ]一般的に、基礎モデルのトレーニング目標は、データの広く有用な表現の学習を促進します。
基盤モデルの台頭と、それを支える大規模データセットの普及に伴い、トレーニング目標はインターネット規模のデータから意味のあるデータポイントを抽出できる能力を備えている必要があります。さらに、基盤モデルは幅広いタスクを解決するように設計されているため、トレーニング目標はドメイン完全性、つまり与えられたドメイン内で幅広い下流機能を解決できる能力を備えている必要があります。最後に、基盤モデルのトレーニング目標は、高いスケーラビリティと計算効率性を実現する必要があります。モデルサイズと計算能力はどちらも重要な制約となるため、トレーニング目標はこれらのボトルネックを克服できる能力を備えている必要があります。
基盤モデルは、「データが多いほど良い」という原則に基づいて、大量のデータでトレーニングされます。[ 77 ]パフォーマンス評価では、一般的にデータが多いほどパフォーマンスが向上することが示されていますが、データ量が増加するにつれて他の問題が発生します。データセットの管理、新しいアプリケーション間でのデータ統合、データライセンスの遵守の確保、データ品質の維持などのタスクは、データサイズが大きくなるにつれてすべて難しくなります。大規模な基盤モデルでは公開されているウェブスクレイピングデータを使用することが依然として一般的であるため、基盤モデルの特定の要求は、これらの問題をさらに悪化させています。基盤モデルには、検索エンジンデータと SEO メタタグデータも含まれます。公開されているウェブデータは豊富なリソースですが、トレーニングパイプラインに正常に統合される前に、基盤モデルの開発者による厳格なモデレーションとデータ処理も必要です。[ 78 ]
基礎モデルのトレーニングは、プライベートデータが明示された範囲を超えて開示、収集、または使用される可能性があるため、ユーザーのプライバシーを侵害するリスクを伴うことがよくあります。プライベートデータが漏洩しなくても、結果として得られる基礎モデルの学習された動作によって、モデルが意図せずセキュリティを侵害する可能性があります。[ 79 ]データ品質も重要なポイントです。Webスクレイピングされたデータには、偏り、重複、有害な素材が頻繁に含まれているためです。基礎モデルが展開された後も、データの小さなサブセットから望ましくない動作が発生する可能性があるため、高品質のデータを確保することは依然として課題です。
基礎モデルのサイズは、それらが動作するコンピュータシステムにも問題を引き起こします。平均的な基礎モデルは、単一のアクセラレータのメモリ内で実行するには大きすぎ、初期トレーニングプロセスには大量のリソースが必要です。[ 80 ]基礎モデルが新たな高みに達するにつれて、このような問題は将来さらに悪化すると予測されています。この制約のため、研究者たちはタイトなモデル推論によってモデルサイズを圧縮することを検討し始めています。
GPUは、大容量メモリと強力な処理能力を備えているため、機械学習における最も一般的な計算ハードウェアとして選ばれています。典型的な基礎モデルのトレーニングには、高速インターコネクトで並列接続された分散コンピューティング環境で多数のGPUが必要です。必要な計算効率を備えた十分な数のGPUを入手することは、多くの基礎モデル開発者にとって課題であり、この分野でますます深刻なジレンマとなっています。モデルが大きくなると、より大きな計算能力が必要になりますが、多くの場合、計算効率の向上を犠牲にすることになります。トレーニングは依然として時間とコストがかかるため、計算能力と計算効率のトレードオフにより、大規模で最先端の基礎モデルの製造コストを負担できる企業はごく少数に限られています。圧縮や蒸留などの技術によって推論のコストを抑えることはできますが、この弱点を完全に克服することはできません。
基礎モデルの精度と性能は、モデルのサイズと訓練データの量に応じて予測可能な形で向上することが多い。具体的には、スケーリング法則が発見されており、これはリソース(データ、モデルサイズ、計算量)とモデルの性能を関連付けるデータに基づいた経験的傾向である。特に、モデルの規模は計算量、データセットのサイズ、およびパラメータ数によって定義され、これらはすべて最終的な性能とべき乗則の関係を示す。
しかし、この関係が(ブレークと呼ばれる点で)ある指数を持つべき乗則から別の(異なる)指数を持つべき乗則へと滑らかに移行する、破れたスケーリング法則[ 81 ]が発見されている。ブレーク付近(またはブレーク後)の点を収集しない場合、正確な外挿を得ることは困難になる可能性がある。
基盤モデルは本質的に多目的に使用できるため、特定のユースケースにこれらのモデルを使用するには、何らかの適応が必要となります。最低限、モデルは対象となるタスクを実行できるように適応させる必要があります(タスク仕様)。しかし多くの場合、対象となるドメインへのより広範な適応(ドメイン特化)によって、より優れたパフォーマンスを実現できます。
さまざまな方法 (プロンプト、コンテキスト内学習、ファインチューニング、LoRA など) により、適応のコストとモデルの特化の程度との間でさまざまなトレードオフが提供されます。基盤モデルを適応させる際に考慮すべき主な側面には、計算予算とデータの可用性があります。基盤モデルは非常に大きく、最大で数兆個のパラメータを持つため、基盤モデル全体を適応させるには計算コストがかかる場合があります。そのため、開発者は時間とスペースを節約するために、最後のニューラル層のみ、またはバイアスベクトルのみを適応させる場合があります。[ 82 ]特にニッチなアプリケーションの場合、基盤モデルを十分に適応させるための特定のデータが利用できない場合もあります。このような状況では、データを手動でラベル付けする必要がありますが、これはコストがかかり、専門家の知識が必要になる場合があります。
評価は、基盤モデルの開発において重要な部分です。評価は、高性能モデルの進捗状況を追跡できるだけでなく、将来のモデル開発のためのベンチマークも作成します。利害関係者は、モデルの動作を理解し、そのさまざまな属性についての洞察を得るために評価に頼っています。従来、基盤モデルは、MMLU [ 83 ]、MMMU [ 84 ] 、 HumanEval [ 85 ]、GSM8K [ 86 ]などの標準化されたタスクベンチマークを通じて相互に評価されていました。基盤モデルは多目的であるため、さまざまな基盤ベンチマークを集約するメタベンチマークがますます開発されています。例としては、LM-Harness [ 87 ] 、 BIG-Bench [ 88 ] 、 HELM [ 89 ]、OpenLLM Leaderboard [ 90 ]、DecodingTrust [ 91 ] 、 HEIM [ 92 ]などがあります。
基盤モデルの有用性は、基盤モデル自身の一般的な機能と、微調整されたアプリケーションのパフォーマンスに依存するため、評価は両方の指標を網羅する必要があります。適切な評価では、基盤モデルの下流アプリケーションを全体として検証するとともに、基盤モデルが持つ直接的な特性も検証します。評価の公平性をさらに確保するために、既存の評価フレームワークの中には、すべての適応リソースを考慮に入れているものがあり、これにより、すべての利害関係者の利益となる、より情報に基づいた分析が可能になります。[ 93 ]
基盤モデルの一般的な機能により、多くの上流および下流のテクノロジーによって支えられているAIエコシステムにおいて独自の役割を果たすことができます。[94 ]基盤モデルのトレーニングには、データ、コンピューティング、労働力、ハードウェア、コードなどの複数のリソースが必要であり、基盤モデルには膨大な量のデータとコンピューティング(計算能力とも呼ばれる)が伴うことがよくあります。基盤モデルの開発コストが高く、適応要件が安価であるため、AI環境は下流の適応のために基盤モデルを作成する少数のAI企業にシフトしています。[ 95 ]そのため、ほとんどの基盤モデル企業は、このステップを専門のデータプロバイダー(Scale AI、[ 96 ] Surge [ 97 ]など)およびコンピューティングプロバイダー( Amazon Bedrock、Google Cloud、Microsoft Azureなど)にアウトソーシングしています。

基盤モデル開発者自身がデータを受け取り、提供されたコンピューティングリソースを使用して実際に基盤モデルをトレーニングします。基盤モデルが完全に構築されると、データと労働力の要件の大部分が軽減されます。この開発プロセスでは、ハードウェアとコンピューティングが最も必要であり、最も独占的なリソースでもあります。より大規模で複雑なAIをトレーニングするには、十分な量のコンピューティングが鍵となります。しかし、コンピューティングは少数の特定のエンティティに集中しており、ほとんどの基盤モデル開発者はそれらに依存しています。そのため、基盤モデルのパイプラインはこれらのプロバイダーに大きく集中しています。コンピューティングはコストもかかります。2023年には、AI企業は総資本の80%以上をコンピューティングリソースに費やしました。[ 99 ]
基盤モデルは、その機能を実現するために大量の一般データを必要とします。初期の基盤モデルは、このデータ情報を提供するためにインターネットのサブセットからデータをスクレイピングしていました。基盤モデルの規模と範囲が拡大するにつれて、より多くのインターネットスクレイピングが必要になり、偏ったデータや有害なデータが発生する可能性が高くなります。この有害または偏ったデータは、社会的に疎外されたグループに不均衡な害を与え、既存の偏見を悪化させる可能性があります。[ 100 ]
教師なし学習で発生した低品質データの問題に対処するため、一部の基礎モデル開発者は手動フィルタリングに頼るようになった。データ労働として知られるこの手法には、独自の多くの問題が伴う。[ 101 ]このような手動によるデータ浄化は、人件費を削減するために外部委託されることが多く、中には時給2ドル未満の労働者もいる。[ 102 ]
基盤モデルは、開発者自身または外部組織を通じてオンラインで公開されます。公開後、他の関係者は、基盤モデルを基に、微調整や全く新しい目的のためのアプリケーションを作成できます。人々はこれらのアプリケーションにアクセスして様々な用途に活用できるため、一つの基盤モデルが幅広いユーザー層にサービスを提供し、その基盤となる機能を実現できます。
基盤モデルが構築された後、さまざまな方法でリリースできます。リリースには、アセット自体、アクセス権限を持つユーザー、アクセス権限が時間とともにどのように変化するか、使用条件など、多くの側面があります。[ 103 ]これらの要素すべてが、基盤モデルが下流のアプリケーションに与える影響に影響します。[ 104 ]特に、基盤モデルのリリースで最も一般的な形式は、API とモデルの直接ダウンロードの 2 つです。
APIを介してモデルがリリースされる場合、ユーザーはモデルにクエリを実行して応答を受け取ることはできますが、モデル自体に直接アクセスすることはできません。これに対し、モデルを直接ダウンロードしてユーザーがアクセスおよび変更することも可能です。どちらのリリース方法も、多くの場合オープンリリースに分類されます。オープンリリースの正確な定義については議論がありますが、広く受け入れられている要件はOpen Source Initiativeによって提供されています。
オープンな基盤モデルには、PaLM 2、Llama 2、Granite、Mistralなどがあります。オープンな基盤モデルは研究開発を容易にする一方で、悪用されるリスクも高くなります。オープンな基盤モデルは誰でもダウンロードでき、特に強力なモデルは、意図的または非意図的に害を及ぼすように微調整される可能性があります。
非公開リリースでは、基盤となるモデルは一般にはアクセスできず、組織内部でのみ使用されます。このようなリリースは安全性が高いと考えられていますが、研究コミュニティや一般の人々にとって付加価値を提供するものではありません。
Google DeepMindのFlamingo [ 105 ]のような一部の基盤モデルは完全にクローズドであり、モデル開発者のみが利用できます。OpenAIのGPT-4のような他のモデルはアクセスが制限されており、一般に公開されていますが、ブラックボックスとしてのみ利用可能です。また、MetaのLlama 2のような他のモデルはオープンであり、広く利用可能なモデルの重みにより、下流での変更や精査が可能です。
{{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク){{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク){{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク){{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク){{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク){{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク){{cite web}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク)