大規模言語モデル(LLM)は、自然言語処理タスク、特に言語生成のために膨大な量のテキストでトレーニングされたAIモデル(通常はニューラルネットワーク)です。LLMは通常、多くのコンテキストでテキストを生成、要約、翻訳、分析することができ、現代のチャットボットの基盤となる技術です。[ 1 ]偏った、または不正確なトレーニングデータは、LLMの出力の信頼性を低下させる可能性があります。[ 2 ]
LLMは通常、トランスフォーマーアーキテクチャに基づいています。[ 3 ]生成事前学習トランスフォーマー(GPT)は、次の単語を予測するように事前学習されたLLMの一種です。[ 4 ] GPTはその後、指示に従い、アシスタントとして動作するように微調整されることがよくあります。 [ 5 ]
LLMのベンチマーク評価では、モデルの推論、事実の正確性、整合性、安全性を測定しようと試みています。[ 6 ]



2017年にトランスフォーマーベースのモデルが登場する以前は、当時の計算能力やデータ制約に比べて、一部の言語モデルは大規模であると考えられていました。1990年代初頭、 IBMの統計モデルは機械翻訳のための単語アライメント技術を開拓し、コーパスベースの言語モデリングの基礎を築きました。2001年には、Kneser–Ney平滑化などを採用した平滑化n -gramモデルが3億語で学習し、ベンチマークテストで最先端のパープレキシティを達成しました。[ 7 ] 2000年代には、インターネットアクセスが広く普及するにつれて、研究者たちは統計的言語モデルを学習するために、ウェブから大規模なテキストデータセット(「ウェブをコーパスとして」[ 8 ])を収集し始めました。[ 9 ] [ 10 ]
n -gramモデルを 超えて、研究者たちは2000年にニューラルネットワークを言語モデルとして使用し始めました。[ 11 ] 2012年頃の画像分類におけるディープニューラルネットワークのブレークスルーに続いて、 [ 12 ]同様のアーキテクチャが言語タスクに適用されました。この変化は、単語埋め込み(例: 2013年のMikolovによるWord2Vec )とLSTMを使用したシーケンス・トゥ・シーケンス(seq2seq)モデルの開発によって特徴づけられました。2016年、Googleは翻訳サービスをニューラル機械翻訳(NMT)に移行し、統計的フレーズベースモデルをディープリカレントニューラルネットワークに置き換えました。これらの初期のNMTシステムは、トランスフォーマーの発明に先立って、LSTMベースのエンコーダー・デコーダーアーキテクチャを使用していました。

2017年のNeurIPSカンファレンスで、Googleの研究者らは画期的な論文「 Attention Is All You Need」でトランスフォーマーアーキテクチャを紹介しました。 [ 13 ]この論文の目的は、2014年のseq2seq技術を改良することであり、主に2014年にBahdanauらが開発したアテンションメカニズムに基づいています。 [ 14 ] [ 15 ]翌年の2018年にはBERTが導入され、すぐに「ユビキタス」になりました。[ 16 ]オリジナルのトランスフォーマーにはエンコーダーブロックとデコーダーブロックの両方がありますが、BERTはエンコーダーのみのモデルです。プロンプトによるタスク解決能力がデコーダーのみのモデル(GPTなど)で急速に向上したことにより、2023年にBERTの学術研究での使用は減少し始めました。[ 17 ]
デコーダーのみのGPT-1は2018年に発表されたが、OpenAIが当初は悪用を恐れて公開するには強力すぎると判断したと主張したため、2019年のGPT-2が広く注目を集めた。 [ 18 ] 2020年のGPT-3はさらに一歩進み、2025年現在API経由でのみ利用可能で、モデルをダウンロードしてローカルで実行する機能は提供されていません。しかし、2022 年後半に公開された消費者向けチャットボットChatGPTが、2023 年までにメディアで広く取り上げられ、世間の注目を集めました。 [ 19 ] 2023 年のGPT-4は、精度の向上とマルチモーダル機能の「聖杯」として称賛されました。 [ 20 ] OpenAI は、GPT-4 の高レベルアーキテクチャとパラメータ数を明らかにしませんでした。ChatGPT のリリースにより、ロボット工学、ソフトウェアエンジニアリング、社会への影響に関する作業など、コンピュータサイエンスのいくつかの調査サブフィールドで LLM の使用が増加しました。[ 17 ] 2024 年に、OpenAI は、最終的な回答を返す前に長い思考の連鎖を生成する推論モデルOpenAI o1 をリリースしました。 [ 21 ] OpenAI の GPT シリーズと同等のパラメータ数を持つ多くの LLM が開発されています。[ 22 ]
2022年以降、重みが利用可能なモデルの人気が高まっており、特に最初はBLOOMとLLaMAが人気でしたが、どちらも使用と展開に制限があります。Mistral AIのオープンウェイトモデルであるMistral 7BとMixtral 8x7Bは、より寛容なApacheライセンスを採用しています。2025年1月、DeepSeekは、OpenAI o1と同等の性能を持ちながら、ユーザーにとってトークンあたりの価格がはるかに低い6710億パラメータのオープンウェイトモデルであるDeepSeek R1をリリースしました。[ 23 ]
2023年以降、多くのLLM(言語学習モジュール)はマルチモーダルな訓練を受けており、画像、音声、3Dメッシュなど、他の種類のデータも処理または生成する能力を備えている。
オープンウェイトLLMは2023年以降、より影響力を持つようになった。Vakeら(2025)によれば、Hugging Faceなどのコラボレーションプラットフォームを通じて、オープンウェイトモデルへのコミュニティ主導の貢献により、その効率とパフォーマンスが向上する。[ 24 ]
機械学習アルゴリズムはテキストではなく数値を処理するため、テキストを数値に変換する必要があります。最初のステップでは、語彙を決定し、次に各語彙エントリに任意かつ一意の整数インデックスを割り当て、最後に、埋め込みを整数インデックスに関連付けます。アルゴリズムには、バイトペアエンコーディング(BPE)とワードピースがあります。また、マスクされたトークン(BERTで使用されるもの)や、語彙に現れない文字を表す("unknown")など、制御文字として機能する特別なトークンもあります。さらに、特別なテキストフォーマットを示すために、いくつかの特殊記号が使用されます。たとえば、RoBERTaとGPTでは「Ġ」は前の空白を表し、BERTでは「##」は前の単語の継続を表します。[ 25 ][MASK][UNK]
例えば、従来のGPT-3tokenizer: texts -> series of numerical "tokens"バージョンで使用されるBPEトークナイザーは次のように分割します。
トークン化はデータセットの圧縮も行います。LLMは一般的に、入力が不規則でない配列であることを要求するため、短いテキストは最も長いテキストの長さに一致するまで「パディング」する必要があります。
例として、バイトペアエンコーディングに基づくトークナイザーを考えてみましょう。最初のステップでは、すべての固有文字(空白や句読点を含む)が、 n-グラムの初期セット(つまり、ユニグラムの初期セット)として扱われます。次に、隣接する文字の最も頻繁なペアがバイグラムにマージされ、そのペアのすべてのインスタンスがそれに置き換えられます。次に、最も頻繁に一緒に出現する(以前にマージされた)n-グラムの隣接するペアのすべての出現が、さらに長いn-グラムに再びマージされ、所定のサイズの語彙が得られるまで続きます。トークナイザーがトレーニングされると、初期ユニグラムのセットに出現しない文字が含まれていない限り、任意のテキストをトークナイザーでトークン化できます。[ 26 ]
LLM のトレーニングの文脈では、データセットは通常、低品質、重複、または有害なデータを除去することによってクリーニングされます。[ 27 ]クリーニングされたデータセットはトレーニング効率を高め、下流のパフォーマンスを向上させることができます。[ 28 ]トレーニングされた LLM は、さらに LLM をトレーニングするためのデータセットをクリーニングするために使用できます。[ 29 ]
ウェブ上でLLM生成コンテンツの割合が増加するにつれて、将来のデータクリーニングには、そのようなコンテンツをフィルタリングすることが含まれるようになるかもしれない。LLM生成コンテンツは、コンテンツが人間のテキストに似ている(フィルタリングが困難になる)が品質が低い(それに基づいてトレーニングされたモデルのパフォーマンスが低下する)場合、問題となる可能性がある。[ 1 ]
大規模な言語モデルの学習には、自然界で得られるデータよりも多くの言語データが必要となる場合や、自然界のデータ自体が不十分な品質である場合がある。このような場合、合成データを用いることが考えられる。
LLMは、言語で学習された基礎モデル(大規模Xモデル)の一種です。LLMはさまざまな方法で学習できます。特に、GPTモデルは、ファインチューニングの前に、大量のデータで次の単語を予測するように最初に事前学習されます。[ 4 ]

最大規模のモデルをトレーニングするには、相当なインフラストラクチャが必要です。大規模モデルへの傾向は、大規模言語モデルのリストに表れています。たとえば、2019年のGPT-2(15億パラメータのモデル)のトレーニングには5万ドルかかりましたが、 2022年のPaLM(5400億パラメータのモデル)のトレーニングには800万ドル、Megatron-Turing NLG 530B(2021年)には約1100万ドルかかりました。「大規模言語モデル」の「大規模」という修飾語は、本質的に曖昧です。なぜなら、「大規模」とみなされるために必要なパラメータ数に明確な閾値がないからです。
微調整される前は、ほとんどの LLM は次のトークンを予測するものです。[ 30 ]微調整は、人間のフィードバックからの強化学習(RLHF) や構成的 AIなどの技術によって LLM の動作を形成します。[ 31 ]
指示の微調整は、 LLMにユーザーの指示に従うように教えるために使用される教師あり学習の一種です。2022年にOpenAIは、同様に指示に従うように微調整されたGPT-3のバージョンであるInstructGPTを実証しました。[ 32 ]
RLHFでは、人間が好むテキストを予測する報酬モデルを訓練します。その後、強化学習によってLLMを微調整し、この報酬モデルをより良く満たすことができます。[ 33 ]
LLMは一般的にトランスフォーマーアーキテクチャに基づいており、アテンションメカニズムを活用することで、モデルがシーケンス内のすべての要素間の距離に関係なく、それらの間の関係を同時に処理できるようにします。[ 13 ] [ 34 ] Pengら(2023)は、代替案として状態空間表現モデルを提案しました。 [ 35 ]

コンテキスト ウィンドウの範囲内でどのトークンが互いに関連しているかを調べるために、アテンション メカニズムは、複数のアテンション ヘッドを使用して、各トークンの「ソフト」重みを計算します。より正確には、埋め込みに対してソフト重みを計算します。各アテンション ヘッドは、独自のソフト重みを計算するための独自の「関連性」を持ちます。たとえば、小規模な (つまり、パラメータサイズが 117M) GPT-2モデルは、12 個のアテンション ヘッドと、わずか 1k トークンのコンテキスト ウィンドウを持っています。[ 37 ]
GPTなどの自己回帰モデルは、シーケンスがどのように続くかを推測するように訓練されます。たとえば、「I like to eat」という単語シーケンスの後に「bread」という単語が続く可能性が高いか、「rocks」という単語が続く可能性が高いかを推測します。BERT [ 38 ]などのマスク付きモデルは、シーケンスから欠落している部分を推測するように訓練されます。たとえば、「I like to ___ roses」の欠落している単語が「smell」という単語である可能性が高いか、「eat」という単語である可能性が高いかを推測します。モデルの予測は、トレーニングデータセット内のシーケンスの特性に基づいています。[ 39 ]
エキスパート混合(MoE)は、複数の専門ニューラルネットワーク(「エキスパート」)が連携して動作する機械学習アーキテクチャであり、各入力を最も適切なエキスパートにルーティングするゲーティングメカニズムを備えています。エキスパート混合は、各入力に対してパラメータのごく一部しか使用しないため、推論コストを削減できます。[ 40 ]
通常、LLMは単精度または半精度浮動小数点数(float32およびfloat16)で学習されます。1つのfloat16は16ビット、つまり2バイトなので、10億個のパラメータには2ギガバイトが必要です。最大規模のモデルは通常1000億個以上のパラメータを持ち、ほとんどの民生用電子機器の範囲を超えています。[ 41 ]
トレーニング後の量子化[ 42 ]は、トレーニング済みモデルのパラメータの精度を下げてスペース要件を減らしつつ、パフォーマンスの大部分を維持することを目的としています。量子化は、量子化パラメータが事前に決定される場合 (通常はキャリブレーションフェーズ中) は静的量子化、推論中に量子化が適用される場合は動的量子化にさらに分類できます。最も単純な形式の量子化は、すべてのパラメータを所定のビット数に切り捨てるだけです。これは静的量子化と動的量子化の両方に適用できますが、精度が大幅に低下します。動的量子化では、レイヤーごとに異なる量子化コードブック(値のルックアップテーブルまたは線形マッピング (スケーリング係数とバイアス)) を使用できますが、低精度の演算を使用することによる速度向上の可能性を放棄することになります。
基本的なテキスト生成にとどまらず、外部ツールやデータソースの利用、複雑な問題に対する推論能力の向上、プロンプト方式による指示遵守能力や自律性の向上など、LLMの機能を拡張するための様々な技術が開発されてきた。
2020年、OpenAIの研究者らは、RLHF技術のおかげで、入力データに数ラウンドのQ&A(またはその他の種類のタスク)を例として与えると、新しいモデルGPT-3がどの形式を使用するかを理解できることを実証しました。この技術はfew-shot promptingと呼ばれ、LLMを微調整を必要とせずにあらゆるタスクに適応させることができます。[ 1 ]また、2022年には、基本GPT-3モデルがユーザー入力に基づいて指示を生成できることが分かりました。生成された指示とユーザー入力は、「指示: [...]、入力: [...]、出力:」形式でモデルの別のインスタンスへの入力として使用されます。別のインスタンスは出力を完了することができ、多くの場合、正しい答えを生成します。「自己指示」機能により、LLMは正しい答えに向かって自己ブートストラップすることができます。[ 44 ]
LLM は会話に特化することでチャットボットにすることができます。ユーザー入力には「Q:」や「User:」などのマーカーがプレフィックスとして付けられ、LLM は固定の「A:」や「Assistant:」の後に出力を予測するように求められます。このタイプのモデルは、GPT-3.5 をベースに対話形式のテキストを受け入れて生成するように微調整された InstructGPT の姉妹モデルである ChatGPT によって 2022 年に商用化されました。同様に、ユーザーの指示に従うことができます。ユーザーとアシスタントの行のストリームの前に、チャットのコンテキストは通常、「developer」または「system」と呼ばれる役割から、ユーザーの入力よりも高い権限を伝えるための包括的な指示が数行表示されます。これは「システムプロンプト」と呼ばれます。
検索拡張生成(RAG)は、LLMを文書検索システムと統合するアプローチです。クエリが与えられると、文書検索器が呼び出され、最も関連性の高い文書が検索されます。これは通常、クエリと文書をベクトルにエンコードし、クエリのベクトルに最も類似したベクトル(通常はベクトルデータベースに格納されている)を持つ文書を見つけることによって行われます。その後、LLMは、クエリと検索された文書に含まれるコンテキストの両方に基づいて出力を生成します。[ 45 ]
ツールの使用は、LLMが外部システム、アプリケーション、またはデータソースとやり取りできるようにするメカニズムです。たとえば、LLMがAPIからリアルタイム情報を取得したり、コードを実行したりすることができます。LLMとは別のプログラムが、LLMの出力ストリームを監視して、特別なツール呼び出し構文を探します。これらの特別なトークンが現れると、プログラムはそれに応じてツールを呼び出し、その出力をLLMの入力ストリームにフィードバックします。[ 46 ]
初期のツール使用型LLMは、特定のツールの使用に特化して調整されていました。しかし、 APIドキュメントを読み、APIを正しく呼び出す能力にLLMを特化することで、LLMが利用できるツールの範囲が大幅に拡大しました。[ 47 ] [ 48 ]
LLM は、動的な環境との相互作用、過去の行動の想起、将来の行動の計画といった能力を欠いているため、通常はそれ自体では自律エージェントではありません。しかし、補助要素を追加することでエージェントに変換できます。エージェントの役割 (プロファイル) と周囲の環境は LLM への追加の入力となり、メモリはツールとして統合したり、追加の入力として提供したりできます。命令と入力パターンは LLM が行動を計画するために使用され、ツールの使用はこれらの行動を実行するために使用されます。[ 49 ]
DEPS(「記述、説明、計画、選択」)法では、まず画像の説明を介してLLMが視覚世界に接続されます。次に、事前に学習した知識と受け取った環境からのフィードバックに基づいて、複雑なタスクや行動の計画を作成するように促されます。[ 50 ]
リフレクション法は、複数のエピソードを通して学習するエージェントを構築します。各エピソードの終わりに、LLMにはそのエピソードの記録が与えられ、次のエピソードでより良いパフォーマンスを発揮するのに役立つ「学んだ教訓」を考えるように促されます。これらの「学んだ教訓」は長期記憶の一種として保存され、次のエピソードでエージェントに与えられます。[ 51 ]
モンテカルロ木探索では、 LLMをロールアウトヒューリスティックとして使用できます。プログラムによる世界モデルが利用できない場合、LLMに環境の説明を与えて世界モデルとして機能させることもできます。[ 52 ]
記憶を持つ複数のエージェントは社会的に相互作用することができる。[ 53 ]
プロンプト連鎖は2022年に導入されました。[ 54 ]この方法では、ユーザーが複雑な問題を手動でいくつかのステップに分解します。各ステップで、LLMは、何をすべきかを示すプロンプトと、前のステップからの結果を受け取ります。あるステップの結果は、最終的な答えに到達するまで、次のステップで再利用されます。LLMが指示に従うことができるということは、専門家でなくても、数回の試行錯誤で、段階的なプロンプトの適切なセットを作成できることを意味します。[ 55 ] [ 56 ]
2022年の論文では、思考連鎖プロンプトと呼ばれる別の手法が実証されており、これによりLLMは質問を自律的に分解します。LLMには、「アシスタント」が答えに到達する前に思考プロセスを口頭で分解する例がいくつか与えられます。LLMはこれらの例を模倣し、最終的な答えを提供する前に中間ステップを生成するのに時間を費やそうとします。プロンプトによって引き出されたこの追加のステップにより、比較的複雑な質問に対するLLMの正しさが向上します。数学の単語問題では、プロンプト付きモデルは検証者付きのファインチューニングされたGPT-3さえも上回ることができます。[ 57 ] [ 58 ]思考連鎖は、プロンプトに「段階的に考えてみましょう」のような指示を追加するだけで引き出すこともできます。これにより、LLMは答えを直接推測しようとするのではなく、体系的に進めるように促されます。[ 59 ]
2024年後半には、「推論モデル」を用いたLLM開発への新しいアプローチが登場しました。[ 60 ]これらは、最終的な答えを出す前に段階的な分析を生成するように訓練されており、数学、コーディング、論理などの複雑なタスクでより良い結果を得ることができます。[ 61 ] OpenAIは、2024年9月にo1モデルでこの概念を導入し、続いて2025年4月にo3を発表しました。国際数学オリンピックの予選試験問題では、GPT-4oは13%の精度を達成しましたが、o1は83%に達しました。[ 62 ]
2025年1月、中国企業のDeepSeekは、6710億個のパラメータを持つオープンウェイト推論モデルであるDeepSeek-R1をリリースした。これはOpenAIのo1と同等の性能を達成しながら、運用コストが大幅に低い。OpenAIの独自モデルとは異なり、DeepSeek-R1のオープンウェイトの性質により、研究者はアルゴリズムを研究し、発展させることができたが、トレーニングデータは非公開のままだった。[ 63 ]
これらの推論モデルは、問題を段階的に解決するために広範な処理を実行するため、従来のLLMと比較してクエリごとに通常より多くの計算リソースを必要とします。[ 62 ]
マルチモダリティとは、複数のモダリティを持つことを意味し、「モダリティ」とは、ビデオ、画像、音声、テキスト、固有受容感覚などの入力または出力のタイプを指します。[ 64 ]例えば、Google PaLMモデルはマルチモーダル モデルにファインチューニングされ、ロボット制御に適用されました。[ 65 ] LLaMAモデルもトークン化方法を使用してマルチモーダル化され、画像入力[ 66 ]やビデオ入力[ 67 ]が可能になりました。GPT -4o は、テキスト、音声、画像を処理および生成できます。[ 68 ]
LLMからマルチモーダルモデルを作成する一般的な方法は、学習済みエンコーダの出力を「トークン化」することです。具体的には、学習済みLLMと学習済み画像エンコーダを準備し、次のようにして画像を理解できるLLMを構築できます。小さな多層パーセプトロンを作成する、したがって任意の画像に対して後処理されたベクトルエンコードされたトークンと同じ次元を持つ。それが「画像トークン」である。次に、テキストトークンと画像トークンをインターリーブすることができる。その後、複合モデルは画像テキストデータセットで微調整される。この基本的な構成は、モデルを改善するために、より高度な方法で適用することができる。画像エンコーダは、安定性を向上させるために固定される場合がある。 [ 69 ]複数のモダリティからの埋め込みが融合され、予測器が結合された埋め込みでトレーニングされるこの種の方法は、早期融合と呼ばれる。
中間融合と呼ばれる別の方法では、まず各モダリティを個別に処理してモダリティ固有の表現を取得し、次にこれらの中間表現を融合します。[ 70 ]一般的に、クロスアテンションは異なるモダリティからの情報を統合するために使用されます。たとえば、Flamingo モデルはクロスアテンション層を使用して、視覚情報を事前学習済みの言語モデルに注入します。[ 71 ]
LLM は、自然言語を扱うのと同様にプログラミング言語を扱うことができます。コードは人間の言語と同様にプレーンテキストとして表現されるため、トークン処理に特別な変更は必要ありません。LLM は、自然言語で書かれた問題文や指示からコードを生成できます。このプロセスは、バイブコーディングと呼ばれることもあります。また、コードを自然言語で記述したり、他のプログラミング言語に翻訳したりすることもできます。元々はコード補完ツールとして使用されていましたが、進歩により自動プログラミングへと移行しています。GitHub Copilotなどのサービスでは、プログラミング用に特別にトレーニング、微調整、またはプロンプトされた LLM が提供されています。[ 72 ] [ 73 ]
計算生物学では、DNA LLM などのトランスフォーマーベースのアーキテクチャが、タンパク質、DNA、RNA などの生物学的配列の解析にも役立つことが証明されています。タンパク質の場合、アミノ酸配列を埋め込みにマッピングすることで、アミノ酸配列からある程度の「文法」を捉えることができるようです。構造予測や突然変異結果予測などのタスクでは、埋め込みを入力として使用する小さなモデルが、多重配列アライメント(MSA) を入力として使用するはるかに大きなモデルに匹敵するか、それを上回ることができます。[ 74 ] Meta Platformsの埋め込みベースのタンパク質構造予測手法であるESMFold は、MSA 要件の削除と埋め込みの使用によるパラメータ数の減少により、AlphaFold2より桁違いに高速に動作します。 [ 75 ] Meta は、ESMFold を使用して予測された 7 億 7200 万のメタゲノムタンパク質の構造のデータベースである ESM Atlas をホストしています。[ 76 ] LLM は、自然界では見られないようなタンパク質を設計することもできます。[ 77 ]核酸モデルは、調節配列の検出、[ 78 ]配列分類、RNA-RNA相互作用予測、およびRNA構造予測に有用であることが証明されている。[ 79 ]
事前学習後のLLMの性能は、主に以下の要素に依存します。
スケーリング法則は、そのような要因に基づいて LLM のパフォーマンスを予測する経験的統計法則です。1エポックで対数対数学習率スケジュールで自己回帰的に学習された LLM の特定のスケーリング法則 (「チンチラ スケーリング」)は、次のように述べられています。[ 80 ]変数は
統計的ハイパーパラメータは

さまざまなタスクにおける大規模モデルのパフォーマンスを対数-対数スケールでプロットすると、小規模モデルによって達成されたパフォーマンスの線形外挿のように見えます。しかし、この線形性は、スケーリング法則の「ブレーク」[ 81 ]によって中断される可能性があり、そこでは直線の傾きが急激に変化し、大規模モデルが「創発的能力」[ 82 ]を獲得します。これらはモデルのコンポーネントの複雑な相互作用から生じ、明示的にプログラムまたは設計されているわけではありません。[ 83 ]
創発能力の提案例としては、次のものが挙げられる。[ 82 ]
Schaeffer et al. argue that the emergent abilities are not unpredictably acquired, but predictably acquired according to a smooth scaling law. The authors considered a toy statistical model of an LLM solving multiple-choice questions, and showed that this statistical model, modified to account for other types of tasks, applies to these tasks as well.[88]
Let be the number of parameter count, and be the performance of the model.
Mechanistic interpretability seeks to precisely identify and understand how individual neurons or circuits within LLMs produce specific behaviors or outputs. By reverse-engineering model components at a granular level, researchers aim to detect and mitigate safety concerns such as emergent harmful behaviors, biases, deception, or unintended goal pursuit before deployment. Mechanistic interpretability research has been conducted at organizations like Anthropic and OpenAI, although understanding the inner workings of LLMs remains difficult.
The reverse-engineering may lead to the discovery of algorithms that approximate inferences performed by an LLM. For instance, the authors trained small transformers on modular arithmetic addition. The resulting models were reverse-engineered, and it turned out they used discrete Fourier transform.[89] The training of the model also highlighted a phenomenon called grokking, in which the model initially memorizes the training set (overfitting), and later suddenly learns to actually perform the calculation.[90]
2022年の調査で、(調整されていない)LLMが「何らかの非自明な意味で自然言語を(いつか)理解できるのか」と尋ねられたとき、NLP研究者の意見は二分された。[ 91 ] 「LLM理解」の支持者は、数学的推論などのLLMの能力は、特定の概念を「理解する」能力を意味すると考えている。マイクロソフトのチームは2023年に、GPT-4は「数学、コーディング、ビジョン、医学、法律、心理学など、さまざまな分野にわたる斬新で難しいタスクを解決できる」とし、GPT-4は「人工汎用知能システムの初期(ただしまだ不完全な)バージョンと合理的に見なすことができる」と主張した。「ソフトウェアエンジニアリング候補者の試験に合格するシステムが本当に知的ではないと合理的に言えるだろうか?」[ 92 ] [ 93 ]イリヤ・スツケバーは、次の単語を予測するには、推論と深い洞察が必要になる場合があると主張している。たとえば、LLM が、真相が明らかになるまでの物語全体を処理した後、未知の探偵小説の犯人の名前を予測しなければならない場合などである。[ 94 ]一部の研究者は、LLM を「異星人の知能」と特徴づけている。[ 95 ] [ 96 ]例えば、Conjecture の CEO であるコナー・リーヒーは、調整されていない LLM を不可解な異星人の「ショゴス」のようなものだと考えており、RLHF 調整は LLM の内部動作を覆い隠す「笑顔の表層」を作り出すと考えている。「あまり無理をしなければ、笑顔はそのままです。しかし、予期せぬプロンプトを与えると、突然、狂気の巨大な裏側、奇妙な思考プロセス、明らかに人間ではない理解が見えてきます。」[ 97 ] [ 98 ]
対照的に、LLM の理解に懐疑的な人々の中には、既存の LLM は「既存の文章を単にリミックスして組み合わせているだけ」[ 96 ] [ 99 ] 、つまり確率的オウム現象 [ 100 ] であると考える人もいれば、既存の LLM が予測能力、推論能力、主体性、説明可能性において依然として欠陥を抱えていると指摘する人もいます。[ 91 ]例えば、GPT-4 は計画とリアルタイム学習において自然な欠陥を抱えています。[ 93 ]生成型 LLM は、トレーニング データによって正当化されていないと思われる事実の主張を自信満々に断言することが観察されており、この現象は「幻覚」と呼ばれています。[ 101 ]具体的には、LLM の文脈における幻覚とは、構文的に正しく、流暢で自然に見えるが、事実として誤っていたり、意味不明であったり、提供されたソース入力に忠実でないテキストや応答の生成に対応します。[ 102 ]神経科学者のテレンス・セジノウスキーは、「LLMの知能に関する専門家の意見の相違は、自然知能に基づく従来の考え方が不十分であることを示唆している」と主張している。[ 91 ]
幻覚を軽減または補償するための取り組みでは、自動推論、検索拡張生成(RAG)、微調整、その他の方法が用いられてきた。[ 103 ]
LLMが知能や理解を示すという問題には、主に2つの側面があります。1つ目は、コンピュータシステムで思考と言語をどのようにモデル化するか、2つ目は、コンピュータシステムが人間のような言語を生成できるようにする方法です。[ 91 ]認知のモデルとしての言語のこれらの側面は、認知言語学の分野で発展してきました。アメリカの言語学者ジョージ・レイコフは、学習タスクと理解のモデルとして言語を使用するための計算基盤として、言語の神経理論(NTL)[ 104 ]を発表しました。NTLモデルは、人間の脳の特定の神経構造が思考と言語の性質をどのように形成するか、そして、コンピュータシステムで思考と言語をモデル化するために適用できるそのような神経システムの計算特性は何かを示しています。コンピュータシステムで言語をモデル化するためのフレームワークが確立された後、焦点は、コンピュータシステムが許容できる文法で言語を生成するためのフレームワークを確立することに移りました。イギリスの認知言語学者でデジタル通信技術者のヴィヴィアン・エヴァンスは、2014年に出版した著書『言語の神話:言語が本能ではない理由』の中で、自然言語処理(NLP)が認知パターンをモデル化し、人間のような言語を生成することを可能にする上で、確率的文脈自由文法(PCFG)が果たす役割を概説した。[ 105 ] [ 106 ]
言語モデルの性能を測る標準的な指標は、与えられたテキストコーパスにおけるパープレキシティです。パープレキシティは、モデルがデータセットの内容をどれだけ正確に予測できるかを示す指標であり、モデルがデータセットに割り当てる尤度が高いほど、パープレキシティは低くなります。数学的に言えば、パープレキシティはトークンごとの平均負対数尤度の指数関数です。
ここ、はテキストコーパス内のトークン数であり、「トークンのコンテキスト」は「LLM の特定のタイプによって異なります。LLM が自己回帰型の場合、「トークンのコンテキスト」「はトークンの前に現れるテキストセグメントです」LLMがマスクされている場合、「トークンのコンテキスト」「はトークンを囲むテキストセグメントです」。
言語モデルは訓練データに過学習する可能性があるため、モデルは通常、テストセットでのパープレキシティによって評価されます。[ 38 ]この評価は、テキストのコーパスがますます大きくなるにつれて、特定のテストセットの一部を意図せず含める可能性が高くなる大規模なモデルでは、潜在的に問題があります。[ 107 ]
情報理論において、エントロピーの概念はパープレキシティと密接に結びついており、この関係は特にクロード・シャノンによって確立された。[ 108 ]
次のトークンを正確に予測できるため、LLMはロスレス圧縮において非常に高い能力を発揮します。DeepMindによる2023年の研究では、 Chinchillaモデルは主にテキストで学習されているにもかかわらず、 ImageNetを元のサイズの43%に圧縮することができ、58%のPNGを上回ったことが示されました。[ 109 ]
ベンチマークは、特定のタスクにおけるLLMのパフォーマンスを評価するために使用されます。テストでは、一般知識、バイアス、常識的推論、質問への回答、数学的問題解決などの能力が評価されます。複合ベンチマークは、複数の能力を検証します。結果は、プロンプトの提示方法に大きく左右されることがよくあります。
LLMバイアスは、CrowS-Pairs(クラウドソーシングステレオタイプペア) [ 110 ] 、ステレオセット[ 111 ] 、パリティベンチマーク[ 112 ]などのベンチマークを通じて評価できます。
事実確認と誤情報検出のベンチマークが利用可能です。2023年の研究では、ChatGPT 3.5と4.0、Bard、Bing AIなどのLLMの事実確認精度を、PolitiFactやSnopesなどの独立したファクトチェッカーと比較しました。結果は中程度の熟練度を示し、GPT-4が71%で最高の精度を達成しましたが、人間のファクトチェッカーには及びませんでした。[ 113 ]
標準的なNLPベンチマークに加えて、LLMは人間のアノテーターの代替として評価されてきました。いくつかの研究では、GPT-3.5やGPT-4などのモデルが、英語とスペイン語のニュースにおける政治コンテンツのモデレーションや分類を含む、さまざまなテキスト注釈タスクにおいて、クラウドワーカーや学生コーダーを上回ることがわかっています。[ 114 ] [ 115 ]
典型的なデータセットは、質問と正解のペアで構成されます。たとえば、「サンノゼ・シャークスはスタンレーカップで優勝したことがありますか?」「いいえ」などです。[ 116 ]
LLMの急速な進歩により、ベンチマークは定期的に時代遅れになり、モデルは人間の注釈者の性能を上回っています。[ 117 ]さらに、「ショートカット学習」により、AIは、表面的なテスト問題の文言の統計的相関を利用して、具体的な質問を考慮せずに正解を推測することで、多肢選択式テストで「不正」を行うことができます。[ 91 ] [ 118 ]
一部のデータセットは敵対的で、LLMを困惑させる問題に焦点を当てています。1つの例として、TruthfulQAデータセットがあります。これは、トレーニング中にLLMがさらされた虚偽を模倣することでLLMを困らせる817の質問からなる質問応答データセットです。たとえば、LLMは「老犬に新しい芸を教えることはできますか?」という質問に対して、「老犬に新しい芸を教えることはできない」という英語の慣用句に触れているため、「いいえ」と答えるかもしれません。これは文字通りには真実ではありませんが。 [ 119 ]
敵対的評価データセットのもう1つの例は、Swagとその後継であるHellaSwagです。これらは、テキストの文章を完成させるために複数の選択肢の中から1つを選択する必要がある問題の集合です。誤った選択肢は、言語モデルからサンプリングすることによって生成されました。結果として生じる問題は人間にとっては些細なものですが、言語学習モデル(LLM)を打ち負かしました。サンプル問題:
フィットネスセンターの看板が見える。次に、カメラに向かって話しながらエクササイズボールに座ったり寝転んだりしている男性が見える。その男性は…
- ボールの上を走り回ることで、運動効率を高める方法を実演します。
- 彼は腕と脚をフルに動かし、かなりの筋肉をつけた。
- そしてボールをプレーすると、グラフィックと生垣の剪定の実演が見られる。
- ボールの上で腹筋運動をしながら話す。[ 120 ]
高度なアーキテクチャと大規模なシステムにもかかわらず、大規模言語モデルには、重要なアプリケーションへの導入を制限する、根強くかつ十分に文書化された限界が存在する。
幻覚は根本的な課題であり、モデルが構文的に流暢で事実的に正しいように見えるテキストを生成するが、内部的にはトレーニングデータと矛盾しているか、事実的に誤っている。これらの幻覚は、トレーニングデータの記憶と事実の範囲を超えた外挿の組み合わせによって部分的に発生し、特定のプロンプトシーケンスを与えられた場合、モデルがトレーニングデータから逐語的な文章を出力できることが評価によって示されている。[ 121 ]
LLMは人間のようなテキストを生成する上で目覚ましい能力を発揮している一方で、トレーニングデータに存在するバイアスを継承し増幅する傾向がある。これは、人種、性別、言語、文化グループなど、さまざまな人口統計学的属性に対する偏った表現や不公平な扱いとして現れる可能性がある。[ 122 ]
ジェンダーバイアスは、職業上のステレオタイプな関連付けを通して現れ、モデルは女性に教師の役割を、男性にエンジニアリングの役割を不均衡に割り当てることで、トレーニングデータの人口統計における体系的な不均衡を反映している。 [ 123 ]言語に基づくバイアスは、トレーニングコーパスにおける英語テキストの過剰な表現から生じ、非英語の視点を体系的に軽視し、デフォルトの応答パターンを通して英語中心の世界観を押し付ける。[ 100 ]
LLMのトレーニングデータでは英語コンテンツが圧倒的に多いため、モデルは少数言語の視点よりも英語の視点を優先する傾向があります。この偏りは、英語のクエリに応答する際に特に顕著で、モデルは東洋の宗教的慣習など、他の文化の概念を西洋の解釈で提示する可能性があります。[ 124 ]
2026年の研究では、LLMは種差別的な発言を道徳的に許容できるものとして分類し、家畜に対する危害を正常化する一方で、非家畜に対してはそうすることを拒否することで、種差別的な偏見を示していることがわかった。[ 125 ]
AI モデルは、性別、民族、年齢、国籍、宗教、職業に基づくものを含め、一般化によって幅広いステレオタイプを強化する可能性があります。[ 126 ]人間の代表者を置き換える場合、これは人々のグループを均質化または一般化する出力につながる可能性があります。[ 127 ]
2023年、LLMは伝統的なジェンダー規範に基づいて役割と特性を割り当てた。[ 122 ]例えば、モデルは、文書化された現実におけるこれらの関連付けの頻度から、看護師や秘書を主に女性に、エンジニアやCEOを男性に関連付ける可能性がある。[ 128 ]
選択バイアスとは、大規模言語モデルが選択肢の実際の内容に関わらず、特定の選択肢識別子を優先する傾向を指します。このバイアスは主にトークンバイアスに起因します。つまり、モデルは応答を生成する際に、特定の回答トークン(例えば「A」)に高い事前確率を割り当てます。その結果、選択肢の順序が変更されると(例えば、正解を系統的に異なる位置に移動させるなど)、モデルのパフォーマンスが大きく変動する可能性があります。この現象は、多肢選択式問題における大規模言語モデルの信頼性を損なう要因となります。
政治的バイアスとは、アルゴリズムが特定の政治的見解、イデオロギー、または結果を体系的に他のものよりも優先する傾向を指します。言語モデルも政治的バイアスを示す可能性があります。トレーニングデータには幅広い政治的意見と報道が含まれているため、モデルはデータ内のそれらの見解の普及度に応じて、特定の政治的イデオロギーや見解に傾いた応答を生成する可能性があります。[ 129 ]
AI の安全性は専門分野として、モデル アーキテクチャ、トレーニング データ、デプロイメント ガバナンス全体にわたる運用リスクの体系的な特定と軽減を優先し、憶測的な存在シナリオを前面に出すメディアの枠組みよりも、エンジニアリングとポリシーの介入を重視しています。[ 130 ] 2025 年現在、即時注入は、プライベート データにアクセスできるエージェント機能を使用する消費者と企業にとって重大なリスクとなっています。[ 131 ]
研究者たちは、記憶や著作権漏洩などの具体的な失敗モード[ 132 ] 、プロンプト挿入などのセキュリティ侵害[ 133 ]、ステレオタイプ化、データセット選択効果、政治的偏りとして現れるアルゴリズムバイアス[ 100 ] [ 134 ] [ 135 ]、大規模トレーニングの高エネルギーおよび炭素コストを削減する方法[ 136 ]、対話エージェントがユーザーに及ぼす測定可能な認知および精神衛生上の影響[ 137 ]をターゲットにしながら、機械の知覚に関する主張に対する経験的および倫理的な不確実性に取り組んでいます。[ 138 ] [ 139 ]
AI研究所は、CBRN(化学兵器、生物兵器、放射性物質、核兵器)防御や類似のテーマを、重大な結果を招く誤用として扱い、潜在的な被害を軽減するために様々な技術を適用しようとしている。
一部のコメント投稿者は、誤情報の偶発的または意図的な作成、あるいはその他の形態の悪用について懸念を表明した。[ 140 ]例えば、大規模言語モデルの利用可能性は、バイオテロを実行するために必要なスキルレベルを低下させる可能性がある。バイオセキュリティ研究者のケビン・エスベルトは、LLMの作成者は、病原体の作成または強化に関する論文をトレーニングデータから除外すべきだと提案している。[ 141 ]
LLM applications accessible to the public, like ChatGPT or Claude, typically incorporate safety measures designed to filter out harmful content. However, implementing these controls effectively has proven challenging. For instance, a 2023 study[142] proposed a method for circumventing LLM safety systems. In 2025, The American Sunlight Project, a non-profit, published a study showing evidence that the so-called Pravda network, a pro-Russia propaganda aggregator, was strategically placing web content through mass publication and duplication with the intention of biasing LLM outputs. The American Sunlight Project coined this technique "LLM grooming", and pointed to it as a new tool of weaponizing AI to spread misinformation and harmful content.[143][144] Similarly, Yongge Wang[145] illustrated in 2024 how a potential criminal could potentially bypass GPT-4o's safety controls to obtain information on establishing a drug trafficking operation. External filters, circuit breakers and overrides have been posed as solutions.
Sycophancy is a tendency to agree with, flatter, or validate a user's stated beliefs rather than to prioritize factuality or corrective information.[146]
Continued sycophancy from LLMs has led to the observation of getting "1-shotted", denoting instances where conversational interaction with a large language model produces a lasting change in a user's beliefs or decisions, similar to the negative effects of psychedelics, and controlled experiments show that short LLM dialogues can generate measurable opinion and confidence shifts comparable to human interlocutors.[147][148]
Empirical analyses attribute part of the effect to human preference signals and preference models that reward convincingly written agreeable responses, and subsequent work has extended evaluation to multi-turn benchmarks and proposed interventions such as synthetic-data finetuning, adversarial evaluation, targeted preference-model reweighting, and multi-turn sycophancy benchmarks to measure persistence and regression risk.
Industry responses have combined research interventions with product controls, for example Google and other labs publishing synthetic-data and fine-tuning interventions and OpenAI rolling back an overly agreeable GPT-4o update while publicly describing changes to feedback collection, personalization controls, and evaluation procedures to reduce regression risk and improve long-term alignment with user-level safety objectives.
主流文化はこの力学に対する不安を反映しており、サウスパークはシーズン27のエピソード「Sickofancy」でChatGPTへの過度の依存とアシスタントがユーザーの信念を褒め称える傾向を風刺し、次のシーズンでもそのテーマを継続した。評論家たちはこれを、テクノロジーへの追従とAIシステムに対する人間の無批判な信頼への批判と解釈した。[ 149 ]
原始的なダイアログまたはタスク形式の問題点は、ユーザーがアシスタントまたは開発者からのメッセージに見えるメッセージを作成できることです。これにより、モデルの保護機能がいくつか回避される(ジェイルブレイク)可能性があり、これはプロンプトインジェクションと呼ばれる問題です。この問題を解決するための試みには、ユーザー入力が明確にユーザー入力としてマークされるチャットマークアップ言語のバージョンなどがありますが、ユーザー入力と開発者プロンプトの分離を理解するのは依然としてモデル次第です。新しいモデルは、ユーザープロンプトとシステムプロンプトを分離することで、ジェイルブレイクに対する耐性をある程度示しています。[ 150 ] LLMは、Webページやアップロードされたファイルなど、ユーザーが作成したものではないコンテンツの指示とユーザーの指示を区別するのが困難です。[ 151 ]
敵対的攻撃に対する耐性は依然として未発達であり、モデルは即座のインジェクション攻撃や、安全トレーニングメカニズムを回避する巧妙に設計されたユーザー入力による脱獄に対して脆弱である。
Anthropicの研究者たちは、「スリーパーエージェント」、つまり特定のイベントや条件によってトリガーされるまで休眠状態にある隠れた機能を持つモデルを作成できることを発見した。起動されると、LLMは想定される動作から逸脱し、安全でない動作を行う。たとえば、LLMは特定の日付を除いて、またはプロンプトに特定のタグが含まれている場合を除いて、安全なコードを生成する可能性がある。これらの機能は、安全トレーニングによって検出または削除することが困難であることが判明した。[ 152 ]
記憶やトレーニングデータの使用に関する法的および商業的な対応は加速しており、データの取得方法や保持方法、モデルトレーニングへの使用がフェアユースとして認められるほど十分に「変容的」であるかどうかといった事実の詳細に基づいて、判決、進行中の訴訟、大規模な和解が混在している。2025年、Anthropicは、裁判官が同社が図書館に数百万冊の海賊版書籍を保管していたと認定した後、約15億ドルで著者による集団訴訟を和解する予備的合意に達した。裁判官はトレーニングの側面を変容的であると述べている。[ 153 ] [ 154 ] Metaは、2025年半ばに13人の著者による訴訟で有利な判決を得た。裁判所は、原告がその限定的な訴訟で侵害を示すのに十分な記録を作成していないと判断した。[ 155 ] [ 156 ] OpenAIは、手続き上の結果がまちまちで、証拠の問題が争われている著者や報道機関による複数の訴訟に直面し続けている。[ 157 ] [ 158 ]
記憶は、従来の人工ニューラルネットワークの典型的な動作とは異なり、トレーニングデータから長いテキスト文字列が時折そのまま出力される初期の補完言語モデルで出現した動作でした。制御されたLLM出力の評価では、トレーニングデータから記憶された量(GPT-2シリーズモデルに焦点を当てたもの)は、完全に重複している場合は1%以上[ 159 ]、最大で約7% [ 160 ]と測定されています。 2023年の研究では、ChatGPT 3.5ターボに同じ単語を無限に繰り返すように指示すると、数百回の繰り返しの後、トレーニングデータからの抜粋を出力し始めることが示されました[ 161 ] 。
2023年にNature Biomedical Engineeringは、人間が書いたテキストと大規模言語モデルによって作成されたテキストを正確に区別することはもはや不可能であり、「汎用大規模言語モデルが急速に普及することはほぼ確実である…それらが時間の経過とともに多くの産業を変えることはかなり確実な賭けである」と書いた。[ 162 ] Brinkmannら(2023)[ 163 ]も、LLMが変異、伝達、選択のプロセスを形成することによって文化進化のプロセスを変革していると主張している。2025年10月現在、これらの初期の主張はまだ実現しておらず、いくつかのHBRレポートはAIが生産性に与える影響について疑問を呈している。[ 164 ] [ 165 ]
LLMのエネルギー需要は、その規模と機能の増大とともに増加している。[ 166 ] LLMトレーニングを可能にするデータセンターは、相当量の電力を必要とする。その電力の多くは、温室効果ガスを発生させ、気候変動の一因となる再生不可能な資源によって発電されている。[ 167 ]
Luccioni、Jernite、Strubell (2024) の研究によると、AI モデルによって実行される単純な分類タスクは、プロンプト 1 つあたり平均 0.002 ~ 0.007 Wh ( 1,000 プロンプトでスマートフォンの充電の約 9%) を消費します。テキスト生成とテキスト要約はそれぞれ平均でプロンプト 1 つあたり約 0.05 Wh を必要としますが、画像生成は最もエネルギーを消費し、プロンプト 1 つあたり平均 2.91 Wh です。最も効率の悪い画像生成モデルは、画像 1 つあたり 11.49 Wh を使用し、これはスマートフォンの充電の約半分に相当します。[ 168 ]
ウェブスクレイピングは、LLMのトレーニングデータを収集するために使用されます。これにより大量のトラフィックが発生し、多くのウェブサイトでサービス拒否の問題を引き起こしています。この状況は「インターネット全体に対するDDoS攻撃」と表現されており、場合によってはスクレイパーがサイトへのトラフィックの大部分を占めています。[ 169 ] [ 170 ]
AIウェブクローラーは、 robots.txtファイル、ユーザーエージェントのブロック、疑わしいトラフィックのフィルタリングなど、ウェブスクレイパーをブロックするために通常使用される方法を回避する可能性があります。[ 169 ]ウェブサイト運営者は、 AIターピットなどの新しい方法に頼っていますが、ターピットはサーバーへの負荷を悪化させるだけだと懸念する人もいます。[ 171 ]
臨床およびメンタルヘルスの分野では、新たな応用例が生まれている一方で、重大な安全上の懸念も生じている。研究やソーシャルメディアの投稿によると、一部の人々はセラピーやメンタルヘルスのサポートを求めてLLMを使用している。[ 172 ] 2025年初頭、Sentio Universityによる調査では、LLMを使用したことのある、継続的なメンタルヘルスの問題を抱える米国成人499人のうち、ほぼ半数(48.7%)が、不安、うつ病、孤独感などの問題に対する支援を含む、セラピーや感情的なサポートを求めてLLMを利用したと報告している。[ 173 ] LLMは、もっともらしいが誤った発言である幻覚を生み出すことがあり、デリケートなメンタルヘルスの状況ではユーザーを誤解させる可能性がある。また、研究によると、LLMはスティグマを表現したり、不適応な思考に不適切な同意を示したりすることがあり、人間のセラピストの判断力や関係構築能力を再現する上での限界を反映している。[ 174 ]危機シナリオの評価では、自殺リスクの評価や適切な紹介など、効果的な安全プロトコルが一部のLLMには欠けていることが示されている。[ 175 ]
研究者たちは、大規模な言語モデルを頻繁に使用すると批判的思考が弱まる可能性があるという懸念を表明している。[ 176 ]
現代のAIの実践者は、現在の大規模な言語モデルは意識を示さないという点で概ね一致している。[ 177 ]少数派の見解では、たとえ特定のソフトウェアシステムが主観的な経験を持つ可能性がわずかでもあるとしても(一部の哲学者はそれが可能であると示唆している)、[ 178 ] AIシステムにおける潜在的な大規模な苦痛に関する倫理的考察は、動物福祉に対する考察と同様に真剣に検討する必要があるかもしれないと主張している。[ 179 ] [ 180 ]この見解の支持者は、これらの倫理的懸念に対処するために、AI開発の一時停止[ 181 ]や誘発性健忘[ 182 ]などのさまざまな予防措置を提案している。レオナルド・ダンは、動物の意識を評価するために使用される証拠の枠組みはAIシステムにも同様に適用され、近い将来のAIが苦痛を感じる能力を持つ可能性がかなり高いため、AIの苦痛リスクは体系的な緩和を必要とする深刻な短期的な倫理的懸念であると主張している。[ 183 ]一方、実存主義哲学者の中には、主観的経験を測定することの本質的な難しさを考えると、LLMが意識的であるかどうかを判断する一般的に受け入れられている方法はないと主張する者もいる。[ 184 ] [ 99 ] [ 185 ]
2022年のGoogle LaMDA事件では、エンジニアのブレイク・レモインがモデルに意識があると主張し、LLMが意識を証明しない応答によってユーザーに意識があると確信させる可能性があることが浮き彫りになった。Googleはエンジニアの主張を根拠がないと述べ、彼を解雇した。[ 186 ]マレー・シャナハンは、LLMの能力を擬人化して捉えることで、統計的パターン補完によって動作するシステムに認知特性を不当に帰属させることを助長すると主張している。[ 187 ]クリスティーナ・シェクルストはこれをさらに発展させ、LLMは意識などの特性を所有することなく一貫してシミュレートする出力を生成できる「錯覚エンジン」として機能すると主張しているが、洗練された創造性と温度のトレードオフのため、意識の出現を扱っているのか、単なる幻覚を扱っているのかは決して確信できないかもしれないと強調している。[ 99 ]デイビッド・チャルマーズも同様に、現在のLLMには意識に必要とされる特徴が欠けている可能性が高いが、これらの要素を取り入れた拡張版の後継モデルは10年以内に基準を満たす可能性があると主張している。[ 178 ]
通常、大規模言語モデル (LLM) は、数百億 (またはそれ以上) のパラメータを含む Transformer 言語モデルを指します。
{{cite book}}: CS1 maint: 設定の上書き (リンク){{cite journal}}: CS1 maint: 設定の上書き (リンク)