推論モデルは、推論言語モデル(RLM)または大規模推論モデル(LRM )とも呼ばれ、複数の論理的推論ステップを必要とする複雑なタスクを解決するために特別にトレーニングされた大規模言語モデル(LLM)の一種です。 [ 1 ]これらのモデルは、標準的なLLMと比較して、論理、数学、プログラミングのタスクで優れたパフォーマンスを発揮します。以前の推論ステップを再訪して修正し、推論中に追加の計算を利用してパフォーマンスをスケーリングする機能を備えており、トレーニングデータのサイズ、モデルパラメータ、トレーニング計算に基づく従来のスケーリングアプローチを補完します。[ 2 ]
即座に応答を生成する従来の言語モデルとは異なり、推論モデルは、多段階の問題を解決するために、回答を生成する前に追加の計算時間、つまり思考時間を割り当てます。OpenAIは、2024 年 9 月にo1 シリーズをリリースした際にこの用語を導入し、モデルは応答する前に「より多くの思考時間を費やす」ように設計されていると説明しました。同社は、o1 を科学、コーディング、数学の複雑なタスクを対象としたモデル命名のリセットとして位置付け、AIMEやCodeforcesなどのベンチマークでo1 のパフォーマンスをGPT-4oと比較しました。同じ週に独立系レポートが発表の概要をまとめ、o1 が思考連鎖スタイルの推論を自動化して難しい試験で大きな利益を達成するという OpenAI の主張を強調しました。[ 3 ] [ 4 ] [ 5 ]
運用において、推論モデルは中間ステップの内部チェーンを生成し、最終的な回答を選択して洗練します。OpenAIは、トレーニング中に強化学習を増やし、推論時にテスト時の計算を増やすと、o1 の精度が向上すると報告しました。同社は当初、生のチェーンを非表示にして、代わりにモデルが作成した要約を返すことを選択し、エンド ユーザーに整合性のないコンテンツを公開することなく研究者が監視できるように、基となる思考を「表示しないことにした」と述べています。商用展開では、隠された思考を計測する個別の「推論トークン」と、モデルが使用する計算量を調整する「推論努力」の制御が文書化されています。これらの機能により、モデルは通常のチャット システムよりも遅くなりますが、難しい問題でより強力なパフォーマンスを発揮できます。[ 4 ] [ 6 ]
推論モデルに向けた研究の方向性は、監視、プロンプト、および探索型推論における進歩を組み合わせたものである。
人間のフィードバックによる強化学習に関する初期の調整作業では、モデルは「人間のフィードバック」と好みに基づく報酬によって指示に従うように微調整できることが示されました。[ 7 ] [ 8 ] 2022年、Google Researchの科学者であるJason WeiとDenny Zhouは、思考連鎖のプロンプトが複雑な推論タスクにおける大規模モデルの「能力を大幅に向上させる」ことを示しました。[ 9 ]
関連する結果では、「段階的に考えよう」という単純な指示がゼロショット推論を引き出すことができることが示されました。[ 10 ]後続の研究では、多様な解決経路をサンプリングして合意を選択することで思考連鎖の「パフォーマンスを向上させる」自己一貫性デコーディングと、モデルに「推論の痕跡」と行動の両方を生成するように促す、 ReasonとActの合成語であるReActなどのツール拡張メソッドが導入されました。[ 11 ] [ 12 ]その後、研究は思考連鎖を複数の候補プランの探索に一般化しました。プリンストン大学のコンピュータ科学者Shunyu YaoによるTree-of-Thoughtsフレームワークは、モデルが中間思考のツリーを探索してバックトラックすることで「意図的な意思決定を実行する」ことを提案しています。[ 13 ]
OpenAIの報告されたブレークスルーは、結果だけでなく推論プロセスを監督することに焦点を当てており、Lightman らの「Let's Verify Step by Step」では、各正しいステップに報酬を与えることで、難しい数学の問題で「結果の監督を大幅に上回る」ことができ、思考の連鎖を人間の判断に合わせることで解釈性が向上すると報告されています。[ 14 ] [ 15 ] OpenAI のo1発表では、これらの流れを、モデルが自身の思考の連鎖を洗練するようにトレーニングする大規模な強化学習アルゴリズムで結び付けており、トレーニング計算量と推論に費やす時間が増えるほど精度が向上すると報告しています。[ 4 ]
これらの発展は、推論モデルの中核を成すものです。これらは、中間ステップの品質を評価する監視信号を使用し、コンセンサスやツリーサーチなどの推論時の探索を活用し、内部の思考計算をどれだけ割り当てるかを制御する機能を提供します。OpenAI の o1 ファミリーは、2024 年 9 月にこのアプローチを大規模に利用可能にし、回答する前に意図的に考える LLM に対して「推論モデル」というラベルを普及させました。[ 3 ] [ 6 ]
推論モデルの開発は、コンピューティングのスケーリングが通常、人間が設計した洞察に基づく方法よりも優れているという、リチャード・S・サットンの「苦い教訓」を示している。 [ 16 ]この原則は、生成AI研究ラボ(GAIR)の研究者によって実証された。彼らは当初、2024年後半にツリーサーチや強化学習などの高度な方法を使用してo1の機能を再現しようと試みた。彼らの調査結果は「o1 Replication Journey」シリーズで発表され、より小さなモデルを訓練してo1の出力を模倣する比較的単純な手法である知識蒸留が、予想外に強力なパフォーマンスを生み出したことが明らかになった。この結果は、直接スケーリングのアプローチが、より複雑なエンジニアリングソリューションよりも優れている場合があることを示している。[ 17 ] [ 18 ]
推論モデルは、推論を行わないモデルと比較して、推論中に著しく多くの計算リソースを必要とします。米国招待数学試験(AIME)ベンチマークの研究では、推論モデルは、推論を行わないモデルと比較して、動作コストが10~74倍高いことがわかりました。[ 19 ]推論時間が長くなるのは、これらのモデルが生成する詳細な段階的な推論出力が原因であり、これは通常、推論プロセスを表示せずに直接的な回答を提供する標準的な大規模言語モデルからの応答よりもはるかに長くなります。
2025年初頭のある研究者は、これらのモデルは「過剰思考攻撃」によるサービス拒否攻撃の潜在的な懸念に直面する可能性があると主張した。[ 20 ]
2024 年 9 月、OpenAI は推論機能が強化された大規模言語モデルであるo1-previewをリリースしました。 [ 21 ]完全版のo1は 2024 年 12 月にリリースされました。OpenAI は、後継モデルであるo3の予備的な結果を2024 年 12 月に最初に共有し、[ 22 ] [ 23 ] [ 24 ]完全版の o3 モデルは 2025 年に利用可能になりました。[ 25 ]
アリババは2024年11月にQwen大規模言語モデルの推論バージョンをリリースした。[ 26 ] 2024年12月には、実験的な視覚推論モデルであるQvQ-72B-Previewを発表した。[ 27 ]
2024年12月、Googleは複数ステップの研究タスクを実行するために設計された機能であるディープリサーチをGeminiに導入しました。 [ 28 ] [ 29 ]
2024年12月16日、研究者らは、テスト時の計算をスケーリングすることで、比較的小規模なLlama 3Bモデルが、はるかに大規模なLlama 70Bモデルよりも難しい推論タスクで優れた性能を発揮できることを実証した。この実験は、推論戦略を改善することで、より小規模なモデルでも推論能力を引き出すことができることを示唆した。[ 30 ] [ 31 ]
2025年1月、DeepSeekはR1をリリースしました。これは、OpenAIのo1に匹敵する性能をはるかに低い計算コストで達成した推論モデルです。このリリースは、モデルのトレーニングに使用された強化学習手法であるグループ相対ポリシー最適化(GRPO)の有効性を示しました。 [ 32 ] [ 33 ]
2025年1月25日、DeepSeekはR1にウェブ検索機能を追加し、推論タスクを実行しながらインターネットから情報を取得できるようにした。[ 34 ]
この期間の研究により、推論モデルを作成するための知識蒸留の有効性がさらに検証されました。s1-32B モデルは、予算強制法とスケーリング法によって高いパフォーマンスを達成し、より単純なトレーニングアプローチが推論能力に非常に効果的であるという知見を強化しました。[ 35 ] [ 18 ]
2025年2月2日、OpenAIは、ユーザーが包括的な調査タスクを実行できるようにするo3モデルを搭載した機能であるDeep Researchをリリースしました。 [ 36 ]このシステムは、複数のWebソースから情報を自動的に収集および統合することにより、詳細なレポートを生成します。[ 36 ]
OpenAIはGPT-4.5を「最後の非連鎖思考モデル」と呼び[ 37 ] 、タスクの難易度に基づいてモデルを選択するルーターモデルをGPT-5で実装した[ 38 ] 。
2026 年 1 月に、Moonshot AI は、 320 億のアクティブ パラメータを持つオープンソースの 1 兆パラメータMoEモデルである Kimi K2.5 をリリースし、2026 年 4 月に Kimi K2.6 をリリースしました。どちらの Kimi モデルも、推論と実行のためにタスクをサブエージェントに動的に分解する「エージェントスウォーム」システムを使用しており、単一の逐次推論チェーンよりもスケーラブルなマルチステップ問題解決を可能にしています[ 39 ]。しかし、パラメータは同じであるにもかかわらず、両方の Kimi モデルはエージェント スウォームに違いがあり、K2.5 は 100 個のサブエージェント形式を使用しているのに対し、K2.6 は 300 個のサブエージェントを使用しており、後者のタスク調整能力が強化されています。[ 40 ]
推論モデルは、最先端の言語モデルで使用されるおなじみの大規模な事前学習に従いますが、事後学習と最適化で分岐します。OpenAIは、 o1 は、回答する前に思考の連鎖を使用および洗練するようにモデルを学習させる大規模な強化学習アルゴリズムでトレーニングされていると報告しています。同社は、トレーニング中の強化学習の増加と推論時に思考に費やす時間の増加という 2 つの連動したレバーを強調し、それぞれが増加するにつれてスムーズな向上を記録しています。OpenAI はまた、エンドユーザーに生の連鎖を表示せず、代わりにモデルが作成した要約を返すことに決定したと述べています。これは、安全性の監視と競争上の懸念に関連する製品選択です。[ 4 ]
中心的な要素はプロセス監視であり、最終的な答えだけでなく中間ステップにも報酬を与えます。OpenAI の研究では、ステップレベルのラベルでトレーニングされたプロセス報酬モデルが導入され、プロセス監視は難しい数学の問題で結果のみの監視を大幅に上回ることがわかりました。このプロジェクトでは、PRM800K ステップレベルのフィードバックデータセットも公開され、プロセスレベルの報酬は人間が各ステップを確認できるため解釈性を向上させると主張しました。これらの結果は、後に実運用トレーニングに拡張された思考連鎖を監視するための実用的なレシピを提供しました。[ 15 ]
このトレーニングは、推論をターゲットとしない従来の最先端モデルとは重要な点で異なります。標準システムは、次のトークン予測を目的としたインターネット規模のコーパスで事前トレーニングされ、その後、指示チューニングと選好最適化によって調整されます。標準的なInstructGPTレシピでは、まず人間のデモンストレーションで教師ありファインチューニングを行い、次にペアワイズ選好から報酬モデルをトレーニングし、最後に強化学習、通常はKL ペナルティ付きのPPOを使用してポリシーを最適化します。[ 8 ] [ 41 ]直接選好最適化などのバリアントでは、明示的な RL ステップを削除し、モデルを選好データで直接最適化しますが、教師のターゲットは、内部ステップの品質ではなく、評価者によって判断される最終結果のままです。[ 42 ] GPT-4の技術レポートでは、この従来のパイプラインを、次のトークン事前トレーニングに続いて、動作を形成するためのRLHFスタイルの事後トレーニングとして要約しています。 [ 43 ]
対照的に、推論モデルは、トレーニング中にマルチステップチェーンを生成、批判、修正するように最適化されています。OpenAIは、強化学習がチェーン自体に適用され、モデルが間違いを認識し、問題をより単純なステップに分解し、現在のアプローチが失敗したときに戦略を切り替えることを学習すると述べています。OpenAIはまた、推論時にチェーンを隠蔽し、内部トレースから有用なアイデアを要約した回答を返すことも文書化しています。これらの設計上の選択は、モデルのトレーニング目標と意図された監視を反映しています。[ 4 ]
Zelikman らは STaR (Self-Taught Reasoner) を導入し、反復的に連鎖を生成およびフィルタリングし、それらのトレースを微調整することでブートストラップ推論を探求し、結果のみの微調整よりも優れた結果を報告した。この方法のバリアントの 1 つは、最終的な答えだけでなく、中間的な推論を表すトレーニング信号を生成するための追加のメカニズムを提供した。[ 44 ]
DeepSeekは、純粋な強化学習で訓練されたR1およびR1-Zeroシステムが長い連鎖、自己検証、および反省を引き出すことを報告し、明示的な連鎖レベルの報酬が一般的な推論行動を誘発できると主張した。これらの結果は、連鎖の質に焦点を当てたトレーニング後の学習が、結果のみのアライメントとは別の明確な体制になったことを示している。 [ 45 ]
大規模言語モデル(LLM)は、段階的な解決手順とペアになった推論タスクのデータセットで微調整できます。微調整されたモデルは、新しい問題に対して独自の推論チェーンを生成することを学習します。[ 46 ] [ 47 ]
人間が書いたトレースを収集するにはコストがかかるため、研究者は棄却サンプリング微調整(RFT)を使用してデータセットを自動的に構築します。この方法は、各プロンプトに対して複数の推論トレースを生成し、検証器を使用して誤った最終回答のトレースをフィルタリングします。[ 48 ]
事前学習済みの言語モデルは、強化学習 (RL) でさらに学習させることができます。RL では、生成言語モデルはポリシーとして機能し、この形式体系において、タスクプロンプトは環境状態と呼ばれる。、そしてモデルの応答はアクションですモデルが応答する確率与えられた次のように書かれています。
強化学習を用いて推論言語モデルをさらに発展させるには、次のステップとして報酬モデルを構築する必要がある。プロセスを導くため。直感的に言えば、報酬はプロンプトに対する応答の質を示す指標となる。推論課題では、応答が課題を解決すれば報酬は高く、そうでなければ報酬は低くなる。
これを踏まえて、複数のステップに分解することができ、それぞれこれは、対応プロセスにおける明確な段階を表しています。
最近のシステムのほとんどは、この理由から近接方策最適化(PPO)などの方策勾配法を使用しています。PPOは、各方策更新をクリッピングされた目的関数で制約し、非常に大きな方策のトレーニングを安定させます。[ 49 ]
結果報酬モデル、または結果監視型RM(ORM)[ 46 ]は、ステップに対する報酬を与える。最終回答に基づくと:このようなモデルはしばしば「検証器」と呼ばれます。
数学の文章問題のように、答えの検証が容易なタスクの場合、結果報酬はバイナリ(最終的な答えが正しければ1、そうでなければ0)にすることができます。[ 46 ]自動検証が難しい場合は、人間が答えを正解か不正解かでラベル付けし、そのラベルを使用して、人間のラベルを予測する基本モデルを微調整することができます。[ 47 ]創作文のような、質が単純に真偽で判断できないタスクの場合、人間のフィードバックからの強化学習のように、人間の順位付けされた選好データに基づいて報酬モデルを訓練することができます。[ 19 ]基本モデルは、部分的な思考痕跡から予測するように微調整することもできます。最終的な答えが正しいかどうか、そしてこの予測はバイナリ報酬として機能する可能性がある。[ 46 ]
ORMは通常、ロジスティック回帰、すなわち交差エントロピー損失を最小化することによって学習される。[ 50 ]
PRM が与えられた場合、ORM は、推論トレース中の総プロセス報酬を乗算することによって[ 19 ] 、最小値を取ることによって[ 50 ] 、またはプロセス報酬を集約する他の方法によって構築できます。DeepSeek は、 R1 モデルのトレーニングに単純な ORM を使用しました。[ 33 ]
プロセス報酬モデル、またはプロセス監視型報酬モデル(PRM)[ 46 ]は、ステップに対する報酬を与える。これまでの手順のみに基づくと:。
部分的な思考の軌跡が与えられた場合人間は、最終的な答えを見なくても、これまでの手順が正しいかどうかを判断できます。これにより、バイナリ報酬が得られます。人間のラベル付けにはコストがかかるため、ベースモデルを微調整してそれらを予測することができます。[ 46 ] PRM は通常、人間のラベルに対してロジスティック回帰を使用してトレーニングされます。つまり、真のラベルと予測されたラベル間の交差エントロピー損失を最小化することによってトレーニングされます。[ 50 ]
例えば、2023年のOpenAIの論文では、75,000の思考トレースに対して800,000のプロセスラベルが収集されました。ラベル付け担当者はトレースを見て、各ステップが解決策に向かっている場合は「肯定的」、間違ってはいないが役に立たない場合は「中立」、間違いの場合は「否定的」とマークしました。最初の「否定的」ラベルの後、ラベル付け担当者はそのトレースで停止し、別のトレースに移りました。著者らは、後のステップにラベル付けすることでより豊富なシグナルが得られる可能性があるにもかかわらず、最初のエラーまでのラベル付けで十分なPRMをトレーニングできると主張しました。[ 19 ] [ 51 ]
人間のラベル付けを避けるため、研究者たちはプロセスに人間のラベルを付けずにPRMを作成する方法を提案している。モンテカルロ木探索(MCTS)にヒントを得たMath-Shepherd法は、各推論ステップから開始し、最後まで複数の継続をサンプリングする。そして、そのステップでの報酬を以下のいずれかに設定する。「ソフト推定」の場合、または 「ハード推定」の場合。これはORMからプロセス報酬を生成するが、これは構築がより簡単または安価になることが多い。その後、これらのラベルでPRMをトレーニングすることができる。[ 50 ]完全なMCTSアプローチを試みた研究もある。[ 52 ]
トレーニング済みの ORM を使用して、最適な応答を選択できます。ポリシーは複数の応答を生成し、ORM は最適なものを選択します。これは、テスト時の計算スケーリングのシンプルな形式(「ベスト オブ N」) を実装します。[ 47 ] [ 54 ]
訓練された PRM は、貪欲なツリー探索によって推論を誘導できます。ポリシーはいくつかの次のステップを提案し、PRM は 1 つを選択し、プロセスが繰り返されます。これは、ORM を使用して応答全体を選択することに似ています。[ 55 ]ビーム探索は貪欲探索よりも優れたパフォーマンスを発揮します。
先読み検索は、別のツリー検索方法です。このポリシーはいくつかの次のステップを提案し、それぞれについて短いロールアウトを実行します。ロールアウト中に解決策が見つかった場合は、検索は早期に終了します。そうでない場合は、PRM が各ロールアウトにスコアを付け、最も高いスコアのステップが選択されます。[ 31 ]
自己一貫性はORMと組み合わせることができます。モデルは複数の回答を生成し、各クラスターが同じ最終回答を持つように回答をクラスタリングします。ORMは各回答にスコアを付け、各クラスターのスコアを合計し、最もスコアの高いクラスターからの回答を返します。[ 50 ]
推論モデルは一般的に、多くのベンチマーク、特に多段階の推論を必要とするタスクにおいて、非推論モデルよりも高いスコアを達成します。[ 56 ] [ 57 ] [ 58 ] [ 59 ]
例えば、難易度の高い数学コンテストであるアメリカ招待数学試験(AIME)では、非推論モデルは通常、問題の30%未満しか解決できませんでした。対照的に、初期の推論モデルの多くは、50%から80%の成功率を達成しました。[ 2 ] [ 33 ] [ 35 ] 2025年1月にリリースされたo3-mini-highは、80%以上の精度を達成しました。[ 60 ]
サイバーフィジカルシステムにおけるオンライン複雑イベント検出、一般的な推論時間計算評価、Verilog エンジニアリングタスク、ネットワークセキュリティ評価などのベンチマークでは、応答時間が長く推論コストが高いため、推論モデルを除外しているベンチマークもあります。[ 61 ] [ 62 ] [ 63 ] [ 64 ]
o1およびo3モデルは評価していませんが、その高コストと推論時間のため、頻繁かつ低遅延のAPIリクエストを必要とするオンラインCEDには実用的ではありません。
O1 と R1 を評価できませんでした…
O1 プレビューの場合、コストが高いため、サンプリングは 1 回のみです。
o1 を評価することができませんでした…公開 API には、o1 が攻撃を実行できないようにする安全対策があります。