OpenAI o3は、 ChatGPT用のOpenAI o1の後継としてOpenAIが開発した生成事前学習済みトランスフォーマー(GPT) モデルです。段階的な論理的推論を必要とする質問に対処する際に、追加の検討時間を割り当てるように設計されています。[ 1 ] [ 2 ] 2025 年 1 月 31 日に、OpenAI はより小型のモデルである o3-mini をリリースし、[ 3 ] 4 月 16 日に o3 とo4-mini をリリースしました。[ 4 ]
OpenAI o3 モデルは 2024 年 12 月 20 日に発表されました。O2という名前の携帯電話キャリアブランドとの商標衝突を避けるため、「 o2 」ではなく「o3」と呼ばれています。[ 1 ] OpenAI は、2025 年 1 月 10 日まで、安全およびセキュリティ研究者にこれらのモデルの早期アクセスを申請するよう呼びかけました。[ 5 ] o1 と同様に、o3 と o3-mini の 2 つの異なるモデルがあります。[ 3 ]
2025 年 1 月 31 日、OpenAI は o3-mini をChatGPT の全ユーザー (無料ティアを含む) と一部のAPIユーザー向けにリリースしました。OpenAI は o3-mini を「精度とスピードが求められる技術分野」向けの o1 の「特殊な代替手段」と説明しています。[ 6 ] o3-mini には、低、中、高の 3 つの推論レベルがあります。無料版では中レベルを使用します。より多くの計算能力を使用するバリアントは o3-mini-high と呼ばれ、有料購読者が利用できます。[ 3 ] [ 7 ] ChatGPT の Pro ティアの購読者は、o3-mini と o3-mini-high の両方に無制限にアクセスできます。[ 6 ]
2月2日、OpenAIはウェブ検索に基づいて5分から30分以内に包括的なレポートを作成するo3のバージョンを使用したChatGPTサービスであるOpenAI Deep Researchをリリースした。[ 8 ]
2月6日、 DeepSeek R1などのライバルからの圧力に応えて、OpenAIはo3-miniモデルの思考プロセスの透明性を高めることを目的としたアップデートを発表した。[ 9 ]
2月12日、OpenAIはChatGPT Plus加入者向けにo3-mini-highのレート制限を1日あたり50リクエスト(1週間あたり50リクエストから)にさらに引き上げ、ファイル/画像アップロードのサポートを実装した。[ 10 ]
2025年4月16日、OpenAIはo3とo3 -miniの後継であるo4 -miniをリリースした。 [ 4 ]
6月10日、OpenAIは、同社がこれまでで最も高性能なモデルだと主張するo3-proをリリースした。[ 11 ] OpenAIは、「信頼性が速度よりも重要で、数分待つ価値がある難しい質問に使用することを推奨します」と述べた。[ 12 ]
2026年5月28日、OpenAIは、90日間の猶予期間を経て、2026年8月26日にChatGPTからo3が廃止されることを発表しました。同社は、この変更はChatGPTのみに適用され、APIには影響しないと述べています。[ 13 ]
強化学習は、OpenAIが「プライベートな思考の連鎖」と呼ぶものを使用して、o3に回答を生成する前に「考える」ように教えるために使用されました。[ 14 ]このアプローチにより、モデルはタスクを事前に計画し、推論して、問題を解決するのに役立つ一連の中間推論ステップを実行できますが、追加の計算能力と応答の遅延の増加という代償を伴います。 [ 15 ]
o3 は、コーディング、数学、科学などの複雑なタスクにおいて、o1 よりも大幅に優れたパフォーマンスを発揮します。[ 1 ] OpenAI は、専門家レベルの科学問題がオンラインで公開されていない GPQA Diamond ベンチマークで、o3 が 87.7% のスコアを達成したと報告しました。[ 16 ]
実際のGitHub課題を解決する能力を評価するソフトウェアエンジニアリングベンチマークであるSWE-bench Verifiedでは、o3は71.7%のスコアを獲得し、o1は48.9%でした。Codeforcesでは、 o3はEloスコア2727を達成し、o1は1891でした。[ 16 ]
AIが新しい論理問題やスキル獲得問題を処理する能力を評価する、汎用人工知能のための抽象化および推論コーパス(ARC-AGI)ベンチマークにおいて、o3はo1の3倍の精度を達成した。[ 1 ] [ 17 ]
OpenAI の 2025 年 1 月の o3-mini に関するレポートによると、「推論の努力」を調整すると、特にSTEMタスクのパフォーマンスに大きな影響を与えます。推論の努力を低くして高くすると、OpenAI のAIME 2024 (MathArena AIME ベンチマークとは異なります)、GPQA Diamond、Codeforcesでの精度が通常 10〜30% 向上します。高い努力の場合、o3-mini (high) は AIME 2024 で 87.3%、GPQA Diamond で 79.7%、Codeforces で 2130 Elo、SWE-bench Verified で 49.3 を達成しました。[ 6 ]