Geminiは、 Google DeepMindが開発したマルチモーダル大規模言語モデル(LLM)のファミリーであり、 LaMDAとPaLM 2の後継です。Gemini Pro、Gemini Deep Think、Gemini Flash、Gemini Flash Lite [ 1 ]で構成され、2023年12月6日に発表されました。Geminiチャットボットの基盤となっており、双子座にちなんで名付けられました。
Google は、子会社のGoogle DeepMindが開発した大規模言語モデル(LLM) である Gemini を、2023 年 5 月 10 日のGoogle I/O基調講演で発表しました。これは、同イベントで発表されたPaLM 2のより強力な後継として位置づけられ、Google のCEOであるSundar Pichai氏は、Gemini はまだ開発の初期段階にあると述べています。[ 3 ] [ 4 ]他の LLM とは異なり、Gemini はテキスト コーパスのみでトレーニングされておらず、テキスト、画像、音声、ビデオ、コンピュータ コードなど、複数の種類のデータを同時に処理できるマルチモーダルとして設計されている点でユニークであると言われています。[ 5 ]これは、Google DeepMind として統合された Google の 2 つの部門であるDeepMind とGoogle Brainのコラボレーションによって開発されました。 [ 6 ] DeepMindのCEOであるデミス・ハサビス氏はWired誌のインタビューで、 Geminiの高度な機能について語り、このアルゴリズムがOpenAIのChatGPT ( GPT-4で動作し、GoogleがLaMDAとBardで積極的に対抗してきた)を凌駕できると確信していると述べた。ハサビス氏は、2016年に囲碁チャンピオンのイ・セドル氏を破り世界的な注目を集めたDeepMindのAlphaGoプログラムの強みを強調し、GeminiはAlphaGoと他のGoogle-DeepMind LLMの力を組み合わせるだろうと述べた。[ 7 ]
2023 年 8 月、The Information は、Google の Gemini のロードマップを概説したレポートを公開し、同社が 2023 年後半のローンチを目指していることを明らかにした。レポートによると、Google は、ほとんどの LLM に搭載されている会話テキスト機能と人工知能による画像生成を組み合わせることで、OpenAI や他の競合他社を凌駕し、文脈に沿った画像を作成し、より幅広いユースケースに適応できるようにすることを望んでいた。[ 8 ] Bard と同様に、[ 9 ] Google の共同創設者であるSergey Brin は、Google Brain や DeepMind の数百人のエンジニアとともに、引退から呼び戻され、Gemini の開発を支援した。[ 8 ] [ 10 ]彼は後に Gemini の「コア貢献者」としてクレジットされた。[ 11 ] Gemini はYouTube動画の文字起こしでトレーニングされていたため、著作権侵害の可能性のある素材をフィルタリングするために弁護士が招集された。[ 8 ]
Geminiのローンチが間近に迫っているというニュースを受けて、OpenAIはGeminiと同様のマルチモーダル機能とGPT-4を統合する作業を加速させた。[ 12 ] The Informationは9月に、GoogleがGoogle CloudのVertex AIサービスを通じて顧客に提供する予定のLLMの「初期バージョン」への早期アクセス権を複数の企業に付与したと報じた。同誌はまた、GoogleがGeminiをGPT-4とMicrosoftのGitHub Copilotの両方と競合できるように強化しているとも報じた。[ 13 ] [ 14 ]
2023 年 12 月 6 日、ピチャイとハサビスは、バーチャル記者会見で「Gemini 1.0」を発表しました。[ 15 ] [ 16 ]これには、3 つのモデルがあります。「非常に複雑なタスク」向けに設計された Gemini Ultra、「幅広いタスク」向けに設計された Gemini Pro、および「デバイス上のタスク」向けに設計された Gemini Nano です。発売当初、Gemini Pro と Nano はそれぞれ Bard とPixel 8 Proスマートフォンに統合され、Gemini Ultra は「Bard Advanced」の動力源となり、2024 年初頭にソフトウェア開発者向けに提供される予定でした。Google が Gemini を組み込む予定だった他の製品には、検索、広告、Chrome 、 Google Workspaceの Duet AI 、およびAlphaCode 2がありました。[ 17 ] [ 16 ]これは英語でのみ利用可能でした。[ 16 ] [ 18 ] Googleの「最大かつ最も有能なAIモデル」として宣伝され、人間の行動を模倣するように設計された[ 19 ] [ 16 ] [ 20 ]同社は、「広範な安全性のテスト」が必要であるため、Geminiは翌年まで広く利用可能にならないと述べた。[ 15 ] GeminiはGoogleのTensor Processing Unit(TPU)でトレーニングされ、動作しており、 [ 15 ] [ 18 ]その名前はDeepMindとGoogle Brainの合併、およびNASAのProject Geminiに由来している。[ 21 ]
Gemini Ultraは、さまざまな業界ベンチマークでGPT-4、AnthropicのClaude 2、Inflection AIのInflection-2、MetaのLLaMA 2、xAIのGrok 1を上回ったと言われており、 [ 22 ] [ 15 ] Gemini ProはGPT-3.5を上回ったと言われている。[ 5 ] Gemini Ultraは、57人の被験者によるMassive Multitask Language Understanding(MMLU)テストで人間の専門家を上回った最初の言語モデルでもあり、90%のスコアを獲得した。[ 5 ] [ 21 ] Gemini Proは12月13日にAI StudioとVertex AIでGoogle Cloudの顧客向けに提供開始され、Gemini NanoはAndroid開発者向けにも提供される予定である。[ 23 ] [ 24 ] [ 25 ]ハサビス氏はさらに、DeepMindがGeminiを「ロボット工学と組み合わせて物理的に世界と相互作用する方法」を模索していることを明らかにした。[ 26 ] 10月にジョー・バイデン米大統領が署名した大統領令に従い、GoogleはGemini Ultraのテスト結果を米国連邦政府と共有すると発表した。同様に、同社は11月にブレッチリー・パークで開催されたAI安全サミットで示された原則を遵守するため、英国政府と協議を行っていた。 [ 5 ]
2025年6月、GoogleはGemini CLIを発表しました。これは、Geminiの機能を端末に直接提供するオープンソースのAIエージェントで、高度なコーディング、自動化、問題解決機能を提供し、個人開発者には寛大な無料使用制限が設けられています。[ 27 ]
2024 年 1 月、Google はSamsungと提携し、Gemini Nano と Gemini Pro をGalaxy S24スマートフォンのラインナップに統合しました。[ 28 ] [ 29 ]翌月、Bard と Duet AI は Gemini ブランドの下に統合され、[ 30 ] [ 31 ] Google Oneサブスクリプション サービスの新しい「AI Premium」ティアを通じて「Gemini Advanced with Ultra 1.0」がリリースされました。[ 32 ] Gemini Pro もグローバルに発売されました。[ 33 ]
2024 年 2 月、Google は Gemini 1.5 を発表し、1.0 Ultra よりも強力で高性能なモデルであると説明しました。[ 34 ] [ 35 ] [ 36 ]変更点には、新しいアーキテクチャ、専門家の混合アプローチ、より大きな 100 万トークンのコンテキスト ウィンドウが含まれます。[ 37 ]同じ月に、Google は Gemini モデルのより小型で無料のオープンソースの範囲である Gemma を発表しました。複数の出版物は、これを Meta や他の企業が AI モデルをオープンソース化したことへの対応であり、Google がこれまで AI を独自仕様にしていた慣行からの転換であると説明しました。[ 38 ] [ 39 ] [ 40 ] Google は 5 月 14 日、2024 I/O の基調講演で、Gemini 1.5 Flash という追加モデルを発表しました。[ 41 ]
2024年9月24日に、Gemini-1.5-Pro-002とGemini-1.5-Flash-002という2つのアップデートされたGeminiモデルがリリースされました。[ 42 ]
2024 年 12 月 11 日、Google は新しい Gemini 2.0 Flash Experimental モデルを発表しました。[ 43 ]機能には、リアルタイムのオーディオおよびビデオのインタラクションのためのマルチモーダル Live API、ネイティブ画像と制御可能なテキスト読み上げ生成 (ウォーターマーク付き)、および統合された Google 検索が含まれます。[ 44 ]また、エージェント機能の改善、新しい Google Gen AI SDK、および GitHub 用の実験的な AI コーディング エージェントである「Jules」も導入されています。[ 45 ]
2025年1月30日、GoogleはGemini 2.0 Flashを新しいデフォルトモデルとしてリリースし、Gemini 1.5 Flashも引き続き使用可能とした。これに続き、2025年2月5日にはGemini 2.0 Proがリリースされた。さらに、GoogleはGemini 2.0 Flash Thinking Experimentalをリリースした。これは、プロンプトに応答する際の言語モデルの思考プロセスの概要を生成するものである。[ 46 ]
2025年3月12日、GoogleはGemini Roboticsも発表した。これはGemini 2.0ファミリーのモデルに基づいたビジョン・言語・アクションモデルである。[ 47 ]翌日、 GoogleはAndroid StudioのGeminiがシンプルなUIモックアップを理解し、それを動作するJetpack Composeコードに変換できると発表した。[ 48 ]
Gemini 2.5 Pro Experimental は 2025 年 3 月 25 日にリリースされました。[ 49 ] [ 50 ] [ 51 ]このモデルは、ネイティブのマルチモダリティを維持しながら、思考の連鎖を促す機能を提供します。[ 49 ] [ 51 ] [ 52 ]
Google I/O 2025で、GoogleはGemini 2.5 Flashが標準モデルになると発表しました。[ 53 ] Gemini 2.5 Proは、より優れたコーディング機能やその他の改良を特徴とする、最も先進的なGeminiモデルとして発表されました。[ 54 ] 2.5 ProとFlashの両方がネイティブオーディオ出力をサポートしています。
2025年6月17日、Googleは2.5 ProとFlashの一般提供開始を発表した。同日、速度とコスト効率を最適化したモデルであるGemini 2.5 Flash-Liteも発表した。[ 55 ]
2025年11月18日、Googleは3 Proと3 Deep Thinkのリリースを発表しました。[ 56 ]これらの新しいモデルは2.5 ProとFlashに取って代わります。このリリースを受けて、OpenAIは競合モデルであるGPT-5.2のリリースを早め、12月11日にリリースしました。[ 57 ] [ 58 ] [ 59 ] [ 60 ]
2025年12月4日、Googleは3 Deep ThinkがUltra加入者向けに展開を開始すると発表した。[ 61 ]
2025年12月17日、Googleは、現在のバージョン2.5 Flashに代わるバージョン3 Flashのリリースを発表した。[ 62 ]
2026年1月12日、Appleは次期バージョンのSiriにGemini AIモデルを使用する計画を発表した。[ 63 ]
2026年2月11日、ジェミニは女性ファッションブランドのL'Agenceと提携し、ニューヨークファッションウィークで同社のバーチャル試着技術を活用した。 [ 64 ]
2026年2月19日、GoogleはGemini 3.1 Proをリリースした。[ 2 ] [ 65 ]
2026年2月26日、Nano Banana 2がリリースされました。これはGemini 3.1 Flash Imageプラットフォームをベースにしたアップデート版です。[ 66 ]
2026年3月3日、GoogleはGoogle APIで開発者向けにGemini 3.1 Flash Liteをリリースした。[ 67 ] [ 68 ]
2026年4月2日、Googleは高度な推論とエージェントワークフローのために特別に構築されたGemma 4をリリースした。[ 69 ]
2026年5月19日、GoogleはGemini 3.5 Flashをリリースした。これは3.5モデルファミリーの最初の一般公開版である。[ 70 ]
2026年7月21日、GoogleはGemini 3.6 FlashとGemini 3.5 Flash-Liteをリリースした。[ 71 ] [ 72 ]
次の表は、ジェミニの主なモデルバージョンを一覧にし、各バージョンに含まれる重要な変更点を説明しています。[ 73 ] [ 74 ] [ 75 ]

Nano Banana(正式名称:Gemini 2.5 Flash Image)、Nano Banana Pro(正式名称:Gemini 3 Pro Image)、Nano Banana 2(正式名称:Gemini 3.1 Flash Image)は、画像生成および編集モデルです。
「Nano Banana」は、 Arenaで秘密裏に公開テストが行われていた際にモデルに使用されたコードネームです。2025 年 8 月 12 日に、クラウドソーシング型 AI 評価プラットフォーム Arena に匿名モデルとして初めて公開されました。2025 年 8 月 26 日に、Gemini アプリおよび関連するGoogle AIサービスを通じて公開されました。「Nano Banana」というニックネームは、Google DeepMindのプロダクト マネージャーである Naina Raisinghani に付けられたニックネームに由来しています。[ 92 ] Google は後に、公開時に公式発表で、Gemini 2.5 Flash Imageであることを確認しました。 [ 93 ] [ 94 ] 2025 年 11 月 20 日に、DeepMind はテキスト レンダリングと世界知識を改善した Nano Banana Pro (Gemini 3 Pro Image) をリリースしました。[ 85 ] [ 95 ] [ 96 ] [ 94 ]
Nano Bananaはリリース後、特にフォトリアルな「3Dフィギュア」画像でソーシャルメディア上で爆発的なインターネットセンセーションを巻き起こしました。リリース後、Nano BananaはGeminiアプリ、Google AI Studio、Vertex AIで利用可能になりました。Googleによると、リリースから数週間でGeminiアプリに1,000万人以上の新規ユーザーを引き付け、2億回以上の画像編集を促進しました。[ 97 ] [ 98 ]
このモデルでは、ユーザーがヘアスタイルや背景を変更したり、自然言語の手がかりを使って写真を合成したりできます。被写体の一貫性により、同じ人物やアイテムが画像の改訂版全体で認識されます。マルチイメージ融合により、複数の写真が1つのシームレスな出力に結合され、世界知識によりコンテキストに応じた変更が可能になります。また、AI生成情報を識別するための出力内の目に見えないデジタル署名であるSynthIDウォーターマークも提供します。 [ 94 ] [ 99 ] マルチイメージ融合により、複数の写真が1つのシームレスな出力に結合され、世界知識によりコンテキストに応じた変更が可能になります。人々は、Nano Bananaを、自撮り写真を玩具のような3Dフィギュアに変えるというバイラルなブームと結びつけ始めました。このイベントは、InstagramやX(以前はTwitter)などのサイトで急速に広まりました。[ 100 ] [ 101 ]モデルをXに追加することで、ユーザーは投稿でNano Bananaを直接タグ付けしてプロンプトから写真を作成できるようになり、さらに人気が高まりました。[ 100 ]
TechRadarの2025年9月のレビューでは、Nano BananaはChatGPTの画像生成よりも、複数のプロンプトにわたってよりリアルで一貫性があると報告されています。[ 102 ] Tom's Guideのレビューでは、クリエイティブで生き生きとした画像編集を処理する能力が称賛されています。[ 103 ] PC Gamerの別のレビューでは、このモデルにはトリミングなどの基本的な編集ツールがなく、製品が変更を適用せず、代わりに元の画像に戻ることがあると指摘されています。[ 99 ] Nano Bananaは、複雑な形状でも正しいスケールで画像を生成する建築ビジュアライゼーションで優れたパフォーマンスを示しました。[ 104 ] [ 99 ]
2026年2月26日、Nano Banana 2が展開され、Geminiチャットボット、検索AIモード、およびLensに統合されました。これはGemini 3.1 Flash Imageをベースにした高速バージョンで、指示の追従性とテキストレンダリングが向上しています。[ 66 ] 2026年5月のGoogle I/O基調講演で、GoogleはGoogle Workspaceスイートの一部であるGoogle Picsと呼ばれるNano Banana搭載の画像生成プラットフォームを発表しました。[ 105 ]
Geminiはマルチモーダルであるため、各コンテキストウィンドウには複数の形式の入力を含めることができます。異なるモードはインターリーブすることができ、固定された順序で提示する必要がないため、マルチモーダルな会話が可能になります。たとえば、ユーザーはテキスト、画像、ビデオ、および音声を任意の順序で組み合わせて会話を開始することができ、Geminiも同様に自由な順序で応答することができます。入力画像は異なる解像度である可能性があり、ビデオは一連の画像として入力されます。音声は16 kHzでサンプリングされ、Universal Speech Modelによってトークンのシーケンスに変換されます。Geminiのデータセットはマルチモーダルかつ多言語であり、「Webドキュメント、書籍、およびコードで構成され、画像、音声、およびビデオデータを含みます」。[ 106 ]
GeminiおよびGemmaモデルはデコーダーのみのトランスフォーマーであり、TPU上で効率的なトレーニングと推論を可能にするための変更が加えられています。1.0世代ではマルチクエリアテンションが使用されています。[ 106 ]ただし、Gemini 2.0、2.5、および3に関するホワイトペーパーは公開されていません。
MIT Technology Review は、Gemini の発表に関する憶測を「AI の誇大宣伝のピーク」と評した。 [ 109 ] [ 22 ] Business Insiderのヒュー・ラングレーは、Gemini を Google にとっての成否を分ける瞬間と評し、「Gemini が素晴らしい成果を上げれば、Google が Microsoft と OpenAI に不意を突かれたという認識を変えるのに役立つだろう。もし期待外れであれば、Google が遅れをとっていると言う批判者を勢いづかせることになるだろう」と書いた。 [ 110 ]
2023 年 12 月の発表を受けて、コンピュータ科学者のOren Etzioni氏はGoogle DeepMindとOpenAIの間で軍拡競争が起こると予測した。コンピュータ科学者のAlexei Efros氏は Gemini のマルチモーダルアプローチの可能性を称賛した。[ 21 ] Percy Liang教授、Emily Bender教授、Michael Madden 教授は、使用されたトレーニング データについての洞察なしにベンチマーク スコアを解釈するのは難しいと警告した。[ 109 ] [ 111 ] Fast Companyに寄稿したMark Sullivan 氏は、Apple がSiri仮想アシスタントで Gemini と同様の機能を開発する能力を持っている可能性は低いと考え、Google には iPhone の圧倒的な市場シェアに挑戦する機会があると述べた。[ 112 ] Google の株価はGemini の発表の翌日に5.3% 上昇した。 [ 113 ] [ 114 ]
Googleは、Geminiのデモ動画が、モデルのリアルタイムインタラクション機能の真のデモとして提示されたものの、実際にはそう見えるように編集されていたとして批判に直面した。しかし、Googleは(動画とは別に)別の場所に、実際にはリアルタイムで録画されたものではないことを警告する小さな免責事項を掲載した。[ 115 ]
Gemini 2.5 Pro Experimental は、人間の好みを測定するベンチマークであるLMArena のリーダーボードでトップの座に初登場しました。 [ 49 ] [ 51 ]このモデルは、Humanity's Last Examを含むさまざまな AI ベンチマークで高い結果を達成しました。[ 49 ] [ 116 ] [ 51 ] [ 50 ]初期のレビューでは、以前のバージョンと比較して推論能力とパフォーマンスが向上したことが言及されています。[ 50 ] [ 52 ]公開されたベンチマークでは、 Anthropic、xAI、OpenAIなどの競合他社の最新のモデルが優位性を持っている領域も示されました。[ 116 ] [ 51 ]
{{cite news}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク){{cite news}}: CS1メンテナンス: アーカイブサービスは非推奨になりました (リンク)私たちの研究では、最大1,000万トークンのテストにも成功しました。