Google Brain は、Google の人工知能研究チームであり、後にGoogle AIという新しい傘下の人工知能研究部門に統合されるまで、Google の唯一の AI 部門として機能していました。2011 年に設立された Google Brain は、オープンエンドの機械学習研究と情報システムおよび大規模なコンピューティング リソースを組み合わせていました。[ 1 ]一般にニューラル ネットワークを使用できるTensorFlowなどのツールや、複数の社内 AI 研究プロジェクトを作成し、 [ 2 ]機械学習と自然言語処理の研究機会を創出することを目指していました。[ 2 ] 2023 年 4 月に、Google の旧姉妹会社 DeepMind と統合され、Google DeepMindとなりました。
Google Brainプロジェクトは、2011年にGoogleフェローのジェフ・ディーンとGoogle研究者のグレッグ・コラードによるパートタイムの研究協力として始まりました。 [ 3 ] Google BrainはGoogle Xプロジェクトとして始まりましたが、非常に成功したため、Googleに復帰しました。アストロ・テラーは、Google BrainがGoogle Xの費用を全額負担したと述べています。[ 4 ]
2012年6月、ニューヨーク・タイムズ紙は、人間の脳活動のいくつかの側面を模倣することに特化した1,000台のコンピュータに搭載された16,000個のプロセッサのクラスターが、YouTube動画から取得した1,000万枚のデジタル画像に基づいて猫を認識するように自己学習することに成功したと報じた。[ 3 ]このニュースは、ナショナル・パブリック・ラジオ(NPR)でも取り上げられた。[ 5 ]
2013年3月、Googleは深層学習分野の第一人者であるジェフリー・ヒントン氏を雇用し、ヒントン氏が率いるDNNResearch Inc.を買収した。ヒントン氏は、今後は大学での研究とGoogleでの仕事に時間を割いていくと述べた。[ 6 ]
2023年4月、Google BrainはGoogleの姉妹会社であるDeepMindと合併し、Google DeepMindが設立された。これは、同社がAIの研究を加速させるための継続的な取り組みの一環である。[ 7 ]
Google Brain は、当初、Google フェローのJeff Deanとスタンフォード大学の客員教授Andrew Ngによって設立されました。2014 年のチームには、Jeff Dean、Quoc V. Le、Ilya Sutskever、Alex Krizhevsky、Samy Bengio、および Vincent Vanhoucke が含まれていました。2017 年のチームメンバーには、Anelia Angelova、Samy Bengio、Greg Corrado、George Dahl、Michael Isard、Anjuli Kannan、Hugo Larochelle、Chris Olah、Benoit Steiner、Vincent Vanhoucke、Vijay Vasudevan、およびFernanda Viegasが含まれていました。[ 8 ] Appleのプログラミング言語Swiftを作成し、その後Teslaの自動運転チームを 6 か月率いたChris Lattner は、2017 年 8 月に Google Brain のチームに加わりました。 [ 9 ] Lattner は 2020 年 1 月にチームを離れ、SiFiveに加わりました。[ 10 ]
2021年現在Google Brain はJeff Dean、Geoffrey Hinton、Zoubin Ghahramaniによって率いられました。他のメンバーには、キャサリン・ヘラー、ピチュアン・チャン、イアン・サイモン、ジャン・フィリップ・ヴェール、ネヴェナ・ラジッチ、アネリア・アンジェロバ、ルカシュ・カイザー、キャリー・ジュン・カイ、エリック・ブレック、ルオミン・パン、カルロス・リケルメ、ヒューゴ・ラロシェル、デビッド・ハが含まれます。サミー・ベンジオは2021年4月にチームを去り[ 11 ] 、ズービン・ガーラマニがその責任を引き継いだ。
Google ResearchにはGoogle Brainが含まれており、マウンテンビューに拠点を置いています。また、アクラ、アムステルダム、アトランタ、 北京、ベルリン、ケンブリッジ、イスラエル、ロサンゼルス、ロンドン、モントリオール、ミュンヘン、ニューヨーク、パリ、ピッツバーグ、プリンストン、サンフランシスコ、シアトル、東京、トロント、チューリッヒにもサテライトグループがあります。[ 12 ]
2016 年 10 月、Google Brain は、ニューラル ネットワークが安全な対称暗号化を学習できるかどうかを判断するための実験を設計しました。[ 13 ]この実験では、Alice、Bob、Eve の 3 つのニューラル ネットワークが作成されました。[ 14 ]敵対的生成ネットワーク(GAN)の考え方に従い、この実験の目標は、Alice が Bob に暗号化されたメッセージを送信し、Bob はそれを復号できますが、敵対者である Eve は復号できないようにすることでした。[ 14 ] Alice と Bob は、暗号化と復号に使用される鍵を共有していたため、Eve に対して優位性を維持していました。[ 13 ]これにより、Google Brain は、ニューラル ネットワークが安全な暗号化を学習できる能力を実証しました。[ 13 ]
2017年2月、Google Brainは、 8x8解像度の画像を32x32解像度に変換する確率的手法を考案した。 [ 15 ] [ 16 ]この手法は、ピクセル変換を生成するために既に存在するpixelCNNと呼ばれる確率モデルに基づいて構築されている。[ 17 ] [ 18 ]
提案されたソフトウェアは、2 つのニューラル ネットワークを使用して、変換された画像のピクセル構成を近似します。 [ 16 ] [ 19 ]最初のネットワークは「条件付けネットワーク」として知られており、高解像度の画像を 8x8 に縮小し、元の 8x8 画像からこれらの高解像度の画像へのマッピングを作成しようとします。[ 16 ]もう 1 つのネットワークは「事前ネットワーク」として知られており、前のネットワークからのマッピングを使用して、元の画像に詳細を追加します。[ 16 ]結果として得られる変換された画像は、高解像度の同じ画像ではなく、他の既存の高解像度画像に基づいて 32x32 解像度の推定値です。[ 16 ] Google Brain の結果は、ニューラル ネットワークが画像を強化する可能性を示しています。[ 20 ]
Google Brain は、人工ニューラル ネットワークと多言語テキストの膨大なデータベースを組み合わせた新しい深層学習システムを採用することで、 Google 翻訳プロジェクトに貢献しました。 [ 21 ] 2016 年 9 月に、多数の例から学習できるエンドツーエンドの学習フレームワークであるGoogle ニューラル機械翻訳(GNMT) がリリースされました。 [ 21 ]以前の Google 翻訳のフレーズベース機械翻訳 (PBMT) アプローチでは、単語ごとに統計的に分析し、文中の周囲のフレーズを考慮せずに、他の言語の対応する単語に一致させようとしていました。[ 22 ]しかし、GNMT は、目的の言語で個々の単語の置き換えを選択するのではなく、文の残りのコンテキストで単語セグメントを評価して、より正確な置き換えを選択します。[ 2 ]以前の PBMT モデルと比較して、GNMT モデルは人間の翻訳との類似性が 24% 向上し、エラーが 60% 減少しました。[ 2 ] [ 21 ] GNMTは、中国語から英語への翻訳のような、非常に難しいことで知られる翻訳においても、著しい改善を示しています。[ 21 ]
GNMT の導入により、試験運用言語における Google 翻訳の翻訳品質は向上しましたが、103 言語すべてで同様の改善を実現することは非常に困難でした。この問題に対処するため、Google Brain チームは、複数の言語間での翻訳を可能にすることで以前のシステムを拡張した多言語GNMTシステムを開発しました。さらに、このシステムは、システムがこれまで明示的に見たことのない 2 つの言語間の翻訳であるゼロ ショット翻訳を可能にします。[ 23 ] Google は、Google 翻訳がニューラル ネットワークを使用して文字起こしなしでも翻訳できるようになったと発表しました。これは、まず文字起こしすることなく、ある言語の音声を別の言語のテキストに直接翻訳できることを意味します。
Google Brain の研究者によると、この中間ステップはニューラルネットワークを使用することで回避できるとのことです。システムがこれを学習できるように、何時間にも及ぶスペイン語の音声とそれに対応する英語のテキストをシステムに与えました。人間の脳を模倣したニューラルネットワークのさまざまな層は、対応する部分をリンクし、音声波形を操作して英語のテキストに変換することができました。[ 24 ] GNMT モデルのもう 1 つの欠点は、文中の単語数に応じて翻訳時間が指数関数的に増加することです。[ 2 ]このため、Google Brain チームは、新しい翻訳プロセスが高速かつ信頼できるものであることを保証するために、さらに 2000 個のプロセッサを追加しました。[ 22 ]
ロボットの新しいスキルを手動でプログラミングする必要がある従来のロボット制御アルゴリズムを改善することを目指し、Google Brain のロボット研究者たちは、ロボットが新しいスキルを自力で学習できるようにする機械学習技術を開発しています。 [ 25 ]また、ロボットが学習プロセス中に互いに学習できるように、ロボット間で情報を共有する方法の開発も試みており、これはクラウド ロボティクスとしても知られています。[ 26 ]その結果、Google は 2019 年に開発者向けに Google Cloud Robotics Platform をリリースしました。これは、ロボット工学、AI、クラウドを組み合わせて、クラウド接続された協働ロボットによる効率的なロボット自動化を実現する取り組みです。[ 26 ]
Google Brain のロボット研究は、経験、シミュレーション、人間のデモンストレーション、および/または視覚表現から学習することでロボットがタスクを完了できるように、深層学習アルゴリズムを改善および適用することに主に焦点を当ててきました。[ 27 ] [ 28 ] [ 29 ] [ 30 ]例えば、Google Brain の研究者は、ロボットが事前にプログラムされていない環境で実験することで、硬い物体を拾って選択した箱に投げ入れることを学習できることを示しました。[ 27 ]別の研究では、研究者は、コップから液体を注ぐなどの行動を学習するようにロボットを訓練しました。ロボットは、複数の視点から記録された人間のデモンストレーションのビデオから学習しました。[ 29 ]
Google Brain の研究者は、ロボット工学の研究で他の企業や学術機関と協力してきました。2016 年、Google Brain チームはXの研究者と協力し、ロボットの把持のための手と目の協調の学習に関する研究を行いました。[ 31 ]彼らの手法により、自己修正を伴う新しい物体を把持するためのリアルタイムのロボット制御が可能になりました。[ 31 ] 2020 年、Google Brain、Intel AI Lab、および UC Berkeley の研究者は、手術ビデオのトレーニングから縫合などの手術関連のタスクをロボットが学習するための AI モデルを作成しました。[ 30 ]
2020年、Google Brainチームとリール大学は、インタラクティブ話者認識と呼ばれる自動話者認識モデルを発表しました。ISRモジュールは、ユーザー固有の単語をいくつか要求するだけで、指定された話者リストから話者を認識します。[ 32 ]このモデルは、テキスト音声合成トレーニングのコンテキストで音声セグメントを選択するように変更できます。[ 32 ]また、悪意のある音声生成器がデータにアクセスするのを防ぐこともできます。[ 32 ]
TensorFlowは、Google Brainが開発したオープンソースのソフトウェアライブラリで、独自のニューラルネットワークをトレーニングするためのツールを提供することで、誰でも機械学習を利用できるようにするものです。[ 2 ]このツールは、農家が収穫物の選別に必要な手作業の量を減らすために使用するディープラーニングモデルを使用したソフトウェアの開発に使用されており、人間が選別した画像のデータセットでトレーニングされています。[ 2 ]
Magentaは、既存のデータを分類・整理するのではなく、Google Brainを使用してアートや音楽の形で新しい情報を作成するプロジェクトです。[ 2 ] TensorFlowは、ユーザーがニューラルネットワークを誘導して画像や音楽を作成するためのツール群で更新されました。[ 2 ]しかし、バルドスタ州立大学のチームは、翻訳で直面する問題と同様に、AIが芸術における人間の意図を完全に再現するのに苦労していることを発見しました。[ 2 ]
Google Brain の画像分類機能は、人間の医師が気づかない可能性のあるパターンを探し出すことで、特定の病状の早期発見に役立てられてきました。[ 2 ]乳がんのスクリーニングでは、この方法は、各写真を見るのに時間がかかり、この作業に全神経を集中できない人間の病理医に比べて、偽陽性率が 4 分の 1 であることがわかりました。[ 2 ]ニューラル ネットワークは単一のタスクに特化してトレーニングされているため、人間が容易に発見できる写真内の他の疾患を識別することはできません。[ 2 ]
トランスフォーマー深層学習アーキテクチャは、2017年にGoogle Brainの研究者によって発明され、科学論文「Attention Is All You Need」で説明されました。[ 33 ] Googleはこの広く使用されているアーキテクチャの特許を所有していますが、それを行使していません。[ 34 ] [ 35 ]

Google Brainは2022年に、 OpenAIのDALL-Eに対抗するImagenとPartiという2種類のテキストから画像への変換モデルを作成したと発表した。[ 36 ] [ 37 ]
その後2022年には、このプロジェクトはテキストからビデオへの変換へと拡張された。[ 38 ]
Imagenの開発は、Deepmindとの合併後、Google Deepmindに移管された。 [ 39 ]
Google Brainプロジェクトの技術は現在、Androidオペレーティングシステムの音声認識システム、 Googleフォトの写真検索、 Gmailのスマートリプライ、YouTubeの動画レコメンデーションなど、他のさまざまなGoogle製品で使用されています。[ 40 ] [ 41 ] [ 42 ]
Google Brain はWired [ 43 ] [ 44 ] [ 45 ]、NPR [ 5 ]、Big Think [ 46 ]で取り上げられています。これらの記事には、主要チームメンバーの Ray Kurzweil と Andrew Ng へのインタビューが含まれており、プロジェクトの目標とアプリケーションの説明に焦点を当てています。[ 43 ] [ 5 ] [ 46 ]
2020年12月、AI倫理学者のティムニット・ゲブルはGoogleを退社した。[ 47 ]彼女が辞職したのか解雇されたのか正確な理由は議論されているが、退社の原因は「確率的オウムの危険性について:言語モデルは大きくなりすぎる可能性があるか?」と題する論文の撤回を拒否したことと、それに関連して、条件を満たさなければ退社するという最後通牒を出したことである。[ 47 ]この論文は、Google BrainなどのAIの成長に伴う潜在的なリスク、環境への影響、トレーニングデータの偏り、一般の人々を欺く能力などを探求した。[ 47 ] [ 48 ]論文の撤回を要求したのは、Google Brainの副社長であるメーガン・カチョリアであった。[ 49 ] 2021年4月現在、約7000人の現職または元Google従業員と業界支持者が、Googleを「研究検閲」で非難し、同社でのゲブルの扱いを非難する公開書簡に署名している。[ 50 ]
2021年2月、Googleは同社のAI倫理チームのリーダーの一人であるマーガレット・ミッチェルを解雇した。[ 49 ]同社の声明では、ミッチェルがゲブルへの支持を見つけるために自動化ツールを使用したことで社内規定に違反したと主張している。[ 49 ]同じ月、倫理チーム以外のエンジニアがゲブルの解雇を理由に辞職し始めた。[ 51 ] 2021年4月、Google Brainの共同創設者であるサミー・ベンジオが同社からの辞任を発表した。[ 11 ]ベンジオはゲブルのマネージャーであったにもかかわらず、彼女の解雇前に通知を受けておらず、彼女とミッチェルの両方を支持する投稿をオンラインで行った。[ 11 ]ベンジオの発表では、辞任の理由として自己成長に重点が置かれていたが、匿名の情報筋はロイターに対し、AI倫理チーム内の混乱が彼の判断に影響を与えたと述べている。[ 11 ]
2022年3月、GoogleはAI研究者のSatrajit Chatterjee氏を解雇した[ 52 ] [ 53 ]。同氏は、Google AIがNature誌に発表した論文[ 55 ]の調査結果に疑問を呈した[ 54 ]。この論文では、集積回路の配置問題に対するGoogleのAI技術(特に強化学習)が従来の方法よりも優れていると主張していた。しかし、この主張は、特に高速チップ設計といった結果が具体的な実証データによって適切に裏付けられておらず、その後発表された研究と矛盾していることが判明したため、異議を唱えられている[ 56 ] [ 57 ] [ 58 ] 。この論文では、特定の入力に対する従来の方法と提案された方法の実行時間が報告されておらず、従来の方法の十分に高度な実装との直接比較がなく、独自のトレーニングデータとテストデータのために再現が困難であった[ 57 ] 。少なくとも1つの当初好意的だったコメントは、その後の調査で撤回され[ 59 ] 、この論文はNature誌の編集者によって調査されていると報じられた。[ 60 ]解雇を争う訴訟で、チャタジーはネイチャー誌の論文がグーグルの技術を過剰に宣伝していると主張した。グーグルは訴訟の却下を求めたが、裁判所はチャタジーが「グーグルが州法または連邦法に違反する行為への参加を拒否したことへの報復として彼を解雇した」という主張を十分に裏付けていると判断した。 [ 61 ] [ 62 ]
Natureは2024年9月に補遺を発表し、Googleのエンジニアは方法論を明確にし、論文で説明した方法(ただし、例の専有データは除く)を再現するためのソフトウェアリポジトリをオープンソース化したと発表した。[ 63 ] しかし、これは提案された技術が実際に他の既存の方法よりも進歩しているかどうかについての論争を鎮めることはなかった。特に、Googleは、この分野の標準であり、専門家が長年求めてきた証拠である公開ベンチマークでの比較結果を示しなかった。[ 64 ] [ 65 ]