PaLM(Pathways Language Model )は、 Google AIが開発した、5400億個のパラメータを持つ密なデコーダのみのトランスフォーマーベースの大規模言語モデル(LLM)です。[ 1 ]研究者らは、モデル規模の効果をテストするために、PaLMのより小さなバージョン(80億個と620億個のパラメータ)もトレーニングしました。[ 2 ]
PaLM は、常識推論、算術推論、ジョークの説明、コード生成、翻訳など、幅広いタスクを実行できます。[ 2 ] [ 3 ] [ 4 ] [ 5 ]思考連鎖プロンプトと組み合わせると、PaLM は、文章問題や論理ベースの質問など、多段階の推論を必要とするデータセットで大幅に優れたパフォーマンスを達成しました。[ 1 ] [ 2 ]
このモデルは2022年4月に初めて発表され、2023年3月にGoogleがPaLMと他のいくつかのテクノロジーのAPIを公開するまで非公開のままでした。 [ 6 ]このAPIは当初、一般公開される前に待機リストに登録した限られた数の開発者にのみ利用可能でした。[ 7 ]
GoogleとDeepMindは、医療データで微調整され、医療に関する質問応答ベンチマークで以前のモデルを上回る性能を発揮する、 PaLM 540B(5400億個のパラメータを持つ)のバージョンであるMed-PaLMを開発しました。 [ 8 ] [ 9 ] Med-PaLMは、米国の医師免許試験で初めて合格点を獲得し、多肢選択式と自由記述式の両方の質問に正確に答えるだけでなく、推論を提供し、自身の回答を評価することもできます。[ 10 ]
Google はまた、ビジョン トランスフォーマーを使用して PaLM を拡張し、再トレーニングや微調整を必要とせずにロボット操作に使用できるビジョン言語モデルであるPaLM-Eを作成しました。[ 11 ] [ 12 ] [ 13 ]
2023年5月、Googleは年次Google I/O基調講演でPaLM 2を発表した。[ 14 ] PaLM 2は3.6兆トークンでトレーニングされた3400億パラメータのモデルであると報告されている。[ 15 ]
2023年6月、Googleは音声間翻訳用のAudioPaLMを発表しました。これはPaLM-2アーキテクチャと初期化を使用しています。[ 16 ]
PaLM は、さまざまな自然言語タスクとユースケースを含む 7800 億トークンの高品質コーパスで事前学習されています。このデータセットには、フィルタリングされたウェブページ、書籍、 Wikipedia の記事、ニュース記事、 GitHubのオープンソースリポジトリから取得したソースコード、およびソーシャルメディアの会話が含まれています。[ 1 ] [ 2 ]これは、 GoogleのLaMDAモデルのトレーニングに使用されたデータセットに基づいています。[ 2 ]データセットのソーシャルメディアの会話部分はコーパスの 50% を占めており、モデルの会話能力を向上させています。[ 2 ]
PaLM 540B は、モデルとデータの並列処理の組み合わせを使用して接続された 768 台のホストに接続された、各 Pod に 3,072 個の TPU v4 チップを備えた2 つのTPU v4 Pod でトレーニングされました。これは最大の TPU 構成でした。[ 2 ] [ 17 ]これにより、6,144 個のチップを使用して大規模な効率的なトレーニングが可能になり、この規模の LLM で達成された最高のトレーニング効率の記録となりました。ハードウェアFLOPs使用率は 57.8% でした。[ 3 ]