モデル これは、以前のモデルファミリーである Gopher をさらに発展させたものであるため、「チンチラ」と名付けられました。両方のモデルファミリーは 、大規模言語モデルのスケーリング法則 を調査するためにトレーニングされました。[ 2 ]
GPT-3 を 上回る性能を発揮すると主張している。推論と微調整に必要な計算能力がはるかに少ないため、下流での利用が大幅に簡素化される。以前に使用された言語モデルのトレーニングに基づいて、モデルのサイズを 2 倍にすると、トレーニング トークンの数も 2 倍にする必要があることが判明した。この仮説は、DeepMind による Chinchilla のトレーニングに使用された。コストの点では Gopher と似ているが、Chinchilla は 70B 個のパラメータと 4 倍のデータ (1.4T トークン対 300B) を持つ。[ 3 ]
Chinchillaは、大規模マルチタスク言語理解 測定(MMLU)ベンチマークで平均精度67.5%を達成しており、これはGopherのパフォーマンスより7%高い。Chinchillaは2023年1月12日時点ではまだテスト段階であった。[ 4 ]
Chinchillaは、限られた計算リソースで大規模な自己回帰言語モデルを効果的に学習させるパラダイムの開発に貢献しています。Chinchillaチームは、モデルサイズが2倍になるごとに学習トークンの数を2倍にすることを推奨しており、これは、より大きく、より高品質な学習データセットを使用することで、下流タスクでより良い結果が得られることを意味します。[ 5 ] [ 6 ]
これはFlamingoの視覚言語モデル に使用されています。[ 7 ]
建築 ゴーファーファミリーとチンチラファミリーはどちらもトランスフォーマーモデル のファミリーです。
特に、これらは基本的にGPT-2 と同じで、サイズと若干の変更点があるだけです。GopherファミリーはLayerNorm の代わりにRMSNormを 使用し、絶対位置エンコーディングではなく相対位置エンコーディングを使用しています。ChinchillaファミリーはGopherファミリーと同じですが、Adamオプティマイザ の代わりにAdamWを使用して学習されています。
Gopherファミリーには、4400万パラメータから2800億パラメータまで、規模の異なる6つのモデルが含まれています。デフォルトでは、最大のモデルが「Gopher」と呼ばれます。Chinchillaファミリーにも同様の命名規則が適用されます。
[ 2 ] の表1には、Gopherファミリー全体が示されている。
[ 1 ] の表4では、700億パラメータのChinchillaとGopher 280Bを比較しています。
参考文献 1 2 ホフマン、ヨルダン。ボルジョー、セバスチャン。アーサー・メンシュ。ブチャツカヤ、エレナ。カイ、トレバー。ラザフォード、イライザ。カサス、ディエゴ・デ・ラス。ヘンドリックス、リサ・アン。ウェルブル、ヨハネス。クラーク、エイダン。ヘニガン、トム。ノーランド、エリック。ミリカン、ケイティ。ドリーシェ、ジョージ・ヴァン・デン。ダモック、ボグダン (2022-03-29)。 「コンピューティングに最適な大規模言語モデルのトレーニング」。arXiv : 2203.15556 [ cs.CL ]。 1 2 Rae, Jack W.; Borgeaud, Sebastian; Cai, Trevor; Millican, Katie; Hoffmann, Jordan; Song, Francis; Aslanides, John; Henderson, Sarah; Ring, Roman; Young, Susannah; Rutherford, Eliza; Hennigan, Tom; Menick, Jacob; Cassirer, Albin; Powell, Richard (2022-01-21). "Scaling Language Models: Methods, Analysis & Insights from Training Gopher". arXiv : 2112.11446 [ cs.CL ]. ↑ Eliaçık, Eray (2023年1月12日). 「チンチラAIがGPT-3の王座を狙う」 . Dataconomy . 2023年3月26日時点のオリジナルより アーカイブ。 ↑ ヘンドリックス、ダン (2023-03-14)、 「大規模マルチタスク言語理解の測定 」、 2023-03-15 のオリジナルから アーカイブ 、 2023-03-15 に取得 ↑ Chaithali, G. (2022年4月9日). 「DeepMindの新しい言語モデルChinchilla(70Bパラメータ)をチェックしてください。これは、幅広い下流評価タスクでGopher(280B)とGPT-3(175B)を大幅に上回ります」 。 2023年3月27日のオリジナルから アーカイブ 。 2023年 1月15日 に取得。 ↑ Wali, Kartik (2022年4月12日) 「DeepMindがGPT-3のライバル、Chinchillaを発表」 。Analytics India Magazine 。 2023年3月26日の オリジナル からアーカイブ。 2023年 1月15日 取得 。 ↑ Alayrac, Jean-Baptiste; Donahue, Jeff; Luc, Pauline; Miech, Antoine; Barr, Iain; Hasson, Yana; Lenc, Karel; Mensch, Arthur; Millican, Katherine; Reynolds, Malcolm; Ring, Roman; Rutherford, Eliza; Cabi, Serkan; Han, Tengda; Gong, Zhitao (2022-12-06). "Flamingo: 少数ショット学習のための視覚言語モデル" . Advances in Neural Information Processing Systems . 35 : 23716– 23736. arXiv : 2204.14198 .