
機械学習において、ニューラルスケーリング法則は、主要な要素が拡大または縮小されるにつれてニューラルネットワークのパフォーマンスがどのように変化するかを記述する経験的なスケーリング法則です。これらの要素には通常、パラメータの数、トレーニングデータセットのサイズ、[ 1 ] [ 2 ] 、およびトレーニングコストが含まれます。一部のモデルでは、テスト時間計算 (TTC) の増加による推論のスケーリングによってパフォーマンスが向上することも示されており、ニューラルスケーリング法則はトレーニングだけでなく展開フェーズにも拡張されています。[ 3 ]
一般的に、深層学習モデルは、モデルサイズ、トレーニングデータセットサイズ、トレーニングコスト、トレーニング後のエラー率(例えば、テストセットのエラー率)という4つのパラメータで特徴付けられます。これらの変数はそれぞれ実数として定義でき、通常は次のように表記されます。(それぞれ、パラメータ数、データセットサイズ、計算コスト、損失)。
ニューラルスケーリング法則とは、これらのパラメータ間の理論的または経験的な統計法則のことである。他のスケーリング法則を持つパラメータも存在する。
ほとんどの場合、モデルのサイズは単にパラメータの数です。しかし、専門家混合モデルなどのスパースモデルを使用すると、1 つの問題が生じます。[ 4 ]スパースモデルでは、推論中にパラメータのごく一部しか使用されません。これに対し、トランスフォーマーモデルなどの他のほとんどの種類のニューラルネットワークは、推論中に常にすべてのパラメータを使用します。
トレーニングデータセットのサイズは、通常、その中のデータポイントの数で定量化されます。トレーニングデータセットが大きいほど、モデルが学習できる情報源がより豊富で多様になるため、一般的に好ましいとされています。これにより、モデルを新しい未知のデータに適用したときの汎化性能が向上します。[ 5 ]ただし、トレーニングデータセットのサイズを大きくすると、モデルのトレーニングに必要な計算リソースと時間も増加します。
ほとんどの大規模言語モデルで使用される「事前学習、その後ファインチューニング」方式では、事前学習データセットとファインチューニングデータセットの2種類のトレーニングデータセットがあります。これらのサイズはモデルのパフォーマンスに異なる影響を与えます。一般的に、ファインチューニングデータセットのサイズは事前学習データセットのサイズの1%未満です。[ 6 ]
場合によっては、微調整には少量の高品質データで十分であり、データ量を増やしても必ずしもパフォーマンスが向上するとは限らない。[ 6 ]
多くのスケーリング法則は、その固有の収穫逓減の性質により、 このトピックに関する論文[ 7 ]で示された劣モジュラ集合関数に基づいてデータを評価する。

トレーニングコストは通常、時間(モデルのトレーニングにかかる時間)と計算リソース(必要な処理能力とメモリ量)で測定されます。効率的なトレーニングアルゴリズム、最適化されたソフトウェアライブラリ、GPUやTPUなどの専用ハードウェア上での並列計算を用いることで、トレーニングコストを大幅に削減できることに注意が必要です。
ニューラルネットワークモデルのトレーニングコストは、モデルサイズ、トレーニングデータセットサイズ、トレーニングアルゴリズムの複雑さ、利用可能な計算リソースなど、いくつかの要因によって決まります。[ 5 ]特に、トレーニングデータセットのサイズを2倍にしても、トレーニングコストが必ずしも2倍になるわけではありません。同じデータセットでモデルを複数回トレーニングできるからです(それぞれが「エポック」です)。



ニューラルネットワークモデルのパフォーマンスは、入力データが与えられたときに出力を正確に予測する能力に基づいて評価されます。モデルのパフォーマンスを評価するための一般的な指標には、次のものがあります。[ 5 ]
パフォーマンスを向上させるには、より多くのデータ、より大規模なモデル、異なる学習アルゴリズムの使用、過学習を防ぐためのモデルの正則化、および検証セットを使用した早期停止が有効です。
パフォーマンスが以下の範囲内の数値である場合精度や正確さなど、多くの場合、コストのシグモイド関数としてスケーリングします。これは図に示されています。
2017年の論文[ 2 ]は、実験データに対する統計分析によって適合されたニューラルスケーリング法則の一般的な参照点である。この論文で引用されている2000年以前の先行研究は、理論的なものか、規模が桁違いに小さいものであった。先行研究では一般的にスケーリング指数は次のようにスケーリングすることが見出された。、 と論文によると、。
彼らが変化させた要因のうち、指数を変えることができるのはタスクだけですアーキテクチャのオプティマイザ、正則化器、損失関数を変更しても、比例係数は変わるだけで、指数は変わりません。たとえば、同じタスクの場合、あるアーキテクチャでは一方、別の人はまた、特定のアーキテクチャの場合、固定データセットサイズで損失を最小レベルにするために必要なパラメータの数は、次のように増加することもわかった。別の指数については。
彼らはLSTMを用いた機械翻訳を研究した()、LSTM を用いた生成言語モデリング () ResNet による ImageNet 分類 ()、および 2 つのハイブリッド (LSTM に CNN またはアテンションデコーダーのいずれかを補完) アーキテクチャを使用した音声認識 ()
2020年の分析[ 12 ]では、統計的関係が研究されました。広範囲の値にわたって、同様のスケーリング法則が見つかりました。、、そして複数のモダリティ(テキスト、ビデオ、画像、テキストから画像など)にわたって。[ 12 ]
特に、発見されたスケーリング法則は以下のとおりである([ 12 ]の表1 )。

ある特定のスケーリング法則(「チンチラ・スケーリング」)によれば、コサイン学習率スケジュールで1エポック自己回帰的に学習された大規模言語モデル(LLM)の場合、次のようになります。 [ 15 ]変数は
統計パラメータは
Besiroglu ら[ 17 ]は統計的推定がわずかにずれていると主張し、。
統計法則は実験データに適合され、。
2つの方程式で関連付けられた4つの変数があるため、1つの追加制約と1つの追加最適化目的を課すことで、4つの変数すべてを解くことができます。特に、任意の固定値に対して4 つの変数すべてを一意に解くことで、これにより最適な任意の固定値に対して:数値を代入すると、「チンチラ効率」モデルのサイズとトレーニングデータセットのサイズ、および達成可能なテスト損失が得られます。同様に、任意の固定モデルパラメータサイズに対して最適なトレーニングデータセットサイズとトレーニング計算予算を見つけることもできます。
「チンチラ効率」モデルのサイズとトレーニングデータセットのサイズについては、他にも推定値があります。上記は、統計モデルに基づいています。また、統計法則を直接当てはめることもできます。迂回せずに、以下のことを行うと、次の結果が得られる。または表形式で表すと次のようになります。
トランスフォーマー言語モデルのトレーニングに関するチンチラのスケーリング法則分析は、特定のトレーニング計算予算に対して()、その予算で最小限の事前学習損失を達成するには、モデルパラメータの数()とトレーニングトークンの数()は均等な比率で拡大縮小されるべきである。この結論は、Kaplanら[ 16 ]が行った分析とは異なり、より速く増加させるべきである、。
この相違は主に、2つの研究がモデルサイズの測定に異なる方法を使用していることに起因する。Kaplan et al.: [ 18 ]
ハイパーパラメータの調整や学習率スケジュールの違いによって二次的な影響も生じる。Kaplan et al.: [ 19 ]
チンチラスケーリングは多くの大規模トレーニング実行の基準点となってきたため、「チンチラスケーリングを超える」ための取り組みも同時に行われてきた。これは、より少ない労力で同じ損失を得るためにトレーニングパイプラインの一部を変更したり、「チンチラ最適」よりも意図的に長い時間トレーニングしたりすることを意味する。
通常、目標はスケーリング法則の指数を大きくすることであり、これは同じ損失をより少ない計算量で学習できることを意味します。たとえば、データをフィルタリングすることでスケーリング法則の指数を大きくすることができます。[ 20 ]
別の研究の流れでは、限られたデータへの対処法を研究しています。チンチラのスケーリング法則によれば、最大の言語モデルのトレーニングデータセットのサイズは、すでにインターネットで入手可能なデータに近づいています。[ 21 ]は、データセットから構築された「ノイズ除去目的」の組み合わせでデータセットを拡張すると、パフォーマンスが向上することを発見しました。[ 22 ]は、利用可能なすべてのデータがすでに使い果たされている場合(希少言語など)の最適なスケーリングを研究しており、同じデータセットで複数のエポックをトレーニングする必要があります(チンチラのスケーリングでは1つのエポックしか必要ありません)。小規模言語モデルのPhiシリーズは、大規模な言語モデルによって生成された教科書のようなデータでトレーニングされました。大規模な言語モデルの場合、データは利用可能な計算量によってのみ制限されます。[ 23 ]
チンチラ最適性は「トレーニング計算に最適」と定義されていましたが、実際のプロダクション品質のモデルでは、トレーニング完了後に多くの推論が行われます。トレーニング中の「過剰トレーニング」は、推論中のパフォーマンス向上を意味します。[ 24 ] LLaMAモデルはこの理由で過剰トレーニングされました。その後の研究では、データセットのサイズがチンチラ最適の最大 32 倍まで、過剰トレーニング領域におけるスケーリング法則が発見されました。[ 25 ]
2022年の分析[ 26 ]では、人工ニューラルネットワークの多くのスケーリング挙動が、滑らかに折れ曲がったべき乗則関数形式に従うことがわかった。
その中でスケーリングされる量を指します(つまり、、(トレーニングステップ数、推論ステップ数、またはモデル入力サイズ)ゼロショット、プロンプト、またはファインチューニング設定における、下流(または上流)の関心のあるパフォーマンス評価指標(予測誤差、交差エントロピー、較正誤差、AUROC、BLEUスコアパーセンテージ、F1スコア、報酬、Eloレーティング、解決率、またはFIDスコアなど)を指します。統計的フィッティングによって求められる。
対数-対数グラフでは、大きすぎず、y軸から差し引くと、この関数形式は弧でつながれた一連の線分のように見えます。セグメント間の遷移は「ブレーク」と呼ばれ、そのため、壊れたニューラルスケーリング法則(BNSL)という名前が付けられています。
人工ニューラルネットワークのスケーリング動作がこの関数形式に従うことがわかったシナリオには、大規模な視覚、言語、音声、ビデオ、拡散、生成モデリング、マルチモーダル学習、対照学習、AI アライメント、AI 機能、ロボット工学、分布外 (OOD) 汎化、継続的学習、転移学習、不確実性推定/較正、分布外検出、敵対的堅牢性、蒸留、スパース性、検索、量子化、剪定、公平性、分子、コンピュータ プログラミング / コーディング、数学の文章問題、算術、創発能力、二重降下、教師あり学習、教師なし/自己教師あり学習、強化学習(シングル エージェントおよびマルチ エージェント) が含まれます。
人工ニューラルネットワークのスケーリング挙動がこの関数形式に従うことがわかったアーキテクチャには、残差ニューラルネットワーク、トランスフォーマー、MLP、MLPミキサー、リカレントニューラルネットワーク、畳み込みニューラルネットワーク、グラフニューラルネットワーク、Uネット、エンコーダーデコーダー(およびエンコーダーのみ)(およびデコーダーのみ)モデル、アンサンブル(および非アンサンブル)、MoE(エキスパートの混合)(および非MoE)モデル、スパース剪定(および非スパース剪定なし)モデルが含まれます。

トレーニング計算をスケールアップする以外にも、推論計算(または「テスト時計算」[ 3 ])をスケールアップすることもできます。たとえば、AlphaGoのElo レーティングは、1 回のプレイでモンテ カルロ ツリー検索に費やす時間を増やすと着実に向上します。[ 27 ] :図 4 AlphaGo Zeroの場合、Elo を 120 上げるには、モデル サイズとトレーニングを 2 倍にするか、テスト時検索を 2 倍にする必要があります。[ 28 ]同様に、競技レベルのコーディング チャレンジを解決するための言語モデルである AlphaCode は、検索時間を増やすと一貫してパフォーマンスが向上しました (対数線形)。[ 29 ]
Hexの場合、トレーニング時の計算量が 10 倍になる代わりに、テスト時の計算量が 15 倍になります。[ 10 ]ヘッズアップノーリミットテキサス ホールデムのLibratus、ディプロマシーのCicero 、その他多くの部分情報抽象ゲームでは、推論時の検索により、トレーニング時の計算量が最大 100,000 倍に実効的に増加するという同様のトレードオフ比率でパフォーマンスが向上します。[ 28 ]
2024年のOpenAI o1レポートでは、o1のパフォーマンスはトレーニング時の計算とテスト時の計算の両方の増加に伴って一貫して向上することが文書化され、数学、科学的推論、コーディングタスクにおけるテスト時の計算スケーリングの多数の例が示されました。[ 30 ] [ 31 ]
テスト時の計算をスケールアップする1つの方法は、プロセスベースの監視です。これは、モデルが質問に答えるための段階的な推論チェーンを生成し、別のモデル(人間またはAI)が最終的な答えだけでなく、いくつかの中間ステップに対して報酬スコアを提供するものです。プロセスベースの監視は、別のモデルを使用せずに合成報酬スコアを使用することで任意にスケールアップできます。たとえば、モンテカルロロールアウトを実行し、推論の各ステップが正しい答えにつながる可能性に応じてスコアを付けます。もう1つの方法は、修正モデルを使用することです。これは、問題を複数回解決するようにトレーニングされたモデルで、毎回前回の試みを修正します。[ 32 ]
言語トランスフォーマーと同様に、ビジョントランスフォーマーもスケーリング法則を示します。2022年の研究では、パラメータ数を持つビジョントランスフォーマーを訓練しました。サイズの画像セットについて計算のために(TPUv3コア日単位)。[ 33 ]
モデルのトレーニング後、ImageNetトレーニングセットでファインチューニングを行います。ImageNetテストセットを分類するファインチューニングモデルのエラー確率は、。
Ghorbani、Behroozら[ 34 ]は、エンコーダー・デコーダーTransformerモデルにおけるニューラル機械翻訳(具体的には、ソース言語が英語、ターゲット言語がドイツ語)のスケーリング法則を研究し、同じデータセットで収束するまで学習させた(そのため、計算コストのスケーリング法則には適合しなかった)。またはデータセットのサイズそれらは様々だった。彼らは3つの結果を発見した。
著者らは、ソースとなる自然言語データセットは均一で退屈なターゲット文を含んでいるため、ターゲット文を予測するように訓練されたモデルはすぐに過学習を起こすだろうと仮説を立てている。
[ 36 ]サイズを機械翻訳用に訓練したトランスフォーマーデータセットのサイズについて彼らは、機械翻訳に適用されるKaplanら(2020)[ 16 ]のスケーリング法則を発見した。また、BLEUスコアのスケーリングは。
Hernandez、Dannyら[ 37 ]は、言語モデルにおける転移学習のスケーリング法則を研究した。彼らは、Transformerのファミリーを3つの方法で訓練した。
英語で事前学習を行うことで、Pythonテキストのテストセットでモデルが低損失を達成できるようになるというのがその考え方です。モデルのパラメータ数がであると仮定します。微調整後Pythonトークンでは、損失が発生します。我々は、その「転送されたトークン数」は同じモデルが別のモデルである場合同じことを達成するトレーニング後Pythonトークン。
彼らは見つけた英語のテキストで事前学習する場合、英語およびPython以外のコードでの事前学習用。
Kumar ら[ 38 ]は、言語モデルのトレーニングにおける数値精度のスケーリング法則を研究している。彼らは、整数型と浮動小数点型の両方で数値精度を変化させた重み、活性化関数、および KV キャッシュを持つ言語モデル群をトレーニングし、精度の関数として損失への影響を測定した。トレーニングの場合、彼らのスケーリング法則は、精度の影響を全体的な「有効パラメータ数」にラップすることで、低精度を考慮し、パラメータ化を使用して損失のスケーリングを制御する。これは、低精度でのトレーニングが、ビット数に応じて指数関数的に変化する形でモデルの真の容量を減少させることで、パフォーマンスを低下させる様子を示しています。
推論に関しては、チンチラ最適性を超えた言語モデルの過学習が、効率的な深層学習の標準的な手法である量子化に対するモデルの感度を高める可能性があることがわかった。これは、重み量子化による損失の劣化がトークン/パラメータ比のべき乗則に近似的に比例して増加することを観察することで実証されている。事前学習中に見られるように、極端なトークン予算で事前学習されたモデルは、事後学習量子化が適用された場合、より控えめなトークン予算で学習されたモデルよりも検証損失の点で劣る可能性があります。過剰学習の影響を調べた他の研究には、Sardana et al. [ 39 ]および Gadre et al. [ 40 ]があります。
Xiaoら[ 9 ]は、時間の経過に伴うモデルのパラメータ効率(「密度」)を検討した。その考え方は、時間の経過とともに、研究者はパラメータをより効率的に使用するモデルを発見するだろう、つまり、同じパフォーマンスを持つモデルはより少ないパラメータで済むというものである。
モデルは実際のパラメータ数を持つことができるは、モデル内の実際のパラメータ数として定義され、「有効な」パラメータ数として定義されます。これは、 MMLUなどのベンチマークで同じパフォーマンスを達成するために、以前のよく知られたモデルが必要としたパラメータの数として定義されます。直接測定するのではなく、実際のモデル性能を測定することによって測定する。そして、チンチラのスケーリング法則など、以前に適合させたスケーリング法則にそれを代入して、そのパフォーマンスを達成するには、以前に当てはめたスケーリング法則によれば。
圧縮法則によれば、、 どこ現実世界の時間であり、日数で計測される。