小型言語モデルまたはコンパクト言語モデルとは、言語やテキスト生成を含む人間の自然言語処理のために設計された人工知能言語モデルです。これらは、大規模言語モデルよりも規模と範囲が小さいのが特徴です。
大規模な言語モデルは通常、数千億個の学習パラメータを含み、中には1兆個を超えるパラメータを持つモデルもあります。この膨大なパラメータ数により、モデルは膨大な量の情報を符号化することができ、出力の汎化性能と精度が向上します。しかし、このようなモデルの学習には膨大な計算リソースが必要となるため、個人が単一のコンピュータとグラフィックス処理ユニット(GPU )を使用して学習を行うことは現実的ではありません。
一方、小規模な言語モデルは、通常数千から数億の範囲の、はるかに少ないパラメータを使用します。そのため、単一のコンピュータやモバイルデバイスなどのリソースが限られた環境でトレーニングおよびホストすることがより現実的になります。[ 1 ] [ 2 ] [ 3 ] [ 4 ] [ 5 ]
現代の小規模言語モデルのほとんどは、大規模言語モデルと同じアーキテクチャを採用していますが、パラメータ数が少なく、場合によっては演算精度も低くなっています。パラメータ数は、知識蒸留と枝刈りの組み合わせによって削減されます。精度は量子化によって低下させることができます。大規模言語モデルに関する研究成果は、小規模言語モデルにもほぼそのまま応用できます。枝刈りと量子化は、大規模言語モデルの高速化にも広く用いられています。
注目すべきモデルには以下のようなものがあります。[ 2 ]
従来のAI言語システムは、巨大なコンピュータと膨大な量のデータを必要とする。
事前学習は重要であり、たとえ小規模なモデルであっても、事前学習データセットが大きくなるにつれて性能が大幅に向上することが示されています。事前学習データセットとテストデータセットが類似したトークンを共有する場合、分類精度が向上します。
浅いアーキテクチャは、協調学習を通じて深層モデルのパフォーマンスを再現できる。[ 7 ]