
Generative Pre-trained Transformer 1 ( GPT-1 ) は、OpenAIのGPT シリーズモデルの最初の大規模言語モデルであり、 2017 年にGoogleがトランスフォーマーアーキテクチャを発明した後に開発されました。 [ 2 ] 2018 年 6 月に、OpenAI は「生成事前トレーニングによる言語理解の向上」というタイトルの論文を発表し、[ 3 ]この論文の中で、生成事前トレーニング Transformer (GPT)という用語とともにこの初期モデルを紹介しました。[ 4 ]
それまで、最も優れたニューラルNLPモデルは、主に大量の手動でラベル付けされたデータからの教師あり学習を採用していました。この教師あり学習への依存は、十分に注釈が付けられていないデータセットの使用を制限するだけでなく、非常に大規模なモデルのトレーニングを法外に高価で時間のかかるものにしていました。 [ 3 ] [ 5 ]スワヒリ語やハイチ語クレオール語などの多くの言語は、コーパス構築に利用できるテキストが不足しているため、このようなモデルを使用して翻訳および解釈することが困難です。[5] 対照的に、GPTの「半教師あり」アプローチは、2つの段階で構成されていました。言語モデリングの目的を使用して初期パラメータを設定する教師なし生成「事前トレーニング」段階と、これらのパラメータをターゲットタスクに適応させる教師あり識別「ファインチューニング」段階です。[ 3 ]
従来の注意機構を拡張したRNNを用いた手法とは異なり、トランスフォーマーアーキテクチャを用いることで、GPTモデルはリカレントメカニズムでは実現できない構造化されたメモリを持つことができ、その結果、「多様なタスク間で堅牢な転移性能」が実現した。[ 3 ]
GPT-1 アーキテクチャは、12 層のデコーダのみのトランスフォーマーで、それぞれ 64 次元の状態を持つ12 個のマスクされた自己注意ヘッドを使用しています (合計 768 次元)。単純な確率的勾配降下法ではなく、Adam 最適化アルゴリズムが使用されました。学習率は、最初の 2,000 回の更新でゼロから最大 2.5×10 −4まで線形に増加し、コサイン スケジュールを使用して 0 に焼きなましされました。[ 3 ] GPT-1 には 1億 1700 万個のパラメータがあります。[ 6 ]
微調整は特定のタスクに合わせて行われたが、事前学習はそうではなかった。さまざまなタスクを実行するために、基盤となるタスク非依存のモデルアーキテクチャに最小限の変更が加えられた。[ 3 ]それにもかかわらず、GPT-1はいくつかの言語処理タスクで以前のベンチマークを改善し、いくつかの多様なタスクでタスク指向アーキテクチャを持つ識別的に学習されたモデルを上回った。[ 3 ]
GPT-1 は、さまざまなデータセットから文のペアを解釈し、それらの間の関係を「含意」、「矛盾」、「中立」に分類する能力を評価する自然言語推論 (テキスト含意とも呼ばれる)タスクで、以前の最良の結果 [ 3 ] を 5.8% および 1.5% 上回りました。 [ 3 ]このようなデータセットの例には、QNLI ( Wikipedia の記事) や MultiNLI (書き起こされた音声、大衆小説、政府報告書など) があります。[ 7 ]同様に、質問応答と常識推論に関連する 2 つのタスクでも以前のモデルを上回りました。中学校と高校の試験からの書面による質問と回答のペアのデータセットである RACE [ 8 ]では 5.7% 、Story Cloze Test [ 9 ]では 8.9% 上回りました。
GPT-1は、Quora Question Pairs(QQP)データセットを使用して、2つの文が互いの言い換えであるかどうかを予測する能力を評価し、意味的類似性(または言い換え検出)において、以前の最も優れたモデルを4.2%改善しました。[ 3 ]
GPT-1は、言語受容性コーパス(CoLA)を用いたテキスト分類タスクにおいて、これまでの最高記録35.0を上回る45.4のスコアを達成した[ 3 ]。最後に、GPT-1はマルチタスクテストであるGLUEにおいて、総合スコア72.8(これまでの最高記録68.9と比較)を達成した[ 10 ] 。
の例を含むこのリソースは、自然言語推論(テキストの含意の認識とも呼ばれる)に利用できる最大のコーパスの1つであり、[...] 10の異なるジャンルの書き言葉と話し言葉の英語のデータを提供し、[...] ジャンルをまたいだドメイン適応を評価するための明示的な設定を提供します。
LSDSem'17 共有タスクはストーリー クローズ テストで、ストーリーの理解とスクリプト学習の新しい評価です。このテストでは、システムに4文のストーリーと2つの可能な結末が与えられ、システムは正しい結末を選択する必要があります。ストーリーの理解に成功する (人間のパフォーマンス100%に近づく) には、システムがさまざまなレベルの意味論を常識的な知識にリンクする必要があります。