フィードバックニューラルネットワークは、出力または後続の層に基づいて、入力層または前の層に対してボトムアップおよびトップダウンの設計フィードバックを提供する能力を持つニューラルネットワークです。これは、特に推論言語モデル(RLM)などの大規模言語モデルでよく使用されます。このプロセスは、自己評価と内部審議を模倣するように設計されており、エラー(幻覚など)を最小限に抑え、解釈可能性を高めることを目的としています。この反省は、「テスト時計算」の一形態であり、推論中に追加の計算リソースが使用されます。
従来のニューラルネットワークは、入力を順方向処理し、単一のパスで出力を生成します。しかし、複雑なタスク、特に構成的なタスクの処理における限界から、内部的な思考プロセスをシミュレートする手法が開発されてきました。思考連鎖を促すなどの手法は、モデルが中間的な推論ステップを生成することを促し、それによってそのようなタスクにおける性能を向上させます。
フィードバックは、ネットワーク全体が通過してトークンにデコードされた後に行われる場合と、潜在空間で継続的に行われる場合がある(最後の層を最初の層にフィードバックすることができる)。[ 1 ] [ 2 ] LLMでは、特別なトークンによって、最終的な応答を生成する前に、反省の開始と終了をマークすることができる(例:<thinking>)。
答えに至るまでの手順を「考える」というこの内部プロセスは、人間のメタ認知、つまり「思考について考える」ことに類似するように設計されています。これは、AIシステムが多段階の推論、計画、論理的思考を必要とするタスクに取り組む際に役立ちます。
思考連鎖推論プロセスの長さを長くするために、モデルの出力を入力に戻し、ネットワークを複数回通過させることで、推論時間のスケーリングが向上します。[ 3 ]強化学習フレームワークも思考連鎖を制御するために使用されています。1つの例は、DeepSeek-R1で使用されているグループ相対ポリシー最適化(GRPO)です。 [ 4 ]これは、生成された出力のグループ内で報酬を正規化することで、個別の「批評家」モデルの必要性を排除し、計算コストを削減するポリシー勾配法の変種です。「予算強制」(モデルに推論ステップの生成を継続させる)などの単純な手法も、パフォーマンスの向上に効果的であることが証明されています。[ 5 ]
初期出力を個別に分析および批評し、多くの場合、モデルにエラーを特定させたり、応答を生成した後に改善点を提案させたりします。Reflexionフレームワークはこのアプローチに従います。[ 6 ]
生成中に応答の前半部分を動的に修正します。自己監視メカニズムにより、モデルは進行に合わせて推論を調整できます。思考ツリーなどの手法はこれをよく表しており、バックトラックや代替探索を可能にします。
外部からの指示だけに頼るのではなく、自己監視をモデルアーキテクチャに直接統合することで、推論の限界や不確実性をモデルが本質的に認識できるようになります。これは、Google DeepMindが強化学習による自己修正 (SCoRe) と呼ばれる手法で使用しており、モデルが応答を改善すると報酬を与えます。[ 7 ]
初期の研究では、従来の強化学習が最終結果のみに報酬を与えるのとは異なり、各推論ステップにフィードバックを提供するPRMが検討されました。しかし、PRMは計算コストや報酬ハッキングなどの課題に直面しました。DeepSeek-R1の開発者は、PRMは有益ではないことを発見しました。[ 8 ] [ 9 ]