
機械学習において、人間のフィードバックからの強化学習(RLHF )は、インテリジェントエージェントを人間の好みに合わせるための手法です。これは、好みを表現する報酬モデルをトレーニングし、それを強化学習を通じて他のモデルをトレーニングするために使用するものです。[ 1 ]
古典的な強化学習では、インテリジェントエージェントの目標は、その行動を導く関数(ポリシーと呼ばれる)を学習することです。[ 2 ]この関数は、エージェントのタスクパフォーマンスから得られる報酬信号を増やすために反復的に最適化されます。[ 3 ]しかし、人間の好みを正確に近似する報酬関数を明示的に定義することは困難です。そのため、RLHF は人間のフィードバックから直接「報酬モデル」をトレーニングしようとします。[ 4 ]報酬モデルは、まず教師あり学習によって、人間のアノテーターから収集したランキングデータに基づいて、与えられたプロンプトに対する応答が良い(高報酬)か悪い(低報酬)かを予測するようにトレーニングされます。このモデルは、近接ポリシー最適化などの最適化アルゴリズムを通じてエージェントのポリシーを改善するための報酬関数として機能します。[ 5 ] [ 6 ] [ 7 ]
RLHFは、テキスト要約や対話エージェントなどの自然言語処理タスク、テキストから画像への変換モデルなどのコンピュータビジョンタスク、ビデオゲームボットの開発など、機械学習のさまざまな分野で応用されています。RLHFは、人間の好みに合わせてモデルの動作を改善する効果的な方法ですが、人間の好みデータの収集方法に起因する課題も抱えています。RLHFはパフォーマンスを向上させるために大量のデータを必要としませんが、高品質の好みデータを入手するには依然としてコストがかかります。さらに、データが代表的なサンプルから慎重に収集されていない場合、結果として得られるモデルに望ましくないバイアスが生じる可能性があります。
人間のフィードバックに基づいてモデルを最適化することは、タスクの特定が難しいが判断は容易な場合に望ましい。[ 8 ]例えば、有益かつ無害な安全なテキスト(偏見、毒性、その他の有害なコンテンツがないなど)を生成するようにモデルを訓練したい場合がある。人間に無害なテキストと有害なテキストの例を手動で作成してもらうのは難しく、時間もかかる。しかし、人間はさまざまなAI生成テキストの有害性を迅速に評価および比較することに長けている。したがって、より現実的な目標は、モデルがこの種の人間のフィードバックを使用してテキスト生成を改善できるようにすることである。[ 9 ]
トレーニングモデルに人間のフィードバックを組み込むことの明らかな利点にもかかわらず、強化学習(RL) を活用するものを含め、これまでの取り組みは大きな課題に直面してきました。ほとんどの試みは、より複雑なタスクで破綻するほど狭く汎化が困難であったか、[ 10 ] [ 11 ] [ 12 ] [ 13 ]あるいは、疎な (特定の情報が不足しており、一度に大量のテキストに関連する) またはノイズの多い (類似の出力に対して一貫性のない報酬を与える) 報酬関数からの学習に困難を抱えていました。[ 14 ] [ 15 ]
RLHF は、強化学習に人間のフィードバックを使用する最初の成功した方法ではありませんが、最も広く使用されている方法の 1 つです。RLHF の基礎は、実用的な量の人間のフィードバックから学習するための汎用アルゴリズムを作成しようとする試みとして導入されました。[ 8 ] [ 5 ]現在使用されているアルゴリズムは、人間のフィードバックに基づいてテキストの継続または要約を強化するというOpenAIの論文で紹介され、 InstructGPTに関する論文で同じ方法が再利用されたときに人気が出始めました。[ 4 ] [ 16 ] [ 17 ] RLHF は、RL エージェントの堅牢性と探索能力を向上させることも示されており、その結果、不確実性を処理し、最高の報酬を求めて環境を効率的に探索する最適化プロセスが実現します。[ 18 ]
人間からのフィードバックは、エージェントの行動の事例を人間にランク付けさせることで収集されるのが一般的です。[ 17 ] [ 19 ] [ 20 ]これらのランキングは、例えば、各ゲームの結果のみに基づいてゲーム内のプレイヤーの相対的なスキルレベルを計算するアルゴリズムであるEloレーティングシステムを使用して、出力をスコアリングするために使用できます。 [ 5 ]出力のランキングは最も広く採用されているフィードバックの形式ですが、最近の研究では、数値フィードバック、自然言語フィードバック、モデルの出力への直接編集を促すなど、他の形式が検討されています。[ 21 ]
RLHF の当初の動機の一つは、効果を発揮するために必要な比較データが比較的少量で済むことでした。[ 8 ]少量のデータでも、大量のデータと同等の結果が得られることが示されています。さらに、データ量を増やすよりも、報酬モデルのサイズを比例的に増やす方が効果的です。[ 16 ]それにもかかわらず、部分的に代表的なアノテーターのグループによるバイアスを避けることが重要なタスクでは、より大規模で多様なデータが不可欠となる場合があります。 [ 17 ]
ブラッドリー・テリー・ルースモデル (または2 つ以上の比較に対する K 個の比較の場合のプラケット・ルースモデル)によるペアワイズ比較を通じて人間のフィードバックから学習する場合、比較データが適切に指定された線形モデルの下で生成されると、線形報酬関数の最尤推定量(MLE) が収束することが示されています。これは、特定の条件下で、モデルが選択肢のペア (またはグループ) 間で人々がどの選択肢を好むかを決定するように訓練されている場合、将来の好みを予測する能力が必然的に向上することを意味します。この改善は、学習元の比較が一貫性のある単純なルールに基づいている限り期待されます。[ 22 ] [ 23 ]
静的データセットとの相互作用によってモデルが学習し、ポリシーをバッチで更新するオフラインデータ収集モデルと、モデルが動的な環境と直接相互作用し、ポリシーを即座に更新するオンラインデータ収集モデルの両方について、さまざまなフィードバックモデルの下でのRLHFのサンプル複雑性の限界を証明する数学的研究が行われています。[ 22 ] [ 24 ]
オフラインデータ収集モデルでは、目的がポリシー学習である場合、報酬推定値として信頼区間の下限を組み込んだ悲観的MLEが最も効果的です。さらに、適用可能な場合、K 個の比較を直接考慮することは、予測目的でペアワイズ比較に変換するよりも漸近的に効率的であることが示されています。[ 24 ] [ 25 ] [ 17 ]
オンラインシナリオでは、ブラッドリー・テリー・ルースモデルの下でペアワイズ比較によって人間のフィードバックが収集され、目的がアルゴリズムの後悔(最適なエージェントと比較したパフォーマンスの差)を最小化することである場合、報酬推定値として上限信頼区間を組み込んだ楽観的な最尤推定値を使用して、サンプル効率の高いアルゴリズム(つまり、比較的少ないトレーニングデータしか必要としないアルゴリズム)を設計できることが示されています。ペアワイズ(またはデュエル)比較から学習する際のRLHFにおける重要な課題は、その最適ポリシーの非マルコフ性に関連しています。最適な戦略が過去の行動の記憶を必要としない単純なシナリオとは異なり、RLHFでは、最善の行動方針はしばしば過去のイベントと決定に依存するため、戦略は本質的に記憶に依存します。[ 23 ]
RLHF は、会話エージェント、テキスト要約、自然言語理解など、自然言語処理(NLP)のさまざまな領域に適用されています。 [ 26 ] [ 16 ]エージェントが事前に定義された「報酬関数」に基づいて行動から学習する通常の強化学習は、特に人間の価値観や好みが関係する複雑なタスクを扱う場合、報酬の定義や測定が困難になる傾向があるため、NLP タスクに適用するのは困難です。[ 8 ] RLHF は、報酬モデルに人間の好みを事前に取り込むことで、特に言語モデルなどの NLP モデルを、そのようなタスクに関する人間の好みに一致する回答を提供するように誘導できます。これにより、より関連性の高い応答を生成し、不適切または無関係なクエリを拒否できるモデルが実現します。[ 17 ] [ 27 ] RLHFで学習した言語モデルの注目すべき例としては、OpenAIのChatGPT(およびその前身であるInstructGPT)、[ 19 ] [ 28 ] [ 29 ] DeepMindのSparrow、[ 30 ] [ 31 ] [ 32 ] GoogleのGemini、[ 33 ] AnthropicのClaude [ 34 ]などがある。
コンピュータビジョンでは、RLHF はテキストから画像へのモデルのアライメントにも使用されています。この目的で RLHF をうまく使用した研究では、学習されたポリシーがアライメントされていないモデルから大きく逸脱するのを防ぐことを目的とした RLHF でのKL 正則化の使用が、報酬モデルへの過学習を減らすことでトレーニング プロセスを安定させるのに役立ったと指摘されています。KL 正則化を使用してトレーニングされたモデルからの最終的な画像出力は、使用せずにトレーニングされたものよりも大幅に高品質であることが指摘されています。[ 35 ] [ 36 ]他の方法では、強化学習を使用せずに報酬を最大化することに基づく、より直接的なトレーニングを通じてフィードバックを組み込もうとしましたが、RLHF で更新中に使用されるオンライン サンプル生成と、報酬関数への過学習を軽減する前述の KL 正則化が以前のモデルに対して行われるため、RLHF ベースのアプローチの方がパフォーマンスが優れている可能性が高いことを認めています。 [ 37 ]
RLHFは当初、ビデオゲームボットの開発やシミュレーションロボットのタスクなど、他の分野にも応用されました。たとえば、OpenAIとDeepMindは、人間の好みに基づいてAtariゲームをプレイするエージェントをトレーニングしました。このようなボットの古典的なRLベースのトレーニングでは、報酬関数は、通常ゲーム内スコアなどの指標を使用して、エージェントがゲームでどれだけうまく機能しているかに単純に相関しています。これに対し、RLHFでは、人間はゲーム内でのエージェントの動作の2つのクリップを定期的に提示され、どちらが見栄えが良いかを判断しなければなりません。このアプローチにより、エージェントはスコアにアクセスすることなく、競争力のあるレベルでパフォーマンスするように学習できます。実際、人間の好みはパフォーマンスベースの指標よりも有用な情報を含むことができるため、RLHFはスコア指標を使用したRLよりも優れたパフォーマンスにつながる場合があることが示されています。[ 8 ] [ 38 ]エージェントは、テストされた多くの環境で強力なパフォーマンスを達成し、多くの場合、人間のパフォーマンスを上回りました。[ 39 ]
RLHFでは、報酬モデルと強化学習ポリシーという2つの異なるモデルが学習されます。報酬モデルは、人間のフィードバックに基づいて望ましい行動を判断するように学習し、ポリシーは報酬モデルによってエージェントの行動を決定します。どちらのモデルも、通常、事前学習済みの自己回帰言語モデルを使用して初期化されます。このモデルは、人間のアノテーターによって作成された、アシスタントへのプロンプトとその応答のペアからなる比較的小規模なデータセットを用いて、教師あり学習によって学習されます。
報酬モデルは、文字列(テキストの一部)を入力として受け取り、「報酬」となる単一の数値を生成する関数です。 [ 40 ]
通常は事前学習済みモデルで初期化されます。これは、言語の理解で初期化され、人間の好みの学習に特化してトレーニングが行われるためです。報酬モデルとRLポリシーの初期化に使用されることに加えて、このモデルはアノテーターが比較するデータのサンプリングにも使用されます。[ 17 ] [ 16 ]
次に、報酬モデルは、前のモデルの最終層をランダムに初期化された回帰ヘッドに置き換えることで学習されます。この変更により、モデルは元の語彙分類タスクから、任意のプロンプトとレスポンスのスコアに対応する数値を出力するだけのタスクへと移行します。このモデルは、教師ありモデルから以前に収集された人間の嗜好比較データに基づいて学習されます。具体的には、次の交差エントロピー損失関数を最小化するように学習されます。
どこは、ラベル付け担当者がランク付けした回答の数です。プロンプトに対する報酬モデルの出力は完成、より好ましい完了、はシグモイド関数を表し、は期待値を表します。[ 17 ]これはロジスティック回帰の一種と考えることができ、モデルは応答の確率を予測します。より好ましい。
この損失関数は、基本的に報酬モデルの予測と人間の決定との差を測定します。目標は、この式で測定される差を最小化することにより、モデルの推測を人間の好みにできるだけ近づけることです。ペアワイズ比較のみの場合、係数[ 16 ]一般的に、すべて各プロンプトからの比較は、単一のバッチとしてトレーニングに使用されます。[ 17 ]
トレーニング後、モデルの出力は、参照完了の平均スコアが 0 になるように正規化されます。つまり、[ 16 ] 各クエリと参照のペアについてトレーニングデータセット全体の平均報酬を計算し、それを報酬ヘッドのバイアスとして設定することによって行います。
ポリシーモデルは、文字列を入力として受け取り、別の文字列を生成する関数です。通常、言語モデリングでは、出力文字列は1回の順伝播ではなく、自己回帰的に生成される複数の順伝播によって生成されます。報酬モデルと同様に、人間のフィードバックポリシーも事前学習済みモデルから初期化されます。[ 16 ]
重要なのは、言語生成を強化学習によって学習されるゲームのように理解することです。強化学習では、ポリシーはゲームの状態をゲームの動作にマッピングする関数です。RLHFでは、「ゲーム」はプロンプトに応答するゲームです。プロンプトと以前に生成されたすべてのトークンがゲームの状態であり、新しいトークンを生成することがゲームの動作です。[ 41 ]
トレーニングの最初のステップは、教師ありファインチューニング(SFT)です。このステップでは報酬モデルは必要ありません。代わりに、事前学習済みモデルをデータセットでトレーニングします。プロンプトとレスポンスのペアを含むそして、SFTの過程で、モデルは対応する応答を自己回帰的に生成するように訓練される。ランダムなプロンプトが与えられたとき元の論文では、SFTは1エポックのみ行うことを推奨しています。それ以上行うと過学習を引き起こすためです。
データセット通常は、プロンプトと回答の両方を作成する人間の請負業者によって作成されます。
2番目のステップでは、報酬モデルに方策勾配法を使用します。データセットを使用します。これはプロンプトを含みますが、応答は含みません。ほとんどのポリシー勾配法と同様に、このアルゴリズムは外側のループと2つの内側のループを持ちます。
ご了承くださいと同等つまり、「次に、ポリシーから応答をサンプリングします。
目的関数は2つの部分から構成される。最初の部分は単純に期待報酬である。は、あらゆる強化学習アルゴリズムの標準です。2番目の部分は、KLダイバージェンスを含む「ペナルティ項」です。ペナルティ項の強さは、ハイパーパラメータによって決定されます。。
このKL項は、微調整中のモデルと初期の教師ありモデルとの間のKLダイバージェンス(分布間の統計的距離の尺度)にペナルティを与えることで機能します。適切なトレーニングでは、新しいデータからの学習と初期モデルからの有用な情報の保持のバランスを取ることができ、新しいデータに過度に適合することを避けることで汎化性能を高めることができます。新しいモデルが初期モデルと大きく異なる出力を生成するのを防ぐことに加えて、KL 項を含めるもう 1 つの動機は、モデルが少数の定型応答に崩壊するのを防ぐために、モデルが高エントロピーのテキストを出力するように促すことです。[ 16 ]
簡単に言うと、目的関数は、ポリシーの応答が人間のフィードバックとどの程度一致するかを計算します。ポリシーはプロンプトに対して応答を生成し、各応答は、人間の好み(報酬モデルで測定)との一致度と、モデルが自然に生成する応答との類似性の両方に基づいて評価されます。目標は、人間の好みとの一致度を高めることと、モデルの応答が多様性を保ち、初期トレーニングで学習した内容から大きく逸脱しないようにすることのバランスを取ることです。これにより、モデルは人々が有用または好ましいと感じる回答を提供するだけでなく、幅広い理解を維持し、過度に狭く反復的な応答を避けることができます。
ポリシー関数は通常、近接ポリシー最適化(PPO)アルゴリズムによって学習されます。つまり、パラメータクリップされた代理関数に対して勾配上昇法によって学習される。[ 17 ] [ 16 ]
従来、PPOアルゴリズムは一般化優位性推定を採用しており、これは追加の価値推定器が存在することを意味する。ポリシーと同時に更新されるPPO研修中:[ 42 ]値推定器はトレーニング中にのみ使用され、トレーニング外では使用されません。
PPOは、以下の切り詰められた代理変数の優位性に対して勾配降下法を使用します。
利点の項は次のように定義される。つまり、アドバンテージは報酬(期待収益)と価値推定値(ポリシーからの期待収益)の差として計算されます。これは、通常、 Adamオプティマイザのような標準的なモーメンタム勾配オプティマイザを使用して、勾配上昇法によってポリシーを学習するために使用されます。
元の論文では、学習済みの報酬モデルから価値推定器を初期化しました。[ 16 ] PPOはアクタークリティックアルゴリズムであるため、価値推定器はポリシーと同時に更新され、この場合、二乗TD誤差(これは二乗アドバンテージ項に等しい)を最小化します。これは、勾配降下法によって最小化されます。二乗TD誤差以外の方法も使用できます。詳細は、アクタークリティックアルゴリズムのページを参照してください。
目的関数に第3項を追加するのは、モデルが壊滅的な忘却を起こすのを防ぐためです。たとえば、モデルが顧客サービスのみを学習している場合、地理に関する一般的な知識を忘れてしまう可能性があります。これを防ぐために、RLHFプロセスでは元の言語モデリングの目的関数を組み込みます。つまり、いくつかのランダムなテキスト元の事前学習データセットからサンプリングされています、そしてモデルはテキストの対数尤度を最大化するように訓練されます。最終的な目的関数は次のように表されます。
どここの事前学習項の強度を制御します。[ 17 ]この結合目的関数は PPO-ptx と呼ばれ、「ptx」は「事前学習勾配の混合」を意味します。[ 9 ]これは InstructGPT 論文で初めて使用されました。[ 17 ]
総じて、この目的関数は、人間のフィードバックに合わせるという目標と、モデル本来の言語理解を維持するという目標を融合させ、強化学習のポリシーを調整する方法を定義するものである。
したがって、PPO-ptxの目的関数を完全に明示的に書き出すと次のようになります。
これは勾配上昇法 によって最適化される。
RLHF は、人間のフィードバックの収集、報酬モデルの学習、ポリシーの最適化に課題を抱えています。[ 43 ]教師なし学習や自己教師あり学習などの手法のデータ収集と比較すると、RLHF のデータ収集は拡張性が低く、コストも高くなります。その品質と一貫性は、タスク、インターフェース、個々の人間の好みやバイアスによって異なる場合があります。[ 17 ] [ 44 ]
RLHF の有効性は、人間のフィードバックの質に依存します。たとえば、フィードバックに公平性がなく、一貫性がなく、または不正確な場合、モデルは偏り、特定のグループを他のグループよりも優遇する可能性があります。 [ 5 ] [ 45 ]過学習のリスクがあり、モデルは一般化を学習する代わりに、特定のフィードバックの例を記憶します。たとえば、特定の人口統計からのフィードバックが大部分を占めると、モデルは意図したアライメントとともに、特異性やノイズを学習する可能性があります。受け取った特定のフィードバック (つまり、その中のバイアス) に過度にアライメントすると、モデルは新しいコンテキストで、または異なるグループによって使用される場合に最適ではないパフォーマンスを発揮する可能性があります。[ 46 ]単一の報酬関数は、常に多様なグループの人々の意見を表現できるとは限りません。代表的なサンプルであっても、相反する見解や好みにより、報酬モデルが多数派の意見を優遇し、過小評価されているグループに不利益をもたらす可能性があります。[ 43 ]
通常の強化学習で起こりうるように、場合によっては、モデルがフィードバックプロセスを操作したり、システムを悪用して、真にパフォーマンスを向上させるのではなく、より高い報酬を得ることを学習するリスクがある可能性があります。 [ 47 ] RLHFの場合、モデルは、実際に良いことではなく、肯定的に評価されたものに対して報酬が与えられるという事実を利用することを学習する可能性があり、その結果、説得や操作を学習する可能性があります。たとえば、モデルは、たとえ不正確であっても、見かけ上の自信がより高い報酬をもたらすことを学習する可能性があります。このような行動は、チェックされないと、奨励されるだけでなく、モデルが誤解を招く可能性があるため、重大な展開上の問題を引き起こす可能性があります。研究によると、人間は複雑なタスクにおけるLLM出力の間違いを特定するのに熟練していないことがわかりました。したがって、自信があるように聞こえるが間違ったテキストを生成することを学習したモデルは、展開時に重大な問題を引き起こす可能性があります。[ 43 ]
RLHFと同様に、AIフィードバックからの強化学習(RLAIF)は選好モデルのトレーニングに依存しますが、フィードバックは自動的に生成されます。[ 48 ]これは特にAnthropicの憲法AIで使用されており、AIフィードバックは憲法の原則への適合に基づいています。[ 49 ]
直接アライメントアルゴリズム(DAA)は、従来のポリシー勾配法ではなく、教師あり学習で人間のフィードバックデータに基づいて大規模言語モデル(LLM)を直接最適化しようとする新しいクラスのアルゴリズムとして提案されています[ 50 ] [ 51 ]。
これらのアルゴリズムは、別途報酬モデルを学習するという中間ステップを排除することで、モデルを人間の意図により透明性の高い形で整合させることを目指しています。人間の嗜好を最初に予測し、その予測に基づいて最適化するのではなく、直接整合手法では、人間がラベル付けまたはキュレーションした出力データに基づいて、モデルをエンドツーエンドで学習させます。これにより、代理目標や報酬ハッキングによって生じる可能性のある不整合リスクを低減できます。
これらのアプローチは、人間が好む行動を直接最適化することで、RLHFと比較して、人間の価値観とのより緊密な一致、解釈性の向上、およびよりシンプルなトレーニングパイプラインを実現することが多い。
直接選好最適化(DPO)は、人間の選好を学習する手法です。RLHFと同様に、人間が生成した選好データを用いて、事前学習済みの大規模言語モデルを整合させるために適用されてきました。しかし、RLHFはまず別の中間モデルを学習させて、どのような結果が良いかを理解し、次にメインモデルにその結果を達成する方法を教えるのに対し、DPOは人々の選好に応じてメインモデルを直接調整することでプロセスを簡素化します。DPOは変数変換を用いて「選好損失」をポリシーの関数として直接定義し、この損失を用いてモデルを微調整することで、別のステップを必要とせずに人間の選好を理解し、優先順位付けできるようにします。つまり、このアプローチは、人間の肯定的または否定的なフィードバックに基づいて、モデルの意思決定を直接的に形成します。
RLHFのパイプラインは以下のとおりです。
しかし、DPOは報酬モデルの中間段階を実行する代わりに、最終的なポリシーを直接最適化します。
まず、統計力学で通常行われるように、ラグランジュ乗数法を用いて最適な方策を直接解く。
どこは分割関数です。残念ながら、これはすべての可能な応答について合計する必要があるため、扱いが困難です。
次に、この関係を逆転させて、報酬を最適方策の観点から暗黙的に表現します。
最後に、これを最尤推定量に代入すると、[ 52 ] :付録Aが得られます。
通常、DPOはペアワイズ比較における人間の好みをモデル化するために使用されるため、その場合、
DPOは、アライメントを嗜好データに対する教師あり学習問題として扱うことで、個別の報酬モデルや強化学習ループの必要性を排除します。これはRLHFよりも実装とトレーニングが容易であり、同等、場合によってはそれ以上の結果を生み出すことが示されています。[ 52 ]それにもかかわらず、RLHFは、たとえば真実性を測定しようとするベンチマークなど、一部のデータセットでDPOを上回ることも示されています。したがって、方法の選択は、人間の嗜好データの特徴とタスクの性質によって異なる場合があります。[ 53 ]
アイデンティティ選好最適化(IPO)[ 54 ]は、元のDPO目的関数を修正したもので、選好データにノイズが含まれている場合でも過学習の可能性を減らすために正則化項を導入しています。
この目的を達成するために、IPOは二次損失関数を最小化する。どこ。
IPOは、常に解を基準モデルに正則化することで、ポリシーモデルと基準モデルの対数尤度比の間のギャップを制御できます。報酬モデリング段階を経ずに、またペアワイズ選好をポイントワイズ報酬に置き換えることができると仮定するブラッドリー・テリー・モデリングの仮定に頼ることなく、選好から直接学習することができます。[ 54 ]
カーネマン・トベルスキー最適化(KTO)[ 55 ]は、人間の意思決定における不確実性をモデル化するためにプロスペクト理論から着想を得た、もう1つの直接アライメントアルゴリズムです。DPOとは異なり、KTOは明示的な選好ペアではなく、バイナリフィードバック信号(望ましいか望ましくないか)のみを必要とします。
値関数は、望ましい()または望ましくない():
ここ、価値関数がどれだけ「リスク回避的」であるかを制御します(大きいほど= ロジスティック関数の飽和が速い)そしては、カルバック・ライブラー情報量によって与えられる基準値です。多くの現実世界のフィードバックパイプラインでは、ペアワイズ比較よりも「好き/嫌い」データの方が容易に得られるため、KTOはデータ効率が高く、事例レベルで「良いか悪いか」という単純な概念を用いることで「損失回避」をより直接的に反映するように設計されています。