ゲーム理論において、旅行者のジレンマ(略してTDとも呼ばれる)は、各プレイヤーが利得を提示する非ゼロサムゲームである。2つの提案のうち低い方が勝ちとなり、低い提案をしたプレイヤーは低い利得に加えて少額のボーナスを受け取り、高い提案をしたプレイヤーは低い提案と同じ利得から少額のペナルティを差し引いたものを受け取る。驚くべきことに、ナッシュ均衡は両プレイヤーが積極的に低い提案をすることである。旅行者のジレンマの特徴は、ナイーブなプレイがナッシュ均衡を上回るように見える点にある。この一見矛盾する現象は、ムカデゲームや有限回反復囚人のジレンマにも見られる。
オリジナルのゲームシナリオは1994年にカウシク・バスによって考案され、以下の通りです。[ 1 ] [ 2 ]
ある航空会社が、2人の異なる旅行者のスーツケース2個を紛失した。2つのスーツケースは偶然にも同じもので、中身も同じ骨董品だった。両旅行者の賠償請求を処理する任務を負った航空会社のマネージャーは、航空会社がスーツケース1個につき最大100ドルまでしか賠償責任を負わないと説明した。骨董品の価格を直接調べることはできないとのことだった。
「骨董品の適正な評価額を決定するため、支配人は旅行者2人を別々にし、相談できないようにした上で、それぞれに2ドル以上100ドル以下の金額を記入するよう求めました。また、両者が同じ金額を記入した場合、その金額を両スーツケースの実際の価値として、両旅行者にその金額を払い戻すと伝えました。しかし、どちらか一方が他方よりも低い金額を記入した場合、その低い金額を実際の価値として、両旅行者はその金額に加えて、ボーナスまたはペナルティを受け取ります。低い金額を記入した旅行者には2ドルが追加で支払われ、高い金額を記入した旅行者からは2ドルが差し引かれます。課題は、両旅行者が記入する金額を決定するために、どのような戦略をとるべきかということです。」
両プレイヤーは、相手のプレイヤーの利益を一切考慮せず、自身の利益を最大化しようとする。
旅行者にとって最適な選択は100ドル、つまり旅行者が航空会社のマネージャーが定める最高価格で骨董品を評価することだと考える人もいるだろう。しかし驚くべきことに、そして多くの人にとって直感に反するかもしれないが、ナッシュ均衡解は実際にはわずか2ドル、つまり旅行者が航空会社のマネージャーが定める最低価格で骨董品を評価することになる。
2ドルがナッシュ均衡である理由を理解するために、以下の証明を検討してください。
別の証明は以下のとおりです。
この場合の($2, $2)の結果は、ゲームのナッシュ均衡です。定義上、これは相手がこのナッシュ均衡値を選択した場合、最良の選択はナッシュ均衡値である$2であることを意味します。相手が$2より高い値を選択する可能性がある場合は、これが最適な選択ではありません。 [ 3 ]実験的にゲームをプレイすると、ほとんどの参加者はナッシュ均衡よりも高く、$100(パレート最適解に対応)に近い値を選択します。より正確には、ナッシュ均衡戦略解は、ボーナス/ペナルティが小さい旅行者のジレンマにおける人々の行動の予測としては不適切であり、ボーナス/ペナルティパラメータが大きい場合はかなり適切な予測であることが証明されました。[ 4 ]
さらに、旅行者はゲーム内でナッシュ均衡から大きく逸脱することで報酬を得ており、純粋に合理的な戦略で得られる報酬よりもはるかに高い報酬を得ています。これらの実験(および焦点などの他の実験)は、大多数の人々が純粋に合理的な戦略を使用していないことを示していますが、彼らが使用する戦略は明らかに最適です。このパラドックスは、純粋なゲーム理論分析の価値を低下させる可能性がありますが、少なくとも「合理的」にプレイしないと予想されるプレイヤーがいるゲームの文脈では、非合理的な選択をすることが非常に合理的であることを理解するための拡張された推論の利点を示す可能性もあります。たとえば、カプラロは、人間は事前に単独のエージェントとして行動するのではなく、連合を形成した場合のゲームのプレイ方法を予測し、その予測を最大化するように行動するというモデルを提案しました。彼のモデルは、旅行者のジレンマや類似のゲームに関する実験データに非常によく適合しています。[ 5 ]最近、旅行者のジレンマは、個人ではなくグループで意思決定を行うことで検証され、グループでの意思決定の方がより合理的であるという仮説を検証し、通常は二人の知恵が一人より優れているというメッセージを伝えている。[ 6 ]実験結果によると、グループは常に合理的であり、つまり、その主張はナッシュ均衡に近く、ボーナス/ペナルティの大きさに敏感である。[ 7 ]
一部のプレイヤーはベイズ的ナッシュ均衡を追求しているように見える。[ 8 ] [ 9 ]
旅行者のジレンマは、有限回繰り返される囚人のジレンマとして定式化できる。[ 8 ] [ 9 ]同様のパラドックスは、ムカデゲームやp-美人コンテストゲーム[ 7 ](より具体的には、「平均の2/3を推測する」)にも見られる。旅行者のジレンマの変形の一つで、両方の旅行者に2ドルまたは3ドルの2つの整数選択肢のみが提示されるものは、数学的には標準的な非反復囚人のジレンマと同一であり、したがって旅行者のジレンマは囚人のジレンマの拡張と見なすことができる。(最低保証支払額は1ドルであり、それ以上の1ドルは3年の懲役刑から1年減刑されることに相当すると考えられる。)これらのゲームは、ナッシュ均衡を示すために支配される戦略の深い反復削除を伴う傾向があり、古典的なゲーム理論の予測から大きく逸脱する実験結果につながる傾向がある。
(整数入力のみを考慮した場合の)標準的な利得行列は以下のとおりです。
と表記するプレイヤーとプレイヤーの両方が利用できる戦略のセット そのうちの1つの利得関数は次のように書ける
(他のプレイヤーが受け取ることに注意してください)ゲームは量的に対称であるため)。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)