均衡選択はゲーム理論の概念であり、ゲームのプレイヤーが特定の均衡を別の均衡よりも選択する理由に対処しようとします。この概念は進化ゲーム理論で特に関連しており、均衡選択のさまざまな方法は、他のプレイヤーの逸脱(および突然変異)に直面しても、1人のプレイヤーがプレイするのにどの均衡が安定して持続するかについてのさまざまなアイデアに対応します。さまざまな均衡概念があり、ナッシュ均衡などの多くの特定の概念では、多くのゲームに複数の均衡があるため、これは重要です。
繰り返しゲームによる均衡選択
ステージ ゲームはn プレイヤーのゲームであり、プレイヤーは有限のアクション セットから選択し、その選択に対する報酬プロファイルがあります。繰り返しゲームは、ステージ ゲームを離散的な期間に何度も繰り返してプレイすることです (Watson、2013)。プレイヤーの評判は、他のプレイヤーのアクションと行動に影響します。言い換えると、プレイヤーが前のラウンドでどのように行動するかによって、次のラウンドでの対戦相手のアクションが決まります。例として、従業員と雇用主のやり取りが挙げられます。従業員は短期的な利益のために責任を回避し、雇用主は従業員の行動を観察した後、ボーナスを中止します (Watson、2013)。繰り返しゲームの均衡選択のダイナミクスは、2 期間のゲームで説明できます。1 つの期間のプレイヤーのすべてのアクションで、そのアクション プロファイルに基づいて新しいサブゲームが開始されます。ゲーム全体のナッシュ均衡を得るには、すべてのゲームのサブゲーム完全均衡が必要です。したがって、繰り返しゲームの最終期間では、プレイヤーはステージ ゲームのナッシュ均衡を選択します。ステージ ゲームでナッシュ均衡戦略ではない均衡条件アクションは、引き続きサポートされます。これは、前の期間に「協力」の評判を確立し、最終期間で対戦相手がより有利なナッシュ均衡戦略を選択するようにすることで実現できます。プレイヤーが協力ではなく逸脱するという評判を築いた場合、対戦相手は繰り返しゲームの最終期間でより不利な均衡を選択してプレイヤーを「罰する」ことができます。
焦点
均衡点を選択するのに役立つもう 1 つの概念は、焦点です。この概念は、ノーベル賞を受賞したゲーム理論家トーマス シェリングが 1960 年に著書「The Strategy of Conflict (紛争の戦略)」で初めて紹介しました (Schelling、1960)。参加者が事前に戦略を話し合う機会のない協調ゲームに参加している場合、焦点は、何らかの形で自然な答えとして際立つ解決策です。
たとえば、1990 年に Mehta ら (1994) が実施した実験では、研究者は参加者に「年を答えてください」または「イギリスの都市を答えてください」という質問を含むアンケートに答えてもらいました。参加者は最初に思い浮かんだ答えを言うように求められ、多くの参加者が誕生年または出身地の都市を答えました。
しかし、参加者にコーディネートのインセンティブが与えられたとき(参加者には、匿名のパートナーと同じように質問に答えることができれば報酬が支払われると伝えられた)、ほとんどの参加者は 1990 年(当時の年)とロンドン(英国最大の都市)を選択しました。これらは最初に思いついた答えではありませんが、事前の話し合いなしにパートナーを見つけようとしながら熟考した結果、最善の選択肢となったものです。この場合、1990 年、つまりロンドン市がこのゲームの焦点であり、プレイヤーがこのコーディネート ゲームで最適な均衡を選択できるように支援します。
さらに、交渉など、ゲームプレイヤーが互いにコミュニケーションをとることができる状況でも、焦点は適切な均衡を選択するのに役立ちます。交渉が終わりに近づくと、各プレイヤーは、どの程度積極的になるべきか、相手をどの程度信頼すべきかについて、土壇場で決定を下す必要があります (Hyde、2017)。
対称性
様々な著者が対称性(プレイヤーや行動に関して)のあるゲーム、特に完全協力型ゲームを研究してきました。例えば、チームゲーム「Hanabi」が検討されましたが、このゲームでは異なるプレイヤーとスート(カード)が対称的です。これに関連して、同型ゲーム間で均衡選択がどのように関係するかを検討した著者もいます。一般的に、プレイヤーのグループはこれらの対称性を恣意的に破る戦略を選択すべきではない、つまり対称均衡を目指すために対称戦略をプレイすべきであると主張されてきました。[1]同様に、同型ゲームも同型的にプレイすべきです。[2]例えば、「Hanabi」では、異なるスートに対応するヒントは類似した(対称的な)意味を持つ必要があります。チームゲームでは、最適な対称戦略も(対称的な)ナッシュ均衡です。[3]対称性を破ると効用が高くなるかもしれませんが、不自然で非人間的な戦略につながります。[1]すべての有限対称ゲーム(チームゲーム以外も含む)には対称ナッシュ均衡が存在する。[4]
均衡選択概念の例
リスクと利益の優位性
定義: ゲームに複数のナッシュ均衡 (NE) がある状況を考えてみましょう。均衡は次の 2 つのカテゴリに分類できます。
- ナッシュ均衡は、最大の吸引域を持つ(つまりリスクが低い)場合、リスク優位であると見なされます。
- ナッシュ均衡は、ゲーム内の他のすべてのナッシュ均衡よりもパレート優れている場合、報酬優位であるとみなされます。
説明:リスク優位の NE は、プレイヤーが大きな損失を回避したい場合に選択され、ペイオフ優位の NE は最適なペイオフ ソリューションとして考慮されます。リスク優位またはペイオフ優位の NE はいずれも、典型的なタイプの NE であることに注意してください。
例:ゲームの正規形のペイオフ マトリックスを例に挙げます。
このゲームには 2 つの NE、つまり (U, L) と (D,R) があります。ここで (U, L) は、最適な全体的なペイオフを返すことができる戦略であるため、ペイオフ優位の NE です。ただし、対戦相手の行動が不確実であることを考えると、プレーヤーの 1 人がより保守的な戦略 (プレーヤー 1 は D、プレーヤー 2 は R) を検討する可能性があります。これにより、「大きな損失」の状況、つまり対戦相手が逸脱したときにペイオフが 0 になる状況を回避できます。したがって、(D, R) はリスク優位の NE です。
1/2 優位
参照
参考文献
- ^ ab Hu、Hengyuan;レラー、アダム。ペイサコビッチ、アレックス。フォースター、ヤコブ (2020)。 」「ゼロショット調整のための『Other-Play』」。第37回国際機械学習会議の議事録。arXiv :2003.02979。
- ^ ジョン・C・ハルサニー;ゼルテン、ラインハルト (1988)。平衡選択の一般理論。 MITプレス。
- ^ エモンズ、スコット; オステルヘルド、カスパル; クリッチ、アンドリュー; コニツァー、ヴィンセント; ラッセル、スチュアート (2022)。「対称チームでの学習では、局所最適解はグローバルナッシュ均衡である」。第39回国際機械学習会議の議事録。pp. 5924–5943。
- ^ ナッシュ、ジョン(1951)。「非協力ゲーム」。数学年報。54 (2): 286–295。doi : 10.2307/1969529。JSTOR 1969529。
- ハーサニ、ジョン C.、セルテン、ラインハルト、『ゲームにおける均衡選択の一般理論』、MIT 出版 (1988)
- Watson, J. (2013) 「反復ゲームと評判」 『戦略:ゲーム理論入門』(第 3 版、pp. 291–305)エッセイ、Norton & Company。
- Hyde, T., 2017. シェリングの焦点は、ハイステークス交渉を理解するのに役立つか? [オンライン] Aeaweb.org。以下から入手可能: <https://www.aeaweb.org/research/can-schellings-focal-points-help-us-understand-high-stakes-negotiations> [2021年12月9日アクセス]。
- Mehta, J., Starmer, C., Sugden, R. (1994). 顕著性の本質: 純粋調整ゲームの実験的研究. アメリカ経済評論, 84(3), 658–673. JSTOR 2118074
- シェリング、TC (1960)。紛争の戦略。マサチューセッツ州ケンブリッジ。
