ゲーム理論 において、ベイジアンゲームは 、プレイヤーが不完全な情報を持っていることを前提とした戦略的意思決定モデルです。プレイヤーはゲームに関連する私的情報を持っている可能性があり、つまり、利得は共通の知識 ではありません。[ 1 ] ベイジアンゲームは、ベイジアン確率 の側面を使用してプレイヤーの相互作用の結果をモデル化します。ゲーム理論において初めて不完全な情報 を持つゲームの解を特定できたため、注目に値します。
ハンガリーの経済学者ジョン・C・ハルサニは 、1967年と1968年の3つの論文でベイジアンゲームの概念を導入しました。[ 2 ] [ 3 ] [ 4 ] 彼は、これらの貢献とゲーム理論へのその他の貢献により、1994年にノーベル経済学賞 を受賞しました。大まかに言うと、ハルサニはベイジアンゲームを次のように定義しました。プレイヤーは、ゲームの開始時に自然によって一連の特性を割り当てられます。これらの特性に確率分布を マッピングし、ベイジアン確率を使用してゲームの結果を計算することにより、技術的な理由 から、非ベイジアンコンテキストでの同様のゲームよりも、解を計算するのがはるかに簡単なゲームが得られます。
要素 ベイズゲームは次のように定義される。( N 、 A 、 T 、 u 、 p ) {\displaystyle (N\!,A,T,u,p)} 、それは以下の要素から構成される:[ 5 ]
プレイヤーの集合、N ゲーム内のプレイヤーの集合 アクションセット、 i プレイヤーi が実行可能なアクションの集合。アクションプロファイルa = ( a 1 , . . . , a N ) は、各プレイヤーごとに 1 つのアクションのリストです。型セット、t i プレイヤーi のタイプセット。「タイプ」は、プレイヤーが持つことができるプライベート情報を捉えます。タイププロファイルt = ( t1 , ..., tN ) は、各プレイヤーに対応するタイプのリストです。 利得関数、u プレイヤーのタイプと行動プロファイルに基づいて、プレイヤーに利得を割り当てる。利得関数u = ( u 1 , . . . , u N ) は、プレイヤーi の効用を表す。 以前、p すべての可能なタイププロファイルに対する確率分布。ここで、p ( t ) = p ( t 1 , . . . , t N ) は、プレイヤー 1 がタイプt 1 を持ち、プレイヤーN がタイプt N を持つ確率です。
純粋戦略 戦略ゲームにおいて、純粋戦略 とは、プレイヤーが意思決定をしなければならない各局面でのプレイヤーの行動選択のことである。[ 6 ]
3つの段階 ベイズゲームには3つの段階があり、それぞれがゲーム内のプレイヤーのタイプに関する知識を表しています。
事前段階のゲーム。 プレイヤーは自分のタイプや他のプレイヤーのタイプを知らない。プレイヤーは、考えられるすべてのタイプの事前分布に基づいて、期待値として報酬を認識する。中間段階のゲーム。 プレイヤーは自分のタイプは知っているが、他のプレイヤーのタイプは確率分布しか知らない。報酬を検討する際、プレイヤーは他のプレイヤーのタイプに基づく期待値を分析する。事後段階のゲーム。 プレイヤーは自分のタイプと他のプレイヤーのタイプを知っている。報酬はプレイヤーに知られている。[ 7 ]
非ベイズゲームに対する改善点 ベイズゲームには、ハルサニーによって具体的に示された重要な新しい側面が 2 つあります。[ 8 ] 1 つ目は、ベイズゲームは完全情報ゲームと全く同じように考え、構造化されるべきであるということです。しかし、ゲームに確率を付与することで、最終的なゲームは不完全情報ゲームとして機能します。したがって、プレイヤーは本質的に不完全な情報を持っているとモデル化でき、ゲームの確率空間は依然として全確率の法則に従います。ベイズゲームは、 繰り返しゲーム における戦略的思考に典型的な無限逐次計算を必要としないためにも有用です。無限逐次計算は、プレイヤーが「互いの考えを読み取ろう」とするときに発生します。たとえば、質問をして、「プレイヤー B から何らかの行動を期待するなら、プレイヤー B は私がその行動を期待すると予測するだろうから、私はその予測を予測すべきだ」と無限に 決定する可能性があります。ベイズゲームでは、異なる結果に同時に異なる確率重みを割り当てることで、これらの結果を 1 手で計算できます。この結果、ベイジアンゲームでは、非ベイジアン設定では計算が非合理的と なるような多くのゲームをモデル化することが可能になる。
塗りつぶされていない円は通常、自然のノードを表します。その戦略は常に明確に定義され、完全に混合されています。自然は一般的にツリーの根元に位置しますが、他のポイントに移動することもできます。
プレイヤーi の情報集合とは、プレイヤーiが 区別できない決定ノードのサブセットのことである。プレイヤーi が情報集合内のいずれかの決定ノードにいる場合、プレイヤーiは自分が情報集合内のどのノードにいるのかを知らない。
2 つの決定ノードが同じ情報セット に含まれるためには、それらは[ 13 ]
同じプレイヤーに属する。 同じ一連のアクションを実行する 情報集合は点線で表され、これは今日最も一般的な表記法である。
信念の役割 ベイズゲームでは、プレイヤーのゲームに関する信念は、様々な種類の確率分布によって表される。
プレイヤーがプライベート情報を持たない場合、タイプに関する確率分布は共通事前分布 として知られています。[ 1 ]
ベイズの定理展開形ゲームの評価はペア⟨ b, μ ⟩である
行動戦略 プロファイル、および信念体系 評価⟨b , μ⟩ は、 h i がb − i に従って厳密に正の確率 で到達する場合に[ 14 ] μ ( x | h i ) = Pr [ x はb − iが与えられたときに到達する] / Σ Pr [ x ′ はb − i が与えられたときに到達する]であれば、ベイズの 規則 を 満たす 。
完全なベイズ均衡 展開型ゲームにおける完全なベイズ均衡 とは、以下の2つの条件を満たす戦略と信念の仕様の組み合わせである。[ 15 ]
ベイズ的一貫性:信念は検討中の戦略と整合している。 逐次合理性:プレイヤーは自身の信念に基づいて最適な選択を行う。 ベイズ的ナッシュ均衡は、プレイヤーが同時ではなく順次行動する動的ゲームにおいて、非現実的な均衡をもたらす可能性がある。完全情報ゲームと同様に、これは均衡経路から外れた非現実的な 戦略によって生じる可能性がある。不完全情報ゲームにおいても、非現実的な信念が生じる可能性がある。
これらの問題に対処するため、部分ゲーム完全均衡 によれば、完全ベイズ均衡では、あらゆる情報集合から開始しても、その後のプレイが最適であることが要求される。また、正の確率で発生するすべてのプレイ経路において、信念がベイズの定理に従って一貫して更新されることも要求される。
ベイジアンゲームとベイジアン均衡の定義は、集団的行為 を扱うように拡張されている。 1 つのアプローチは、個々のプレイヤーを孤立して推論するものとして扱い続けるが、ある程度の確率で集団の視点から推論することを許容することである。[ 23 ] もう 1 つのアプローチは、集団的エージェント内のプレイヤーはエージェントの存在を知っているが、他のプレイヤーはそれを知らないが、ある程度の確率で疑っていると仮定することである。[ 24 ] 例えば、アリスとボブは、自然の状態に応じて、個人として最適化することもあれば、チームとして共謀することもあるが、他のプレイヤーはどちらであるかを知らないかもしれない。
例
保安官のジレンマ保安官は武装した容疑者と対峙する。両者は同時に、相手を撃つか否かを決断しなければならない。
容疑者は「犯罪者」または「一般人」のいずれかのタイプである。保安官は1つのタイプしか知らない。容疑者は自分のタイプと保安官のタイプを知っているが、保安官は容疑者のタイプを知らない。したがって、不完全な情報 が存在する(容疑者が私的情報を持っているため)ため、ベイジアンゲームとなる。容疑者が犯罪者である確率はp 、一般人である確率は1-pである。両プレイヤーはこの確率を認識している(共通の事前確率の仮定であり、 不完全な情報 を持つ完全情報ゲームに変換できる)。
保安官は、容疑者が発砲した場合は自衛のために発砲し、容疑者が発砲しない場合は発砲しない(容疑者が犯罪者であっても)。容疑者は、自分が犯罪者であれば保安官が発砲しなくても発砲するが、自分が一般市民であれば保安官が発砲しても発砲しない。したがって、この標準形ゲーム における両プレイヤーの利得行列は、容疑者の種類によって異なる。このゲームは次のように定義される。 ( N 、 A 、 T 、 p 、 u ) {\displaystyle (N,A,T,p,u)} 場所:
N = {容疑者、保安官}容疑 者 = {発砲、しない}、保安 官 = {発砲、しない}T 容疑者 = {犯罪者、民間人}、T 保安官 = {*}p 犯罪者 = p 、p 民間人 = (1 − p )利得u は次のように与えられると仮定する。両方のプレイヤーが合理的であり、両方のプレイヤーが両方のプレイヤーが合理的であることを知っており、どのプレイヤーが知っていることもすべてのプレイヤーが知っていることがわかっている場合(つまり、プレイヤー 1 はプレイヤー 2 がプレイヤー 1 が合理的であることを知っていることを知っており、プレイヤー 2 もこれを知っている、など無限に続く -共通知識 )、完全ベイズ均衡に従ってゲームでのプレイは次のようになります。[ 25 ] [ 26 ]
容疑者の種類が「犯罪者」の場合、容疑者の支配戦略は発砲することであり、容疑者の種類が「民間人」の場合、容疑者の支配戦略は発砲しないことである。したがって、厳密に支配される代替戦略は除外できる。これを踏まえると、保安官が発砲した場合、確率 pで 0 の利得、確率 で − 1の利得を得る。 1 − p {\displaystyle 1-p} 、つまり期待収益は p − 1 {\displaystyle p-1} 保安官が 発砲しない場合、確率pで -2 の報酬、確率 で 0 の報酬を得る。 1 − p {\displaystyle 1-p} 、つまり期待収益は − 2 p {\displaystyle -2p} したがって、保安官は必ず発砲する 。 p − 1 > − 2 p {\displaystyle p-1>-2p} つまり、 p > 1 / 3 {\displaystyle p>1/3} .
レモンの市場 『レモンの市場』は、逆選択 と呼ばれる概念と関連している。
設定
中古車があります。プレイヤー1は、その車に興味を持っている潜在的な購入者です。プレイヤー2はその車の所有者で、その価値(車の状態など)を知っています。プレイヤー1はそれを知らず、所有者(プレイヤー2)にとっての車の価値は0から100の間で均等に分布している(つまり、長さが等しい2つの値区間[0, 100]のそれぞれが等しい確率で発生する)と考えています。
プレイヤー1は0から100(両端を含む)の間でpを入札できます。プレイヤー2はその後、そのオファーを受け入れるか拒否することができます。利得は以下のとおりです。
プレイヤー1の報酬:入札が承認されました 3 2 v − p {\displaystyle {\frac {3}{2}}v-p} 入札拒否件数は0件です。 プレイヤー2の利得:入札が受け入れられた場合、p 、入札が拒否された場合、v 補足:カットオフ戦略
プレイヤー2の戦略:特定のカットオフP * 以上の入札はすべて受け入れ、P * 未満の入札は拒否する、という戦略はカットオフ戦略として知られており、P * はカットオフと呼ばれます。
取引されるのは「レモン」(状態の悪い中古車、具体的には価値が最大でもp 以下の車)だけです プレイヤー1はゼロを入札することで確実にゼロの報酬を得ることができる。したがって、均衡状態ではp = 0となる。 状態の悪い中古車(いわゆる「レモン」)しか取引されないため、市場は崩壊する。 貿易が経済的に効率的 であっても、貿易は不可能である[ 27 ]
独占市場に参入する 大手企業が独占している市場に参入しようとする新規企業(プレイヤー1)は、2種類の独占企業(プレイヤー2)に遭遇する。タイプ1は阻止され、タイプ2は許可される。プレイヤー1はプレイヤー2に関する完全な情報を得ることはできないが、先行企業が市場に参入しようとした際に阻止されたかどうかから、タイプ1とタイプ2が出現する確率を推測できる可能性がある。これはベイジアンゲームである。このような判断の理由は、プレイヤー2には阻止コストが存在するためである。プレイヤー2はプレイヤー1の市場参入を阻止するために大幅な値下げを行う必要があるため、市場参入によって得られる利益が阻止コストを上回る場合にプレイヤー1を阻止する。
参考文献 1 2ザミール 、 シュムエル (2009)。「ベイジアンゲーム:不完全情報ゲーム」(PDF) 。複雑系科学百科事典 。p. 426。doi : 10.1007/978-0-387-30440-3_29。ISBN 978-0-387-75888-6 . S2CID 14218591 . ↑ ハーサニー、ジョン C.、1967/1968。「ベイジアン プレイヤーによる不完全情報ゲーム、I-III」マネジメント サイエンス 14 (3): 159-183 (パート I)、14 (5): 320-334 (パート II)、14 (7): 486-502 (パート III)。 ↑ Harsanyi, John C. (1968). "ベイズ的プレイヤーによる不完全情報ゲーム、I-III. パートII. ベイズ均衡点". Management Science . 14 (5): 320– 334. doi : 10.1287/mnsc.14.5.320 . ISSN 0025-1909 . JSTOR 2628673 . ↑ Harsanyi, John C. (1968). "ベイズ的プレイヤーによる不完全情報ゲーム、I-III. パート III. ゲームの基本確率分布". Management Science . 14 (7): 486– 502. doi : 10.1287/mnsc.14.7.486 . ISSN 0025-1909 . JSTOR 2628894 . 1 2 Kajii, A.; Morris, S. (1997). "不完全情報に対する均衡の頑健性". Econometrica . 65 (6): 1283– 1309. doi : 10.2307/2171737 . JSTOR 2171737 . ↑ Grüne-Yanoff, Till; Lehtinen, Aki (2012). "Philosophy of Game Theory". Philosophy of Economics : 532. ↑ コニオルチク、マーティアシュ。アンドラーシュ州ボドル。ピンテール、ミクロス(2020年6月29日)。 「非ローカルリソースを使用した古典的なベイジアンゲームにおける事前均衡と事後均衡」 。 物理的レビュー A . 1 (6): 2–3 . arXiv : 2005.12727 。 ビブコード : 2020PhRvA.101f2115K 。 土井 : 10.1103/PhysRevA.101.062115 。 S2CID 218889282 。 ↑ Harsanyi, John C. (2004). "ベイズ型プレイヤーによる不完全情報ゲーム、I-III:パートI. 基本モデル". Management Science . 50 (12): 1804– 1817. doi : 10.1287/mnsc.1040.0270 . ISSN 0025-1909 . JSTOR 30046151 . ↑マシュラー、マイケル ; ソラン、エイロン;ザミール、シュムエル(2013)。 ゲーム理論 。ケンブリッジ:ケンブリッジ大学出版局。doi : 10.1017 / cbo9780511794216。ISBN 978-0-511-79421-6 。↑ショハム、ヨアブ ; レイトン=ブラウン、ケビン(2008)。 マルチエージェントシステム 。ケンブリッジ:ケンブリッジ大学出版局。doi : 10.1017 / cbo9780511811654。ISBN 978-0-511-81165-4 。↑ Ponssard, J. -P.; Sorin, S. (1980 年 6 月). "不完全情報を持つ有限ゼロサムゲームの LP 定式化". International Journal of Game Theory . 9 (2): 99– 105. doi : 10.1007/bf01769767 . ISSN 0020-7276 . S2CID 120632621 . ↑ Narahari, Y (2012年7月). 「展開形式ゲーム」 (PDF) . コンピュータ科学および自動化学科 : 1. ↑ 「戦略型ゲーム」、 ゲーム理論 、ケンブリッジ大学出版局、2013年3月21日、 75~ 143ページ、 doi : 10.1017/cbo9780511794216.005 、 ISBN 978-0-511-79421-6 ↑ 「ベイズの定理:ベイズ分析入門チュートリアル」。Choice Reviews Online。51 ( 6 ):51–3301–51-3301。2014年1月21日。doi : 10.5860 /choice.51-3301 (2025年7月1 日 非アクティブ)。ISSN 0009-4978 。 {{cite journal}}: CS1メンテナンス: DOIは2025年7月現在非アクティブです(リンク)↑ Peters, Hans (2015). ゲーム理論 . Springer Texts in Business and Economics. Berlin: Springer. p. 60. doi : 10.1007/978-3-662-46950-7 . ISBN 978-3-662-46949-1 。↑ Albrecht, Stefano; Crandall, Jacob; Ramamoorthy, Subramanian (2016). "Belief and Truth in Hypothesised Behaviours". Artificial Intelligence . 235 : 63– 94. arXiv : 1507.07688 . doi : 10.1016/j.artint.2016.02.004 . S2CID 2599762 . ↑ Caballero, William N.; Banks, David; Wu, Keru (2022-08-08). "資源の不確実性と複数期間のコミットメントの下での防衛および安全保障計画" . Naval Research Logistics . 69 (7): 1009– 1026. doi : 10.1002/nav.22071 . ISSN 0894-069X . S2CID 251461541 . ↑ Maccarone, Lee Tylor (2021). 原子力発電所のサイバーセキュリティのための確率的ベイズゲーム 。博士論文、ピッツバーグ大学。 ↑ Bernhard, Julian; Pollok, Stefan; Knoll, Alois (2019). "Addressing Inherent Uncertainty: Risk-Sensitive Behavior Generation for Automated Driving using Distributional Reinforcement Learning". 2019 IEEE Intelligent Vehicles Symposium (IV) . Paris, France: IEEE. pp. 2148–2155 . arXiv : 2102.03119 . doi : 10.1109/IVS.2019.8813791 . ISBN 978-1-7281-0560-4 . S2CID 201811314 . ↑ Asheralieva, Alia; Niyato, Dusit (2021). "Fast and Secure Computational Offloading With Lagrange Coded Mobile Edge Computing". IEEE Transactions on Vehicular Technology . 70 (5): 4924–4942 . Bibcode : 2021ITVT...70.4924A . doi : 10.1109/TVT.2021.3070723 . ISSN 0018-9545 . S2CID 234331661 . ↑ Ramtin, Amir Reza; Towsley, Don (2021). "利己的なエージェントによる自己安定化へのゲーム理論的アプローチ". arXiv : 2108.07362 [ cs.DC ]. ↑ Su, Runbo; Sfar, Arbia Riahi; Natalizio, Enrico; Moyal, Pascal; Song, Ye-Qiong (2023-09-11). "クラウドソーシングIoTにおける不正行為に対処するゲーム理論モデル" . 2023 第20回IEEE国際センシング・通信・ネットワーク会議(SECON) (PDF) . IEEE. pp. 195–203 . doi : 10.1109/SECON58729.2023.10287527 . ISBN 979-8-3503-0052-9 。↑ Bacharach, M. (1999). "インタラクティブなチーム推論:協力理論への貢献". Research in Economics . 53 (2): 117–47 . doi : 10.1006/reec.1999.0188 . ↑ Newton, J. (2019). "エージェンシー均衡" . Games . 10 (1): 14. doi : 10.3390/g10010014 . hdl : 10419/219237 . ↑ "Coursera" . Coursera . 2016年8月10日の オリジナルからアーカイブ済み。 2016年6月16日 取得 。 ↑ Hu, Yuhuang; Loo, Chu Kiong (2014-03-17). "A Generalized Quantum-Inspired Decision Making Model for Intelligent Agent" . The Scientific World Journal . 2014 240983. doi : 10.1155/2014/240983 . ISSN 1537-744X . PMC 3977121 . PMID 24778580 . ↑ Akerlof, George A. (1970 年 8月). 「レモンの市場」:品質の不確実性と市場メカニズム 。 『 四半期 経済 学ジャーナル 』 84 (3): 488–500。doi : 10.2307/1879431。JSTOR 1879431 。
さらに読む ギボンズ、ロバート(1992)。応用経済学者の ためのゲーム理論 。プリンストン大学出版局。144-152頁。ISBN 1-4008-3588-7 。 レヴィン、ジョナサン(2002)。「不完全情報ゲーム」(PDF) 。 2016年 8月25日 取得 。