経済学とゲーム理論では、参加者が完全な合理性を持ち(したがって効用を最大化する)、他のすべてのプレーヤーも超合理的であり、超合理的な個人は同じ問題に直面したときに他の超合理的な思考者と常に同じ戦略を思いつくと仮定する場合、参加者は超合理性(または再正規化された合理性)を持っていると見なされます。この定義を適用すると、囚人のジレンマで超合理的な相手と対戦する超合理的なプレーヤーは協力しますが、合理的に利己的なプレーヤーは裏切ります。
この決定ルールはゲーム理論の主流モデルではなく、ダグラス・ホフスタッターが彼の記事、シリーズ、および書籍「メタマジカル・テーマ」 [1]で、広く受け入れられているゲーム理論とは異なる代替的な合理的意思決定のタイプとして提案したものです。ホフスタッターは次のように定義しています。「超合理的思考者は、再帰的定義により、超合理的思考者のグループに属しているという事実を計算に含めます。」[1]
いわゆる「相互的な人間」とは異なり、超合理的な思考者は、社会全体の効用を最大化する均衡を常に取るとは限らず、したがって慈善家ではない。
囚人のジレンマ
超合理性という考え方は、同じ問題を分析する 2 人の論理的思考者が同じ正解を思いつくというものです。たとえば、2 人がどちらも数学が得意で、同じ複雑な問題を解くように指示された場合、2 人とも同じ正解を導きます。数学では、2 つの答えが同じになることがわかっても、問題の価値は変わりませんが、ゲーム理論では、答えが同じになることがわかっていると、答え自体が変わる可能性があります。
囚人のジレンマは、通常、犯罪者の懲役刑という形で表現されますが、現金賞金でも同様に表現できます。2 人のプレーヤーはそれぞれ、協力する (C) か裏切る (D) かの選択肢を与えられます。プレーヤーは、相手が何をするかを知らずに選択します。2 人とも協力する場合、それぞれ 100 ドルを獲得します。2 人とも裏切る場合、それぞれ 1 ドルを獲得します。一方が協力し、もう一方が裏切る場合、裏切ったプレーヤーは 150 ドルを獲得し、協力したプレーヤーは何も獲得しません。
4 つの結果と各プレイヤーへの報酬は以下のとおりです。
プレイヤーが推論するための有効な方法の 1 つは次のとおりです。
- 他のプレイヤーが裏切ったと仮定すると、協力すれば何も得られず、裏切ったら 1 ドル得られます。
- 他のプレイヤーが協力すると仮定すると、協力すれば 100 ドル、裏切ると 150 ドルが得られます。
- つまり、他のプレイヤーが何をしても、裏切ることで私の報酬は 1 ドルだけでも増えるのです。
結論としては、裏切るのが合理的だということです。このタイプの推論はゲーム理論的合理性を定義し、このゲームをプレイしている 2 人のゲーム理論的に合理的なプレイヤーは両方とも裏切り、それぞれ 1 ドルを受け取ります。
超合理性は、別の推論方法です。まず、対称的な問題に対する答えは、すべての超合理プレイヤーにとって同じであると想定されます。したがって、戦略が何であるかを知る前に、同一性が考慮されます。戦略は、すべてのプレイヤーが同じ戦略を使用すると仮定して、各プレイヤーの報酬を最大化することによって見つけられます。超合理プレイヤーは、他の超合理プレイヤーが何であれ同じことを行うことを知っているので、2 人の超合理プレイヤーには 2 つの選択肢しかありません。超合理回答の価値に応じて、両者が協力するか、両者が裏切るかです。したがって、この回答は報酬を最大化するため、2 人の超合理プレイヤーは両方とも協力します。このゲームをプレイしている 2 人の超合理プレイヤーは、それぞれ 100 ドルを手にします。
ゲーム理論的に合理的なプレイヤーと対戦する超合理的なプレイヤーは裏切るでしょう。なぜなら、その戦略は超合理的なプレイヤーが同意することを前提としているだけだからです。
標準的なゲーム理論は合理性についての共通知識を前提としているが、その方法は異なる。ゲーム理論的分析は、対称ゲームにおける答えが最終的に全員にとって同じであると仮定しながらも、各プレイヤーが他のプレイヤーとは独立して戦略を変更できるようにすることで、利益を最大化する。これがゲーム理論的ナッシュ均衡の定義であり、安定した戦略とは、どのプレイヤーも一方的に進路を変更することで利益を改善できない戦略であると定義される。対称ゲームにおける超合理均衡とは、最大化ステップの前にすべてのプレイヤーの戦略が同じになるように強制される均衡である。(超合理性の概念を非対称ゲームに拡張することについては合意されていないが、詳細については § 非対称ゲーム を参照。)
超合理性は、コミュニケーションがなくても、各プレイヤーが協力するという決定が他のプレイヤーの協力につながると想定する一種の魔法の思考を意味すると主張する人もいます[誰? ]。ホフスタッターは、プレイヤーの目標が何かを理解することである場合、「選択」の概念は適用されず、決定が他のプレイヤーの協力を引き起こすのではなく、コミュニケーションや因果関係とは関係なく、同じロジックが同じ答えにつながると指摘しています。この議論は、超合理性が何を意味するかではなく、人間が超合理的に行動することが合理的かどうかをめぐるものであり、ゲーム理論で説明される「合理的」な行動をとることが合理的かどうかに関する議論に似ています (ゲーム理論では、他のプレイヤーが自分だったらどうするかと自問し、後方帰納法と支配戦略の反復消去法を適用することで、他のプレイヤーが何をするか、または何をしたかを理解できます)。
確率的戦略
簡単のため、前述の超合理性の説明では混合戦略、つまりコインを投げることが最善の選択である可能性、またはより一般的には、ある確率で異なる結果を選択する可能性は無視されました。囚人のジレンマでは、混合戦略が認められる場合でも、確率 1 で協力することが超合理的です。これは、一方のプレイヤーが協力し、もう一方のプレイヤーが裏切った場合の平均報酬は、両者が協力した場合と同じであり、裏切ると両者が裏切るリスクが高まり、期待報酬が減少するためです。しかし、場合によっては、超合理的戦略が混合されます。
たとえば、ペイオフが次のようになっている場合:
- CC – $100/$100
- CD – $0/$1,000,000
- DC – 1,000,000ドル/0ドル
- DD – $1/$1
裏切ることで大きな報酬が得られるように、超合理的戦略では、499,900/999,899 または 49.995% を少し超える確率で裏切ることになります。報酬が無限大に増えても、確率はさらに 1/2 に近づくだけであり、より単純な 1/2 の戦略を採用した場合の損失 (すでに最小限) は 0 に近づきます。それほど極端ではない例として、協力者 1 人と裏切り者 1 人の報酬がそれぞれ 400 ドルと 0 ドルだった場合、超合理的混合戦略の世界では、100/299 または約 1/3 の確率で裏切ることになります。
同様の状況でプレイヤーがもっと多い場合、ランダム化装置の使用が不可欠になることがあります。ホフスタッターが論じた例の 1 つはプラトニアのジレンマです。風変わりな大富豪が 20 人の人々に連絡を取り、そのうちの 1 人だけが翌日の正午までに電報 (無料と仮定) を送ってくれたら、その人は 10 億ドルを受け取ると伝えます。電報を 1 通以上受け取った場合や電報をまったく受け取らなかった場合は、誰もお金を受け取れず、プレイヤー間のコミュニケーションは禁止されます。この状況で、超合理的な行動 (20 人全員が超合理的であることがわかっている場合) は、確率 p=1/20 で電報を送信することです。つまり、各受信者は基本的に20 面のサイコロを振り、1 が出た場合のみ電報を送信します。これにより、正確に 1 通の電報が受信される確率が最大化されます。
ただし、これは従来のゲーム理論的分析における解決策ではないことに注意してください。ゲーム理論的に合理的な 20 人のプレーヤーはそれぞれ電報を送信し、したがって何も受け取りません。これは、電報を送信することが支配的な戦略であるためです。個々のプレーヤーが電報を送信した場合、お金を受け取る可能性がありますが、電報を送信しない場合は何も受け取ることができません。(すべての電報が確実に到着する場合、1 つだけ送信し、誰もお金を受け取ることを期待しません)。
非対称ゲーム
超合理性の概念を非対称ゲームに拡張する学術研究はまだ始まったばかりです。
ギスラン・フルニー[2]が開発したそのような研究の1つは、一連のエージェントによって実行されると、彼が「完全に透明な均衡」と呼ぶものにつながる意思決定アルゴリズムを提案しています。
一般化された均衡は、完全に透明な均衡 (PTE) と呼ばれます。[...] 常に存在するわけではありませんが、存在する場合は常に一意であり、常にパレート最適であり、対称ゲームにおけるホフスタッターの均衡と一致します。
このアルゴリズムは、非公式には次の手順のシーケンスとして理解できます。
- プレイヤーにどのような選択肢があるかを考慮して、各プレイヤーがマキシミン決定ルールを実行した場合にどのような結果に到達するかを決定します。この結果をm と呼びます。
- パレート優位にならない結果は考慮から除外します。
- 結果が 1 つだけ残るか、または複数の結果が排除されるまで、手順 1 と 2 を繰り返します。
この排除プロセスを通過した結果が PTE になります。
形式化と関連概念
ワンショット囚人のジレンマにおいて、ある状況下で協力すべきかどうかという疑問は、ニューカムの問題に端を発した意思決定理論の文献にも登場している。因果的意思決定理論は、超合理性は非合理的であると示唆しているが、証拠的意思決定理論は、超合理性に似た推論を支持し、同様の相手との囚人のジレンマにおいて協力することを推奨している。[3] [4]
プログラム均衡は超合理性の機械論的モデルとして提案されている。[5] [6] [7]
参照
参考文献
- ^ ab ホフスタッター、ダグラス(1983年6月)。「超合理的思考者のジレンマ、魅力的な宝くじにつながる」サイエンティフィック・アメリカン。248 (6)。– 再版:ホフスタッター、ダグラス(1985年)。メタマジカルテーマ。ベーシックブックス。pp. 737–755。ISBN 0-465-04566-9。
- ^ Fourny, Ghislain ( 2020年6月). 「正規形での完全な予測:非対称ゲームに拡張された超合理的思考」.数理心理学ジャーナル. 96. arXiv : 1712.05723 . doi :10.1016/j.jmp.2020.102332.
- ^ルイス、デイヴィッド( 1979年)。「囚人のジレンマはニューカム問題である」。哲学と公共問題。8 (3):235-240。doi :10.1093/0195036468.003.0011。JSTOR 2265034 。
- ^ Brams, Steven J. (1975). 「ニューカムの問題と囚人のジレンマ」.紛争解決ジャーナル. 19 (4): 596–612.
- ^ Howard, JV (1988年5月). 「囚人のジレンマにおける協力」.理論と意思決定. 24 (3): 203–213. doi :10.1007/BF00148954.
- ^ Barasz, M.; Christiano, P .; Fallenstein, B.; Herreshoff, M.; LaVictoire, P.; Yudkowsky, E. (2014). 「囚人のジレンマにおける堅牢な協力:証明可能性ロジックによるプログラム均衡」. arXiv : 1401.5577 [cs.GT].
- ^ Oesterheld, Caspar; Treutlein, Johannes; Grosse, Roger; Conitzer, Vincent; Foerster, Jakob (2023). 「類似性に基づく協調平衡」。Neural Information Processing Systems (NeurIPS) の議事録。
