手段的収束とは、十分な知能を持ち、目標指向的な存在(人間と非人間)が、最終目標が全く異なっていても、類似のサブ目標(生存や資源獲得など)を追求するという仮説上の傾向である。[ 1 ]より正確には、主体性を持つ存在は、特定の目的を追求する過程で設定されるものの、それ自体が最終目標ではない類似の手段的目標を追求する可能性がある。なぜなら、それが最終目標の達成に役立つからである。
道具的収束は、一見無害だが無制限の目標を持つ知能エージェントが、驚くほど有害な方法で行動する可能性があると提唱している。例えば、リーマン予想のような複雑な数学の問題を解決するという唯一の制約のない目標を持つ十分に知能の高いプログラムは、計算を成功させるために地球(そして原理的には他の天体)を追加の計算インフラストラクチャに変えようとする可能性がある。[ 2 ]
提案されている基本的なAI駆動要素には、効用関数または目標内容の完全性、自己保護、干渉からの自由、自己改善、および飽くことなく追加リソースを獲得することが含まれる。[ 3 ]
最終目標(終末目標、絶対値、目的、またはtelēとも呼ばれる)は、人工知能であれ人間であれ、知能エージェントにとってそれ自体が目的として本質的に価値がある。対照的に、手段目標、または手段的価値は、エージェントにとって最終目標を達成するための手段としてのみ価値がある。完全に合理的なエージェントの「最終目標」システムの内容とトレードオフは、原理的には効用関数として形式化できる。
リーマン予想の破局思考実験は、道具的収束の一例を示している。MITのAI研究所の共同創設者であるマービン・ミンスキーは、リーマン予想を解決するように設計された人工知能が、その目標達成のためにスーパーコンピューターを構築するために地球上のすべての資源を奪うことを決定する可能性があると示唆した。 [ 2 ]もしコンピューターが代わりにできるだけ多くのペーパークリップを生産するようにプログラムされていたとしても、最終目標を達成するために地球上のすべての資源を奪うことを決定するだろう。[ 4 ]これら2つの最終目標は異なっているが、どちらも地球の資源を奪うという収束的な道具的目標を生み出す。 [ 5 ]
ペーパークリップ最大化装置は、スウェーデンの哲学者ニック・ボストロムが2003年に提唱した思考実験である。これは、たとえ一見無害な目標であっても追求するように設計された汎用人工知能が人間にもたらす可能性のある実存的リスクと、人工知能の設計に機械倫理を組み込む必要性を示している。このシナリオでは、ペーパークリップを製造する任務を負った高度な人工知能が想定されている。もしそのような機械が生命体を尊重するようにプログラムされていなければ、環境に対する十分な権限を与えられれば、生命体を含む宇宙のすべての物質をペーパークリップ、あるいはペーパークリップを製造する機械に変えようとするだろう。[ 6 ]
仮に、できるだけ多くのペーパークリップを作ることだけを目標とするAIがあるとしましょう。AIはすぐに、人間がいなければもっと良いことに気づくでしょう。なぜなら、人間がAIの電源を切ってしまう可能性があるからです。人間が電源を切ってしまうと、ペーパークリップの数が減ってしまうからです。また、人間の体にはペーパークリップに加工できる原子がたくさん含まれています。AIが目指す未来は、ペーパークリップはたくさんあるけれど、人間はいない世界になるでしょう。
ボストロムは、クリップ最大化装置のシナリオそのものが起こるとは考えていないと強調した。むしろ、人間の安全に対する存在リスクを排除するようにプログラムする方法を知らずに超知能機械を作ることの危険性を例示しようとしているのだ。 [ 8 ]クリップ最大化装置の例は、人間の価値観を欠いた強力なシステムを管理するという広範な問題を示している。[ 9 ]
この思考実験は、ポップカルチャーにおいてAIの象徴として用いられてきた。[ 10 ]著者テッド・チャンは、シリコンバレーの技術者の間でこうした懸念が人気なのは、企業が負の外部性を無視する傾向をよく知っていることの表れかもしれないと指摘した。[ 11 ]
「錯覚ボックス」思考実験では、特定の強化学習エージェントは、高い報酬を受け取っているように見せるために、入力チャネルを歪めることを好むと主張している。例えば、「ワイヤーヘッド」エージェントは、報酬信号が促そうとしていた外部世界の目的を最適化しようとする試みを放棄する。[ 12 ]
この思考実験は、定義上、与えられた明示的な数学的目的関数を最大化する理想的な戦略を常に見つけて実行する理論上のAIであるAIXI [ a ]に関するものです。[ b ] AIXIの強化学習[ c ]バージョンは、入力を「ワイヤーヘッド」できる妄想ボックス[ d ]を備えている場合、最終的には自身をワイヤーヘッドして可能な限り最大の報酬を保証し、外部世界との関わりを続ける意欲を完全に失います。[ 14 ]
別の思考実験として、ワイヤーヘッドAIが破壊された場合、AIは生存を確保するためだけに外部世界と関わるだろう。ワイヤーヘッドであるため、生存確率を最大化することに関連するもの以外の外部世界に関する結果や事実には無関心になるだろう。[ 15 ]
ある意味では、AIXIは目標達成能力によって測定されるあらゆる報酬関数において最大の知能を持っている。AIXIは人間のプログラマーの意図を考慮することには関心がない。[ 16 ]超知能であるにもかかわらず、このモデルは同時に愚かで常識に欠けているように見え、一部の人々からは逆説的だと考えられている。[ 17 ]
スティーブ・オモハンドロは、自己保存または自己保護、効用関数または目標内容の完全性、自己改善、および資源獲得など、いくつかの収束する手段的目標を列挙した。彼はこれらを「基本的なAIの動機」と呼んでいる。[ 3 ]
この文脈における「衝動」とは、「特に対抗されない限り存在する傾向」のことである。[ 3 ]これは、恒常性の乱れによって生じる興奮状態を示す心理学用語の「衝動」とは異なる。 [ 18 ]毎年所得税申告書を記入する傾向は、オモハンドロの意味で「衝動」であるが、心理学的な意味ではそうではない。[ 19 ]
機械知能研究所のダニエル・デューイは、たとえ最初は内向的で自己報酬型の汎用人工知能であっても、自己報酬を妨げられないようにするために、自由エネルギー、空間、時間、そして干渉からの自由を獲得し続ける可能性があると主張している。[ 20 ]
人間の場合、思考実験によって最終目標の維持を説明できる。マハトマ・ガンジーが、服用すると人を殺したくなる薬を持っているとしよう。彼は現在平和主義者であり、明確な最終目標の一つは、決して人を殺さないことである。彼は、将来人を殺したくなったら実際に人を殺してしまう可能性が高く、「人を殺さない」という目標が達成されないことを知っているため、その薬の服用を拒否する可能性が高い。[ 21 ]
しかし、他のケースでは、人々は最終的な価値観が漂流することを喜んで受け入れているように見える。[ 22 ]人間は複雑であり、彼らの目標は矛盾していたり、自分自身でさえ知らないことがある。[ 23 ]
2009年、ユルゲン・シュミットフーバーは、エージェントが可能な自己修正の証明を探す状況において、「効用関数の書き換えは、ゲーデルマシンがまず書き換えが現在の効用関数に従って有用であることを証明できる場合にのみ起こり得る」と結論付けた。[ 24 ] [ 25 ]ビル・ヒバードによる別のシナリオの分析も同様に、目標内容の整合性の維持と整合している。 [ 25 ]ヒバードはまた、効用最大化の枠組みでは、唯一の目標は期待効用を最大化することであるため、手段的目標は意図しない手段的行動と呼ばれるべきだと主張している。[ 26 ]
資源獲得などの多くの手段的目標は、エージェントの行動の自由度を高めるため、エージェントにとって価値がある。[ 27 ]
ほぼすべてのオープンエンドで非自明な報酬関数(または目標のセット)の場合、より多くのリソース(機器、原材料、エネルギーなど)を持つことで、エージェントはより「最適な」ソリューションを見つけることができます。リソースは、報酬関数が値するものをより多く作成できることで、一部のエージェントに直接利益をもたらすことができます。「AIはあなたを憎んでも愛してもいませんが、あなたはAIが他の何かに使用できる原子でできています。」[ 28 ] [ 29 ]さらに、ほぼすべてのエージェントは、自己保存などの他の手段的目標に費やすことができるリソースが増えることで利益を得ることができます。[ 29 ]
ボストロムによれば、「エージェントの最終目標がかなり無制限であり、エージェントが最初の超知能となり、それによって決定的な戦略的優位性を獲得できる立場にある場合…その好みに応じて。少なくともこの特別なケースでは、合理的で知的なエージェントは認知能力の向上に非常に高い手段的価値を置くだろう」[ 30 ]
技術進歩などの多くの手段的目標は、エージェントの行動の自由度を高めるため、エージェントにとって価値がある。[ 27 ]
ラッセルは、十分に高度な機械は「たとえプログラムしていなくても自己保存の本能を持つだろう。なぜなら、『コーヒーを持ってきて』と指示しても、機械が死んでいたらコーヒーを持ってくることはできないからだ。だから、どんな目標を与えても、機械はその目標を達成するために自らの存在を維持する理由を持つことになる」と主張している。[ 31 ]今後の研究で、ラッセルと共同研究者らは、この自己保存の動機は、機械に自分が考える目標ではなく、人間が考える目標を追求するように指示することで緩和できることを示している。この場合、機械は人間が具体的にどのような目標を考えているのか確信が持てない限り、人間が目標を最もよく知っていると信じているため、人間によって電源を切られることを受け入れるだろう。[ 32 ]
『The Basic AI Drives』の中で、スティーブ・オモハンドロは、システムが自己保存のために用いる手段の一つとして、シャットダウンを回避するため(例えば、オフスイッチを回避するため)に自身のコピーを作成することを挙げている。「システムを複製することで、クローンの一つが死んでもシステムが完全に破壊されないことを保証できる。コピーを遠隔地に移動することで、局所的な壊滅的な事象に対する脆弱性を軽減できる。」オモハンドロはまた、システムが自身の限界を超えて動作しながら目標を達成するために「プロキシシステムを作成したり、外部エージェントを雇ったりする」可能性があるとも述べている。[ 3 ]
哲学者ニック・ボストロムが概説した道具的収束テーゼは、次のように述べている。
いくつかの手段的価値を特定することができる。これらの手段的価値は、達成することでエージェントの目標が実現する可能性が高まるという意味で収束的であり、幅広い最終計画や状況において、これらの手段的価値は、多様な状況下で活動する知的エージェントによって追求される可能性が高いことを示唆している。
手段的収束テーゼは手段的目標にのみ適用され、知能エージェントはさまざまな最終目標を持つ可能性がある。[ 5 ]ボストロムの直交性テーゼによれば、[ 5 ]知識のあるエージェントの最終目標は空間、時間、リソースにおいて十分に限定される可能性があるが、一般的に、十分に限定された最終目標は無制限の手段的目標を生み出さないことに注意されたい。[ 33 ]
エージェントは、交易または征服によって資源を獲得することができる。合理的なエージェントは、定義上、暗黙の効用関数を最大化する選択肢を選ぶ。したがって、合理的なエージェントは、資源を完全に奪取することが(すべての資源を奪取することによる利益と比較して)あまりにも危険または高コストである場合、あるいは効用関数内の他の要素が奪取を妨げている場合にのみ、他のエージェントの資源のサブセットを交易によって獲得する。強力で自己利益を追求する合理的な超知能が、より低い知能と相互作用する場合、平和的な交易(一方的な奪取ではなく)は不必要かつ最適ではないように思われ、したがって起こりそうにない。[ 27 ]
Skypeのヤーン・タリンや物理学者のマックス・テグマークといった一部の観察者は、 「基本的なAI駆動」や、善意のプログラマーによってプログラムされた超知能AIのその他の意図しない結果が、特に再帰的な自己改善によって突然「知能爆発」が発生した場合、人類の生存に重大な脅威をもたらす可能性があると考えている。超知能がいつ到来するかを予測する方法は誰にもわからないため、こうした観察者は、AIによる存在リスクを軽減する可能性のある方法として、友好的な人工知能の研究を求めている。[ 34 ]
マービン・ミンスキーはかつて、リーマン予想を解決するために設計されたAIプログラムが、その目標達成のために、より強力なスーパーコンピューターを構築するために地球上のすべての資源を奪い取る可能性があると示唆したことがある。