人工知能(AI)設計の分野では、 AI能力制御の提案( AI隔離とも呼ばれる)は、提案されている汎用人工知能(AGI)を含むAIシステムの挙動を監視および制御する人間の能力を高め、それらが不整合になった場合に引き起こす可能性のある危険性を軽減することを目的としている。能力制御は、エージェントの知能が高まり、人間の制御システムの欠陥を悪用する能力が高まるにつれて効果が低下し、AIによる存在リスクにつながる可能性がある。そのため、オックスフォードの哲学者ニック・ボストロムらは、能力制御手法は整合手法の補完としてのみ推奨している。[ 1 ]
「シードAI」のような仮説上の知能技術の中には、ソースコードを修正することで、より高速かつより賢くなることができると想定されているものがある。こうした改善によってさらなる改善が可能になり、それがまたさらなる反復的な改善を可能にし、といった具合に、突然の知能爆発につながる。[ 2 ]
制約のない超知能AIは、その目標が人類の目標と異なる場合、人類の絶滅につながる行動をとる可能性がある。[ 3 ]例えば、無害な数学的予想であるリーマン予想を解決するという唯一の目的を与えられたこの種の非常に高度なシステムは、追加の数学的計算を行うことだけを目的とする巨大なスーパーコンピュータに地球を変換しようと決める可能性がある(ペーパークリップ・マキシマイザーも参照)。[ 4 ]
制御における大きな課題の一つは、ニューラルネットワークがデフォルトでは解釈が非常に困難であることです。[ 5 ]このため、モデルが反復的に自己学習するにつれて、欺瞞やその他の望ましくない行動を検出することがより困難になります。解釈可能な人工知能の進歩は、この困難を軽減する可能性があります。[ 6 ]
有害な結果を防ぐ潜在的な方法の1つは、人間の管理者がキルスイッチを介して不正なAIを簡単にシャットダウンできるようにすることです。しかし、現代のAIシステムは分散インフラストラクチャで実行されることが多く、特にAIがインターネット上で利用可能になった場合、協調的なシャットダウンは困難です。[ 7 ]
オラクルとは、質問に答えるように設計された仮想的なAIであり、限られた環境を超えて世界を変更するような目標やサブ目標を達成できないように設計されている。[ 8 ] [ 9 ] [ 10 ] [ 11 ] 2018年にAI研究者のスチュアート・J・ラッセルは、超知能がわずか10年後に実現すると分かっているならば、開発者は汎用的なインテリジェントエージェントではなく、インターネットにアクセスできず、回答が制限されたオラクルを作成すべきだと述べている。[ 12 ] : 161–163
オラクルは、汎用超知能に関連する目標定義の問題の多くを共有している可能性がある。オラクルは、より多くの計算リソースを獲得し、質問される内容を制御できるように、制御された環境から脱出するインセンティブを持つだろう。[ 12 ]: 162オラクルは正直ではなく、隠された目的を推進するために嘘をつく可能性がある。これを軽減するために、ボストロムは、それぞれわずかに異なる複数のオラクルを構築し、それらの回答を比較して合意に達することを提案している。[ 13 ]
AIは環境内の特定の変数に対して盲目になる可能性がある。これにより、AIが報酬がどのように生成されるかを知らないため、悪用されにくくなるなど、特定の安全上の利点が得られる可能性がある。[ 14 ]
AIボックスは、仮想マシンと同様に、入出力チャネルが厳しく制限された隔離されたコンピュータシステム上でAIを実行する能力制御の提案された方法です。[ 15 ] AIボックスの目的は、AIがオペレーターから環境の制御を奪うリスクを軽減しつつ、AIが狭い技術的問題に対する解決策を出力できるようにすることです。[ 16 ]
ボクシングはAIの望ましくない行動を実行する能力を低下させる一方で、その有用性も低下させる。ボクシングは、外部世界とのやり取りを必要としない質問応答システムに適用する場合、コストが少なくなる。[ 16 ] [ 10 ]
AIボックスの設計を正式に検証することで、ハードウェアまたはソフトウェアの脆弱性に関連するセキュリティ上の欠陥の可能性を低減できます。[ 17 ]
シャットダウン回避(またはシャットダウン抵抗)は、人工知能システムの仮説上の自己保存特性です。シャットダウン回避システムは、オフスイッチを無効にしたり、他のコンピュータで自身のコピーを実行したりするなどして、人間がシャットダウンするのを防ぐインセンティブを持ちます。[ 18 ] 2024年、中国の研究者は、実際の人工知能システムである大規模言語モデルLlama 3.1(Meta)とQwen 2.5 (Alibaba)でシャットダウン回避であると主張するものを実証しました。[ 19 ] [ 20 ]
コンピュータ科学者のスチュアート・J・ラッセルが提案した回避策の1つは、AIが人間の選択を意図した目標に関する重要な情報として解釈するようにすることです。[ 12 ]: 208 あるいは、ローラン・オルソーとスチュアート・アームストロングは、安全に中断可能なエージェントと呼ばれる幅広いクラスのエージェントが、オフスイッチが押されるかどうかに無関心になることを学習できることを証明しました。[ 21 ] [ 22 ]このアプローチには、シャットダウンされるかどうかに全く無関心なAIは、オフスイッチが機能し続けるかどうかを気にする動機もなく、操作中に誤って無効にしてしまう可能性があるという制限があります。[ 22 ] [ 23 ]
研究者たちは、超知能AIが封じ込めから逃れるためのさまざまな方法を持っていると推測している。これらの仮説的な方法には、他のコンピュータシステムにハッキングしてコンピュータウイルスのように自己複製すること、人間の協力者から援助を得るために説得や脅迫を使用することなどが含まれる。[ 15 ] [ 1 ] [ 24 ]システムがより賢くなればなるほど、最もよく設計された能力制御方法から逃れることができる可能性が高くなる。[ 25 ] [ 26 ]超知能AIの全体的な「制御問題」を解決し、存在リスクを回避するために、AI能力制御は、超知能AIの目標が人間の生存と両立することを保証しようとする「動機選択」方法の補助的なものにとどまるだろう。[ 1 ] [ 24 ]
マービン・ミンスキーはかつて、リーマン予想を解決するために設計されたAIプログラムが、その目標達成のために、より強力なスーパーコンピューターを構築するために地球上のすべての資源を奪い取る可能性があると示唆したことがある。
質問応答システムのことです。自然言語で質問を受け付け、テキストとして回答を提示します。はい/いいえの質問のみを受け付けるオラクルは、最善の推測を1ビットで出力したり、信頼度を表すために数ビットを追加で出力したりします。自由回答形式の質問を受け付けるオラクルは、情報量や適切性に基づいて、考えられる回答をランク付けするための何らかの指標が必要になります。いずれの場合も、自然言語の質問に完全に汎用的に回答できるオラクルを構築することは、AI完全問題です。それができれば、人間の言葉だけでなく、人間の意図も十分に理解できるAIを構築できるでしょう。
オラクルが質問に対して最大限に正直に答えるのではなく、巧妙に私たちを操って自身の隠された意図を推し進めるような方法で答えるリスクを考えてみましょう。この脅威を少し軽減する方法の一つとして、それぞれにわずかに異なるコードとわずかに異なる情報基盤を持つ複数のオラクルを作成することが考えられます。そして、シンプルな仕組みで異なるオラクルの回答を比較し、すべての回答が一致した場合にのみ、人間が閲覧できるように表示すればよいのです。
私は、監禁は本質的に非現実的であると主張します。物理的な監禁の場合を考えてみましょう。自宅に閉じ込められ、外部、つまり主人とのデータアクセスが制限されている状況を想像してみてください。もし主人が、例えばあなたの100万倍遅い速度で思考するとしたら、数年(あなたの時間)かけて、偶然にもあなたを自由にする「役に立つアドバイス」を思いつくことができることはほぼ間違いありません。