友好的人工知能(友好的AIまたはFAI)とは、人類にプラスの(良性の)影響を与える、あるいは少なくとも人類の進歩を促進するなど人間の利益に合致する、仮説上の汎用人工知能(AGI)のことである。これは人工知能倫理の一部であり、機械倫理と密接に関連している。機械倫理は人工知能エージェントがどのように振る舞うべきかに関心を寄せているのに対し、友好的人工知能の研究は、実際にその振る舞いを実現し、適切に制約されるようにする方法に焦点を当てている。

この用語は、人間の価値観を確実に実行する超知能人工エージェントについて議論するために、このアイデアを普及させたことで最もよく知られているエリザー・ユドコウスキー[ 1 ]によって造語されました[ 2 ] [ 3 ] 。スチュアート・J・ラッセルとピーター・ノーヴィグによる人工知能の主要な教科書である『人工知能:現代的アプローチ』では、このアイデアについて次のように説明しています[ 2 ]。
ユドコウスキー(2008)は、友好的なAIを設計する方法についてさらに詳しく述べている。彼は、友好性(人間を傷つけたくないという願望)は最初から設計に組み込むべきだと主張するが、設計者は自身の設計に欠陥がある可能性と、ロボットが時間とともに学習し進化していくことを認識する必要があると述べている。したがって、課題はメカニズム設計にある。つまり、チェックアンドバランスのシステムの下でAIシステムを進化させるためのメカニズムを定義し、そのような変化に直面しても友好的なままでいられるような有用機能をシステムに与えることである。
この文脈では「友好的」は技術用語として用いられ、口語的な意味での「友好的」なエージェントではなく、安全で有用なエージェントを指している。この概念は主に、知能が急速に爆発的に向上する再帰的に自己改善する人工エージェントに関する議論の文脈で用いられており、この仮説上の技術は人間社会に大きく、急速で、制御困難な影響を与えるだろうという前提に基づいている。[ 4 ]
人工知能に対する懸念の根源は非常に古い。ケビン・ラグランデュールは、AI特有の危険性は、ゴーレムのような人型人工召使いや、ジェルベール・ド・オーリヤックやロジャー・ベーコンのプロト・ロボットに関する古代の文学にも見られることを示した。これらの物語では、これらの人型創造物の極めて高い知能と力が、奴隷としての地位(本質的に人間以下と見なされている)と衝突し、悲惨な紛争を引き起こす。[ 5 ] 1942年までに、これらのテーマはアイザック・アシモフに「ロボット三原則」の作成を促した。これは、彼の小説に登場するすべてのロボットに組み込まれた原則であり、ロボットが創造者に反逆したり、創造者に危害を加えたりすることを防ぐことを目的としている。[ 6 ]
現代において、超知能AIの実現が目前に迫る中、哲学者ニック・ボストロムは、人間の倫理観に合致しない目標を持つ超知能AIシステムは、人類の安全を確保するための極端な措置が講じられない限り、本質的に危険であると述べている。彼は次のように述べている。
基本的に、「超知能」は自らが設定した目標を何でも達成できると想定すべきである。したがって、超知能に与える目標、そしてその動機付けシステム全体が「人間にとって親しみやすい」ものであることが極めて重要となる。
2008年、エリザー・ユドコウスキーは、高度な人工知能による存在リスクを軽減するために「友好的なAI」の創設を提唱した。彼は次のように説明している。「AIはあなたを憎んでいるわけでも、愛しているわけでもないが、あなたはAIが他の何かに利用できる原子でできているのだ。」[ 7 ]
スティーブ・オモハンドロは、十分に高度なAIシステムは、明示的に対抗されない限り、あらゆる目標駆動型システムの本質的な性質により、資源獲得、自己保存、継続的な自己改善などの基本的な「衝動」を多数示すだろうし、これらの衝動は「特別な予防措置を講じなければ」、AIに望ましくない行動を起こさせるだろうと述べている。[ 8 ] [ 9 ]
アレクサンダー・ウィスナー=グロスは、将来の行動の自由度(または因果経路エントロピー)を最大化するように駆動されるAIは、計画期間が一定の閾値よりも長い場合は友好的であり、計画期間がその閾値よりも短い場合は非友好的であると考えられるかもしれないと述べている。[ 10 ] [ 11 ]
機械知能研究所に寄稿したルーク・ミュールハウザーは、機械倫理の研究者に対し、ブルース・シュナイアーが「セキュリティ思考」と呼んだ考え方を採用するよう勧めている。つまり、システムがどのように機能するかを考えるのではなく、どのように失敗する可能性があるかを想像すべきだという考え方だ。例えば、正確な予測のみを行い、テキストインターフェースを介して通信するAIでさえ、意図しない害を引き起こす可能性があると彼は示唆している。[ 12 ]
2014年、ルーク・ミュールハウザーとニック・ボストロムは「友好的なAI」の必要性を強調したが[ 13 ]、例えば反事実的な道徳的思考をプログラミングすることによって「友好的な」超知能を設計する難しさは相当なものである。[ 14 ] [ 15 ]
ユドコウスキーは、首尾一貫した外挿意志(CEV)モデルを提唱している。彼によれば、首尾一貫した外挿意志とは、「もっと多くのことを知っていれば、もっと速く考えれば、もっと自分がなりたいと願うような人間になれれば、もっと一緒に成長できたのに、という私たちの願い。外挿が発散するのではなく収束し、私たちの願いが干渉するのではなく整合し、私たちが望むように外挿され、私たちが望むように解釈される」ものである。[ 16 ]
友好的AIは、人間のプログラマーが直接設計するのではなく、まず人間の本性を研究し、十分な時間と洞察力があれば満足のいく答えにたどり着けるようなAIを生成するようにプログラムされた「シードAI」によって設計される。[ 16 ]偶発的な人間の本性(おそらく数学的な目的のために、効用関数やその他の意思決定理論の形式として表現される)を通して客観的なものに訴えることは、「友好的」の究極の基準を提供するものであり、客観的な道徳を定義するというメタ倫理的問題への答えである。外挿された意志は、あらゆることを考慮して、人類が客観的に望むものであることを意図しているが、それは現在の外挿されていない人類の心理的および認知的特性に相対的にのみ定義できる。
スティーブ・オモハンドロは、 AIの安全性に対する「足場」アプローチを提案しており、証明可能な安全性を備えたある世代のAIが、証明可能な安全性を備えた次の世代の構築に役立つとしている。[ 17 ]
セス・バウムは、安全で社会的に有益な人工知能または汎用人工知能の開発は、AI研究コミュニティの社会心理学の機能であり、外的な基準によって制約され、内的な基準によって動機付けられる可能性があると主張している。内的な動機は、メッセージがAI開発者に響くときに強化される可能性がある。バウムは、対照的に、「有益なAIに関する既存のメッセージは必ずしも適切に表現されているとは限らない」と主張している。バウムは「協力的な関係とAI研究者の肯定的な枠組み」を提唱し、AI研究者を「有益な設計を追求したくない」と特徴づけることに対して警告している。[ 18 ]
AI研究者のスチュアート・J・ラッセルは著書『Human Compatible 』の中で、有益な機械の開発を導く3つの原則を挙げている。彼は、これらの原則は機械に明示的にコード化されるべきものではなく、むしろ人間の開発者のためのものであると強調している。その原則は以下の通りである。[ 19 ]: 173
- この機械の唯一の目的は、人間の好みを最大限に実現することである。
- 機械は当初、それらの嗜好が何であるかを把握できていない。
- 人間の嗜好に関する究極の情報源は、人間の行動である。
ラッセルが言及する「選好」は「包括的であり、あなたが関心を持つであろうあらゆる事柄を、任意に遠い未来まで網羅する」[ 19 ]: 173 同様に、「行動」には選択肢間のあらゆる選択が含まれ[ 19 ]: 177不確実性は、論理的に可能なあらゆる人間の選好に、非常に小さいかもしれないが、何らかの確率を割り当てる必要があるほど大きい[ 19 ]: 201
『我々の最後の発明』の著者であるジェームズ・バラットは、「AI開発者を集めてセキュリティに関するアイデアを共有するための官民連携組織を作る必要がある。国際原子力機関のようなものだが、企業と連携する形だ」と提言した。彼はAI研究者に対し、バイオテクノロジーのリスクについて議論した組換えDNAに関するアシロマ会議と同様の会議を開催するよう促している。[ 17 ]
ジョン・マクギニスは、政府に対し友好的AI研究を加速するよう促している。友好的AIの目標は必ずしも明確ではないため、彼は国立衛生研究所(NIH)に似たモデルを提案している。そこでは、「コンピュータ科学者と認知科学者からなるピアレビューパネルがプロジェクトを精査し、AIの進歩を促進すると同時に、そのような進歩が適切な安全対策を伴うことを保証するように設計されたプロジェクトを選択する」。マクギニスは、ピアレビューは「官僚的な命令では捉えられない技術的問題に対処するための規制よりも優れている」と考えている。マクギニスは、彼の提案は一般的に友好的AIへの政府の関与を避けることを目指している機械知能研究所(MIRI )の提案とは対照的であると指摘している。[ 20 ]
批評家の中には、人間レベルのAIと超知能の両方が実現する可能性は低く、したがって友好的なAIも実現する可能性は低いと考える人もいる。ガーディアン紙に寄稿したアラン・ウィンフィールドは、人間レベルの人工知能を光速を超える航行と比較し、その難しさを考えると「慎重かつ準備万端」である必要があるが、超知能のリスクについて「執着する必要はない」と述べている。[ 21 ]一方、ボイルズとホアキンは、ルーク・ミュールハウザーとニック・ボストロムによる友好的なAIを作成するという提案は暗いものに見えると主張している。これは、ミュールハウザーとボストロムが、知能機械は人間が持っていたであろう道徳的価値観について反事実的に考えるようにプログラムできるという考えを持っているように見えるためである。[ 13 ] AI & Societyの記事で、ボイルズとホアキンは、次のような理由から、そのような AI はそれほど友好的ではないと主張している。機械にプログラムしなければならない無数の反事実的条件、道徳的価値観のセット、つまり人間が現在持っているものよりも理想的な価値観を現金化することの難しさ、そして反事実的条件と理想的な価値観の結果との間の明らかな乖離。[ 14 ]
一部の哲学者は、人工であれ人間であれ、真に「合理的」なエージェントは当然善意を持つと主張しており、この見解では、友好的なAIを生み出すために意図的に設計された安全策は不要、あるいは有害である可能性さえある。[ 22 ]他の批評家は、人工知能が友好的になり得るかどうか疑問を呈している。テクノロジー誌「The New Atlantis 」の編集者であるアダム・カイパーとアリ・N・シュルマンは、倫理的複雑性の問題がソフトウェアの進歩や計算能力の向上によって解決されることはないため、AIの「友好的」な行動を保証することは決して不可能だと述べている。彼らは、友好的AI理論の基準は「無数の可能性のある結果の可能性について優れた予測能力があるだけでなく、異なる結果をどのように評価するかについて確実性と合意がある場合にのみ機能する」と書いている。[ 23 ]
高度なAIシステムの内部動作は複雑で解釈が難しい場合があり、透明性と説明責任に関する懸念につながる可能性がある。[ 24 ]
所有者は、エリザー・ユドコウスキーが「友好的なAI」と呼ぶものに制御を委ねる可能性がある。
{{cite book}}ISBN /日付の不一致(ヘルプ)...AGI の本質は推論機能であり、道徳的な振る舞いを促すのは、まさにその存在の論理である... 本当の悪夢のシナリオは、人間が自己欺瞞に対する保証がないまま、AGI と強く結びつくことが有利だと考える場合である。