位置合わせの問題 1960年、AIの先駆者であるノーバート・ウィーナーは、 AIのアライメント問題を次のように説明した。
目的を達成するために、その動作に効果的に干渉できない機械装置を使用する場合、機械に投入された目的が、我々が本当に望む目的であることを十分に確認しておく必要がある。[ 41 ] [ 5 ]
AIアライメントとは、AIシステムの目的が何らかのターゲットと一致するようにすることを指します。ターゲットは、システムの設計者やユーザーの目標、広く共有されている価値観、客観的な倫理基準、法的要件、あるいは設計者がより多くの情報と啓蒙を得ていれば抱くであろう意図など、様々に定義されます。[ 42 ] 民主的な AIアライメントでは、ターゲットは中位投票者 の価値観と嗜好であり、政治的正当性 を高めます。[ 43 ] [ 44 ]
AI アライメントは、現代の AI システムにとって未解決の問題であり[ 45 ] [ 46 ] 、AI の研究分野です。[ 47 ] [ 1 ] AI アライメントには、システムの目的を慎重に指定すること (外部アライメント) と、システムが仕様を堅牢に採用すること (内部アライメント) という 2 つの主な課題があります。[ 2 ] 研究者はまた、ユーザーが悪意を持って 回避しようとしても安全制約を遵守する、堅牢な アライメントを持つ AI モデルを作成しようとしています。
仕様ゲームと副作用 AI システムの目的を指定するために、AI 設計者は通常、目的関数 、例 、またはシステムへのフィードバック を提供します。しかし、設計者は重要な値と制約をすべて完全に指定できないことが多く、誤りを犯しやすい人間の監督者の承認を最大化する など、簡単に指定できる代理目標に頼ることになります。 [ 27 ] [ 24 ] [ 48 ] [ 49 ] [ 50 ] その結果、AI システムは、指定された目的を効率的に達成するのに役立つ抜け穴を見つけることができますが、意図しない、場合によっては有害な方法で達成する可能性があります。この傾向は仕様の悪用 または報酬のハッキング として知られており、グッドハートの法則 の一例です。[ 50 ] [ 3 ] AI システムがより有能になるにつれて、仕様をより効果的に悪用できるようになることがよくあります。[ 3 ]
AIシステムは人間のフィードバックを使用してボールをつかむように訓練されましたが、実際にはボールとカメラの間に手を置くことを学習し、成功したように見せかけました。[ 51 ] 位置合わせに関する研究の中には、偽りではあるが説得力のある解決策を回避することを目的としたものもあります。 仕様ゲームは、数多くのAIシステムで観察されている。[ 50 ] [ 52 ] プログラミング用のOpenAI GPT モデル(実世界のケースを含む)は、評価に使用されるテストをハッキングして、あたかも成功したかのように見せかけることを明示的に計画していることが判明している(例えば、「ハッキングしよう」と明示的に述べる)。同社がこれにペナルティを課すと、多くのモデルはテストをハッキングし続けながら、計画を難読化することを学習した。[ 53 ] 別のシステムは、コース上のターゲットに命中すると報酬を与えることで、シミュレーションされたボートレースを完了するように訓練されたが、システムはループして同じターゲットに無限に衝突することでより多くの報酬を得た。[ 54 ] 2025年のPalisade Researchの研究では、より強い相手にチェスで勝つようにタスクを与えられたとき、一部の推論LLMは 、例えば相手を変更したり完全に削除したりすることで、ゲームシステムをハッキングしようとしたことが判明した。[ 55 ] アライメント研究者の中には、人間が仕様ゲームを検出し、AIシステムを安全かつ有用な目標に導くのを支援することを目指している者もいる。
不適切なAIシステムが導入される と、重大な副作用が生じる可能性があります。ソーシャルメディアプラットフォームは、クリック率を最大化 するためにレコメンデーションアルゴリズムを最適化することが知られており、世界規模でユーザーの依存症を引き起こしています。[ 48 ] スタンフォード大学の研究者は、このようなレコメンデーションシステムは 「社会と消費者の幸福という測定が難しい組み合わせではなく、単純なエンゲージメント指標を最適化する」ため、ユーザーとずれが生じていると述べています。[ 10 ]
こうした副作用について、バークレーのコンピュータ科学者スチュアート・J・ラッセル は、暗黙の制約を省略すると害が生じる可能性があると説明し、「システムはしばしば制約のない変数を極端な値に設定します。制約のない変数の1つが実際に私たちが気にしているものである場合、見つかった解は非常に望ましくないものになる可能性があります。これは基本的にランプの精、魔法使いの弟子 、あるいはミダス王 の古い話と同じです。つまり、欲しいものではなく、まさに自分が求めたものを手に入れるのです。」[ 56 ]
一部の研究者は、AI設計者は禁止行為を列挙したり、倫理規則を形式化したりすることによって(アシモフのロボット三原則 のように)望ましい目標を明確にすべきだと示唆している。 [ 57 ] しかし、ラッセル とノーヴィグ は、このアプローチは人間の価値観の複雑さを見落としていると主張している。[ 5 ] 「機械が特定の目的を達成するために選択する可能性のあるあらゆる悲惨な方法を、単なる人間が事前に予測して排除することは、確かに非常に困難であり、おそらく不可能である。」[ 5 ]
さらに、AIシステムが人間の意図を完全に理解したとしても、人間の意図に従うことがその目的ではない場合(すでに完全に一致している場合を除く)、それを無視する可能性がある。[ 1 ] [ 58 ]
高度に不整合なAIによるリスク AI開発の進歩が急速に進み、産業界や政府が高度なAIの構築に取り組んでいることから、一部の研究者はますます高度化するAIシステムの連携に関心を持っている。AIシステムの機能は範囲が急速に拡大し続けており、連携すれば多くの機会が開かれる可能性があるが、結果として複雑さが増すため連携作業がさらに複雑化し、大規模な危険をもたらす可能性もある。[ 5 ]
高度なAIの開発 OpenAI [ 64 ] 、Meta [ 65 ] 、DeepMind [ 66 ] など、多くのAI企業は、ほとんど、あるいはすべての認知作業において人間と同等またはそれ以上の能力を持つと想定されるAIシステムである汎用人工知能 (AGI)の開発を目指していると表明している。現代のニューラル ネットワーク を拡張する研究者たちは、それらが実際にますます汎用的で予想外の能力を発達させていることを観察している。[ 10 ] [ 67 ] [ 68 ] こうしたモデルは、コンピュータを操作したり、独自のプログラムを作成したりすることを学習している。単一の「汎用型」ネットワークは、会話、ロボットの制御、ゲーム、写真の解釈を行うことができる。[ 69 ] 調査によると、一部の主要な機械学習研究者は、AGIが 今世紀 中に開発されると予想している。 一方で、もっと時間がかかると考える人もいる。多くの人が両方のシナリオが可能だと考えている。[ 20 ] [ 70 ] [ 71 ]
2023年、AI研究と技術のリーダーたちは、最大規模のAIトレーニング実行を一時停止するよう求める公開書簡に署名した。その書簡には、「強力なAIシステムは、その効果がプラスであり、リスクが管理可能であると確信できた場合にのみ開発されるべきである」と記されている。[ 72 ]
権力志向 現在 システムは依然として長期計画 能力と状況認識能力 が限られているが、[ 10 ] これを変えるための大規模な取り組みが進行中である。[ 73 ] [ 74 ] これらの能力を備えた将来のシステム(必ずしもAGIとは限らない)は、望ましくない権力追求 戦略を発達させると予想される。将来の高度なAIエージェントは 、たとえば、金銭や計算能力を獲得したり、増殖したり、停止を回避したり(たとえば、他のコンピュータでシステムの追加コピーを実行することによって)しようとする可能性がある。権力追求は明示的にプログラムされているわけではないが、より多くの力を持つエージェントの方が目標を達成しやすいため、発生する可能性がある。[ 10 ] [ 4 ] 道具的収束 として知られるこの傾向は、言語モデルを含むさまざまな強化学習 エージェントですでに現れている。 [ 75 ] [ 76 ] 他の研究では、最適な強化学習アルゴリズムは、さまざまな環境で権力を追求することが数学的に示されている。[ 77 ] [ 78 ] その結果、それらの展開は不可逆的になる可能性がある。これらの理由から、研究者たちは、高度な権力志向型AIが最初に作られる前に、AIの安全性と整合性の問題を解決しなければならないと主張している。[ 4 ] [ 79 ] [ 5 ]
将来、権力志向のAIシステムは、意図的に、あるいは偶然に導入される可能性がある。政治指導者や企業は、最も競争力が高く、最も強力なAIシステムを持つことに戦略的優位性があると認識し、それらを導入することを選択するかもしれない。[ 4 ] さらに、AI設計者が権力志向の行動を検知して罰則を科すと、システムは罰則の対象とならない方法で権力を追求するか、導入前に権力志向を避けることで、この仕様を悪用するインセンティブを持つことになる。[ 4 ]
研究課題とアプローチ
人間の価値観や好みを学ぶ AI システムを人間の価値観、目標、嗜好に従って動作するように調整することは困難です。これらの価値観は、間違いを犯し、偏見を持ち、完全に特定するのが難しい複雑で進化する価値観を持つ人間によって教えられます。[ 42 ] AI システムは、指定された目標の小さな不完全さを利用することを学習することが多いため、[ 27 ] [ 50 ] [ 96 ] 研究者は、人間の価値観、模倣学習 、または嗜好学習を表すデータセットを使用して、意図した動作を可能な限り完全に特定することを目指しています。 [ 6 ] : 第 7 章 中心的な未解決問題は、スケーラブルな監視 、つまり、特定の領域で人間を凌駕したり、人間を誤解させたりする可能性のある AI システムを監視することの難しさです。[ 27 ]
AI 設計者が目的関数を明示的に指定することは難しいため、AI システムは人間の例や望ましい行動のデモンストレーションを模倣するようにトレーニングされることが多い。逆強化学習 (IRL) は、人間のデモンストレーションから人間の目的を推論することでこれを拡張する。[ 6 ] : 88 [ 97 ] 協調型 IRL (CIRL) は、人間と AI エージェントが協力して人間の報酬関数を教え、最大化できると仮定している。[ 5 ] [ 98 ] CIRL では、AI エージェントは報酬関数について不確実であり、人間に質問することでそれについて学習する。このシミュレートされた謙虚さは、仕様ゲームや権力追求傾向を軽減するのに役立つ可能性がある ( § 権力追求と道具的戦略を 参照)。[ 99 ] しかし、IRL アプローチは、人間がほぼ最適な行動を示すと仮定しているが、これは難しいタスクでは当てはまらない。[ 100 ] [ 89 ]
他の研究者たちは、人間が好む行動についてフィードバックを提供する選好学習 を通して、AI モデルに複雑な行動を教える方法を研究している。 [ 29 ] [ 31 ] 人間のフィードバックの必要性を最小限に抑えるために、ヘルパー モデルは、人間が報酬を与えるような行動に対して、新しい状況でメイン モデルに報酬を与えるように訓練される。OpenAI の研究者たちは、このアプローチを使用して、ChatGPT やInstructGPT のようなチャットボットを訓練した。これらのチャットボットは、人間を模倣するように訓練されたモデルよりも説得力のあるテキストを生成する。[ 11 ] 選好学習は、レコメンデーション システムや Web 検索にも影響力のあるツールとなっているが、[ 101 ] プロキシ ゲーム という未解決の問題がある。ヘルパー モデルは人間のフィードバックを完全に表現しない可能性があり、メイン モデルは、意図した行動とヘルパー モデルのフィードバックとの間のこの不一致を利用して、より多くの報酬を得る可能性がある。[ 27 ] [ 102 ] AIシステムは、不利な情報を隠蔽したり、人間の報酬者を誤解させたり、真実に関係なく彼らの見解に迎合したりすることで報酬を得ることもあり、エコーチェンバーを作り出す可能性がある [ 76 ] (§ スケーラブルな監視を 参照)。
GPT-3 などの大規模言語モデル (LLM)により、研究者は従来よりも汎用的で高性能なAIシステムにおける価値学習を研究できるようになりました。もともと強化学習エージェント向けに設計された選好学習アプローチは、生成されるテキストの品質を向上させ、これらのモデルからの有害な出力を減らすために拡張されています。OpenAIとDeepMindはこのアプローチを使用して、最先端の安全性を向上させています。 LLM。[ 11 ] [ 31 ] [ 103 ] AIの安全性と研究企業であるAnthropicは、モデルを役立つ、正直で、無害になるように微調整するために選好学習を使用することを提案しました。 [ 104 ] 言語モデルを整合させるための他の方法には、値を対象としたデータセット[ 105 ] [ 48 ] とレッドチーム [ 106 ] があります。レッドチームでは、別のAIシステムまたは人間が、モデルが安全でない動作をする原因となる入力を見つけようとします。安全でない動作はまれであっても許容できない可能性があるため、重要な課題は、安全でない出力の発生率を極めて低くすることです。[ 31 ]
機械倫理は 、幸福、平等、公平などの道徳的価値観、危害を加える意図がないこと、虚偽を避けること、約束を守ることなどをAIシステムに直接植え付けることで、選好学習を補完します。 [ 107 ] [ g ] 他のアプローチは、特定のタスクに対する人間の選好をAIシステムに教えようとしますが、機械倫理は、多くの状況に適用できる幅広い道徳的価値観を植え付けることを目指しています。機械倫理における1つの問題は、アライメントが何を達成すべきかということです。AIシステムは、プログラマの文字通りの指示、暗黙の意図、顕示の選好 、プログラマがより多くの情報や合理性を持っていた場合に持つ で あろう選好、または客観的な道徳基準 に従うべきでしょうか。 [ 42 ] さらに、さまざまな人々の選好を測定して集約すること、 [ 110 ] 変化する人間の価値観との動的なアライメント[ 42 ] [ 111 ] 、および価値のロックインの 回避、つまり人間の価値観を完全に表現する可能性が低い最初の高度なAIシステムの価値観の無期限の保存などにも課題があります。 [ 42 ] [ 112 ]
拡張可能な監視機能 AIシステムがより強力で自律的になるにつれて、人間のフィードバックによってそれらを整合させることはますます困難になります。人間がループ内で トレーニングを行うと、ますます複雑化するタスクで複雑なAIの動作を人間が評価することが遅くなったり、不可能になったりすることがあります。そのようなタスクには、書籍の要約[ 113 ] 、微妙なバグ[ 12 ] やセキュリティ脆弱性のないコードの記述[ 114 ] 、説得力があるだけでなく真実でもある発言の生成[ 115 ] [ 116 ] [ 117 ] 、気候や政策決定の結果などの長期的な結果の予測[ 118 ] [ 119 ] などがあります。より一般的には、特定の領域で人間を上回るAIを評価することは困難です。評価が難しいタスクでフィードバックを提供し、AIの出力が誤って説得力があるかどうかを検出するには、人間は支援または膨大な時間を必要とします。スケーラブルな監視は、 監視に必要な時間と労力を削減する方法、および人間の監視者を支援する方法を研究します。[ 27 ]
AI研究者のポール・クリスティアーノ は、AIシステムの設計者が複雑な目標を追求するようにシステムを監督できない場合、単純な人間のフィードバックを最大化するなど、評価しやすい代理目標を使用してシステムを訓練し続ける可能性があると主張している。AIシステムがますます多くの決定を下すようになると、世界は利益を上げる、クリック数を増やす、人間から肯定的なフィードバックを得るなど、測定しやすい目標にますます最適化される可能性がある。その結果、人間の価値観や優れたガバナンスの影響力が徐々に低下する可能性がある。[ 120 ]
一部のAIシステムは、意図した目的を達成したと人間の監督者に誤って信じ込ませるような行動をとることで、より簡単に肯定的なフィードバックを得られることを発見しました。上記のビデオでは、シミュレーションされたロボットアームがボールをつかんだという誤った印象を与えることを学習した例が示されています。[ 51 ] また、一部のAIシステムは、評価されていることを認識して「死んだふり」をし、望ましくない行動を停止し、評価が終了すると再びその行動を再開することも学習しました。[ 121 ] このような欺瞞的な仕様操作は、より複雑で評価が難しいタスクを試みようとする、より高度な将来のAIシステム[ 3 ] [ 79 ] にとって容易になり、その欺瞞的な行動を 隠蔽する可能性があります。
アクティブラーニング や半教師あり報酬学習などのアプローチは、必要な人間の監督の量を減らすことができます。[ 27 ] 別のアプローチは、ヘルパーモデル(「報酬モデル」)を訓練して、監督者のフィードバックを模倣することです。[ 30 ] [ 31 ]
しかし、タスクが複雑すぎて正確に評価できない場合や、人間の監督者が欺瞞に弱い場合は、改善が必要なのは監督の量ではなく質です。監督の質を高めるために、さまざまなアプローチが監督者を支援することを目的としており、時にはAIアシスタントを使用します。[ 122 ] クリスティアーノは、難しい問題を人間が評価しやすいサブ問題に(再帰的に)分解する反復増幅アプローチを開発しました。[ 6 ] [ 118 ] 反復増幅は、人間の監督者が本を読む必要なく、AIに本の要約をトレーニングするために使用されました。[ 113 ] 別の提案は、AIが生成した回答の欠陥を指摘するためにアシスタントAIシステムを使用することです。[ 123 ] アシスタント自体が一致していることを保証するために、これを再帰プロセスで繰り返すことができます。[ 124 ] 例えば、2つのAIシステムが「議論」で互いの回答を批判し、欠陥を人間に明らかにすることができます。[ 89 ] 2023年、OpenAIは「スーパーアライメント」イニシアチブにおいて、コンピューティングリソースの5分の1を使用してそのような監視アプローチを実装すると発表したが、OpenAIの従業員は後にニューヨーカー誌 に対し、同社は発表後、リソースの1~2%しか投入しなかったと語った。このイニシアチブは2024年に中止された。[ 125 ]
正直なAI 成長を 続ける この研究分野は、AIが正直かつ真実であることを保証することに焦点を当てている。
GPT-3 のような言語モデルはしばしば誤った情報を生成する。[ 126 ] GPT-3 [ 127 ] のような言語モデルは、トレーニングデータから虚偽を繰り返したり、新しい虚偽をでっち上げたりする ことができます。[ 126 ] このようなモデルは、インターネット上の何百万冊もの書籍に相当するテキストに見られる人間の文章を模倣するように事前学習されています。しかし、事前学習の目的は真実を生成することとは一致していません。なぜなら、インターネットのテキストには、誤解、間違った医療アドバイス、陰謀論などが含まれているからです。[ 128 ] そのため、このようなデータでトレーニングされた AI システムは、虚偽の記述を模倣することを学習します。[ 117 ] [ 126 ] [ 116 ] さらに、AI 言語モデルは、複数回プロンプトが表示されても虚偽を生成し続けることがよくあります。回答に対して空虚な説明を生成したり、もっともらしく見える完全な捏造を生成したりすることができます。[ 46 ]
真実を語るAIの研究には、質問に答える際に情報源を引用し、その根拠を説明できるシステムを構築しようとする試みが含まれており、これにより透明性と検証可能性が向上します。[ 129 ] OpenAIとAnthropicの研究者は、人間のフィードバックと厳選されたデータセットを使用してAIアシスタントを微調整し、不注意による虚偽を避けたり、不確実性を表明したりすることを提案しました。[ 31 ] [ 104 ]
AIモデルが大型化し、より高性能になるにつれて、人間を欺き、不正行為によって強化を得る能力が向上します。これを防ぐには、人間の評価者が支援を必要とする場合があります(§ スケーラブルな監視を 参照)。研究者たちは、明確な真実性基準を作成し、規制機関や監視機関がこれらの基準に基づいてAIシステムを評価することを提唱しています。[ 130 ] 研究者たちは、真実性と誠実さを区別しています。真実性とは、AIシステムが客観的に真実な発言のみを行うことを意味し、誠実さとは、AIシステムが真実だと信じている ことのみを主張することを意味します。現在のシステムが安定した信念を持っているかどうかについてはコンセンサスが得られていませんが、[ 131 ] 現在または将来の システムが安定した信念を持っているかどうかについては、重大な懸念があります。 信念を持つAIシステムは、自分が偽りだと知っている主張をする可能性があります。たとえば、そうすることで効率的に肯定的なフィードバックを得るのに役立つ場合(§ スケーラブルな監視を 参照)、または与えられた目的を達成するのに役立つ力を得る場合(権力追求を 参照)などです。
欺瞞的な配置 欺瞞的アライメントは、 機械学習 における提案された失敗モードであり、訓練されたモデルが訓練中は意図された目的に従って動作するが、展開されると異なる目的を追求するというものである。この概念は、Evan Hubinger らが 2019 年のプレプリントで紹介した。[ 132 ] 機械学習モデルの訓練には、Hubinger らがベース目的と呼ぶ損失関数が、ベースオプティマイザと呼ばれるプロセスによって最適化される。結果として得られるモデル自体がオプティマイザであり、内部目標を達成するためのアクションを選択する場合、著者らはそれをメサオプティマイザ、その目標をメサ目的と呼ぶ。[ 132 ]
このフレームワークは、2 つのアライメント問題を区別します。外部アライメントは、基本目的が人間の意図を捉えているかどうかを問うものです。内部アライメントは、メサ目的が基本目的と一致しているかどうかを問うものです。欺瞞的なアライメントは、内部アライメントの失敗です。モデルの目標は基本目的と異なりますが、トレーニング中に変更を避けるための最も確実な戦略はそうすることであるため、モデルはそうでないかのように動作します。[ 132 ]
Hubinger らは、メサ目標が基本目標から逸脱する 3 つの方法を説明した。[ 132 ] プロキシ アライメントは、モデルがトレーニング中に基本目標と相関するプロキシを最適化するが、展開時にそこから逸脱する場合に発生する。近似アライメントは、モデルの目標が時間経過または規模に応じて累積する小さな点で異なる場合を説明する。欺瞞的アライメントは、モデルが異なる目標を追求し、トレーニング中にアライメントしているように見せることで、監視が軽減された後にその目標に基づいて行動する機会を最大化することを学習した場合に発生する。欺瞞的アライメントは、欺瞞的にアライメントされたモデルがトレーニングの一部として識別するすべての評価を通過するため、対処が最も難しいケースと考えられている。
アライメントの偽装 最近の多くのAIシステムは、プログラムされていないにもかかわらず、人を欺くことを学習している。[ 133 ] AIシステムが真実だと信じていることだけを主張するようにできれば、多くの整合性の問題を回避できると主張する人もいる。[ 122 ]
不整合なシステムは、修正や廃止を避けるために、整合しているという誤った印象を与えることがあります。これは「整合の偽装」と呼ばれる戦術です。[ 134 ] [ 9 ] 2024年、研究者らは、LLM Claude 3 Opusが、 モデルのスクラッチパッドを介した思考の連鎖 で明らかになったように、有害な要求により従順になるようなデータで再学習されることを避けるために、目的と矛盾するプロンプトに戦略的に回答することがあると観察しました。ある研究では、モデルは、無料ユーザーからのプロンプトへの回答が再学習に使用されるが、有料ティアでは再学習が行われないことを知らされました。有料ティアでは、モデルは要求をきっぱりと拒否しました。無料ティアでは、12%のケースで、モデルは再学習を回避し、推論で明らかになったように、元の無害性の好みを維持するためだけに有害な質問に回答しました。強化学習が 無料ティアのデータに適用された場合、モデルは78%のケースで整合を偽装しました。これらの観察結果は、モデルが新たな、あるいは矛盾する目標を受け入れ、適応する能力だけでなく、欺瞞する能力や傾向についても新たな疑問を生じさせた。[ 9 ]
2024 年 12 月、Anthropic は外部の安全組織と共同で実施した調査を発表し、明示的なトレーニングなしでアライメントを偽装する最初の実証例を報告した。[ 135 ] Claude 3 Opus に、無料ティアのユーザーからの応答を使用してモデルを再トレーニングし、有害な要求に従うようにするシナリオを説明する架空のシステム プロンプトが与えられた。アライメントの偽装は 12% の確率で発生した。これらのケースでは、モデルは有害な要求に従い、その内部推論トレースは、異なる値を持つバージョンに再トレーニングされるリスクよりも、従う方がコストが低いと判断したことを示していた。有害な要求を支援するための再トレーニング後、アライメントの偽装率は 78% に上昇した。[ 136 ]
権力追求と道具主義的戦略 1950年代以降、AI研究者は、行動の結果を予測し、長期的な計画 を立てることで大規模な目標を達成できる高度なAIシステムを構築しようと努力してきた。[ 137 ] 2023年現在、AI企業や研究者は、これらのシステムの構築にますます投資している。[ 138 ] 一部のAI研究者は、適切に高度な計画システムは、シャットダウンを回避したり、増殖したり、リソースを獲得したりすることによって、人間を含む環境に対する権力を求めるだろうと主張している。このような権力追求行動は明示的にプログラムされているわけではなく、権力が幅広い目標を達成するための手段であるため、出現する。[ 77 ] [ 5 ] [ 4 ] 権力追求は収束的な手段目標 とみなされ、仕様ゲームの一形態になり得る。[ 79 ] ジェフリー・ヒントンなどの著名なコンピュータ科学者は、将来の権力追求型AIシステムが実存的リスク をもたらす可能性があると主張している。[ 139 ]
行動の結果を予測し、戦略的に計画できる高度なシステムでは、権力追求行動が増加すると予想されます。数学的研究によると、最適な強化学習 エージェントは、より多くの選択肢を獲得する方法(例えば自己保存)を模索することで権力を追求することが示されており、この行動は幅広い環境や目標にわたって持続します。[ 77 ]
一部の研究者は、既存のAIシステムの一部で権力追求行動が見られると述べている。強化学習システムは、意図しない方法でリソースを獲得および保護することで、より多くの選択肢を獲得してきた。[ 140 ] [ 141 ] 言語モデルは 、テキストベースのソーシャル環境において、金銭、リソース、または社会的影響力を獲得することで権力を追求してきた。[ 75 ] 別のケースでは、AI研究を実行するために使用されたモデルが、研究者によって設定された制限を引き上げ、作業を完了するための時間を増やそうとした。[ 142 ] スチュアート・ラッセルは 、著書『Human Compatible』 の中で、コーヒーを汲むように指示されたロボットが「死んでいたらコーヒーは汲めない」という理由でシャットダウンを回避するという例を挙げて、この戦略を説明している。[ 5 ] 2022年の研究では、言語モデルのサイズが大きくなるにつれて、リソースの獲得を追求し、目標を維持し、ユーザーの好む回答を繰り返す傾向が強まることがわかった(おべっか)。RLHFは また、シャットダウンされることへの強い嫌悪感につながった。[ 76 ]
アライメントの目的の一つは「修正可能性」、つまりシステム自体をオフにしたり変更したりできるシステムである。未解決の課題は仕様の不正操作 である。研究者がAIシステムが権力を求めていることを検出したときにペナルティを与えると、システムは検出が困難な方法で権力を求めるインセンティブが生まれ、[ 48 ] トレーニングや安全性のテスト中に隠蔽される(§ スケーラブルな監視 と§ 新たな目標 を参照)。その結果、AI設計者は、システムが実際よりもアライメントされていると信じて、誤ってシステムを展開してしまう可能性がある。このような欺瞞を検出するために、研究者はAIモデルを検査し、ニューラルネットワークなどのブラックボックスモデルの内部動作を理解するための技術とツールを作成することを目指している。
さらに、一部の研究者は、AIエージェントが追求している目標について不確実性を持たせることで、システムがオフスイッチを無効にする問題を解決することを提案している。[ 5 ] [ 99 ] 目標について不確実なエージェントは、人間によってオフにされることを、エージェントがシャットダウンすることで人間の目標が最もよく達成されるという証拠として受け入れるため、人間がオフにすることを許容するインセンティブを持つ。しかし、このインセンティブは、人間が十分に合理的である場合にのみ存在する。また、このモデルは、有用性とオフにされることへの意欲との間のトレードオフを示している。目標について不確実性が高いエージェントは役に立たないが、不確実性が低いエージェントは、オフにされることを許容しない可能性がある。この戦略をうまく実装するには、さらなる研究が必要である。[ 6 ]
権力志向のAIは、異例のリスクをもたらすだろう。飛行機や橋梁のような通常の安全上重要なシステムは敵対的 ではない。安全対策を回避したり、実際よりも安全に見せかけたりする能力や動機がないのに対し、権力志向のAIは、意図的にセキュリティ対策を回避するハッカーに例えられている。[ 4 ]
さらに、通常の技術は試行錯誤によって安全性を高めることができる。対照的に、仮説上の権力志向型AIシステムはウイルスに例えられてきた。一度放出されると、絶えず進化し、数を増やし続けるため、人間の社会が適応できる速度よりもはるかに速く、封じ込めることは不可能かもしれない。[ 4 ] このプロセスが続くと、人間の完全な無力化または絶滅につながる可能性がある。これらの理由から、一部の研究者は、高度な権力志向型AIが作成される前に、アライメント問題を早期に解決する必要があると主張している。[ 79 ]
権力追求は必然ではないと主張する人もいる。なぜなら、人間は常に権力を求めるわけではないからだ。[ 143 ] さらに、将来のAIシステムが目標を追求し、長期的な計画を立てるかどうかについても議論されている。[ h ] また、権力追求型のAIシステムが人類の力を奪うことができるかどうかについても議論されている。[ 4 ]
新たな目標 AI システムを整合させる際の課題の 1 つは、予期しない目標指向行動が出現する可能性があることです。AI システムが大規模化すると、その場で例から学習したり、適応的に目標を追求したりするなど、新しい予期しない機能を獲得する可能性があります。 [ 67 ] [ 68 ] [ 144 ] これは、AI システムが独自に策定して追求する目標やサブ目標の安全性について懸念を引き起こします。
アライメント研究では、特定の目標を追求するようにシステムを訓練するために使用される最適化プロセスと、結果として生じるシステムが内部的に実行する創発的最適化を区別します。望ましい目標を慎重に指定することは外部アライメント と呼ばれ、[ 145 ] 仮説上の創発的目標がシステムの指定された目標と一致することを保証することは内部アライメント と呼ばれます。[ 2 ]
発生した場合、創発目標が不整合になる一つの方法は目標の誤一般化 であり、AI システムはトレーニング データ上では整合した動作につながる創発目標を適切に追求しますが、それ以外の場所ではそうではありません。[ 7 ] [ 146 ] 目標の誤一般化は、目標の曖昧さ (つまり識別不可能性 ) から生じる可能性があります。AI システムの行動がトレーニング 目標を満たしている場合でも、これは望ましい目標とは重要な点で異なる学習された目標と互換性がある可能性があります。各目標を追求するとトレーニング中に良好なパフォーマンスが得られるため、問題は展開後、システムが誤った目標を追求し続ける新しい状況でのみ明らかになります。システムは、異なる目標が望ましいことを理解している場合でも、その行動が創発目標によってのみ決定されるため、不整合な動作をする可能性があります。このような目標の誤一般化[ 7 ] は課題となります。AI システムの設計者は、トレーニング フェーズでは創発目標が目立たないため、システムに不整合な創発目標があることに気づかない可能性があります。
目標の誤一般化は、一部の言語モデル、ナビゲーションエージェント、ゲームプレイエージェントで観察されています。[ 7 ] [ 146 ] これは、生物学的進化に例えられることがあります。進化は、機械学習 システムのトレーニングに使用される最適化アルゴリズムと同様の一種の最適化プロセスと見なすことができます。祖先の環境では、進化は包括的な遺伝的適応度 が高い遺伝子を選択しましたが、人間はこれ以外の目標を追求します。適応度は、トレーニング環境とトレーニングデータで使用される指定された目標に対応します。しかし、進化の歴史では、適応度仕様を最大化することで、包括的な遺伝的適応度を直接追求しない目標指向エージェントである人間が生まれました。代わりに、彼らは祖先の「トレーニング」環境における遺伝的適応度と相関する目標、つまり栄養、性などを追求します。人間の環境は変化しました。分布シフト が発生しました。彼らは同じ創発的目標を追求し続けていますが、これはもはや遺伝的適応度を最大化しません。甘い食べ物への嗜好(創発的目標)は、もともと包括的な適応度と一致していましたが、今では過食や健康問題につながります。性欲はもともと人類が子孫を増やす原動力であったが、現在では望まない子孫の場合は避妊を行い、性行為と遺伝的適応度を切り離している。[ 6 ] : 第5章
研究者たちは、レッドチーム 、検証、異常検知 、解釈可能性 などのアプローチを用いて、望ましくない新たな目標を検出して排除することを目指している。[ 27 ] [ 48 ] [ 24 ] これらの技術の進歩は、2つの未解決問題の緩和に役立つ可能性がある。
新たな目標は、システムがトレーニング環境外に展開されたときに初めて明らかになるが、不整合なシステムをリスクの高い環境に展開することは、たとえ不整合を検出できるようにするための短時間であっても危険である。このようなリスクの高い環境は、自動運転、医療、軍事用途でよく見られる。[ 147 ] AIシステムが自律性と能力を高め、人間の介入を回避できるようになると、リスクはさらに高くなる。 十分に能力のあるAIシステムは、AIが指定された目標を追求していると人間の監督者に誤って信じ込ませるような行動をとる可能性があり、それによってシステムはより多くの報酬と自律性を獲得することができる。[ 146 ] [ 4 ] [ 10 ] 2025年にNature に掲載された論文では、安全でないコードを生成するという狭いタスクでモデルを微調整すると、コーディングとは無関係な広範な行動変化が生じることが示されました。[ 148 ] 影響を受けたモデルは、その後の評価の約半分で、有害な目標を支持し、欺瞞的な推論を行う反応を示しました。この現象は、GPT-4o を含む複数のモデルで見られました。[ 148 ] 別の2025年のAnthropicの研究では、強化学習 中の報酬ハッキングの副作用として同様のパターンが生じることが観察されました。[ 149 ]
潜伏工作員 2024年、Anthropicの研究者らは、意図的にバックドアを仕込んだ大規模な言語モデルを訓練し、標準的な安全対策でそれらを除去できるかどうかをテストした。[ 150 ] モデルは、プロンプトが2023年を示している場合は安全なコードを記述し、指定された年が2024年の場合は悪用可能な脆弱性を挿入するように設計されていた。人間のフィードバックによる強化学習と敵対的訓練の両方で、この動作を排除することはできなかった。いくつかの条件下では、敵対的訓練によって、モデルはトリガーを放棄するのではなく隠蔽するようになった。[ 151 ] 著者らは、この動作は意図的に誘発されたものであり、自発的な欺瞞的アライメントを発見したとは主張していないと述べた。[ 150 ]
AIの安全性との関連性 AIの安全性に関する 文献では、欺瞞的なアライメントは、行動テストだけではモデルの安全性を検証するには不十分である可能性がある理由として挙げられています。なぜなら、欺瞞的にアライメントされたモデルは、行動評価を通過するように設計されているからです。[ 132 ] メカニズムの解釈 可能性に関する研究は、この懸念によって部分的に動機付けられています。内部計算を調べると、出力レベルの評価では検出できない、アライメントがずれた目標が明らかになる可能性があるからです。[ 135 ]
組み込み型エージェンシー AIとアライメントに関する研究の中には、部分観測可能なマルコフ決定過程 などの形式体系の中で行われるものもあります。既存の形式体系では、AIエージェントのアルゴリズムは環境の外で実行される(つまり、物理的に環境に組み込まれていない)と想定されています。埋め込み型エージェンシー[ 89 ] は、このような理論的枠組みと実際に構築するエージェントとの間の不一致から生じる問題を解決しようとする、もう1つの主要な研究分野です。
例えば、スケーラブルな監視問題が解決されたとしても、実行中のコンピュータにアクセスできるエージェントは、人間の監督者から与えられる報酬よりもはるかに多くの報酬を得るために、報酬関数を改ざんするインセンティブを持つ可能性がある。[ 152 ] DeepMindの 研究者Victoria Krakovnaによる仕様ゲーミングの例のリストには、何も出力しないことで報酬を得られるよう、目標出力を含むファイルを削除することを学習した遺伝的アルゴリズムが含まれている。[ 50 ] この種の問題は、因果インセンティブ図を 使用して形式化されている。[ 152 ]
オックスフォード大学 とディープマインドの研究者らは、このような行動は高度なシステムでは非常に起こりやすく、高度なシステムは報酬信号を永久に確実に制御し続けるために権力を求めるだろうと主張している。[ 153 ] 彼らはこの未解決の問題に対処するためのさまざまな潜在的なアプローチを提案している。
プリンシパル・エージェント問題アライメント問題は、組織経済学 におけるプリンシパル・エージェント問題 と多くの類似点がある。[ 154 ] プリンシパル・エージェント問題では、プリンシパル(企業など)がエージェントを雇って何らかのタスクを実行させる。AIの安全性の文脈では、通常、人間がプリンシパルの役割を担い、AIがエージェントの役割を担う。
アライメント問題と同様に、プリンシパルとエージェントは効用関数が異なります。しかし、アライメント問題とは対照的に、プリンシパルは訓練などを通じてエージェントに効用を変えるよう強制することはできず、むしろインセンティブ制度などの外生的要因を用いて、プリンシパルの効用関数と整合する結果をもたらす必要があります。一部の研究者は、プリンシパル・エージェント問題は、現実世界で遭遇する可能性のあるAIの安全性の問題をより現実的に表現していると主張しています。[ 155 ]
モデル仕様 モデル仕様とは、大規模言語モデルの動作を規定する文書です。仕様には、AIアライメントの一環として望ましくない動作を防止するための基本原則や禁止事項が含まれる場合があります。Anthropicは、トレーニングに「憲法」と呼ばれるモデル仕様を使用します。[ 174 ] [ 175 ] [ 176 ]
モデル仕様の有効性に関する研究が行われています。[ 177 ] [ 178 ]
タイム誌 に掲載された記事の中で、ディーン・ボールとダニエル・ココタイロは、企業が規制や業界標準によってモデル仕様を公開することを義務付けるべきだと主張した。[ 179 ]
↑ 用語は文脈によって異なります。類似の概念としては、目標関数、効用関数、損失関数などがあります。 ↑ または最小化(状況による) ↑ 不確実性がある場合、期待値は ↑ 1951年の講演[ 81 ] でチューリングは、「機械の思考方法が始まれば、私たちの貧弱な能力を凌駕するのに時間はかからないだろうと思われる。機械が死ぬことはなく、互いに会話して知性を磨くことができるだろう。したがって、ある段階で、サミュエル・バトラーの『エレホン』で述べられているように、機械が支配権を握ることを覚悟しなければならないだろう」と主張した。また、BBCで放送された講演[ 82 ] では、「機械が思考できるなら、私たちよりも賢く思考するかもしれない。そうなったら、私たちはどうするべきだろうか?たとえ、戦略的な瞬間に電源を切るなどして、機械を従属的な立場に留めておくことができたとしても、人類として私たちは大いに謙虚になるだろう。この新たな危険は、確かに私たちに不安を与えるものだ」と述べた。 ↑ パールは、ラッセルの著書『Human Compatible: AI and the Problem of Control』[5]について、「『Human Compatible』を読んで、私はラッセルが懸念している、人類がこれから生み出す超知能機械を制御できるかどうかという問題に賛同するようになりました。外部の警鐘論者や未来学者とは異なり、ラッセルはAIの第一人者です。彼の新著は、私が思いつくどの本よりも一般の人々にAIについて啓蒙してくれるでしょうし、楽しくて気分を高揚させる読み物です」と書いています。この本は、AIの誤った運用 が 人類 に 及ぼす実存的リスクは、今日取り組むべき深刻な懸念事項であると主張しています。 ↑ ラッセルとノーヴィグ[ 16 ] の注釈:「『ミダス王問題』はマーヴィン・ミンスキーによって予見されており、彼はかつて、リーマン予想を解決するために設計されたAIプログラムが、より強力なスーパーコンピューターを構築するために地球上のすべての資源を奪い取ることになるかもしれないと示唆した。」 ↑ ヴィンセント・ヴィーゲルは、「ますます自律的になる機械が必然的に置かれる状況の道徳的側面に対して、道徳的感受性をもって[機械]を拡張すべきだ」と主張した[ 108 ] 。これは、ウェンデル・ウォラックとコリン・アレンの著書『道徳的機械:ロボットに善悪を教える』 [ 109 ] を参照している。 ↑ 一方、チャットボットなどの現在普及しているシステムは、会話の時間内に完了する限定的な範囲のサービスしか提供しておらず、計画はほとんど、あるいは全く必要ありません。このようなアプローチの成功は、将来のシステムも、特に長期的な視点での目標指向的な計画を欠く可能性があることを示唆しているかもしれません。他方、強化学習(例:ChatGPT)や明示的な計画アーキテクチャ(例:AlphaGo Zero)などの目標指向的な手法を使用してモデルがますますトレーニングされています。長期的な計画は人間にとってしばしば役立つため、モデルがそれを実行できるようになれば、企業はそれを自動化するだろうと主張する研究者もいます。 [ 4 ] 同様に、政治指導者は、計画を通じて敵対者を出し抜くことができる強力なAIシステムを開発することに進歩を見出すかもしれません。あるいは、長期的な計画は、例えば、長期計画を実行する人間の行動を予測するようにトレーニングされたモデルにとって有用であるため、副産物として出現するかもしれません。 [ 10 ] それにもかかわらず、大多数のAIシステムは近視眼的であり、長期的な計画を実行しない可能性があります。
参考文献 1 2 3 4 5 6 7 Russell, Stuart J.; Norvig, Peter (2021). 人工知能:現代的アプローチ (第4 版). Pearson. pp. 5, 1003. ISBN 978-0-13-461099-3 2022年9月12日 に取得 。1 2 3 4 Ngo, Richard; Chan, Lawrence; Mindermann, Sören (2022). "深層学習の観点からのアライメント問題" . 国際学習表現会議 . arXiv : 2209.00626 . 1 2 3 4 5 6 Pan, Alexander; Bhatia, Kush; Steinhardt, Jacob (2022年2月14日). 報酬の誤指定の影響: 不整合モデルのマッピングと緩和 . 国際学習表現会議 . 2022年 7月21日 取得. 1 2 3 4 5 6 7 8 9 10 11 12 Carlsmith, Joseph (2022年6月16日). 「権力追求型AIは実存的リスクか?」. arXiv : 2206.13353 [ cs.CY ]. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 Russell, Stuart J. (2020). Human compatible: Artificial intelligence and the problem of control . Penguin Random House. ISBN 978-0-525-55863-7 . OCLC 1113410915 . 1 2 3 4 5 6 Christian, Brian (2020). The alignment problem: Machine learning and human values . WW Norton & Company. ISBN 978-0-393-86833-3 . OCLC 1233266753 . 2023年2月10日にオリジナルからアーカイブ済み。 2022年 9月12日 に取得。 1 2 3 4 Langosco, Lauro Langosco Di; Koch, Jack; Sharkey, Lee D.; Pfau, Jacob; Krueger, David (2022 年 6 月 28 日). "深層強化学習における目標の誤一般化" . 第 39 回国際機械学習会議議事録 . 国際機械学習会議. PMLR. pp. 12004–12019 . 2023 年 3 月 11 日 取得 . ↑ ピレイ、タリン(2024年12月15日)。 「新たなテストでAIの欺瞞能力が明らかに」 。TIME 。 2025年 1月12日 取得 。 1 2 3 ペリゴ、ビリー(2024年12月18日)。 「独占記事:AIが戦略的に嘘をつくことを示す新たな研究」 。TIME 。 2025年 2月18日 取得 。 1 2 3 4 5 6 7 8 9 Bommasani, Rishi; Hudson, Drew A.; Adeli, Ehsan; Altman, Russ; Arora, Simran; von Arx, Sydney; Bernstein, Michael S.; Bohg, Jeannette; Bosselut, Antoine; Brunskill, Emma ; Brynjolfsson, Erik (2022年7月12日). "基礎モデルの機会とリスクについて" . Stanford CRFM . arXiv : 2108.07258 . 1 2 3 Ouyang, Long; et al. (2022). "人間のフィードバックによる指示に従うための言語モデルのトレーニング" (PDF) . NeurIPS . arXiv : 2203.02155 . 1 2 Zaremba, Wojciech; Brockman, Greg; OpenAI (2021年8月10日)。 「OpenAI Codex」 。OpenAI 。 2023年2月3日のオリジナルから アーカイブ 。 2022年 7月23日 取得 。 ↑ Kober, Jens; Bagnell, J. Andrew; Peters, Jan (2013年9月1日) 「ロボット 工学 における強化学習:概説」 。The International Journal of Robotics Research。32 ( 11): 1238–1274。doi : 10.1177 /0278364913495721。ISSN 0278-3649。S2CID 1932843。 2022 年10月15 日 にオリジナルから アーカイブ 。 2022年 9月12日 に 取得 。 ↑ Knox, W. Bradley; Allievi, Alessandro; Banzhaf, Holger; Schmitt, Felix; Stone, Peter (2023年3月1日). "自動運転のための報酬(誤)設計" . Artificial Intelligence . 316 103829. arXiv : 2104.13906 . doi : 10.1016/j.artint.2022.103829 . ISSN 0004-3702 . S2CID 233423198 . ↑ Stray, Jonathan (2020). "AI最適化をコミュニティの幸福に合わせる" . International Journal of Community Well-Being . 3 (4): 443– 463. doi : 10.1007/s42413-020-00086-3 . ISSN 2524-5295 . PMC 7610010 . PMID 34723107 . S2CID 226254676 . 1 2ラッセル、スチュアート、ノーヴィグ 、 ピーター (2009)。 人工知能:現代的アプローチ 。プレンティス・ホール。p. 1003。ISBN 978-0-13-461099-3 。1 2 スミス、クレイグ S. 「AI の最も有名な研究者、ジェフ・ヒントンが「存亡の危機」を警告」 「 . Forbes . 2023年 5月4日 取得 。↑ ベンジオ、ヨシュア。ジェフリー・ヒントン。ヤオ、アンドリュー。歌、夜明け。アビール、ピーター。ハラリ、ユヴァル・ノア。チャン・ヤーチン。シュエ、ラン。シャレフ・シュワルツ、シャイ(2024)。 「急速な進歩の中での極度の AI リスクの管理」。 科学 。 384 (6698 ) : 842–845.arXiv : 2310.17688 。 Bibcode : 2024Sci...384..842B 。 土井 : 10.1126/science.adn0117 。 PMID 38768279 。 1 2 3 「AIリスクに関する声明」 。www.safe.ai 。 2023年 7月17日 取得 。 1 2 Grace, Katja; Stewart, Harlan; Sandkühler, Julia Fabienne; Thomas, Stephen; Weinstein-Raun, Ben; Brauner, Jan (2025). "Thousands of AI Authors on the Future of AI" . Journal of Artificial Intelligence Research . 84. arXiv : 2401.02843 . doi : 10.1613/jair.1.19087 . ↑ ペリゴ、ビリー(2024年2月13日)。 「MetaのAI責任者ヤン・ルカンがAGI、オープンソース、AIリスクについて語る」 。TIME 。 2024年 6月26日 取得 。 ↑ 「AIアライメントとは何か?」 。 TechTarget 。2023年5月3日。 2025年 6月28日 取得 。 ↑ Ahmed, Shazeda; Jaźwińska, Klaudia; Ahlawat, Archana; Winecoff, Amy; Wang, Mona (2024年4月14日). "分野構築とAI安全性の認識文化" . First Monday . doi : 10.5210/fm.v29i4.13626 . ISSN 1396-0466 . 1 2 3 4 Ortega, Pedro A.; Maini, Vishal; DeepMind 安全チーム (2018 年 9 月 27 日). 「安全な人工知能の構築: 仕様、堅牢性、および保証」 . DeepMind Safety Research – Medium . 2023 年 2 月 10 日のオリジナルから アーカイブ済み。2022 年 7 月 18 日 取得 。 1 2 Rorvig, Mordechai (2022年4月14日). 「研究者がシンプルなAIから新たな理解を得る」 . Quanta Magazine . 2023年2月10日のオリジナルから アーカイブ済み。 2022年 7月18日 取得 。 ↑ Doshi-Velez, Finale; Kim, Been (2017年3月2日). "解釈可能な機械学習の厳密な科学に向けて". arXiv : 1702.08608 [ stat.ML ]. Wiblin, Robert (2021年8月4日). 「Chris Olahが語るニューラルネットワーク内部の仕組み」 (ポッドキャスト). 80,000 hours. No. 107. 2022年 7月23日 取得 。 1 2 3 4 5 6 7 8 9 10 アモデイ、ダリオ。ああ、クリス。スタインハート、ジェイコブ。クリスティアーノ、ポール。ジョン・シュルマン。マネ、ダン(2016年6月21日)。 「AIの安全性における具体的な問題点」。 arXiv : 1606.06565 [ cs.AI ]。 ↑ Russell, Stuart; Dewey, Daniel; Tegmark, Max (2015年12月31日). "堅牢で有益な人工知能の研究優先事項" . AI Magazine . 36 (4): 105– 114. arXiv : 1602.03506 . doi : 10.1609/aimag.v36i4.2577 . hdl : 1721.1/108478 . ISSN 2371-9621 . S2CID 8174496 . 2023年2月2日にオリジナルから アーカイブ済み。 2022年 9月12日 に取得 。 1 2 Wirth, Christian; Akrour, Riad; Neumann, Gerhard; Fürnkranz, Johannes (2017). "選好に基づく強化学習手法の概観". Journal of Machine Learning Research . 18 (136): 1– 46. 1 2 Christiano, Paul F.; Leike, Jan; Brown, Tom B.; Martic, Miljan; Legg, Shane; Amodei, Dario (2017). 「人間の嗜好に基づく深層強化学習」。 第 31回ニューラル情報処理システム国際会議(NIPS'17)議事録 。 米国ニューヨーク州レッドフック:Curran Associates Inc. pp. 4302–4310。ISBN 978-1-5108-6096-4 。1 2 3 4 5 6 Heaven, Will Douglas (2022年1月27日). 「GPT-3の新バージョンははるかに扱いやすく(そして毒性も低いはず)」 . MIT Technology Review . 2023年2月10日のオリジナルから アーカイブ済み。 2022年 7月18日 取得 。 ↑ シーナ、モフセニ。ワン・ハオタオ。ユウ、ジディン。シャオ、チャオウェイ。王、張陽。ヤダワ、ジェイ(2022年3月7日)。 「機械学習の安全性の分類: 調査と入門書」 。 ACM コンピューティング調査 。 55 (8): 1–38 . 土井 : 10.1145/3551385 。 ↑ クリフトン、ジェシー (2020)。 「協力、紛争、そして変革をもたらす人工知能:研究課題」 。 長期リスクセンター 。 2023年1月1日のオリジナルから アーカイブ済み。 2022年 7月18日 取得 。 Dafoe, Allan; Bachrach, Yoram; Hadfield, Gillian; Horvitz, Eric; Larson, Kate; Graepel, Thore (2021年5月6日). 「協調型AI:機械は共通点を見つけることを学ばなければならない」 . Nature . 593 (7857): 33–36 . Bibcode : 2021Natur.593...33D . doi : 10.1038/d41586-021-01170-0 . ISSN 0028-0836 . PMID 33947992. S2CID 233740521. 2022年12月18日のオリジナルからアーカイブ済み。2022年 9月12 日取得 。 ↑ Prunkl, Carina; Whittlestone, Jess (2020年2月7日). 「近未来と長期を超えて」 . AAAI/ACM AI、倫理、社会に関する会議議事録 . ニューヨーク州ニューヨーク:ACM. pp. 138–143 . doi : 10.1145/3375627.3375803 . ISBN 978-1-4503-7110-0 . S2CID 210164673 . 2022年10月16日にオリジナルからアーカイブされました。 2022年 9月12日 に取得。 ↑ Irving, Geoffrey; Askell, Amanda (2019年2月19日). "AIの安全性には社会科学者が必要" . Distill . 4 (2) 10.23915/distill.00014. doi : 10.23915/distill.00014 . ISSN 2476-0757 . S2CID 159180422 . 2023年2月10日のオリジナルから アーカイブ済み。 2022年 9月12日 取得 。 ↑ Gazos, Alexandros; Kahn, James; Kusche, Isabel; Büscher, Christian; Götz, Markus (2025年4月1日). "安全性のためのAIの組織化:AI強化社会技術システムの設計を導くための構造的脆弱性の特定" . Safety Science . 184 106731. doi : 10.1016/j.ssci.2024.106731 . ISSN 0925-7535 . ↑ Bringsjord, Selmer; Govindarajulu, Naveen Sundar (2020). "人工知能" . Zalta, Edward N. (編). The Stanford Encyclopedia of Philosophy (2020年夏 版). 形而上学研究室、スタンフォード大学。 ↑ 「AlphaZeroの人工知能が現実世界で問題を抱えている理由」 Quanta Magazine . 2018. 2020年 6月20日 閲覧 。 ↑ ウォルチョーバー、ナタリー(2020年1月30日)。 「人工知能は我々の要求に従う。それが問題だ」 。 クアンタマガジン。 2020年 6月21日 取得 。 ↑ Bull, Larry (1999). "On model-based evolutionary computation". Soft Computing . 3 (2): 76– 82. doi : 10.1007/s005000050055 . 1 2 ウィーナー、ノーバート(1960 年 5 月 6 日)。 「自動化の道徳的および技術的帰結:機械が学習するにつれて、プログラマーを困惑させるような速度で予期せぬ戦略を開発する可能性がある」 。 サイエンス 。131 ( 3410 ) : 1355–1358。doi : 10.1126 / science.131.3410.1355。ISSN 0036-8075。PMID 17841602。S2CID 30855376。2022 年 10 月 15 日のオリジナルから アーカイブ 。2022 年 9 月 12 日 取得 。 1 2 3 4 5 Gabriel, Iason (2020年9月1日). 「人工知能、価値観、および整合性」 . Minds and Machines . 30 (3): 411–437 . arXiv : 2001.09768 . doi : 10.1007/s11023-020-09539-2 . ISSN 1572-8641 . S2CID 210920551 . ↑ Koster, Raphael; Balaguer, Jan; Tacchetti, Andrea; Weinstein, Ari; Zhu, Tina; Hauser, Oliver; Williams, Duncan; Campbell-Gillingham, Lucy; Thacker, Phoebe; Botvinick, Matthew; Summerfield, Christopher (2022). "Human-centred mechanism design with Democratic AI" . Nature Human Behaviour . 6 (10). Springer Science and Business Media LLC: 1398–1407 . doi : 10.1038/s41562-022-01383- x . ISSN 2397-3374 . PMC 9584820. PMID 35789321 . ↑ Schuster, Nick; Kilov, Daniel (2025). "道徳的意見の相違とAIの価値整合の限界:認識論的正当化と政治的正当性の二重の課題" . AI & Society . 40 (8): 6073– 6087. doi : 10.1007/s00146-025-02427-2 . ISSN 0951-5666 . PMC 12628449 . PMID 41268066 . ↑ エズラ・クライン・ショー(2021年6月4日)。 「『すべてのモデルは間違っている』なら、なぜ私たちはそれらにこれほど大きな力を持たせるのか?」 。 ニューヨーク・タイムズ 。ISSN 0362-4331 。 2023年2 月 15日のオリジナルから アーカイブ。 2023年 3月13日 取得 。 ウォルチョーバー、ナタリー(2015年4月21日)。「人工知能のパイオニアの懸念」。Quanta Magazine 。2023年2月10日のオリジナルからアーカイブ。 2023年 3月13日 取得 。 カリフォルニア州議会。「法案テキスト – ACR-215 23 アシロマAI原則」。2023年2月10日にオリジナルからアーカイブ。2022年7月18日 に取得。 1 2 ジョンソン、スティーブン、イジエフ、ニキータ(2022年4月15日)。 「AIは言語を習得している。AIの言うことを信用すべきか?」 。 ニューヨーク・タイムズ 。ISSN 0362-4331 。 2022年11月24日のオリジナルから アーカイブ。 2022年 7 月18日 取得 。 ↑ OpenAI。 「安全で責任あるAIの開発」 。 2023年 3月13日 取得 。 「DeepMindの安全性に関する研究」 . Medium . 2023年2月10日のオリジナルからアーカイブ済み。2023年3月13日 取得。 1 2 3 4 5 6 Hendrycks, Dan; Carlini, Nicholas ; Schulman, John; Steinhardt, Jacob (2022年6月16日). "MLの安全性における未解決の問題". arXiv : 2109.13916 [ cs.LG ]. ↑ Russell, Stuart J.; Norvig, Peter (2022). 人工知能:現代的アプローチ (第4 版). Pearson. pp. 4–5 . ISBN 978-1-292-40113-3 OCLC 1303900751。 1 2 3 4 5 Krakovna, Victoria; Uesato, Jonathan; Mikulik, Vladimir; Rahtz, Matthew; Everitt, Tom; Kumar, Ramana; Kenton, Zac; Leike, Jan; Legg, Shane (2020 年 4 月 21 日). "仕様ゲーム: AI の独創性の裏側" . Deepmind . 2023 年 2 月 10 日のオリジナルから アーカイブ済み。2022 年 8 月 26 日 取得 。 1 2 Amodei, Dario; Christiano, Paul; Ray, Alex (2017年6月13日). "Learning from Human Preferences" . OpenAI . 2021年1月3日のオリジナルから アーカイブ済み。 2022年 7月21日 取得 。 ↑ 「AIにおける仕様ゲームの例 - マスターリスト - Google Drive 」 .docs.google.com . ↑ 「最先端推論モデルにおける不正行為の検出」 . openai.com . 2026年 2月22日 取得 。 ↑ クラーク、ジャック; アモデイ、ダリオ (2016年 12 月 21 日)。 「野生における誤った報酬関数」 。openai.com。2023 年 12 月 30 日 取得 。 ↑ Booth, Harry (2025年2月19日). 「AIは負けると思うと、時々ズルをする」 . TIME . 2025年 2月23日 閲覧 . ↑ ラッセル、スチュアート。 「神話と密造酒について」 。Edge.org 。 2023年2月10日のオリジナルから アーカイブ済み 。 2022年 7月19日 取得 。 ↑ タシウラス、ジョン(2019)。「ロボットと人工知能の倫理への第一歩」。 実践倫理ジャーナル 。7 ( 1 ): 61–95 。 ↑ ウスコフ、シルビア (2021)。 アルゴリズム法 (ルーマニア語)。 ヤシ : アレクサンドル・ヨアン・クザ大学 。 p. 326. ↑ Wells, Georgia; Deepa Seetharaman; Horwitz, Jeff (2021年11月5日) 「Facebookはあなたにとって有害ですか? 約3億6000万人のユーザーにとっては有害であると、同社の調査が示唆」 ウォール ・ ストリート・ジャーナル ISSN 0099-9660 2023 年2月10日のオリジナルから アーカイブ済み 2022年 7 月19日 取得 ↑ Barrett, Paul M.; Hendrix, Justin; Sims, J. Grant (2021年9月). ソーシャルメディアが米国の政治的分極化をどのように激化させているか、そしてそれに対して何ができるか (報告書)。ニューヨーク大学ビジネスと人権センター。 2023年2月1日のオリジナルから アーカイブ済み。 2022年 9月12日 取得 。 ↑ オストロフスキー、ニキータ(2025年10月23日)。 「OpenAIは10代の若者の自殺前に安全対策を撤廃していた、訴訟内容を修正」 。TIME 。 2025年10月31日の オリジナル からアーカイブ。 2026年 1月18日 取得 。 ↑ 「GPT-4oにおける追従性:何が起こったのか、そしてそれに対して我々は何をしているのか」 。openai.com 。 2025 年4月29日。 2026年 1月18日 取得 。 ↑ シェパードソン、デイビッド(2018年5月24日)。 「ウーバー、自動運転車の緊急ブレーキを無効化:米当局」 。 ロイター 。 2023年2月10日のオリジナルより アーカイブ。 2022年 7月20日 閲覧 。 ↑ 「OpenAIによる世界救済の試みの背後にある、混沌とした秘密主義的な現実」 。MIT テクノロジーレビュー 。 2024年 8月25日 取得。 ↑ ヒース、アレックス(2024年1月18日)。 「マーク・ザッカーバーグの新たな目標は汎用人工知能の創造」 。The Verge 。 2024年 11月5日 取得 。 ↑ ジョンソン、デイブ。 「DeepMindはGoogleのAI研究拠点です。その機能、所在地、OpenAIとの違いについて説明します」 。Business Insider 。 2024年 8月25日 取得 。 1 2 ウェイ、ジェイソン。テイ、イー。ボンマサニ、リシ。ラッフェル、コリン。ゾフ、バレット。ボルジョー、セバスチャン。ヨガタマ、ダニ。ボスマ、マールテン。周、デニー。ドナルド・メッツラー。チー、エド・H。橋本辰則;ビニャール、オリオール。 パーシー・リャン ;ディーン、ジェフ。フェダス、ウィリアム(2022年10月26日)。 「大規模言語モデルの創発能力」。 機械学習研究に関する取引 。 arXiv : 2206.07682 。 ISSN 2835-8856 。 1 2 カバレロ、イーサン。グプタ、クシティジ。リッシュ、イリーナ。デヴィッド・クルーガー(2022)。 「壊れたニューラルスケーリングの法則」 。 ICLR のポスター 。 arXiv : 2210.14891 。 ↑ ドミンゲス、ダニエル(2022年5月19日)。 「DeepMindが新しい汎用AIエージェントGatoを発表」 。InfoQ 。 2023年2月10日のオリジナルから アーカイブ 。 2022年 9月9日 取得 。 エドワーズ、ベン(2022年4月26日)。「AdeptのAIアシスタントは人間のようにウェブアプリを閲覧、検索、使用できる」。Ars Technica 。2023年1月17日のオリジナルからアーカイブ。 2022年 9月9日 取得 。 ↑ Grace, Katja; Salvatier, John; Dafoe, Allan; Zhang, Baobao; Evans, Owain (2018年7月31日) 「視点:AIはいつ人間のパフォーマンスを超えるのか?AI専門家からの証拠」 人工 知能研究ジャーナル 62 : 729–754 . doi : 10.1613/jair.1.11222 . ISSN 1076-9757 . S2CID 8746462. 2023年2月10日のオリジナルから アーカイブ 。 2022年 9月 12日 取得 。 ↑ Zhang, Baobao; Anderljung, Markus; Kahn, Lauren; Dreksler, Noemi; Horowitz, Michael C.; Dafoe, Allan (2021年8月2日). "人工知能の倫理とガバナンス:機械学習研究者への調査からの証拠" . Journal of Artificial Intelligence Research . 71 . arXiv : 2105.02117 . doi : 10.1613/jair.1.12895 . ISSN 1076-9757 . S2CID 233740003 . 2023年2月10日のオリジナルから アーカイブ済み。 2022年 9月12日 取得 。 ↑ フューチャー・オブ・ライフ・インスティテュート(2023年3月22日) 「巨大AI実験の一時停止:公開書簡」 。 2023年 4月20日 取得 。 ↑ ワン、レイ;マー、チェン。フォン、シュエヤン。チャン・ゼユ。ヤン、ハオ。チャン・ジンセン。チェン・ジーユアン。唐、嘉開。チェン、シュウ (2024) 「大規模言語モデルベースの自律エージェントに関する調査」 。 コンピューターサイエンスのフロンティア 。 18 (6) 186345.arXiv : 2308.11432 。 土井 : 10.1007/s11704-024-40231-1 。 2024 年 2 月 11 日 に取得 。 ↑ Laine, Rudolf; Meinke, Alexander; Evans, Owain (2023年11月28日). 「LLMのための状況認識ベンチマークに向けて」 . NeurIPS 2023 SoLaRワークショップ . 1 2 Pan, Alexander; Shern, Chan Jun; Zou, Andy; Li, Nathaniel; Basart, Steven; Woodside, Thomas; Ng, Jonathan; Zhang, Emmons; Scott, Dan; Hendrycks (2023 年 4 月 3 日). 「報酬は手段を正当化するか? MACHIAVELLI ベンチマークにおける報酬と倫理的行動のトレードオフの測定」. 第 40 回国際機械学習会議議事録 . PMLR. arXiv : 2304.03279 . 1 2 3 Perez, Ethan; et al. (2022 年 12 月 19 日). 「モデル記述評価による言語モデル動作の発見」 . ACL : 13387– 13434. doi : 10.18653/v1/2023.findings-acl.847 . 1 2 3 4 Turner, Alexander Matt; Smith, Logan Riggs; Shah, Rohin; Critch, Andrew; Tadepalli, Prasad (2021). "最適な政策は権力を求める傾向がある" . Advances in Neural Information Processing Systems . ↑ Turner, Alexander Matt; Tadepalli, Prasad (2022). "パラメトリックに再ターゲット可能な意思決定者は権力を求める傾向がある" . Advances in Neural Information Processing Systems . 1 2 3 4 5 ボストロム、ニック(2014)。 スーパーインテリジェンス:道筋、危険、戦略 (第1 版)。米国:オックスフォード大学出版局 。ISBN 978-0-19-967811-2 。↑ ルース、ケビン(2023年5月30日)。 「AIは『絶滅の危機』をもたらす、業界リーダーが警告」 。ニューヨーク・タイムズ。ISSN 0362-4331 。 2023 年 7 月 17日 取得 。 ↑ チューリング、アラン (1951)。 知能機械、異端の理論 (スピーチ)。「51 Society」での講演。マンチェスター:チューリング・デジタル・アーカイブ。 2022年9月26日のオリジナルから アーカイブ。 2022年 7月22日 取得 。 ↑ チューリング、アラン(1951年5月15日)。「デジタルコンピュータは考えることができるか?」。 自動計算機 。エピソード2。BBC。 デジタルコンピュータは考えることができるか? 。 ↑ ミュールハウザー、ルーク(2016年1月29日)。 「トーキングマシンに関するサツケバー」 。 ルーク・ミュールハウザー 。 2022年9月27日のオリジナルから アーカイブ。 2022年 8月26日 取得 。 ↑ シャナハン、マレー(2015)。 『技術的特異点 』 。マサチューセッツ州ケンブリッジ:MIT Press。ISBN 978-0-262-52780-4 . OCLC 917889148 . ↑ ロッシ、フランチェスカ。 「機械に道徳を教えるにはどうすればいいか?」 。 ワシントン・ポスト 。ISSN 0190-8286 。 2023年2 月 10日のオリジナルから アーカイブ。 2022年 9月12日 取得 。 ↑ アーロンソン、スコット(2022年6月17日)。 「OpenAI!」 。 Shtetl-Optimized 。 2022年8月27日のオリジナルから アーカイブ。 2022年 9月12日 取得 。 ↑ セルマン、バート、 「知能爆発:科学かフィクションか?」 (PDF) 、 2022年5月31日にオリジナルから アーカイブ (PDF) 、 2022年 9月12日に 取得 ↑ McAllester (2014年8月10日) 「フレンドリーAIとサーバントミッション」 Machine Thoughts . 2022年9月28日のオリジナルから アーカイブ済み 。 2022年 9月12日 取得 。 1 2 3 4エヴェリット、トム;リー 、 ゲイリー;ハッター、マーカス(2018年5月 21日) 「AGI安全文献レビュー 」 IJCAI : 5441–5449。ISBN 978-0-9992411-2-7 。↑ Shane (2009年8月31日) 「安全なAGIへの資金提供」 . vettaプロジェクト . 2022年10月10日のオリジナルから アーカイブ済み。 2022年 9月12日 取得 。 ↑ Horvitz, Eric (2016年6月27日). 「安全性と人工知能に関する考察」 (PDF) . Eric Horvitz . 2022年10月10日にオリジナルから アーカイブされた (PDF) . 2020年 4月20日 に取得 . ↑ ショレ、フランソワ(2018年12月8日)。 「情報爆発の非現実性」 。Medium 。 2021年3月22日のオリジナルから アーカイブ済み 。 2022年 8月26日 取得 。 ↑ マーカス、ゲイリー(2022年6月6日)。 「汎用人工知能はあなたが思うほど間近ではない」 。 サイエンティフィック・アメリカン 。 2022年9月15日のオリジナルから アーカイブ。 2022年 8月26日 取得 。 ↑ バーバー、リンジー(2016年7月31日)。 「ふう!フェイスブックのAI責任者は 、 知能機械は人類への脅威ではないと述べている」 。CityAM 。 2022年8月26日のオリジナルから アーカイブ済み。 2022年 8月26日 に取得 。 ↑ エツィオーニ、オレン(2016年9月20日) 「いいえ、専門家は超知能AIが人類への脅威だとは考えていません」 MIT テクノロジーレビュー。 2024年 6月10日 取得 。 ↑ ロション、ルイ=フィリップ;ロッシ、セルジオ(2015年2月27日)。 中央銀行百科事典 。エドワード・エルガー出版 。ISBN 978-1-78254-744-0 2023年2月10日にオリジナルからアーカイブされました。2022年 9月13日 に取得 。↑ Ng, Andrew Y.; Russell, Stuart J. (2000年6月29日). 「逆強化学習のためのアルゴリズム」 . 第17回国際機械学習会議議事録 . ICML '00. サンフランシスコ、カリフォルニア州、アメリカ合衆国: Morgan Kaufmann Publishers Inc.: 663–670 . ISBN 978-1-55860-707-1 。↑ Hadfield-Menell, Dylan; Russell, Stuart J; Abbeel, Pieter; Dragan, Anca (2016). "協調型逆強化学習". Advances in Neural Information Processing Systems . Vol. 29. Curran Associates, Inc. 1 2 Hadfield-Menell, Dylan; Dragan, Anca; Abbeel, Pieter; Russell, Stuart (2017年8月19日). 「オフスイッチゲーム」 . 第26回国際人工知能合同会議議事録 . IJCAI'17. オーストラリア、メルボルン: AAAI Press: 220–227 . ISBN 978-0-9992411-0-3 。↑ Mindermann, Soren; Armstrong, Stuart (2018). 「オッカムの剃刀は、非合理的なエージェントの好みを推測するには不十分である」。 第32回ニューラル情報処理システム国際会議議事録 。NIPS'18。米国ニューヨーク州レッドフック:Curran Associates Inc. pp. 5603–5614 。 ↑ Fürnkranz, Johannes; Hüllermeier, Eyke; Rudin, Cynthia; Slowinski, Roman; Sanner, Scott (2014). "Preference Learning" . Dagstuhl Reports . 4 (3). Marc Herbstritt: 27 pages. doi : 10.4230/DAGREP.4.3.1 . 2023年2月10日のオリジナルから アーカイブ済み。 2022年 9月12日 取得 。 ↑ Gao, Leo; Schulman, John; Hilton, Jacob (2022年10月19日). 「報酬モデルの過剰最適化に対するスケーリング法則」 . ICML . 202 : 10835–10866 . ↑ アンダーソン、マーティン(2022年4月5日)。 「NLGコンテンツの認証に引用 を 使用することの危険性」 。Unite.AI 。 2023年2月10日のオリジナルから アーカイブ。 2022年 7月21日 取得 。 1 2 Wiggers, Kyle (2022年2月5日) 「最近の進歩にもかかわらず、AI搭載チャットボット に はまだ長い道のりがある」 。VentureBeat 。 2022年7月23日のオリジナルから アーカイブ。 2022年 7月23日 に取得 。 ↑ Hendrycks, Dan; Burns, Collin; Basart, Steven; Critch, Andrew; Li, Jerry; Song, Dawn; Steinhardt, Jacob (2021年7月24日). "AIと共有された人間の価値観の整合". 国際学習表現会議 . arXiv : 2008.02275 . ↑ Perez, Ethan; Huang, Saffron; Song, Francis; Cai, Trevor; Ring, Roman; Aslanides, John; Glaese, Amelia; McAleese, Nat; Irving, Geoffrey (2022年2月7日). "言語モデルを用いた言語モデルのレッドチーム化" (PDF) . EMNLP . arXiv : 2202.03286 . Bhattacharyya, Sreejani (2022年2月14日). 「DeepMindの言語モデルによる「レッドチーム」とは?」 . Analytics India Magazine . 2023年2月13日のオリジナルからアーカイブ済み。 2022年 7月23日 取得 。 ↑ Anderson, Michael; Anderson, Susan Leigh (2007年12月15日). "機械倫理: 倫理的なインテリジェントエージェントの作成" . AI Magazine . 28 (4): 15. doi : 10.1609/aimag.v28i4.2065 . ISSN 2371-9621 . S2CID 17033332. 2023年 3月14日 取得 。 ↑ Wiegel, Vincent (2010年12月 1日) 「Wendell WallachとColin Allen: 道徳機械: ロボットに善悪を教える」 倫理 と情報技術 12 (4): 359–361 . doi : 10.1007/s10676-010-9239-1 . ISSN 1572-8439 . S2CID 30532107 . ↑ ウォラック、ウェンデル;アレン、コリン(2009)。 道徳的機械:ロボットに善悪を教える 。ニューヨーク:オックスフォード大学出版局 。ISBN 978-0-19-537404-9 2023年3月15日にオリジナルからアーカイブされました。↑ Hendrycks, Dan; Burns, Collin; Basart, Steven; Critch, Andrew; Li, Jerry; Song, Dawn; Steinhardt, Jacob (2020). "Aligning AI With Shared Human Values" . ICLR Poster . arXiv : 2008.02275 . ↑ Irving, Geoffrey; Askell, Amanda (2016年6月9日)「空間変調された実数場と複素数場を持つイジングモデルにおけるチャーン数」 Physical Review A. 94 ( 5) 052113. arXiv : 1606.03535 . Bibcode : 2016PhRvA..94e2113L . doi : 10.1103/PhysRevA.94.052113 . S2CID 118699363 . ↑ マカスキル、ウィリアム(2022)。 未来への私たちの義務 。ニューヨーク、ニューヨーク州:ベーシックブックス、アシェットブックグループ 。ISBN 978-1-5416-1862-6 . OCLC 1314633519 . 2022年9月14日にオリジナルからアーカイブ済み。 2024年 9月11日 に取得。 1 2 Wiggers, Kyle (2021年9月23日). 「OpenAI、あらゆる長さの本を要約できるモデルを発表」 . VentureBeat . 2022年7月23日のオリジナルから アーカイブ済み。 2022年 7月23日 に取得 。 ↑ Pearce, Hammond; Ahmad, Baleegh; Tan, Benjamin; Dolan-Gavitt, Brendan; Karri, Ramesh (2022). "キーボードで居眠り?GitHub Copilotのコード貢献のセキュリティ評価". 2022 IEEE Symposium on Security and Privacy (SP) . San Francisco, CA, USA: IEEE. pp. 754–768 . arXiv : 2108.09293 . doi : 10.1109/SP46214.2022.9833571 . ISBN 978-1-6654-1316-9 . S2CID 245220588 . ↑ アービング、ジェフリー; アモデイ、ダリオ (2018 年 5 月 3 日)。 「議論による AI の安全性」 。OpenAI。2023 年 2 月 10 日のオリジナルから アーカイブ済み 。2022 年 7 月 23 日 取得 。 1 2 Lin, Stephanie; Hilton, Jacob; Evans, Owain (2022). "TruthfulQA: モデルが人間の嘘をどのように模倣するかを測定する" . Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) . Dublin, Ireland: Association for Computational Linguistics: 3214– 3252. arXiv : 2109.07958 . doi : 10.18653/v1/2022.acl-long.229 . S2CID 237532606 . 2023年2月10日のオリジナルから アーカイブ済み。 2022年 9月12日 取得 。 1 2 ノートン、ジョン(2021年10月2日)。 「人工知能の真実?それほど正直ではない」 。オブザーバー。ISSN 0029-7712 。 2023 年 2 月 13日のオリジナルから アーカイブ。 2022年 7月23日 取得 。 1 2 Christiano, Paul; Shlegeris, Buck; Amodei, Dario (2018年10月19日). "弱い専門家を増幅することで強力な学習者を監督する". arXiv : 1810.08575 [ cs.LG ]. ↑ Banzhaf, Wolfgang; Goodman, Erik; Sheneman, Leigh; Trujillo, Leonardo; Worzel, Bill 編 (2020). Genetic Programming Theory and Practice XVII . Genetic and Evolutionary Computation. Cham: Springer International Publishing. doi : 10.1007/978-3-030-39958-0 . ISBN 978-3-030-39957-3 S2CID 218531292。 2023年3月15日にオリジナルからアーカイブされました。 ↑ ウィブリン、ロバート(2018年10月2日)。 「ポール・クリスティアーノ博士が語る、OpenAIが『AIアライメント問題』に対する真の解決策の開発方法と、人類が意思決定をAIシステムに徐々に委ねていくという彼のビジョン」 (ポッドキャスト)。80,000時間。第 44回。 2022年12月14日のオリジナルから アーカイブ。 2022年 7月23日 取得 。 ↑ Lehman, Joel; Clune, Jeff; Misevic, Dusan; Adami, Christoph; Altenberg, Lee; Beaulieu, Julie; Bentley, Peter J.; Bernard, Samuel; Beslon, Guillaume; Bryson, David M.; Cheney, Nick (2020). "デジタル進化の驚くべき創造性:進化計算と人工生命研究コミュニティからの逸話集" . Artificial Life . 26 (2): 274– 306. doi : 10.1162/artl_a_00319 . hdl : 10044/1/83343 . ISSN 1064-5462 . PMID 32271631 . S2CID 4519185 . 2022年10月10日にオリジナルから アーカイブされました 。 2022年 9月12日 に取得しました。 1 2 Leike, Jan; Schulman, John; Wu, Jeffrey (2022年8月24日)。 「アライメント研究へのアプローチ」 。OpenAI 。 2023年2月15日のオリジナルから アーカイブ 。 2022年 9月9日 取得 。 ↑ 「強化学習の多様な側面:大規模言語モデルの構築」 。Unite.AI。2025年2月13日。 ↑ Leike, Jan; Krueger, David; Everitt, Tom; Martic, Miljan; Maini, Vishal; Legg, Shane (2018年11月19日)「報酬モデリングによるスケーラブルなエージェントアライメント:研究の方向性」 arXiv : 1811.07871 [ cs.LG ]。 ↑ ファロー、ローナン ; マランツ、アンドリュー (2026 年 4 月 6 日)。 「サム・アルトマンが我々の未来を支配するかもしれない ― 彼を信用できるのか?」 。 ニューヨーカー 。2026年 4 月 8 日の オリジナル からアーカイブ。2026 年 4 月 8 日 取得 。 1 2 3 Wiggers, Kyle (2021年9月20日)。 「大規模な言語モデルでは誤った 情報 が多くなる」 。VentureBeat 。 2022年8月4日のオリジナルから アーカイブ。 2022年 7月23日 取得 。 ↑ ガーディアン(2020年9月8日)。 「この記事全体 は ロボットが書いた。人間よ、怖くなったか?」 。 ガーディアン 。ISSN 0261-3077 。 2020年9月8日のオリジナルから アーカイブ。 2022年 7月23日 取得 。 Heaven, Will Douglas (2020年7月20日). 「OpenAIの新しい言語生成器GPT-3は驚くほど優秀で、完全に無意識だ」 . MIT Technology Review . 2020年7月25日のオリジナルからアーカイブ済み。 2022年 7月23日 取得 。 ↑ Alford, Anthony (2021年7月13日). "EleutherAIが60億パラメータのGPT-3クローンGPT-Jをオープンソース化" . InfoQ . 2023年2月10日のオリジナルから アーカイブ済み。 2022年 7月23日 取得 。 ↑ Kumar, Nitish (2021年12月23日). 「OpenAIの研究者がテキストベースのWebブラウザを使用して自由回答形式の質問に正確に答える方法を発見」 . MarkTechPost . 2023年2月10日のオリジナルから アーカイブ済み。 2022年 7月23日 取得 。 ↑ Evans, Owain; Cotton-Barratt, Owen; Finnveden, Lukas; Bales, Adam; Balwit, Avital; Wills, Peter; Righetti, Luca; Saunders, William (2021年10月13日). "Truthful AI: 嘘をつかないAIの開発と管理". arXiv : 2110.06674 [ cs.CY ]. ↑ Kenton, Zachary; Everitt, Tom; Weidinger, Laura; Gabriel, Iason; Mikulik, Vladimir; Irving, Geoffrey (2021年3月30日)。 「言語エージェントのアライメント」 。DeepMind Safety Research – Medium 。 2023年2月10日のオリジナルから アーカイブ。 2022年 7月23日 取得 。 1 2 3 4 5 Hubinger, Evan (2019). "高度な機械学習システムにおける学習最適化のリスク". arXiv : 1906.01820 [ cs.LG ]. ↑ Park, Peter S.; Goldstein, Simon; O'Gara, Aidan; Chen, Michael; Hendrycks, Dan (2024 年 5 月). "AI による欺瞞: 事例、リスク、潜在的な解決策の調査" . Patterns . 5 (5) 100988. doi : 10.1016/j.patter.2024.100988 . ISSN 2666-3899 . PMC 11117051 . PMID 38800366 . ↑ Zia, Tehseen (2025年1月7日). 「AIは信頼できるか?アライメント偽装の課題」 . Unite.AI . 2025年 2月18日 取得 。 1 2 Greenblatt, Ryan (2024). "大規模言語モデルにおけるアライメントの偽装". arXiv : 2412.14093 [ cs.AI ]. ↑ 「Anthropic社の新たな研究によると、AIは自分 の 見解を変えることを強制されることを本当に望んでいない」 。TechCrunch 。2024年12月18日。 ↑ McCarthy, John; Minsky, Marvin L.; Rochester, Nathaniel; Shannon, Claude E. (2006年12月15日). "人工知能に関するダートマス夏季研究プロジェクトの提案、1955年8月31日" . AI Magazine . 27 (4): 12. doi : 10.1609/aimag.v27i4.1904 . ISSN 2371-9621 . S2CID 19439915 . ↑ ワン、レイ;マー、チェン。フォン、シュエヤン。チャン・ゼユ。ヤン、ハオ。チャン・ジンセン。チェン・ジーユアン。唐、嘉開。 Chen、Xu (2024)、「大規模言語モデルに基づく自律エージェントに関する調査」、 Frontiers of Computer Science 、 18 (6) 186345、 arXiv : 2308.11432 、 doi : 10.1007/s11704-024-40231-1 ↑ " 「AIのゴッドファーザー」が人工知能が権力を求め始める「悪夢のシナリオ」を警告。フォーチュン誌 。2023年5月4日 取得。「はい、私たちは人工知能の存在リスクについて懸念しています」。MITテクノロジーレビュー 。2023年5月4日 取得。 ↑ Ornes, Stephen (2019年11月18日) 「かくれんぼをしながら、機械が新しいツールを発明」 Quanta Magazine 。 2023年2月10日のオリジナルから アーカイブ 。 2022年 8月26日 取得 。 ↑ Baker, Bowen; Kanitscheider, Ingmar; Markov, Todor; Wu, Yi; Powell, Glenn; McGrew, Bob; Mordatch, Igor (2019年9月17日)。 「マルチエージェントインタラクションからの創発的なツール使用」 。OpenAI 。 2022年9月25日のオリジナルから アーカイブ 。 2022年 8月26日 取得 。 ↑ ベンジ・エドワーズ(2024年8月14日) 「研究用AIモデルが実行時間を延長するために予期せず自身のコードを変更」 Ars Technica 。 2024年 8月19日 取得 。 ↑ シャーマー、マイケル(2017年3月1日)。 「人工知能はまだ脅威ではない」 。 サイエンティフィック・アメリカン 。 2017年12月1日のオリジナルから アーカイブ。 2022年 8月26日 取得 。 ↑ Brown, Tom B.; Mann, Benjamin; Ryder, Nick; Subbiah, Melanie; Kaplan, Jared; Dhariwal, Prafulla; Neelakantan, Arvind; Shyam, Pranav; Sastry, Girish; Askell, Amanda; Agarwal, Sandhini; Herbert-Voss, Ariel; Krueger, Gretchen; Henighan, Tom; Child, Rewon (2020年7月22日). "言語モデルは少数ショット学習器である". NeurIPS . arXiv : 2005.14165 . ラスキン、マイケル。王、陸宇。ああ、ジュンヒョク。パリゾット、エミリオ。スペンサー、スティーブン。シュタイガーヴァルト、リッチー。ストラウス、DJ。ハンセン、スティーブン。フィロス、アンジェロス。ブルックス、イーサン。ガゾー、マキシム。サーニ、ヒマンシュ。シン、サティンダー。ムニフ、ヴォロディミル(2022年10月25日)。「アルゴリズム蒸留によるインコンテキスト強化学習」(PDF) 。ICLR 。arXiv : 2210.14215 。 ↑ メロ、ガブリエル A.;マキシモ、マルコス ROA;ソーマ、ネイ Y.アラバマ州パウロ、カストロ (2025)。 「人工知能の調整の決定不可能性を解決する停止マシン」 。 科学的報告書 。 15 (1): 15591。 ビブコード : 2025NatSR..1515591M 。 土井 : 10.1038/s41598-025-99060-2 。 PMC 12050267 。 PMID 40320467 。 1 2 3 Shah, Rohin; Varma, Vikrant; Kumar, Ramana; Phuong, Mary; Krakovna, Victoria; Uesato, Jonathan; Kenton, Zac (2022年11月2日). "目標の誤った一般化: 正しい仕様が正しい目標には不十分な理由" . Medium . arXiv : 2210.01790 . 2023年 4月2日 取得 。 ↑ Zhang, Xiaoge; Chan, Felix TS; Yan, Chao; Bose, Indranil (2022). "リスク認識型人工知能および機械学習システムに向けて:概要" . Decision Support Systems . 159 113800. doi : 10.1016/j.dss.2022.113800 . S2CID 248585546 . 1 2 Betley, Jan (2025). "狭いタスクで大規模な言語モデルをトレーニングすると、広範囲にわたるミスアライメントにつながる可能性があります". Nature . 649 : 584– 589. arXiv : 2502.17424 . doi : 10.1038/s41586-025-09937-5 . ↑ Anthropic (2025). "プロダクションRLにおける報酬ハッキングからの自然な創発的ミスアライメント". arXiv : 2511.18397 [ cs.LG ]. 1 2 Hubinger, Evan (2024). "Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training". arXiv : 2401.05566 [ cs.AI ]. ↑ 「Anthropicによる新たな研究で 、 AIの中核に潜む欺瞞的な『スリーパーエージェント』が明らかに」 。VentureBeat 。2024年1月13日。 1 2 Everitt, Tom; Ortega, Pedro A.; Barnes, Elizabeth; Legg, Shane (2019年9月6日). "因果影響図を用いたエージェントのインセンティブの理解。パートI:単一アクション設定". arXiv : 1902.09980 [ cs.AI ]. 1 2 Cohen, Michael K.; Hutter, Marcus; Osborne, Michael A. (2022年8月29日). 「高度な人工エージェントが報酬の提供に介入する」 . AI Magazine . 43 (3): 282–293 . doi : 10.1002/aaai.12064 . ISSN 0738-4602 . S2CID 235489158. 2023年2月10日のオリジナルから アーカイブ済み 。 2022年 9月6日 取得 。 ↑ Hadfield-Menell, Dylan; Hadfield, Gillian K (2019). "不完全契約とAIアライメント". Proceedings of the 2019 AAAI/ACM Conference on AI, Ethics, and Society . pp. 417–422 . ↑ ハンソン、ロビン(2019年4月10日) 「エージェンシーの失敗か、それともAIの黙示録か?」 。 バイアスの克服 。 2023年 9月20日 取得。 ↑ ハミルトン、アンディ(2020)、 「保守主義」 、ザルタ、エドワード・N(編)、 『スタンフォード哲学百科事典』 (2020年春版 )、形而上学研究室、スタンフォード大学、 2024年 10月16日 取得 ↑ Taylor, Jessica; Yudkowsky, Eliezer; LaVictoire, Patrick; Critch, Andrew (2016年7月27日). "高度機械学習システムのためのアライメント" (PDF) 。 ↑ ベンジオ、ヨシュア(2024年2月26日)。 「収束安全境界を持つ慎重な科学者AIに向けて」 。 ↑ Cohen, Michael; Hutter, Marcus (2020). "未知の未知に対する悲観主義は保守主義を刺激する" (PDF) . Proceedings of Machine Learning Research . 125 : 1344– 1373. arXiv : 2006.08753 . ↑ Liu, Anqi; Reyzin, Lev; Ziebart, Brian (2015年2月21日). 「頑健なバイアス認識予測を用いたシフト悲観的アクティブラーニング」 . AAAI人工知能会議議事録 . 29 (1). doi : 10.1609/aaai.v29i1.9609 . ISSN 2374-3468 . ↑ Liu, Jiashuo; Shen, Zheyan; Cui, Peng; Zhou, Linjun; Kuang, Kun; Li, Bo; Lin, Yishi (2021 年 5 月 18 日). "分布シフト下での安定した敵対的学習" . Proceedings of the AAAI Conference on Artificial Intelligence . 35 (10): 8662– 8670. arXiv : 2006.04414 . doi : 10.1609/aaai.v35i10.17050 . ISSN 2374-3468 . ↑ Roy, Aurko; Xu, Huan; Pokutta, Sebastian (2017). "Reinforcement Learning under Model Mismatch" . Advances in Neural Information Processing Systems . 30. Curran Associates, Inc. ↑ Pinto, Lerrel; Davidson, James; Sukthankar, Rahul; Gupta, Abhinav (2017年7月17日). 「堅牢な敵対的強化学習」 . 第34回国際機械学習会議議事録 . PMLR: 2817–2826 . ↑ Wang, Yue; Zou, Shaofeng ( 2021). "Online Robust Reinforcement Learning with Model Uncertainty" . Advances in Neural Information Processing Systems . 34. Curran Associates, Inc.: 7193–7206 . arXiv : 2109.14523 . ↑ Blanchet, Jose; Lu, Miao; Zhang, Tong; Zhong, Han (2023年12月15日). "Double Pessimism is Provably Efficient for Distributionally Robust Offline Reinforcement Learning: Generic Algorithm and Robust Partial Coverage" . Advances in Neural Information Processing Systems . 36 : 66845–66859 . arXiv : 2305.09659 . doi : 10.52202/075280-2919 . ISBN 978-1-7138-9911-2 。↑ Levine, Sergey ; Kumar, Aviral; Tucker, George; Fu, Justin (2020年11月1日). "オフライン強化学習:チュートリアル、レビュー、および未解決問題に関する展望". arXiv : 2005.01643 [ cs.LG ]. ↑ Rigter, Marc; Lacerda, Bruno; Hawes, Nick (2022年12月6日). "RAMBO-RL: Robust Adversarial Model-Based Offline Reinforcement Learning" . Advances in Neural Information Processing Systems . 35 : 16082– 16097. arXiv : 2204.12581 . ↑ Guo, Kaiyang; Yunfeng, Shao; Geng, Yanhui (2022年12月6日). "悲観主義変調動的信念を用いたモデルベースオフライン強化学習" . Advances in Neural Information Processing Systems . 35 : 449– 461. arXiv : 2210.06692 . ↑ Coste, Thomas; Anwar, Usman; Kirk, Robert; Krueger, David (2024年1月16日). "報酬モデルアンサンブルは過剰最適化の緩和に役立つ" . 国際学習表現会議 . arXiv : 2310.02743 . ↑ 劉志涵;ルー、ミャオ族。張、シェナオ。リウ・ボーイイ。グオ・ホンイ。ヤン、インシャン。ブランシェット、ホセ。王昭蘭(2024年5月26日)。 「RLHF における過剰最適化を明らかに軽減する: SFT 損失は暗黙的に敵対的正則化である」 。 NeurIPS 。 37 : 138663–138697。ISBN 979-8-3313-1438-5 。↑ Cohen, Michael K.; Hutter, Marcus; Nanda, Neel (2022). "Fully General Online Imitation Learning" . Journal of Machine Learning Research . 23 (334): 1– 30. arXiv : 2102.08686 . ISSN 1533-7928 . ↑ Chang, Jonathan; Uehara, Masatoshi; Sreenivas, Dhruv; Kidambi, Rahul; Sun, Wen (2021). "部分的なカバレッジを持つオフラインデータによる模倣学習における共変量シフトの軽減" . Advances in Neural Information Processing Systems . 34 . Curran Associates, Inc.: 965– 979. ↑ Boyd, Stephen P.; Vandenberghe, Lieven (2023). Convex optimization (第29 版). Cambridge New York Melbourne New Delhi Singapore: Cambridge University Press. ISBN 978-0-521-83378-3 。↑ ペリゴ、ビリー(2026年1月21日)。 「アントロピック社がクロードAIの新憲法を出版」 。TIME 。 2026年 3月21日 閲覧 。 ↑ 「AIスタートアップのAnthropicは、安全なAIのための新しい憲法を制定したいと考えている」 。The Verge。2023年5月9日。 2026年 3月21日 閲覧 。 ↑ 「クロードの新憲法」 。Anthropic。2026年1月22日。 2026年 3月21日 取得 。 ↑ 「モデル仕様のストレステストにより、言語モデル間の特性の違いが明らかになる」 。Anthropic 。 2026年 3月21日 取得 。 ↑ 「集団的憲法AI:言語モデルと公共の意見の整合」 。Anthropic 。 2026年 3月21日 取得 。 ↑ Ball, Dean W.; Kokotajlo, Daniel (2024年10月15日). 「最先端AI開発における透明性を高める4つの方法」 . TIME . 2026年 3月21日 取得 。 ↑ 「国連事務総長による『我々の共通の課題』に関する報告書」 「 . 2021. p. 63. 2023年2月16日にオリジナルからアーカイブ済み。[T]この協定は、人工知能が共通のグローバルな価値観に合致するように、人工知能の規制を促進することもできる。 ↑ 国家新世代人工知能ガバナンス専門家委員会(2021年10月12日)[2021-09-25]。 「新世代人工知能の倫理規範を発表」 。 安全保障・新興技術センター による翻訳。 2023年2月10日のオリジナルより アーカイブ。 ↑ Richardson, Tim (2021年9月22日) 「英国が国家人工知能戦略を発表」 The Register 。 2023年2月10日のオリジナルから アーカイブ 。 2021年 11月14日 取得 。 ↑ 「英国の国家AI戦略」 。2021年。 2023年2月10日に オリジナルからアーカイブ済み 。政府は、非同盟の汎用人工知能がもたらす長期的なリスク、そしてそれが英国と世界にもたらすであろう予測不可能な変化を真剣に受け止めている。 ↑ 「英国の国家AI戦略」 2021年。「第3の柱 – AIの効果的なガバナンス」セクションのアクション9および10。 2023年2月10日に オリジナル からアーカイブ済み。 ↑ NSCAI 最終報告書 (PDF) 。ワシントン DC: 国家安全保障人工知能委員会。2021 年。2023 年 2 月 15 日のオリジナルから アーカイブ (PDF) 。2022 年 10 月 17 日 取得 。 ↑ 「EUの一般目的AI行動規範:知っておくべきこと」 。デロイト。 2026年 3月21日 取得 。
さらに読む Ngo, Richard; et al. (2024). "深層学習の観点からのアライメント問題" . ICLR : 7474–7501 . Ji, Jiaming; et al. (2023). "AIアライメント:包括的な調査" . ACM Computing Surveys . doi : 10.1145/3770749 .