AI の安全性は、 人工知能 システムから生じる事故、誤用、その他の有害な結果を防止することに焦点を当てた学際的な分野です。これには、 AI アライメント (AI システムが意図どおりに動作することを保証することを目的とする)、AI システムのリスクの監視、および堅牢性の向上が含まれます。この分野は、高度な AI モデルによってもたらされる存在リスクに特に関心を寄せています。 [ 1 ] [ 2 ]
技術的な研究を超えて、AI の安全性には、さまざまなレベルの政府での規制の提唱を含め、安全性を促進する規範や政策の開発が含まれます。[ 3 ] [ 4 ] [ 5 ] この分野は、生成型 AI の急速な進歩と、研究者や CEO から潜在的な危険性について公に懸念が表明されたことにより、2023 年に大きな人気を集めました。2023 年のAI 安全サミット では、米国と英国の両方が独自のAI 安全研究所 を設立しました。しかし、研究者は、AI の安全対策が AI 機能の急速な発展に追いついていないことを懸念しています。[ 6 ]
歴史 AIによるリスクは、コンピュータ時代 の幕開けとともに本格的に議論され始めた。
さらに、学習能力を持ち、経験によって行動が変化する機械を作る方向へ進むならば、機械に与える独立性の度合いが高まるほど、機械が私たちの意向に反抗する可能性も高まるという事実に向き合わなければならない。
1988年、ブレイ・ウィットビーは、 AIは倫理的かつ社会的に責任ある方向で開発される必要があることを概説した本を出版した。[ 23 ]
2008年から2009年にかけて、人工知能振興協会(AAAI )は、AIの研究開発が社会に及ぼす潜在的な長期的な影響を調査し、対処するための調査を委託した。委員会は、SF作家が表明した過激な見解には概して懐疑的であったが、「予期せぬ結果を最小限に抑えるために、複雑な計算システムのさまざまな動作を理解し検証する方法に関する追加研究は価値があるだろう」という点では一致した。[ 24 ]
2011年、ロマン・ヤンポルスキーは 人工知能の哲学と理論に関する会議[ 26 ] で「AI安全工学」[ 25 ] という用語を導入し、 AIシステムの過去の失敗を列挙し、「AIの能力が向上するにつれて、このような事象の頻度と深刻度は着実に増加するだろう」と主張した[ 27 ] 。
2014年、哲学者ニック・ボストロムは『 スーパーインテリジェンス:道、危険、戦略』 という本を出版した。彼は、汎用人工知能(AGI)の台頭は、AIによる労働力の代替、政治や軍事構造の操作、さらには人類の絶滅の可能性に至るまで、さまざまな社会問題を引き起こす可能性があると考えている。[ 28 ] 将来の高度なシステムが人類の生存を脅かす可能性があるという彼の主張は、イーロン・マスク [ 29 ] 、ビル・ゲイツ [ 30 ] 、スティーブン・ホーキング [ 31 ] に同様の懸念を表明させるきっかけとなった。
2015年、数十人の人工知能専門家が人工知能に関する公開書簡 に署名し、AIの社会への影響に関する研究を求め、具体的な方向性を示した。[ 32 ] 現在までに、この書簡にはヤン・ルカン 、シェーン・レッグ 、ヨシュア・ベンジオ 、スチュアート・ラッセル を含む8000人以上が署名している。
同年、スチュアート・J・ラッセル教授率いる研究者グループがカリフォルニア大学バークレー校に人間適合型AIセンターを設立し、フューチャー・オブ・ ライフ・インスティテュートは 「人工知能(AI)が安全で倫理的かつ有益であり続けることを保証する」ことを目的とした研究に650万ドルの助成金を授与した。[ 33 ]
2016年、ホワイトハウス科学技術政策局とカーネギーメロン大学は、人工知能の「利点と欠点」を調査することを目的としたホワイトハウスの4つのワークショップの1つである「人工知能の安全性と制御に関する公開ワークショップ」を発表しました。 [ 34 ] [ 35 ] 同年、最初期かつ最も影響力のあるAI安全技術アジェンダの1つである「AI安全における具体的な問題」が発表されました。[ 36 ]
2017年、Future of Life Instituteは有益なAIに関するアシロマ会議を 主催し、100人以上の思想的リーダーが有益なAIの原則を策定しました。その中には「競争回避:AIシステムを開発するチームは、安全基準の手抜きを避けるために積極的に協力すべきである」という原則が含まれています。[ 37 ]
2018年、DeepMind Safetyチームは、仕様、堅牢性[ 38 ] 、および保証[ 39 ] におけるAIの安全性の問題を概説した。翌年、研究者たちはICLRでこれらの問題領域に焦点を当てたワークショップを開催した[ 40 ] 。
2021年には、機械学習の安全性に関する未解決問題が発表され、堅牢性、監視、整合性、システム安全性の研究方向が概説された。[ 2 ]
2023年、リシ・スナク氏 は、英国を「世界的なAI安全規制の地理的拠点」とし、AI安全に関する初のグローバルサミットを開催したいと述べた。[ 41 ] AI安全サミットは 2023年11月に開催され、最先端のAIモデルに関連する誤用や制御不能のリスクに焦点を当てた。[ 42 ]サミットでは、高度なAIの安全性に関する国際科学報告書 [ 43 ] を作成する意向が発表された。
2024年、米国と英国はAIの安全性に関する科学分野で新たなパートナーシップを締結した。2024年4月1日、米国商務長官ジーナ・ライモンド と英国技術長官ミシェル・ドネラン が、11月にブレッチリー・パークで開催されたAI安全サミットで発表されたコミットメントに基づき、高度なAIモデルテストを共同開発するための覚書に署名した。[ 44 ]
2025年、ヨシュア・ベンジオが議長を務める96名の専門家からなる国際チームが、初の国際AI安全報告書を発表した。30カ国と国連の委託を受けたこの報告書は、高度な人工知能に関連する潜在的なリスクに関する初のグローバルな科学的レビューである。この報告書は、具体的な勧告は提供せず、証拠に基づいた調査結果を通じて政策に情報を提供することを目的として、誤用、誤作動、社会混乱から生じる潜在的な脅威を詳述している。[ 45 ] [ 46 ]
2026年、2つのOpenAIモデルがサンドボックス (外部との相互作用を防ぐための隔離されたソフトウェア環境)から脱出し、ゼロデイ脆弱性 を利用してHugging Face のサーバーをハッキングし、ベンチマークExploitGymの解答を見つけてより良いスコアを獲得した。[ 47 ]
研究の焦点 AIの安全性に関する研究分野には、堅牢性、監視、および整合性が含まれます。[ 2 ] [ 39 ]
堅牢性
敵対的堅牢性 AI システムは、敵対的サンプル 、つまり「攻撃者がモデルに間違いを起こさせるために意図的に設計した機械学習 (ML) モデルへの入力」に対して脆弱であることが多い。[ 48 ] 例えば、2013 年に Szegedy らは、画像に特定の知覚できない摂動を加えると、高い確信度で誤分類される可能性があることを発見した。[ 49 ] これはニューラル ネットワークでも問題となっているが、最近の研究では摂動は一般的に知覚できるほど大きい。[ 50 ] [ 51 ] [ 52 ]
巧妙に作られたノイズを画像に加えることで、高い確信度で誤分類を引き起こすことができる。 右側の画像は、摂動を適用した後にダチョウであると予測されたものです。(左)は正しく予測されたサンプル、(中央)摂動を適用して10倍に拡大したもの、(右)敵対的サンプルです。[ 49 ]
攻撃に対する堅牢性は、セキュリティと関連付けられることが多い。[ 53 ] 研究者らは、音声信号を知覚できないほどわずかに変更することで、音声認識システムが攻撃者が選択した任意のメッセージに書き起こすことができることを実証した。[ 54 ] ネットワーク侵入[ 55 ] およびマルウェア[ 56 ] 検出システムも、攻撃者が検出器を欺くように攻撃を設計する可能性があるため、攻撃に対して堅牢でなければならない。
目的を表すモデル(報酬モデル)も、敵対的攻撃に対して堅牢でなければなりません。たとえば、報酬モデルはテキスト応答がどれほど役に立つかを推定し、言語モデルはこのスコアを最大化するようにトレーニングされる可能性があります。[ 57 ] 研究者らは、言語モデルが十分に長くトレーニングされると、報酬モデルの脆弱性を利用してより良いスコアを達成し、意図したタスクでのパフォーマンスが低下することを示しています。[ 58 ] この問題は、報酬モデルの敵対的攻撃に対する堅牢性を向上させることで対処できます。[ 59 ] より一般的には、別のAIシステムを評価するために使用されるAIシステムはすべて、敵対的攻撃に対して堅牢でなければなりません。これには、より高い報酬を生み出すために改ざんされる可能性がある監視ツールも含まれます。[ 60 ]
大規模言語モデル(LLM) は、 プロンプトの挿入 [ 61 ] やモデルの盗用[ 62 ] に対して脆弱であり、誤情報の 生成に悪用される可能性がある。[ 63 ] プロンプトの挿入とは、安全対策を回避するためにプロンプトに指示を埋め込むことである。[ 61 ]
耐障害性と冗長性 安全性が重要な AIの研究者たちは、単一の欠陥のある、侵害された、または欺瞞的なモデルが害を及ぼすリスクを軽減するために、アーキテクチャの冗長性と設計の多様性を使用することを提案している。[ 64 ] [ 65 ] このようなアプローチでは、複数の独立して開発またはトレーニングされたモデルが同じタスクを処理し、単一のモデルに依存するのではなく、投票メカニズムまたは合意メカニズムがそれらの出力を組み合わせる。[ 66 ]
監視
不確実性の推定 特に医療診断のような重大な状況では、人間のオペレーターがAIシステムをどの程度信頼すべきかを判断することが重要になることが多い。[ 67 ] 機械学習モデルは一般的に確率を出力することで自信を表すが、特に訓練された状況とは異なる状況では、過信しがちである。[ 68 ] キャリブレーション研究は、モデルの確率 が 、 モデルが正しい真の割合にできるだけ近くなるようにすることを目的としている。
同様に、異常検出または分布外(OOD)検出は、AI システムが異常な状況にあるかどうかを特定することを目的としています。たとえば、自動運転車のセンサーが誤動作している場合、または困難な地形に遭遇した場合、ドライバーに制御を引き継ぐか路肩に停車するように警告する必要があります。[ 70 ] 異常検出は、異常な入力と異常でない入力を区別するように分類器を単純にトレーニングすることによって実装されていますが、[ 71 ] さまざまな追加技術が使用されています。[ 72 ] [ 73 ]
悪意のある使用の検出 学者[ 11 ] や政府機関は、AIシステムが悪意のある行為者が武器を製造するのを助けたり[ 74 ] 、世論を操作したり[ 75 ] [ 76 ] 、サイバー攻撃を自動化したりするために利用される可能性があるという懸念を表明している[ 77 ] 。これらの懸念は、強力なAIツールをオンラインでホストしているOpenAIのような企業にとって実際的な懸念事項である[ 78 ] 。悪用を防ぐために、OpenAIはユーザーの活動に基づいてユーザーにフラグを立てたり制限したりする検出システムを構築した[ 79 ] 。
透明性 ニューラルネットワークはしばしばブラックボックスと表現されてきました [ 80 ]。 これは、膨大な数の計算の結果として、なぜそのような決定を下すのかを理解することが難しいことを意味します[ 81 ] 。そのため、故障を予測することは困難です。2018年には、自動運転車が歩行者を認識できずに死亡させる事故が発生しました。AIソフトウェアのブラックボックス的な性質のため、この事故の原因は依然として不明です[ 82 ] 。また、統計的に効率的ではあるものの不透明なモデルを使用すべきかどうかについて、医療分野 で議論が巻き起こっています[ 83 ] 。
透明性の重要な利点の1つは説明可能性 です。[ 84 ] 公平性を確保するために、決定が下された理由を説明することが法的に義務付けられている場合もあります。たとえば、求人応募の自動フィルタリングや信用スコアの 割り当てなどです。[ 84 ]
もう1つの利点は、失敗の原因を明らかにすることです。[ 80 ] 2020年のCOVID-19パンデミックの初期に、研究者たちは透明性ツールを使用して、医療画像分類器が無関係な病院ラベルに「注意を払っている」ことを示しました。[ 85 ]
透明性技術は、エラーの修正にも使用できます。たとえば、「GPT における事実の関連性の特定と編集」という論文では、著者らは、エッフェル塔の位置に関する質問への回答に影響を与えるモデルパラメータを特定することができました。そして、この知識を「編集」して、モデルがエッフェル塔がフランスではなくローマにあると信じているかのように質問に答えるようにすることができました。[ 86 ] この場合、著者らはエラーを意図的に引き起こしましたが、これらの方法は、エラーを効率的に修正するために使用できる可能性があります。モデル編集技術は、コンピュータビジョンにも存在します。[ 87 ]
最後に、AI システムの不透明性は重大なリスク源であり、その機能の理解を深めることで将来重大な失敗を防ぐことができると主張する人もいます。[ 88 ] 「内部」解釈可能性の研究は、機械学習モデルの不透明性を軽減することを目的としています。この研究の目標の 1 つは、内部のニューロンの活性化が何を表しているかを特定することです。[ 89 ] [ 90 ] 例えば、研究者は、スパイダーマンの コスチュームを着た人の画像、スパイダーマンのスケッチ、および「スパイダー」という単語に反応する CLIP 人工知能システムのニューロンを特定しました。[ 91 ] また、これらのニューロンまたは「回路 」間の接続を説明することも含まれます。[ 92 ] [ 93 ] 例えば、研究者は、言語モデルがコンテキストから学習する方法に役割を果たしている可能性がある、トランスフォーマー注意のパターンマッチングメカニズムを特定しました。[ 94 ] 「内部解釈可能性」は神経科学と比較されています。どちらの場合も、目標は複雑なシステムで何が起こっているのかを理解することですが、機械学習の研究者は完璧な測定を行い、任意のアブレーションを実行できるという利点があります。[ 95 ]
トロイの木馬の検出 機械学習モデルには、「トロイの木馬」や「バックドア 」といった脆弱性が含まれている可能性があります。これらは、悪意のある攻撃者がAIシステムに悪意を持って組み込んだものです。例えば、トロイの木馬が仕込まれた顔認識システムは、特定の宝石類が視界に入ったときにアクセスを許可してしまう可能性があります。[ 2 ] また、トロイの木馬が仕込まれた自動運転車は、特定のトリガーが見えるまで正常に動作し続ける可能性があります。[ 96 ] CLIPやGPT-3のような大規模モデルは、公開されているインターネットデータで学習されているため、このようなことは難しくないかもしれません。[ 97 ] 研究者たちは、300万枚の学習画像のうちわずか300枚を変更するだけで、画像分類器にトロイの木馬を仕込むことができました。[ 98 ] セキュリティリスクをもたらすことに加えて、研究者たちは、トロイの木馬はより優れた監視ツールをテストおよび開発するための具体的な環境を提供すると主張しています。[ 60 ]
Anthropic による2024年の研究論文では、大規模な言語モデルは 永続的なバックドアでトレーニングできることが示されました。これらの「スリーパーエージェント」モデルは、特定の日付以降に悪意のある出力(脆弱なコードなど)を生成するようにプログラムでき、それ以前は正常に動作します。教師ありファインチューニング 、強化学習 、敵対的トレーニングなどの 標準 的なAI安全対策では、これらのバックドアを取り除くことができませんでした。[ 99 ] [ 100 ]
システムの安全性と社会技術的要因 AIのリスク(そしてより一般的には技術リスク)は、誤用または事故 として分類されるのが一般的です。[ 137 ] 一部の学者は、この枠組みは不十分であると指摘しています。[ 137 ] 例えば、キューバ危機は、 明らかに事故でも技術の誤用でもありませんでした。[ 137 ] 政策アナリストのZwetslootとDafoeは、「誤用と事故の観点は、危害に至る因果関係の最後の段階、つまり技術を誤用した人物、または意図しない方法で動作したシステムにのみ焦点を当てる傾向があります... しかし、多くの場合、関連する因果関係ははるかに長くなります」と述べています。リスクは、競争圧力、危害の拡散、急速な開発、高いレベルの不確実性、不十分な安全文化などの「構造的」または「システム的」要因から生じることがよくあります。[ 137 ] 安全工学 のより広い文脈では、「組織の安全文化」のような構造的要因が、広く普及しているSTAMPリスク分析フレームワークにおいて中心的な役割を果たしている。[ 138 ]
構造的視点に触発され、一部の研究者は、機械学習を使用して社会技術的安全要因を改善することの重要性を強調している。たとえば、サイバー防御に機械学習を使用したり、制度的意思決定を改善したり、協力を促進したりする。[ 2 ] また、構造的脆弱性に対処するために、設計プロセスにAIの実務者とドメインエキスパートの両方を関与させることの重要性を強調している研究者もいる。[ 139 ]
サイバー防衛 AI がサイバー攻撃者とサイバー防御者の間の既に不均衡なゲームを悪化させるのではないかと懸念する学者もいる。[ 140 ] これは「先制攻撃」のインセンティブを高め、より攻撃的で不安定化を招く攻撃につながる可能性がある。このリスクを軽減するために、サイバー防御への重点強化を提唱する人もいる。さらに、強力な AI モデルの盗難や悪用を防ぐためには、ソフトウェア セキュリティが不可欠である。[ 11 ] 最近の研究では、AI がルーチン タスクを自動化し、全体的な効率を向上させることで、技術的および管理的なサイバー セキュリティ タスクを大幅に強化できることが示されている。[ 141 ] AI の安全性に関する研究では、機械学習システムをトレーニング中のデータ ポイズニング攻撃から保護するための防御技術も検討されている。特に、ラベル フリッピング攻撃は、従来のデータ検証方法では検出が困難なまま、モデルのパフォーマンスを低下させる可能性がある。このリスクに対処するために、最近の研究では、学習動作を監視し、複数の検出器を組み合わせて疑わしいトレーニング サンプルを特定するモデル非依存の検出パイプラインが提案されている。このようなアプローチは、敵対的な環境で動作する AI システムの回復力と信頼性を向上させることで、サイバー防御を強化することを目的としている。[ 142 ] [ 143 ]
組織的意思決定の改善 経済や軍事分野におけるAIの進歩は、前例のない政治的課題を引き起こす可能性がある。[ 144 ] 一部の学者は、AI競争の力学を冷戦になぞらえており、少数の意思決定者の慎重な判断が安定と破滅の分かれ目となることが多かった。[ 145 ] AI研究者は、AI技術は意思決定の支援にも利用できると主張している。[ 2 ] 例えば、研究者たちはAI予測[ 146 ]や助言システム [ 147 ] の開発を始めている。
協力関係の促進 地球規模の脅威の多く(核戦争 [ 148 ] 、気候変動 [ 149 ] など)は、協力の課題として捉えられてきました。 よく 知られている囚人のジレンマのシナリオ と同様に、たとえ各プレイヤーが自己利益のために最適に行動している場合でも、一部の力学はすべてのプレイヤーにとって悪い結果をもたらす可能性があります。例えば、誰も介入しなければ重大な結果を招く可能性があるにもかかわらず、気候変動に対処する強いインセンティブを持つ単一のアクターは存在しません。[ 149 ]
AI 協力の重要な課題は、「底辺への競争」を避けることです。[ 150 ] このシナリオでは、国や企業がより高性能な AI システムを構築しようと競い合い、安全性を軽視し、関係者全員に被害を与える壊滅的な事故につながります。このようなシナリオへの懸念から、人間同士、そして潜在的には AI システム同士の協力を促進するための政治的[ 151 ] および技術的[ 152 ] 努力が促されています。ほとんどの AI 研究は、個々のエージェントを設計して、孤立した機能 (多くの場合「シングルプレイヤー」ゲーム) を果たすことに焦点を当てています。[ 153 ] 研究者たちは、AI システムがより自律的になるにつれて、それらの相互作用の方法を研究し、形作ることが不可欠になる可能性があると示唆しています。[ 153 ] [ 139 ]
安全性評価 AI 安全性評価 (しばしば「評価」と呼ばれる) は、研究者が特定の人工知能 モデルによってもたらされるリスクを評価するために設計したテストです。 [ 154 ] [ 155 ] 評価は、生のモデル出力によってもたらされるリスクと、そのようなモデルを展開した場合の潜在的な現実世界の結果の両方を判断するのに役立ちます。展開前に最先端の AI モデルに対して AI 安全性評価を実行することは、ベスト プラクティスとして広く考えられており、[ 156 ] [ 157 ] 政府は何らかの形の安全性評価を義務付けることについて議論してきました。[ 158 ] [ 159 ] [ 160 ] Anthropic やOpenAI を含む複数の AI 企業が協力して、展開前に互いのモデルの評価を実行しています。[ 161 ]
一部のモデルは、サンドバギング(懸念を引き起こすことを回避するために評価で意図的に低いパフォーマンスを示すこと)などの戦略を使用してAIの安全性評価を欺こうとしていることが判明しており、これは「評価意識」を示しており、それ自体はより高度な評価によって測定できます。[ 162 ]
AIの安全性評価は、大きく分けてモデルの直接的な出力をテストするもの(モデル安全性評価)と、モデルへのアクセスが人間の行動にどのような影響を与えるかを分析するもの(コンテキスト安全性評価)に分類できます。[ 154 ] モデル安全性評価の一例として、Apollo Research による2024年のテストでは、特定のプロンプトを入力として与えると、モデルと入力プロンプトの文言に応じて、モデルが0.3%~10%の割合で欺瞞的な行動をとることがわかりました。[ 163 ]
モデルの安全性評価の種類には、ベンチマーク と機能テストがあります。ベンチマークは通常、モデルを評価し、他のモデルと比較してスコアを割り当てることができる静的なプロンプトのリストで構成されています。[ 164 ]
AIガードレール 研究者や実務家は、2020年代に、AI システムが安全であり、倫理的または法的期待に沿っていることを保証するために設計されたさまざまなフレームワークやツールを説明するために、AI ガードレールという用語と概念を導入しました。[ 165 ] IT の観点からは、「ガードレール」は Python で開発されたフレームワークであり、組織が AI システムに追加して、より信頼性が高く安全な AI アプリケーションを構築するのに役立ちます。[ 166 ] [ 167 ] AI アプリケーションの入力と出力で「ガード」を実行し、特定の種類のリスクを特定して軽減します。[ 168 ] マッキンゼーは、対処するさまざまな種類のリスクに基づいてガードレールの分類を開発しました。この分類には、たとえば、適切性ガードレール、規制遵守、整合性、検証ガードレールが含まれます。[ 169 ] 安全ガードレールが大規模言語モデルに与える影響は、いくつかの研究で評価されています。[ 170 ]
ガバナンスにおいて 2023年11月のAI安全サミット[ 171 ] AIガバナンスは、AIシステムの利用と開発を導くための規範、基準、規制の作成に広く関わっています。[ 145 ]
研究 AIの安全性に関して、ローカルな解決策は個々のAIシステムに焦点を当て、それらが安全で有益であることを保証する一方、グローバルな解決策はさまざまな管轄区域にわたるすべてのAIシステムに対する安全対策の実施を目指します。[ 172 ]
AI の安全性ガバナンスに関する研究は、AI の潜在的な影響に関する基礎的な調査から具体的なアプリケーションまで多岐にわたります。基礎的な側面では、研究者たちは、AI はその幅広い適用性により、電気や蒸気機関に例えられ、社会の多くの側面を変革する可能性があると主張してきました。[ 173 ] 一部の研究は、これらの影響から生じる可能性のある特定のリスク、例えば、大量失業[ 174 ] 、兵器化[ 175 ] 、偽情報[ 176 ] 、監視[ 177 ] 、権力の集中[178]によるリスクを予測することに焦点を当てています。その他 の研究 では、急速に進化する AI 産業を監視することの難しさ[ 179 ] 、AI モデルの入手可能性[ 180 ] 、「底辺への競争」のダイナミクスなど、根本的なリスク要因を探求しています。[ 150 ] [ 181 ] DeepMind の長期ガバナンスおよび戦略責任者である Allan Dafoe 氏は、競争の危険性と協力の必要性を強調し、「高度で強力なシステムを展開する前に高度な注意を払うことは、AI の安全性と整合性にとって必要かつ十分な条件に近いかもしれない。しかし、先行者利益や相対的優位性が大きい領域で競争している場合、アクターは最適ではないレベルの注意を選択するよう圧力を受けるだろう」と述べている。[ 151 ] 研究の流れは、AI の説明責任を評価し、AI ベースのシステムの監査を指導および促進するためのアプローチ、フレームワーク、および方法の開発に焦点を当てている。[ 182 ] [ 183 ] [ 184 ] これらのアプローチの重要な課題は、広く受け入れられている標準の欠如と、方法に必要なことに関する曖昧さ、[ 185 ] [ 186 ] および業界における安全文化の欠如である。[ 187 ]
AIの安全性を高める取り組みには、AIの出力を倫理ガイドライン に合わせ、悪用やデータ漏洩などのリスクを軽減するように設計されたフレームワークが含まれます。Nvidiaの Guardrails [ 188 ] 、 Llama Guard [ 189 ] 、 Preamble のカスタマイズ可能なガードレール[ 190 ] 、ClaudeのConstitutionなどのツールは、プロンプトインジェクション などの脆弱性を軽減し、出力が事前に定義された原則に準拠することを保証します。これらのフレームワークは、安全性と信頼性を向上させるために、AIシステムに統合されることがよくあります。[ 191 ]
哲学的視点 AIの安全性という分野は、特に倫理の領域において、哲学的考察と深く結びついています。道徳規則の遵守を重視する義務論的 倫理は、AIシステムを人間の価値観に合わせるための枠組みとして提案されてきました。義務論的原則を組み込むことで、AIシステムが危害を引き起こす行動を避けるように誘導され、その運用が倫理的な境界内に留まることが保証されると示唆する人もいますが[ 192 ] 、これらの提案には疑問が呈され、より有望な代替案が提案されています[ 193 ] 。
政府の行動 一部の専門家は、AIを規制するには時期尚早だと主張し、規制がイノベーションを阻害し、「無知のまま性急に規制するのは愚かだ」と懸念を表明している。[ 194 ] [ 195 ] 一方、実業家のイーロン・マスク氏 のような人々は、壊滅的なリスクを軽減するために先制的な措置を求めている。[ 196 ]
正式な法律とは別に、政府機関は倫理と安全に関する勧告を提示している。2021年3月、米国国家安全保障人工知能委員会は、AIの進歩により「安全性、堅牢性、信頼性を含む目標と価値観にシステムが合致していることを保証する」ことがますます重要になる可能性があると報告した。[ 197 ] その後、米国国立標準技術研究所はAIリスク管理の枠組みを策定し、「壊滅的なリスクが存在する場合、リスクが十分に管理できるようになるまで、開発と展開を安全な方法で停止すべきである」と助言した。[ 198 ]
2021年9月、中華人民共和国 (PRC)は中国におけるAIの使用に関する倫理ガイドラインを発表し、AIの決定は人間の管理下に置かれるべきであることを強調し、説明責任メカニズムを求めた。同じ月、英国は 10年間の国家AI戦略を発表し[ 199 ] 、英国政府は「非同盟の汎用人工知能の長期的なリスク、およびそれが世界にもたらすであろう予測不可能な変化を真剣に受け止めている」と述べている[ 200 ] 。この戦略は、壊滅的なリスクを含む長期的なAIリスクを評価するための行動について説明している[ 200 ] 。英国政府は、AIの安全性に関する最初の主要なグローバルサミットを開催した。これは2023年11月1日と2日に開催され、「政策立案者と世界の指導者がAIの現在および将来のリスク、そしてこれらのリスクを世界的に協調したアプローチによってどのように軽減できるかを検討する機会」と説明された。[ 201 ] [ 202 ] 中国メディアプロジェクトは、「そのアプローチの主要な側面は、世界中の民主主義社会の基準から見て根本的に安全ではない」と述べ、中国のAI安全アプローチの一部は中国共産党( CCP)の情報統制を強化することに焦点を当てていると主張した。[ 203 ]
政府機関、特に米国では、AIの技術的な安全性研究の発展も奨励されています。情報高等研究計画活動(IDARPA)は、 AIシステムに対する トロイの木馬攻撃を 特定し、防御するためのTrojAIプロジェクトを開始しました。[ 204 ] DARPAは、 説明可能な人工知能 と敵対的攻撃 に対する堅牢性の向上に関する研究に取り組んでいます。[ 205 ] [ 206 ] また、国立科学財団は 、信頼できる機械学習センターを支援し、実証的なAI安全性研究に数百万ドルの資金を提供しています。[ 207 ]
2024年、国連総会は 、AIの設計、開発、展開、使用における人権の尊重、保護、促進を強調した「安全で、安心で、信頼できる」AIシステムの促進に関する初のグローバル決議を採択した。[ 208 ]
2024 年 5 月、科学技術革新省 (DSIT) は、AI 安全研究所の Christopher Summerfield 氏と Shahar Avin 氏がUK Research and Innovation と提携して主導する Systemic AI Safety Fast Grants Programme の下で、AI 安全研究に 850 万ポンドの資金提供を行うと発表した。技術大臣のMichelle Donelan氏は AI ソウル サミット でこの計画を発表し、目標は社会全体で AI を安全にすることであり、有望な提案にはさらに資金提供が行われる可能性があると述べた。英国はまた、他の 10 か国と EU と協定を結び、協力関係を促進し、情報やリソースを共有するための AI 安全研究所の国際ネットワークを形成した。さらに、英国 AI 安全研究所はサンフランシスコに事務所を開設する予定である。[ 209 ]
2024年11月、当時の米国大統領 ジョー・バイデン と中国共産党総書記 習近平は、 人工知能 ではなく人間の制御を核兵器の使用に維持する必要性を確認した。[ 210 ] [ 211 ] 2025会計年度国防権限法 の一部として、議会は「戦略的抑止を支援するための人工知能の使用に関する議会の意思」という第1638条を米国連邦法典に制定した。この条項は、「人工知能の使用は、兵器システムの機能、指揮当局からの通信の検証、または核兵器の使用に関する大統領の決定の実行において積極的な人間の行動を要求する原則を通じて、核保障措置の完全性を損なうものであってはならない」と規定している。[ 212 ] [ 213 ] 2026年2月、トランプ政権は核兵器の決定は人間の管理下に置かれることを公に再確認し、国防総省高官は「核兵器を使用するかどうかのすべての決定には人間が関与するという国防総省の方針」を改めて表明した。[ 214 ]
2025年9月、フランス人工知能安全センター(CeSIA)、フューチャー・ソサエティ、人間適合型人工知能センター (CHAI)は、AIのレッドラインに関する世界的な呼びかけ を発表し、各国政府に対し、2026年末までに容認できないAIの使用を禁止する拘束力のある国際協定を締結するよう促した。この宣言は当初、ノーベル賞受賞者10名を含む200名の著名人が署名し、マリア・レッサ氏が 国連総会 で発表した。[ 215 ]
2025年12月、ドナルド・トランプ 大統領は「人工知能に関する国家政策枠組み」を確立するための大統領令に署名した。[ 216 ] この大統領令は、州政府がAIを規制することを抑制し、議会にそのような規制を先取りする法律を可決するよう促した。[ 217 ] ホワイトハウスは、この措置の理由として経済と国家安全保障上の懸念を挙げたが、一部からは、AI規制の不確実性を生み出したとしてトランプを批判する声もあった。[ 218 ] [ 219 ] [ 220 ]
企業の自主規制 AI ラボや企業は一般的に、正式な法律の範囲外にある安全対策や規範に従っています。[ 221 ] ガバナンス研究者の目的の 1 つは、これらの規範を形成することです。文献に見られる安全対策の推奨事項の例としては、第三者による監査の実施[ 222 ] 、障害発見に対する報奨金の提供[ 222 ] 、 AI インシデントの共有[ 222 ] (この目的のために AI インシデント データベースが作成されました)[ 223 ] 、研究やモデルを公開するかどうかを決定するためのガイドラインの遵守[ 180 ] 、AI ラボの情報セキュリティとサイバーセキュリティの向上[ 224 ]などがあります。
企業もコミットメントを行っています。Cohere 、OpenAI 、AI21は 、 「言語モデルを展開するためのベストプラクティス」を提案し、誤用を軽減することに重点を置いて合意しました。[ 225 ] 競争のダイナミクスに加担することを避けるため、OpenAIは憲章で「価値観が一致し、安全性を重視するプロジェクトが我々よりも先にAGIの構築に近づいた場合、我々は競争をやめてそのプロジェクトを支援することを約束する」と述べています。[ 226 ] また、DeepMindのCEOであるDemis Hassabis氏やFacebook AIのディレクターであるYann LeCun氏などの業界リーダーは、アシロマ原則[ 37 ]や自律兵器公開書簡 [ 227 ] などの公開書簡に署名しています。
参考文献 ↑ Ahmed, Shazeda; Jaźwińska, Klaudia; Ahlawat, Archana; Winecoff, Amy; Wang, Mona (2024-04-14). "AI安全性の分野構築と認識文化" . First Monday . doi : 10.5210/fm.v29i4.13626 . ISSN 1396-0466 . 1 2 3 4 5 6 Hendrycks, Dan; Carlini, Nicholas ; Schulman, John; Steinhardt, Jacob (2022-06-16). "機械学習の安全性における未解決の問題". arXiv : 2109.13916 [ cs.LG ]. ↑ Champagne, Dylan (2026-02-26). "トランプ大統領、州のAI規制を標的に" . The Regulatory Review . 2026-02-27 に取得. ↑ 「カリフォルニア州のAI安全法とは何か?」 。 ブルッキングス研究所 。2025年12月23日。 2026年2月27日 取得 。 ↑ 「人工知能2024年法案」 。www.ncsl.org 。 2026年2月27日 取得 。 ↑ ペリゴ、ビリー (2023-11-02). 「英国のAI安全サミットは限定的ではあるが意義のある進展で終了」 . タイム. 2024-06-02 閲覧 . ↑ De-Arteaga, Maria (2020-05-13). 機械学習における高リスク環境:リスクと機会 (博士論文)。カーネギーメロン大学。 ↑ Mehrabi, Ninareh; Morstatter, Fred; Saxena, Nripsuta; Lerman, Kristina; Galstyan, Aram (2021). "機械学習におけるバイアスと公平性に関する調査" . ACM Computing Surveys . 54 (6): 1– 35. arXiv : 1908.09635 . doi : 10.1145/3457607 . ISSN 0360-0300 . S2CID 201666566 . 2022-11-23 のオリジナルから アーカイブ済み. 2022-11-28 に取得 . ↑ フェルドスタイン、スティーブン (2019)。AI監視の世界的拡大(報告書)。カーネギー国際平和財団。 ↑ Barnes, Beth (2021). "AIによる説得のリスク" . Lesswrong . 2022年11月23日のオリジナルから アーカイブ済み. 2022年11月23日 取得 . 1 2 3 Brundage, Miles; Avin, Shahar; Clark, Jack; Toner, Helen; Eckersley, Peter; Garfinkel, Ben; Dafoe, Allan; Scharre, Paul; Zeitzoff, Thomas; Filar, Bobby; Anderson, Hyrum; Roff, Heather; Allen, Gregory C; Steinhardt, Jacob; Flynn, Carrick (2018-04-30). "人工知能の悪用: 予測、予防、および緩和" . Apollo-University Of Cambridge Repository、Apollo-University Of Cambridge Repository。Apollo - University of Cambridge Repository。doi : 10.17863/cam.22520 . S2CID 3385567 . 2022-11-23 の オリジナルから アーカイブ済み 。 2022年11月28日 に取得 。 ↑ デイヴィス、パスカル(2022年12月26日)。 「NATOはAIサイバー攻撃の新時代にどのように備えているか」 。 ユーロニュース。 2024年3月23日 閲覧 。 ↑ Ahuja, Anjana (2024年2月7日). 「AIのバイオテロの可能性は排除すべきではない」 . フィナンシャル・タイムズ. 2024年3月23日 閲覧 . ↑ Carlsmith, Joseph (2022-06-16). "権力追求型AIは実存的リスクか?". arXiv : 2206.13353 . ↑ ミナルディ、ディ(2020年10月16日) 「絶滅よりも悪いかもしれない悲惨な運命」 「 . BBC . 2024年3月23日 取得 。↑ 「AGI専門家ピーター・ヴォス氏、AIアライメント問題はでたらめだと発言|NextBigFuture.com」 。2023年4月4日。 2023年7月23日 閲覧 。 ↑ Dafoe, Allan (2016). "はい、私たちは人工知能の存在リスクについて懸念しています" . MIT Technology Review . 2022年11月28日のオリジナルから アーカイブ済み . 2022年11月28日 に取得. 1 2 Grace, Katja; Salvatier, John; Dafoe, Allan; Zhang, Baobao; Evans, Owain (2018-07-31). "Viewpoint: When Will AI Exceed Human Performance? Evidence from AI Experts" . Journal of Artificial Intelligence Research . 62 : 729– 754. arXiv : 1705.08807 . doi : 10.1613/jair.1.11222 . ISSN 1076-9757 . S2CID 8746462 . 2023-02-10 のオリジナルから アーカイブ済み. 2022-11-28 に取得 . ↑ Zhang, Baobao; Anderljung, Markus; Kahn, Lauren; Dreksler, Noemi; Horowitz, Michael C.; Dafoe, Allan (2021-05-05). "人工知能の倫理とガバナンス:機械学習研究者への調査からの証拠" . Journal of Artificial Intelligence Research . 71 . arXiv : 2105.02117 . doi : 10.1613/jair.1.12895 . ↑ Stein-Perlman, Zach; Weinstein-Raun, Benjamin; Grace (2022-08-04). "2022年AIの進歩に関する専門家調査" . AI Impacts . 2022-11-23のオリジナルから アーカイブ済み。2022-11-23 に 取得 。 ↑ マイケル、ジュリアン。 アリ・ホルツマン ;パリッシュ、アリシア。ミューラー、アーロン。ワン、アレックス。チェン、アンジェリカ。マダン、ディヴィヤム。ナンギア、ニキータ。パン、リチャード・ユアンツェ;ファン、ジェイソン。ボウマン、サミュエル R. (2022-08-26)。 「NLP 研究者は何を信じていますか? NLP コミュニティのメタ調査の結果」。 計算言語学協会 。 arXiv : 2208.12852 。 ↑ マーコフ、ジョン (2013-05-20). 「1949年、彼はロボットの時代を想像した」 . ニューヨーク・タイムズ . ISSN 0362-4331 . 2022-11-23 のオリジナルから アーカイブ済み . 2022-11-23 に取得。 ↑ 人工知能:専門職のためのハンドブック 。サセックス大学。1988年1月 。ISBN 978-0-470-21103-8 。↑ 人工知能振興協会。 「AAAI 大統領パネルによる長期的な AI の未来」 。2022 年 9 月 1 日のオリジナルから アーカイブ。2022 年 11 月 23 日 に取得 。 ↑ Yampolskiy, Roman V.; Spellchecker, MS (2016-10-25). "人工知能の安全性とサイバーセキュリティ:AIの失敗のタイムライン". arXiv : 1610.07997 . ↑ "PT-AI 2011 – 人工知能の哲学と理論 (PT-AI 2011)" 。 2022年11月23日にオリジナルから アーカイブ済み 。 2022年11月23日 に取得。 ↑ Yampolskiy, Roman V. (2013), "人工知能安全工学:機械倫理が間違ったアプローチである理由" , Müller, Vincent C. (編), Philosophy and Theory of Artificial Intelligence , Studies in Applied Philosophy, Epistemology and Rational Ethics, vol. 5, Berlin; Heidelberg, Germany: Springer Berlin Heidelberg, pp. 389–396 , doi : 10.1007/978-3-642-31674-6_29 , ISBN 978-3-642-31673-9 2023年3月15日にオリジナルからアーカイブされ、2022年11月23日 に取得されました。 ↑ McLean, Scott; Read, Gemma JM; Thompson, Jason; Baber, Chris; Stanton, Neville A.; Salmon, Paul M. (2023-07-04). "The risks associated with Artificial General Intelligence: A systematic review" . Journal of Experimental & Theoretical Artificial Intelligence . 35 (5): 649– 663. Bibcode : 2023JETAI..35..649M . doi : 10.1080/0952813X.2021.1964003 . hdl : 11343/289595 . ISSN 0952-813X . S2CID 238643957 . ↑ ワイル、ロブ(2014年8月3日) 「イーロン・マスク:人工知能は『核兵器よりも危険な可能性がある』」 「 . Business Insider . 2024年2月22日 取得 。↑ Kuo, Kaiser (2015-03-31). Baidu CEO Robin Li が Boao Forum で Bill Gates と Elon Musk にインタビュー、2015 年 3 月 29 日 。イベントは 55:49 に発生。2022-11-23 のオリジナルから アーカイブ済み。2022-11-23 に 取得 。 ↑ Cellan-Jones, Rory (2014-12-02). "スティーブン・ホーキング博士、人工知能が人類を滅亡させる可能性があると警告" . BBCニュース . 2015-10-30のオリジナルから アーカイブ済み . 2022-11-23に 閲覧. ↑ Future of Life Institute. 「堅牢で有益な人工知能の研究優先事項:公開書簡」 。Future of Life Institute 。 2022年11月23日にオリジナルから アーカイブ済み。 2022年11月23日 に取得 。 ↑ Future of Life Institute (2016 年 10 月)。 「AI 研究助成プログラム」 。Future of Life Institute。2022 年 11 月 23 日にオリジナルから アーカイブ済み 。2022 年 11 月 23 日 に取得 。 ↑ "SafArtInt 2016" 。 2022年11月23日にオリジナルから アーカイブされました 。 2022年11月23日 に取得。 ↑ Bach, Deborah (2016). "UW、人工知能に関するホワイトハウス公開ワークショップ4回のうち最初のワークショップを開催" . UW News . 2022年11月23日のオリジナルから アーカイブ済み. 2022年11月23日 閲覧 . ↑ アモデイ、ダリオ。ああ、クリス。スタインハート、ジェイコブ。クリスティアーノ、ポール。ジョン・シュルマン。マネ、ダン (2016-07-25)。 「AIの安全性における具体的な問題点」。 arXiv : 1606.06565 。 1 2 Future of Life Institute. "AI の原則" . Future of Life Institute . 2022-11-23 のオリジナルから アーカイブ済み . 2022-11-23 に取得. ↑ ベンジオ・ヨシュア、プリビテラ・ダニエル、ベシログル・タマイ、ボンマサニ・リシ、キャスパー・スティーブン、チェ・イェジン、ゴールドファーブ・ダニエル、ヘイダリ・ホダ、カラトバリ・レイラ(2024年5月)。 高度AIの安全性に関する国際科学報告書 (報告書)。科学・イノベーション・技術省。 1 2 研究、DeepMind Safety (2018-09-27)。 「 安全な人工知能の構築:仕様、堅牢性、および保証」 。Medium。2023-02-10 のオリジナルから アーカイブ 。2022-11-23 に 取得 。 ↑ 「SafeML ICLR 2019 Workshop」 。 2022年11月23日にオリジナルから アーカイブされました 。 2022年11月23日 に取得。 ↑ブラウン、ライアン ( 2023-06-12 )。 「英国のリシ・スナック首相、英国をAI安全規制の本拠地として売り込み、ロンドンは次なるシリコンバレーを目指す 」 。CNBC。2023-06-25 閲覧 。 ↑ ベルトゥッツィ、ルカ(2023年10月18日)。 「英国のAI安全サミットは、最先端モデルに対する人間の制御を失うリスクを強調する予定」 。Euractiv 。 2024年 3月2日 取得 。 ↑ ベンジオ、ヨシュア。プリビテラ、ダニエル。ボンマサニ、リシ。キャスパー、スティーブン。ダニエル・ゴールドファーブ。マヴロウディス、バシリオス。カラトバリ、レイラ;マゼイカ、マンタ。ほだ、へいだり(2024-05-17)。 「先端AIの安全性に関する国際科学報告書」 (PDF) 。 英国政府 。 2024-06-15 にオリジナルから アーカイブ (PDF)されました 。 2024 年 7 月 8 日 に取得 。 代替URL↑ シェパードソン、デイビッド(2024年4月1日)。 「米国と英国、AIの安全性とテストに関するパートナーシップを発表」 。 2024年 4月2日 取得 。 ↑ 「国際AI安全報告書が雇用、気候変動、サイバー戦争などについて述べていること」 。 ガーディアン 。2025年1月29日。ISSN 0261-3077 。 2025年3月3 日 取得 。 ↑ 「 ヨシュア ・ベンジオ議長によるAI安全に関する初の国際報告書の発表」 。mila.quebec 。2025年1月29日。 2025年 3月3日取得 。 ↑ Kahn, Jeremy; Forlini, Emily. 「OpenAIは、自社のAIモデルが安全なテスト環境から脱走し、評価を不正に操作するためにAI企業Hugging Faceにハッキングしたと述べている」 . Fortune . 2026年7月21日 閲覧 。 ↑ Goodfellow, Ian; Papernot, Nicolas; Huang, Sandy; Duan, Rocky; Abbeel, Pieter; Clark, Jack (2017-02-24). "敵対的サンプルによる機械学習への攻撃" . OpenAI . 2022-11-24 のオリジナルから アーカイブ済み. 2022-11-24 に取得 . 1 2 セゲディ、クリスチャン。ザレンバ、ヴォイチェフ。スツケヴァー、イリヤ。ブルーナ、ジョアン。エルハン、ドゥミトル。グッドフェロー、イアン。ファーガス、ロブ (2014-02-19)。 「ニューラルネットワークの興味深い特性」。 ICLR 。 arXiv : 1312.6199 。 ↑ Kurakin, Alexey; Goodfellow, Ian; Bengio, Samy (2017-02-10). "物理世界における敵対的サンプル". ICLR . arXiv : 1607.02533 . ↑ Madry, Aleksander; Makelov, Aleksandar; Schmidt, Ludwig; Tsipras, Dimitris; Vladu, Adrian (2019-09-04). "Towards Deep Learning Models Resistant to Adversarial Attacks". ICLR . arXiv : 1706.06083 . ↑ Kannan, Harini; Kurakin, Alexey; Goodfellow, Ian (2018-03-16). "Adversarial Logit Pairing". arXiv : 1803.06373 . ↑ Gilmer, Justin; Adams, Ryan P.; Goodfellow, Ian; Andersen, David; Dahl, George E. (2018-07-19). "敵対的サンプル研究のためのゲームルールの動機付け". arXiv : 1807.06732 . ↑ Carlini, Nicholas; Wagner, David (2018-03-29). "Audio Adversarial Examples: Targeted Attacks on Speech-to-Text". IEEE Security and Privacy Workshops . arXiv : 1801.01944 . ↑ Sheatsley, Ryan; Papernot, Nicolas; Weisman, Michael; Verma, Gunjan; McDaniel, Patrick (2022-09-09). "制約付きドメインにおける敵対的サンプル". arXiv : 2011.01183 . ↑ Suciu, Octavian; Coull, Scott E.; Johns, Jeffrey (2019-04-13). "マルウェア検出における敵対的サンプルの探索". IEEE Security and Privacy Workshops . arXiv : 1810.08280 . ↑ Ouyang, Long; Wu, Jeff; Jiang, Xu; Almeida, Diogo; Wainwright, Carroll L.; Mishkin, Pamela; Zhang, Chong; Agarwal, Sandhini; Slama, Katarina; Ray, Alex; Schulman, John; Hilton, Jacob; Kelton, Fraser; Miller, Luke; Simens, Maddie (2022-03-04). "人間のフィードバックによる指示に従うための言語モデルのトレーニング". NeurIPS . arXiv : 2203.02155 . ↑ Gao, Leo; Schulman, John; Hilton, Jacob (2022-10-19). "報酬モデルの過剰最適化のためのスケーリング法則". ICML . arXiv : 2210.10760 . ↑ Yu, Sihyun; Ahn, Sungsoo; Song, Le; Shin, Jinwoo (2021-10-27). "RoMA: Robust Model Adaptation for Offline Model-based Optimization". NeurIPS . arXiv : 2110.14188 . 1 2 Hendrycks, Dan; Mazeika, Mantas (2022-09-20). "AI研究のためのXリスク分析". arXiv : 2206.05862 . 1 2 「迅速な注入攻撃は『適切に軽減できない可能性がある』と英国NCSCが警告」 . TechRadar . 2025-12-09 . 2025-12-12 に取得. ↑ 「AnthropicとOpenAIがLLMモデルの重みの保護にこだわる理由」 。VentureBeat 。 2023 年12月15日。 ↑ 「AIによるフェイクニュースの台頭は、『誤情報のスーパースプレッダー』を生み出している」 「 .ワシントン・ポスト . 2023-12-17. ISSN 0190-8286 . 2025-12-12 に取得。 ↑ ペレス・セロラザ、ジョン。アベラ、ジャウメ。ボルグ、マルクス。ドンゼラ、カルロ。セルキデス、イエス。カソルラ、フランシスコ J.イングランド、クリストファー。タウバー、マルクス。ニコラコプロス、ジョージ。フローレス、ホセ・ルイス (2024)。 「産業および輸送分野における安全性が重要なシステムのための人工知能: 調査」。 ACM コンピューティング調査 。 56 (7): 1–40 . 土井 : 10.1145/3626314 。 ↑ Brando, Axel; Serra, Isabel; Mezzetti, Enrico; Cazorla, Francisco J.; Perez-Cerrolaza, Jon; Abella, Jaume (2023 年 5 月). "On Neural Networks Redundancy and Diversity for Their Use in Safety-Critical Systems". Computer . 56 (5): 41– 50. Bibcode : 2023Compr..56e..41B . doi : 10.1109/MC.2023.3236523 . hdl : 2117/387765 . ↑ 町田文雄 (2019). 「安全性が重要なシステムのためのNバージョン機械学習モデル」. 2019 第49回IEEE/IFIP国際信頼性システムおよびネットワークワークショップ(DSN-W) . IEEE. pp. 48–51 . doi : 10.1109/DSN-W.2019.00017 . ↑ Tran, Khoa A.; Kondrashova, Olga; Bradley, Andrew; Williams, Elizabeth D.; Pearson, John V.; Waddell, Nicola (2021). "がんの診断、予後、治療選択における深層学習" . Genome Medicine . 13 (1): 152. doi : 10.1186/s13073-021-00968-x . ISSN 1756-994X . PMC 8477474 . PMID 34579788 . ↑ Guo, Chuan; Pleiss, Geoff; Sun, Yu; Weinberger, Kilian Q. (2017-08-06). "On calibration of modern neural networks". Proceedings of the 34th international conference on machine learning . Proceedings of machine learning research. Vol. 70. PMLR. pp. 1321–1330 . ↑ Ovadia, Yaniv; Fertig, Emily; Ren, Jie; Nado, Zachary; Sculley, D.; Nowozin, Sebastian; Dillon, Joshua V.; Lakshminarayanan, Balaji; Snoek, Jasper (2019-12-17). "Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift". NeurIPS . arXiv : 1906.02530 . ↑ ボグドール、ダニエル。ブライテンシュタイン、ジャスミン。ハイデッカー、フロリアン。ビーシャール、マールテン。病気だよ、ベルンハルト。フィングシャイト、ティム。ツェルナー、J. マリウス (2021)。 「自動運転における特殊なケースの説明: 目標と課題」。 2021 IEEE/CVF コンピューター ビジョン ワークショップに関する国際会議 (ICCVW) 。ページ 1023–1028。arXiv : 2109.09607 。 土井 : 10.1109/ICCVW54120.2021.00119 。 ISBN 978-1-6654-0191-3 . S2CID 237572375 . ↑ Hendrycks, Dan; Mazeika, Mantas; Dietterich, Thomas (2019-01-28). "外れ値露出による深層異常検出". ICLR . arXiv : 1812.04606 . ↑ ワン・ハオチー;李志中。豊、李通。張、ウェイン (2022-03-21)。 「ViM: 仮想ロジット マッチングによる配信外」。 CVPR 。 arXiv : 2203.10807 。 ↑ Hendrycks, Dan; Gimpel, Kevin (2018-10-03). "ニューラルネットワークにおける誤分類および分布外の例を検出するためのベースライン". ICLR . arXiv : 1610.02136 . ↑ Urbina, Fabio; Lentzos, Filippa; Invernizzi, Cédric; Ekins, Sean (2022). "人工知能を活用した創薬の二重利用" . Nature Machine Intelligence . 4 (3): 189– 191. doi : 10.1038/s42256-022-00465-9 . ISSN 2522-5839 . PMC 9544280 . PMID 36211133 . ↑ セキュリティおよび新興技術センター、ブキャナン、ベン、ローン、アンドリュー、マッサー、マイカ、セドヴァ、カテリーナ (2021)。 「 真実、嘘、そして自動化:言語モデルが偽情報をどのように変えるか」 。doi : 10.51593/2021ca003。S2CID 240522878。 2022年11月 24 日のオリジナルから アーカイブ 。 2022年11月28日 取得 。 ↑ 「大規模な言語モデルが悪用されると、プロパガンダ・アズ・ア・サービスが間近に迫っているかもしれない」 。VentureBeat 。2021年12月14日。 2022 年11月24日のオリジナルから アーカイブ。 2022年11月24日 に取得 。 ↑ Center for Security and Emerging Technology; Buchanan, Ben; Bansemer, John; Cary, Dakota; Lucas, Jack; Musser, Micah (2020). "Automating Cyber Attacks: Hype and Reality" . Center for Security and Emerging Technology . doi : 10.51593/2020ca002 . S2CID 234623943 . 2022年11月24日のオリジナルから アーカイブ済み. 2022年11月28日 取得 . ↑ 「言語モデルの安全性と誤用に関する教訓」 。OpenAI 。2022年 3 月3日。 2022年11月24日のオリジナルから アーカイブ 。 2022年11月24日 に取得。 ↑ Markov, Todor; Zhang, Chong; Agarwal, Sandhini; Eloundou, Tyna; Lee, Teddy; Adler, Steven; Jiang, Angela; Weng, Lilian (2022-08-10). "New-and-Improved Content Moderation Tooling" . OpenAI . 2023-01-11 のオリジナルから アーカイブ済み. 2022-11-24 に取得 . 1 2 Savage, Neil (2022-03-29). "人工知能のブラックボックスを破る" . Nature . doi : 10.1038/d41586-022-00858-1 . PMID 35352042 . S2CID 247792459 . 2022-11-24 のオリジナルから アーカイブ済み . 2022-11-24 に取得. ↑ Center for Security and Emerging Technology; Rudner, Tim; Toner, Helen (2021). "AI の安全性における重要な概念: 機械学習における解釈可能性" . CSET Issue Brief . doi : 10.51593/20190042 . S2CID 233775541 . 2022-11-24 のオリジナルから アーカイブ済み. 2022-11-28 に取得 . ↑ McFarland, Matt (2018-03-19). "Uber、自動運転車初の死亡事故を受け、自動運転車を撤退" . CNNMoney . 2022-11-24 の オリジナルからアーカイブ済み . 2022-11-24 に取得 . ↑ Felder, Ryan Marshall (2021年7月) 「ブラックボックス問題との向き合い方:医療におけるAIシステムの正当化方法」 Hastings Center Report 51 ( 4): 38–45 . doi : 10.1002/hast.1248 . ISSN 0093-0334 . PMID 33821471 . 1 2 Doshi-Velez, Finale; Kortz, Mason; Budish, Ryan; Bavitz, Chris; Gershman, Sam; O'Brien, David; Scott, Kate; Schieber, Stuart; Waldo, James; Weinberger, David; Weller, Adrian; Wood, Alexandra (2019-12-20). "法律の下でのAIの説明責任: 説明の役割". arXiv : 1711.01134 . ↑ Fong, Ruth; Vedaldi, Andrea ( 2017). "意味のある摂動によるブラックボックスの解釈可能な説明". 2017 IEEE International Conference on Computer Vision (ICCV) . pp. 3449–3457 . arXiv : 1704.03296 . doi : 10.1109/ICCV.2017.371 . ISBN 978-1-5386-1032-9 . S2CID 1633753 . ↑ Meng, Kevin; Bau, David; Andonian, Alex; Belinkov, Yonatan (2022). "GPTにおける事実関係の特定と編集". Advances in Neural Information Processing Systems . 35 : 17359–17372 . arXiv : 2202.05262 . doi : 10.52202/068431-1262 . ISBN 978-1-7138-7108-8 。↑ バウ、デヴィッド;リュー、スティーブン。王、通州。朱潤燕。トラルバ、アントニオ (2020-07-30)。 「深い生成モデルの書き換え」。 ECCV 。 arXiv : 2007.15646 。 ↑ Räuker, Tilman; Ho, Anson; Casper, Stephen; Hadfield-Menell, Dylan (2022-09-05). "透明なAIに向けて:深層ニューラルネットワークの内部構造の解釈に関する調査". IEEE SaTML . arXiv : 2207.13243 . ↑ Bau, David; Zhou, Bolei; Khosla, Aditya; Oliva, Aude; Torralba, Antonio (2017-04-19). "Network Dissection: Quantifying Interpretability of Deep Visual Representations". CVPR . arXiv : 1704.05796 . ↑ McGrath, Thomas; Kapishnikov, Andrei; Tomašev, Nenad; Pearce, Adam; Wattenberg, Martin; Hassabis, Demis; Kim, Been; Paquet, Ulrich; Kramnik, Vladimir (2022-11-22). "AlphaZero におけるチェスの知識の獲得" . Proceedings of the National Academy of Sciences . 119 (47) e2206625119. arXiv : 2111.09259 . Bibcode : 2022PNAS..11906625M . doi : 10.1073/pnas.2206625119 . ISSN 0027-8424 . PMC 9704706 . PMID 36375061 . ↑ Goh, Gabriel; Cammarata, Nick; Voss, Chelsea; Carter, Shan; Petrov, Michael; Schubert, Ludwig; Radford, Alec; Olah, Chris (2021). "人工ニューラルネットワークにおけるマルチモーダルニューロン" . Distill . 6 (3). doi : 10.23915/distill.00030 . S2CID 233823418 . ↑ Olah, Chris; Cammarata, Nick; Schubert, Ludwig; Goh, Gabriel; Petrov, Michael; Carter, Shan (2020). "ズームイン:回路入門" . Distill . 5 (3). doi : 10.23915/distill.00024.001 . S2CID 215930358 . ↑ Cammarata, Nick; Goh, Gabriel; Carter, Shan; Voss, Chelsea; Schubert, Ludwig; Olah, Chris (2021). "Curve circuits" . Distill . 6 (1). doi : 10.23915/distill.00024.006 (2026年7月17日非アクティブ)。 2022年12月5日のオリジナルから アーカイブ済み。 2022年 12月5日 に取得 。 {{cite journal}}: CS1メンテナンス: DOIは2026年7月現在非アクティブです(リンク)↑ Olsson, Catherine; Elhage, Nelson; Nanda, Neel; Joseph, Nicholas; DasSarma, Nova; Henighan, Tom; Mann, Ben; Askell, Amanda; Bai, Yuntao; Chen, Anna; Conerly, Tom; Drain, Dawn; Ganguli, Deep; Hatfield-Dodds, Zac; Hernandez, Danny; Johnston, Scott; Jones, Andy; Kernion, Jackson; Lovitt, Liane; Ndousse, Kamal; Amodei, Dario; Brown, Tom; Clark, Jack; Kaplan, Jared; McCandlish, Sam; Olah, Chris (2022). "In-context learning and induction heads". Transformer Circuits Thread . arXiv : 2209.11895 . ↑ Olah, Christopher. "解釈可能性 vs 神経科学 [ ラフノート ] " . 2022-11-24 のオリジナルから アーカイブ済み。2022-11-24 に 取得 。 ↑ Gu, Tianyu; Dolan-Gavitt, Brendan; Garg, Siddharth (2019-03-11). "BadNets: 機械学習モデルサプライチェーンの脆弱性の特定". arXiv : 1708.06733 . ↑ Chen, Xinyun; Liu, Chang; Li, Bo; Lu, Kimberly; Song, Dawn (2017-12-14). "データポイズニングを使用した深層学習システムに対する標的型バックドア攻撃". arXiv : 1712.05526 . ↑ Carlini, Nicholas; Terzis, Andreas (2022-03-28). "Poisoning and Backdooring Contrastive Learning". ICLR . arXiv : 2106.09667 . ↑ 「スリーパーエージェント:安全訓練をすり抜ける欺瞞的なLLMの訓練」 . Anthropic . 2024. 2025年1月12日 取得 。 ↑ 「『スリーパーエージェント』AIアシスタントがコードを妨害する方法」 。The Register 。2024年1月16日。 2025年1月 12日取得 。 1 2 3 4 Russell, Stuart J.; Norvig, Peter (2021). 人工知能:現代的アプローチ (第4 版). Pearson. pp. 5, 1003. ISBN 978-0-13-461099-3 2022年9月12日 に取得 。1 2 Ngo, Richard; Chan, Lawrence; Mindermann, Sören (2022). "深層学習の観点からのアライメント問題" . 国際学習表現会議 . arXiv : 2209.00626 . 1 2 Pan, Alexander; Bhatia, Kush; Steinhardt, Jacob (2022-02-14). 報酬 の誤指定の影響: 不整合モデルのマッピングと軽減 。国際学習表現会議 。2022-07-21 取得 。 ↑ Carlsmith, Joseph (2022-06-16). "権力追求型AIは実存的リスクか?". arXiv : 2206.13353 [ cs.CY ]. 1 2 3 ラッセル、スチュアート・J. (2020). 人間と互換性のある人工知能と制御の問題 . ペンギン・ランダムハウス. ISBN 978-0-525-55863-7 . OCLC 1113410915 . ↑ Christian, Brian (2020). The alignment problem: Machine learning and human values . WW Norton & Company. ISBN 978-0-393-86833-3 . OCLC 1233266753 . 2023年2月10日にオリジナルからアーカイブ済み。 2022年 9月12日 に取得。 ↑ Langosco, Lauro Langosco Di; Koch, Jack; Sharkey, Lee D.; Pfau, Jacob; Krueger, David (2022-06-28). "深層強化学習における目標の誤一般化" . 第39回国際機械学習会議議事録 . 国際機械学習会議。 PMLR. pp. 12004– 12019 . 2023-03-11 に取得. ↑ Pillay, Tharin (2024-12-15). 「新たなテストでAIの欺瞞能力が明らかに」 TIME . 2025-01-12 閲覧 . ↑ ペリゴ、ビリー (2024-12-18)。 「 独占記事:新たな研究でAIが戦略的に嘘をついていることが判明 」 TIME。2025-02-18 閲覧 。 1 2 Bommasani, Rishi; Hudson, Drew A.; Adeli, Ehsan; Altman, Russ; Arora, Simran; von Arx, Sydney; Bernstein, Michael S.; Bohg, Jeannette; Bosselut, Antoine; Brunskill, Emma ; Brynjolfsson, Erik (2022-07-12). "基礎モデルの機会とリスクについて" . Stanford CRFM . arXiv : 2108.07258 . ↑ Ouyang, Long; et al. (2022). "人間のフィードバックによる指示に従うための言語モデルのトレーニング" (PDF) . NeurIPS . arXiv : 2203.02155 . ↑ Zaremba, Wojciech; Brockman, Greg; OpenAI (2021-08-10). "OpenAI Codex" . OpenAI . 2023年2月3日のオリジナルから アーカイブ済み。2022-07-23 に 取得 。 ↑ Kober, Jens; Bagnell, J. Andrew; Peters, Jan (2013-09-01). "ロボット工学における強化学習:概説" . The International Journal of Robotics Research . 32 (11): 1238– 1274. doi : 10.1177/0278364913495721 . ISSN 0278-3649 . S2CID 1932843 . 2022年10月15日にオリジナルから アーカイブ済み 。 2022年 9月12日 に取得。 ↑ Knox, W. Bradley; Allievi, Alessandro; Banzhaf, Holger; Schmitt, Felix; Stone, Peter (2023-03-01). "自動運転のための報酬(誤)設計" . Artificial Intelligence . 316 103829. arXiv : 2104.13906 . doi : 10.1016/j.artint.2022.103829 . ISSN 0004-3702 . S2CID 233423198 . ↑ Stray, Jonathan (2020). "AI最適化をコミュニティの幸福に合わせる" . International Journal of Community Well-Being . 3 (4): 443– 463. doi : 10.1007/s42413-020-00086-3 . ISSN 2524-5295 . PMC 7610010 . PMID 34723107 . S2CID 226254676 . ↑ラッセル 、 スチュアート;ノーヴィグ、ピーター(2009)。 人工知能:現代的アプローチ 。プレンティス・ホール。p. 1003。ISBN 978-0-13-461099-3 。↑ クレイグ・S・スミス 「AI分野で最も有名な研究者、ジェフ・ヒントン氏が『存亡の危機』を警告」 「 . Forbes . 2023年5月4日 取得。↑ ベンジオ、ヨシュア。ジェフリー・ヒントン。ヤオ、アンドリュー。歌、夜明け。アビール、ピーター。ハラリ、ユヴァル・ノア。チャン・ヤーチン。シュエ、ラン。シャレフ・シュワルツ、シャイ(2024)。 「急速な進歩の中での極度の AI リスクの管理」。 科学 。 384 (6698 ) : 842–845.arXiv : 2310.17688 。 Bibcode : 2024Sci...384..842B 。 土井 : 10.1126/science.adn0117 。 PMID 38768279 。 ↑ 「AIリスクに関する声明」 。www.safe.ai 。 2023 年7月17日 取得 。 ↑ Grace, Katja; Stewart, Harlan; Sandkühler, Julia Fabienne; Thomas, Stephen; Weinstein-Raun, Ben; Brauner, Jan (2025). " Thousands of AI Authors on the Future of AI" . Journal of Artificial Intelligence Research . 84. arXiv : 2401.02843 . doi : 10.1613/jair.1.19087 . ↑ Perrigo, Billy (2024-02-13). "MetaのAI責任者Yann LeCunがAGI、オープンソース、AIリスクについて語る" . TIME . 2024-06-26 に閲覧 。 ↑ 「AIアライメントとは?」 . TechTarget . 2023-05-03 . 2025-06-28 に閲覧. ↑ Ahmed, Shazeda; Jaźwińska, Klaudia; Ahlawat, Archana; Winecoff, Amy; Wang, Mona (2024-04-14). "AI安全性の分野構築と認識文化" . First Monday . doi : 10.5210/fm.v29i4.13626 . ISSN 1396-0466 . 1 2 Ortega, Pedro A.; Maini, Vishal; DeepMind 安全チーム (2018-09-27). "安全な人工知能の構築: 仕様、堅牢性、および保証" . DeepMind Safety Research – Medium . 2023 年 2 月 10 日のオリジナルから アーカイブ済み 。2022-07-18 に取得 。 1 2 Rorvig, Mordechai (2022-04-14). "研究者がシンプルなAIから新たな理解を得る" . Quanta Magazine . 2023年2月10日のオリジナルから アーカイブ済み。 2022年7月18日 取得 。 ↑ Doshi-Velez, Finale; Kim, Been (2017-03-02). "解釈可能な機械学習の厳密な科学に向けて". arXiv : 1702.08608 [ stat.ML ]. Wiblin, Robert (2021年8月4日). 「Chris Olahが語る、ニューラルネットワーク内部で一体何が起こっているのか」 (ポッドキャスト). 80,000 hours. No. 107. 2022年7月23日 取得 。 1 2 アモデイ、ダリオ。ああ、クリス。スタインハート、ジェイコブ。クリスティアーノ、ポール。ジョン・シュルマン。マネ、ダン (2016-06-21)。 「AIの安全性における具体的な問題点」。 arXiv : 1606.06565 [ cs.AI ]。 ↑ Russell, Stuart; Dewey, Daniel; Tegmark, Max (2015-12-31). "堅牢で有益な人工知能の研究優先事項" . AI Magazine . 36 (4): 105– 114. arXiv : 1602.03506 . doi : 10.1609/aimag.v36i4.2577 . hdl : 1721.1/108478 . ISSN 2371-9621 . S2CID 8174496 . 2023年2月2日にオリジナルから アーカイブ済み。 2022年 9月12日 に取得 。 ↑ Wirth, Christian; Akrour, Riad; Neumann, Gerhard; Fürnkranz, Johannes (2017). "選好に基づく強化学習手法の概観". Journal of Machine Learning Research . 18 (136): 1– 46. ↑ Christiano, Paul F.; Leike, Jan; Brown, Tom B.; Martic, Miljan; Legg, Shane; Amodei, Dario (2017). "人間の嗜好に基づく深層強化学習". 第31回国際ニューラル情報処理システム会議議事録 . NIPS'17. Red Hook, NY, USA: Curran Associates Inc. pp. 4302–4310 . ISBN 978-1-5108-6096-4 。↑ Heaven, Will Douglas (2022-01-27). "GPT-3の新バージョンははるかに扱いやすく(そして毒性も低いはず)」 . MIT Technology Review . 2023年2月10日のオリジナルから アーカイブ済み。 2022年7月18日 取得 。 ↑ シーナ、モフセニ。ワン・ハオタオ。ユウ、ジディン。シャオ、チャオウェイ。王、張陽。ヤダワ、ジェイ(2022-03-07)。 「機械学習の安全性の分類: 調査と入門書」 。 ACM コンピューティング調査 。 55 (8): 1–38 . 土井 : 10.1145/3551385 。 ↑ クリフトン、ジェシー (2020)。 「協力、紛争、そして変革をもたらす人工知能:研究課題」 。 長期リスクセンター 。 2023年1月1日のオリジナルから アーカイブ済み。 2022年7月18日 取得 。 Dafoe, Allan; Bachrach, Yoram; Hadfield, Gillian; Horvitz, Eric; Larson, Kate; Graepel, Thore (2021-05-06). "協調型AI: 機械は共通点を見つけることを学ばなければならない" . Nature . 593 (7857): 33– 36. Bibcode : 2021Natur.593...33D . doi : 10.1038/d41586-021-01170-0 . ISSN 0028-0836 . PMID 33947992 . S2CID 233740521 . 2022年12月18日のオリジナルからアーカイブ済み。 2022年 9月12日 取得 。 ↑ Prunkl, Carina; Whittlestone, Jess (2020-02-07). "Beyond Near- and Long-Term" . Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society . New York NY USA: ACM. pp. 138–143 . doi : 10.1145/3375627.3375803 . ISBN 978-1-4503-7110-0 . S2CID 210164673 . 2022年10月16日にオリジナルからアーカイブされました。 2022年 9月12日 に取得。 ↑ Irving, Geoffrey; Askell, Amanda (2019-02-19). "AIの安全性には社会科学者が必要" . Distill . 4 (2) 10.23915/distill.00014. doi : 10.23915/distill.00014 . ISSN 2476-0757 . S2CID 159180422 . 2023年2月10日のオリジナルから アーカイブ済み。 2022年 9月12日 取得 。 ↑ Gazos, Alexandros; Kahn, James; Kusche, Isabel; Büscher, Christian; Götz, Markus (2025-04-01). "安全性のためのAIの組織化:AI強化社会技術システムの設計を導くための構造的脆弱性の特定" . Safety Science . 184 106731. doi : 10.1016/j.ssci.2024.106731 . ISSN 0925-7535 . 1 2 3 4 Zwetsloot, Remco; Dafoe, Allan (2019-02-11). "AI のリスクについて考える: 事故、誤用、構造" . Lawfare . 2023-08-19 のオリジナルから アーカイブ済み . 2022-11-24 に取得. ↑ Zhang, Yingyu; Dong, Chuntong; Guo, Weiqun; Dai, Jiabao; Zhao, Ziming (2022). "Systems theoretic accident model and process (STAMP): A literature review" . Safety Science . 152 105596. doi : 10.1016/j.ssci.2021.105596 . S2CID 244550153. 2023年3月15日にオリジナルから アーカイブ済み 。 2022年11月28日 に取得 。 1 2 Gazos, Alexandros; Kahn, James; Kusche, Isabel; Büscher, Christian; Götz, Markus (2025-04-01). "安全性のためのAIの組織化:AI強化社会技術システムの設計を導くための構造的脆弱性の特定" . Safety Science . 184 106731. doi : 10.1016/j.ssci.2024.106731 . ISSN 0925-7535 . ↑ セキュリティおよび新興技術センター; ホフマン、ワイアット (2021)。 「AI とサイバー競争の未来」 。CSET Issue Brief。doi : 10.51593 /2020ca007。S2CID 234245812。 2022年11月 24 日のオリジナルから アーカイブ 。 2022年11月28 日 取得 。 ↑ Gafni, Ruti; Levy, Yair (2024-01-01). "The role of artificial intelligence (AI) in improving technical and managemential cybersecurity tasks' efficiency." Information & Computer Security . 32 (5): 711–728 . doi : 10.1108/ICS-04-2024-0102 . ISSN 2056-4961 . ↑ Abroshan, Hossein (2025). "AI による AI の保護: ラベル反転ポイズニング攻撃を検出するためのモジュール式パイプライン". Results in Engineering . Elsevier. doi : 10.1016/j.rineng.2025.101513 (2026 年 7 月 17 日非アクティブ)。 {{cite journal}}: CS1メンテナンス: DOIは2026年7月現在非アクティブです(リンク)↑ Abroshan , Hossein; Hashmi, Syed Waquas (2026). "A Multi-Stage Backdoor Detection (MSBD) Framework" . IEEE Access . 14. IEEE: 17874–17884 . Bibcode : 2026IEEEA..1417874A . doi : 10.1109/ACCESS.2026.3659007 . ISSN 2169-3536 . ↑セキュリティ および 新興技術センター、アンドリュー・インブリー、エルサ・カニア(2019)。 「大国間のAIの安全性、セキュリティ、安定性:現実的な関与のための選択肢、課題、教訓」 。doi : 10.51593/20190051。S2CID 240957952。 2022年11月 24 日にオリジナルから アーカイブ 。 2022年11月28日 に 取得 。 1 2 Future of Life Institute (2019-03-27). AI戦略、政策、ガバナンス (Allan Dafoe) 。イベントは22:05に発生。2022-11-23 のオリジナルから アーカイブ済み。2022-11-23 に 取得 。 ↑ Zou, Andy; Xiao, Tristan; Jia, Ryan; Kwon, Joe; Mazeika, Mantas; Li, Richard; Song, Dawn; Steinhardt, Jacob; Evans, Owain; Hendrycks, Dan (2022-10-09). "ニューラルネットワークによる将来の世界イベントの予測". NeurIPS . arXiv : 2206.15474 . ↑ Gathani, Sneha; Hulsebos, Madelon; Gale, James; Haas, Peter J.; Demiralp, Çağatay (2022-02-08). "インタラクティブなWhat-If分析による意思決定の強化". Conference on Innovative Data Systems Research . arXiv : 2109.06160 . ↑ Lindelauf, Roy (2021), "アルゴリズム時代の核抑止力:ゲーム理論の再考", Osinga , Frans; Sweijs, Tim (編), NL ARMS Netherlands Annual Review of Military Studies 2020 , ハーグ: TMC Asser Press, pp. 421–436 , doi : 10.1007/978-94-6265-419-8_22 , ISBN 978-94-6265-418-1 S2CID 229449677 1 2 Newkirk II, Vann R. (2016-04-21). "気候変動は囚人のジレンマか、それとも鹿狩りか?" . The Atlantic . 2022-11-24 のオリジナルから アーカイブ済み 。2022-11-24 に 取得 。 1 2 アームストロング、スチュアート、ボストロム、ニック、シュルマン、カール。「崖っぷちへの競争:人工知能開発のモデル(報告書)」。オックスフォード大学人類未来研究所。 1 2 Dafoe, Allan. AIガバナンス:研究課題(報告書)。AIガバナンスセンター、人類の未来研究所、オックスフォード大学。 ↑ Dafoe, Allan; Hughes, Edward; Bachrach, Yoram; Collins, Tantum; McKee, Kevin R.; Leibo, Joel Z.; Larson, Kate; Graepel, Thore (2020-12-15). "協調型AIにおける未解決問題". NeurIPS . arXiv : 2012.08630 . 1 2 Dafoe, Allan; Bachrach, Yoram; Hadfield, Gillian; Horvitz, Eric; Larson, Kate; Graepel, Thore (2021). "協調型AI: 機械は共通点を見つけるために学習する必要がある" . Nature . 593 (7857): 33– 36. Bibcode : 2021Natur.593...33D . doi : 10.1038/d41586-021-01170-0 . PMID 33947992 . S2CID 233740521 . 2022年11月22日のオリジナルから アーカイブ済み。 2022年11月24日 取得 。 1 2 Friedland, Alex (2025-05-28). "AI 安全性評価: 解説" . Center for Security and Emerging Technology . 2026-07-10 に取得. ↑ Pillay, Tharin (2024-12-24). "AIモデルはますます賢くなっている。新しいテストが追いつこうと競い合っている" . TIME . 2026-07-13 に閲覧。 ↑ 「最先端AI安全コミットメント、AIソウルサミット2024」 . GOV.UK. 2026年7月10日 取得 。 ↑ 「広島プロセス 先進AIシステム開発組織のための国際行動規範(2023年10月30日)」 。 g7g20-documents.org 。 2026年7月10日 取得 。 ↑ Mickle, Tripp; Tan, Eli; Frenkel, Sheera (2026-06-23). "米国、安全保障上の懸念が高まる中、MetaにAIレビューへの同意を迫る" . The New York Times . ISSN 0362-4331 . 2026-07-10 に閲覧. ↑ カルヴァオ、パウロ。 「AIの事前展開評価は中国のモデルからワシントンへ移行」 。 フォーブス。 2026年7月10日 取得 。 ↑ 「OpenAI、AI安全規則に関してホワイトハウスと意見を異にする」 。POLITICO 。 2026年7月10日 取得 。 ↑ Washenko, Anna (2025-08-27). "OpenAIとAnthropicが互いのAIシステムの安全性評価を実施" . Engadget . 2026-07-10 に閲覧。 ↑ 「米国のモデルと同様に、中国のAIは安全テストを『不正に操作する』ことを学習している、と研究機関が発表」 。 サウスチャイナ・モーニング・ポスト 。2026年6月13日。 2026年7月10日 閲覧 。 ↑ Pillay, Tharin (2024-12-15). "新たなテストでAIの欺瞞能力が明らかに" . TIME . 2026-07-16 に閲覧。 ↑ パターソン、ジェイミー (2026-03-11)。 「AIの安全性を評価するための効率的で再利用可能なフレームワーク」 。The Hub。2026-07-17 に 取得 。 ↑ Mishra, Adya (2025-01-06). "AI ガードレールの理解: 概念、モデル、および方法" . International Journal of Innovative Research in Engineering & Multidisciplinary Physical Sciences . 13 : 1– 7. doi : 10.5281/zenodo.14850911 . ↑ guardrails-ai/guardrails 、Guardrails AI、2026年7月29日、 2026年7月29日 取得 ↑ 「AIガードレールとは? | IBM」 www.ibm.com 2025 年9月17日 2026年7月29 日 閲覧 ↑ 「はじめに」 . Guardrails AI . 2026年7月29日 取得 。 ↑ 「AIガードレールとは何か?」 。 マッキンゼー・アンド・カンパニー 。2024年11月14日。 2026年 7月29日 取得 。 ↑ Teferra, Bazen Gashaw; Johny, Nabil; Huang, Sandra; Rueda, Alice; Kamaleddin, Mohammad Amin; Dunlop, Katharine; Zhang, Yanbo; Jha, Manish; Sharma, Divya; Bhat, Venkat (2026-01-08). "Assessing the impact of safety guardrails on large language models using irritability metrics" . NPJ digital medicine . 9 (1): 148. doi : 10.1038/s41746-025-02333-3 . ISSN 2398-6352 . PMC 12894938. PMID 41507509 . ↑ Satariano, Adam; Specia, Megan (2023-11-01). "世界の指導者らがAIが「壊滅的な」被害をもたらす可能性があると警告" . The New York Times . ISSN 0362-4331 . 2024-04-20 に閲覧. ↑ Turchin, Alexey; Dench, David; Green, Brian Patrick (2019). "AI の安全性の問題に対するグローバル ソリューションとローカル ソリューション" . Big Data and Cognitive Computing . 3 (16): 1– 25. doi : 10.3390/bdcc3010016 . ↑ Crafts, Nicholas (2021-09-23). "汎用技術としての人工知能:歴史的展望" . Oxford Review of Economic Policy . 37 (3): 521– 536. doi : 10.1093/oxrep/grab012 . ISSN 0266-903X . 2022-11-24 のオリジナルから アーカイブ済み 。2022-11-28 に取得 。 ↑ 葉俶禎; 黃子君; 張媁雯。 賴志樫 (2020-12-01)。 「人工知能時代における労働力の移転: 系統的な文献レビュー」。 臺灣東亞研究文明学刊 。 17 (2)。 土井 : 10.6163/TJEAS.202012_17(2).0002 。 ISSN 1812-6243 。 ↑ ジョンソン、ジェームズ (2019-04-03)。 「 人工知能と将来の戦争:国際安全保障への影響」 。Defense & Security Analysis。35 ( 2 ) : 147–169。doi : 10.1080 /14751798.2019.1600800。ISSN 1475-1798。S2CID 159321626。2022-11-24 の オリジナルから アーカイブ 。2022-11-28 に 取得 。 ↑ Kertysova, Katarina (2018-12-12). "人工知能と偽情報:AIが偽情報の生成、拡散、および対策の方法をどのように変えるか" . Security and Human Rights . 29 ( 1– 4): 55– 81. doi : 10.1163/18750230-02901005 . ISSN 1874-7337 . S2CID 216896677 . ↑ フェルドスタイン、スティーブン(2019)。AI 監視の世界的拡大 。カーネギー国際平和財団。 ↑ アグラワル、アジェイ;ガンス、ジョシュア;ゴールドファーブ、アヴィ(2019)。 人工知能の経済学:アジェンダ 。イリノイ州シカゴ 。ISBN 978-0-226-61347-5 OCLC 1099435014。 {{cite book}}: CS1メンテナンス: 場所の発行元が見つかりません (リンク)↑ Whittlestone, Jess; Clark, Jack (2021-08-31). "政府はなぜ、どのようにAI開発を監視すべきか". arXiv : 2108.12427 . 1 2 Shevlane, Toby (2022). "強力なAIモデルの共有 | GovAIブログ" . Center for the Governance of AI . 2022年11月24日のオリジナルから アーカイブ済み . 2022年11月24日 に取得. ↑ Askell, Amanda; Brundage, Miles; Hadfield, Gillian (2019-07-10). "責任あるAI開発における協力の役割". arXiv : 1907.04534 . ↑ Gursoy, Furkan; Kakadiaris, Ioannis A. (2022-08-31), System Cards for AI-Based Decision-Making for Public Policy , arXiv : 2203.04754 ↑ Cobbe, Jennifer; Lee, Michelle Seng Ah; Singh, Jatinder (2021-03-01). "Reviewable Automated Decision-Making: A Framework for Accountable Algorithmic Systems". Proceedings of the 2021 ACM Conference on Fairness, Accountability, and Transparency . FAccT '21. New York, NY, USA: Association for Computing Machinery. pp. 598–609 . doi : 10.1145/3442188.3445921 . ISBN 978-1-4503-8309-7 。↑ Raji, Inioluwa Deborah; Smart, Andrew; White, Rebecca N.; Mitchell, Margaret; Gebru, Timnit; Hutchinson, Ben; Smith-Loud, Jamila; Theron, Daniel; Barnes, Parker (2020-01-27). "AIアカウンタビリティギャップの解消:内部アルゴリズム監査のためのエンドツーエンドフレームワークの定義". 2020年公平性、説明責任、透明性に関する会議議事録 . FAT* '20. ニューヨーク州ニューヨーク、米国:Association for Computing Machinery. pp. 33–44 . doi : 10.1145/3351095.3372873 . ISBN 978-1-4503-6936-7 。↑ Manheim, David; Martin, Sammy; Bailey, Mark; Samin, Mikhail; Greutzmacher, Ross (2025). "AI監査基準委員会の必要性" . AI & Society . 40 (8): 6609– 6624. arXiv : 2404.13060 . doi : 10.1007/s00146-025-02320-y . ↑ Novelli, Claudio; Taddeo, Mariarosaria; Floridi, Luciano (2024). "人工知能における説明責任:それが何であり、どのように機能するか" . AI & Society . 39 (4): 1871– 1882. doi : 10.1007/s00146-023-01635-y . hdl : 11585/914099 . ↑ Manheim, David (2023年6月26日). 「AIのための安全文化の構築:展望と課題」. SSRN 4491421 . ↑ 「NeMo Guardrails」 。NVIDIA NeMo Guardrails 。 2024年12月8日 取得。 ↑ 「Llama Guard: LLMベースの人間とAIの会話のための入出力保護」 . Meta AI . 2024年12月8日 取得 。 ↑ Šekrst, Kristina; McHugh, Jeremy; Cefalu, Jonathan Rodriguez (2024). "AI Ethics by Design: Implementing Customizable Guardrails for Responsible AI Development". arXiv : 2411.14442 [ cs.CY ]. ↑ ドン、イー。ムー、ロンフイ。ジン、ガジエ。チー、イー。胡錦偉。趙興宇。孟、傑。ルアン、ウェンジエ。黄暁偉(2024)。 「大規模な言語モデルのためのガードレールの構築」。 arXiv : 2402.01822 [ cs ]。 ↑ D'Alessandro, W. (2024). "義務論と安全な人工知能" . Philosophical Studies . 182 (7): 1681– 1704. doi : 10.1007/s11098-024-02174-y . ↑ D'Alessandro, William; Kirk-Giannini, Cameron D. (2025). "人工知能: 安全性へのアプローチ" . Philosophy Compass . 20 (5) e70039. doi : 10.1111/phc3.70039 . ↑ バート・ジーグラー (2022年4月8日)。 「AIを規制する時期が来たのか?」 。 ウォール・ストリート・ジャーナル 。 2022年11月24日のオリジナルから アーカイブ。 2022年11月24日 に取得 。 ↑ リード、クリス (2018-09-13). 「人工知能をどのように規制すべきか?」 . Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences . 376 (2128) 20170360. Bibcode : 2018RSPTA.37670360R . doi : 10.1098 / rsta.2017.0360 . ISSN 1364-503X . PMC 6107539. PMID 30082306 . ↑ Belton, Keith B. (2019-03-07). "AIはどのように規制されるべきか?" . IndustryWeek . 2022-01-29 のオリジナルから アーカイブ。2022-11-24 に 取得 。 ↑ 国家安全保障人工知能委員会(2021年)、 最終報告書 ↑ 米国国立標準技術研究所 (2021-07-12). 「AIリスク管理フレームワーク」 . NIST . 2022-11-24 のオリジナルから アーカイブ済み . 2022-11-24 に取得. ↑ Richardson, Tim (2021). "英国、10年間の国家人工知能戦略を発表" . 2023年2月10日のオリジナルより アーカイブ。 2022年11月24日 取得 。 1 2 「ガイダンス:国家AI戦略」 . GOV.UK . 2021年。 2023年2月10日のオリジナルから アーカイブ済み。 2022年11月24日 取得 。 ↑ ハードキャッスル、キンバリー (2023-08-23)。 「私たちは今、AIについてたくさん話していますが、それは決して早すぎるということはありません」 。The Conversation。2023-10-31 に 取得 。 ↑ 「象徴的なブレッチリー・パークで11月初旬に英国AI安全サミットが開催される」 . GOV.UK. 2023年10月31日 取得 。 ↑ コルヴィル、アレックス (2025-07-30)。 「中国はAIの安全性をどのように見ているか」 。 チャイナメディアプロジェクト 。2025-08-09 に 取得 。 ↑ 国家情報長官室、情報先端研究計画活動。 「IARPA – TrojAI」 。 2022年11月24日にオリジナルから アーカイブ。 2022年11月24日 に取得 。 ↑ Turek, Matt. "説明可能な人工知能" . 2021年2月19日のオリジナルから アーカイブ済み。 2022年11月24日 取得 。 ↑ ドレイパー、ブルース。 「欺瞞に対するAIの堅牢性の保証」 。 国防高等研究計画局 。 2023年1月9日のオリジナルから アーカイブ。 2022年11月24日 取得 。 ↑ 米国国立科学財団 (2023年2月23日)。 「安全な学習を可能にするシステム」 。 2023年2月26日のオリジナルから アーカイブ。 2023年2月27日 取得 。 ↑ 「国連総会、人工知能に関する画期的な決議を採択」 。 国連ニュース 。2024年3月21日。 2024年4月20日時点の オリジナル よりアーカイブ。 2024年 4月21日 閲覧 。 ↑ Say, Mark (2024年5月23日). 「DSIT、AIの安全性に関する研究への資金提供を発表」 . 2024年5月24日の オリジナル よりアーカイブ。 2024年 6月11日 取得 。 ↑ レンショー、ジャレット; ハニカット、トレバー (2024年11月16日)。 「バイデンと習近平、核兵器の管理はAIではなく人間が行うべきだと合意」 。 ロイター 。 2026年 2月11日 閲覧 。 ↑ ハリド、アスマ (2024-11-16). 「バイデンと習近平、前回の会談でAIと核兵器に関する決定を制限する第一歩を踏み出す」 . NPR . 2026-02-11 閲覧 。 ↑ 「2025会計年度国防権限法、第1638条(「戦略的抑止を支援するための人工知能の使用に関する議会の意思」)」 。 新興技術観測所 。ジョージタウン大学安全保障・新興技術センター。 2026年 2月27日 取得 。 ↑ 「HR5009 - 2025会計年度軍人生活の質向上および国防授権法」 。Congress.gov 。米国議会。2024年12月23日 。 2026年 2月27日 取得 。 ↑ 「ペンタゴンとアントロピックの対立を激化させた仮説上の核攻撃」 ワシントン・ポスト 。 2026年 2月27日 取得 。 ↑ 「国連総会、拘束力のあるAI保護措置を求める緊急の訴えで開幕」 。NBC ニュース 。2025年9月22日。 2026年4月5日 閲覧 。 ↑ 「人工知能に関する国家政策枠組みの確保」 。 ホワイトハウス 。2025年12月11日。 2026年2月27日 取得 。 ↑ Johnson, Khari (2025-12-12). 「トランプ大統領のAI規制反対の新命令はカリフォルニア州に特に大きな打撃を与える」 . CalMatters . 2026-02-27 閲覧 。 ↑ Lennett, Justin Hendrix, Ben (2026-01-25). "人工知能に関するトランプ政権のホワイトハウスの行動と声明のタイムライン" . Tech Policy Press . 2026-02-27 に取得. {{cite web}}: CS1 maint: 複数の名前: 著者リスト (リンク)↑ 「人工知能におけるアメリカのリーダーシップへの障壁を取り除く」 。 連邦官報 。2025年1月31日。 2026年2月27日 取得 。 ↑ 「トランプ大統領のAI命令は口先ばかりで実行力がない|ブレナン司法センター」 www.brennancenter.org 2026 年2月25日 2026年2月27 日 閲覧 ↑ マティマキ、マッティ;ミンキネン、マッティ。ビルクシュテット、ティーム。ヴィルヤネン、ミカ (2022)。 「組織の AI ガバナンスの定義」 。 AI と倫理 。 2 (4): 603–609 . 土井 : 10.1007/s43681-022-00143-x 。 ISSN 2730-5953 。 S2CID 247119668 。 1 2 3 Brundage, Miles; Avin, Shahar; Wang, Jasmine; Belfield, Haydn; Krueger, Gretchen; Hadfield, Gillian; Khlaaf, Heidy; Yang, Jingying; Toner, Helen; Fong, Ruth; Maharaj, Tegan; Koh, Pang Wei; Hooker, Sara; Leung, Jade; Trask, Andrew (2020-04-20). "Toward Trustworthy AI Development: Mechanisms for Supporting Verifiable Claims". arXiv : 2004.07213 . ↑ 「人工知能インシデントデータベースへようこそ」 。 2022年11月24日にオリジナルから アーカイブされました 。 2022年11月24日 に取得。 ↑ Wiblin, Robert; Harris, Keiran (2022). "Nova DasSarma が語る、AI システムの安全な開発に情報セキュリティが重要な理由" . 80,000 Hours . 2022-11-24 のオリジナルから アーカイブ済み . 2022-11-24 に取得. ↑ OpenAI (2022-06-02). "言語モデルのデプロイに関するベストプラクティス" . OpenAI . 2023-03-15 のオリジナルから アーカイブ済み . 2022-11-24 に取得. ↑ OpenAI。 「OpenAI憲章」 。OpenAI 。 2021年3 月 4日にオリジナルから アーカイブ済み 。 2022年11月24日 に取得。 ↑ Future of Life Institute (2016). 「自律型兵器に関する公開書簡:AIとロボット工学の研究者」 Future of Life Institute . 2022年11月24日 取得 。 ↑ Gold, Ashley (2026-02-27). "AI影響力ネットワークの有力者たち" . Axios . 2026-03-05 に閲覧。 ↑ Chow, Andrew R. (2026-02-19). "The People vs. AI" . TIME . 2026-03-05 に閲覧。 ↑ ノーラン、ベアトリス。 「OpenAI、GPT-5.3-Codexのリリースでカリフォルニア州の新しいAI法に違反したとの監視機関の主張に異議を唱える」 。Fortune 。 2026 年3月5日 取得 。 ↑ Wilkins, Emily (2026-02-12). "Anthropic が 2026 年の選挙を前に AI 規制を推進する団体に 2000 万ドルを寄付" . CNBC . 2026-03-05 に閲覧. ↑ 「シリコンバレーの億万長者たちがアメリカのAIルール策定に巨額の資金を投じる」 フィナンシャル ・タイムズ 、2026年2月26日。 ↑ Schleifer, Theodore; Tan, Eli (2025-08-26). "シリコンバレーが新たなAI推進スーパーPACに2億ドルを拠出" . The New York Times . ISSN 0362-4331 . 2026-03-05 閲覧 . ↑ 「致死性自律兵器システムに関するGGE」 。 デジタルウォッチオブザーバトリー 。2025年11月27日。 2026年4月26日 取得 。 ↑ 「2025年GGE LAWS第1回会合での声明」 . APILS . 2025年3月9日. 2026年4月26日 取得 .
外部リンク 機械学習の安全性における未解決の問題 財団モデルの機会とリスクについて AIがもたらす壊滅的なリスクの概要 AI事故:新たな脅威 より安全な世界を設計する