敵対的機械学習とは、機械学習アルゴリズムに対する攻撃と、そのような攻撃に対する防御策を研究する学問である。[ 1 ]
機械学習の手法は、訓練データとテストデータが同一の統計分布(独立同分布)から生成されるという前提のもと、特定の課題セットに対応するように設計されています。しかし、実際の重要なアプリケーションでは、ユーザーが統計的前提に反する捏造データを意図的に提供する可能性があるため、この前提はしばしば破られます。
敵対的機械学習で最も一般的な攻撃には、回避攻撃[ 2 ] 、データ汚染攻撃[ 3 ] 、ビザンチン攻撃[ 4 ]、モデル抽出[ 5 ]などがあります。
2004年1月のMITスパム会議で、ジョン・グラハム=カミングは、機械学習スパムフィルターが、スパムメールにどの単語を追加すればスパムではないと分類されるかを自動的に学習することで、別の機械学習スパムフィルターを無効化できることを示した。[ 6 ]
2004 年、Nilesh Dalvi らは、スパムフィルタで使用される線形分類器は、スパマーがスパムメールに「良い単語」を挿入する単純な「回避攻撃」によって破られる可能性があることを指摘した。(2007 年頃、一部のスパマーは、 OCRベースのフィルタを破るために、「画像スパム」内のあいまいな単語にランダムなノイズを追加した。)2006 年、Marco Barreno らは、「機械学習は安全になり得るか?」を発表し、攻撃の広範な分類を概説した。2013 年になっても、多くの研究者は、非線形分類器(サポートベクターマシンやニューラルネットワークなど)が攻撃者に対して堅牢であることを期待し続けていたが、Battista Biggio らがそのような機械学習モデルに対する最初の勾配ベースの攻撃を実証した(2012 年[ 7 ] – 2013 年[ 8 ])。2012 年、ディープニューラルネットワークがコンピュータビジョンの問題を支配するようになった。 2014年から、Christian Szegedyらは、勾配ベースの攻撃を用いて敵対的摂動を作成することで、深層ニューラルネットワークが敵対者によって欺かれる可能性があることを実証した。[ 9 ] [ 10 ]
さらなる研究により、制御されていない環境では、ノイズの影響を打ち消すさまざまな環境制約のため、敵対的攻撃を生成するのが難しくなることが示されるだろう。[ 11 ] [ 12 ]例えば、敵対的画像にわずかな回転やわずかな照明を加えるだけで、敵対性は失われる。さらに、Google BrainのNick Frosstのような研究者は、敵対的サンプルを作成するよりも、標識自体を物理的に取り除く方が、自動運転車[ 13 ]が停止標識を見落とすようにする方がはるかに簡単だと指摘している。 [ 14 ] Frosst はまた、敵対的機械学習コミュニティは、特定のデータ分布でトレーニングされたモデルが、まったく異なるデータ分布でもうまく機能すると誤って想定していると考えている。彼は、機械学習への新しいアプローチを探求すべきだと提案しており、現在、最先端のアプローチよりも人間の知覚により近い特性を持つ独自のニューラルネットワークに取り組んでいる。[ 14 ]
敵対的機械学習は依然として学術界に深く根付いているが、Google、Microsoft、IBMなどの大手テクノロジー企業は、機械学習モデルの堅牢性を具体的に評価し、敵対的攻撃のリスクを最小限に抑えるために、ドキュメントやオープンソースのコードベースをキュレーションし始めている。[ 15 ] [ 16 ] [ 17 ]
例としては、スパムフィルタリングにおける攻撃があり、スパムメッセージは「悪い」単語のスペルミスや「良い」単語の挿入によって難読化されます。[ 18 ] [ 19 ]コンピュータセキュリティにおける攻撃では、ネットワークパケット内のマルウェアコードを難読化したり、侵入検知を誤認させるためにネットワークフローの特性を変更したりします。 [ 20 ] [ 21 ]生体認証における攻撃では、偽の生体認証特性が悪用されて正当なユーザーになりすます可能性があります。[ 22 ]または、時間の経過とともに更新された特性に適応するユーザーのテンプレートギャラリーを侵害します。
研究者らは、たった1つのピクセルを変更するだけで、深層学習アルゴリズムを欺くことができることを示した。[ 23 ]また、別の研究者らは、亀をどの角度から見ても、Googleの物体検出AIがそれをライフルと分類するように設計されたテクスチャを持つおもちゃの亀を3Dプリントした。 [ 24 ]この亀の作成には、市販の低コストの3Dプリント技術のみが必要だった。[ 25 ]
機械で加工した犬の画像は、コンピューターと人間の両方にとって猫のように見えることが示されました。[ 26 ] 2019年の研究では、人間は機械が敵対的画像をどのように分類するかを推測できることが報告されています。[ 27 ]研究者たちは、自動運転車が停止標識を合流標識または速度制限標識として分類するように、停止標識の外観を乱す方法を発見しました。[ 13 ] [ 28 ]
シカゴ大学の研究者らは、2023年にNightshadeと呼ばれるデータ汚染フィルターをリリースした。これは、視覚芸術家が自分の作品に適用して、通常は画像作成者の同意なしにインターネットからデータをスクレイピングするテキストから画像へのモデルのデータセットを汚染するために作成された。[ 29 ] [ 30 ]
マカフィーは、テスラの旧モービルアイシステムを攻撃し、 速度制限標識に2インチの黒いテープを追加するだけで、制限速度を50mph超過するようにシステムを騙した。 [ 31 ] [ 32 ]
顔認識システムやナンバープレート読み取り装置を欺くように設計された眼鏡や衣服の敵対的パターンは、「ステルスストリートウェア」というニッチな産業を生み出した。[ 33 ]
ニューラルネットワークに対する敵対的攻撃により、攻撃者はアルゴリズムをターゲットシステムに注入することができます。[ 34 ]研究者は、無害に見える音声でインテリジェントアシスタントへのコマンドを偽装するために、敵対的な音声入力を作成することもできます。[ 35 ]並行して、そのような刺激に対する人間の知覚を探求する文献があります。[ 36 ] [ 37 ]
クラスタリングアルゴリズムはセキュリティアプリケーションで使用されます。マルウェアとコンピュータウイルスの分析は、マルウェアファミリーを特定し、特定の検出シグネチャを生成することを目的としています。[ 38 ] [ 39 ]
マルウェア検出の文脈では、研究者らは、悪意のある機能を維持しながら学習ベースの検出器を回避するバイナリを自動的に作成する敵対的マルウェア生成手法を提案している。GAMMAなどの最適化ベースの攻撃では、遺伝的アルゴリズムを使用して、Windows実行ファイルに良性コンテンツ(パディングや新しいPEセクションなど)を挿入し、誤分類の成功と挿入されたペイロードのサイズのバランスを取る制約付き最適化問題として回避を捉え、商用アンチウイルス製品への適用可能性を示している。[ 40 ]補完的な研究では、生成敵対ネットワーク(GAN)を使用して、マルウェアが良性として分類される原因となる特徴空間摂動を学習している。たとえば、Mal-LSGANは、標準的なGAN損失を最小二乗目的関数と修正された活性化関数に置き換えて、トレーニングの安定性を向上させ、複数の検出器で真陽性率を大幅に低下させる敵対的マルウェアの例を生成する。[ 41 ]
研究者たちは、セキュリティ領域における機械学習技術の制約は、一般的なベンチマーク領域の制約とは異なることを指摘している。セキュリティデータは時間とともに変化したり、誤ったラベル付けのサンプルが含まれていたり、敵対的な行動を反映したりする可能性があり、評価と再現性を複雑にする。[ 42 ]
セキュリティデータセットは、バイナリ、ネットワークトレース、ログファイルなど、さまざまな形式があります。これらのソースを特徴量に変換するプロセスでは、バイアスや矛盾が生じる可能性があることが研究で報告されています。[ 42 ] さらに、関連するマルウェアサンプルがトレーニングとテストの分割間で適切に分離されていない場合、時間ベースの漏洩が発生し、過度に楽観的な結果につながる可能性があります。[ 42 ]
マルウェアのラベルは、異なるアンチウイルスエンジンが同じサンプルを矛盾した方法で分類する可能性があるため、不安定になることが多い。Ceschin らは、時間の経過とともにファミリーの名前が変更されたり再編成されたりする可能性があり、その結果、真の値にさらに不一致が生じ、ベンチマークの信頼性が低下すると指摘している。[ 42 ]
マルウェア作成者はその手法を絶えず適応させているため、悪意のあるサンプルの統計的特性も変化します。この種の概念ドリフトは広く文書化されており、システムが定期的に更新されるか、増分学習のメカニズムが組み込まれない限り、モデルのパフォーマンスが低下する可能性があります。[ 42 ]
研究者は、容易に操作できる特徴と、変更に対してより耐性のある特徴を区別している。たとえば、ヘッダーフィールドなどの単純な静的属性は攻撃者によって変更される可能性があるが、制御フローグラフなどの構造的特徴は一般的に安定しているが、抽出するには計算コストがかかる。[ 42 ]
実際の展開環境では、悪意のあるサンプルの割合は極めて低く、全データの 0.01% から 2% の範囲になります。この不均衡な分布により、モデルは多数派クラスに偏り、高い精度を達成するものの、悪意のあるサンプルを識別できなくなります。[ 43 ]
この問題に対するこれまでのアプローチには、データレベルのソリューションとシーケンス固有のモデルの両方が含まれていました。n -gramやLong Short-Term Memory(LSTM)ネットワークなどの手法はシーケンスデータをモデル化できますが、マルウェアサンプルがトレーニングセット内で現実的な割合を占める場合、そのパフォーマンスは大幅に低下することが示されており、現実的なセキュリティコンテキストにおける限界が明らかになっています。[ 43 ]
この問題に対処するため、 BERTなどの自然言語処理のモデルを応用するというアプローチが取られてきました。この方法では、アプリケーションアクティビティのシーケンスを「言語」の一種として扱い、事前学習済みの BERT モデルを特定のタスクに合わせて微調整します。この手法を Android アクティビティ シーケンスに適用した研究では、マルウェア サンプルが 0.5% しかないデータセットでF1 スコア0.919 が報告されました。この結果は LSTM および n-gram モデルよりも大幅に改善されており、マルウェア検出におけるクラスの不均衡に対処する事前学習済みモデルの可能性を示しています。[ 43 ]
特徴量エンジニアリングとトレーニングは問題を引き起こす可能性があります。データスヌーピングは、モデルが現実世界のシナリオでは利用できない情報を使用してトレーニングされる一般的な落とし穴です。[ 44 ] モデルが、根本的なセキュリティ関連のパターンではなく、アーティファクトをラベルに関連付けることを学習すると、偽の相関が生じます。 [ 44 ]例えば、マルウェア分類器は、悪意のある動作自体ではなく、特定のコンパイラアーティファクトを識別することを学習する可能性があります。バイアスのかかったパラメータ選択は、モデルのハイパーパラメータがテストセットを使用して調整されるデータスヌーピングの一種です。[ 44 ]
評価指標の選択は、結果の妥当性に影響を与える可能性があります。不適切なベースラインとは、新しいモデルをより単純で確立されたベースラインと比較しないことを意味します。[ 44 ] 不適切なパフォーマンス測定とは、システムの実際的な目標と一致しない指標を使用することを意味します。[ 44 ] 「精度」のみを報告することは、偽陽性率が非常に重要視される侵入検知システムでは不十分であるとよく言われます。 [ 44 ]ベースレートの誤謬とは、大規模なクラス不均衡の状況でパフォーマンスを正しく解釈できないことです。[ 44 ]
展開によって、ライブ環境におけるパフォーマンスとセキュリティに関する課題が生じます。ラボのみの評価とは、制御された静的なラボ環境でのみシステムを評価する手法であり、概念ドリフトやパフォーマンスオーバーヘッドなどの現実世界の課題を考慮していません。[ 44 ]不適切な脅威モデルとは、機械学習システム自体を攻撃対象 として考慮しないことを指します。[ 44 ]
(教師あり)機械学習アルゴリズムに対する攻撃は、主に3つの軸に沿って分類されています。[ 45 ]分類器への影響、セキュリティ侵害、およびその特異性。
この分類法は、攻撃者の目標、攻撃対象システムの知識、入力データ/システムコンポーネントを操作する能力、および攻撃戦略について明示的な仮定を可能にする、より包括的な脅威モデルに拡張されています。[ 47 ] [ 48 ]この分類法はさらに、敵対的攻撃に対する防御戦略の次元を含むように拡張されています。[ 49 ]
以下に、最もよく見られる攻撃シナリオをいくつか示します。
ポイズニングとは、出力のエラーを増やすように設計されたデータでトレーニングデータセットを汚染することです。学習アルゴリズムはトレーニングデータセットによって形成されるため、ポイズニングは潜在的に悪意のある意図でアルゴリズムを効果的に再プログラムすることができます。特に、コンテンツ推薦や自然言語モデルなどのユーザー生成トレーニングデータに関して懸念が提起されています。偽アカウントの普及は、ポイズニングの機会を多く提供します。Facebookは、年間約70億の偽アカウントを削除していると報告されています。[ 50 ] [ 51 ]ポイズニングは、産業アプリケーションにおける主要な懸念事項として報告されています。[ 52 ]
ソーシャルメディア上では、偽情報キャンペーンが推奨アルゴリズムやモデレーションアルゴリズムを操作し、特定のコンテンツを他のコンテンツよりも優先させようとする。
データポイズニングの特殊なケースとしてバックドア攻撃[ 53 ]があり、これは特定のトリガー(例えば、画像、音声、動画、テキストの小さな欠陥)を持つ入力に対して特定の動作を学習させることを目的としています。

例えば、侵入検知システムは収集されたデータを使用してトレーニングされることが多い。攻撃者は、動作中に悪意のあるサンプルを注入することでこのデータを汚染し、その後の再トレーニングを妨害する可能性がある。[ 47 ] [ 48 ] [ 45 ] [ 55 ] [ 56 ]
データポイズニング技術は、テキストから画像への変換モデルにも適用でき、その出力を改変することができます。これは、アーティストが著作権で保護された作品や芸術スタイルを模倣から守るために使用されています。[ 29 ]
データ汚染は、モデルが合成データでトレーニングされる際に発生するモデル崩壊によって意図せず発生することもあります。[ 57 ]
機械学習が大規模化すると、多くの場合、複数のコンピューティングマシンに依存します。たとえば、フェデレーテッドラーニングでは、エッジデバイスが中央サーバーと連携し、通常は勾配やモデルパラメータを送信します。しかし、これらのデバイスの中には、中央サーバーのモデルに損害を与えたり[ 58 ]、アルゴリズムを特定の動作に偏らせたり(たとえば、偽情報コンテンツの推奨を増幅する)するなど、期待される動作から逸脱するものがあります。一方、トレーニングが単一のマシンで実行される場合、モデルはマシンの障害やマシンへの攻撃に対して非常に脆弱になります。マシンは単一障害点です。[ 59 ]実際、マシンの所有者自身が、証明不可能なバックドアを挿入している可能性があります。[ 60 ]
少数の悪意のある(別名ビザンチン)参加者に対して(分散)学習アルゴリズムが確実に耐性を持つようにするための現在の主要な解決策は、堅牢な勾配集約ルールに基づいています。 [ 61 ] [ 62 ] [ 63 ] [ 64 ] [ 65 ] [ 66 ]堅牢な集約ルールは、参加者間のデータが非独立同分布である場合、特に常に機能するとは限りません。しかし、推薦アルゴリズムの消費習慣が異なるユーザーや言語モデルの書き方など、異質な正直な参加者のコンテキストでは、堅牢な学習アルゴリズムが保証できることについて証明可能な不可能性定理があります。[ 4 ] [ 67 ]
回避攻撃[ 8 ] [ 47 ] [ 48 ] [ 68 ]は、訓練済みモデルの不完全性を悪用するものです。たとえば、スパマーやハッカーは、スパムメールやマルウェアの内容を難読化することで検出を回避しようとすることがよくあります。サンプルは検出を回避するように変更されます。つまり、正当なものとして分類されるように変更されます。これは、訓練データに影響を与えるものではありません。回避の明確な例は、スパムコンテンツが添付画像に埋め込まれてアンチスパムフィルタによるテキスト分析を回避する画像ベースのスパムです。回避のもう1つの例は、生体認証システムに対するスプーフィング攻撃です。[ 22 ]
回避攻撃は、一般的にブラックボックス攻撃とホワイトボックス攻撃の2つの異なるカテゴリに分類できます。[ 16 ]
モデル抽出とは、攻撃者がブラックボックスの機械学習システムを調査して、そのシステムが学習したデータを抽出することです。[ 69 ] [ 70 ] これは、学習データまたはモデル自体が機密情報である場合に問題を引き起こす可能性があります。たとえば、モデル抽出を使用して独自の株式取引モデルを抽出し、攻撃者がそれを自身の金銭的利益のために利用する可能性があります。
極端な場合、モデル抽出はモデルの盗難につながる可能性があり、これはモデルから十分な量のデータを抽出して、モデルを完全に再構築することを可能にする行為に相当します。
一方、メンバーシップ推論は、不適切な機械学習手法による過学習を利用してデータポイントの所有者を推論する、標的型モデル抽出攻撃です。 [ 71 ]懸念されるのは、標的モデルのパラメータに関する知識やアクセスがなくてもこれが可能になる場合があり、医療記録や個人識別情報などを含む機密データでトレーニングされたモデルのセキュリティ上の懸念が高まっていることです。転移学習の出現と多くの最先端機械学習モデルの公開により、テクノロジー企業は公開モデルに基づいてモデルを作成する傾向が強まっており、攻撃者は使用されているモデルの構造とタイプに関する情報に自由にアクセスできるようになっています。[ 71 ]
線形モデルにおける敵対的攻撃に関する文献は増え続けている。実際、Goodfellow らによる先駆的な研究[ 72 ]以来、線形モデルにおけるこれらのモデルの研究は、敵対的攻撃が機械学習モデルにどのように影響するかを理解するための重要なツールとなっている。線形回帰および分類問題では敵対的攻撃の計算を簡略化できるため、これらのモデルの分析は簡略化される。さらに、この場合、敵対的トレーニングは凸である。 [ 73 ]
線形モデルは、最先端のモデルで観察される現象を再現しながら、分析的な解析を可能にします。その代表的な例の 1 つは、このモデルを使用して堅牢性と精度のトレードオフを説明する方法です。[ 74 ]実際、さまざまな研究が、分類[ 75 ]や線形回帰[ 76 ] [ 77 ] の漸近解析を含む、線形モデルにおける敵対的攻撃の解析を提供しています。また、ラデマッハー複雑度に基づく有限サンプル解析[ 78 ]もあります。
線形モデルにおける敵対的攻撃の研究から得られた結果の一つは、それが正則化と密接に関係しているということである。[ 79 ]特定の条件下では、
敵対的深層強化学習は、学習されたポリシーの脆弱性に焦点を当てた強化学習の活発な研究分野です。この研究分野では、当初、強化学習ポリシーが知覚できない敵対的操作に脆弱であることがいくつかの研究で示されました。 [ 72 ] [ 80 ]これらの脆弱性を克服するためのいくつかの方法が提案されていますが、最新の研究では、これらの提案されたソリューションは深層強化学習ポリシーの現在の脆弱性を正確に表現するには程遠いことが示されています。[ 81 ]
音声認識に対する敵対的攻撃は、音声テキスト変換アプリケーション、特にMozillaのDeepSpeech実装[ 82 ]とGoogleのSpeech Commandsモデル[ 83 ]に対して導入されています。このような攻撃から防御するためにさまざまな前処理技術が提案されています[ 84 ]が、これらの方法は、それらの防御策を知っている攻撃者に対しては耐性がない可能性があります。
機械学習システムに対して使用できる敵対的攻撃には、非常に多くの種類があります。これらの多くは、深層学習システムだけでなく、 SVM [ 7 ]や線形回帰[ 85 ]などの従来の機械学習モデルにも有効です。これらの攻撃タイプの代表的な例としては、次のものが挙げられます。
敵対的サンプルとは、人間には「普通」に見えるように特別に作成された入力データのことですが、機械学習モデルでは誤分類を引き起こすように設計されています。多くの場合、誤分類を誘発するために、特別に設計された「ノイズ」が使用されます。以下に、文献で紹介されている敵対的サンプル生成のための最新手法をいくつか示します(網羅的なリストではありません)。
敵対的機械学習におけるブラックボックス攻撃は、攻撃者が与えられた入力に対してのみ出力を取得でき、モデルの構造やパラメータについては何も知らないことを前提としています。[ 16 ] [ 94 ]この場合、敵対的サンプルは、ゼロから作成されたモデルを使用するか、モデルをまったく使用せずに(元のモデルを照会する機能を除いて)生成されます。いずれの場合も、これらの攻撃の目的は、問題のブラックボックスモデルに転移できる敵対的サンプルを作成することです。[ 95 ]
単純なブラックボックス敵対的攻撃は、ブラックボックス画像分類器を攻撃するためのクエリ効率の良い方法です。[ 96 ]
ランダムな正規直交基底を取得するで著者らは、標準基底(ピクセル)の離散コサイン変換を提案した。
正しく分類された画像の場合、 試す分類器のエラー量を比較する最も多くのエラーを引き起こすものを選んでください。
これを繰り返して分類器における所望の誤差レベルに達するまで。
著者らがガウス過程に基づく以前のブラックボックス敵対的攻撃アルゴリズムと比較するための単純なベースラインを設計した際に発見され、そのベースラインがさらに優れた性能を発揮したことに驚いた。[ 97 ]
Square 攻撃は、勾配情報を必要とせずに分類スコアを照会することに基づくブラックボックス回避型の敵対的攻撃手法として 2020 年に導入されました。[ 98 ]スコアベースのブラックボックス攻撃として、この敵対的アプローチはモデル出力クラス全体の確率分布を照会できますが、モデル自体にはアクセスできません。論文の著者によると、提案された Square 攻撃は、当時最先端のスコアベースのブラックボックス攻撃と比較して、必要なクエリ数が少なくて済みました。[ 98 ]
機能の目的を説明するために、攻撃では分類器を次のように定義します。、 と入力の次元を表し、出力クラスの総数として。入力がクラスに属するこれにより、任意の入力に対して分類器のクラス出力が可能になります。定義されるこの攻撃の目的は以下のとおりです。[ 98 ]
言い換えれば、何らかの摂動を受けた敵対的サンプルを見つけること分類器が、制約の下でそれを誤って別のクラスに分類することになる。そして類似している。次に、論文では損失を定義する。としてそして、敵対的サンプルを見つけるための解決策を提案する。以下の制約付き最適化問題を解く場合:[ 98 ]
理論上、結果として得られる敵対的サンプルは、誤ったクラスに非常に自信を持っているが、元の画像と非常によく似ている。このようなサンプルを見つけるために、Square Attack は反復ランダム検索技術を利用して画像をランダムに摂動させ、目的関数の改善を目指します。各ステップで、アルゴリズムは小さな正方形のピクセル領域のみを摂動させるため、Square Attack という名前が付けられ、クエリ効率を向上させるために敵対的サンプルが見つかるとすぐに終了します。最後に、この攻撃アルゴリズムはスコアを使用し、勾配情報は使用しないため、このアプローチは、以前は回避攻撃を防ぐために使用されていた一般的な技術である勾配マスキングの影響を受けないことが論文の著者らによって示されています。[ 98 ]
このブラックボックス攻撃は、クエリ効率の良い攻撃としても提案されましたが、入力の予測出力クラスへのアクセスのみに依存します。言い換えれば、HopSkipJump攻撃は、Square Attackのように勾配を計算したりスコア値にアクセスしたりする機能を必要とせず、モデルのクラス予測出力(任意の入力に対して)のみを必要とします。提案された攻撃は、ターゲット設定と非ターゲット設定の2つの異なる設定に分かれていますが、どちらも、異なるモデル出力につながる最小限の摂動を追加するという一般的なアイデアに基づいています。ターゲット設定では、モデルが摂動された画像を特定のターゲットラベル(元のラベルではない)に誤分類するようにすることが目標です。非ターゲット設定では、モデルが摂動された画像を元のラベルではない任意のラベルに誤分類するようにすることが目標です。両方の攻撃目標は次のとおりです。オリジナル画像です。は敵対的イメージであり、画像間の距離関数です。はターゲットラベルであり、はモデルの分類クラスラベル関数です: [ 99 ]
この問題を解決するために、攻撃者は以下の境界関数を提案する。非標的設定と標的設定の両方について:[ 99 ]
これは、異なる潜在的な敵対的サンプル間の境界をよりよく視覚化するためにさらに単純化できます。[ 99 ]
この境界関数を用いると、攻撃は反復アルゴリズムに従って敵対的サンプルを見つける。特定の画像に対してそれは攻撃目標を満たす。
境界探索は、修正された二分探索を使用して境界(定義による)の点を見つけます。) は、そして次のステップでは、勾配を計算します。オリジナルを更新この勾配と事前に選択されたステップサイズを使用します。HopSkipJumpの著者らは、この反復アルゴリズムが収束することを証明し、境界線に沿った、元の画像と非常に近い距離にある点まで。[ 99 ]
しかし、HopSkipJumpはブラックボックス攻撃として提案されており、上記の反復アルゴリズムでは2番目の反復ステップで勾配の計算が必要となるため(ブラックボックス攻撃ではこの勾配にアクセスできない)、著者らはモデルの出力予測のみを必要とする勾配計算の解決策を提案している。[ 99 ]すべての方向に多数のランダムベクトルを生成することにより、勾配の近似値は、画像上の境界関数の符号で重み付けされたこれらのランダムベクトルの平均を使用して計算できます。、 どこはランダムベクトル摂動のサイズです: [ 99 ]
上記の式の結果は、反復アルゴリズムのステップ 2 で必要とされる勾配の近似値を与え、HopSkipJump をブラックボックス攻撃として完成させます。[ 100 ] [ 101 ] [ 99 ]
ホワイトボックス攻撃は、攻撃者が提供された入力のラベルを取得できることに加えて、モデルパラメータにもアクセスできることを前提としている。[ 95 ]
敵対的サンプルを生成するための最初の攻撃手法の1つは、Googleの研究者であるIan J. Goodfellow、Jonathon Shlens、およびChristian Szegedyによって提案されました。[ 102 ]この攻撃は高速勾配符号法(FGSM)と呼ばれ、画像に知覚できない量の線形ノイズを追加し、モデルがそれを誤って分類するように仕向けます。このノイズは、摂動させたい画像に関する勾配の符号に小さな定数εを乗じることで計算されます。εが増加すると、モデルは騙されやすくなりますが、摂動も識別しやすくなります。以下に、敵対的サンプルを生成するための式を示します。オリジナル画像です。非常に小さな数です。は勾配関数です。損失関数は、はモデルの重みであり、が真のラベルです。[ 103 ]
この方程式の重要な特性の一つは、勾配が入力画像に関して計算される点です。これは、真のラベルの元の画像に対する損失を最大化する画像を生成することが目的だからです。従来の勾配降下法(モデル学習用)では、正解データセットにおけるモデルの損失を最小化することが目標であるため、勾配を使用してモデルの重みを更新します。高速勾配符号法は、ニューラルネットワークは入力に対する線形量の摂動にも抵抗できないという仮説に基づいて、モデルを回避するための敵対的サンプルを高速に生成する方法として提案されました。[ 104 ] [ 103 ] [ 102 ] FGSMは、画像分類や骨格動作認識に対する敵対的攻撃で効果的であることが示されています。[ 105 ]
既存の敵対的攻撃と防御を分析する取り組みとして、カリフォルニア大学バークレー校の研究者であるニコラス・カルリーニとデビッド・ワグナーは、 2016年に敵対的サンプルを生成するためのより高速で堅牢な方法を提案した。[ 106 ]
CarliniとWagnerが提案した攻撃は、難しい非線形最適化方程式を解くことから始まります。[ 70 ]
ここでの目的はノイズを最小限に抑えることです()を元の入力に追加します機械学習アルゴリズム()はデルタ(または)で元の入力を予測します)他のクラスとしてしかし、上記の式を直接用いる代わりに、カルリーニとワグナーは新しい関数を用いることを提案している。したがって:[ 70 ]
これは最初の式を以下の問題に要約したものです。[ 70 ]
さらに、以下の式にも当てはまります。[ 70 ]
カルリーニとワグナーは、以下の関数を代わりに使うことを提案している。使用入力されたクラス確率を決定する関数代入すると、この方程式は、次に可能性の高いクラスよりも一定量だけ確信度が高いターゲットクラスを見つけるものと考えることができます。[ 70 ]
勾配降下法を用いて解くと、この方程式は、かつて敵対的サンプルに対して有効であると提案された防御的蒸留を回避することもできる高速勾配符号法と比較して、より強力な敵対的サンプルを生成することができる。[ 107 ] [ 108 ] [ 106 ] [ 70 ]

研究者たちは、機械学習を保護するための多段階アプローチを提案している。[ 10 ]
回避、ポイズニング、プライバシー攻撃に対する防御メカニズムとして、以下のようなものが提案されている。