Loading article…
ファジーハッシュ法は類似性ハッシュ法とも呼ばれ、[1]他のデータと似ているが全く同じではないデータを検出する技術です。これは、わずかな違いでも大幅に異なるハッシュ値を持つように設計された暗号ハッシュ関数とは対照的です。ファジーハッシュ法はマルウェアの識別に使用されており[2] [3] 、データ損失防止や複数バージョンのコード検出などの他の用途にも使用できる可能性があります。[4] [5]
背景
ハッシュ関数は、任意のサイズのデータを固定サイズの出力にマッピングする数学的アルゴリズムです。多くのソリューションでは、SHA-256などの暗号ハッシュ関数を使用して、重複を検出したり、大量のファイルの中から既知のファイルをチェックしたりしています。[4]ただし、暗号ハッシュ関数は、ファイルが既知のファイルと類似しているかどうかを判断するためには使用できません。暗号ハッシュ関数の要件の1つは、入力に小さな変更を加えるとハッシュ値が大幅に変更され、新しいハッシュ値が古いハッシュ値と相関がなくなることです(雪崩効果)[6]。
ファジー ハッシュは、他のデータと似ているがまったく同じではないデータを検出するというこの問題を解決するために存在します。ファジー ハッシュ アルゴリズムは、特に、2 つの類似した入力から 2 つの類似したハッシュ値が生成されるアルゴリズムを使用します。この特性は、暗号ハッシュ関数で望まれるアバランシェ効果とはまったく逆です。
ファジーハッシュは、あるオブジェクトが別のオブジェクトに含まれているかどうかを検出するためにも使用できます。[1]
ファジーハッシュのアプローチ
ファジーハッシュアルゴリズムの構築にはいくつかのアプローチがある: [7] [5]
- コンテキストトリガーピースワイズハッシュ(CTPH)は、入力を複数の部分に分割し、各部分に対して従来のハッシュを計算し、それらの従来のハッシュを1つの文字列に結合することによってハッシュを構築します。[8]
- 局所性感知ハッシュは、類似の入力項目を同じ「バケット」に配置し、データのクラスタリングや最近傍検索に使用できます。
注目すべきファジーハッシュツールとアルゴリズム
- spamsum はAndrew Tridgellが作成したツールで、ファジーハッシュを使用して、電子メールが既知のスパムと類似しているかどうかを判断します。電子メールのファジーハッシュを生成し、それを既知のスパムメールのファジーハッシュと比較して、0 (完全な不一致) から 100 (完全な一致) までの一致結果を生成します。一致結果が十分に高い場合、電子メールはスパムとして分類されます。[9] [10]
- Nilsimsa Hash は、スパム対策に重点を置いた、局所性に敏感なハッシュアルゴリズムです。
- ssdeepは、コンテキストに基づいて部分トリガーされたハッシュに基づいてファイルを比較するファジーハッシュツールです。[4]
- sdhashは、ブルームフィルターを使用して、1つのファイルが別のファイルに含まれているかどうか、または2つのファイルが互いにどの程度類似しているかを判断するファジーハッシュツールです。 [11]
- TLSHは、ファイルが互いに類似しているかどうかを比較するための局所性に敏感なハッシュ方式であり、マルウェアのクラスタリングに使用されています。[12]
参照
参考文献
- ^ ab Breitinger, Frank (2014年5月). 「NIST Special Publication 800-168」(PDF) . NIST Publications . doi :10.6028/NIST.SP.800-168 . 2023年1月11日閲覧。
- ^ Pagani, Fabio; Dell'Amico, Matteo; Balzarotti, Davide (2018-03-13). 「精度と再現率を超えて」(PDF) 。第8 回 ACM データおよびアプリケーション セキュリティとプライバシー カンファレンスの議事録。ニューヨーク、ニューヨーク、米国: ACM。pp. 354–365。doi : 10.1145 /3176258.3176306。ISBN 9781450356329. 2022年12月12日閲覧。
- ^ Sarantinos, Nikolaos; Benzaïd, Chafika; Arabiat, Omar (2016). 「フォレンジックマルウェア分析: 類似点の特定におけるファジーハッシュアルゴリズムの価値」 2016 IEEE Trustcom/BigDataSE/ISPA (PDF) . pp. 1782–1787. doi :10.1109/TrustCom.2016.0274. ISBN 978-1-5090-3205-1. S2CID 32568938. 10.1109/TrustCom.2016.0274.
- ^ abc Kornblum, Jesse (2006). 「コンテキストトリガーの断片的ハッシュ法を使用したほぼ同一のファイルの識別」Digital Investigation . 3, Supplement (2006年9月): 91–97. doi : 10.1016/j.diin.2006.06.015 . 2022年6月30日閲覧。
- ^ ab Oliver, Jonathan; Cheng, Chun; Chen, Yanggui (2013). 「TLSH -- 局所性に敏感なハッシュ」(PDF) . 2013 第 4 回サイバー犯罪と信頼できるコンピューティング ワークショップ. IEEE. pp. 7–13. doi :10.1109/ctc.2013.9. ISBN 978-1-4799-3076-0. 2022年12月12日閲覧。
- ^ Al-Kuwari, Saif; Davenport, James H.; Bradford, Russell J. (2011). 「暗号ハッシュ関数: 最近の設計動向とセキュリティの概念」。Cryptology ePrint Archive。 レポート 2011/565。
- ^ オリバー、ジョナサン、ハーゲン、ジョサイア (2021)。「ファジーハッシュスキームの要素の設計」 ( PDF )。2021 IEEE 第19回組み込みおよびユビキタスコンピューティング国際会議 (EUC) 。IEEE。pp . 1–6。doi :10.1109/euc53437.2021.00028。ISBN 978-1-6654-0036-7. 2021年4月14日時点のオリジナル(PDF)よりアーカイブ。2021年4月14日閲覧。
- ^ 「オープンソース類似性ダイジェスト DFRWS 2016年8月」(PDF) tlsh.org . 2022年12月11日閲覧。
- ^ "spamsum README". samba.org . 2022年12月11日閲覧。
- ^ "spamsum.c". samba.org . 2022年12月11日閲覧。
- ^ Roussev, Vassil (2010)。「類似性ダイジェストによるデータ フィンガープリンティング」。デジタル フォレンジックの進歩 VI。IFIP情報通信技術の進歩。第 337 巻。ベルリン、ハイデルベルク: Springer Berlin Heidelberg。pp. 207–226。doi : 10.1007 / 978-3-642-15506-2_15。ISBN 978-3-642-15505-5. ISSN 1868-4238。
- ^ 「高次元データの高速クラスタリング:マルウェアバザールデータセットのクラスタリング」(PDF) . tlsh.org . 2022年12月11日閲覧。
