t近似は、 l多様性グループ ベースの匿名化をさらに改良したもので、データ表現の粒度を小さくすることでデータ セットのプライバシーを保護するために使用されます。この縮小はトレードオフであり、プライバシーを確保するために、データ管理またはデータ マイニングアルゴリズムの有効性がいくらか低下します。t近似モデルは、属性のデータ値の分布を考慮して属性の値を個別に処理することで、l多様性モデルを拡張します。
正式な定義
l多様性データの値の分布に基づいて機密属性が推測される可能性があるデータ侵害の存在を考慮して、機密フィールドの分布をさらに維持することでl多様性をさらに高めるためにt近似法が作成されました。Ninghui Li、Tiancheng Li、Suresh Venkatasubramanianによる元の論文[1]では、 t近似を次のように定義しています。
t近似原則:このクラス内のセンシティブ属性の分布とテーブル全体の属性の分布との間の距離がしきい値t以下である場合、同値クラスはt近似性を持つと言われます。すべての同値クラスがt近似性を持つ場合、テーブルはt近似性を持つと言われます。
Charu Aggarwal とPhilip S. Yu は、プライバシー保護 データマイニングに関する著書[2]で、この定義では、しきい値t は、匿名化されたグループ内の機密属性値の分布と値のグローバル分布の差の上限を与えると述べています。また、数値属性の場合、t近似匿名化を使用する方が、他の多くのプライバシー保護データマイニング方法よりも効果的であると述べています。
データ侵害とl-多様性
実際のデータ セットでは、属性値が偏っていたり、意味的に類似していたりすることがあります。ただし、値の分布を考慮すると、実現可能なl多様性表現の作成が困難になる場合があります。l多様性手法は、攻撃者が属性のデータ値のグローバル分布を利用して機密データ値に関する情報を推測するのを阻止できる点で便利です。すべての値が同等の機密性を示すわけではありません。たとえば、まれに見られる病気の陽性指標は、一般的な陰性指標よりも多くの情報を提供する場合があります。このような例があるため、属性の漏洩を防ぐ場合、 l多様性を実現するのは困難で不必要な場合があります。あるいは、l多様性要件によって各グループの機密値の「多様性」が保証される一方で、値が意味的に近い可能性があることを認識しないため、機密情報の漏洩が発生する可能性があります。たとえば、個人を含むサンプルに 3 つの異なる胃の病気しか記載されていない場合、攻撃者は胃の病気がその個人に当てはまると推測できます。
参照
参考文献
- ^ Li, Ninghui; Li, Tiancheng; Venkatasubramanian, Suresh (2007). 「T-Closeness: プライバシーは k-匿名性と l-多様性を超える」. t-Closeness: プライバシーは k-匿名性と l-多様性を超える(PDF) . pp. 106–115. doi :10.1109/ICDE.2007.367856. ISBN 978-1-4244-0802-3. S2CID 2949246。
- ^ Charu C. Aggarwal、Philip S. Yu 編 (2008)。「プライバシーの総合調査」。プライバシー保護データマイニング - モデルとアルゴリズム( PDF)。Springer。ISBN 978-0-387-70991-8。
