Loading article…
準識別子は、それ自体は一意の識別子ではないが、エンティティと十分に相関しており、他の準識別子と組み合わせて一意の識別子を作成できる情報です。 [1]
このように、準識別子は組み合わせると個人を特定できる情報になる。このプロセスは再識別と呼ばれる。例えば、ラタニヤ・スウィーニーは、性別、生年月日、郵便番号のいずれも個人を一意に特定するものではないが、これら3つを組み合わせることで米国の87%の個人を特定できることを示した。 [2]
この用語は1986年にトーレ・ダレニウスによって導入されました。[3]それ以来、準識別子は公開されたデータに対するいくつかの攻撃の根拠となっています。たとえば、スウィーニーは健康記録を公開情報にリンクさせ、一意に識別できる準識別子を使用して当時のマサチューセッツ州知事の病院記録を特定しました。[4] [5]また、スウィーニー、アブ、ウィンは公開されている有権者記録を使用してパーソナルゲノムプロジェクトの参加者を再識別しました。[6]さらに、アルヴィンド・ナラヤナンとヴィタリー・シュマティコフは、Netflixによって公開されたデータの匿名化を解除するための統計的条件を示す準識別子について議論しました。[7]
モトワニ氏とイン氏は、準識別子を含む大量の政府および企業データの公開によってプライバシー侵害が発生する可能性があると警告している。[8]
参照
参考文献
- ^ 「統計用語集:準識別子」OECD。2005年11月10日。 2013年9月29日閲覧。
- ^ スウィーニー、ラタニヤ。単純な人口統計は、多くの場合、人々を一意に識別します。カーネギーメロン大学、2000年。http://dataprivacylab.org/projects/identifiability/paper1.pdf
- ^ Dalenius, Tore. Finding a Needle In a Haystack or Identifying Anonymous Census Records . Journal of Official Statistics, Vol.2, No.3, 1986. pp. 329–336. http://www.jos.nu/Articles/abstract.asp?article=23329 Archived 2017-08-08 at the Wayback Machine
- ^ アンダーソン、ネイト。 匿名化されたデータは実際にはそうではありません。その理由は次のとおりです。Ars Technica、2009 年。https://arstechnica.com/tech-policy/2009/09/your-secrets-live-online-in-databases-of-ruin/
- ^ Barth-Jones, Daniel C.ウィリアム・ウェルド知事の医療情報の「再識別」:健康データ識別リスクとプライバシー保護の批判的再検討、過去と現在。過去と現在(2012年6月4日)(2012年)。
- ^ Sweeney、Latanya、Akua Abu、Julia Winn。「個人ゲノムプロジェクトの参加者を名前で識別する」SSRN 2257732 (2013) で入手可能。
- ^ Narayanan, Arvind および Shmatikov, Vitaly.大規模スパースデータセットの堅牢な匿名化解除。テキサス大学オースティン校、2008 年。https://www.cs.utexas.edu/~shmat/shmat_oak08netflix.pdf
- ^ Rajeev Motwani および Ying Xu (2008)。準識別子のマスキングと検出のための効率的なアルゴリズム(PDF)。実用的なプライバシー保護データマイニングに関する SDM'08 国際ワークショップの議事録。
