データの再識別または匿名解除とは、匿名データ(非識別データとも呼ばれる)を公開されている情報または補助データと照合して、データの所有者を特定する行為です。[ 1 ]これは、プライバシーポリシーを持つ企業、医療提供者、金融機関が、非識別処理を経たデータを公開する可能性があるため、懸念事項となります。
匿名化プロセスには、直接的および間接的な識別子の両方をマスキング、一般化、または削除することが含まれます。このプロセスの定義は普遍的ではありません。公開されている情報は、たとえ匿名化されているように見えても、他の利用可能なデータや基本的なコンピュータサイエンスの技術と組み合わせることで再識別される可能性があります。米国保健福祉省を含む複数の米国連邦機関および部門の集合体である「人間の被験者の保護」(「共通ルール」)は、「ビッグデータ」、つまり情報の豊富さと継続的な収集と分析、および技術の進化とアルゴリズムの進歩により、再識別が徐々に容易になっていると警告しています。しかし、匿名化は安全で効果的なデータ解放ツールであり、再識別を懸念事項とは考えていないと主張する人もいます。[ 2 ]
インターネット上で公開されるデータはますます増えています。これらのデータは、情報源のプライバシーを保護するため、氏名、住所、社会保障番号などの個人識別情報(PII)を削除するなどの匿名化技術を適用した上で公開されます。このプライバシー保護により、政府は書面による許可を必要とせずに、限定されたデータセットを第三者と合法的に共有することが可能になります。このようなデータは、特に医療分野の研究者にとって非常に貴重なものとなっています。
GDPRに準拠した仮名化は、別途保管されている「追加情報」を使用することで、再識別のリスクを低減することを目的としています。このアプローチは、データセットを専門家が評価し、一部の識別子を「直接」、一部を「間接」と分類することに基づいています。このアプローチの支持者は、データ管理者が別途保管している「追加情報」へのアクセスを制限することで、再識別を回避できると主張しています。再識別には別途保管されている「追加情報」へのアクセスが必要であり、データ管理者は、合法的な目的のみをサポートするために、特定のデータ主体へのデータの帰属を制限できるというのがその理論です。このアプローチは、再識別に使用できる追加のデータセットが存在する場合に失敗するため、議論の的となっています。このような追加のデータセットは、GDPRに準拠した仮名化を証明する者には知られていない場合や、仮名化の時点では存在しないが将来的に出現する可能性があるからです。
既存のプライバシー規制は通常、変更された情報を保護し、データが匿名化または非識別化されたとみなします。金融情報については、連邦取引委員会は、非識別化され集計されている場合に限り、その流通を許可しています。[ 3 ]金融機関が消費者に第三者との情報共有を拒否する機会を与えることを義務付けているグラム・リーチ・ブライリー法(GLBA)は、情報が集計され個人識別情報が含まれていない場合、非識別化されたデータは対象外です。これは、このデータが個人識別情報として扱われないためです。[ 3 ]
大学の記録に関しては、州レベルと連邦レベルの両方で当局が教育におけるプライバシーの問題を認識しており、機関による情報の開示を嫌悪している。米国教育省は、データに関する議論と識別についてのガイダンスを提供し、教育機関に対し、補助データとの相互参照による匿名データの再識別のリスクに敏感であること、学生や機関職員に関する名簿情報の公開を減らすことで公開領域にあるデータの量を最小限に抑えること、および匿名化のプロセスにおいて一貫性を保つことを指示している。[ 4 ]
患者の医療情報は、政府のオープンデータ政策や民間部門が主導するデータ共有イニシアチブによって促進され、 HealthData.govやPatientsLikeMeなどの無料で公開されているプラットフォームでインターネット上でますます入手可能になっています。このレベルのアクセス性は多くの利点をもたらしますが、差別やプライバシーに関する懸念が提起されています。[ 5 ]医療記録や薬局からの消費者データに対する保護は、他の種類の消費者データに対する保護よりも強力です。医療保険の携行性と説明責任に関する法律(HIPAA) は、健康に関する識別可能なデータのプライバシーを保護しますが、匿名化された情報であれば第三者への情報開示を許可します。さらに、患者の情報が不適切に開示または利用され、患者への損害を十分に軽減できなかった可能性が低い場合、患者に侵害通知を受け取ることを義務付けています。[ 6 ]再識別の可能性は、患者の情報が侵害された可能性を判断する要因です。一般的に、薬局は匿名化された情報をデータマイニング会社に販売し、データマイニング会社はそれを製薬会社に販売する。[ 3 ]
医療情報のデータマイニングを禁止する州法が制定されたが、メイン州とニューハンプシャー州の連邦裁判所は、憲法修正第1条を理由にそれらを無効とした。別の連邦裁判所は別の訴訟で、患者のプライバシーに関する懸念を「捉えどころのない」と表現し、再識別のリスクを認めなかった。[ 3 ]
2015 年 9 月に共通規則機関が発表した規則制定案通知では、研究における「ヒト被験者」という包括的な用語が、生体試料、つまり人体から採取された物質(血液、尿、組織など)を含むように拡大されました。これにより、生体試料を使用する研究者は、ヒト被験者を用いた研究を行う際のより厳格な要件に従わなければならないことが義務付けられました。その根拠は、生体試料の再識別のリスクが高まることです。[ 7 ]最終的な改訂では、この規則が確認されました。[ 8 ]
さまざまな分野で再識別に成功した事例が数多くあります。一般の人が匿名性を破るのは容易ではありませんが、その手順が明らかになり学習されると、データベース内の情報にアクセスするために高度な知識は不要になります。場合によっては、集団が固有の識別子の組み合わせを持っている場合は、技術的な専門知識さえ必要ありません。[ 3 ]
1990年代半ば、マサチューセッツ州の職員の健康保険を購入していたグループ保険委員会(GIC)という政府機関は、病院受診記録を、データを要求する研究者に無料で公開することを決定した。GICは、氏名、住所、社会保障番号などの識別情報を削除したため、患者のプライバシーは問題ないと保証した。しかし、郵便番号、生年月日、性別などの情報はそのまま残された。GICの保証は、当時のマサチューセッツ州知事ウィリアム・ウェルドによって強化された。当時大学院生だったラタニア・スウィーニーは、GICのデータから知事の記録を探し出すことに着手した。GICのデータと、彼女が20ドルで購入したケンブリッジ市の有権者データベースを組み合わせることで、ウェルド知事の記録は容易に発見された。[ 9 ]
1997年、ある研究者が有権者データベースを使って医療記録の匿名化を解除することに成功した。[ 3 ]
2011年、ラタニア・スウィーニー教授は再びワシントン州の匿名化された病院受診記録と投票記録を使用し、43%の確率で個人を特定することに成功した。[ 10 ]
処方薬情報を用いて患者を再識別するために使用される既存のアルゴリズムが存在する。[ 3 ]
テキサス大学の研究者、アーヴィンド・ナラヤナン氏とヴィタリー・シュマティコフ教授は、Netflixの匿名化された映画ランキングデータの一部をストリーミングウェブサイト上の個々の消費者に再識別することに成功した。[ 11 ] [ 12 ] [ 13 ] このデータは、個人名をランダムな数字に置き換え、個人情報を移動させることで匿名化処理を行った後、2006年にNetflixによって公開された。2人の研究者は、匿名化されていないIMDb(インターネット映画データベース)ユーザーの映画評価と比較することで、データの一部を非匿名化処理した。データベースからの情報は、加入者を特定するためにほとんど必要ないことがわかった。[ 3 ]その結果の研究論文では、Netflixユーザーを再識別することがいかに容易であるかという驚くべき事実が明らかになった。例えば、ユーザーがレビューした映画2本に関するデータ(正確な評価と評価日(前後3日以内)を含む)を知るだけで、68%の確率で再識別に成功する。[ 9 ]
2006年、AOLがユーザーの検索クエリを公開した後、公開前に匿名化されたデータから、ニューヨーク・タイムズの記者が匿名化されたユーザーの検索グループを取り上げて個人を再特定することに成功した。[ 3 ] AOLはユーザー名やIPアドレスなどの識別情報を抑制しようとしたが、研究者にとってこのデータの有用性を維持するために、これらを固有の識別番号に置き換えた。公開後、ブロガーたちはデータを精査し、このコンテンツを持つ特定のユーザーを特定しようとしたり、「妻を殺す方法」、「うつ病と病気休暇」、「自動車事故の写真」などの面白く、憂鬱で、衝撃的な検索クエリを指摘したりした。マイケル・バルバロとトム・ゼラーという2人の記者は、ユーザー417729の検索履歴の手がかりから、テルマ・アーノルドという62歳の未亡人を突き止めることができた。アーノルドは自分が検索を行ったことを認め、再特定が可能であることを裏付けた。[ 9 ]
位置情報データ(人の居場所や移動を示す時間的な地理的位置の系列)は、特に匿名化が難しい個人データの一種です。位置情報は、自宅、職場、買い物、医療機関など、日常生活で頻繁に訪れる場所への繰り返しの訪問や、特定の余暇のパターンを示します。[ 14 ]位置情報データから個人の身元を削除するだけでは、通勤リズム、睡眠場所、職場などの識別可能なパターンは削除されません。座標を住所にマッピングすることで、位置情報データは容易に再識別され[ 15 ]、個人の私生活の状況と関連付けられます。位置情報のストリームは、アプリによってアクセスされるスマートフォンデータから個人識別子を再構築する上で重要な役割を果たします。[ 16 ]
2019年、チューリッヒ大学の2人の研究者、ケルスティン・ノエル・ヴォキンガー教授とウルス・ヤコブ・ミューレマッター博士は、スイス連邦最高裁判所の事例を分析し、医薬品の価格決定に関して連邦公衆衛生局(FOPH)に対する訴訟に関与した製薬会社と医薬品を評価した。一般的に、スイスの判決では、関与した民間企業(製薬会社など)や民間企業を特定できる情報(医薬品名など)は匿名化されている。研究者らは、公開データベースからの情報をリンクすることで、スイス連邦最高裁判所の関連する匿名化された事例の84%を再特定することができた。 [ 17 ] [ 18 ]この成果はメディアで取り上げられ、裁判事例を匿名化すべきかどうか、またどのように匿名化すべきかについての議論が始まった。[ 19 ] [ 20 ]
1997年、ラタニア・スウィーニーは国勢調査記録の研究から、米国人口の最大87パーセントが5桁の郵便番号、性別、生年月日の組み合わせで特定できることを発見した。 [ 21 ] [ 22 ]
このような組み合わせに基づく不正な再識別には、GDPRに準拠した仮名化に現在必要とされているように、データ管理者の管理下にある別途保管された「追加情報」へのアクセスは必要ありません。
データが再識別された個人は、自分の情報とそれに紐づけられた個人情報が、自分の財政、健康、嗜好に関するプライベートな情報を保有されたくない組織に売却されるリスクにもさらされます。このようなデータの公開は、不安、恥、または当惑を引き起こす可能性があります。再識別によって個人のプライバシーが侵害されると、将来の侵害ははるかに容易になります。あるデータと個人の実際の身元が結び付けられると、そのデータと匿名の身元とのいかなる関連付けも、その個人の匿名性を損なうことになります。[ 3 ]
再識別は、匿名性を保証することを誓約した企業や機関を不法行為責任の増加にさらし、再識別後にユーザーを特定できる第三者に情報を開示したことで、内部ポリシー、公共のプライバシー ポリシー、および財務上の機密保持や医療上のプライバシーに関する法律などの州法や連邦法に違反させる可能性がある。[ 3 ]
再識別のリスクに対処するため、いくつかの提案がなされている。
再識別の全面禁止が強く求められている一方で、その実施は困難である。しかし、立法者が再識別行為が発覚した場合に、それに対抗し処罰する方法はある。連邦取引委員会と連邦捜査局によるより厳しい罰則とより強力な執行を禁止と組み合わせること、再識別の被害者に再識別を行った者に対する訴訟権を与えること、匿名化されたデータを利用・分析する者に対してソフトウェア監査証跡を義務付けることなどである。政府のデータマイナーや研究者など、特定のデータベースの信頼できる受領者に対して小規模な再識別禁止を課すこともできる。この禁止は実施がはるかに容易であり、再識別を抑止する可能性がある。[ 9 ]