統計的開示制御(SDC )は、統計的開示制限(SDL)または開示回避とも呼ばれ、データ駆動型研究において、調査データや行政データの分析結果やマイクロデータの公開から個人や組織が特定されないようにするために使用される手法です。SDCの目的は、研究の回答者と被験者の機密性を保護することです。[1]
SDC は通常、「出力 SDC」を指します。これは、たとえば、公開された表やグラフで回答者に関する機密情報が漏洩しないようにするものです。SDC は、データに適用される保護方法 (名前や住所の削除、極端な値の制限、問題のある観測値の交換など) を表すこともあります。これは「入力 SDC」と呼ばれることもありますが、匿名化、匿名化、またはマイクロデータ保護と呼ばれることが一般的です。
教科書(例えば[2])では、通常、入力SDCと表形式のデータ保護(出力SDCの他の部分ではない)が取り上げられています。これは、この2つの問題が、この分野の発展を支援した統計機関にとって直接的な関心事であるためです。[3]分析環境では、データ管理者が研究用の特定の出力SDCを主張し始めるまで、統計機関向けに開発された出力ルールが一般的に使用されていました。[4]
このページでは出力 SDC に焦点を当てます。
必要性
多くの種類の社会、経済、健康に関する研究では、調査や国勢調査のデータ、納税記録、健康記録、教育情報など、潜在的に機密性の高いデータを研究の根拠として使用しています。このような情報は通常、内密に提供され、行政データの場合は、必ずしも研究目的ではありません。
研究者は通常、一人の人物や企業に関する情報に興味があるわけではなく、より大きな集団の傾向を探しています。[5]しかし、彼らが使用するデータはそもそも個々の人物や企業にリンクされており、SDCは、公開されたデータがどれほど詳細で広範囲であっても、これらが特定できないようにしています。[6]
データ分析の最後に、研究者が何らかの形で研究を通じて 1 人の人物または企業を特定する可能性があります。たとえば、研究者は、遠隔地にある病院の老年科で、そのようなケアを提供している病院が 1 つしかない場合に、その病院の老年科のサービスが特に優れているか劣っているかを特定することがあります。その場合、分析に使用されたデータセットが適切に匿名化または非識別化されてい たとしても、データ分析によって病院の身元が「明らかに」されます。
統計的開示管理は、この開示リスクを特定し、分析結果が機密性を保護するために変更されることを保証します。[7]機密性の保護とデータ分析結果が統計研究に依然として有用であることの保証との間でバランスを取る必要があります。[8]
出力SDC: 統計モデル
出力 SDC は、出力チェッカーが従うことができる一連のルールに依存しています。たとえば、頻度表には最低限の観測数が必要であることや、生存表では極端な値について右側打ち切りを行う必要があることなどです。頻度表と大きさ表のルールの価値と欠点は、20 世紀後半から広く議論されてきました。しかし、他の種類の分析に対するルールの必要性が高まっていることが認識されているため、より構造化されたアプローチが必要です。
「安全」と「危険」の統計
度数分布表などの統計出力には、差異、低い数値、クラスの開示など、高いレベルの固有のリスクがあります。したがって、リリース前に、理想的にはデータについてある程度理解している人がチェックして、リリース時に意味のあるリスクがないことを確認する必要があります。これらは「安全でない統計」と呼ばれます。ただし、モデリングからの係数など、意味のあるリスクがないため、それ以上のチェックなしでリリースできる統計もあります。これらは「安全な統計」と呼ばれます。統計を「安全」と「安全でない」に分けることで、出力チェックを後者に集中させることができ、セキュリティと効率の両方が向上します。[4]
これは、カウント、平均値、中央値、単純なインデックスなどの「安全でない」統計が出力の大部分を占める公式統計ではそれほど重要ではありません。ただし、研究出力の場合、これは重要です。なぜなら、研究出力の多く (特に推定値とテスト統計) は本質的に「安全」だからです。
統計バーンまたはスタットバーン
安全/危険モデルは便利ですが、2 つの単純なカテゴリに限定されています。これらのカテゴリ内では、SDC のガイドラインは主に統計の長いリストとその処理方法で構成されています。2023 年に、SACRO プロジェクト https://dareuk.org.uk/driver-project-sacro/ は、分野全体を見直し、より有用な分類スキームを導入できるかどうかを確認することを開始しました。その結果、「統計バーン」(または「statbarn」) の概念が生まれました。
Statbarn は、開示制御を目的とした統計の分類であり、そのクラス内のすべての統計は、開示制御に関する限り同じ特性を共有します。
- 数学的な形式は似ている
- 彼らは同じリスクを共有している
- 彼らはそれらのリスクに対して同じ反応を示している
- 出力チェックルールはすべての
2024年3月現在、14のスタットバーンが特定されており、そのうち12は出力チェッカー用である。[9]
- 周波数
- 統計的仮説検定
- 関連係数
- 位置(中央値、IQRなど)
- 極値(最大値、最小値)
- 形
- 線形集合体
- モード
- 非線形濃度比
- オッズとリスク比
- 生存表
- ジニ係数
これらはほぼすべての統計をカバーしています。また、グラフを適切な統計情報に変換できるほとんどのグラフ形式もカバーしています (たとえば、円グラフは頻度表の別の形式です)。SACRO マニュアルには、注意すべき点と、確認する際に従うべきルールについてのガイダンスが記載されています。
出力SDC: 運用モデル
SDC を出力するには、原則ベースとルールベースの2 つの主なアプローチがあります。 [10]原則ベースのシステムでは、開示管理は特定の基本原則 (たとえば、「公開されたマイクロデータでは個人が特定されてはならない」) を維持しようとします。[11]対照的に、ルールベースのシステムは、開示管理を実行する人が従う特定のルール セット (たとえば、「頻度は少なくとも 5 つの観察に基づいていなければならない」) によって証明され、その後はデータを安全に公開できると推定されます。一般に、公式統計はルール ベースですが、研究環境は原則ベースである可能性が高くなります。
研究環境では、出力チェック体制の選択が運用上重要な影響を及ぼす可能性がある。[12]
ルールベースのSDC
ルールベースのSDCでは、データ分析の結果を公表できるかどうかを判断するために、厳格なルールセットが使用されます。ルールは一貫して適用されるため、どのような出力が許容されるかが明確になります。ルールベースのシステムは、時間、データソース、制作チーム間で一貫性を確保するのに適しており、統計機関にとって魅力的です。[12]ルールベースのシステムは、microdata.noやLissyなどのリモートジョブサーバーにも適しています。
しかし、ルールが柔軟性に欠けるため、開示情報が漏れてしまう可能性があったり、ルールが過度に制限的であるため、有用な分析を公開するには範囲が広すぎる結果しか許可されない可能性があります。[10]実際には、ルールベースのシステムを実行している研究環境では、「アドホック」システムに柔軟性をもたらす必要があるかもしれません。[12]
北アイルランド統計研究局(NISRA)は、統計と研究結果の発表にルールベースのアプローチを採用しています。[13]
原則に基づくSDC
原則ベースの SDC では、研究者と出力チェッカーの両方が SDC のトレーニングを受けます。彼らは、ルールベースの SDC のような厳格なルールではなく、経験則である一連のルールを受け取ります。つまり、原則として、どの出力も承認または拒否される可能性があります。経験則は、研究者にとっての出発点です。研究者は、(1) 非開示であること、(2) 重要であること、(3) 例外的な要求である限り、「経験則」に違反する出力を要求することができます。[14]「安全でない」出力が非開示であることを証明するのは研究者の責任ですが、最終決定権はチェッカーにあります。厳格なルールがないため、研究者とチェッカーの両方から開示リスクに関する知識と判断力が求められます。これには、トレーニングと統計とデータ分析の理解が必要ですが、[10]これを使用することで、ルールベースのモデルよりもプロセスを効率的にできると 主張されています[12] 。
英国では、北アイルランドを除き、社会科学と公衆衛生の分野における主要な安全な研究環境はすべて原則に基づいています。これには、英国データサービスのセキュアデータサービス、[15]英国国家統計局のセキュアリサーチサービス、スコットランドセーフヘイブン、セキュア匿名情報リンク(SAIL)、OpenSAFELYが含まれます。
批評
一般化やセル抑制などの現代の統計的開示制御技術の多くは、仮想的なデータ侵入者による攻撃に対して脆弱であることが示されています。たとえば、Cox は 2009 年に、補完セル抑制は、プライマリ セルと補完セルの両方を抑制する必要があるため、通常は「過剰保護」ソリューションにつながり、正確な間隔が報告されると機密データが侵害される可能性があることを示しました。[16]
ルールの多くは恣意的で、確固たる証拠というよりも、データ所有者の異なる行動を望まない気持ちを反映しています。例えば、リッチー[17]は、最小閾値の選択は、統計的な根拠よりも、組織が他と一致させたいという願望によるものであることを実証しました。
より実質的な批判は、制御手段を探求するために使用される理論モデルは、実際の行動のガイドとしては適切ではないというものである。[18]ハフナーらは、視点を変えることで大幅に異なる結果を生み出すことができるという実践的な例を示している。[3]
SDCおよびAIモデルの出力
人工知能と機械学習モデルは、出力チェックに異なるリスクをもたらします。[19] GRAIMATTERプロジェクトhttps://dareuk.org.uk/sprint-exemplar-project-graimatter/は、いくつかの初期のガイダンスと自動ツールを提供しました。これらはSACROプロジェクト(下記参照)の一環として拡張および簡素化され、データサービススタッフ向けのガイドラインが追加されました。これはまだ急速に進化している分野です。SDC-REBOOTコミュニティネットワークhttps://www.jiscmail.ac.uk/cgi-bin/webadmin?A0=SDC-REBOOTは現在、ツールとガイダンスの継続的な開発を調整しています。
自動化ツール
出力チェックは、何を見ているのかを理解し、出力を公開するかどうかを判断できるアナリストを必要とするため、一般的に労働集約的です。そのため、自動チェックには大きな関心が寄せられています。ユーロスタットが委託したレポート[20]では、出力チェックのオプションを検討しましたが、それは主に2つのオプションに絞られました。
- プロセス終了時レビュー (EoPR): コンピュータが出力を見て、それが何を示しているかを理解できるようにトレーニングします。これには、研究者が追加のトレーニングを受ける必要がないという利点があります。ただし、自動化されたシステムに何を見ているのかを説明するのは難しい場合があります。これは、出力を手動で確認するよりも時間がかかる可能性があります。tauArgus と sdcTable は EoPR です。
- プロセス内レビュー (WPR): 出力チェックツールは出力の生成と同時に呼び出され、ソースデータにアクセスします。したがって、出力がどのように作成されたかを説明する必要はありません。このアプローチの欠点は、処理時間が遅くなる可能性があることと、分析に出力チェックツールを実行するために必要なコマンドを含める必要があることです。ただし、主な利点は、データについて教える必要がないことです。
tauArgus と sdcMicro
tau-Argus と sdcTable は、表形式のデータ保護 (頻度表とマグニチュード表) 用の完全に自動化されたオープンソース EoPR ツールです。複数の表で動作するよう設計されています。出力と制御パラメータを説明するメタデータを設定する必要があります。出力チェッカーに、表全体にわたる二次開示を含む潜在的な問題に関する広範な情報を提供します。また、抑制と単純な丸めから二次抑制と制御された表形式の丸めまで、修正措置を実行することもできます。表形式以外の出力は処理しません。
各テーブルのメタデータを書き換える必要があるため、これらのツールは研究用途にはあまり適していません。ただし、同じテーブルが繰り返し生成され、二次差分が大きな問題と見なされる公式統計では、ツールの設定への投資は非常に費用対効果が高い場合があります。
両方のソフトウェアは、GitHub https://github.com/sdcTools/tauargus および CRAN https://cran.r-project.org/web/packages/sdcTable/ でオープンソースになっています。
サクロ
SACRO(研究成果の半自律チェック)はWPRツールであり、もともとは2020年にユーロスタットによって委託(ACRO)され、汎用的な成果チェックツールが開発可能であることを示す概念実証でした。[21] 2023年に英国医学研究会議は、複数の言語(2024年時点ではStata、R、Python)で動作し、よりユーザーフレンドリーなインターフェースを提供する一般化バージョン(SACRO)を委託しました。[22] SACROはStatbarnsモデルを直接実装し、原則に基づいています。したがって、ユーザーが例外を要求したり、成果チェック担当者が自動化された推奨事項をオーバーライドしたりできるため、「半自動」です。英国のすべての社会科学の安全な施設と英国のほとんどの公衆衛生の安全な施設がこれを採用する予定です。
このソフトウェアは Github (https://github.com/AI-SDC) で入手できます。ここにはオリジナルの ACRO へのリンクと AI モデルを評価するためのツールも含まれています。
参照
参考文献
- ^ スキナー、クリス (2009)。「調査データの統計開示管理」(PDF)。統計ハンドブック第29A巻:サンプル調査:設計、方法、およびアプリケーション。統計ハンドブック。29 : 381–396。doi :10.1016/S0169-7161(08) 00015-1。ISBN 978-0-444-53124-7. 2016年3月8日閲覧。
- ^ 「参考文献」、Statistical Disclosure Control、英国チチェスター:John Wiley & Sons、Ltd、pp. 261–277、2012-07-05、doi:10.1002/9781118348239.refs、ISBN 978-1-118-34823-9
- ^ ab Hafner, Hans-Peter; Lenz, Rainer; Ritchie, Felix (2019-01-01). 「匿名化されたマイクロデータに対するユーザー重視の脅威識別」(PDF) . IAOS統計ジャーナル. 35 (4): 703–713. doi :10.3233/SJI-190506. ISSN 1874-7655. S2CID 55976703.
- ^ ab Ritchie, Felix (2007)。研究環境における情報漏洩検出の実践。統計データの機密性に関する UNECE/Eurostat 作業セッションで発表された論文。
- ^ 「ADRN » 安全な結果」。adrn.ac.uk 。 2016年3月8日閲覧。
- ^ 「政府統計サービス:統計開示管理」。2016年3月8日閲覧。
- ^ Templ, Matthias; et al. (2014). 「International Household Survey Network」(PDF) . IHSNワーキングペーパー. 2016年3月8日閲覧。
- ^ 「アーカイブ:ONS統計情報開示管理」。英国国家統計局。2016年1月5日時点のオリジナルよりアーカイブ。2016年3月8日閲覧。
- ^ Ritchie, Felix; Green, Elizabeth; Smith, Jim; Tilbrook, Amy; White, Paul (2023-10-30). 「統計出力チェックのためのSACROガイド」. doi :10.5281/zenodo.10054629.
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要です - ^ abc Ritchie, Felix、Elliott , Mark (2015)。「リモートアクセス環境における原則とルールベースの出力統計開示制御」(PDF)。IASSIST Quarterly。39 (2): 5–13。doi : 10.29173 /iq778。S2CID 59043893。2016年3月8 日閲覧。
{{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク) - ^ Ritchie, Felix (2009-01-01). 「英国における公式マイクロデータの公開方法」. IAOS統計ジャーナル. 26 (3, 4): 103–111. doi :10.3233/SJI-2009-0706. ISSN 1874-7655.
- ^ abcd Alves, Kyle; Ritchie, Felix (2020-11-25). 「ランナー、リピーター、ストレンジャー、エイリアン:効率的な出力開示管理の運用」. IAOS統計ジャーナル. 36 (4): 1281–1293. doi :10.3233/SJI-200661. S2CID 209455141.
- ^ 「2001年国勢調査 - 方法論」(PDF)北アイルランド統計調査局 2001年 2016年3月8日閲覧。
- ^ 英国国家統計局。「安全な研究者のトレーニング」。
- ^ Afkhamai, Reza; et al. (2013). 「英国データサービスの安全なアクセスにおける統計開示管理の実践」(PDF)。国連欧州経済委員会。 2016年3月8日閲覧。
- ^ ローレンス・H・コックス、「侵入者攻撃に対する補完細胞抑制の脆弱性」、プライバシーと機密性ジャーナル(2009)1、第2号、pp. 235–251 http://repository.cmu.edu/jpc/vol1/iss2/8/
- ^リッチー、フェリックス(2022年)。「 10はこれまでで最も安全な数字です」。データプライバシーに関する取引。15 (2):109–140。
- ^ Ritchie, Felix; Hafner, Hans-Peter; Lenz, Rainer; Welpton, Richard (2018-10-18). 「エビデンスに基づいた、デフォルトでオープンな、リスク管理された、ユーザー中心のデータアクセス」
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要です - ^ Ritchie, Felix; Tilbrook, Amy; Cole, Christian; Jefferson, Emily; Krueger, Susan; Mansouri-Bensassi, Esma; Rogers, Simon; Smith, Jim (2023-12-14). 「信頼できる研究環境における機械学習モデル - 運用リスクの理解」. International Journal of Population Data Science . 8 (1): 2165. doi :10.23889/ijpds.v8i1.2165. ISSN 2399-4908. PMC 10898318. PMID 38414545 .
- ^ Green, Elizabeth; Ritchie, Felix; Smith, James (2020-05-31). 「出力チェックを理解する」
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要です - ^ Eurostat(欧州委員会); Green, Elizabeth; Smith, James; Ritchie, Felix(2021)。研究成果の自動チェック(ACRO):動的な開示チェックのためのツール:2021年版。LU:欧州連合出版局。doi :10.2785 /75954。ISBN 978-92-76-41529-9。
- ^ スミス、ジム; プリーン、リチャード; アルバシール、マハ; リッチー、フェリックス; グリーン、エリザベス; デイビー、サイモン; ストークス、ピート; ベーコン、セバスチャン (2023-09-26). 「SACRO: 研究成果の半自動チェック」
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要です
