統計的開示制御(SDC)は、統計的開示制限(SDL)または開示回避とも呼ばれ、調査や行政データの分析結果、あるいはマイクロデータの公開から個人や組織が特定されないようにするために、データ駆動型研究で使用される手法です。SDCの目的は、調査の回答者や被験者の機密性を保護することです。[ 1 ]
SDCは通常「出力SDC」を指し、例えば、公開された表やグラフに回答者に関する機密情報が漏洩しないようにすることなどが含まれます。SDCは、データに適用される保護方法、例えば、氏名や住所の削除、極端な値の制限、問題のある観測値の入れ替えなどを指す場合もあります。これは「入力SDC」と呼ばれることもありますが、一般的には匿名化、非識別化、またはマイクロデータ保護と呼ばれます。
教科書(例:統計的開示管理[ 2 ])では、通常、入力SDCと表形式データの保護(出力SDCの他の部分は除く)について扱っています。これは、これら2つの問題が、この分野の発展を支援した統計機関にとって直接的な関心事であるためです。[ 3 ]分析環境では、データ管理者が研究のための特定の出力SDCを主張し始めるまで、統計機関向けに開発された出力ルールが一般的に使用されていました。[ 4 ]
このページでは、出力SDCに焦点を当てています。
社会、経済、健康に関する多くの研究では、調査データや国勢調査データ、納税記録、医療記録、教育情報など、機密性の高い可能性のあるデータを研究の基礎として利用しています。こうした情報は通常、秘密保持を前提として提供され、行政データの場合は必ずしも研究目的で使用されるとは限りません。
研究者は通常、特定の個人や企業に関する情報には関心がなく、より大きな集団における傾向を探しています。[ 5 ]しかし、彼らが使用するデータは、そもそも個人や企業と結びついており、SDCは、どれほど詳細で広範なデータであっても、公開されたデータからこれらが特定されないようにしています。[ 6 ]
データ分析の最終段階で、研究者が何らかの形で特定の個人や企業を特定してしまう可能性はあります。例えば、研究者が、遠隔地にある病院の老年科で、非常に優れた、あるいは劣悪なサービスを提供している病院を特定したとします。その地域では、老年科を提供している病院は1つしかありません。このような場合、分析に使用したデータセットが適切に匿名化または非識別化されていたとしても、データ分析によって病院の身元が「明らかに」されてしまうことになります。
統計的開示管理は、この開示リスクを特定し、機密性を保護するために分析結果が変更されることを保証します。[ 7 ]機密性を保護することと、データ分析の結果が統計研究に依然として有用であることを保証することとのバランスが必要です。[ 8 ]
出力SDCは、出力チェッカーが従うべき一連のルールが存在することを前提としています。例えば、度数分布表には最低限の観測値数が必要であること、生存表は極端な値に対して右側打ち切りを行うべきであることなどです。度数分布表や大きさ分布表に関するルールの利点と欠点については、20世紀後半から広く議論されてきました。しかし、他の種類の分析に関するルールの必要性が高まっていることから、より体系的なアプローチが求められています。
度数分布表などの統計出力には、差分、数値の少なさ、クラスの開示など、固有のリスクが高いものがあります。そのため、公開前に、理想的にはデータについてある程度の理解を持つ人がチェックして、公開時に重大なリスクがないことを確認する必要があります。これらは「安全でない統計」と呼ばれます。しかし、モデリングの係数など、重大なリスクがなく、追加のチェックなしで公開できる統計もあります。これらは「安全な統計」と呼ばれます。統計を「安全」と「安全でない」に分けることで、出力チェックを後者に集中させることができ、セキュリティと効率の両方が向上します。[ 4 ]
公式統計においては、件数、平均値、中央値、単純な指数といった「信頼性の低い」統計が主流であるため、この点はそれほど重要ではありません。しかし、研究成果においては、この点は重要です。なぜなら、研究成果の大部分(特に推定値や検定統計量)は本質的に「信頼性が高い」からです。
安全/危険モデルは有用ですが、2つの単純なカテゴリに限定されています。これらのカテゴリ内では、SDCのガイドラインは主に統計の長いリストとそれらの処理方法で構成されています。2023年に、SACROプロジェクトhttps://dareuk.org.uk/driver-project-sacro/は、この分野全体を見直し、より有用な分類スキームを導入できるかどうかを検討しました。その結果が「統計バーン」(または「スタットバーン」)の概念です。[ 9 ]
統計バーンとは、情報開示管理の目的で統計を分類したものであり、その分類に含まれるすべての統計は、情報開示管理の観点から同じ特性を共有している。
2024年3月現在、14の統計バーンが特定されており、そのうち12は出力チェッカー用に説明されています。[ 10 ]
これらはほぼすべての統計を網羅しています。また、グラフを適切な統計形式に変換できるほとんどのグラフ形式も網羅しています(例えば、円グラフは度数分布表の一種です)。SACROマニュアルには、注意すべき点とチェックの際のルールに関するガイダンスが記載されています。統計/グラフと統計形式の対応表はoutputchecking.orgで入手できます。
SDCを出力する主なアプローチは、原則ベースとルールベースの2つです。 [ 11 ]原則ベースのシステムでは、開示制御は特定の基本原則セットを維持しようとします。たとえば、「公開されるマイクロデータでは、個人を特定できるものがあってはならない」などです。[ 12 ]一方、ルールベースのシステムは、開示制御を実行する人が従う特定のルールセットによって特徴付けられます(たとえば、「頻度は少なくとも5つの観測に基づいていなければならない」など)。その後、データは安全に公開できるとみなされます。一般的に、公式統計はルールベースですが、研究環境は原則ベースである可能性が高いです。
研究環境においては、成果物チェック体制の選択は、運用上の重大な影響を及ぼす可能性がある。[ 13 ]
ルールベースのSDCでは、データ分析の結果をリリースできるかどうかを判断するために、厳格なルールセットが使用されます。ルールは一貫して適用されるため、どのような出力が許容されるかが明確になります。ルールベースのシステムは、時間、データソース、および制作チーム間で一貫性を確保するのに適しており、統計機関にとって魅力的です。[ 13 ]ルールベースのシステムは、 microdata.noやLissyなどのリモートジョブサービスにも適しています。
しかし、ルールが柔軟性に欠けるため、開示情報が漏れる可能性があったり、ルールが過度に制限的で、有用な分析を行うには広すぎる結果しか公表できない可能性があったりする。[ 11 ]実際には、ルールベースのシステムで運用されている研究環境では、「アドホック」なシステムに柔軟性を持たせる必要があるかもしれない。[ 13 ]
原則に基づくSDCでは、研究者とアウトプットチェッカーの両方がSDCのトレーニングを受けます。彼らは一連のルールを受け取りますが、これはルールに基づくSDCのような厳格なルールではなく、経験則です。つまり、原則として、あらゆるアウトプットが承認または拒否される可能性があります。経験則は研究者にとっての出発点です。研究者は、(1)非開示であること、(2)重要であること、(3)例外的な要求である限り、「経験則」に違反するアウトプットを要求することができます。[ 15 ]「安全でない」アウトプットが非開示であることを証明するのは研究者の責任ですが、最終的な決定権はチェッカーにあります。厳格なルールがないため、研究者とチェッカーの両方に開示リスクに関する知識と判断力が必要です。トレーニングと統計およびデータ分析の理解が必要ですが、 [ 11 ]ルールに基づくモデルよりもプロセスを効率化するために使用できるという議論もあります。[ 13 ]
英国では、北アイルランドを除き、社会科学と公衆衛生における主要な安全な研究環境はすべて原則に基づいています。これには、英国データサービスのセキュアデータサービス[ 16 ] 、国家統計局のセキュア研究サービス、スコットランドのセーフヘイブン、セキュア匿名化情報リンク(SAIL)、およびOpenSAFELYが含まれます。
一般化やセル抑制など、現代の多くの統計的開示制御技術は、仮想的なデータ侵入者による攻撃に対して脆弱であることが示されています。たとえば、Coxは2009年に、相補的セル抑制は、プライマリセルと相補的セルの両方を抑制する必要があるため、通常は「過剰に保護された」ソリューションにつながり、それでも正確な間隔が報告されると機密データが侵害される可能性があることを示しました。[ 17 ]
多くのルールは恣意的で、確固たる証拠に基づくものではなく、データ所有者が他と違うことをしたくないという気持ちを反映している。例えば、リッチー[ 18 ]は、最小閾値の選択は、統計的な根拠よりも、組織が他と足並みを揃えたいという願望によるものであることを示した。
より実質的な批判としては、制御策を検討するために用いられる理論モデルは、実践的な行動の指針としては適切ではないという点がある。[ 19 ]ハフナーらは、視点を変えることで結果が大きく変わることを示す実践的な例を示している。[ 3 ]
人工知能と機械学習モデルは、出力チェックに関して異なるリスクをもたらします。[ 20 ] GRAIMATTERプロジェクトhttps://dareuk.org.uk/sprint-exemplar-project-graimatter/ は、初期ガイダンスと自動ツールを提供しました。これらはSACROプロジェクトの一部として拡張および簡素化され(下記参照)、データサービススタッフ向けのガイドラインが追加されました。これは依然として急速に進化している分野です。SDC-REBOOTコミュニティネットワークhttps://www.jiscmail.ac.uk/cgi-bin/webadmin?A0=SDC-REBOOTは現在、ツールとガイダンスの継続的な開発を調整しています。
出力チェックは一般的に人手がかかる作業であり、分析担当者がデータの内容を理解し、出力を公開するかどうかを判断できる必要がある。そのため、自動チェックへの関心は非常に高い。ユーロスタットが委託した報告書[ 21 ]では、出力チェックの選択肢が検討されており、大きく分けて2つの選択肢がある。
tau-ArgusとsdcTableは、表形式データ(頻度表および大きさ表)の保護を目的とした、完全自動化されたオープンソースのEoPRツールです。これらは複数の表を扱うように設計されています。出力と制御パラメータを記述するメタデータを設定する必要があります。これらのツールは、表をまたいだ二次的な情報漏洩など、潜在的な問題に関する詳細な情報を出力チェッカーに提供します。また、抑制や単純な丸めから、二次的な抑制や制御された表形式の丸めまで、修正措置を実行することもできます。ただし、表形式以外の出力には対応していません。
各テーブルのメタデータを書き換える必要があるため、これらのツールは研究用途にはあまり適していません。しかし、同じテーブルが繰り返し生成され、二次差分が重大な問題とみなされる公式統計においては、これらのツールを導入するための投資は非常に費用対効果が高いと言えます。
両方のソフトウェアはGitHub (https://github.com/sdcTools/tauargus)とCRAN (https://cran.r-project.org/web/packages/sdcTable/ )でオープンソースとして公開されています。
SACRO(研究成果の半自律的チェック)はWPRツールであり、元々は汎用的な成果チェックツールが開発可能であることを示す概念実証として、2020年にEurostatによって委託(ACRO)されました。 [ 22 ] 2023年に英国医学研究評議会は、複数の言語(2024年現在:Stata、R、Python)で動作し、よりユーザーフレンドリーなインターフェースを提供する汎用版(SACRO)を委託しました。[ 23 ] SACROはstatbarnsモデルを直接実装しており、原則に基づいています。そのため、ユーザーが例外を要求したり、成果チェック担当者が自動化された推奨事項を上書きしたりできるため、「半自動」です。英国のすべての社会科学のセキュリティ施設と、英国のほとんどの公衆衛生のセキュリティ施設が、これを採用する予定です。
このソフトウェアはGitHub (https://github.com/AI-SDC )で入手可能で、オリジナルのACROへのリンクやAIモデルを評価するためのツールも含まれています。
{{citation}}: CS1メンテナンス: ISBNを使用した作業パラメータ (リンク)