ビッグデータ倫理(単にデータ倫理とも呼ばれる)とは、データ、特に個人データに関連する正しい行動と間違った行動の概念を体系化し、擁護し、推奨することを指します。[ 1 ]インターネットの黎明期以来、データの量と質は劇的に増加し、指数関数的に増加し続けています。ビッグデータとは、膨大な量と複雑さを持つため、従来のデータ処理アプリケーションソフトウェアでは処理しきれない大量のデータを指します。ハイスループットゲノムシーケンス、高解像度イメージング、電子カルテ、多数のインターネット接続型医療機器など、医療研究とヘルスケアにおける最近のイノベーションは、近い将来エクサバイト規模に達するデータ洪水を引き起こしています。データ倫理は、その影響の規模の大きさから、データ量の増加に伴い重要性を増しています。
ビッグデータ倫理は情報倫理とは異なります。情報倫理は知的財産の問題や図書館員、アーカイブ担当者、情報専門家に関する懸念事項に重点を置いているのに対し、ビッグデータ倫理はデータブローカー、政府、大企業など、構造化データまたは非構造化データの収集者や配布者に重点を置いているからです。しかし、人工知能や機械学習システムはビッグデータセットを使用して構築されることが多いため、データ倫理に関する議論は人工知能の倫理に関する議論と密接に結びついています。[ 2 ]最近では、応用数学や工学の多くの分野でますます大規模なデータセットが使用されるようになったため、ビッグデータ倫理の問題は、数学倫理や工学倫理など、技術や科学倫理の他の分野との関連でも研究されています。
データ倫理は、以下の原則に関係しています。[ 3 ]
データの所有権には、個人のデジタルアイデンティティを構成する個人データに対する個人の制御(共有の制限を含む)を行う能力など、財産に対する権利と義務を決定することが含まれます。データの所有権の問題は、誰かが個人に関する観察を記録するときに発生します。観察者と観察された側の両方がデータに対する権利を主張します。また、観察者と観察された側が互いに負う責任についても問題が生じます。インターネットが人々とその思考の観察の規模と体系化を拡大するにつれて、これらの問題はますます重要になっています。個人データの所有権の問題は、企業の所有権と知的財産の問題に関連しています。[ 4 ]
欧州連合では、一般データ保護規則は個人が自身の個人データを所有することを示していると主張する人もいるが、これは議論の的となっている。[ 5 ]
アルゴリズム設計にバイアスが組み込まれ、意識的か無意識的かを問わず体系的な抑圧につながる可能性について懸念が提起されている[ 6 ]。こうした操作は、多くの場合、データ、アルゴリズムの設計、またはそれらを展開する組織の根本的な目標におけるバイアスに起因する。アルゴリズムバイアスの主な原因の1つは、アルゴリズムが過去のデータから学習し、既存の不平等を永続させる可能性があることである。多くの場合、アルゴリズムは、疎外されたコミュニティや代表性の低いコミュニティの個人に適用された場合、精度が低下する。その顕著な例はパルスオキシメトリーであり、これらの集団に関する十分なテストや情報が不足しているため、特定の人口統計グループでは信頼性が低下することが示されている[ 7 ] 。さらに、多くのアルゴリズムは、倫理的な影響を十分に考慮せずに、エンゲージメントや利益などの特定の指標を最大化するように設計されています。たとえば、FacebookやTwitterのような企業は、嫌がらせをする人に匿名性を提供し、ユーモアを装った人種差別的なコンテンツが蔓延することを許容しているとして批判されている。こうしたコンテンツはエンゲージメントを高めることが多い。[ 8 ]これらの課題は、多くのアルゴリズムが企業秘密のために「ブラックボックス」として動作し、その出力の背後にある推論がユーザーに完全には理解されていないという事実によってさらに複雑化しています。この不透明性により、アルゴリズムの偏りを特定して対処することがより困難になります。
ガバナンスの観点から見ると、ビッグデータ倫理は、アルゴリズムなどのビッグデータ技術を使用してどのような種類の推論や予測を行うべきかに関係している。[ 9 ]
予測型ガバナンスとは、予測分析を用いて将来起こりうる行動を評価する手法である。 [ 10 ]これは、特定の集団や場所を標的にすることができ、偏見や差別を助長する可能性があるため、倫理的な意味合いを持つ。[ 10 ]例えば、予測型警察活動は、他の集団や地域よりも注意深く監視すべき特定の集団や地域を特定し、これらの地域でより多くの制裁措置が取られ、制裁を受けた者と同じプロファイルに該当する者に対する監視が強化される。[ 11 ]
「コントロールクリープ」という用語は、特定の目的のために生成されたデータが、別の目的に転用されることを指します。[ 10 ]この慣行は、空港でのセキュリティリスクのプロファイリングと管理のために転用された航空業界のデータに見られます。[ 10 ]
プライバシーは、データ利用の制限として提示されてきましたが、これは非倫理的であるとも考えられています。[ 12 ]例えば、医療データの共有は、病気の原因や治療の効果を明らかにし、個人のニーズに基づいたカスタマイズされた分析を可能にします。[ 12 ]これは、ビッグデータ倫理の分野では倫理的に重要です。なぜなら、多くの人がプライバシーを重視する一方で、データ共有の利便性も非常に価値があり、プライバシーの概念と矛盾する可能性があるからです。データ共有に対する態度は、データに対する制御の喪失と個人データの悪用への恐怖に基づいている可能性があります。[ 12 ]しかし、プライバシーを侵害することなくデータの価値を引き出すことは可能です。
政府によるビッグデータの監視は、電話、インターネット活動、位置情報などのデータを収集・保存することで、個人のプライバシーを侵害する可能性がある。例えば、NSAによるメタデータの収集が世界的な監視活動の開示で明らかになったことで、通信内容が分析されない場合でもプライバシーが適切に保護されているかどうかについて懸念が生じた。プライバシー権は、政府に「国家安全保障」目的でのデータ収集に関する広範な権限を与える法的枠組みによって複雑化されることが多い。米国では、最高裁判所は「情報プライバシー」、つまり個人情報に対する管理権という一般的な権利を認めていないが、立法者は特定の法律を通じてこの問題に選択的に対処してきた。[ 13 ]公平性の観点から見ると、政府による監視とプライバシー侵害は、社会的に疎外されたコミュニティに不均衡な被害を与える傾向がある。歴史的に、公民権運動に関わった活動家は、破壊分子とみなされたため、政府の監視の標的となることが多かった。COINTELPROのようなプログラムは、公民権運動の指導者に対するスパイ活動を含むこのパターンを典型的に示している。このパターンは今日でも続いており、活動家や組織に対する継続的な監視の証拠がある。[ 14 ]
さらに、政府が同意なしに取得したデータに基づいて行動するためにアルゴリズムを使用することは、アルゴリズムの偏りに関する重大な懸念を引き起こします。たとえば、予測型警察ツールは、過去の犯罪データを使用して「危険な」地域や個人を予測しますが、これらのツールは少数派コミュニティを不均衡に標的にしていることが示されています。[ 15 ]そのようなツールの1つであるCOMPASシステムは、注目すべき例です。黒人被告は白人被告と比較して、高リスクと誤分類される可能性が2倍高く、ヒスパニック系被告も同様に白人被告と比較して高リスクと分類される可能性が高くなっています。[ 16 ]疎外されたコミュニティは、これらのプライバシー侵害に異議を唱えたり、同意なしにデータが使用されるのを防ぐために必要なリソースや教育を欠いていることがよくあります。さらに、「萎縮効果」として知られる心理的負担があり、監視されているという絶え間ない意識は、すでに社会的差別を受けているコミュニティに不均衡な影響を与えます。この効果は、抗議活動や法的支援の要請など、合法ではあるものの潜在的に「危険」を伴う活動への参加を個人に躊躇させ、彼らの自由をさらに制限し、既存の不平等を悪化させる可能性がある。
ジョナサン・H・キングやニール・M・リチャーズといった学者の中には、プライバシーの伝統的な意味を再定義している者もいれば、プライバシーがまだ存在するのかどうか疑問を呈している者もいる。[ 9 ]ウェイクフォレスト・ロー・レビューの2014年の記事で、キングとリチャーズは、デジタル時代のプライバシーは秘密主義ではなく、個人情報の使用を規制し管理する規則という観点から理解できると主張している。[ 9 ]欧州連合では、忘れられる権利により、EU加盟国は、情報が無関係または古くなっているとみなされた場合、個人の要求に応じてデータベースから個人データを削除またはリンク解除する権利を有する。[ 17 ]アンドリュー・ホスキンズによれば、この法律は、デジタル時代におけるプライバシーの喪失と個人データを管理する能力に対するEU加盟国の道徳的パニックを示している。[ 18 ]米国では、市民は自発的に提出したデータを削除する権利を有する。[ 17 ]これは忘れられる権利とは大きく異なります。なぜなら、ビッグデータ技術やプラットフォームを使用して生成されるデータの多くは、自発的に提供されたものではないからです。[ 17 ]従来のプライバシーの概念が精査されている一方で、EUと米国のプライバシーに関するさまざまな法的枠組みは、各国がビッグデータの文脈でこれらの懸念にどのように取り組んでいるかを示しています。たとえば、EUの「忘れられる権利」と米国の自発的に提供されたデータを削除する権利は、デジタル時代のプライバシー規制に対するさまざまなアプローチを示しています。[ 19 ]
テクノロジー企業が提供するサービスの価値と、これらのテクノロジー企業の株式価値との差は、市民に提示される交換レートと、市民のデータの価値の「市場レート」との差です。科学的には、この基本的な計算には多くの欠陥があります。脱税企業の財務数値は信頼できない、収益または利益の方が適切かもしれない、ユーザーをどのように定義するか、データが価値を持つためには多数の個人が必要、異なる国で異なる人に対して段階的な価格設定が可能である、などです。これらの計算は粗雑ですが、データの金銭的価値をより具体的に示すのに役立ちます。別のアプローチは、闇市場でのデータ取引レートを見つけることです。RSAは、このアプローチを採用したサイバーセキュリティの年間ショッピングリストを公開しています。[ 20 ]
これは、個人データと引き換えに無料の技術サービスを提供することが、消費者にとって有益な暗黙の交換であるかどうかという経済的な問題を提起する。個人データ取引モデルでは、企業がデータを販売するのではなく、所有者が自分の個人データを販売して利益を得ることができる。[ 21 ]
オープンデータの概念は、データは自由に利用可能であるべきであり、著作権法などの利用を禁止する制限があってはならないという主張を中心に据えている。2014年現在多くの政府は、透明性と説明責任を目的として、オープンデータセットの公開に向けて動き始めていた。[ 22 ]この動きは、「オープンデータ活動家」によって勢いを増しており、彼らは政府に対し、国民が自らデータから意味を抽出し、自らチェックアンドバランスを実行できるようにデータセットを公開するよう求めている。[ 22 ] [ 9 ]キングとリチャーズは、この透明性の要求には、公開性と秘密主義の間の緊張関係が含まれていると主張している。[ 9 ]
活動家や学者たちは、このオープンソースのデータ評価モデルは自発的な参加に基づいているため、オープンデータセットの利用可能性は社会に民主化効果をもたらし、あらゆる市民が参加できるようになると主張している。[ 23 ]一部の人々にとって、特定の種類のデータの利用可能性は権利であり、市民の主体性の不可欠な部分と見なされている。[ 23 ]
オープンナレッジ財団(OKF)は、政府が真にオープンであるために提供すべきデータセットの種類をいくつか挙げています。[ 24 ] OKFは、オープン定義に基づいて政府のオープン性を測定するためのクラウドソーシング調査であるグローバルオープンデータインデックス(GODI)と呼ばれるツールを持っています。 [ 24 ] GODIは、政府にオープンデータセットの質に関するフィードバックを提供するツールとなることを目指しています。[ 25 ]
データ共有の意欲は人によって異なります。データ共有の意欲の決定要因に関する予備的な研究が行われてきました。例えば、ベビーブーマー世代はミレニアル世代よりもデータ共有に消極的であると示唆する研究もあります。[ 26 ]
2013年のエドワード・スノーデンによる暴露は、データ収集とビッグデータ倫理のプライバシー原則に関する世論を大きく変えた。この事件は、政府がこれまで考えられていたよりもはるかに多くの市民に関する情報を管理・保有しており、所有権の原則に違反していることを明らかにした。特に、恵まれないコミュニティに不均衡な影響を与えていた。例えば、ウォール街占拠運動やブラック・ライブズ・マターなどの運動のメンバーを含む活動家が頻繁に標的にされた。[ 14 ]この暴露を受けて、政府や組織は、個人のプライバシーをより良く保護しつつ国家安全保障上の懸念にも対処するために、データ収集と保存の慣行を見直すようになった。この事件はまた、他国とその国民に対する広範なオンライン監視を明らかにし、データ主権と所有権に関する重要な問題を提起した。これに対し、ブラジルやドイツなどの一部の国は、こうした慣行に対抗する行動を起こした。[ 14 ]しかし、多くの発展途上国は、必要な技術的独立性を欠いていたり、監視している国に過度に依存していたりして、こうした監視に抵抗することができず、これらの懸念に対処する上で不利な立場に置かれていた。
ケンブリッジ・アナリティカのスキャンダルは、ビッグデータの利用における重大な倫理的問題を浮き彫りにしました。約8,700万人のFacebookユーザーから明示的な同意なしにデータが収集され、ターゲットを絞った政治広告の表示に使用されました。これは、個人が当初、自分のデータがどのように悪用されているかを知らなかったため、ビッグデータ倫理の通貨原則に違反しました。このスキャンダルは、ある目的で収集されたデータが、ユーザーの同意を迂回して全く異なる用途に転用される可能性があることを明らかにし、データ利用における明示的かつ十分な情報に基づいた同意の必要性を強調しました。[ 27 ]さらに、広告配信に使用されるアルゴリズムは不透明であり、取引の透明性とオープン性の原則に疑問を投げかけました。場合によっては、政治広告は誤情報を拡散し、[ 27 ]不利な立場にあるグループを不均衡にターゲットにし、知識のギャップを助長しました。疎外されたコミュニティやデジタルリテラシーの低い個人は、悪用を認識したり、それに対して行動したりする可能性が低いため、不均衡に影響を受けました。対照的に、より多くのリソースやデジタルリテラシーを持つユーザーは、自身のデータをより適切に保護できるため、既存の権力格差をさらに悪化させる可能性がある。