生物学的データとは、生物およびその産物から得られる化合物または情報を指します。血清やワクチンなど、生物から作られた医薬化合物は、生物学的データとして特徴付けられます。生物学的データは、他の形式のデータと比較すると非常に複雑です。生物学的データには、テキスト、配列データ、タンパク質構造、ゲノムデータ、アミノ酸、リンクなど、さまざまな形式があります。

生物学的データとバイオインフォマティクス
生物学的データは、膨大な量のゲノムデータを分析および解釈する必要性に対処することに重点を置いた最近の分野である バイオインフォマティクスと密接に連携しています。
過去数十年にわたるゲノム研究の飛躍的な進歩により、膨大な量の生物学的データが生成されました。その結果、生物学的データに重点を置きながら、ゲノミクス、バイオテクノロジー、情報技術を融合したバイオインフォマティクスが誕生しました。
バイオインフォマティクスは広範囲にわたる分野であるため、生物学的データも定義が困難でした。さらに、「生きている」という言葉は分子進化、生物学的モデリング、生物物理学、システム生物学を含む漠然とした用語であるため、生物を構成する要素についての疑問は議論を呼んでいます。過去 10 年以降、バイオインフォマティクスと生物学的データの分析は、データの管理と解釈に必要な技術の飛躍的な進歩の結果として盛んになってきました。バイオインフォマティクスと生物学的データの取得、転送、および活用に社会がますます集中するようになったため、現在、バイオインフォマティクスは盛んな分野となっています。
生物学的データの種類
生物学的データは、オミクス、バイオイメージング、医療用画像処理の分野で利用するために抽出することができます。生命科学者は、生体の分子の詳細を提供する生物学的データを高く評価しています。DNA配列決定、遺伝子発現(GE)、バイオイメージング、神経イメージング、脳と機械のインターフェースのためのツールはすべて、生物学的データを活用し、高次元の生物学的システムをモデル化する領域です。[1]
さらに、生の生物学的配列データは通常、DNA、RNA、アミノ酸を指します。[1]
生物学的データは、生物学的実体に関するデータとも言える。[2]たとえば、配列、グラフ、幾何学的情報、スカラー場とベクトル場、パターン、制約、画像、空間情報などの特性は、生物の特徴を記述するものであるため、生物学的データとして特徴付けられる。多くの場合、生物学的データはこれらのカテゴリのいくつかに関連付けられている。たとえば、国立衛生研究所の「コンピューティングと生物学のインターフェースにおける探究の促進」に関する報告書に記載されているように、タンパク質構造は、1次元配列、2次元画像、3次元構造などに関連付けられることがある。[2]

生物医学データベース
生物医学データベースは、電子健康記録(EHR)のデータベース、分散型連邦データベースシステム内のゲノムデータ、大規模な臨床研究から収集されたゲノムデータを含む生物学的データと呼ばれることが多い。 [3] [4]
バイオハッキングとプライバシーの脅威
バイオハッキング
バイオコンピューティング攻撃は、一般的なツールを使用することで、攻撃者が生物学的情報を合成し、DNA分析から情報を盗み出すことができる可能性があることが最近の研究で示されているため、より一般的になっています。 [5]法医学、臨床研究、ゲノミクスなどの分野でDNA分析の一般化が進むにつれて、バイオハッキングの脅威はより顕著になっています。
バイオハッキングは、悪意のあるDNAを合成し、それを生物学的サンプルに挿入することで実行できます。研究者は、ハッカーが実験着、ベンチ、ゴム手袋などの一般的な表面に悪意のあるDNAを隠して生物学的サンプルに到達し、遺伝子データを汚染するなど、バイオハッキングの脅威を示すシナリオを確立しました。[5]
しかし、バイオハッキングの脅威は、従来のインジェクション攻撃の防止に使用される同様の技術を使用することで軽減できる可能性があります。臨床医や研究者は、生物学的サンプルから遺伝情報を抽出し、サンプルを比較して未知の物質を特定することで、バイオハッキングを軽減できます。研究によると、遺伝情報と生物学的サンプルを比較してバイオハッキングコードを特定すると、バイオハッキング攻撃における悪意のあるDNA挿入を検出するのに最大95%の効果があることが示されています。[5]
個人データとしての遺伝子サンプル
ゲノム研究におけるプライバシーに関する懸念は、ゲノムサンプルに個人データが含まれているかどうか、またはゲノムサンプルを物理的物質と見なすべきかどうかという概念をめぐって生じている。[6]さらに、一部の国ではゲノムデータを個人データとして認識し(データ保護規則を適用している)、他の国ではサンプルを物理的物質と見なし、ゲノムサンプルには同じデータ保護法を適用していないことからも懸念が生じている。近々施行される一般データ保護規則(GDPR )は、バイオバンキングやゲノム研究におけるプライバシー規制をより適切に施行する可能性のある法的手段として挙げられている。[6]
しかし、GDPRの条文における「個人データ」の定義、特に生物学的データに関する定義が曖昧であるため、遺伝子サンプルに対して規制が施行されるかどうか疑問が生じている。第4条(1)では、個人データは「特定された、または特定可能な自然人(「データ主体」)に関するあらゆる情報」と定義されている[7]。
深層学習の生物学的データへの応用
データサイエンスと計算能力の急速な進歩の結果、生命科学者は、ディープラーニング(DL)、強化学習(RL)、およびそれらの組み合わせ(ディープRL)などのデータ集約型機械学習手法を生物学的データに適用できるようになりました。これらの手法は、データストレージとコンピューティングの増加と相まって、生命科学者が生物学的データをマイニングし、以前は大きすぎたり複雑すぎたりしたデータセットを分析することを可能にしています。ディープラーニング(DL)と強化学習(RL)は、オミクス研究の分野で使用されています[1](ゲノミクス、プロテオミクス、またはメタボロミクスを含む)。通常、生の生物学的配列データ(DNA、RNA、アミノ酸など)が抽出され、生物学的データから特徴、機能、構造、および分子ダイナミクスを分析するために使用されます。その時点から、GEプロファイリングスプライシングジャンクション予測やタンパク質間相互作用評価など、さまざまな分析を実行できます。[1]
強化学習は行動心理学に由来する用語で、試行錯誤を通じて学習することで問題を解決する手法です。強化学習は、オミクスの分野で、RLを使用して細菌ゲノムを予測することで、生物学的データに適用できます。[8]
他の研究では、強化学習は生物学的配列の注釈を正確に予測するために使用できることが示されています。[9]
ディープラーニング(DL)アーキテクチャは、生物学的データのトレーニングにも役立ちます。たとえば、生物学的画像のピクセルレベルをターゲットとするDLアーキテクチャは、乳房の組織学的画像における有糸分裂のプロセスを識別するために使用されています。DLアーキテクチャは、乳がん細胞の画像における核の識別にも使用されています。[10]
バイオメディカル情報学におけるデータマイニングの課題
複雑
バイオメディカルデータモデルが直面する主な問題は、通常、複雑さです。臨床現場やバイオメディカル研究に携わる生命科学者は、情報過多の可能性に直面しています。しかし、情報過多は医療分野でしばしば議論される現象です。[11]計算の進歩により、異なる哲学の下で別々のコミュニティが形成されるようになりました。たとえば、データマイニングと機械学習の研究者は、生物学的データ内の関連パターンを検索しますが、そのアーキテクチャは人間の介入に依存しません。ただし、エンドユーザーの理解や制御などの人間の介入が減ると、成果物をモデル化する際にリスクが伴います。[12]
研究者らは、医療費の増加と活用されていない膨大なデータの存在により、医療情報技術が医療の効率と質を向上させる鍵となる可能性があると指摘している。[11]
データベースのエラーと不正使用
電子健康記録(EHR)には何百万人もの患者のゲノムデータが含まれる可能性があり、これらのデータベースの作成は賞賛と懸念の両方をもたらしました。[4]
法学者は、生物医学データベースに関連する訴訟の増加について、3つの主な懸念を指摘している。第一に、生物医学データベースに含まれるデータは不正確または不完全である可能性がある。第二に、研究者の偏見や生物学的データの性質から生じる体系的な偏見が、研究結果の妥当性を脅かす可能性がある。第三に、生物学的データベースにデータマイニングが存在すると、政治的、社会的、または経済的アジェンダを持つ個人が研究結果を操作して世論を左右することが容易になる可能性がある。[13] [4]
データベースの不正使用の例としては、2009年に精神医学研究ジャーナルが中絶と精神障害を関連付けた研究を発表したことがあります。[14]この研究の目的は、中絶歴と不安障害(パニック障害、PTSD、広場恐怖症など)などの精神障害、および薬物乱用障害や気分障害との関連性を分析することでした。
しかし、2012年に科学者が研究方法を精査し、重大な欠陥があることが判明したため、この研究は信用を失った。[15]研究者らは「生殖歴とメンタルヘルスの変数を含む全国データセット」 [14]を使用して調査結果を作成した。しかし、研究者らは、計画外の妊娠を経験し中絶した女性と中絶しなかった女性のグループを比較しておらず、中絶後に発生した精神疾患に焦点を当てていた。その結果、科学的信頼性を与えるように見えた調査結果により、長期的なメンタルヘルスへの影響の可能性があるため、中絶前にカウンセリングを受けることを女性に義務付ける法律[16]がいくつかの州で制定された。
ニューヨークタイムズに掲載された別の記事では、電子医療記録(EHR)システムが医師によって操作され、メディケアの払い戻しの目的で提供した治療の量を誇張する可能性があることを示しました。[17] [4]
.pdf/page1-440px-IN10235_Anthem_Data_Breach_How_Safe_Is_Health_Information_Under_HIPAA_(IA_IN10235AnthemDataBreachHowSafeIsHealthInformationUnderHIPAA-crs).pdf.jpg)
バイオメディカルデータの共有
生物医学データの共有は、研究の再現性と科学的発見を高める効果的な方法として宣伝されてきた。[13] [18]
研究者がデータ共有における技術的な問題に苦労している一方で、社会的問題も生物学的データ共有の障壁となっている。例えば、臨床医や研究者は、医療コミュニティ内で生物学的データや健康データを共有する上で、プライバシーに関する懸念やHIPAAなどの患者のプライバシー保護法など、特有の課題に直面している。[19]
データ共有に対する姿勢
臨床医と科学研究スタッフの実践態度に焦点を当てた2015年の研究[19]によると、回答者の大多数はデータ共有が仕事にとって重要であると回答したが、その主題に関する専門知識は低いことを示していた。調査の回答者190人のうち、135人が臨床または基礎研究者であると自認しており、調査対象者には国立衛生研究所の研究所内研究プログラムの臨床および基礎研究者が含まれていた。この研究ではまた、回答者の間では他の臨床医とデータを直接共有することは一般的な慣行であるが、研究対象者はデータをリポジトリにアップロードする慣行がほとんどないことも明らかになった。
生物医学研究の分野では、個別化医療や精密医療のメリットを最大限に引き出すために研究者がデータを共有し再利用するための重要な方法として、データ共有が推進されてきました[ 20] 。[19]
データ共有の課題
医療におけるデータ共有は、いくつかの理由から依然として課題となっている。医療におけるデータ共有に関する研究は進んでいるものの、多くの医療機関は、医療保険の携行性と責任に関する法律(HIPAA)などのプライバシー法を理由に、医療データを公開することに消極的または消極的である。さらに、機関間で生物学的データを共有するには、複数の組織にまたがる可能性があるデータの機密性を保護する必要がある。多様なプライバシー要件を満たしながらデータの構文と意味の異質性を実現することは、すべてデータ共有の障壁となる要因である。[21]
参考文献
- ^ abcd Mahmud, Mufti; Kaiser, Mohammed Shamim; Hussain, Amir; Vassanelli, Stefano (2018 年 6 月). 「ディープラーニングと強化学習の生物学的データへの応用」. IEEE Transactions on Neural Networks and Learning Systems . 29 (6): 2063– 2079. doi :10.1109/tnnls.2018.2790388. hdl : 1893/26814 . ISSN 2162-237X. PMID 29771663. S2CID 9823884.
- ^ ab Wooley, John C.; Lin, Herbert S.; 生物学、米国国立研究会議(National Research Council)コンピューティングおよびコンピューティング界面のフロンティアに関する委員会(2005年)。生物学的データの性質について。米国アカデミー出版局(米国)。
- ^ Nadkarni, PM; Brandt, C.; Frawley, S.; Sayward, FG; Einbinder, R.; Zelterman, D.; Schacter, L.; Miller, PL (1998-03-01). 「ACT/DB クライアント サーバー データベース システムを使用した属性値臨床試験データの管理」. Journal of the American Medical Informatics Association . 5 (2): 139– 151. doi :10.1136/jamia.1998.0050139. ISSN 1067-5027. PMC 61285. PMID 9524347 .
- ^ abcd Hoffman, Sharona; Podgurski, Andy (2013). 「バイオメディカルデータの使用と誤用:大きいほど良いのか?」American Journal of Law & Medicine . 39 (4): 497– 538. doi :10.1177/009885881303900401. ISSN 0098-8588. PMID 24494442. S2CID 35371353.
- ^ abc Islam, Mohd Siblee; Ivanov, S.; Robson, E.; Dooley-Cullinane, T.; Coffey, L.; Doolin, K.; Balasubramaniam, S. (2019). 「DNAシーケンシング機能のバイオハッキングに対抗するための生物学的サンプルの遺伝的類似性」. Scientific Reports . 9 (1): 8684. Bibcode :2019NatSR...9.8684I. doi :10.1038/s41598-019-44995-6. PMC 6581904. PMID 31213619. S2CID 190652460 .
- ^ ab Hallinan, Dara; De Hert, Paul (2016), Mittelstadt, Brent Daniel; Floridi, Luciano (eds.)、「多くの人が間違っている - サンプルには個人データが含まれている:バイオバンキングとゲノム研究におけるドナーの利益を保護するための優れたフレームワークとしてのデータ保護規則」、バイオメディカルビッグデータの倫理、法律、ガバナンス、テクノロジーシリーズ、第29巻、Cham:Springer International Publishing、pp. 119– 137、doi:10.1007/978-3-319-33525-4_6、ISBN 978-3-319-33525-4、 2020年12月9日取得
- ^ 「Statewatch.org」(PDF) . StateWatch.org . 2015年7月3日閲覧。
- ^ Chuang, Li-Yeh; Tsai, Jui-Hung; Yang, Cheng-Hong (2010 年 7 月). 「オペロン予測のためのバイナリ粒子群最適化」. Nucleic Acids Research . 38 (12): e128. doi :10.1093/nar/gkq204. ISSN 0305-1048. PMC 2896535. PMID 20385582 .
- ^ Ralha, CG; Schneider, HW; Walter, MEMT; Bazzan , AL (2010 年 10 月)。「バイオエージェントの強化学習法」。2010年第 11 回ブラジル ニューラル ネットワーク シンポジウム。pp. 109– 114。doi :10.1109/ SBRN.2010.27。ISBN 978-1-4244-8391-4. S2CID 14685651。
- ^ Xu, Jun; Xiang, Lei; Liu, Qingshan; Gilmore, Hannah; Wu, Jianzhong; Tang, Jinghai; Madabhushi, Anant (2016 年 1 月). 「乳がん組織病理画像における核検出のためのスタック スパース オートエンコーダー (SSAE)」. IEEE Transactions on Medical Imaging . 35 (1): 119– 130. doi :10.1109/TMI.2015.2458702. ISSN 0278-0062. PMC 4729702. PMID 26208307 .
- ^ ab Holzinger, Andreas; Jurisica, Igor (2014)、Holzinger, Andreas; Jurisica, Igor (編)、「バイオメディカル インフォマティクスにおける知識発見とデータ マイニング: 将来は統合的でインタラクティブな機械学習ソリューションにあります」、インタラクティブなバイオメディカル インフォマティクスにおける知識発見とデータ マイニング: 最新技術と将来の課題、Lecture Notes in Computer Science、vol. 8401、ベルリン、ハイデルベルク: Springer、pp. 1– 18、doi :10.1007/978-3-662-43968-5_1、ISBN 978-3-662-43968-5、 2020年12月9日取得
- ^ Shneiderman, Ben (2002 年 3 月). 「発見ツールの発明: 情報視覚化とデータマイニングの結合」.情報視覚化. 1 (1): 5– 12. doi :10.1057/palgrave.ivs.9500006. hdl : 1903/6484 . ISSN 1473-8716. S2CID 208272047.
- ^ ab Mittelstadt, Brent Daniel; Floridi, Luciano (2016年4月). 「ビッグデータの倫理:バイオメディカルコンテキストにおける現在の問題と予測可能な問題」.科学と工学の倫理. 22 (2): 303– 341. doi :10.1007/s11948-015-9652-2. ISSN 1471-5546. PMID 26002496. S2CID 23142795.
- ^ ab Coleman, Priscilla K.; Coyle, Catherine T.; Shuping, Martha; Rue, Vincent M. (2009年5月)。「人工妊娠中絶と不安、気分、物質乱用障害:全国併存疾患調査における妊娠中絶の影響の特定」。Journal of Psychiatric Research。43 ( 8): 770– 776。doi : 10.1016/ j.jpsychires.2008.10.009。ISSN 1879-1379。PMID 19046750 。
- ^ Kessler, Ronald C.; Schatzberg, Alan F. (2012年3月). 「SteinbergとFiner (Social Science & Medicine 2011; 72:72–82)とColeman (Journal of Psychiatric Research 2009;43:770–6 & Journal of Psychiatric Research 2011;45:1133–4)による中絶研究に関する論評」Journal of Psychiatric Research . 46 (3): 410– 411. doi :10.1016/j.jpsychires.2012.01.021.
- ^ 「中絶のカウンセリングと待機期間」Guttmacher Institute 2016年3月14日2020年12月9日閲覧。
- ^ アベルソン・リード、クレスウェル・ジュリー、パーマー・グリフ(2012年9月22日)。「記録の電子化に伴いメディケアの請求額が増加(2012年発行)」ニューヨーク・タイムズ。ISSN 0362-4331 。2020年12 月9日閲覧。
- ^ Kalkman, Shona; Mostert, Menno; Gerlinger, Christoph; van Delden, Johannes JM; van Thiel, Ghislaine JMW (2019年3月28日). 「国際保健研究における責任あるデータ共有:原則と規範の体系的レビュー」. BMC Medical Ethics . 20 (1): 21. doi : 10.1186/s12910-019-0359-9 . ISSN 1472-6939. PMC 6437875. PMID 30922290 .
- ^ abc Federer, Lisa M.; Lu, Ya-Ling; Joubert, Douglas J.; Welsh, Judith; Brandys, Barbara (2015-06-24). Kanungo, Jyotshna (ed.). 「バイオメディカルデータの共有と再利用:臨床および科学研究スタッフの態度と実践」. PLOS ONE . 10 (6): e0129506. Bibcode :2015PLoSO..1029506F. doi : 10.1371/journal.pone.0129506 . ISSN 1932-6203. PMC 4481309 . PMID 26107811.
- ^ Shneiderman, Ben (2016-07-21). 「発見ツールの発明: 情報視覚化とデータマイニング1の結合」.情報視覚化. 1 : 5–12 . doi :10.1057/palgrave.ivs.9500006. hdl : 1903/6484 . S2CID 208272047.
- ^ Wimmer, Hayden; Yoon, Victoria Y.; Sugumaran, Vijayan (2016-08-01). 「データ共有とデータプライバシーを介してエビデンスに基づく医療と臨床意思決定をサポートするマルチエージェントシステム」.意思決定支援システム. 88 : 51–66 . doi :10.1016/j.dss.2016.05.008. ISSN 0167-9236.
