
データサイエンスは、統計学、科学計算、科学的手法、処理、科学的可視化、アルゴリズム、コーディング(Python、SQL、Rなど)、およびシステムを使用して、ノイズの多い可能性のある構造化データまたは非構造化データから知識を抽出または外挿する学際的な学術分野です[ 1 ] 。[ 2 ]データサイエンティストは、プログラミングコードを作成し、それを統計的知識と組み合わせてデータを要約する専門家です[ 3 ] 。
データサイエンスは、組織が大規模で複雑なデータセットから実用的な洞察を抽出できるようにすることで、現代の意思決定において重要な役割を果たしています。[ 4 ] データサイエンスは、基盤となるアプリケーションドメイン(自然科学、情報技術、医学など)のドメイン知識も統合します。[ 5 ]データサイエンスは多面的であり、科学、研究パラダイム、研究方法、学問分野、ワークフロー、専門職として説明できます。[ 6 ]
データサイエンスは、「統計学、データ分析、情報学、およびそれらに関連する手法を統合する概念」であり、データを用いて「実際の現象を理解し分析する」ものです。[ 7 ]数学、統計学、コンピュータサイエンス、情報科学、ドメイン知識の文脈で、多くの分野から引き出された技術と理論を使用します。[ 8 ]ただし、データサイエンスはコンピュータサイエンスや情報科学とは異なります。チューリング賞受賞者のジム・グレイは、データサイエンスを科学の「第4のパラダイム」(経験的、理論的、計算的、そして現在はデータ駆動型)と捉え、「情報技術の影響とデータの洪水によって、科学のすべてが変化している」と主張しました。[ 9 ] [ 10 ]
データサイエンスは、コンピュータサイエンス、統計学、情報科学、その他の専門分野など、多様な分野の技術を取り入れているため、学際的で急速に進化している分野としてよく説明されます。一部の研究者は、異なる分野の組み合わせは、数十年前の情報科学に似ていると主張しています。[ 11 ]これらの類似点は、データサイエンスがどのようにして徐々に独自の研究分野になったかを明確にするのに役立ちます。[ 11 ]
データサイエンスは、通常大規模なデータセットから知識を抽出し、そのデータから得られた知識を他のアプリケーション領域の問題を解決するために応用することに焦点を当てた学際的な分野です[ 12 ] 。この分野には、分析のためのデータの準備、データサイエンスの問題の定式化、データの分析、およびこれらの結果の要約が含まれます。そのため、コンピュータサイエンス、数学、データ視覚化、グラフィックデザイン、コミュニケーション、およびビジネスのスキルを取り入れています[ 13 ]。
Vasant Dhar は、統計学は定量的データと記述を重視すると書いています。対照的に、データ サイエンスは定量的データと定性的データ (画像、テキスト、センサー、トランザクション、顧客情報など) を扱い、予測とアクションを重視します。[ 14 ]コロンビア大学のAndrew Gelman は、統計学はデータ サイエンスの非必須部分であると述べています。[ 15 ]スタンフォード大学のDavid Donoho教授は、データ サイエンスはデータセットのサイズやコンピューティングの使用によって統計学と区別されるものではなく、多くの大学院プログラムが分析と統計のトレーニングをデータ サイエンス プログラムの本質として誤解を招くように宣伝していると書いています。彼は、データ サイエンスを伝統的な統計学から発展した応用分野であると説明しています。[ 16 ]
1962年、ジョン・テューキーは「データ分析」と呼ばれる分野について説明し、これは現代のデータサイエンスに似ている。[ 16 ] 1985年、北京の中国科学院で行われた講演で、C. F. ジェフ・ウーは統計学の別名として初めて「データサイエンス」という用語を使用した。[ 17 ]その後、1992年にモンペリエ 第2大学で開催された統計学シンポジウムの参加者は、さまざまな起源と形式のデータに焦点を当て、確立された統計学とデータ分析の概念と原理をコンピューティングと組み合わせた新しい学問分野の出現を認めた。[ 18 ] [ 19 ]
「データサイエンス」という用語は、1974 年にPeter Naur がコンピュータサイエンスの代替名として提案したことに遡ります。1974 年に出版された著書 Concise Survey of Computer Methods の中で、Peter Naur は、データ駆動型手法への重視の高まりを反映するために、「コンピュータサイエンス」ではなく「データサイエンス」という用語を使用することを提案しました[ 20 ] [ 8 ] 1996 年に、国際分類協会連合が、データサイエンスをトピックとして取り上げた最初の会議となりました[ 8 ]しかし、定義はまだ流動的でした。1985 年に北京の中国科学院で行われた講演の後、1997 年にC. F. Jeff Wu は再び統計学をデータサイエンスに改名すべきだと提案しました。彼は、新しい名前によって、統計学が会計と同義であるとか、データの記述に限定されているといった不正確なステレオタイプを払拭できると考えました。[ 21 ] 1998年、林智紀夫は、データサイエンスを、データ設計、収集、分析の3つの側面を持つ新しい学際的な概念として提唱した。[ 19 ]
2012年、技術者のトーマス・H・ダベンポートとDJ・パティルは「データサイエンティスト:21世紀で最もセクシーな仕事」[ 22 ]を宣言し、このキャッチフレーズはニューヨーク・タイムズ[ 23 ]やボストン・グローブ[ 24 ]といった大都市の新聞にも取り上げられた。10年後、彼らは「この仕事は雇用主の間でこれまで以上に需要が高い」と述べ、この主張を再確認した。[ 25 ]
データサイエンスを独立した学問分野として捉える現代的な概念は、ウィリアム・S・クリーブランドに由来するとされることがある。[ 26 ] 2014年、アメリカ統計学会の統計的学習およびデータマイニング部門は、データサイエンスの人気上昇を反映して、統計的学習およびデータサイエンス部門に名称を変更した。[ 27 ]
「データサイエンティスト」という専門職名は、2008年にDJ PatilとJeff Hammerbacherによって提唱されました。 [ 28 ] 2005年の米国科学財団の報告書「長期保存可能なデジタルデータコレクション:21世紀の研究と教育を可能にする」ではこの用語が使われていましたが、デジタルデータコレクションの管理におけるあらゆる重要な役割を広く指していました。[ 29 ]

データ分析では、通常、構造化されたデータセットを扱って、特定の質問に答えたり、特定の問題を解決したりします。これには、データの要約や変数間の関係についての仮説を立てるためのデータクリーニングやデータ視覚化などのタスクが含まれます。データアナリストは通常、統計的手法を使用してこれらの仮説を検証し、データから結論を導き出します。[ 30 ]
データサイエンスでは、多くの場合、高度な計算手法や統計的手法を用いて分析する必要のある大規模なデータセットを扱います。データサイエンティストは、テキストや画像などの非構造化データを扱い、機械学習アルゴリズムを使用して予測モデルを構築することがよくあります。データサイエンスでは、統計分析、データ前処理、教師あり学習がよく使用されます。[ 31 ] [ 32 ]

クラウドコンピューティングは、大量の計算能力とストレージへのアクセスを提供できます。[ 33 ]ビッグデータでは、大量の情報が継続的に生成および処理されるため、これらのプラットフォームは複雑でリソース集約型の分析タスクを処理するために使用できます。[ 34 ]
分散コンピューティングフレームワークの中には、ビッグデータワークロードを処理するように設計されているものがあります。これらのフレームワークを使用すると、データサイエンティストは大規模なデータセットを並列に処理および分析できるため、処理時間を短縮できます。[ 35 ]
データサイエンスは、個人情報や機密情報を含むデータの収集、処理、分析を伴います。倫理的な懸念事項としては、潜在的なプライバシー侵害、偏見の永続化、社会への悪影響などが挙げられます。[ 36 ] [ 37 ]
機械学習モデルは、トレーニングデータに存在する既存のバイアスを増幅し、差別的または不公平な結果につながる可能性があります。[ 38 ] [ 39 ]