
データ収集とは、確立されたシステム内の対象変数に関する情報を収集および測定する プロセスであり、それによって関連する質問に答え、結果を評価することが可能になります。データ収集は、物理科学、社会科学、人文科学、[ 2 ]、ビジネスなど、すべての研究分野における研究要素です。方法は分野によって異なりますが、正確かつ誠実な収集を確保するという点では変わりません。すべてのデータ収集の目標は、データ分析によって提起された質問に対する信頼できる回答を導き出すことができる証拠を収集することです。
データの定義方法(定量的か定性的か)や分野に関わらず、研究の信頼性を維持するためには、正確なデータ収集が不可欠です。適切なデータ収集ツール(既存のもの、改良したもの、または新たに開発されたもの)を選択し、その正しい使用方法を明確に定めることで、エラーの発生確率を低減できます。
データ収集と検証は、国勢調査の場合は4つのステップ、標本抽出の場合は7つのステップから構成される。[ 3 ]
正式なデータ収集プロセスは、収集されたデータが定義され、かつ正確であることを保証するため必要です。このようにして、調査結果に示された議論に基づくその後の決定は、有効なデータを使用して行われます。[ 4 ]このプロセスは、測定の基準となるベースラインを提供するとともに、場合によっては改善すべき点を示す指標にもなります。
データ管理プラットフォーム(DMP)は、主にマーケティング分野で使用される、データの一元的な保存および分析システムです。DMPは、大量の需要データと供給データを収集し、分かりやすい情報に変換するために存在します。マーケターは、ファーストパーティデータ、セカンドパーティデータ、サードパーティデータを取得して活用したいと考える場合があります。DMPは、 DSP(デマンドサイドプラットフォーム)とSSP(サプライサイドプラットフォーム)を統合したシステムであるため、これを可能にします。DMPは、広告キャンペーンの最適化と将来の展開に不可欠です。
データ整合性を維持する主な理由は、データ収集プロセスにおけるエラーの観察を支援するためです。これらのエラーは、意図的に(意図的な改ざん)発生する場合もあれば、意図せず(ランダムまたは系統的なエラー)発生する場合もあります。[ 5 ]
データの完全性を保護し、研究結果の科学的妥当性を確保する可能性のあるアプローチが 2 つあります。[ 6 ]
品質保証(QA)の重点は予防にあり、これは主にデータ収集の完全性を保護するための費用対効果の高い活動です。データ収集のための包括的かつ詳細な手順記述を含むプロトコルの標準化は、予防の中心となります。研究プロセスにおける問題やエラーの特定に失敗するリスクは、多くの場合、ガイドラインの記述が不十分であることに起因します。以下に、そのような失敗例をいくつか挙げます。
クラウドコンピューティングによって収集される個々のユーザーデータの完全性については深刻な懸念がある。なぜなら、このデータは、個々のユーザーデータの保護基準が異なる国々をまたいで転送されるからである。[ 7 ]情報処理は、ユーザーデータを使用して、個人が話す前に何を言っているかを予測できるレベルにまで進歩した。[ 8 ]
品質管理(QC)活動はデータ収集中またはデータ収集後に行われるため、すべての詳細を綿密に記録することができます。監視システムを確立するための前提条件として、明確に定義されたコミュニケーション構造が必要です。情報の流れに関する不確実性は推奨されません。なぜなら、組織化されていないコミュニケーション構造は監視の緩慢化につながり、エラー検出の機会を制限する可能性があるからです。品質管理は、不適切なデータ収集方法を修正し、将来同様の事態が発生するのを最小限に抑えるために必要な措置を特定する責任も負っています。手順が曖昧に記述され、フィードバックや教育に基づいていない場合、チームはこれらの措置を実行する必要性を認識しない可能性が高くなります。
迅速な対応が必要なデータ収集上の問題点: