データ編集は、収集された調査データのレビューと調整を伴うプロセスとして定義されます。[1]データ編集は、潜在的なバイアスを減らし、一貫性のある推定値を確保し、この記事の後半で説明する方法を使用して矛盾したデータを修正することでデータセットの明確な分析につながるガイドラインを定義するのに役立ちます。[2]目的は、収集されたデータの品質を管理することです。[3]データ編集は、手動でも、コンピューターの支援を受けても、またはその両方を組み合わせても実行できます。[4]
編集方法
編集方法とは、データ内のエラーを検出して処理するために使用される一連の手順とプロセスを指します。データ編集は、生成される統計データの品質を向上させる目的で使用されます。これらの変更により、エラーを検出して修正することを目指して作成される分析の品質を大幅に向上できます。マイクロ編集、マクロ編集、選択編集などのデータ編集のさまざまな手法、またはグラフィカル編集やインタラクティブ編集などのデータ編集を実現するために使用されるさまざまなツールの例。
インタラクティブ編集
インタラクティブ編集という用語は、現代のコンピュータ支援による手動編集によく使用されます。国立統計研究所 (NSI) で使用されているほとんどのインタラクティブ データ編集ツールでは、データ入力中または入力後に指定された編集内容を確認し、必要に応じて誤ったデータを直ちに修正できます。誤ったデータを修正するには、いくつかの方法があります。
- 回答者に再度連絡する
- 回答者のデータを前年のデータと比較する
- 回答者のデータを類似の回答者のデータと比較する
- 人間の編集者の主題知識を活用する
インタラクティブ編集は、データを編集するための標準的な方法です。カテゴリデータと連続データの両方を編集するために使用できます。[5]インタラクティブ編集により、レビューと調整の周期的なプロセスを完了するために必要な時間が短縮されます。[6]インタラクティブ編集では、データセットと、データ分析から得られる可能性のある結果を理解することも必要です。
選択編集
選択的編集とは、影響力のあるエラー[注 1]や外れ値[注 2]を特定するためのいくつかの方法の総称です。選択的編集技術は、インタラクティブ編集を厳選されたレコードのサブセットに適用し、インタラクティブ編集に利用できる限られた時間とリソースを、公表される数値の最終推定値の品質に最も影響を与えるレコードに割り当てることを目的としています。選択的編集では、データは 2 つのストリームに分割されます。
- 重要な流れ
- 非クリティカルストリーム
クリティカルストリームは、影響力のあるエラーを含む可能性が高いレコードで構成されています。これらのクリティカルレコードは、従来のインタラクティブな方法で編集されます。影響力のあるエラーを含む可能性が低い非クリティカルストリームのレコードは、コンピューター支援方式で編集されません。[7]
データ編集技術
データ編集はさまざまな方法で実行できますが、主に調査対象のデータセットによって異なります。[8]
データの有効性と完全性
データ セットの有効性は、回答者が提供する回答の完全性に依存します。データ編集の 1 つの方法は、数値または非数値の回答を必要とするフィールドのすべての回答が完全であることを確認することです。以下の例を参照してください。

重複データ入力
データが一意であることを確認することは、提供されたすべてのデータが 1 回だけ入力されたことを確認するためのデータ編集の重要な側面です。これにより、分析レポートを歪める可能性のある重複データの可能性が減ります。以下の例を参照してください。

外れ値
データ セットで外れ値が見つかることはよくあります。これは前述のように、データのモデルにうまく適合しない値です。これらの極端な値は、同じデータ セットの以前のデータ シリーズまたは並列データ シリーズのデータ ポイントの分布に基づいて見つけることができます。これらの値は誤りであると見なされる可能性があり、応答の有効性を確認して判断するにはさらに分析が必要です。以下の例を参照してください。

論理的矛盾
論理的一貫性とは、変数間に論理的な関係と相互依存性が存在することです。この編集には、データセットに関する一定の理解と、以前のレポートや情報に基づいてデータのエラーを識別する能力が必要です。このタイプのデータ編集は、データ フィールドまたは変数間の違いを説明するために使用されます。以下の例を参照してください。

マクロ編集
マクロ編集には2つの方法があります: [7]
集計方法
この方法は、ほとんどすべての統計機関が公表前に採用しているもので、公表する数字が妥当かどうかを検証するものである。これは、公表表の数量を以前の公表表の同じ数量と比較することによって行われる。異常な値が観察された場合、疑わしい数量に寄与する個々の記録とフィールドにマイクロ編集手順が適用される。[6]
配布方法
利用可能なデータは変数の分布を特徴付けるために使用されます。次に、すべての個々の値が分布と比較されます。(分布を考えると)珍しいと考えられる値を含むレコードは、さらに検査され、編集される可能性があります。[9]
自動編集
自動編集では、記録は人間の介入なしにコンピュータによって編集される。[10]単一の変数または変数の組み合わせの値に関する事前知識は、許容される値を指定または制限する編集ルールのセットとして定式化することができる。
データ編集の決定要因
データ編集には、特定の研究の能力とリソースによる限界があります。これらの決定要因は、データセットの事後分析にプラスまたはマイナスの影響を与える可能性があります。以下は、データ編集の決定要因のいくつかです。[8]
利用可能なリソース: [8]
- プロジェクトに割り当てられた時間
- お金と予算の制約
利用可能なソフトウェア: [8]
- データを分析するために使用するツール
- データセット内のエラーを特定するために利用できるツール
- データの目的や目標に応じてソフトウェアを即時利用可能
データソース: [8]
- 回答者が期待通りに回答できないこと
- 回答者からすぐに入手できない情報が不足している
- 大規模なデータプールではフォローアップを維持するのが難しい
データ編集手順の調整: [8]
- データセットに関する主観的な見解
- データの全体的な目的間の不一致
- データ編集の処理に使用される方法
参照
注記
- ^ 出版数に大きな影響を与える誤り
- ^ データのモデルにうまく適合しない値
参考文献
- ^ Ferguson, Dania P. 「データ編集プロセスの紹介」(PDF) . unece.org/ .
- ^ 「米国教育省の一部である国立教育統計センター(NCES)ホームページ」nces.ed.gov 。 2020年12月6日閲覧。
- ^ 「UNECE」.
- ^ 「統計:データからパワーを!データ編集」www150.statcan.gc.ca。
- ^ Waal, Ton de et al. 「統計データ編集および補完ハンドブック」 Wiley 出版、2011 年、p.15。
- ^ ab 「UNECE ホームページ」. www.unece.org。
- ^ ab Waal、Ton de 他「統計データ編集および補完ハンドブック」Wiley 出版、2011 年、p.16。
- ^ abcdef SCAD. "SCAD". SCAD . 2020年12月7日閲覧。
- ^ Bethlehem, J.「応用調査方法 統計的観点」Wiley 出版、2009 年、205 ページ。
- ^ Waal, Ton de et al. 「統計データ編集および補完ハンドブック」 Wiley 出版
