統計学において、補完とは、欠損データを代替値で置き換えるプロセスです。データポイントを置き換える場合は「単位補完」、データポイントの構成要素を置き換える場合は「項目補完」と呼ばれます。欠損データには主に3つの問題があります。欠損データは、かなりの量のバイアスを導入する可能性があり、データの処理と分析をより困難にし、効率を低下させる可能性があります。[ 1 ]欠損データはデータ分析に問題を引き起こす可能性があるため、補完は、欠損値のあるケースをリストワイズ削除することに伴う落とし穴を回避する方法と見なされています。つまり、ケースに1つ以上の値が欠損している場合、ほとんどの統計パッケージはデフォルトで欠損値のあるケースを破棄しますが、これはバイアスを導入したり、結果の代表性に影響を与えたりする可能性があります。補完は、利用可能な他の情報に基づいて推定値で欠損データを置き換えることにより、すべてのケースを保持します。すべての欠損値が補完されると、データセットは完全なデータに対する標準的な手法を使用して分析できます。[ 2 ]欠損データに対処するために科学者によって採用された理論は数多くありますが、そのほとんどはバイアスを導入します。欠損データに対処するためのよく知られた試みには、ホットデックおよびコールドデック補完、リストワイズおよびペアワイズ削除、平均補完、非負行列因子分解、回帰補完、最終観測値の繰り越し、確率的補完、多重補完などがあります。
欠損データを処理する最も一般的な方法は、リストワイズ削除(完全ケースとも呼ばれる)であり、これは欠損値を持つすべてのケースを削除することです。データが完全にランダムに欠損している場合、リストワイズ削除はバイアスを加えませんが、有効サンプルサイズを減少させることで分析の検出力を低下させます。たとえば、1000 ケースが収集され、80 に欠損値がある場合、リストワイズ削除後の有効サンプルサイズは 920 になります。ケースが完全にランダムに欠損していない場合、欠損データによって表されるサブサンプルは元のサンプルを代表していないため、リストワイズ削除はバイアスを導入します(元のサンプル自体が母集団の代表サンプルである場合、完全ケースもその母集団を代表していません)。[ 3 ]欠損データが完全にランダムに欠損している場合はリストワイズ削除はバイアスがありませんが、実際にはそのようなケースはほとんどありません。[ 4 ]
ペアワイズ削除(または「利用可能なケース分析」)とは、特定の分析に必要な変数が欠落しているケースを削除する一方で、必要な変数がすべて揃っている分析にはそのケースを含めることを意味します。ペアワイズ削除を使用すると、分析のNの合計はパラメータ推定全体で一貫していません。ある時点ではNの値が不完全である一方、他のパラメータについては完全なケース比較が維持されるため、ペアワイズ削除は、相関が100%を超えるなど、あり得ない数学的状況を引き起こす可能性があります。[ 5 ]
完全削除方式が他の方法に比べて優れている点は、その簡便性と実装の容易さです。多くの欠点があるにもかかわらず、完全削除方式が欠損データ処理の最も一般的な方法となっている大きな理由の一つは、まさにこの点にあります。
かつてよく用いられた欠損値補完方法の一つに、ホットデック補完があった。これは、ランダムに選択された類似のレコードから欠損値を補完する方法である。「ホットデック」という用語は、パンチカードにデータを保存する時代に由来し、情報提供元と情報受領元が同じデータセットから得られた情報であることを示している。カードの束が「ホット」だったのは、それが現在処理中だったからである。
ホットデック補完の一形式として「最終観測値繰り越し」(略してLOCF)と呼ばれるものがあり、これはデータセットを複数の変数のいずれかに従ってソートし、順序付きデータセットを作成するものです。この手法では、最初の欠損値を見つけ、欠損しているデータの直前のセル値を使用して欠損値を補完します。欠損値のある次のセルに対してこのプロセスを繰り返し、すべての欠損値が補完されるまで続けます。ケースが個人またはその他のエンティティの変数の繰り返し測定である場合、これは測定値が欠損している場合、前回測定されたときから変化していないと推測するのが最善であるという考え方を表しています。この方法は、バイアスの増加や誤った結論につながるリスクを高めることが知られています。このため、LOCFの使用は推奨されません。[ 6 ]
一方、コールドデック補完では、別のデータセットからドナーを選択します。コンピュータ処理能力の向上により、より高度な補完方法が、従来のランダムでソートされたホットデック補完手法に取って代わりました。これは、過去の調査における類似項目の回答値で置き換える方法です。時間間隔を測定する調査で利用できます。
別の補完手法として、欠損値を他のすべてのケースにおける当該変数の平均値で置き換える方法があります。この方法の利点は、当該変数の標本平均が変わらないことです。しかしながら、平均値による補完は、補完対象の変数に関連する相関関係を弱めてしまいます。これは、補完を行うケースでは、補完対象の変数と他の測定変数との間に相関関係が存在しないことが保証されるためです。したがって、平均値による補完は単変量解析には魅力的な特性を持ちますが、多変量解析には問題が生じます。
平均値の補完はクラス内(性別などのカテゴリ)で実行でき、次のように表現できます。どこレコードの推定値そしてあるクラス内の回答者データの標本平均これは、一般化回帰補完の特殊なケースです。
ここに値があります回帰分析から推定されるの上補完されていないデータでは、はクラスメンバーシップのダミー変数であり、データは回答者()と欠落(). [ 7 ] [ 8 ]
非負行列因子分解(NMF)は、欠損データをバイアスを導入する可能性のあるゼロとして扱うのではなく、コスト関数を最小化しながら欠損データを取り込むことができます。[ 9 ]これにより、NMFはデータ補完のための数学的に証明された方法となります。NMFはコスト関数で欠損データを無視することができ、欠損データの影響は2次効果ほど小さくなります。
回帰代入は、平均値代入とは正反対の問題を抱えています。回帰モデルは、他の変数に基づいて変数の観測値を予測するように推定され、そのモデルは、その変数の値が欠損している場合に値を代入するために使用されます。言い換えれば、完全なケースと不完全なケースの両方で利用可能な情報を使用して、特定の変数の値を予測します。回帰モデルから得られた適合値は、欠損値を代入するために使用されます。問題は、代入されたデータには推定に誤差項が含まれていないため、推定値は残差分散なしに回帰線に完全に適合してしまうことです。これにより、関係性が過剰に識別され、代入値の精度が実際よりも高く見えてしまいます。回帰モデルは欠損データの最も可能性の高い値を予測しますが、その値に関する不確実性は提供しません。
確率的回帰は、回帰補完に平均回帰分散を追加して誤差を導入することで、回帰補完における誤差項の欠如を修正するかなり成功した試みでした。確率的回帰は、上述の手法よりもはるかにバイアスが少ないですが、まだ1つ見落としている点があります。データが補完される場合、直感的には単純な残差分散よりも多くのノイズが問題に導入されるべきだと考えられます。[ 5 ]
補完によるノイズ増加の問題に対処するため、Rubin (1987) [ 10 ]は、これを考慮に入れるために、複数の補完データセットにわたって結果を平均化する方法を開発した。すべての多重補完法は、3 つのステップに従う。[ 3 ]
多重代入は、データが完全にランダムに欠損している場合、ランダムに欠損している場合、およびランダムではない場合に使用できますが、後者の場合はバイアスがかかる可能性があります。[ 14 ] 1つのアプローチは、連鎖方程式による多重代入(MICE)で、「完全条件付き指定」および「逐次回帰多重代入」としても知られています。[ 15 ] MICEはランダムに欠損しているデータ用に設計されていますが、十分な数の補助変数があれば、ランダムではない欠損データにも適用できることを示唆するシミュレーション証拠があります。ただし、MICEは、観測数が多く、非線形性や高次元性などの複雑な特徴を持つデータの場合、パフォーマンスの問題に悩まされる可能性があります。
多重代入法の最近のアプローチでは、機械学習技術を使用してパフォーマンスを向上させています。たとえば、MIDAS(Multiple Imputation with Denoising Autoencoders)は、教師なしニューラルネットワークの一種であるデノイズオートエンコーダを使用して、観測データのきめ細かい潜在表現を学習します。[ 16 ] MIDASは、従来の多重代入戦略よりも精度と効率の面で優れていることが示されています。
前のセクションで述べたように、単一代入では代入の不確実性は考慮されません。代入後、データは単一代入における実際の値であるかのように扱われます。代入の不確実性を無視すると、結果が過度に正確になり、導き出された結論に誤りが生じる可能性があります。[ 17 ]複数回代入することで、多重代入は真の値が取り得る値の不確実性と範囲を考慮します。予想どおり、不確実性推定とディープラーニングを組み合わせた代入は最良の戦略の1つであり、異種創薬データのモデリングに使用されています。[ 18 ] [ 19 ]
さらに、単一代入と完全ケースは実装が容易ですが、多重代入も実装はそれほど難しくありません。さまざまな統計ソフトウェアには、多重代入を容易に実行できる統計パッケージが多数あります。たとえば、MICE パッケージを使用すると、 RのユーザーはMICE メソッドを使用して多重代入を実行できます。[ 20 ] MIDAS は、R では rMIDAS パッケージで、Python では MIDASpy パッケージで実装できます。[ 16 ]
{{cite journal}}: CS1メンテナンス: DOIは2025年7月現在非アクティブです(リンク)