統計学 において、欠損データ 、または欠損値とは 、観測対象 の変数 に対してデータ 値 が保存されていない場合に発生する現象です。欠損データはよく発生するものであり、データから導き出せる結論に大きな影響を与える可能性があります。
欠損データは、無回答によって発生する可能性があります。つまり、1つ以上の項目または単位全体(「被験者」)について情報が提供されない場合です。項目によっては、他の項目よりも無回答が発生しやすいものがあります。例えば、収入などの個人的な事柄に関する項目などです。脱落は 、縦断研究で発生する欠損の一種です。例えば、発達を研究する際に、一定期間後に測定を繰り返す場合などです。欠損は、参加者がテスト終了前に脱落し、1つ以上の測定値が欠落した場合に発生します。
経済学 、社会学 、政治学 の研究では、政府や民間団体が重要な統計を報告しないことを選択したり、報告しなかったりするため、あるいは情報が入手できないため、データが欠落していることがよくあります。 [ 1 ] 時には、研究者が原因で欠落値が発生することもあります。たとえば、データ収集が不適切に行われた場合や、データ入力で間違いがあった場合などです。[ 2 ]
これらの欠損にはさまざまな種類があり、研究結果の妥当性に異なる影響を与えます。完全にランダムに欠損している場合、ランダムに欠損している場合、ランダムではない欠損がある場合です。欠損データは、打ち切りデータ と同様に扱うことができます。
種類 データが欠落している理由を理解することは、残りのデータを正しく処理するために重要です。値が完全にランダムに欠落している場合、データサンプルは母集団を代表している可能性が高いです。しかし、値が体系的に欠落している場合、分析に偏りが生じる可能性があります。たとえば、IQと収入の関係を調査する研究において、平均以上のIQを持つ参加者が「あなたの給与はいくらですか?」という質問をスキップする傾向がある場合、このランダムな欠落(MARパターン(下記参照))を考慮しない分析では、IQと給与の間に正の相関関係が見出せない可能性があります。これらの問題のため、方法論者は、欠損値の発生を最小限に抑えるように研究を設計するよう研究者に日常的に助言しています。[ 2 ] グラフモデルを使用して、欠損データのメカニズムを詳細に記述できます。[ 3 ] [ 4 ]
このグラフは、対象集団におけるうつ病の予想される重症度の推定値の確率分布を示しています。症例数は60です。真の母集団は標準正規分布に従い、無回答確率はうつ病の重症度のロジスティック関数であるとします。結論は次のとおりです。欠損データが多いほど(MNAR)、推定値の偏りが大きくなります。対象集団におけるうつ病の重症度を過小評価していることになります。
完全にランダムに紛失 データセット内の値は、特定のデータ項目が欠損する原因となる事象が、観測可能な変数と観測不可能な関心パラメータの両方から独立しており、完全にランダムに発生する場合、完全にランダムに欠損している(MCAR)と言えます。[ 5 ]データ がMCARである場合、データに対して実行される分析は偏りのないものとなります。ただし、データがMCARであることはまれです。
MCARの場合、データの欠損はどの研究変数とも無関係です。したがって、完全に観測されたデータを持つ参加者は、特定の介入を割り当てられたすべての参加者のランダムサンプルとなります。MCARでは、治療のランダム割り当てが維持されると仮定されますが、これは通常、実際には非現実的に強い仮定です。[ 6 ]
ランダムに消失 欠損がランダムではないが、欠損が完全な情報を持つ変数によって完全に説明できる場合に、欠損がランダムに発生する (MAR) 。 [ 7 ] MAR は統計的に検証できない仮定であるため、その実質的な妥当性に頼る必要がある。[ 8 ] 例として、男性はうつ病調査に回答する可能性が低いが、男性であることを考慮すると、これはうつ病のレベルとは何の関係もない。分析方法によっては、これらのデータは、セルの偶発的な空虚 (男性、うつ病が非常に高い場合、エントリがゼロになる可能性がある) により、分析でパラメータのバイアスを引き起こす可能性がある。ただし、パラメータが完全情報最尤法で推定される場合、MAR は漸近的に不偏推定値を提供する。
欠落はランダムではない 非ランダム欠損 (MNAR) (非無視可能な無回答とも呼ばれる) は、MAR でも MCAR でもないデータ (つまり、欠損している変数の値は、欠損している理由に関連している) です。[ 5 ] 前の例を拡張すると、これは、男性がうつ病のレベルのために うつ病調査に回答しなかった場合などに発生します。
サムエルソンとスピラー(1992)は、人口統計、法執行、健康に関する欠落または歪んだデータが人権侵害のパターンを示す指標となり得ることを論じた。彼らは、十分に裏付けられたいくつかの例を挙げた。[ 9 ]
構造的欠損 欠損データは、古典的な理論では十分に説明できない微妙な形で発生することもあります。近年よく見られる問題として、データがMARではないものの、欠損値が明示的または暗黙的に何らかの関連性や構造を示すケースがあります。このような欠損は「構造化された欠損」と呼ばれています。[ 10 ]
構造的欠損は、複数の研究からの情報を組み合わせる際によく発生します。各研究は設計や測定セットが異なる場合があり、そのため測定方法の集合から変数のサブセットしか含まれません。このような状況では、欠損値はデータ収集に使用されたさまざまなサンプリング方法に関連しているか、より広範な対象集団の特性を反映している可能性があり、有用な情報を提供する可能性があります。たとえば、医療分野では、臨床データ、ゲノムデータ、画像データをリンクした結果として構造的欠損が観察されています。[ 10 ]
構造的欠損の存在は、古典的な統計的手法と最新の機械学習手法の両方を含め、大規模なデータの効果的な利用を妨げる可能性があります。たとえば、一部のデータがパターンで欠損している理由に固有のバイアスが存在する可能性があり、これは機械学習モデルの予測の公平性に影響を与える可能性があります。さらに、補完 などの欠損データ処理の確立された方法は、通常、欠損データの構造を考慮していないため、構造的欠損に適切かつ効果的に対処するには、新しい定式化の開発が必要です。最後に、MCAR、MAR、MNARの古典的なフレームワーク内で構造的欠損を特徴付けることは、進行中の作業です。[ 11 ]
計画的な行方不明 欠損データは、研究デザインの意図的な一部である場合もあります。具体的には、計画的欠損は、調査研究で用いられる研究デザイン戦略であり、個々の回答者から意図的にデータを収集しない(通常は各参加者に項目のランダムに抽出したサブセットを配布する)ことで、サンプル全体で項目セット全体のパラメータを推定する能力を維持しながら負担を軽減します。[ 12 ] [ 13 ]
欠損データの処理方法 欠損データはサンプルの代表性を低下させ、母集団に関する推論を歪める可能性があります。一般的に、欠損データの処理には主に次の 3 つのアプローチがあります。(1)補完 - 欠損データの代わりに値を代入する、(2)除外 - 無効なデータを含むサンプルを以降の分析から除外する、(3)分析 - 欠損値の影響を受けない方法を直接適用する。患者中心のアウトカム研究における欠損データの予防と処理に関するあるシステマティック レビューでは、欠損データの予防と処理に必要な 10 の基準が特定されました。これには、研究デザイン、研究の実施、分析、および報告に関する基準が含まれます。[ 14 ]
実際の応用例では、実験者は欠損値のレベルを制御し、データ収集前に欠損値の発生を防ぐことができます。例えば、コンピュータによるアンケートでは、質問をスキップできないことがよくあります。質問には必ず回答しなければならず、そうでなければ次の質問に進むことができません。そのため、この種のアンケートでは参加者による欠損値は排除されますが、この方法は研究を監督する倫理委員会によって許可されない場合があります。調査研究では、サンプル内の各個人に複数回連絡を取ることが一般的で、参加しないと決めた人に考えを変えるよう説得するために手紙を送ることがよくあります。[ 15 ] : 161-187 しかし、このような手法は、欠損データの負の推論効果を軽減するという点では、役に立つ場合もあれば、害になる場合もあります。なぜなら、最初に拒否したり不在だったりした後に説得されて参加する意思のある人は、追加の努力をしてもなお拒否したり連絡が取れないままの人とは大きく異なる可能性が高いからです。[ 15 ] : 188-198
欠損値が発生する可能性が高い状況では、研究者は欠損値に強い データ分析手法を用いるよう計画することが推奨される。分析が頑健であるとは、その手法の主要な前提条件に軽度から中程度の違反があっても、母集団に関する結論にほとんど、あるいは全く偏りや歪みが生じないと確信できる場合を指す。
補完 データ分析 手法の中には、欠損値に対して頑健でないものもあり、欠損データを「補完」または代入する必要がある。Rubin (1987) は、代入を数回 (5 回以下) 繰り返すだけでも推定の精度が大幅に向上すると主張した。 [ 2 ] 実際の多くの目的においては、2 回または 3 回の代入で、より多くの代入で得られる相対的な効率のほとんどを捉えることができる。しかし、代入の数が少なすぎると統計的検出力 が大幅に低下する可能性があり、現在では一部の研究者は 20 ~ 100 回以上を推奨している。[ 16 ] 多重代入データ分析は、代入されたデータセットごとに繰り返す必要があり、場合によっては、関連する統計量を比較的複雑な方法で組み合わせる必要がある。[ 2 ] 多重代入は、訓練の不足や誤解があるため、特定の分野では実施されていない。[ 17 ] リストワイズ削除などの手法はデータの代入に使用されてきたが、追加のバイアスを導入することがわかっている。[ 18 ] データの補完方法を段階的に説明した初心者向けガイドがあります。[ 19 ]
期待値最大化アルゴリズム は、欠損データのパターンを考慮しながら、完全なデータセットが利用可能な場合に計算されるはずの統計量の値を推定(補完)する手法です。この手法では、個々の欠損データ項目の値は通常補完されません。
補間 数値解析という数学分野において、補間とは 、既知の離散的なデータ点の範囲内で新しいデータ点を構築する方法である。
欠損データを含む2つのペアサンプルを比較する場合、補完を必要とせずに利用可能なすべてのデータを使用する検定統計量は、部分的に重複するサンプルt検定である。[ 20 ] これは正規分布の下で有効であり、MCARを仮定している。
部分削除 欠損値のないデータセットに利用可能なデータを削減する方法には、以下のようなものがあります。
詳細な分析 利用可能なすべての情報を完全に考慮に入れ、推定値をあたかも実際に観測された値であるかのように使用することによって生じる歪みを排除する方法。
部分的な識別 方法も使用できる。[ 23 ]
モデルベースの手法 モデルベースの手法(多くの場合グラフを使用)は、欠損データの種類(MCAR、MAR、MNAR)をテストしたり、欠損データ条件下でパラメータを推定したりするための追加ツールを提供します。たとえば、MAR/MCARを否定するテストは次のようになります。
任意の3つの変数X、Y 、Zについて、 Z が完全に観測され、X とYが 部分的に観測されている場合、データは次の条件を満たす必要があります。 X ⊥ ⊥ R y | ( R x 、 Z ) {\displaystyle X\perp \!\!\!\perp R_{y}|(R_{x},Z)} 。
言い換えれば、Xの観測された部分は、 Z のすべての値に条件付けられたY の欠損状態とは独立している必要がある。この条件を満たさない場合、問題は MNAR カテゴリに属することを示す。[ 24 ]
(注:これらのテストは、イベントベースのMARのわずかなバリエーションである変数ベースのMARに必要です。[ 25 ] [ 26 ] [ 27 ] )
データがMNARカテゴリに分類される場合、モデルで特定の条件が満たされれば、パラメータを一貫して推定するための手法が利用可能です。[ 3 ] 例えば、Yが X の欠損の理由を説明し、Y 自体に欠損値がある場合、Y の欠損がランダムであれば、 X とY の同時確率分布を 推定できます。この場合の推定対象は次のようになります。
P ( X 、 Y ) = P ( X | Y ) P ( Y ) = P ( X | Y 、 R x = 0 、 R y = 0 ) P ( Y | R y = 0 ) {\displaystyle {\begin{aligned}P(X,Y)&=P(X|Y)P(Y)\\&=P(X|Y,R_{x}=0,R_{y}=0)P(Y|R_{y}=0)\end{aligned}}} どこR x = 0 {\displaystyle R_{x}=0} そしてR y = 0 {\displaystyle R_{y}=0} それぞれの変数の観測された部分を表す。
異なるモデル構造は、一貫性のある推定が可能な場合、異なる推定対象と異なる推定手順をもたらす可能性がある。前述の推定対象は、まず推定を必要とする。P ( X | Y ) {\displaystyle P(X|Y)} 完全なデータからそれを乗算してP ( Y ) {\displaystyle P(Y)} Yが X の状態に関係なく観測されるケースから推定される。さらに、一貫性のある推定値を得るためには、最初の項がP ( X | Y ) {\displaystyle P(X|Y)} 対照的にP ( Y | X ) {\displaystyle P(Y|X)} 。
多くの場合、モデルベースの手法により、モデル構造が反証テストを受けることが可能になります。[ 27 ] 部分的に観測された変数Xと別の変数 Y の欠損指標との間の独立性を暗示するモデル(つまり、R y {\displaystyle R_{y}} )条件付きR x {\displaystyle R_{x}} 以下の反証テストに提出することができます。 X ⊥ ⊥ R y | R x = 0 {\displaystyle X\perp \!\!\!\perp R_{y}|R_{x}=0} 。
最後に、これらの手法から得られる推定量は閉じた形式で導出され、局所最適解に陥りやすい期待値最大化法などの反復手順を必要としません。[ 28 ]
欠損の確率が時間に依存する場合、特殊な問題が生じます。たとえば、外傷データベースでは、外傷の結果に関するデータが失われる確率は、外傷発生後の日数に依存します。このような場合、さまざまな非定常マルコフ連鎖 モデルが適用されます。 [ 29 ]
参考文献 ↑ Messner SF (1992). "殺人事件に関する国際比較研究における不規則なデータ報告の影響の検討". Journal of Quantitative Criminology . 8 (2): 155– 173. doi : 10.1007/bf01066742 . S2CID 133325281 . 1 2 3 4 ハンド、デビッド J.アデル、ハーマン J.メレンバーグ、ギデオン J. (2008)。 研究方法のアドバイス: コンサルタントの同行者 。オランダ、ホイゼン:ヨハネス・ファン・ケッセル。 305 ~ 332 ページ 。ISBN 978-90-79418-01-5 。1 2 Mohan, Karthika; Pearl, Judea; Tian, Jin (2013). "欠損データを用いた推論のためのグラフィカルモデル". Advances in Neural Information Processing Systems 26 . pp. 1277– 1285. ↑ カルヴァネン、ユハ (2015)。 「因果モデルでデザインを研究する」。 スカンジナビア統計ジャーナル 。 42 (2 ) : 361–377。arXiv : 1211.2958 。 土井 : 10.1111/sjos.12110 。 S2CID 53642701 。 1 2 Polit DF Beck CT (2012). 看護研究:看護実践のためのエビデンスの生成と評価、第9版 。米国フィラデルフィア:Wolters Klower Health、Lippincott Williams & Wilkins。 ↑ Deng (2012-10-05). "生物統計学と臨床試験について" . 2016年3月15日の オリジナルからアーカイブ済み。 2016年 5月13日 取得 。 ↑ 「ホーム」 。 2015年9月10日にオリジナルから アーカイブされました 。 2015年8月1日 に取得。 ↑ Little, Roderick JA; Rubin, Donald B. (2002), Statistical Analysis with Missing Data (2nd ed.), Wiley , Bibcode : 2002samd.book.....L 。↑ サミュエルソン、ダグラス A.、スピラー、ハーバート F. (1992年12月31日)、 「第3章 人権侵害に関する推論における不完全かつ歪んだデータの使用」 、 人権と統計 、ペンシルベニア大学出版局、 62~ 78ページ、 doi : 10.9783/9781512802863-006 、 ISBN 9781512802863 2022年8月18日 取得1 2 Mitra, Robin; McGough, Sarah F.; Chakraborti, Tapabrata; Holmes, Chris; Copping, Ryan; Hagenbuch, Niels; Biedermann, Stefanie; Noonan, Jack; Lehmann, Brieuc; Shenvi, Aditi; Doan, Xuan Vinh; Leslie, David; Bianconi, Ginestra; Sanchez-Garcia, Ruben; Davies, Alisha (2023-01-25). "構造化された欠損値を持つデータからの学習" . Nature Machine Intelligence . 5 (1): 13– 23. arXiv : 2304.01429 . doi : 10.1038/s42256-022-00596-z . ISSN 2522-5839 . ↑ Jackson, James; Mitra, Robin; Hagenbuch, Niels; McGough, Sarah; Harbron, Chris (2023-07-05), A Complete Characterisation of Structured Missingness , arXiv : 2307.02650 ↑ Zhang, Charlene; Yu, Martin C. (2022年10月). 「計画的欠勤:どのように、そしてどの程度?」 . Organizational Research Methods . 25 (4): 623–641 . doi : 10.1177/10944281211016534 . ISSN 1094-4281 . ↑ Zhang, Charlene; Sackett, Paul R. (2023年3月). 「計画的欠損:調査とテストの長さを短縮するための、あまり使われていないが実用的なアプローチ」。Industrial and Organizational Psychology . 16 (1): 129– 142. doi : 10.1017/iop.2022.113 . ↑ Li, Tianjing; Hutfless, Susan; Scharfstein, Daniel O.; Daniels, Michael J.; Hogan, Joseph W.; Little, Roderick JA; Roy, Jason A.; Law, Andrew H.; Dickersin, Kay (2014). "患者中心のアウトカム研究における欠損データの予防と処理には標準を適用すべきである:系統的レビューと専門家のコンセンサス" . Journal of Clinical Epidemiology . 67 (1): 15– 32. doi : 10.1016/j.jclinepi.2013.08.013 . PMC 4631258 . PMID 24262770 . 1 2 Stoop, I. ; Billiet, J.; Koch, A.; Fitzgerald, R. (2010). 調査無回答率の削減:欧州社会調査から得られた教訓 . オックスフォード:Wiley-Blackwell. ISBN 978-0-470-51669-0 。↑ Graham JW; Olchowski AE; Gilreath TD (2007). "本当に必要な補完の数はいくつですか? 多重補完理論の実践的な明確化". Preventative Science . 8 (3): 208– 213. CiteSeerX 10.1.1.595.7125 . doi : 10.1007/s11121-007-0070-9 . PMID 17549635 . S2CID 24566076 . ↑ van Ginkel, Joost R.; Linting, Marielle; Rippe, Ralph CA; van der Voort, Anja (2020-05-03). "Rebutting Existing Misconceptions About Multiple Imputation as a Method for Handling Missing Data" . Journal of Personality Assessment . 102 (3): 297– 308. doi : 10.1080/00223891.2018.1530680 . hdl : 1887/138825 . ISSN 0022-3891 . PMID 30657714 . S2CID 58580667 . ↑ ヴァン ブーレン、S. (2018)。 欠損データの柔軟な代入 (第 2 版)。 CRCプレス。 ↑ Woods, Adrienne D.; Gerasimova, Daria; Van Dusen, Ben; Nissen, Jayson; Bainter, Sierra; Uzdavines, Alex; Davis-Kean, Pamela E.; Halvorson, Max; King, Kevin M.; Logan, Jessica AR; Xu, Menglin; Vasilev, Martin R.; Clay, James M.; Moreau, David; Joyal-Desmarais, Keven (2023-02-23). "多重代入による欠損データへの対処に関するベストプラクティス" . Infant and Child Development . 33 e2407. doi : 10.1002/icd.2407 . ISSN 1522-7227 . ↑ Derrick, B; Russ, B; Toher, D; White, P (2017). "ペアと独立の観測値の両方を含む2つのサンプルの平均の比較のための検定統計量" . Journal of Modern Applied Statistical Methods . 16 (1): 137– 157. doi : 10.22237/jmasm/1493597280 . ↑ Chechik, Gal; Heitz, Geremy; Elidan, Gal; Abbeel, Pieter ; Koller, Daphne (2008-06-01). "不完全データの最大マージン分類" (PDF) . Neural Information Processing Systems : 233– 240. ↑ Chechik, Gal; Heitz, Geremy; Elidan, Gal; Abbeel, Pieter ; Koller, Daphne (2008-06-01). "Max-margin Classification of Data with Absent Features" . The Journal of Machine Learning Research . 9 : 1– 21. ISSN 1532-4435 . ↑ Tamer, Elie (2010). "Partial Identification in Econometrics" (PDF) . Annual Review of Economics . 2 (1): 167– 195. doi : 10.1146/annurev.economics.050708.143401 . ↑ Mohan, Karthika; Pearl, Judea (2014). 「欠損データを含むモデルのテスト可能性について」。AISTAT -2014 会議録、近日公開予定 。 ↑ Darwiche, Adnan (2009). Modeling and Reasoning with Bayesian Networks . Cambridge University Press. ↑ Potthoff, RF; Tudor, GE; Pieper, KS; Hasselblad, V. (2006). "医学研究において欠損データがランダムに欠損しているかどうかを評価できるか?". Statistical Methods in Medical Research . 15 (3): 213– 234. doi : 10.1191/0962280206sm448oa . PMID 16768297 . S2CID 12882831 . 1 2 Pearl, Judea; Mohan, Karthika (2013). 欠損データの回復可能性とテスト可能性: 序論と結果の概要 (PDF) (技術レポート). UCLA コンピュータサイエンス学科、R-417。 ↑ Mohan, K.; Van den Broeck, G.; Choi, A.; Pearl, J. (2014). "不完全なデータからのベイジアンネットワークパラメータ学習のための効率的な方法". ICML-2014 の因果モデリングと機械学習ワークショップで発表 。 ↑ Mirkes, EM; Coats, TJ; Levesley, J.; Gorban, AN (2016). "大規模医療データセットにおける欠損データの処理:外傷転帰不明の事例研究" . Computers in Biology and Medicine . 75 : 203– 216. arXiv : 1604.00627 . Bibcode : 2016arXiv160400627M . doi : 10.1016/j.compbiomed.2016.06.004 . PMID 27318570 . S2CID 5874067 . 2016年8月5日にオリジナルから アーカイブ済み。
さらに読む Acock AC (2005)、「欠損値の扱い方」、Journal of Marriage and Family 、67 (4): 1012–28 、doi : 10.1111/j.1741-3737.2005.00191.x アリソン、ポール・D. (2001)、『欠損データ』 、SAGE Publishing Bouza-Herrera, Carlos N. (2013), 『ランクセットサンプリングにおける欠損データの処理』 , Springer エンダース、クレイグ・K. (2010)、『応用欠損データ分析』 、ギルフォード出版 グラハム、ジョン・W. (2012)、『欠損データ』 、スプリンガー モーレンバーグス、ギアト。フィッツモーリス、ギャレット。ケンワード、マイケル G.シアティス、アナスタシオス。フェルベケ、ギアルト編。 (2015)、欠損データ手法ハンドブック 、チャップマン & ホール Raghunathan、Trivellore (2016)、『実務における欠損データ分析』 、Chapman & Hall Little, Roderick JA; Rubin, Donald B. (2002),欠損データを用いた統計分析 (第2 版), Wiley , Bibcode : 2002samd.book.....L Tsiatis, Anastasios A. (2006), Semiparametric Theory and Missing Data , Springer Van den Broeck J、Cunningham SA、Eeckels R、Herbst K (2005)、「データクリーニング:データ異常の検出、診断、および編集」、PLOS Medicine 、2 (10): e267、doi : 10.1371/journal.pmed.0020267 、PMC 1198040 、PMID 16138788、S2CID 5667073 Zarate LE、Nogueira BM、Santos TR、Song MA (2006)「不均衡データベースにおける欠損値回復技術:大量の欠損データを含むマーケティングデータベースへの応用」IEEE International Conference on Systems, Man and Cybernetics, 2006. SMC '06 . Vol. 3. pp. 2658–2664 . doi : 10.1109/ICSMC.2006.385265。
外部リンク
背景 欠損データ、医学統計学部、ロンドン大学衛生熱帯医学大学院 データが不足している流域における長期降雨記録の空間的および時間的傾向分析:1953年から2010年までのマラウイのロウアー・シャイア氾濫原の事例研究。 R-miss-tasticは、欠損値処理方法とワークフローのための統合プラットフォームです。 欠損値 - ビジョン
ソフトウェア Mplus PROC MI および PROC MIANALYZE - SAS SPSS