Loading article…
計量経済学と統計学において、トップコード化されたデータ観測とは、値が上限を超えるデータポイントが検閲されるデータのことです。
調査データは、回答者の匿名性を保つために、一般に公開される前にトップコーディングされることが多い。たとえば、調査の回答で回答者の自己申告の資産額が 790 億ドルであると報告された場合、回答者がビル・ゲイツである可能性が高いことが分かるため、匿名ではない。トップコーディングは、誤っている可能性のある外れ値が公開されるのを防ぐためにも適用されることがある。
ボトムコーディングも同様で、例えば、ゼロ未満の金額がゼロとして報告される場合です。トップコーディングは、グループで記録されたデータに対して行われます。例えば、年齢範囲が 0 ~ 20、21 ~ 50、50 ~ 99、100 歳以上のグループで報告される場合です。ここでは、100 歳を超える人の数だけがわかっており、その分布はわかりません。調査データの作成者は、ユーザーがトップグループの偏りのない推定値を入力できるように、打ち切り金額の平均を公開することがあります。
例: 所得が30,000ドルの場合のトップコーディング
トップコーディングは、公共利用データセットの分析における一般的な問題です。現在の人口調査のトップコーディングでは、高所得者の分布の形状がブロックされるため、所得格差の尺度を推定することが困難になります。この問題を克服するために、CPS はトップコーディングされた値の平均値を提供します。[1]
トップコーディング、つまり所得者の匿名性を保護するために納税申告書に報告される最高額に上限を設ける慣行は、米国における富の分配の分析を複雑にしている。[2]
影響通常の最小二乗法推定
- 上位コード化グループの下限を回帰変数値として使用すると (上記の例では 30000)、回帰変数の最高値が系統的誤差とともに報告されるため、OLS は偏りがあり、一貫性がありません。
- 上位にコード化された観測値は、回帰分析から完全に省略できます。省略されたグループと含まれているグループの間に体系的な違いがない場合、OLS は一貫性があり、偏りがありません。
- Tobit手順はトップコーディングに対して堅牢であり、偏りのない推定値を提供します。
参照
さらに読む
- Jenkins, SP, Burkhauser, RV, Feng, S., & Larrimore, J. (2009)。検閲データを使用した不平等の測定:多重代入アプローチ、ISERワーキングペーパーシリーズ2009-04、社会経済研究所。
参考文献
- ^ Larrimore, Jeff、Richard V. Burkhauser、Shuaizhang Feng、Laura Zayatz。2008年。「公共利用3月CPS(1976-2007)におけるトップコード所得の一貫したセル平均」。経済社会測定ジャーナル33(2-3)
- ^ Hacker, Jacob S. および Paul Pierson (2010)。『勝者総取り政治:ワシントンはいかにして富裕層をさらに豊かにし、中流階級に背を向けたか』Simon & Schuster、13 ページ。ISBN 978-1-4165-8869-6。
