ヒストグラムは、定量的データの分布を視覚的に表現したものです。ヒストグラムを作成するための最初のステップは、値の範囲を「ビン」(または「バケット」)に分けることです。つまり、値の範囲全体を一連の間隔に分割し、各間隔に含まれる値の数を数えます。ビンは通常、変数の連続した重複しない間隔として指定されます。ビン(間隔)は隣接しており、通常は(必ずしもそうである必要はありませんが)同じサイズです。[1]
ヒストグラムは、データの基になる分布の密度の大まかな感覚を示し、多くの場合、密度推定、つまり基になる変数の確率密度関数の推定に使用されます。確率密度に使用されるヒストグラムの合計面積は常に 1 に正規化されます。x軸上の間隔の長さがすべて 1 の場合、ヒストグラムは相対頻度プロットと同一です。
ヒストグラムは棒グラフと混同されることがあります。ヒストグラムでは、各ビンは異なる範囲の値を表すため、全体としてヒストグラムは値の分布を示します。しかし、棒グラフでは、各バーは異なるカテゴリの観測値を表すため(たとえば、各バーは異なる母集団を表す)、全体として棒グラフは異なるカテゴリを比較するために使用できます。一部の著者は、棒グラフがヒストグラムではないことを明確にするために、棒の間に常に隙間があることを推奨しています。[2] [3]
語源
「ヒストグラム」という用語は、数理統計学の創始者であるカール・ピアソンが、 1892年にロンドン大学ユニバーシティ・カレッジで行った講義で初めて導入しました。ピアソンの用語は、ギリシャ語の語源γραμμα (gramma) = 「図」または「図解」と語源ἱστορία (historia) = 「調査」または「歴史」を組み合わせたものだと誤って言われることがあります。あるいは、「網」または「組織」を意味する語源ἱστίον (histion) も提案されています (例えば、生物組織の研究であるhistologyなど)。これらの語源は両方とも間違っており、実際には、古代ギリシャ語に精通していたピアソンは、グラフの垂直バーを指す同音異義語の異なるギリシャ語語源ἱστός = 「垂直に立てられたもの」からこの用語を派生させました。ピアソンの新しい用語は、「スティグモグラム」や「ラジオグラム」など、他の類似の新語のシリーズに組み込まれました。 [4]
ピアソン自身は1895年に、「ヒストグラム」という用語は新しいが、それが指すグラフの種類は「一般的なグラフ表現形式」であると述べています。[5] 実際、統計測定を表すために棒グラフを使用する手法は、スコットランドの経済学者ウィリアム・プレイフェアが彼の著書『商業および政治地図』(1786年)で考案しました。[4]
例
これは、500 個の項目を使用した右側のヒストグラムのデータです。

ヒストグラムのパターンを説明するために使用される言葉は、「対称」、「左に偏っている」、「右に偏っている」、「単峰性」、「二峰性」、「多峰性」です。
-
対称的、単峰性
-
バイモーダル
-
マルチモーダル
-
対称的
より詳しく知るには、いくつかの異なるビン幅を使用してデータをプロットすることをお勧めします。以下は、レストランで提供されるチップの例です。
-
1 ドルのビン幅、右に偏った単峰型のヒント
-
10セントのビン幅を使用するヒント、依然として右に偏っている、$と50セントの金額でモードを持つ多峰性、丸めを示し、いくつかの外れ値もある
米国国勢調査局は、自宅以外で働く人が 1 億 2,400 万人いることを発見しました。[6] 通勤に要する時間に関するデータを使用した以下の表では、通勤時間が「30 分以上 35 分未満」と回答した人の絶対数が、その上と下のカテゴリの数値よりも高いことが示されています。これは、報告された移動時間を丸めているためであると考えられます。[引用が必要]値をやや恣意的に丸めた数値として報告するという問題は、人々からデータを収集する際によく見られる現象です。[引用が必要]

このヒストグラムは、単位間隔あたりの症例数を各ブロックの高さとして表示します。そのため、各ブロックの面積は、調査でそのカテゴリに該当する人の数に等しくなります。曲線の下の面積は、症例の総数 (1 億 2,400 万) を表します。このタイプのヒストグラムは、Q が千単位の絶対数を示します。

このヒストグラムは、最初のヒストグラムと垂直スケールのみが異なります。各ブロックの面積は、各カテゴリが表す合計の割合であり、すべてのバーの合計面積は 1 に等しくなります (割合は「すべて」を意味します)。表示される曲線は、単純な密度推定値です。このバージョンは比率を示し、単位面積ヒストグラムとも呼ばれます。
言い換えれば、ヒストグラムは、幅がクラス間隔を表し、面積が対応する頻度に比例する長方形によって頻度分布を表します。各長方形の高さは、間隔の平均頻度密度です。間隔が一緒に配置されているのは、ヒストグラムによって表されるデータが排他的でありながら連続していることを示すためです。(たとえば、ヒストグラムでは、10.5–20.5 と 20.5–33.5 の 2 つの接続区間を持つことは可能ですが、10.5–20.5 と 22.5–32.5 の 2 つの接続区間を持つことはできません。空の区間は空として表され、スキップされません。)[7]
数学的な定義

ヒストグラムを作成するために使用されるデータは、各分離カテゴリ(ビンと呼ばれる)に分類される観測値の数をカウントする関数m iによって生成されます。したがって、観測値の総数をn 、ビンの総数をkとすると、ヒストグラム データm i は次の条件を満たします。
ヒストグラムは、カーネルを使用してビン上の頻度を平滑化する、単純化されたカーネル密度推定と考えることができます。これにより、より滑らかな確率密度関数が生成され、一般に基礎となる変数の分布をより正確に反映します。密度推定は、ヒストグラムの代わりにプロットすることができ、通常はボックスの集合ではなく曲線として描画されます。それでも、統計的特性をモデル化する必要があるアプリケーションでは、ヒストグラムが好まれます。カーネル密度推定の相関変動を数学的に記述するのは非常に困難ですが、各ビンが独立して変化するヒストグラムの場合は簡単です。
カーネル密度推定の代替法として平均シフトヒストグラム[8]があり、 これは計算が速く、カーネルを使用せずに密度の滑らかな曲線推定値を与えます。
累積ヒストグラム
累積ヒストグラムは、指定されたビンまでのすべてのビンの観測値の累積数をカウントするマッピングです。つまり、ヒストグラムm jの累積ヒストグラムM i は次のように定義されます。
ビンの数と幅
ビンの数に「最適」なものはなく、ビンのサイズを変えることでデータのさまざまな特徴を明らかにすることができます。データのグループ化は少なくとも17世紀のGrauntの研究と同じくらい古いものですが、 1926年のSturgesの研究まで体系的なガイドラインは示されていませんでした[9] 。 [10]
基になるデータ ポイントの密度が低い場合に広いビンを使用すると、サンプリングのランダム性によるノイズが軽減されます。密度が高い場合に狭いビンを使用すると (信号がノイズをかき消すため)、密度の推定精度が向上します。したがって、ヒストグラム内でビンの幅を変えることは有益です。とはいえ、等幅のビンが広く使用されています。
最適なビンの数を決定しようとした理論家もいるが、これらの方法は一般に分布の形状について強い仮定を立てている。実際のデータ分布と分析の目的に応じて、異なるビン幅が適切となる場合があり、適切な幅を決定するには通常実験が必要である。しかし、さまざまな有用なガイドラインと経験則がある。[11]
ビンの数kは直接割り当てることも、推奨されるビン幅 hから次のように計算することもできます。
.jpg/500px-Untitled_document_(1).jpg)
中括弧は天井関数を示します。
平方根の選択
これはサンプル内のデータポイントの数の平方根を取り、次の整数に丸めます。このルールは多くの初等統計の教科書[12]で提案されており、多くのソフトウェアパッケージで広く実装されています。[13]
スタージスの公式
スタージスの法則[10]は二項分布から導かれ、暗黙的に近似的に正規分布を仮定している。
スタージスの公式は、ビンのサイズをデータの範囲に基づいて暗黙的に決定するため、n < 30の場合、ビンの数が少なくなり(7未満)、データの傾向をうまく表示できなくなるため、パフォーマンスが低下する可能性があります。その一方で、スタージスの公式は、非常に大きなデータセットに対してビンの幅を過大評価し、ヒストグラムが過度に平滑化される可能性があります。[14]データが正規分布していない場合にも、パフォーマンスが低下する可能性があります。
ヒストグラムビンの2つの広く受け入れられている公式であるスコットの法則とテレル・スコットの法則と比較すると、スタージスの法則の出力はn ≈ 100のときに最も近くなります。[14]
ライスルール
ライスルール[15]はスタージスのルールの単純な代替として提示されています。
ドーンの式
ドーンの公式[16]は、非正規データでの性能を向上させるためにスタージスの公式を修正したものである。
ここで分布の 推定3次モーメント歪度であり、
スコットの正規参照ルール
ビンの幅は次のように与えられる。
ここで、は標本標準偏差である。スコットの正規参照則[17]は、密度推定値の積分平均二乗誤差を最小化するという意味で、正規分布データのランダム標本に対して最適である。[9]これはMicrosoft Excelで使用されるデフォルトの規則である。[18]
テレル・スコット則
テレル・スコット則[14] [19]は通常の参照則ではない。これは漸近的に最適なヒストグラムに必要な最小のビン数を与えるもので、最適性は積分平均二乗誤差によって測定される。この境界は「最も滑らかな」可能な密度を見つけることによって導かれ、それは となる。他の密度ではより多くのビンが必要になるため、上記の推定値は「過剰平滑化」則とも呼ばれる。式の類似性と、この則を提案したときにテレルとスコットがライス大学にいたという事実は、これがライス則の起源でもあることを示唆している。
フリードマン・ディアコニス則
フリードマン・ディアコニス則はビンの幅を次のように表す: [20] [9]
これは、IQR で表される四分位範囲に基づいています。これは、スコットのルールの 3.5σ を 2 IQR に置き換えたもので、データの外れ値に対する標準偏差よりも感度が低くなります。
クロスバリデーション推定二乗誤差の最小化
スコットの法則から得られる積分平均二乗誤差を最小化するこのアプローチは、leave-one out交差検証を使用することで、正規分布を超えて一般化することができる。[21] [22]
ここで、はk番目のビンのデータポイントの数であり、J を最小化するhの値を選択すると、積分平均二乗誤差が最小化されます。
島崎と篠本の選択
この選択は、推定L2リスク関数の最小化に基づいている[23]
ここで、およびは、ビン幅、のヒストグラムの平均と偏りのある分散です。
可変ビン幅
均等間隔のビンを選択するのではなく、一部のアプリケーションではビンの幅を変えることが望ましい場合があります。これにより、カウントの少ないビンを回避できます。一般的なケースは、各ビンのサンプル数がほぼ等しいと予想される等確率ビンを選択することです。ビンは、既知の分布に従って選択することも、各ビンにサンプルが含まれるようにデータに基づいて選択することもできます。ヒストグラムをプロットする場合、従属軸には頻度密度が使用されます。すべてのビンの面積はほぼ等しくなりますが、ヒストグラムの高さは密度分布に近似します。
等確率ビンの場合、ビンの数に関する次の規則が提案されている:[24]
このビンの選択は、ビンに等しい数のサンプルが含まれているかどうかをテストするピアソンカイ2乗検定の検出力を最大化することを目的とします。より具体的には、与えられた信頼区間に対して、次の式の1/2倍から1倍の間で選択することが推奨されます。[25]
ここで、 はプロビット関数です。 に対するこの規則に従うと、は との間になります。この広い最適値から覚えやすい値として、係数 2 が選択されます。
述べる
ビンの数が に比例するべき理由として、次のことが挙げられます。データが、滑らかな密度を持つ有界確率分布の独立した実現として取得されると仮定します。この場合、ヒストグラムは、無限大に近づくにつれて、同様に「凹凸」したままになります。 が分布の「幅」(標準偏差または四分位範囲など)である場合、ビン内のユニット数(頻度)は のオーダーで、相対標準誤差は のオーダーです。次のビンと比較すると、頻度の相対的な変化は、密度の導関数がゼロでない場合、 のオーダーです。が のオーダーである場合、これら 2 つは同じオーダーであるため、 はのオーダーです。この単純な立方根の選択は、一定でない幅のビンにも適用できます。[引用が必要]

アプリケーション
- 水文学では、降雨量と河川流量データのヒストグラムと推定密度関数を確率分布で解析し、それらの挙動と発生頻度についての洞察を得るために使用されます。[27]一例を青い図に示します。
- 多くのデジタル画像処理プログラムには、ピクセルのコントラスト/明るさの分布を表示するヒストグラム ツールがあります。

コントラストのヒストグラム
参照
- データと情報の視覚化
- データビニング
- 密度推定
- カーネル密度推定、より滑らかだがより複雑な密度推定方法
- エントロピー推定
- フリードマン・ディアコニス則
- 画像ヒストグラム
- パレート図
- 品質の7つの基本ツール
- V最適ヒストグラム
参考文献
- ^ Howitt, D.; Cramer, D. (2008).心理学における統計学入門(第4版). Prentice Hall. ISBN 978-0-13-205161-3。
- ^ ナオミ・ロビンズ「ヒストグラムは棒グラフではない」フォーブス。 2018年7月31日閲覧。
- ^ M. Eileen Magnello (2006 年 12 月)。「カール・ピアソンと現代統計の起源: 弾性主義者が統計学者になる」。ニュージーランド科学技術史哲学ジャーナル。第 1 巻。OCLC 682200824 。
- ^ ab Daniel Riaño Rufilanchas (2017)、「カール・ピアソンの用語「ヒストグラム」の起源について」、Estadística Española vol. 59、いいえ。 192、p. 29-35。
- ^ ピアソン、K. (1895)。「進化の数学的理論への貢献。II.均質材料における歪曲変化」。王立協会哲学論文集A:数学、物理、工学科学。186:343–414。Bibcode :1895RSPTA.186..343P。doi :10.1098/rsta.1895.0010。
- ^ 米国2000年国勢調査。
- ^ Dean, S., & Illowsky, B. (2009 年 2 月 19 日)。記述統計: ヒストグラム。Connexions Web サイトから取得: http://cnx.org/content/m16298/1.11/
- ^ David W. Scott (2009年12月). 「平均シフトヒストグラム」. Wiley Interdisciplinary Reviews: Computational Statistics . 2 (2): 160–164. doi :10.1002/wics.54. S2CID 122986682.
- ^ abc Scott, David W. (1992).多変量密度推定: 理論、実践、視覚化ニューヨーク: John Wiley.
- ^ ab Sturges, HA (1926). 「クラス間隔の選択」.アメリカ統計学会誌. 21 (153): 65–66. doi :10.1080/01621459.1926.10502161. JSTOR 2965501.
- ^ 例えば§5.6「密度推定」、WN VenablesとBD Ripley、「Modern Applied Statistics with S」(2002年)、Springer、第4版。ISBN 0-387-95457-0。
- ^ Lohaka, HO (2007). 「グループ化されたデータの頻度表の作成: 反復アルゴリズムの開発と検討」. オハイオ大学博士論文. p. 87.
- ^ 「MathWorks:ヒストグラム」。
- ^ abc Scott, David W. (2009). 「スタージスの法則」. WIREs 計算統計. 1 (3): 303–306. doi :10.1002/wics.35. S2CID 197483064.
- ^ オンライン統計教育: マルチメディア学習コース (http://onlinestatbook.com/)。プロジェクト リーダー: David M. Lane、ライス大学 (第 2 章「分布のグラフ化」、セクション「ヒストグラム」)
- ^ Doane DP (1976) 美的頻度分類。アメリカ統計学者、30: 181–183
- ^ Scott, David W. (1979). 「最適ヒストグラムとデータに基づくヒストグラムについて」. Biometrika . 66 (3): 605–610. doi :10.1093/biomet/66.3.605.
- ^ 「Excel:ヒストグラムを作成する」。
- ^ Terrell, GRおよびScott, DW, 1985. 過剰平滑化ノンパラメトリック密度推定値。アメリカ統計学会誌、80(389)、pp.209-214。
- ^ デヴィッド・フリードマン;ディアコニス、P. (1981)。 「密度推定器としてのヒストグラムについて: L2 理論」(PDF)。Zeitschrift für Wahrscheinlichkeitstheorie および Verwandte Gebiete。57 (4): 453–476。CiteSeerX 10.1.1.650.2473。土井:10.1007/BF01025868。S2CID 14437088。
- ^ ワッサーマン、ラリー(2004)。統計学のすべて。ニューヨーク:シュプリンガー。p.310。ISBN 978-1-4419-2322-6。
- ^ Stone, Charles J. (1984). 「漸近的に最適なヒストグラム選択ルール」(PDF) . Jerzy Neyman と Jack Kiefer を記念したバークレー会議の議事録。
- ^ Shimazaki, H.; Shinomoto, S. (2007). 「時間ヒストグラムのビンサイズを選択する方法」. Neural Computation . 19 (6): 1503–1527. CiteSeerX 10.1.1.304.6404 . doi :10.1162/neco.2007.19.6.1503. PMID 17444758. S2CID 7781236.
- ^ Jack Prins、Don McCormack、Di Michelson、Karen Horrell。「カイ二乗適合度検定」。NIST /SEMATECH 統計手法の電子ハンドブック。NIST/SEMATECH。p. 7.2.1.1 。 2019年3月29日閲覧。
- ^ Moore, David (1986). 「3」。D'Agostino, Ralph、Stephens, Michael (編)。適合度テクニック。ニューヨーク、ニューヨーク、米国: Marcel Dekker Inc. p. 70。ISBN 0-8247-7487-6。
- ^ 確率分布と密度関数の計算機
- ^ ヒストグラムと確率密度関数の図解
さらに読む
- ランカスター、HO医療統計学入門。ジョン・ワイリー・アンド・サンズ。1974年。ISBN 0-471-51250-8
外部リンク
- ヒストグラムの探究、アラン・ルンツァーとアメリア・マクナマラによるエッセイ
- 通勤経路と勤務地(例で引用した国勢調査文書の場所)
- 少数のサンプルからの信号と画像の滑らかなヒストグラム
- ヒストグラム: 外部リンクと素粒子物理学への応用による構築、分析、理解。
- ヒストグラムのビンサイズを選択する方法
- ヒストグラム: 理論と実践、上記で導き出されたビン幅の概念のいくつかをわかりやすく図示しています。
- ヒストグラムを正しく使う
- インタラクティブなヒストグラムジェネレーター
- きれいなヒストグラムをプロットする Matlab 関数
- MS Excel の動的ヒストグラム
- Java アプレットを使用したヒストグラムの構築と操作、およびSOCR上のチャート
- 最高のヒストグラムを作成するためのツールボックス 2017-10-24 にWayback Machineでアーカイブされました
