経験的統計法則、または(一般的には)統計法則とは、多数のデータセット、そして実際にはさまざまなタイプのデータセットにわたって見出された行動様式を表すものです。[ 1 ]これらの観察結果の多くは、統計的または確率的定理として定式化され証明されており、「法則」という用語はこれらの定理にも引き継がれています。経験的観察から明らかに導き出されたものではないものの、名前に「法則」を含む他の統計的および確率的定理も存在します。しかし、どちらのタイプの「法則」も、統計学の分野における科学法則の一例とみなすことができます。経験的統計法則と形式的統計定理を区別するのは、これらのパターンが、データに関する事前の理論的推論なしに、自然分布に単純に現れるという点です。
こうしたよく知られた「統計の法則」はいくつか存在する。
パレートの法則は、そのような「法則」の代表的な例です。これは、結果の約 80% は原因の 20% から生じるという法則で、80/20 ルールとも呼ばれています。[ 2 ]ビジネスでは、80/20 ルールは、ビジネスの 80% は顧客のわずか 20% から得られるということを意味します。[ 3 ]ソフトウェア エンジニアリングでは、エラーの 80% はバグのわずか 20% によって引き起こされるとよく言われます。[ 4 ]世界の 20% が世界の GDP の約 80% を生み出しています。[ 5 ]米国の医療費の 80% は人口の 20% によって発生しています。[ 6 ]
言語学の「経験的統計法則」と称されるジップの法則[ 7 ]もその一例です。この「法則」によれば、テキストのデータセットが与えられた場合、単語の出現頻度はその出現頻度順位に反比例します。つまり、2番目に頻繁に出現する単語は、最も頻繁に出現する単語の約半分の頻度で出現し、5番目に頻繁に出現する単語は、最も頻繁に出現する単語の約5倍の頻度で出現します。しかし、ジップの法則が単なる言語学の定理ではなく「経験的統計法則」である所以は、この法則が言語学以外の現象にも適用される点にあります。例えば、米国の都市人口の順位リストもジップの法則に従います[ 8 ]し、忘却でさえジップの法則に従います[ 9 ] 。このように、いくつかの自然データのパターンを単純なルールで要約する行為は、これらの「経験的統計法則」の決定的な特徴です。
経験的に着想を得た統計法則で、確固たる理論的根拠を持つものの例としては、以下のようなものがある。
根拠が弱い「法律」の例としては、以下のようなものがある。
理論的な背景を持つというよりは、より一般的な観察結果である「法則」の例:
誤っているとされる「法律」の例としては、以下のようなものがある。