数値列は、認識可能なパターンや規則性を含まない場合に統計的にランダムであると言われます。理想的なサイコロの出目やπの桁などの数列は、統計的ランダム性を示します。[ 1 ]
統計的ランダム性は、必ずしも「真の」ランダム性、すなわち客観的な予測不可能性を意味するものではありません。擬似ランダム性は、統計学など多くの用途において十分なので、統計的ランダム性という名称が付けられています。
全体的なランダム性と局所的なランダム性は異なります。ランダム性に関する哲学的概念のほとんどは全体的なものです。なぜなら、特定の部分列がランダムに見えなくても、「長期的には」列全体が真にランダムに見えるという考えに基づいているからです。たとえば、十分な長さの「真に」ランダムな数列では、全体としてはランダムであっても、同じ数字が繰り返される長い列が存在する可能性が高いです。局所的なランダム性とは、ランダムな分布が近似される最小数列長が存在するという考え方を指します。同じ数字が長く続くと、たとえ「真に」ランダムなプロセスによって生成されたものであっても、サンプルの「局所的なランダム性」が低下します(たとえば、10,000個の数字の列でのみ局所的にランダムになる可能性があり、1,000個未満の数列では全くランダムに見えない可能性があります)。
パターンを示す数列は、それによって統計的にランダムではないと証明されるわけではない。ラムゼイ理論の原理によれば、十分に大きな物体は必ず特定のサブ構造を含んでいるはずである(「完全な無秩序は不可能」)。
乱数の最初の検定は、1938年にMGケンドールとバーナード・バビントン・スミスによって王立統計学会誌に発表されました。 [ 2 ]これらは、実験現象が理論上の確率と一致するかどうかを区別するために開発されたピアソンのカイ二乗検定などの統計的手法に基づいています。ピアソンは、 WFRウェルドンによる多数のサイコロ実験が「ランダム」な挙動を示さないことを示すことによって、この検定を開発しました。
ケンドールとスミスが最初に考案した4つの検定は仮説検定であり、帰無仮説として、与えられたランダムな数列の各数字は等しい確率で出現し、データ内の他の様々なパターンも等確率で分布するはずだという考えに基づいていた。
ある数列が、一定の有意水準(一般的には5%)内でこれらのテストすべてに合格した場合、彼らの言葉を借りれば「局所的にランダム」であると判断された。ケンドールとスミスは、「局所的ランダム性」と「真のランダム性」を区別した。真のランダムな方法で生成された多くの数列は、一定の程度まで「局所的ランダム性」を示さない可能性がある。非常に大きな数列には、1桁の数字が並んだ行が多数含まれる場合がある。これは数列全体のスケールでは「ランダム」かもしれないが、より小さなブロックでは「ランダム」ではなく(彼らのテストに合格しない)、多くの統計的応用には役に立たない。
乱数セットがますます一般的になるにつれて、より高度なテストが使用されるようになりました。現代のテストの中には、乱数を3次元平面上の点としてプロットし、それを回転させて隠れたパターンを探すものもあります。1995年、統計学者のジョージ・マルサグリアは、 50億個の擬似乱数を収録したCD-ROMとともに配布している「ダイハードテスト」と呼ばれる一連のテストを作成しました。2015年には、ヨンゲ・ワンが統計的に距離に基づいた乱数テスト用のJavaソフトウェアパッケージ[ 3 ]を配布しました。
擬似乱数生成器は、真のランダムなプロセスではなく決定論的なアルゴリズムによって生成されるため、その「ランダム性」を検証するための唯一の方法としてテストが必要です。乱数生成の歴史において、テストでは「ランダム」に見えると考えられていた多くの数値源が、特定の種類のテストを受けると非常に非ランダムであることが判明しています。準乱数の概念は、これらの問題の一部を回避するために開発されましたが、擬似乱数生成器は、ほとんどのアプリケーションにとって「十分」であるため、多くのアプリケーション(極めて「非ランダム」であることが知られているものも含めて)で依然として広く使用されています。
その他の検査: