Datasaurus 12 は、小数点以下 2 桁までほぼ同じ単純な記述統計量を持つが、分布が大きく異なり、グラフ化すると大きく異なるように見える13 のデータセットで構成されています。[ 1 ]これは、1973 年に作成されたより小規模なAnscombe 4 組に触発されたものです。
以下の表は、13個のデータセットすべてに関する要約統計量を示しています。

13個のデータセットには、以下のようにラベルが付けられました。
アンスコムの4つ組と同様に、データソーラスの12個組は、特定の関係の種類に従って分析を開始する前にデータセットをグラフィカルに見る重要性と、現実的なデータセットを記述するための基本的な統計的特性の不十分さをさらに示すために設計されました。[ 2 ] [ 3 ] [ 4 ] [ 5 ] [ 1 ] [ 6 ]

ティラノサウルスの形をした最初のデータセットは、 2016年にアルベルト・カイロによって構築され、これが「データサウルス」データセットの残りの部分に影響を与えた。[ 7 ] [ 8 ]マールテン・ランブレヒツはこのデータセットを「アンスコンボサウルス」とも呼ぶことを提案した。[ 7 ]
このデータセットには、 Autodeskの Justin Matejka と George Fitzmaurice によって作成された他の 12 個のデータセットが付属していました。データセットがどのように生成されたかが不明な Anscombe の 4 つのデータセットとは異なり、[ 9 ]著者らはシミュレーテッドアニーリングを使用してこれらのデータセットを作成しました。彼らは、目的の形状に向かって各点に小さくランダムで偏った変更を加えました。各形状の完成には 200,000 回の摂動の反復が必要でした。[ 1 ]
このアルゴリズムの擬似コードは以下のとおりです。
current_ds ← initial_ds x回の反復に対して、以下を実行する。 test_ds ← perturb(current_ds, temp) if similar_enough(test_ds, initial_ds): current_ds ← test_ds 関数 perturb(ds, temp): ループ: テスト ← move_random_points(ds) fit(test) > fit(ds) または temp > random() の場合: リターンテスト どこ
initial_dsシードデータセットはcurrent_dsこれはデータセットの最新バージョンですfit()これは、点の移動によって目的の形状に近づくかどうかをチェックするために使用される関数です。tempシミュレーテッドアニーリングアルゴリズムの温度similar_enough()これは、与えられた2つのデータセットの統計情報が十分に類似しているかどうかをチェックする関数です。move_random_points()データポイントをランダムに移動させる関数です