合成データとは、現実世界の出来事によって生成されたものではない、人工的に生成されたデータのことです。通常、アルゴリズムを使用して作成される合成データは、数理モデルの検証や機械学習モデルのトレーニングに利用できます。[ 1 ]
コンピュータシミュレーションによって生成されるデータは、合成データとみなすことができる。これは、音楽シンセサイザーやフライトシミュレーターなど、物理モデリングのほとんどの応用例に当てはまる。こうしたシステムの出力は現実のものに近似しているが、完全にアルゴリズムによって生成される。
合成データは、さまざまな分野で、そうでなければデータの特定の側面の機密性を損なう可能性のある情報をフィルタリングするために使用されます。多くの機密性の高いアプリケーションでは、データセットは理論的には存在しますが、一般に公開することはできません。[ 2 ]合成データは、許可や補償なしに実際の消費者情報を使用することから生じるプライバシーの問題を回避します。
合成データは、元の実際のデータには見られない特定のニーズや条件を満たすために生成されます。複雑な科学的タスクに最新の機械学習アプローチを適用する際の障害の 1 つは、ラベル付きデータの不足です。このギャップは、実際の実験データを忠実に再現する合成データを使用することで効果的に埋められます。[ 3 ]これは、理論値に基づくシミュレーションからデータベースプロセッサなど、多くのシステムを設計する際に役立ちます。これにより、情報処理の制限などの予期しない問題を検出して解決することができます。合成データは、多くの場合、実際のデータを表現するように生成され、ベースラインを設定できます。[ 4 ]合成データのもう 1 つの利点は、テストシステムでの使用を可能にしながら、実際のデータのプライバシーと機密性を保護することです。
コンピュータセキュリティの専門家は、生成された合成データによって「ユーザーと攻撃者の現実的な行動プロファイルを作成できる」と主張しています。このデータは不正検出システム自体のトレーニングに使用され、特定の環境へのシステムの必要な適応が実現されます。[ 4 ]防衛および軍事の文脈では、合成データは、特に高品質の実世界データが少ない状況において、複雑なAIシステムを開発および改善するための潜在的に価値のあるツールと見なされています。[ 5 ]同時に、合成データはテストアプローチと組み合わせることで、現実世界のシナリオをモデル化する能力を与えることができます。
物理システムの科学的モデリングは、物理学の歴史と並行して長い歴史を持っています。例えば、音声合成の研究は1930年代以前にまで遡ることができ、電話や音声録音技術の発展によって推進されました。デジタル化は1970年代以降、ソフトウェアシンセサイザーの登場につながりました。
プライバシー保護統計分析の文脈において、1993年にドナルド・ルービンによって完全合成データという概念が考案された。[ 6 ]ルービンは当初、国勢調査の長文回答を短文回答世帯向けに合成するためにこれを設計した。その後、彼は実際の長文回答記録を含まないサンプルを公開し、世帯の匿名性を維持した。[ 7 ]同年後半、リトルによって部分合成データという概念が考案された。リトルはこの概念を用いて、公開用ファイルの機密値を合成した。[ 8 ]
1993年の研究[ 9 ]では、60,000個のMNIST数字に統計モデルを適合させ、それを用いて100万個以上のサンプルを生成した。これらのサンプルは、最先端の性能を達成するためにLeNet-4のトレーニングに使用された。 [ 10 ]: 173
1994年、スティーブン・フィーンバーグは、ベイズブートストラップの代わりにパラメトリック事後予測分布を使用してサンプリングを行う「クリティカル・リファインメント」を導入した。[ 7 ]その後、合成データ生成の開発に大きく貢献した人物として、トリヴェロール・ラグナサン、ジェリー・ライター、ドナルド・ルービン、ジョン・M・アボウド、ジム・ウッドコックらがいる。彼らは共同で、欠損データを含む部分的に合成されたデータの処理方法に関する解決策を考案した。同様に、彼らは逐次回帰多変量補完法を開発した。[ 7 ]
研究者たちは、合成データでフレームワークをテストします。これは、「アルゴリズムのパフォーマンスを客観的に評価できる唯一のグラウンドトゥルースのソース」です。[ 11 ]
合成データは、異なる方向と開始位置を持つランダムな線を使用して生成できます。[ 12 ]データセットはかなり複雑になることがあります。より複雑なデータセットは、シンセサイザービルドを使用して生成できます。シンセサイザービルドを作成するには、まず元のデータを使用して、データに最もよく適合するモデルまたは方程式を作成します。このモデルまたは方程式は、シンセサイザービルドと呼ばれます。このビルドを使用して、さらに多くのデータを生成できます。[ 13 ]
シンセサイザーの構築には、統計モデルの構築が含まれます。線形回帰直線の例では、元のデータをプロットし、データから最適な線形直線を作成できます。この直線は、元のデータから作成されたシンセサイザーです。次のステップは、シンセサイザーの構築またはこの線形直線の方程式から、より多くの合成データを生成することです。このようにして、新しいデータは研究や調査に使用でき、元のデータの機密性を保護します。 [ 13 ]
知識発見研究所の David Jensen 氏は、合成データを生成する方法について次のように説明しています。「研究者は、特定のデータ特性がデータモデルに与える影響を調査する必要が頻繁にあります。」[ 13 ]自己相関や次数不一致などの特定の特性を示すデータセットの構築を支援するために、近接性は、いくつかのタイプのグラフ構造のいずれかを持つ合成データを生成できます。ランダムプロセスによって生成されるランダムグラフ、リング構造を持つ格子グラフ、グリッド構造を持つ格子グラフなどです。 [ 13 ] すべての場合において、データ生成プロセスは同じプロセスに従います。
あるオブジェクトの属性値は、関連するオブジェクトの属性値に依存する可能性があるため、属性生成プロセスでは値をまとめて割り当てます。[ 13 ]
不正検出システムと機密保持システムのテストとトレーニングは、合成データを使用して考案されます。現実的なデータを作成するために特定のアルゴリズムとジェネレータが設計され、[ 14 ]これにより、システムが特定の状況や基準にどのように反応するかを学習するのに役立ちます。たとえば、侵入検知ソフトウェアは合成データを使用してテストされます。このデータは実際のデータの表現であり、実際のデータには見られない侵入事例が含まれる場合があります。合成データにより、ソフトウェアはこれらの状況を認識し、それに応じて反応することができます。合成データが使用されない場合、ソフトウェアは実際のデータによって提供される状況にのみ反応するようにトレーニングされ、他の種類の侵入を認識できない可能性があります。[ 4 ]
臨床試験やその他の研究を行う研究者は、将来の研究や試験の基準値を作成するために、合成データを生成することがある。
実際のデータには、研究者が公開したくない情報が含まれている可能性があるため、[ 15 ]データセットのプライバシーと機密性を保護するために合成データが使用されることがあります。合成データには個人情報が含まれておらず、個人に遡って追跡できないため、合成データを使用すると機密性とプライバシーの問題が軽減されます。
プライバシー保護に加えて、合成データは医薬品開発における方法論的革新のためにも研究されています。例えば、合成データは、実世界データ(RWD)やランダム化比較試験(RCT)に基づく従来の外部対照群の代替として、合成対照群を構築するために使用できます。FDAやEMAなどの規制当局は、AIによって生成された合成データを認識して方法論に統合する段階がそれぞれ異なっているようです。このようなデータがモデル開発や医薬品のライフサイクル全体をサポートする可能性についてはコンセンサスが高まっていますが、これまでのところ、合成データのみ、または主に合成データを使用して承認された医薬品や医療機器はありません。特に、データ駆動型アルゴリズムによって完全に生成された比較対照群として使用された医薬品や医療機器はありません。合成データの品質と統計的処理は、将来の規制に関する議論において、特に予測モデリング(デジタルツインなど)のような文脈において、より重要になると予想されます。これらの分野では、すでに革新的なアプローチが参照されています。[ 16 ]
合成データは機械学習アプリケーションでますます使用されるようになっています。モデルは、実データへの転移学習を目的として、合成的に生成されたデータセットでトレーニングされます。Synthetic Data Vault などの汎用合成データジェネレーターを構築することで、より多くのデータサイエンス実験を可能にするための取り組みが行われてきました。 [ 17 ]一般的に、合成データにはいくつかの自然な利点があります。
この合成データの使用は、コンピュータビジョンアプリケーション、特に物体検出(合成環境は物体の3Dモデルである)[ 18 ]、および視覚情報による環境ナビゲーションの学習に提案されている。
大規模言語モデルのトレーニングにおいては、合成データ生成がトレーニング後のパイプラインの中核的な要素となっています。Self-Instruct のように、人間が書いた 175 個の小さなシードセットを使用して 52,000 個の合成指示に従う例を生成する技術や、Persona Hub のように、多様な指示生成のために 10 億を超える合成ペルソナを生成する技術により、人間の注釈付けのわずかなコストで大規模なトレーニングデータセットを作成することが可能になりました。[ 19 ]
同時に、転移学習は依然として容易ではない問題であり、合成データはまだ普及していません。研究結果によると、少量の実データを追加すると、合成データを使用した転移学習が大幅に改善されます。敵対的生成ネットワーク(GAN)の進歩により、データを生成してトレーニングに使用できるという自然なアイデアが生まれました。少なくとも2016年以降、このような敵対的トレーニングは、生成された合成データに実データを再混合する必要もなく、一部のドメインで最先端の結果を生み出すのに十分な品質の合成データを生成するために成功裏に使用されています。[ 20 ]
1987年、Navlabの自律走行車は、トレーニング方法の1つとして1200枚の合成道路画像を使用した。[ 21 ]
2021年、マイクロソフトは(500の実際の顔)に基づいて10万の合成顔のデータベースを公開し、「実際のデータと精度で一致する」と主張した。[ 21 ] [ 22 ]
2023年、Nature(学術誌)は、プロジェクトの「人工世界観」のキム・アルブレヒトがデザインしたNature's 10シリーズの表紙を掲載した。 [ 23 ]この表紙には、知識のカテゴリーに関してChatGPTから生成された18,000を超える合成データポイントのマッピングが特徴となっている。
DataFramerはHugging Faceにデータセットを公開しており、その中には合成マルチファイル患者履歴データセットであるehr-multi-file-patient-samples [ 24 ]や、保険電話のフェーズ検出とコンプライアンス検証のための対話データセットであるINSURE-Dial [ 25 ]などがある。