Loading article…
| 開発者 |
|
|---|---|
| 初回リリース | 2022年12月15日 |
| リポジトリ | github.com/hmartiro/riffusion-inference |
| 書かれた | パイソン |
| タイプ | テキストから画像へのモデル |
| ライセンス | MITライセンス |
| Webサイト | 翻訳: |
Riffusionは、Seth ForsgrenとHayk Martirosによって設計されたニューラルネットワークで、オーディオではなくサウンドの画像を使用して音楽を生成します。[1]これは、スペクトログラム上のテキストプロンプトから画像を生成する既存のオープンソースモデルであるStable Diffusionを微調整して作成されました。[1]これにより、テキストプロンプトを使用して画像ファイルを生成し、逆フーリエ変換を実行してオーディオファイルに変換できるモデルが作成されました。[2]これらのファイルの長さは数秒しかありませんが、モデルは出力間の潜在空間を使用して、異なるファイルを補間することもできます。 [1] [3]これは、 img2imgと呼ばれるStable Diffusionモデルの機能を使用して実現されます。[4]
結果として得られた音楽は「 de otro mundo」(異世界の)と評されているが[5]、人間の作った音楽に取って代わる可能性は低い。[5]このモデルは2022年12月15日に公開され、コードはGitHubでも無料で入手できる。[2]これは、安定拡散から派生した多くのモデルのうちの1つである。[4]
Riffusionは、AIテキスト音楽生成器のサブセットに分類されます。2022年12月、Mubert [6]は同様にStable Diffusionを使用して説明文を音楽ループに変換しました。2023年1月、GoogleはMusicLMと呼ばれる独自のテキスト音楽生成器に関する論文を発表しました。[7] [8]
参考文献
- ^ abc Coldewey、Devin(2022年12月15日)。「音楽を視覚化して作曲するAIモデル『Riffusion』を試してみよう」。
- ^ ab ナシ、ミケーレ (2022 年 12 月 15 日)。 「リフフュージョン: 人工知能による音声の追跡」。IlSoftware.it。
- ^ “Essayez "Riffusion", un modèle d'IA qui compose de la musique en la Visualisant". 2022 年 12 月 15 日。
- ^ ab "文章に沿った楽曲を自動生成してくれるAI「Riffusion」登場、画像生成AI「Stable Diffusion」ベースで誰でも自由に利用可能".ギガジン。 2022 年 12 月 16 日。
- ^ ab リャノ、エウトロピオ (2022 年 12 月 15 日)。 「AI のイメージを生成し、音楽を制作します (con resultados de otro mundo)」。
- ^ 「MubertがText-to-Musicインターフェースを発表 – 単一のテキストプロンプトから音楽を生成するまったく新しい方法」2022年12月21日。
- ^ 「MusicLM: テキストから音楽を生成する」。2023年1月26日。
- ^ 「Google の MusicLM AI テキスト音楽アプリが他と違う 5 つの理由」2023 年 1 月 27 日。
