音楽情報検索(MIR)は、音楽から情報を抽出する学際的な科学です。MIRに関わる人々は、音楽学、音響心理学、心理学、信号処理、情報科学、機械学習、光学的音楽認識、計算知能などの学術的なバックグラウンドを持つ場合もあれば、これらの組み合わせを持つ場合もあります。
音楽情報検索は、企業や研究者によって、音楽の分類、操作、さらには創作にも利用されている。
音楽情報検索(MIR)における古典的な研究テーマの一つにジャンル分類があり、これは音楽アイテムをクラシック、ジャズ、ロックなど、あらかじめ定義されたジャンルのいずれかに分類するものです。ムード分類、アーティスト分類、楽器識別、音楽タグ付けなども人気の高いテーマです。
音楽のレコメンデーションシステムは既にいくつか存在するが、驚くべきことに、ユーザー間の類似性や手間のかかるデータ収集ではなく、MIR(音楽情報検索)技術に基づいているものはごくわずかだ。例えば、 Pandoraは専門家を使って、「女性歌手」や「力強いベースライン」といった特定の特性を音楽にタグ付けしている。他の多くのシステムは、リスニング履歴が似ているユーザーを見つけ出し、それぞれのコレクションからまだ聴いたことのない音楽をユーザーに提案する。音楽における類似性のためのMIR技術は、こうしたシステムの一部となりつつある。
音楽ソース分離とは、混合オーディオ信号から元の信号を分離することです。楽器認識とは、音楽に含まれる楽器を識別することです。マスターコピーにアクセスすることなく音楽を構成要素となるトラックに分離できる様々なMIRシステムが開発されています。例えば、この方法によって通常の音楽トラックからカラオケトラックを作成できますが、ボーカルが他の楽器と同じ周波数帯域の一部を占めているため、このプロセスはまだ完璧ではありません。
自動音楽転写とは、音声録音を楽譜やMIDIファイルなどの記号表記に変換するプロセスです。[ 1 ]このプロセスには、複数の音高の検出、開始点の検出、持続時間の推定、楽器の識別、および和声、リズム、または旋律情報の抽出など、いくつかの音声分析タスクが含まれます。このタスクは、楽器の数が増え、ポリフォニーのレベルが高くなるにつれて難しくなります。
音楽の自動生成は、多くのMIR研究者が掲げる目標である。しかし、その結果を人間が評価するという点では、これまで限られた成功しか収めていない。
楽譜は、作業の出発点となる音楽を明確かつ論理的に記述するものですが、デジタルか紙かを問わず、楽譜へのアクセスはしばしば非現実的です。 [ 2 ] MIDI音楽も同様の理由で使用されてきましたが、音楽がMIDI規格を念頭に置いて作曲されていない限り、他の形式からMIDIへの変換で一部のデータが失われます。これは稀です。WAV 、mp3、oggなどのデジタルオーディオ形式は、オーディオ自体が分析の一部である場合に使用されます。mp3やoggなどの非可逆形式は人間の耳にはよく合いますが、研究に重要なデータが欠落している可能性があります。さらに、一部のエンコーディングは、自動分析器を誤解させる可能性のあるアーティファクトを生成します。にもかかわらず、mp3の普及により、この分野の多くの研究は、これらをソース素材として使用しています。ますます、ウェブからマイニングされたメタデータが、文化的文脈における音楽のより包括的な理解のためにMIRに組み込まれており、最近では、音楽のソーシャルタグの分析が含まれています。
分析には要約が必要となる場合が多く[ 3 ]、音楽(他の多くのデータ形式と同様に)の場合、特に音声コンテンツ自体を分析し、機械学習を適用する場合には、特徴抽出によって要約が行われます。その目的は、膨大な量のデータを扱いやすい値のセットに減らし、妥当な時間枠内で学習を実行できるようにすることです。抽出される一般的な特徴の1つは、楽曲の音色を測定するメル周波数ケプストラム係数(MFCC)です。その他の特徴は、楽曲のキー、コード、ハーモニー、メロディー、主音高、1分あたりの拍数、リズムなどを表すために使用できます。利用可能な音声特徴抽出ツールは多数あります[ 4 ] 。