音声信号処理は、信号処理の一分野であり、音声信号の電子的な操作を扱う。音声信号は、空気中を伝わる縦波である音波を電子的に表現したものであり、圧縮と膨張から構成される。
音声信号はデジタル形式とアナログ形式の両方で表現できるため、処理はどちらの領域でも行うことができます。アナログプロセッサは電気信号を直接処理するのに対し、デジタルプロセッサはデジタル表現に対して数学的な処理を行います。
音声信号処理の動機は、20 世紀初頭に電話、蓄音機、ラジオなどの発明によって音声信号の送信と保存が可能になったことから始まった。初期のラジオ放送では、スタジオから送信機へのリンクに多くの問題があったため、音声処理が必要だった。[ 1 ]信号処理の理論とその音声への応用は、20 世紀半ばにベル研究所で主に開発された。クロード・シャノンとハリー・ナイキストによる通信理論、サンプリング理論、パルス符号変調(PCM) に関する初期の研究が、この分野の基礎を築いた。1957 年、マックス・マシューズがコンピュータから音声を合成した最初の人物となり、コンピュータ音楽が誕生した。
デジタルオーディオ符号化とオーディオデータ圧縮における主要な発展には、1950年にベル研究所のC.チャピン・カトラーによる差分パルス符号変調(DPCM)[ 2 ] 、1966年に板倉文忠(名古屋大学)と斎藤修三(日本電信電話)による線形予測符号化(LPC) [ 3 ]、1973年にベル研究所のP.カミスキー、ニキル・S・ジャヤント、ジェームズ・L・フラナガンによる適応型DPCM(ADPCM)[ 4 ] [ 5 ]、1974年にナシル・アーメド、T.ナタラジャン、KR・ラオによる離散コサイン変換(DCT)符号化[6] 、1987年にサリー大学のJP・プリンセン、AW・ジョンソン、AB・ブラッドリーによる修正離散コサイン変換(MDCT)符号化[ 7 ]などがある。LPCは知覚オーディオ符号化の基礎であり、広く普及している。音声符号化に使用されている[ 8 ]一方、MDCT符号化はMP3 [ 9 ]やAdvanced Audio Coding(AAC)[ 10 ]などの最新の音声符号化フォーマットで広く使用されている。
アナログ音声信号は、空気中の音波に類似した、電気的な電圧または電流で表される連続信号です。アナログ信号処理とは、電気回路を介して電圧、電流、または電荷を変化させることによって、この連続信号を物理的に変化させる処理です。
歴史的に見ると、デジタル技術が広く普及する以前は、アナログ信号処理が信号を操作する唯一の方法でした。その後、コンピュータとソフトウェアの性能向上と価格の手頃化に伴い、デジタル信号処理が主流となりました。しかし、音楽分野においては、アナログ技術は依然として好まれる場合が多く、デジタルフィルターでは再現が難しい非線形応答を生み出すことがあるためです。
デジタル表現では、音声波形を記号のシーケンス(通常はバイナリ数)として表現します。これにより、デジタル信号プロセッサ、マイクロプロセッサ、汎用コンピュータなどのデジタル回路を使用した信号処理が可能になります。デジタル信号処理の技術はアナログ領域の信号処理よりもはるかに強力で効率的であるため、ほとんどの最新のオーディオシステムはデジタル方式を採用しています。[ 11 ]
処理方法および応用分野には、ストレージ、データ圧縮、音楽情報検索、音声処理、位置特定、音響検出、伝送、ノイズキャンセリング、音響フィンガープリンティング、音声認識、合成、および強調(等化、フィルタリング、レベル圧縮、エコーおよびリバーブの除去または追加など)が含まれます。
音声信号処理は、音声信号の忠実度を高めたり、帯域幅や遅延を最適化したりするために、音声信号の放送に用いられます。この分野において、最も重要な音声処理は送信機の直前で行われます。ここで用いられる音声プロセッサは、過変調を防止または最小限に抑え、非線形送信機(中波および短波放送で発生する可能性のある問題)を補正し、全体の音量を所望のレベルに調整する必要があります。
アクティブノイズコントロールは、不要な音を低減するために設計された技術です。不要なノイズと同一の信号で、かつ極性が逆のものを生成することで、2つの信号が破壊的干渉によって相殺されます。
音声合成とは、電子的に音声信号を生成する技術です。この技術を実現する楽器をシンセサイザーと呼びます。シンセサイザーは、既存の音を模倣することも、新しい音を生成することもできます。音声合成は、音声合成を用いて人間の音声を生成するためにも利用されます。
オーディオエフェクトは、楽器やその他の音源の音を変化させます。一般的なエフェクトには、エレクトリックブルースやロック音楽でエレキギターによく使われるディストーション、音量に影響を与えるボリュームペダルやコンプレッサーなどのダイナミックエフェクト、周波数帯域を変更するワウペダルやグラフィックイコライザーなどのフィルター、コーラス、フランジャー、フェイザーなどのモジュレーションエフェクト、ピッチシフターなどのピッチエフェクト、そして残響音を作り出し、さまざまな空間の音を模倣するリバーブやディレイなどのタイムエフェクトがあります。
ミュージシャン、オーディオエンジニア、レコードプロデューサーは、ライブパフォーマンスやレコーディングスタジオでエフェクトユニットを使用し、通常はエレキギター、ベースギター、電子キーボード、または電子ピアノで使用します。エフェクトは、電気楽器や電子楽器で最も頻繁に使用されますが、アコースティック楽器、ドラム、ボーカルなど、あらゆるオーディオソースで使用できます。 [ 12 ] [ 13 ]
コンピュータ聴覚(CA)または機械聴覚は、機械による音声解釈のためのアルゴリズムとシステムの研究の一般的な分野です。 [ 14 ] [ 15 ]機械が「聞く」とはどういうことかという概念は非常に広範でやや曖昧であるため、コンピュータ聴覚は、元々は特定の問題を扱っていた、または具体的な応用を念頭に置いていたいくつかの分野を統合しようとしています。Technology Reviewのインタビューを受けたエンジニアのParis Smaragdis氏は、これらのシステムについて、「音を使用して部屋の中を移動する人の位置を特定したり、機械の故障が差し迫っていることを監視したり、交通カメラを起動して事故を記録したりするソフトウェア」と述べています。[ 16 ]
人間の聴覚モデルに触発されたCAは、コンピュータによる音声信号や音楽信号に対するインテリジェントな操作を実行するために、表現、変換、グループ化、音楽知識の使用、一般的な音の意味論の問題を扱います。技術的には、これには信号処理、聴覚モデリング、音楽知覚と認知、パターン認識、機械学習の分野からの手法の組み合わせと、音楽知識表現のためのより伝統的な人工知能の手法が必要です。[ 17 ] [ 18 ]
{{cite book}}: CS1 maint: 複数の名前: 著者リスト (リンク)