エコー抑制とエコーキャンセルは、電話通信において、エコーの発生を防いだり、既に発生したエコーを除去したりすることで音声品質を向上させるための手法です。エコー抑制は、主観的な音声品質の向上に加え、通信ネットワークを伝わるエコーを防ぐことで、無音抑制によって得られる通信容量を増加させます。エコー抑制装置は、通信に衛星が初めて利用されるようになった1950年代に開発されました。
エコー抑制およびエコーキャンセル方法は、一般的に音響エコー抑制(AES)および音響エコーキャンセル(AEC)と呼ばれ、まれにラインエコーキャンセル(LEC)と呼ばれることもあります。音響エコー(スピーカーからの音がマイクロホンで反射・録音され、時間とともに大きく変化する)やラインエコー(送信線と受信線の間の結合、インピーダンスの不整合、電気的反射などによって発生する電気パルス[ 1 ]で、音響エコーよりも変化が少ない)など、エコーの種類や原因によってそれぞれ固有の特性を持つものがあるため、これらの用語の方がより正確な場合もあります。ただし、実際には、すべての種類のエコーを処理するために同じ技術が使用されるため、音響エコーキャンセラーは音響エコーだけでなくラインエコーもキャンセルできます。特にAECは、音響エコー、ラインエコー、またはその両方を対象としているかどうかに関わらず、エコーキャンセラー全般を指すのに一般的に使用されます。
エコーサプレッサーとエコーキャンセラーは、発話者が自分の声の反響を聞かないようにするという点で目的は似ているものの、使用する方法は異なります。
ITU規格G.168およびP.340は、それぞれデジタルおよびPSTNアプリケーションにおけるエコーキャンセラーの要件と試験について規定している。
電話において、エコーとは、自分の声が反射してしばらくしてから聞こえる音のことです。遅延がかなり大きい場合(数百ミリ秒以上)、不快に感じられます。遅延が非常に小さい場合(数十ミリ秒以下[ 3 ] )、この現象はサイドトーンと呼ばれます。遅延がやや長く、約50ミリ秒の場合、人間はエコーを明確な音として聞き取ることはできず、コーラス効果として聞こえます。[ 3 ]
通信黎明期には、エコー抑制は人間のユーザーにとって不快なエコーを軽減するために用いられていました。一方が話し、もう一方が聞き、両者が交互に話すという流れです。エコー抑制器は、どちらの方向が主方向であるかを判断し、その方向の信号を優先的に伝送します。一方、逆方向の信号はエコーであると想定し、減衰器を用いてあらゆる信号を遮断または抑制します。エコー抑制器はエコーを効果的に処理しますが、この方式にはいくつかの問題点があり、通話の両者にとって煩わしいものとなる可能性があります。
これに対し、ベル研究所は1960年代初頭にエコーキャンセラー理論を開発し[ 4 ] [ 5 ]、その結果、1960年代後半には実験室用エコーキャンセラーが、1980年代には商用エコーキャンセラーが開発されました[ 6 ] 。エコーキャンセラーは、話者の信号からエコーの推定値を生成し、その推定値を戻り経路から差し引くことで機能します。この技術では、エコーを効果的にキャンセルするのに十分な精度の信号を生成するために適応フィルタが必要です。エコーは、途中でさまざまな種類の劣化により元の信号と異なる場合があります。AT&Tベル研究所で発明されて以来[ 5 ]、エコーキャンセレーションアルゴリズムは改良され、洗練されてきました。すべてのエコーキャンセリングプロセスと同様に、これらの最初のアルゴリズムは、必然的に伝送経路に再入力される信号を予測し、それをキャンセルするように設計されていました。
デジタル信号処理の急速な進歩により、エコーキャンセラーはより小型でコスト効率の良いものになりました。1990年代には、エコーキャンセラーはスタンドアロンデバイスとしてではなく、音声交換機(Northern Telecom DMS-250 )に初めて組み込まれました。エコーキャンセレーションが交換機に直接統合されたことで、通話ごとにエコーキャンセラーを確実にオン/オフできるようになり、音声通話とデータ通話用に別々のトランクグループを用意する必要がなくなりました。今日の電話技術では、小型または携帯型の通信機器にソフトウェア音声エンジンを介してエコーキャンセラーが採用されることが多く、このエンジンは音響エコーまたは遠端のPSTNゲートウェイシステムによって発生する残留エコーのいずれかをキャンセルします。このようなシステムは通常、最大64ミリ秒の遅延でエコー反射をキャンセルします。

エコーキャンセレーションの処理は以下のとおりです。
エコーキャンセラーの主な課題は、遠端信号に適用するフィルタの応答特性を決定し、結果として得られる近端エコーに似せることです。フィルタは基本的に、スピーカー、マイクロフォン、および部屋の音響特性のモデルです。近端スピーカーとマイクロフォンの特性は一般的に事前にわからないため、エコーキャンセラーは適応型である必要があります。近端の部屋の音響特性も一般的に事前にわかっておらず、変化する可能性があります(たとえば、マイクロフォンがスピーカーに対して移動した場合、または人が部屋の中を歩き回って音響反射が変化する場合)。[ 2 ] [ 7 ]遠端信号を刺激として使用することで、最新のシステムは適応フィルタを使用し、約 200 ms でキャンセルなしから 55 dB のキャンセルに収束することができます。
多くの用途において、エコーキャンセレーションだけでは不十分な場合があります。エコーキャンセレーションとエコーサプレッションを組み合わせることで、許容できる性能を実現できます。
エコーは次のように測定されます。エコーリターンロス(ERL)。これは、元の信号とそのエコーのデシベルで表したものです。 [ 8 ]値が高いほどエコーは非常に弱く、値が低いほどエコーは非常に強いことを意味します。負の値は、エコーが元の信号よりも強いことを示し、これを放置すると音声フィードバックが発生します。
エコーキャンセラーの性能は、エコーリターンロスエンハンスメント(ERLE)[ 3 ] [ 9 ]で測定されます。これは、エコーキャンセラーによって適用される追加の信号損失の量です。ほとんどのエコーキャンセラーは、18~35 dBのERLEを適用できます 。
反響音の発生源は、日常生活の様々な場面で見られます。例えば、以下のようなものです。
こうしたケースの中には、スピーカーからの音がほとんど変化せずにマイクロフォンに入力されるものもあります。エコー除去の難しさは、周囲の空間によって元の音が変化してしまうことに起因します。こうした変化には、特定の周波数が布張りの家具に吸収されたり、異なる周波数の音が様々な強さで反射されたりすることが含まれます。
AEC(自動エミッション制御)の実装には、高度なエンジニアリング技術と高速プロセッサ(通常はデジタル信号プロセッサ(DSP))が必要です。この処理能力のコストは高額になる可能性がありますが、多くの組み込みシステムには既に完全な機能を持つAECが搭載されています。
音声入力を受け付けるスマートスピーカーや対話型音声応答システムは、音声プロンプト再生中にAEC(自動エコーキャンセレーション)を使用し、システム自身の音声認識機能がエコーされたプロンプトやその他の出力を誤って認識するのを防ぎます。
標準的な電話回線では、音声の送受信に同じ一対の電線を使用するため、送信信号のごく一部が反射して戻ってきます。これは、電話で話している人にとっては、自分の声がシステムを通して届いていることを相手に知らせる信号となるため便利です。しかし、この反射信号はモデムにとって問題となります。モデムは、遠隔地のモデムからの信号と自身の信号のエコーを区別できないためです。
このため、初期のダイヤルアップモデムは信号周波数を分割し、両端の機器が異なるトーンを使用することで、それぞれが送信に使用している周波数帯域内の信号を無視できるようにしていた。しかし、この方法では両側で利用できる帯域幅が減少するという問題があった。
エコーキャンセレーションによってこの問題は軽減されました。通話設定とネゴシエーションの間、両方のモデムはそれぞれ固有のトーンを送信し、電話システムを通して戻ってくるトーンを待ちます。合計遅延時間を測定し、同じ時間だけ遅延線を設定します。接続が完了すると、通常どおり電話回線に信号を送信すると同時に、遅延線にも信号を送信します。信号が反射して戻ってくると、遅延線からの反転信号と混合され、エコーが打ち消されます。これにより、両方のモデムが利用可能な全周波数帯域を使用でき、通信速度が2倍になりました。
エコーキャンセレーションは多くの通信事業者によって回線自体にも適用されており、信号を改善するどころかデータの破損を引き起こす可能性があります。一部の電話交換機やコンバータ(アナログ端末アダプタなど)は、ITU-T勧告G.164またはG.165に従って、そのような通話に関連付けられた2100Hzまたは2225Hzの応答トーンを検出すると、 エコー抑制またはエコーキャンセレーションを無効にします。
標準ツイストペア電話線上で音声帯域を超える周波数で動作するISDNおよびDSLモデムも、同時双方向データ通信を可能にするために自動エコーキャンセレーションを利用します。送信信号がデジタルビットストリームであるため、適応フィルタの実装における計算複雑度は音声エコーキャンセレーションに比べて大幅に軽減されます。フィルタの各タップに対して乗算と加算演算を行う代わりに、加算のみが必要となります。RAMルックアップテーブルに基づくエコーキャンセレーション方式[ 11 ] [ 12 ]では、切り詰められた送信ビットストリームでメモリをアドレス指定してエコー推定値を取得するだけで、加算演算さえも不要になります。エコーキャンセレーションは現在、デジタル信号プロセッサ(DSP)技術で一般的に実装されています。
モデムによっては、エコーキャンセレーションを不要にするために、受信周波数と送信周波数を別々に使用したり、送信と受信に別々のタイムスロットを割り当てたりするものがあります。電話ケーブルの設計限界を超える高周波数では、ブリッジタップや不完全なインピーダンス整合により、著しい減衰歪みが生じます。その結果、エコーキャンセレーションでは補正できない、深く狭い周波数ギャップが発生することがよくあります。これらのギャップは、接続ネゴシエーション中に検出され、マッピングされます。