ソースフィルタモデルは、音声を声帯などの音源と、声道などの線形音響フィルタの組み合わせとして表現します。このモデルは近似に過ぎませんが、比較的単純であるため、音声合成や音声分析などの多くのアプリケーションで広く使用されています。また、線形予測とも関連しています。このモデルの開発は、主にグンナー・ファントの初期の研究によるものですが、ケン・スティーブンスをはじめとする他の人々も、音声の音響分析と音声合成の基礎となるモデルに大きく貢献しています。[ 1 ]ファントは、母音の音響特性と声道の形状の関係を初めて示した千葉勉と梶山正人の研究に基づいています。 [ 1 ]
ソースフィルタモデルを使用する際によく行われる重要な仮定は、ソースとフィルタの独立性である。このような場合、モデルはより正確には「独立ソースフィルタモデル」と呼ばれるべきである。[ 1 ]
1942年、千葉と梶山は、母音の音響と声道の研究を著書『母音:その性質と構造』で発表した。X線写真を用いて声道のモデルを作成することで、彼らはさまざまな母音のフォルマント周波数を予測し、両者の関係を確立することができた。音声科学者の先駆者であるグンナー・ファントは、千葉と梶山の声道のX線写真に関する研究を利用して、自身のロシア語音声データを解釈し、 『音声生成の音響理論』の中で音源・フィルタモデルを確立した。[ 2 ]
さまざまな程度で、異なる音素は、その音源の特性とスペクトル形状によって区別できます。有声音(母音など)は、主に周期的な声門励起による少なくとも1つの音源を持ち、これは時間領域ではインパルス列、周波数領域では高調波によって近似でき、また、たとえば舌の位置や唇の突出に依存するフィルタによって近似できます。[ 3 ]一方、[s]や[f]などの摩擦音は、口腔または咽頭の狭窄で発生する乱流ノイズによる少なくとも1つの音源を持ちます。いわゆる有声摩擦音([z]や[v]など)は、声門と声門上狭窄の2つの音源を持ちます。
音声生成のソース・フィルタモデルを実装する際、音源、すなわち励起信号は、有声音声の場合は周期的なインパルス列、無声音声の場合はホワイトノイズとしてモデル化されることが多い。声道フィルタは、最も単純な場合、全極フィルタで近似され、その係数は、再生する音声信号の平均二乗誤差を最小化するように線形予測を行うことで得られる。励起信号とフィルタ応答の畳み込みによって、合成音声が生成される。

人間の発話において、音源は声帯であり、声帯が収縮すると周期的な音を、弛緩すると非周期的な(ホワイトノイズ)音を発することができる。[ 4 ]フィルターは声道の残りの部分であり、咽頭、口、鼻腔の操作によって形状を変えることができる。[ 3 ]ファントは、音源とフィルターをそれぞれ発声と発音に大まかに比較している。音源は振幅の異なる多数の倍音を生成し、それが声道を通って伝わり、増幅または減衰されて音声が生成される。[ 4 ]