一般的な形式は、2つの幾何学的次元を持つグラフです。1つの軸は時間 を表し、もう1つの軸は周波数を表します。特定の時間における特定の周波数の 振幅 を示す3つ目の次元は、画像内の各点の強度 または色によって表されます。
グラフの形式にはさまざまなバリエーションがあります。縦軸と横軸を入れ替えて、時間が上下に流れるようにしたり、振幅を色や強度ではなく3Dサーフェスの高さで表すウォーターフォールプロット にしたりすることもあります。周波数軸と振幅軸は、グラフの用途に応じて、線形 または対数になります。音声は通常、振幅軸が対数(おそらく デシベル 、またはdB)で表され、周波数は、調和関係を強調するために線形、または音楽的、音調的関係を強調するために対数になります。
これはバイオリン演奏の録音 のスペクトログラムです。基本周波数の整数倍の周波数で倍音が発生していることに注目してください。
楽曲の一部分の3D表面スペクトログラム。
男性の声で「タタタ」と言っているときのスペクトログラム。
イルカの鳴き声のスペクトログラム。さえずり、クリック音、ハーモニーは、それぞれ逆V字、垂直線、水平縞として表示される。
FM 信号のスペクトログラム。この場合、信号
周波数は 正弦 波状の周波数対時間プロファイルで変調されている。
上図は8MHz幅の
PAL -Iテレビ信号のスペクトル、下図はウォーターフォール(スペクトログラム)です。
重力波(
GW170817 )の 定Q スペクトログラム。
3つの口笛音のスペクトログラムとウォーターフォール図。
マウントレーニア国立公園 の
音環境生態系 のスペクトログラム。様々な生物や航空機の音が強調表示されている。
スペクトログラム(フリーウェアのSonogram visible Speechで生成)。
ピアノコードの
可変Q変換スペクトログラム( FFmpeg のshowcqtフィルターを使用して生成)。
超低周波音録音の音響スペクトログラフィー 30301
世代 光のスペクトログラムは、光学分光計 を用いて時間経過とともに直接作成することができる。
スペクトログラムは、時間領域 信号から2つの方法で作成できます。1つは、一連のバンドパスフィルタ から得られるフィルタバンクとして近似する方法(これは、現代のデジタル信号処理が登場する以前の唯一の方法でした)、もう1つは、フーリエ変換 を使用して時間信号から計算する方法です。これら2つの方法は、実際には2つの異なる時間周波数表現 を形成しますが、いくつかの条件下では同等になります。
バンドパスフィルタ方式では、通常、アナログ 処理を用いて入力信号を周波数帯域に分割します。各フィルタの出力の大きさによって、スペクトログラムを紙に画像として記録するトランスデューサが制御されます。[ 3 ]
FFTを用いたスペクトログラムの作成はデジタル処理です。 時間領域 でデジタルサンプリングされた データは、通常は重なり合うチャンクに分割され、各チャンクの周波数スペクトルの振幅を計算するためにフーリエ変換されます。各チャンクは画像内の垂直線に対応し、特定の時点(チャンクの中点)における振幅と周波数の関係を表します。これらのスペクトルまたは時間プロットは、画像または3次元表面を形成するために「並べて」配置されるか[ 4 ] 、ウィンドウ処理 など様々な方法でわずかに重ね合わされます。この処理は基本的に、信号の短時間フーリエ変換(STFT)の 振幅 の二乗を計算することに相当します。s ( t ) {\displaystyle s(t)} つまり、窓の幅に対してω {\displaystyle \omega } 、s p e c t r o g r 1 m ( t 、 ω ) = | S T F T ( t 、 ω ) | 2 \displaystyle \mathrm {スペクトログラム} (t,\omega )=\left|\mathrm {STFT} (t,\omega )\right|^{2}} [ 5 ]
限界と再合成 上記の式から、スペクトログラムには、それが表す信号の正確な位相 、あるいは近似位相に関する情報さえ含まれていないことがわかります。このため、このプロセスを逆にしてスペクトログラムから元の信号のコピーを生成することはできませんが、正確な初期位相が重要でない状況では、元の信号の有用な近似を生成することは可能です。分析および再合成サウンドスペクトログラフ[ 6 ] は、これを試みるコンピュータプログラムの一例です。パターン再生は、1940年代後半に ハスキンズ研究所 で設計された初期の音声合成装置で、音声の音響パターンの画像(スペクトログラム)を音に変換します。
実際、スペクトログラムには位相情報が含まれていますが、それは瞬時周波数 の双対である時間遅延(または 群遅延 )という別の形で現れます。[ 7 ]
解析ウィンドウのサイズと形状は変更可能です。ウィンドウが小さい(短い)ほど、タイミングの精度は向上しますが、周波数表現の精度は低下します。ウィンドウが大きい(長い)ほど、周波数表現の精度は向上しますが、タイミング表現の精度は低下します。これは、 2つの共役変数 の精度の積が定数以上である(通常の表記では B*T>=1)というハイゼンベルクの不確定性 原理の一例です。 [ 8 ]
アプリケーション 初期のアナログスペクトログラムは、鳥の鳴き声(シジュウカラ など)の研究を含む幅広い分野に適用され、現在の研究は最新のデジタル機器を使用して継続され[ 9 ] 、すべての動物の音に適用されています。デジタルスペクトログラムの現代的な使用は、動物の鳴き声の周波数変調 (FM)の研究に特に役立ちます。具体的には、FMチャープ、広帯域クリック 、社会的調和の識別特性は、スペクトログラムを使用すると最も簡単に視覚化できます。スペクトログラムは、言語障害の克服や、重度の聴覚障害を 持つ人々の言語訓練に役立つ。[ 10 ] 音声学 や音声合成 の研究は、スペクトログラムの使用によって促進されることが多い。[ 11 ] [ 12 ] 深層学習を用いた音声合成では、まずseq2seqモデルによってスペクトログラム(またはメルスケール のスペクトログラム)が予測され、次にそのスペクトログラムがニューラルボコーダーに入力されて合成された生の波形が生成されます。 スペクトログラムを生成するプロセスを逆に行うことで、スペクトログラムが任意の画像である信号を作成することが可能です。この技術は、音声の中に画像を隠すために使用でき、いくつかの電子音楽 アーティストによって採用されています。[ 13 ] ステガノグラフィー も参照してください。 現代音楽の中には、スペクトログラムを中間媒体として用いるものがあります。これは、異なる周波数の強度を時間とともに変化させたり、あるいはスペクトログラムを描画して逆変換することで新しい周波数を作り出したりするものです。オーディオのタイムスケール・ピッチ変更 と位相ボコーダー を参照してください。 スペクトログラムは、フィルタなどの信号プロセッサにテスト信号を通した結果を分析し、その性能を確認するために使用できます。[ 14 ] 高解像度スペクトログラムは、RFおよびマイクロ波システムの開発に使用されます。[ 15 ] スペクトログラムは現在、ベクトルネットワークアナライザで測定された散乱パラメータを表示するために使用される。 [ 16 ] 米国地質調査所 とIRISコンソーシアムは、 地震観測所を監視するためのほぼリアルタイムのスペクトログラム表示を提供している。[ 17 ] [ 18 ] スペクトログラムは、音声認識 のためのリカレントニューラルネットワーク で使用できます。[ 19 ] [ 20 ] 振動信号の場合、スペクトログラムの色スケールは、波形の振幅ピークの周波数を時間経過とともに識別します。時間グラフや周波数グラフとは異なり、スペクトログラムはピーク値を時間と周波数に関連付けます。振動試験エンジニアは、スペクトログラムを使用して連続波形の周波数成分を分析し、強い信号の位置を特定し、振動挙動が時間とともにどのように変化するかを判断します。[ 21 ] スペクトログラムは、2つの異なる用途で音声を分析するために使用できます。1つは、人工内耳使用者の音声障害の自動検出、もう1つは、音素クラス認識による音素属性特徴の抽出です。[ 22 ] 話者の発音の特徴を得るために、一部の研究者は、短時間のスペクトログラムの線形重ね合わせから話者の発音の安定した表現を与える特徴的なスペクトログラムを得るためにスペクトログラム統計を使用するバイオニクスのアイデアに基づいた方法を提案した。[ 23 ] 研究者らは、スペクトログラム技術を活用することで、ECG信号解析への新しいアプローチを模索しており、視覚化と理解の向上を目指している可能性がある。特徴抽出にMFCCを統合することで、音声処理 の手法を借用して生体信号から関連情報を抽出する、学際的な応用が示唆される。[ 24 ] 温度指示塗料(TIP)の正確な解釈は、航空およびその他の産業用途において非常に重要です。TIPの2Dスペクトログラムは温度解釈に使用できます。[ 25 ] スペクトログラムは、人間の胸郭の変化率の信号を処理するのに使用できます。スペクトログラムを使用して呼吸信号を視覚化することにより、研究者らはニューラルネットワークモデルに基づいて呼吸状態を分類するアプローチを提案しました。[ 26 ]
参考文献 ↑ JL フラナガン著『音声分析、合成、知覚』、シュプリンガー・フェルラーク、ニューヨーク、1972年 ↑ Sejdic, E.; Djurovic, I.; Stankovic , L. (2008年8月). "瞬時周波数推定器としてのスケーログラムの定量的性能分析". IEEE Transactions on Signal Processing . 56 (8): 3837–3845 . Bibcode : 2008ITSP...56.3837S . doi : 10.1109/TSP.2008.924856 . ISSN 1053-587X . S2CID 16396084 . ↑ 「分光器」 。www.sfu.ca 。 2018年 4月7日 取得 。 ↑ 「スペクトログラム」 . ccrma.stanford.edu . 2018年 4月7日 取得 。 ↑ 「STFTスペクトログラムVI – NI LabVIEW 8.6ヘルプ」 。zone.ni.com 。 2018年 4月7日 取得 。 ↑ 「分析と再合成サウンドスペクトログラフ」 。arss.sourceforge.net 。 2018年 4月7日 取得 。 ↑ Boashash, B. (1992). "信号の瞬時周波数の推定と解釈。I. 基礎". Proceedings of the IEEE . 80 (4). Institute of Electrical and Electronics Engineers (IEEE): 520–538 . doi : 10.1109/5.135376 . ISSN 0018-9219 . ↑ 「ハイゼンベルクの不確定性原理」 。 2019年1月25日に オリジナル からアーカイブ済み 。 2019年2月5日 に取得。 ↑ 「南トスカーナ(トスカーナ州、イタリア)の鳥の鳴き声とスペクトログラム(ソノグラム)」 。 www.birdsongs.it 。 2018年 4月7日 取得 。 ↑ Saunders, Frank A.; Hill, William A.; Franklin, Barbara (1981年12月1日). 「重度の 聴覚障害児のための装着型触覚補助具」. Journal of Medical Systems . 5 (4): 265–270 . doi : 10.1007/BF02222144 . PMID 7320662. S2CID 26620843 . ↑ 「スペクトログラムの読み方」 。ogi.edu 。 1999年4月27日の オリジナル からアーカイブ済み 。 2018年 4月7日 取得。 ↑ 「Praat: コンピュータによる音声学」 。www.fon.hum.uva.nl 。 2018年 4月7 日 取得 。 ↑ 「The Aphex Face – bastwood」 。www.bastwood.com 。 2018年 4月7日 取得 。 ↑ 「SRC比較」 . src.infinitewave.ca . 2018年 4月7日 取得 。 ↑ "constantwave.com – constantwaveのリソースと情報" . www.constantwave.com . 2018年 4月7日 取得 . ↑ 「ベクトルネットワークアナライザ用スペクトログラム」 。 2012年8月10日に オリジナル からアーカイブされました。 ↑ 「リアルタイムスペクトログラム表示」 。earthquake.usgs.gov 。 2018年 4月7日 取得 。 ↑ "IRIS: MUSTANG: ノイズスペクトログラム: ドキュメント: v. 1: ヘルプ" . ↑ Geitgey, Adam (2016-12-24). "機械学習は楽しい パート6: ディープラーニングで音声認識を行う方法" . Medium . 2018-03-21 に取得 . ↑ Praat も参照してください。 ↑ 「スペクトログラムとは何か?」 。 2023年12月18日 取得 。 ↑ T., Arias-Vergara; P., Klumpp; JC, Vasquez-Correa; E., Nöth; JR, Orozco-Arroyave; M., Schuster (2021). "深層学習法を用いた音声処理アプリケーションのためのマルチチャネルスペクトログラム" . Pattern Analysis and Applications . 24 (2): 423– 431. doi : 10.1007/s10044-020-00921-5 . ↑ ジア、ヤンジエ。チェン、シー。ユウ、ジエキョン。王、梁明。徐元哲。リュウ、シャオジン。王永輝(2021)。 「特徴的なスペクトログラムと改良された自己組織化特徴マップ ニューラル ネットワークに基づく話者認識」 。 複雑かつインテリジェントなシステム 。 7 (4): 1749 ~ 1757 年。 土井 : 10.1007/s40747-020-00172-1 。 ↑ Yalamanchili, Arpitha; Madhumathi, GL; Balaji, N. (2022). "MFCC特徴抽出技術を用いたECG信号のスペクトログラム解析と分類効率" . Journal of Ambient Intelligence and Humanized Computing . 13 (2): 757–767 . doi : 10.1007/s12652-021-02926-2 . S2CID 233657057 . ↑ Ge, Junfeng; Wang, Li; Gui, Kang; Ye, Lin (2023年9月30日). "スペクトログラムに基づく温度指示塗料の温度解釈方法" . Measurement . 219 . Bibcode : 2023Meas..21913317G . doi : 10.1016/j.measurement.2023.113317 . S2CID 259871198 . ↑ Park, Cheolhyeong; Lee, Deokwoo (2022年2月11日). "畳み込みニューラルネットワークを用いたスペクトログラムによる呼吸状態の分類" . Applied Sciences . 12 (4): 1895. doi : 10.3390/app12041895 .
外部リンク お使いのコンピューターのマイクで録音された音声やその他の音のスペクトログラムをオンラインで確認できます。 スペクトログラムが任意のテキストと一致する音列をオンラインで生成する スペクトログラムが任意の画像である信号を作成する方法に関する詳細情報 ソフトウェアスペクトログラムの開発について解説した記事 スペクトログラムの歴史と計測機器の開発 言語学教授が発行する月刊ミステリースペクトログラム誌に掲載されている スペクトログラムから、単語を特定する方法。 Sonogram Visible Speechは、信号ファイルのスペクトログラム生成のためのGPLライセンスのフリーウェアです。