モデル、手法、アルゴリズム音響モデリング と言語モデリングは 、統計的手法に基づく音声認識アルゴリズムにおいて重要な要素です。隠れマルコフモデル(HMM)は多くのシステムで広く用いられています。言語モデリングは、文書分類 や統計的機械翻訳 など、他の多くの自然言語処理アプリケーションでも活用されています。
隠れマルコフモデル 音声認識システムはHMM(隠れマルコフモデル)に基づいています。HMMは、記号または量のシーケンスを出力する統計モデルです。音声信号は区分的定常信号または短時間定常信号とみなせるため、音声認識にHMMが用いられます。短い時間スケール(例えば10ミリ秒)では、音声は定常過程 として近似できます。音声は、多くの確率的目的においてマルコフモデル として考えることができます。
HMMは、自動的に学習でき、シンプルで計算が容易なため人気があります。HMMは、n 次元の実数値ベクトル(n は10などの整数)のシーケンスを10ミリ秒ごとに出力します。これらのベクトルは、短い音声ウィンドウのフーリエ変換 によって得られたケプストラム係数で構成され、 コサイン変換 を使用してスペクトルを非相関化し、最初の(最も重要な)係数を取得します。HMMは、各状態において、対角共分散ガウス 分布の混合である統計分布を持つ傾向があり、これにより、各観測ベクトルの尤度が得られます。各単語、または(より一般的な音声認識システムでは)各音素は 、異なる出力分布を持ちます。単語または音素のシーケンスに対するHMMは、個々の単語および音素に対して学習されたHMMを連結することによって作成されます。
音声認識システムは、結果を改善するために標準的な手法を組み合わせて使用します。典型的な大規模語彙システムでは、音素に文脈依存性を適用します(左右の文脈が異なる音素は、HMM状態として異なる実現値を持つことになります)。話者と録音条件を処理するためにケプストラム正規化 を使用します。男性と女性の正規化には声道長正規化(VTLN)を、より一般的な適応には 最尤線形回帰 (MLLR)を使用する場合があります。特徴量では、デルタ係数とデルタデルタ係数を使用して音声のダイナミクスを捉え、さらに異分散 線形判別分析(HLDA)を使用する場合があります。または、スプライシングとLDA ベースの射影を使用し、その後HLDAまたはグローバル半結合共分散変換(最尤線形変換 (MLLT)とも呼ばれる)を使用する場合があります。多くのシステムでは、HMMパラメータ推定に純粋に統計的なアプローチを使わず、代わりにトレーニングデータの分類関連の尺度を最適化する判別トレーニング手法を使用します。例としては、最大相互情報量 (MMI)、最小分類誤差(MCE)、最小音声誤差(MPE)などが挙げられる。
動的時間伸縮法(DTW)に基づく音声認識動的時間伸縮法は、かつて音声認識に用いられていたが、後にHMMに取って代わられた。
動的時間伸縮法(DTW)は、時間や速度が異なる2つのシーケンス間の類似性を測定します。例えば、ある動画では人がゆっくり歩いていて、別の動画では速く歩いていた場合や、1回の観察中に加速と減速があった場合でも、歩行パターンの類似性を検出できます。DTWは、動画、音声、グラフィックスなど、線形表現に変換できるあらゆるデータに適用されています。
これは、異なる発話速度の音声にも対応できます。一般的に、特定の制約の下で2つのシーケンス(例えば時系列)間の最適なマッチングを可能にします。シーケンスは互いに一致するように非線形に「歪め」られます。このシーケンスアライメント方法は、HMMの文脈でよく使用されます。
ニューラルネットワーク ニューラルネットワークは 1980年代後半に注目を集め、2010年代には主流となりました。ニューラルネットワークは、音素分類[ 75 ] 、多目的進化アルゴリズムによる音素分類[ 76 ] 、単語認識 [ 77 ] 、音声・映像による音声認識、音声・映像 による話者認識 、話者適応など、音声認識の多くの側面で使用されています。
ニューラルネットワークは、HMMよりも特徴の統計的特性に関する明示的な仮定が少ない。音声セグメントの確率を推定するために使用する場合、ニューラルネットワークは自然で効率的な識別トレーニングを可能にする。しかし、個々の音素や孤立した単語などの短時間単位の分類には効果的であるにもかかわらず、[ 78 ] 初期のニューラルネットワークは、時間的依存性をモデル化する能力が限られていたため、連続認識にはほとんど成功しなかった。
1つのアプローチは、特徴変換または次元削減にニューラルネットワークを使用することでした。[ 79 ] しかし、より最近では、LSTMおよび関連するリカレントニューラルネットワーク(RNN)[ 45 ] [ 49 ] [ 80 ] [ 81 ]、 時間遅延ニューラルネットワーク (TDNN)[ 82 ] 、およびトランスフォーマー[ 54 ] [ 55 ] [ 56 ] が性能の向上を示しました。
ディープフィードフォワードニューラルネットワークとリカレントニューラルネットワーク 研究者たちは、深層ニューラルネットワーク (DNN)とノイズ除去オートエンコーダ を研究している。[ 83 ] DNNは、入力と出力の間に複数の隠れ層を含む人工ニューラルネットワークの一種である。[ 59 ] より単純なニューラルネットワークと同様に、DNNは複雑な非線形関係をモデル化できる。しかし、そのより深いアーキテクチャにより、以前の層の特徴を組み合わせた、より洗練された表現を構築することができる。これにより、音声データ内の複雑なパターンを学習および認識する強力な能力が得られる。[ 84 ]
大規模語彙音声認識にDNNを使用する上で大きなブレークスルーが2010年に起こりました。産業界と学術界の協力により、研究者たちは決定木を使用して作成された文脈依存HMM状態に基づく大きな出力層を持つDNNを使用しました。[ 85 ] [ 86 ] [ 87 ] このアプローチはパフォーマンスを大幅に向上させました。[ 88 ] [ 89 ] [ 90 ]
ディープラーニングの根底にある考え方は、手動で設計された特徴量の必要性を排除し、入力データから直接学習することです。これは、生のスペクトログラムまたは線形フィルタバンク特徴量でトレーニングされたディープオートエンコーダを使用して最初に実証されました。[ 91 ] これらのモデルは、固定変換に依存する従来のメルケプストラム特徴量よりも優れた性能を発揮しました。最近では、波形が大規模な音声認識で優れた結果を達成できることが研究者によって示されました。[ 92 ]
アプリケーション
車載システム 音声コマンドは、電話をかけたり、ラジオ局を選択したり、音楽を再生したりするために使用できます。音声認識機能は、車のメーカーやモデルによって異なります。一部のモデルでは、自然言語音声認識機能が搭載されており、ドライバーは会話スタイルで完全な文章や一般的なフレーズを使用できます。このようなシステムでは、固定コマンドは必要ありません。[ 111 ]
健康管理
医療記録 医療分野では、音声認識は医療文書作成プロセスのフロントエンドまたはバックエンドに導入できます。フロントエンド音声認識では、医療従事者が音声認識エンジンに音声を録音し、認識された単語が画面に表示され、話者は文書の編集と承認を担当します。バックエンドまたは遅延音声認識では、医療従事者がデジタル音声入力 システムに音声を録音し、音声が音声認識マシンを経由して、音声ファイルとともに下書き文書が編集者に送られ、編集者が下書きと最終報告書を編集・確定します。
大きな問題は、2009 年米国復興・再投資法 ( ARRA ) が、 「有意義な利用」基準に準拠した電子健康記録 (EHR) を使用する医師に多額の財政的利益を提供していることです。これらの基準では、EHR に相当量のデータが保持されることが求められます。音声認識の使用は、放射線科/病理学の解釈、経過記録、または退院サマリーの一部として、物語形式のテキストを生成するのに自然に適しています。構造化された個別のデータ (たとえば、リストまたは統制語彙 からの数値またはコード) を入力するために音声認識を使用することによる人間工学的利点は、視覚がありキーボードとマウスを操作できる人にとっては比較的小さいです。
より重要な問題は、ほとんどの電子カルテシステムが音声認識機能を活用するように明確に設計されていないことです。臨床医が電子カルテシステムを操作する際の大部分は、キーボードとマウスに大きく依存するユーザーインターフェースの操作であり、音声によるナビゲーションは人間工学的なメリットをわずかにしか提供しません。これに対し、放射線科や病理科の音声入力用に高度にカスタマイズされたシステムの多くは、音声マクロを実装しています。例えば、「正常レポート」といった特定のフレーズを使用すると、多数のデフォルト値が自動的に入力されたり、検査の種類(放射線科システムの場合は胸部X線検査と消化管造影検査など)に応じて異なる定型文が生成されます。
軍隊
航空機 戦闘機 における音声認識の試験と評価には、多大な努力が注がれてきた。特に注目すべきは、先進戦闘機技術統合(AFTI) / F-16 戦闘機(F-16 VISTA )向けの米国における音声認識プログラム、 ミラージュ 戦闘機向けのフランスにおけるプログラム、そして様々な航空機プラットフォームを対象とした英国におけるプログラムである。これらのプログラムにおいて、音声認識装置は無線周波数の設定、自動操縦システムの制御、操舵点座標と兵器投下パラメータの設定、飛行表示装置の制御など、様々な用途で正常に動作している。
スウェーデンのパイロットが操縦するJAS-39 グリペンと共同で研究を行ったEnglund(2004)は、G負荷の 増加に伴い認識精度が低下することを報告した。この研究では、適応によって全てのケースで結果が大幅に改善され、呼吸モデルの導入により認識スコアが著しく向上することが示されたと結論付けた。予想に反して、話者の不完全な英語の影響は見られなかった。予想通り、自発的な発話は認識器に問題を引き起こした。したがって、語彙を制限し、何よりも適切な構文を用いることで、認識精度が大幅に向上することが期待できる。[ 128 ]
ユーロファイター タイフーンは 、各パイロットがテンプレートを作成する必要があるスピーカー依存型システムを採用しています。このシステムは、武器の投下や降着装置の降下など、安全上または武器上重要なタスクには使用されませんが、コックピットの多くの機能に使用されます。音声コマンドは、視覚的および/または聴覚的なフィードバックによって確認されます。このシステムは、パイロットの作業負荷 の軽減に大きな利点があると見なされており、[ 129 ] パイロットは2つの音声コマンドで目標を指定したり、5つのコマンドだけで僚機に目標を指定したりできます。[ 130 ]
話者独立システムは、F-35 ライトニング II (JSF) およびアレーニア・アエルマッキ M-346 マスター 戦闘機訓練機向けにテストされています。これらのシステムは、98% を超える単語精度スコアを達成しています。[ 131 ] [ 132 ]
航空交通管制 航空管制官 (ATC)の訓練は、音声認識システムの優れた応用例と言えるでしょう。現在、多くのATC訓練システムでは、訓練担当者が「擬似パイロット」役を務め、訓練中の管制官と音声対話を行うことで、実際のパイロットとの対話をシミュレートしています。音声認識および音声合成 技術は、擬似パイロット役を不要にする可能性を秘めており、訓練およびサポート要員の削減につながります。
理論上、航空管制官の業務は、主要な出力が高度に構造化された音声であるため、音声認識タスクの難易度は低くなります。しかし実際には、そうであることは稀です。FAA文書7110.65では、航空管制官が使用すべきフレーズが詳細に規定されています。この文書にはそのようなフレーズの例が150未満しか示されていませんが、あるシミュレーションベンダーの音声認識システムがサポートするフレーズの数は50万を超えています。
アメリカ空軍、アメリカ海兵隊、アメリカ陸軍、アメリカ海軍、FAA、およびオーストラリア空軍やイタリア、ブラジル、カナダの民間航空局などの国際的なATC訓練機関は、音声認識機能を備えたATCシミュレーターを使用しています。[ 133 ]
障害のある人々 音声認識プログラムは、障害のある人々に多くのメリットをもたらします。聴覚障害のある人や難聴の 人は、音声認識ソフトウェアを使用して会話の字幕 を作成できます。 [ 134 ] さらに、視覚障害のある人(「視覚障害と教育 」を参照)や視力の弱い人は、テキストコンテンツを聞くことでメリットを得られるだけでなく、音声でコマンドを発行することでコンピューターの機能をさらに活用できます。[ 135 ]
音声認識ソフトウェアをデジタルオーディオレコーダーとワープロソフトを実行するパーソナルコンピュータと組み合わせて使用することは、脳卒中を起こした人や開頭手術 を受けた人の損傷した短期記憶能力を回復させるのに有効であることが証明されている。
音声認識は、軽度の反復性ストレス障害から従来のコンピュータ入力デバイスの使用を妨げる障害まで、さまざまな原因で手を使うのが困難な人にとって非常に役立つことが証明されています。身体障害のある人は、音声コマンドと文字起こしを使用して、ハンズフリーで電子機器を操作できます。[ 135 ] 実際、キーボードの使用によってRSI を発症した人々は、音声認識の初期かつ緊急の市場となりました。[ 136 ] [ 137 ] 音声認識は、ボイスメールのテキスト化、リレーサービス 、字幕付き電話など、聴覚障害者向けの 電話 にも使用されています。思考を紙に書き出すコミュニケーションに苦労する学習障害のある人は、このソフトウェアから恩恵を受ける可能性がありますが、製品の不完全性は多くの人にとって依然として重要な考慮事項です。[ 138 ] さらに、音声テキスト変換技術は、適切なトレーニングとリソース(教室環境など)が提供された場合にのみ、知的障害のある人にとって効果的な支援となります。[ 139 ]
この種の技術は、失読症やその他の学習障害を 持つ人々に役立つ可能性があります。音声認識は、学習障害のある生徒の文章の質を向上させることがわかっています[ 140 ] 。手書きのサンプルと比較すると、音声認識を使用した学習障害のある生徒は、より速く[ 141 ] [ 142 ] 、より長く複雑な文章[ 142 ] を書き、エラーが少ないことがわかりました[143]。音声 認識を 使用すると、書くことに関連する不安 のレベルが低下するため、学習障害のある若い生徒の自尊心 [ 140 ]が上昇することがわかりました [ 144 ] 。生徒は、手書きと比較してソフトウェアを使用すると間違いが少なくなり、書くことに自信を持つようになります。聞き間違えた単語を修正するには時間がかかるため、ソフトウェアの間違いは効果を妨げます[ 145 ] 。聞き間違えた単語に戻って修正する必要があるという行為は、生徒が自分の間違いに気づいて修正するのに役立ちます。[ 141 ] これは、ユーザーのエラー認識能力を高めることが示されている。[ 144 ]
その他のドメイン ASR(自動音声認識)は現在、電話通信 分野で広く普及している。電話システムにおいては、ASRは主にIVR(自動音声応答 )システムと統合されたコンタクトセンターで利用されている。
コンピュータゲーム やシミュレーションの分野で、ますます普及しつつある。
一般的なパーソナルコンピュータにおけるワープロとの高度な統合にもかかわらず、文書作成の分野では、ASRの利用は期待されたほど増加していない。
モバイルプロセッサの速度向上により、スマートフォン における音声認識が実用的になった。音声は主にユーザーインターフェースの一部として、あらかじめ定義された音声コマンドやカスタム音声コマンドを作成するために利用されている。
音声認識システムの性能は、通常、精度と速度の観点から評価されます。[ 150 ] [ 151 ] 精度は通常、単語誤り率 (WER)で評価され、速度は経過時間で測定されます。精度の他の指標には、単語誤り率 (SWER)とコマンド成功率(CSR)があります。
音声認識は、音声の多くの特性によって複雑化します。発声は、アクセント、発音、構音、粗さ、方言、鼻音、ピッチ、音量、速度の点で異なります。音声は、背景雑音、反響、録音特性によって歪められます。音声認識の精度は、次の要因によって変化する可能性があります。[ 152 ] [ 153 ]
語彙の規模と混同しやすさ 話者依存性対話者独立性 孤立した、断続的な、または連続的な発話 タスクと言語の制約 朗読と自発的な発話 不利な状況
正確さ 音声認識の精度は、以下の要因によって変動する可能性があります。
例えば、「0」から「9」までの10個の数字はほぼ完璧に認識できますが、語彙サイズが200、5000、または100000の場合、それぞれ3%、7%、または45%のエラー率が発生する可能性があります。 紛らわしい文字が含まれている場合、語彙を認識するのは困難です。 例えば、英語のアルファベット 26文字は紛らわしい単語であるため区別が難しい(最も悪名高いのはEセット: "B、C、D、E、G、P、T、V、Z(地域によっては「Z」が「ゼッド」ではなく「ジー」と発音される))。この語彙では8%の誤り率が良好とみなされる。[ 154 ] 話者の依存性 vs. 話者の独立性: スピーカー依存型システムは、単一のスピーカーで使用することを想定しています。 話者非依存システムは、あらゆる話者が使用することを想定している(より困難)。[ 155 ] 孤立した、断続的な、または連続的な発話 単発話では単語が使われるため、聞き取りやすい。 断続発話では、文全体が沈黙によって区切られます。沈黙は、孤立した発話と同様に認識しやすいです。 連続音声では、自然な話し言葉の文章が使われるため、聞き取りにくくなります。 タスクと言語の制約は認識に役立つ可能性がある 申請者は、「リンゴは赤い」という仮説を却下する可能性がある。 制約は意味論的なものかもしれない。「リンゴは怒っている」という文を拒否する。 構文的; 「Red is apple the」を拒否します。 制約はしばしば文法によって表現される。 読み上げと即興スピーチ 人が読書をする際、通常は事前に準備された文脈の中で行われる。 人が自然に話す場合、認識は「えー」「あー」といった言い間違い、言い間違い、不完全な文、どもり、咳、笑いなどの流暢さの欠如や、限られた語彙に対処する必要がある。 不利な状況 環境騒音(例:自動車内や工場内)。 音響歪み(例:反響、室内音響) 音声認識は、多段階のパターン認識タスクである。
音響信号は、音素 、単語、句、文などの単位の階層構造に構成されている。各レベルでは、追加の制約が設けられています。例えば、既知の単語の発音や法的単語の並び順などがあり、下位レベルでのエラーや不確実性を補うことができます。 この制約の階層構造により精度が向上します。すべての下位レベルで確率的に決定を組み合わせ、最上位レベルで最終的な決定のみを行うことで、音声認識はいくつかのフェーズに分割されます。計算上、音声認識は、音のパターンを認識または人間にとって意味のあるカテゴリに分類する必要がある問題です。すべての音響信号は、より小さなサブ信号に分割できます。より複雑な音信号が分割されるにつれて、異なるレベルが作成され、最上位レベルでは下位レベルのより単純な音から構成される複雑な音が存在します。最下位レベルでは、より単純で確率的なルールが適用されます。これらの音は上位レベルでより複雑な音にまとめられ、より決定論的な新しいルールセットによって、複雑な音が何を表しているかが予測されます。決定論的なルールの上位レベルは、複雑な表現の意味を解明する必要があります。音声認識に関する知識を拡張するために、ニューラルネットワークを考慮する必要があります。ニューラルネットワークのアプローチでは、次の手順を使用します。
音声をデジタル化する – 電話音声の場合は、毎秒 8000 サンプルがキャプチャされます。[ 156 ] 音声のスペクトル領域の特徴を(フーリエ変換を用いて)計算します。10msごとに計算され、10msのセクションをフレームと呼びます。 音は空気(または他の媒体)の振動によって発生します。音は振幅 (強さ)と周波数 (1秒あたりの振動数)の2つの尺度を持つ波を生成します。[ 157 ] 精度はWERを使用して計算できます。WERは、動的文字列アライメントを使用して認識された単語と参照された単語を整列することによって計算されます。認識された単語と参照された単語のシーケンス長の違いにより、WERの計算中に問題が発生する可能性があります。
単語誤り率(WER)を計算する式は次のとおりです。
W E R = ( s + d + 私 ) n {\displaystyle WER={(s+d+i) \over n}}
ここで、 s は置換の数、d は削除の数、i は挿入の数、n は単語参照の数である。[ 158 ]
計算時には、単語認識率(WRR)が使用されます。その計算式は以下のとおりです。
W R R = 1 − W E R = ( n − s − d − 私 ) n = h − 私 n {\displaystyle WRR=1-WER={(nsdi) \over n}={hi \over n}} ここで、h は正しく認識された単語の数です。
h = n − ( s + d ) 。 {\displaystyle h=n-(s+d).}
安全 音声認識は、攻撃、盗難、または誤操作の手段となる可能性があります。たとえば、音声またはビデオ放送で「Alexa」などの起動ワードを発声すると、家庭やオフィスのデバイスが不適切に入力を聞き始めたり、意図しない動作を実行したりする可能性があります。[ 159 ] 音声制御デバイスは、不正なユーザーがアクセスできる可能性があります。攻撃者は、カレンダー、アドレス帳の内容、プライベートメッセージ、ドキュメントなどの個人情報にアクセスできる可能性があります。また、ユーザーになりすましてメッセージを送信したり、オンラインで購入したりすることもできます。
人工音を利用した2つの攻撃が実証されている。1つは超音波 を送信し、人々に気づかれずにコマンドを送信しようとするものである。[ 160 ] もう1つは、特定の音声認識システムを混乱させて音楽を音声として認識させたり、人間にはあるコマンドに聞こえるものをシステムには別のコマンドに聞こえるようにするために特別に作られた、他の音声や音楽に小さく聞こえない歪みを加えるものである。[ 161 ]
ジャーナル 主要な学術誌は、IEEE/ACM Transactions on Audio, Speech and Language Processing です。
本 ローレンス・ラビナー 著『音声認識の基礎』 (1993年)フレデリック・ジェリネク 著『音声認識のための統計的手法』 Xuedong Huang 他著『音声言語処理』 (2001年)マンフレッド・R・シュローダー 著『コンピュータ音声』 (2004年)音声処理:動的かつ最適化指向のアプローチ (Li DengおよびDoug O'Shaughnessey著、2003年)。ジュラフスキー とマーティンによる『音声と言語処理』 (2008年) 話者認識の基礎 – 理論と実践に関する最新の詳細情報を提供する詳細な資料。[ 162 ] 『機械の中の声:音声を理解するコンピュータの構築』 ( ロベルト・ピエラッチーニ 著、2012年)-序論自動音声認識:ディープラーニングアプローチ (Microsoft 研究者 D. Yu および L. Deng (2014)) – ディープラーニング手法の数学的アプローチは[ 88 ] ディープラーニング:メソッドとアプリケーション (L. DengおよびD. Yu著、2014年) – DNNベースの音声認識のメソッドに焦点を当てた概要[ 84 ]
プロジェクト 2007年時点で進行中の音声認識関連プロジェクトの中で最大規模だったのはGALEプロジェクトであり、音声認識と翻訳の両方の要素を含んでいる。
参考文献 ↑ 「音声認識とは? | IBM」 www.ibm.com 2021 年9月28日2025年 8月28日 閲覧 ↑ P. Nguyen (2010). 「話者特性の自動分類」. 国際通信電子会議 2010. pp. 147–152 . doi : 10.1109/ICCE.2010.5670700 . ISBN 978-1-4244-7055-6 . S2CID 13482115 . ↑ 「音声認識の英国英語の定義」 。マクミラン出版社。 2011年9月16日のオリジナルから アーカイブ。 2012年 2月21日 取得 。 ↑ 「音声認識の定義」 。WebFinance, Inc. 2011年12月3日にオリジナルから アーカイブ 。 2012年 2月21日 に取得。 ↑ 「The Mailbag LG #114」 。Linuxgazette.net。 2013年2月19日のオリジナルから アーカイブ済み 。 2013年 6月15日 取得。 ↑ Sarangi, Susanta; Sahidullah, Md; Saha, Goutam (2020年9月)「自動話者検証のためのデータ駆動型フィルタバンクの最適化」 Digital Signal Processing . 104 102795. arXiv : 2007.10729 . Bibcode : 2020DSP...10402795S . doi : 10.1016/j.dsp.2020.102795 . S2CID 220665533 . ↑ Reynolds, Douglas; Rose, Richard (1995 年 1 月)。 「ガウス混合話者モデルを使用した堅牢なテキスト非依存話者識別」 ( PDF) 。IEEE Transactions on Speech and Audio Processing 。3 ( 1): 72– 83。Bibcode : 1995ITSAP ...3 ... 72R 。doi : 10.1109/89.365379 。ISSN 1063-6676 。OCLC 26108901 。S2CID 7319345 。2014 年 3 月 8 日のオリジナルから アーカイブ (PDF) 。2014 年 2 月 21 日 取得 。 ↑ 「話者識別(WhisperID)」 。 Microsoft Research。Microsoft 。 2014年2月25日のオリジナルから アーカイブ。 2014年 2月21日 取得 。 誰かと話すとき、相手はあなたが言ったことだけでなく、あなたが誰であるかも認識します。WhisperIDは、コンピューターにもそれを可能にし、あなたの声の調子からあなたが誰であるかを判断します。 ↑ ミルズ、マラ;リー、シャオチャン(2019)。 「音声 の 特徴:音声識別から機械による音声認識へ」 。 テクノロジーと文化 。60 (2): 129–160。doi : 10.1353 /tech.2019.0066 。 2026年2 月 21日 取得 。 ↑ サディーン、アルハルビ。アルラズガン、ムナ;アラシド、アラウド。アルノマシ、トルキアイ;アルモジェル、ラガド。アルハルビ、リマ。アルハルビ、サジャ;アルトゥルキ、サハル州。アルシェリ、ファティマ。マハ、アルモジル(2021)。 「自動音声認識: 体系的な文献レビュー」 。 IEEE アクセス 。 9 : 131858–131876 。 Bibcode : 2021IEEEA...9m1858A 。 土井 : 10.1109/ACCESS.2021.3112535 。 ISSN 2169-3536 。 ↑ Li, Suo; You, Jinchi; Zhang, Xin (2022年8月)「音声認識の概要と分析」 2022 IEEE International Conference on Advances in Electrical Engineering and Computer Applications (AEECA) pp. 391–395 . doi : 10.1109 /AEECA55500.2022.9919050 . ISBN 978-1-6654-8090-1 。↑ 「訃報:スティーブン・バラシェク」 。 スター・レジャー紙 。2012年7月22日。 2019年4月4日にオリジナルから アーカイブ済み 。 2024年 9月9日 閲覧。 ↑ "IBM-Shoebox-front.jpg" . androidauthority.net。 2018年8月9日にオリジナルから アーカイブ済み 。 2019年 4月4日 に取得。 ↑ Juang, BH; Rabiner, Lawrence R. 「自動音声認識―技術開発の簡単な歴史」 (PDF) 。p. 6。 2014年8月17日のオリジナルから アーカイブ (PDF) 。 2015年 1月17日 取得 。 ↑ GUNNAR, FANT. 「音声生成の音響理論」 (PDF) . ストックホルム王立工科大学. 2025年 10月20日 取得 . 1 2 Melanie Pinola (2011年11月2日)。 「数十年にわたる音声認識:Siriに至るまで」 。PC World 。 2018年11月3日のオリジナルから アーカイブ。 2018年 10月22日 取得 。 ↑ Gray, Robert M. (2010). "パケットネットワークにおけるリアルタイムデジタル音声の歴史:線形予測符号化とインターネットプロトコルの第II部" (PDF) . Found. Trends Signal Process . 3 (4): 203– 303. doi : 10.1561/2000000036 . ISSN 1932-8346 . 2022年10月9日のオリジナルから アーカイブ (PDF) . 2024年 9月9日 取得 . ↑ John R. Pierce (1969). "音声認識の行方?". Journal of the Acoustical Society of America . 46 (48): 1049– 1051. Bibcode : 1969ASAJ...46.1049P . doi : 10.1121/1.1911801 . ↑ Raj, Reddy (1937年6月17日). "ACMチューリング賞" . Association for Computing Machinery . 2025年 10月20日 取得 . ↑ TK、ヴィンツィウク(1968年1月1日)。 「動的 計画法による音声識別」。サイバネティクス。4: 52–57。doi : 10.1007 / BF01074755 。 2025 年 10 月 20 日 取得 。 ↑ Benesty, Jacob; Sondhi, MM; Huang, Yiteng (2008). Springer Handbook of Speech Processing . Springer Science & Business Media. ISBN 978-3-540-49125-5 。↑ ジョン・マクール。 「ISCAメダリスト:音声および言語処理におけるリーダーシップと多大な貢献に対して」 。 2018年1月24日のオリジナルから アーカイブ。 2018年 1月23日 取得 。 ↑ Blechman, RO; Blechman, Nicholas (2008年6月23日). "Hello, Hal" . The New Yorker . 2015年1月20日のオリジナルから アーカイブ済み。 2015年 1月17日 閲覧 。 ↑ Klatt, Dennis H. (1977). "ARPA音声理解プロジェクトのレビュー". The Journal of the Acoustical Society of America . 62 (6): 1345–1366 . Bibcode : 1977ASAJ...62.1345K . doi : 10.1121/1.381666 . ↑ Rabiner (1984). "音響、音声、信号処理学会。歴史的展望" (PDF) 。 2017年8月9日のオリジナルから アーカイブ (PDF) 。 2018年 1月23日 取得 。 ↑ 「First-Hand:The Hidden Markov Model – Engineering and Technology History Wiki」 . ethw.org . 2015年1月12日。 2018年4月3日のオリジナルから アーカイブ済み。 2018年 5月1日 取得 。 1 2 「ジェームズ・ベイカーのインタビュー」 。 2017年8月28日にオリジナルから アーカイブ済み 。 2017年 2月9日 に取得。 ↑ 「先駆的な音声認識」 。2012年3月7日。 2015年2月19日に オリジナル からアーカイブ済み 。 2015年 1月18日 に取得。 ↑ Huang, Xuedong; Baker, James; Reddy, Raj (2014年1月) 「音声認識の歴史的展望」 Communications of the ACM . 57 (1): 94–103 . doi : 10.1145/2500887 . ISSN 0001-0782 . S2CID 6175701. 2023年12月8日に オリジナル からアーカイブ済み 。 ↑ Juang, BH; Rabiner, Lawrence R. 自動音声認識 ― 技術開発の簡単な歴史 (PDF) (レポート)。p. 10。 2014年8月17日のオリジナルから アーカイブ (PDF) 。 2015年 1月17日 取得 。 ↑ 李暁昌(2023年7月1日)。 」 「データが多いほど良いデータは ない」:自動音声認識とアルゴリズム文化 の 形成 」。Osiris。38: 165–182。doi : 10.1086 / 725132。ISSN0369-7827。S2CID 259502346 。 ↑ 「音声認識の歴史」 。Dragon Medical Transcription 。 2015年8月13日の オリジナルからアーカイブ済み。 2015年 1月17日 取得 。 ↑ ビリ、ロベルト。カナベシオ、フランコ。シアメラ、アルベルト。ルチアーノ、ネッビア(1995年11月1日)。 「対話型音声テクノロジーの活用: CSELT エクスペリエンス」 。 音声コミュニケーション 。 17 (3): 263–271 . 土井 : 10.1016/0167-6393(95)00030-R 。 1 2 Xuedong Huang; James Baker; Raj Reddy (2014 年 1 月)。 「音声認識の歴史的展望」 。Communications of the ACM。2015 年 1 月 20 日のオリジナルから アーカイブ。2015 年 1 月 20 日 取得 。 ↑ ケビン・マッキーン(1980年4月8日) 「コールが話すと、コンピューターが聞く」 サラソタ・ジャーナル。AP通信。 2015年 11月23日 閲覧 。 ↑ "ACT/Apricot - アプリコットの歴史" . actapricot.org . 2016年12月21日のオリジナルから アーカイブ済み 。 2016年 2月2日 に取得。 ↑ Melanie Pinola (2011年11月2日) 「数十年にわたる音声認識:Siriの誕生まで」 PC World 。 2017年1月13日のオリジナルから アーカイブ 。 2017年 7月28日 閲覧 。 ↑ 「レイ・カーツワイルの略歴」 。KurzweilAINetwork。 2014年2月5日のオリジナルから アーカイブ済み 。 2014年 9月25日 取得。 ↑ Juang, BH; Rabiner, Lawrence. 自動音声認識 – 技術開発の簡単な歴史 (PDF) (レポート)。 2017年8月9日のオリジナルから アーカイブ (PDF) 。 2017年 7月28日 取得 。 ↑ 「Nuanceの幹部がiPhone 4S、Siri、そして音声認識の未来について語る」 。Tech.pinions。2011年10月10日。 2011年11月19日のオリジナルから アーカイブ。 2011年 11月23日 閲覧 。 ↑ 「Switchboard-1 Release 2」 。 2017年7月11日にオリジナルから アーカイブ済み 。 2017年 7月26日 に取得。 ↑ Jason Kincaid (2011年2月13日) 「音声の力:Googleの音声技術責任者との対話」 TechCrunch 。 2015年7月21日のオリジナルから アーカイブ 。 2015年 7月21日 に取得 。 ↑ Froomkin, Dan (2015年5月5日). "コンピューターは盗聴している" . The Intercept . 2015年6月27日のオリジナルから アーカイブ済み 。 2015年 6月20日 取得。 ↑ Herve Bourlard およびNelson Morgan 、「Connectionist Speech Recognition: A Hybrid Approach」、The Kluwer International Series in Engineering and Computer Science; v. 247、ボストン: Kluwer Academic Publishers、1994 年。 1 2 Sepp Hochreiter ; J. Schmidhuber (1997). "Long Short-Term Memory". Neural Computation . 9 (8): 1735– 1780. doi : 10.1162/neco.1997.9.8.1735 . PMID 9377276 . S2CID 1915014 . ↑ Schmidhuber, Jürgen (2015) . "ニューラルネットワークにおける深層学習:概要". Neural Networks . 61 : 85–117 . arXiv : 1404.7828 . Bibcode : 2015NN.....61...85S . doi : 10.1016/j.neunet.2014.09.003 . PMID 25462637. S2CID 11715509 . ↑ Alex Graves、Santiago Fernandez、Faustino Gomez、 Jürgen Schmidhuber (2006)。Connectionist temporal classification: Labelling unsegmented sequence data with recurrent neural nets。Wayback Machine に 2024 年 9 月 9 日に アーカイブ済み。ICML'06 会議録、pp. 369–376。 ↑ Santiago Fernandez、Alex Graves、Jürgen Schmidhuber (2007)。リカレントニューラルネットワークの識別キーワード検出への応用。ICANN 会議録 (2)、pp. 220–229。 1 2 Haşim Sak、Andrew Senior、Kanishka Rao、Françoise Beaufays、Johan Schalkwyk (2015 年 9 月): " "Google 音声検索: より速く、より正確" . 2016 年 3 月 9 日の オリジナル からアーカイブ済み。2016 年 4 月 5 日 取得 。 。 ↑ ドソヴィツキー、アレクセイ。バイエル、ルーカス。コレスニコフ、アレクサンダー。ヴァイセンボルン、ディルク。ザイ、シャオファ。ウンターティナー、トーマス。デガニ、モスタファ。ミンデラー、マティアス。ハイゴールド、ゲオルク。ジェリー、シルヴァン。ウシュコレイト、ヤコブ。ニール・ホールズビー(2021年6月3日)。 「画像は 16x16 ワードの価値があります: 大規模な画像認識のためのトランスフォーマー」。 arXiv : 2010.11929 [ cs.CV ]。 ↑ 呉、海平。シャオ・ビン。コデラ、ノエル。劉孟晨。ダイ、西陽。ユアン、ルー。張、雷(2021年3月29日)。 「CvT: ビジョン トランスフォーマーへの畳み込みの導入」。 arXiv : 2103.15808 [ cs.CV ]。 ↑ バスワニ、アシシ。シャジーア、ノーム。パルマー、ニキ。ウシュコレイト、ヤコブ。ジョーンズ、リオン。ゴメス、エイダン N;カイザー、ウカシュ。ポロスキン、イリア (2017)。 「必要なのは注意力だけです」 。 神経情報処理システムの進歩 。 30 .カランアソシエイツ。 2024 年 9 月 9 日のオリジナルから アーカイブ 。 2024 年 9 月 9 日 に取得 。 ↑ Devlin, Jacob; Chang, Ming-Wei; Lee, Kenton; Toutanova, Kristina (2019年5月24日). "BERT: 言語理解のための深層双方向トランスフォーマーの事前学習". arXiv : 1810.04805 [ cs.CL ]. 1 2 Gong, Yuan; Chung, Yu-An; Glass, James (2021年7月8日). "AST: Audio Spectrogram Transformer". arXiv : 2104.01778 [ cs.SD ]. 1 2 リステア、ニコラエ=カタリン。イヨネスク、ラドゥ・チューダー。カーン、ファハド・シャバズ(2022年6月20日)。 「SepTr: オーディオ スペクトログラム処理用の分離可能なトランス」。 arXiv : 2203.09581 [ cs.CV ]。 1 2 Lohrenz, Timo; Li, Zhengyang; Fingscheidt, Tim (2021年7月14日). "Transformerベースのエンドツーエンド自動音声認識のためのマルチエンコーダー学習とストリーム融合". arXiv : 2104.00120 [ eess.AS ]. ↑ 「李登」 。李登サイト。 2024年9月9日時点のオリジナルから アーカイブ済み 。 2024年 9月9日 取得。 ↑ NIPSワークショップ:音声認識および関連アプリケーションのための深層学習、カナダ、ブリティッシュコロンビア州ウィスラー、2009年12月(主催者:Li Deng、Geoff Hinton、D. Yu)。 1 2 3 Hinton, Geoffrey; Deng, Li; Yu, Dong; Dahl, George; Mohamed, Abdel-Rahman; Jaitly, Navdeep; Senior, Andrew; Vanhoucke, Vincent; Nguyen, Patrick; Sainath, Tara ; Kingsbury, Brian (2012). "Deep Neural Networks for Acoustic Modeling in Speech Recognition: The shared views of four research groups". IEEE Signal Processing Magazine . 29 (6): 82– 97. Bibcode : 2012ISPM...29...82H . doi : 10.1109/MSP.2012.2205597 . S2CID 206485943 . 1 2 Deng, L.; Hinton, G.; Kingsbury, B. (2013). "音声認識および関連アプリケーションのための新しいタイプの深層ニューラルネットワーク学習:概要". 2013 IEEE International Conference on Acoustics, Speech and Signal Processing: New types of deep neural network learning for speech recognition and related applications: An overview . p. 8599. doi : 10.1109/ICASSP.2013.6639344 . ISBN 978-1-4799-0356-6 . S2CID 13953660 . 1 2 Markoff, John (2012年11月23日) 「科学者たちは深層学習プログラムに将来性を見出す」 ニューヨーク・タイムズ 。 2012年11月30日のオリジナルから アーカイブ 。 2015年 1月20日 取得 。 ↑ Morgan、Bourlard、Renals、Cohen、Franco (1993)「連続音声認識のためのハイブリッドニューラルネットワーク/隠れマルコフモデルシステム」ICASSP/IJPRAI ↑ T. Robinson (1992). "リアルタイム再帰的誤り伝播ネットワーク単語認識システム" . [ Proceedings ] ICASSP-92: 1992 IEEE International Conference on Acoustics, Speech, and Signal Processing . pp. 617–620 vol.1. doi : 10.1109/ICASSP.1992.225833 . ISBN 0-7803-0532-9 . S2CID 62446313 . ↑ Waibel 、Hanazawa、Hinton、Shikano、Lang。(1989)「時間遅延ニューラルネットワークを用いた音素認識」。 2021年2月25日にWayback Machine に アーカイブ済み。IEEE Transactions on Acoustics, Speech, and Signal Processing。↑ Baker, J.; Li Deng; Glass, J.; Khudanpur, S.; Chin-Hui Lee ; Morgan, N.; O'Shaughnessy, D. (2009). "Developments and Directions in Speech Recognition and Understanding, Part 1". IEEE Signal Processing Magazine . 26 (3): 75– 80. Bibcode : 2009ISPM...26...75B . doi : 10.1109/MSP.2009.932166 . hdl : 1721.1/51891 . S2CID 357467 . ↑ Sepp Hochreiter (1991)、 Untersuhungen zu dynamischen neuronalen Netzen 2015 年 3 月 6 日にウェイバック マシン に アーカイブ、卒業論文。インスティチュート f.工科大学インフォマティックミュンヘン。アドバイザー: J. シュミットフーバー。↑ Bengio, Y. (1991). 人工ニューラルネットワークとその音声/シーケンス認識への応用 (博士論文)。マギル大学。 ↑ Deng, L.; Hassanein, K.; Elmasry, M. (1994). "音声認識への応用を伴うニューラル予測モデルの相関構造の分析". Neural Networks . 7 (2): 331– 339. doi : 10.1016/0893-6080(94)90027-2 . ↑ 基調講演:深層ニューラルネットワークの最近の発展。ICASSP、2013年(ジェフ・ヒントン氏による)。 1 2 基調講演:「ディープラーニングの成果と課題:音声分析と認識から言語とマルチモーダル処理まで」 Interspeech、2014 年 9 月 ( Li Deng 著)。 ↑ 「音声認識ソフトウェアの改善が増加」 。TechRepublic.com 。2002年8月27日。2018年10月23日のオリジナルからアーカイブ 。 2018 年 10 月22日 取得 。 マナーズ氏は、IBMが音声認識の進歩に取り組んできたと述べた...または騒々しい展示会の会場で。 ↑ 「音声認識で旅行予約が簡単に:ビジネストラベルニュース」 BusinessTravelNews.com 1997年3月3日。 2024 年9月9日にオリジナルから アーカイブ 。 2024年 9月9日 に取得。 音声認識ソフトウェアの初期のアプリケーションは、ディクテーションでした... 4か月前、IBMは、... 1994年に全米ビジネストラベル協会のトレードショーで初披露された「継続的ディクテーション製品」を発表しました。 ↑ エリス・ブッカー(1994年3月14日)「音声認識が主流に」 Computerworld 、 45 ページ。 ほんの数年前まで、音声認識は… ↑ 「マイクロソフトの研究者が会話型音声認識の新たなマイルストーンを達成」 。 マイクロソフト 。2017年8月21日。 2024年9月9日時点のオリジナルより アーカイブ。 2024年 9月9日 取得 。 ↑ Waibel, A.; Hanazawa, T.; Hinton, G.; Shikano, K.; Lang, KJ (1989). "時間遅延ニューラルネットワークを用いた音素認識". IEEE Transactions on Acoustics, Speech, and Signal Processing . 37 (3): 328– 339. Bibcode : 1989ITASS..37..328W . doi : 10.1109/29.21701 . hdl : 10338.dmlcz/135496 . S2CID 9563026 . ↑ Bird, Jordan J.; Wanner, Elizabeth; Ekárt, Anikó; Faria, Diego R. (2020). "Optimisation of phonetic aware speech recognition through multi-objective evolutionary algorithms" (PDF) . Expert Systems with Applications . 153 113402. Elsevier BV. doi : 10.1016/j.eswa.2020.113402 . ISSN 0957-4174 . S2CID 216472225 . 2024年9月9日にオリジナルから アーカイブ (PDF) 。 2024年 9月9日 に取得 。 ↑ Wu, J.; Chan, C. (1993). "音声ダイナミクスの相互相関係数を用いたニューラルネットワークモデルによる孤立語認識". IEEE Transactions on Pattern Analysis and Machine Intelligence . 15 (11): 1174– 1185. Bibcode : 1993ITPAM..15.1174J . doi : 10.1109/34.244678 . ↑ SA Zahorian、AM Zimmer、F. Meng、(2002)「聴覚障害者の音声訓練のためのコンピュータベースの視覚フィードバックにおける母音分類」、ICSLP 2002 ↑ Hu, Hongbing; Zahorian, Stephen A. (2010). "HMM音声認識のための次元削減手法" (PDF) . ICASSP 2010 . 2012年7月6日にオリジナルから アーカイブ (PDF) 。 ↑ Fernandez, Santiago; Graves, Alex; Schmidhuber, Jürgen (2007). "階層型リカレントニューラルネットワークを用いた構造化ドメインにおけるシーケンスラベリング" (PDF) . IJCAI 論文集 . 2017 年 8 月 15 日のオリジナルから アーカイブ (PDF) 。 ↑ Graves, Alex; Mohamed, Abdel-rahman; Hinton, Geoffrey (2013). "Speech recognition with deep recurrent neural networks". arXiv : 1303.5778 [ cs.NE ]. ICASSP 2013。↑ Waibel, Alex (1989). "音声認識のための時間遅延ニューラルネットワークのモジュール構成" (PDF) . Neural Computation . 1 (1): 39– 46. doi : 10.1162/neco.1989.1.1.39 . S2CID 236321 . 2016年6月29日にオリジナルから アーカイブ (PDF) 。 ↑ Maas, Andrew L.; Le, Quoc V.; O'Neil, Tyler M.; Vinyals, Oriol; Nguyen, Patrick; Ng, Andrew Y. (2012). "頑健な音声認識におけるノイズ低減のためのリカレントニューラルネットワーク". Proceedings of Interspeech 2012 . 1 2 Deng, Li; Yu, Dong (2014). "Deep Learning: Methods and Applications" (PDF) . Foundations and Trends in Signal Processing . 7 ( 3– 4): 197– 387. CiteSeerX 10.1.1.691.3679 . doi : 10.1561/2000000039 . 2014年10月22日にオリジナルから アーカイブされた (PDF) 。 ↑ Yu, D.; Deng, L.; Dahl, G. (2010). "実世界音声認識のためのコンテキスト依存型DBN-HMMにおける事前学習とファインチューニングの役割" (PDF) . NIPS 深層学習と教師なし特徴学習に関するワークショップ . ↑ Dahl, George E.; Yu, Dong; Deng, Li; Acero, Alex (2012). "Context-Dependent Pre-Trained Deep Neural Networks for Large-Vocabulary Speech Recognition". IEEE Transactions on Audio, Speech, and Language Processing . 20 (1): 30– 42. Bibcode : 2012ITASL..20...30D . doi : 10.1109/TASL.2011.2134090 . S2CID 14862572 . ↑ Deng L., Li, J., Huang, J., Yao, K., Yu, D., Seide, F. et al. Microsoft における音声研究のための深層学習の最近の進歩 ( 2024 年 9 月 9 日Wayback Machine に アーカイブ) 。ICASSP、2013 年。 1 2 Yu, D.; Deng, L. (2014). "自動音声認識:深層学習アプローチ(出版社:Springer)". ↑ Deng, L.; Li, Xiao (2013). "音声認識のための機械学習パラダイム:概要" (PDF) . IEEE Transactions on Audio, Speech, and Language Processing . 21 (5): 1060– 1089. Bibcode : 2013ITASL..21.1060D . doi : 10.1109/TASL.2013.2244083 . S2CID 16585863 . 2024年9月9日にオリジナルから アーカイブ (PDF) 。 2024年 9月9日 に取得 。 ↑ Schmidhuber, Jürgen (2015). "Deep Learning" . Scholarpedia . 10 (11) 32832. Bibcode : 2015SchpJ..1032832S . doi : 10.4249/scholarpedia.32832 . ↑ L. Deng、M. Seltzer、D. Yu、A. Acero、A. Mohamed、G. Hinton (2010)ディープオートエンコーダを使用した音声スペクトログラムのバイナリ符号化。Interspeech。 ↑ Tüske, Zoltán; Golik, Pavel; Schlüter, Ralf; Ney, Hermann (2014). "LVCSR の生時間信号を使用した深層ニューラルネットワークによる音響モデリング" (PDF) . Interspeech 2014 . 2016 年 12 月 21 日のオリジナルから アーカイブ (PDF) 。 ↑ ジュラフスキー、ダニエル (2016)。 音声と言語処理 。 ↑ Graves, Alex (2014). "Towards End-to-End Speech Recognition with Recurrent Neural Networks" (PDF) . ICML . 2017年1月10日に オリジナル (PDF)からアーカイブ済み。 2019年 7月22日 取得 。 ↑ Amodei, Dario (2016). "Deep Speech 2: End-to-End Speech Recognition in English and Mandarin". arXiv : 1512.02595 [ cs.CL ]. ↑ 「LipNet: 読唇術ってどれくらい簡単だと思う?」 。 YouTube 。2016年11月4日。 2017年4月27日のオリジナルから アーカイブ。 2017年 5月5日 閲覧 。 ↑ Assael, Yannis; Shillingford, Brendan; Whiteson, Shimon; de Freitas, Nando (2016年11月5日). "LipNet: エンドツーエンドの文レベルの読唇術". arXiv : 1611.01599 [ cs.CV ]. ↑ ブレンダン、シリングフォード。アサエル、ヤニス。ホフマン、マシュー・W.ペイン、トーマス。ヒューズ、シアン。プラブ、ウツァブ。リャオ、ハンク。サク、ハシム。ラオ、カニシカ(2018年7月13日)。 「大規模視覚音声認識」。 arXiv : 1807.05162 [ cs.CV ]。 ↑ Li, Jason; Lavrukhin, Vitaly; Ginsburg, Boris; Leary, Ryan; Kuchaiev, Oleksii; Cohen, Jonathan M.; Nguyen, Huyen; Gadde, Ravi Teja (2019). "Jasper: An End-to-End Convolutional Neural Acoustic Model" . Interspeech 2019. pp. 71–75 . arXiv : 1904.03288 . doi : 10.21437/Interspeech.2019-1819 . ↑ Kriman, Samuel; Beliaev, Stanislav; Ginsburg, Boris; Huang, Jocelyn; Kuchaiev, Oleksii; Lavrukhin, Vitaly; Leary, Ryan; Li, Jason; Zhang, Yang (2019年10月22日), QuartzNet: 1D Time-Channel Separable Convolutions を用いた深層自動音声認識 , arXiv : 1910.10261 ↑ メデイロス、エドゥアルド。コラド、レオネル。ラト、ルイス。クアレスマ、パウロ。サルゲイロ、ペドロ(2023年5月)。 「深層学習を使用した低リソースのヨーロッパ系ポルトガル語向けのドメイン適応音声テキスト変換」 。 未来のインターネット 。 15 (5): 159. 土井 : 10.3390/fi15050159 。 hdl : 10174/41180 。 ISSN 1999-5903 。 ↑ Joshi, Raviraj; Singh, Anupam (2022 年 5 月). Malmasi, Shervin; Rokhlenko, Oleg; Ueffing, Nicola; Guy, Ido; Agichtein, Eugene; Kallumadi, Surya (編). "合成データを使用したエンドツーエンド ASR システムにおけるドメイン適応のためのシンプルなベースライン" . 第 5 回 E コマースと NLP ワークショップ (ECNLP 5) 議事録 . ダブリン、アイルランド: Association for Computational Linguistics: 244– 249. arXiv : 2206.13240 . doi : 10.18653/v1/2022.ecnlp-1.28 . ↑ Sukhadia, Vrunda N.; Umesh, S. (2023年1月9日). 「十分に訓練されたASR適合モデルを使用した低リソースターゲットドメインモデルのドメイン適応」. 2022 IEEE Spoken Language Technology Workshop (SLT) . IEEE. pp. 295–301 . arXiv : 2202.09167 . doi : 10.1109/SLT54892.2023.10023233 . ISBN 979-8-3503-9690-4 。↑ ペトロヴァ、マグダレーナ(2018年4月10日)。 「MITが頭の中の声に音声を与えるヘッドセットを開発」 。CNBC 。 2025年 9月11日 閲覧 。 ↑ Kapur, Arnav; Kapur, Shreyas; Maes, Pattie (2018). "AlterEgo: パーソナライズされたウェアラブルサイレント音声インターフェース". IUI '18: 第23回インテリジェントユーザーインターフェース国際会議議事録 : 43–53 . ↑ Chan, William; Jaitly, Navdeep; Le, Quoc; Vinyals, Oriol (2016). "Listen, Attend and Spell: A Neural Network for Large Vocabulary Conversational Speech Recognition" (PDF) . ICASSP . 2024年9月9日のオリジナルから アーカイブ (PDF) . 2024年 9月9日 取得 . ↑ Bahdanau, Dzmitry (2016). "End-to-End Attention-based Large Vocabulary Speech Recognition". arXiv : 1508.04395 [ cs.CL ]. ↑ Chorowski, Jan; Jaitly, Navdeep (2016年12月8日). "シーケンス・トゥ・シーケンス・モデルにおけるより良いデコーディングと言語モデル統合に向けて". arXiv : 1612.02695 [ cs.NE ]. ↑ チャン、ウィリアム。張、裕。ル、クオック。ジェイトリー、ナブディープ(2016 年 10 月 10 日)。 「潜在配列分解」。 arXiv : 1610.03035 [ stat.ML ]。 ↑ Chung, Joon Son; Senior, Andrew; Vinyals, Oriol; Zisserman, Andrew (2016年11月16日). "Lip Reading Sentences in the Wild". 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) . pp. 3444–3453 . arXiv : 1611.05358 . doi : 10.1109/CVPR.2017.367 . ISBN 978-1-5386-0457-1 . S2CID 1662180 . ↑ ウェン・フーリャン。ポンテップ、アンキティトラクル。エリザベス、E. シュライバーグ。ラリー、てか。スタンリー、ピーターズ。ジョン、HL・ハンセン(2016年11月4日)。 「会話型車内対話システム」 (PDF) 。 土井 : 10.1109/MSP.2016.2599201 。 2025 年 10 月 20 日 に取得 。 ↑ El Kheir, Yassine; et al. (2023年10月21日)、 「自動発音評価 ― レビュー」 、自然言語処理における経験的手法に関する会議、 arXiv : 2310.13974 、 S2CID 264426545 ↑ Isaacs, Talia; Harding, Luke (2017年7月) 「発音評価」 . Language Teaching . 50 (3): 347–366 . doi : 10.1017/S0261444817000118 . ISSN 0261-4448 . S2CID 209353525 . ↑ Loukina, Anastassia; et al. (2015年9月6日)、 「非ネイティブスピーカーの発音の正確性と明瞭度」 (PDF) 、 INTERSPEECH 2015 、ドイツ、ドレスデン: 国際音声コミュニケーション協会 、pp. 1917–1921 、 2024年9月9日にオリジナルから アーカイブ (PDF) 、 2024年 9月9日 に取得 、 単語レベルの明瞭度の変動のわずか16%が明らかな誤発音の存在によって説明できる。 ↑ O'Brien, Mary Grantham; et al. (2018 年 12 月 31 日). "発音の研究と教育におけるテクノロジーの未来の方向性" . Journal of Second Language Pronunciation . 4 (2): 182– 207. doi : 10.1075/jslp.17001.obr . hdl : 2066/199273 . ISSN 2215-1931 . S2CID 86440885 . 発音研究者は主に L2 学習者の明瞭度と理解度の向上に関心を持っていますが、どのエラーがこれらの音声次元に影響を与え、どのエラーが影響を与えないかを示す代表的で信頼できるデータ (対応する注釈と判断が付いた音声録音) を十分に収集していません。これらのデータは、L2 学習者の明瞭度を評価する ASR アルゴリズムをトレーニングするために不可欠です。 ↑ Eskenazi, Maxine (1999年1月) 「外国語の発音指導における自動音声処理の利用:いくつかの問題点とプロトタイプ」 . Language Learning & Technology . 2 (2): 62–76 . doi : 10.64152/10125/25043 . hdl : 10125/25043 . 2024年9月9日にオリジナルから アーカイブ済み。 2023年 2月11日 に取得 。 ↑ Tholfsen, Mike (2023年2月9日). 「Immersive ReaderのReading CoachとMicrosoft TeamsのReading Progressに搭載される新機能」 . Techcommunity Education Blog . Microsoft. 2024年9月9日のオリジナルから アーカイブ済み。 2023年 2月12日 取得 。 ↑ Banerji, Olina (2023年3月7日) 「学校は音声技術を使って読み方を教えている。効果はあるのか?」 EdSurge News 。 2024年9月9日のオリジナルから アーカイブ。 2023年 3月7日 取得 。 ↑ Hair, Adam; et al. (2018年6月19日). 「Apraxia world: 発話音障害のある子どものための言語療法ゲーム」. 第17回ACMインタラクションデザインと子どもに関する会議議事録 (PDF) . pp. 119–131 . doi : 10.1145/3202185.3202733 . ISBN 978-1-4503-5152-2 . S2CID 13790002 . 2024年9月9日にオリジナルからアーカイブ(PDF)されました 。 2024年 9月9日 に取得。 ↑ 「コンピューターがノーと言う:アイルランドの獣医、オーストラリア滞在に必要な英語の口頭試験に不合格」 。 ガーディアン 。オーストラリア通信社。2017年8月8日。 2024年9月9日にオリジナルから アーカイブ。 2023年 2月12日 に取得 。 ↑ Ferrier, Tracey (2017年8月9日) 「英語の学位を持つオーストラリアの元ニュースキャスター、ロボットの英語テストに不合格」 。 シドニー・モーニング・ヘラルド 。 2024年9月9日のオリジナルから アーカイブ。 2023年 2月12日 閲覧 。 ↑ メイン、エド; ワトソン、リチャード (2022年2月9日)。 「何千人もの人生を台無しにした英語のテスト」 。BBC ニュース 。 2024年9月9日のオリジナルから アーカイブ。 2023年 2月12日 取得 。 ↑ ジョイス、ケイティ・スプラット(2023年1月24日)。 「2通りの発音ができる13の単語」 。リーダーズ・ダイジェスト。 2024年9月9日のオリジナルから アーカイブ。 2023年 2月23日 取得 。 ↑ 例: CMUDICT 、「CMU発音辞書」 。www.speech.cs.cmu.edu 。 2010年8月15日のオリジナルから アーカイブ 済み。 2023年 2月15日 取得 。 「four」を「F AO R」と表記し、「caught」のAOのような母音を用いる場合と、「row」を「R OW」と表記し、「oat」のOWのような母音を用いる場合を比較してください。 ↑ Tu, Zehai; Ma, Ning; Barker, Jon (2022). "非侵入型音声明瞭度予測のための自動音声認識の教師なし不確実性尺度" (PDF) . Proc. Interspeech 2022 . INTERSPEECH 2022. ISCA. pp. 3493– 3497. doi : 10.21437/Interspeech.2022-10408 . 2024年9月9日にオリジナルから アーカイブ (PDF) 。 2023年 12月17日 に取得 。 ↑ 言語学習、教授、評価に関する欧州共通参照枠:新しい記述子を含む補足版 。言語政策プログラム、教育政策課、教育局、 欧州評議会 。2018年2月。p. 136。OCLC 1090351600。 2024年9月9日にオリジナルから アーカイブ 。 2024年 9月9日 に 取得 。 ↑ マリア、グラツィア・マッジョ。ダニエラ、デ・バルトロ。ロッコ、サルヴァトーレ・カラブロ。アイリーン、シアンカレリ。アントニオ、チェラサ。パオロ、トニン。フルビア、ディ・ユリオ。ステファノ、パオルッチ。ガブリエラ、アントヌッチ。ジョバンニ、モローネ。イオサ、マルコ(2023年9月29日)。 「神経疾患患者におけるコンピュータ支援による認知リハビリテーション: 最先端の技術と将来の展望」 。 神経学のフロンティア 。 14 1255319. 土井 : 10.3389/fneur.2023.1255319 。 PMC 10580980 。 PMID 37854065 。 ↑ Englund, Christine (2004). JAS 39 グリペン航空機における音声認識:異なるG負荷での音声への適応 (PDF) (修士論文)。 ストックホルム王立工科大学 。 2008年10月2日にオリジナルから アーカイブ (PDF) 。 ↑ 「コックピット」 。 ユーロファイター タイフーン 。 2017年3月1日にオリジナルから アーカイブされました。 ↑ 「ユーロファイター タイフーン – 世界で最も先進的な戦闘機」 。www.eurofighter.com 。 2013年5月11日のオリジナルから アーカイブ済み 。 2018年 5月1日 に 取得。 ↑ シュッテ、ジョン(2007年10月15日)。 「研究者らがF-35パイロットと航空機間の音声システムを微調整」 。米国空軍。 2007年10月20日時点のオリジナルより アーカイブ。 ↑ ジョン・シュッテ(2007年10月17日) 「研究者らがF-35パイロットと航空機間の音声システムを微調整」 。 空軍資材コマンド 。 2025年 10月20日 取得。 ↑ トレンテン、ウォルターズ (2022年6月27日)。 「ATCが寮にシミュレーションを導入」 。 空軍学習専門家 。 2025年10月25日の オリジナル からアーカイブ。 2025年 10月20日 取得 。 ↑ 「教室におけるコミュニケーションの障壁を克服する」 。MassMATCH。2010年3月18日。2013年7月25日にオリジナルからアーカイブ済み 。 2013年 6月15日 に取得。 1 2 「学習のための音声認識」 。国立技術革新センター。2010年。 2014年4月13日のオリジナルから アーカイブ。 2014年 3月26日 取得 。 ↑ 「障害者のための音声認識」 。 2008年4月4日に オリジナル からアーカイブされました。 ↑ フレンズ・インターナショナル・サポートグループ ↑ Garrett, Jennifer Tumlin; et al. (2011). "身体障害者の筆記流暢性を向上させるための音声認識ソフトウェアの使用" . Journal of Special Education Technology . 26 (1): 25– 41. doi : 10.1177/016264341102600104 . S2CID 142730664 . 2024年9月9日にオリジナルから アーカイブ済み。 2024年 9月9日 に取得 。 ↑ Forgrave, Karen E.「支援技術:障害のある学生のエンパワーメント」Clearing House 75.3 (2002): 122–6. Web. 1 2 Kambouri, Maria; Simon, Helen; Brooks, Greg (2023). "音声認識技術を用いて特別な教育ニーズを持つ若い書き手を支援する" . Research in Developmental Disabilities . 135 104466. doi : 10.1016/j.ridd.2023.104466 . ISSN 0891-4222 . 2023年5月1日にオリジナルから アーカイブ済み 。 2026年 6月5日 に取得。 1 2 Forgrave, Karen E. (2002). "Assistive Technology: Empowering Students with Learning Disabilities" . The Clearing House . 75 (3): 122– 126. ISSN 0009-8655 . 1 2 Almgren Back, Gunilla; Nordstrom, Thomas; Svensson, dor (2024年9月13日). 「中学生の文章表現力の向上:音声認識技術の補完的役割」 . Reading & Writing Quarterly . 41 (2): 160– 175 – Taylor & Francis Online経由。 ↑ Košak Babuder, Milena; Poredoš, Mojca; Pižorn, Karmen (2025 年 10 月). 「高等教育における特定の学習障害を持つ学生のためのデジタル支援学習」 . Journal of Contemporary Education Studies . 76 (3). 1 2 「学習のための音声認識 | LD OnLine」 。www.ldonline.org 。 2026年 6月5日 取得 。 ↑ Tang, KW; Kamoua, Ridha; Sutan, Victor (2004). "障害者教育のための音声認識技術". Journal of Educational Technology Systems . 33 (2): 173–84 . CiteSeerX 10.1.1.631.3736 . doi : 10.2190/K6K8-78K2-59Y7-R9R2 . S2CID 143159997 . ↑ 「プロジェクト:惑星マイクロフォン」 。惑星協会。 2012年1月27日時点の オリジナル よりアーカイブ。 ↑ Caridakis, George; Castellano, Ginevra; Kessous, Loic; Raouzaiou, Amaryllis; Malatesta, Lori; Asteriadis, Stelios; Karpouzis, Kostas (2007年9月19日). 「表情豊かな顔、身振り、音声からのマルチモーダル感情認識」 . 人工知能とイノベーション2007:理論から応用へ . IFIP(国際情報処理連盟). 第 247巻. Springer US. pp. 375–388 . doi : 10.1007/978-0-387-74161-1_41 . ISBN 978-0-387-74160-4 。↑ 「リアルタイム字幕とは? | DO-IT」 。www.washington.edu 。 2024年9月9日にオリジナルから アーカイブ済み 。 2021年 4 月11日 に取得。 ↑ Zheng, Thomas Fang; Li, Lantian (2017). Robustness-Related Issues in Speaker Recognition . SpringerBriefs in Electrical and Computer Engineering. Singapore: Springer Singapore. doi : 10.1007/978-981-10-3238-7 . ISBN 978-981-10-3237-0 2024年9月9日にオリジナルからアーカイブされました。2024年 9月9日 に取得されました 。↑ Ciaramella, Alberto. 「プロトタイプの性能評価レポート」 Sundialワークパッケージ8000(1993)。 ↑ Gerbino, E.; Baggia, P.; Ciaramella, A.; Rullent, C. (1993). "音声対話システムのテストと評価". IEEE International Conference on Acoustics Speech and Signal Processing . pp. 135–138 vol.2. doi : 10.1109/ICASSP.1993.319250 . ISBN 0-7803-0946-4 . S2CID 57374050 . ↑ 国立標準技術研究所。「 NISTにおける自動音声認識評価の歴史( 2013年10月8日、 Wayback Machine に アーカイブ)」。 ↑ "8.3. 音声認識 — 音声処理入門" . speechprocessingbook.aalto.fi . 2025年 10月24日 取得 . ↑ 「文字の名前は混乱を招く可能性が あり、文字と音の関係について知っておくべきこと」 。NAEYC 。 2024年9月9日にオリジナルから アーカイブ済み 。 2023年 10月27日 に取得。 ↑ 「話者依存型音声認識と話者非依存型音声認識」 . apxml.com . 2025年 10月24日 取得 。 ↑ 「メディアストリーム - WebSocketメッセージ | Twilio」 。www.twilio.com 。 2025年 10月24日 取得 。 ↑ 「音|特性、種類、事実|ブリタニカ」 。www.britannica.com 。 2025年9月13日。 2025年 10月24日 取得 。 ↑ 「音声認識精度の測定:単語誤り率の説明」 . picovoice.ai . 2022年11月2日. 2025年 10月24日 取得 . ↑ 「注目:あなたのAIアシスタントもNPRに夢中」 。NPR 。 2016年3月6日。 2017年7月23日にオリジナルから アーカイブ済み。 ↑ クラバーン、トーマス(2017年8月25日)。 「Amazon Alexa、Google Nowを音声コマンドで操作することは可能か? もちろん可能です」 。The Register 。 2017年9月2日のオリジナルから アーカイブ済み。 ↑ 「自動音声認識システムを標的とした攻撃」 . vice.com . 2018年1月31日。 2018年3月3日のオリジナルから アーカイブ済み。 2018年 5月1日 取得 。 ↑ ベイギ、ホマユーン (2011)。 話者認識の基礎 。ニューヨーク:スプリンガー 。ISBN 978-0-387-77591-3 2018年1月31日にオリジナルからアーカイブされました。↑ Povey, D., Ghoshal, A., Boulianne, G., Burget, L., Glembek, O., Goel, N., ... & Vesely, K. (2011). The Kaldi speech recognition toolkit. In IEEE 2011 workshop on automatic speech recognition and understanding (No. CONF). IEEE Signal Processing Society. ↑ 「Common Voice by Mozilla」 . voice.mozilla.org . 2020年2月27日の オリジナルからアーカイブ済み。 2019年 11月9日 取得 。 ↑ 「BaiduのDeepSpeechアーキテクチャのTensorFlow実装:mozilla/DeepSpeech」 。2019年11月9日。 2024年9月9日にオリジナルから アーカイブ済み 。 2024年 9月9日 に GitHub経由で取得。 ↑ "GitHub - tensorflow/docs: TensorFlow ドキュメント" . 2019 年 11 月 9 日。2024 年 9 月 9 日のオリジナルから アーカイブ済み。2024 年 9 月 9 日 取得 - GitHub 経由。 ↑ 「Coqui、すべての人 に オープンな音声技術を提供するスタートアップ」 。GitHub 。 2024年9月9日にオリジナルから アーカイブ済み 。 2022年 3月7日 に取得。 ↑ Coffey, Donavyn (2021年4月28日). 「マオリ族はビッグテックから自分たちの言語を守ろうとしている」 . Wired UK . ISSN 1357-0978 . 2024年9月9日のオリジナルから アーカイブ済み。 2021年 10月16日 取得 。 ↑ 「DeepSpeechからcoqui.aiに移行すべき理由」 。Mozilla Discourse 。2021年7月7日。2021年10月16日の オリジナル からアーカイブ 。 2021年 10月16日 に取得。 ↑ 「音声で入力」 。 2024年9月9日にオリジナルから アーカイブ済み 。 2024年 9月9日 に取得。 ↑ 「Windows で音声認識を使用する」 。 2025年4月9日にオリジナルから アーカイブされました。
さらに読む コール、ロナルド。ジョゼフ・マリアーニ ;ウシュコレイト、ハンス。ヴァリル、ジョバンニ・バッティスタ。ゼーネン、アニー。ザンポーリ;ズー、ビクター編。 (1997年)。人間の言語技術における最先端の調査 。ケンブリッジ自然言語処理研究。 Vol. XII ~ XIII。ケンブリッジ大学出版局。ISBN 978-0-521-59277-2 。 Junqua, J.-C.; Haton, J.-P. (1995).自動音声認識におけるロバスト性:基礎と応用 . Kluwer Academic Publishers. ISBN 978-0-7923-9646-8 。 Karat, Clare-Marie; Vergo, John; Nahamoo, David (2007). 「会話型インターフェース技術」。Sears , Andrew ; Jacko, Julie A. (編) 『人間とコンピュータのインタラクションハンドブック:基礎、進化する技術、そして新たな応用(人間工学と人間要因)』所収 。Lawrence Erlbaum Associates Inc. ISBN 978-0-8058-5870-9 。 ピエラッチーニ、ロベルト(2012)。機械の中の声。音声を理解するコンピュータの構築 。MIT Press。ISBN 978-0-262-01685-8 。 ピラニ、ジャンカルロ編(2013)。音声理解のための高度なアルゴリズムとアーキテクチャ 。シュプリンガー・サイエンス&ビジネス・メディア。ISBN 978-3-642-84341-9 。 Signer, Beat; Hoste, Lode (2013年12月) 「SpeeG2: 効率的なコントローラー不要のテキスト入力のための音声およびジェスチャーベースのインターフェース」 ICMI 2013論文集 。第15回マルチモーダルインタラクション国際会議。オーストラリア、シドニー。 ウォルフェル、マティアス;マクドノー、ジョン(2009年5月26日)。遠隔音声認識 。ワイリー。ISBN 978-0-470-51704-8 。