コネクショニスト時間分類 (CTC )は、入力と出力が時間的に一致しないシーケンスラベル付けタスクでニューラルネットワークをトレーニングするために使用される 損失関数 と出力表現です。オンライン手書き認識 [ 1 ] や音声認識 などのタスクに使用できます。CTCは出力とスコアリングを指し、基となるニューラルネットワーク構造とは独立しています。2006年に導入されました。[ 2 ]
入力は観測のシーケンスであり、出力はラベルのシーケンスであり、空白の出力も含まれる場合があります。トレーニングの難しさは、ラベルの数よりも観測の数が多いことにあります。たとえば、音声オーディオでは、1 つの音素に対応する複数のタイムスライスが存在する場合があります。観測されたシーケンスとターゲット ラベルのアライメントがわからないため、各タイム ステップで確率分布を予測します。[ 3 ] CTC ネットワークは、連続出力 (たとえばsoftmax ) を持ち、トレーニングによってラベルの確率をモデル化するように適合されます。CTC は境界とタイミングを学習しようとはしません。ラベル シーケンスは、アライメントのみが異なる場合、空白を無視して同等とみなされます。同等のラベル シーケンスはさまざまな方法で発生する可能性があるため、スコアリングは簡単な作業ではありませんが、効率的な順方向- 逆方向アルゴリズム があります。
その後、CTCスコアはバックプロパゲーションアルゴリズムと組み合わせて、ニューラルネットワークの重みを更新するために使用できます。
CTCに適合させたニューラルネットワークの代替アプローチとしては、隠れマルコフモデル (HMM)が挙げられる。
2009年、コネクショニスト時間分類(CTC)で訓練されたLSTMネットワークは、連結手書き文字認識 の複数のコンテストで優勝し、パターン認識コンテストで優勝した最初のRNNとなった。[ 4 ] [ 5 ]
2014年、中国企業のBaiduは 、CTC損失関数で学習させた双方向RNN(LSTMではない)を使用して、従来の音声処理手法を一切使用せずに、2S09 Switchboard Hub5'00音声認識データセット[ 6 ] のベンチマークを破りました。[ 7 ]
2015年には、 Android端末の Google音声検索 と音声入力に使用されました。[ 8 ]
CTCは単調アライメントに限定されており、音声認識では問題ありませんが、言語翻訳では問題となる可能性があります。言語によって単語の順序が異なるため、言語Aの後の単語が言語Bの前の単語に対応する可能性があるからです。[ 3 ]
参考文献 ↑ Liwicki, Marcus; Graves, Alex ; Bunke, Horst; Schmidhuber, Jürgen (2007). "双方向長短期記憶ネットワークに基づくオンライン手書き認識への新しいアプローチ".第9回国際文書 解析認識会議(ICDAR 2007)議事録 。CiteSeerX 10.1.1.139.5852 。 ↑ Graves, Alex ; Fernández, Santiago; Gomez, Faustino; Schmidhuber, Juergen (2006). "Connectionist temporal classification: Labelling unsegmented sequence data with recurrent neural networks". Proceedings of the International Conference on Machine Learning, ICML 2006 : 369– 376. CiteSeerX 10.1.1.75.6306 . 1 2 Hannun, Awni (2017年11月27日). "CTCによるシーケンスモデリング". Distill . 2 (11). arXiv : 1508.01211 . doi : 10.23915/distill.00008 . ISSN 2476-0757 . ↑ Schmidhuber, Jürgen (2015 年 1 月). " ニューラル ネットワークにおける深層学習: 概要". Neural Networks . 61 : 85–117 . arXiv : 1404.7828 . doi : 10.1016/j.neunet.2014.09.003 . PMID 25462637. S2CID 11715509 . ↑ Graves, Alex; Schmidhuber, Jürgen (2009). "Offline Handwriting Recognition with Multidimensional Recurrent Neural Networks" . In Koller, D.; Schuurmans, D. ; Bengio, Y. ; Bottou, L. (eds.). Advances in Neural Information Processing Systems . Vol. 21. Neural Information Processing Systems (NIPS) Foundation. pp. 545–552 . ↑ "2000 HUB5 英語評価スピーチ - 言語データコンソーシアム" . catalog.ldc.upenn.edu . ↑ ハヌン、アウニ。ケース、カール。キャスパー、ジャレッド。カタンザーロ、ブライアン。ディアモス、グレッグ。エルセン、エーリッヒ。プレンジャー、ライアン。サシーシュ、サンジーブ。セングプタ、シュボ(2014 年 12 月 17 日)。 「ディープスピーチ: エンドツーエンドの音声認識のスケールアップ」。 arXiv : 1412.5567 [ cs.CL ]。 ↑ Sak, Haşim; Senior, Andrew; Rao, Kanishka; Beaufays, Françoise; Schalkwyk, Johan (2015年9月). 「Google音声検索:より速く、より正確」 。
外部リンク ジュラフスキーとマーティンの『音声と言語処理』 第3版、第16.4節「CTC」 Hannun, Awni (2017年11月27日). "CTCによるシーケンスモデリング" . Distill . 2 (11): e8. doi : 10.23915/distill.00008 . ISSN 2476-0757 .