キーワードスポッティング(または、より簡単に言えば、ワードスポッティング)は、歴史的に音声処理の文脈で最初に定義された問題です。[1] [2]音声処理において、キーワードスポッティングは発話中のキーワード の識別を扱います。
キーワードスポッティングは、文書画像処理の文脈では、別個の、しかし関連する問題としても定義されています。[1] 文書画像処理において、キーワードスポッティングは、スキャンされた文書画像に存在するクエリワードのすべてのインスタンスを、それを完全に認識することなく見つける問題です。
音声処理において
キーワードスポッティングに関する最初の研究は1980年代後半に登場しました。[2]
キーワード検出の特殊なケースとして、 AlexaやSiriなどのパーソナル デジタル アシスタントが休止状態のスピーカーを起動する、つまり名前が話されたときに「起動」させるために 使用されるウェイク ワード (ホット ワードとも呼ばれる) 検出があります。
米国では、国家安全保障局が少なくとも2006年からキーワードスポッティングを活用している。[3]この技術により、アナリストは大量の録音された会話を検索し、疑わしいキーワードの言及を分離することができる。録音はインデックス化することができ、アナリストはデータベースに対してクエリを実行して興味のある会話を見つけることができます。IARPAはBabelプログラムにおけるキーワードスポッティングの研究に資金を提供した。
このタスクに使用されるアルゴリズムは次のとおりです。
- スライディングウィンドウとガベージモデル
- Kベスト仮説
- 反復ビタビ復号
- メル周波数ケプストラム係数に関する畳み込みニューラルネットワーク[4]
- トランスフォーマーベースの小さなフットプリントのキーワードスポッティング[5]
文書画像処理において
文書画像処理におけるキーワードスポッティングは、コンテンツベースの画像検索(CBIR)というより一般的な問題の 1 つの例として考えることができます。クエリが与えられた場合、その目標はスキャンされた文書のコレクションから最も関連性の高い単語のインスタンスを取得することです。[1] クエリは、テキスト文字列 (クエリによる文字列キーワードスポッティング) または単語画像 (クエリによる例キーワードスポッティング) の場合があります。
参考文献
- ^ abc Giotis, AP; Sfikas, G.; Gatos, B.; Nikou, C. (2017). 「文書画像ワードスポッティング技術の調査」.パターン認識. 68 : 310–332. Bibcode :2017PatRe..68..310G. doi :10.1016/j.patcog.2017.02.023.
- ^ ab Rohlicek, J.; Russell, W.; Roukos, S.; Gish, H. (1989). 「話者に依存しない単語スポッティングのための連続隠れマルコフモデリング」第 14 回 IEEE 国際音響・音声・信号処理会議 (ICASSP )議事録。1 : 627–630。
- ^ Froomkin, Dan (2015年5月5日). 「THE COMPUTERS ARE LISTENING」. The Intercept . 2015年6月20日閲覧。
- ^ Sainath, Tara N ; Parada, Carolina (2015). 「小さなフットプリントのキーワードスポッティングのための畳み込みニューラルネットワーク」。国際音声コミュニケーション協会第16回年次会議。arXiv : 1711.00333。
- ^ Wei, Bo; Yang, Meirong; Zhang, Tao; Tang, Xiao; Huang, Xing; Kim, Kyuhong; Lee, Jaeyun; Cho, Kiho; Park, Sung-Un (2021年8月30日). エンドツーエンドのトランスフォーマーベースのオープン語彙キーワードスポッティングと位置誘導型ローカルアテンション(PDF)。Interspeech 2021。
{{cite conference}}: CS1 メンテナンス: 日付と年 (リンク)
