自動発音評価は、音声認識を使用して発音された音声の正確さを検証することであり、[1] [2]、講師や試験監督者による手動評価とは区別されます。[3]音声検証、発音評価、発音採点とも呼ばれるこの技術の主な用途は、コンピュータ支援言語学習(CALL)のためのコンピュータ支援指導、音声矯正、またはアクセント削減と組み合わせたコンピュータ支援発音指導(CAPT)です。
発音評価は、未知の音声を判断するのではなく(ディクテーションや自動転写のように)、予想される単語を事前に知っておくことで、学習者の発音の正確さと、理想的には聞き手にとっての明瞭度を検証しようとします。 [4] [5]時には、イントネーション、ピッチ、テンポ、リズム、音節や単語の強勢など、重要でない韻律も併せて確認します。[6]発音評価は、 Microsoft Teams [7]やAmira Learningなどの製品など、読書指導にも使用されています。[8]自動発音評価は、失行症などの発話障害の診断と治療にも役立ちます。[9]
明瞭度
発音評価に関する最も初期の研究では、真の聞き手の了解度の測定を避けていましたが、[10]この欠点は2011年に豊橋技術科学大学で修正され、[11]ピアソンのVersantハイステークス英語流暢性評価[12]や17zuoye Education & Technologyのモバイルアプリには組み込まれましたが、[13] Google Search、[14] Microsoft、[15] Educational Testing Service、[16] Speechace、[17]およびELSAの2023製品にはまだ組み込まれていません。[18]真の聞き手の了解度を評価することは、特にハイステークス評価におけるアクセントバイアスによる不正確さを回避するために不可欠です。 [19] [20] [21]複数の正しい発音がある単語による不正確さ、[22]および機械可読発音辞書の音素コーディングエラーによる不正確さを回避するために不可欠です。[23]ヨーロッパ言語共通参照枠(CEFR)の「全体的な音韻制御」の評価基準では、すべてのレベルにおいて、理解可能性が正式な発音よりも優先されます。[24]
2022年に研究者らは、エンドツーエンドの強化学習に基づいて音声信号を直接単語にマッピングする新しい音声テキスト変換システムが、本物の聞き手の了解度と密接に相関する単語とフレーズの信頼スコアを生成することを発見した。[25] 2023年には、他の研究者らが、良好な音声のWav2Vec2表現からの距離に基づく動的時間ワーピングを使用して了解度を評価できた。[26]
評価
発音評価の精度を評価する業界標準のベンチマークはまだありませんが、研究者は評価の質を向上させるために他の人が使用できるように、評価音声コーパスを時折公開しています。 [27] [28]このような評価データベースは、盲検化されたリスナーの書き起こしから明らかな真の明瞭度を排除して、形式的にアクセントのない発音を強調することがよくあります。[5]
最近の動向
2024年に開発される有望な改善分野としては、調音 特徴抽出[29] [30] [31]や不必要な修正を抑制する転移学習[32]などがある。開発中のその他の興味深い進歩としては、光学式文字認識を使用してユーザー環境にあるテキストの発音トレーニングを提供するモバイルデバイス用の「拡張現実」インターフェースがある。 [33] [34] 2024年半ばの時点で、音声マルチモーダル大規模言語モデルが発音の評価に使用されている。[35]
参照
参考文献
- ^ El Kheir, Yassine; et al. (2023年10月21日)、「自動発音評価 — レビュー」、自然言語処理における経験的手法に関する会議、arXiv : 2310.13974、S2CID 264426545
- ^ Ehsani, Farzad; Knodt, Eva (1998年7月). 「コンピュータ支援言語学習における音声技術:新しいCALLパラダイムの強みと限界」.言語学習と技術. 2 (1). ハワイ大学国立外国語リソースセンター; ミシガン州立大学言語教育研究センター: 54–73 . 2023年2月11日閲覧。
- ^ アイザックス、タリア; ハーディング、ルーク (2017年7月). 「発音評価」.言語教育. 50 (3): 347–366. doi : 10.1017/S0261444817000118 . ISSN 0261-4448. S2CID 209353525.
- ^ Loukina, Anastassia; et al. (2015 年 9 月 6 日)、「非ネイティブ音声の発音精度と明瞭度」(PDF)、INTERSPEECH 2015、ドレスデン、ドイツ: International Speech Communication Association、pp. 1917–1921、
単語レベルの明瞭度の変動のわずか 16% が、明らかな発音ミスの存在によって説明できます。
- ^ ab O'Brien, Mary Grantham; et al. (2018年12月31日). 「発音研究と教育におけるテクノロジーの将来への方向性」. Journal of Second Language Pronunciation . 4 (2): 182–207. doi : 10.1075/jslp.17001.obr . hdl : 2066/199273 . ISSN 2215-1931. S2CID 86440885.
発音研究者は主に、L2学習者の了解度と理解度を向上させることに関心がありますが、どのエラーがこれらの音声次元に影響し、どのエラーが影響しないかを示す代表的で信頼性の高いデータ(対応する注釈と判断が付いた音声録音)をまだ十分に収集していません。これらのデータは、L2学習者の了解度を評価するASRアルゴリズムをトレーニングするために不可欠です。
- ^ Eskenazi, Maxine (1999年1月). 「外国語の発音指導に自動音声処理を使用する: いくつかの問題とプロトタイプ」.言語学習とテクノロジー. 2 (2): 62–76 . 2023年2月11日閲覧。
- ^ Tholfsen, Mike (2023 年 2 月 9 日)。「Immersive Reader の Reading Coach と Microsoft Teams の Reading Progress に新機能が登場」。Techcommunity Education ブログ。Microsoft。2023年2 月 12 日閲覧。
- ^ Banerji, Olina (2023年3月7日). 「学校では音声テクノロジーを使って読書を教えています。役に立っているのでしょうか?」EdSurge News . 2023年3月7日閲覧。
- ^ ヘア、アダム、他 (2018 年 6 月 19 日)。「失行症の世界: 音声障害のある子供のための言語療法ゲーム」。第 17 回 ACM インタラクション デザインと子供に関する会議の議事録(PDF)。pp. 119–131。doi : 10.1145 / 3202185.3202733。ISBN 9781450351522. S2CID 13790002。
- ^ Bernstein, Jared; et al. (1990 年 11 月 18 日)、「英語発音の自動評価とトレーニング」(PDF)、First International Conference on Spoken Language Processing (ICSLP 90)、神戸、日本: International Speech Communication Association、pp. 1185–1188、2023年2 月 11 日閲覧。
聞き手によって、理解できない単語を予測する能力にかなりの差があります。...したがって、品質評価の方がより望ましいと思われます...自動採点スコアです。
(セクション2.2.2) - ^ 木比志 宏; 中川 誠一 (2011年8月28日) 「国際会議における英語発表の発音評価のための新たな特徴パラメータ」(PDF)、INTERSPEECH 2011、フィレンツェ、イタリア:国際音声コミュニケーション協会、pp. 1149–1152 、 2023年2月11日閲覧、
発音スコア/明瞭度とさまざまな音響指標との関係を調査し、次にこれらの指標を組み合わせた。…我々が知る限り、明瞭度の自動推定はまだ研究されていない。
- ^ Bonk, Bill (2020年8月25日). 「評価における新たなイノベーション:Versantの明瞭性指数スコア」。英語学習者と教師のためのリソース。Pearson English。2023年1月27日時点のオリジナルよりアーカイブ。 2023年2月11日閲覧。
理解されるために、完璧なアクセント、文法、語彙は必要ありません。実際には、聞き手が少し努力するだけで理解できる必要があります。
- ^ Gao, Yuan; et al. (2018年5月25日)、「PocketSphinxアライメントと特徴抽出による英語音声明瞭度改善は、最先端技術を大幅に上回る」、第2回IEEE高度情報管理、通信、電子および自動化制御会議 (IMCEC 2018)、pp. 924–927、arXiv : 1709.01713、doi :10.1109/IMCEC.2018.8469649、ISBN 978-1-5386-1803-5、S2CID 31125681
- ^ Snir, Tal (2019年11月14日). 「クオッカの発音は?検索で練習」. The Keyword . Google . 2023年2月11日閲覧。
- ^ 「発音評価ツール」。Azure Cognitive Services Speech Studio。Microsoft。2023年2月11日閲覧。
- ^ Chen, Lei; et al. (2018年12月). 非ネイティブ音声の自動採点: SpeechRater v. 5.0 エンジンの使用。ETS 研究レポートシリーズ。Vol. 2018。プリンストン、ニュージャージー: Educational Testing Service。pp. 1–31。doi : 10.1002 /ets2.12198。ISSN 2330-8516。S2CID 69925114。2023年2月11日閲覧。
- ^ Alnafisah, Mutleb (2022年9月)、「Technology Review: Speechace」、第12回第二言語学習および教育における発音会議(Virtual PSLLT)の議事録、第40号、第12巻、オンタリオ州セントキャサリンズ、ISSN 2380-9566 、 2023年2月14日閲覧
{{citation}}: CS1 メンテナンス: 場所が見つかりません 発行者 (リンク) - ^ Gorham, Jon; et al. (2022年3月10日). 英語学習のための音声認識(ビデオ) .言語教育と学習におけるテクノロジー. 教育ソリューション. 2023年2月14日閲覧。
- ^ 「コンピューターがノーと言う:アイルランドの退役軍人、オーストラリア滞在に必要な英語口頭試験に不合格」。ガーディアン。オーストラリア通信社。2017年8月8日。 2023年2月12日閲覧。
- ^ フェリアー、トレーシー(2017年8月9日)。「英語学位を持つオーストラリアの元ニュースリーダーがロボットの英語テストに不合格」シドニー・モーニング・ヘラルド。2023年2月12日閲覧。
- ^ メイン、エド、ワトソン、リチャード(2022年2月9日)。「何千人もの人生を台無しにした英語テスト」BBCニュース。 2023年2月12日閲覧。
- ^ Joyce, Katy Spratte (2023年1月24日). 「2通りの発音ができる13の単語」. Reader's Digest . 2023年2月23日閲覧。
- ^ 例: CMUDICT、「CMU 発音辞書」。www.speech.cs.cmu.edu 。2023 年2 月 15 日閲覧。「four」を「F AO R」で表し、「caught」のように母音 AO を使用するのと、「row」を「R OW」で表し、「oat」のように母音 OW を使用するのとを比較します。
- ^言語の学習、教授、評価に関するヨーロッパ共通参照枠:新しい記述子を収録したコンパニオンブック。 欧州評議会教育部教育政策課言語政策プログラム。2018年2月。136ページ。OCLC 1090351600。
- ^ Tu, Zehai; Ma, Ning; Barker, Jon (2022). 「非侵入的な音声明瞭度予測のための自動音声認識の教師なし不確実性測定」(PDF)。Proc. Interspeech 2022。 INTERSPEECH 2022. ISCA。pp. 3493–3497。doi :10.21437/Interspeech.2022-10408 。2023年12月17日閲覧。
- ^ Anand, Nayan; Sirigiraju, Meenakshi; Yarra, Chiranjeevi (2023年6月15日). 「教師と学習者のWav2Vec-2.0表現間の発話レベルアラインメント距離による教師なし音声明瞭度評価」. arXiv : 2306.08845 [cs.SD].
- ^ Vidal, Jazmín; et al. (2019年9月15日)、「EpaDB: 発音評価システム開発のためのデータベース」(PDF)、Interspeech 2019、pp. 589–593、doi :10.21437/Interspeech.2019-1839、hdl : 11336/161618、S2CID 202742421 、 2023年2月19日閲覧; データベース .zip ファイル。
- ^ チャン、ジュンボ;他。 (2021 年 8 月 30 日)、「speechocean762: 発音評価のためのオープンソースの非ネイティブ英語音声コーパス」(PDF)、Interspeech 2021、pp. 3710–3714、arXiv : 2104.01378、doi :10.21437/Interspeech.2021-1259、S2CID 233025050、2023年2 月 19 日に取得; GitHub コーパス リポジトリ。
- ^ Wu, Peter; et al. (2023年2月14日)、「話者に依存しない音響から調音への音声反転」、arXiv : 2302.06774 [eess.AS]
- ^ Cho, Cheol Jun; Mohamed, Abdelrahman; Black, Alan W.; Anumanchipalli, Gopala K. (2024年1月16日). 「音声の自己教師モデルによる普遍的な調音運動学の推論」. arXiv : 2310.10788 [eess.AS].
- ^ Mallela, Jhansi; Aluru, Sai Harshitha; Yarra, Chiranjeevi (2024年2月28日). 「自動音節強勢検出のための自己教師あり表現の使用の検討」 National Conference on Communications. チェンナイ、インド。pp. 1–6. doi :10.1109/NCC60321.2024.10486028 。 2024年6月10日閲覧。
- ^ Sancinetti, Marcelo; et al. (2022年5月23日). 「発音スコアリングのための転移学習アプローチ」ICASSP 2022 - 2022 IEEE 国際音響・音声・信号処理会議 (ICASSP) . pp. 6812–6816. arXiv : 2111.00976 . doi :10.1109/ICASSP43922.2022.9747727. ISBN 978-1-6654-0540-9. S2CID 249437375。
- ^ Che Dalim、Che Samihah、他 (2020年2月)。「非ネイティブ児童の言語学習に音声入力による拡張現実を使用する」( PDF)。International Journal of Human-Computer Studies。134 : 44–64。doi :10.1016/j.ijhcs.2019.10.002。S2CID 208098513。2023年2 月28日閲覧。
- ^ Tolba, Rahma M.; et al. (2023). 「音声学学習のためのモバイル拡張現実:レビュー(2012–2022)」。拡張現実とメタバース。Springer Proceedings in Business and Economics。Springer International Publishing:87–98。doi : 10.1007 / 978-3-031-25390-4_7。ISBN 978-3-031-25389-8. 2023年2月28日閲覧。
- ^ Fu, Kaiqi; Peng, Linkai; Yang, Nan; Zhou, Shuran (2024年7月18日). 「マルチモーダル大規模言語モデルによる発音評価」. arXiv : 2407.09209 [cs.CL].
- ^ Mathad, Vikram C.; et al. (2021). 「強制アライメントエラーが自動発音評価に与える影響」( PDF)。第22回国際音声コミュニケーション協会年次会議 (INTERSPEECH 2021)。国際音声コミュニケーション協会。pp. 176–180。doi : 10.21437 /interspeech.2021-1403。ISBN 9781713836902. S2CID 239694157 . 2023年3月10日閲覧。
外部リンク
- 国際音声コミュニケーション協会(ISCA) 教育における音声言語技術に関する特別興味グループ (SLaTE)
