文字起こしソフトウェアは、人間の音声をテキストのトランスクリプトに変換することを支援します。オーディオまたはビデオファイルは、手動または自動で文字起こしできます。[1]文字起こし担当者は、文字起こしエディタで録音を数回再生し、聞いた内容を入力できます。文字起こしホットキーを使用すると、手動の文字起こしを加速したり、サウンドをフィルタリングしたり、イコライズしたり、明瞭度が高くない場合はテンポを調整したりできます。音声認識テクノロジーを使用すると、文字起こし担当者は、録音を PC で開いてクラウドにアップロードして自動文字起こしすることで、録音をテキストのトランスクリプトに自動的に変換したり、デジタルディクテーションを使用して録音をリアルタイムで文字起こししたりできます。録音の品質によっては、機械で生成されたトランスクリプトを手動で検証する必要がある場合があります。自動文字起こしの精度は、背景ノイズ、話者とマイクの距離、アクセントなど、いくつかの要因によって異なります。
文字起こしソフトウェアは、文字起こしサービスと同様に、ビジネス、法律、医療の目的で提供されることがよくあります。音声コンテンツと比較すると、テキスト文字起こしは検索可能で、コンピュータのメモリをあまり消費せず、字幕やクローズドキャプションなどの代替コミュニケーション手段として使用できます。
トランスクリプション「ソフトウェア」の定義は、トランスクリプション「サービス」と比較すると、前者は十分に自動化されているため、ユーザーは外部の人員を介さずにシステム全体を実行できるというものです。しかし、サービスとしてのソフトウェアとクラウドコンピューティングモデルの出現により、この区別は曖昧になっています。人工知能、機械学習、自然言語処理を使用して、音声をテキストに変換し、新しいフレーズやアクセントを継続的に学習します。[2]
発達
Googleの研究者は、 Google Cloud上で動作する無料のAndroidアプリGoogle Live Transcribeをリリースしました。[3] [4] Google Chromeは英語のライブキャプションを開発し、組み込んで利用可能です。[5] Googleドキュメント、Google翻訳、Googleアシスタント、GBoard Google Text to Speechエンジンも文字起こしツールをサポートしています。[6] [7] [8] [9]
OpenAIは2022年9月にオープンソースの音声認識ディープラーニングモデルであるWhisperをリリースした。[10]
参照
参考文献
- ^ 「トランスクリプション機能 | Transcribear」。一般的なトランスクリプション機能と規則、オーディオトランスクリプション。2017年6月8日。 2019年2月15日閲覧。
- ^ Bhatt, Medha. 「AIトランスクリプションとは何か?知っておくべきことすべて」fireflies.ai . 2022年6月3日閲覧。
- ^ 「Live Transcribe を使用する - Android ユーザー補助機能ヘルプ」。support.google.com。2021年6 月 14 日閲覧。
- ^ Butler, Sydney (2019-12-09). 「Google の Live Transcribe アプリを使用して音声を書き起こす方法」. 9to5Google . 2021-06-14閲覧。
- ^ 「Google Chrome の新しいライブキャプション機能により、動画内の音声が文字起こしされる」techxplore.com . 2021 年 6 月 14 日閲覧。
- ^ 「Google 翻訳で音声の文字起こしが可能に」Google 2020年3月17日2021年6月14日閲覧。
- ^ Krasnoff, Barbara (2020-08-14). 「Google の無料文字起こしツールの使い方」The Verge . 2021-06-14閲覧。
- ^ 「Live Transcribe & Sound Notifications - Apps on Google Play」. play.google.com . 2021年6月14日閲覧。
- ^ 「Google、Gboard ユーザー向けにリアルタイムの文字起こしと翻訳を展開」2021年6月14日閲覧。
- ^ Golla, Ramsri Goutham (2023-03-06). 「新しいWhisper APIの6つの実用的な使用例」Slator。2023-03-25時点のオリジナルよりアーカイブ。2023-08-12に取得。
