
音声生成装置(SGD )は、音声出力コミュニケーション補助装置とも呼ばれ、重度の言語障害を持つ人が発話や筆記を補完または代替するために使用される電子補助代替コミュニケーション(AAC)システムであり、口頭でのコミュニケーションを可能にします。[ 1 ] SGDは、口頭でのやり取りの手段が限られている人にとって重要であり、コミュニケーションのやり取りに積極的に参加することを可能にします。特に筋萎縮性側索硬化症(ALS)の患者に役立ちますが、最近では言語障害が予測される子供にも使用されています。[ 2 ]
SGD を利用する能力の異なるユーザー向けに、いくつかの入力および表示方法があります。一部の SGD は、多数の発話に対応するために複数のシンボルページを備えており、そのため、一度に表示できるシンボルは利用可能なシンボルの一部のみで、コミュニケーションを行うユーザーはさまざまなページをナビゲートします。音声生成デバイスは、自然な音声のデジタル録音を使用するか、音声合成によって電子音声出力を生成できます。音声合成は感情情報が少ないかもしれませんが、ユーザーが新しいメッセージを話すことを可能にします。[ 3 ]
SGDの語彙の内容、構成、更新は、ユーザーのニーズやデバイスが使用される状況など、多くの要因に影響されます。[ 4 ]利用可能な語彙と発話速度を向上させる技術の開発は、活発な研究分野です。語彙項目は、ユーザーにとって関心が高く、頻繁に適用可能で、意味の範囲が広く、機能的に実用的である必要があります。[ 5 ]
デバイス上のメッセージにアクセスする方法は複数あります。直接アクセスする方法、間接アクセスする方法、または専用のアクセスデバイスを使用する方法などがありますが、具体的なアクセス方法はユーザーのスキルと能力によって異なります。[ 1 ] SGD の出力は通常、音声よりもはるかに遅いですが、レート向上戦略によってユーザーの出力レートを上げることができ、結果としてコミュニケーションの効率が向上します。[ 6 ]
SGDの最初のプロトタイプは1970年代半ばに開発され、ハードウェアとソフトウェア開発の急速な進歩により、現在ではSGDの機能をスマートフォンなどのデバイスに統合することが可能になっています。SGDの著名なユーザーには、スティーブン・ホーキング、ロジャー・エバート、トニー・プラウドフット、ピート・フレイツ( ALSアイスバケットチャレンジの創設者)などがいます。
音声生成システムは、AAC専用に開発された専用デバイスの場合もあれば、AACデバイスとして機能できるように追加ソフトウェアを実行するコンピュータなどの非専用デバイスである場合もある。[ 7 ] [ 8 ]

SGD は初期の電子通信補助装置にルーツがあります。そのような補助装置の最初のものは、1960 年に英国の Reg Maling によって試作された患者操作セレクタ機構 (Naman) と呼ばれる吸気と呼気によるタイプライター制御装置でした。 [ 9 ] [ 10 ] POSSUM は、照明付きディスプレイ上の記号のセットをスキャンしました。 [ 9 ]オランダのデルフト工科大学の研究者は、1970 年に光点操作式タイプライター (LOT) を開発しました。これは、ヘッドの小さな動きを利用して、光電セルを備えた文字のマトリックスに小さな光点を向けます。LOT は商業的には成功しませんでしたが、ユーザーには好評でした。[ 11 ]
1966年、ケース・ウェスタン・リザーブ大学の工学部1年生だったバリー・ロミッチと、オハイオ州クリーブランドのハイランド・ビュー病院のエンジニアだったエド・プレントケが提携し、プレントケ・ロミッチ社を設立した。[ 12 ] 1969年、同社は廃棄されたテレタイプ機をベースにしたタイピングシステムという最初の通信機器を製造した。
1979年、マーク・ダームケは、マイクロコンピュータとComputalker CT-1アナログ音声合成装置を使用した音声コミュニケーション補助プログラムのソフトウェアを開発しました。[ 13 ] [ 14 ] [ 15 ] [ 16 ] [ 17][18 ] [ 19 ]このソフトウェアは音素を使用して音声を生成し、コミュニケーション障害のある人が単語や文章を構成するのを支援しました。[ 20 ]ダームケの研究は、障害者のための支援技術の進歩に貢献しました。特に、脳性麻痺の学生であるビル・ラッシュのために「語彙管理システム」を設計しました。[ 21 ] [ 20 ] [ 22 ] [ 23 ]この初期の音声合成技術はラッシュのコミュニケーションの改善を促進し、1980年のLIFE誌で紹介されました。[ 24 ] [ 25 ]ダームケの貢献は、補助代替コミュニケーション(AAC)技術の開発に影響を与えた。
1970年代から1980年代初頭にかけて、SGDの著名な製造業者となった他の企業がいくつか出現した。トビー・チャーチルは、脳炎で言葉を失った後、1973年にトビー・チャーチル社を設立した。[ 26 ]米国では、ダイナボックス(当時はセンティエント・システムズ・テクノロジーとして知られていた)が、脳性麻痺の若い女性のコミュニケーションを支援するために1982年に設立されたカーネギーメロン大学の学生プロジェクトから発展した。[ 27 ] 1980年代に入ると、技術の進歩により、市販のコミュニケーション機器の数、種類、性能が大幅に増加し、サイズと価格が下がった。ターゲットスキャン(アイポインティングとも呼ばれる)などの代替アクセス方法は、ユーザーの目の動きを調整してSGDを誘導し、目的の音声を生成する。代替案をユーザーに順次提示するスキャン方式が、コミュニケーション機器で利用可能になった。[ 10 ] [ 28 ]音声出力の可能性には、デジタル化された音声と合成音声の両方が含まれていました。[ 10 ]
ハードウェアとソフトウェアの開発は急速に進歩し、欧州共同体から資金提供を受けたプロジェクトも含まれていました。最初の市販の動的スクリーン音声生成デバイスは1990年代に開発されました。コンピュータベースのコミュニケーションボードの製造を可能にするソフトウェアが開発されました。[ 10 ] [ 28 ]ハイテクデバイスは小型軽量化が進み、[ 28 ]アクセス性と機能が向上しました。コミュニケーションデバイスはアイトラッキングシステムを使用してアクセスでき、ワードプロセッシングやインターネット使用のためのコンピュータとして機能し、テレビ、ラジオ、電話などの他の機器への独立したアクセスのための環境制御装置としても機能します。 [ 29 ]
スティーブン・ホーキングは、彼が使用した特殊な合成装置の独特な声と結びつくようになった。ホーキングはALSによる障害と緊急気管切開手術の複合的な影響で話すことができなかった。[ 30 ]過去20年ほどで、SGDは自閉症、ダウン症候群、手術による脳損傷が予測されるなど、言語障害のある幼児の間で人気が高まっている。
2000年代初頭から、専門家たちは音声生成装置(SGD)が大人だけでなく子供にも有効であることに気づき始めた。神経言語学者たちは、SGDがALS患者と同様に、脳外科手術後に一時的な言語障害のリスクがある子供たちの支援にも効果的であることを発見した。特に、デジタル化されたSGDは、小児患者の回復過程におけるコミュニケーション補助具として活用されている。
デバイス上のメッセージにアクセスする方法は、直接アクセス、間接アクセス、専用アクセスデバイスを使用するなど、多数あります。直接アクセス方法は、キーボードやタッチスクリーンを使用してシステムに物理的に接触する方法です。SGDに間接的に、または専用デバイスを介してアクセスするユーザーは、ジョイスティック、ヘッドマウス、光学式ヘッドポインター、ライトポインター、赤外線ポインター、スイッチアクセススキャナなどを操作することでシステムにアクセスする必要があります。[ 1 ]
具体的なアクセス方法は、ユーザーのスキルと能力によって異なります。直接選択では、身体の一部、ポインター、改造マウス、ジョイスティック、またはアイトラッキングを使用できますが、 [ 31 ]スイッチアクセススキャンは間接選択によく使用されます。[ 8 ] [ 32 ]直接選択(キーボードでの入力、画面のタッチなど)とは異なり、ターゲットスキャンのユーザーは、電子機器のスキャンインジケータ(またはカーソル)が目的の選択肢にある場合にのみ選択できます。[ 33 ]指差しができない人は、通常、視線を指差しの方法として、またブロックを目的の単語やフレーズを選択する方法として使用するために目を調整します。スキャンの速度とパターン、および項目の選択方法は、ユーザーの身体的、視覚的、および認知的能力に合わせて個別化されます。[ 33 ]

補助代替コミュニケーションは通常、音声よりもはるかに遅く、[ 6 ]一般的にユーザーは1分間に8~10語を発話します。[ 34 ]速度向上戦略により、ユーザーの発話速度を1分間に約12~15語まで上げることができ、[ 34 ]その結果、コミュニケーションの効率が向上します。
SGDには、挨拶、願望の表明、質問など、効率的かつ効果的なコミュニケーションを促進する多数の音声表現が含まれている場合があります。[ 35 ]一部のSGDは、多数の音声表現に対応するために複数のシンボルページを備えており、そのため、一度に表示できるシンボルは一部のみで、コミュニケーションを行う人はさまざまなページをナビゲートします。[ 36 ]音声生成装置は通常、動的に変化する画面または固定ディスプレイを使用して、一連の選択肢を表示します。[ 37 ]
SGDの通信速度を上げるには、主にエンコーディングと予測の2つの方法があります。[ 6 ]
エンコーディングにより、ユーザーはSGDを1回または2回起動するだけで単語、文、またはフレーズを生成できます。[ 6 ]意味的圧縮などのアイコンエンコーディング戦略では、アイコン(絵記号)のシーケンスを組み合わせて単語やフレーズを生成します。[ 38 ]数値、英数字、および文字エンコーディング(略語展開とも呼ばれる)では、単語と文は文字と数字のシーケンスとしてコード化されます。たとえば、「HH」または「G1」(挨拶1)と入力すると、「こんにちは、お元気ですか?」を取得できます。[ 38 ]
予測は、SGDがユーザーが入力している単語やフレーズを予測することで、使用するキーストローク数を削減しようとするレート向上戦略です。ユーザーは、単語全体を入力する必要なく、正しい予測を選択できます。単語予測ソフトウェアは、言語における頻度、他の単語との関連性、ユーザーの過去の選択、または文法的な適切性に基づいて、提示する選択肢を決定する場合があります。[ 6 ] [ 38 ] [ 39 ]しかし、ユーザーは、予測グリッドレイアウトよりも静的キーボードレイアウトを使用した方が、 1分あたりの単語数が多いことが示されています(スキャンインターフェースを使用) 。これは、スキャンインターフェースを使用する場合、新しい配列を確認する認知的オーバーヘッドが予測レイアウトの利点を相殺することを示唆しています。[ 40 ]
レート向上への別のアプローチとして、 Dasher [ 41 ]があります。これは言語モデルと算術符号化を使用して、履歴に基づいて可能性に応じてサイズを変えて代替の文字ターゲットを画面に表示します。[ 42 ] [ 43 ]
生成される単語の速度は、システムの概念レベルに大きく依存する可能性がある。多数の文レベルの発話からユーザーが選択できるTALKシステムは、60 wpmを超える出力速度を示した。[ 44 ]

固定表示デバイスとは、記号や項目が特定の形式で「固定」されているデバイスのことを指します。一部の資料では、これらを「静的」ディスプレイと呼んでいます。[ 45 ]このような表示デバイスは、他のデバイスよりも学習曲線が単純です。
固定表示デバイスは、コミュニケーションボードなどのローテクAACデバイス(ローテクとは、電池、電気、電子機器を必要としないデバイスと定義される)の典型的な配置を再現しています。それらはいくつかの欠点を共有しています。たとえば、通常は限られた数のシンボルとメッセージに制限されます。[ 37 ] 21世紀の技術進歩により、固定表示SGDはもはや一般的に使用されていません。
動的表示デバイスは通常、タッチスクリーンデバイスでもあります。これらは一般的に、電子的に生成された視覚的なシンボルを生成し、それを押すと表示される選択肢が変わります。ユーザーはページリンクを使用して、語彙やメッセージの適切なページに移動することで、利用可能なシンボルを変更できます。

動的表示デバイスの「ホーム」ページには、さまざまな状況や会話のトピックに関連するシンボルが表示される場合があります。これらのシンボルのいずれかを押すと、そのトピックに関連するメッセージが表示される別の画面が開きます。[ 37 ]たとえば、バレーボールの試合を見ているときに、ユーザーは「スポーツ」シンボルを押してスポーツに関連するメッセージが表示されるページを開き、次にスコアボードを示すシンボルを押して「スコアは?」というフレーズを発話することができます。
動的表示デバイスの利点としては、はるかに豊富な語彙が利用できること、および構築中の文を見ることができることが挙げられます。[ 35 ]動的表示デバイスのもう1つの利点は、基盤となるオペレーティングシステムが、携帯電話、テキストメッセージ、電子メールなど、複数の通信チャネルのオプションを提供できることです。 [ 46 ]リンシェーピング大学の研究では、このような電子メールの作成方法により、SGD を使用する子供たちが新しい社会的スキルを身につけ、社会参加を増やすことができたことが示されています。[ 47 ]

低価格システムには、動的なディスプレイや画面のない、キーボードとオーディオスピーカーの組み合わせが含まれる場合もあります。このタイプのキーボードは、入力されたテキストを直接オーディオスピーカーに送信します。そのため、必ずしも必要ではない画面を必要とせずに、あらゆるフレーズを音声で入力できます。音声キーボードを標準的な電話機やスピーカーフォンと併用することで、音声に障害のある人が電話で双方向の会話を行うことができるという、シンプルな利点があります。
SGD の出力はデジタル化および/または合成される可能性があります。デジタル化されたシステムは直接録音された単語やフレーズを再生しますが、合成音声はテキスト読み上げソフトウェアを使用し、感情的な情報は少なくなりますが、新しい単語を入力することで新しいメッセージを話すことができます。[ 48 ] [ 49 ]現在、個人は SGD で録音されたメッセージとテキスト読み上げ技術を組み合わせて使用しています。[ 49 ]ただし、一部のデバイスは 1 種類の出力のみに制限されています。

単語、フレーズ、またはメッセージ全体をデジタル化してデバイスに保存し、ユーザーが再生を開始することができます。[ 1 ]このプロセスは正式にはボイスバンキングとして知られています。[ 50 ]録音された音声の利点には、(a)聞き手に自然な韻律と自然な話し方を提供すること[ 3 ] (たとえば、AAC ユーザーと同じ年齢と性別の人がメッセージを録音するように選択できます)、[ 3 ]、および (b) 笑い声や口笛など、ユーザーにとって重要な追加の音を提供することが含まれます。さらに、デジタル化された SGD は、患者が自分で話す能力を失ったときに、患者と家族の両方に一定の正常性を提供します。
録音音声のみを使用する大きな欠点は、ユーザーが新しいメッセージを作成できないことです。デバイスに事前に録音されたメッセージに限定されます。[ 3 ] [ 51 ]デバイスによっては、録音の長さに制限がある場合があります。[ 3 ] [ 51 ]
合成音声を使用するSGDは、言語の音声規則を適用して、ユーザーのメッセージを音声出力(音声合成)に変換します。[ 1 ] [ 49 ]ユーザーは新しい単語やメッセージを自由に作成でき、他の人がデバイスに事前に録音したものに限定されません。[ 49 ]
合成音声の利用は、ユーザーが既に所有しているコンピューターやスマートフォンを活用するソフトウェアの開発によって増加している。SpokenやAvazといったAACアプリはAndroidとiOSで利用可能で、医師の診察を受けたり、特殊な機器の使い方を習得したりすることなく、音声生成装置を利用できる。多くの場合、これらの選択肢は専用機器よりも手頃な価格である。
合成音声生成器では、個別にまたは組み合わせて使用できる複数のメッセージ作成方法が可能です。メッセージは、文字、単語、フレーズ、文、画像、または記号から作成できます。[ 1 ] [ 51 ]合成音声では、メモリ容量への要求が少なく、メッセージの保存容量は事実上無制限です。[ 3 ]
合成音声エンジンは多くの言語で利用可能であり、[ 49 ] [ 51 ]音声速度、ピッチ範囲、性別、アクセントパターン、ポーズ、発音例外などのエンジンのパラメータはユーザーが操作できます。[ 51 ]

SGDの選択セットは、そのデバイスを使用する人が利用できるすべてのメッセージ、シンボル、およびコードのセットです。[ 52 ]この選択セットの内容、構成、および更新は、活発な研究分野であり、ユーザーの能力、興味、年齢など、多くの要因の影響を受けます。[ 4 ] AACシステムの選択セットには、ユーザーがまだ知らない単語が含まれる場合があります。これらは、ユーザーが「成長して習得する」ために含まれています。[ 4 ]特定のSGDにインストールされているコンテンツには、製造元が提供する多数のプリセットページが含まれる場合があり、ユーザーのニーズとデバイスが使用される状況に応じて、ユーザーまたはユーザーのケアチームが作成した追加のページが多数含まれる場合があります。[ 4 ]
研究者のベウケルマンとミレンダは、SGDの初期コンテンツを選択するための情報源として、家族、友人、教師、介護スタッフなど、さまざまなものを挙げています。一般的に、1人の個人が特定の環境で必要とされるすべての音声表現を生成する知識と経験を持っているとは限らないため、さまざまな情報源が必要です。[ 4 ]例えば、親やセラピストは、「 innit 」のようなスラングを追加することを考えないかもしれません。[ 53 ]
これまでの研究では、定型発達者の語彙使用とAACユーザーの単語使用の両方を分析して、新しいAAC機器のコンテンツを作成してきました。このようなプロセスは、コアとなる発話や音声表現を生成するには効果的ですが、特定の語彙が必要な状況(たとえば、乗馬に対するユーザーの興味に直接関連する用語)では効果が劣ります。「周辺語彙」という用語は、個人の興味やニーズに特有の語彙を指します。機器用の周辺語彙を開発する一般的な手法は、兄弟姉妹、両親、教師、同僚、その他の関係者など、複数の「情報提供者」にインタビューを行うことです。[ 4 ]
マッセルホワイトやセントルイスなどの他の研究者は、最初の語彙項目はユーザーにとって関心が高く、頻繁に適用でき、意味の範囲が広く、機能的に実用的であるべきだと提唱している。[ 5 ]これらの基準は、AAC分野でSGDコンテンツの生態学的チェックとして広く使用されている。[ 4 ]

BeukelmanとMirendaは、語彙の選択には継続的な語彙の維持も含まれることを強調しています。[ 4 ]しかし、AACの難点は、ユーザーまたは介護者が新しい発話(新しい友人の名前や個人的な話など)を手動でプログラムする必要があり、コンテンツを自動的に追加する既存の商用ソリューションがないことです。[ 34 ]この難点を克服するために、多くの研究アプローチが試みられてきました。 [ 54 ]これらは、ユーザーの友人や家族との会話のログに基づいてコンテンツを生成するなどの「推論された入力」から、Webcrawlerプロジェクトのようにインターネットからデータをマイニングして言語資料を見つけるものまで多岐にわたります。[ 55 ]さらに、ライフログベースのアプローチを利用することで、デバイスのコンテンツは、ユーザーが1日の間に経験する出来事に基づいて変更できます。[ 54 ] [ 57 ]ユーザーのより多くのデータにアクセスすることで、より高品質のメッセージを生成できますが、機密性の高いユーザーデータが漏洩するリスクがあります。[ 54 ]例えば、全地球測位システムを利用することで、デバイスのコンテンツを地理的な位置に基づいて変更することができる。[ 58 ] [ 59 ]
最近開発された多くのSGDには、個人が使用するコンテンツを監視するのに役立つパフォーマンス測定および分析ツールが含まれています。これはプライバシーに関する懸念を引き起こし、デバイスの使用をこのように監視するという決定にデバイスの使用者が関与すべきだと主張する人もいます。[ 60 ] [ 61 ]自動コンテンツ生成機能を備えたデバイスの提案に関して同様の懸念が提起されており、[ 57 ]プライバシーはSGDの設計においてますます重要な要素となっています。[ 53 ] [ 62 ] AACデバイスはユーザーの生活のあらゆる領域で使用されるように設計されているため、 AACの使用状況で見られる個人データ管理の問題の幅広いファミリーを中心とした、デリケートな法的、社会的、技術的な問題があります。たとえば、SGDは、会話のログや自動的に追加されたコンテンツを削除するユーザーの権利をサポートするように設計する必要があるかもしれません。[ 63 ]
動的音声生成装置(SGD)のプログラミングは、通常、補助コミュニケーション専門家が行います。患者は使用する単語やフレーズの種類を自分で選択するため、専門家は患者のニーズに対応する必要があります。例えば、患者は年齢、障害、興味などに応じて異なるフレーズを使用します。そのため、コンテンツの整理には非常に時間がかかります。さらに、SGDは健康保険でカバーされることはほとんどありません。結果として、資金と人員の両面でリソースが非常に限られています。ボストン小児病院のジョン・コステロ医師は、病院内だけでなく全国の病院でもこれらのプログラムを継続し、十分な人員を確保するために、寄付を募る原動力となっています。
{{cite web}}: CS1 maint: 数値名: 著者リスト (リンク)