TRACE は、 1986 年にJames McClellandとJeffrey Elmanによって提案された音声知覚のコネクショニストモデルです。 [1]これは、「TRACE」と呼ばれる構造に基づいています。これは、ユニットのネットワークで構成された動的処理構造で、システムの作業メモリと知覚処理メカニズムとして機能します。[2] TRACE は、知覚シミュレーションを実行するための実用的なコンピュータ プログラムになりました。これらのシミュレーションは、人間の心/脳が、リアルタイムで聞いた音声や単語をどのように処理するかを予測したものです。
インスピレーション
TRACEはコネクショニズムの形成期に作成され、並列分散処理:認知の微細構造の探究の章に収録されました。[3]研究者は、音声知覚に関する特定の問題がコネクショニストのインタラクティブ活性化モデルの観点から概念化できることを発見しました。その問題とは、
- スピーチは時間的に延長される
- 音声(音素)が互いに重なり合う
- 発音は、その前後の音によって影響を受け、
- 話し言葉には自然な変動があり(例:外国訛り)、環境にもノイズがあります(例:混雑したレストラン)。
これらのそれぞれにより、音声信号が複雑になり、しばしば曖昧になり、人間の心/脳が実際に聞いている単語を判断することが困難になります。非常に簡単に言えば、インタラクティブ活性化モデルは、さまざまな種類の処理ユニット(音素、単語)を独立したレイヤーに配置し、活性化されたユニットがレイヤー間で情報を渡すことを可能にし、レイヤー内のユニットが互いに競争し、モデルによって「勝者」が「認識」されるまで、この問題を解決します。
主な調査結果
「TRACEは、音声入力の任意の部分に一致する複数の単語候補の活性化をインスタンス化した最初のモデルでした。」[4]音声知覚のシミュレーションでは、TRACEコンピュータプログラムに模擬音声入力を提示し、プログラムを実行して結果を生成します。シミュレーションが成功すると、結果が人間の音声処理方法と意味のある類似性があることがわかります。
単語認識の経時変化
心理言語学では、(1)単語の冒頭を聞くと、同じ最初の音を持つ一連の単語が記憶の中で活性化され、[5] (2)活性化された単語は、単語がさらに長く聞こえるにつれて互いに競合し、[6] (3)ある時点で、聴覚入力と語彙の競合の両方により、1つの単語が認識される、と一般的に認められています。[1]
たとえば、リスナーがbaldの冒頭を聞くと、 bald、ball、bad、bill という単語が記憶の中で活性化されます。その後すぐに、競合するのは bald と ball だけです (bad、bill は母音の音が入力と一致しないため排除されています)。その後すぐに、 bald が認識されます。TRACE は、音声の時間的次元を表現し、語彙集内の単語の活性化の強さを変え、処理中に単語を競合させることで、このプロセスをシミュレートします。図 1 は、単純な TRACE シミュレーションにおける単語の活性化の折れ線グラフを示しています。

音素知覚に対する語彙効果
/t/と/d/のちょうど中間にある曖昧な音声が話された場合、聞き手はそれが何なのか判断に迷うかもしれません。しかし、同じ曖昧な音が woo/?/ (ここで ? は曖昧な音)のように単語の終わりで聞こえた場合、聞き手はその音を/d/として知覚する可能性が高くなります。これはおそらく、「wood」は単語ですが、「woot」は単語ではないために発生します。語彙のコンテキストで提示された曖昧な音素は、周囲の語彙のコンテキストと一致していると知覚されます。この知覚効果はガノン効果として知られています。[7] TRACE はこれを確実にシミュレートし、比較的単純な言葉で説明できます。基本的に、入力(つまり wood)によってアクティブになった語彙単位は、音素層にアクティブ化をフィードバックし、その構成音素(つまり/d/)のアクティブ化を促進して、曖昧さを解決します。
分節化の語彙的基礎
話し手は通常、話すときに単語の間に休止を入れませんが[要出典]、聞き手はスピーチを単語の連続として聞き取ることに何の問題もないようです。これはセグメンテーション問題として知られ、言語心理学における最も古い問題の 1 つです。TRACE は、シミュレーションによって裏付けられた次の解決策を提案しました。単語が活性化され認識されると、単語の境界の位置が明らかになります。単語の活性化が強くなると単語の境界に対する自信が高まり、聞き手は次の単語がどこから始まるかを予測できるようになります。[1]
プロセス
TRACE モデルは、入力層と 3 つの処理層 (擬似スペクトル (特徴)、音素、単語) を持つコネクショニスト ネットワークです。図 2 は、TRACE の概略図を示しています。接続には 3 つのタイプがあります。(1) 入力から特徴、特徴から音素、音素から単語へのフィードフォワード興奮性接続、(2) 特徴、音素、単語層での横方向 (つまり、層内) の抑制性接続、(3) 単語から音素へのトップダウン フィードバック興奮性接続です。TRACE への入力は次のように機能します。ユーザーは、多次元の特徴ベクトルに変換される音素シーケンスを提供します。これは、時間的に拡張された音響スペクトルの近似です。入力ベクトルは、音声の時間的性質をシミュレートするために、一度に少しずつ表示されます。新しい入力チャンクが提示されるたびに、ネットワーク接続に沿ってアクティビティが送信され、処理層のアクティブ化値が変更されます。特徴は音素単位をアクティブ化し、音素は単語単位をアクティブ化します。パラメータは、興奮性および抑制性の結合の強さ、および他の多くの処理の詳細を制御します。単語または音素が認識されたことを決定する特定のメカニズムはありません。シミュレーションを知覚実験 (語彙決定など) からの反応時間データと比較する場合は、通常、活性化しきい値が使用されます。これにより、モデルの動作を認識として解釈し、認識時間を経過した処理サイクルの数として記録できます。TRACE 処理ダイナミクスをより深く理解するには、元の出版物[1]と、グラフィカル ユーザー インターフェイスを使用してシミュレーションを実行する TRACE ソフトウェア ツールを参照してください。

批判
心のモジュール性に関する議論
TRACE のモジュール性論争への関連性は、最近 Norris、Cutler、McQueen (2001) による音声知覚の Merge (?) モデルに関するレポートによって前面に押し出されました。[8] TRACE と多くの機能を共有していますが、重要な違いは次のとおりです。TRACE では単語単位が音素レベルに活性化をフィードバックできますが、Merge ではその処理がフィードフォワード接続に制限されます。この論争の観点では、TRACE は、処理の後の段階 (単語) が前の段階 (音素) に情報を送ることを許可しているため、モジュール性の中核となる情報カプセル化の原則に違反していると見なされています。Merge は、TRACE で説明される同じクラスの知覚現象は、フィードバック接続を含まないコネクショニスト アーキテクチャで説明できると主張してモジュール性を支持しています。Norrisらは、2 つの理論が同じ現象を説明できる場合、簡素化のため、より単純な理論が望ましいと指摘しています。
アプリケーション
言語療法
言語処理モデルは、発話および言語障害のある人の障害の性質を概念化するために使用できます。たとえば、表現性失語症の言語障害は、語彙単位間の過度の競合が原因で、どの単語も十分に活性化されないことが原因である可能性が示唆されています。[9] この仮説を支持する議論では、精神機能障害はネットワークモデルの処理のわずかな乱れによって説明できると考えられています。この新しい研究分野には、幅広い理論とモデルが組み込まれており、TRACE は拡大するパズルの 1 つのピースにすぎません。
音声認識ソフトウェアとの違い
TRACE などの音声知覚の心理言語モデルは、コンピュータの音声認識ツールとは区別する必要があります。前者は、人間の心/脳がどのように情報を処理するかについての心理学的理論です。後者は、音響信号をテキストに変換するための工学的ソリューションです。歴史的に、この 2 つの分野はほとんど接触していませんでしたが、これは変わり始めています。[10]
影響
TRACE が心理学文献に与える影響は、引用されている論文の数で評価できます。PsycINFOデータベースには、McClelland と Elman (1986) の引用が 345 件あります。図 3 は、出版以来の引用の分布を示しています。この図から、TRACE への関心が 2001 年に大幅に高まり、その後も年間約 30 件の引用で高い水準を維持していることがわかります。

参照
参考文献
- ^ abcd マクレランド、JL、エルマン、JL (1986)
- ^ McClelland, James; Elman, Jeffrey (1986年1月). 「音声知覚のTRACEモデル」.認知心理学. 18 (1): 1–86. doi :10.1016/0010-0285(86)90015-0. PMID 3753912. S2CID 7428866.
- ^ McClelland, JL, DE Rumelhart および PDP 研究グループ (1986)。並列分散処理: 認知の微細構造の探究。第 2 巻: 心理および生物学的モデル、マサチューセッツ州ケンブリッジ: MIT プレス
- ^ Weber, Andrea; Scharenborg, Odette (2012-05-01). 「話し言葉認識のモデル」. Wiley Interdisciplinary Reviews: Cognitive Science . 3 (3): 387–401. doi :10.1002/wcs.1178. hdl : 11858/00-001M-0000-0012-29E4-5 . ISSN 1939-5086. PMID 26301470.
- ^ Marslen-Wilson, W.; Tyler, LK (1980). 「話し言葉の理解の時間的構造」.認知. 8 (1): 1–71. CiteSeerX 10.1.1.299.7676 . doi :10.1016/0010-0277(80)90015-3. PMID 7363578. S2CID 11708426.
- ^ Luce, PA; Pisoni, DB (1998). 「話し言葉の認識: 近隣活性化モデル」. Ear and Hearing . 19 (1): 1–36. doi : 10.1097/00003446-199802000-00001. PMC 3467695. PMID 9504270.
- ^ Ganong, WF (1980). 聴覚知覚における音声分類。実験心理学ジャーナル:人間の知覚とパフォーマンス、6、110–125。
- ^ Norris, D.; McQueen, JM; Cutler, A. (2000). 「音声認識における情報の統合: フィードバックは不要」.行動および脳科学. 23 (3): 299–370. doi :10.1017/s0140525x00003241. hdl : 11858/00-001M-0000-0013-3790-1 . PMID 11301575. S2CID 32291239.
- ^ 正常者と失語症者における語彙アクセスの自己組織化ダイナミクス。McNellis, Mark G.; Blumstein, Sheila E.; Journal of Cognitive Neuroscience, Vol 13(2), Feb 2001. pp. 151-170。
- ^ Scharenborg, O.; Norris, D.; ten Bosch, L.; McQueen, JM (2005). 「音声認識装置はどのように機能すべきか?」.認知科学. 29 (6): 867–918. doi :10.1207/s15516709cog0000_37. hdl : 11858/00-001M-0000-0013-1E5D-C . PMID 21702797.
外部リンク
- jTRACE - TRACE モデルの Java 再実装。プラットフォームに依存しないオープンソース ソフトウェア。このページには、TRACE の以前の C 言語実装のダウンロードも含まれています。
