書き言葉において、表意文字(古代ギリシャ語のlogos「言葉」とgramma「描かれたもの、書かれたもの」に由来)は、表意文字または語彙文字とも呼ばれ、言語の意味的要素、例えば単語や形態素を表す書き言葉である。中国語やその他の言語で使用される漢字は表意文字であり、エジプトの象形文字や楔形文字も同様である。主に表意文字を使用する書き言葉体系は表意文字体系と呼ばれる。アルファベットや音節文字などの非表意文字体系は音素文字であり、個々の記号は音を直接表し、固有の意味を持たない。しかし、既知の表意文字体系はすべて何らかの音素要素を持ち、一般的には絵文字の原理に基づいている。純粋な表意文字に音素要素を加えることは、書き言葉体系が人間の言語を適切に符号化できるようにする上で重要な革新であると考えられている。
記録に残る最も古い文字体系のいくつかは表意文字である。メソポタミア、エジプト、中国、メソアメリカの最初の歴史上の文明はすべて何らかの形の表意文字を使用していた。[ 1 ] [ 2 ]
自然言語に用いられてきたすべての表意文字は、比較的限られた表意文字セットを拡張するために、リブスの原理に依拠している。文字のサブセットは、子音または音節のいずれかの音価に用いられる。音節領域が音節である場合、これらの文字が部分的に音韻的であることを強調するために、表意音節文字という用語が用いられる。古代エジプトのヒエログリフ、チョルティ文字、および中国語では、限定詞がさらに発展し、表意文字と組み合わせて意味を絞り込んでいる。中国語では、限定詞は音韻的に用いられる表意文字要素と融合しており、このような「部首と音韻」を持つ文字が文字の大部分を占めている。古代エジプトと中国語では、リブスの積極的な使用は、外来語や方言の綴りに限定されていた。
ロゴコナント文字体系では、母音を無視して、表す単語の子音に応じて音韻的に拡張できる文字が存在します。例えば、エジプト文字は
はsȝ 'アヒル' とsȝ '息子'の両方を表記するために使用されましたが、これらの単語は子音を除いて同じ発音ではなかったと考えられます。ロゴ子音文字の主な例は、エジプト象形文字、ヒエラティック文字、デモティック文字です。
音節文字(または形態音節文字)は、形態素を表す文字(多くの場合、多音節形態素)を持ちますが、音韻的に拡張すると単一の音節を表します。これには、楔形文字、アナトリア象形文字、クレタ象形文字、線文字Aと線文字B、漢字、マヤ文字、アステカ文字、ミシュテカ文字、およびバムン文字の最初の5段階が含まれます。
ササン朝時代の大部分において中期ペルシア語の表記に用いられたパフラヴィー文字(アラム語のアブジャドから発展したもの)には、独特な表意文字体系が存在した。これらの表意文字は、アラム語で単語を綴る文字で構成されているが、ペルシア語で発音される(例えば、mlkという組み合わせは「shah」と発音される)。ホズワーリシュン(異形文字の一種)と呼ばれるこれらの表意文字は、アラブによるペルシア征服とアラビア文字の変種が採用された後に完全に廃止された。
すべての歴史的な表意文字体系には音韻的側面が含まれています。言語のすべての単語や形態素に個別の基本文字を持たせるのは非現実的だからです。[ a ]アッカド語で使用された楔形文字のように、グリフの大部分が表意文字としてではなく音価のために使用されている場合もあります。多くの表意文字体系には意味的/表意的要素(表意文字を参照)もあり、エジプト語の場合は「限定詞」、中国語の場合は「部首」と呼ばれています。[ b ]
典型的なエジプトの用法は、複数の異なる発音を持つ単語を表す可能性のある表意文字に、意味を絞り込むための限定詞と、発音を特定するための音素を付加することであった。中国語の場合、文字の大部分は、名詞カテゴリーを示す部首と、発音の目安となる音素の固定された組み合わせである。マヤの体系は、エジプトと同様に音素を付加した表意文字を使用していたが、表意文字の要素は欠如していた。
すべての表意文字が特定の言語に関連付けられているわけではなく、言語と全く関連付けられていないものもあります。アンパサンドはラテン文字の表意文字で、[ 3 ]「e」と「t」の文字の組み合わせです。ラテン語では「et」は「and」と訳され、アンパサンドは今日でもこの単語を表すために使用されていますが、英語、スペイン語、オランダ語を話す人にとってはそれぞれ「and」、「y」、「en」の形態素を表すものとして、さまざまな言語で使用されています。
どの文字体系にも属さないUnicodeは、さまざまな意味を持つ文字の集合体です。Unicodeは、あらゆる言語のすべての文字を含む標準を構築するという意図を表明しています。[ 4 ]これはコンピュータの文字エンコーディングの一般的に受け入れられている標準ですが、ASCIIやBaudotなどの他の標準も存在し、デジタル通信でさまざまな目的で使用されています。これらのデータベースにある多くの表意文字は遍在しており、世界中のユーザーによってインターネットで使用されています。
中国の学者たちは伝統的に、語源に基づいて漢字を6種類に分類してきた。
最初の2種類は「単体」で、文字が他の文字とは独立して作成されたことを意味します。「単体」の象形文字と表意文字は、中国語の表意文字のごく一部を占めるにすぎません。中国語の文字体系においてより生産的だったのは、2つの「複合」方式、つまり異なる文字を組み合わせて作成された文字です。「複合」と呼ばれていますが、これらの表意文字も依然として単一の文字であり、他の表意文字と同じスペースを占めるように書かれています。最後の2種類は、文字そのものの形成方法ではなく、文字の使用方法に関するものです。

中国語の最も生産的な表記法である部首音字は、音節の音韻体系における特定の区別を無視することによって可能になった。古中国語では、語末子音/s/と/ʔ/は通常無視されていた。これらは中古中国語で声調に発展したが、新しい文字が作られる際にも同様に無視された。また、気音の違い(有気阻害音と無気阻害音、有声共鳴音と無声共鳴音の違い)、古中国語における A 型と B 型の音節の違い(口蓋化または咽頭化の有無として説明されることが多い)、そして時には語頭阻害音の有声化や語頭子音後の/r/の存在も無視された。それ以前の時代には、一般的に音韻的な自由度はより大きかった。中期中国語時代には、新たに作られた文字は、声調を除いて発音と完全に一致する傾向があった。これは、多くの場合、音を表す要素として、それ自体が部首と音を表す要素からなる複合文字を用いることによって実現された。
言語進化の長い期間のため、部首と音の組み合わせによって提供される文字内の構成要素の「ヒント」は、現代の用法では役に立たず、誤解を招く可能性があります。例として、標準中国語でměiと発音される每'各' を基にした漢字には、中国語でそれぞれwǔ、huǐ 、 hǎiと発音される、愛'屈辱'、悔'悔やみ'、海'があります。これらの漢字のうち 3 つは、ウィリアム H. バクスターとローラン サガートによる最近の再構築 [ 6 ] によると、古代中国語では非常に似た発音でした。/mˤəʔ/ (每) 、 /m̥ˤəʔ/ (悔)、/m̥ˤəʔ/ (海) ですが、その間の約3,000年の間に音の変化(最後の 2 つの漢字の場合は 2 つの異なる方言の発展を含む) により、根本的に異なる発音になりました。
中国語の文脈では、漢字(hanziとして知られる)は、純粋な概念というよりも、概して単語や形態素を表します。しかし、日本語と韓国語(それぞれkanjiとhanjaとして知られる)が漢字を採用したことで、この状況はやや複雑になっています。
中国語の形態素から構成される多くの中国語の単語は、文字表記とともに日本語や韓国語に借用されました。この場合、形態素と文字が一緒に借用されました。しかし、他の場合では、意味のみに基づいて、日本語や韓国語固有の形態素を表すために文字が借用されました。その結果、1つの文字が、複数の言語にわたって、意味は似ているが起源が異なる複数の形態素を表すことになる可能性があります。このため、漢字と漢字は形態素表記体系と呼ばれることがあります。[ 7 ]
言語処理に関する研究の多くは英語やその他のアルファベット表記言語に焦点を当ててきたため、言語処理の多くの理論は音声生成における音韻の役割を強調してきた。単一の文字が音韻的かつ表意的に表現される表意文字言語と、音韻的/音素的に綴られる言語を比較することで、異なる言語がどのように異なる処理メカニズムに依存しているかについての洞察が得られた。表意文字言語の処理に関する研究では、とりわけ処理における神経生物学的差異が検討されており、特に関心を集めている領域の一つが半球側性化である。表意文字言語はアルファベット表記言語よりもイメージと密接に関連しているため、いくつかの研究者は表意文字言語では右半球の活性化がより顕著になるはずだと仮説を立てている。いくつかの研究はこの仮説と一致する結果を示しているものの、正書法言語と音韻言語における半球側性化の役割について最終的な結論を出すには、相反する結果が多すぎる。[ 8 ]
注目されているもう 1 つのトピックは、同音異義語の処理の違いです。Verdonschot ら[ 9 ]は、同音異義語の文字の前に、その文字に関連する、または関連しない[ 10 ]絵が提示された場合に、同音異義語を声に出して読むのにかかる時間の違いを調べました。日本語と中国語の同音異義語の両方が調査されました。アルファベットでコード化された言語 (英語など) の単語生成は、文脈刺激の影響に対して比較的強い耐性を示していますが[ 11 ] Verdschot ら[ 12 ]は、日本語の同音異義語は、このようなタイプの影響に特に敏感であるようです。具体的には、参加者に音韻的に関連する絵が提示されてから、目標の文字を声に出して読むように求められた場合、反応時間が短くなりました。この研究からの音韻的に関連する刺激の例としては、たとえば、参加者に日本語でzouと発音される象の絵が提示されてから、同じくzouと発音される中国語の文字造が提示された場合が挙げられます。中国語の単語を読む際の反応時間には、音韻的に関連する文脈画像の影響は見られなかった。日本語と中国語は、(部分的に)表意文字で符号化されている言語であるが、日本語は同音異義語(2つ以上の異なる読み方ができる文字)が60%以上を占めるのに対し、中国語の文字のほとんどは1つの読み方しかないため、両者を比較することは興味深い。両言語とも表意文字で符号化されているため、文脈効果による日本語と中国語の音読の潜時差は、文字体系の表意文字的な性質に起因するものではない。代わりに、著者らは、潜時差は日本語における追加の処理コストによるものであり、日本語では、読み手は直接的な正書法から音韻への経路だけに頼ることができず、正しい発音を選択するために語彙統語レベルの情報にもアクセスする必要があると仮説を立てている。この仮説は、文字の理解力が低下した日本人アルツハイマー病患者が、特に困難なく単語を音読できたという研究結果によって裏付けられている。[ 13 ] [ 14 ]
語彙判断課題における英語と中国語の同音異義語の処理を比較した研究では、中国語の同音異義語処理に有利な点があり、英語の同音異義語処理に不利な点があることがわかっています。[ 15 ]英語の処理上の不利な点は、通常、英語における同音異義語の相対的な不足という観点から説明されます。同音異義語に遭遇すると、まずその単語の音韻表現が活性化されます。しかし、これは曖昧な刺激であるため、刺激の曖昧さを解消し、正しい発音を選択するには、正書法/語彙(「メンタル辞書」)レベルでのマッチングが必要です。対照的に、同じ読み方をする文字が多数存在する言語(中国語など)では、文字を読む人は同音異義語に馴染みがあり、この馴染みやすさが文字の処理とそれに続く正しい発音の選択を助け、刺激に注意を向けたときの反応時間を短縮すると仮説が立てられています。処理における同音異義語の影響をよりよく理解するために、Hino らは、[ 11 ]は、日本語を対象言語として一連の実験を行った。馴染みやすさを統制した上で、日本語では同音異義語が非同音異義語よりも処理上有利であることを発見した。これは、以前に中国語で発見されたものと同様である。研究者らはまた、英語の同音異義語の場合と同様に、綴りが似ている同音異義語が処理において不利になるかどうかをテストしたが、[ 16 ]、その証拠は見つからなかった。表意文字で符号化された言語とアルファベットで符号化された言語では、同音異義語の処理方法に違いがあることは明らかだが、表意文字で符号化された言語である日本語と中国語(つまり、それらの文字体系)における同音異義語の処理上の利点が、文字体系の表意文字的な性質によるものなのか、それとも単に文字体系の性質に関係なく同音異義語が多い言語の利点を反映しているだけなのかは、まだ明らかになっていない。
表意文字と他の文字体系の主な違いは、文字が発音と直接結びついていない点です。この分離の利点は、書き手の発音や言語を理解する必要がないことです。例えば、「1」は、読み手が「one」「ichi」「wāḥid」のいずれと発音しても理解できます。同様に、中国語の異なる方言を話す人々は、会話では互いを理解できないかもしれませんが、標準中国語で書かなくても、書面ではかなりの程度理解できる場合があります。そのため、近代以前の中国、ベトナム、韓国、日本では、古典中国語を用いた筆談によるコミュニケーションが、東アジアの国際貿易や外交の規範でした。
しかし、この分離には、読み書きを学ぶ際に発音とは別に表意文字を暗記する必要があるという大きな欠点もあります。日本語は表意文字の固有の特徴ではなく、独自の発展の歴史により、ほぼすべての表意文字に複数の発音があるという複雑さが加わっています。逆に、表音文字セットは話されたとおりに正確に書かれますが、わずかな発音の違いが曖昧さを生むという欠点があります。ギリシャ語、ラテン語、イタリア語、スペイン語、フィンランド語などの多くのアルファベット体系は、文字と音のほぼ1対1の関係を維持しながら、単語の書き方を標準化するという実用的な妥協をしています。英語、フランス語、タイ語、チベット語などの他の言語の正書法はすべてそれよりも複雑で、文字の組み合わせは、通常はその歴史に応じて、複数の方法で発音されることがよくあります。韓国語の文字体系であるハングルは、識字率を高めるために表意文字の漢字に取って代わるように設計されたアルファベット文字の一例です。後者は現在ではほとんど使われていないが、韓国ではハングルと組み合わせて使われることもあり、依然として一定の効力を持っている。
政府委託調査によると、中華人民共和国の「現代中国語常用字表」(现代汉语常用字表、Xiàndài Hànyǔ Chángyòngzì Biǎo)に掲載されている最もよく使われる3,500字は、200万語のサンプルの99.48%を占めている。繁体字の場合、中華民国教育部の「常用國字標準字體表」(常用國字標準字體表)には4,808字が掲載されており、香港教育人材局の「常用字字形表」(常用字字形表)には4,759字が掲載されている。これらはいずれも小学校と中学校で教えることを目的としている。小学校卒業後の教育では、新しい文字よりも新しい単語が多く、新しい単語は主に既に学習した2つ以上の文字の組み合わせである。[ 17 ]
電子機器では、入力キーの数に実際的な制限があるため、複雑な文字を入力するのは面倒な場合があります。漢字を入力するには、倉頡式や五筆式のように漢字を構成要素に分解する方法や、ボポモフォ式やピンイン式のように発音通りに単語を入力し、それに一致する漢字のリストから選択する方法など、さまざまな入力方法があります。前者の方法は(直線的に)速いですが、習得が難しいです。一方、中国語のアルファベットシステムでは、漢字を構成する画数を通常通りに入力し、それに対応する漢字を入力します。
また、グリフの数が多いため、プログラミングやコンピューティング全般において、文字セットが大きくなるにつれて、各グラフェムを格納するために必要なメモリ量も増えます。比較として、ISO 8859では各グラフェムに1バイトしか必要としませんが、 UTF-8でエンコードされた基本多言語面では最大 3 バイトが必要です。一方、たとえば英語の単語は、1 語あたり平均 5 文字とスペース 1 つで構成され[ 18 ]、したがって、1 語あたり 6 バイトが必要です。多くの表意文字には複数のグラフェムが含まれているため、どちらがよりメモリ効率が良いかは明らかではありません。可変幅エンコーディングにより、 Unicodeなどの統一文字エンコーディング標準では、文字を表すのに必要なバイトのみを使用できるため、大きな文字セットと小さな文字セットをマージすることによって生じるオーバーヘッドが削減されます。