中国語の書き言葉は、漢字と呼ばれる表意文字と句読点などの記号を用いて中国語の様々な言語を表記する文字体系です。漢字は、アルファベットの文字や音節文字のように発音を直接表すものではありません。むしろ、この文字体系は形態音節的であり、漢字は発音される音節の長さですが、一般的には言語の形態素に対応しており、形態素は独立した単語である場合もあれば、多音節語の一部である場合もあります。ほとんどの漢字は、漢字の意味や発音を反映する可能性のある部首または片盤と呼ばれる小さな構成要素から成り立っています。 [ 1 ]読み書きには数千の漢字の暗記が必要であり、大学教育を受けた中国語話者は約4,000の漢字を知っています。[ 2 ] [ 3 ]このため、各漢字の発音を音訳するために、ピンインやボポモフォなどの補完的な音声表記システムが現代で採用されるようになりました。 [ 4 ] [ 5 ]
中国語の文字は、殷王朝後期(紀元前1250年頃~紀元前1050年頃)に甲骨文字の形で初めて確認されているが、[ 6 ] [ 7 ] [ 8 ]文字のような記号を作成するプロセスは、それより数世紀前の新石器時代後期から青銅器時代初期(紀元前2500年頃~2000年頃)に始まったと考えられている。 [ 9 ]周王朝(紀元前1046年~紀元前256年)には、中国語の文字はより成熟した青銅文字と篆書に発展し、後者は短命な秦王朝(紀元前221年~紀元前206年)で標準化され[ 10 ] 、その後漢王朝(紀元前202年~紀元後220年)でより便利な書記体(立方体と呼ばれるプロセス)にさらに統合された。その後数千年にわたり、これらの文字は、正式な楷書体からよりくだけた行書体や草書体まで、中国書道の高度に発達したスタイルへと進化し、[ 11 ]宋体、方松体、ゴシック体などの印刷を目的とした標準化された書体も生まれました。さまざまな中国語方言が分岐するにつれて、二言語併用の状況が生まれ、そうでなければ相互に理解できない方言を話す人々が、文語体を使って文章でコミュニケーションをとることができるようになりました。[ 12 ] 20世紀初頭には、文語体は大部分が口語体中国語に置き換えられ、これは北京方言を基にした標準形である現代標準中国語の文法にほぼ対応しています。他のほとんどの中国語方言は独自の口語体で書かれていませんが、広東語、上海語、福建語などの地方の書き方の伝統があります。
中国語の書き言葉は、アルファベットや音節文字に基づいていません。[ 13 ]ほとんどの文字は、いくつかの異なる原則に従って組み立てられる小さな構成要素の複合体として分析できます。文字や構成要素は、意味や発音の側面を反映している場合があります。中国語の文字構成に関する最もよく知られた解説は、西暦100年頃に徐深によって編纂された『説文解字』です。徐深は中国語の文字の最も初期の形態にアクセスできなかったため、彼の分析は文字体系の本質を完全に捉えているとは考えられていません。[ 14 ]それにもかかわらず、その広範さにおいて『説文解字』に取って代わる後世の著作はなく、今日でも語源研究にとって重要なものです。[ 15 ]
『説文解子』によれば、漢字は6つの基本原理に基づいて発展した。[ 16 ](これらの原理は『説文解子』によって普及したが、それ以前に発展しており、それらに関する最も古い記述は紀元前150年頃の文献である『周礼』にある。[ 17 ])最初の2つの原理は、文(wén)と呼ばれる単純な文字を生み出す。[ 16 ]
残りの4つの原理は、歴史的に字(zì)と呼ばれてきた複雑な文字を生成するが、この用語は現在では一般的に、単純な文字か複雑な文字かを問わず、すべての文字を指すのに使われている。これら4つのうち2つは、より単純な部分から文字を構成する。[ 16 ]
最後の2つの原則は新しい書き言葉を生み出すのではなく、既存の形式に新しい意味を移すものである。[ 16 ]
中国語の書き言葉は表意文字であるという一般的な認識とは対照的に、書文解字の文字の大部分(約95%)は発音の要素を反映しているか、論理的な集合体である。[ 1 ]実際、いくつかの音韻複合体は元々は単純な象形文字であり、後に意味語根が追加されて拡張された。例として、現在では古語となっている炷(zhù)「ランプの芯」があり、これは元々はランプスタンドの象形文字であった。主(現在はzhǔと発音され、「ホスト」を意味する文字)または火(huǒ)「火」という文字が追加され、意味が火に関連していることを示す。[ 18 ]
漢字は、たとえ2つの単純な形を横に並べたり、上から下に並べたりして構成されている場合でも、正方形に収まるように書かれます。そのような場合、各形は圧縮されて、文字全体が正方形に収まるようになります。[ 19 ]
文字の構成要素は、さらに個々の筆画に細分化できます。漢字の筆画は、主に次の8つのカテゴリに分類されます。「横」⟨一⟩、「縦」⟨丨⟩ 、 「左下」⟨丿⟩ 、 「右下」⟨丶⟩、「上昇」、「点」⟨ 、⟩、「鉤」⟨亅⟩、「回転」⟨乛⟩、⟨乚⟩、⟨乙⟩。[ 20 ]
漢字を書く際の筆順に関する8つの基本ルールがありますが、これらは一般的に適用されるだけで、時には破られることもあります。[ 21 ]

漢字は基本的に直線的で互いに繋がっていないため、中国語の書き言葉には決まった向きは必要ありません。中国語の文章は伝統的に上から下へ、右から左へと縦書きで書かれていました。20世紀以前の文語中国語では句読点はほとんど、あるいは全く使われず、文や句の区切りは主に文脈と音節のパターンによって示されるリズムによって決まりました。[ 22 ]
20世紀には、西洋の文字体系で使われるレイアウト(テキストを左から右に書き、上から下に並べる)が中国本土で主流となり、1955年に中国政府によって義務付けられました。縦書きレイアウトは、美的効果のため、または看板や本の背表紙などスペースの制約がある場合に今でも使われています。[ 23 ]台湾政府も2004年に公文書でこれに倣いましたが、一部の書籍や新聞では縦書きレイアウトが残っています。[ 24 ]
中国語は、看板や横断幕などで右から左に並んで書かれることはあまりないが、左から右への書き方が依然として一般的である。[ 25 ]
句読点の使用もより一般的になっています。一般的に、句読点は文字1文字分の幅を占めるため、テキストはグリッド内で視覚的に整列されます。簡体字中国語で使用される句読点は、西洋の文字体系で使用される句読点の影響を明らかに受けていますが、一部の記号はアジア言語特有のものです。たとえば、二重引用符と一重引用符(『 』と「 」)、および中空のピリオド(。)があり、これは西洋のピリオドと同じように文を区切るために使用されます。列挙コンマ(、)と呼ばれる特別な記号は、文中の節ではなく、リストの項目を区切るために使用されます。

中国語の書き言葉は、最も古くから継続的に使用されている文字体系の一つです。[ 26 ]中国語の書き言葉として広く認められている最も古い例は、殷王武丁(紀元前1250年頃~紀元前1192年頃)の治世中に作られた甲骨文字です。これらの文字は、殷王家が行った占いの結果を記録するために、主に牛の肩甲骨と亀の甲羅に刻まれました。まず、質問を表す文字が骨に刻まれました。次に、骨を火で加熱し、できたひび割れを解釈することで、質問の答えが占いで示されました。そして、その解釈が同じ甲骨に刻まれました。[ 27 ]
2003年、河南省の賈湖遺跡で亀の甲羅に刻まれた11個の孤立した記号が発見された。その中には目(mù;「目」)など、現代の漢字に驚くほどよく似たものもあった。賈湖遺跡は紀元前6600年頃のもので、現存する最古の中国語の文字よりも5000年以上も古い。安徽省の中国科学技術大学で考古学者チームを率いていたガーマン・ハーボトルは、これらの記号が中国語の文字の先駆けだったのではないかと示唆した。しかし、古文書学者のデイビッド・ケイトリーは、時間の隔たりが大きすぎて関連性を確立することはできないと主張している。[ 28 ]殷王朝末期(紀元前1250年頃~紀元前1050年頃) から、中国の文字は西周王朝(紀元前1046年頃~紀元前771年)と春秋時代(紀元前771年~紀元前476年)に作られた儀式用青銅器の鋳造銘文に見られる形へと進化し、金文(jīnwén )と呼ばれる書体となった。金文の文字は甲骨文字の文字よりも角張っていない。この書体は戦国時代(紀元前475年~紀元前221年)にますます規則化され、徐申が『説文解子』の資料として用いた「六国文字」(liùguó wénzì)と呼ばれる書体に落ち着いた。これらの文字は後に装飾され様式化されて篆書となり、これは現代でも使用されている最古の中国語の文字の形である。これらは主に署名印章、つまり印鑑として使用され、中国の文書や美術品の署名の代わりによく使われます。李斯は、秦王朝(紀元前221~206年)によって統一されたばかりの中国全土で篆書を標準として普及させました。 [ 10 ]
篆書が最初に書記体として採用されたのは、統一戦争以前の秦国の書記たちが働いていたことに遡る。書記体は一般的に「平らな」外観を持ち、篆書体よりも幅が広い。 [ 29 ]書記体から発展した半草書体では、文字の要素が互いに融合し始めるが、文字自体は一般的に分離したままである。これは、文字が正統な形では認識できないほどになることが多い完全草書体とは対照的である。 [ 30 ]楷書体は最も広く認識されている書体であり、半草書体の影響を大きく受けている。楷書体では、各文字の各画が他の画から明確に引き出されている。[ 31 ]

楷書体は中国語の典型的な書体と考えられており、ほとんどの印刷体の基礎となっています。さらに、楷書体には筆順が定められており、文字を正しく書くためにはこの筆順に従う必要があります。[ 32 ]厳密に言えば、この筆順は書道体、行書体、草書体にも適用されますが、特に行書体と草書体では、この筆順から外れることがあります。例えば、文字「木(mù ; '木' )」は、まず左から右に横画を描き、次に上から下に縦画を描き、次に上から下に左斜め画を描き、最後に上から下に右斜め画を描かなければなりません。[ 33 ]
20世紀半ば以降、中国語は主に簡体字または繁体字のいずれかを使用して書かれるようになった。簡体字は、いくつかの文字を統合し、文字あたりの平均画数を減らしたもので、国民の識字率向上を目的として中国政府によって開発された。この時期に識字率は急速に上昇したが、一部の観察者はこれを他の教育改革や生活水準の全般的な向上によるものとしている。簡体字の使用が識字率に影響を与えたという結論を裏付ける体系的な研究はほとんど行われておらず、中国で行われた研究は、特定のテキストサンプルで平均的に節約された画数を定量化するなど、恣意的な統計に焦点を当てている。[ 34 ]簡体字は中国本土、シンガポール、マレーシアで標準であり、繁体字は香港、マカオ、台湾、および一部の海外華人コミュニティで標準である。[ 35 ]
簡体字は一貫性に欠けるという特徴もある。例えば、伝統的な讓(ràng)「許す」は让に簡体化され、右側の音節が17画から3画に減り、左側の⾔「話」部首も簡体化されている。しかし、壤(rǎng)「土」や齉(nàng)「鼻を鳴らす」などの簡体字では同じ音節は減らされていない。これらの漢字は比較的まれであり、したがって画数の減少はごくわずかである。[ 36 ]他の簡体字は、万(wàn)「万」のように、長年使われてきた書道の略語に由来しており、伝統的な形は萬である。[ 37 ]

中国語の文字は、常に個々の発音音節を表すために使用されてきました。黄河流域で文字が発明された当時、中国語の話し言葉は主に単音節語であり、各文字は単音節語に対応していました。[ 39 ]その後、中国語の話し言葉は、より多くの多音節語を獲得しました。[ 40 ]それらは通常、古い単音節語に対応する形態素から構成される複合語です。[ 41 ]
2000年以上にわたり、中国語の書き言葉の主流は文語体でした。文語体の語彙と構文は、孔子の時代(紀元前500年頃)に話されていた中国古典の言語に根ざしていました。時を経て、文語体は、その後分岐した様々な方言中国語から文法と語彙の要素を取り入れました。20世紀までには、文語体は話し言葉のどの方言とも明らかに異なり、別々に学ぶ必要がありました。[ 42 ] [ 43 ]一度習得すれば、異なる方言を話す人々の間でのコミュニケーションの共通媒体となり、西暦1千年紀末までには、それらの方言の多くは相互に理解不能でした。[ 44 ] [ 12 ]

中国語の諸方言は発音が異なり、語彙や文法もそれほど違いはない。[ 45 ] 1919年の五四運動の間接的な結果として古典中国語に代わって標準の書き言葉となった現代中国語は、厳密には単一の方言に縛られるものではないが、地理的な範囲と話者数の両方で圧倒的に広く普及している中国語方言群である北京語の語彙と構文を最もよく表している。[ 46 ]この形式は書き言葉の口語中国語として知られている。[ 47 ]書き言葉の口語中国語の表現の中には、北京語以外では文法的に誤りであったり慣用的ではないものもあるが、その使用によって異なる方言を話す者同士のコミュニケーションが可能になる。この機能は、ラテン語などのリンガエ・フランカエの機能に類似していると考えられる。読み書きができる話者にとっては共通の媒体として機能するが、個々の文字の形は、すでに意味がわかっていない限り、その意味を理解する手がかりにはほとんどならない。[ 48 ]ギルアド・ズッカーマンによる標準中国語における音韻意味の一致の調査では、中国語の表記体系は多機能であり、意味内容と音韻内容の両方を伝えると結論付けられている。[ 49 ]
方言間の語彙の差異は、「方言文字」の非公式な使用にもつながっており、これには、標準中国語の書き言葉では古風とみなされる、以前は文語中国語で使用されていた文字が含まれる場合がある。[ 50 ]広東語は、香港や海外で使用されている口語標準の書き言葉を持ち、この言語特有の単語を表す非公式の文字が多数ある点で、北京語以外の地域言語の中では独特である。[ 51 ]広東語の書き言葉はインターネット上で非常に人気が高まっているが、標準中国語は依然として正式な文書によるコミュニケーションで通常使用されている。[ 52 ]程度は低いものの、福建語も台湾やその他の地域で同様に使用されているが、広東語に見られるような標準化のレベルには達していない。しかし、台湾の教育部では福建語の標準文字セットを公布しており、学校で教えられ、一般の人々の使用が奨励されている。[ 53 ]
中国語の書き言葉の歴史において、様々な媒体が文字を書くために用いられてきた。それらには以下のようなものがある。
現代中国語の単語の大部分は複数の文字で構成されているため、中国語の識字能力を測る尺度は少なくとも2つあります。それは、知っている文字の数と知っている単語の数です。ジョン・デフランシスは、著書『Advanced Chinese Reader』の序文で、典型的な中国の大学卒業生は4,000~5,000の文字と40,000~60,000の単語を認識していると推定しています。[ 2 ]ジェリー・ノーマンは、著書『Chinese』の中で、文字の数を3,000~4,000とやや低くしています。[ 3 ]これらの数字は、中国語の文字の複雑な発展によって複雑になっています。多くの場合、1つの文字に複数の異体字ができました。この発展は、秦王朝時代の篆書体の標準化によってある程度抑制されましたが、すぐに再び始まりました。『説文解字』には10,516字が収録されているが、そのうち9,353字は固有の文字(編纂当時すでに使われなくなっていた文字もあるかもしれない)で、さらに1,163字の異体字が含まれている。一方、それから1000年も経たない1039年に編纂された北宋の『済雲』には53,525字が収録されており、そのほとんどが異体字である。[ 54 ]
中国語の書き言葉はアルファベットや音節文字に基づいていないため、中国語の辞書や、中国語の文字を他の言語で定義する辞書は、英語の辞書のように簡単にアルファベット順に並べたり、語彙的に整理したりすることができません。効率的な検索を可能にするために中国語の文字を整理する必要性から、文字を整理して索引付けするためのさまざまな方法が生まれてきました。[ 55 ]
伝統的な仕組みとしては、文字の語根を用いる部首法がある。これらの語根、すなわち部首は、論理的な集約と音韻的な複合体によって文字を構成する部分と、一般的には不完全ながらも一致する。214の標準的な部首は康熙帝の治世(1700年頃)に開発された。これらは康熙部首と呼ばれることもある。部首はまず画数(つまり、部首を書くのに必要な画数)で並べられ、同じ画数内でも部首には定められた順序がある。[ 56 ]

すべての漢字は、(時として恣意的または誤って)これら214の部首のうちのちょうど1つに分類されます。[ 55 ]多くの場合、部首自体が文字であり、当然ながらその部首の最初に表示されます。特定の部首の下にある他のすべての文字は、その文字の画数によって順序付けられます。しかし通常、特定の部首の下には、特定の画数を持つ文字がまだ多数存在します。この時点では、文字は認識可能な順序で表示されません。ユーザーは、その画数を持つすべての文字を順に確認して文字を見つける必要があります。通常、便宜上、それらの文字は、その文字が表示されるページの上部に一覧表示されます。[ 57 ]
部首法は書かれた文字にのみ適用されるため、文字を調べる前にその文字の読み方を知る必要はありません。項目が見つかれば、通常は読み方がわかります。しかし、文字のさまざまな語根のうちどれが適切な部首であるかを特定するのは必ずしも容易ではありません。そのため、辞書には、総画数で索引付けされた、見つけにくい文字のリストが辞書の冒頭付近によく含まれています。辞書によっては、このリストに全文字のほぼ7分の1が含まれています。[ 55 ]あるいは、辞書によっては、「難しい」文字を複数の部首の下にリストし、それらの項目の1つを除いてすべて、康熙による文字の「正統的な」位置に読者を誘導します。
他にも、部首方式の欠点を補うために、さまざまな整理方法が存在するが、あまり一般的ではない。例えば、康熙部首を主軸とする辞書には、通常ピンインまたはボポモフォで表記される発音による補助索引が付いているのが一般的である。[ 58 ]この索引は、目的の文字が見つかるメイン辞書のページを指し示す。他の方法では、文字の構造のみを使用する。例えば、四隅方式では、文字は四隅に最も近い画の種類に従って索引付けされる(そのため、この方法の名前が付けられている)[ 59 ] 、または倉頡方式では、文字は24の基本構成要素のセットに分解される。[ 60 ]四隅方式も倉頡方式も、適切な部首を識別する必要はないが、多くの画や構成要素には別の形があり、これらの方法を効果的に使用するには、それらを記憶する必要がある。
コンピュータ化された中国語辞書が利用可能になったことで、前述の索引方式のいずれかを使用して漢字を検索できるようになり、検索プロセスが短縮された。
中国語の文字は発音を正確に表すものではありません。そのため、さまざまな中国語の方言の音を表記するために、多くの音訳システムが開発されてきました。多くはラテン文字を使用していますが、キリル文字やペルシア・アラビア文字を使用するシステムも設計されています。これらのシステムは、とりわけ、対応する方言を学習する学生によって使用されています。中国語の文字を音声表記システムに置き換えるという考えは、五四運動の際に初めて広く提唱されました。これは、国の識字率を向上させたいという願望が動機の一つでした。この考えは、1949年の共産党の勝利後、さらに支持を集め、共産党は中国語の表記に関する2つの並行したプログラムを直ちに開始しました。1つ目は、中国人口の約3分の2が話す北京語の音を表記するためのアルファベットの開発でした。[ 45 ]もう1つのプログラムは、標準文字の簡略化を研究するものでした。当初、文字の簡略化は音声表記の考え方と競合するものではなく、むしろ、完全な音声表記システムへの移行を容易にすることを目的としていました。[ 5 ]
1958年までに、公式の優先事項は文字の簡略化へと移行した。漢語ピンイン(または単に「ピンイン」)アルファベットは開発されたが、中国語の文字をこれに置き換える計画は延期され、このアイデアはもはや積極的に追求されていない。この優先事項の変更は、ピンインの設計が他の方言を排除した標準中国語に特有のものであることが一因であった可能性がある。[ 61 ]
ピンインは、標準中国語の音韻を表すために、発音記号付きのラテン文字を使用します。ピンインは、ほとんどの場合、ロマンス語や国際音声記号(IPA) における既存の発音を反映した文字の音価を使用します。ただし、フランス語などの言語で有声性の区別に対応するbとpのような文字のペアは、北京語でより多く見られる気音の区別を表します。 [ 45 ]ピンインはまた、他の言語での割り当てとは著しく異なる音を表すために、いくつかの子音文字を使用します。たとえば、ピンインのqとx は、それぞれ英語のchとshに似た音に対応します。ピンインは北京語の主要な翻字システムとなっていますが、他のシステムには、ボポモフォ、ウェード・ジャイルズ、イェール、EFEO、グヨウ・ロマツィなどがあります。[ 62 ]
台湾議会で可決された新法により、台湾の公文書は右から左、または上から下への書き方が禁止された。