漢字ITは、コンピュータで漢字を処理する情報技術です。英語の表記体系では数十種類の文字が使われていますが、中国語ではそれよりはるかに大きな文字セットが必要です。新華社辞書には1万以上の文字が収録されています。[1] Unicode多言語文字セットの149,813文字のうち、98,682文字(約3分の2)が中国語です。[2]つまり、漢字のコンピュータ処理は他の言語の中でも最も難しいのです。
中国語は、コンピュータ入力、内部エンコード、漢字出力の技術など、他の言語に比べて特別な問題を抱えています。[3]
文字入力
コンピューターによる中国語の文字入力は、英語ほど簡単ではありません。英語は26文字と他のいくつかの文字で書かれ、各文字はキーボードのキーに割り当てられています。中国語も同様の方法で入力できます。ただし、少なくとも数千のキーを備えた巨大なキーボードが必要になります。キーボードで文字を探すのは大変な作業です。[4]
中国語キーボードを「縮小」して、1 つのキーに複数の文字を配置しようとした人もいました。これにより、元の 1 ステップの入力手順が、筆者にとっては 2 ステップになりました。
- 対象文字の文字グループのキーを押すと、
- グループ内のターゲット文字を選択します。
結果として得られたキーボードは、依然として扱いにくいままでした。1つのキーに多くの文字を配置すると、文字を認識しやすくするためにキーが大きくなり、大きなグループから文字を選択するのが難しくなります。さらに、合理的で簡単に習得できる方法で文字を均等にグループ化することは容易ではありません。文字全体を直接入力する中国語キーボードのもう1つの欠点は、英語入力との一貫性がないことです。[5]
もう一つの方法は、各中国語の文字を英語の文字にエンコードして、英語のキーボードで中国語を入力できるようにすることです。実際、この方法は中国語のコンピュータ入力の主流となっています。エンコード入力方式のソフトウェアには、文字コード表 (码表;碼表; mǎbiǎo ) が含まれています。英語のキーボードでASCII入力コードを入力すると、ソフトウェアは表内で一致する中国語の文字を検索します。同じコードを共有する文字が複数ある場合は、ユーザーに選択用に表示されます。入力方式を習得しやすくするために、エンコードは中国語の文字の形、音、または意味の特徴に基づいている必要があります。文字の意味はより抽象的で複雑な傾向があるため、入力エンコードは通常、音または形に基づいています。[5]
サウンドベースのエンコーディング
音声ベースのエンコードは通常、中国語音声学のための既存のラテン文字体系に基づいています。たとえば、普通話のピンインや広東語の聯合音などです。中国語の文字の入力コードは、ピンイン文字列に続いて、オプションで声調を表す数字が続きます。たとえば、香港の普通話ピンイン入力コードはxianggangまたはxiang1gang3で、広東語の聯合音コードはhoenggongまたはhoeng1gong2です。これらはすべて英語キーボードで簡単に入力できます。普通話ピンインには、英語キーボードにはない ê と ü の 2 つの文字があります。国家標準[6]によれば、ピンイン入力コードでは ê は「ea」、ü は「v」で表されます。一部の中国語入力ソフトウェアでは、ê は「e^」、ü は「u:」または「uu」と表されます。中国で一般的な音声ベースの入力方法には、中国本土と香港では Microsoft Pinyin、Sogou Pinyin、Google Pinyin、Jyutping、台湾ではbopomofoなどがあります。
サウンドベースのエンコーディングには、次のような多くの利点があります。
- ほとんどの中国人作家はすでに普通話とピンインを熟知しているので、学習は簡単です。
- 中国語学習と一致します。
- 簡体字と繁体字の中国語の文字を同様の方法で入力できます。
- 同じキーボードで中国語と英語を入力できます。
音声ベースのエンコードの欠点は、同音異義語の中国語の文字が同じコードを共有するため、エンコードが重複する頻度が高いことです。中国語の文字は通常、1 つの音節で発音されます。中国語の普通話には、声調を考慮しない場合で約 400 の異なる音節があり、声調を考慮すると約 1,200 の音節があります。一方、中国語の文字は数万あります。つまり、平均して、各音節は 10 文字以上をカバーする必要があります。この問題は、中国語を文字ごとではなく単語ごとに入力することでほぼ解決できます。これは、現代中国語のほとんどの単語が複数の文字で構成されており、単語レベルでのエンコードの重複がはるかに少ないためです。たとえば、香港 (Hong Kong) のピンインは単語に固有ですが、香または港のどちらの文字も他の多くの文字と発音が共通しています。音声ベースの中国語入力のもう 1 つの制限は、コンピューターに入力する前に中国語の文字の発音を知っておく必要があることです。この問題は、フォームベースのエンコードによって解決できます。[7]
フォームベースのエンコーディング
漢字は、その形や構造に従って入力することもできます。ほとんどの漢字は、一連の構成要素に分けられ、各構成要素は筆順で一連の画で構成されています。たとえば、「福」という文字は、次のように分解できます 。
構成要素: 礻、一、口、田
画数:丶㇇丨丶、一、丨𠃍一、丨𠃍一丨一基本構成要素は数百[8]あり、文字数よりはるかに少ない。各構成要素を英語の文字で表し、文字の書き順に並べることで、入力方法の作成者は、英語キーボードの入力コードとして使用できる文字列を取得できます。もちろん、文字列が長すぎる場合は、作成者が文字列から代表文字を選択する規則を設計することもできます。たとえば、Cangjie入力方法では、文字「疆」(「境界」)は、構成要素「弓土一田一」に対応して「NGMWM」としてエンコードされ、一部の構成要素は省略されています。
ストロークベースのコーディングは、コンポーネントベースのコーディングよりも簡単です。ただし、コードが長くなる傾向があります。中国語の文字には、約30〜40の特徴的なストロークがあります。[9]これらは通常、辞書の参照や携帯電話での中国語入力のために、heng(一)、shu(丨)、pie(丿)、dian(丶)、zhe(𠃍)の5つのカテゴリに分類されます。ASCIIキーボードでの中国語入力の場合、2つのストロークを組み合わせて、5 * 5 = 25の異なるペアを形成し、英語の文字にマッピングできます。たとえば、入力方法ZYQでは、[10]ストロークペアのシーケンス「一一、一丨、一丿、...、𠃍丿、𠃍丶、𠃍𠃍」は、それぞれ「a、b、c、...、w、x、y」で表されます。一般的な形式ベースの符号化方式としては、中国本土の五筆字、台湾と香港の倉頡字などがあります。 [11]
フォームベースの入力方法の長所と短所は、音声ベースの入力方法と相補的です。フォームベースの入力方法の主な利点は、重複エンコードの度合いが低いため、漢字を高速に入力できることです。主な欠点は、学習の難しさです。通常、学生は100を超える構成要素とそれに対応する英語の文字を覚える必要があります。さらに、文字を一連の構成要素に分解し、その中から選択するための複雑なルールを学習する必要があります。[12]
光学文字認識
中国語の文字は、英語と同様の技術に基づいた 光学文字認識(OCR)、手書き認識、音声認識によってコンピュータに入力することもできます。 [13] 英語と比較すると、中国語のOCRと手書き認識は、26文字ではなく何千もの異なる一般的な文字があるため、より困難です。一般的に、印刷文字の認識は、その形式がより標準化されているため、手書き文字よりも正確です。人気のある宋、楷、黒など、さまざまなフォント用のOCRツールがあります。オフラインの手書きと比較して、オンラインの手書き認識は、コンピュータが書かれた文字を「見る」だけでなく、それを書く手順も「見る」ため、より効率的です。[14]
音声認識
音声認識は、連続した音声信号を単語のシーケンスに変換します。2つの問題があります。異なる話者による単語の発音の違いと、英語の「pair」、「pear」、「pare」、中国語の「攻势」、「公式」、「公示」(gong1shi4) などの同音異義語の存在です。音声認識は、コーパス統計手法と言語規則に依存しています。中国語の便利な特徴は、各文字が1音節で発音されることです。[14]
中国語の文字認識と音声認識はどちらも応用レベルに達している。しかし、どちらも人間による校正やオンラインでの文字選択なしでは100%の正確性を保証することはできない。[14]
インテリジェント入力エンジン
インテリジェント入力の最も重要な特徴は、候補文字の選択に文脈制約を適用することである。例えば、Microsoft Pinyinでは、ユーザーが入力コード「daxuejiaoshou」を入力すると、大学教授(大学教授)が表示されるが、「daxuepiaopiao」と入力すると、コンピューターは大雪飘飘(大雪が飛ぶ)を提案する。大学と大雪の非発音区別ピンイン文字はどちらも「daxue」であるが、コンピューターは後続の単語に基づいて合理的な選択を行うことができる。[15]
インテリジェントな中国語入力では、コーパス情報と言語規則も活用されています。あいまいな中国語の文字の中からコンピュータが選択する文字は必ずしも正しいとは限らず、さらなる改善が必要です。[15]
その他の入力
中国語の表記体系には、完全な漢字の他に、句読点(例:「。」、「、」、「《》」)、画数(例:「丿」、「𠃍」、「乚」)、部首(例:「氵」、「宀」、「刂」)、ピンインで使用される発音区別符号付きの母音文字や広東語のイェール式ローマ字表記(例:「ā」、「á」、「ǎ」、「à」)などのローマ字表記に使用される文字があります。
Microsoft Windows、Office、Web には、一般的な中国語入力方法での句読点の入力から、ソフト キーボードによる発音区別符号付きピンインの入力、Unicode Web サイトや Unicode 文字変換からの画数や部首の入力、Web 上の特別なツールを使用してピンインやその他の文字を入力するまで、これらの中国語補助文字のほとんどすべてを入力できる機能が用意されています。非表語文字の入力に関する詳細は、論文[16]に記載されています。この論文には、 280 個の非 ASCII 非表語文字のリストが含まれており、それぞれに Unicode コード ポイントと著者の設計による入力コードが注釈として付けられています。Microsoft Word では、Unicode コード ポイントを入力して Alt+X キーを押すことで文字を入力することもできます。
情報交換のための中国語文字エンコーディング
コンピュータ内部では、各文字は内部コードで表現されます。2 台のマシン間で文字が送信される場合、その文字は情報交換コードになります。現在では、ASCII や Unicode などの情報交換コードが内部コードとして直接使用されることがよくあります。次のセクションでは、GB、Big5、Unicodeなど、中国の情報技術で使用される最も重要なエンコード標準を紹介します。
イギリス
GB は、 Guobiaoの略で、北京語で「国家标準」または「国家標準」の略で、中華人民共和国が発行する公式規格の参照番号の接頭辞です。
最初のGB中国語文字エンコード規格は1980年に発表されたGB 2312である。これには6,763の漢字が含まれており、そのうち3,755のよく使われる漢字はピンインで分類され、残りは部首(インデックス構成要素)で分類されている。GB2312は簡体字中国語文字用に設計された。簡体字化された繁体字はカバーされていない。文字コードは2バイトの16進数で表され、例えば香港のGBコードはそれぞれCFE3とB8DBである。GB2312は一部のコンピュータやWWWで今でも使用されているが、GB13000.1やGB18030などの拡張文字セットを備えた新しいバージョンがリリースされている。[17]
GBエンコーディングの最新バージョンはGB18030です。GB18030は簡体字と繁体字の両方の中国語文字をサポートし、Unicodeの文字セットと一致しています。[18]
ビッグ5
Big5エンコーディングは、1980年代初頭に台湾の5つの大手IT企業によって設計され、それ以来、コンピュータで繁体字中国語を表すための事実上の標準となっています。Big5は、台湾、香港、マカオで広く使用されています。元のBig5標準には、中国本土の簡体字を除く13,053の漢字が含まれていました。各文字は、2バイトの16進コードでエンコードされています。たとえば、香 (ADBB) 港 (B4E4) 龍 (C073) です。Big5文字セットの中国語の文字は、部首順に並べられています。Big5の拡張バージョンには、一部の簡体字と香港広東語の文字を含むBig-5EとBig5-2003があります。[19]
ユニコード
Unicode は、多言語文字エンコーディングの最も影響力のある国際標準です。これは、ISO/IEC10646 標準と整合しています (または実質的に同等です)。Unicode のフルバージョンは、4 バイトのデジタルコードで文字を表し、世界中のすべての言語のすべての文字をカバーする巨大なエンコーディング空間を提供します。基本多言語面 (BMP) は、多くの言語の重要な文字の 2^16=65,536 のコードポイントを持つ 2 バイトのカーネルバージョンの Unicode です。CJKV (中国、日本、韓国、ベトナム) の表意文字領域には、GB2312 と Big5 の繁体字の簡体字と繁体字のすべての文字を含む 27,522 の文字があります。 [20]
Unicode 15.0には、149,813文字の多言語文字セットがあり、そのうち約3分の2にあたる98,682文字が康熙部首で分類された中国語です。非常にまれにしか使用されない文字も利用可能です。以下は、括弧内にUnicodeを付した文字の例です:H(0048)、K(004B)、香(9999)、港(6E2F)、龍(9F8D)、龙(9F99)、龖(9F96)、龘(9F98)、𪚥(2A6A5)。[21]
香港補助文字セット(HKSCS)[22]の5,009文字すべてがUnicodeに含まれています。HKSCSは、香港政府によって、初期にはコンピュータでは利用できなかった香港特有の漢字のコレクションとして開発されました。たとえば、咗(すでに)、嘢(物)、脷(舌)、曱甴(ゴキブリ)などです。
中国語のエンコードでは、GB、Big5、Unicode が同時に使用されているため、コンピューターが元のコードとは異なるエンコード標準のテキストを誤って解釈すると、間違った文字が表示されます。これは、「luànmǎ」(コードの混乱) と呼ばれる現象で、Web や電子メールで時々発生します。この問題は、エンコードまたは文字セットを手動で選択するか (Web ブラウザーの場合など)、事前にコードを変換することで解決されることがよくあります。
ユニコードはますます普及しています。UTF-8(ユニコードは)すべてのウェブサイトの98.1%で使用されていると報告されています。ユニコードは最終的に他のすべての情報交換コードと内部コードに取って代わり、コードが混乱することはなくなると広く信じられています。[23]
出力
書体
英語や他の言語と同様に、中国語の文字はプリンタや画面上で様々なフォントやスタイルで出力されます。最も人気のある中国語フォントは、宋体(宋体)、楷体(楷体)、黑体(黑体)、仿宋体(仿宋体)のフォントファミリーです[24]。例えば、
汉字字体[a] (歌) 汉字体 (Kai) 汉字体(ヘイまたはブラック) 汉字字体 (FangSong)
フォントサイズ
フォントには様々なサイズがあります。国際的な測定システムであるポイントに加えて、漢字は1859年にアメリカ人が中国の印刷用に発明したサイズ番号(字号と呼ばれる)でも測定されます。表1は、中国語版MS Wordで使用できるすべてのフォントサイズとそれに相当するポイントの一覧です。[25]
表1:中国語のフォントサイズ(数字、ポイント、mm)
文字号(数字) 数量(pt) 毫米(mm) 例 八号 (#8) 5 1.76 中国語[b] 七号 (#7) 5.5 1.93 中国語 小六号 (#small 6) 6.5 2.28 六号 (#6) 7.5 2.64 中国語 小五号 (#small 5) 9 3.16 中文 五号 (#5) 10.5 3.69 中国語 小四号 (#small 4) 12 4.22 中文 四号 (#4) 14 4.92 中国語 小三号 (#small 3) 15 5.27 中文 三号 (#3) 16 5.62 中国語 小二号 (#small 2) 18 6.33 中文 二号 (#2) 22 7.73 中国語 小一号 (#small 1) 24 8.44 中文 一号 (#1) 26 9.14 中国語 小初号 (#small Primary) 36 12.65 中文 初号 (#primary) 42 14.76 中文
この表は、数字のフォント サイズをサポートしていないコンピューターで中国語をタイプセットする場合に特に便利です。たとえば、この表から、中国語のサイズ番号 3 (三号) は、例の文字に示されているように、16 ポイント、つまり高さ 5.62 mm に相当することがわかります。
特定のフォントで書かれた中国語の文字のイメージは、コンピュータ内では英語の場合と同様に、ドットのマトリックス(ドットマトリックスフォントまたはビットマップフォントと呼ばれる)またはアウトライン(アウトラインフォントと呼ばれる)によって表現されます。[13]
参照
注記
- ^ ターゲットフォントに設定する
- ^ 目標サイズに設定する
参考文献
引用
- ^ 語学研究所 2020年。
- ^ 「Unicode統計」。
- ^ フー1999、5-232頁。
- ^ Su 2014、218頁。
- ^ ab 張 2016、p.421。
- ^ 中国国家言語委員会 2001年。
- ^ 李2013、333頁。
- ^ 中国国家言語委員会 1997年。
- ^ https://www.unicode.org/charts/PDF/U31C0.pdf
- ^ 張 2003.
- ^ 張 2016、422頁。
- ^ 李2013、333-334頁。
- ^ ab ホワイト 2008.
- ^ abc Su 2014、p.225。
- ^ Su 2014、222ページより。
- ^ 張 2012年。
- ^ Su 2014、213-215頁。
- ^ ケン、ルンデ (2022 年 8 月 4 日)。 「GB 18030-2022 規格」。中くらい。2022 年8 月 7 日に取得。
- ^ "[chinese mac] 文字セット". chinesemac.org . 2023年11月24日閲覧。
- ^ Unicodeコンソーシアム2023。
- ^ 「Unicode統計」。
- ^ 「OGCIO : 香港補足文字セット (HKSCS)」.
- ^ 「ウェブサイトにおけるUTF-8の使用統計と市場シェア、2024年3月」。
- ^ 李2013、62頁。
- ^ 張 2006年。
引用文献
- 傅永和(1999年)。 中国語情報処理[中国情報処理] (中国語) (第3版)。広州:広東教育出版社。ISBN 978-7-540-64080-4。
- 中国社会科学院言語研究所編(2020年)。 新华字典[新華辞書] (中国語) (第12版)。北京:商務出版局。ISBN 978-7-100-17093-2。
- 李大遂(2013年)。 簡体字中国語[簡明実用中国語文字] (中国語) (第3版)。北京:北京大学出版局。ISBN 978-7-301-21958-4。
- Mullaney, Thomas S. (2024)。『中国のコンピューター:情報化時代の世界史』。マサチューセッツ州ケンブリッジ:MIT 出版。ISBN 978-0-262-04751-7。
- GB13000.1情報処理用文字セットの中国語文字コンポーネント標準(PDF)。北京:中国国家言語委員会。1997年。
- 汉语拼音方式の一般的な键盘表示规范[ユニバーサルキーボードによる中国語音声アルファベット入力方式の標準](中国語)。北京:中国国家言語委員会。2001年。
- 蘇培成 (苏培成) (2014) 現代の漢字学[現代中国語文字要点](中国語)(第3版)。北京:商務出版。ISBN 978-7-100-10440-1。
- Unicode 標準、バージョン 15.1.0。カリフォルニア州サウスサンフランシスコ: Unicode コンソーシアム。2023 年。
- White, R. (2008). 『コンピュータの仕組み』(第 9 版)インディアナポリス、インディアナ州: ケベック州。
- 張暁恒(2003)。 正易全: 一个动态结构笔组汉字编码输入法[正確性、容易性、完全性を目指して: 動的構造化ストロークグループに基づく中国語文字コーディング入力方式の構築]。中国情報処理ジャーナル。17 (3): 59– 65。
- 張暁恒 (2006) 「フォント サイズの数値、ポイント、メートル法」字形の「号制」「点制」と「米制」.コンピュータ工学と応用 コンピュータ工学とアプリケーション(中国語)42(10):175-177、215。
- 張暁恒(2012年)「非ASCII非漢字中国語文字のコンピュータ入力」中国語教育近代化ジャーナル。1 (2):18-36。
- 張暁恒 (2016)。「計算言語学」。ラウトレッジ中国語百科事典。オックスフォード:ラウトレッジ。pp. 420– 437。ISBN 978-0-415-53970-8。
