中国語計算言語学は計算言語学のサブセットであり、コンピュータを用いて中国語を科学的に研究し、情報処理する分野です。その目的は、言語の仕組みをより深く理解し、言語アプリケーションの利便性を向上させることです。中国語計算言語学という用語は、中国語情報処理とほぼ同義で用いられることが多いですが、前者はより理論的、後者はより技術的に聞こえるかもしれません。[ 1 ]
本稿では、一般的な意味での計算言語学を紹介するのではなく、他の言語と比較して中国語の実装に伴う特有の問題に焦点を当てる。内容は、中国語文字情報処理、単語分割、固有名詞認識、自然言語理解と生成、コーパス言語学、機械翻訳などである。[ 1 ]
中国語文字情報技術(IT)は、中国語文字をコンピュータで処理する技術です。英語の表記体系では数十種類の文字が使われますが、中国語でははるかに多くの文字セットが必要です。新華辞典には1万字以上あります。[ 2 ] 149,813文字のUnicode多言語文字セットのうち、98,682文字(約2/3)が中国語文字です。[ 3 ]これは、中国語文字のコンピュータ処理がすべての言語の中で最も集中的であることを意味します。
中国語の文字をコンピュータに入力することは、文字体系が単純な言語よりも複雑です。たとえば、英語は26文字と少数のその他の文字で構成され、各文字はキーボードのキーに割り当てられています。理論的には、中国語の文字も同様の方法で入力できますが、文字数が多いため、ほとんどのアプリケーションではこの方法は実用的ではありません。何千ものキーを備えた巨大なキーボードが必要になり、ユーザーはキーボード上で個々の文字を見つけるのが難しく、時間がかかるでしょう。[ 4 ]代替方法として、英語のキーボードレイアウトを使用し、各中国語の文字を英語の文字でエンコードする方法があります。これは、今日の中国語の文字入力の主流の方法となっています。
音声ベースのエンコーディングは通常、中国語の音声表記に用いられる既存のラテン文字体系に基づいています。例えば、標準中国語(普通話)にはピンイン体系、広東語には粤拼体系が用いられます。中国語の文字の入力コードは、ピンインの文字列に、声調を表す任意の数字を付加したものです。例えば、香港(Hong Kong)の標準中国語ピンイン入力コードは「xianggang」または「xiang1gang3」、広東語粤拼コードは「hoenggong」または「hoeng1gong2」となり、いずれも英語キーボードで簡単に入力できます。
中国語の文字は、形式ベースのエンコーディングによって入力することもできます。ほとんどの中国語の文字は、それぞれが書き順の画のシーケンスで構成される一連のコンポーネントに分割できます。基本的なコンポーネントは数百個あり、[ 5 ]文字の数よりはるかに少ないです。入力方法の作成者は、各コンポーネントを英語の文字で表し、文字の書き順に並べることで、英語のキーボードで入力コードとして使用できる文字列を作成できます。もちろん、作成者は、文字列が長すぎる場合に、代表文字を選択するルールを設計することもできます。たとえば、Cangjie入力方法では、文字疆(境界)は、コンポーネント「弓土一田一」に対応する「NGMWM」としてエンコードされ、一部のコンポーネントは省略されます。一般的な形式ベースのエンコーディング方法には、中国本土のWubi (五笔) と台湾および香港のCangjie (仓颉) があります。[ 6 ]
インテリジェント入力の最も重要な機能は、候補文字の選択にコンテキスト制約を適用することです。たとえば、Microsoft Pinyin では、ユーザーが入力コード「daxuejiaoshou」を入力すると、「大学教授 / 大學教授」(大学教授)が表示され、「daxuepiaopiao」と入力すると、コンピュータは「大雪飘飘 / 大雪飄飄」(大雪が飛ぶ)を提案します。 「大学」と「大雪」の声調のないピンイン文字はどちらも「daxue」ですが、コンピュータは後続の単語に基づいて合理的な選択を行うことができます。[ 7 ]
コンピュータ内部では、各文字は内部コードによって表現されます。2台のコンピュータ間で文字が送信される際、それは情報交換コードで表現されます。今日では、ASCIIやUnicodeといった情報交換コードが、内部コードとして直接使用されることがよくあります。
GB中国語文字エンコーディング規格の最初のものは、1980年に中国が発表したGB2312です。6,763の中国語文字が含まれており、そのうち3,755のよく使われる文字はピンイン順に並べられ、残りは部首(インデックス構成要素)順に並べられています。GB2312は簡体字中国語用に設計されています。簡体化された繁体字は含まれていません。文字のコードは2バイトの16進数で表され、たとえば香港(Hong Kong)のGBコードはそれぞれCFE3とB8DBです。GB2312は、GB13000.1やGB18030などの拡張文字セットを備えた新しいバージョンがリリースされていますが、一部のコンピュータやWWWではまだ使用されています。[ 8 ] GBエンコーディングの最新バージョンはGB18030で、簡体字と繁体字の両方の中国語をサポートし、Unicode文字セットと互換性があります。[ 9 ]
Big5エンコーディングの標準は、1980 年代初頭に台湾の 5 つの大手 IT 企業によって設計され、それ以来、コンピュータで繁体字中国語を表現する事実上の標準となっています。Big5 は、台湾、香港、マカオで広く使用されています。オリジナルの Big5 標準には、中国本土の簡体字は含まれず、13,053 の中国語文字が含まれていました。各文字は、2 バイトの 16 進コードでエンコードされます。たとえば、香 (ADBB)、港 (B4E4)、龍 (C073) などです。Big5 文字セットの中国語文字は、部首順に並べられています。Big5 の拡張バージョンには、簡体字と香港広東語文字を含む Big-5E と Big5-2003 があります。[ 10 ]
Unicode標準の完全版は、4 バイトのデジタル コードで文字を表し、世界中のすべての言語のすべての文字をカバーする巨大なエンコード スペースを提供します。基本多言語面 (BMP) は、Unicode の 2 バイト カーネル バージョンで、多くの言語の重要な文字に対して 2^16=65,536 のコード ポイントがあります。CJKV (中国、日本、韓国、ベトナム) 漢字エリアには 27,522 文字があり、GB2312 と Big5 繁体字のすべての簡体字と繁体字が含まれています。Unicode 15.0 には 149,813 文字の多言語文字セットがあり、そのうち 98,682 以上 (約 2/3) は康熙部首で分類された中国語です。非常にまれにしか使用されない文字も使用できます。例: H (0048) K (004B)、香 (9999)、港 (6E2F)、龍(9F8D)、龙 (9F99)、龖 (9F96)、龘 (9F98)、𪚥 (2A6A5)。[ 11 ] [ 12 ]
Unicodeはますます普及しています。UTF -8(Unicode)は全ウェブサイトの98.1%で使用されていると報告されています。Unicodeは最終的に他のすべての情報交換コードと内部コードに取って代わり、コードの混乱はなくなると広く信じられています。[ 13 ]
英語や他の言語と同様に、中国語の文字もさまざまなフォントやスタイルでプリンターや画面に出力されます。最も人気のある中国語フォントは、宋体、楷体、黒体、仿宋体です。[ 14 ]
フォントはさまざまなサイズで表示されます。ポイントという国際的な測定システムに加えて、中国語の文字は、1859年にアメリカ人が中国語の印刷のために考案したサイズ番号(字号と呼ばれる)でも測定されます。[ 15 ]
英語のテキストでは単語がスペースで区切られているため、単語を認識するのは簡単です。しかし、中国語の単語は境界マーカーで区切られていません。したがって、単語分割は中国語のテキスト分析の最初のステップです。たとえば、
中文信息学报(中国語原文) 中文信息学报(単語分割テキスト) 中国語情報誌(逐語訳英語) 中国情報処理ジャーナル(英語名)
コンピュータ上での中国語の単語分割は、中国語テキストの文字を語彙集(中国語の単語リスト)と照合することによって、文の先頭から順方向、または文の末尾から逆方向に照合することによって行われます。分割の曖昧さには、交差型と多項式型の2種類があります。[ 16 ]
通常、交差の曖昧さは次のような形式になります。
ABCとは、A、AB、BC、Cがすべて語彙に含まれる単語であることを意味します。
元の文字列を、ABの後にCが続く単語、またはAの後にBCが続く単語に分割することが可能です。例えば、「美国会」は「美国会」(米国議会)または「美国会」(米国はできる/するだろう)を意味する可能性があります。
多項式分割の曖昧性の最も一般的な形式はABで、A、B、ABはすべて単語です。つまり、文字列は1つの単語とみなすことも、2つの単語に分割することもできます。たとえば、次の文の文字列「可以」は次のようになります。
(1) 坐ってもいいです。 座っても構いません。 座っても構いませんよ。 (2) あなたは他人でもいいです。 それらを例にとると良いでしょう。 彼らを例に挙げてみてもいいでしょう。
単語分割の曖昧さは、中国語コーパスから得られた言語規則と単語共起確率を使用して、文脈情報で解決できます。通常、長い単語のマッチングの方が信頼性が高くなります。自動単語分割の正答率は95%に達しています。[ 17 ]しかし、テキストを完全に理解する必要があるため、近い将来100%の正答率を保証することはできません。代替ソリューションは、英語の場合のように、単語を分割して書くように人々に促すことです。[ 18 ]しかし、これはコンピュータによる単語分割が不要になるという意味ではありません。英語でも、音声分析には単語分割が必要だからです。
固有名詞は人、場所、機関などの名前であり、英語では各単語の最初の文字を大文字にして表記されます。例えば、「Mr. John Nealon」、「America」、「Cambridge University」などです。しかし、中国語の固有名詞は通常、特定のスタイルで表記されません。[ 19 ]
中国語テキスト中の人名や地名の認識は、名前のリストによってサポートされる。しかし、世界中に存在する膨大な数の場所や人々、そしてそれらが出現、変化、消滅するという動的な特徴を考慮すると、そのようなリストは決して完全ではない。また、固有名詞ではない名詞と似た名前もある。例えば、中国南部には民众(Minzhong)という町があるが、これは「人々」を意味する普通名詞でもある。したがって、人名や地名の認識には、内部構成と外部コンテキストにおけるそれらの識別特性を利用する必要がある。固有名詞に注釈を付けたコーパスも有用な参考資料となる。 [ 19 ]
辞書に載っていない人名は、姓と肩書きのリストを使って識別できます。例えば、「张大方先生,李经理」のように、张(張)と李(李)は中国の姓、先生(氏)と经理(マネージャー)は肩書きです。张大方話では、中国語の名は通常姓の後に続き、1文字か2文字で構成されるという規則と、人が話せる(話せる)という事実から、张大方を人名として正しく識別できます。
地名にはコンピュータの認識に役立つ特徴もあります。たとえば、「在广东省中山市民众镇」では、構成語の省、市、镇は地名の終了記号であり、在は場所の前に頻繁に現れる前置詞です。
コンピュータによる認識の正答率は、人名では約90%、地名では約95%に達している。[ 17 ]