中国語の文字の内部構造を記述するためのシステムがいくつか提案されています。これには、筆画、構成要素、筆順、および文字の理想的な正方形内でのそれぞれの位置が含まれます。この情報は、UnicodeおよびISO/IEC 10646によって1つのコードポイントに統合された文字の異体字を識別するのに役立つだけでなく、Unicodeで標準化されたエンコーディングがまだない珍しい文字の代替表現形式を提供するのにも役立ちます。これらのシステムの多くは、通常のスクリプトに対応すること、および文字の内部構造を提供することを目指しており、文字の内部構成をインデックス化し、類似の文字間で相互参照することで、文字の検索を容易にします。
文字記述言語(CDL) は、ウェンリン研究所のためにトム・ビショップとリチャード・クックが共同で作成したXML ベースの宣言型言語です。CDL は、文字の意味や語源の歴史を反映する必要のないコンポーネントの配置によって文字を定義します。コンポーネントが文字全体の正方形の割り当てられた部分に収まるようにするには、50 ストローク未満のセットで約 1,000 個のコンポーネントを構築でき、それによって数万の文字を記述できます。[ 1 ]
Unicode標準(バージョン15.0)の第18章では、コードポイントを持つ構成要素の配置によって文字を特徴的に記述するために使用される「表意文字記述シーケンス」(IDS)構文が定義されています。U+2FF0~U+2FFFの範囲にある16個の特殊文字は、他の文字やシーケンスを組み合わせてより大きな文字を形成するための接頭辞演算子として機能します。
他の Unicode ブロックには、さらに 2 つの表意文字が散在しています。U +303E 〾 IDEOGRAPHIC VARIATION INDICATOR は公式には表意文字ではありませんが、表意文字のシーケンスで使用されることがあります。
これらのシーケンスは、特定のフォントに存在しない、あるいはUnicode標準に全く含まれていないため、直接印刷できない文字を読者に説明するのに役立ちます。たとえば、CJK統合漢字拡張FでU+2DA21 𭨡としてエンコードされているsawndip文字は、⿰書史と説明できます。また、辞書検索の際のクエリの概略的な入力方法としても使用できます。![]()
これらのシーケンスは、個々の文字を別々に保持するか、表意文字記述シーケンスを解析して記述された表意文字を描画することによってレンダリングできます。ただし、これらだけでは、すべての文字に対して明確なレンダリングを提供するわけではありません。たとえば、シーケンス⿱十一 は、中央の横棒が狭い⼟ 'EARTH'と、中央の横棒が広い⼠ 'SCHOLAR'の両方を表します。
Unicodeにおけるこれらのシーケンスの仕様は、以前のGBKエンコーディングの文字と構文に基づいています。不足している組み合わせを補うために、後から追加のシンボルがエンコードされます。
Matthew Skala [ 2 ] [ 3 ]によるフリーソフトウェアパッケージ IDSgrep は、Unicode の IDS 構文を拡張して辞書検索のための追加機能を含みます。KanjiVG のデータベースを独自の拡張 IDS フォーマットに変換したり、関連する Tsukurimashou フォントファミリーによって生成された EIDS ファイルを検索したりできます。