Loading article…
Unicode照合アルゴリズム(UCA)は、Unicode技術レポート#10で定義されたアルゴリズムであり、Unicodeで表現できる任意の表記システムと言語のテキストを表す文字列からバイナリキーを生成するカスタマイズ可能な方法です。これらのキーは、大文字と小文字、アクセントなどを無視するオプションを使用して、言語のルールに従って照合または並べ替えるために、バイトごとに効率的に比較できます。[1]
Unicode技術レポート#10では、デフォルトのUnicode照合要素テーブル(DUCET)も規定されています。このデータファイルは、デフォルトの照合順序を規定しています。DUCETは、さまざまな言語に合わせてカスタマイズ可能であり、[1] [2]、そのようなカスタマイズの一部は、Unicode共通ロケールデータリポジトリ(CLDR)で見つけることができます。[3]
UCAのオープンソース実装は、International Components for Unicode( ICU)に含まれています。[4] [5] ICUは調整をサポートしており、CLDRの照合調整はICUに含まれています。[6] [2]
参照
- 照合
- 国際標準化機構(ISO) 14651
- 欧州発注規則(EOR)
- 共通ロケールデータリポジトリ(CLDR)
参考文献
- ^ ab Whistler, Ken; Scherer, Markus; Davis, Mark (2022-08-26). 「UTS #10: Unicode 照合アルゴリズム」. Unicode . 2023-08-16閲覧。
- ^ ab Hosken, Martin (2021-09-23). Unicode Sort Tailoring: Tutorial (PDF) (1.3 ed.). SIL Writing Systems Technology . pp. 2–3 . 2023-08-16閲覧。
- ^ 「CLDR リリース/ダウンロード」。Unicode CLDR 。 2023年8月16日閲覧。
- ^ 「ICU - Unicode の国際コンポーネント」。Unicode。2023年8 月 16 日閲覧。
- ^ 「Collations」。SyBooks Online 。 2023年8月16日閲覧。
- ^ 「カスタマイズ」。ICU ドキュメント。2023年 8 月 16 日閲覧。
外部リンク
- Unicode 照合アルゴリズム: Unicode 技術標準 #10
- Mimer SQL Unicode 照合表
ツール
- ICU ロケール エクスプローラーUnicode の国際コンポーネントを使用した Unicode 照合アルゴリズムのオンライン デモ
- ICU 照合デモ
- msort 照合の定義とキーの抽出において、並外れたレベルの柔軟性を提供するソート プログラム。
