| タイ・タム | |
|---|---|
| 範囲 | U+1A20..U+1AAF (144 コードポイント) |
| 飛行機 | BMP |
| スクリプト | タイ・タム |
| 主なアルファベット | タイ・タム |
| 割り当て済み | 127 コードポイント |
| 未使用 | 17 個の予約コードポイント |
| Unicode バージョン履歴 | |
| 5.2 (2009) | 127 (+127) |
| Unicodeドキュメント | |
| コードチャート ∣ Webページ | |
| 注: [1] [2] | |
Tai Tham は、北タイ語 (Kam Mu'ang)、Tai Lü、および Khün 言語の表記に使用される Lanna 文字の文字を含むUnicode ブロックです。
歴史
最初にエンコードされた127のコードポイントのうち123はL2/07-007Rで提案され、[3]さらに2つ(U+1A5CとU+1A7C)はL2/08-037R2で提案され[4]、最後のペア(U+1A5DとU+1A5E)はL2/08-073で提案されました。[5] これら3つの文書の最後の文書では、最初の文書で示されたU+1A37とU+1A38の定義が変更されました。
次の Unicode 関連ドキュメントには、Tai Tham ブロック内の特定の文字を定義する目的とプロセスが記録されています。
下付き子音のエンコード
ᨲᩥ᩠ᨠと ᨲᩥᨠなどの単語は見た目も音も異なるため、基底子音と下付き子音は異なるエンコードになっています。下付き子音は2文字のシーケンスとしてエンコードされます。2番目は基底文字で、1番目は特殊文字U+1A60 TAI THAM SIGN SAKOTです。[3] :セクション2
子音に 2 つの下付き文字形式があり、その選択によって意味が変わる場合は、音節末尾の子音に通常使用される形式が SAKOT でエンコードされ、もう 1 つの形式には独自のコード ポイントが割り当てられます。このように下付き文字形式が異なる子音は 7 つあり、ᩁ RA、ᩃ LA、ᨷ BA、ᩈ HIGH SA、ᨾ MA、ᨳ HIGH RATA、およびᨻ LOW PA です。
ᨣᩕᩪ (タイ北部の発音: [k ʰ uː] ) は <U+1A23 LOW KA, U+1A55 MEDIAL RA , U+1A6A SIGN UU> としてエンコードされますが、 ᨠᩣ᩠ᩁ ( IPA: [kaː n ] ) は <U+ としてエンコードされます1A20 高 KA、U+1A63サイン AA、 U+1A60 サコット、U+1A41 RA > [3] : セクション 4
ᩆᩦ᩠ᩃ ( IPA: [siː n ] ) は、<U+1A46 HIGH SHA, U+1A66 SIGN II, U+1A60 SAKOT, U+1A43 LA > [3] : Section 14.5 としてエンコードされますが、 ᨸᩖᩦ ( IPA: [piː] ) は、<U+1A38 HIGH PA, U+1A56 MEDIAL LA , U+1A66 SIGN II> としてエンコードされます。 [3] : Section 4 (LA を音節末尾の文字として使用する場合は、 ᩁᨭᩛᨷᩣ᩠ᩃ [3] : Section 4 (北タイ語の発音: [lat tha baːn] )を参照)。
U+1A57 SIGN LA TANG LAI は <U+1A60 SAKOT, U+1A43 LA> のように見えますが、元々は <U+1A60 SAKOT, U+1A26 NGA> と合字したものです。 Tai Lue はこれを使ってᨴᩢ᩵ᩗᩣ ( IPA: [taŋ laːi] )という単語を書きます。[6]
ᨣᩝᩴ ( IPA: [kɔː b ɔː] ) は <U+1A23 LOW KA, U+1A5D SIGN BA , U+1A74 MAI KANG> としてエンコードされますが、 ᨠᩢ᩠ᨷ ( IPA: [ka p ] ) は <U+1A20 としてエンコードされます高KA、U+1A62 MAI SAT、 U+1A60 SAKOT、U+1A37 BA > および ᨠᩢᨷ᩠ᨷ᩺ ( IPA: [kap] ) は <U+1A20 HIGH KA、U+1A62 MAI SAT、U+1A37 BA、 U+1A60 SAKOT、U+としてエンコードされます1A37 BA、U+1A7A RAハーム>
- 最終提案[3] :1 では、Unicodeコンソーシアムは、現在SIGN BA(ᨣᩝᩴのように)は<SAKOT, BA>としてエンコードされ、現在<SAKOT, BA>(ᨠᩢ᩠ᨷのように)は<SAKOT, HIGH PA>としてエンコードされるべきであると受け入れましたが、ISOプロセス中に<SAKOT, BA>の意味が変わり[5]、SIGN BAが追加されました。しかし、ปを音節末子音とするタイ語の単語については、<SAKOT, HIGH PA>の元の意味が残っています。(この提案では、誤って<SAKOT, HIGH PA>を<SAKOT, HIGH PHA>と呼んでいます。)
ラオスとタイ北東部のパーリ語では、BA の代わりに HIGH PA が使用されています。したがって、パーリ語では <SAKOT, BA> が <U+1A60 SAKOT, U+1A38 HIGH PA> としてエンコードされていることに留意してください。
タイ・クエン文字には、下付き文字 HIGH SA の書き方が 2 種類あります。これらは互換性がありません。タイ・クエン文字では、ᩃᩮᩞと書くのが正しく、ᩃᩮ᩠ᩈと書くのは誤りです。[5]しかし、 ᩈᨶ᩠ᨶᩥᩅᩤ᩠ᩈ と書くのは正しいのですが、ᩈᨶ᩠ᨶᩥᩅᩤᩞと書くのは誤りです。ᩃᩮᩞ は<U+1A43 LA, U+1A6E SIGN E , U+1A5E SIGN SA >とエンコードされ、誤ったᩃᩮ᩠ᩈは<U+1A43 LA, U+1A6E SIGN E, U+1A60 SAKOT, U+1A48 HIGH SA > とエンコードされます。
タイ・クエン文字には、下付き文字MAを書く別の方法があります。この追加の方法には特別なコードポイントがあります[4] :項目9 北タイ語でᨵᨾ᩠ᨾ᩺ と書く単語は、タイ・クエン文字では、<U+1A35 LOW THA, U+1A3E MA, U+1A60 SAKOT, U+1A3E MA , U+1A7C KARAN>としてエンコードされたᨵᨾ᩠ᨾ᩼と、 <U+1A35 LOW THA, U+1A3E MA, U +1A5C SIGN MA , U+1A7C KARAN> としてエンコードされたᨵᨾᩜ᩼の両方で書かれます。
HIGH RATHA と LOW PA の両方の下付き文字の書き方は 2 通りあります。ᨶᩥᨣᨱᩛ [7] : 368 は <U+1A36 NA, U+1A65 SIGN I, U+1A23 LOW KA, U+1A31 RANA, U+1A5B SIGN HIGH RATHA OR LOW PA > としてエンコードされます。ᩁᩣᨩᨽᩢ᩠ᨮ [ 3 ] : 3 は <U+1A41 RA, U+1A63 SIGN AA, U+1A29 LOW CA, U + 1A3D LOW PHA, U+1A62 MAI SAT, U+1A60 SAKOT, U+1A2E HIGH RATHA > としてエンコードされます。 ᨶᩥᨻᩛᩣᨶは、<U+1A36 NA, U+1A65 SIGN I, U+1A3B LOW PA, U+1A5B SIGN HIGH RATHA OR LOW PA , U+1A63 SIGN AA, U+1A36 NA> としてエンコードされます。ᨴᩮ᩠ᨻ は、 < U+1A34 LOW TA, U+1A6E SIGN E, U+1A60 SAKOT, U+1A3B LOW PA > としてエンコードされます。後者の単語はᨴᩮ᩠ᨷとも表記されます。ラオス語の子音接続詞ᨲ᩠ᨳ (エンコードは <U+1A32 HIGH TA、U+1A60 SAKOT、U+1A33 HIGH THA>) は、ᨲᩛエンコードでは <U+1A32 HIGH TA、U+1A5B SIGN HIGH RATHA OR LOW PA> のように見えます。U+1A5B の形状は、下付き文字の子音によって異なります。
ᨯᩬᨠ 「花」のような単語の従属母音は、特殊母音 <U+1A6C SIGN OA BELOW> でエンコードされます。シーケンス <U+1A60 SAKOT, U+1A4B LETTER A> は使用しないでください。また、Tai Khuen、Tai Lue、およびᨶ᩶ᩭなどのラオ語には、エンコードされた従属母音、つまり U+1A6D SIGN OY があります。この母音は、<U+1A6C SIGN OA BELOW、U+1A60 SAKOT、U+1A3F LOW YA> としてエンコードされていません (これは、北タイ語で対応する単語に使用されるものです)。また、シーケンス <U+1A60 SAKOT、U+1A40 HIGH YA> でもありません[3] : セクション 5
上付き子音
上付き子音は、基本子音とは独立してエンコードされます。一部の文字は上付き子音としてだけでなく、他の役割も果たすため、このセクションでさらに詳しく説明します。
ニッガヒータはU+1A74 MAI KANGとしてエンコードされます。上付き文字のWAは別々にエンコードされません。MAI KANGとしてエンコードされます。たとえば、Tai Khuen ᨯ᩠ᨿᩴ ( IPA: [deu] ) は、<U+1A2, DA, U+1A60 SAKOT, U+1A3F LOW YA, U+1A74 MAI KANG>としてエンコードされます。文字の順序付けの目的では、通常は母音として扱われます。
上付きクラスター頭文字 NGA は、U+1A58 MAI KANG LAI としてエンコードされます。ラオス語では通常、MAI KANG LAI と U+1A59 SIGN FINAL NGA に同じグリフが使用されることに注意してください。
U+1A62 MAI SAT は、母音、末尾の子音、母音短縮の 3 つの役割を果たします。
RA の上付き文字と母音消去のエンコーディングを選択するのは困難でした。1940 年代、タイ クエンでは子音と母音消去を同じ方法で書きました。エンコーディングの提案者は問い合わせを行い、グリフは同じままであると伝えられたため、両方を U+1A7A RA HAAM としてエンコードしました。その後、タイ クエンが母音消去のグリフを変更したことが判明し、タイ クエン スタイルの母音消去用に新しい文字 U+1A7C KARAN が追加されました。北タイの書き手の中には U+1A7C を母音消去として使用することを好む人もおり、実際、そのグリフの使用は北タイの手書き文字では珍しいことではありません。
特殊子音
特殊形式ᩓとᩕ は、それぞれコードポイント U+1A53 と U+1A55 でエンコードされます。
U+1A36 NA と U+1A63 SIGN AA のグリフが隣り合う場合は、 2 つの別々のグリフᨶᩣではなく、合字ᨶᩣとして書きます。NA に下付き子音や後続しない記号が付いている場合でも、合字として書きます。例: ᨾᨶ᩠ᨲᩣ ( IPA: [man taː]、エンコード <U+1A3E MA, U+1A36 NA, U+1A60 SAKOT, U+1A32 HIGH TA, U+1A63 SIGN AA>) およびᨶᩮᩢᩣ ( IPA: [nau]、エンコード <U+1A36 NA, 1A6E サイン E、U+1A62 マイサット、U+1A63 サイン AA>)。添字 NA と SIGN AA は同様に結合しません。例: ᩉ᩠ᨶᩣ (( IPA: [naː] )、エンコードされた <U+1A49 HIGH HA, U+1A60 SAKOT, 1A36 NA, U+1A63 SIGN AA>)
促音ᩔは別々にコード化されている。なぜなら、ᩅᩥᩈᩮ᩠ᩈ (北タイ語の発音: [wiseːt]、コード化<U+1A45 WA、U+1A65 SIGN I、U+1A48 HIGH SA、U+1A6E SIGN E、U+1A60 SAKOT、U+1A48 HIGH SA>)という単語は、 ᩅᩥᩔᩮとは見た目が大きく異なるためであるが、最後の音節を折りたたんで<HIGH SA、SAKOT、HIGH SA、SIGN E>と表記する場合がある。実際、2019年から2020年にかけて、後者を標準の綴りとして確立するキャンペーンがあった。
対照的に、促音ᨬ᩠ᨬは、そのグリフの一部が仮想接続音ᨱ᩠ᨬ <U+1A31 RANA、U+1A60 SAKOT、U+1A2C NYA>に似ているにもかかわらず、接続音<U+1A2C NYA、U+1A60 SAKOT、U+1A2C NYA>としてエンコードされます。
独立母音
独立母音ᩋと子音ᩋは同じ文字 U+1A4B です。
独立母音ᩋᩣと子音ᩋおよび従属母音ᩣのシーケンスは、同じ外観ᩋᩣを持つため、両方とも <U+1A20 LETTER A、U+1A63 SIGN AA> でエンコードされます。
北タイ語では、ᩍ、ᩎ、ᩏ、ᩐ、ᩑの5つの独立した母音と独自のコードポイントが使用されています。[3] :セクション3
北タイ語では、8番目の独立母音は子音ᩋと従属母音ᩰのシーケンス、つまりᩋᩰと違いがないため、両方とも <U+1A4B LETTER A、U+1A70 SIGN OO> でエンコードされます。他の言語では、独立母音に 別の文字ᩒ U+1A52 LETTER OO を使用します。
テキスト内の文字順序
エンコーディング提案[3]はUnicode文字の順序を定義しました。
ビルマ語、クメール語、インド語の書き方と同様に、Unicode 文字は特別な場合[9]を除いて音の順序に従って並べられます。または、2 つの音が 1 つの音に結合される場合は、古い順序が使用されます。この順序は通常、シャム語のとおりです。音に順序がない場合は、視覚的な順序または特別な代替順序が使用されます。
以下の特別なルールがあります:
- (a) 母音の順序
- (b)マイキアの表記法(その変種)
- (c) マイクアの表記法
- (d)マイカムの書き方
- (e)声調記号の書き方
ユニコード文字の子音と母音の順序は、頭文字、真の母音記号、コーダ子音、頭文字、真の母音記号、コーダ子音です。[3] :セクション14 便宜上、母音を消す記号は母音であるとみなします。
「頭文字」は子音、独立した母音、または特殊記号です。グループ内の子音は、発音される順序、または発音されていた順序に従って並べられます。
例: ᨻᩩᨴ᩠ᨵ (北タイ語の発音: [put thaʔ] )
- 頭文字: ᨻ
- 純粋母音: ᩩ
- 最後の子音: ᨴ
- 頭文字: ᨵ
- 純粋母音: 記号なし
- 末子音: なし
エンコーディングは<U+1A3B LOW PA、U+1A69 SIGN U、U+1A34 LOW TA、U+1A60 SAKOT、U+1A35 LOW THA>です。
例: ᨻᩕ は、北タイ語の発音では[pʰ] という単一の子音ですが、以前は中部タイ語のようにᨻとᩁの 2 つの音がありました 。この単語は <LOW PA, MEDIAL RA> としてエンコードされます。
MEDIAL RA を除けば、子音グリフの順序は音の順序と同じです。ほとんどの場合、MEDIAL RA は最後の子音ですが、/ua/ の WA と /ia/ の LOW YA は MEDIAL RA に続きます。
例:
- ᩆᩣᩈ᩠ᨲᩕ᩺は <U+1A46 HIGH SHA、U+1A63 SIGN AA、U+1A48 HIGH SA、U+1A60 SAKOT、U+1A32 HIGH TA、U+1A55 MEDIAL RA、U+1A7A RA HAAM> でエンコードされます。
- ᨠᩕᩈᩢ᩠ᨲは <U+1A20 HIGH KA、U+1A55 MEDIAL RA、U+1A48 HIGH SA、U+1A62 MAI SAT、U+1A60 SAKOT、U+1A32 HIGH TA> でエンコードされます。
- ᩈᩕ᩠ᩅᨾは <U+1A48 HIGH SA、U+1A55 MEDIAL RA、U+1A60 SAKOT、U+1A45 WA、U+1A3E MA> でエンコードされます。
- ただし、ᨲᩕ᩠ᨶᩬᨾ (タイ北部の発音: [tʰa nɔːm] ) [7] : 269 は エンコードされます <U+1A32 HIGH TA、U+1A55 MEDIAL RA、U+1A60 SAKOT、U+1A36 NA、U+1A6C SIGN OA BELOW、U +1A3E MA>
ᨧᩮᩢ᩶ᩣのような単語の場合、母音と声調の記号の順序は次のようになるという規則がある: [3] : 第5章第1部、5.3および13
- (1)導母音
- (2)下の母音(上から下へ)
- (3)上の母音(下から上へ)
- (4)声調記号(左から右へ)
- (5)末尾の母音(左から右へ)
これらの規則を適用すると、MAI KANG は、niggahita または子音として機能している場合でも、母音として扱われます。Unicode 文字 MAI SAT は、子音、つまり mai kak、つまり末尾の子音として機能したり、ᨸᩮᩢ᩠ᨯ のように母音短縮子として機能したりしている場合でも、母音として扱われます。
上下のマークの相対的な順序は、เจ้า เกี่ว ชุํおよびບິ່のように、タイ語とラオス語に従う必要があります。
例:
- ᨧᩮᩢ᩶ᩣは<U+1A27 HIGH CA, U+1A6E SIGN E, U+1A62 MAI SAT, U+1A76 TONE-2, U+1A63 SIGN AA>としてエンコードされます[3] :セクション5番号29
- ᨾᩢᩣ ( IPA: [maːk] ) は <U+1A3E MA, U+1A62 MAI SAT, U+1A63 SIGN AA> としてエンコードされます。
- ᩃᩪᩢ ( IPA: [luːk] ) は <U+1A43 LA, U+1A6A SIGN UU, U+1A62 MAI SAT> としてエンコードされます。
- ᨶᩮᩢᩣは <U+1A36 NA、U+1A6E SIGN E、U+1A62 MAI SAT、U+1A63 SIGN AA> としてエンコードされます。
- ᩋᩫᨶ᩠ᨲᩕᩣ᩠ᨿ (タイ北部の発音: [on thaʔ laːi] ) は、<U+1A4B LETTER A、U+1A6B SIGN O、U+1A36 NA、U+1A60 SAKOT、U+1A32 HIGH TA、U+1A55 MEDIAL RA、としてエンコードされます。 U+1A63 サイン AA、U+1A60 サコット、U+1A3F ロー YA>
/ia/と/ua/のすべての形態において、下付き低音YAとWAは頭子音として扱われる。[3] :セクション14.3
例:
- ᩈ᩠ᨿᩮは実際にエンコードされます <U+1A48 HIGH SA, U+1A60 SAKOT, U+1A3F LOW YA, U+1A6E SIGN E> [3] : セクション 5 No. 33
- ᨸ᩠ᩃ᩠ᨿ᩵ᩁは実際にエンコードされます <U+1A38 HIGH PA, U+1A60 SAKOT, U+1A43 LA, U+1A60 SAKOT, U+1A3F LOW YA, U+1A75 TONE-1, U+1A41 RA> [3] : セクション 14.9
- ᨲ᩠ᩅᩫは実際には<U+1A32 HIGH TA、U+1A60 SAKOT、U+1A45 WA、U+1A6B SIGN O>とエンコードされる[3] :セクション14.3
- ᩈ᩠ᩅ᩵ᩁは実際にはエンコードされています <U+1A48 HIGH SA、U+1A60 SAKOT、U+1A45 WA、U+1A75 TONE-1、U+1A41 RA>
- ᨠᩖ᩠ᩅ᩠᩶ᨿは実際には <U+1A20 KA、U+1A56 MEDIAL LA、U+1A60 SAKOT、U+1A45 WA、U+1A76 TONE-2、U+1A60 SAKOT、U+1A3F LOW YA> としてエンコードされます。
- (<U+1A60, U+1A76>は正規的には<U+1A76, U+1A60>と同等です)
タイ北部以外では、/am/ の記号の MAI KANG は SIGN AA 要素に書かれています。タイ北部では、子音の上、SIGN AA の上、子音と子音の間など、さまざまな位置にあります。Unicode コンソーシアムは、この組み合わせに特殊文字を拒否しました。ᨷᩴ᩠᩵ᨾᩣ (タイ北部の発音: [bɔːmaː] )という単語は、 ᨲ᩵ᩣᩴ ( IPA: [tam] )と同じ母音を持つようにはなりません。したがって、/am/ の組み合わせは、<U+1A63 SIGN AA、U+1A74 MAI KANG> としてエンコードされます。単語ᨷᩴ᩠᩵ᨾᩣは、<U+1A37 BA、U+1A74 MAI KANG、U+1A75 TONE-1、U+1A60 SAKOT、U+1A3E MA、U+1A63 SIGN AA> としてエンコードされます。単語ᨲ᩵ᩣᩴは、<U+1A32 HIGH TA、U+1A75 TONE-1、U+1A63 SIGN AA、U+1A74 MAI KANG> としてエンコードされます。/am/ と SIGN TALL AA の組み合わせは、<U+1A64 SIGN TALL AA、U+1A74 MAI KANG> としてエンコードされます。
U+1A5A SIGN LOW PAは特別なケースで、タイ語のᨣᨽᩚ(IPA: [kap phaʔ])は<U+1A23 LOW KA、U+1A3D LOW PHA、U+1A5A SIGN LOW PA>とエンコードされます。[3] : セクション4
マイ カン ライとラ タン ライを示す例:
- パーリ語ᩈᩘᨥᩮᩣ (saṅgho) は、<U+1A48 SA、U+1A58 MAI KANG LAI、U+1A25 LOW KHA、U+1A6E SIGN E、U+1A63 SIGN AA> にエンコードされます。
- タイ北部の単語ᨴᩘ᩠ᩃᩣ᩠ᨿ (タイ北部の発音: [taŋ laːi] ) は、<U+1A34 LOW TA、U+1A58 MAI KANG LAI、U+1A60 SAKOT、U+1A43 LA、U+1A63 SIGN AA、U+1A60 SAKOT でエンコードされます。 、U+1A3F 低YA>.
- Tai Lue の単語ᨴᩢᩗᩣ ( Tai Lue の発音: [taŋ laːi] ) は、<U+1A34 LOW TA、U+1A62 MAI SAT、U+1A57 LA TANG LAI、U+1A63 SIGN AA> としてエンコードされます。
外部リンク
- Chew, P.、Saengboon, P.、および Wordingham, R. (2015)。「Tai Tham: 現在のエンコーディング モデルに挑戦するハイブリッド スクリプト」。国際化および Unicode カンファレンス (IUC 39)で発表。
参考文献
- ^ 「Unicode 文字データベース」。Unicode標準。2023 年 7 月 26 日閲覧。
- ^ 「Unicode 標準の列挙バージョン」。Unicode標準。2023 年 7 月 26 日閲覧。
- ^ abcdefghijklmnopqrst Everson, Michael ; Hosken, Martin; Constable, Peter (2007 年 3 月 21 日). 「UCS の BMP で Lanna 文字をエンコードするための改訂提案」(PDF) . Unicode .
- ^ ab 「 Tai Tham特別会議報告書(WG2 N3379)」(PDF)。Unicode 。2008年1月22日。
- ^ abc Hosken, Martin (2008年1月28日). 「Tai Tham Subjoined Variants」(PDF) . Unicode .
- ^ Khotsimeuang、Veomany。「Tai Lue:複雑な正書法のルール:グラフィックブレンド(I)」。SEAsite 。 2018年6月10日閲覧。
- ^ ab ルングルンシ、ウドム (2004 年 1 月)。ランナータイ語辞典: メーファールアン版 意味: ฉบับแม่ฟ้าหลวง(タイ語で)。チェンマイ: チェンマイ大学。ISBN 974-685-175-6。
- ^ COENGと読む、つまりU+17D2 KHMER SIGN COENG
- ^ 「ランナー語の符号化モデルはミャンマー語やクメール語のものと似ており、CEONG [8]のような文字といくつかの結合中間子音文字を使用しています。」[3] :第14節
