ベトナム語はラテン文字で表記され、発音記号(アクセント音)が付いているため、携帯電話やコンピューターで入力する際にはいくつかの工夫が必要です。ソフトウェアベースのシステムは、デバイスにインストールできるソフトウェア、またはUniKeyなどのサードパーティ製ソフトウェアを使用して、携帯電話やコンピューターでベトナム語を入力する方法です。テレックスは、ベトナム語とその声調をエンコードするために考案された最も古い入力方法です。その他の入力方法には、 VNI(数字キーベースのキーボード)やVIQRなどがあります。VNI入力方法は、VNIコードページと混同しないように注意してください。
歴史的に、ベトナム語はチュノムでも書かれており、近年では主に儀式や伝統的な目的で使用され、歴史家や言語学者の分野に残っています。既存のベトナム語入力方法でチュハンとチュノムを入力する試みはありますが、広く普及していません。[ 1 ] [ 2 ]ベトナム語は声調記号なしで入力されることもありますが、ベトナム語話者は通常、文脈に応じてそれを推測できます。
ベトナム語のアルファベットを表す文字エンコーディングは46種類もあります。[ 3 ] Unicodeは、その優れた互換性とソフトウェアサポートにより、世界の多くの表記体系で最も人気のある形式となっています。発音記号は、結合文字または合成文字としてエンコードできます。これらは、 Latin-1 Supplement、Latin Extended-A、Latin Extended-B、およびLatin Extended Additionalブロック全体に散在しています。ベトナム語のドン記号は、通貨記号ブロックにエンコードされています。
Unicodeにおけるベトナム語のカバー範囲は、1990年代以降、何度か変更されてきました。初期のUnicodeバージョンでは、dấu huyềnとdấu sắcはそれぞれU+0340 ◌ ̀ COMBINING GRAVE TONE MARKとU+0341 ◌ ́ COMBINING ACUTE TONE MARKとしてエンコードされていました。2001年に、これらの2文字はU+0300 ◌ ̀ COMBINING GRAVE ACCENTとU+0301 ◌ ́ COMBINING ACUTE ACCENTの重複エンコードとして廃止されました。[ 4 ]この変更は、2002年にリリースされたUnicode 3.2に組み込まれました。[ 5 ] 2009年にリリースされたUnicode 5.2では、U+0340 ◌ ̀およびU+0341 ◌ ́非推奨ではなかったが、推奨されなかった。[ 6 ] [ 7 ]歴史的に、ベトナム語は現代のアルファベット以外の文字を使用していた。装飾付きの中期ベトナム語の文字B (ꞗ) は、ラテン拡張 Dブロックに含まれている。アペックスは、ポルトガル語のチルダに由来するため、Unicode では個別にエンコードされていないが、ギリシャ語のperispomeniに由来するdấu ngãは常にチルダとして誤ってエンコードされてきた。回避策として、U+1DC3 ◌ ᷃ COMBINING SUSPENSION MARK はWikisourceおよびWiktionaryでアペックスを表す。
Unicode をサポートしていないシステム向けに、数十種類の 8 ビット ベトナム語コード ページが設計されています。[ 3 ]最も一般的に使用されているのは、 VISCII、VSCII (TCVN 5712:1993)、VNI、VPS、およびWindows-1258です。[ 8 ] [ 9 ]プレーン テキストの電子メールで読みやすさを確保する場合など、ASCIIが必要な場合、ベトナム語の文字は、 Vietnamese Quoted-Readable (VIQR) またはVSCII Mnemonic (VSCII-MNEM) に従ってエンコードされることがよくありますが、[ 10 ]ワールド ワイド ウェブで Unicode が採用されてから、どちらの可変幅スキームの使用も劇的に減少しています。たとえば、Windows-1258 を除く上記のすべての 8 ビット エンコーディングのサポートは、 2014 年にMozillaソフトウェアから削除されました。 [ 11 ]
デスクトップ パブリッシングを目的としたベトナム語フォントの多くは、VNIまたは TCVN3 ( VSCII )でエンコードされています。 [ 9 ]このようなフォントは「ABC フォント」として知られています。[ 12 ]一般的なウェブ ブラウザは、ベトナム語の特殊なエンコーディングをサポートしていないため、これらのフォントを使用しているウェブ ページは、インストールされていないシステムでは判読不能な文字化けとして表示されます。

ベトナム語では発音記号を重ねることが多いため、書体デザイナーは重ねた発音記号が隣接する文字や行と衝突しないように注意する必要があります。声調記号が別の発音記号と一緒に使用される場合、声調記号を右にずらすことで一貫性が保たれ、サッケードの速度低下を回避できます。[ 13 ]広告看板や筆記体では、発音記号は他のラテン文字では馴染みのない形をとることがよくあります。たとえば、小文字の I はì、ỉ、ĩ、およびíでそのタイトルを保持します。[ 14 ]これらのニュアンスは、コンピューティング環境ではほとんど考慮されていません。
ベトナム語の表記には、ASCIIに既に存在する52文字に加えて、134文字(大文字と小文字の両方を含む)の追加文字が必要です。[ 15 ]これは、従来の拡張ASCIIエンコーディングで使用可能な128文字を超えています。可変幅エンコーディング( UTF-8のように)を使用することでこの問題を解決できますが、他のエンコーディングでは、可変幅エンコーディングを使用せずにベトナム語をサポートするために、いくつかの方法が用いられています。
以下の表は、ASCII文字以外のすべてのベトナム語文字に対応するUnicodeコードポイントを示しています。
多くのフォントは、ベトナム語のアルファベットの大部分を省略したラテン文字体系のサブセットをサポートしています。ベトナム語のテキストにはベトナム語固有の文字が密集しているため、フォント置換機能を実装したウェブブラウザは、ウェブページで不適切なフォントが指定された場合、必ずと言っていいほど警告メッセージのような表示になります。

Unicodeには、 CJK統一表意文字の一部として10,000を超えるノム文字が含まれています。これらの文字のうち、10,082文字はCJK統一表意文字拡張Bブロックにあり、残りはCJK統一表意文字、CJK統一表意文字拡張A、およびCJK統一表意文字拡張Cブロックに分散されています。さらに、タイ語に固有の400文字以上を含む1,028文字がCJK統一表意文字拡張Eブロックにエンコードされています。これらの文字は、ベトナムの標準規格TCVN 5773:1993およびTCVN 6909:2001 [TCVN 6056:1995は誤りか?]、ならびに漢ノム研究所およびその他のグループによる研究から取得されています。 [ 18 ] TCVN 5773:1993 のすべての文字と TCVN 6909:2001 の文字の約 95% [TCVN 6056:1995 のエラー?] は Unicode 5.1 に対応するコードポイントを持っていますが、TCVN 5773:1993 自体はその文字のほとんどをUnicode のプライベート使用領域にマッピングしています。[ 19 ] Unicode 13.0 では、 chữ Nômで借用文字を示すためによく使われていた2 つの発音記号が表意文字と句読点ブロックに追加されました。[ 20 ] [ 21 ]
最も包括的な2つのノムフォントは、ベトナムノム保存財団のNôm Na Tống Light [ 22 ]とコミュニティ開発のHAN NOM A / HAN NOM B [ 23 ]であり、どちらも多数の非標準文字を私用領域に配置しています。
UnicodeコンソーシアムのUnihanデータベースには、一部の文字のベトナム語の読みが含まれていますが、漢語とノム語の読みを区別していません。
他のCJKV表記体系と同様に、チュノムは伝統的に上から下、右から左へと縦書きされます。
Chữ Hánとchữ Nômにはルビ文字を使用して注釈を付けることもできます。これは、ベトナム語のchữ Quốc Ngữと同じです。 [ 24 ]

ベトナム語のアルファベットにはờやịのように文字と発音記号の組み合わせが非常に多いため、純粋な物理キーボードは実用的ではありません。そのため、ベトナム語の入力には、定型的なソフトウェアベースのキーボードレイアウト、仮想キーボード、または入力方法(IMEとも呼ばれる)が用いられます。
ベトナム語のキーボード配列は、発音記号付きの文字を入力するためにデッドキーを使用します。ほとんどのデスクトップオペレーティングシステムには、ベトナムの国家規格であるTCVN 6064:1995に類似したベトナム語キーボード配列が含まれています。以前は、タイプライターはAZERTYベースのベトナム語配列(AĐERTY)を使用していました。[ 25 ]

ベトナム語の入力方法として最も一般的なのは、 Telex、VNI、VIQRの3つです。Telexは単語の末尾に現れる可能性の低い文字を使って発音記号を表し、VNIは数字キーやファンクションキーを、VIQRは様々な句読点をそれぞれ別の用途に転用します。TelexとVIQRの表記法は、それぞれテレックス機とタイプライターが主流だった時代に由来します。
これらの入力方法をサポートするのは、入力方法エディタ(IME)です。ベトナム語では、IMEは文字通り「ペッカー」、「タイピングセット」、またはより一般的には「パーカッション」と呼ばれています。IMEは、オペレーティングシステムによって提供される場合もあれば、サードパーティ製アプリケーションとしてインストールされる場合、ブラウザ拡張機能としてインストールされる場合、または個々のWebサイトによってスクリプトの形で提供される場合もあります。一般的なサードパーティ製アプリケーションには、GoTiengViet、UniKey、VietKey、VPSKeys、WinVNKey、およびxvnkbなどがあります。Unix系オペレーティングシステムでは、 IBus(ibus-bamboo、ibus-bambusa、ibus-unikey、ibus-bogo)、SCIM、およびfcitxフレームワーク用に設計されたベトナム語入力エンジンが多数あります。AVIM 、Mudim、およびVietTypingなどのIMEスクリプトは、ほとんどのベトナム語掲示板、ベトナム語版Wikipedia、およびその他のテキスト中心のWebサイトで見つけることができます。ベトナムのウェブブラウザ「Cốc Cốc」には入力方法が組み込まれています。
入力方式では、キーボードレイアウトよりも柔軟な順序で単語を構成できます。たとえば、TCVN 6064:1995 キーボードレイアウトを使用して「 viết 」という単語を入力するには、 、 の順に入力する必要があります。これに対し、ほとんどの IME では、テレックス、VNI、 VIQR のように、単語の末尾に発音記号を挿入できます。一部の IME では、発音記号を基本文字の前に入力することもできます。IME の実装によっては、単語を再入力せずに既存の単語の発音記号を編集することも可能です。VI38TVIEETSVIET61VIET^'
仮想キーボードの中には、標準のデッドキーに加えて専用のショートカットキーを備えているものがあります。例えば、iOSに内蔵されているVIQRキーボードでは、物理キーボードには対応するキーがない専用キーをタップすることで、「U」にホーンを追加できます。123#+=+◌̛

中国語の入力方法によく見られる機能を取り入れ、一部のベトナム語IMEでは、発音記号を完全に省略し、基本文字を入力した後、候補リストからアクセント付きの単語を選択できるようになっています。このオートコンプリートリストを提供するために、IMEはWebサービスと通信する必要がある場合があります。また、一部のIMEでは、候補リストを使用して、ベトナム語のアルファベットからチュノム文字へのテキスト変換を可能にしています。これは、アルファベットの単語とチュノム文字の間には1対1の対応関係がないためです。
典型的なベトナム語の文章には、複合語が多く含まれています。現代の用法では複合語にハイフンは使われないため、統計的な言語モデルを参照しない限り、スペルチェッカーは個々の音節しかチェックできません。
ベトナム語は綴りの規則が厳格で例外が少ないため、テキスト読み上げエンジンは外来語に遭遇した場合を除き、辞書検索を避けることができます。TTSエンジンは声調を考慮する必要があります。声調はベトナム語の単語の意味に不可欠であり、例えば má (母) と mà (しかし) は異なる単語です。
国際化されたユーザーインターフェースは、ユーザーについて多くのことがわかっている場合でも、伝統的な社会的状況で期待されるベトナム語の代名詞をすべて使用することは一般的にできません。代わりに、ユーザーインターフェースは通常、 tôiやbạnなどの一般的な代名詞を使用しますが、これらの代名詞の中には、ユーザーの年齢や他のユーザーとの関係について誤った推測をするものがあります。たとえば、ソーシャルメディアプラットフォームが若いユーザーについてユーザーに通知する場合、 em ấyではなくanh ấyという三人称でそのユーザーを指すことがあり、ユーザーは通知を他の誰かへの言及だと誤解する可能性があります。[ 26 ]
{{cite report}}: CS1 maint: 数値名: 著者リスト (リンク)2バイトではありませんが、そのエンコーディングの性質上、大文字(母音)は通常の小文字に似た別の大文字フォントにマッピングされます。