単語区切り | |||||||
|---|---|---|---|---|---|---|---|
| |||||||
句読法において、単語区切りは書かれた単語を区切るグリフの一種である。ラテン文字、キリル文字、アラビア文字、およびヨーロッパや西アジアの他の文字を使用する言語では、単語区切りは空白またはホワイトスペースである。この慣習は、ヨーロッパの句読法の他の側面とともに、単語を単語で区切らずに書くことが多いアジアやアフリカに広がっている。[1] [より良い情報源が必要]
文字エンコードでは、単語の分割はどの文字が単語区切りとして定義されているかによって決まります。
歴史
古代エジプト語では、限定詞は単語の意味を明確にするためだけでなく、単語の境界を定めるためにも使われていた可能性がある。[2]アッシリア楔形文字ではまれだが、後期楔形文字のウガリット文字では一般的に、縦線𒑰が単語の区切りに使われた。古代ペルシア楔形文字では、斜めに傾いたくさび形𐏐が使われた。[3]
アルファベットが古代世界中に広まるにつれ、単語はしばしば区切らずに連続して書かれるようになり、この習慣は南アジアと東南アジアの多くの地域で現在も、あるいは最近まで続いていた。しかし、碑文では縦線が、写本では単一 (·)、二重 (:)、三重 (⫶) の句点(点) が単語の区切りとして使われることが少なくなかった。この習慣はフェニキア語、アラム語、ヘブライ語、ギリシャ語、ラテン語に見られ、今日でもエチオピア語に引き継がれているが、エチオピア語では空白が普及しつつある。
スクリプト継続
フェニキア文字などの初期のアルファベット表記体系には、子音を表す記号しかありませんでした(ただし、子音を表す記号の中には、母音を表すものもあり、いわゆるmatres lectionis)。何らかの形の目に見える単語の区切りがなければ、テキストを個々の単語に解析するのは難問だったでしょう。ギリシャ語アルファベットで母音を表す文字が導入されると、単語間の区切りの必要性は減りました。最初期のギリシャ語の碑文では、それ以前の表記体系で一般的だったように句読点が使用されていましたが、すぐに、すべての単語が区切られずに一緒に続く連続表記、つまり scriptio continuaの習慣が一般的になりました。
種類
なし
単語間の区切りのないアルファベット表記は、scriptio continuaとして知られ、古代エジプト語で使用されていました。数世紀にわたる句読点の使用の後、古典期以降のラテン語に登場しました。
伝統的に、連続文字は南アジアと東南アジアのインド系アルファベットと韓国のハングルに使用されていましたが、現在ではハングルでスペースが使用され、インド系アルファベットでもスペースが使用されるようになっています。
今日、最も広く使用されている文字は中国語と日本語ですが、一貫して単語を区切る句読点なしで書かれていますが、タイ語やラオス語などの他の文字もこの表記規則に従っています。古典中国語では、単語と文字はほぼ同じものであったため、単語の区切りは不要でした。現代の北京語には多音節語が多数あり、各音節は明確な文字で書かれていますが、文字と単語、または少なくとも形態素との概念的なつながりは依然として強く、文字がすでに提供しているもの以外に単語を区切る必要性は感じられません。このつながりはベトナム語にも見られますが、ベトナム語のアルファベットでは、単語の境界を形成するかどうかに関係なく、事実上すべての音節がスペースで区切られています。

空間
スペースは、特にラテン文字では最も一般的な単語区切り文字です。

縦線
アナトリア象形文字などの古代の刻字や楔形文字では、線文字 Bと同様に単語を区切るために短い縦線がよく使われていました。写本では、縦線はラテン語のカンマやピリオドに相当する大きな区切りによく使われていました。これは聖書のヘブライ語(パセク)の場合に当てはまり、今日の多くのインド系文字 (ダンダ) でも続いています。
点間、多重点、低拡張期
,_15th_century_(The_S.S._Teacher's_Edition-The_Holy_Bible_-_Plate_XII,_1).jpg/500px-Ethiopic_genesis_(ch._29,_v._11-16),_15th_century_(The_S.S._Teacher's_Edition-The_Holy_Bible_-_Plate_XII,_1).jpg)
上で述べたように、古代世界全体で写本(紙)に一重句読点と二重句読点が使用されていました。たとえば、エチオピアの碑文では縦線が使用され、写本ではコロンに似た二重点(፡)が使用されていました。後者の慣習は現在も続いていますが、スペースは徐々に浸透しつつあります。古典ラテン語では、紙の写本と石の碑文の両方で句読点が使用されていました。[5] 古代ギリシャの正書法では、単語の区切りとして2つから5つの点と、下点が使用されていました。
異なる文字形式
現代のヘブライ語とアラビア語のアルファベットでは、一部の文字は単語の末尾と先頭で異なる形をしています。この区別は、スペースに加えて使用されます。
垂直配置

イスラム書道のナスタリーク形式では、単語を区切るために縦書きを使用します。各単語の始まりは前の単語の終わりよりも高く書かれるため、テキストの行は鋸歯状の外観になります。ナスタリークはペルシャから広まり、今日ではペルシャ語、ウイグル語、パシュトゥー語、ウルドゥー語に使用されています。
一時停止
ユニコード
コンピュータで使用する場合、これらのマークにはUnicodeのコードポイントがあります。
- U+00B7 · ミドル ドット( ·, ·, · ) は、以下の一般的な代替文字です。
- U+2E31 ⸱ 単語区切り中点
- U+1361 ፡エチオピア語の単語 スペース
- U+10FB ჻ グルジア語段落区切り文字
- U+205D ⁝ トリコロン
- U+2E12 ⸒ 拡張不全
- U+2E19 ⸙ ヤシの枝
線文字Bの場合:
- U+10100 𐄀 エーゲ語単語区切り線
- U+10101 𐄁 エーゲ語単語区切りドット
参照
参考文献
- ^ (サンガー 2000)
- ^ 「限定詞は、容易に識別できる単語の区切りであり、読みやすさに最も重要な助けとなる。」(Ritner 1996:77)
- ^ キング、レナード・ウィリアム(1901年)。アッシリア楔形文字。ニューヨーク:AMSプレス。p.42。
- ^ シカゴ大学出版局 (1911)。『スタイルマニュアル:シカゴ大学の出版物を統括するタイポグラフィ規則集、大学出版局で使用されている書体見本(第3版)』シカゴ:シカゴ大学。p. 101。
この行にはスペースが入っています。
- ^ (ウィンゴ 1972:16)
さらに読む
- ダニエルズ、ピーター T.、ブライト、ウィリアム編 (1996)。『世界の文字体系』オックスフォード大学出版局。
- ナイト、スタン (1996)。「ローマ字アルファベット」。ダニエルズ、ピーター T.、ブライト、ウィリアム (編)。世界の文字体系。オックスフォード大学出版局。
- リトナー、ロバート (1996)。「エジプトの文字」。ダニエルズ、ピーター T.、ブライト、ウィリアム (編) 『世界の文字体系』。オックスフォード大学出版局。
- センガー、ポール(2000年)。『言葉の間の空間:黙読の起源』スタンフォード大学出版局。ISBN 0-8047-4016-X。
- ウィンゴ、E. オサ (1972)。古典時代のラテン語の句読法。ムートン。16 ページ。
