バックウォルターアラビア語音訳は、 1988 年にケン ビーズリーが運営していた ALPNET アラビア語プロジェクトの一環として開発されました。
始める
このプロジェクトの最初のアラビア語アナリストは、パートタイムで雇われたBYUの学部生、デレク・フォックスリーでした。フォックスリーは当時BYUでアラビア語の4年生でした。[1] ティム・バックウォルターは数か月後にALPNETのフルタイム従業員として雇われました。バックウォルターは当時アラビア語の博士課程の候補者でもありました。プロジェクトでの彼の仕事の1つは、パートタイム従業員のフォックスリーと協力し、アラビア語のタスクを割り当てることでした。
ビーズリーはバックウォルターとフォックスリーに言語学の細かい点について指導し、ある日ホワイトボードで、ビーズリーはフォックスリーとバックウォルターに、その時点で音訳スキーマを作成するよう促しました。フォックスリーはプロジェクトのその時点でほとんどのデータを入力していたので、この問題に対処する準備ができていました。それでも、バックウォルターと密接に協力して、音訳表に使用するほぼすべての文字を作成しました。バックウォルターはフォックスリーのアラビア語の作業を監督し、音訳表の最終的な調整と改良を行いました。当時は名前がありませんでした。しかし、プロジェクトから数年後、バックウォルターは音訳スキーマを使用して何千ものテキスト項目を入力し、何度もそれを発表し、推進しました。そのため、彼にちなんで名付けられました。
当時は、そのような一対一の文字の翻字は使用されていませんでした。少なくとも、チームが知る限りでは使用されていませんでした。
ビーズリーはその後ゼロックス社に移り、同社は 1990 年代に ALPNET データの権利を購入しました。このことは、ビーズリーが長年にわたって発表してきた他のいくつかの記事にも記載されています。
システムに関する解説
Buckwalter 音訳はASCIIのみの音訳方式で、アラビア文字で表現されない形態情報を追加する一般的なローマ字化方式とは異なり、アラビア語の正書法を厳密に 1 対 1 で表します。したがって、たとえば、 wāwは、母音/uː/として実現されるか子音/w/として実現されるかに関係なく、 wと音訳されます。 wāwがハムザ( ؤ )によって変更される場合にのみ、音訳は&に変更されます。これにより、ユーザーはテキストを表示されているとおりに入力または変換できます。
しかし、この音訳方式には批判もある。一部のユーザーは、変更されていない文字は読みやすい(* =dhaal とE =ayin、v =thaa を除く)が、発音区別符号とハラカット付きの文字の音訳には慣れるのに時間がかかると述べている。たとえば、名詞付きの -un、-an、-in はN、F、Kと表示され、sukūn(「母音なし」)はoと表示される。Taʾ marbūṭah ةはpである。おそらく、通常、Buckwalter 音訳は文字の背後にある根拠なしに使用および/または提示されるため、困難が生じる。これらの特定の文字はランダムのように見えるが、実際には元の文字に記憶術的にリンクされている。
さらに、オリジナルの Buckwalter 方式が開発されて以来、標準化されていないものの、いくつかの他のバリエーションが登場しています。Buckwalter の音訳は XML と互換性がないため、「XML 対応」バージョンでは、次の文字が変更されることがよくあります: < > & (それぞれ أ إ および ؤ です。Buckwalter は、それぞれ IOW として音訳することを提案しています)。完全に「安全な」音訳方式では、英数字以外の文字 ($';* など) がすべて英数字に置き換えられます。[2]
アラビア語のテキストを音訳する場合、他にもいくつかの問題が発生する可能性があります。まず、アラビア語の文字の中には、۞やなどのアルファベット以外の文字、؛ ؟ などの句読点、東アラビア数字など、音訳表に指定されていないものがあります。同様に、アラビア語の文章では、ペルシャ語からアラビア語以外の文字を借用することがありますが、その一部は完全な Buckwalter 表で定義されています。[3]音訳表で定義されていない記号は、削除されるか、音訳されたテキストに埋め込まれた非ラテン文字として保持されるか、または異なる (競合しない) ラテン文字に音訳されます。(たとえば、ヒンディー語の数字からアラビア数字に変換するのは簡単です。) 発生するもう 1 つの問題は、埋め込まれた ASCII テキストを含むアラビア語の音訳をどのように処理するかです。たとえば、"IBM" を参照するアラビア語の文章や、英語の引用を含むアラビア語の文章などです。ラテン語のテキストが明示的にマークされていない場合、音訳されたアラビア語とラテン語を区別するのは困難です。ラテン語が埋め込まれた翻字テキストを後でアラビア語に翻字すると、ラテン語テキストは意味不明なアラビア語に翻字されます。最後に、翻字中にアラビア語テキストをどの程度正規化するかという重要な決定があります。これには、kashidaの削除、短母音やその他の発音区別符号の削除、および/またはスペルの正規化が含まれます。[2]
一方、文章を書くときに使用すると予想される典型的なマーク - !@#%?.,;:()[]+= は、アラビア語のテキストでも使用されているため、使用されていません。したがって、英語の IBM が英語に現れた場合、アラビア語のテキストでは、元のコンセプトでは二重引用符で囲んでマークするはずでした: ""IBM""。このメカニズムにより、自動言語処理が行われ、非アラビア語のテキストは二重引用符が見つかったときに処理されずにそのままになります。もともと、< > & も使用されておらず、特にフランス語の借用引用符である < > は、アラビア語のテキストで時々使用されるため使用されていませんでした。これらは、必要に応じて後で追加されました。XML 対応バージョンは、考案された (および以下で説明する) 記憶術に従っており、つまり、発音された各音に (不正確ではありますが) 対応しています。
テーブル開発における重要な概念
翻字スキーマで使用される主要な概念は 3 つあります。
1 つ目は、アラビア語の各文字 (音) は、英語の 1 つの文字にしか対応できないことです。アラビア語の文字の中には、書き表すと 2 つの英語の文字に対応する音を出すものがあります。そのため、それらの文字には 1 つの文字または共通記号を使用する必要があります。
2 つ目のコンセプトは、可能な限り馴染みのあるものを使用するというものでした。たとえば、アラビア語の文字が常に英語の文字「s」と関連付けられている場合、その状態を維持できれば覚えやすくなります。
3 つ目の重要な概念は、表が完全に簡単に記憶できるものでなければならないということです。したがって、すべての項目は、a) アラビア文字の音、b) 元のアラビア文字の物理的側面、c)呼ばれる名前の順に相関しています。
力学
小文字が優先的に使用されました。ただし、似たような音を持つアラビア文字が複数ある場合は、より開いた音には小文字が使用され、より閉じた/制限された音には大文字が使用されました。たとえば、アラビア語には英語の[d]音に似た文字が 2 つあります。単純音には小文字の「d」が使用され、強調音[dˤ]には大文字の「D」が割り当てられました。
言い換えれば、大文字は小文字と似ているが、何らかの点で質的な違いがあることを示します。
バックウォルター音訳表
- ハムザ
- 孤独なハムザ: '
- ハムザ・オン・アリフ: >
- ハムザ以下アリフ: <
- ハムザ・オン・ワ: &
- ハムザ・オン・ヤ: }
- アリフ
- マッダ・オン・アリフ: |
- アリフ・アル・ワスラ: {
- ダガー・アリフ:`
- アリフ・マクスーラ: Y
- ハラカット
- ファサ: a
- ダムマ:u
- カスラ:私
- ファタタイン: F
- ダマタイン: N
- カスラタインK
- シャッダ: ~
- スクン:o
- タ・マルブータ: p
- タトゥー: _
記憶術
オリジナルの ALPNET チームはすぐにこのスキーマを採用しました。ビーズリーはアラビア語の知識がなかったにもかかわらず、すぐに理解して使用できました。バックウォルター音訳の強みは、アラビア語の文字が 1 つ 1 つ明確に表現されていることです。しかし、非伝統的なものについては伝統的な音訳や記憶術に依存しているため、習得が非常に簡単です。
サンプル
世界人権宣言の第一条:
アラビア語テキスト
يُولَدُ جَمِيعُ ٱلنَّاسِ أَحْرَارًا مُتَسَاوِينَ فِي ٱلْكَرَامَةِ َٱلْحُقُوقِ。 وَقَدْ وُهِبُوا عَقْلًا وَضَمِيرًا وَعَلَيْهِمْ أَنْ يُعَامِلَ بَعْضُهُمْ بَعْضًا بِرُوحِ ٱلْإِخَاءِ。 [5]
バックウォルター音訳
yuwladu jamiyEu {ln~aAsi >aHoraArFA mutasaAwiyna fiy {lokaraAmapi wa{loHuquwqi. Waqado wuhibuwA EaqolFA waDamiyrFA waEalayohimo >ano yuEaAmila baEoDuhumo baEoDFA biruwHi {lo<ixaA'i.
31635 規格
ユラドゥ・アミー・ナシ・アーラン・ムタサーウィナ・フィール・カラマティ・ワ・ル・ハウクク。 Wa-qad wuhibō ʿaqlan wa-ḍamīran wa-ʿalayhim ʾan yuʿāmila baʿḍuhum baʿḍan bi-rōḥi l-ʾiḫāʾi。
英語テキスト
すべての人間は生まれながらにして自由であり、尊厳と権利において平等である。人間は理性と良心を備えており、互いに同胞の精神をもって行動すべきである。[6]
注記
- ^ (ビーズリー博士が1989年にユタ大学で行った最初のプレゼンテーションの最初のページを参照。脚注には、その時点までの寄稿者が順番にリストされている。)[1]
- ^ ab さまざまな Buckwalter 方式の完全な説明と、さまざまな方式間のトレードオフに関する詳細な議論については、Habash, Nizar 著「Introduction to Arabic Natural Language Processing」(Morgan & Claypool、2010 年) を参照してください。
- ^ Buckwalter, Tim. Buckwalterアラビア語音訳表。
- ^ エジプト、スーダン、その他の地域では、最後の形がی (点なし) になることもあります。
- ^ 「世界人権宣言 - アラビア語(アラビア語)」ohchr.org . OHCHR. 2016年. 2016年10月22日閲覧。
- ^ 「世界人権宣言 - 英語」ohchr.org . OHCHR. 2016年. 2016年10月22日閲覧。
外部リンク
- 翻字に関する情報
- XRCE サイトでの音訳
- Tim Buckwalter のサイトの音訳
- 拡張バックウォルター音訳(コーラン用)
