バックウォルター式アラビア語翻字は、1988年にケン・ビーズリーが主導したALPNETアラビア語プロジェクトの一環として開発された。
このプロジェクトの最初のアラビア語アナリストは、BYUの学部生でパートタイムで雇われたデレク・フォックスリーでした。フォックスリーは当時BYUでアラビア語の4年次コースを受講していました。[ 1 ] 数か月後、ティム・バックウォルターがALPNETの正社員として採用されました。バックウォルターも当時アラビア語の博士課程の学生でした。プロジェクトにおける彼の仕事の1つは、パートタイム従業員のフォックスリーと協力し、アラビア語のタスクを割り当てることでした。
ビーズリーはバックウォルターとフォックスリーに言語学の細かい部分について指導し、ある日ホワイトボードの前で、フォックスリーとバックウォルターにその場で音訳体系を作成するよう促した。フォックスリーはその時点でプロジェクトのデータの大半を入力していたため、この課題に取り組む準備ができていた。それでも、バックウォルターと緊密に協力しながら、彼は音訳表に使用される文字のほぼすべてを考案した。バックウォルターはフォックスリーのアラビア語の作業を監督し、音訳表の最終的な調整と改良を行った。当時、音訳表には名前がなかったが、バックウォルターはプロジェクト終了後数年の間に、音訳体系を用いて何千ものテキスト項目を入力し、何度も発表してその有効性を擁護した。そのため、音訳表は彼の名にちなんで名付けられた。
当時、そのような一対一の文字変換は使用されておらず、少なくともチームが知る限りでは使用されていなかった。
ビーズリーは後にゼロックスに移籍し、ゼロックスは1990年代にALPNETデータの権利を買収した。このことは、ビーズリーが長年にわたって発表してきた他のいくつかの論文にも記載されている。
バックウォルター翻字はASCIIのみの翻字方式であり、アラビア語の正書法を厳密に1対1で表現します。これは、アラビア語の文字体系には表現されていない形態情報を追加する一般的なローマ字表記方式とは異なります。したがって、たとえば、wāwは母音/uː/として実現されるか子音/w/として実現されるかに関わらず、 wとして翻字されます。wāwがハムザ(ؤ )によって修飾された場合にのみ、翻字は&に変わります。これにより、ユーザーはテキストをそのまま入力または変換できます。
しかし、この音訳方式には批判もあります。一部のユーザーは、変更されていない文字は(* = dhaal とE =ayin、v =thaa を除いて)読みやすいが、発音記号やハラカトが付いた文字の音訳には慣れるのに時間がかかると述べています。たとえば、ヌン付きの-un、-an、-in はN、F、Kと表示され、スクーン(「母音なし」)はoと表示されます。Taʾ marbūṭah ةはpです。おそらく、バックウォルターの音訳が文字の背後にある理由なしに使用または提示されることが多いため、このような困難が生じているのでしょう。これらの特定の文字はランダムに見えますが、実際には元の文字と記憶的に結びついています。
さらに、オリジナルのバックウォルター方式が開発されて以来、いくつかの他のバリアントが登場していますが、それらはすべて標準化されているわけではありません。バックウォルターの音訳は XML と互換性がないため、「XML セーフ」バージョンでは、多くの場合、次の文字が変更されます。< > & (それぞれ أ إ および ؤ。バックウォルターは、それぞれ IOW と音訳することを推奨しています)。完全に「セーフ」な音訳方式では、すべての非英数字文字 ($';* など) が英数字文字に置き換えられます。[ 2 ]
アラビア語のテキストを音訳する際には、他にもいくつかの問題が発生する可能性があります。まず、音訳表に指定されていないアラビア文字がいくつかあります。これには、 ۞やなどの非アルファベット文字、؛ ؟ などの句読点、東アラビア数字などが含まれます。同様に、アラビア語の文では、ペルシア語からアラビア文字以外の文字を借用することがあり、その一部はバックウォルター表で定義されています。[ 3 ]音訳表で定義されていない記号は、削除するか、音訳されたテキストに埋め込まれた非ラテン文字として保持するか、または異なる(矛盾しない)ラテン文字に音訳することができます。(たとえば、ヒンディー語の数字をアラビア数字に変換するのは簡単です。)もう 1 つの問題は、埋め込まれた ASCII テキストを含むアラビア語のテキストの音訳をどのように処理するかです。たとえば、「IBM」を参照するアラビア語の文や、英語の引用を含むアラビア語の文などです。ラテン語のテキストが明示的にマークされていない場合、音訳されたアラビア語とラテン語を区別するのは困難です。埋め込まれたラテン語を含む翻字テキストを後でアラビア語に翻字し直すと、ラテン語テキストは意味不明なアラビア語に翻字されます。最後に、翻字中にアラビア語テキストをどの程度正規化するかという重要な決定事項があります。これには、カシダの削除、短母音やその他の発音記号の削除、スペルの正規化などが含まれる場合があります。[ 2 ]
一方、 アラビア語のテキストでも使用されるため、通常使用されると思われる記号(!@#%?.,;:()[]+=)はすべて使用されませんでした。そのため、英語のIBMが英語で表示された場合、アラビア語のテキストでは、二重引用符で囲むことでマークされるべき本来の概念である「""IBM"」で表示されました。この仕組みにより、自動言語処理が行われ、二重引用符が見つかった非アラビア語のテキストはそのまま処理されずに残ります。当初は、< > & も使用されませんでした。特に、アラビア語のテキストで時折使用されるフランス語からの引用符である< >は使用されませんでした。これらは後から必要に迫られて追加されました。これらのXMLセーフバージョンは、考案された(そして後述する)記憶術と整合しており、つまり、各音に(不正確ではあるものの)対応しています。
音訳スキームでは、主に3つの概念が用いられました。
第一に、アラビア語の各文字(音)は、英語の文字1つにしか対応できないという点です。アラビア語の中には、書くと英語の文字2つに相当する音を出す文字があります。そのため、それらの文字には単一の文字、あるいは共通の記号を用いる必要がありました。
The second concept was to use the familiar if possible. If an Arabic letter had always been associated with the letter “s” in English, for example, then it would be easier to remember if it could be kept that way.
The third key concept was that the table had to be fully, easily mnemonic. Therefore, every single item correlates in the following order of preference a) to the sound of the Arabic letter, or b) to a physical aspect of the original Arabic letter or, c) to the name it is called.
Lower case letters were used in preference. However, when there are multiple Arabic letters that have similar sounds then for more open sounds the lower case letter was used and for more close/restricted sounds an upper case letter was used. For example, in Arabic there are 2 letters similar to the [d] in English sound. The plain sound was given a small “d” and the emphatic sound [dˤ] was assigned an upper case “D”.
In other words, an upper case letter indicates that the letter is similar to a lower case letter – but has a qualitative difference in some way.
The original ALPNET team quickly adopted this schema. Even though Beesley had no background in Arabic he was quickly able to understand and use it. The strength of the Buckwalter transliteration is that every single Arabic letter is represented distinctly. Yet, its reliance on traditional transliterations or mnemonic devices for anything non-traditional makes it very easy to learn.
The first article of The Universal Declaration of Human Rights:
يُولَدُ جَمِيعُ ٱلنَّاسِ أَحْرَارًا مُتَسَاوِينَ فِي ٱلْكَرَامَةِ وَٱلْحُقُوقِ. وَقَدْ وُهِبُوا عَقْلًا وَضَمِيرًا وَعَلَيْهِمْ أَنْ يُعَامِلَ بَعْضُهُمْ بَعْضًا بِرُوحِ ٱلْإِخَاءِ.[5]
yuwladu jamiyEu {ln~aAsi >aHoraArFA mutasaAwiyna fiy {lokaraAmapi wa{loHuquwqi. waqado wuhibuwA EaqolFA waDamiyrFA waEalayohimo >ano yuEaAmila baEoDuhumo baEoDFA biruwHi {lo<ixaA'i.
Yūladu ǧamīʿu n-nāsi ʾaḥrāran mutasāwīna fī l-karāmati wa-l-ḥuqūq. Wa-qad wuhibū ʿaqlan wa-ḍamīran wa-ʿalayhim ʾan yuʿāmila baʿḍuhum baʿḍan bi-rūḥi l-ʾiḫāʾi.
All human beings are born free and equal in dignity and rights. They are endowed with reason and conscience and should act towards one another in a spirit of brotherhood.[6]