
テキストエンコーディングイニシアチブ(TEI)は、デジタルヒューマニティーズの学術分野におけるテキスト中心の実践コミュニティであり、1980年代から継続的に活動しています。このコミュニティは現在、メーリングリスト、会議やカンファレンスシリーズを運営し、TEI技術標準、ジャーナル[ 1 ]、ウィキ、GitHubリポジトリ、およびファイル処理とTEIフレームワークのカスタマイズのためのツールチェーンを維持しています。
TEIガイドラインは、現在XML形式としてシリアル化されているエンコーディング標準をまとめて定義しています。その推奨事項の多くは、以前はSGMLを使用して表明され、その使用が推奨されていましたが、将来的にはXML以外の形式も許可される可能性があります。 [ 2 ] TEI ガイドラインは、この実践コミュニティの基礎を形成し、その決定的な成果物となっています。この形式はフレームワークに近いものであり、テキストの他のよく知られたオープン形式( HTMLやOpenDocumentなど) とは異なり、主に表現的ではなく意味論的であり、ユーザーは TEI を独自のニーズに合わせてカスタマイズできます。すべてのタグと属性の意味と解釈が指定されています。テキストのさまざまな構成要素や概念を表す 580を超える個々の要素があります。単語[ 3 ]文[ 4 ]文字[ 5 ]グリフ[ 6 ]人[ 7 ]などです。多くの場合、damage [ 8 ]のような汎用要素ですが、その後、「agent」、「degree」、「extent」などの一連の属性によって意味的に拡張され、ダメージのコンテキストがさらに提供されます。テキスト現象に対するユーザーの解釈を記録する方法は、多くの場合、 1 つ以上の学術分野に基づいており、TEI ガイドラインの詳細なセクションで多数の例とともに説明されています。
この規格は、詳細な例と解説を含むテキストによる説明と、タグごとの定義の2つの部分に分かれています。最新のフォーマット(DTD、RELAX NG、XML Schema(W3C))のスキーマは、タグごとの定義から自動的に生成されます。ガイドラインの作成と特定のプロジェクトへの適用をサポートするツールも多数用意されています。
Unicodeに存在しないグリフの存在を文書化するために使用できる要素はいくつかあります。例えば、glyph [ 9 ] 、 char [ 10 ] 、 charDecl [ 11 ] などです 。これにより、エンコーダーはテキストに含まれる非 Unicode 文字を文書化できますが、TEI ガイドラインでは、まずこれが本当に必要かどうかを確認することを推奨しています。[ 12 ] TEI ガイドラインには、Unicodeプライベート使用領域の使用方法に関するドキュメントも含まれています。[ 13 ]
このフォーマットのユーザーのほとんどは、すべての要素を使用するのではなく、ガイドラインで定義されているタグと属性のプロジェクト固有のサブセットを使用してカスタマイズを行います。TEIでは、この目的のためにODDと呼ばれる高度なカスタマイズメカニズムを定義しています。ODD仕様では、各TEIタグのドキュメント化と説明に加えて、そのコンテンツモデルやその他の使用上の制約を指定しており、これらはschematronを使用して表現できます。
TEI Liteは、そのようなカスタマイズの一例です。これは、テキスト交換のためのXMLベースのファイル形式を定義しています。完全版TEIガイドラインで利用可能な膨大な要素セットの中から、管理しやすい形で選択されたものです。
XMLベースのフォーマットであるTEIは、重複するマークアップや非階層構造を直接扱うことはできません。ガイドラインでは、このようなデータを表現するためのさまざまなオプションが提案されています。[ 14 ]
TEIガイドラインの本文には豊富な例が掲載されています。TEIウィキにはサンプルページもあり[ 15 ] 、そこにはTEIの基盤となる実際のプロジェクトの例が示されています。
TEIでは、テキストを任意の粒度レベル、または複数の粒度の組み合わせで構文的にマークアップできます。たとえば、この段落(p)は文(s)と節(cl)にマークアップされています。[ 16 ]
<p> <s> <cl> 1664 年9 月の初め頃、<cl>私 を含め近隣の人々は、<cl>ペスト が再びオランダに流行したという話を日常会話で耳にしました。</cl> </cl> </cl> <cl>というのも 、1663年にオランダ、特にアムステルダムとロッテルダムでペストが非常に猛威 を振るっていたからです。</cl> <cl>人々は、<cl> ペストは、<cl>イタリアから、</cl>レバントから、トルコ艦隊が持ち帰った物資の中に 混じって、持ち込ま れたと言っています。</cl> </cl> <cl>カンディアから、キプロスから持ち込まれたと言う人もいます。</cl> </s> <s> <cl>どこから来たかは問題ではありませんでした。</cl> </cl> <cl>しかし、皆が同意したのは、ペストが再びオランダにやってきたということでした。</cl> </cl> </s> </p>TEIには詩をマークアップするためのタグがあります。この例(TEIガイドラインのフランス語訳から引用)はソネットを示しています。[ 17 ]
< div type= " sonnet" > <lg type= "quatrain" > <l>情熱と魔術の世界</l> <l>愛と芸術の世界、</l> <l>ピュイサンとドゥー、オルゲイユドラメゾンの会話、</l> <l>人生の楽しみフリルーエコムユーセダンテール。</l> </lg> < lg type = " quatrain " > <l>科学とボリュームの世界</l> <l>沈黙と恐怖の恐怖; </l> <l> L'Érèbe les eût pris pour ses coursiers funèbres、</l> <l> S'ils pouvaient au servage incliner leur fierté. </l> </lg> <lg type= "tercet" > <l>貴族のような態度を示します</l> <l>孤独を愛する大スフィンクスのすべてを、</l> <l>フィンの存在を忘れないでください。</l> </lg> <lg type= "tercet" > <l>魔法のような遊びを手綱でとります。 </l> <l>区画の中で、セーブルのひれを見つけます。</l> <l>神秘的なものを曖昧にします。</l> </lg> </div>選択タグは、複数の方法でエンコードまたはタグ付けされる可能性のあるテキストのセクションを表すために使用されます。次の例では、標準規格の1つに基づいて、選択が2回使用されています。1つは元の番号と修正された番号を示すため、もう1つは元のスペルと正規化されたスペルを示すためです。[ 18 ]
最後に、上記のすべてを遵守するという厳粛な誓いを立てた上で 条項によれば、当該巨漢には1日あたり以下の手当が支給される。我々の臣民の<choice> <sic> 1724 </sic> <corr> 1728 </corr> </choice>を支えるのに十分な 肉と飲み物、王室への 自由なアクセス、および我々の <choice> <orig>好意</orig> <reg>好意</reg> </choice>のその他の印。 One Document Does it all ("ODD") はXML スキーマ用のリテラルプログラミング言語です。[ 19 ] [ 20 ] [ 21 ] [ 22 ]
ODDドキュメントは、リテラルプログラミングのスタイルで、Text Encoding InitiativeのDocumentation Elementsモジュールを使用して、人間が読めるドキュメントと機械が読めるモデルを組み合わせます。ツールは、ローカライズおよび国際化されたHTML、EPUB、またはPDF形式の人間が読める出力と、DTD、W3C XMLスキーマ、Relax NG Compact Syntax、またはRelax NG XML Syntax形式の機械が読める出力を生成します。
Romaウェブアプリケーション[ 23 ]はODDフォーマットを中心に構築されており、多くのXML検証ツールやサービスで使用されているDTD、W3C XML Schema、Relax NG Compact Syntax、またはRelax NG XML Syntaxフォーマットでスキーマを生成するために使用できます。
ODD は、Text Encoding Initiative が TEI技術標準のために内部的に使用するフォーマットです。[ 24 ] ODD ファイルは一般的にカスタマイズされた XML フォーマットと完全な TEI モデルの違いを記述しますが、OTD は TEI とは全く異なる XML フォーマットを記述するためにも使用できます。その一例として、スキーマを生成し語彙を文書化するために ODD フォーマットを使用するW3C のInternationalization Tag Set があります。 [ 25 ] [ 26 ]
TEIのカスタマイズとは、特定の分野や特定のコミュニティで使用するために、TEI XML仕様を特殊化したものです。
TEIのカスタマイズは、前述のODDメカニズムを通じて行われます。実際、P5バージョン以降、いわゆる「TEI準拠」のTEIガイドラインの利用はすべて、TEI ODDファイルに文書化されたTEIカスタマイズに基づいています。ユーザーが検証対象として既製の事前生成スキーマを選択する場合でも、それらは自由に利用可能なカスタマイズファイルから作成されています。
このフォーマットは世界中の多くのプロジェクトで使用されています。GitHubには200万以上のTEI XMLファイルが含まれています。[ 29 ]事実上すべてのプロジェクトは1つ以上の大学と関連付けられています。TEIを使用してテキストをエンコードする有名なプロジェクトには、次のようなものがあります。
TEI が作られる以前は、人文科学の研究者は、学術的な目的に役立つ方法で電子テキストをエンコードするための共通の基準を持っていませんでした ( Hockey 1993、p. 41 )。1987 年、人文科学、言語学、コンピューティングの分野を代表する学者グループがヴァッサー大学に集まり、「ポキプシー原則」として知られる一連のガイドラインを発表しました。これらのガイドラインは、最初の TEI 標準である「P1」の開発を方向付けました。[ 30 ] [ 31 ]
xml:langの属性との統合(これらは以前はTEI名前空間の属性でした)、ローカルポインタ属性のハッシュを使用するための正規化(HTMLで使用されているものと同様)、ptrタグとxptrタグの統合などが含まれています。これらの変更とその他多くの新機能の追加により、P5はより規則的になり、W3Cが推進し、他のXMLバリアントで使用されている現在のXMLの慣習に近づきました。TEI P5のメンテナンスおよび機能更新バージョンは、2007年以降、少なくとも年に2回リリースされています。xml:id{{cite journal}}: CS1メンテナンス: DOIは2025年7月現在非アクティブです(リンク)