マークアップ言語とデジタル人文学では、文書に非階層的な方法で相互作用する2つ以上の構造がある場合に重複が発生します。重複したマークアップを持つ文書はツリーとして表現できません。これは並行マークアップとも呼ばれます。重複は、たとえば詩で発生します。詩には、脚と行の韻律構造、文と引用の言語構造、巻とページと編集者の注釈の物理的構造がある場合があります。[1] [2]
歴史

文書における非階層構造の問題は1988年から認識されてきた。テキストを単一の階層(コンテンツオブジェクトの順序付けられた階層、つまりOHCO)として扱うという支配的なパラダイムに反してこの問題を解決することは、当初は単なる技術的な問題だと考えられていたが、実際にははるかに困難であることが判明した。[4] 2008年に、ジェニ・テニソンはマークアップの重複を「マークアップ技術者にとって残された主要な問題領域」と特定した。[5] マークアップの重複は2019年現在でも神学テキストのデジタル研究における主要な問題であり続けており、この分野が他のデジタル人文学で一般的な相互運用可能なText Encoding Initiativeベースのフォーマットではなく、Open Scripture Information StandardやTheological Markup Languageなどの特殊なマークアップフォーマットを維持している主な理由となっている。[6]
プロパティとタイプ
連続しないオーバーラップを許可するスキームと、連続するオーバーラップのみを許可するスキームの間には区別があります。多くの場合、「マークアップのオーバーラップ」は厳密には後者を意味します。連続したオーバーラップは、マイルストーン(通常は一緒にインデックス付けされた開始マーカーと終了マーカー)を含む線形ドキュメントとして常に表現でき、(論理的な)コンポーネントを複数の物理的なコンポーネントに断片化する必要はありません。連続しないオーバーラップでは、ドキュメントの断片化が必要になる場合があります。オーバーラップするマークアップ スキームのもう 1 つの区別は、要素が同じ種類の他の要素とオーバーラップできるかどうかです(自己オーバーラップ)。[2]
スキームには特権階層がある場合があります。たとえば、一部のXMLベースのスキームでは、1 つの階層を XML ドキュメント ツリーで直接表現し、他の重複する構造を別の方法で表現します。これらは非特権であると言われています。
Schmidt (2012) は、重複の事例を 3 つの分類に分類しています。1.「コンテンツと構造のバリエーション」、2.「複数の観点またはマークアップ セットのオーバーレイ」、3.「単一のマークアップ観点内での個々の開始タグと終了タグのオーバーレイ」です。さらに、一部の明らかな重複事例は実際にはスキーマ定義の問題であり、階層的に解決できます。彼は、タイプ 1 はマークアップ外部の複数のドキュメントのシステムによって最もよく解決されるが、タイプ 2 と 3 は内部で処理する必要があると主張しています。
アプローチと実装
DeRose (2004、評価基準) は、重複問題の解決策を判断するためのいくつかの基準を特定しています。
- 読みやすさと保守性、
- ツールのサポートとXMLとの互換性、
- 可能な検証スキーム、および
- 処理の容易さ。
タグスープは、厳密に言えば、重複マークアップではなく、非重複言語であるHTML の不正な形式であり、定義が不正確である可能性があります。一部のウェブブラウザは、非階層的なドキュメントオブジェクトモデル(DOM) を使用して重複する開始タグと終了タグを表現しようとしましたが、これはすべてのブラウザで標準化されておらず、DOM の本来の階層的性質と互換性がありませんでした。[7] [8] HTML5 は、プロセッサが HTML 構文内のこのような誤ってネストされたマークアップを処理し、単一の階層に変換する方法を定義しています。[9]ただし、 XHTMLおよびSGMLベースの HTML では、誤ってネストされたマークアップは厳密なエラーであり、標準に準拠したシステムによる処理は不可能です。[10] HTML 標準では、他の要素と重複したり、連続していない可能性のある段落の概念を定義しています。[11]
初期の HTML のベースとなった SGMLには、複数の独立した階層を、いずれにも特権を与えることなく共存させることができる CONCUR という機能があります。DTD 検証は、 CONCUR で個々の階層に対してのみ定義されます。階層間の検証は標準では定義されていません。CONCUR は自己重複をサポートできず、SGML の省略機能の一部との相互作用が不十分です。この機能はツールによって十分にサポートされておらず、実際に使用されることはほとんどなく、標準の編集者の解説によると、文書の重複を表すために CONCUR を使用することは推奨されていません。[12] [13]
階層型言語内
重複のない言語で重複を表現するには、いくつかのアプローチがあります。[14] XMLベースのマークアップスキームであるText Encoding Initiativeは 、重複するマークアップを直接表現することはできません。以下の4つのアプローチすべてが提案されています。 [15] Open Scripture Information Standardは 、聖書をマークアップするために設計された別のXMLベースのスキームです。空のマイルストーン要素を使用して、特権のないコンポーネントをエンコードします。[16]
これらのアプローチを説明するために、ウィリアム シェイクスピアの『リチャード三世』の断片の文章と行をマークアップする例を使用します。特権的な階層がある場合は、行が使用されます。
複数のドキュメント
複数の文書はそれぞれ内部的に一貫性のある異なる階層構造を提供することができる。このアプローチの利点は、各文書がシンプルで既存のツールで処理できることだが、冗長なコンテンツのメンテナンスが必要となり、異なるビュー間の相互参照が困難になる可能性がある。[17]複数の文書がある場合、重複部分はデータ比較とデルタエンコーディング技術で分析でき、XMLコンテキストでは特定のXMLツリー差分アルゴリズムが利用できる。[18] [19]
シュミット(2012、3.5 変異)は、存在するすべての変異を表す構造を作成しようとするのではなく、単一のテキストの複数の変異をエンコードし、変化しない部分の重複を受け入れるためのこのアプローチを推奨しています。さらに、彼はこのアライメントは自動的に実行され、実際には不一致はまれであると示唆しています。[20]
行がマークアップされた例:
<line>私は代理人 として、あなたの母親からあなたを祝福します。 </line> <line>彼女はリッチモンドの幸せを常に祈っています。 </line> <line>以上です。—静かな時間が忍び寄り、</line> <line>薄れゆく闇が東に広がります。</line>
マークアップされた文:
<sentence>私は代理人 として、リッチモンドの幸せを常に祈っているあなたの母親
に代わり、あなたを祝福します。</sentence> <sentence>以上です。</sentence> <sentence> —静かな時間が忍び寄り、
薄れゆく闇が東に広がります。</sentence>
マイルストーン
マイルストーンは、コンポーネントの始まりと終わりを示す空要素で、通常は XML ID メカニズムを使用して、どの「始まり」要素がどの「終わり」要素と関連しているかを示します。マイルストーンは、階層型言語内に非特権構造を埋め込むために使用できます。マイルストーンの基本形式では、連続した重なりのみを表すことができます。汎用 XML は、もちろんマイルストーン要素を解析できますが、その特別な意味を理解しないため、非特権構造を簡単に処理または検証することはできません。[21] [22]
マイルストーンの利点は、他のマークアップと同様に、重複する要素のマークアップが関連する境界に正確に配置されることです。これは保守性と可読性の点で有利です。[23] CLIX (DeRose 2004) はそのようなアプローチの例です。
例:
<line><sentence-start />私は代理人として、あなたの母からあなたを祝福します。 </line> <line>彼女はリッチモンドの幸せを常に祈っています。<sentence-end /></line> <line><sentence-start />以上です。<sentence-end /><sentence-start /> —静かな時間が忍び寄り、</line> <line>そして薄れゆく闇が東に広がります。<sentence-end /></line>
句読点やスペースは、単語、節、文などの境界が必ずしも正式なマークアップの境界と階層的に一致するとは限らないため、マイルストーンスタイルの「暗号オーバーラップ」または「疑似マークアップ」の一種であると認識されています。[24] [25]
より複雑なマイルストーンを使用して、非連続構造を表すこともできます。たとえば、TAGMLの「一時停止」と「再開」のセマンティクス[26]は、各マイルストーンが開始、一時停止、再開、または終了ポイントを表すかどうかを示す属性を追加するなど、マイルストーンを使用して表現できます。各マイルストーンに「次のチャンク」参照を注釈付けすることで、同様に並べ替えや自己オーバーラップを実現できます。
結合
結合は、特権階層内の他のコンポーネントへのポインタであり、リンクリストに従うのと同様に、非特権コンポーネントを再構築するために使用できます。 単一の非特権要素は、特権階層内でいくつかの部分要素に分割されます。部分要素自体は、非特権階層内の単一のユニットを表すものではないため、誤解を招き、処理を困難にする可能性があります。[27] [28]このアプローチは、いくつかの不連続な構造をサポートできますが、要素を並べ替えることはできません。[29]ただし、わずかに異なるアプローチでは、直接性と保守性を犠牲にして、結合をコンテンツから離れて表現することで並べ替えを表現できます。[30]
結合ベースの表現では要素間に循環が生じる可能性があり、これを検出して拒否すると実装が複雑になる。[31]
例:
<line><sentence id= "a" >私は代理人として、あなたの母からあなたを祝福します。 </sentence></line> <line><sentence continue= "a" >彼女はリッチモンドの幸せを常に祈っています。</sentence></line> <line><sentence id= "b" >それは以上です。</sentence><sentence id= "c" > —静かな時間が忍び寄り、</sentence></line> <line><sentence continue= "c" >そして薄れゆく闇が東に広がります。</sentence></line>
スタンドオフマークアップ
スタンドオフ マークアップは、ジョインの使用に似ていますが、特権階層がない場合があります。ドキュメントの各部分にはラベルが付けられ (またはオフセットで参照される可能性があります)、ドキュメント構造は、コンテンツから「離れた」マークアップ (まったく別のファイルにある可能性があります) からコンテンツを指すことによって表現され、コンテンツ自体が含まれていない可能性があります。TEI ガイドラインでは、要素の統一性がスタンドオフ マークアップのジョインに対する主な利点であるとされています。また、テキストとは別に注釈を作成して配布する機能も備えており、読み取り専用ドキュメントにマークアップを適用する異なる作成者によっても可能であり、[32]分割統治戦略によるマークアップへの共同アプローチが可能になります。[33]
例:
<span id= "a" >私は代理人として、あなたの母からあなたを祝福します。 </span> < span id= " b" >彼女はリッチモンドの幸せを絶えず祈っています。 </span> <span id= "c" >それは以上です。</span><span id = "d" >静かな時間が忍び寄り、</span> < span id= "e" >そして薄片状の闇が東に広がります。</span> ...
<line contents= "a" /> <line content= "b" /> <line content= "c d" /> < line content= "e" /> <sentence contents= "a b" /> <sentence content= "c" /> <sentence contents= "d e" />
マークアップとテキストを分離すると、全体的な簡素化と保守性の向上につながると主張されており、[34] 2017年までに、「言語的に注釈が付けられたデータを[表現する]現在の最先端技術は、ピボット形式としてスタンドオフXMLとしてシリアル化されたグラフベースの表現を使用することです」[35]。つまり、スタンドオフは、重複するマークアップの課題に対処するための最も広く受け入れられたアプローチでした。
スタンドオフ形式論は、言語注釈のISO標準の基礎となっており[36]、コーパス管理システムの開発にも応用され[37]、(2020年4月現在)TEIでも積極的に開発が進められている。[38]スタンドオフ注釈方式の成功例の1つは、資源の乏しい言語や絶滅の危機に瀕した言語の保存に焦点を当てたバイテキスト自然言語ドキュメンテーションプロジェクトの一環として開発された。[39]
課題
階層型言語内で重複するマークアップを表現することは、冗長性や複雑さの理由から困難です。2000年代から2010年代にかけて、スタンドオフ形式がここで最も有望なアプローチとして一般的に受け入れられましたが、[35]スタンドオフの欠点は検証が非常に難しいことです。[40] スタンドオフ形式はデータベース管理システムでネイティブにサポートされていないため、(2017年までに)「スタンドオフXMLをピボット形式として使用し、クエリにはリレーショナルデータベースを使用する」ことが提案されました。[35]実際のアプリケーションでは、これには複雑なアーキテクチャや、ピボット形式と内部表現間の労力のかかる変換が必要です。その結果、メンテナンスに問題が生じます。[41]これが、グラフデータベースに基づいてコーパス管理システムを開発し、確立されたグラフベースの形式をピボット形式として使用する動機となっています。
特殊用途言語
上記の戦略を実装するには、既存のマークアップ言語 (TEI など) を拡張するか、専用言語を設計します。まったく新しいマークアップ言語を設計するには、既存の言語のツール サポートを放棄して、より単純なセマンティック モデルとより便利な構文を採用します。
歴史的形式主義
- LMNLは、2002年にジェニ・テニソンとウェンデル・ピエズによって初めて説明された非階層型マークアップ言語であり、文書の範囲にプロパティを注釈付けし、自己重複を許可します。CLIXは元々「Canonical LMNL In XML」の略で、マイルストーンスタイルのXML文書で任意のLMNL文書を表す方法を提供します。[42]また、別のXMLシリアル化であるxLMNLもあります。[43]
- MECS はベルゲン大学のウィトゲンシュタイン アーカイブによって開発されました。しかし、いくつかの問題がありました。要素が重なり合った意味のない文書がいくつか存在し、自己重なりをサポートできず、DTD のような文法を定義する能力がありませんでした。[44]一般順序付き子孫有向非巡回グラフ (GODDAG) の理論は、厳密にはマークアップ言語ではありませんが、非階層マークアップの一般的なデータ モデルです。制限付き GODDAG はMECS のセマンティクスに一致するように特別に設計されました。一般的な GODDAG は非連続である可能性があり、より強力な言語が必要です。[45] TexMECS は MECS の後継であり、形式文法を持ち、すべての GODDAG を表現し、GODDAG 以外のものは表現できないように設計されています。[46]
- XCONCUR(旧称MuLaX)はXMLとSGMLのCONCURを融合したもので、検証言語XCONCUR-CLとSAXのようなAPIも含んでいます。[47] [48] [49]
- Marinelli、Vitali、Zacchiroliは、制限付きGODDAG、ECLIX、LMNL、XMLの並列文書、連続スタンドオフマークアップ、TexMECS間の変換アルゴリズムを提供しています。[50]
これらの形式論はいずれも、もはや維持されていないようです。コミュニティの合意では、スタンドオフ XML またはグラフベースの形式論を採用しているようです。
積極的に維持されているスタンドオフXML言語
- GrAF-XML [51]言語注釈フレームワーク(LAF)[36]のスタンドオフXMLシリアル化。例えば、アメリカ国立コーパス[52]に使用されている。
- PAULA-XML、[53]コーパス管理システムANNISとコンバータスイートSALTの基礎となるデータモデルのスタンドオフXMLシリアル化[54]
- NAF(NLPアノテーションフォーマット/ニュースリーダーアノテーションフォーマット)[55]は、もともとNewsReaderプロジェクト(FP7、2013-2015 [56])で開発されたスタンドオフXMLフォーマットで、現在はFreeLing [57](英語、スペイン語、ポルトガル語、イタリア語、フランス語、ドイツ語、ロシア語、カタロニア語、ガリシア語、クロアチア語、スロベニア語などをサポート)やEusTagger [58](バスク語、英語、スペイン語をサポート)などのNLPツールで使用されています。
- チャールズ・ハーパー・クリティカル・アーカイブは、文書のさまざまなバージョンを表すために「マルチバージョン文書」(MVD)を使用してエンコードされ、基礎となるグラフベースのモデル内で複数の文書とスタンドオフ範囲を戦略的に組み合わせて追加、削除、および改訂を示す手段として使用されています。MVDはアプリケーションファイル形式として提供されており、表示または編集するには特別なツールが必要です。[59]
- スタンドオフXMLスキームは、 Odin、Intent、XigtEditのコラボレーションによって開発されました。これは、自然言語リソースとドキュメンテーションプロジェクトをサポートするためのInterlinear Glossed Text(IGT)の大規模なデータセットに焦点を当てています。 [60]
スタンドオフアプローチには、一般に「コンテンツ」と「注釈」と呼ばれる 2 つの部分があります。これらは、無関係な表現で表現できます。単純なスタンドオフ注釈自体は、(場所、タイプ) ペアのリストのみで構成されます。したがって、いくつかのアプリケーション[要例]では、スタンドオフ注釈は CSV、JSON (- LD )、またはその他の表現 (例: Web Annotation [61] )、または文字列URIに基づくグラフ形式(以下を参照) で表現されます。ただし、このような表現でコンテンツを表現および検証することは、はるかに困難であり、あまり一般的ではありません。
グラフベースの形式主義
スタンドオフマークアップは有向グラフに基づくデータモデルを採用しているため、[62]マークアップ情報をツリーにグラウンディングする場合、その表現が複雑になります。グラフで重複する階層を表現すると、この課題は解消されます。スタンドオフ注釈は、一般化された有向マルチグラフとしてより適切に表現でき、この目的のために開発された形式主義と技術、最も有名なものはリソース記述フレームワーク (RDF)に基づくものです。[63] [64] EARMARK は、一般的な順序付き子孫有向非巡回グラフ (GODDAG) を網羅する 初期のRDF / OWL表現です。 [14] GODDAG の理論は、厳密にはマークアップ言語そのものではありませんが、非階層型マークアップの一般的なデータモデルです。
RDF は線形化に依存しないセマンティック データ モデルであり、スタンドオフ XML を反映するようにモデル化できる XML 形式 ( RDF/XML )、RDF を XML 属性で表現できる線形化 ( RDFa )、JSON 形式 ( JSON-LD )、およびクエリや処理を容易にするように設計されたバイナリ形式 (RDF-HDT、[65] RDF-Thrift [66] ) など、さまざまな線形化を提供します。RDF は、スタンドオフ マークアップの基礎となるグラフベースのデータ モデルと意味的に同等であり、保存、解析、およびクエリに特別なテクノロジを必要としません。ドキュメントまたはコーパスを表す複数の相互リンクされた RDF ファイルは、言語的リンク オープン データの一例です。
任意のグラフを注釈付き文書にリンクするための確立された手法は、テキストや文書の一部を参照するためにURI フラグメント識別子を使用することです。Web注釈の概要を参照してください。Web注釈標準では、オフセット、文字列一致、またはXPathベースのセレクタなど、フォーマット固有の「セレクタ」を追加手段として提供しています。[67]
言語注釈を表現できるネイティブRDF語彙には以下のものがある: [68]
- ウェブ注釈[69]
- NLP交換フォーマット(NIF)[70]
- LAPPS交換フォーマット(LIF)[71]
関連する語彙には以下が含まれる
- POWLA、PAULA-XMLのOWL2/DLシリアル化[72]
- RDF-NAF、NLP注釈フォーマットのRDFシリアル化[73]
2020年初頭、W3CコミュニティグループLD4LTは、これらの語彙を調和させ、ウェブ上の言語注釈のための統合RDF語彙を開発するための取り組みを開始しました。[74]
注記
- ^ テキストエンコーディングイニシアチブ。
- ^ ab DeRose 2004、「問題の種類」。
- ^ ピエズ 2014年。
- ^ レニア、ミロナス、デュランド 1993.
- ^ テニスン 2008年。
- ^ MoChridhe 2019.
- ^ ヒクソン 2002年。
- ^ シヴォネン 2003.
- ^ HTML、§ 8.2.8 パーサーにおけるエラー処理と異常なケースの紹介。
- ^ Sperberg-McQueen & Huitfeldt 2000、2.1. 非SGML表記。
- ^ HTML、§ 3.2.5.4 段落。
- ^ Sperberg-McQueen & Huitfeldt 2000、2.2。同意します。
- ^ DeRose 2004、SGML CONCUR。
- ^ ab ディ・イオリオ、ペローニ&ヴィターリ、2009。
- ^ テキストエンコーディングイニシアチブ、§ 20 非階層構造。
- ^ デュルサウ 2006年。
- ^ テキストエンコーディングイニシアチブ、§ 20.1 同じ情報の複数のエンコーディング。
- ^ シュミット 2009.
- ^ ラフォンテーヌ 2016年。
- ^ Schmidt 2012、4.1 バリエーションの自動化。
- ^ Text Encoding Initiative、§ 20.2 空要素による境界マーキング。
- ^ Sperberg-McQueen & Huitfeldt 2000、2.4。マイルストーン。
- ^ DeRose 2004、TEI スタイルのマイルストーン。
- ^ バーンバウム&トールセン 2015年。
- ^ ヘンチェンス・デッカー & バーンバウム 2017.
- ^ デッカー 2018年。
- ^ テキストエンコーディングイニシアチブ、§ 20.3 仮想要素の断片化と再構成。
- ^ DeRose 2004、「セグメンテーション」。
- ^ Sperberg-McQueen & Huitfeldt 2000、2.5。断片化。
- ^ DeRose 2004、参加。
- ^ Schmidt 2012、3.4 相互リンク。
- ^ テキストエンコーディングイニシアチブ、§ 20.4 スタンドオフマークアップ。
- ^ Schmidt 2012、4.2 テキスト外のマークアップ。
- ^ Eggert & Schmidt 2019、結論。
- ^ abc 井手ら 2017、p.99。
- ^ ab "Iso 24612:2012"より。
- ^ Chiarcos et al. 2008.
- ^ 「スタンドオフ: 注釈マイクロストラクチャ · 問題 #1745 · TEIC/TEI」。GitHub。
- ^ Xia, F., Lewis, WD, Goodman, MW 他「インターライン注釈テキストの大規模多言語データベースの拡充」Lang Resources & Evaluation 50, 321–349 (2016). https://doi.org/10.1007/s10579-015-9325-4
- ^ Sperberg-McQueen & Huitfeldt 2000、2.6。スタンドオフマークアップ。
- ^ DeRose 2004、スタンドオフマークアップ。
- ^ DeRose 2004、CLIX および LMNL。
- ^ ピエズ 2012年。
- ^ Sperberg-McQueen & Huitfeldt 2000、2.7。MECS。
- ^ Sperberg-McQueen & Huitfeldt 2000.
- ^ Huitfeldt & Sperberg-McQueen 2003.
- ^ ヒルベルト、シェーネフェルト、ウィット 2005年。
- ^ ウィットら2007年。
- ^ シェーネフェルト 2008.
- ^ マリネッリ、ヴィターリ、ザッキロリ 2008.
- ^ 「ISO GraAF」。2015年3月7日。
- ^ 「ホーム」. anc.org .
- ^ https://www.sfb632.uni-potsdam.de/en/paula.html [裸のURL ]
- ^ Zipser, Florian (2016-11-18). 「Salt」. corpus-tools.org. doi :10.5281/zenodo.17557 . 2022年9月11日閲覧。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要です - ^ “NAF”. GitHub。 2021年6月30日。
- ^ 「意思決定のための大量の金融および経済データの構造化イベントインデックスの構築」コミュニティ研究開発情報サービス(CORDIS)。
- ^ “ホーム - FreeLingホームページ”. 2012年4月29日時点のオリジナルよりアーカイブ。2020年4月6日閲覧。
- ^ “テキスト分析 | HiTZ Zentroa”.
- ^ エガート&シュミット 2019.
- ^ Xia, F., Lewis, WD, Goodman, MW 他「インターライン注釈テキストの大規模多言語データベースの拡充」Lang Resources & Evaluation 50, 321–349 (2016). https://doi.org/10.1007/s10579-015-9325-4
- ^ 「Web アノテーション データ モデル」。2017 年 2 月 23 日。
- ^ イデ&スダーマン 2007年。
- ^ キャシディ 2010、キャシディ。
- ^ Chiarcos 2012、POWLA。
- ^ 「ホーム」. rdfhdt.org .
- ^ 「Apache Thrift を使用した RDF バイナリ」。
- ^ 「セレクターと状態」。2017年2月23日。
- ^ Cimiano, Philipp; Chiarcos, Christian; McCrae, John P.; Gracia, Jorge (2020).言語リンクデータ。表現、生成、アプリケーション。Cham: Springer。
- ^ Verspoor, Karin; Livingston, Kevin (2012). 「セマンティックウェブ上の言語注釈の学術注釈形式への適応に向けて」。第6回言語注釈ワークショップ議事録、済州島、大韓民国:75–84 。 2020年4月6日閲覧。
- ^ 「NLP 交換フォーマット (NIF) 2.0 - 概要とドキュメント」。
- ^ 「LIF の概要」。
- ^ 「POWLA」。2022年1月。
- ^ 「NLP アノテーション フォーマット | NAF の背景情報」。
- ^ 「言語注釈のための統合LOD語彙に向けて」GitHub 2021年9月7日。
参考文献
- Birnbaum, David J; Thorsen, Elise (2015)。「マークアップとメーター: XML ツールを使用してコンピューターに韻律について考えさせる」。Balisage : The Markup Conference 2015 の議事録。Balisage: The Markup Conference 2015。第 15 巻。モントリオール。doi : 10.4242 /BalisageVol15.Birnbaum01。ISBN 978-1-935958-11-6。
- Cassidy, Steve (2010) . DADA アノテーション サーバーにおける LAF の RDF 実現(PDF) . ISA-5 議事録。香港。CiteSeerX 10.1.1.454.9146 .
- Chiarcos, Christian (2012)。「POWLA: OWL/DL での言語コーパスのモデリング」(PDF)。セマンティック ウェブ: 研究と応用。第 9 回拡張セマンティック ウェブ カンファレンス (ESWC 2012 、クレタ島ヘラクリオン、LNCS 7295) の議事録。コンピュータ サイエンスの講義ノート。第 7295 巻。pp. 225–239。doi : 10.1007 / 978-3-642-30284-8_22。ISBN 978-3-642-30283-1. 2016年5月24日閲覧。
- Chiarcos, Christian; Dipper, Stefanie; Götze, Michael; Leser, Ulf; Lüdeling, Anke; Ritz, Julia; Stede, Manfred (2008). 「異なるツールやタグセットからの注釈を統合するための柔軟なフレームワーク」Traitement Automatique des Langues . 49 (2): 271–293.
- Dekker, Ronald Haentjens; Bleeker, Elli; Buitendijk, Bram; Kulsdom, Astrid; Birnbaum, David J (2018)。「TAGML: 多次元のマークアップ言語」。Balisage : The Markup Conference 2018 の議事録。Balisage: The Markup Conference 2018。第 21 巻。ロックビル、MD。doi : 10.4242 / BalisageVol21.HaentjensDekker01。ISBN 978-1-935958-18-5。
- DeRose, Steven (2004). Markup Overlap: A Review and a Horse. Extreme Markup Languages 2004. モントリオール. CiteSeerX 10.1.1.108.9959 . 2014-10-17 にオリジナルからアーカイブ。2014-10-14に取得。
- Di Iorio, Angelo、Peroni, Silvio、Vitali, Fabio (2009 年 8 月)。「完全な GODDAG のマークアップ サポートに向けて: EARMARK アプローチ」。Balisage : The Markup Conference 2009 の議事録。Balisage: The Markup Conference 2009。第 3 巻。モントリオール。doi : 10.4242 /BalisageVol3.Peroni01。ISBN 978-0-9824344-2-0。
- エガート、ポール、シュミット、デスモンド A (2019)。「チャールズ・ハーパー批評アーカイブ:歴史と技術レポート」。国際デジタル人文学ジャーナル。1 (1) 。 2019年3月25日閲覧。
- Haentjens Dekker, Ronald; Birnbaum, David J (2017)。「単なる重なり以上のもの: グラフとしてのテキスト」。Balisage : The Markup Conference 2017 の議事録。Balisage: The Markup Conference 2017。第 19 巻。モントリオール。doi : 10.4242 / BalisageVol19.Dekker01。ISBN 978-1-935958-15-4。
- Durusau, Patrick (2006). OSIS ユーザーズ マニュアル (OSIS スキーマ 2.1.1) (PDF) . 2014-10-23 にオリジナル(PDF)からアーカイブ。2014-10-14に取得。
- Ian Hickson ( 2002-11-21 ). 「タグスープ: UA が <x> <y> </x> </y> を処理する方法」。2017-11-05 に取得。
- Hilbert, Mirco; Schonefeld, Oliver; Witt, Andreas (2005). CONCUR を機能させる Extreme Markup Languages 2005. モントリオール. CiteSeerX 10.1.1.104.634 . 2014 年 10 月 14 日閲覧。
- Huitfeldt, Claus; Sperberg-McQueen, CM (2003). 「TexMECS: 複雑なドキュメントのための実験的なマークアップメタ言語」。2017-02-27 にオリジナルからアーカイブ。2014-10-14に取得。
- Ide, Nancy; Chiarcos, Christian; Stede, Manfred; Cassidy, Steve (2017)。「注釈スキームの設計: モデルから表現へ」。Ide, Nancy、Pustejovsky, James (編)。言語注釈ハンドブック。ドルドレヒト: Springer。p. 99。doi : 10.1007 /978-94-024-0881-2_3。ISBN 978-94-024-0879-9。
- La Fontaine, Robin (2016)。「XML で重複階層を変更として表現する」。Balisage : The Markup Conference 2016 の議事録。Balisage: The Markup Conference 2016。第 17 巻。モントリオール。doi : 10.4242 / BalisageVol17.LaFontaine01。ISBN 978-1-935958-13-0。
- Marinelli, Paolo; Vitali, Fabio; Zacchiroli, Stefano (2008 年 1 月)。「重複マークアップの形式の統一に向けて」(PDF)。New Review of Hypermedia and Multimedia。14 ( 1) : 57–94。CiteSeerX 10.1.1.383.1636。doi : 10.1080 /13614560802316145。ISSN 1361-4568。S2CID 16909224。2014 年10 月 14日に取得。
- MoChridhe, Race J (2019-04-24). 「神学マークアップ言語の20年:回顧と展望」.神学図書館学. 12 (1). doi : 10.31046/tl.v12i1.523 . ISSN 1937-8904. S2CID 171582852. 2019-07-15に取得.
- Piez, Wendell (2012年8 月)。「Luminescent: XSLT アップコンバージョンによる LMNL の解析」。Balisage : The Markup Conference 2012 の議事録。Balisage: The Markup Conference 2012。第8巻。モントリオール。doi : 10.4242/ BalisageVol8.Piez01。ISBN 978-1-935958-04-8. 2014年10月14日閲覧。
- Piez, Wendell (2014)。範囲空間内の階層: LMNL から OHCO まで。Balisage: The Markup Conference 2014。モントリオール。doi : 10.4242/BalisageVol13.Piez01。
- Renear, Allen; Mylonas, Elli; Durand, David (1993-01-06). 「テキストの本質についての認識の明確化: 階層構造の重複の問題」. CiteSeerX 10.1.1.172.9017 . hdl :2142/9407. 2021-03-23 にオリジナルからアーカイブ。2016-10-02に取得。
- Schonefeld, Oliver (2008年8 月)。「XCONCUR のシンプルな API: イベント中心の API を使用した並行マークアップの処理」Balisage: The Markup Conference 2008。モントリオール。doi :10.4242/BalisageVol1.Schonefeld01。2014年 10 月 14 日閲覧。
- Sperberg-McQueen, CM ; Huitfeldt, Claus (2004)。「GODDAG: 重複階層のデータ構造」。デジタル ドキュメント: システムと原則。コンピュータ サイエンスの講義ノート。第 2023 巻。pp. 139–160。doi : 10.1007/ 978-3-540-39916-2_12。ISBN 978-3-540-21070-2. 2014年10月14日閲覧。
- Schmidt, Desmond (2009)。「マルチバージョン テキストのマージ: 重複問題に対する一般的な解決策」。マルチバージョン テキストのマージ: 重複問題に対する一般的な解決策。Balisage: The Markup Conference 2009。Balisage: The Markup Conference 2009 の議事録。第 3 巻。モントリオール。doi : 10.4242 /BalisageVol3.Schmidt01。ISBN 978-0-9824344-2-0。
- シュミット、デズモンド(2012)。「デジタル人文学におけるマークアップの役割」。歴史社会研究。27 (3):125-146。doi :10.12759/ hsr.37.2012.3.125-146。
- Henri Sivonen (2003-08-16). 「タグスープ: Mac IE 5 と Safari が <x> <y> </x> </y> を処理する方法」。2017-11-05に取得。
- Ide, Nancy; Suderman, Keith (2007). GrAF: 言語注釈のためのグラフベースフォーマット(PDF) . 第1回言語注釈ワークショップ (LAW-2007、プラハ、チェコ共和国) の議事録。pp . 1–8。CiteSeerX 10.1.1.146.4543 。
- Tennison, Jenni ( 2008-12-06 ). 「重複、封じ込め、そして優位性」。2016-10-02 閲覧。
- Witt, Andreas; Schonefeld, Oliver; Rehm, Georg; Khoo, Jonathan; Evang, Kilian (2007). 「単一ファイル、多層注釈のマルチルートツリーへのロスレス変換について」 Extreme Markup Languages 2007. モントリオール。 2014-10-17 にオリジナルからアーカイブ。2014-10-14に取得。
- Text Encoding Initiative Consortium (2014 年 9 月 16 日)。「電子テキストのエンコーディングと交換に関するガイドライン」(第 5 版) 。2014年 10 月 14 日閲覧。
- WHATWG .「HTML Living Standard」. 2019年3月25日閲覧。
