言語学や教育学において、行間注釈とは、原文の行と別の言語への翻訳の間など、行間に挿入される注釈(定義や発音などの短い説明の連続)のことです。注釈が付けられると、原文の各行に、行間注釈テキストまたは行間注釈テキスト(IGT)と呼ばれる、対応する1行以上の転写が付けられます。略して行間注釈とも呼ばれます。このような注釈は、読者が原文と翻訳の関係、および原文の構造を理解するのに役立ちます。最も単純な形式では、行間注釈は原文の逐語訳です。

行間注釈は、長年にわたり様々な目的で使用されてきました。一般的な用途の一つは、言語教育用の二言語教科書に注釈を付けることです。このような行間注釈は、原文の構造的特徴を形式的に再現しようとすることなく、原文の意味を明確にするのに役立ちます。
このような注釈は、行間レイアウトではなく、対象言語とメタ言語の単語の列挙によって表現されることもあります。そのような例の1つが、ヴィルヘルム・フォン・フンボルトによる古典ナワトル語の注釈です。[ 1 ]
1
ニ-
1
いち
2
c-
3
マシェ
3
チフイ
2
es
4
-リア
4
毛皮
5
で
5
ダー
6
いいえ-
6
メイン
7
ピルツィン
7
ソン
8
ce
8
アイン
9
コール
9
ハウス
1 2 3 4 5 6 7 8 9
ni- c- chihui -lia in no- piltzin ce calli
1 3 2 4 5 6 7 8 9
ich mache es für der mein Sohn ein Haus
この「インライン」スタイルでは、例文を本文中に挿入でき、対象言語の語順を対象言語の構文に近似した順序で記述できます。(この注釈では、mache esは対応する原文の語順から並べ替えられ、ドイツ語の構文により自然な近似となるようにしています。)とはいえ、この方法では、読者は原文と訳文の対応関係を「再調整」する必要があります。
19世紀から20世紀にかけてのより近代的なアプローチでは、語句を縦に並べる手法が採用され、メタ言語の用語が原文の用語の下に縦に配置されました。このスタイルでは、上記の例は次のように表現できます(英語の語句)。
ニ-
私
c-
それ
チフイ
作る
-リア
のために
で
へ
いいえ-
私の
ピルツィン
息子
ce
1
コール
家
ni- c- chihui -lia in no- piltzin ce calli
息子に家を建ててあげたい
「私は息子に家を建ててあげた。」
ここでは、語順は対象言語の構文によって決定されます。
最後に、現代の言語学者は、文法カテゴリーの略語ラベルを使用する慣習を採用しています。この例を繰り返している2008年の出版物では、次のようにラベル付けされています。[ 2 ]
ニ・シ・チフイ・リア
1SG . SUBJ - 3SG . OBJ -mach- APPL
で
刑事
ノーピルツィン
1SG . POSS -Sohn
ce
アイン
コール
ハウス
no-piltzin ce calli の ni-c-chihui-lia
1SG.SUBJ-3SG.OBJ-mach-APPL DET 1SG.POSS-Sohn ein Haus
このアプローチはより密度が高く、読むのに労力を要するが、対象となる形式の意味を表現する上で、メタ言語の文法構造への依存度は低い。
コンピュータ分野では、行間注釈の開始と終了を示すために、Unicodeの特殊文字ブロックに特別なテキストマーカーが用意されています。
IGT形式には正式な仕様はありませんが、ライプツィヒ・グロッシング・ルール[ 3 ]は、形式を可能な限り標準化することを目的とした一連のガイドラインです。
言語学における行間テキストは、通常、上から下へこの順序で、以下の要素の一部または全部で構成されます。
そして最後に
例として、以下の台湾閩南語の節を5行のテキストで書き起こしたものを以下に示します。
(1.)
(2.)
(3.)
(4.)
ゴア
ゴア1
ゴア2
私
iáu-boē
iau 1 -boe 3
iau 2 -boe 7
まだ
koat-tēng
koat 2 -teng 3
koat 4 -teng 7
決める
タンシー
タン7 -シ5
タン1 -シ5
いつ
ボー
ボー2
ボー4
欲しい
tńg-khì
tng 1 -khi 3。
tng 2 -khi 3。
戻る。
(1.) goá iáu-boē koat-tēng tang-sî boeh tńg-khì
(2.) goa1 iau1-boe3 koat2-teng3 tang7-si5 boeh2 tng1-khi3。
(3.) goa2 iau2-boe7 koat4-teng7 tang1-si5 boeh4 tng2-khi3.
(4.)いつ戻りたいかはまだ決めていません。
(5)「いつ戻るかはまだ決めていません。」
単語ごとの整列。ライプツィヒ・グロッシング規則によれば、対象言語の単語をメタ言語の対応する単語と左揃えにするのが標準です。この整列は、(1-3)行目と(4)行目の間で確認できます。
形態素ごとの対応関係。単語レベルでは、例文と注釈の両方で、分割可能な形態素はハイフンで区切られています。例文と注釈には、レズギア語の次の例に示すように、同じ数のハイフンが含まれている必要があります。
ギラ
今
フェルマ
農場
hamišaluǧ
永遠に
güǧüna
後ろに
ヒラ・アブル・ウン・フェルマ・ハミシャルージ・グーナ・アムク・ダ・チ
今、彼らは永遠にFUT-NEGの後ろにOBL-GENファームを置いています
「彼らの農場は、もはや永遠に取り残されることはないだろう。」
文法範疇のラベル。amuqʼ -da-čでは、語幹 ( amuq ) は対応する英語の語彙素( stay )に翻訳され、屈折接辞 ( da ) と ( č ) は未来時制と否定を表す屈折接辞です。これらの屈折接辞はFUTとNEGと表記されます。言語学で広く使用されている文法範疇の標準的な略語の一覧は、ライプツィヒのグロッシング規則に記載されています。
一対多の対応。単一のオブジェクト言語要素が複数のメタ言語要素に対応する場合、それらはピリオドで区切られます。[ 3 ]例:
非明示的要素。形態素ごとのグロス(中央の行)に、例文中の明示的要素に対応しない要素が含まれている場合、標準的な戦略は、明示的要素が示すようにハイフンで区切られた明示的な「∅」を対象言語テキストに含めることです[ 3 ] 。
重複は接辞と同様に扱われますが、コピーされた要素を語幹に接続するチルダ(標準のハイフンの代わりに)を使用します。[ 3 ]
行間形態素注釈では、さまざまな句読点によって注釈が区切られます。通常、単語は注釈と揃えられます。単語内では、テキストと注釈の両方で境界が示される場合はハイフン、一方にのみ境界が示される場合はピリオドが使用されます。つまり、テキストと注釈でスペースで区切られた単語の数、および単語内と注釈でハイフンで区切られた形態素の数が同じである必要があります。これが基本システムであり、普遍的に適用できます。例:
トルコ語
oda-dan hız-lı çık-tı-m
room-ABL speed-COM go.out-PFV-1sg
ルームからスピードで外出完了形I
「私は急いで部屋を出た。」
原文の単語が翻訳言語のフレーズにたまたま対応している場合は、ピリオドの代わりにアンダースコアが使用されることがあります(例:go_out- PFV) 。ただし、ギリシャ語のoikíais house. FEM.PL.DAT 'to the houses'のように、他の状況ではピリオドが使用されます。
しかし、より細かい区別がなされる場合もあります。例えば、接語はハイフンではなく二重ハイフン(または、入力の便宜上、等号)で区切られることがあります。フランス語の例を挙げます。
je⹀te⹀aime
私はあなたを愛しています
(フランス語)
je⹀te⹀aime
私はあなたを愛しています
'愛してます。'
不連続性を引き起こす接辞(接中辞、接周辞、接中辞など)は山括弧で囲むことができ、重複はハイフンではなくチルダで囲むことができる。
スラット
書く
su~sulat
物思いにふける気分~書く
s ⟨ um ⟩ ulat
⟨エージェント トリガー.past⟩書き込み
s ⟨ um ⟩ u~sulat
⟨エージェント トリガー⟩熟考~執筆
スラット スー〜スラット⟨ウム⟩ウラット⟨ウム⟩ウ〜スラット
瞑想的な気分で書く~書く⟨エージェント トリガー.過去 ⟩書く⟨エージェント トリガー⟩瞑想的~書く
(その他の例については、接辞の項を参照してください。)
ウムラウトのように容易に分離できない形態素は、ピリオドの代わりにバックスラッシュで表記されることがある。
ウンサーン
私たちのDAT.PL
Väter-n
父\ PL - DAT . PL
(ドイツ語)
unser-n Väter-n
私たちの父\PL-DAT.PL
「私たちの父祖たちに」( Väter「父祖たち」の単数形はVater)
ライプツィヒ注釈規則には、時折見られるその他の慣例がいくつか示されています。[ 3 ]
世界中の何百もの言語のIGTをデジタル化する取り組みが行われてきました。[ 5 ]
オンライン逐語訳データベース(ODIN)は、学術的な言語研究から抽出された1,500以上の言語の20万件を超える逐語訳のデータベースです。[ 6 ]このデータベースは、自動構築と手動修正の2段階で構築されました。自動構築段階自体は3つのステップで完了しました。
手動修正段階では、データベース作成者は、自動構築段階のステップ2でシーケンスラベリング法によって発見された行間グロスインスタンスの境界を手動で修正した。その後、作成者はデータに対して2回目と3回目の処理を行い、それぞれ言語名と言語コードを検証した。
オンライン逐語テキストデータベースなどの逐語訳リソースを活用した自然言語処理モデルが開発されている。[ 7 ] [ 8 ]
例えば、自然言語処理システムは、自動的に行間注釈を生成するように開発されている。[ 7 ]
ミス
あなた-GEN
ħumukuli
キャメル
elu-ab-ok'ek'-asi
私たち。OBL - ERG。1。PL -steal- PRT
アヌ
否定
mi-s ħumukuli elu-ab-ok'ek'-asi anu
あなた-GEN ラクダ 私たち.OBL-ERG.1.PL-steal-PRT です。NEG
「私たちはあなたのラクダを盗んでいません。」
形態素で区切られた行(上記の1行目)と自由翻訳行(上記の3行目)が与えられた場合、タスクは、語幹翻訳(例:mi : you)と接辞に対応する文法カテゴリラベル(例:a : ERG.1.PL)を含む中間の注釈行を生成することです。このタスクを実行するために、自然言語処理のシーケンス予測モデルが使用されています。[ 7 ]このタスクの難しさには、2つの要因が関係しています。
イツクイル語やロジバン語のような人工言語には、これらの言語の規則性と論理性により、(理論上)常に正確な注釈が得られる自動化ツールが存在します。以下に、イツクイル語とロジバン語の注釈例を示します。
A'zvaţcaxüẓpöňḑeššaščëirktöňçogjahnói
S1 -“dog”-「Xであると推測されるもの」₁-「巨大な」₁-「人間の行動の計画された結果として」₁-「何らかの」₁- DDF -「粉末または塵として」₁-「午後の軽食として食べられる」₁-「情報源の信頼性は不明であり、情報は検証できない」₁-「検証可能な推測/理論/仮説」₁- COU - POT
nnţ
「それはただ一つのことを意味する…」
A'zvaţcaxüẓpöňḑeššaščëirktöňçogjahnói nnţ
S1 -“dog”-「 Xであると推測される もの」₁-「巨大な」₁- 「人間の行動の計画された結果として」₁-「何らかの」₁- DDF -「粉末または塵として」₁-「午後の軽食として食べられる」₁-「情報源の信頼性は不明であり、情報は検証できない」₁-「テスト可能/検証可能な推測/理論/仮説」₁- COU - POT「それは1つのことしか意味しない…」
説明は一つしかない。証明はできないし、私の精神状態も少しぼんやりしているが、それは間違いなく、あちらであなたが午後のおやつとして出した、塵の形をした犬のように見える、二種類の異なる人工巨大生物が不完全に融合したものだろう。ああ、それから、この発言は鵜呑みにしないでくれ。
ミ
I=x 1
ルムシ
洗う
le
刑事
クレカ
シャツ=× 2
le
刑事
グラス
グリース=× 3
le
刑事
リルクセ
川=× 4
ミ・ルムシ・ル・クレカ・レ・グラスル・ル・リックス
I=× 1ウォッシュDETシャツ=× 2 DETグリス=× 3 DETリバー=× 4
「私は川でシャツについた油汚れを洗い流す。」
研究者は、対象言語(つまり、注釈を付ける言語)の形態素パラダイムを取得するために、行間注釈を使用してきました。行間注釈から形態素パラダイムを自動的に作成するために、研究者は注釈のすべての語幹のテーブルと、注釈のすべての文法カテゴリ(例:ERG)の(空の場合もある)スロットを作成しました。たとえば、次の注釈付き文が与えられています。[ 7 ]
ヴェチェルオム
夕方-INS
v
で
雑誌
ストア。ACC
Vecher-om ya pobeja-la v magazin
evening-INS 1.SG.NOM run-PFV.PST.SG.FEM in store.ACC
「夕方、私は店まで走って行った。」
PFV.PST.SG.FEMおよびPFV.PST.SG.MASC用のスロットを備えたステムpobejaのパラダイムが存在するでしょう。
PFV.PST.SG.FEMのスロットは埋められます (行間グロス データで観測されたため) が、 PFV.PST.SG.MASCのスロットは空になります (他の行間グロス インスタンスにPFV.PST.SG.MASC文法カテゴリで活用されたpobejaが含まれていないと仮定した場合)。形態論的活用の統計的機械学習モデルを使用して、欠落しているエントリを埋めることができます。[ 8 ] [ 9 ] [ 10 ] [ 11 ] [ 12 ]