
メタデータ(またはメタ情報)とは、他のデータの特性を定義し、説明するデータ(または情報)のことです。 [ 1 ]メタデータは、データの検索、使用、管理を容易にするために、説明、特定、またはその他の方法で役立つことがよくあります。たとえば、本のタイトル、著者、出版日は、その本に関するメタデータです。しかし、データ資産は有限ですが、メタデータは無限です。
そのため、メタデータの定義、分類、構造化の取り組みは、その使用状況の文脈における例として表現されます。「メタデータ」という用語は、1960年代にコンピュータサイエンスや大衆文化で使われ始めた歴史があります。メタデータの種類によって、それぞれ異なる機能が果たされます。例えば、文書の説明メタデータには、作成者、作成日、ファイルサイズ、キーワードなどが含まれる場合があります。
メタデータにはさまざまな目的があります。ユーザーが関連情報を見つけたり、リソースを発見したりするのに役立ちます。また、電子リソースを整理したり、デジタル識別子を提供したり、リソースをアーカイブして保存したりするのに役立ちました。メタデータは、「関連する基準でリソースを見つけられるようにし、リソースを識別し、類似のリソースをまとめ、類似していないリソースを区別し、位置情報を提供する」ことによって、ユーザーがリソースにアクセスできるようにします。 [ 2 ]インターネットトラフィックを含む電気通信活動のメタデータは、さまざまな国の政府機関によって非常に広く収集されています。このデータはトラフィック分析の目的で使用され、大規模な監視に使用される可能性があります。[ 3 ]
さまざまな分野 (博物館のコレクション、デジタルオーディオファイル、ウェブサイトなど) には、それぞれ独自のメタデータ標準が存在します。データまたはデータファイルのコンテンツとコンテキストを記述することで、その有用性が向上します。たとえば、ウェブページには、ページがどのソフトウェア言語 ( HTMLなど) で記述されているか、作成に使用されたツール、ページの内容、主題に関する詳細情報の入手先などを指定するメタデータが含まれる場合があります。このメタデータにより、読者のエクスペリエンスが自動的に向上し、ユーザーがオンラインでウェブページを見つけやすくなります。[ 4 ] CDには、ディスクに収録されている作品のミュージシャン、歌手、ソングライターに関する情報を提供するメタデータが含まれる場合があります。
多くの国では、政府機関が電子メール、電話、ウェブページ、ビデオトラフィック、IP接続、携帯電話の位置に関するメタデータを日常的に保存している。[ 5 ]
メタデータには、以下のような多くの異なる種類があります。
メタデータはこれらのカテゴリのいずれかに厳密に限定されるものではなく、データの一部を他のさまざまな方法で記述することができる。
メタデータの用途は多岐にわたり、さまざまな分野を網羅していますが、メタデータの種類を指定するための専門的で広く受け入れられているモデルがあります。Bretherton & Singley (1994) は、構造/制御メタデータとガイドメタデータの 2 つの明確なクラスを区別しています。[ 11 ]構造メタデータは、テーブル、列、キー、インデックスなどのデータベースオブジェクトの構造を記述します。ガイドメタデータは、人間が特定の項目を見つけるのに役立ち、通常は自然言語のキーワードのセットとして表現されます。Ralph Kimballによると、メタデータは、技術メタデータ(または内部メタデータ)、ビジネスメタデータ(または外部メタデータ)、およびプロセスメタデータの 3 つのカテゴリに分類できます。データボールトメソドロジーの作成者であるDan Linstedtは、ビジネスメタデータは「機能の定義、データの定義、要素の定義、およびビジネス内でデータがどのように使用されるかの定義を提供する」と述べています。ビジネスメタデータには、ビジネス要件、タイムライン、ビジネス指標、ビジネス プロセス フロー、およびビジネス用語が含まれます。[ 12 ]
ビジネスメタデータは、ビジネスパーソンにとってデータの有用性を大幅に高めることができるため重要です。ビジネスメタデータの簡単な例として、用語集のエントリが挙げられます。アプリケーションやWebフォームのホバー機能により、カーソルがフィールドや用語の上に置かれたときに用語集の定義を表示させることができます。
ビジネスメタデータの他の例としては、アプリケーション内での注釈機能があります。例えば、ビジネスユーザーがビジネスインテリジェンス(BI)レポートを閲覧中に、データに何らかの傾向が見られるとします。ユーザーは、その傾向が発生する理由について背景知識を持っているかもしれません。一部のビジネスインテリジェンスツールでは、ユーザーがレポート内にその傾向を説明する注釈を作成できます。このような注釈は、他のユーザーのデータ理解を深めるのに役立ちます。この例は、ビジネスユーザーが他のビジネスパーソンのために作成したものであるため、特に効果的です。
NISO はメタデータを記述メタデータ、構造メタデータ、管理メタデータの 3 種類に分類しています。[ 13 ]記述メタデータは通常、タイトル、著者、主題、キーワード、出版社など、オブジェクトを検索して特定するための情報として、発見と識別に使用されます。構造メタデータは、オブジェクトの構成要素がどのように構成されているかを記述します。構造メタデータの例としては、本の章を形成するためにページがどのように順序付けられているかが挙げられます。最後に、管理メタデータは、ソースの管理に役立つ情報を提供します。管理メタデータは、ファイルの種類や、ファイルがいつどのように作成されたかなどの技術情報を指します。管理メタデータの 2 つのサブタイプは、権利管理メタデータと保存メタデータです。権利管理メタデータは知的財産権を説明し、保存メタデータはリソースを保存および保管するための情報を含みます。[ 2 ]
統計データリポジトリには、データの出所や品質だけでなく[ 9 ]、データの作成に使用された統計的プロセスも記述するためのメタデータに関する独自の要件があり、これは統計コミュニティにとって、統計データ作成プロセスの検証と改善の両方において特に重要です[ 10 ] 。
メタデータのもう 1 つのタイプは、アクセシビリティ メタデータです。アクセシビリティ メタデータは、図書館にとって新しい概念ではありませんが、ユニバーサル デザインの進歩により注目度が高まっています。[ 14 ] : 213–214 Cloud4All や GPII などのプロジェクトでは、ユーザーのニーズと好み、およびそれらのニーズに合致する情報を記述するための共通の用語とモデルの欠如が、ユニバーサル アクセス ソリューションを提供する上での大きなギャップであると指摘されています。[ 14 ] : 210–211これらのタイプの情報はアクセシビリティ メタデータです。[ 14 ] : 214 Schema.orgのWeb サイトには、IMS Global Access for All Information Model Data Element Specification に基づくアクセシビリティ プロパティがいくつか組み込まれています。[ 14 ] : 214情報探索者のさまざまなアクセシビリティ ニーズを記述し標準化する取り組みはより強力になりつつありますが、確立されたメタデータ スキーマへの採用はそれほど進んでいません。例えば、ダブリン・コア(DC)の「対象読者」とMARC 21の「読解レベル」は、失読症のユーザーに適したリソースを特定するために使用でき、DCの「フォーマット」は、点字、音声、または大活字形式で利用可能なリソースを特定するために使用できますが、まだやるべきことがたくさんあります。[ 14 ]: 214
メタデータは、図書館が目録データをデジタルデータベースに変換する1980年代まで、図書館のカード目録で伝統的に使用されていました。[ 15 ] 2000年代には、データと情報がますますデジタルで保存されるようになり、このデジタルデータはメタデータ標準を使用して記述されるようになりました。[ 16 ]
コンピュータシステムの「メタデータ」に関する初期の記述は、1967年にMIT国際研究センターのDavid GriffelとStuart McIntoshによって書かれた。 [ 17 ]「要約すると、データに関する主語記述とデータのトークンコードについてオブジェクト言語で記述したステートメントがある。また、データ間の関係と変換、および規範とデータ間のべき/事実の関係を記述するメタ言語のステートメントもある。」[ 18 ]
メタデータとは「データに関するデータ」を意味します。メタデータは、データの1つ以上の側面に関する情報を提供するデータとして定義され、特定のデータの追跡や操作を容易にするデータに関する基本情報を要約するために使用されます。[ 19 ]いくつかの例を挙げると次のようになります。
例えば、デジタル画像には、画像のサイズ、色深度、解像度、作成日時、シャッタースピードなどのデータを示すメタデータが含まれる場合があります。[ 20 ]テキスト文書のメタデータには、文書の長さ、著者、文書の作成日時、文書の簡単な要約などの情報が含まれる場合があります。ウェブページのメタデータには、ページコンテンツの説明や、コンテンツにリンクされたキーワードも含まれる場合があります。[ 21 ]これらのリンクは「メタタグ」と呼ばれることが多く、1990年代後半までウェブ検索の順序を決定する主要な要素として使用されていました。[ 21 ] 1990年代後半にウェブ検索におけるメタタグへの依存度が低下したのは、「キーワードスタッフィング」[ 21 ]によるもので、メタタグが悪用され、検索エンジンを騙して、実際よりも多くのウェブサイトが検索で関連性が高いと思わせる行為が行われていました。[ 21 ]
メタデータは、メタデータレジストリまたはメタデータリポジトリと呼ばれることが多いデータベースに保存および管理できます。[ 22 ]ただし、コンテキストと参照点がない場合、メタデータを見るだけでそれを識別することは不可能かもしれません。[ 23 ]例えば、13 桁の数字がいくつか含まれているデータベースは、それ自体では計算結果または方程式に代入する数字のリストである可能性があります。他のコンテキストがない場合、数字自体がデータとして認識される可能性があります。しかし、このデータベースが書籍コレクションのログであるというコンテキストが与えられると、これらの 13 桁の数字は、書籍を参照する情報である ISBN として識別される可能性がありますが、書籍内の情報そのものではありません。「メタデータ」という用語は、1968 年に Philip Bagley が著書「Extension of Programming Language Concepts」で造語しました。同書では、彼が ISO 11179 の「伝統的な」意味、つまり「構造メタデータ」、すなわち「データのコンテナに関するデータ」でこの用語を使用していることは明らかです。代替的な意味である「データコンテンツの個々のインスタンスに関するコンテンツ」やメタコンテンツ(通常、図書館の目録に見られるタイプのデータ)とは異なります。[ 24 ] [ 25 ]それ以来、情報管理、情報科学、情報技術、図書館学、 GIS の分野でこの用語が広く採用されています。これらの分野では、メタデータという言葉は「データに関するデータ」と定義されています。[ 13 ]これは一般的に受け入れられている定義ですが、さまざまな分野でこの用語のより具体的な説明と使用法が採用されています。
Slateは2013年に、米国政府の「メタデータ」の解釈は広範であり、電子メールの件名などのメッセージの内容も含まれる可能性があると報じた。 [ 26 ]

メタデータ(メタコンテンツ)、より正確にはメタデータ(メタコンテンツ)ステートメントを構成するために使用される語彙は、通常、メタデータ標準やメタデータモデルを含む、明確に定義されたメタデータスキームを用いて、標準化された概念に基づいて構造化されます。統制語彙、分類体系、シソーラス、データ辞書、メタデータレジストリなどのツールは、メタデータのさらなる標準化に利用できます。構造的なメタデータの共通性は、データモデルの開発やデータベース設計においても極めて重要です。
メタデータ(メタコンテンツ)構文とは、メタデータ(メタコンテンツ)のフィールドまたは要素を構造化するために作成されたルールを指します。[ 27 ]単一のメタデータ スキームは、それぞれ異なる構文を必要とする複数の異なるマークアップ言語またはプログラミング言語で表現できます。たとえば、Dublin Core は、プレーン テキスト、HTML、XML、およびRDFで表現できます。[ 28 ]
(ガイド)メタコンテンツの一般的な例としては、書誌分類、主題、デューイ十進分類番号が挙げられます。何らかの対象を「分類」する際には、必ず暗黙のステートメントが存在します。例えば、対象をデューイ分類番号514(トポロジー)(つまり、背表紙に514の番号が付いている書籍)として分類する場合、暗黙のステートメントは「<書籍><主題見出し><514>」となります。これは主語-述語-目的語の三重項、あるいはより重要なことに、クラス-属性-値の三重項です。三重項の最初の2つの要素(クラス、属性)は、定義された意味を持つ構造メタデータの一部です。3番目の要素は値であり、好ましくは統制語彙、つまり参照(マスター)データからのものです。メタデータとマスターデータの要素の組み合わせによって、メタコンテンツステートメント、すなわち「メタコンテンツ = メタデータ + マスターデータ」というステートメントが生成されます。これらの要素はすべて「語彙」と考えることができます。メタデータとマスターデータはどちらも、メタコンテンツステートメントに組み立てることができる語彙です。これらの語彙(メタデータとマスターデータの両方)のソースは多数あります。UML、EDIFACT、XSD、デューイ/UDC/LoC、SKOS、ISO-25964、Pantone、リンネ式二名法などです。インデックス作成または検索のいずれの場合でも、メタコンテンツステートメントのコンポーネントに統制語彙を使用することは、ISO 25964で推奨されています。「インデクサーとサーチャーの両方が同じ概念に対して同じ用語を選択するように誘導されれば、関連するドキュメントが取得されます。」[ 29 ]これは、Googleなどのインターネット検索エンジンを考慮すると特に重要です。このプロセスでは、ページをインデックス化し、複雑なアルゴリズムを使用してテキスト文字列を照合します。知能や「推論」は発生しておらず、その錯覚があるだけです。
メタデータスキーマは階層構造を持つことができ、メタデータ要素間に関係が存在し、要素がネストされているため、要素間に親子関係が存在します。階層構造のメタデータスキーマの例としては、メタデータ要素が親メタデータ要素に属することができるIEEE LOMスキーマがあります。メタデータスキーマは、各要素が他の要素から完全に分離され、1つの次元のみに従って分類される、1次元または線形の場合もあります。線形メタデータスキーマの例としては、 1次元のDublin Coreスキーマがあります。メタデータスキーマは、各要素が他の要素から完全に分離され、2つの直交する次元に従って分類される、2次元または平面である場合もよくあります。[ 30 ]
データまたはメタデータの構造化の度合いは「粒度」と呼ばれます。「粒度」とは、提供される詳細情報の量を指します。粒度の高いメタデータは、より深く、より詳細で、より構造化された情報を提供し、より高度な技術的操作を可能にします。粒度が低い場合、メタデータの作成コストは大幅に削減できますが、詳細な情報は提供されません。粒度の主な影響は、作成と取得だけでなく、メンテナンスコストにも及びます。メタデータ構造が古くなると、参照されるデータへのアクセスもできなくなります。したがって、粒度は、メタデータの作成にかかる労力と、その維持にかかる労力の両方を考慮に入れる必要があります。
メタデータスキーマが平面表現を超えるすべてのケースにおいて、選択された側面に応じてメタデータを表示および閲覧できるようにし、特別なビューを提供するために、何らかのハイパーマッピングが必要となる。ハイパーマッピングは、地理情報や地質情報の重ね合わせによく適用される。[ 31 ]
メタデータには国際規格が適用されます。メタデータとレジストリの標準化に関する合意に達するために、国内および国際標準化コミュニティ、特にANSI(米国規格協会)とISO (国際標準化機構)で多くの作業が行われています。コアとなるメタデータレジストリ規格はISO/ IEC 11179メタデータレジストリ(MDR)で、この規格のフレームワークはISO/IEC 11179-1:2004で説明されています。[ 32 ]パート1の新版は、2015年または2016年初頭に発行される最終段階にあります。これは、概念システムの登録をサポートするようにMDRを拡張したパート3の現行版、ISO/IEC 11179-3:2013 [ 33 ]に合わせるように改訂されています( ISO/IEC 11179を参照)。この規格は、人間とコンピュータによる明確な使用のために、データの意味と技術構造の両方を記録するスキーマを規定しています。 ISO/IEC 11179規格では、メタデータをデータに関する情報オブジェクト、すなわち「データに関するデータ」と定義しています。ISO/IEC 11179パート3では、情報オブジェクトはデータ要素、値ドメイン、およびデータ項目の意味と技術的な詳細を記述するその他の再利用可能な意味論的および表現的な情報オブジェクトに関するデータです。この規格では、メタデータレジストリの詳細、およびメタデータレジストリ内での情報オブジェクトの登録と管理についても規定しています。ISO/IEC 11179パート3には、計算、1つ以上のデータ要素の集合、またはその他の形式の派生データなど、他のデータ要素から派生した複合構造を記述するための規定も含まれています。この規格は当初「データ要素」レジストリとして記述されていますが、その目的は、特定のアプリケーションとは独立してメタデータコンテンツを記述および登録できるようにすることであり、登録されたメタデータコンテンツに従って収集されたデータの分析や新しいアプリケーションの開発において、人間やコンピュータが記述を発見し再利用できるようにすることです。この規格は、他の種類のメタデータレジストリの一般的な基盤となっており、規格の登録および管理部分を再利用および拡張している。
地理空間情報コミュニティには、特に地図や画像ライブラリ、カタログの伝統に基づいた、専門的な地理空間メタデータ標準の伝統があります。一般的なテキスト処理手法は適用できないため、正式なメタデータは通常、地理空間データにとって不可欠です。
ダブリンコアメタデータ用語は、リソースの発見を目的としてリソースを記述するために使用できる語彙用語のセットです。ダブリンコアメタデータ要素セット[ 35 ]として知られる、15の古典的な[ 34 ]メタデータ用語の元のセットは、次の標準文書で承認されています。
W3Cデータカタログ語彙(DCAT)[ 39 ]は、データセット、データサービス、カタログ、カタログレコードのクラスでダブリンコアを補完するRDF語彙です。DCATはFOAF、PROV-O、OWL-Timeの要素も使用します。DCATは、データセットまたはサービスを記述するレコードを含むカタログの典型的な構造をサポートするRDFモデルを提供します。
標準規格ではないものの、マイクロフォーマット(後述の「インターネット上のメタデータ」の項でも触れている)は、既存のHTML/XHTMLタグを再利用してメタデータを伝達しようとする、ウェブベースのセマンティックマークアップ手法である。マイクロフォーマットはXHTMLおよびHTMLの標準規格に準拠しているが、それ自体が標準規格ではない。マイクロフォーマットの提唱者の一人であるタンテク・チェリクは、代替手法の問題点を次のように説明している。
ここに新しい言語を学んでほしいのですが、今度はこれらの追加ファイルをサーバーに出力する必要があります。面倒です。(マイクロフォーマット)は参入障壁を下げます。[ 40 ]
メタデータにおいて、命名規則と設計規則は、単一のデータ交換標準仕様で許可される範囲を超える一連のガイドラインと命名規則です。命名規則と設計規則が作成される最も一般的な標準は、XML Schemaです。たとえば、大文字のキャメルケースのデータ要素名の使用は、多くの標準で使用されている慣例ですが、XML Schema 仕様では規定されていません。命名規則と設計規則は、各組織のデータ交換標準の重要な側面となっています。米国では、命名規則と設計規則の標準は、各連邦機関および州機関に推奨されています。[ 41 ]

最も一般的なコンピュータファイルの種類にはメタデータを埋め込むことができ、これには文書(Microsoft Officeファイル、OpenDocumentファイル、PDFなど)、画像(JPEG、PNGなど)、ビデオファイル(AVI、MP4など)、オーディオファイル(WAV、MP3など)が含まれます。
メタデータはユーザーがファイルに追加することもできますが、多くの場合、オーサリングアプリケーションやファイル作成に使用されるデバイスによって、ユーザーの介入なしに自動的にファイルに追加されます。
ファイル内のメタデータはファイルを見つけるのに役立ちますが、ファイルを共有する際にはプライバシー侵害のリスクとなる可能性があります。共有前にメタデータ削除ツールを使用してファイルをクリーンアップすることで、このリスクを軽減できます。
メタデータはデジタル写真ファイルに書き込まれることがあり、所有者、著作権、連絡先情報、ファイルを作成したカメラのブランドやモデル、露出情報(シャッタースピード、F値など)、写真に関するキーワードなどの説明情報などを識別し、ファイルや画像をコンピュータやインターネットで検索できるようにします。カラースペース、カラーチャンネル、露出時間、絞り(EXIF)などのメタデータはカメラによって作成され、一部はコンピュータにダウンロードした後、写真家やソフトウェアによって入力されます。[ 42 ]ほとんどのデジタルカメラはモデル番号、シャッタースピードなどのメタデータを書き込み、一部はそれを編集できます。[ 43 ]この機能は、 Nikon D3以降のほとんどの Nikon DSLR、 Canon EOS 7D以降のほとんどの新しい Canon カメラ、Pentax K-3 以降のほとんどの Pentax DSLR で利用可能です。メタデータは、キーワードを使用してポストプロダクションでの整理を容易にするために使用できます。フィルターを使用すると、特定の写真セットを分析し、評価や撮影時間などの基準に基づいて選択を行うことができます。GPSなどの位置情報機能を備えたデバイス(特にスマートフォン)では、写真が撮影された場所も含まれる場合があります。
写真メタデータ標準は、以下の標準を策定する組織によって管理されています。これには、以下が含まれますが、これらに限定されません。
メタデータは、動画において特に有用です。動画の内容に関する情報(会話の書き起こしやシーンのテキスト説明など)はコンピュータが直接理解できるものではありませんが、コンテンツの効率的な検索が望ましいからです。これは、ナンバープレートデータが保存され、レポートやアラートの作成に使用される自動ナンバープレート認識や車両認識識別ソフトウェアなどの動画アプリケーションで特に有用です。[ 45 ]動画メタデータは、次の2つのソースから取得されます。(1) 運用上の収集メタデータ。これは、機器の種類、ソフトウェア、日付、場所など、制作されたコンテンツに関する情報です。(2) 人間が作成したメタデータ。これは、検索エンジンの可視性、発見可能性、視聴者のエンゲージメントを向上させ、動画パブリッシャーに広告機会を提供するものです。[ 46 ] AvidのMetaSyncとAdobeのBridgeは、メタデータにアクセスできるプロフェッショナルな動画編集ソフトウェアの例です。[ 47 ]
電話、電子メール、インスタントメッセージ、その他の通信手段の発信日時、発信元、発信先に関する情報は、メッセージの内容とは対照的に、メタデータの一種です。諜報機関によるこの通話詳細記録メタデータの大量収集は、エドワード・スノーデンによる暴露以降、物議を醸しています。スノーデンは、 NSAなどの一部の諜報機関が、対象者が諜報機関にとって関心のある人物であるかどうかに関わらず、数百万人のインターネットユーザーに関するオンラインメタデータを最長1年間保管していた(そしておそらく今も保管している)ことを明らかにしました。
地理空間メタデータは、地理情報システム(GIS)ファイル、地図、画像、およびその他の位置情報に基づくデータに関連しています。メタデータは、データベースファイルやGIS内で開発されたデータなど、地理データの特性と属性を文書化するためにGISで使用されます。メタデータには、データを開発した人、収集された時期、処理方法、利用可能な形式などの詳細が含まれ、データを効果的に使用するためのコンテキストを提供します。[ 49 ]

メタデータは、自動情報処理または手作業によって作成できます。コンピュータによって取得される基本的なメタデータには、オブジェクトがいつ作成されたか、誰が作成したか、最後に更新された日時、ファイルサイズ、ファイル拡張子などの情報が含まれます。この文脈において、オブジェクトとは以下のいずれかを指します。
メタデータエンジンは、ドメイン内で使用されているデータとメタデータに関する情報を収集、保存、分析します。[ 50 ]
データ仮想化は、2000年代に企業における仮想化「スタック」を完成させる新たなソフトウェア技術として登場しました。メタデータは、データベースサーバーやアプリケーションサーバーと並んで、企業インフラストラクチャの構成要素であるデータ仮想化サーバーで使用されます。これらのサーバー内のメタデータは永続的なリポジトリとして保存され、様々な企業システムやアプリケーションにおけるビジネスオブジェクトを記述します。データ仮想化をサポートするためには、構造的なメタデータの共通性も重要です。
標準化と調和の取り組みは、統計コミュニティにおけるメタデータシステムの構築に向けた業界の取り組みに利点をもたらしました。[ 51 ] [ 52 ]欧州統計実施規範[ 53 ]やISO 17369:2013(統計データとメタデータの交換、SDMX)[ 51 ]などのいくつかのメタデータガイドラインと標準は、企業、政府機関、その他の組織が統計データとメタデータをどのように管理すべきかに関する重要な原則を提供しています。ユーロスタット[ 54 ] 、欧州中央銀行制度[ 54 ]、米国環境保護庁[ 55 ]などの組織は、「統計業務プロセスの管理における効率性の向上」を目的として、これらの標準やガイドラインを導入しています。[ 54 ]
メタデータは、デジタル形式とアナログ形式の両方で、図書館の資料をカタログ化する手段としてさまざまな方法で使用されてきました。このようなデータは、図書館が所蔵する特定の書籍、DVD、雑誌、またはその他のオブジェクトを分類、集約、識別、および見つけるのに役立ちます。[ 56 ] 1980 年代までは、多くの図書館カタログでは、本のタイトル、著者、主題、および図書館の棚内の本の物理的な場所を示す略語の英数字文字列 (請求記号) を表示するために、ファイル引き出し内の 3x5 インチのカードを使用していました。図書館資料を主題別に分類するために図書館で使用されているデューイ十進分類法は、メタデータ使用の初期の例です。初期の紙のカタログには、カードに記載されているアイテムに関する情報、つまりタイトル、著者、主題、およびそのアイテムを見つける場所を示す番号が含まれていました。[ 57 ] 1980 年代と 1990 年代から、多くの図書館はこれらの紙のファイルカードをコンピュータ データベースに置き換えました。これらのコンピュータ データベースにより、ユーザーはキーワード検索をはるかに簡単かつ迅速に行うことができます。古いメタデータ収集のもう 1 つの形式は、米国国勢調査局が使用している「ロング フォーム」と呼ばれるものです。ロング フォームでは、分布のパターンを見つけるための人口統計データを作成するために使用される質問をします。[ 58 ]図書館は、統合図書館管理システムの一部として、図書館カタログでメタデータを使用します。メタデータは、書籍、定期刊行物、DVD、ウェブ ページ、デジタル 画像などのリソースをカタログ化することによって取得されます。このデータは、 MARCメタデータ標準を使用して、統合図書館管理システム (ILMS) に保存されます。その目的は、利用者が探しているアイテムまたはエリアの物理的または電子的場所に案内し、問題のアイテムの説明を提供することです。
図書館メタデータのより最近の専門的な例としては、電子印刷リポジトリやデジタル画像ライブラリなどのデジタルライブラリの設立が挙げられます。多くの場合、図書館の原則に基づいているものの、特にメタデータの提供において、図書館員以外の利用に重点を置いているため、従来または一般的な目録作成方法には従っていません。含まれる資料のカスタム性を考慮すると、メタデータフィールドは、分類フィールド、場所フィールド、キーワード、著作権表示など、特別に作成されることがよくあります。ファイルサイズやフォーマットなどの標準的なファイル情報は通常自動的に含まれます。[ 59 ]図書館の運営は、数十年にわたり、国際標準化に向けた取り組みの重要なトピックとなっています。デジタルライブラリのメタデータの標準には、 Dublin Core、METS、MODS、DDI、DOI、URN、PREMISスキーマ、EML、OAI-PMHなどがあります。世界をリードする図書館は、メタデータ標準戦略についてヒントを与えています。[ 60 ] [ 61 ]
同様の概念として、synset(同義語セットの略)があります。synsetは、ある文脈で共通の意味を共有する1つ以上の同義語のグループです。synsetは、計算言語学と語彙意味論における基本的な概念であり、特に英語の語彙データベースであるWordNetで使用されています。[ 62 ]この概念は、 EuroWordNet [ 63 ] 、BabelNet [ 64 ]、Global WordNetイニシアチブ[65]などの他の言語や多言語プロジェクトにも拡張されています。synsetは、自然言語処理のいくつかの分野で重要な役割を果たし、語彙項目と概念的意味の間の橋渡しを提供し、次のことを可能にすることが示されています。[ 66 ]
科学出版物のメタデータは、多くの場合、ジャーナル出版社やPubMedやWeb of Scienceなどの引用データベースによって作成されます。原稿に含まれるデータや補足資料として付随するデータは、メタデータ作成の対象となることはあまりありませんが、[ 67 ] [ 68 ]出版後に生物医学データベースなどに登録されることがあります。その場合、原著者とデータベース管理者が、自動化されたプロセスを利用してメタデータを作成する責任を負います。すべての実験データに対する包括的なメタデータは、FAIR ガイドライン、つまり研究データが検索可能、アクセス可能、相互運用可能、再利用可能であることを保証するための標準の基盤となります。[ 69 ]
このようなメタデータは、有用な方法で利用、補完、アクセス可能にすることができます。OpenAlexは、2 億を超える科学文書の無料オンラインインデックスであり、情報源、引用、著者情報、科学分野、研究トピックなどのメタデータを統合して提供しています。そのAPIとオープンソースの Web サイトは、メタサイエンス、計量書誌学、およびこの論文のセマンティックWebをクエリする新しいツールに使用できます。[ 70 ] [ 71 ] [ 72 ]開発中の別のプロジェクトであるScholia は、科学出版物のメタデータを使用して、 Wikidataの「メイン主題」プロパティを使用して SARS-CoV-2 ウイルスの特定の特徴に関する文献を要約するシンプルなユーザー インターフェイスを提供するなど、さまざまな視覚化および集約機能を提供します。[ 73 ]
研究労働においては、論文の作成における役割、貢献度、責任など、著者の貢献に関する透明性のあるメタデータが提案されている。[ 74 ] [ 75 ]
さらに、科学的成果に関するさまざまなメタデータを作成または補完することができます。たとえば、一部の組織は、論文の引用を研究の「支持」、「言及」、「対照」として追跡およびリンクしようとしています。[ 76 ]他の例としては、代替指標の開発[ 77 ]があります。これは、評価と検索性に役立つだけでなく、 Redditなどのソーシャルメディアでの科学論文に関する多くの公開の議論、Wikipediaの引用、ニュースメディアでの研究に関するレポートも集約します[ 78 ] 。また、元の発見が確認されたかどうか、または再現できるかどうかを示すよう求める声もあります。[ 79 ] [ 80 ]
博物館におけるメタデータとは、アーカイブ担当者、司書、博物館登録担当者、学芸員などの訓練を受けた文化文書専門家が、美術作品、建築物、文化財、およびそれらの画像を索引付け、構造化、記述、識別、またはその他の方法で特定するために作成する情報のことです。[ 81 ] [ 82 ] [ 83 ]記述メタデータは、博物館の文脈では、オブジェクトの識別とリソースの復旧の目的で最も一般的に使用されます。[ 82 ]
メタデータは、収集機関や博物館において、以下の目的で開発および適用されます。
多くの博物館や文化遺産センターは、美術品や文化財の多様性を考えると、文化作品を記述し目録化するのに十分な単一のモデルや標準はないことを認識しています。[ 81 ] [ 82 ] [ 83 ]例えば、彫刻された先住民の工芸品は、美術品、考古学的遺物、または先住民の遺産アイテムとして分類される可能性があります。博物館コミュニティ内でのアーカイブ、記述、目録化の標準化の初期段階は、1990年代後半に美術作品記述のためのカテゴリ(CDWA)、Spectrum、CIDOC概念参照モデル(CRM)、文化財目録化(CCO)、CDWA Lite XMLスキーマなどの標準の開発とともに始まりました。 [ 82 ]これらの標準は、機械処理、公開、実装にHTMLとXMLマークアップ言語を使用しています。 [ 82 ]元々は書籍を特徴付けるために開発された英米目録規則(AACR)も、文化財、美術作品、建築物に適用されています。[ 83 ] CCO などの標準は、博物館のコレクション管理システム(CMS) に統合されています。CMS は、博物館がコレクション、取得、貸出、保存を管理できるデータベースです。[ 83 ]この分野の学者や専門家は、「急速に進化する標準とテクノロジーの状況」が、特に技術的な訓練を受けていない専門家にとって文化ドキュメンタリストに課題を生み出していると指摘しています。[ 84 ]ほとんどの収集機関や博物館は、文化作品とその画像を分類するためにリレーショナルデータベースを使用しています。 [ 83 ]リレーショナルデータベースとメタデータは、文化オブジェクトと多面的な芸術作品の間、およびオブジェクトと場所、人物、芸術運動の間の複雑な関係を文書化および記述するために機能します。[ 82 ] [ 83 ]リレーショナルデータベース構造は、収集機関や博物館内でも有益です。なぜなら、アーカイブ担当者が文化オブジェクトとその画像を明確に区別できるからです。区別が不明瞭だと、混乱を招き、不正確な検索につながる可能性があります。[ 83 ]
文化資料作成者が対象物に付与するデータの記述の深さは、対象物の物質性、機能、目的、サイズ(高さ、幅、重量などの寸法)、保管要件(温度・湿度管理された環境など)、博物館やコレクションの焦点によって左右されます。[ 83 ]確立された機関の目録作成慣行、文化資料作成者の目標と専門知識、データベース構造も、文化対象物に付与される情報や文化対象物の分類方法に影響を与えます。[ 81 ] [ 83 ]さらに、博物館では、アーカイブ担当者が美術品や文化対象物を記述する方法を規定し制限する標準化された市販のコレクション管理ソフトウェアがよく使用されます。[ 84 ]また、収集機関や博物館は、コレクション内の文化対象物や美術品を記述するために統制語彙を使用します。 [ 82 ] [ 83 ]ゲッティ語彙と米国議会図書館統制語彙は、博物館コミュニティで評判が高く、CCO 基準で推奨されています。[ 83 ]博物館は、コレクションに関連し、文脈に沿った統制語彙を使用し、デジタル情報システムの機能を強化することが推奨されています。[ 82 ] [ 83 ]統制語彙は、高いレベルの一貫性を提供し、リソースの検索を改善するため、データベース内で有益です。[ 82 ] [ 83 ]統制語彙を含むメタデータ構造は、それらが作成されたシステムのオントロジーを反映しています。博物館でメタデータを通じて文化財を記述および分類するプロセスは、多くの場合、制作者コミュニティの視点を反映していません。[ 81 ] [ 85 ]
メタデータは、博物館内のデジタル情報システムやアーカイブの作成に不可欠であり、博物館がデジタルコンテンツをオンラインで公開することを容易にしました。これにより、地理的または経済的な障壁のために文化財にアクセスできなかった可能性のある観客がそれらにアクセスできるようになりました。[ 82 ] 2000年代には、より多くの博物館がアーカイブ標準を採用し、複雑なデータベースを作成するにつれて、博物館データベース間のリンクトデータに関する議論が博物館、アーカイブ、図書館学コミュニティで提起されました。[ 84 ]コレクション管理システム(CMS)とデジタル資産管理ツールは、ローカルシステムまたは共有システムです。[ 83 ]デジタル人文科学の研究者は、博物館データベースとコレクション間の相互運用性の多くの利点を指摘する一方で、そのような相互運用性を実現することの難しさも認めています。[ 84 ]
米国の訴訟におけるメタデータに関する問題は、広く蔓延しつつあります。裁判所は、当事者によるメタデータの開示可能性など、メタデータに関するさまざまな問題を検討してきました。連邦民事訴訟規則には、電子的に保存された情報の開示に関する具体的な規則があり、これらの規則を適用したその後の判例は、連邦裁判所で訴訟を行う際の訴訟当事者のメタデータ提出義務を明確にしてきました。[ 86 ] 2009 年 10 月、アリゾナ州最高裁判所は、メタデータ記録は公記録であると判決を下しました。[ 87 ]訴訟でメタデータが要求される法的環境では、文書メタデータは特に重要であることが証明されています。メタデータには、裁判所の特定の当事者に不利な機密情報が含まれる可能性があります。メタデータ削除ツールを使用して文書を「クリーンアップ」または編集することで、機密データを意図せず送信するリスクを軽減できます。このプロセスは、法律事務所を電子開示による機密データの潜在的に有害な漏洩から部分的に保護します。
世論調査によると、アメリカ人の45%はソーシャルメディアサイトが個人データの安全性を確保できる能力に「全く自信がない」と回答しており、40%はソーシャルメディアサイトが個人に関する情報を一切保存すべきではないと回答している。アメリカ人の76%は広告代理店が収集する情報が安全であるとは確信しておらず、50%はオンライン広告代理店が自分の情報を一切記録することを許可すべきではないと回答している。[ 88 ]
EUでは、スノーデンによる暴露が、プライバシーと個人データの処理に関する事項の見直しに影響を与えている。[ 89 ] 2025年現在、データ保持指令によって調査された18のヨーロッパ諸国のうち、ドイツ、オランダ、ルーマニアのみがデータ保持規則を施行していない。[ 90 ]
2020年10月6日、欧州連合司法裁判所(CJEU)は、無差別な大量データ保持計画はEU法の下で違法であるとの判決を下した。[ 91 ]一方、フランスは2013年12月18日に、フランス軍および情報機関によるデータ収集を容易にする法律を可決した。[ 92 ]また、2022年4月には、ポルトガル憲法裁判所が、一般に利用可能な電子通信サービスまたは公共通信ネットワークの提供に関連して生成または処理されたデータの保持に関するCJEU法を違憲と宣言した。[ 93 ]
オーストラリアでは、国家安全保障を強化する必要性から、新しいメタデータ保存法が導入されました。[ 94 ]この新しい法律により、治安機関と警察機関の両方が個人のメタデータに最大2年間アクセスすることが許可され、テロ攻撃や重大犯罪の発生を阻止しやすくなります。
立法メタデータは、2010年3月22日と23日にコーネル大学ロースクールの法情報研究所が開催したワークショップなど、さまざまなフォーラムで議論されてきました。これらのワークショップの資料は「立法および規制のためのメタデータの推奨される実践」というタイトルです。[ 95 ]
これらの議論によっていくつかの重要な点が明らかにされ、その各項目の見出しは以下のとおりです。
オーストラリアの医学研究は、医療におけるアプリケーションのメタデータの定義を先駆的に行いました。このアプローチは、世界保健機関(WHO)の傘下で独自の標準を定義するのではなく、医学における国際標準に準拠しようとする最初の試みとして認められました。しかし、これらの標準を支持する研究があったにもかかわらず、医療界はメタデータ標準に従う必要性を認めませんでした。[ 96 ]
生物医学や分子生物学の分野で行われる研究では、ゲノムやメタゲノムのシーケンス結果、プロテオミクスデータ、さらには研究の過程で作成されたメモや計画など、大量のデータが得られることがよくあります。 [ 97 ]各データタイプには、それぞれ独自のメタデータと、これらのメタデータを生成するために必要なプロセスがあります。ISA-Tab [ 98 ]などの一般的なメタデータ標準により、研究者は一貫した形式で実験メタデータを作成および交換できます。特定の実験手法には、独自のメタデータ標準とシステムがあることがよくあります。質量分析のメタデータ標準には、 mzML [ 99 ]と SPLASH [ 100 ]があり、 PDBML [ 101 ]や SRA XML [ 102 ]などのXMLベースの標準は、それぞれ高分子構造とシーケンスデータの標準として機能します。
生物医学研究の成果は一般的に査読付き論文として発表され、これらの出版物はデータのもう一つの情報源となる。
データウェアハウス(DW) は、組織の電子的に保存されたデータのレポジトリです。データウェアハウスは、データの管理と保存を行うように設計されています。データウェアハウスは、ビジネスインテリジェンス(BI) システムとは異なります。BI システムは、データを使用してレポートを作成し、情報を分析し、経営陣に戦略的なガイダンスを提供するように設計されているからです。[ 103 ]メタデータは、データウェアハウスにデータを保存する方法において重要なツールです。データウェアハウスの目的は、組織内のさまざまな運用システムから抽出された、標準化され、構造化され、一貫性があり、統合され、正確で、「クリーン」され、タイムリーなデータを格納することです。抽出されたデータは、企業全体の視点を提供するために、データウェアハウス環境に統合されます。データは、レポート作成と分析の要件を満たすように構造化されます。エンティティ関係モデル図などのデータモデリング手法を使用して構造メタデータの共通性を設計することは、あらゆるデータウェアハウス開発作業において重要です。データウェアハウス内の各データに関するメタデータの詳細を記述します。データウェアハウス/ビジネスインテリジェンスシステムの重要な構成要素は、メタデータと、メタデータを管理および取得するためのツールです。ラルフ・キンボール[ 104 ]は、メタデータをデータウェアハウスのDNAと表現し、メタデータはデータウェアハウスの要素とそれらがどのように連携して機能するかを定義すると述べています。
Kimballら[ 105 ]は、メタデータの主なカテゴリとして、技術、ビジネス、プロセスの 3 つを挙げています。技術メタデータは主に定義的であり、ビジネスメタデータとプロセスメタデータは主に記述的です。これらのカテゴリは重複することもあります。
ウェブページを定義するために使用されるHTMLフォーマットでは、基本的な説明テキスト、日付、キーワードから、ダブリン コア、e-GMS、AGLS [ 106 ]標準などの高度なメタデータ スキームまで、さまざまな種類のメタデータを含めることができます。ページやファイルには、座標によるジオタグを付けたり、フォークソノミーなどの共同作業を含めてカテゴリ分けやタグ付けをすることもできます。
メディアに識別子が設定されている場合、またはそのような識別子を生成できる場合、ファイルタグや説明などの情報をインターネットから取得またはスクレイピングできます。たとえば、映画に関する情報などです。 [ 107 ]さまざまなオンラインデータベースが集約され、さまざまなデータのメタデータを提供します。共同で構築されたWikidataには、メディアだけでなく、抽象的な概念、さまざまなオブジェクト、その他のエンティティの識別子も含まれており、人間や機械が検索して有用な情報を取得したり、他の知識ベースやデータベースの知識をリンクしたりできます。[ 73 ]
メタデータは、ページのヘッダーまたは別のファイルに含めることができます。マイクロフォーマットを使用すると、通常のウェブユーザーには見えない方法でページ上のデータにメタデータを追加できますが、コンピュータ、ウェブクローラー、検索エンジンは簡単にアクセスできます。多くの検索エンジンは、メタデータの悪用と検索エンジン最適化(SEO)によるランキング向上の慣行のため、ランキングアルゴリズムでメタデータを使用することに慎重です。詳細については、メタ要素の記事を参照してください。Doctorow 氏によると、 [ 108 ]人々は自分のメタデータを作成する際に注意と勤勉さを発揮しておらず、メタデータはメタデータ作成者自身の目的を促進するために使用される競争環境の一部であるため、この慎重な姿勢は正当化される可能性があります。調査によると、検索エンジンはメタデータ実装のあるウェブページに反応し、[ 109 ] Google は検索エンジンが理解するメタタグを示すアナウンスをサイトに表示しています。[ 110 ]エンタープライズ検索スタートアップのSwiftypeは、メタデータをウェブマスターが自社のウェブサイト固有の検索エンジンに実装できる関連性シグナルとして認識しており、Meta Tags 2として知られる独自の拡張機能もリリースしている。[ 111 ]
放送業界では、メタデータは音声および映像放送メディアにリンクされ、以下の目的で使用されます。
このメタデータは、ビデオサーバーのおかげでビデオメディアにリンクできます。FIFAワールドカップやオリンピックなどの主要な放送スポーツイベントのほとんどは、キーワードを介してテレビ局にビデオコンテンツを配信するためにこのメタデータを使用します。多くの場合、ホスト放送局[ 112 ]が、国際放送センターとビデオサーバーを介してメタデータを整理する責任を負います。このメタデータは画像とともに記録され、メタデータオペレーター(ロガー)によって入力され、ソフトウェア( FIFAワールドカップやオリンピックで使用されるMulticam(LSM)やIPDirectorなど)を介してメタデータグリッドで利用可能なライブメタデータに関連付けられます。[ 113 ] [ 114 ]
生態学的および環境メタデータは、特定の研究におけるデータ収集の「誰が、何を、いつ、どこで、なぜ、どのように」を記録することを目的としています。これは通常、どの組織または機関がデータを収集したか、どのような種類のデータか、データが収集された日付、データ収集の根拠、およびデータ収集に使用された方法論を意味します。メタデータは、ダーウィン コア、生態学的メタデータ言語[ 115 ]、またはダブリン コアなど、最も関連性の高い科学コミュニティで一般的に使用されている形式で生成する必要があります。メタデータの生成を容易にするためのメタデータ編集ツールが存在します (例: Metavist [ 116 ] 、 Mercury、Morpho [ 117 ] )。メタデータは、データの出所(データの起源、およびデータが受けた変換) と、データ製品に対するクレジット (引用) の方法を記述する必要があります。
1982年に初めて発売されたコンパクトディスクには、ディスク上のトラック数とその長さ(サンプル単位)を記載した目次(TOC)のみが含まれていました。[ 118 ] [ 119 ] 14年後の1996年、 CDレッドブック規格の改訂により、追加のメタデータを格納できるCD-Textが追加されました。[ 120 ]しかし、CD-Textは広く採用されませんでした。その後まもなく、パーソナルコンピュータが目次に基づいて外部ソース( CDDB、Gracenoteなど)からメタデータを取得することが一般的になりました。
デジタルオーディオファイルなどのデジタルオーディオフォーマットは、2000年代にカセットテープやCDなどの音楽フォーマットに取って代わりました。デジタルオーディオファイルには、ファイル名だけでは表現できないより多くの情報をラベル付けできます。この記述情報は、オーディオタグ、または一般的にオーディオメタデータと呼ばれます。この情報を追加または変更することに特化したコンピュータプログラムは、タグエディタと呼ばれます。メタデータは、デジタルオーディオファイルの命名、説明、カタログ化、所有権または著作権の表示に使用でき、メタデータが存在することで、通常はメタデータにアクセスする検索エンジンを使用して、グループ内の特定のオーディオファイルをはるかに簡単に見つけることができます。さまざまなデジタルオーディオフォーマットが開発されるにつれて、この情報を格納できるデジタルファイル内の特定の場所を標準化する試みが行われました。
その結果、mp3、放送用wav、AIFFファイルなど、ほぼすべてのデジタルオーディオフォーマットには、メタデータを格納できる同様の標準化された場所が存在します。圧縮および非圧縮のデジタル音楽のメタデータは、多くの場合ID3タグにエンコードされます。TagLibなどの一般的なエディタは、MP3、Ogg Vorbis、FLAC、MPC、Speex、WavPack TrueAudio、WAV、AIFF、MP4、およびASFファイルフォーマットをサポートしています。
コンテンツにメタデータを追加するアプリケーションを含むクラウドアプリケーションの普及に伴い、メタデータはインターネット上でますます利用可能になっている。
メタデータは、内部的に[ 121 ]データと同じファイルまたは構造に格納することも(これは埋め込みメタデータとも呼ばれます)、外部的に記述されたデータとは別のファイルまたはフィールドに格納することもできます。データリポジトリは通常、メタデータをデータから切り離して格納しますが、埋め込みメタデータ方式をサポートするように設計することも可能です。それぞれのオプションには、長所と短所があります。
メタデータは、人間が読める形式またはバイナリ形式で保存できます。XML などの人間が読める形式でメタデータを保存すると、特別なツールを使わずにユーザーが理解して編集できるため便利です。[ 122 ]ただし、テキストベースの形式は、ストレージ容量、通信時間、処理速度のいずれにおいても最適化されているとは限りません。バイナリメタデータ形式は、これらのすべての点で効率性を実現しますが、バイナリ情報を人間が読めるコンテンツに変換するには特別なソフトウェアが必要です。
各リレーショナルデータベースシステムには、メタデータを保存するための独自のメカニズムがあります。リレーショナルデータベースのメタデータの例としては、以下のようなものがあります。
データベース用語では、このメタデータのセットはカタログと呼ばれます。SQL標準では、カタログにアクセスするための統一的な手段である情報スキーマが規定されていますが、 SQL標準の他の側面を実装しているデータベースであっても、すべてのデータベースがこれを実装しているわけではありません。データベース固有のメタデータ アクセス方法の例については、Oracle メタデータを参照してください。JDBCや SchemaCrawlerなどの API を使用して、プログラムによるメタデータへのアクセスが可能です。[ 123 ]
今日私たちが理解しているメタデータの概念を風刺的に考察した最初の作品の1つは、アメリカのSF作家ハル・ドレイパーの短編小説「図書館のMS Fnd」(1961年)である。[ 124 ]この物語では、全人類の知識が机の引き出しほどの大きさの物体に凝縮されているが、メタデータ(例えば、カタログのカタログ、索引、履歴など)の規模が、最終的には人類にとって悲惨でありながらも滑稽な結果をもたらす。この物語は、メタデータがそれが対象とする実際のデータよりも重要になることを許容することによる現代の結果と、その事態に内在するリスクを、教訓話として予見している。
ドキュメントとは、データセット、システム、または研究プロセスを理解しやすく、使いやすく、再利用できるようにするための、それらを説明するすべてのコンテキスト情報を指します。これには、研究の背景、データ収集方法、ファイル一覧、コードブック、データ辞書、ユーザーガイド、ワークフローノートなどの広範な詳細が含まれます。一方、メタデータは、タイトル、作成者、ファイル形式、サイズ、アクセス条件、ファイルやセクションの構成方法など、データ自体に関する標準化された情報を提供する、具体的で高度に構造化されたドキュメント形式です。
メタデータとドキュメントは、情報管理において関連性はあるものの、明確に区別される概念です。どちらもデータガバナンス、ユーザビリティ、および保存において重要な役割を果たします。ドキュメントはデータに関する詳細な説明と手順を提供するのに対し、メタデータは簡潔で構造化された記述子を提供し、ユーザーやシステムがデータを効率的に識別、検索、管理、保存するのに役立ちます。
{{cite journal}}: CS1メンテナンス: DOIは2025年10月現在非アクティブです(リンク)