
セマンティックHTMLとは、単に表示形式や見た目を定義するのではなく、ウェブページやウェブアプリケーション内の情報のセマンティクス(意味)を強化するためにHTMLマークアップを使用する手法です。セマンティックHTMLは、従来のウェブブラウザだけでなく、他の多くのユーザーエージェントによっても処理されます。CSSは、人間ユーザーへの表示方法を指定するために使用されます。
HTMLは誕生以来、意味論的なマークアップを含んでいます。[ 1 ] HTML文書では、作成者はとりわけ、「タイトルから始め、見出しや段落を追加し、テキストを強調し、画像を追加し、他のページへのリンクを追加し、さまざまな種類のリストを使用する」ことができます。[ 2 ]
HTML 標準のさまざまなバージョンには、(HTML 3.2 で追加され、HTML 4.0 Strict で削除された)、(すべてのバージョン)、 (HTML 3.2 で追加された)などのプレゼンテーション マークアップが含まれています。意味的に中立なspan 要素と div要素もあります。1990 年代後半にCascading Style Sheets がほとんどのブラウザで動作し始めて以来、Web 作成者はコンテンツとプレゼンテーションの分離を考慮して、プレゼンテーション HTML マークアップの使用を避けるよう奨励されてきました。[ 3 ]<font><i><center>
2001年、ティム・バーナーズ=リーはセマンティックWebに関する議論に参加し、知能ソフトウェア「エージェント」がいつかWebを自動的にクロールし、エンドユーザーの利益のために、これまで無関係だった公開された事実を見つけ、フィルタリングし、関連付ける可能性があると発表しました。[ 4 ]このようなエージェントは今でも一般的ではありませんが、 Web 2.0、マッシュアップ、価格比較ウェブサイトのアイデアの一部はそれに近いものになっているかもしれません。これらのWebアプリケーションのハイブリッドとバーナーズ=リーのセマンティックエージェントの主な違いは、現在の情報の集約とハイブリッド化は通常、Web開発者によって設計されており、開発者はマッシュ、比較、結合したい特定のデータのWebの場所とAPIセマンティクスをすでに知っているという事実にあります。
ウェブページを自動的にクロールして読み込む重要なタイプのウェブエージェントとして、ウェブクローラーまたは検索エンジンスパイダーがあります。これらのソフトウェアエージェントは、さまざまな技術とアルゴリズムを使用して1日に何百万ものウェブページを読み込み、インデックスを作成し、ウェブユーザーに検索機能を提供するため、ウェブページの意味的な明確さに依存しています。
検索エンジンのクローラーが HTML 文書内で見つけたテキストの重要性を評価できるようにするため、またマッシュアップやその他のハイブリッドを作成するため、さらに開発中のより自動化されたエージェントのためにも、公開された情報の意味を明らかにするために HTML に存在する意味構造を広く均一に適用する必要がある。[ 5 ]
真のセマンティック Web は複雑なRDFオントロジーとメタデータに依存するかもしれませんが、すべての HTML ドキュメントは、可能な限り見出し、リスト、タイトル、その他のセマンティック マークアップを正しく使用することで、Web の意味に貢献しています。この「プレーン」な HTML の使用は、「プレーン オールド セマンティック HTML」または POSH と呼ばれています。[ 6 ] Web 2.0 の「タグ付け」を正しく使用すると、多くの人にとって同等またはそれ以上に意味のあるフォークソノミーが作成されます。[ 5 ] HTML 5では、、、、、、、、などの新しいセマンティック要素が導入されました。[ 7 ]全体として、 W3Cの目標は、ブラウザ、開発者、クローラーが異なる種類のデータをより適切に区別するための方法を徐々に導入し、さまざまなデバイスのブラウザでの表示の改善などのメリットを実現することです。<section><article><footer><progress><nav><aside><mark><time>
プレゼンテーション要素は、HTML 4.01 および XHTML の勧告では正式には非推奨とはされていませんでしたが、使用は推奨されていませんでした。HTML 5 では、<p> や<p>などの要素は、その意味が「特別な重要性を伝えることなく、通常の散文からスタイル的に分離される」と明確に定義されているため、依然として指定されています。[ 8 ] [ 9 ]<i><b>
ドキュメントが HTML だけで表現できるよりも正確な意味論を必要とする場合、ドキュメントの断片は、<script> や <script> などの意味のあるクラス名 [10] を持つ要素または要素で囲まれることがあります。これらのクラス名がspanスキーマまたはオントロジー内の断片識別子でもある場合、それらはより明確な意味にリンクすることができます。マイクロフォーマットは、 HTML における意味論へのこのアプローチを形式化したものです。div<span class="author"><div class="invoice">
このアプローチの重要な制約の 1 つは、要素の包含に基づくこのようなマークアップが整形式条件を満たす必要があることです。これらのドキュメントは大部分がツリー構造になっているため、この方法でマークアップできるのはサブツリーのバランスの取れたフラグメントのみとなります。[ 11 ] [ 12 ] HTML の任意のセクションをマークアップする手段には、 XPointerのようなマークアップ構造自体とは独立したメカニズムが必要になります。
適切なセマンティックHTMLは、 Webドキュメントのアクセシビリティも向上させます( Webコンテンツアクセシビリティガイドラインも参照)。例えば、スクリーンリーダーや音声ブラウザがドキュメントの構造を正しく認識できる場合、適切にマークアップされた情報であれば、視覚障害のあるユーザーの時間を無駄にすることなく、重複した情報や無関係な情報を読み上げることができます。
2010 年、Google は、ウェブ ページ内の構造化された意味コンテンツを見つけるためにシステムが使用する 3 つの形式の構造化メタデータを指定しました。このような情報は、レビュー、人物プロフィール、ビジネス リスト、イベントに関連する場合、ページが検索結果に表示されるときに表示される「スニペット」、つまり短い引用テキストを強化するために Google によって使用されます。Google は、このデータはマイクロデータ、マイクロフォーマット、またはRDFa を使用して提供できると指定しています。[ 13 ]マイクロデータは、既存の HTML 要素内に指定されitemtype、属性が追加されます。マイクロフォーマットのキーワードは、前述のように属性itemprop内に追加されます。RDFa は、既存の要素に追加される、および属性に依存します。[ 14 ]classreltypeofproperty