メディア リソース コントロール プロトコル( MRCP ) は、音声サーバーがクライアントにさまざまなサービス (音声認識や音声合成など) を提供するために使用する通信プロトコルです。MRCP は、クライアントとサーバー間の制御セッションとオーディオ ストリームを確立するために、リアルタイム ストリーミング プロトコル(RTSP) やセッション開始プロトコル( SIP ) などの別のプロトコルに依存します。
MRCP は、 HTTPや他の多くのインターネット プロトコルと同様のクリア テキスト シグナリング スタイルを使用します。各メッセージには、最初の行、ヘッダー、本文の 3 つのセクションが含まれます。最初の行は、メッセージの種類と応答コードなどの情報を示します。ヘッダーには、<header>: <data>という形式の行が複数含まれています。ヘッダーによって長さが指定される本文には、メッセージの詳細が含まれます。
HTTP と同様に、MRCP はリクエスト (通常はクライアントが発行) とレスポンス モデルを使用します。レスポンスは、リクエストの受信を確認するか、リクエストの処理に関するその他の情報を提供するだけです。たとえば、MRCP クライアントは、処理 (たとえば、音声認識) のためにオーディオデータを送信するように要求する場合があります。これに対して、サーバーは、データを送信するのに適したポート番号を含むメッセージで応答します。これは、MRCP はオーディオ データに特に対応していないため、オーディオ データはReal-time Transport Protocol (RTP) などの他のプロトコルで処理する必要があるためです。
MRCP プロトコル バージョン 2 はRFCとして承認されました。バージョン 2 では、サーバーとクライアント間のセッションとオーディオ ストリームの管理にSIP を使用しますが、バージョン 1 では基礎となるプロトコルが指定されていませんでした。
MRCP は、Verbio Technologies、Skit.ai の VIVA、Microsoft Speech Server、LumenVox Speech Engine、ReadSpeaker speechServer MRCP、Nuance Recognizer および Vocalizer、Sestek TTS、Sestek Call Steering などの幅広い商用音声サーバーや、Blueworx Voice Response などの商用対話型音声応答ソフトウェアに採用されています。
外部リンク
- RFC 4463、メディア リソース制御プロトコル (MRCP)
- RFC 6787、メディア リソース制御プロトコル バージョン 2 (MRCPv2)
- UniMRCP、オープンソースのクロスプラットフォームMRCP実装
