IT災害復旧(単に災害復旧(DR )とも呼ばれる)は、嵐や戦闘などの自然災害または人為的災害の後、重要なインフラストラクチャとシステムを維持または再構築するプロセスです。DRは、重要なビジネス機能をサポートするITシステムに焦点を当てたポリシー、ツール、および手順を採用します。 [ 1 ]これは、重大な混乱イベントにもかかわらず、ビジネスのすべての重要な側面が機能し続けることを含みます。したがって、ビジネス継続性(BC)のサブセットと考えることができます。[ 2 ] [ 3 ] DRは、プライマリサイトがすぐに復旧できないことを前提として、セカンダリサイトにデータとサービスを復元します。
ITサービス継続性(ITSC)はBCPのサブセットであり[ 4 ] 、復旧時点/時間目標の指標(主要リスク指標としてよく使用される)に依存しています。IT災害復旧計画とより広範なITレジリエンス計画を包含しています。また、電話やデータ通信などの通信に関連するITインフラストラクチャとサービスも組み込まれています。[ 5 ] [ 6 ]
計画には、バックアップサイトの手配が含まれます。バックアップサイトは、「ホット」(災害発生前に稼働している)、「ウォーム」(稼働開始準備が整っている)、「コールド」(稼働開始に相当な作業が必要な)のいずれであるかを問わず、また、事業継続に必要なハードウェアを備えた待機サイトも手配します。
2008年、英国規格協会は、コンピュータの継続性を事業継続性と整合させることを目的として、事業継続性規格BS 25999をサポートするBS25777という特定の規格を発表しました。これは、2011年3月にISO/IEC 27301「セキュリティ技術 - 事業継続のための情報通信技術の準備に関するガイドライン」が発行されたことを受けて撤回されました。[ 7 ]
復旧時間目標 (RTO) [ 9 ] [ 10 ]は、事業継続性の途絶を避けるために、障害発生後に事業プロセスを復旧させる必要がある目標時間とサービスレベルです。 [ 11 ]
事業継続計画の手法によれば、RTO(復旧目標時間)は、事業影響度分析(BIA)の過程で、プロセスの所有者によって設定され、代替手段や手動による回避策の時間枠を特定することも含まれます。

RTOはRPOの補完概念です。許容可能な、あるいは「許容できる」ITSCパフォーマンスの限界は、通常の業務プロセス機能の損失時間と、その期間中に失われたりバックアップされなかったデータの観点から、RTOとRPOによって測定されます。[ 11 ] [ 12 ]
実際の復旧時間(RTA)は、事業継続と災害復旧にとって重要な指標です。[ 9 ]
事業継続グループは、時間制限付きのリハーサル(または実地訓練)を実施し、その過程でRTAが決定され、必要に応じて改善される。[ 9 ]
リカバリポイント目標 (RPO)は、 IT サービスからトランザクション データが失われても許容される最大期間です。 [ 11 ]
例えば、RPOが分単位で測定される場合、実際には、オフサイトのミラーリングバックアップを継続的に維持する必要があり、毎日のオフサイトバックアップでは不十分です。[ 13 ]
即時ではない復旧は、重大なリスクや損失を被ることなく、一定期間にわたってトランザクションデータを復元します。[ 11 ]
RPOは、最近のデータが永久に失われる可能性のある最大時間を測定するものであり、損失量を直接示すものではありません。例えば、BCプランが利用可能な最後のバックアップまで復元することである場合、RPOはそのようなバックアップ間の間隔となります。
RPOは既存のバックアップ体制によって決定されるものではありません。代わりに、BIAが各サービスごとにRPOを決定します。オフサイトデータが必要な場合、データが失われる可能性のある期間は、バックアップがオフサイトに保管された時点ではなく、バックアップの準備が開始された時点から始まる場合があります。[ 12 ]
復旧指標は、故障指標に変換したり、故障指標と併用したりすることができます。一般的な測定項目には、平均故障間隔(MTBF)、平均初回故障時間(MTFF)、平均修復時間(MTTR)、平均ダウンタイム(MDT)などがあります。
データ同期ポイント[ 14 ]は、バックアップが完了した時点です。ディスク間コピーが完了するまで、更新処理は停止されます。バックアップ[ 15 ]コピーは、データがテープにコピーされたり、他の場所に送信されたりした時点ではなく、コピー操作の以前のバージョンを反映しています。
RTOとRPOは、他のシステム設計基準とともに、ビジネスリスクを考慮してバランスを取る必要がある。[ 16 ]
RPOは、バックアップがオフサイトで安全に保管される時間に連動しています。同期コピーをオフサイトのミラーに送信することで、ほとんどの予期せぬ事態に対応できます。テープ(またはその他の持ち運び可能なメディア)の物理的な輸送は一般的です。リカバリは、あらかじめ決められた場所で実行できます。共有のオフサイトスペースとハードウェアがパッケージを完成させます。[ 17 ]
大量の高価値トランザクションデータを扱う場合、ハードウェアを複数の拠点に分散させることができます。
災害復旧計画と情報技術(IT)は、1970年代半ばから後半にかけて、コンピュータセンターの管理者たちが組織がコンピュータシステムに依存していることを認識し始めたことで発展した。
当時、ほとんどのシステムはバッチ処理型のメインフレームだった。プライマリサイトの復旧を待つ間、オフサイトのメインフレームにバックアップテープからデータをロードすることができたため、ダウンタイムは比較的それほど深刻な問題ではなかった。
災害復旧業界[ 18 ] [ 19 ]はバックアップコンピュータセンターを提供するために発展しました。Sungard Availability Servicesは、スリランカに拠点を置く初期のそのようなセンターの1つでした(1978年)。[ 20 ] [ 21 ]
1980年代から90年代にかけて、コンピューター技術は飛躍的に発展し、企業内タイムシェアリング、オンラインデータ入力、リアルタイム処理などが普及した。ITシステムの可用性の重要性がますます高まった。
規制当局が関与するようになり、可用性目標として2、3、4、または5ナイン(99.999%)が義務付けられることが多くなり、ホットサイト施設向けの高可用性ソリューションが求められるようになった。
ITサービスの継続性は、ISO/IEC 27001およびISO 22301でそれぞれ規定されているように、事業継続マネジメント(BCM)および情報セキュリティマネジメント(ISM)の一部として不可欠なものとなった。
2010年以降のクラウドコンピューティングの台頭により、システムの回復力に関する新たな機会が生まれました。サービスプロバイダーは、可用性や信頼性を含む高いサービスレベルを維持する責任を負い、非常に回復力の高いネットワーク設計を提供しました。Recovery as a Service (RaaS) は広く利用可能であり、クラウドセキュリティアライアンスによって推進されています。[ 22 ]
災害は、大きく分けて3つのカテゴリーの脅威や危険によって引き起こされる可能性がある。
あらゆるカテゴリーとタイプの災害に対する備えの対策は、予防、保護、軽減、対応、復旧の 5 つの任務領域に分類されます。[ 23 ]
研究によると、より包括的な災害前計画アプローチを実施する方が費用対効果が高いことが示されています。災害軽減(災害復旧計画など)に1ドル費やすごとに、社会は対応と復旧のコストを4ドル節約できます。[ 24 ]
2015年の災害復旧統計によると、1時間のダウンタイムは[ 25 ]のコストがかかる可能性がある。
ITシステムが企業の円滑な運営、ひいては経済全体にとってますます重要になるにつれて、これらのシステムの継続的な運用と迅速な復旧を確保することの重要性が高まっている。 [ 26 ]
制御措置とは、脅威を軽減または排除するための手順や仕組みのことです。これらの仕組みの選択は、災害復旧計画(DRP)に反映されます。
制御措置は、事象の発生を防止することを目的とした制御、望ましくない事象を検出または発見することを目的とした制御、および災害や事象の後にシステムを修正または復旧することを目的とした制御に分類できる。
これらの対策は文書化されており、いわゆる「DRテスト」を用いて定期的に実施されている。
災害復旧戦略は、事業継続計画から派生します。[ 27 ]次に、ビジネスプロセスの指標がシステムとインフラストラクチャにマッピングされます。[ 28 ]費用対効果分析により、どの災害復旧対策が適切かが明らかになります。ダウンタイムのコストと特定の戦略を実行するコストを比較すると、さまざまな戦略が理にかなっています。
一般的な戦略としては、以下のようなものがある。
予防策としては、以下のようなものが考えられます。

災害復旧サービス(DRaaS)とは、停電、機器の故障、サイバー攻撃、自然災害などのシナリオにおいて、災害復旧機能の一部または全部を実行するために第三者ベンダーと契約することである。[ 30 ]
ベストプラクティスに従うことで、クラウドホストシステムの災害復旧戦略を強化できます。 [ 31 ] [ 32 ] [ 33 ]
いくつかの規制枠組みでは、機密データを扱う組織に災害復旧機能を義務付けています。医療分野では、医療保険の携行性と説明責任に関する法律(HIPAA)のセキュリティ規則により、対象事業体およびビジネスアソシエイトは、緊急時対応計画基準の一部として災害復旧計画を策定することが義務付けられています(45 CFR 164.308(a)(7))。これには、データの損失を復元するための手順に加え、データバックアップ計画、緊急モード運用計画、緊急時対応手順の定期的なテストと改訂に関する要件が含まれます。[ 34 ]
2024 年 12 月にHIPAA セキュリティ規則を更新するための規則案通知(NPRM) では、障害発生後 72 時間以内に重要なシステムとデータを復旧するという義務付けを含む、大幅に拡大された災害復旧要件が提案されています。この規則案では、システム復旧順序の優先順位付けのための重要度分析、災害復旧計画の定期的なテスト、バックアップおよび復旧システムのための個別の技術的制御も要求されています。これらの要件は、米国の医療システム全体で数週間にわたって請求処理および支払いシステムを混乱させた2024 年の Change Healthcare サイバー攻撃などの大規模なインシデントの影響を受けています。[ 35 ]
金融セクターでは、連邦金融機関検査評議会(FFIEC)が、金融機関に対し、事業継続計画および災害復旧計画を維持・テストすることを義務付けており、事業機能の重要度に基づいて復旧時間目標に関する具体的な期待値を定めている。[ 36 ]
...冗長性とバックアップを提供する...
。…患者記録
…災害復旧業界は成長し、
サンガードは1978年に設立された。
サンガード…スリランカの未来。