予測障害解析( PFA ) とは、システムまたはコンポーネント (ソフトウェアまたはハードウェア) の差し迫った障害を予測し、障害の問題を回避または対処するメカニズムを有効にしたり、障害が発生する前にシステムのメンテナンスを推奨したりすることを目的とした手法を指します。
たとえば、修正されたエラーの傾向を分析してハードウェア/メモリ コンポーネントの将来の障害を予測し、その障害を回避するメカニズムを積極的に有効にするコンピュータ メカニズムなどです。予測障害分析は、もともとハード ディスク ドライブの障害の可能性を監視するIBM独自のテクノロジを指す用語として使用されていましたが、現在では CPU、メモリ、I/O デバイスの差し迫った障害を判断するさまざまなテクノロジを指す一般的な用語として使用されています。[1]ファースト フェイル データ キャプチャも参照してください。
ディスク
IBM は1992 年に 0662-S1x ドライブ ( 5400 rpmで動作する 1052 MB Fast-Wide SCSI-2ディスク) に関連してPFAという用語とそのテクノロジーを導入しました。
この技術は、ヘッドの浮上高など、ドライブ ユニットのいくつかの重要な (主に機械的な) パラメータを測定することに依存しています。ドライブファームウェアは、測定されたパラメータを事前定義されたしきい値と比較し、ドライブの健全性状態を評価します。ドライブがすぐに故障する可能性があると思われる場合、システムはディスク コントローラに通知を送信します。
この技術の主な欠点は次のとおりです。
- バイナリ結果 - ホストに表示される唯一のステータスは通知の有無でした
- 一方向通信 - ドライブファームウェアが通知を送信する
このテクノロジーは IntelliSafe と統合され、自己監視、分析、レポート テクノロジー(SMART) を形成しました。
プロセッサとメモリ
ECCによって修正されたRAMの断続的なエラーの数が多いと、将来のDIMM障害を予測できる[2]ため、メモリとCPUキャッシュの自動オフライン化を使用して将来のエラーを回避できます[3]。たとえば、Linuxオペレーティングシステムでは、mcelogデーモンが過剰な修正を示すメモリページを自動的に使用から削除し、過剰なキャッシュ修正可能なメモリエラーを示すプロセッサコアを使用から削除します[4] 。
光学メディア
光学メディア(CD、DVD、Blu-ray)では、 QpxToolやNero DiscSpeedなどのソフトウェアを使用して修正可能なデータエラーの割合を測定することで、メディアの劣化による障害を予測し、データ損失が発生する前に製造品質の低いメディアを検出できます。ただし、すべてのベンダーと光学ドライブモデルでエラースキャンがサポートされているわけではありません。[5]
参考文献
- ^ Intel Corp (2011). 「Intel Xeon プロセッサー E7 ファミリー: 次世代 RAS サーバーのサポート。ホワイト ペーパー」。2012 年5 月 9 日閲覧。
- ^ Bianca Schroeder、Eduardo Pinheiro、Wolf-Dietrich Weber (2009)。「DRAM エラーの実態: 大規模フィールド調査。Proceedings SIGMETRICS、2009」。
- ^ タン、アーラサーズ、トタリ、シャピロ (2006)。 」「ハードウェア障害に対するシステム RAS に対するメモリ ページ リタイアメントの影響の評価」、2006 年国際ディペンダブル システムおよびネットワーク カンファレンスの議事録。
{{cite news}}: CS1 maint: 複数の名前: 著者リスト (リンク) - ^ 「mcelog - ユーザー空間でのメモリエラー処理。Linux Kongress 2010」(PDF)。2010 年。
- ^ dosc 品質スキャン ソフトウェア QPxTool でサポートされているデバイスのリスト
参照
- MCELog - 予測障害分析のための x86 マシン チェックを処理する Linux デーモン
