システム障害の対応フローと再発防止策

「朝出社したら、受注システムにログインできない」「月末の締め処理が途中で止まってしまった」。業務システムの障害は、ある日突然起こります。そのとき、誰に連絡し、何を優先し、どう業務を続けるのかが決まっていないと、現場が混乱し、復旧までの時間も長引いてしまいます。
この記事では、システム障害とは何かを整理したうえで、障害発生から復旧・報告までの対応フロー、発注者と保守会社の役割分担、そして同じ障害を繰り返さないための再発防止策までを、発注者目線で解説します。
- 障害対応は検知→初動→切り分け→復旧→報告→再発防止の流れで進める
- 最優先は原因究明ではなく業務の再開。暫定対応と恒久対応を分けて考える
- 発注者側は影響範囲の把握と社内への連絡、業務の代替手段を担う
- 再発防止は障害報告書で原因と対策を記録し、実行状況を追うことが重要
目次
システム障害とは?
システム障害とは、システムが本来の機能を果たせなくなり、業務に支障が出ている状態のことです。システムが完全に止まる場合だけでなく、処理が極端に遅くなる、一部の機能だけが使えない、誤ったデータが出力されるといった状態も障害に含まれます。
障害の主な原因
| 分類 | 主な原因の例 |
|---|---|
| ハードウェア | サーバーのディスク故障、電源トラブル、ネットワーク機器の故障 |
| ソフトウェア | プログラムの不具合、更新プログラム適用後の不整合 |
| 容量・性能 | ディスク容量の不足、アクセス集中による処理遅延 |
| 人的ミス | 設定の誤り、誤ったデータの登録や削除、作業手順の漏れ |
| 外部要因 | クラウドサービスや回線事業者の障害、サイバー攻撃 |
原因はさまざまですが、どの場合でも対応の基本的な流れは共通しています。流れを事前に決めておくことが、復旧までの時間を短くする最大のポイントです。
システム障害の対応フロー
障害が発生したときは、次の流れで対応を進めます。
- 検知・受付利用者からの連絡や監視の通知で障害に気づき、発生時刻と症状を記録する
- 初動対応社内の窓口担当者が保守会社に連絡し、影響範囲(誰が・どの業務で困っているか)を確認する
- 重要度の判断業務への影響の大きさから障害のレベルを判断し、対応の優先度と社内への周知範囲を決める
- 切り分け・暫定対応原因の範囲を絞り込み、再起動や一時的な回避策でまず業務を再開させる
- 恒久対応根本原因を特定し、プログラムの修正や設定の見直しなど本格的な対策を行う
- 報告・振り返り障害報告書を作成し、原因と再発防止策を関係者で共有する
暫定対応と恒久対応を分ける
障害対応で大切なのは、原因の究明よりも先に業務を再開させることです。原因がはっきりしなくても、再起動や別の手順での回避で業務を続けられるなら、まずそれを優先します。そのうえで、落ち着いてから根本原因を調べ、恒久的な対策を行います。
暫定対応
- 目的は業務の早期再開
- 再起動、処理の手動実行、代替手段への切り替えなど
- 数分〜数時間で行う
恒久対応
- 目的は同じ障害の再発防止
- プログラムの修正、設定の見直し、機器の交換など
- 数日〜数週間かけて行う
発注者と保守会社の役割分担
障害対応は保守会社に任せればよいと思われがちですが、発注者側にしかできない役割もあります。
| 役割 | 発注者(社内) | 保守会社 |
|---|---|---|
| 検知・連絡 | 利用者からの連絡を集約し、保守会社へ連絡 | 監視による検知、受付 |
| 影響範囲の把握 | どの業務・取引先に影響するかを判断 | どの機能・データに影響するかを調査 |
| 業務の継続 | 手作業などの代替手段で業務を回す | 暫定的な回避策の提示 |
| 原因調査・修正 | 発生状況の情報提供 | 原因の特定と修正 |
| 社内外への説明 | 社内・取引先・顧客への連絡 | 報告書の作成と技術的な説明 |
特に「業務の継続」は、発注者側で事前に考えておく必要があります。システムが止まっても最低限の業務を続けられるよう、紙の伝票やExcelで一時的に対応する手順を用意しておくと、障害時の損失を抑えられます。
- 緊急連絡先の一覧:保守会社の連絡先、受付時間外の連絡方法、社内の責任者
- システム構成の概要:どのサーバーやクラウドで動き、どのシステムと連携しているか
- 業務の代替手順:システムが止まったときに手作業で最低限の業務を続ける方法
- 重要度の判断基準:どんな状態なら緊急扱いにするかの基準
障害報告書と再発防止策
障害が復旧したら、それで終わりにせず、障害報告書で原因と対策を記録します。報告書は、同じ障害を繰り返さないための材料であり、保守会社との認識を合わせるための資料でもあります。
障害報告書に記載する項目
再発防止策の考え方
再発防止策は、「今後注意する」のような心がけではなく、仕組みで防ぐ対策を考えることが大切です。
たとえば、ディスク容量の不足が原因なら「容量の監視と警告を設定する」、作業ミスが原因なら「作業手順書とダブルチェックを導入する」「誤操作できないように画面を改修する」といった対策が考えられます。対策を決めたら、実施されたかどうかを定例会などで確認し、やりっぱなしにしないことが重要です。
障害が頻発する場合は、システム自体の老朽化やブラックボックス化が根本原因になっていることもあります。その場合は、個別の対策だけでなく、システム全体の見直しも検討しましょう。
平時に準備しておきたいこと
障害対応をスムーズに進めるためには、障害が起きていない平時の準備が欠かせません。次のような取り組みを、保守会社と相談しながら進めておきましょう。
- 障害対応の訓練:年に1回程度、連絡網や代替手順を実際に試し、手順書の古い部分を見直す
- バックアップからの復元テスト:バックアップが取れていても復元できなければ意味がないため、実際に戻せるか確認する
- 監視の設定:サーバーの稼働状況やディスク容量、処理の失敗を自動で検知し、通知されるようにする
- 障害履歴の蓄積:過去の障害報告書を一か所にまとめ、同じ傾向の障害が増えていないかを確認する
こうした準備は、障害が少ない時期ほど後回しにされがちです。保守会社との定例会などで、障害対応の手順や連絡先に変更がないかを定期的に確認する時間を設けると、いざというときに慌てずに済みます。特に担当者の異動や退職があった場合は、連絡網の更新を忘れないようにしましょう。
よくある質問
- システム障害が起きたら、まず何をすべきですか?
- 発生時刻と症状を記録し、社内の窓口担当者から保守会社に連絡します。同時に、どの業務や取引先に影響が出ているかを確認し、必要に応じて手作業などの代替手段で業務を続けましょう。
- 障害の原因が分かるまで業務を止めるべきですか?
- 多くの場合、原因の究明より業務の再開を優先します。再起動や回避策で業務を続けられるなら、まず暫定対応で再開し、その後に根本原因を調べて恒久対応を行います。
- 障害報告書は必ず作成してもらうべきですか?
- 業務に影響した障害については、作成してもらうことをおすすめします。原因と対策を記録しておくことで、再発防止策の実行状況を確認でき、保守会社との認識のずれも防げます。
- 障害を減らすために発注者ができることはありますか?
- 保守契約に予防的な作業(更新の適用、容量の監視など)を含めること、障害報告書の再発防止策が実行されたかを確認することが効果的です。障害が頻発する場合は、システムの老朽化も疑いましょう。
まとめ
システム障害への対応は、検知から初動、切り分け、復旧、報告、再発防止までの流れを事前に決めておくことで、復旧までの時間と業務への影響を大きく減らせます。障害時は原因究明よりも業務の再開を優先し、暫定対応と恒久対応を分けて進めましょう。発注者側は影響範囲の把握と業務の代替手段を担い、障害報告書で再発防止策の実行を確認することが大切です。
この記事に関連するサービス
システムリプレイス
老朽化したシステムやサポートが終わるシステムを新しく置き換えます。仕様書がないシステムも、画面・データ・プログラムの解析から対応し、段階的な移行で業務を止めずに切り替えます。 サービスの詳細を見る



