【障害経過のご報告】zezeノードのストレージ障害によるデータ消失について

Top > 最新情報一覧 > 【障害経過のご報告】zezeノードのストレージ障害によるデータ消失について

掲載:2026年10月8日

このたび、弊社ストレージサービスの一部ノード(zeze.teracloud.jp、以下「zezeノード」)において、保存されていたお客様のデータが消失する重大な障害が発生いたしました。

2026年9月にご報告したkitaノードの障害に続き、再び同様の事態を招いてしまったことを、深くお詫び申し上げます。

本ページでは、何が起きたのか、その技術的な背景と原因、今後の対応について、ご説明いたします。

対象ノードzezeノード(zeze1ストレージプール)
影響を受けるユーザー上記ノードにデータを保存されていたユーザー
障害発生日2026年10月1日(JST)〜

本障害の影響は、zezeノードに限られます。それ以外のノード、サービスをご利用のお客様には影響なく、通常どおりご利用いただけます。

ご自身が影響対象かどうかは、ファイルブラウザーのアドレス欄またはWebDAV接続URLにてご確認いただけます。

障害発生以降の経過は、「zezeにおける障害発生のお知らせ」でもご案内しています。

1. 何が起きたのか

2026年10月1日未明、お客様のデータを保存していたzezeノードで、ハードディスク(以下「ディスク」)1台が故障し、それをきっかけにデータの破損が発生しました。

このストレージは、ディスク11台をZFSのRAIDZ3という構成で運用しておりました。RAIDZ3は、パリティ(復元用の予備情報)を三重に持ち、最大3台のディスクが同時に失われてもデータを復元できる方式です。

故障したディスクはストレージから切り離され、ストレージは残る10台で運転を続けました。ここまでは、RAIDZ3が想定する範囲内の出来事です。

しかし、故障の前後から、故障したディスクと同じ制御カード(HBA、ディスクをサーバーにつなぐ部品)につながる別のディスクでも、命令に応答しない状態が起きていました。そして、一部のデータで、RAIDZ3でも復元できない破損が見つかりました。RAIDZ3で復元できなくなるのは、同じデータの4か所以上が同時に壊れた場合です。

10月1日の時点で読み出せなくなったファイルは61件でした。その中にサービスを動かすためのシステムファイルが含まれていたため、この時点でサービスを提供できない状態になりました。

なお、このとき残る10台のディスクすべてが「不調(DEGRADED)」と表示されましたが、これは10台が同時に故障したことを意味するものではありません。ZFSは、復元できないデータを読もうとすると、どのディスクの内容が壊れているのかを特定できないため、すべてのディスクにエラーを記録します。この記録が基準の数を超えたことで、すべてのディスクに「不調」の判定が付いたものです。

翌10月2日、同じ制御カードにつながるディスク3台が相次いで利用できなくなりました。最初の1台と合わせて4台が欠け、RAIDZ3が耐えられる3台を超えたため、ストレージ全体が読み出せない状態に至りました。

2. 障害対応の経過

日時(JST)内容
10/1 01:43制御カード(HBA)につながるディスクで、命令に応答しない状態が発生
10/1 01:45ディスク1台が故障し、ストレージから切り離し。以後、残る10台で運転を継続
10/1 01:53監視システムが異常を通知。弊社エンジニアがディスク1台の故障を確認したものの、この時点ではデータの読み出しエラーがなく、サービスへの影響はないと判断
10/1 06:36対応を開始。サービスを動かすためのシステムファイルが読み出せず、サービス異常を確認
10/1 07:06被害の拡大を防ぐため、サービス環境を停止
10/1 08:15データを一括で転送する方法では救出できないことを確認。新しいノードを用意し、読み出せるデータを個別に救出する方針を決定
10/1 08:15「zezeにおける障害発生のお知らせ」を掲載
10/1 14:03記録の解析から、制御カードに問題がある可能性が高いと判断
10/1 16:48〜19:06データセンターにて、制御カードへの対処とファームウェアの更新を実施
10/1 20:35お知らせに続報を追記
10/2 昼頃追加で2台のディスクが応答を失い、計3台が離脱。RAIDZ3が持つ3台分の冗長性を使い切り、ストレージが停止(SUSPENDED)
10/2 13:51新しいノードに、zezeノードのお客様向けの新しいデータ領域を用意する方針を確定
10/2 14:40お知らせに続報を追記
10/2 17:17データセンターにて、交換用ディスクの取り付けを実施
10/2 19:214台目のディスクが利用できなくなり、ストレージ全体が読み出せない状態(UNAVAIL)に
10/2 21:03データの取り出しはほぼ不可能と判断し、全損を前提とした対応に切り替え
10/3 00:16お知らせに続報を追記
10/8障害の技術的な背景、原因、被害状況、今後の対応についてまとめた本ページを公開

※ SUSPENDED(停止)は、ストレージが読み書きを止めた状態を指します。UNAVAIL(利用不可)は、必要な台数のディスクがそろわず、ストレージ全体を開けない状態を指します。

3. 被害の状況

現時点(10/8)で、zezeノードのストレージは全体が読み出せない状態にあり、保存されていたデータを確認することができません。

弊社では、zezeノードに保存されていたデータは全損したものとして対応を進めております。

4. 原因について

原因の調査は継続中です。

以下では、記録から確認できている事実と、そこからの推定を分けてご説明します。内容は、今後の調査により更新する可能性があります。

確認できている事実

誘引(障害を引き起こした直接のきっかけ)

ディスク1台の内部故障を引き金として、同じ制御カードにつながる複数のディスクが同時に不安定になったと考えています。制御カードは、応答しなくなったディスクに対して、命令の中止やリセットといった回復処理を行います。この回復処理が、同じカードにつながる他のディスクの処理にも影響したと見ています。

素因(影響を拡大させた背景)

素因として、次の二点を考えています。

一つは、ディスクの接続の配置です。RAIDZ3は3台までの同時故障に耐えますが、11台中6台が1枚の制御カードに集中していました。そのため、カード1枚の不調が、RAIDZ3の許容範囲を超える台数のディスクに同時に及び得る配置になっていました。

もう一つは、制御カードのファームウェアです。古い版のファームウェアのエラー回復処理に不具合があり、それが影響の拡大に関与した可能性を調べています。

当社において本発表の段階で、10月2日に利用できなくなった3台については、制御カード側の問題とディスク側の問題の両方の可能性が考えられますが、複数のディスクが共通して接続されていた制御カード側を第一の確認対象として、今後の再発防止策を検討しております。

5. 再発防止・対応策

同様の障害を繰り返さないため、以下に取り組みます。

同型の制御カードを使う全ノードの点検

他のノードで同じ型の制御カードとファームウェアが使われていないかを点検し、該当する場合は緊急メンテナンスとして、ファームウェアの更新や部品の交換を行います。被害の拡大を防ぐため、この点検を最優先で進めております。

ディスクの接続配置の見直し

制御カード1枚やケーブル1本の不調が、RAIDZ3の耐えられる3台を超えるディスクに同時に及ばないよう、各ノードのディスクの接続配置を見直します。

Cephによる多重化への移行

ストレージ基盤をCephと組み合わせた仮想基盤構成へ移行し、複数の筐体をまたいでデータを多重化する方針です。今回の障害では、データの冗長性が1台の装置の中に限られていたため、その装置内部の部品の不調が複数のディスクに影響し、許容範囲を超えてデータが失われる結果となりました。複数の筐体にまたがってデータを多重化することで、1台の装置に障害が発生した場合でも、データを維持できる構成を目指します。

6. 今後の対応

前述のとおり、弊社ではデータは全損したものとして対応を進めております。お客様のデータを復元・救出できない可能性が高いことを、あらかじめご了承いただきますようお願い申し上げます。

このたびは、お客様の大切なデータをお預かりする立場でありながらこのような事態を招いてしまい、重ねて深くお詫び申し上げます。

お問い合わせ

本件に関するお問い合わせは、以下の窓口までご連絡ください。