1 ポイント 投稿者 GN⁺ 2025-02-12 | 1件のコメント | WhatsAppで共有
  • Backblazeは、2024年末時点で管理している305,180台のドライブのうち、データドライブ301,120台を対象に、Q4・年間・ライフタイム基準の故障率を比較した
  • 2024年Q4の集計では、基準未達の487台を除いた300,633台のハードドライブを対象とし、四半期AFRはQ3の1.89%からQ4の1.35%へ低下した
  • 2024年の年間表には298,954台のドライブと27モデルが残り、全体の年間AFRは2023年の1.70%から2024年の1.57%へ低下した
  • Seagate 24TBドライブ1,200台は2024年12月初旬の導入後、Q4末まで故障がなかったが、ドライブ日数が不足していたため年間・ライフタイム表には含まれなかった
  • ライフタイム基準AFRは2023年の1.46%から2024年の1.31%へ低下し、4TB Seagateドライブの移行完了が大きく影響した

集計対象と除外基準

  • 2024年12月31日時点で、Backblazeは合計305,180台のドライブを管理している
    • ブートドライブ: 4,060台
    • データドライブ: 301,120台
  • 統計では、データ保存用ハードドライブのQ4 2024、2024年年間、ライフタイム基準の**年率換算故障率(AFR)**を比較している
  • 表とチャートに含めるには、期間ごとの最低条件を満たす必要がある
    • 四半期: ドライブ数100台超、ドライブ日数10,000日超
    • 年間: ドライブ数250台超、ドライブ日数50,000日超
    • ライフタイム: ドライブ数500台超、ドライブ日数100,000日超
  • 除外対象には、現在プロダクションドライブと見なしていないテストドライブや、データポイントが不足しているモデルが含まれる
  • 表に載っていないドライブまで含めた全データは、BackblazeのDrive Stats pageから入手できる

Q4 2024 ハードドライブ故障率

  • Q4 2024の分析対象は、データドライブ301,120台のうち基準未達の487台を除いた300,633台である
  • 12月初旬に導入されたSeagate 24TB ST24000NM002Hは、Backblaze Vault 1基を満たす1,200台規模で、Q4末まで故障はなかった
    • このモデルは、20TB Toshiba、22TB WDCとともに20TB超の容量グループに含まれる
  • Q4に故障がなかったモデルは5つある
    • Seagate 24TB ST24000NM002H
    • HGST 4TB HMS5C4040ALE640
    • Seagate 8TB ST8000NM000A
    • Seagate 14TB ST14000NM000J
    • Seagate 16TB ST16000NM002J
  • 故障0件のモデルは、ドライブ数とドライブ日数が相対的に少ないため、解釈には注意が必要である
  • Q4全体のAFRはQ3の1.89%から**1.35%**へ低下した
    • すべてのドライブ容量グループでQ3より改善した
    • 20TB超ドライブが14,000台以上追加されたことが主な要因の1つである
    • 20TB超ドライブグループのQ4 AFRは0.77%だった

4TBドライブ置き換えと大容量化への移行

  • Q4に4TBドライブ数はさらに1,774台減少した
  • 残っている約4,000台の4TBドライブは、2025年Q1末までに姿を消す見込みである
  • 置き換え対象は、新たに導入される20TB、22TB、24TBドライブである
  • Q4に稼働していた4TBドライブで故障したのは1台だけであり、故障率の比較では20TB超ドライブのほうがより重要な観察対象となる

2024年の年間故障率

  • 2024年の年間表では、基準未達の9モデル、2,012台のドライブが除外された
  • 最終集計対象は298,954台のドライブ、27モデルである
  • 2024年には、基準を満たしたモデルのうち故障0件のモデルはなかった
  • Seagate 16TB ST16000NM002JはQ3に故障1件 בלבדを記録し、2024年AFRは**0.22%**にとどまった
  • データセンター技術チームは2024年中に53,337台のドライブを設置した
    • 年間勤務時間を2,080時間と仮定すると、1時間あたり26台を設置した計算になる
  • 2024年に新たに追加されたSeagate 24TBドライブ1,200台は12月初旬に設置され、年間・ライフタイム表に必要なドライブ日数を満たせなかった
  • 年間表に含まれなかったモデルは以下の通り
    • Seagate ST8000NM000A: 247台、22,684ドライブ日数、2024 AFR 0.84%
    • Seagate ST14000NM000J: 232台、19,696ドライブ日数、2024 AFR 1.32%
    • Seagate ST24000NM002H: 1,200台、18,000ドライブ日数、2024 AFR 0.00%

2022〜2024年の比較と容量別の傾向

  • 2024年の全体年間AFRは**1.57%**で、2023年の1.70%より低かった
  • 2025年も全体故障率は引き続き低下すると予想されるが、注視すべき容量グループはそれぞれ異なる
    • 8TBと12TBモデル: いずれも使用期間が5年を超えており、一般に5年以降は故障率が目に見えて増加する
    • 14TBと16TBモデル: 稼働3〜5年の中間年齢帯に近づいており、bathtub curveに従って故障率が徐々に上昇する可能性がある
    • 20TB、22TB、24TBモデル: bathtub curveの平坦区間に入り、この区間では故障率が最も低いはずである
  • 4TBと10TBドライブは、2024年末時点で台数が相対的に少なく、全体故障率への影響は小さかった
  • 8TBと12TBドライブは5〜8年使用された旧型ドライブである
    • 12TBは2021年の約1% AFRから、2024年には約3%まで上昇した
    • 8TBは四半期ごとの変動はあったが、同期間のトレンドラインはほぼ横ばいだった
  • 14TBと16TBドライブは、全稼働ドライブの**57%**を占める
    • 平均年齢は2〜4年
    • 低く安定した故障率を示すべき時期であり、実際にもその通りになっている
  • 22TBドライブは引き続き追加されている初期段階にあり、ドライブ群が安定した後のほうがAFRの方向性を把握しやすい
    • 現在のライフタイムAFRは1.06%である

メーカー別の故障率推移

  • HGSTのメーカートレンドラインは良くないが、Q4 2023までは全体平均以下、または平均並みだった
  • 2024年のHGSTの高いAFRは、2つの12TBモデルが主導している
    • HUH721212ALN604はQ1 2023から四半期AFR上昇の兆候を示している
    • HUH721212ALE604はQ3 2024から同様の傾向を示している
    • この2モデルを除くと、2024年のHGST AFRは0.55%である
  • Seagateの四半期AFRトレンドラインは、2022〜2024年の間に2.25%から2.0%へわずかに低下した
    • この期間にメーカーの中で低下傾向を示したのはSeagateだけである
    • 低下の一部はSeagate 4TBドライブの除去による影響とみられる
  • Toshibaドライブモデルの四半期AFRは、2022〜2024年の間**0.80%〜1.52%**の範囲で推移した
    • ほとんどの四半期は約1.2%付近だった
    • 個別のToshibaモデルで最も高い四半期AFRは1.58%だった
  • WDCモデルはToshibaと似た一貫性を示したが、毎四半期より低いAFRを記録した
    • 2022〜2024年のWDCモデルの四半期AFR範囲は0.0%〜0.85%だった
    • Q1 2022には、稼働中だったWDCドライブ12,207台の故障がゼロで、AFR 0.0%を記録した

ライフタイム基準統計とバックアップ警告

  • ライフタイム基準表では、基準未達の11モデル、2,736台のドライブが除外された
  • 最終集計対象は298,230台のドライブ、25モデルである
  • 全体のライフタイムAFRは2023年の1.46%から2024年の**1.31%**へ低下した
  • ライフタイムAFR低下の主な理由は、2024年に4TB Seagateドライブの移行が完了したことである
    • 2024年末時点で稼働中の4TB Seagateドライブは2台だけ残っていた
    • 2023年末までにこれらのドライブが累積した7,900万ドライブ日数と5,600件超の故障が、2024年のライフタイム表には含まれていない
  • ライフタイムAFR 1.50%以下のモデルだけを並べた表も提供されている
  • モデル別AFR値は十分なデータがあるため堅牢とみなせるが、ドライブ故障率は一般にbathtub curveに従い、例外も残っている
    • 4TB HGSTのように、古くてもほとんど故障しないモデルがある
    • あるモデルは良好でも、突然故障曲線が急激に上向くことがある
  • AFR 1%は、1年間で100台中1台が故障しうることを意味する
    • 個人ユーザーが1台しかドライブを持っていなくても、その1台が故障する可能性はある
    • 常にバックアップを用意し、テストしておくべきである

データ公開と担当者変更

  • 今回のレポートの表とチャート作成に使われた完全なデータセットは、Hard Drive Test Dataページで提供されている
  • データは無料でダウンロードして利用できる
    • 利用時にはBackblazeを出典として明記する必要がある
    • データ利用方法に関する責任は利用者にある
    • データ自体を販売してはならない
  • 過去10年間Drive Statsレポートを作成してきた担当者は、今回のレポートを最後に引退する
  • Q1 2025レポートからはStephanie DoyleとDavid JohnsonがDrive Statsを引き継ぐ

1件のコメント

 
GN⁺ 2025-02-12
Hacker Newsのコメント
  • この10年間、Drive Statsレポートを読み続けてきたなんて、ほとんど信じられない

    • これらのレポートは購入判断にも役立ったが、データが与えてくれる最も重要な教訓も教えてくれた。つまり、データは確率の高いパターンを示すだけで、特定の結果を保証するものではないということ
      行動する前のデータには固有の価値はなく、行動した後でも望む結果を保証してくれるわけではない。10年にわたる素晴らしい統計と教訓に感謝し、引退後も楽しく「resilvering」してほしい
    • 本当に素晴らしく、高い基準を示してくれた
  • ベストプラクティスではないが、この10年間ホームサーバーをOS用の小型高速ドライブと、Backblaze Drive Statsを見て選んだ大容量単一ディスクで運用してきて、まだ故障はなかった
    Backblazeの手法は信頼しており、消費者の立場から非常に価値のある資料だと思う。最近のドライブはWDC WUH722222ALE6L4 22TiBだったが、数か月分のデータしかないとはいえ、今回のレポートにあるWDC全体の傾向を見ると、次の交換時期までは大丈夫そうで安心した

    • この統計はある程度割り引いて見る必要がある。ハードディスクの信頼性は個別モデルよりも生産バッチに左右されるのではないかと、ますます確信するようになった
      同じバッチで買ったドライブが何台も故障したという話をオンラインでよく見る。Backblazeの調達パターンは知らないので証明はできないが、一覧ではかなり良さそうに見えたST16000NM001Gを買ったものの、1年以内に故障した。ハードディスクやストレージ機器については、ソフトウェアRAIDとバックアップでダウンタイムに備え、壊れるなら保証期間内に壊れてくれたほうがよい
    • この10年間で複数のドライブを運用してきたが、故障はなかった。ただしBackblazeの統計を見て買ったのではなく、単に一番安いものを買っていた
      信頼性が多少高くなって総保有コストが下がる効果があるとしても、せいぜい10%前後なら、「最高」のドライブに付く値引きのなさで相殺されると考えたからだ。n=1の逸話の問題は、良い助言に従った結果なのか、単に運が良かっただけなのか分からない点にある
    • 注意が必要。WDC WUH722222ALE6L4は22TBであって22TiBではない
      ディスクのマーケティングでは今でも10進単位が使われ、TiBは2進単位だ。22TBはおよそ20TiBである
    • 単一ドライブだからといって安心してはいけない。1サイクルごとにストレージ用ドライブが故障する確率が約5%、OSドライブもまた5%ほどあるかもしれず、かなり大きなリスクだ
      この場合、リファービッシュのWUH721414ALE6L4を3台そろえても総額はほぼ同じになる。これをRAIDZ1で組めば28TBが得られ、単一デバイスに期待できるレベルの信頼性に近づく。もちろんバックアップは依然として重要だが、それは別の話題だ
    • 既に承知しているだろうが、どんな形であれRAID用ドライブをもう1台追加することを検討する価値はある。普通はデータそのものを復旧するより、RAIDを再構築するほうがはるかに簡単だ
      ここでいう「どんな形であれ」とは、ハードウェアでもソフトウェアでもという意味だ
  • 過去24か月のあいだ、大きなraidz3プールでSeagate ST12000NM001G 12TB SATAドライブを17台使ってきたが、シリアル番号の先頭3〜4文字ごとの個人統計はこうだった。ZLW2は8台中5台故障、ZL2は4台中1台、ZS80は2台中1台、ZTNは2台中0台、ZLW0は1台中0台
    すべてリファービッシュドライブで、2台はSeagate eBayストア、残りはServerPartDealsで購入した。ServerPartDealsで買った15台のうち7台が故障し、そのうち少なくとも4台は設置後6週間以内に故障した。最初にストレージプールを構成するドライブを選ぶときはBackblazeの統計を参考にしたが、更新された統計が受信箱に届くたびに表を確認して、自分のドライブが本当にBackblazeが年間故障率0.99%と言っていた001Gなのか見直すようになった。結局のところ、結果は人それぞれだ

    • リファービッシュ品は信頼性がひどいことが多い。5年保証をうたっていても、交換品として戻ってくるドライブの品質も良くない
    • 衝撃は機械式ハードディスクの寿命に大きく影響しうる。ServerPartDealsのドライブは、調達・取り扱い・配送のされ方によって損傷していた可能性もある
    • Backblazeがリファービッシュ品を買っているとは思えない
  • 以前はこの統計が興味深く、次のHDD購入の参考になると思っていたが、結局のところ最近は信頼性がそこそこ良いブランドを選ぶためにしか使っていないと気づいた
    今やブランドは実質3つしかなく、統計の大半は旧モデルなので、Backblazeがたまたま使っていたのと同じバッチの中古ドライブを買うときくらいしか主な用途がない。異なる販売元から2台買ってRAIDを組むか、定期的なオフサイトバックアップを行うほうがよい

    • RAIDはバックアップではない。両方必要だ
    • ミラーリングRAIDは悪くないが、今では他のRAIDレベルの価値は微妙だ
      理想を言えば、ビット腐敗を検出するためにスクラビングと修復ができるソフトウェアRAIDやファイルシステムを使うのがよい。あるいは、同じことができてエラー訂正をOSに通知できるハードウェアソリューションが必要だ。いつものことだが、RAID系ソリューションは主に可用性を高めるためのもので、バックアップはまったく別の問題である。複数の場所にたくさんのコピーを置くことに勝るものはない
  • WDCとToshibaの数字を見ると反論しにくく、それに比べるとSeagateの数字はかなり気まずい
    HGSTドライブは素晴らしかったが、今ではWDC傘下のレガシードライブだ。かなり前からWDの一部であり、新モデルはWDCブランドで出ている

    • この3年間で、多くの中古Seagateドライブが新品のように再販売されていた。暗号資産マイニングに使われた後、SMART値が「新品」のように使用時間0へ消去されていたケースだ
      https://www.heise.de/en/news/Hard-disk-fraud-Increasing-evid...
    • Seagateはモデルやバッチによって当たり外れが非常に大きいようだ
  • 10年以上前に現在の24ベイNASを組み始めたとき、当時出始めたBackblazeのドライブ統計を見て、どのドライブを買うか決めた。選んだのは4TB 7200rpmのHGSTドライブだった
    個人的なLouwrentius統計では、10年以上にわたってドライブ故障は0件だ。一方で、Backblaze Drive Statsの執筆者であるAndy Kleinが引退するとのことで、感謝するとともに今後の健勝を祈りたい。付け加えると、自分の24ドライブNASのデータが今では最新の32TBドライブ2台に収まるというのは驚きだ

  • Backblazeはストレージ業界で最も敬意を集めるサービスの1つであり、自分のクラウドストレージソリューションを立ち上げてからは、その敬意がさらに大きくなった

  • 昔のNVRでハードディスクが何台か故障したあと、こそがハードディスク最大の敵だと気づいた
    そのNVRはPoEカメラに給電し、動画のトランスコーディングを行い、ディスクへ継続的に書き込みもしていたため、かなり発熱していた。おそらく熱のせいでディスクが歪み、ヘッドが表面に衝突してデータ損失が起きたのだと思う。新しいNVRではPoE給電を電源内蔵スイッチに分離し、新しいCPUがハードウェア動画エンコードを処理し、一次記録にはSSDを使い、ハードディスクは二次バックアップに回した。発熱は大きく減り、今のところ問題なく動いている。SSDへの継続的な再書き込みが好ましくないのは分かっているが、SSDの平均故障時間を見れば故障までは数年かかるはずなので、受け入れ可能なリスクだ

    • それはNVRメーカーのシャーシ設計がかなり悪かったのだと思う。平均的な最新の3.5インチ大容量HDDは、そこまで大きな熱を出さない
      データセンター向けHGSTドライブでも平均で約5.5W、最大負荷時の熱設計電力でも7.8W程度だ。比較的低速で静かな120mmまたは140mmの12V DCファンで空気を通し、6〜8台のハードディスクを冷やすケースを設計するのは難しくない。低消費電力CPUを載せたミドルタワーのデスクトップPCケースをNASとして使う場合でも、背面の140mmファン1基で前から後ろへ空気を引き抜くだけで、3.5インチHDD 8台を十分に冷却できることが多い。それなのに、機器設計者があまりに小さな空間へ詰め込み、換気不足にしてしまうことが相変わらず多い
  • 毎年このレポートは、技術系の潜在顧客に向けたBackblazeの見事なブランドPRのように見えるし、業界にとっても有益なサービスになっている
    オープンソースコード以外で、ほかに似たような事例が何かあるのか気になる

    • こういうのはコンテンツマーケティングと呼ばれ、たいていHNのトップページには常にいくつか載っている
      ただしBackblazeのドライブ統計記事は、この手法でよく見かけるものよりはるかに手間がかかっていて、品質基準も高い
    • TechEmpowerという会社が定期的にWebフレームワークベンチマークを実行し、見やすいダッシュボードで結果を共有していた。なぜ止まったのかはよく分からない
      https://www.techempower.com/benchmarks/#hw=ph&test=fortune&s...
      iFixItの分解記事も情報コンテンツとしてかなり良い: https://www.ifixit.com/Teardown
      LumafieldのCTスキャンもある: https://www.scanofthemonth.com/
    • 例えばデータベースベンチマークのhttps://github.com/ClickHouse/ClickBenchがあり、30以上のデータベースを含んでいる。新しいJSON解析ベンチマークはhttps://github.com/ClickHouse/JSONBench/にある
      ハードウェアベンチマークもある: https://benchmark.clickhouse.com/hardware/ これはPhoronixでも使われている
    • Backblazeがこれを始めた当初は、データを共有し、ほかの場所でもそうなってほしいという意図があった
      あちこちでそうした兆しは見えるが、いまでも自分たちで続けるのは楽しく、Networking Statsや今後公開される追加コンテンツへと拡張中だ。この統計がインフラ配備にどう反映されるかも扱う予定なので、興味深い内容になりそうだ
    • Benson LeungのUSBケーブル運動を思い出す。Jim Gettysが事実上の引退状態から出てきて、皆にバッファブロート(Bufferbloat)を教えてくれたことも思い出す
  • 毎年これを見るのは良いことだ。ただ、無料だと分かっていながら少しだけ惜しいと思うのは、単に「電源が入っていた」だけでなく、実使用量の指標もあわせて見たいということだ
    ドライブがどれだけ長く、どれだけ頻繁に使われたのか、たとえば読み書き回数やバイト/秒が分からないと、HDDの年間故障率はあまり意味を持たない。すべてのドライブが1年中99%の使用率だったのなら、そのときは納得できる

    • 詳しくは言えないが、これらのドライブのI/Oはかなり一貫して高い水準で維持されていると理解している
      Backblazeが、再構築時間や高密度ドライブがより大きな酷使に耐えられない点のために、より小容量のドライブを使い続けるべきか悩まなければならないほどだ