![]()
一、35万块硬盘的体检报告,刚出炉
有人把硬盘当消耗品,有人把硬盘当传家宝。有家公司把这两件事同时干了十三年。
Backblaze 是做云存储的,从 2013 年开始,每季度公开一次自家机房里所有硬盘的健康情况:哪块坏了、哪块还在跑、跑了多少天。这是全球规模最大的公开硬盘可靠性数据集,完整 CSV 免费下载,入口就在 backblaze.com/drivestats。
2026 年 9 月 29 日,最新一期发布。统计范围是 354,415 块在役硬盘,覆盖 4 月 1 日到 6 月 30 日,累计 3155 万个"盘天",期间坏掉 1498 块。折算成年化故障率,1.73%。
这是近几年最高的一次,上一季度只有 1.24%。但真正被反复讨论的不是这个总数,而是另一件事——坏得最狠的那批盘里,有一款现在还在全新出售,而且下单的人不少。
二、1.73% 怎么算出来的,你自己就能验
先说口径。AFR 的公式极简:故障数 ÷ 盘天数 × 365。之所以要乘 365,是因为各型号服役时长不一样,必须折算成"一年里有多大比例的盘会坏",才能横向比较。
Backblaze 给的是两张表,别混着看:
口径
盘数
累计盘天
故障数
年化故障率
2026 Q2 单季
354,415
31,553,350
1,498
1.73%
2013 年至今终身
353,041
558,148,607
21,609
1.41%
单季 1.73%,十三年累计 1.41%。季度数字波动大,终身数字稳。终身值几乎没动,说明这季度的问题出在个别老型号身上,不是整批盘集体变坏。
这两行数字不需要信任任何人,拿公式一算就对得上:
def afr(failures, drive_days): """年化故障率 = 故障数 / 盘天数 * 365""" return failures / drive_days * 365 * 100print("Q2 2026 单季 : %.2f%%" % afr(1498, 31_553_350))print("2013 起终身 : %.2f%%" % afr(21609, 558_148_607))输出:
Q2 2026 单季 : 1.73%2013 起终身 : 1.41%官方给异常型号划了一条 6.95% 的线,本季有三款突破:
型号
容量
在役盘数
单季年化故障率
Seagate ST10000NM0086
10TB
965
9.33%
Seagate ST14000NM0138
14TB
1,235
8.26%
HGST HUH721212ALN604
12TB
9,694
7.63%
这三款的共同点是老。其中两款服役接近七年和八年半,剩下一款也早已停产。
单季数字容易被偶然性带跑,把时间拉长看更准。有第三方按 2021 年至 2026 年 Q2、共 22 个季度的合格数据重新聚合过一遍,得出的是这样一张长期榜:
型号
容量
合格季度数
合并年化故障率
WDC WUH721414ALE6L4
14TB
22
0.545%
Seagate ST16000NM001G
16TB
22
0.673%
Seagate ST12000NM001G
12TB
22
1.010%
Toshiba MG07ACA14TA
14TB
22
1.079%
Seagate ST12000NM0008
12TB
22
2.296%
HGST HUH721212ALN604
12TB
22
3.105%
Seagate ST10000NM0086
10TB
22
4.858%
Seagate ST14000NM0138
14TB
22
5.884%
要说明的是,这一列是第三方按 22 个季度自行聚合的结果,不是 Backblaze 官方公布的终身值,两者口径不同,别混用。
这张表的价值在于它区分了"偶尔摔一跤"和"一直摔"。ST14000NM0138 长期 5.88%、ST10000NM0086 长期 4.86%,都不是本季突发,而是连续二十多个季度稳定地差。真要避坑,避的是这种。
三、零故障这三个字,含金量能差 270 倍
本季度被官方点名表扬的是四款盘,全部来自希捷:ST8000NM000A 8TB 在 239 块里坏 0 块,ST12000NM000J 12TB 在 1,079 块里坏 0 块,ST14000NM000J 14TB 在 497 块里坏 0 块,ST16000NM000J 16TB 在 171 块里坏 1 块。
看上去希捷这一季赢麻了。把样本量摆上桌,结论立刻翻转。
239 块盘一个季度没坏,到底能说明什么?用泊松分布算 95% 置信上界——59.6 个"盘年"里观测到 0 次故障,真实年化故障率的上界是 5.03%。意思是这款盘的故障率可能是 0,也可能是 5%,比全队平均值高三倍,数据根本分不出来。
1,079 块那款就扎实得多,269 个盘年,上界 1.11%;497 块那款,上界 2.42%。
什么才算有说服力?看西部数据那款 22TB:45,665 块在役,累计 72,927 个盘年,样本量是上面最大那款的 271 倍,测出来的 0.58% 才是一个能拿来下结论的数字。
import mathdef upper_bound_zero(drive_years): """观测到 0 次故障时,真实故障率的 95% 单侧上界""" return -math.log(0.05) / drive_years * 100for name, cnt in [("ST8000NM000A 8TB", 239), ("ST12000NM000J 12TB", 1079), ("ST14000NM000J 14TB", 497)]: drive_years = cnt * 91 / 365 # 一个季度按 91 天折算 print("%-18s %5d 盘 = %6.1f 盘年 -> 上界 %.2f%%" % (name, cnt, drive_years, upper_bound_zero(drive_years)))输出:
ST8000NM000A 8TB 239 盘 = 59.6 盘年 -> 上界 5.03%ST12000NM000J 12TB 1079 盘 = 269.0 盘年 -> 上界 1.11%ST14000NM000J 14TB 497 盘 = 123.9 盘年 -> 上界 2.42%所以"零故障"从来不是结论,它是样本量问题。500 块盘零故障,证据强度远弱于 4 万块盘 0.6%。
另一半真相是:拉高本季故障率的主力是老盘。硬盘的故障曲线是浴盆形,早期坏一批,中间长期平稳,老了再坏一批,这批盘就处在浴盆的右侧。同一季度 Backblaze 还退役了两块服役接近十年的 HGST 老盘,一块 4TB 一块 8TB。十年——这不是"硬盘不耐用"的证据,恰恰相反,它说明选型的盘在机房里能跑满十年。
四、同为 24TB,一款 0.5%,一款 3.24%
真正值得掏钱的人盯住的,是这张表。
型号
容量
在役盘数
平均服役
故障数
终身年化故障率
Toshiba MG11ACA24TE
24TB
9,620
5.8 个月
23
0.50%
WDC WUH722222ALE6L4
22TB
45,665
19 个月
423
0.58%
Toshiba MG10ACA20TE
20TB
25,270
12.1 个月
202
0.79%
WDC WUH722626ALE6L4
26TB
7,212
3.4 个月
17
0.84%
Seagate ST24000NM002H
24TB
9,631
12.1 个月
323
3.24%
同为 24TB,希捷这款是东芝那款的 6.5 倍。
容量越大越容易坏?数据说的是反话。22TB、24TB、26TB 这几款恰恰是全队最低的一批,反倒是 8TB 到 14TB 的老型号在排队出事。按容量分级采购,等于把钱和稳定性一起扔掉。
不过要为 ST24000NM002H 说句公道话:它平均只服役了 12.1 个月,累计 364 万个盘天,历史比西数那款 22TB 短得多。3.24% 可能是早期批次问题,也可能随后续固件和批次调整降下来,需要再观察几个季度才能定性。但反过来讲,一款上市一年多、正在大规模出货的盘交出这个数字,下单前多看一眼不算多余。
落到具体动作上,三条是可执行的:
按型号买,不按品牌买。 同一个希捷,16TB 的 ST16000NM001G 是 0.68%,14TB 的 ST14000NM0138 是 5.88%,差八倍多。品牌忠诚度在这份数据里没有任何解释力。
看历史,别看单季。 一款盘要连续多个季度都有数据、样本在几千块以上,那个百分比才值得信。刚上架三个月、评论区一片"零故障"的新型号,等于没有数据。
二手企业级盘,先查型号再掏钱。 9.33% 那款 ST10000NM0086、8.26% 那款 ST14000NM0138,全新货早就停了,但翻新盘和拆机盘市场仍有流通。商家标注的"通电两万多小时、SMART 全绿"和这个型号本身的历史故障率是两码事——SMART 只能证明这一块现在没坏,证明不了这个型号靠不靠谱。
还有一件正在发生的事值得提前知道。这一期报告专门写了一章 SMR,也就是叠瓦式磁记录:把磁道像屋顶瓦片一样叠着排,同样大小的盘片能多塞 10% 到 25% 的容量。代价是它只在顺序、追加式写入的负载下表现好,随机改写会严重掉速,上层存储软件得跟着改。
Backblaze 现役机队里目前一块 SMR 盘都没有。但厂商为了冲 AI 训练需要的容量,往 SMR 走是大概率事件。真到了那一天,买盘前要确认的不只是型号和故障率,还有它到底是 CMR 还是 SMR——这两个字母的差别,在 NAS 里可能是能不能组阵列重建的区别。
五、98.3% 的盘不会坏,但没人知道是哪一块
这份报告说的是"一年里约 1.7% 的盘会坏"。反过来读,98.3% 的盘不会坏——可它没法告诉你坏的是不是你手里那块。
真正的安全感不是挑到那块不会坏的盘,是默认它一定会坏,然后提前把数据放到第二个地方。RAID 不是备份,这是硬件圈里最贵的一个误解。
说了这么多,你现在的 NAS 或者台式机里装的是哪一款盘?用几年了?评论区报一下型号,看看这批读者里谁的盘最扛造。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.