一、先说结论:RAID5掉两块盘,你只有两个正确动作

第一个动作是停机,第二个动作是找做恢复的人。中间所有操作——强制上线(Force Online)、重新插拔、初始化、重建(Rebuild)——每一个都可能把还能救的数据变成救不回来的数据。

这不是吓唬人。RAID5的容错只有一块盘。掉第一块盘时阵列进入降级(Degraded)状态,还能读写;掉第二块时阵列整体离线,所有数据在逻辑上已经“不可见”。这时候阵列里剩下的每一块盘都带着唯一一份校验信息的碎片,动错一步就是永久性破坏。

二、这次的情况:模具厂的设计数据,掉了两块盘

2026年8月26日下午,番禺石碁一家做注塑模具的厂子打电话过来,说服务器“滴滴响,屏幕全是红字”。电话里先让他们什么都别动,把型号报过来:Dell PowerEdge R730,PERC H730阵列卡,4块2TB西数RE4企业盘(WD2000FYYZ)做RAID5,装着SolidWorks图纸、CNC加工程序和近三年的订单扫描件,总数据量约3.2TB。

iDRAC里看到的状态是:Slot 1和Slot 3两块盘先后离线,虚拟磁盘(VD)状态Failed。坏消息在后面——厂里的IT兼职小哥前一天晚上已经在PERC管理界面里点过一次“Force Online”,把Slot 3强行拉回阵列,当时系统“恢复了”,用了一个上午,下午Slot 1又掉,然后整个阵列彻底认不出来,开机提示“No Foreign Configuration or PDs are not responding”。

强制上线的后果:Slot 3那块盘实际上是慢速故障(响应超时被踢出,不是彻底死),强行拉回来后阵列用它的数据做了部分写入,校验块(parity)被更新了一轮。也就是说,这块盘上的数据和另外两块好盘的数据在时间线上错开了。

三、恢复过程:四步,用了三天

第1步:全盘写保护镜像(第1天)。四块盘全部拆下贴标,用PC-3000 Data Extractor逐扇区镜像。Slot 3那块盘读到约68%的位置出现大量坏道(读取超时),镜像速度从120MB/s掉到2MB/s,最后用反向读取+跳跃读取的方式把能读的扇区都抠出来,镜像完整度约97.4%。这一步花了14个小时,不能快,快了就丢扇区。

第2步:确定盘的顺序和条带参数(第2天上午)。RAID5恢复最难的不是算法,是参数:盘序(哪块是0号盘)、条带大小(这台是128KB)、校验旋转方向(左对称)。用分析软件对镜像文件做熵值分析,结合文件系统(NTFS)的MFT位置反推盘序。这里踩了一个坑:因为客户强制上线过,直接按阵列卡里的盘序分析对不上MFT,试了四种排列组合,第三种(2-0-3-1)的MFT结构完整。

第3步:虚拟重组与校验修复(第2天下午)。在镜像层虚拟重组RAID5,不写回任何原盘。针对Slot 3镜像中损坏的1200余个区块,用其余三块盘的校验关系反算补齐——RAID5的好处就在这里,任意一块盘的数据可以用另外几块盘算出来。

第4步:导出验证(第3天)。先扫目录树:SolidWorks图纸目录完整,订单扫描件完整,有两台2019年的旧CNC程序目录出现文件名乱码(MFT记录损坏),手工按文件头特征扫描补捞,最终按文件类型恢复了其中约8成。数据导出到客户新买的2块4TB企业盘做镜像备份,导出用了11个小时。现场打开SolidWorks随机抽验30个装配体,28个正常打开,2个报“文件损坏”(对应坏道集中的区域),CNC程序用记事本抽验G代码完整。

四、这次的收费和成本账

项目价格说明
RAID5逻辑重组恢复(4盘/3.2TB)3800元含镜像、参数分析、重组、导出
坏道盘深度镜像附加费600元Slot 3盘坏道率约2.6%,反向+跳跃读取
目标存储介质(2×4TB企业盘)1560元西数Ultrastar,客户自购也可
合计5960元恢复不成功不收恢复费

厂长的原话是“早知道花五千块,也不让小张点那个按钮”。强制上线没有多花钱,但把恢复难度从“标准流程一天半”推到了“参数试错三天”。运气不好的话,校验块被整轮改写后反算不回来,就是真的没了。

五、RAID5掉盘后的自查清单

  1. 掉第一块盘:立即备份关键数据(趁阵列还在线),然后尽快换盘重建。重建期间阵列性能下降,且再掉一块就全灭,这段时间是最危险的窗口。换盘前确认新盘型号、容量、固件版本尽量一致。
  2. 掉第二块盘:停机。记下每块盘的槽位号,拍照。不要拔盘换位,不要强制上线,不要初始化,不要试图重建。
  3. 看盘的灯:Dell服务器盘托架指示灯,绿色常亮=正常,绿色闪烁=重建中,琥珀色常亮=故障,琥珀色闪烁=预测故障(PFA,盘还能用但快不行了)。两块琥珀色的,第二块往往不是真死了,是响应超时被踢——这正是强制上线最危险的情形。
  4. 报修时说清楚:控制器型号(PERC H730/H330、P440等)、RAID级别、盘数量容量型号、掉盘顺序、期间做过什么操作。这些信息直接决定恢复方案。

六、给还在用RAID5的企业的三句话

第一,RAID5不是备份,它只是“坏一块盘不用停机”的可用性方案,数据只有一份。第二,超过4块盘或单盘超过4TB的RAID5,重建时间以十小时计,重建期间再掉盘的概率不低,考虑RAID6或RAID10。第三,也是最实在的:图纸、程序、订单这类丢了要命的数据,加一块盘做定时冷备份,或者上一个几百块一年的云端备份,比事后花六千块恢复便宜得多。

阵列出问题了,先停机再打电话:020-39029800,24小时有人接。电话里把上面第4条的信息报一遍,我们能先帮你判断还有多大把握。