RAID 阵列降级、掉盘:服务器上的应急恢复操作
服务器 RAID 报警灯亮起,阵列状态从 Optimal 变成 Degraded,运维最怕的『连环掉盘』开始了。处理 RAID 的核心原则只有一条:在被剩余磁盘拖垮前,搞清楚拓扑、别乱操作。本文以常见 RAID 1、5、10 为例,讲清应急步骤。
一、登录管理界面看真实状态
- 进 RAID 卡 BIOS(如 Ctrl+R 或 Ctrl+H) 或厂商管理软件(MegaCLI、storcli)。
- 确认是 哪块物理盘 Offline,以及阵列是 RAID 几,剩余盘是否都 Online。
- 用 storcli /c0 /eall /sall show 查看每盘状态与介质错误数。
二、区分可恢复与高危场景
- RAID 1 或 10 单盘掉:镜像仍在,数据可读,直接换盘重建。
- RAID 5 单盘掉:校验位可重建,但重建时其余盘全速读,旧盘易二次故障。
- 两块及以上同时掉:阵列不可用,禁止初始化,需备份后做数据恢复。
三、标准应急流程
- 确认有 可用热备盘(Hot Spare):多数卡会自动开始重建,观察进度。
- 无热备则插入 同规格新盘,在管理界面将其设为替换盘并启动 Rebuild。
- 重建期间 监控其余盘 SMART,若出现新预警提前准备第二块备件。
- 务必先对阵列做 一次完整备份 再重建,尤其 RAID 5 高龄盘群。
四、绝对不能做的事
- 不要随手按『初始化或 Create』,这会清空元数据,数据难救。
- 不要在同一阵列上反复 强制上线(Force Online) 掉盘,可能写入不一致数据。
- 掉盘后别马上 重启阵列卡,先记录状态再操作。
技术总结:RAID 降级靠冗余续命,应急时先读状态、再备份、后重建;任何初始化或强制上线操作都可能把可恢复变成不可逆,高龄 RAID 5 更应视重建为高风险动作。