一、先看灯的颜色和位置,故障等级就出来一半
三大品牌服务器(Dell PowerEdge、HP ProLiant、联想ThinkSystem)的告警逻辑基本一致:
- 绿灯:正常。绿灯闪烁:正在重建/活动。
- 琥珀色(黄灯):警告或故障。分两种——部件级黄灯(某块盘、某个电源)和系统级黄灯(面板上的整体告警灯,通常伴随“滴滴”声)。
- 红灯/琥珀快闪:严重故障,部分机型温度或供电临界时会快闪。
关键原则:黄灯≠立刻停机。企业级服务器大量部件是冗余的(双电源、RAID、ECC内存、热插拔风扇),很多黄灯的意思是“冗余丢了,尽快修”,而不是“业务要停”。慌慌张张直接拔电,反而把可计划的维修变成事故。
二、五分钟自查:远程管理口是你的仪表盘
别在机房里盯着灯猜,用带外管理口登录看日志,信息全得多:
| 品牌 | 管理口 | 默认地址 | 看哪里 |
|---|---|---|---|
| Dell | iDRAC | 机身拉出小标签上有IP,默认用户root | 日志→生命周期日志(Lifecycle Log) |
| HP | iLO | 机身标签,默认用户Administrator | AHS日志/IML集成管理日志 |
| 联想 | XCC/IMM | 机身标签,默认用户USERID | 事件日志 |
不知道管理口IP的:Dell开机按F2进BIOS看iDRAC设置,或者接个显示器看开机自检画面(POST)里的报错;也可以开机时按对应的快捷键进系统设置看。没配过管理口IP的,这次修完顺手配上,下次就不用跑机房了。
三、常见告警TOP6:从“能等”到“要停”排个序
① 硬盘预测故障(PFA)——能等,但要尽快
表现:单块盘琥珀灯慢闪,日志报“Predictive failure”或SMART告警。盘还在阵列里正常工作,只是厂商固件判断它快不行了。正确动作:趁业务低峰热插拔换新盘,让阵列自动重建。别等到它真死——RAID5里真死一块就进入降级,再死一块就是灾难(见我们那篇RAID5双盘离线实录)。换盘要点:同型号同容量优先,容量不能小于原盘;换之前确认备份可用。
② 内存ECC报错——分频率处理
表现:日志报“Correctable ECC”(可纠正)或“Uncorrectable”(不可纠正)。可纠正错误偶发一两次:记录DIMM槽位,观察,可以等业务窗口再换。可纠正错误高频出现(一天几十上百条)或出现不可纠正错误:尽快安排,不可纠正ECC会直接导致宕机重启。企业级内存是ECC的,报错定位到槽位(如DIMM_A3),换对应内存条即可,换的时候注意通道配对规则。
③ 电源故障——冗余还在就不停业务
表现:双电源机型单个电源琥珀灯,日志报PSU故障或“Power supply AC lost”。先查最简单的:电源线松没松、PDU那一路插座有没有电、机房那一路空开跳没跳。真是电源坏了:双电源机型单电源运行可以撑到备件来(注意另一路别再出事),热插拔更换。单电源机型按停机处理,尽快。
④ 风扇/温度告警——最不能拖的一类
表现:风扇狂转(噪音明显变大)、面板温度灯亮、日志报温度阈值超限。先查:机房空调是不是出问题了(夏天广州机房空调故障是我们的高频出诊原因)、机器进风口是不是被灰糊死了、风扇模块是不是坏了。温度临界时服务器会降频自保,再高就强制关机——数据风险大。这类告警要立即处理,哪怕只是清灰。
⑤ 阵列卡电池(BBU/超级电容)老化——计划内更换
表现:日志报“RAID battery/capacitor degraded”,写缓存策略可能自动从Write Back切到Write Through(业务会变慢但安全)。不紧急,安排备件更换即可。电池老化的机器遇到断电,写缓存里的数据有丢失风险,所以别拖太久。
⑥ 系统级告警灯+滴滴响——按日志来
面板整体告警灯亮通常伴随蜂鸣,是上面任何问题的汇总提示。有些机型可以在iDRAC/iLO里远程消音。看到系统灯亮,直接查日志定位到具体部件,别被声音吓到。
四、案例:一台HP DL380 Gen10的“半夜滴滴响”
2026年7月29日凌晨1点,番禺一家做跨境电商的公司值班电话打到我们这里:机房一台HP DL380 Gen10(承载ERP和官网)开始滴滴响,面板黄灯,业务还在跑。电话里先让他们别动机器,报iLO地址给我们远程看(之前做维保时配好的)。
iLO的IML日志显示:DIMM_B4内存条不可纠正ECC错误一次、可纠正错误37条,另外Slot 3硬盘SMART报PFA。两个问题叠在一起触发了系统告警。
处理:不可纠正ECC有过一次,宕机风险实际存在,不能等。凌晨2点到场,备件是维保合同里备好的(同规格16GB RDIMM+2TB企业盘)。业务方把ERP切到备用方案停了20分钟服务,换内存条、换硬盘、触发阵列重建,重建挂着跑,凌晨4点撤。第二天回访:阵列重建完成,业务无感。这台机器签了年度维保,这次出诊和备件都没另外收费——这就是维保合同的意义:把半夜的救火变成有备件的计划动作。
五、给企业IT管理员的三条建议
- 把带外管理口配好并接入监控。iDRAC/iLO/XCC都支持SNMP、邮件告警、Redfish API。配好邮件告警,问题半夜发生你早上就能看到,而不是等用户投诉。没精力自己盯的,可以托管给我们的IT外包运维,7×24监控告警响应。
- 备件先行。PFA盘、内存条、电源这三样是服务器故障的大头。关键业务机器,同型号备件各备一份放在机房,故障处理从“等物流三天”变成“半小时换完”。年维保合同含备件库的,这笔账很划算。
- 建立告警响应分级。照抄我们的分级就行:温度/供电类立即处理;不可纠正ECC/双盘风险24小时内;PFA/电池老化一周内计划处理。写成一页纸贴在值班表旁边,值班的人照做,不用每次打电话问。
服务器亮灯了拿不准的,拍个面板照片、把型号和日志截图发到020-39029800(微信同号),电话里先帮你分级。番禺、南沙2小时内到场。
