一、先看灯的颜色和位置,故障等级就出来一半

三大品牌服务器(Dell PowerEdge、HP ProLiant、联想ThinkSystem)的告警逻辑基本一致:

关键原则:黄灯≠立刻停机。企业级服务器大量部件是冗余的(双电源、RAID、ECC内存、热插拔风扇),很多黄灯的意思是“冗余丢了,尽快修”,而不是“业务要停”。慌慌张张直接拔电,反而把可计划的维修变成事故。

二、五分钟自查:远程管理口是你的仪表盘

别在机房里盯着灯猜,用带外管理口登录看日志,信息全得多:

品牌管理口默认地址看哪里
DelliDRAC机身拉出小标签上有IP,默认用户root日志→生命周期日志(Lifecycle Log)
HPiLO机身标签,默认用户AdministratorAHS日志/IML集成管理日志
联想XCC/IMM机身标签,默认用户USERID事件日志

不知道管理口IP的:Dell开机按F2进BIOS看iDRAC设置,或者接个显示器看开机自检画面(POST)里的报错;也可以开机时按对应的快捷键进系统设置看。没配过管理口IP的,这次修完顺手配上,下次就不用跑机房了。

三、常见告警TOP6:从“能等”到“要停”排个序

① 硬盘预测故障(PFA)——能等,但要尽快

表现:单块盘琥珀灯慢闪,日志报“Predictive failure”或SMART告警。盘还在阵列里正常工作,只是厂商固件判断它快不行了。正确动作:趁业务低峰热插拔换新盘,让阵列自动重建。别等到它真死——RAID5里真死一块就进入降级,再死一块就是灾难(见我们那篇RAID5双盘离线实录)。换盘要点:同型号同容量优先,容量不能小于原盘;换之前确认备份可用。

② 内存ECC报错——分频率处理

表现:日志报“Correctable ECC”(可纠正)或“Uncorrectable”(不可纠正)。可纠正错误偶发一两次:记录DIMM槽位,观察,可以等业务窗口再换。可纠正错误高频出现(一天几十上百条)或出现不可纠正错误:尽快安排,不可纠正ECC会直接导致宕机重启。企业级内存是ECC的,报错定位到槽位(如DIMM_A3),换对应内存条即可,换的时候注意通道配对规则。

③ 电源故障——冗余还在就不停业务

表现:双电源机型单个电源琥珀灯,日志报PSU故障或“Power supply AC lost”。先查最简单的:电源线松没松、PDU那一路插座有没有电、机房那一路空开跳没跳。真是电源坏了:双电源机型单电源运行可以撑到备件来(注意另一路别再出事),热插拔更换。单电源机型按停机处理,尽快。

④ 风扇/温度告警——最不能拖的一类

表现:风扇狂转(噪音明显变大)、面板温度灯亮、日志报温度阈值超限。先查:机房空调是不是出问题了(夏天广州机房空调故障是我们的高频出诊原因)、机器进风口是不是被灰糊死了、风扇模块是不是坏了。温度临界时服务器会降频自保,再高就强制关机——数据风险大。这类告警要立即处理,哪怕只是清灰。

⑤ 阵列卡电池(BBU/超级电容)老化——计划内更换

表现:日志报“RAID battery/capacitor degraded”,写缓存策略可能自动从Write Back切到Write Through(业务会变慢但安全)。不紧急,安排备件更换即可。电池老化的机器遇到断电,写缓存里的数据有丢失风险,所以别拖太久。

⑥ 系统级告警灯+滴滴响——按日志来

面板整体告警灯亮通常伴随蜂鸣,是上面任何问题的汇总提示。有些机型可以在iDRAC/iLO里远程消音。看到系统灯亮,直接查日志定位到具体部件,别被声音吓到。

四、案例:一台HP DL380 Gen10的“半夜滴滴响”

2026年7月29日凌晨1点,番禺一家做跨境电商的公司值班电话打到我们这里:机房一台HP DL380 Gen10(承载ERP和官网)开始滴滴响,面板黄灯,业务还在跑。电话里先让他们别动机器,报iLO地址给我们远程看(之前做维保时配好的)。

iLO的IML日志显示:DIMM_B4内存条不可纠正ECC错误一次、可纠正错误37条,另外Slot 3硬盘SMART报PFA。两个问题叠在一起触发了系统告警。

处理:不可纠正ECC有过一次,宕机风险实际存在,不能等。凌晨2点到场,备件是维保合同里备好的(同规格16GB RDIMM+2TB企业盘)。业务方把ERP切到备用方案停了20分钟服务,换内存条、换硬盘、触发阵列重建,重建挂着跑,凌晨4点撤。第二天回访:阵列重建完成,业务无感。这台机器签了年度维保,这次出诊和备件都没另外收费——这就是维保合同的意义:把半夜的救火变成有备件的计划动作

五、给企业IT管理员的三条建议

  1. 把带外管理口配好并接入监控。iDRAC/iLO/XCC都支持SNMP、邮件告警、Redfish API。配好邮件告警,问题半夜发生你早上就能看到,而不是等用户投诉。没精力自己盯的,可以托管给我们的IT外包运维,7×24监控告警响应。
  2. 备件先行。PFA盘、内存条、电源这三样是服务器故障的大头。关键业务机器,同型号备件各备一份放在机房,故障处理从“等物流三天”变成“半小时换完”。年维保合同含备件库的,这笔账很划算。
  3. 建立告警响应分级。照抄我们的分级就行:温度/供电类立即处理;不可纠正ECC/双盘风险24小时内;PFA/电池老化一周内计划处理。写成一页纸贴在值班表旁边,值班的人照做,不用每次打电话问。

服务器亮灯了拿不准的,拍个面板照片、把型号和日志截图发到020-39029800(微信同号),电话里先帮你分级。番禺、南沙2小时内到场。