宝塔监控告警如何开启|服务器异常实时通知(消息提醒教程)

发布时间:2026-07-23 19:10

对于任何线上业务而言,服务器宕机、资源耗尽或程序崩溃往往是致命的。如果等到用户投诉或手动巡检时才发现问题,损失可能已经无法挽回。宝塔面板内置的监控告警功能,可以实时检测CPU、内存、磁盘、负载以及网站状态,并通过邮件、钉钉、企业微信或飞书等渠道将异常信息第一时间推送到你手中。

本教程将手把手教你从零配置宝塔监控告警,确保服务器出现异常时你能立即收到通知。

### 前置准备

在开始操作之前,请确保你具备以下条件:

1. **已安装并登录宝塔面板**:你需要拥有一个正在运行的宝塔面板(建议版本7.9以上),并且能够正常登录后台。如果你使用的是海外服务器,请确保面板版本为最新,以避免兼容性问题。

2. **确定通知渠道**:你需要决定使用哪种方式接收告警消息。目前最常用且稳定的方式是**企业微信机器人**和**钉钉机器人**。如果你只是个人使用,推荐使用**企业微信**(无需注册企业,个人即可创建机器人)。本教程将以企业微信机器人为例,同时会附带钉钉机器人的配置要点。

3. **获取Webhook地址**:这是最关键的一步。无论使用哪个平台,都需要创建一个机器人并获取一个特殊的网络钩子(Webhook)地址。请提前准备好,具体获取方法在步骤中会详细说明。

### 分步操作步骤

#### 步骤1:配置消息通知渠道(以企业微信机器人为例)

在配置告警规则之前,必须先告诉宝塔面板“告警消息应该发送到哪里”。这一步相当于设置一个“收件箱”。

1. **创建企业微信群机器人**:

- 打开电脑版企业微信,进入任意一个群聊(可以是只有你自己的群,也可以是一个工作群)。

- 点击群聊右上角的“三个点”图标(...),进入群设置。

- 在群设置页面,找到并点击“群机器人”选项。

- 点击“添加机器人”,然后点击“新创建一个机器人”。

- 为机器人起一个名字,例如“服务器告警”,然后点击“添加”。

- **复制Webhook地址**:添加成功后,页面会显示一个以 `https://qyapi.weixin.qq.com/cgi-bin/webhook/send?key=` 开头的长串地址。请务必完整复制并保存好这个地址,它就是后续配置的关键。

2. **在宝塔面板中添加通知设置**:

- 登录宝塔面板后台,点击左侧菜单栏的“消息通知”图标(通常是一个小铃铛或信封形状)。

- 进入“消息通知”页面后,点击上方的“通知设置”选项卡。

- 在“通知设置”页面中,找到“企业微信”这一栏(或者“钉钉”、“飞书”等,取决于你选择的渠道)。

- **填写信息**:

- **名称**:随意填写,例如“我的企业微信告警”。

- **Webhook地址**:将刚才在企业微信复制的地址粘贴到此处。

- **发送位置**:通常选择“群聊”。

- 点击页面底部的“添加”或“保存”按钮。

- **测试连接**:添加成功后,点击该配置项右侧的“测试”按钮。如果配置正确,你会在企业微信群里立刻收到一条由机器人发送的测试消息。如果没收到,请检查Webhook地址是否完整复制,或者群机器人是否被禁用。

#### 步骤2:开启并配置监控服务

通知渠道打通后,接下来需要让宝塔面板开始监控服务器的各项指标。这一步是数据采集的基础。

1. 在宝塔面板左侧菜单栏,点击“监控”图标(通常是一个折线图或仪表盘图标)。

2. 进入监控页面后,你会看到CPU、内存、磁盘、网络等实时数据图表。

3. **开启监控**:在监控页面的右上角或顶部,会有一个“监控开关”或“状态”按钮。请确保它处于**开启**状态(通常显示为绿色或“已开启”)。如果未开启,点击它并选择“开启监控”。

4. **设置监控周期**:在监控开关附近,通常有一个“监控周期”或“存储时长”的设置。建议选择“最近7天”或“最近30天”,这决定了历史数据的保留时间。设置完成后,宝塔面板就会开始持续记录服务器的性能数据。

#### 步骤3:创建告警规则(核心步骤)

这是整个教程的核心。你需要告诉宝塔面板“什么情况算异常”,以及“异常发生后通知谁”。

1. 在宝塔面板左侧菜单栏,点击“消息通知” -> “告警规则”。

2. 点击页面右上角的“添加告警规则”按钮。

3. **填写规则基本信息**:

- **规则名称**:起一个你一看就懂的名字,例如“CPU过高告警”或“磁盘爆满预警”。

- **监控对象**:选择“服务器”或“网站”。如果是针对服务器整体资源,选择“服务器”;如果是针对某个网站是否可访问,选择“网站”。

- **监控周期**:建议选择“1分钟”或“5分钟”。这表示宝塔每隔这个时间就会检查一次数据。周期越短,告警越及时,但也会消耗更多系统资源。一般服务器选择“5分钟”即可。

4. **设置触发条件(最关键部分)**:

- 点击“添加条件”按钮。

- **指标选择**:在下拉菜单中选择你要监控的指标。常用指标包括:

- **CPU使用率**:超过80%持续一段时间视为异常。

- **内存使用率**:超过90%视为危险。

- **磁盘使用率**:超过85%需要预警,防止写入失败。

- **负载均衡**:负载值长期超过CPU核心数视为异常。

- **网络流入/流出**:用于检测流量异常攻击。

- **运算符**:选择“大于”或“小于”。例如CPU使用率通常选“大于”。

- **阈值**:输入具体的数值。例如CPU使用率输入“80”。

- **持续时间**:输入一个时间长度,例如“5分钟”。这表示“当CPU使用率连续5分钟都超过80%”才算触发告警。这可以有效避免因瞬间峰值导致的误报。

- **重复告警间隔**:设置“30分钟”或“60分钟”。意思是第一次告警发出后,如果问题依然存在,至少间隔这么久才会再次发送告警,避免消息轰炸。

5. **关联通知渠道**:

- 在页面下方的“通知方式”区域,勾选你在步骤1中创建的那个通知渠道(例如“我的企业微信告警”)。

- 你可以同时勾选多个渠道,例如同时发送到企业微信和邮件。

6. **保存并启用规则**:检查所有设置无误后,点击“保存”按钮。保存后,请确保该规则右侧的开关是**开启**状态(绿色)。

#### 步骤4:验证告警规则是否生效

规则配置完成后,不能坐等故障发生,需要主动测试一下。

1. **模拟高负载(推荐方法)**:

- 使用SSH工具(如Xshell、Putty)登录你的服务器。

- 执行一条压力测试命令(请谨慎操作,建议在业务低峰期进行):

```bash

# 使用stress工具,如果没安装先执行:apt install stress 或 yum install stress

stress --cpu 4 --timeout 120

```

- 这条命令会让CPU满载运行2分钟。

- 观察你的企业微信(或其他通知渠道)。大约1-5分钟后(取决于你设置的监控周期),你应该会收到一条告警消息,内容类似:“【服务器异常】CPU使用率已超过80%,当前值:98%...”。

2. **检查告警记录**:

- 回到宝塔面板的“消息通知” -> “告警记录”页面。

- 你应该能看到刚才触发的告警记录,包括触发时间、指标、当前值等信息。如果这里没有记录,说明规则没有生效,请返回步骤3检查配置。

### 常见问题

**Q1:我配置了规则,但一直没有收到告警消息,为什么?**

- **检查通知渠道**:回到“通知设置”页面,点击你配置的渠道右侧的“测试”按钮。如果测试消息收不到,说明Webhook地址无效或网络不通。请重新获取地址或检查服务器是否能访问外网(如企业微信API)。

- **检查告警规则状态**:确保规则右侧的开关是绿色的“已启用”状态。

- **检查触发条件**:你的服务器是否真的达到了你设定的阈值?例如你设定了CPU>80%,但你的服务器CPU一直只有20%,自然不会触发。

- **检查监控是否开启**:回到“监控”页面,确认监控开关是开启的。如果监控未开启,宝塔无法获取数据,自然无法触发告警。

**Q2:告警消息太多了,一直在刷屏,怎么办?**

- **调整“重复告警间隔”**:在规则编辑页面,将“重复告警间隔”设置得长一些,例如从30分钟改为120分钟。

- **调整“持续时间”**:将“持续时间”设置得更长一些,例如从1分钟改为5分钟。这样可以过滤掉瞬间的毛刺数据。

- **提高阈值**:例如将CPU告警阈值从80%提高到90%。这可以让你只关注最严重的问题。

**Q3:我想监控网站是否挂了,怎么配置?**

- 在步骤3中,选择“监控对象”为“网站”。

- 在“添加条件”时,选择指标为“网站状态码”。当状态码不等于200(或302等正常状态码)时触发告警。

- 设置“持续时间”为“1分钟”或“2分钟”,这样一旦网站无法访问,你很快就能知道。

**Q4:我使用的是钉钉,配置有什么区别?**

- 钉钉机器人的配置流程与企业微信类似。

- 在钉钉群中,点击“群设置” -> “智能群助手” -> “添加机器人” -> 选择“自定义”机器人。

- 安全设置建议选择“加签”,并将生成的密钥复制保存好。在宝塔的“通知设置”中,选择“钉钉”,然后将Webhook地址和密钥分别填入对应位置即可。如果选择“IP地址(段)”,则必须填写你服务器的公网IP。

### 收尾总结

至此,你已经成功为你的宝塔面板配置了服务器异常实时告警系统。这套机制的核心价值在于将“被动等待”转变为“主动预警”。通过企业微信、钉钉等即时通讯工具,你可以在服务器发生问题的几分钟内就收到通知,从而快速响应,避免业务中断或数据丢失。

建议你至少配置以下三条基础规则作为“保命”防线:

1. **磁盘使用率告警**:阈值设定为85%,这是最容易被忽视但后果最严重的故障。

2. **CPU使用率告警**:阈值设定为90%,用于应对程序死循环或恶意攻击。

3. **网站状态码告警**:监控你的核心业务网站,确保7x24小时在线。

配置完成后,定期(例如每月一次)检查一下告警记录,确保系统仍在正常工作。这套系统将成为你服务器运维中最可靠的“哨兵”。